“Clef vs Qwen3.8-27B — 하나의 백본, 두 가지 출력 계약”이라고 적힌 타이틀 카드, 그 아래에 두 장의 카드: Clef, 27B 결정 모델, 옵션당 하나의 로짓; 그리고 Qwen3.8-27B, 27B dense VLM, 토큰과 도구 호출.
Guides & Insights

Clef vs Qwen3.8-27B: 하나의 백본, 두 개의 출력 계약

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Clef는 문장 하나 쓸 줄 모르지만, 정작 문장을 쓸 수 있는 모델로 만들어졌습니다. Cloudflare/clef는 270억 개 파라미터의 멀티모달 결정 모델로, 여기에 상태 하나와 타입이 지정된 질문들의 스키마를 넘기면 산문을 단 한 토큰도 생성하지 않은 채 허용된 모든 선택지에 대한 확률을 돌려줍니다. 그 밑을 받치는 백본은 Qwen3.8-27B로, 오픈 웨이트 밀집형 비전-언어 모델이며 작은 추가 헤드를 붙인 채 그대로 동결되어 있습니다. 그래서 이 페이지는 양쪽이 전혀 경쟁 관계가 아닌 몇 안 되는 모델 대 모델 페이지 중 하나입니다. 둘은 하나의 체크포인트와 그 파생물로서 55기가바이트의 가중치를 공유하면서도, 답이란 읽어 내는 것인지 계산해 내는 것인지를 두고 서로 의견을 달리합니다.

둘 모두의 가중치는 발표보다 먼저 공개됐다. Cloudflare는 Cloudflare/clef 저장소를 2026년 9월 30일 21:15 UTC에 Hugging Face에 Apache-2.0 라이선스로 만들고, 다음 날 오후에 발표 게시물 — "Clef 소개: 우리의 오픈소스 의사 결정 모델과 새로운 RL 파인튜닝 플랫폼" — 을 게시했다. 약 18시간 동안 55기가바이트 모델은 Cloudflare 자체 엣지 GPU에서 다운로드되고 실행될 수 있었는데, 이는 그 공급업체가 그 모델에 대해 아무 말도 하기 전의 일이었다. 사흘 안에 이 모델은 Ollama 0.35.1을 통해 제공되는 Ollama 라이브러리 페이지를 갖게 됐고, 이 글은 바로 그 페이지에서 이 모델을 발견했으며, 12명의 서로 다른 업로더가 올린 NVFP4, FP8, EXL3, INT8, Q4, Q8 빌드도 있었다.

저장소에서 알 수 있는 것은 이례적으로 완전하며, 알 수 없는 것과 구분할 가치가 있다. 알 수 있는 것: 아키텍처, 기본 체크포인트, 라이선스, 실행되는 참조 구현, 그리고 전체 평가 매트릭스. 알 수 없는 것: 그 수치들 중 어느 것이 Cloudflare가 아닌 누군가의 재실행에서도 살아남는지 여부. 아래에서 Clef에 부여된 모든 점수는 벤더가 직접 호스팅하는 스위트를 벤더가 자체적으로 실행한 결과에서 나온다. 한 달간 독립적으로 사용된 모델과의 이러한 비대칭이 이 비교의 정직한 척추이며, 나머지 글은 그것이 실제로 어디에서 문제가 되는지에 관한 것이다.

두 개의 저장소, 나란히

다운로드부터 시작하자, 동일함이 바로 핵심이기 때문이다. Clef의 safetensors는 12개 샤드에 걸쳐 54.97GB에 이른다. 부모의 것은 18개 샤드에 걸쳐 55.56GB에 이른다. Clef는 Qwen3.8-27B의 비전 인코더 — 프로세서, 비전 타워, 멀티모달 프런트 엔드 전체 — 를 유지하므로, 더 작게 만들기 위해 아무것도 제거되지 않았다. Cloudflare가 추가한 것은 256MB의 조인트 스키마 헤드다: 4개 레이어, 폭 1,024, 16개 헤드, 폭 4,096의 피드포워드, 백본의 최종 은닉 상태를 읽는 두 개의 라우팅 레이어. 학습 레시피는 고정된 백본, 그 헤드, 랭크 256의 저랭크 어댑터이며, 유효한 스키마 답변에 대한 레이블 스무딩 교차 엔트로피가 캘리브레이션을 더 정교하게 다듬기 위해 Brier 손실과 짝을 이룬다.

그다음은 발산인데, 이는 전적으로 모델이 출력하도록 허용된 것에 있습니다.

• 파라미터 — Clef 27B, Qwen/Qwen3.8-27B에서 포스트 트레이닝됨. Qwen3.8-27B는 27B dense, 64개 레이어, 5,120 hidden, 248,320개 토큰 어휘, Gated Attention과 인터리브된 16 × (3 × Gated DeltaNet → FFN) 구조입니다.

• 출력 — Clef: 허용된 각 옵션당 하나의 로짓, 질문별로 소프트맥스 처리, 생성 경로가 전혀 없음. Qwen3.8-27B: 토큰, 도구 호출, 그리고 기본적으로 켜져 있는 추론 블록.

• 질문 형태 — Clef는 요청당 1~64개의 타입 지정 질문을 세 가지 형식으로 받습니다: noul (참일 확률), choice (2~255개의 이름이 지정된 옵션), score (2~10개의 순서가 있는 레벨, 그 사이에 놓일 수 있는 확률 가중 값을 반환). Qwen3.8-27B에는 그러한 계약이 없습니다. 산문을 받게 되며 파서는 직접 작성해야 합니다.

• 라이선스 — 둘 다 Apache-2.0이며, 그래서 서드파티 양자화가 주말 만에 이루어졌다.

• 동결된 절반의 비용 — Clef의 헤드는 256 MB인 반면 백본은 54.97 GB입니다. 다운로드의 거의 전부가 부모 모델입니다. 디스크에 이미 Qwen3.8-27B가 있다면, 답변 방식에 대한 다른 의견을 얻기 위해 그것을 두 번째로 다운로드하는 셈입니다.

A two-column scoreboard for Clef and Qwen3.8-27B across six dimensions: output, parameters, GPQA Diamond (48.0 vs 90.5), hosted context (65,536 vs 262,144 tokens), median latency (209.3 ms vs 1,929 ms) and list price ($0.24 per M in vs $0.33/$2.40 per M). A footer notes Clef's figures are vendor-reported and unreproduced, Qwen's GPQA is per Artificial Analysis, and latency was measured by each side on its own hardware.

재헤딩에 드는 비용, 두 개의 숫자로

Cloudflare의 평가는 내부에서 실행되는 Decision Index 0.2.1 스위트이며, 의사 결정 모델에 관한 표입니다 — 여섯 개 열: Clef, Clef-flash, Jev, DiffusionGemma Jev, Kev 9B, Laya. Qwen3.8-27B는 그 표에 행이 없고, Clef는 Artificial Analysis Intelligence Index에 행이 없습니다. 따라서 공유된 스코어보드가 없으며, 이 글은 그것을 임의로 만들어 내지 않을 것입니다.

그러나 양측 모두가 거쳐 간 벤치마크가 하나 있는데, 그 격차는 이번 발표에서 의사 결정에 가장 관련 있는 수치일 만큼 크다. GPQA Diamond — 대학원 수준의 과학 문제, 객관식 — 에서 Cloudflare는 Clef를 48.0으로 측정한다. 상위 모델은 90.5를 Artificial Analysis의 하네스에서, 89.2를 벤더 자체 모델 카드에서 기록한다. 이는 일반 지식에서 40점 절벽이며, 미스터리도 아니다: Clef는 주어진 고정된 선택지 집합에 점수를 매겨 답하며, 일반 지식 객관식은 같은 가중치를 겨눌 수 있는 대상 중 "이 티켓을 라우팅하라"와 가장 거리가 먼 축이다. 이 비교는 통제된 것이 아니라 시사적인 것으로 받아들여라 — 두 하네스, 두 연구소이며, 벤더의 것도 트래커의 것도 아니다. 그러나 방향은 의심할 바가 없으며, 그것이 이 계약의 대가다.

같은 패턴은 Clef의 나머지 범용 셀에서도 나타난다. MMLU-Pro 65.9, BBH 73.7, 범위 외 처리(out-of-scope handling)를 포함한 CLINC150에서 27B는 97.4로 Jev의 89.3을 앞선다 — 마지막 항목은 파생 모델이 더 오래된 의사결정 모델을 완전히 앞서는 드문 셀이며, 분류를 거부하는 것이 라우팅의 어려운 절반이라는 점에서 중요하다. Clef가 강한 곳은 바로 사내에서 학습한 분류기가 강해야 할 지점이다: BANKING77 의도 macro-F1 94.2, BFCL case-exact 98.5, API-Bank 91.9. 약한 곳에서는 경쟁 연구소의 텍스트 전용 의사결정 모델인 TypeSafe의 Jev가 GPQA Diamond에서 30점 차로 앞서는데, 청구하는 금액은 백만 입력 토큰당 $0.042이며, 우리 자체 카탈로그에서 청구한다. 이는 "27B" 자체가 논거가 아니라는 유용한 알림이다.

상위 모델이 유지하는 것은 Decision Index가 묻지 않는 모든 것이다. 자체 카드와 AA 출처 행에서 우리 카탈로그가 싣고 있는 항목은 다음과 같다: Terminal-Bench 2.1 73.0, SWE-bench Pro 61.7, LiveCodeBench v6 90.3, OSWorld-Verified 84.3, DeepSWE 1.1 42.2, AA Coding 68.1(샘플링된 138개 모델 중 35위). 그중 어느 것도 Clef 행이 없는데, Clef가 그것들을 시도할 수 없기 때문이다. Clef에는 도구 호출 경로도, 장기 계획도, 패치를 내보낼 방법도 없다.

한 가지 결정이 치르는 대가, 그리고 출력 줄이 왜 논증의 전부인지

Workers AI 모델 페이지에는 Clef의 단가가 정확히 하나만 나열되어 있습니다: 백만 입력 토큰당 $0.24. 출력 항목은 없는데, 그 이유는 응답 안에 있습니다. Ollama 자체 문서에 나온 예시 — 세 개의 질문으로 라우팅된 지원 티켓 — 는 "usage": {"input_tokens": 1204, "output_tokens": 3}를 반환합니다. 세 개의 질문에 출력 토큰 세 개. Cloudflare가 그 세 토큰을 청구하든 말든 거의 상관없습니다: 결정의 출력 비용은 요율이 아니라 질문의 개수입니다.

그것을 우리 자체 카탈로그에 있는 상위 모델의 요금표와 비교해 보면, 백만 입력 토큰당 $0.33, 백만 출력 토큰당 $2.40이며 262,144토큰 창을 제공합니다. 동일한 1,204토큰 상태, 동일한 단일 라우팅 결정:

• Clef — 백만 개당 $0.24의 가격으로 1,204 입력 토큰은 약 결정당 $0.00029이고, 백만 건의 결정당 약 $289입니다. 이 숫자는 답이 더 어려워져도 거의 움직이지 않으며, 상태가 더 길어질 때만 움직입니다.

• thinking이 비활성화된 Qwen3.8-27B — 동일한 상태에서 입력 비용은 약 $0.00040이고, 여기에 백만 토큰당 $2.40인 출력 토큰 약 10개가 더해집니다. 이를 $0.00042, 즉 백만 건당 $421라고 부릅니다. Clef는 약 1.5배 더 저렴한데, 이는 누구도 말하고 있지 않은 이야기입니다.

• thinking을 켜 둔 Qwen3.8-27B — 이 체크포인트에서는 이것이 기본값입니다. 모델이 비밀번호 재설정 이메일이 네 개의 버킷 중 어디에 속하는지 추론하는 데 400토큰을 쓴다면, 그건 추가로 $0.00096이고 그 결정은 거의 $0.0014에 이릅니다. 즉 100만 건당 $1,357입니다. 그 400토큰은 측정값이 아니라 가정이며, 배수는 그 가정에 따라 선형적으로 변합니다.

그래서 가격 논리의 정직한 버전은 처음 보이는 것보다 범위가 더 좁다. 사고(thinking)를 끈 채 실행되는 범용 모델과 비교하면, Clef는 달러 기준으로 약 1.5배 앞선다 — 실질적이지만 판도를 바꾸는 수준은 아니다. 같은 모델을 기본 구성으로 두고 비교하면, 격차는 장황함(verbosity)의 함수이며, 장황함은 언어 모델이 가진 바로 그것이고 선택지에 점수를 매기는 설계는 전혀 갖지 못한 것이다. 이것이 구조적 주장이다: Clef의 비용은 상태(state)의 길이에 의해 제한되고, 부모의 비용은 부모가 얼마나 말하기로 결정하는지에 의해 제한된다.

Cloudflare's Workers AI model page for clef, showing a 65,536-token context window, vision support, and unit pricing of $0.24 per million input tokens with no output line.

가깝지 않은 단 하나의 숫자

Cloudflare는 자사 엣지 GPU에서 자사 실행의 43개 벤치마크 전반에 걸쳐 측정한 Clef의 요청 지연 시간 중앙값이 209.3ms, p95가 238.6ms라고 보고한다. Cloudflare 외부에서는 아무도 이를 재현하지 못했으며, 이 수치가 이렇게 낮은 이유는 해당 벤더의 인프라에 있다 — 이 모델은 호출자와 동일한 네트워크에 위치하도록 설계되었기 때문이다.

부모의 경우, 그것이 우리의 경로 중 하나이므로 벤더가 제공한 수치보다 더 나은 값을 제시할 수 있습니다. 2026년 10월 2일로 끝나는 7일 기간 동안 OrcaRouter 자체 플레이그라운드는 Qwen3.8-27B를 측정했으며, 그 수치는 p50 1,929ms 및 초당 출력 토큰 235.8개였습니다. 이는 해당 기간의 트래픽 1억 3,630만 토큰을 기준으로 한 것입니다. 일별 시계열이 흥미로운 부분입니다. p95는 7일 중 6일 동안 정확히 10,000ms에 머물러 있어 측정값이라기보다 상한선처럼 보이며, p50은 날짜에 따라 1,751ms에서 4,296ms 사이를 오갑니다. 중앙값은 대략 Clef의 9배로 간주하고, 실제 분포가 공개되기 전까지는 꼬리 부분을 정보가 없는 것으로 취급하십시오.

그 격차는 튜닝 차이가 아니며 좁혀지지 않을 것이다. 프리필 전용 패스에 병렬 스코어링 헤드를 더하면 한 번의 스윕으로 끝나지만, 자기회귀 모델은 할 말이 떨어지면 끝난다. Clef에 대한 벤더의 절대 수치는 늘 하듯 할인해서 봐야 하지만, 그 순위는 Cloudflare의 하드웨어가 아니라 아키텍처의 속성이다.

그중 하나에 대해서는 컨텍스트가 세 가지 방식으로 인용됩니다.

두 모델 모두 텍스트, JSON, 이미지, 동영상을 입력으로 받습니다. 윈도우는 서로 같지 않으며, 그중 하나는 어디서 확인하느냐에 따라 일관성 없이 제시됩니다.

• Clef, 호스팅됨 — Workers AI 모델 페이지와 발표 글에 따르면 65,536개 토큰. 이것이 API 호출자를 제약하는 수치이며, Cloudflare 자신의 설명 방식은 비교식입니다: Jev의 32K 윈도가 담는 상태의 두 배입니다.

• Clef, 디스크에 있는 — 릴리스된 config.json은 max_position_embeddings가 262,144임을 선언합니다. 왜냐하면 고정된 백본은 부모의 것이고 여전히 부모의 위치 상한을 지니기 때문입니다. 번들로 제공되는 encode_record 헬퍼의 기본값은 max_length=16,384이며, max_state_tokens를 사용하면 상태를 별도로 제한할 수 있습니다. 이 세 숫자 중 어느 것도 틀리지 않았습니다. 그것들은 서로 다른 질문에 답하며, 256K를 광고하는 런타임 목록은 구성 파일을 읽는 것이지 엔드포인트를 읽는 것이 아닙니다.

• Qwen3.8-27B — 공급업체의 카드와 우리 카탈로그 행에 따르면 기본 262,144, 올바른 서빙 구성으로 1,000,000까지 확장 가능합니다. 최소한 호스팅된 Clef 윈도우의 네 배입니다.

실질적인 결과는 그 비율이 시사하는 것보다 작다. Clef는 대화가 아니라 상태, 즉 티켓이나 인보이스, 스크린샷을 소비하며, 그 장점 중 하나는 커다란 평탄화 페이로드를 넘겨주고 질문마다 페이로드 비용을 다시 지불하지 않고도 그것에 관해 64개의 질문을 할 수 있다는 점이다. 부모는 히스토리와 도구 결과, 그리고 자체 추론을 담아야 하므로 윈도우가 필요하다. 요구 사항이 다르면 한도도 다르다.

둘 다 같은 픽셀을 본다

비전 인코더는 상속되므로, 한 모델은 멀티모달이고 다른 모델은 그렇지 않은 경우가 아닙니다. Clef는 요청당 최대 4개의 이미지를 허용하며, base64로 인코딩된 PNG, JPEG 또는 WebP이고, 페이로드의 모든 질문이 공유하며, 비디오 프레임은 프레임 배열로 추가할 수 있습니다 — 카드의 영수증 예시는 합계를 읽을 수 있는지에 대한 예/아니오 질문을 하는데, 이는 설계의 축소판입니다. Qwen3.8-27B는 네이티브 비전-언어 모델로, 벤더 카드에서 OmniDocBench 1.5가 91.1, RealWorldQA가 85.9, CharXiv가 78.8입니다.

차이는 돌려받는 결과에 있습니다. Clef는 문서에 대한 타입이 지정된 답변인, 확률이 함께 제공되는 필드별 결정을 제공합니다. 부모는 문서에 대한 설명을 제공하며, 그러면 당신은 이를 파싱합니다. 이 양식을 확인하고, 이 조항을 찾고, 이 합계가 임계값을 넘는지 판단하는 등 많은 범주의 문서 작업에서 타입이 지정된 답변이 작업의 전부이며, 설명은 비용을 치른 뒤 버리는 오버헤드입니다.

선이 실제로 어디에 그어지는가

• Clef를 선택하세요 — 답변을 미리 열거할 수 있고 파서를 직접 작성하고 싶지 않을 때. 라우팅, 트리아지, 게이팅, 정책 검사, 문서 필드 추출. 닫힌 집합, 질문당 2~255개 옵션, 최대 64개 질문을 함께 채점.

• Clef를 택하라 — 이 결정은 핫 패스에 걸려 있고, 1,929ms 대비 209ms라는 차이는 파이프라인이 할 수 있는 일 자체를 바꾼다. 이것이 옮겨가야 하는 가장 강력한 단 하나의 이유이며, 그것도 정확성이 아니라 지연 시간 때문이다.

• Clef를 택하세요 — 결정성이 필요할 때 말이죠. 선언하지 않은 옵션은 다시 나타날 수 없습니다. 그것을 생성할 단계 자체가 없기 때문입니다.

• Qwen3.8-27B를 유지하세요 — 답은 목록에서 고르는 선택지가 아닙니다. 요약하기, 초안 작성하기, 새로운 문제를 논리적으로 풀어내기, 코드 작성하기, 장기적인 지평에 걸쳐 도구를 운용하기. Clef는 이 중 어느 것도 할 수 없으며, 그렇다고 당신에게 알려주지도 않습니다.

• Qwen3.8-27B를 유지하세요 — 모델이 "이 중 어느 것도 아니다"라고 말할 수 있어야 하니까요. 의사결정 모델은 주어진 선택지에 점수를 매깁니다. 청구/기술/영업 스키마와 개인정보 요청을 주면, 거부하는 대신 그 세 가지 중 가장 덜 나쁜 것을 반환합니다. 부모 모델은 당신이 미처 생각하지 못한 질문을 드러냅니다.

• Qwen3.8-27B를 유지하세요 — 컨텍스트 또는 장문 문서 작업용. 백만 토큰 확장 전에는 호스팅 버전의 네 배입니다.

그 목록은 판결이 아니라 파이프라인으로 읽어야 합니다. 실제로 그러하니까요. 이 아키텍처는 그 관계를 문자 그대로 보여줍니다. Clef는 끝에 다른 답변 메커니즘을 붙인 부모의 프리필 패스입니다. 합리적인 설계는 Clef를 앞에 두어 — 경로와 우선순위, 에스컬레이션 플래그를 결정하고 — Qwen3.8-27B를 그 뒤에 두어 그 결정에 따라 행동하게 합니다. 이 둘은 다운로드를 공유할 뿐인 상호 보완재입니다.

각각을 어디에서 실행할지

Clef는 위에 제시된 백만 입력당 $0.24 요금으로 Cloudflare의 Workers AI에 호스팅되며, Apache-2.0 가중치는 로컬에서 직접 실행할 수 있습니다. Ollama 라이브러리 목록은 가장 최신 접점입니다: ollama pull clef는 Ollama 0.35.1 이상이 필요합니다. 왜냐하면 이 모델은 /v1/systemone 엔드포인트를 통해 말하기 때문입니다. 이 엔드포인트는 Ollama가 의사 결정 모델용으로 추가했습니다. 헤드라인이 아니라 태그를 보세요 — 기본 및 clef:27b 태그는 18 GB이며, 이는 55기가바이트 모델의 4비트 빌드입니다; clef:27b-q8_0의 경우 30 GB, clef:27b-nvfp4의 경우 18 GB, clef:27b-mxfp8의 경우 31 GB, 그리고 clef:27b-mlx-bf16은 Apple 실리콘용 전체 55 GB입니다. TypeSafe 자체 Python SDK는 로컬 Ollama를 가리키게 하고 아무 API 키나 제공하면 이와 통신합니다. 런타임은 이를 무시합니다. 프로덕션에서 발목을 잡을 한 가지 주의점: confidence는 확률이 얼마나 집중되어 있는지를 측정하는 것이지, 답이 정확할 가능성을 측정하는 것이 아니며, 동점은 선언한 옵션 순서대로 해결됩니다.

부모 모델은 오늘날 API로 제공하기 더 쉬운 쪽입니다. Qwen3.8-27B는 위에서 사용한 백만 토큰당 $0.33 및 $2.40 요금으로 OrcaRouter에서 라우팅할 수 있으며, 262,144토큰 창을 갖추고 있고, 단일 OpenAI 호환 키로 접근할 수 있는 200개 이상의 모델 중 하나입니다. 공급자 정가가 0% 마크업으로 그대로 전달되므로, 이 비교의 어느 한쪽에서 공급업체 가격 인하가 있으면 적용되는 당일 우리 라우트에 반영됩니다.

Clef 자체는 우리의 라우트 중 하나가 아닙니다 — 우리의 공개 카탈로그는 Clef에 대해 아무것도 반환하지 않으며, 여기 어떤 내용도 우리의 가용성 주장으로 읽혀서는 안 됩니다. 우리가 실제로 제공하는 것은 Cloudflare 계정 없이도 그 의사결정 패턴에 도달할 수 있게 해주는 모델입니다: TypeSafe의 Jev 1.13은 백만 입력 토큰당 $0.042에 등재된 라우트로, 65,536토큰 컨텍스트를 갖추고 있으며, 동일한 7일 구간에서 p50 148ms로 측정되었고, 완전히 동일한 POST /v1/systemone 요청 형태를 사용합니다. Clef는 의도적으로 Jev와 API 호환되므로, 둘 중 하나를 기준으로 구축된 파이프라인은 설정 변경 하나만으로 다른 쪽으로 옮겨갈 수 있습니다 — 바로 이것이 라우팅 계층이 공짜로 만들어 주기 위해 존재하는 경우입니다. 둘 다 접근 가능하게 유지하고, 여러분 자신의 레이블로 측정한 뒤, 승자가 아키텍처적 약속이 아니라 하나의 데이터 포인트가 되게 하십시오. 의사결정 모델이 결국 에이전트를 게이팅하게 되더라도, 그 결정에 따라 행동하는 모델은 여전히 접근 가능해야 하며, 그 나머지 절반은 이미 같은 키 뒤에 있습니다.

OrcaRouter's own model page for qwen/qwen3.8-27b, showing a 262,144-token context window and pricing of $0.33 per million input tokens and $2.40 per million output tokens.

무엇이 이 읽기를 바꿀까요?

세 가지, 그것을 움직이는 정도가 커지는 순서로.

제3자가 Decision Index를 다시 실행해야 합니다. 이 스위트는 공개되어 있고 Cloudflare는 해당 평가를 재현 가능하다고 설명하므로 이는 달성 가능한 일입니다. 그리고 주목해야 할 것은 CLINC150의 범위 외 셀인데, 27B의 97.4가 라우팅에서 가장 어려운 절반에 대한 Jev의 89.3보다 진정한 우위인지, 아니면 자체 제작 하네스에서 비롯된 아티팩트인지가 걸려 있기 때문입니다. Cloudflare 외부에서는 아직 아무도 알지 못합니다.

누군가는 Clef와 Qwen3.8-27B를 동일한 레이블을 가진 동일한 분류 작업에서 점수를 매겨야 한다. 그 비교만이 헤드 교체가 폐쇄 집합 결정에서 품질 타협인지 품질 업그레이드인지를 판가름할 수 있으며, 두 공급업체 모두 그것을 실행할 유인이 없다. 그때까지 40점 GPQA 격차는 무엇이 제거되었는지에 관한 이용 가능한 최선의 증거로 남아 있으며, 그것은 잘못된 작업에 관한 증거다.

그리고 Clef의 지연 시간은 동시성 하에서 p95가 필요하다. 209ms 중앙값은 공급업체가 측정했으며, 공급업체가 통제하는 하드웨어에서, 핫 패스에 자리한다는 것이 전체 셀링 포인트인 모델을 대상으로 한 것이었다. 자기회귀 부모 대비 순서는 아키텍처적인 것이며 살아남을 것이다. 불신해야 할 숫자는 절대 밀리초 값이고, 전체 비즈니스 케이스가 기대고 있는 숫자도 바로 그 값이다.

Qwen3.8-27B는 하나의 OpenAI 호환 키로 접근할 수 있는 200개 이상의 모델 중 하나입니다 — Qwen3.8-27B.