
Clef vs Gemma 4 12B: 256K 토큰 범용 모델에 맞선 64K 토큰 의사결정 어플라이언스
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
를 비교할 때 가장 유용한 숫자Clef와 Gemma 4 12B는 벤치마크 점수가 아니다. 그것은 65,536 대 256,000 — 바로 컨텍스트 윈도우다. Cloudflare/clef는 270억 개 파라미터의 멀티모달 결정 모델로, Qwen3.8-27B에서 후속 학습되었으며, 하나의 상태와 타입이 지정된 질문들로 이루어진 스키마를 읽고 단일 비자기회귀 패스로 모든 허용된 답변에 대한 확률을 반환한다. Gemma 4 12B — Unified 체크포인트, google/gemma-4-12B-it — 는 2026년 여름에 출시된 벤더의 119.5억 개 파라미터 인코더 없는 any-to-any 모델로, 140개 이상의 언어로 256,000 토큰 윈도우에 걸쳐 텍스트를 생성한다. 두 모델 앞에 계약서 폴더를 놓으면 결정 모델이 네 배 더 빨리 공간이 바닥난다. 상한이 문서상 65,536 토큰인 반면 범용 모델의 상한은 256,000이기 때문이다. 이 비대칭은 각주가 아니다. 라우팅 작업의 한 부류 전체 — 긴 문서, 붙여넣은 스레드, 여러 페이지 양식 — 에서 이것은 정확도가 논의되기도 전에 선택을 결정한다.
그러니까 이것은 어느 모델이 더 나은지에 관한 페이지가 아니다. 이것은 두 모델이 진정으로 차이를 보이는 두 축, 즉 각각이 얼마나 많은 상태를 담을 수 있는지, 그리고 각각이 물리적으로 어떤 형태의 답을 낼 수 있는지에 관한 페이지다. 나머지 모든 것은 아무도 재현하지 못한 벤더 수치이거나, 겉보기와는 다른 의미를 지닌 비교일 뿐이다.
각각이 무엇인지, 각각 한 문단으로.
Clef는 Cloudflare의 27B 결정 모델로, Apache-2.0에 따라 공개되었으며, 가중치는 Hugging Face에, 호스팅 엔드포인트는 Workers AI에 있습니다. Cloudflare는 비전 인코더를 포함한 Qwen3.8-27B 백본을 동결하고, 조인트 스키마 헤드와 rank-256 저랭크 어댑터를 부착했으며, 유효한 스키마 답변을 위한 레이블 스무딩 교차 엔트로피와 보정을 날카롭게 하기 위한 Brier 손실을 함께 사용해 훈련했습니다. 여러분은 제공합니다: 상태 — 텍스트, JSON, 이미지 또는 비디오 프레임 — 와 1~64개의 명명된 질문, 각각 유형: 부울 (참/거짓, 참일 확률을 반환), 선택 (2~26개의 명명된 옵션) 또는 점수 (2~26개의 순서가 있는 레벨). 반환되는 것은 질문당 분포뿐이며 다른 것은 없습니다. 텍스트 생성 경로는 전혀 없습니다.
Gemma 4 12B는 텍스트를 생성하는 범용 모델입니다. 이 모델은 인코더가 없습니다. 별도의 비전 또는 오디오 타워 대신, 원시 이미지 패치와 파형이 경량 선형 계층을 통해 언어 모델의 임베딩 공간으로 곧바로 투영됩니다. 덕분에 모달리티별 파이프라인 없이 텍스트, 이미지, 비디오, 오디오를 처리할 수 있습니다. 구성 가능한 사고 모드, 네이티브 함수 호출, 262K 어휘, 그리고 1,024토큰 슬라이딩 윈도우 어텐션과 전체 전역 어텐션을 교차시키는 하이브리드 어텐션 방식을 갖추고 있습니다. Apache-2.0이며 벤더 자체 사용 약관이 함께 적용됩니다. 그리고 사람들이 "이 크기를 로컬에서 실행하라"고 할 때 대개 의미하는 체크포인트입니다.
더 나아가기 전에 분명히 말할 것이 하나 있습니다: 어느 모델도 OrcaRouter의 라우트가 아닙니다. 우리 카탈로그가 404를 반환하는 대상은 cloudflare/clef 그리고 같은 제품군의 12B 체크포인트입니다. 이 글의 어떤 내용도 우리의 가용성 주장으로 해석되어서는 안 됩니다. 우리가 Gemma 제품군에서 실제로 보유한 것은 더 큰 두 가지 크기이며, 그 가격은 아래에 나옵니다.

옵션 목록은 인터페이스이며, 그것에는 실패 모드가 있다.
이 둘 사이의 구조적 차이는 들어맞지 않는 입력에 어떤 일이 일어나는가에 있습니다.
• 출력 — Clef는 선언된 각 옵션에 대해 확률을 반환하며, 오직 그 옵션들만 반환합니다. Gemma 4 12B는 생성된 텍스트를 반환합니다.
• 거부 — Clef에는 당신이 직접 기준에 "위 항목 어디에도 해당하지 않음"을 써 넣지 않는 한 그런 선택지가 없습니다. Gemma 4 12B는 당신이 물어본 어느 것에도 들어맞지 않는 사례를 설명할 수 있습니다.
• 실패 모드 — Clef의 오류는 조용하다: 스키마 안에서 자신 있게 선택하지만, 예외도 발생하지 않고 폴백 분기도 트리거되지 않는다. 범용 모델의 오류는 대개 요란하다: 파싱되지 않는 산문.
• 테스트 용이성 — 고정된 옵션 세트는 컴포넌트를 재현 가능하게 하고 감사 비용을 저렴하게 만듭니다. 자유 텍스트는 유연하게 하지만 검증 비용이 많이 듭니다.
그 거부 문제에 대한 Clef 자체 수치는 Clef가 공개하는 수치 중 가장 취약한 부분이다. 범위 외(out-of-scope) 처리를 포함한 CLINC150에서 — 유효한 답 하나가 "어느 범주에도 속하지 않는다"인 의도 탐지에서 — 27B는 97.4 macro-F1을 기록하는데, 이는 Cloudflare의 표에서 최고 점수이며, 같은 벤치마크에서 66.8을 기록한 자사의 9B 형제 모델보다 27B를 주목해야 하는 이유다. 같은 레시피로 만든 두 모델 사이의 30점 격차는 범위 외 동작이야말로 포스트트레이닝 규모가 사 주는 것임을 말해주며, 대부분의 라우팅 파이프라인이 조용히 의존하는 바로 그것이다. Cloudflare가 문서화한 완화책은 스키마에 두 번째 질문을 추가하는 것이다 — noul 필드를 추가해 상태가 애초에 해당하는지 묻고, 그다음 임계값을 적용하는 것 — 이것은 효과가 있으며, 모델이 아니라 여러분의 일이다.
숫자가 어디서 나온 것인지가 숫자가 무엇을 말하는지보다 더 중요하다.
이 글에 나오는 모든 Clef 수치는 Cloudflare에서 나온 것입니다: Cloudflare의 모델 카드, 출시 게시물, 또는 Decision Index 실행 결과에서요. 그 스위트 자체도 Cloudflare의 것이고, 점수를 호스팅하는 리더보드도 Cloudflare의 것입니다. 즉, 자사가 통제하는 하드웨어에서, 자사가 의도적으로 API를 미러링하는 경쟁 제품을 상대로 자사 제품을 측정하는 공급업체인 셈입니다. 어떤 제3자도 이 중 어느 것도 재현하지 못했으며, 이 글은 그렇지 않은 척하지 않을 것입니다.
Gemma 4 12B 열은 다른 종류의 증거입니다. 벤더가 자체 카드에서 MMLU Pro 77.2%, GPQA Diamond 78.8%, 도구를 사용하지 않은 AIME 2026 77.5%, LiveCodeBench v6 72.0%를 공개합니다. 독립 추적 기관인 Artificial Analysis는 추론 구성을 Intelligence Index 14.18로 산정하며, 백만 토큰당 $0.10 / $0.30을 명시하고, 측정된 중앙값 출력 속도는 초당 약 113토큰입니다 — 그리고 자체 페이지에는 이 수치가 워크로드와 하드웨어에 따라 달라진다고 명시되어 있습니다.
정직하게 읽자면, 이 두 열은 전혀 비교할 수 없다. 하나는 공급업체가 자체적으로 운영하는 공급업체의 의사결정 품질 스위트이고, 다른 하나는 공급업체 벤치마크와 일반 모델에 대한 독립적 평가가 섞인 것이다. 97.4를 77.2 옆에 마치 같은 표의 열인 것처럼 나란히 인용하는 것은 이 페이지가 할 수 있는 가장 오해를 부르는 일일 것이다.
지연 시간은 양자를 최소한 같은 단위로 논의할 수 있는 유일한 지점이며, 그곳에서조차 주의할 점이 겹겹이 쌓인다. Cloudflare는 자체 인프라에서 측정한 Clef의 중앙값이 209.3ms, p95가 238.6ms라고 보고한다. Artificial Analysis는 추론 구성에서 12B의 첫 청크까지 걸리는 시간을 약 2.4초로 측정하는데, 이에는 의사 결정 모델에 없는 사고 예산이 포함된다. 2.4초의 생성 시작에 대비한 209ms의 비자기회귀 패스는 실제 아키텍처 차이 — 하나의 순방향 패스 대 디코딩 루프 — 이며, Clef가 핫 패스에 대해 내세울 수 있는 가장 강력한 논거이다. 또한 27B에서는 그 수치를 달성하려면 H200급 하드웨어가 필요한 모델이며, Cloudflare는 이를 대신 실행해 주는 대가로 입력 토큰 100만 개당 $0.24를 청구한다.

64K의 컨텍스트가 실제로 무엇을 해 주는가
맥락은 이 비교가 실용적으로 바뀌는 지점이며, 제너럴리스트가 이론상으로 큰 차이로 앞서는 지점입니다.
• Clef — Workers AI 모델 페이지와 출시 게시물에 따르면 65,536토큰이며, 번들로 제공되는 인코딩 헬퍼의 기본값은 max_length=16,384입니다. 이는 상한이 아니라 기본값이지만, 로더를 제공된 그대로 사용할 경우 얻게 되는 기본값입니다.
• Gemma 4 12B — 벤더의 카드에 따르면 256,000토큰이며, 긴 컨텍스트 비용을 낮추기 위해 1,024토큰 슬라이딩 윈도 어텐션을 사용합니다.
• 이미지 — Clef는 상속된 비전 인코더를 통해 이미지와 비디오 프레임을 텍스트 상태와 함께 공동으로 스코어링합니다. Gemma 4 12B는 인코더 없는 경로를 통해 텍스트, 이미지, 비디오, 오디오를 처리합니다.
• 언어 — Clef의 카드는 다국어 지원을 내세우지 않습니다; Gemma 4 12B는 140개 이상의 언어로 문서화되어 있습니다.
티켓, 인보이스, 렌더링된 스크린샷의 경우 64K는 넉넉하며 그 차이는 학술적인 것에 불과하다. 필드별로 분류하려는 200페이지 계약서의 경우, 그것이 논쟁의 전부다. 범용 모델은 문서를 통째로 담을 수 있지만 결정 모델은 그럴 수 없다. 이에 대한 Clef의 답은 청킹이며, 문서에 대해 결정을 내리기 전에 문서를 청킹한다는 것은 모델이 내려야 했던 결정을 이미 내렸다는 뜻이다. 그것은 실질적인 한계이며, 한계라고 명시할 가치가 있다.
실제로 얼마를, 그리고 어디에 지불하게 되는가
두 모델 모두 우리 카탈로그에 없으므로, 가격 문제는 세 갈래로 나뉩니다.
• Clef — Cloudflare의 Workers AI에서 입력 토큰 100만 개당 $0.24이거나, Apache-2.0 가중치로 자체 호스팅할 수 있습니다; Cloudflare가 공개한 지연 시간은 단일 H200에서 torch 2.11 및 transformers 5.10.2로 측정되었으며, 이틀 이내에 등장한 커뮤니티 양자화는 아무도 측정하지 않은 어느 정도의 정확도 손실을 감수하면 더 작게 줄일 수 있음을 시사합니다.
• Gemma 4 12B — 여기에는 호스팅 경로가 전혀 없습니다. 약 24GB의 BF16 가중치를 직접 내려받아 직접 서빙하거나, 제3자 플랫폼을 이용해야 합니다. 저희가 제시할 수 있는 토큰당 가격은 존재하지 않습니다.
• 라우팅된 대체 모델 — Gemma 4 26B A4B는 총 25.2B, 활성 3.8B 파라미터의 전문가 혼합 모델로, OrcaRouter에 100만 입력 토큰당 $0.06, 100만 출력 토큰당 $0.33에 262,144토큰 컨텍스트로 등록되어 있습니다. 구성 가능한 사고와 네이티브 함수 호출을 지원하는 밀집 멀티모달 형제 모델인 Gemma 4 31B는 $0.13 및 $0.38에 등록되어 있습니다. 둘 다 하나의 키로 토큰당 마크업 없이 제공자 목록 가격을 그대로 전달하는 것 및 제공자 간 자동 장애 조치.
그 마지막 문장은 이 비교에서 우리의 관여를 정직하게 표현한 버전입니다. 긴 문서를 읽고 문장 하나를 써 내는 범용 모델이 필요하다면, 그것으로 가는 저렴한 길은 우리가 실제로 서빙하는 Gemma 4 크기이며, 임대한 GPU에서 12B를 자체 호스팅하는 것보다 백만 토큰당 비용이 더 저렴합니다. 핫 패스에서 경계가 정해진 결정이 필요하다면, Clef의 중앙값 209 ms는 실제 아키텍처적 속성이며, 우리 카탈로그에서 그것에 가장 가까운 것은 TypeSafe의 Jev 1.13입니다 — Cloudflare가 벤치마크 대상으로 삼고 와이어 포맷을 그대로 베낀 모델 — 65,536 토큰 컨텍스트에서 백만 입력 토큰당 $0.042로, 동일한 POST /v1/systemone 형태로 서빙됩니다. 두 모델은 얇은 어댑터 뒤에서 API 호환이 되므로, 기존 모델을 상대로 Clef를 시험해 보는 것은 마이그레이션이 아니라 실험이며, 양쪽 모두 하나의 엔드포인트를 통해 접근할 수 있을 때 그 실험은 저렴하게 유지됩니다.

결정으로서 진술된 그 결정
답이 열거 가능하고, 상태가 64K에 들어가며, 결정이 지연에 민감한 경로에 있고, 잔여 클래스를 직접 책임질 의향이 있을 때 Clef를 선택하세요. 27B의 범위 밖 의도 감지에서의 97.4점은 9B 동급 모델 대신 이 모델에 비용을 지불할 이유이며, 고정된 출력 형태는 파서 없이도 컴포넌트를 감사 가능하게 만드는 요소입니다.
입력이 길 때, 모달리티가 오디오나 비디오일 때, 답변이 산문이어야 할 때, 또는 범주를 아직 모를 때에는 Gemma 4 12B를 고르세요 — 왜냐하면 "이 더미를 합당한 아무 묶음으로나 분류해 주세요"는 결정 모델이 받아들일 수 없는 요청이지, 잘못 처리하는 요청이 아니기 때문입니다. 이것은 독립적인 평가가 뒷받침하는 범용 모델이며, 개방형 작업에서는 공급업체 표보다 더 가치가 있습니다.
그리고 이 글에서 계속 반복하는 이유로 두 수치 세트 모두에 회의적으로 임하세요: Cloudflare는 어떤 것에 대해서도 독립적으로 재현된 적이 없으며, 그 카드는 벤더 자체의 벤치마크 표입니다. 이 쌍에서 정말로 흥미로운 단 하나의 숫자 — 27B 스키마 헤드가 학습되지 않은 데이터에서 97.4라는 범위 외 점수를 실제로 유지하는지 — 는 정확히 어느 벤더도 확정할 수 없고 제3자는 확정할 수 있는 숫자입니다.
