
Clef so với Gemma 4 12B: Một thiết bị chuyên dụng cho việc ra quyết định 64K token đối đầu với một mô hình tổng quát 256K token
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 219 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Con số hữu ích nhất trong một so sánh giữa Clef và Gemma 4 12B không phải là điểm benchmark. Đó là 65.536 so với 256.000 — các cửa sổ ngữ cảnh. Cloudflare/clef là một mô hình quyết định đa phương thức 27 tỷ tham số, được huấn luyện hậu kỳ từ Qwen3.8-27B, đọc một trạng thái và một lược đồ các câu hỏi có kiểu rồi trả về xác suất cho mọi câu trả lời được phép trong một lượt không tự hồi quy duy nhất. Gemma 4 12B — checkpoint Unified, google/gemma-4-12B-it — là mô hình any-to-any không dùng encoder 11,95 tỷ tham số của nhà cung cấp, ra mắt vào mùa hè năm 2026, tạo văn bản trên cửa sổ 256.000 token bằng hơn 140 ngôn ngữ. Đặt một thư mục hợp đồng trước cả hai và mô hình quyết định sẽ hết chỗ sớm hơn bốn lần, vì giới hạn trần của nó là 65.536 token được ghi trong tài liệu, còn của mô hình tổng quát là 256.000. Sự bất đối xứng đó không phải là một chú thích nhỏ. Với cả một nhóm công việc định tuyến — tài liệu dài, các luồng trò chuyện được dán vào, biểu mẫu nhiều trang — nó quyết định lựa chọn trước cả khi độ chính xác được bàn đến.
Vậy đây không phải là một trang nói về mô hình nào tốt hơn. Đây là một trang nói về hai trục mà chúng thực sự khác biệt: mỗi mô hình có thể nắm giữ bao nhiêu trạng thái, và mỗi mô hình thực sự có thể tạo ra dạng câu trả lời nào. Mọi thứ còn lại hoặc là một con số của nhà cung cấp mà chưa ai tái lập được, hoặc là một phép so sánh không mang ý nghĩa như vẻ ngoài của nó.
Mỗi thứ là gì, mỗi thứ một đoạn văn.
Clef là mô hình ra quyết định 27B của Cloudflare, được phát hành theo Apache-2.0 với trọng số trên Hugging Face và một endpoint được lưu trữ trên Workers AI. Cloudflare đã đóng băng phần backbone Qwen3.8-27B bao gồm cả bộ mã hóa thị giác của nó, gắn thêm một joint schema head cùng các adapter low-rank hạng 256, và huấn luyện nó bằng cross-entropy làm mượt nhãn cho các câu trả lời schema hợp lệ song song với một Brier loss để tăng độ chuẩn xác của hiệu chuẩn. Bạn cung cấp trạng thái — văn bản, JSON, hình ảnh hoặc khung video — cùng từ một đến 64 câu hỏi có tên, mỗi câu thuộc một kiểu noul (đúng/sai, trả về xác suất đúng), choice (2 đến 26 tùy chọn có tên) hoặc score (2 đến 26 mức có thứ tự). Thứ trả về là một phân phối cho mỗi câu hỏi và không gì khác. Hoàn toàn không có đường sinh văn bản nào.
Gemma 4 12B là một mô hình tổng quát sinh văn bản. Nó không dùng encoder: thay vì các nhánh thị giác hay âm thanh riêng biệt, các patch ảnh thô và dạng sóng âm thanh được chiếu thẳng vào không gian embedding của mô hình ngôn ngữ thông qua các lớp tuyến tính nhẹ, điều này cho phép nó tiếp nhận văn bản, hình ảnh, video và âm thanh mà không cần pipeline riêng cho từng phương thức. Nó có các chế độ suy nghĩ có thể cấu hình, khả năng gọi hàm gốc, từ vựng 262K và một cơ chế attention kết hợp xen kẽ attention cửa sổ trượt 1.024 token với attention toàn cục đầy đủ. Nó theo giấy phép Apache-2.0, cùng với các điều khoản sử dụng riêng của nhà cung cấp đi kèm, và đây là checkpoint mà hầu hết mọi người ám chỉ khi nói "chạy kích thước này cục bộ".
Có một điều cần nói thẳng trước khi đi xa hơn: không mô hình nào trong hai mô hình là một tuyến trên OrcaRouter. Danh mục của chúng tôi trả về lỗi 404 đối với cloudflare/clef và đối với checkpoint 12B trong cùng dòng họ, và không có gì trong bài viết này nên được hiểu là tuyên bố về tính khả dụng từ phía chúng tôi. Những gì chúng tôi thực sự cung cấp từ dòng Gemma là hai kích thước lớn hơn, và giá của chúng xuất hiện ở phần dưới.

Danh sách tùy chọn là một giao diện, và nó có một dạng lỗi.
Sự khác biệt về cấu trúc giữa hai cái này nằm ở chỗ điều gì xảy ra với dữ liệu đầu vào không phù hợp.
• Đầu ra — Clef trả về một xác suất cho mỗi tùy chọn đã khai báo, và chỉ những tùy chọn đó. Gemma 4 12B trả về văn bản được tạo.
• Từ chối — Clef không có "không có lựa chọn nào ở trên" trừ khi bạn tự viết một lựa chọn như vậy vào tiêu chí. Gemma 4 12B có thể mô tả một trường hợp không khớp với bất cứ điều gì bạn đã hỏi.
• Dạng lỗi — Lỗi của Clef thì âm thầm: một lựa chọn đầy tự tin bên trong schema của bạn, không có ngoại lệ nào được đưa ra, không có nhánh dự phòng nào được kích hoạt. Lỗi của mô hình tổng quát thì thường ồn ào: văn xuôi không thể phân tích cú pháp.
• Khả năng kiểm thử — một tập tùy chọn cố định giúp thành phần có thể tái tạo và có chi phí kiểm toán thấp. Văn bản tự do mang lại sự linh hoạt nhưng lại tốn kém để xác thực.
Những con số của chính Clef cho vấn đề từ chối đó là những số liệu yếu nhất mà nó công bố. Trên CLINC150 với khả năng xử lý ngoài phạm vi — phát hiện ý định, trong đó một câu trả lời hợp lệ là "cái này không thuộc danh mục nào" — mô hình 27B đạt 97,4 macro-F1, mức cao nhất trong bảng của Cloudflare và là lý do để quan tâm đến 27B hơn so với người anh em 9B của chính nó, vốn chỉ đạt 66,8 trên cùng bài đánh giá đó. Khoảng cách ba mươi điểm giữa hai mô hình được xây dựng từ cùng một công thức cho thấy hành vi ngoài phạm vi chính là thứ mà quy mô hậu huấn luyện mang lại, và cũng là thứ mà hầu hết các pipeline định tuyến âm thầm phụ thuộc vào. Biện pháp giảm thiểu mà Cloudflare ghi lại là một câu hỏi thứ hai trong schema — hãy thêm một noul trường hỏi liệu trạng thái có phù hợp chút nào không, rồi đặt ngưỡng cho nó — cách này hiệu quả, và đó là việc của bạn chứ không phải của mô hình.
Những con số đến từ đâu quan trọng hơn những gì chúng nói
Mọi con số Clef trong bài viết này đều đến từ Cloudflare: thẻ mô hình của nó, bài đăng ra mắt của nó, hoặc lần chạy Decision Index của nó. Bộ công cụ này vốn là của chính Cloudflare, và bảng xếp hạng lưu trữ các điểm số cũng là của chính Cloudflare. Đó là một nhà cung cấp đang đo sản phẩm của mình trên phần cứng do mình kiểm soát để so với một đối thủ mà họ cố tình mô phỏng API. Không bên thứ ba nào đã tái lập được bất kỳ phần nào trong đó, và bài viết này sẽ không giả vờ điều ngược lại.
Cột Gemma 4 12B là một loại bằng chứng khác. Thẻ của chính nhà cung cấp công bố MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 không dùng công cụ ở mức 77,5% và LiveCodeBench v6 ở mức 72,0%. Artificial Analysis, một đơn vị theo dõi độc lập, đánh chỉ số cấu hình suy luận này ở Intelligence Index 14,18, với mức niêm yết 0,10 USD / 0,30 USD mỗi triệu token và tốc độ đầu ra trung vị đo được khoảng 113 token mỗi giây — và trang của chính đơn vị này lưu ý rằng những con số đó phụ thuộc vào tác vụ và phần cứng.
Cách hiểu trung thực là hai cột này hoàn toàn không thể so sánh với nhau. Một cột là bộ đánh giá chất lượng quyết định của nhà cung cấp do chính nhà cung cấp vận hành; cột còn lại là sự pha trộn giữa các chuẩn đánh giá của nhà cung cấp và một đánh giá độc lập về một mô hình tổng quát. Việc đặt 97.4 bên cạnh 77.2 như thể chúng là các cột của cùng một bảng sẽ là điều gây hiểu lầm nhất mà trang này có thể làm.
Độ trễ là một trong những điểm mà ít nhất hai mô hình có thể được bàn đến bằng cùng đơn vị, và ngay cả ở đó, các lưu ý vẫn chồng chất. Cloudflare báo cáo Clef đạt trung vị 209,3 ms và p95 238,6 ms, được đo trên hạ tầng của chính mình. Artificial Analysis đo thời gian đến chunk đầu tiên của mô hình 12B vào khoảng 2,4 giây trong một cấu hình suy luận, vốn bao gồm một ngân sách suy nghĩ mà mô hình ra quyết định không có. Một lượt không tự hồi quy 209 ms so với khởi đầu sinh 2,4 giây là một khác biệt kiến trúc thực sự — một lượt truyền xuôi so với một vòng lặp giải mã — và đó là lập luận mạnh nhất mà Clef có cho một đường dẫn nóng. Ở 27B, nó cũng là một mô hình cần phần cứng cấp H200 để đạt được con số đó, và Cloudflare tính 0,24 USD cho mỗi triệu token đầu vào để chạy nó thay bạn.

64K ngữ cảnh thực sự đem lại cho bạn những gì
Ngữ cảnh là nơi phép so sánh này trở nên thực tế và cũng là nơi mà người đa năng giành chiến thắng trên lý thuyết với cách biệt lớn.
• Clef — 65.536 token, theo trang mô hình Workers AI và bài đăng ra mắt; công cụ hỗ trợ mã hóa đi kèm mặc định là max_length=16,384, đây là giá trị mặc định chứ không phải giới hạn trần, nhưng đó chính là giá trị mặc định bạn sẽ nhận được nếu dùng trình tải ở nguyên trạng khi phát hành.
• Gemma 4 12B — 256.000 token, theo thẻ thông số của nhà cung cấp, với attention cửa sổ trượt 1.024 token để giữ chi phí ngữ cảnh dài ở mức thấp.
• Hình ảnh — Clef chấm điểm hình ảnh và khung hình video cùng với trạng thái văn bản thông qua bộ mã hóa thị giác kế thừa. Gemma 4 12B tiếp nhận văn bản, hình ảnh, video và âm thanh thông qua đường dẫn không dùng bộ mã hóa của nó.
• Ngôn ngữ — Thẻ của Clef không đưa ra bất kỳ tuyên bố đa ngôn ngữ nào; Gemma 4 12B được ghi nhận trên hơn 140 ngôn ngữ.
Đối với một ticket, một hóa đơn hay một ảnh chụp màn hình đã kết xuất, 64K là quá thoải mái và khác biệt chỉ mang tính học thuật. Còn với một hợp đồng 200 trang mà bạn muốn phân loại từng trường một, thì đó là toàn bộ vấn đề: mô hình tổng quát có thể giữ được toàn bộ tài liệu, còn mô hình ra quyết định thì không. Câu trả lời của Clef cho điều đó là chia nhỏ (chunking), và chia nhỏ một tài liệu trước khi bạn ra quyết định về nó nghĩa là bạn đã đưa ra một quyết định mà lẽ ra mô hình phải đưa ra. Đó là một giới hạn thực sự và nó xứng đáng được nêu rõ như một giới hạn.
Bạn thực sự sẽ phải trả bao nhiêu, và ở đâu
Cả hai mẫu đều không có trong danh mục của chúng tôi, vì vậy câu hỏi về giá chia thành ba hướng.
• Clef — 0,24 USD cho mỗi triệu token đầu vào trên Workers AI của Cloudflare, hoặc tự lưu trữ từ trọng số Apache-2.0; độ trễ mà Cloudflare công bố được đo trên một chiếc H200 duy nhất với torch 2.11 và transformers 5.10.2, và các bản lượng tử hóa do cộng đồng tạo ra chỉ trong vòng hai ngày cho thấy có thể thu nhỏ nó hơn nữa với một mức tổn thất độ chính xác mà chưa ai đo được.
• Gemma 4 12B — hoàn toàn không có phương án dịch vụ lưu trữ nào ở đây. Bạn phải tự tải khoảng 24 GB trọng số BF16 về và tự chạy chúng, hoặc tìm đến một nền tảng của bên thứ ba. Không tồn tại mức giá theo token nào mà chúng tôi có thể báo giá.
• Sản phẩm thay thế được định tuyến — Gemma 4 26B A4B, một mixture-of-experts với tổng 25,2B tham số và 3,8B tham số hoạt động, được niêm yết trên OrcaRouter ở mức $0,06 mỗi triệu token đầu vào và $0,33 mỗi triệu token đầu ra với ngữ cảnh 262.144 token. Gemma 4 31B, phiên bản đa phương thức dày đặc cùng dòng với khả năng suy luận có thể cấu hình và gọi hàm gốc, được niêm yết ở mức $0,13 và $0,38. Cả hai đều dùng chung một khóa với giá niêm yết của nhà cung cấp được chuyển nguyên vẹn, không tính phụ phí theo token và tự động chuyển đổi dự phòng giữa các nhà cung cấp.
Dòng cuối cùng đó là phiên bản trung thực về mức độ liên quan của chúng tôi trong phép so sánh này. Nếu thứ bạn cần là một mô hình đa dụng đọc một tài liệu dài rồi viết ra một câu, thì con đường rẻ để có được nó là một kích cỡ Gemma 4 mà chúng tôi thực sự cung cấp, và nó tốn ít hơn trên mỗi triệu token so với việc tự vận hành một mô hình 12B trên GPU đi thuê. Nếu thứ bạn cần là một quyết định có giới hạn nằm trên đường dẫn nóng, thì mức trung vị 209 ms của Clef là một thuộc tính kiến trúc thực sự, và thứ gần nhất với nó trong danh mục của chúng tôi là Jev 1.13 của TypeSafe — mô hình mà Cloudflare đã đánh giá đối chiếu và sao chép định dạng truyền tải từ đó — với giá $0,042 mỗi triệu token đầu vào trong ngữ cảnh 65.536 token, được phục vụ qua cùng hình dạng POST /v1/systemone. Bởi vì cả hai tương thích API phía sau một adapter mỏng, việc thử Clef so với giải pháp hiện hành là một thử nghiệm chứ không phải một cuộc di trú, và thử nghiệm đó vẫn rẻ khi cả hai phía đều có thể truy cập qua một endpoint.

Quyết định, được nêu ra như một quyết định
Chọn Clef khi các câu trả lời có thể liệt kê được, trạng thái vừa vặn trong 64K, quyết định nằm trên một đường xử lý nhạy cảm với độ trễ, và bạn sẵn sàng tự chịu trách nhiệm về lớp còn lại. Điểm 97,4 của 27B trên bài toán phát hiện ý định ngoài phạm vi là lý do bạn sẽ trả tiền cho nó thay vì bản 9B cùng dòng, còn dạng đầu ra cố định của nó là thứ khiến thành phần này có thể kiểm toán mà không cần bộ phân tích cú pháp.
Chọn Gemma 4 12B khi đầu vào dài, khi phương thức là âm thanh hoặc video, khi câu trả lời cần ở dạng văn xuôi, hoặc khi các danh mục vẫn chưa được biết — bởi vì "phân loại đống này thành bất kỳ nhóm nào hợp lý" là một yêu cầu mà mô hình ra quyết định không thể chấp nhận, chứ không phải là yêu cầu nó xử lý kém. Đây là một mô hình tổng quát với một đánh giá độc lập đằng sau nó, và đối với công việc mở, điều đó đáng giá hơn một bảng của nhà cung cấp.
Hãy hoài nghi cả hai bộ số liệu vì lý do mà bài viết này liên tục nhắc lại: Cloudflare chưa từng được tái lập độc lập trên bất kỳ thứ gì, và thẻ đó chính là bảng benchmark của chính nhà cung cấp. Con số thực sự thú vị duy nhất trong cặp này — liệu một schema head 27B có thực sự giữ được điểm ngoài phạm vi 97,4 của nó trên dữ liệu mà nó không được huấn luyện hay không — lại đúng là con số mà cả hai nhà cung cấp đều không thể giải quyết và một bên thứ ba thì có thể.
