
Clef cố ý sao chép API của Jev — và đó mới là phần thú vị
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 219 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Clef là một mô hình đa phương thức 27 tỷ tham số của Cloudflare, chỉ trả lời các câu hỏi có kiểu và không làm gì khác. Bạn đưa cho nó một trạng thái — văn bản, JSON, một hình ảnh, một khung video — cùng một lược đồ gồm tối đa 64 câu hỏi có tên, và nó trả về xác suất cho mọi lựa chọn được phép trong một lượt lan truyền tiến. Không có văn bản được sinh ra, không có trình phân tích cú pháp, không có vòng lặp giải mã. Điều khiến Cloudflare/clef đáng để đọc không phải là thiết kế đó, thứ mà nó đã vay mượn, mà là định dạng truyền tải mà nó chọn: Cloudflare xây dựng Clef để nói cùng phần thân yêu cầu và phản hồi của Jev System One, mô hình quyết định mà TypeSafe phát hành đầu tiên, được phục vụ tại cùng đường dẫn POST /v1/systemone. Khả năng tương tác ở đây chính là toàn bộ lập luận thương mại. Nếu pipeline của bạn đã hỏi một mô hình quyết định các câu hỏi theo hình dạng đó, thì Clef chỉ là một thay đổi URL và một chuỗi mô hình, chứ không phải một cuộc di trú.
Đó là một điều bất thường để một bài đăng phát hành chôn vùi, và Cloudflare không chôn vùi nó — thẻ mô hình nói thẳng rằng API “hoàn toàn tương thích với Jev và SystemOne”, và blog mở đầu bằng việc ghi công TypeSafe vì đã đưa hạng mục này lên bản đồ trước khi định vị Clef là phiên bản thế hệ thứ hai của một thử nghiệm nội bộ. Vậy nên cách đọc trung thực về bản phát hành này có ba phần: quyết định tương thích đó mang lại cho bạn những gì, những con số của chính Cloudflare nói gì về việc Clef thắng và thua ở đâu, và điều gì vẫn chưa được kiểm chứng vì mọi số liệu trong bảng đó đều do nhà cung cấp phát hành mô hình tạo ra.
Danh mục này đến từ một nơi khác.
Bài đăng của Cloudflare thẳng thắn về nguồn gốc. Ý tưởng về một mô hình trả về đầu ra có cấu trúc bị giới hạn thay vì văn xuôi được ghi nhận cho Jev System One của TypeSafe. Cách Cloudflare tự mình bước vào là một bản demo trước đó đã bẻ hướng một mô hình diffusion để phát ra các xác suất tất định bằng cách phơi bày logprobs, cùng với công việc cộng đồng của Matt Mastracci nhằm giúp inference engine xử lý được mô thức đó. Clef xây dựng dựa trên khái niệm đó với một backbone khác, một scoring head được thiết kế chuyên biệt, và — phần quan trọng về mặt thương mại — một request body khớp với của đối thủ đương nhiệm.
Khi một nhà cung cấp vừa sao chép định dạng truyền dữ liệu của đối thủ vừa lấy chỉ số của đối thủ làm chuẩn để đo chính mình, thì khả năng tương thích không phải là một chú thích nhỏ bên lề mô hình, mà chính là chiến lược sản phẩm. Hoán đổi một mô hình ra quyết định phía sau một endpoint hiện có là cách rẻ nhất có thể để một đơn vị mới tham gia được dùng thử, và cũng là thử nghiệm rẻ nhất có thể đối với một đội đã có sẵn một trong những thứ này được đấu nối.
Điều gì thực sự đã được phát hành, và cái giá phải trả là bao nhiêu
• Tham số — 27B, được tạo ra bằng cách đóng băng Qwen3.8-27B cùng bộ mã hóa thị giác của nó và huấn luyện một schema head chung cùng các adapter hạng thấp rank-256 ở trên.
• Anh em — Clef-Flash, cùng công thức ở quy mô 9B từ Qwen3.5-9B. Bài viết riêng, những đánh đổi riêng.
• Ngữ cảnh — 65,536 token, theo trang mô hình Workers AI và bài viết trên blog. Trình trợ giúp mã hóa đi kèm mặc định là max_length=16,384, một giá trị mặc định chứ không phải mức trần, nhưng là giá trị mặc định bạn nhận được nếu dùng trình tải như được cung cấp.
• Các loại câu hỏi — noul (đúng/sai, trả về xác suất đúng), choice (2 đến 26 lựa chọn có tên), score (2 đến 26 mức có thứ tự). Mỗi yêu cầu từ 1 đến 64 câu hỏi.
• Giá — $0,24 cho mỗi triệu token đầu vào trên Workers AI của Cloudflare, hoặc tự lưu trữ từ trọng số Apache-2.0 với dung lượng khoảng 55 GB trải trên mười hai phân đoạn.
• Giấy phép — Apache 2.0, theo checkpoint cơ sở Qwen3.8-27B.

Nơi nó thắng, và nó thắng thật
Lần chạy Decision Index của Cloudflare là nguồn cho mọi thứ trong phần này, và bảng xếp hạng chứa nó là của Cloudflare. Không có nội dung nào dưới đây được tái lập một cách độc lập. Hãy đọc nó như trường hợp tốt nhất của nhà cung cấp, và để ý xem nó không đồng đều đến mức nào.
Các chiến thắng tập trung ở nơi mà một bộ phân loại được huấn luyện nội bộ đáng lẽ phải thắng. Clef đạt macro-F1 cho ý định trên BANKING77 ở mức 94.2 so với 79.7 của Jev, và CLINC150 với khả năng xử lý ngoài phạm vi ở mức 97.4 so với 89.3 — một khoảng cách ba mươi điểm, là ô quan trọng nhất đối với việc ra quyết định trong bảng, bởi vì từ chối phân loại chính là nửa khó của định tuyến. Nó cũng đạt CRUXEval ở mức 86.7, CLadder ở mức 94.0, và trình mô phỏng thiết bị gia dụng ở mức 83.0.
Những điểm thua kém cũng có thật y như vậy và thuộc cùng một đoạn. Về kiến thức tổng quát và suy luận khó, Jev cũ hơn thắng dứt khoát: GPQA Diamond 78.3 so với 48.0, MMLU-Pro 82.7 so với 65.9, BBH 92.9 so với 73.7. Đó là ba chênh lệch lớn nhất trong bảng và tất cả đều cùng một chiều. Clef cũng không phải là mô hình tốt nhất trong so sánh của chính nó trên bộ PhishNChips thuộc lĩnh vực bảo mật, nơi nó đạt 79.6 còn một mục cạnh tranh đạt điểm cao hơn.
Trên bốn đánh giá quy trình làm việc đầu-cuối, được lấy từ bộ đánh giá công khai của chính TypeSafe và được chấm điểm dựa trên nhãn đồng thuận, hai bên sát nút đến mức gần như chỉ là một cuộc tung đồng xu. Clef thắng ở xử lý hóa đơn về các hành động chính xác với tỷ số 64,7 so với 61,8 và ở bộ sự cố bảo mật với 62,9 so với 61,7; Jev thắng ở khả năng quan sát dấu vết tác nhân với 71,6 so với 68,5; dịch vụ khách hàng là kết quả hòa 76,3 đến 76,0, chẳng có ý nghĩa gì ở mức chênh lệch đó.
Độ trễ là điểm mà khoảng cách mang tính cấu trúc chứ không chỉ ở mức cận biên. Cloudflare báo cáo trung vị 209,3 ms và p95 238,6 ms cho Clef, so với 524,1 và 536,0 cho Jev. Thứ tự đó là hệ quả của thiết kế phi tự hồi quy chứ không phải do những điểm dị thường của một benchmark, đó là lý do đây là con số dễ trụ được khi tiếp xúc với một triển khai thực tế nhất. Các mili giây tuyệt đối được đo trên phần cứng riêng của Cloudflare và tự chúng không nói lên nhiều điều.
Điểm dữ liệu thuyết phục nhất trong bản phát hành không phải là một dòng trong bảng benchmark. Cloudflare nói rằng nhóm tình báo mối đe dọa của mình đã giao một tên miền cho Clef cùng với dịch vụ kết xuất trình duyệt của mình và nhận được phán quyết phân loại trong 2,2 giây, so với 4,7 giây đối với LLM đa dụng nhanh nhất của chính họ trên cùng quy trình, đồng thời trả về nhiều phân loại hơn. Giai thoại nội bộ, không phải một nghiên cứu — nhưng đó là kiểu câu chuyện giải thích vì sao bất kỳ ai lại xây dựng thứ này thay vì gửi prompt cho một mô hình tổng quát.

Hai điều mà tài liệu tham chiếu API cho bạn biết, và một điều thì không.
Những cạm bẫy được ghi trong tài liệu thì nhỏ và đáng để đọc trước khi bạn chuyển bất cứ thứ gì. Trường độ tin cậy đo mức độ tập trung của các xác suất, chứ không phải xác suất rằng câu trả lời là đúng — một mô hình được hiệu chỉnh tốt có thể trả về một câu trả lời đúng có độ tin cậy thấp và một câu trả lời sai có độ tin cậy cao. Và khi hai lựa chọn hòa nhau, câu trả lời sẽ tuân theo thứ tự lựa chọn của mô hình, vì vậy hãy đặt lựa chọn ưu tiên của bạn lên trước. Bất kỳ ai chuyển một bộ phân loại dựa trên prompt mà không đọc hai câu đó sẽ đọc sai nhật ký của chính mình.
Hạn chế lớn hơn không được ghi lại ở bất cứ đâu vì nó mang tính cấu trúc. Clef hoàn toàn không có đường sinh văn bản, nghĩa là nó không thể soạn câu trả lời, tóm tắt một luồng thảo luận, gọi một công cụ hay duy trì một cuộc trò chuyện, và nó sẽ không tự bịa ra một danh mục mà bạn chưa khai báo. Toàn bộ thiết kế giả định rằng bạn có thể liệt kê trước các câu trả lời được phép. Điều đó âm thầm loại trừ một lớp lớn các bài toán, và không mức hiệu năng benchmark nào có thể thay đổi điều đó.
Giá trị của lập luận về tính tương thích
Đây là lúc bản phát hành không còn là một bài đánh giá mô hình nữa mà trở thành một câu hỏi kiến trúc. Nếu Clef dùng đúng dạng yêu cầu của Jev, thì mô hình đằng sau endpoint quyết định của bạn chỉ là một giá trị cấu hình, và cách hợp lý để áp dụng nó là chạy song song thay vì thay thế — chạy cả hai trên lưu lượng của chính bạn, giữ cái đo lường tốt hơn trên dữ liệu của bạn, và để việc chuyển đổi luôn rẻ.
Bản thân Clef không nằm trong danh sách route của chúng tôi; danh mục OrcaRouter trả về 404 cho nó, và không có gì ở đây nên được hiểu là tuyên bố về tính sẵn có từ phía chúng tôi. Thứ chúng tôi thực sự cung cấp là mô hình đương nhiệm mà nó được tạo ra để thay thế. Jev 1.13 của TypeSafe là một route có trong danh sách với giá $0,042 cho mỗi triệu token đầu vào trên ngữ cảnh 65.536 token, được phục vụ qua cùng POST /v1/systemone body, nên một thử nghiệm A/B giữa hai mô hình chỉ là thay chuỗi model chứ không phải viết lại. Việc có cả hai phía sau một khóa — hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên, không đánh thêm phí trên mỗi token, tự động chuyển đổi dự phòng giữa các nhà cung cấp — chính là thứ giữ cho thử nghiệm đó tiếp tục chạy sau cái tuần mà ai đó quyết định quan tâm đến nó, thay vì mục rữa thành một dòng chú thích cũ trong file cấu hình. Mô hình tổng quát mà bạn giữ sẵn để xử lý bất cứ điều gì mô hình quyết định đưa ra đều có thể truy cập từ chính khóa đó thay vì phải có hợp đồng thứ hai.

Điều gì sẽ thay đổi cách đọc này?
Ai đó bên ngoài Cloudflare cần chạy lại Decision Index. Bộ này là công khai và các đánh giá được mô tả là có thể tái lập, nên một lần chạy của bên thứ ba là sự khác biệt giữa bảng của nhà cung cấp và một sự thật — và những ô quan trọng nhất là những ô chỉ về hai hướng ngược nhau. Điểm 97.4 về phát hiện ý định ngoài phạm vi bên cạnh điểm 48.0 trên GPQA Diamond không phải là một đường cong năng lực mượt mà; nó mô tả một mô hình rất giỏi ở các dạng phân loại trong phân phối huấn luyện của nó và yếu hơn nhiều ở việc suy luận mà nó chưa từng thấy. Nếu điều đó đứng vững qua kiểm thử độc lập, thì đó là sự thật quan trọng nhất về mặt vận hành về Clef và nó không nằm trong phần nổi bật.
Lưu lượng production cũng cần trông giống bảng độ trễ. Mức trung vị 209 ms đo được trên một H200 không nói lên điều gì về p95 khi có đồng thời, và toàn bộ điểm hấp dẫn của thiết kế nằm ở chỗ nó nằm trên một hot path.
Và nền tảng tinh chỉnh cần tạo ra thứ gì đó. Bài đăng của Cloudflare mô tả một vòng lặp RL — AI Gateway để thu thập tập dữ liệu từ lưu lượng của chính bạn, Workers AI để tạo các rollout, Containers làm sandbox chấm điểm, Trainer để cập nhật trọng số, rồi triển khai lại lên Workers AI — trong cùng bài đăng công bố các mô hình, mà không kèm kết quả khách hàng nào. Một Clef đã được tinh chỉnh mà vượt qua bản cơ sở trên một tác vụ mà bản cơ sở chưa từng được huấn luyện sẽ là bằng chứng mạnh mẽ hơn nhiều cho hạng mục này so với bất kỳ hàng nào trong bảng.
Cho đến lúc đó, tóm tắt công bằng là thế này: Cloudflare đã phát hành một mô hình quyết định thực sự, được cấp phép theo kiểu permissive, thực sự nhanh, và khiến nó có thể được hoán đổi dễ dàng với mô hình ra đời trước đó. Đó là một câu chuyện hay hơn hầu hết các bản phát hành mở mang lại, và cho đến nay, nó vẫn hoàn toàn là lời tự thuật của chính nhà cung cấp về mình.
