
Clef vs Qwen3.8-27B: Một backbone, hai hợp đồng đầu ra
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 219 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Clef không thể viết nổi một câu, và nó được xây dựng từ một mô hình có thể làm được điều đó. Cloudflare/clef là một mô hình ra quyết định đa phương thức 27 tỷ tham số: bạn đưa cho nó một trạng thái và một lược đồ gồm các câu hỏi có kiểu, và nó trả về xác suất cho mọi lựa chọn được phép mà không tạo ra một token văn xuôi nào. Xương sống bên dưới nó là Qwen3.8-27B, một mô hình thị giác-ngôn ngữ dày đặc với trọng số mở, được đóng băng nguyên trạng cùng một đầu phụ nhỏ gắn thêm. Điều đó khiến đây trở thành một trong số ít những trang mô hình-đối-đầu-mô hình mà hai bên hoàn toàn không phải là đối thủ của nhau — chúng là một checkpoint và dẫn xuất của nó, chia sẻ 55 gigabyte trọng số và bất đồng về việc liệu câu trả lời là thứ bạn đọc hay thứ bạn tính toán.
Trọng số của cả hai đã được công khai trước cả những lời giới thiệu. Cloudflare đã tạo kho lưu trữ Cloudflare/clef trên Hugging Face lúc 21:15 UTC ngày 30 tháng 9 năm 2026, theo Apache-2.0, và công bố bài đăng thông báo — "Giới thiệu Clef: các mô hình quyết định mã nguồn mở của chúng tôi, và nền tảng tinh chỉnh RL mới" — vào chiều hôm sau. Trong khoảng mười tám giờ, một mô hình 55 gigabyte đã có thể tải xuống và chạy trên chính các GPU edge của Cloudflare trước khi nhà cung cấp của nó nói bất cứ điều gì về nó. Trong vòng ba ngày, nó đã có một trang thư viện Ollama nằm sau Ollama 0.35.1, đó là nơi bài viết này tìm thấy nó, cùng các bản dựng NVFP4, FP8, EXL3, INT8, Q4 và Q8 từ hàng tá người tải lên khác nhau.
Những gì có thể biết được từ kho lưu trữ thì đầy đủ một cách bất thường, và đáng để tách điều đó khỏi những gì không thể biết. Có thể biết: kiến trúc, checkpoint cơ sở, giấy phép, một bản triển khai tham chiếu chạy được, và một ma trận đánh giá đầy đủ. Không thể biết: liệu bất kỳ con số nào trong đó có trụ được qua một lần chạy lại bởi người không phải Cloudflare hay không. Mọi điểm số gán cho Clef dưới đây đều đến từ chính lần chạy của nhà cung cấp trên một bộ kiểm thử do nhà cung cấp tổ chức. Sự bất đối xứng đó, khi đặt cạnh một mô hình đã có một tháng được sử dụng độc lập, chính là xương sống trung thực của so sánh này, và phần còn lại của bài viết nói về nơi nó thực sự gây tác động.
Hai kho lưu trữ, đặt cạnh nhau
Hãy bắt đầu với phần tải xuống, vì sự giống nhau chính là điểm mấu chốt. safetensors của Clef tổng cộng 54,97 GB trải trên mười hai shard. Còn của mô hình cha là 55,56 GB trải trên mười tám shard. Clef giữ nguyên bộ mã hóa thị giác của Qwen3.8-27B — bộ xử lý, vision tower, toàn bộ front end đa phương thức — nên không có gì bị lược bỏ để làm nó nhỏ hơn. Thứ Cloudflare thêm vào là một head schema liên hợp 256 MB: bốn lớp, rộng 1.024, mười sáu head, một feedforward rộng 4.096, hai lớp định tuyến đọc các trạng thái ẩn cuối cùng của backbone. Công thức huấn luyện gồm một backbone đóng băng, head đó, và các adapter hạng thấp rank-256, với cross-entropy làm mượt nhãn cho các câu trả lời schema hợp lệ được ghép đối chiếu với mất mát Brier để tăng độ sắc nét cho hiệu chuẩn.
Sau đó là sự phân kỳ, vốn hoàn toàn nằm ở những gì mô hình được phép phát ra.
• Tham số — Clef 27B, được huấn luyện hậu kỳ từ Qwen/Qwen3.8-27B. Qwen3.8-27B 27B dense, 64 lớp, 5.120 chiều ẩn, từ vựng 248.320 token, 16 × (3 × Gated DeltaNet → FFN) xen kẽ với Gated Attention.
• Đầu ra — Clef: một logit cho mỗi tùy chọn được phép, được softmax theo từng câu hỏi, hoàn toàn không có đường tạo sinh. Qwen3.8-27B: token, lệnh gọi công cụ, và một khối suy luận được bật theo mặc định.
• Các dạng câu hỏi — Clef nhận từ 1 đến 64 câu hỏi có kiểu mỗi yêu cầu dưới ba dạng: noul (xác suất đúng), choice (2 đến 255 tùy chọn được đặt tên), score (2 đến 10 mức có thứ tự, trả về một giá trị có trọng số xác suất có thể nằm giữa chúng). Qwen3.8-27B không có hợp đồng như vậy; bạn nhận được văn xuôi và bạn viết trình phân tích cú pháp.
• Giấy phép — Apache-2.0 trên cả hai, đó là lý do việc lượng tử hoá của bên thứ ba diễn ra chỉ trong một cuối tuần.
• Chi phí của nửa đóng băng — phần head của Clef là 256 MB so với 54,97 GB của backbone. Gần như toàn bộ dung lượng tải về chính là mô hình cha. Nếu bạn đã có Qwen3.8-27B trên đĩa, thì bạn đang tải nó lần thứ hai chỉ để nhận được một ý kiến khác về cách trả lời.

Chi phí của việc đổi tiêu đề là bao nhiêu, qua hai con số
Đánh giá của Cloudflare là bộ Decision Index 0.2.1, được chạy nội bộ, và đó là một bảng về các mô hình quyết định — sáu cột: Clef, Clef-flash, Jev, DiffusionGemma Jev, Kev 9B và Laya. Qwen3.8-27B không có hàng nào trong đó, và Clef không có hàng trên Artificial Analysis Intelligence Index. Vậy nên không có bảng điểm chung và bài viết này sẽ không tự tạo ra một bảng như thế.
Tuy nhiên, có một bài đánh giá mà cả hai bên đều đã được đưa qua, và khoảng cách đủ lớn để trở thành con số mang tính quyết định nhất trong bản phát hành. Trên GPQA Diamond — các câu hỏi khoa học trình độ sau đại học, dạng trắc nghiệm — Cloudflare đo Clef đạt 48.0. Mô hình mẹ ở mức 90.5 trên bộ khung của Artificial Analysis và 89.2 trên model card của chính nhà cung cấp. Đó là một vách đá bốn mươi điểm về kiến thức tổng quát, và điều đó không có gì bí ẩn: Clef trả lời bằng cách cho điểm một tập lựa chọn cố định mà nó được đưa cho, và trắc nghiệm kiến thức tổng quát thì cách xa "định tuyến phiếu này" hết mức mà cùng bộ trọng số có thể được hướng tới. Hãy coi sự so sánh này là mang tính chỉ dẫn thay vì được kiểm soát — hai bộ khung, hai phòng thí nghiệm, không phải của nhà cung cấp cũng không phải của đơn vị theo dõi. Nhưng hướng đi thì không còn nghi ngờ gì, và đó là cái giá của hợp đồng.
Cùng một kiểu mẫu đó cũng thể hiện ở phần còn lại trong các ô đa dụng của Clef. MMLU-Pro 65.9, BBH 73.7, CLINC150 với xử lý ngoài phạm vi đạt 97.4 đối với 27B so với 89.3 của Jev — ô cuối cùng đó là ô hiếm hoi mà mô hình phái sinh đánh bại hẳn mô hình quyết định cũ, và điều đó quan trọng vì việc từ chối phân loại chính là nửa khó của định tuyến. Ở chỗ Clef mạnh, nó mạnh đúng ở những chỗ mà một bộ phân loại được huấn luyện nội bộ nên mạnh: macro-F1 cho ý định trên BANKING77 đạt 94.2, BFCL khớp chính xác theo ca đạt 98.5, API-Bank đạt 91.9. Ở chỗ nó yếu, một mô hình quyết định chỉ dùng văn bản từ một phòng thí nghiệm đối thủ — Jev của TypeSafe — đánh bại nó ba mươi điểm trên GPQA Diamond trong khi chỉ tính $0.042 cho mỗi triệu token đầu vào trên chính danh mục của chúng ta, đây là một lời nhắc hữu ích rằng "27B" tự nó không phải là một lập luận.
Những gì mô hình cha giữ lại là tất cả những gì Decision Index không hỏi tới. Trên thẻ riêng của nó và trong các hàng lấy nguồn từ AA, danh mục của chúng tôi ghi nhận: Terminal-Bench 2.1 ở mức 73.0, SWE-bench Pro 61.7, LiveCodeBench v6 90.3, OSWorld-Verified 84.3, DeepSWE 1.1 ở mức 42.2, AA Coding 68.1 ở hạng 35 trong 138 mô hình được lấy mẫu. Không mục nào trong số đó có một hàng Clef, vì Clef không thể thử chúng. Nó không có luồng gọi công cụ, không có lập kế hoạch dài hạn, không có cách nào để xuất ra bản vá.
Một quyết định phải đánh đổi những gì, và vì sao dòng đầu ra chính là toàn bộ lập luận
Trang mô hình Workers AI liệt kê đúng một mức đơn giá cho Clef: $0,24 cho mỗi triệu token đầu vào. Không hề có dòng nào cho đầu ra, và lý do nằm ở chính các phản hồi. Ví dụ do chính Ollama ghi trong tài liệu — một phiếu hỗ trợ được định tuyến qua ba câu hỏi — trả về "usage": {"input_tokens": 1204, "output_tokens": 3}. Ba token đầu ra cho ba câu hỏi. Việc Cloudflare có tính tiền cho ba token đó hay không gần như chẳng quan trọng: chi phí đầu ra của một quyết định không phải là một mức giá, mà là một con số đếm câu hỏi.
Đặt con số đó bên cạnh bảng giá của mô hình mẹ trên danh mục của chính chúng tôi, vốn là $0.33 cho mỗi triệu token đầu vào và $2.40 cho mỗi triệu token đầu ra với cửa sổ 262.144 token. Cùng trạng thái 1.204 token, cùng một quyết định định tuyến duy nhất:
• Clef — 1.204 token đầu vào ở mức $0,24 mỗi triệu là khoảng $0,00029 mỗi quyết định, và khoảng $289 mỗi triệu quyết định. Con số hầu như không thay đổi khi câu trả lời trở nên khó hơn, chỉ khi trạng thái trở nên dài hơn.
• Qwen3.8-27B với chế độ suy nghĩ bị tắt — cùng trạng thái đó tốn khoảng $0,00040 cho đầu vào, cộng thêm khoảng mười token đầu ra ở mức $2,40 mỗi triệu. Cứ gọi là $0,00042, hay $421 mỗi triệu. Clef rẻ hơn khoảng 1,5 lần, điều mà không ai đang kể.
• Qwen3.8-27B với chế độ suy nghĩ vẫn bật — đây là mặc định trên checkpoint này. Nếu mô hình dành 400 token để suy luận xem một email đặt lại mật khẩu thuộc nhóm nào trong bốn nhóm, thì đó là thêm $0.00096 và quyết định rơi vào khoảng $0.0014, tức $1,357 mỗi triệu. 400 token đó là một giả định, không phải một phép đo, và hệ số nhân thay đổi tuyến tính theo nó.
Vậy nên phiên bản trung thực của lập luận về giá hẹp hơn vẻ ngoài ban đầu của nó. So với một mô hình đa dụng chạy khi đã tắt thinking, Clef thắng về chi phí đô la với hệ số khoảng một rưỡi — là thật, nhưng không mang tính thay đổi cục diện. So với chính mô hình đó ở cấu hình mặc định, khoảng cách là một hàm của mức độ dài dòng, và mức độ dài dòng chính xác là thứ một mô hình ngôn ngữ có còn một thiết kế scorers-over-options thì hoàn toàn không có. Đó là luận điểm mang tính cấu trúc: chi phí của Clef bị chặn bởi độ dài của trạng thái, còn chi phí của mô hình cha bị chặn bởi việc mô hình cha quyết định nói bao nhiêu.

Con số duy nhất không gần
Cloudflare báo cáo độ trễ yêu cầu trung vị đối với Clef là 209,3 ms và p95 là 238,6 ms, được đo trên 43 bài kiểm chuẩn trong lần chạy của mình, trên các GPU biên của chính họ. Chưa có ai ngoài Cloudflare tái lập được kết quả này, và cơ sở hạ tầng của nhà cung cấp chính là lý do con số này thấp đến vậy — mô hình này được thiết kế để nằm trên cùng mạng với bên gọi.
Đối với công ty mẹ, chúng ta có thể làm tốt hơn một con số từ nhà cung cấp, vì đây là một trong những tuyến của chúng tôi. Trong khoảng thời gian bảy ngày kết thúc vào ngày 2 tháng 10 năm 2026, sân chơi của chính OrcaRouter đã đo Qwen3.8-27B ở mức p50 là 1.929 ms và 235,8 token đầu ra mỗi giây, trên 136,3 triệu token lưu lượng trong khoảng thời gian đó. Chuỗi số liệu theo ngày mới là phần thú vị: p95 đứng đúng ở 10.000 ms trong sáu trên bảy ngày, đọc lên cứ như một mức trần hơn là một phép đo, còn p50 dao động giữa 1.751 ms và 4.296 ms tùy theo từng ngày. Hãy coi trung vị này xấp xỉ gấp chín lần của Clef, và coi phần đuôi là không mang thông tin cho đến khi có ai đó công bố một phân phối thực sự.
Khoảng cách đó không phải là khác biệt do tinh chỉnh và nó sẽ không thu hẹp lại. Một lượt chỉ prefill cộng với một đầu chấm điểm song song hoàn tất trong một lần quét; một mô hình tự hồi quy kết thúc khi nó cạn điều để nói. Các con số tuyệt đối do nhà cung cấp đưa ra cho Clef xứng đáng được trừ hao như thường lệ, nhưng thứ tự là một thuộc tính của kiến trúc, không phải của phần cứng Cloudflare.
Bối cảnh được trích dẫn theo ba cách đối với một trong số chúng.
Cả hai mô hình đều nhận văn bản, JSON, hình ảnh và video. Các cửa sổ không giống nhau, và một trong số chúng được ghi không nhất quán tùy vào nơi bạn đọc.
• Clef, được lưu trữ — 65.536 token, theo trang mô hình Workers AI và bài đăng thông báo. Đó là con số ràng buộc một trình gọi API, và cách diễn đạt của chính Cloudflare mang tính so sánh: gấp đôi trạng thái mà cửa sổ 32K của Jev nắm giữ.
• Clef, trên đĩa — bản phát hành config.json khai báo max_position_embeddings là 262,144, vì phần xương sống đóng băng thuộc về mô hình gốc và vẫn mang mức trần vị trí của mô hình gốc. Trình trợ giúp encode_record đi kèm mặc định là max_length=16,384, với max_state_tokens có sẵn để giới hạn trạng thái một cách riêng biệt. Không có số nào trong ba số đó là sai; chúng trả lời những câu hỏi khác nhau, và một danh sách runtime quảng cáo 256K đang đọc config, chứ không phải endpoint.
• Qwen3.8-27B — 262.144 ở mức nguyên bản, có thể mở rộng lên 1.000.000 với cấu hình phục vụ phù hợp, theo thẻ của nhà cung cấp và dòng trong danh mục của chúng tôi. Tối thiểu gấp bốn lần cửa sổ Clef được host.
Hệ quả thực tế nhỏ hơn mức mà tỷ lệ này gợi ra. Clef tiêu thụ một trạng thái — một ticket, một hóa đơn, một ảnh chụp màn hình — chứ không phải một cuộc trò chuyện, và một trong những điểm bán hàng của nó là bạn có thể đưa cho nó một payload lớn đã được làm phẳng và đặt sáu mươi tư câu hỏi về nó mà không phải trả tiền cho payload đó một lần nữa cho mỗi câu hỏi. Lớp cha cần cửa sổ vì nó phải giữ lịch sử, các kết quả công cụ và lập luận của chính nó. Yêu cầu khác nhau, giới hạn khác nhau.
Cả hai đều nhìn thấy các điểm ảnh giống nhau.
Bộ mã hóa thị giác được kế thừa, nên đây không phải trường hợp một mô hình có khả năng đa phương thức còn mô hình kia thì không. Clef chấp nhận tối đa bốn hình ảnh mỗi yêu cầu, ở dạng PNG, JPEG hoặc WebP được mã hóa base64, được chia sẻ cho mọi câu hỏi trong payload, và các khung hình video có thể được thêm vào dưới dạng mảng khung — ví dụ về hóa đơn trong thẻ đặt câu hỏi có/không về việc liệu một tổng số có đọc được hay không, đây chính là thiết kế thu nhỏ. Qwen3.8-27B là một mô hình ngôn ngữ-thị giác gốc, với OmniDocBench 1.5 đạt 91,1, RealWorldQA đạt 85,9 và CharXiv đạt 78,8 trên thẻ của nhà cung cấp.
Điều khác biệt là những gì bạn nhận lại. Clef cho bạn quyết định theo từng trường kèm theo xác suất, tức là một câu trả lời có kiểu về một tài liệu. Mô hình cha cho bạn một mô tả về tài liệu, rồi sau đó bạn phân tích nó. Với một nhóm lớn các công việc xử lý tài liệu — kiểm tra biểu mẫu này, định vị điều khoản này, tổng này có vượt ngưỡng không — câu trả lời có kiểu chính là toàn bộ công việc, còn phần mô tả là chi phí phụ bạn phải trả rồi vứt đi.
Ranh giới thực sự nằm ở đâu
• Hãy dùng Clef — các câu trả lời có thể liệt kê trước và bạn không muốn tự viết một trình phân tích cú pháp. Định tuyến, phân loại, kiểm soát cổng, kiểm tra chính sách, trích xuất trường tài liệu. Tập đóng, từ 2 đến 255 lựa chọn mỗi câu hỏi, tối đa 64 câu hỏi được chấm điểm cùng nhau.
• Hãy chọn Clef — quyết định nằm trong một hot path, và 209 ms so với 1.929 ms sẽ thay đổi những gì pipeline có thể làm. Đây là lý do mạnh nhất để chuyển, và đó là lý do về độ trễ, không phải về độ chính xác.
• Hãy lấy Clef — bạn muốn tính tất định. Một tùy chọn bạn không khai báo thì không thể xuất hiện trở lại, vì không có bước tạo sinh nào để tạo ra nó.
• Giữ Qwen3.8-27B — câu trả lời không phải là một lựa chọn từ danh sách: tóm tắt, soạn thảo, suy luận qua một vấn đề mới lạ, viết mã, điều khiển công cụ trong một chặng đường dài. Clef không làm được điều nào trong số đó, và nó sẽ không nói với bạn như vậy.
• Giữ Qwen3.8-27B — bạn cần mô hình nói “không có lựa chọn nào trong số này.” Một mô hình ra quyết định sẽ chấm điểm các lựa chọn được đưa cho nó. Đưa nó một lược đồ thanh toán/kỹ thuật/bán hàng và một yêu cầu về quyền riêng tư, thì nó trả về lựa chọn ít tệ nhất trong ba lựa chọn đó thay vì từ chối. Mô hình cha làm nổi lên câu hỏi mà bạn không nghĩ đến để hỏi.
• Giữ Qwen3.8-27B — cho công việc ngữ cảnh hoặc tài liệu dài. Gấp bốn lần cửa sổ của bản hosted, trước khi mở rộng lên một triệu token.
Hãy đọc danh sách đó như một pipeline chứ không phải một phán quyết, bởi vì đó chính là bản chất của nó. Kiến trúc khiến mối quan hệ này trở nên hiển nhiên: Clef chính làlượt prefill của mô hình cha với một cơ chế trả lời khác ở phần cuối. Một thiết kế hợp lý sẽ đặt Clef ở phía trước — quyết định tuyến xử lý, mức ưu tiên, cờ leo thang — và giữ Qwen3.8-27B ở phía sau để hành động theo quyết định đó. Hai mô hình này bổ trợ cho nhau, chỉ tình cờ dùng chung một bản tải về.
Chạy từng cái trong số chúng ở đâu
Clef được lưu trữ trên Workers AI của Cloudflare với mức 0,24 đô la cho mỗi triệu đầu vào như số liệu ở trên, và trọng số Apache-2.0 là của bạn để chạy cục bộ. Danh mục thư viện Ollama là kênh mới nhất: ollama pull clef cần Ollama 0.35.1 trở lên, vì mô hình giao tiếp qua endpoint /v1/systemone mà Ollama đã thêm cho các mô hình ra quyết định. Hãy chú ý đến các tag, không phải tiêu đề — tag mặc định và clef:27b đều là 18 GB, đây là bản dựng bốn bit của một mô hình 55 gigabyte; clef:27b-q8_0 là 30 GB, clef:27b-nvfp4 là 18 GB, clef:27b-mxfp8 là 31 GB, và clef:27b-mlx-bf16 là bản đầy đủ 55 GB cho Apple silicon. Python SDK của chính TypeSafe sẽ giao tiếp với nó nếu bạn trỏ nó đến một Ollama cục bộ và cung cấp bất kỳ khóa API nào, mà runtime sẽ bỏ qua. Một lưu ý sẽ gây rắc rối trong môi trường production: độ tin cậy đo mức độ tập trung của các xác suất, chứ không phải khả năng câu trả lời đúng, và các trường hợp hòa sẽ được giải quyết theo thứ tự tùy chọn bạn đã khai báo.
Mô hình cha hiện là mô hình dễ đặt sau một API hơn. Qwen3.8-27B có thể định tuyến trên OrcaRouter với mức giá 0,33 USD và 2,40 USD mỗi triệu token như đã dùng ở trên, cửa sổ 262.144 token, và đây là một trong hơn 200 mô hình có thể truy cập chỉ qua một khóa tương thích OpenAI duy nhất. Vì giá niêm yết của nhà cung cấp được chuyển tiếp với mức markup 0%, việc bên bán giảm giá ở bất kỳ phía nào trong so sánh này sẽ có hiệu lực trên các tuyến của chúng tôi ngay trong cùng ngày mức giá đó được áp dụng.
Bản thân Clef không phải là một trong các route của chúng tôi — danh mục công khai của chúng tôi không trả về gì cho nó, và không có gì ở đây nên được hiểu là một tuyên bố về tính khả dụng từ phía chúng tôi. Thứ chúng tôi thực sự cung cấp là model giúp pattern ra quyết định trở nên có thể truy cập được mà không cần tài khoản Cloudflare: Jev 1 của TypeSafe là một route được liệt kê ở mức $0,042 cho mỗi triệu token đầu vào với context 65.536 token, được đo ở p50 là 148 ms trong cùng cửa sổ bảy ngày, và nó có cùng hình dạng request POST /v1/systemone. Vì Clef được thiết kế để tương thích API với Jev một cách có chủ đích, một pipeline được xây dựng dựa trên một trong hai chỉ cách cái còn lại đúng một thay đổi cấu hình — và đó chính là trường hợp mà một lớp routing tồn tại để biến thành miễn phí. Giữ cho cả hai đều có thể truy cập, đo lường trên nhãn của riêng bạn, và để người thắng cuộc trở thành một điểm dữ liệu thay vì một cam kết kiến trúc. Nếu một model ra quyết định cuối cùng lại đóng vai gác cổng cho một agent, thì model thực thi quyết định đó vẫn phải có thể truy cập được, và nửa đó vốn đã nằm sau cùng một key.

Điều gì sẽ thay đổi cách đọc này?
Ba điều, theo thứ tự tăng dần về mức độ chúng sẽ tác động đến nó.
Một bên thứ ba cần chạy lại Decision Index. Bộ kiểm thử này là công khai và Cloudflare mô tả các bài đánh giá là có thể tái lập, nên điều này khả thi — và ô out-of-scope của CLINC150 là ô cần để mắt tới, bởi mức 97,4 của 27B hoặc là một lợi thế thực sự so với 89,3 của Jev trên nửa khó nhất của định tuyến, hoặc là một hiện tượng giả tạo từ một harness do nội bộ tự dựng. Chưa ai bên ngoài Cloudflare biết được.
Ai đó cần chấm điểm Clef và Qwen3.8-27B trên cùng một tác vụ phân loại với cùng các nhãn. Đó là phép so sánh duy nhất có thể phân định liệu việc thay đầu (re-heading) là một sự đánh đổi về chất lượng hay một nâng cấp chất lượng cho các quyết định tập đóng, và cả hai nhà cung cấp đều không có động lực để thực hiện điều đó. Cho đến lúc đó, khoảng cách GPQA bốn mươi điểm vẫn là bằng chứng tốt nhất hiện có về những gì đã bị loại bỏ, và đó là bằng chứng về sai tác vụ.
Và độ trễ của Clef cần đạt p95 dưới điều kiện đồng thời. Mức trung vị 209 ms được nhà cung cấp đo, trên phần cứng do nhà cung cấp kiểm soát, cho một mô hình mà toàn bộ lời chào hàng của nó xoay quanh việc nó nằm trong một hot path. Thứ hạng so với một mô hình cha tự hồi quy là do kiến trúc quyết định và sẽ vẫn giữ nguyên. Con số mili giây tuyệt đối là con số cần phải nghi ngờ, và nó lại chính là con số mà toàn bộ phương án kinh doanh dựa vào.
Qwen3.8-27B là một trong hơn 200 mô hình có thể truy cập chỉ qua một khóa duy nhất tương thích với OpenAI — Qwen3.8-27B.
