
Clef จงใจลอก API ของ Jev — และนั่นคือส่วนที่น่าสนใจ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Clef เป็นโมเดลมัลติโมดัลขนาด 27,000 ล้านพารามิเตอร์จาก Cloudflare ที่ตอบคำถามแบบมีชนิดข้อมูลและไม่ทำอย่างอื่นเลย คุณป้อนสถานะให้มัน — ข้อความ, JSON, รูปภาพ, เฟรมวิดีโอ — พร้อมสคีมาของคำถามที่มีชื่อได้สูงสุด 64 ข้อ แล้วมันจะคืนค่าความน่าจะเป็นสำหรับทุกตัวเลือกที่อนุญาตในการส่งผ่านไปข้างหน้าครั้งเดียว ไม่มีการสร้างข้อความ ไม่มี parser ไม่มีลูปถอดรหัส สิ่งที่ทำให้ Cloudflare/clef น่าอ่านไม่ใช่ดีไซน์นั้น ซึ่งมันยืมมา แต่เป็นไวร์ที่มันเลือกใช้: Cloudflare สร้าง Clef ให้พูดภาษาของ body คำขอและคำตอบของ Jev System One โมเดลตัดสินใจที่ TypeSafe เปิดตัวเป็นตัวแรก ซึ่งให้บริการที่เส้นทาง POST /v1/systemone เดียวกัน การทำงานร่วมกันได้ในที่นี้คือข้อโต้แย้งเชิงพาณิชย์ทั้งหมด หากไปป์ไลน์ของคุณถามคำถามกับโมเดลตัดสินใจในรูปแบบนั้นอยู่แล้ว Clef ก็เป็นแค่การเปลี่ยน URL กับสตริงโมเดล ไม่ใช่การโยกย้ายระบบ
การที่โพสต์เปิดตัวจะฝังเรื่องแบบนี้ไว้เป็นเรื่องผิดปกติ และ Cloudflare ก็ไม่ได้ฝังมัน — การ์ดโมเดลระบุตรง ๆ ว่า API นั้น "เข้ากันได้อย่างสมบูรณ์กับ Jev และ SystemOne" และบล็อกเปิดด้วยการให้เครดิต TypeSafe ที่ทำให้หมวดหมู่นี้เป็นที่รู้จัก ก่อนจะวางตำแหน่ง Clef ให้เป็นเวอร์ชันรุ่นที่สองของการทดลองภายใน ดังนั้นการตีความอย่างตรงไปตรงมาของการเปิดตัวนี้มีสามส่วน: การตัดสินใจเรื่องความเข้ากันได้ให้อะไรกับคุณ ตัวเลขของ Cloudflare เองบอกอะไรเกี่ยวกับจุดที่ Clef ชนะและแพ้ และอะไรที่ยังไม่ได้รับการยืนยัน เพราะทุกตัวเลขในตารางนั้นมาจากผู้ขายที่จัดส่งโมเดล
หมวดหมู่นี้มาจากที่อื่น
โพสต์ของ Cloudflare ตรงไปตรงมาเกี่ยวกับที่มา แนวคิดเรื่องโมเดลที่ส่งคืนเอาต์พุตแบบมีโครงสร้างและมีขอบเขตแทนข้อความร้อยแก้วนั้นให้เครดิตกับ Jev System One ของ TypeSafe ส่วนเส้นทางของ Cloudflare เองเริ่มจากเดโมก่อนหน้านี้ที่ดัดแปลงโมเดลแบบ diffusion ให้ปล่อยความน่าจะเป็นแบบกำหนดได้ผ่าน logprobs บวกกับงานของชุมชนโดย Matt Mastracci ในการทำให้เอนจิน inference รองรับรูปแบบดังกล่าว Clef ต่อยอดจากแนวคิดนั้นด้วยแบ็กโบนที่ต่างออกไป หัวให้คะแนนที่สร้างขึ้นโดยเฉพาะ และ — ส่วนที่สำคัญในเชิงพาณิชย์ — บอดี้ของคำขอที่ตรงกับของเจ้าตลาดรายเดิม
เมื่อผู้ขายรายหนึ่งทั้งคัดลอกรูปแบบการรับส่งข้อมูลของคู่แข่ง และวัดประสิทธิภาพของตนเองเทียบกับดัชนีของคู่แข่ง ความเข้ากันได้นั้นไม่ใช่แค่หมายเหตุประกอบโมเดล แต่เป็นกลยุทธ์ของผลิตภัณฑ์ การสลับโมเดลการตัดสินใจที่อยู่เบื้องหลังเอนด์พอยต์ที่มีอยู่แล้ว ถือเป็นวิธีที่ถูกที่สุดเท่าที่จะเป็นไปได้สำหรับผู้เล่นรายใหม่ที่จะได้รับการลองใช้ และเป็นการทดลองที่ถูกที่สุดเท่าที่จะเป็นไปได้สำหรับทีมที่เชื่อมระบบลักษณะนี้ไว้แล้ว
สิ่งที่ส่งมอบจริง และสิ่งที่ต้องแลกมา
พารามิเตอร์ — 27B สร้างขึ้นโดยการแช่แข็ง Qwen3.8-27B พร้อมตัวเข้ารหัสภาพ และฝึก joint schema head ร่วมกับ low-rank adapters แบบ rank-256 ทับด้านบน
• พี่น้อง — Clef-Flash สูตรเดียวกันที่ขนาด 9B จาก Qwen3.5-9B บทความแยก ข้อแลกเปลี่ยนแยก
• บริบท — 65,536 โทเค็น ตามหน้าของโมเดล Workers AI และบทความในบล็อก ตัวช่วยการเข้ารหัสที่มาพร้อมให้มีค่าเริ่มต้นเป็น max_length=16,384 ซึ่งเป็นค่าเริ่มต้น ไม่ใช่เพดานสูงสุด แต่เป็นค่าเริ่มต้นที่คุณจะได้หากใช้ตัวโหลดตามที่มีให้มา
• ประเภทคำถาม — noul (จริง/เท็จ โดยคืนค่าความน่าจะเป็นของค่าจริง), choice (ตัวเลือกที่มีชื่อกำกับ 2 ถึง 26 ตัวเลือก), score (ระดับเรียงลำดับ 2 ถึง 26 ระดับ) โดยแต่ละคำขอรองรับ 1 ถึง 64 คำถาม
• ราคา — 0.24 ดอลลาร์ต่อล้านโทเค็นอินพุตบน Workers AI ของ Cloudflare หรือโฮสต์เองจากเวต Apache-2.0 ซึ่งมีขนาดประมาณ 55 GB กระจายอยู่บนสิบสองแชร์ด
• สัญญาอนุญาต — Apache 2.0 โดยอิงตามเช็กพอยต์ฐาน Qwen3.8-27B

จุดที่มันชนะ และจุดที่มันไม่ชนะ
การรัน Decision Index ของ Cloudflare คือแหล่งที่มาของทุกสิ่งในส่วนนี้ และลีดเดอร์บอร์ดที่โฮสต์มันก็เป็นของ Cloudflare เช่นกัน ไม่มีสิ่งใดด้านล่างนี้ที่ถูกทำซ้ำโดยอิสระ จงอ่านมันในฐานะกรณีที่ดีที่สุดของซัพพลายเออร์ และสังเกตว่ามันไม่สม่ำเสมอเพียงใด
กลุ่มชัยชนะที่ classifier ซึ่งฝึกภายในบ้านควรชนะ Clef ได้ BANKING77 intent macro-F1 ที่ 94.2 เทียบกับ 79.7 ของ Jev และ CLINC150 ที่มีการจัดการนอกขอบเขตที่ 97.4 เทียบกับ 89.3 — ช่องว่างสามสิบจุดซึ่งเป็นเซลล์ที่เกี่ยวข้องกับการตัดสินใจมากที่สุดในตาราง เพราะการปฏิเสธที่จะจำแนกเป็นครึ่งที่ยากของการกำหนดเส้นทาง มันยังได้ CRUXEval ที่ 86.7, CLadder ที่ 94.0, และเครื่องจำลองเครื่องใช้ในบ้านที่ 83.0
ความสูญเสียก็เป็นของจริงไม่ต่างกัน และควรอยู่ในย่อหน้าเดียวกัน ในด้านความรู้ทั่วไปและการใช้เหตุผลยากนั้น Jev ตัวเก่ากว่าชนะขาด: GPQA Diamond 78.3 ต่อ 48.0, MMLU-Pro 82.7 ต่อ 65.9, BBH 92.9 ต่อ 73.7 ทั้งสามช่องนี้เป็นช่องว่างที่ใหญ่ที่สุดในตาราง และล้วนชี้ไปในทิศทางเดียวกัน นอกจากนี้ Clef ยังไม่ใช่โมเดลที่ดีที่สุดในการเปรียบเทียบของตัวเองบนชุด PhishNChips ในโดเมนความปลอดภัย โดยได้ 79.6 ขณะที่รายการคู่แข่งทำคะแนนได้สูงกว่า
ในการประเมินเวิร์กโฟลว์แบบครบวงจรทั้งสี่ชุด ซึ่งดึงมาจากชุดการประเมินสาธารณะของ TypeSafe เองและให้คะแนนเทียบกับป้ายกำกับที่ได้ฉันทามติ ทั้งสองนั้นใกล้กันพอที่จะเป็นแค่การโยนเหรียญได้ Clef ชนะด้านการประมวลผลใบแจ้งหนี้ในเรื่องการดำเนินการที่ตรงเป๊ะด้วยคะแนน 64.7 ต่อ 61.8 และชุดเหตุการณ์ด้านความปลอดภัย 62.9 ต่อ 61.7; Jev ชนะด้านความสามารถในการสังเกตการณ์ร่องรอยของเอเจนต์ที่ 71.6 ต่อ 68.5; ส่วนบริการลูกค้าเป็นผลเสมอ 76.3 ต่อ 76.0 ซึ่งที่ส่วนต่างระดับนั้นไม่มีความหมายอะไร
ความหน่วงเป็นจุดที่ช่องว่างเป็นเชิงโครงสร้างมากกว่าจะเป็นเพียงส่วนเพิ่ม Cloudflare รายงานค่ามัธยฐาน 209.3 ms และ p95 238.6 ms สำหรับ Clef เทียบกับ 524.1 และ 536.0 สำหรับ Jev ลำดับดังกล่าวเกิดจากการออกแบบแบบ non-autoregressive มากกว่าจะเกิดจากความแปลกเฉพาะตัวของ benchmark ซึ่งเป็นเหตุผลว่าทำไมมันจึงเป็นตัวเลขที่น่าจะอยู่รอดเมื่อได้สัมผัสกับการนำไปใช้งานจริงมากที่สุด ตัวเลขมิลลิวินาทีแบบสัมบูรณ์นั้นวัดบนฮาร์ดแวร์ของ Cloudflare เอง และไม่มีความหมายอะไรมากนักเมื่อดูเดี่ยว ๆ
จุดข้อมูลที่น่าเชื่อถือที่สุดในการเปิดตัวครั้งนี้ไม่ใช่แถวผลเบนช์มาร์ก Cloudflare กล่าวว่าทีมข่าวกรองภัยคุกคามของตนส่งโดเมนหนึ่งให้ Clef พร้อมกับบริการเรนเดอร์เบราว์เซอร์ของตน และได้รับคำตัดสินหมวดหมู่ภายใน 2.2 วินาที เทียบกับ 4.7 วินาทีสำหรับ LLM ทั่วไปที่เร็วที่สุดของตนในเวิร์กโฟลว์เดียวกัน โดยได้ผลการจำแนกประเภทกลับมามากกว่า เป็นเกร็ดเล่าภายใน ไม่ใช่ผลการศึกษา — แต่เป็นเรื่องเล่าประเภทที่อธิบายได้ว่าทำไมใครบางคนจึงสร้างสิ่งนี้ขึ้นมาแทนที่จะพรอมป์โมเดลทั่วไป

สองสิ่งที่เอกสารอ้างอิง API บอกคุณ และอีกหนึ่งสิ่งที่มันไม่ได้บอก
กับดักที่ได้รับการบันทึกไว้เป็นเรื่องเล็กน้อยและคุ้มค่าที่จะอ่านก่อนที่คุณจะพอร์ตอะไรก็ตาม ฟิลด์ความมั่นใจวัดว่าความน่าจะเป็นนั้นกระจุกตัวมากเพียงใด ไม่ใช่ความน่าจะเป็นที่คำตอบจะถูกต้อง — โมเดลที่ปรับคาลิเบรตอย่างดีสามารถให้คำตอบที่ถูกต้องโดยมีความมั่นใจต่ำ และคำตอบที่ผิดโดยมีความมั่นใจสูง และเมื่อสองตัวเลือกเสมอกัน คำตอบจะเป็นไปตามลำดับตัวเลือกของโมเดล ดังนั้นให้วางตัวเลือกที่คุณต้องการไว้เป็นอันดับแรก ใครก็ตามที่พอร์ตตัวจำแนกประเภทแบบอิงพรอมป์โดยไม่อ่านสองประโยคนั้นจะตีความล็อกของตนเองผิด
ข้อจำกัดที่ใหญ่กว่านั้นไม่ได้ถูกบันทึกไว้ที่ใดเลย เพราะมันเป็นเชิงโครงสร้าง Clef ไม่มีเส้นทางการสร้างข้อความเลย ซึ่งหมายความว่ามันไม่สามารถร่างคำตอบ สรุปเธรด เรียกใช้เครื่องมือ หรือสนทนาโต้ตอบได้ และมันจะไม่คิดค้นหมวดหมู่ที่คุณไม่ได้ประกาศไว้ การออกแบบทั้งหมดตั้งสมมติฐานว่าคุณสามารถแจกแจงคำตอบที่อนุญาตไว้ล่วงหน้าได้ สิ่งนี้ตัดกลุ่มปัญหาจำนวนมากออกไปอย่างเงียบ ๆ และไม่ว่าประสิทธิภาพใน benchmark จะมากเพียงใดก็ไม่เปลี่ยนข้อนี้
ข้อโต้แย้งเรื่องความเข้ากันได้มีค่าเพียงใด
นี่คือจุดที่รีลีสไม่ใช่การรีวิวโมเดลอีกต่อไป แต่กลายเป็นคำถามเชิงสถาปัตยกรรม หาก Clef เข้าใจรูปแบบคำขอของ Jev ได้ โมเดลที่อยู่เบื้องหลังเอนด์พอยต์การตัดสินใจของคุณก็เป็นเพียงค่าคอนฟิก และวิธีที่สมเหตุสมผลในการนำมาใช้คือใช้ควบคู่กัน ไม่ใช่ใช้แทนกัน — รันทั้งสองกับทราฟฟิกของคุณเอง เก็บตัวที่วัดผลได้ดีกว่าบนข้อมูลของคุณ และทำให้การสลับยังคงมีต้นทุนต่ำ
ตัว Clef เองไม่ได้อยู่ในรายการเส้นทางของเรา แคตตาล็อกของ OrcaRouter ส่งคืน 404 สำหรับมัน และไม่มีสิ่งใดในที่นี้ที่ควรตีความว่าเป็นการรับประกันความพร้อมใช้งานจากเรา สิ่งที่เรามีให้บริการจริงคือตัวเดิมที่มันถูกสร้างขึ้นมาเพื่อแทนที่ Jev 1.13 ของ TypeSafe เป็นเส้นทางที่อยู่ในรายการในราคา $0.042 ต่อโทเคนอินพุตหนึ่งล้านโทเคน เหนือบริบท 65,536 โทเคน ให้บริการผ่าน POST /v1/systemone body แบบเดียวกัน ดังนั้นการทดสอบ A/B ระหว่างสองตัวนี้จึงเป็นแค่การเปลี่ยนสตริงชื่อโมเดล ไม่ใช่การเขียนใหม่ การมีทั้งสองตัวอยู่ภายใต้คีย์เดียว — โมเดลกว่า 200 ตัว, ราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยไม่มีการบวกเพิ่มต่อโทเคน, การสลับไปใช้ผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดความล้มเหลว — คือสิ่งที่ทำให้การทดสอบนั้นยังคงดำเนินต่อไปได้หลังจากสัปดาห์ที่ใครบางคนตัดสินใจให้ความสนใจกับมัน แทนที่จะเสื่อมกลายเป็นคอมเมนต์ค้างเก่า ๆ ในไฟล์คอนฟิก โมเดลทั่วไปที่คุณเก็บไว้เพื่อลงมือทำกับสิ่งที่โมเดลสำหรับตัดสินใจสรุปออกมานั้น เข้าถึงได้จากคีย์เดียวกัน แทนที่จะต้องมีสัญญาอีกฉบับ

อะไรจะทำให้การอ่านนี้เปลี่ยนไป
บุคคลภายนอก Cloudflare จำเป็นต้องรัน Decision Index ใหม่ ชุดการทดสอบนี้เป็นสาธารณะ และการประเมินต่างๆ ถูกอธิบายว่าสามารถทำซ้ำได้ ดังนั้นการรันโดยบุคคลที่สามจึงเป็นความแตกต่างระหว่างตารางของผู้ขายกับข้อเท็จจริง — และเซลล์ที่สำคัญที่สุดคือเซลล์ที่ชี้ไปในทิศทางที่ต่างกัน คะแนน 97.4 ในการตรวจจับเจตนาที่อยู่นอกขอบเขต อยู่ถัดจาก 48.0 ใน GPQA Diamond ไม่ใช่เส้นโค้งที่ราบรื่น แต่เป็นการอธิบายโมเดลที่เก่งมากในการจำแนกรูปแบบต่างๆ ในการกระจายตัวของการฝึกของมัน และอ่อนกว่ามากในการให้เหตุผลในสิ่งที่มันไม่เคยเห็น หากสิ่งนี้ยังคงเป็นจริงภายใต้การทดสอบอิสระ นี่คือข้อเท็จจริงที่สำคัญที่สุดในเชิงปฏิบัติการเกี่ยวกับ Clef และมันไม่ได้อยู่ในไฮไลต์
ทราฟฟิกโปรดักชันก็ต้องดูสอดคล้องกับตารางความหน่วงเช่นกัน ค่ามัธยฐาน 209 ms ที่วัดบน H200 ตัวเดียวไม่ได้บอกอะไรเลยเกี่ยวกับ p95 ภายใต้การทำงานพร้อมกัน และจุดขายทั้งหมดของการออกแบบนี้ก็คือมันอยู่ใน hot path
และแพลตฟอร์มปรับแต่งละเอียด (fine-tuning) จำเป็นต้องผลิตอะไรบางอย่างออกมาให้ได้ โพสต์ของ Cloudflare อธิบายถึงลูป RL หนึ่งลูป — AI Gateway สำหรับเก็บชุดข้อมูลจากทราฟฟิกของคุณเอง Workers AI สำหรับสร้าง rollout Containers เป็นแซนด์บ็อกซ์สำหรับให้คะแนน Trainer สำหรับอัปเดตค่าถ่วงน้ำหนัก แล้วดีพลอยกลับขึ้น Workers AI — โดยอยู่ในโพสต์เดียวกันกับที่ประกาศเปิดตัวโมเดลเหล่านี้ โดยไม่มีผลลัพธ์จากลูกค้าแนบมาด้วย Clef ที่ผ่านการปรับแต่งละเอียดซึ่งเอาชนะโมเดลฐานได้ในงานที่โมเดลฐานไม่เคยถูกฝึกมาก่อน จะเป็นหลักฐานที่หนักแน่นกว่ามากสำหรับหมวดหมู่นี้ เมื่อเทียบกับแถวใด ๆ ในตาราง
จนถึงตอนนั้น สรุปอย่างยุติธรรมก็คือ Cloudflare ได้ปล่อยโมเดลตัดสินใจที่ใช้งานได้จริง มีสัญญาอนุญาตแบบผ่อนปรน และเร็วอย่างแท้จริง พร้อมทำให้มันสลับกับตัวที่มาก่อนได้อย่างง่ายดาย นั่นเป็นเรื่องราวที่ดีกว่าที่โอเพนรีลีสส่วนใหญ่เสนอ และจนถึงตอนนี้ มันก็ยังคงเป็นเพียงคำบอกเล่าของผู้ขายเกี่ยวกับตัวเองแต่เพียงฝ่ายเดียว
