การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความว่า 'Clef' พร้อมคำบรรยายใต้ชื่อว่า 'โมเดลการตัดสินใจของ Cloudflare ที่ไม่เคยเขียนโทเคนแม้แต่ตัวเดียว' และมีชิปสองอันที่ระบุข้อความ 'weights 30 Sept 2026' กับ 'blog 1 Oct 2026' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Engineering & Research

Clef จงใจลอก API ของ Jev — และนั่นคือส่วนที่น่าสนใจ

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Clef เป็นโมเดลมัลติโมดัลขนาด 27,000 ล้านพารามิเตอร์จาก Cloudflare ที่ตอบคำถามแบบมีชนิดข้อมูลและไม่ทำอย่างอื่นเลย คุณป้อนสถานะให้มัน — ข้อความ, JSON, รูปภาพ, เฟรมวิดีโอ — พร้อมสคีมาของคำถามที่มีชื่อได้สูงสุด 64 ข้อ แล้วมันจะคืนค่าความน่าจะเป็นสำหรับทุกตัวเลือกที่อนุญาตในการส่งผ่านไปข้างหน้าครั้งเดียว ไม่มีการสร้างข้อความ ไม่มี parser ไม่มีลูปถอดรหัส สิ่งที่ทำให้ Cloudflare/clef น่าอ่านไม่ใช่ดีไซน์นั้น ซึ่งมันยืมมา แต่เป็นไวร์ที่มันเลือกใช้: Cloudflare สร้าง Clef ให้พูดภาษาของ body คำขอและคำตอบของ Jev System One โมเดลตัดสินใจที่ TypeSafe เปิดตัวเป็นตัวแรก ซึ่งให้บริการที่เส้นทาง POST /v1/systemone เดียวกัน การทำงานร่วมกันได้ในที่นี้คือข้อโต้แย้งเชิงพาณิชย์ทั้งหมด หากไปป์ไลน์ของคุณถามคำถามกับโมเดลตัดสินใจในรูปแบบนั้นอยู่แล้ว Clef ก็เป็นแค่การเปลี่ยน URL กับสตริงโมเดล ไม่ใช่การโยกย้ายระบบ

การที่โพสต์เปิดตัวจะฝังเรื่องแบบนี้ไว้เป็นเรื่องผิดปกติ และ Cloudflare ก็ไม่ได้ฝังมัน — การ์ดโมเดลระบุตรง ๆ ว่า API นั้น "เข้ากันได้อย่างสมบูรณ์กับ Jev และ SystemOne" และบล็อกเปิดด้วยการให้เครดิต TypeSafe ที่ทำให้หมวดหมู่นี้เป็นที่รู้จัก ก่อนจะวางตำแหน่ง Clef ให้เป็นเวอร์ชันรุ่นที่สองของการทดลองภายใน ดังนั้นการตีความอย่างตรงไปตรงมาของการเปิดตัวนี้มีสามส่วน: การตัดสินใจเรื่องความเข้ากันได้ให้อะไรกับคุณ ตัวเลขของ Cloudflare เองบอกอะไรเกี่ยวกับจุดที่ Clef ชนะและแพ้ และอะไรที่ยังไม่ได้รับการยืนยัน เพราะทุกตัวเลขในตารางนั้นมาจากผู้ขายที่จัดส่งโมเดล

หมวดหมู่นี้มาจากที่อื่น

โพสต์ของ Cloudflare ตรงไปตรงมาเกี่ยวกับที่มา แนวคิดเรื่องโมเดลที่ส่งคืนเอาต์พุตแบบมีโครงสร้างและมีขอบเขตแทนข้อความร้อยแก้วนั้นให้เครดิตกับ Jev System One ของ TypeSafe ส่วนเส้นทางของ Cloudflare เองเริ่มจากเดโมก่อนหน้านี้ที่ดัดแปลงโมเดลแบบ diffusion ให้ปล่อยความน่าจะเป็นแบบกำหนดได้ผ่าน logprobs บวกกับงานของชุมชนโดย Matt Mastracci ในการทำให้เอนจิน inference รองรับรูปแบบดังกล่าว Clef ต่อยอดจากแนวคิดนั้นด้วยแบ็กโบนที่ต่างออกไป หัวให้คะแนนที่สร้างขึ้นโดยเฉพาะ และ — ส่วนที่สำคัญในเชิงพาณิชย์ — บอดี้ของคำขอที่ตรงกับของเจ้าตลาดรายเดิม

เมื่อผู้ขายรายหนึ่งทั้งคัดลอกรูปแบบการรับส่งข้อมูลของคู่แข่ง และวัดประสิทธิภาพของตนเองเทียบกับดัชนีของคู่แข่ง ความเข้ากันได้นั้นไม่ใช่แค่หมายเหตุประกอบโมเดล แต่เป็นกลยุทธ์ของผลิตภัณฑ์ การสลับโมเดลการตัดสินใจที่อยู่เบื้องหลังเอนด์พอยต์ที่มีอยู่แล้ว ถือเป็นวิธีที่ถูกที่สุดเท่าที่จะเป็นไปได้สำหรับผู้เล่นรายใหม่ที่จะได้รับการลองใช้ และเป็นการทดลองที่ถูกที่สุดเท่าที่จะเป็นไปได้สำหรับทีมที่เชื่อมระบบลักษณะนี้ไว้แล้ว

สิ่งที่ส่งมอบจริง และสิ่งที่ต้องแลกมา

พารามิเตอร์ — 27B สร้างขึ้นโดยการแช่แข็ง Qwen3.8-27B พร้อมตัวเข้ารหัสภาพ และฝึก joint schema head ร่วมกับ low-rank adapters แบบ rank-256 ทับด้านบน

• พี่น้อง — Clef-Flash สูตรเดียวกันที่ขนาด 9B จาก Qwen3.5-9B บทความแยก ข้อแลกเปลี่ยนแยก

• บริบท — 65,536 โทเค็น ตามหน้าของโมเดล Workers AI และบทความในบล็อก ตัวช่วยการเข้ารหัสที่มาพร้อมให้มีค่าเริ่มต้นเป็น max_length=16,384 ซึ่งเป็นค่าเริ่มต้น ไม่ใช่เพดานสูงสุด แต่เป็นค่าเริ่มต้นที่คุณจะได้หากใช้ตัวโหลดตามที่มีให้มา

• ประเภทคำถาม — noul (จริง/เท็จ โดยคืนค่าความน่าจะเป็นของค่าจริง), choice (ตัวเลือกที่มีชื่อกำกับ 2 ถึง 26 ตัวเลือก), score (ระดับเรียงลำดับ 2 ถึง 26 ระดับ) โดยแต่ละคำขอรองรับ 1 ถึง 64 คำถาม

• ราคา — 0.24 ดอลลาร์ต่อล้านโทเค็นอินพุตบน Workers AI ของ Cloudflare หรือโฮสต์เองจากเวต Apache-2.0 ซึ่งมีขนาดประมาณ 55 GB กระจายอยู่บนสิบสองแชร์ด

• สัญญาอนุญาต — Apache 2.0 โดยอิงตามเช็กพอยต์ฐาน Qwen3.8-27B

A single-column scoreboard titled 'Clef — the scoreboard', with six rows: Parameters: 27B, vision encoder kept; Trained from: Qwen3.8-27B, head plus rank-256 adapters; Context: 65,536 tokens; Output: a probability per option, no generated text; Latency: 209.3 ms median, 238.6 ms p95; Licence: Apache 2.0. A footer reads 'Cloudflare figures, self-run on the Jev Decision Index, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

จุดที่มันชนะ และจุดที่มันไม่ชนะ

การรัน Decision Index ของ Cloudflare คือแหล่งที่มาของทุกสิ่งในส่วนนี้ และลีดเดอร์บอร์ดที่โฮสต์มันก็เป็นของ Cloudflare เช่นกัน ไม่มีสิ่งใดด้านล่างนี้ที่ถูกทำซ้ำโดยอิสระ จงอ่านมันในฐานะกรณีที่ดีที่สุดของซัพพลายเออร์ และสังเกตว่ามันไม่สม่ำเสมอเพียงใด

กลุ่มชัยชนะที่ classifier ซึ่งฝึกภายในบ้านควรชนะ Clef ได้ BANKING77 intent macro-F1 ที่ 94.2 เทียบกับ 79.7 ของ Jev และ CLINC150 ที่มีการจัดการนอกขอบเขตที่ 97.4 เทียบกับ 89.3 — ช่องว่างสามสิบจุดซึ่งเป็นเซลล์ที่เกี่ยวข้องกับการตัดสินใจมากที่สุดในตาราง เพราะการปฏิเสธที่จะจำแนกเป็นครึ่งที่ยากของการกำหนดเส้นทาง มันยังได้ CRUXEval ที่ 86.7, CLadder ที่ 94.0, และเครื่องจำลองเครื่องใช้ในบ้านที่ 83.0

ความสูญเสียก็เป็นของจริงไม่ต่างกัน และควรอยู่ในย่อหน้าเดียวกัน ในด้านความรู้ทั่วไปและการใช้เหตุผลยากนั้น Jev ตัวเก่ากว่าชนะขาด: GPQA Diamond 78.3 ต่อ 48.0, MMLU-Pro 82.7 ต่อ 65.9, BBH 92.9 ต่อ 73.7 ทั้งสามช่องนี้เป็นช่องว่างที่ใหญ่ที่สุดในตาราง และล้วนชี้ไปในทิศทางเดียวกัน นอกจากนี้ Clef ยังไม่ใช่โมเดลที่ดีที่สุดในการเปรียบเทียบของตัวเองบนชุด PhishNChips ในโดเมนความปลอดภัย โดยได้ 79.6 ขณะที่รายการคู่แข่งทำคะแนนได้สูงกว่า

ในการประเมินเวิร์กโฟลว์แบบครบวงจรทั้งสี่ชุด ซึ่งดึงมาจากชุดการประเมินสาธารณะของ TypeSafe เองและให้คะแนนเทียบกับป้ายกำกับที่ได้ฉันทามติ ทั้งสองนั้นใกล้กันพอที่จะเป็นแค่การโยนเหรียญได้ Clef ชนะด้านการประมวลผลใบแจ้งหนี้ในเรื่องการดำเนินการที่ตรงเป๊ะด้วยคะแนน 64.7 ต่อ 61.8 และชุดเหตุการณ์ด้านความปลอดภัย 62.9 ต่อ 61.7; Jev ชนะด้านความสามารถในการสังเกตการณ์ร่องรอยของเอเจนต์ที่ 71.6 ต่อ 68.5; ส่วนบริการลูกค้าเป็นผลเสมอ 76.3 ต่อ 76.0 ซึ่งที่ส่วนต่างระดับนั้นไม่มีความหมายอะไร

ความหน่วงเป็นจุดที่ช่องว่างเป็นเชิงโครงสร้างมากกว่าจะเป็นเพียงส่วนเพิ่ม Cloudflare รายงานค่ามัธยฐาน 209.3 ms และ p95 238.6 ms สำหรับ Clef เทียบกับ 524.1 และ 536.0 สำหรับ Jev ลำดับดังกล่าวเกิดจากการออกแบบแบบ non-autoregressive มากกว่าจะเกิดจากความแปลกเฉพาะตัวของ benchmark ซึ่งเป็นเหตุผลว่าทำไมมันจึงเป็นตัวเลขที่น่าจะอยู่รอดเมื่อได้สัมผัสกับการนำไปใช้งานจริงมากที่สุด ตัวเลขมิลลิวินาทีแบบสัมบูรณ์นั้นวัดบนฮาร์ดแวร์ของ Cloudflare เอง และไม่มีความหมายอะไรมากนักเมื่อดูเดี่ยว ๆ

จุดข้อมูลที่น่าเชื่อถือที่สุดในการเปิดตัวครั้งนี้ไม่ใช่แถวผลเบนช์มาร์ก Cloudflare กล่าวว่าทีมข่าวกรองภัยคุกคามของตนส่งโดเมนหนึ่งให้ Clef พร้อมกับบริการเรนเดอร์เบราว์เซอร์ของตน และได้รับคำตัดสินหมวดหมู่ภายใน 2.2 วินาที เทียบกับ 4.7 วินาทีสำหรับ LLM ทั่วไปที่เร็วที่สุดของตนในเวิร์กโฟลว์เดียวกัน โดยได้ผลการจำแนกประเภทกลับมามากกว่า เป็นเกร็ดเล่าภายใน ไม่ใช่ผลการศึกษา — แต่เป็นเรื่องเล่าประเภทที่อธิบายได้ว่าทำไมใครบางคนจึงสร้างสิ่งนี้ขึ้นมาแทนที่จะพรอมป์โมเดลทั่วไป

A headless capture of Cloudflare's blog post announcing Clef, showing the Cloudflare site header, the breadcrumb 'Blog', the banner date 'October 1, 2026', the headline 'Introducing Clef: our open-source decision models, and new RL fine-tuning platform', and the three named authors.

สองสิ่งที่เอกสารอ้างอิง API บอกคุณ และอีกหนึ่งสิ่งที่มันไม่ได้บอก

กับดักที่ได้รับการบันทึกไว้เป็นเรื่องเล็กน้อยและคุ้มค่าที่จะอ่านก่อนที่คุณจะพอร์ตอะไรก็ตาม ฟิลด์ความมั่นใจวัดว่าความน่าจะเป็นนั้นกระจุกตัวมากเพียงใด ไม่ใช่ความน่าจะเป็นที่คำตอบจะถูกต้อง — โมเดลที่ปรับคาลิเบรตอย่างดีสามารถให้คำตอบที่ถูกต้องโดยมีความมั่นใจต่ำ และคำตอบที่ผิดโดยมีความมั่นใจสูง และเมื่อสองตัวเลือกเสมอกัน คำตอบจะเป็นไปตามลำดับตัวเลือกของโมเดล ดังนั้นให้วางตัวเลือกที่คุณต้องการไว้เป็นอันดับแรก ใครก็ตามที่พอร์ตตัวจำแนกประเภทแบบอิงพรอมป์โดยไม่อ่านสองประโยคนั้นจะตีความล็อกของตนเองผิด

ข้อจำกัดที่ใหญ่กว่านั้นไม่ได้ถูกบันทึกไว้ที่ใดเลย เพราะมันเป็นเชิงโครงสร้าง Clef ไม่มีเส้นทางการสร้างข้อความเลย ซึ่งหมายความว่ามันไม่สามารถร่างคำตอบ สรุปเธรด เรียกใช้เครื่องมือ หรือสนทนาโต้ตอบได้ และมันจะไม่คิดค้นหมวดหมู่ที่คุณไม่ได้ประกาศไว้ การออกแบบทั้งหมดตั้งสมมติฐานว่าคุณสามารถแจกแจงคำตอบที่อนุญาตไว้ล่วงหน้าได้ สิ่งนี้ตัดกลุ่มปัญหาจำนวนมากออกไปอย่างเงียบ ๆ และไม่ว่าประสิทธิภาพใน benchmark จะมากเพียงใดก็ไม่เปลี่ยนข้อนี้

ข้อโต้แย้งเรื่องความเข้ากันได้มีค่าเพียงใด

นี่คือจุดที่รีลีสไม่ใช่การรีวิวโมเดลอีกต่อไป แต่กลายเป็นคำถามเชิงสถาปัตยกรรม หาก Clef เข้าใจรูปแบบคำขอของ Jev ได้ โมเดลที่อยู่เบื้องหลังเอนด์พอยต์การตัดสินใจของคุณก็เป็นเพียงค่าคอนฟิก และวิธีที่สมเหตุสมผลในการนำมาใช้คือใช้ควบคู่กัน ไม่ใช่ใช้แทนกัน — รันทั้งสองกับทราฟฟิกของคุณเอง เก็บตัวที่วัดผลได้ดีกว่าบนข้อมูลของคุณ และทำให้การสลับยังคงมีต้นทุนต่ำ

ตัว Clef เองไม่ได้อยู่ในรายการเส้นทางของเรา แคตตาล็อกของ OrcaRouter ส่งคืน 404 สำหรับมัน และไม่มีสิ่งใดในที่นี้ที่ควรตีความว่าเป็นการรับประกันความพร้อมใช้งานจากเรา สิ่งที่เรามีให้บริการจริงคือตัวเดิมที่มันถูกสร้างขึ้นมาเพื่อแทนที่ Jev 1.13 ของ TypeSafe เป็นเส้นทางที่อยู่ในรายการในราคา $0.042 ต่อโทเคนอินพุตหนึ่งล้านโทเคน เหนือบริบท 65,536 โทเคน ให้บริการผ่าน POST /v1/systemone body แบบเดียวกัน ดังนั้นการทดสอบ A/B ระหว่างสองตัวนี้จึงเป็นแค่การเปลี่ยนสตริงชื่อโมเดล ไม่ใช่การเขียนใหม่ การมีทั้งสองตัวอยู่ภายใต้คีย์เดียว — โมเดลกว่า 200 ตัว, ราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยไม่มีการบวกเพิ่มต่อโทเคน, การสลับไปใช้ผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดความล้มเหลว — คือสิ่งที่ทำให้การทดสอบนั้นยังคงดำเนินต่อไปได้หลังจากสัปดาห์ที่ใครบางคนตัดสินใจให้ความสนใจกับมัน แทนที่จะเสื่อมกลายเป็นคอมเมนต์ค้างเก่า ๆ ในไฟล์คอนฟิก โมเดลทั่วไปที่คุณเก็บไว้เพื่อลงมือทำกับสิ่งที่โมเดลสำหรับตัดสินใจสรุปออกมานั้น เข้าถึงได้จากคีย์เดียวกัน แทนที่จะต้องมีสัญญาอีกฉบับ

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the model title, the description naming the noul, choice and score question types served over POST /v1/systemone, a code sample set to model 'typesafe/jev-1.13', and the performance strip reading p50 TTFT 148 ms.

อะไรจะทำให้การอ่านนี้เปลี่ยนไป

บุคคลภายนอก Cloudflare จำเป็นต้องรัน Decision Index ใหม่ ชุดการทดสอบนี้เป็นสาธารณะ และการประเมินต่างๆ ถูกอธิบายว่าสามารถทำซ้ำได้ ดังนั้นการรันโดยบุคคลที่สามจึงเป็นความแตกต่างระหว่างตารางของผู้ขายกับข้อเท็จจริง — และเซลล์ที่สำคัญที่สุดคือเซลล์ที่ชี้ไปในทิศทางที่ต่างกัน คะแนน 97.4 ในการตรวจจับเจตนาที่อยู่นอกขอบเขต อยู่ถัดจาก 48.0 ใน GPQA Diamond ไม่ใช่เส้นโค้งที่ราบรื่น แต่เป็นการอธิบายโมเดลที่เก่งมากในการจำแนกรูปแบบต่างๆ ในการกระจายตัวของการฝึกของมัน และอ่อนกว่ามากในการให้เหตุผลในสิ่งที่มันไม่เคยเห็น หากสิ่งนี้ยังคงเป็นจริงภายใต้การทดสอบอิสระ นี่คือข้อเท็จจริงที่สำคัญที่สุดในเชิงปฏิบัติการเกี่ยวกับ Clef และมันไม่ได้อยู่ในไฮไลต์

ทราฟฟิกโปรดักชันก็ต้องดูสอดคล้องกับตารางความหน่วงเช่นกัน ค่ามัธยฐาน 209 ms ที่วัดบน H200 ตัวเดียวไม่ได้บอกอะไรเลยเกี่ยวกับ p95 ภายใต้การทำงานพร้อมกัน และจุดขายทั้งหมดของการออกแบบนี้ก็คือมันอยู่ใน hot path

และแพลตฟอร์มปรับแต่งละเอียด (fine-tuning) จำเป็นต้องผลิตอะไรบางอย่างออกมาให้ได้ โพสต์ของ Cloudflare อธิบายถึงลูป RL หนึ่งลูป — AI Gateway สำหรับเก็บชุดข้อมูลจากทราฟฟิกของคุณเอง Workers AI สำหรับสร้าง rollout Containers เป็นแซนด์บ็อกซ์สำหรับให้คะแนน Trainer สำหรับอัปเดตค่าถ่วงน้ำหนัก แล้วดีพลอยกลับขึ้น Workers AI — โดยอยู่ในโพสต์เดียวกันกับที่ประกาศเปิดตัวโมเดลเหล่านี้ โดยไม่มีผลลัพธ์จากลูกค้าแนบมาด้วย Clef ที่ผ่านการปรับแต่งละเอียดซึ่งเอาชนะโมเดลฐานได้ในงานที่โมเดลฐานไม่เคยถูกฝึกมาก่อน จะเป็นหลักฐานที่หนักแน่นกว่ามากสำหรับหมวดหมู่นี้ เมื่อเทียบกับแถวใด ๆ ในตาราง

จนถึงตอนนั้น สรุปอย่างยุติธรรมก็คือ Cloudflare ได้ปล่อยโมเดลตัดสินใจที่ใช้งานได้จริง มีสัญญาอนุญาตแบบผ่อนปรน และเร็วอย่างแท้จริง พร้อมทำให้มันสลับกับตัวที่มาก่อนได้อย่างง่ายดาย นั่นเป็นเรื่องราวที่ดีกว่าที่โอเพนรีลีสส่วนใหญ่เสนอ และจนถึงตอนนี้ มันก็ยังคงเป็นเพียงคำบอกเล่าของผู้ขายเกี่ยวกับตัวเองแต่เพียงฝ่ายเดียว

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube