การ์ดชื่อเรื่องที่เขียนว่า “Clef vs Qwen3.8-27B — backbone เดียว สัญญาเอาต์พุตสองแบบ” โดยมี card สองใบอยู่ด้านล่าง: Clef โมเดลตัดสินใจขนาด 27B หนึ่ง logit ต่อหนึ่งตัวเลือก และ Qwen3.8-27B VLM แบบ dense ขนาด 27B tokens และ tool calls
Guides & Insights

Clef กับ Qwen3.8-27B: แบ็กโบนเดียว สัญญาเอาต์พุตสองแบบ

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Clefเขียนประโยคไม่ได้ และมันถูกสร้างขึ้นจากโมเดลที่เขียนได้ Cloudflare/clef เป็นโมเดลตัดสินใจแบบหลายรูปแบบ (multimodal) ขนาด 27,000 ล้านพารามิเตอร์ คุณป้อนสถานะและสคีมาของคำถามแบบระบุชนิดให้มัน แล้วมันจะคืนค่าความน่าจะเป็นสำหรับทุกตัวเลือกที่อนุญาต โดยไม่ผลิตข้อความร้อยเรียงออกมาแม้แต่โทเคนเดียว โครงร่างหลักที่รองรับมันอยู่คือ Qwen3.8-27B ซึ่งเป็นโมเดลภาพ-ภาษาแบบ dense ที่เปิดน้ำหนัก แช่แข็งไว้กับที่โดยมีหัวเพิ่มเติมเล็ก ๆ ต่อพ่วงอยู่ นั่นทำให้หน้านี้เป็นหนึ่งในไม่กี่หน้าที่เปรียบเทียบโมเดลกับโมเดลซึ่งทั้งสองฝ่ายไม่ใช่คู่แข่งกันเลย — พวกมันคือเช็กพอยต์กับอนุพันธ์ของมัน แบ่งปันน้ำหนัก 55 กิกะไบต์ร่วมกัน และเห็นไม่ตรงกันว่าคำตอบคือสิ่งที่คุณอ่าน หรือสิ่งที่คุณคำนวณด้วย

น้ำหนักของทั้งคู่เปิดเผยต่อสาธารณะก่อนที่ถ้อยคำจะออกมา Cloudflare สร้างCloudflare/clef ที่เก็บบน Hugging Face เมื่อเวลา 21:15 UTC วันที่ 30 กันยายน 2026 ภายใต้ Apache-2.0 และเผยแพร่โพสต์ประกาศ — "เปิดตัว Clef: โมเดลการตัดสินใจแบบโอเพนซอร์สของเรา และแพลตฟอร์มไฟน์ทูนด้วย RL ใหม่" — ในบ่ายวันถัดไป ประมาณสิบแปดชั่วโมง โมเดลขนาด 55 กิกะไบต์สามารถดาวน์โหลดได้และรันอยู่บน GPU เอดจ์ของ Cloudflare เอง ก่อนที่ผู้ให้บริการจะพูดอะไรเกี่ยวกับมัน ภายในสามวันมันมีหน้าไลบรารี Ollama อยู่เบื้องหลัง Ollama 0.35.1 ซึ่งเป็นที่ที่บทความนี้พบมัน และบิลด์ NVFP4, FP8, EXL3, INT8, Q4 และ Q8 จากผู้อัปโหลดที่แตกต่างกันราวสิบสองราย

สิ่งที่รู้ได้จากรีโพซิทอรีนั้นสมบูรณ์อย่างผิดปกติ และคุ้มค่าที่จะแยกส่วนนั้นออกจากส่วนที่ยังไม่รู้ สิ่งที่รู้ได้: สถาปัตยกรรม เช็กพอยต์พื้นฐาน สัญญาอนุญาต การนำไปใช้อ้างอิงที่รันได้ และเมทริกซ์การประเมินแบบเต็มรูปแบบ สิ่งที่รู้ไม่ได้: ว่าตัวเลขเหล่านั้นจะยังคงอยู่หรือไม่เมื่อรันซ้ำโดยคนที่ไม่ใช่ Cloudflare ทุกคะแนนที่กำหนดให้ Clef ด้านล่างมาจากการรันชุดทดสอบที่ผู้ขายโฮสต์เองโดยผู้ขายเอง ความไม่สมมาตรนั้นเมื่อเทียบกับโมเดลที่มีการใช้งานอิสระมาหนึ่งเดือน เป็นแกนกลางที่ซื่อตรงของการเปรียบเทียบนี้ และส่วนที่เหลือของบทความนี้จะพูดถึงว่ามันกัดตรงไหนจริง ๆ

รีโพซิทอรีทั้งสอง เคียงข้างกัน

เริ่มจากการดาวน์โหลดก่อน เพราะความเหมือนกันนี่แหละคือประเด็นสำคัญ safetensors ของ Clef รวมเป็น 54.97 GB แบ่งเป็นสิบสองชาร์ด ของโมเดลแม่รวมเป็น 55.56 GB แบ่งเป็นสิบแปดชาร์ด Clef เก็บ vision encoder ของ Qwen3.8-27B ไว้ — ทั้งโปรเซสเซอร์ วิชันทาวเวอร์ และส่วนหน้าของมัลติโมดัลทั้งหมด — จึงไม่มีอะไรถูกถอดออกเพื่อย่อให้เล็กลง สิ่งที่ Cloudflare เพิ่มเข้ามาคือเฮดสคีมาร่วมขนาด 256 MB: สี่เลเยอร์ กว้าง 1,024 มีสิบหกหัว ฟีดฟอร์เวิร์ดกว้าง 4,096 และสองเลเยอร์จัดเส้นทางที่อ่านสถานะซ่อนสุดท้ายของแบ็กโบน สูตรการฝึกคือแบ็กโบนแบบแช่แข็ง เฮดนั้น และอะแดปเตอร์ low-rank อันดับ 256 โดยใช้ cross-entropy แบบปรับเรียบด้วย label smoothing สำหรับคำตอบสคีมาที่ถูกต้อง ประกบคู่กับ Brier loss เพื่อทำให้การปรับคาลิเบรตคมชัดขึ้น

จากนั้นก็คือความแตกต่าง ซึ่งทั้งหมดอยู่ที่สิ่งที่โมเดลได้รับอนุญาตให้ส่งออก

• พารามิเตอร์ — Clef 27B, ผ่านการฝึกแบบ post-training จาก Qwen/Qwen3.8-27B. Qwen3.8-27B เป็นแบบ dense ขนาด 27B, 64 เลเยอร์, hidden 5,120, คำศัพท์ 248,320 โทเคน, 16 × (3 × Gated DeltaNet → FFN) สลับกับ Gated Attention.

• เอาต์พุต — Clef: หนึ่ง logit ต่อหนึ่งตัวเลือกที่อนุญาต ทำ softmax ต่อคำถาม ไม่มีเส้นทางการสร้างใด ๆ เลย Qwen3.8-27B: โทเค็น การเรียกใช้เครื่องมือ และบล็อกการให้เหตุผลที่เปิดอยู่เป็นค่าเริ่มต้น

• รูปแบบคำถาม — Clef รับคำถามที่มีการระบุชนิดได้ 1 ถึง 64 ข้อต่อคำขอในสามรูปแบบ: noul (ความน่าจะเป็นที่เป็นจริง), choice (ตัวเลือกที่มีชื่อ 2 ถึง 255 รายการ), score (ระดับเรียงลำดับ 2 ถึง 10 ระดับ โดยคืนค่าที่ถ่วงน้ำหนักด้วยความน่าจะเป็นซึ่งอาจอยู่ระหว่างระดับเหล่านั้น) Qwen3.8-27B ไม่มีสัญญาเช่นนี้ คุณจะได้ข้อความร้อยแก้วและคุณต้องเขียนตัวแยกวิเคราะห์เอง

• สัญญาอนุญาต — Apache-2.0 ทั้งคู่ ซึ่งเป็นเหตุผลว่าทำไมการควอนไทเซชันโดยบุคคลที่สามจึงเสร็จได้ในสุดสัปดาห์เดียว

• ต้นทุนของครึ่งที่ถูกแช่แข็ง — หัวของ Clef มีขนาด 256 MB เทียบกับแบ็กโบน 54.97 GB เกือบทั้งหมดของการดาวน์โหลดคือโมเดลแม่ ถ้าคุณมี Qwen3.8-27B อยู่ในดิสก์แล้ว คุณกำลังดาวน์โหลดมันเป็นครั้งที่สองเพื่อให้ได้ความคิดเห็นที่แตกต่างเกี่ยวกับวิธีตอบ

A two-column scoreboard for Clef and Qwen3.8-27B across six dimensions: output, parameters, GPQA Diamond (48.0 vs 90.5), hosted context (65,536 vs 262,144 tokens), median latency (209.3 ms vs 1,929 ms) and list price ($0.24 per M in vs $0.33/$2.40 per M). A footer notes Clef's figures are vendor-reported and unreproduced, Qwen's GPQA is per Artificial Analysis, and latency was measured by each side on its own hardware.

ค่าใช้จ่ายของการเปลี่ยนหัวเรื่องใหม่ ในตัวเลขสองตัว

การประเมินของ Cloudflare คือชุด Decision Index 0.2.1 ซึ่งรันภายในองค์กร และเป็นตารางเกี่ยวกับโมเดลการตัดสินใจ — หกคอลัมน์: Clef, Clef-flash, Jev, DiffusionGemma Jev, Kev 9B และ Laya โดย Qwen3.8-27B ไม่มีแถวอยู่ในนั้น และ Clef ก็ไม่มีแถวใน Artificial Analysis Intelligence Index ดังนั้นจึงไม่มีกระดานคะแนนร่วมกัน และบทความนี้จะไม่คิดค้นขึ้นมาเอง

อย่างไรก็ตาม มีหนึ่งเกณฑ์มาตรฐานที่ทั้งสองฝ่ายได้ผ่านการทดสอบ และช่องว่างนั้นกว้างพอที่จะเป็นตัวเลขที่เกี่ยวข้องกับการตัดสินใจมากที่สุดในการเปิดตัว บน GPQA Diamond — คำถามวิทยาศาสตร์ระดับบัณฑิตศึกษา แบบเลือกตอบ — Cloudflare วัด Clef ได้ที่ 48.0 ขณะที่รุ่นแม่อยู่ที่ 90.5 บนฮาร์เนสของ Artificial Analysis และ 89.2 บนการ์ดโมเดลของผู้ขายเอง นั่นคือหน้าผาสี่สิบจุดในความรู้ทั่วไป และไม่ใช่ปริศนา: Clef ตอบโดยการให้คะแนนชุดตัวเลือกที่กำหนดไว้ซึ่งมันได้รับมา และปรนัยความรู้ทั่วไปนั้นห่างไกลจาก "ส่งตั๋วนี้" พอๆ กับที่น้ำหนักเดียวกันสามารถถูกชี้ไปได้ ถือว่าการเปรียบเทียบนี้เป็นการบ่งชี้มากกว่าการควบคุม — สองฮาร์เนส สองแล็บ ไม่ใช่ของผู้ขายหรือของผู้ติดตาม แต่ทิศทางไม่ต้องสงสัย และมันคือราคาของสัญญา

รูปแบบเดียวกันนี้ปรากฏในเซลล์เอนกประสงค์ที่เหลือของ Clef MMLU-Pro 65.9, BBH 73.7, CLINC150 ที่มีการจัดการนอกขอบเขต 97.4 สำหรับรุ่น 27B เทียบกับ 89.3 ของ Jev — ตัวสุดท้ายนั้นเป็นเซลล์ที่หาได้ยากซึ่งรุ่นที่พัฒนาต่อยอดชนะโมเดลตัดสินใจรุ่นเก่าไปเลย และมันสำคัญเพราะการปฏิเสธที่จะจำแนกคือครึ่งที่ยากของการจัดเส้นทาง ในจุดที่ Clef แข็งแกร่ง มันแข็งแกร่งตรงจุดที่ตัวจำแนกที่ฝึกภายในองค์กรควรจะแข็งแกร่งพอดี: macro-F1 ของเจตนา BANKING77 ที่ 94.2, BFCL case-exact ที่ 98.5, API-Bank ที่ 91.9 ในจุดที่มันอ่อน โมเดลตัดสินใจแบบข้อความล้วนจากแล็บคู่แข่ง — Jev ของ TypeSafe — เอาชนะมันไปสามสิบจุดบน GPQA Diamond ขณะที่คิดค่าบริการ 0.042 ดอลลาร์ต่อล้านโทเค็นอินพุตในแค็ตตาล็อกของเราเอง ซึ่งเป็นเครื่องเตือนใจที่มีประโยชน์ว่า "27B" ไม่ใช่ข้อโต้แย้งในตัวเอง

สิ่งที่พาเรนต์เก็บไว้คือทุกสิ่งทุกอย่างที่ Decision Index ไม่ได้ถามถึง บนการ์ดของมันเองและในแถวที่มาจาก AA แค็ตตาล็อกของเราบรรจุไว้: Terminal-Bench 2.1 ที่ 73.0, SWE-bench Pro 61.7, LiveCodeBench v6 90.3, OSWorld-Verified 84.3, DeepSWE 1.1 ที่ 42.2, AA Coding 68.1 อยู่ในอันดับ 35 จาก 138 โมเดลที่สุ่มมา ไม่มีรายการใดมีแถวของ Clef เพราะ Clef ไม่สามารถลองทำรายการเหล่านั้นได้ มันไม่มีเส้นทางการเรียกใช้เครื่องมือ ไม่มีการวางแผนระยะยาว และไม่มีวิธีปล่อยแพตช์ออกมา

การตัดสินใจหนึ่งครั้งมีต้นทุนเท่าใด และเหตุใดบรรทัดเอาต์พุตจึงเป็นข้อโต้แย้งทั้งหมด

หน้าเพจโมเดลของ Workers AI แสดงราคาต่อหน่วยสำหรับ Clef เพียงรายการเดียวเท่านั้น: 0.24 ดอลลาร์ต่อหนึ่งล้านโทเคนอินพุต ไม่มีบรรทัดราคาสำหรับเอาต์พุต และเหตุผลก็อยู่ในผลลัพธ์ที่ส่งกลับมา ตัวอย่างที่ Ollama ระบุไว้ในเอกสารของตัวเอง — ตั๋วสนับสนุนที่ถูกส่งต่อไปยังสามคำถาม — ส่งกลับมาพร้อมกับ "usage": {"input_tokens": 1204, "output_tokens": 3} สามโทเคนเอาต์พุตสำหรับสามคำถาม ไม่ว่า Cloudflare จะคิดเงินสำหรับสามโทเคนนั้นหรือไม่ก็แทบไม่สำคัญเลย เพราะต้นทุนเอาต์พุตของการตัดสินใจหนึ่งครั้งไม่ใช่อัตราคิดค่าบริการ แต่เป็นจำนวนนับของคำถามต่างหาก

ลองนำมาเทียบกับเรตการ์ดของพาเรนต์บนแค็ตตาล็อกของเราเอง ซึ่งก็คือ $0.33 ต่อล้านโทเคนอินพุต และ $2.40 ต่อล้านเอาต์พุต ด้วยหน้าต่าง 262,144 โทเคน สถานะ 1,204 โทเคนเดียวกัน การตัดสินใจเลือกเส้นทางครั้งเดียวแบบเดียวกัน:

• Clef — 1,204 โทเคนอินพุตที่ $0.24 ต่อล้าน คิดเป็นประมาณ$0.00029 ต่อการตัดสินใจ และประมาณ $289 ต่อล้านการตัดสินใจ ตัวเลขแทบไม่เปลี่ยนแปลงเมื่อคำตอบยากขึ้น เปลี่ยนแปลงเฉพาะเมื่อสถานะยาวขึ้น

• Qwen3.8-27B ที่ปิดโหมดคิด — สถานะเดียวกันมีค่าใช้จ่ายอินพุตประมาณ $0.00040 บวกกับโทเค็นเอาต์พุตประมาณสิบโทเค็นที่ราคา $2.40 ต่อล้าน เรียกมันว่า $0.00042 หรือ $421 ต่อล้าน Clef ถูกกว่าประมาณ 1.5 เท่า ซึ่งไม่ใช่เรื่องที่ใคร ๆ กำลังพูดถึง

• Qwen3.8-27B โดยเปิดโหมดคิด reasoning ไว้ — ซึ่งเป็นค่าเริ่มต้นของเช็กพอยต์นี้ หากโมเดลใช้ 400 โทเคนในการคิดวิเคราะห์ว่าอีเมลรีเซ็ตรหัสผ่านควรอยู่ในถังใดจากทั้งสี่ถัง นั่นก็เพิ่มอีก $0.00096 และผลการตัดสินใจจะอยู่ที่ราว $0.0014 หรือ $1,357 ต่อล้านโทเคน 400 โทเคนนั้นเป็นสมมติฐาน ไม่ใช่ค่าที่วัดได้จริง และตัวคูณจะแปรผันเป็นเส้นตรงตามจำนวนนั้น

ดังนั้น เวอร์ชันที่ตรงไปตรงมาของข้อโต้แย้งเรื่องราคาจึงแคบกว่าที่เห็นในตอนแรก เมื่อเทียบกับโมเดลเอนกประสงค์ที่ทำงานโดยปิดโหมดคิด Clef ชนะในแง่ค่าใช้จ่ายเป็นเงินประมาณหนึ่งเท่าครึ่ง — จริง แต่ไม่ถึงขั้นพลิกโฉม เมื่อเทียบกับโมเดลเดียวกันในการตั้งค่าเริ่มต้น ช่องว่างจะขึ้นอยู่กับความเยิ่นเย้อของคำพูด และความเยิ่นเย้อก็คือสิ่งที่โมเดลภาษามี แต่การออกแบบแบบ scorers-over-options ไม่มีเลยแม้แต่น้อย นั่นคือข้ออ้างเชิงโครงสร้าง: ต้นทุนของ Clef ถูกจำกัดด้วยความยาวของสถานะ ส่วนต้นทุนของพาเรนต์ถูกจำกัดด้วยว่าพาเรนต์ตัดสินใจจะพูดมากแค่ไหน

Cloudflare's Workers AI model page for clef, showing a 65,536-token context window, vision support, and unit pricing of $0.24 per million input tokens with no output line.

ตัวเลขตัวเดียวที่ไม่ใกล้เคียง

Cloudflare รายงานค่ามัธยฐานความหน่วงของคำขอที่ 209.3 ms สำหรับ Clef และ p95 ที่ 238.6 ms โดยวัดจาก 43 เบนช์มาร์กในการรันของตน บน GPU เอดจ์ของตัวเอง ยังไม่มีใครนอก Cloudflare ทำซ้ำได้ และโครงสร้างพื้นฐานของผู้ให้บริการคือเหตุผลที่ตัวเลขต่ำเช่นนี้ — โมเดลนี้ออกแบบมาให้อยู่บนเครือข่ายเดียวกับผู้เรียก

สำหรับพาเรนต์ เราสามารถทำได้ดีกว่าตัวเลขจากผู้ขาย เพราะมันเป็นหนึ่งในเส้นทางของเรา ในช่วงเจ็ดวันที่สิ้นสุดวันที่ 2 ตุลาคม 2026 เพลย์กราวด์ของ OrcaRouter เองได้วัดค่า Qwen3.8-27B ที่ p50 ที่ 1,929 มิลลิวินาที และ 235.8 โทเค็นเอาต์พุตต่อวินาที บนปริมาณการรับส่งข้อมูล 136.3 ล้านโทเค็นในช่วงเวลานั้น ชุดข้อมูลรายวันเป็นส่วนที่น่าสนใจ: p95 อยู่ที่ 10,000 มิลลิวินาทีพอดีในหกจากเจ็ดวัน ซึ่งดูเหมือนเพดานมากกว่าการวัด และ p50 แกว่งระหว่าง 1,751 มิลลิวินาที ถึง 4,296 มิลลิวินาที ขึ้นอยู่กับวัน ให้ถือว่าค่ามัธยฐานอยู่ที่ประมาณเก้าเท่าของ Clef และให้ถือว่าหางนั้นไม่มีข้อมูลที่เป็นประโยชน์จนกว่าจะมีใครเผยแพร่การแจกแจงจริง

ช่องว่างนั้นไม่ใช่ความแตกต่างจากการปรับแต่ง และมันจะไม่หายไป การประมวลผลแบบ prefill-only รอบเดียวบวกกับหัวให้คะแนนแบบขนานจะเสร็จสิ้นในการกวาดเพียงครั้งเดียว ส่วนโมเดลแบบ autoregressive จะเสร็จเมื่อมันไม่มีอะไรจะพูดแล้ว ตัวเลขสัมบูรณ์ของผู้ขายสำหรับ Clef ควรถูกหักลดตามปกติ แต่การจัดลำดับนั้นเป็นคุณสมบัติของสถาปัตยกรรม ไม่ใช่ของฮาร์ดแวร์ของ Cloudflare

บริบทถูกยกมาสามวิธีสำหรับหนึ่งในนั้น

โมเดลทั้งสองรับข้อความ JSON รูปภาพ และวิดีโอ หน้าต่างไม่เหมือนกัน และหนึ่งในนั้นถูกอ้างอิงไม่สอดคล้องกัน ขึ้นอยู่กับว่าคุณอ่านจากที่ไหน

• Clef แบบโฮสต์ — 65,536 โทเคน ตามหน้าโมเดล Workers AI และโพสต์ประกาศ นั่นคือตัวเลขที่ผูกมัดผู้เรียก API และการนำเสนอของ Cloudflare เองก็เป็นการเปรียบเทียบ: สองเท่าของสถานะที่หน้าต่าง 32K ของ Jev เก็บได้

• Clef บนดิสก์ — config.jsonที่เผยแพร่ออกมาประกาศค่า max_position_embeddingsไว้ที่ 262,144 เนื่องจาก backbone ที่ถูกแช่แข็งนั้นเป็นของโมเดลแม่ และยังคงเพดานตำแหน่งของโมเดลแม่ไว้อยู่ encode_record helper ที่มาพร้อมกันมีค่าเริ่มต้นเป็น max_length=16,384 โดยมี max_state_tokensให้ใช้กำหนดขอบเขตของ state แยกต่างหาก ไม่มีตัวเลขใดในสามตัวนี้ที่ผิด แต่ละตัวตอบคำถามคนละข้อกัน และรายการ listing ตอนรันที่โฆษณาว่า 256K นั้นกำลังอ่าน config ไม่ใช่ endpoint

• Qwen3.8-27B — 262,144 แบบเนทีฟ ขยายได้ถึง 1,000,000 ด้วยการตั้งค่าการให้บริการที่เหมาะสม ตามการ์ดของผู้จำหน่ายและแถวในแค็ตตาล็อกของเรา อย่างน้อยก็เป็นสี่เท่าของหน้าต่าง Clef ที่โฮสต์ไว้

ผลลัพธ์ในทางปฏิบัติเล็กกว่าที่อัตราส่วนบ่งชี้ไว้ Clef ใช้สถานะอย่างหนึ่ง — ตั๋ว ใบแจ้งหนี้ ภาพหน้าจอ — ไม่ใช่บทสนทนา และหนึ่งในจุดขายของมันคือคุณสามารถป้อนเพย์โหลดแบบแบนขนาดใหญ่ให้มัน แล้วถามคำถามหกสิบสี่ข้อเกี่ยวกับมันได้ โดยไม่ต้องจ่ายค่าเพย์โหลดซ้ำสำหรับแต่ละคำถาม พาเรนต์ต้องการหน้าต่างบริบทเพราะมันต้องเก็บประวัติ ผลลัพธ์จากเครื่องมือ และการใช้เหตุผลของตัวเอง ความต้องการต่างกัน เพดานก็ต่างกัน

ทั้งคู่เห็นพิกเซลเดียวกัน

ตัวเข้ารหัสภาพเป็นแบบที่สืบทอดมา ดังนั้นนี่จึงไม่ใช่กรณีที่โมเดลหนึ่งเป็นมัลติโมดัลและอีกโมเดลหนึ่งไม่ใช่ Clef ยอมรับรูปภาพได้สูงสุดสี่รูปต่อคำขอ เป็น PNG, JPEG หรือ WebP ที่เข้ารหัส base64 ใช้ร่วมกันโดยทุกคำถามในเพย์โหลด และสามารถเพิ่มเฟรมวิดีโอเป็นอาร์เรย์ของเฟรมได้ — ตัวอย่างใบเสร็จในการ์ดถามคำถามแบบใช่/ไม่ใช่ว่ายอดรวมอ่านออกหรือไม่ ซึ่งเป็นดีไซน์แบบย่อส่วน Qwen3.8-27B เป็นโมเดลภาษาภาพแบบเนทีฟที่มี OmniDocBench 1.5 ที่ 91.1, RealWorldQA ที่ 85.9 และ CharXiv ที่ 78.8 บนการ์ดของผู้ขาย

สิ่งที่แตกต่างคือสิ่งที่คุณได้กลับมา Clef ให้การตัดสินใจทีละฟิลด์พร้อมค่าความน่าจะเป็นกำกับ ซึ่งเป็นคำตอบแบบมีชนิดข้อมูลเกี่ยวกับเอกสาร ส่วนพาเรนต์ให้คำอธิบายของเอกสาร ซึ่งคุณต้องนำไปแยกวิเคราะห์เอง สำหรับงานเอกสารประเภทใหญ่ ๆ — ตรวจแบบฟอร์มนี้ ระบุข้อกำหนดนี้ ยอดรวมนี้เกินเกณฑ์หรือไม่ — คำตอบแบบมีชนิดข้อมูลคือตัวงานทั้งหมด ส่วนคำอธิบายเป็นภาระส่วนเกินที่คุณต้องจ่ายไปแล้วก็ทิ้งไป

จุดที่เส้นแบ่งอยู่จริงๆ

• ใช้ Clef — คำตอบสามารถแจกแจงล่วงหน้าได้ทั้งหมด และคุณไม่อยากเขียน parser การจัดเส้นทาง การคัดกรอง การกำหนดเงื่อนไข การตรวจสอบนโยบาย การสกัดฟิลด์จากเอกสาร ชุดปิด 2 ถึง 255 ตัวเลือกต่อคำถาม ให้คะแนนคำถามพร้อมกันได้สูงสุด 64 ข้อ

• เลือก Clef — การตัดสินใจอยู่ใน hot path และ 209 ms เทียบกับ 1,929 ms เปลี่ยนสิ่งที่ไปป์ไลน์ทำได้ นี่คือเหตุผลที่แข็งแกร่งที่สุดเพียงข้อเดียวในการย้าย และเป็นเหตุผลด้านความหน่วง ไม่ใช่ด้านความแม่นยำ

• ใช้ Clef — คุณต้องการความแน่นอน ตัวเลือกที่คุณไม่ได้ประกาศไว้จะกลับมาไม่ได้ เพราะไม่มีขั้นตอนการสร้างใด ๆ ที่จะผลิตมันขึ้นมา

• เก็บ {{1}}Qwen3.8-27B{{/1}} ไว้ — คำตอบไม่ใช่การเลือกจากรายการ: การสรุปความ การร่าง การใช้เหตุผลกับปัญหาที่ไม่เคยเจอมาก่อน การเขียนโค้ด การขับเคลื่อนเครื่องมือในระยะยาว Clef ทำสิ่งเหล่านั้นไม่ได้เลย และมันจะไม่บอกคุณว่ามันทำไม่ได้

• เก็บ Qwen3.8-27B ไว้ — คุณต้องให้โมเดลพูดว่า "ไม่มีตัวเลือกใดในนี้" โมเดลตัดสินใจจะให้คะแนนตัวเลือกที่มันได้รับ ถ้าส่งสคีมาการเรียกเก็บเงิน/เทคนิค/ฝ่ายขาย กับคำขอด้านความเป็นส่วนตัวให้มัน มันจะคืนตัวเลือกที่แย่น้อยที่สุดในสามตัวนั้น แทนที่จะปฏิเสธ พาเรนต์จะเผยคำถามที่คุณไม่ได้คิดจะถาม

• เก็บ Qwen3.8-27B ไว้ — สำหรับงานที่ใช้บริบทหรือเอกสารยาว ใหญ่กว่าหน้าต่างที่โฮสต์ไว้ถึงสี่เท่า ก่อนการขยายเป็นหนึ่งล้านโทเคน

อ่านรายการนั้นในฐานะไปป์ไลน์ ไม่ใช่คำตัดสิน เพราะนั่นคือสิ่งที่มันเป็น สถาปัตยกรรมทำให้ความสัมพันธ์นี้เป็นรูปธรรมตรงตัว: Clef คือพาสพรีฟิลล์ของโมเดลแม่ที่มีกลไกการตอบต่างออกไปอยู่ที่ปลายทาง การออกแบบที่สมเหตุสมผลจะวาง Clef ไว้ข้างหน้า — ตัดสินเส้นทาง ลำดับความสำคัญ และธงการยกระดับ — แล้วเก็บ Qwen3.8-27B ไว้ข้างหลังเพื่อลงมือตามการตัดสินใจนั้น ทั้งสองเป็นส่วนเสริมที่บังเอิญแชร์การดาวน์โหลดชุดเดียวกัน

รันแต่ละตัวที่ไหน

Clef ถูกโฮสต์อยู่บน Cloudflare's Workers AI ในราคา $0.24 ต่อล้านโทเคนอินพุตตามตัวเลขข้างต้น และน้ำหนัก Apache-2.0 นั้นเป็นของคุณที่จะนำไปรันในเครื่องได้เลย รายการในไลบรารี Ollama คือพื้นผิวใหม่ล่าสุด: ollama pull clef ต้องใช้ Ollama 0.35.1 หรือใหม่กว่า เพราะโมเดลนี้สื่อสารผ่าน /v1/systemone endpoint ที่ Ollama เพิ่มเข้ามาสำหรับโมเดลตัดสินใจ ให้ดูที่แท็ก ไม่ใช่พาดหัว — แท็ก default และ clef:27b มีขนาด 18 GB ซึ่งเป็นบิลด์สี่บิตของโมเดลขนาด 55 กิกะไบต์; clef:27b-q8_0 คือ 30 GB, clef:27b-nvfp4 คือ 18 GB, clef:27b-mxfp8 คือ 31 GB และ clef:27b-mlx-bf16 คือ 55 GB เต็มจำนวนสำหรับ Apple silicon Python SDK ของ TypeSafe เองก็จะคุยกับมันได้ หากคุณชี้มันไปที่ Ollama ในเครื่องและใส่ API key อะไรก็ได้ ซึ่งรันไทม์จะไม่สนใจ ข้อควรระวังหนึ่งอย่างที่จะกัดคุณในโปรดักชัน: confidence วัดว่าความน่าจะเป็นกระจุกตัวมากแค่ไหน ไม่ใช่โอกาสที่คำตอบจะถูกต้อง และกรณีที่คะแนนเท่ากันจะตัดสินตามลำดับตัวเลือกที่คุณประกาศไว้

พาเรนต์เป็นตัวที่ง่ายกว่าที่จะนำมาให้บริการผ่าน API ในตอนนี้ Qwen3.8-27B สามารถกำหนดเส้นทางได้บน OrcaRouter ด้วยอัตรา $0.33 และ $2.40 ต่อล้านโทเค็นที่ใช้ข้างต้น โดยมีหน้าต่าง 262,144 โทเค็น และเป็นหนึ่งในโมเดลกว่า 200 รุ่นที่เข้าถึงได้ผ่านคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียว เนื่องจากราคาตามรายการของผู้ให้บริการถูกส่งต่อโดยบวกมาร์กอัป 0% การลดราคาของผู้ขายในฝั่งใดฝั่งหนึ่งของการเปรียบเทียบนี้จึงมีผลบนเส้นทางของเราภายในวันเดียวกับที่ประกาศ

Clef เองไม่ใช่หนึ่งในเส้นทางของเรา — แคตตาล็อกสาธารณะของเราไม่คืนอะไรให้กับมันเลย และไม่มีสิ่งใดในที่นี้ที่ควรถูกตีความว่าเป็นข้ออ้างเรื่องความพร้อมใช้งานจากเรา สิ่งที่เรามีให้จริงคือโมเดลที่ทำให้รูปแบบการตัดสินใจนั้นเข้าถึงได้โดยไม่ต้องมีบัญชี Cloudflare: Jev 1.13 เป็นเส้นทางที่ระบุไว้ในราคา $0.042 ต่อล้านโทเค็นอินพุต พร้อมบริบท 65,536 โทเค็น วัดได้ที่ p50 เท่ากับ 148 ms ตลอดช่วงเจ็ดวันเดียวกัน และมันพูดรูปแบบคำขอPOST /v1/systemoneแบบเดียวกัน เนื่องจาก Clef เข้ากันได้กับ API ของ Jev โดยเจตนา ไพป์ไลน์ที่สร้างขึ้นกับตัวใดตัวหนึ่งจึงห่างจากการเปลี่ยนคอนฟิกไปยังอีกตัวหนึ่งเพียงขั้นเดียว — ซึ่งเป็นกรณีที่เลเยอร์การจัดเส้นทางมีอยู่เพื่อทำให้ไม่มีค่าใช้จ่าย ทำให้ทั้งสองเข้าถึงได้ วัดผลบนเลเบลของคุณเอง และให้ผู้ชนะเป็นเพียงจุดข้อมูลหนึ่ง ไม่ใช่พันธะทางสถาปัตยกรรม หากโมเดลการตัดสินใจลงเอยด้วยการกั้นเอเจนต์ โมเดลที่ลงมือตามการตัดสินใจนั้นก็ยังคงต้องเข้าถึงได้ และครึ่งนั้นก็อยู่หลังคีย์เดียวกันอยู่แล้ว

OrcaRouter's own model page for qwen/qwen3.8-27b, showing a 262,144-token context window and pricing of $0.33 per million input tokens and $2.40 per million output tokens.

อะไรจะทำให้การอ่านนี้เปลี่ยนไป

สามสิ่ง เรียงตามลำดับจากน้อยไปมากว่าสิ่งเหล่านั้นจะทำให้มันขยับได้มากแค่ไหน

บุคคลที่สามจำเป็นต้องรัน Decision Index ซ้ำ ชุดทดสอบนี้เป็นแบบสาธารณะ และ Cloudflare ระบุว่าการประเมินนั้นทำซ้ำได้ ดังนั้นเรื่องนี้จึงเป็นไปได้ — และเซลล์ out-of-scope ของ CLINC150 คือจุดที่ต้องจับตา เพราะค่า 97.4 ของ 27B อาจเป็นข้อได้เปรียบที่แท้จริงเหนือ 89.3 ของ Jev ในครึ่งที่ยากที่สุดของ routing หรือเป็นอาร์ติแฟกต์ของฮาร์เนสที่สร้างขึ้นเองภายใน ตอนนี้ยังไม่มีใครนอก Cloudflare รู้

มีคนจำเป็นต้องให้คะแนน Clef และ Qwen3.8-27B บนงานจำแนกประเภทเดียวกันด้วยป้ายกำกับชุดเดียวกัน นั่นคือการเปรียบเทียบเพียงอย่างเดียวที่จะชี้ขาดได้ว่าการเปลี่ยนหัว (re-heading) เป็นการแลกคุณภาพหรือการยกระดับคุณภาพสำหรับการตัดสินใจแบบชุดปิด และไม่มีผู้ขายรายใดมีแรงจูงใจที่จะรันมัน จนกว่าจะถึงตอนนั้น ช่องว่าง GPQA ที่ 40 จุดยังคงเป็นหลักฐานที่ดีที่สุดเท่าที่มีอยู่เกี่ยวกับสิ่งที่ถูกนำออกไป และมันก็เป็นหลักฐานเกี่ยวกับงานที่ผิด

และความหน่วงของ Clef ต้องมี p95 ภายใต้การทำงานพร้อมกัน ค่ามัธยฐาน 209 ms ถูกวัดโดยผู้ขาย บนฮาร์ดแวร์ที่ผู้ขายควบคุม สำหรับโมเดลที่จุดขายทั้งหมดคือการที่มันอยู่ในเส้นทางที่เรียกใช้บ่อย การจัดอันดับเมื่อเทียบกับโมเดลแม่แบบ autoregressive นั้นเป็นเชิงสถาปัตยกรรมและจะยังคงอยู่ ตัวเลขมิลลิวินาทีแบบสัมบูรณ์คือตัวเลขที่เราไม่ควรไว้ใจ และเป็นตัวเลขที่กรณีธุรกิจทั้งหมดตั้งอยู่บนนั้น

Qwen3.8-27B เป็นหนึ่งในโมเดลกว่า 200 รายการที่เข้าถึงได้ผ่านคีย์เดียวที่เข้ากันได้กับ OpenAI — Qwen3.8-27B.

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube