
Clef เทียบกับ LFM2.5 2.6B Base: 55 GB บน H200 หรือ 5.4 GB บนแล็ปท็อป
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
นี่คือการเปรียบเทียบที่ฮาร์ดแวร์ตัดสินข้อโต้แย้งก่อนที่โมเดลจะตัดสิน Cloudflare/clefเป็นโมเดลตัดสินใจแบบมัลติโมดัลที่มีพารามิเตอร์ 2.7 หมื่นล้านตัว ผ่านการโพสต์เทรนจาก Qwen3.8-27B โดยรีโพซิทอรีของมันมีขนาดเกิน 55 GB เล็กน้อย กระจายอยู่บนแชร์ด์ backbone สิบสองชิ้นบวกกับ joint schema head ขนาดเล็ก LiquidAI/LFM2.5-2.6B-Baseเป็นเช็คพอยต์แบบข้อความล้วนที่มีพารามิเตอร์ 2.69 พันล้านตัว ซึ่งน้ำหนักของมันเป็นไฟล์เดียวขนาด 5.4 GB เผยแพร่โดย Liquid AI เมื่อวันที่ 1 สิงหาคม 2026 ภายใต้ LFM Open License ความหน่วงที่ Cloudflare เปิดเผยสำหรับ Clef เอง — 209.3 ms ที่ค่ามัธยฐาน, 238.6 ms ที่ p95 — วัดบน H200 เครื่องเดียว การติดตั้งใช้งานที่ Liquid AI ตั้งใจไว้สำหรับตระกูล LFM2.5 ของตนคือแล็ปท็อป โทรศัพท์ หรือเครื่องพกพา Ryzen ผู้ขายทั้งสองรายอธิบายโมเดลของตนว่าเล็ก เร็ว และมีประสิทธิภาพ และทั้งคู่ก็พูดความจริงเกี่ยวกับเครื่องที่ต่างกัน
มีช่องว่างที่สองอยู่เบื้องหลังช่องแรก และเป็นช่องว่างที่เปลี่ยนแผนได้จริง ๆ ทั้ง Clef และ LFM2.5 2.6B Base ไม่ได้ตอบคำถามแบบพร้อมใช้ทันทีในวิธีที่คุณน่าจะคาดหวัง Clef มาพร้อมการฝึกเต็มรูปแบบสำหรับงานที่มันไม่สามารถเบี่ยงเบนไปจากนั้นได้: มันตอบคำถามที่พิมพ์ และจะไม่ทำอย่างอื่น ส่วนเช็กพอยต์ของ Liquid มาพร้อมโดยไม่ได้รับการฝึกสำหรับสิ่งใดเลย — มันเป็นโมเดลฐาน จงใจไม่มีการปรับแต่งตามคำสั่ง และการ์ดของ Liquid AI เองระบุว่าแนะนำให้ใช้เฉพาะสำหรับการทำไฟน์ทูนอย่างหนักเท่านั้น ดังนั้นคำถามจริง ๆ ไม่ใช่ว่าตัวไหนรันถูกกว่ากัน แต่เป็นว่าคุณกำลังซื้อส่วนประกอบสำเร็จรูปหรือวัสดุตั้งต้น และคำตอบก็แตกต่างกันสำหรับแต่ละตัว
แต่ละอันทำงานที่ไหน และทำไมนั่นจึงเป็นการเปรียบเทียบทั้งหมด
การออกแบบการนำไปติดตั้งใช้งานไม่ใช่เรื่องรองสำหรับสองโมเดลนี้ สำหรับโมเดลที่ใช้ตัดสินใจ มันคือสถาปัตยกรรม เพราะการ forward pass 209 ms กับเรื่องเล่า “รันบนเครื่องที่อยู่ตรงหน้าคุณ” เป็นข้อกล่าวอ้างเดียวกันที่ถูกเล่าจากคนละปลาย
• พารามิเตอร์ — 27B สำหรับ Clef โดยยังคงตัวเข้ารหัสภาพ Qwen3.8-27B ไว้; 2.69B แบบข้อความล้วนสำหรับ LFM2.5 2.6B Base
• ดิสก์ — รีโพซิทอรีขนาด 55 GB สำหรับ Clef; ไฟล์ safetensors ขนาด 5.4 GB หนึ่งไฟล์สำหรับเช็คพอยต์ Liquid โดยมีบิลด์ GGUF, ONNX และ MLX แบบควอนไทซ์เผยแพร่ไว้เคียงข้างกัน
• ฮาร์ดแวร์ — Cloudflare ทดสอบ Clef ด้วย torch 2.11 และ transformers 5.10.2 บน H200 ตัวเดียว และค่าความหน่วงของมันมาจากการรันครั้งนั้น โมเดลพี่น้องที่ผ่านการฝึกหลังการฝึก (post-trained) ของเช็กพอยต์นี้จาก Liquid AI ทำงานที่ 220 โทเคนต่อวินาทีบน Apple M5 Max และ 113 tok/s บน CPU AMD Ryzen โดยใช้หน่วยความจำต่ำกว่า 2.5 GB และผู้ขายระบุว่าสามารถทำได้ 30 tok/s บนโทรศัพท์
• คอนเท็กซ์ — 65,536 โทเคนสำหรับ Clef ตามหน้าของโมเดล Workers AI และโพสต์เปิดตัว; 131,072 โทเคนสำหรับ LFM2.5 2.6B Base
• อินพุต — Clef อ่านข้อความ JSON รูปภาพ และเฟรมวิดีโอ แล้วให้คะแนนร่วมกัน ส่วน Liquid checkpoint รองรับเฉพาะข้อความ
• สัญญาอนุญาต — Apache-2.0 สำหรับ Clef สัญญาอนุญาต LFM Open License v1.0 สำหรับ LFM2.5 ซึ่งเป็นแบบเปิดให้เข้าถึงซอร์สโค้ด ไม่ใช่โอเพนซอร์สตามนิยามของ OSI: การใช้เชิงพาณิชย์มีเงื่อนไขว่าองค์กรของคุณต้องมีรายได้ต่อปีต่ำกว่า 10 ล้านดอลลาร์สหรัฐ และหากเกินเส้นนั้นขึ้นไป สัญญาอนุญาตก็ไม่ได้ให้สิทธิ์ดังกล่าวเลย เกณฑ์นี้เป็นข้อเท็จจริงด้านการจัดซื้อจัดจ้าง ไม่ใช่หมายเหตุเล็ก ๆ น้อย ๆ

ต้นทุนต่อการตัดสินใจไม่ใช่คำถามเดียวกันกับต้นทุนต่อโทเคน
สิ่งที่น่าลองทำตรงนี้คือการนำราคาสองราคามาหารกันแล้วประกาศหาผู้ชนะ แต่วิธีนั้นไม่รอดเมื่อต้องเผชิญกับสิ่งที่โมเดลทั้งสองทำจริง
Clef ราคา $0.24 ต่อโทเคนอินพุตหนึ่งล้านโทเคนบน Workers AI ของ Cloudflare เอาต์พุตของมันไม่ใช่ข้อความร้อยแก้ว ดังนั้นบรรทัดโทเคนเอาต์พุตตามปกติจึงไม่มีอยู่; คุณจ่ายสำหรับสถานะเพียงครั้งเดียว และได้รับการแจกแจงกลับมา สำหรับเลเยอร์การกำหนดเส้นทางที่ตัดสินใจเล็ก ๆ หลายล้านครั้งต่อวัน ตัวเลขนั้นคือต้นทุนการดำเนินงานทั้งหมด และเป็นตัวเลขที่คุณได้มาจากผู้ขายเท่านั้น ไม่ใช่จากบิลค่าไฟฟ้าของคุณเอง
LFM2.5 2.6B Base ไม่มีค่าใช้จ่ายต่อการเรียกใช้ และไม่สามารถตัดสินใจได้เอง หากต้องการทราบต้นทุนต่อการตัดสินใจจากมัน คุณต้องปรับแต่งมันกับงานของคุณก่อน ซึ่งหมายถึงการรวบรวมข้อมูล รันงานฝึก ประเมินผลลัพธ์ และจากนั้นจึงจะได้รู้ว่ามันกิน kVA และเวลาทางวิศวกรรมไปเท่าไร เศรษฐศาสตร์ที่น่าดึงดูดของเช็คพอยต์ขนาด 2.6B นั้นเป็นของจริง แต่เป็นผลปลายทางของงานที่ยังไม่ได้เกิดขึ้น และคนที่กำลังเปรียบเทียบราคาต่อโทเคนก็ข้ามมันไปเลย
การวางกรอบกันตามตรงก็คือ ทั้งสองอย่างนี้เป็นการซื้อที่แตกต่างกัน Clef เป็นคอมโพเนนต์ที่มีราคาตามรายการและมีบิลค่าโฮสติ้ง ส่วน Liquid checkpoint เป็นวัตถุดิบที่มีต้นทุนคือการรันฝึกโมเดลที่คุณจะต้องจ่ายไม่ทางใดก็ทางหนึ่ง — และผลตอบแทนของมันคือ หลังจากนั้นคุณจะเป็นเจ้าของอาร์ติแฟกต์นั้นโดยสมบูรณ์ ซึ่ง ณ จุดนั้น ต้นทุนส่วนเพิ่มของการตัดสินใจหนึ่งครั้งก็คือค่าไฟฟ้าจริง ๆ สำหรับงานที่ขอบเขตแคบ มีปริมาณสูง และมีเสถียรภาพ การแลกเปลี่ยนแบบนั้นมักถูกต้อง แต่สำหรับงานที่คุณยังไม่ได้ระบุรายละเอียด มันกลับกัน เพราะคุณไม่สามารถ fine-tune ไปสู่เป้าหมายที่คุณอธิบายไม่ได้
โมเดลฐานที่ยังไม่ได้ฝึกไม่ใช่โมเดลที่แย่กว่า แต่เป็นจุดเริ่มต้นที่แตกต่าง
เป็นเรื่องน่าล่อใจที่จะตีความว่าไม่มีตาราง benchmark ในเช็กพอยต์ Liquid ว่าเป็นจุดอ่อนที่ซ่อนอยู่ แต่ไม่ใช่ การให้คะแนนโมเดลฐานที่ผ่านการ pretrain บน benchmark ด้านการทำตามคำสั่งจะวัดการไม่มี fine-tuning ไม่ใช่คุณภาพของฐานราก ซึ่งเป็นเหตุผลว่าทำไม Liquid AI จึง benchmark LFM2.5-2.6B ที่ผ่านการ post-train และปล่อยให้โมเดลฐานไม่ได้รับการประเมิน ช่องว่างนี้ตรวจสอบได้จากฝั่งของคุณ และนั่นคือประเด็น: ดาวน์โหลด 5.4 GB รันการประเมินของคุณเองบนงานของคุณเอง และรู้คำตอบก่อนที่คุณจะตัดสินใจให้บริการสิ่งใด
ตารางของ Clef มีรูปแบบหลักฐานที่ตรงกันข้าม และมีปัญหาที่ตรงกันข้าม Cloudflare เผยแพร่แถวเกณฑ์มาตรฐานราว 40 กว่าแถว ชุดประเมินเวิร์กโฟลว์แบบเต็ม และการกระจายความหน่วง และทุกอย่างเหล่านั้นล้วนถูกสร้างโดย Cloudflare บน Decision Index ของ Cloudflare เอง โดยไม่มีบุคคลที่สามรายใดทำซ้ำผลใด ๆ ได้เลย คอลัมน์ Clef ให้ข้อมูลมากกว่าคอลัมน์ Liquid มาก และไม่มีตัวเลขใดในนั้นที่ถูกตรวจสอบโดยใครอื่น นั่นเป็นข้อกล่าวอ้างที่หนักแน่นกว่าช่องว่าง และอ่อนกว่าที่มันดูเหมือน
สิ่งที่คุณสามารถวัดได้ด้วยตัวเองก็แบ่งออกในลักษณะเดียวกัน ด้วยเช็กพอยต์ Liquid คุณสามารถวัดทุกอย่างได้ — มันมีขนาด 5.4 GB บนดิสก์ของคุณเอง ด้วย Clef เวท Apache-2.0 ก็เป็นของคุณเช่นกันที่จะดาวน์โหลดและรัน แต่การทำได้เท่ากับค่ามัธยฐาน 209 ms ของ Cloudflare ต้องใช้คลาสของ GPU ที่ Cloudflare ใช้ ดังนั้นในทางปฏิบัติ ทีมส่วนใหญ่จะวัดมันผ่านเอนด์พอยต์ที่โฮสต์ไว้ และสืบทอดความพร้อมใช้งานของผู้ให้บริการมาพร้อมกับความหน่วงของมัน
ตำแหน่งที่ชั้นการกำหนดเส้นทางลงตัว สำหรับแต่ละรายการ
ทั้ง Clef และ LFM2.5 รุ่นใด ๆ ไม่ได้เป็นเส้นทางบน OrcaRouter และบทความนี้ไม่ใช่การอ้างถึงความพร้อมให้ใช้งาน — แค็ตตาล็อกส่งคืน 404 สำหรับทั้งสองรายการ ดังนั้น Clef จึงมาจาก Cloudflare's Workers AI หรือ GPU ของคุณเอง และเช็กพอยต์ Liquid มาจากช่องทางการเผยแพร่ของตัวเอง
สิ่งที่เลเยอร์การกำหนดเส้นทางมีไว้เพื่อจริง ๆ ในที่นี้ คือรูปแบบที่ทั้งสองโมเดลสื่อเป็นนัย ตัวให้คะแนนขนาดเล็กที่มีขอบเขตจำกัดซึ่งตัดสินใจ และโมเดลทั่วไปขนาดใหญ่กว่าที่ลงมือทำตามการตัดสินใจ เป็นสถาปัตยกรรมสองโมเดลโดยโครงสร้าง — และแกนหลักของ Clef เองก็ทำให้ครึ่งหลังของสิ่งนั้นเป็นรูปธรรม เนื่องจากโมเดลที่ Cloudflare ฝึกต่อจาก คือ Qwen3.8 27B นั้นเป็น เส้นทางที่ระบุไว้ในราคา $0.33 ต่ออินพุตหนึ่งล้านโทเคน และ $2.40 ต่อเอาต์พุตหนึ่งล้านโทเคน บนบริบท 262,144 โทเคน ปลายทางเดียวที่อยู่ด้านหน้าโมเดลมากกว่า 200 ตัว หมายความว่าตัวตัดสินใจราคาถูกและตัวดำเนินการที่มีความสามารถอยู่หลังคีย์เดียวกัน ประกอบเป็นการเรียกครั้งเดียวผ่าน routing DSL แทนที่จะเชื่อมต่อกันด้วยมือ พร้อมระบบสลับสำรองอัตโนมัติ เพื่อให้ช่วงเวลาที่ผู้ให้บริการมีปัญหาชั่วคราวไม่ทำให้เส้นทางการตัดสินใจล่มไปด้วย หากในทางกลับกัน คุณโฮสต์เช็กพอยต์ Liquid ด้วยตัวเองและเปรียบเทียบ fine-tune ของคุณกับโมเดลที่มันต้องเอาชนะ ปลายทางเดียวกันนี้คือสิ่งที่ทำให้การเปรียบเทียบนั้นกลายเป็นการเปลี่ยนแปลงการตั้งค่าแทนที่จะเป็นรอบการจัดซื้อจัดจ้าง
Jev 1.13 ของ TypeSafe น่าจะเอ่ยถึงเป็นพิเศษสำหรับกรณี self-hosting โดยเฉพาะ: มันคือโมเดลการตัดสินใจที่ Cloudflare ใช้เป็นเกณฑ์เปรียบเทียบ และจงใจใช้รูปแบบคำขอPOST /v1/systemoneแบบเดียวกับ Clef, มันเป็นเส้นทางที่ประกาศไว้ในราคา $0.042 ต่อโทเคนอินพุตหนึ่งล้านโทเคน บนบริบทขนาด 65,536 โทเคนและเป็นวิธีที่ใช้ความพยายามต่ำในการหาคำตอบว่าโมเดลการตัดสินใจแบบจำกัดขอบเขตช่วยไปป์ไลน์ของคุณได้หรือไม่ ก่อนที่คุณจะทุ่มการรันเทรนหนึ่งครั้งให้กับ substrate ที่อาจไม่จำเป็นต้องมีอยู่เลย

อันไหน เพื่ออะไร
เลือกใช้ Liquid checkpoint เมื่องานนั้นแคบ มีปริมาณสูง มีการระบุรายละเอียดดีพอที่จะเขียนข้อมูลฝึกสำหรับมันได้ และถูกจำกัดด้วยหนึ่งในสองข้อจำกัดตายตัวที่ routed API แก้ไม่ได้: ข้อมูลออกจากโครงสร้างพื้นฐานของคุณไม่ได้ หรือเครื่องที่มันต้องรันนั้นคือเครื่องที่อยู่บนโต๊ะของคุณ เกณฑ์รายได้ของ LFM 1.0 คือสิ่งแรกที่ต้องตรวจสอบ เพราะมันตัดสินว่าคุณมีสิทธิ์ใช้สัญญาอนุญาตนั้นหรือไม่ตั้งแต่แรก
เลือกใช้ Clef เมื่อการตัดสินใจนั้นแจกแจงได้อยู่แล้ว สถานะมีขนาดไม่เกิน 64K คำตอบต้องเป็นความน่าจะเป็นที่ปรับเทียบแล้ว ไม่ใช่ประโยค และ 209 ms ใน hot path คือคุณสมบัติที่คุณกำลังซื้อ สคีมาคงที่ของมันคือจุดเด่น — รูปแบบเอาต์พุตที่ตรวจสอบได้ ทำซ้ำได้ และไม่ต้องใช้ parser — และขนาด 55 GB ของมันคือราคาของแบ็กโบนที่ทำให้แม่นยำตั้งแต่ครั้งแรก แทนที่จะแม่นยำหลังจากการรันเทรน
สิ่งที่คุณไม่ควรทำคือเลือกจากจำนวนพารามิเตอร์ โมเดล 2.69B ที่ต้องเทรนก่อนจึงจะตอบได้ ไม่ใช่เวอร์ชันที่เล็กกว่าของโมเดล 27B ที่ตอบได้อยู่แล้ว และตัวเลขสองตัวในชื่อเรื่อง — 55 GB และ 5.4 GB — อธิบายงบประมาณที่แตกต่างกันสองแบบ ไม่ใช่สองจุดบนสเกลเดียวกัน

คำถามที่ยังค้างอยู่ และมันเป็นคำถามเดียวกันสำหรับทั้งสองฝ่าย
ไม่มีผู้จำหน่ายรายใดเผยแพร่หลักฐานที่ทนทานต่อการตรวจสอบอย่างเป็นอิสระได้ การรัน Decision Index ของ Cloudflare นั้นดำเนินการเองและไม่มีการทำซ้ำ ส่วนตัวเลข throughput ของ Liquid AI เป็นการวัดของผู้จำหน่ายเองบนฮาร์ดแวร์ที่ตนเลือก LFM2.5 2.6B Base ไม่มี benchmark ใดเลยโดยการออกแบบ ขณะที่ตาราง Clef มีอยู่มากมายโดยเจตนา
สำหรับเช็กพอยต์ Liquid หลักฐานที่ขาดหายไปนั้นแก้ไขได้ด้วยต้นทุนต่ำและอยู่ในมือคุณทั้งหมด — ไฟล์มีขนาดเล็กพอที่จะประเมินบนแล็ปท็อปได้ในบ่ายเดียว ส่วน Clef ไม่เป็นเช่นนั้น: การทำซ้ำค่ามัธยฐาน 209 ms ต้องใช้ฮาร์ดแวร์ที่ Cloudflare ใช้ และสถานะที่ไม่มีใครนอก Cloudflare เคยประกอบขึ้นมา ความไม่สมมาตรนั้น มากกว่าสิ่งใดในข้อกำหนดของทั้งสองฉบับ คือสิ่งที่ควรกำหนดว่าคุณจะวางแผนโดยยึดตัวใดในสองตัวนี้ในเดือนนี้
