การ์ดชื่อเรื่องที่สร้างขึ้น มีข้อความว่า 'Clef vs LFM2.5 2.6B Base' พร้อมคำบรรยายใต้ภาพว่า '55 GB บน H200 เทียบกับ 5.4 GB บนแล็ปท็อป' และมีชิปที่ระบุว่า 'โมเดลตัดสินใจ 27B' กับ 'ฐานที่ผ่านการฝึกมาแล้ว 2.69B' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Engineering & Research

Clef เทียบกับ LFM2.5 2.6B Base: 55 GB บน H200 หรือ 5.4 GB บนแล็ปท็อป

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

นี่คือการเปรียบเทียบที่ฮาร์ดแวร์ตัดสินข้อโต้แย้งก่อนที่โมเดลจะตัดสิน Cloudflare/clefเป็นโมเดลตัดสินใจแบบมัลติโมดัลที่มีพารามิเตอร์ 2.7 หมื่นล้านตัว ผ่านการโพสต์เทรนจาก Qwen3.8-27B โดยรีโพซิทอรีของมันมีขนาดเกิน 55 GB เล็กน้อย กระจายอยู่บนแชร์ด์ backbone สิบสองชิ้นบวกกับ joint schema head ขนาดเล็ก LiquidAI/LFM2.5-2.6B-Baseเป็นเช็คพอยต์แบบข้อความล้วนที่มีพารามิเตอร์ 2.69 พันล้านตัว ซึ่งน้ำหนักของมันเป็นไฟล์เดียวขนาด 5.4 GB เผยแพร่โดย Liquid AI เมื่อวันที่ 1 สิงหาคม 2026 ภายใต้ LFM Open License ความหน่วงที่ Cloudflare เปิดเผยสำหรับ Clef เอง — 209.3 ms ที่ค่ามัธยฐาน, 238.6 ms ที่ p95 — วัดบน H200 เครื่องเดียว การติดตั้งใช้งานที่ Liquid AI ตั้งใจไว้สำหรับตระกูล LFM2.5 ของตนคือแล็ปท็อป โทรศัพท์ หรือเครื่องพกพา Ryzen ผู้ขายทั้งสองรายอธิบายโมเดลของตนว่าเล็ก เร็ว และมีประสิทธิภาพ และทั้งคู่ก็พูดความจริงเกี่ยวกับเครื่องที่ต่างกัน

มีช่องว่างที่สองอยู่เบื้องหลังช่องแรก และเป็นช่องว่างที่เปลี่ยนแผนได้จริง ๆ ทั้ง Clef และ LFM2.5 2.6B Base ไม่ได้ตอบคำถามแบบพร้อมใช้ทันทีในวิธีที่คุณน่าจะคาดหวัง Clef มาพร้อมการฝึกเต็มรูปแบบสำหรับงานที่มันไม่สามารถเบี่ยงเบนไปจากนั้นได้: มันตอบคำถามที่พิมพ์ และจะไม่ทำอย่างอื่น ส่วนเช็กพอยต์ของ Liquid มาพร้อมโดยไม่ได้รับการฝึกสำหรับสิ่งใดเลย — มันเป็นโมเดลฐาน จงใจไม่มีการปรับแต่งตามคำสั่ง และการ์ดของ Liquid AI เองระบุว่าแนะนำให้ใช้เฉพาะสำหรับการทำไฟน์ทูนอย่างหนักเท่านั้น ดังนั้นคำถามจริง ๆ ไม่ใช่ว่าตัวไหนรันถูกกว่ากัน แต่เป็นว่าคุณกำลังซื้อส่วนประกอบสำเร็จรูปหรือวัสดุตั้งต้น และคำตอบก็แตกต่างกันสำหรับแต่ละตัว

แต่ละอันทำงานที่ไหน และทำไมนั่นจึงเป็นการเปรียบเทียบทั้งหมด

การออกแบบการนำไปติดตั้งใช้งานไม่ใช่เรื่องรองสำหรับสองโมเดลนี้ สำหรับโมเดลที่ใช้ตัดสินใจ มันคือสถาปัตยกรรม เพราะการ forward pass 209 ms กับเรื่องเล่า “รันบนเครื่องที่อยู่ตรงหน้าคุณ” เป็นข้อกล่าวอ้างเดียวกันที่ถูกเล่าจากคนละปลาย

• พารามิเตอร์ — 27B สำหรับ Clef โดยยังคงตัวเข้ารหัสภาพ Qwen3.8-27B ไว้; 2.69B แบบข้อความล้วนสำหรับ LFM2.5 2.6B Base

• ดิสก์ — รีโพซิทอรีขนาด 55 GB สำหรับ Clef; ไฟล์ safetensors ขนาด 5.4 GB หนึ่งไฟล์สำหรับเช็คพอยต์ Liquid โดยมีบิลด์ GGUF, ONNX และ MLX แบบควอนไทซ์เผยแพร่ไว้เคียงข้างกัน

• ฮาร์ดแวร์ — Cloudflare ทดสอบ Clef ด้วย torch 2.11 และ transformers 5.10.2 บน H200 ตัวเดียว และค่าความหน่วงของมันมาจากการรันครั้งนั้น โมเดลพี่น้องที่ผ่านการฝึกหลังการฝึก (post-trained) ของเช็กพอยต์นี้จาก Liquid AI ทำงานที่ 220 โทเคนต่อวินาทีบน Apple M5 Max และ 113 tok/s บน CPU AMD Ryzen โดยใช้หน่วยความจำต่ำกว่า 2.5 GB และผู้ขายระบุว่าสามารถทำได้ 30 tok/s บนโทรศัพท์

• คอนเท็กซ์ — 65,536 โทเคนสำหรับ Clef ตามหน้าของโมเดล Workers AI และโพสต์เปิดตัว; 131,072 โทเคนสำหรับ LFM2.5 2.6B Base

• อินพุต — Clef อ่านข้อความ JSON รูปภาพ และเฟรมวิดีโอ แล้วให้คะแนนร่วมกัน ส่วน Liquid checkpoint รองรับเฉพาะข้อความ

• สัญญาอนุญาต — Apache-2.0 สำหรับ Clef สัญญาอนุญาต LFM Open License v1.0 สำหรับ LFM2.5 ซึ่งเป็นแบบเปิดให้เข้าถึงซอร์สโค้ด ไม่ใช่โอเพนซอร์สตามนิยามของ OSI: การใช้เชิงพาณิชย์มีเงื่อนไขว่าองค์กรของคุณต้องมีรายได้ต่อปีต่ำกว่า 10 ล้านดอลลาร์สหรัฐ และหากเกินเส้นนั้นขึ้นไป สัญญาอนุญาตก็ไม่ได้ให้สิทธิ์ดังกล่าวเลย เกณฑ์นี้เป็นข้อเท็จจริงด้านการจัดซื้อจัดจ้าง ไม่ใช่หมายเหตุเล็ก ๆ น้อย ๆ

A two-column comparison scoreboard titled 'Clef vs LFM2.5 2.6B Base — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; On disk: 55 GB repository; Context: 65,536 tokens; Output: probability per option, no text; Hardware: H200 class, 209.3 ms median; Licence: Apache 2.0. The right column 'LFM2.5 2.6B Base' reads: Parameters: 2.69B text-only; On disk: 5.4 GB single file; Context: 131,072 tokens; Output: untuned text continuation; Hardware: laptop, 220 tok/s on M5 Max; Licence: LFM 1.0, $10M revenue threshold. A footer reads 'Clef figures per Cloudflare; LFM figures per Liquid AI's cards. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

ต้นทุนต่อการตัดสินใจไม่ใช่คำถามเดียวกันกับต้นทุนต่อโทเคน

สิ่งที่น่าลองทำตรงนี้คือการนำราคาสองราคามาหารกันแล้วประกาศหาผู้ชนะ แต่วิธีนั้นไม่รอดเมื่อต้องเผชิญกับสิ่งที่โมเดลทั้งสองทำจริง

Clef ราคา $0.24 ต่อโทเคนอินพุตหนึ่งล้านโทเคนบน Workers AI ของ Cloudflare เอาต์พุตของมันไม่ใช่ข้อความร้อยแก้ว ดังนั้นบรรทัดโทเคนเอาต์พุตตามปกติจึงไม่มีอยู่; คุณจ่ายสำหรับสถานะเพียงครั้งเดียว และได้รับการแจกแจงกลับมา สำหรับเลเยอร์การกำหนดเส้นทางที่ตัดสินใจเล็ก ๆ หลายล้านครั้งต่อวัน ตัวเลขนั้นคือต้นทุนการดำเนินงานทั้งหมด และเป็นตัวเลขที่คุณได้มาจากผู้ขายเท่านั้น ไม่ใช่จากบิลค่าไฟฟ้าของคุณเอง

LFM2.5 2.6B Base ไม่มีค่าใช้จ่ายต่อการเรียกใช้ และไม่สามารถตัดสินใจได้เอง หากต้องการทราบต้นทุนต่อการตัดสินใจจากมัน คุณต้องปรับแต่งมันกับงานของคุณก่อน ซึ่งหมายถึงการรวบรวมข้อมูล รันงานฝึก ประเมินผลลัพธ์ และจากนั้นจึงจะได้รู้ว่ามันกิน kVA และเวลาทางวิศวกรรมไปเท่าไร เศรษฐศาสตร์ที่น่าดึงดูดของเช็คพอยต์ขนาด 2.6B นั้นเป็นของจริง แต่เป็นผลปลายทางของงานที่ยังไม่ได้เกิดขึ้น และคนที่กำลังเปรียบเทียบราคาต่อโทเคนก็ข้ามมันไปเลย

การวางกรอบกันตามตรงก็คือ ทั้งสองอย่างนี้เป็นการซื้อที่แตกต่างกัน Clef เป็นคอมโพเนนต์ที่มีราคาตามรายการและมีบิลค่าโฮสติ้ง ส่วน Liquid checkpoint เป็นวัตถุดิบที่มีต้นทุนคือการรันฝึกโมเดลที่คุณจะต้องจ่ายไม่ทางใดก็ทางหนึ่ง — และผลตอบแทนของมันคือ หลังจากนั้นคุณจะเป็นเจ้าของอาร์ติแฟกต์นั้นโดยสมบูรณ์ ซึ่ง ณ จุดนั้น ต้นทุนส่วนเพิ่มของการตัดสินใจหนึ่งครั้งก็คือค่าไฟฟ้าจริง ๆ สำหรับงานที่ขอบเขตแคบ มีปริมาณสูง และมีเสถียรภาพ การแลกเปลี่ยนแบบนั้นมักถูกต้อง แต่สำหรับงานที่คุณยังไม่ได้ระบุรายละเอียด มันกลับกัน เพราะคุณไม่สามารถ fine-tune ไปสู่เป้าหมายที่คุณอธิบายไม่ได้

โมเดลฐานที่ยังไม่ได้ฝึกไม่ใช่โมเดลที่แย่กว่า แต่เป็นจุดเริ่มต้นที่แตกต่าง

เป็นเรื่องน่าล่อใจที่จะตีความว่าไม่มีตาราง benchmark ในเช็กพอยต์ Liquid ว่าเป็นจุดอ่อนที่ซ่อนอยู่ แต่ไม่ใช่ การให้คะแนนโมเดลฐานที่ผ่านการ pretrain บน benchmark ด้านการทำตามคำสั่งจะวัดการไม่มี fine-tuning ไม่ใช่คุณภาพของฐานราก ซึ่งเป็นเหตุผลว่าทำไม Liquid AI จึง benchmark LFM2.5-2.6B ที่ผ่านการ post-train และปล่อยให้โมเดลฐานไม่ได้รับการประเมิน ช่องว่างนี้ตรวจสอบได้จากฝั่งของคุณ และนั่นคือประเด็น: ดาวน์โหลด 5.4 GB รันการประเมินของคุณเองบนงานของคุณเอง และรู้คำตอบก่อนที่คุณจะตัดสินใจให้บริการสิ่งใด

ตารางของ Clef มีรูปแบบหลักฐานที่ตรงกันข้าม และมีปัญหาที่ตรงกันข้าม Cloudflare เผยแพร่แถวเกณฑ์มาตรฐานราว 40 กว่าแถว ชุดประเมินเวิร์กโฟลว์แบบเต็ม และการกระจายความหน่วง และทุกอย่างเหล่านั้นล้วนถูกสร้างโดย Cloudflare บน Decision Index ของ Cloudflare เอง โดยไม่มีบุคคลที่สามรายใดทำซ้ำผลใด ๆ ได้เลย คอลัมน์ Clef ให้ข้อมูลมากกว่าคอลัมน์ Liquid มาก และไม่มีตัวเลขใดในนั้นที่ถูกตรวจสอบโดยใครอื่น นั่นเป็นข้อกล่าวอ้างที่หนักแน่นกว่าช่องว่าง และอ่อนกว่าที่มันดูเหมือน

สิ่งที่คุณสามารถวัดได้ด้วยตัวเองก็แบ่งออกในลักษณะเดียวกัน ด้วยเช็กพอยต์ Liquid คุณสามารถวัดทุกอย่างได้ — มันมีขนาด 5.4 GB บนดิสก์ของคุณเอง ด้วย Clef เวท Apache-2.0 ก็เป็นของคุณเช่นกันที่จะดาวน์โหลดและรัน แต่การทำได้เท่ากับค่ามัธยฐาน 209 ms ของ Cloudflare ต้องใช้คลาสของ GPU ที่ Cloudflare ใช้ ดังนั้นในทางปฏิบัติ ทีมส่วนใหญ่จะวัดมันผ่านเอนด์พอยต์ที่โฮสต์ไว้ และสืบทอดความพร้อมใช้งานของผู้ให้บริการมาพร้อมกับความหน่วงของมัน

ตำแหน่งที่ชั้นการกำหนดเส้นทางลงตัว สำหรับแต่ละรายการ

ทั้ง Clef และ LFM2.5 รุ่นใด ๆ ไม่ได้เป็นเส้นทางบน OrcaRouter และบทความนี้ไม่ใช่การอ้างถึงความพร้อมให้ใช้งาน — แค็ตตาล็อกส่งคืน 404 สำหรับทั้งสองรายการ ดังนั้น Clef จึงมาจาก Cloudflare's Workers AI หรือ GPU ของคุณเอง และเช็กพอยต์ Liquid มาจากช่องทางการเผยแพร่ของตัวเอง

สิ่งที่เลเยอร์การกำหนดเส้นทางมีไว้เพื่อจริง ๆ ในที่นี้ คือรูปแบบที่ทั้งสองโมเดลสื่อเป็นนัย ตัวให้คะแนนขนาดเล็กที่มีขอบเขตจำกัดซึ่งตัดสินใจ และโมเดลทั่วไปขนาดใหญ่กว่าที่ลงมือทำตามการตัดสินใจ เป็นสถาปัตยกรรมสองโมเดลโดยโครงสร้าง — และแกนหลักของ Clef เองก็ทำให้ครึ่งหลังของสิ่งนั้นเป็นรูปธรรม เนื่องจากโมเดลที่ Cloudflare ฝึกต่อจาก คือ Qwen3.8 27B นั้นเป็น เส้นทางที่ระบุไว้ในราคา $0.33 ต่ออินพุตหนึ่งล้านโทเคน และ $2.40 ต่อเอาต์พุตหนึ่งล้านโทเคน บนบริบท 262,144 โทเคน ปลายทางเดียวที่อยู่ด้านหน้าโมเดลมากกว่า 200 ตัว หมายความว่าตัวตัดสินใจราคาถูกและตัวดำเนินการที่มีความสามารถอยู่หลังคีย์เดียวกัน ประกอบเป็นการเรียกครั้งเดียวผ่าน routing DSL แทนที่จะเชื่อมต่อกันด้วยมือ พร้อมระบบสลับสำรองอัตโนมัติ เพื่อให้ช่วงเวลาที่ผู้ให้บริการมีปัญหาชั่วคราวไม่ทำให้เส้นทางการตัดสินใจล่มไปด้วย หากในทางกลับกัน คุณโฮสต์เช็กพอยต์ Liquid ด้วยตัวเองและเปรียบเทียบ fine-tune ของคุณกับโมเดลที่มันต้องเอาชนะ ปลายทางเดียวกันนี้คือสิ่งที่ทำให้การเปรียบเทียบนั้นกลายเป็นการเปลี่ยนแปลงการตั้งค่าแทนที่จะเป็นรอบการจัดซื้อจัดจ้าง

Jev 1.13 ของ TypeSafe น่าจะเอ่ยถึงเป็นพิเศษสำหรับกรณี self-hosting โดยเฉพาะ: มันคือโมเดลการตัดสินใจที่ Cloudflare ใช้เป็นเกณฑ์เปรียบเทียบ และจงใจใช้รูปแบบคำขอPOST /v1/systemoneแบบเดียวกับ Clef, มันเป็นเส้นทางที่ประกาศไว้ในราคา $0.042 ต่อโทเคนอินพุตหนึ่งล้านโทเคน บนบริบทขนาด 65,536 โทเคนและเป็นวิธีที่ใช้ความพยายามต่ำในการหาคำตอบว่าโมเดลการตัดสินใจแบบจำกัดขอบเขตช่วยไปป์ไลน์ของคุณได้หรือไม่ ก่อนที่คุณจะทุ่มการรันเทรนหนึ่งครั้งให้กับ substrate ที่อาจไม่จำเป็นต้องมีอยู่เลย

A headless capture of the OrcaRouter model page for qwen/qwen3.8-27b, showing the Qwen breadcrumb, the Qwen3.8 27B title with a 262K context marker, the text, image and video input modalities, and the site's Code samples, Pricing, Performance, Public benchmarks and FAQ navigation tabs.

อันไหน เพื่ออะไร

เลือกใช้ Liquid checkpoint เมื่องานนั้นแคบ มีปริมาณสูง มีการระบุรายละเอียดดีพอที่จะเขียนข้อมูลฝึกสำหรับมันได้ และถูกจำกัดด้วยหนึ่งในสองข้อจำกัดตายตัวที่ routed API แก้ไม่ได้: ข้อมูลออกจากโครงสร้างพื้นฐานของคุณไม่ได้ หรือเครื่องที่มันต้องรันนั้นคือเครื่องที่อยู่บนโต๊ะของคุณ เกณฑ์รายได้ของ LFM 1.0 คือสิ่งแรกที่ต้องตรวจสอบ เพราะมันตัดสินว่าคุณมีสิทธิ์ใช้สัญญาอนุญาตนั้นหรือไม่ตั้งแต่แรก

เลือกใช้ Clef เมื่อการตัดสินใจนั้นแจกแจงได้อยู่แล้ว สถานะมีขนาดไม่เกิน 64K คำตอบต้องเป็นความน่าจะเป็นที่ปรับเทียบแล้ว ไม่ใช่ประโยค และ 209 ms ใน hot path คือคุณสมบัติที่คุณกำลังซื้อ สคีมาคงที่ของมันคือจุดเด่น — รูปแบบเอาต์พุตที่ตรวจสอบได้ ทำซ้ำได้ และไม่ต้องใช้ parser — และขนาด 55 GB ของมันคือราคาของแบ็กโบนที่ทำให้แม่นยำตั้งแต่ครั้งแรก แทนที่จะแม่นยำหลังจากการรันเทรน

สิ่งที่คุณไม่ควรทำคือเลือกจากจำนวนพารามิเตอร์ โมเดล 2.69B ที่ต้องเทรนก่อนจึงจะตอบได้ ไม่ใช่เวอร์ชันที่เล็กกว่าของโมเดล 27B ที่ตอบได้อยู่แล้ว และตัวเลขสองตัวในชื่อเรื่อง — 55 GB และ 5.4 GB — อธิบายงบประมาณที่แตกต่างกันสองแบบ ไม่ใช่สองจุดบนสเกลเดียวกัน

A headless capture of the LiquidAI/LFM2.5-2.6B-Base model card on Hugging Face, showing the model title, the TextGeneration and Transformers and Safetensors tags, a 16-languages marker, the Liquid AI organisation, and the opening line describing the LFM2.5 family as hybrid models designed for on-device deployment.

คำถามที่ยังค้างอยู่ และมันเป็นคำถามเดียวกันสำหรับทั้งสองฝ่าย

ไม่มีผู้จำหน่ายรายใดเผยแพร่หลักฐานที่ทนทานต่อการตรวจสอบอย่างเป็นอิสระได้ การรัน Decision Index ของ Cloudflare นั้นดำเนินการเองและไม่มีการทำซ้ำ ส่วนตัวเลข throughput ของ Liquid AI เป็นการวัดของผู้จำหน่ายเองบนฮาร์ดแวร์ที่ตนเลือก LFM2.5 2.6B Base ไม่มี benchmark ใดเลยโดยการออกแบบ ขณะที่ตาราง Clef มีอยู่มากมายโดยเจตนา

สำหรับเช็กพอยต์ Liquid หลักฐานที่ขาดหายไปนั้นแก้ไขได้ด้วยต้นทุนต่ำและอยู่ในมือคุณทั้งหมด — ไฟล์มีขนาดเล็กพอที่จะประเมินบนแล็ปท็อปได้ในบ่ายเดียว ส่วน Clef ไม่เป็นเช่นนั้น: การทำซ้ำค่ามัธยฐาน 209 ms ต้องใช้ฮาร์ดแวร์ที่ Cloudflare ใช้ และสถานะที่ไม่มีใครนอก Cloudflare เคยประกอบขึ้นมา ความไม่สมมาตรนั้น มากกว่าสิ่งใดในข้อกำหนดของทั้งสองฉบับ คือสิ่งที่ควรกำหนดว่าคุณจะวางแผนโดยยึดตัวใดในสองตัวนี้ในเดือนนี้

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube