
Liquid AI d1-3B กับ LFM2.5-2.6B-Base: โมเดลการตัดสินใจและบรรพบุรุษของตัวมันเอง
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
นี่ไม่ใช่การปะทะกันระหว่างคู่แข่งสองราย Liquid AI d1-3B โมเดลสำหรับการตัดสินใจแบบเปิดน้ำหนักที่ Liquid AI เผยแพร่เมื่อวันที่ 7 ตุลาคม 2026 ถูกสร้างขึ้นบนฐานที่ผู้พัฒนาสร้างโดยการเฉลี่ยน้ำหนักของ LFM2.5-2.6B กับแกนข้อความของ LFM2.5-VL-3B LFM2.5-2.6B-Base คือบรรพบุรุษรายแรกนั้น — เช็กพอยต์ดิบที่ผ่านการฝึกมาก่อน ซึ่ง Liquid อัปโหลดเมื่อวันที่ 1 สิงหาคม 2026 มี 2.69B พารามิเตอร์, 34 ล้านล้านโทเคนสำหรับการฝึก, คอนเท็กซ์ขนาด 131,072 โทเคน, ไม่มีการปรับตามคำสั่ง และไม่มีเทมเพลตแชต ดังนั้นการวางกรอบการเปรียบเทียบนี้อย่างซื่อตรงคือลูกรุ่นหลังกับบรรพบุรุษ: โมเดลที่ถูกฝึกหลังการฝึกให้ทำงานเฉพาะเจาะจงมาก ยืนอยู่ข้างวัสดุฐานที่ยังไม่ถูกขึ้นรูป ซึ่งตัวมันเองถูกขึ้นรูปมาจากวัสดุนั้น หนึ่งในนั้นตอบคำถามคืนนี้ อีกตัวคือจุดเริ่มต้นของคุณ หากคำถามที่คุณต้องการให้ตอบยังไม่มีใครเคยถามมาก่อน
แต่ละอย่างจริงๆ แล้วคืออะไร
โมเดลทั้งสองนี้ให้ความรู้สึกเหมือนเป็นเอกสารจากต่างขั้นตอนของสายการผลิต ความแตกต่างจึงไม่ใช่เรื่องเชิงสไตล์
Liquid AI d1-3B มีพารามิเตอร์ 3.12B, ตัวเข้ารหัสภาพ SigLIP2 NaFlex ขนาด 400M, หน้าต่างบริบท 32,768 โทเค็น, คำศัพท์ 128,000 โทเค็น และภาษาที่มีเอกสารรองรับ 16 ภาษา เป็นโมเดลตัดสินใจ: คุณให้สถานะและคำถามที่ตั้งชื่อไว้ แล้วมันจะคืนค่าความน่าจะเป็นใช่/ไม่ใช่, ป้ายกำกับที่เลือกพร้อมความมั่นใจและการแจกแจงตัวเลือกทั้งหมด, หรือคะแนนแบบเรียงลำดับ — ในการส่งผ่านไปข้างหน้าครั้งเดียว โดยไม่มีการสร้างโทเค็นเอาต์พุต มันมาพร้อมกับ system_one ซึ่งเป็นการเรียกสำหรับหนึ่งสถานะกับหลายคำถาม, ตัวแปรแบบแบตช์ที่รวมคำขอจำนวนมากโดยไม่ต้องมี padding, และแบบดิบ probabilities สำหรับการเข้าถึงการแจกแจงพื้นฐาน มันไม่ใช่โมเดลแชทและไม่เขียนข้อความ และการ์ดระบุไว้เช่นนั้น
LFM2.5-2.6B-Baseมีพารามิเตอร์ 2.69B ใน 30 เลเยอร์ — บล็อกคอนโวลูชันสั้นแบบดับเบิลเกต 22 บล็อก และบล็อกแอตเทนชันแบบกลุ่มคิวรี 8 บล็อก — ฝึกด้วยโทเคน 34 ล้านล้านโทเคน และขยายเป็นบริบท 131,072 โทเคนระหว่างการฝึกช่วงกลาง โดยใช้คลังคำศัพท์ 128,000 โทเคนชุดเดียวกันและภาษา 16 ภาษาเดียวกัน เป็นเช็กพอยต์ข้อความล้วนที่ผ่านการฝึกมาก่อน โดยไม่มีการปรับจูนตามคำสั่ง ไม่มีผลทดสอบมาตรฐานบนการ์ดของมัน และมีคำแนะนำที่อ่านแล้วเหมือนคำเตือน: ใช้มันเฉพาะกับงานที่ต้องอาศัยการปรับจูนละเอียดอย่างหนักเท่านั้น มันเติมข้อความให้สมบูรณ์ มันไม่ปฏิบัติตามคำสั่ง
ทั้งคู่เป็นดาวน์โหลดแบบไม่ต้องผ่านการลงทะเบียน ภายใต้สัญญาอนุญาตเปิดของ Liquid เอง ทั้งคู่เน้นข้อความเป็นหลัก ทั้งสองรายการไม่มีอยู่ในแคตตาล็อกของเรา และไม่มีข้อความใดในที่นี้เป็นการอ้างถึงความพร้อมให้บริการสำหรับรายการใดรายการหนึ่ง

ส่วนที่น่าสนใจคือเชื้อสาย
Liquid ไม่ได้ fine-tune โมเดลใหม่เพื่อทำการเปิดตัว d1 แต่พวกเขาเฉลี่ยเช็กพอยต์สองตัว — LFM2.5-2.6B และ text tower ของ LFM2.5-VL-3B — เพื่อให้ได้จุดเริ่มต้นที่ดีขึ้น จากนั้น fine-tune หลายรอบด้วย seed สุ่มและส่วนผสมข้อมูลที่แตกต่างกัน แล้ว merge กลับเข้าด้วยกัน คำอธิบายของผู้ขายเกี่ยวกับสิ่งที่ทำให้ผลลัพธ์ดีขึ้นนั้นไม่มีเทคนิคแปลกใหม่เลยอย่างเห็นได้ชัด: การฝึกบนอินพุตยาว การสลับลำดับที่ตัวเลือกคำตอบปรากฏ และการเอาทางลัดออกจากข้อมูลฝึก ให้ผลมากกว่าวิธีขั้นสูงใด ๆ ที่พวกเขาลอง
รายละเอียดเรื่องการกำจัดทางลัดนี้น่าจะหยุดคิดสักหน่อย เพราะมันระบุถึงความล้มเหลวที่หมวดหมู่นี้ตั้งขึ้นมาเพื่อหลีกเลี่ยง โมเดลที่ถูกฝึกให้ตอบคำถามแบบปรนัยจะเรียนรู้อย่างสบายใจว่าตัวเลือก B มักเป็นคำตอบที่ถูก หรือตัวเลือกที่ยาวที่สุดชนะ การสุ่มสลับลำดับตัวเลือกในระหว่างการฝึกคือสิ่งที่หยุดเรื่องนั้นไว้ โมเดลตัดสินใจที่เรียนรู้ position prior แทนที่จะอ่านสภาวะนั้นแย่กว่าไร้ประโยชน์ — มันผิดอย่างมั่นใจในวงกว้าง — และมันคือสิ่งเฉพาะที่แยกโมเดลตัดสินใจจริงออกจากตัวจำแนกประเภทที่มีพรอมป์ต์
ยังมีภาวะถดถอยอีกอย่างที่ควรเอ่ยถึงให้ตรง ๆ เพราะผู้ขายไม่ยอมพูดถึง: เช็กพอยต์ฐานมีหน้าต่างบริบท 131,072 โทเค็น และ Liquid AI d1-3B มี 32,768 การทำโพสต์เทรนให้เป็นโมเดลตัดสินใจทำให้ต้องสูญเสียบริบทที่ใช้งานได้ไปสามในสี่ ถ้าคุณคิดว่าโมเดลรุ่นลูกหลานจะเหนือกว่ารุ่นบรรพบุรุษอย่างเด็ดขาดในทุกแกน มันไม่ได้เป็นเช่นนั้น และการตัดสินใจกับเอกสารยาวคือแกนที่เช็กพอยต์รุ่นเก่ามีพื้นที่มากกว่า — ในทางทฤษฎี ถึงแม้ว่ามันจะไม่มีเฮดตัดสินใจให้ใช้กับพื้นที่นั้นก็ตาม
กระดานคะแนน พร้อมด้วยความไม่สมมาตรที่แนบมาด้วย
การนำสองสิ่งนี้มาเปรียบเทียบบนเบนช์มาร์กเป็นความผิดพลาดเชิงหมวดหมู่ แต่เป็นความผิดพลาดเชิงหมวดหมู่ที่มีรูปร่างให้ข้อมูลได้ ดังนั้นนี่คือมันพร้อมข้อควรระวังที่กำกับไว้แล้ว ทุกตัวเลขของ d1-3B เป็นของ Liquid เอง ซึ่งผู้ขายเป็นผู้ให้คะแนนด้วยตัวให้คะแนนทางการ แทนที่จะส่งเข้าลีดเดอร์บอร์ดสาธารณะ และไม่มีบุคคลที่สามรายใดทำซ้ำได้ ทุกตัวเลขของ LFM2.5-2.6B-Base หายไป เพราะโมเดลฐานไม่มีอะไรให้วัด
• Decision Index 0.2.1 — Liquid AI d1-3B 48.57 เป็นอันดับหนึ่งในบรรดาทุกอย่างที่ต่ำกว่า 10B ในตารางของผู้ขาย และนำหน้าโมเดลตัดสินใจที่มีขนาดใหญ่กว่ามันถึงสิบสองเท่า LFM2.5-2.6B-Base — ไม่ถูกให้คะแนน และไม่สามารถให้คะแนนได้หากไม่มี decision head
• เกณฑ์มาตรฐานด้านข้อความ — Liquid AI d1-3B เฉลี่ย 82.9 จากเกณฑ์มาตรฐานสาธารณะเจ็ดรายการ ซึ่งครอบคลุมความเข้าใจ ความเป็นพิษ เจตนา การถามตอบทางการแพทย์ และความเข้าใจข้ามภาษา ส่วน LFM2.5-2.6B-Base ไม่เผยแพร่ตารางเกณฑ์มาตรฐานใด ๆ เลย
• วิชัน — Liquid AI d1-3B มีค่าเฉลี่ย 74.1 จากแบบทดสอบภาพสิบเอ็ดรายการที่ตีความเป็นการตัดสินใจ; การลบภาพออกทำให้คำถามเดียวกันลดลงเหลือ 45.1 LFM2.5-2.6B-Base เป็นข้อความล้วน โดยไม่มีเสาวิชัน
• พารามิเตอร์ — 3.12B เทียบกับ 2.69B โมเดลตัดสินใจเป็นโมเดลที่ใหญ่กว่าของทั้งสอง ซึ่งตรงข้ามกับเรื่องเล่าหลังการฝึกโดยทั่วไป
• บริบท — 32,768 โทเค็น เทียบกับ 131,072 โทเค็น บรรพบุรุษชนะแถวนี้ และเป็นแถวเดียวที่มันชนะ
• เวลาแฝง — Liquid AI d1-3B ตอบคำถามข้อเดียวใน 8 ms บน RTX 4090 และ 50 ms บน Jetson Orin Nano และรันสถานะแพ็ก 64 สถานะที่อัตรา 475 ต่อวินาทีบน 4090 LFM2.5-2.6B-Base ไม่มีค่าเวลาแฝงให้อ้างอิงจนกว่าคุณจะไฟน์จูนมันให้กลายเป็นสิ่งที่ตอบคำถามได้ ซึ่งเมื่อถึงตอนนั้น ตัวเลขนั้นก็เป็นของไฟน์จูนของคุณเอง

สิ่งที่คุณกำลังเลือกระหว่างนั้น ในทางปฏิบัติ
กฎการตัดสินใจในกรณีนี้เรียบง่ายอย่างผิดปกติ เพราะจุดตรวจสอบทั้งสองไม่ได้แย่งชิงงบประมาณรายการเดียวกัน
ใช้ Liquid AI d1-3B เมื่อคำถามมีอยู่แล้วและเป็นหนึ่งในสามรูปแบบที่โมเดลการตัดสินใจจัดการได้: ใช่หรือไม่ใช่, การเลือกจากชุดที่ระบุชื่อ, หรือการให้คะแนนบนมาตรวัดแบบเรียงลำดับ แอปพลิเคชันที่เผยแพร่ล้วนเป็นงานประจำในสายการผลิตที่รู้จักกันดี — การคัดแยกและกำหนดเส้นทาง, การกลั่นกรอง, การจำแนกเจตนาและหัวข้อ, การตรวจสอบการสกัด, การจัดอันดับใหม่, การ์ดเรลของเอเจนต์, และการตรวจสอบด้วยภาพ ตัวเลขจากการสาธิตที่ผู้ขายรันเมื่อวันที่ 5 ตุลาคม นำ d1 ไปเทียบกับ GPT-6.1 Sol และ Claude Opus 5.5 บนงานดังกล่าวหกงาน และอ้างว่ามันเทียบเท่าหรือเอาชนะ GPT-6.1 Sol ได้ในสี่งาน โดยมีค่าใช้จ่ายน้อยกว่า 19 ถึง 200 เท่า; หน้าวิธีวิทยาระบุอย่างชัดเจนว่าแต่ละแอปพลิเคชันถูกรันหนึ่งครั้งต่อโมเดล ดังนั้นให้ถือรูปแบบของข้อกล่าวอ้างเป็นข้อค้นพบ ไม่ใช่ตำแหน่งทศนิยม สิ่งที่สะดุดตาจริง ๆ คือการสาธิตการตรวจสอบ: การคัดแยกของดีเทียบกับของเสียในสี่สายการผลิตด้วยความแม่นยำ 85 ถึง 97% ในงานที่โมเดลไม่เคยได้รับการฝึกฝน โดยเข้าใจจากคำอธิบายสั้น ๆ
LFM2.5-2.6B-Baseเลือกใช้เมื่อโจทย์นั้นยังไม่มีอยู่ มันเป็นจุดเริ่มต้นที่ถูกกว่าสำหรับการไฟน์จูนที่คุณตั้งใจจะเป็นเจ้าของเอง — ไม่ว่าจะเป็นหัวตัดสินใจเฉพาะโดเมน ตัวจำแนกประเภทที่สร้างขึ้นเฉพาะทาง หรืองานที่ยังไม่มีใครมีเช็กพอยต์ให้ใช้ คุณได้สืบทอดสถาปัตยกรรม โทเคไนเซอร์ และบริบทแบบยาวมา และคุณจ่ายด้วยพลังประมวลผล ข้อมูล และการประเมินผล สองในสี่แอปพลิเคชันที่ผู้ขายสร้างขึ้นรอบ ๆ d1 เริ่มต้นจากโปรเจกต์โอเพนซอร์สแทนที่จะเริ่มจากศูนย์ ซึ่งสะท้อนภาพที่เที่ยงตรงว่าเช็กพอยต์ฐานบวกกับวินัยนั้นให้ผลลัพธ์ออกมาอย่างไรจริง ๆ
กับดักในทางปฏิบัติคือการมองว่า base checkpoint นั้นใช้แทนกันได้ทันที มันไม่ใช่ผู้ช่วย มันจะไม่ทำตามพรอมป์ต์ และเมื่อประเมินในฐานะโมเดลแชต มันได้คะแนนใกล้ศูนย์ — ซึ่งนั่นไม่ใช่ข้อเท็จจริงเกี่ยวกับคุณภาพของมัน แต่เป็นข้อเท็จจริงเกี่ยวกับความหมายของคำว่า "base" ต่างหาก
การโฮสต์เองไม่ว่าจะตัวไหน และเลเยอร์ที่อยู่เหนือขึ้นไป
ทั้งคู่มาในรูปแบบเวต และผู้จำหน่ายได้ทำงานด้านการดีพลอยสำหรับฝั่ง d1 ไว้แล้ว: การรองรับ llama.cpp ตั้งแต่วันแรก สแตก NVIDIA แบบครบวงจรตั้งแต่ DGX ลงไปจนถึง Jetson การควอนไทซ์ NVFP4 ตัวแปรแบบ 8-บิตของเวตและแอกติเวชัน และการแปลง GGUF บน Hugging Face เช็กพอยต์ฐานยังมีตัวแปร GGUF, ONNX และ MLX ของตัวเองผ่านตระกูล LFM2.5 ที่กว้างกว่า หากคุณไม่อยากโฮสต์สิ่งใดด้วยตัวเอง Liquid ให้บริการแบบโฮสต์ d1ผ่าน API ของตัวเอง โดยคิดราคาตามโทเคนอินพุตเท่านั้น โดยรูปภาพคิดค่าบริการ 1.5 โทเคนต่อแพตช์ขนาด 32×32 พิกเซล; การเข้าถึงแบบข้อความล้วนก็มีให้ใช้ผ่านแพลตฟอร์มของบุคคลที่สามเช่นกัน
สิ่งที่ไม่มีเส้นทางใดเปลี่ยนแปลงคือส่วนที่เหลือของสแตก โมเดลที่คุณโฮสต์เองก็คือโมเดลที่คุณต้องดูแลให้ยังทำงานอยู่ อัปเดตเวอร์ชัน และสลับไปใช้ตัวสำรองเมื่อล่ม — และการตัดสินใจที่มันป้อนให้ก็ยังไปอยู่เคียงข้างการเรียกใช้โมเดลเชิงสร้างที่คุณไม่ได้โฮสต์เอง การผสมผสานแบบนี้คือชั้นที่เราเตอร์ยุบรวมให้เหลือสิ่งเดียว: เอนด์พอยต์เดียวครอบคลุมโมเดลกว่า 200 ตัว ราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยไม่บวกกำไร 0% ดังนั้นเมื่อผู้ให้บริการเปลี่ยนราคา ฝั่งคุณก็อัปเดตทันทีในวันเดียวกัน และ การสลับไปใช้ระบบสำรองอัตโนมัติ ดังนั้นช่วงบ่ายที่ย่ำแย่ของผู้ให้บริการต้นทางรายหนึ่งจึงไม่กลายเป็นเหตุขัดข้องของคุณ การโฮสต์โมเดลตัดสินใจขนาด 3B ไว้ข้าง ๆ ยิ่งทำให้คำถามเรื่องการจัดเส้นทางคมชัดขึ้น ไม่ใช่เบาลง เพราะตอนนี้คุณเป็นเจ้าของไปป์ไลน์ครึ่งหนึ่งและเช่าอีกครึ่งหนึ่ง
อันไหน สำหรับใคร
ถ้าคำถามที่คุณต้องได้คำตอบภายในสัปดาห์นี้ เป็นหนึ่งในสามรูปแบบที่โมเดลการตัดสินใจเป็นอยู่ และเป็นคำถามที่คนอื่นจินตนาการไว้แล้ว ทายาทตัวนั้นก็เสร็จสมบูรณ์ ใช้ฟรี และรันได้ใน 50 มิลลิวินาทีบนอุปกรณ์ที่ไม่มี GPU — หยิบ Liquid AI d1-3B มาใช้แล้วจบเรื่องได้เลย
ถ้าคุณกำลังสร้างสิ่งที่ตอบคำถามที่ยังไม่มีใครถาม และคุณมีข้อมูลและพลังประมวลผลที่จะเป็นเจ้าของสิ่งนั้น LFM2.5-2.6B-Base คือจุดเริ่มต้นที่ตรงไปตรงมา และน่าจะรู้ไว้ด้วยว่าทายาทในบทความนี้ถูกสร้างขึ้นจากมันด้วยเส้นทางเดียวกับที่คุณกำลังจะเดิน
และถ้าคุณไม่แน่ใจว่าตัวเองอยู่ในสถานการณ์ไหนจากสองสถานการณ์นั้น คำตอบก็เกือบจะเสมอว่า การทำ post-training ให้กลายเป็นการตัดสินใจเป็นทางเลือกที่แพง ส่วนการรันของคนอื่นนั้นฟรี

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
