การ์ดหัวข้อหลักที่เขียนว่า 'Liquid AI d1-3B vs LFM2.5-2.6B-Base' พร้อมคำโปรยย่อยว่า 'โมเดลตัดสินใจกับบรรพบุรุษของตัวมันเอง' วาดเป็นแผนผังต้นไม้ครอบครัวจากซ้ายไปขวา: การ์ดที่ติดป้ายว่า LFM2.5-2.6B-Base น้ำหนักดิบ ลูกศรที่ติดป้ายว่า post-training และการ์ดที่ติดป้ายว่า d1-3B ตอบคำถาม โดยมีชิป keep-training อยู่ใต้การ์ดซ้าย และชิป yes/no, label และ score อยู่ใต้การ์ดขวา
Guides & Insights

Liquid AI d1-3B กับ LFM2.5-2.6B-Base: โมเดลการตัดสินใจและบรรพบุรุษของตัวมันเอง

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

นี่ไม่ใช่การปะทะกันระหว่างคู่แข่งสองราย Liquid AI d1-3B โมเดลสำหรับการตัดสินใจแบบเปิดน้ำหนักที่ Liquid AI เผยแพร่เมื่อวันที่ 7 ตุลาคม 2026 ถูกสร้างขึ้นบนฐานที่ผู้พัฒนาสร้างโดยการเฉลี่ยน้ำหนักของ LFM2.5-2.6B กับแกนข้อความของ LFM2.5-VL-3B LFM2.5-2.6B-Base คือบรรพบุรุษรายแรกนั้น — เช็กพอยต์ดิบที่ผ่านการฝึกมาก่อน ซึ่ง Liquid อัปโหลดเมื่อวันที่ 1 สิงหาคม 2026 มี 2.69B พารามิเตอร์, 34 ล้านล้านโทเคนสำหรับการฝึก, คอนเท็กซ์ขนาด 131,072 โทเคน, ไม่มีการปรับตามคำสั่ง และไม่มีเทมเพลตแชต ดังนั้นการวางกรอบการเปรียบเทียบนี้อย่างซื่อตรงคือลูกรุ่นหลังกับบรรพบุรุษ: โมเดลที่ถูกฝึกหลังการฝึกให้ทำงานเฉพาะเจาะจงมาก ยืนอยู่ข้างวัสดุฐานที่ยังไม่ถูกขึ้นรูป ซึ่งตัวมันเองถูกขึ้นรูปมาจากวัสดุนั้น หนึ่งในนั้นตอบคำถามคืนนี้ อีกตัวคือจุดเริ่มต้นของคุณ หากคำถามที่คุณต้องการให้ตอบยังไม่มีใครเคยถามมาก่อน

แต่ละอย่างจริงๆ แล้วคืออะไร

โมเดลทั้งสองนี้ให้ความรู้สึกเหมือนเป็นเอกสารจากต่างขั้นตอนของสายการผลิต ความแตกต่างจึงไม่ใช่เรื่องเชิงสไตล์

Liquid AI d1-3B มีพารามิเตอร์ 3.12B, ตัวเข้ารหัสภาพ SigLIP2 NaFlex ขนาด 400M, หน้าต่างบริบท 32,768 โทเค็น, คำศัพท์ 128,000 โทเค็น และภาษาที่มีเอกสารรองรับ 16 ภาษา เป็นโมเดลตัดสินใจ: คุณให้สถานะและคำถามที่ตั้งชื่อไว้ แล้วมันจะคืนค่าความน่าจะเป็นใช่/ไม่ใช่, ป้ายกำกับที่เลือกพร้อมความมั่นใจและการแจกแจงตัวเลือกทั้งหมด, หรือคะแนนแบบเรียงลำดับ — ในการส่งผ่านไปข้างหน้าครั้งเดียว โดยไม่มีการสร้างโทเค็นเอาต์พุต มันมาพร้อมกับ system_one ซึ่งเป็นการเรียกสำหรับหนึ่งสถานะกับหลายคำถาม, ตัวแปรแบบแบตช์ที่รวมคำขอจำนวนมากโดยไม่ต้องมี padding, และแบบดิบ probabilities สำหรับการเข้าถึงการแจกแจงพื้นฐาน มันไม่ใช่โมเดลแชทและไม่เขียนข้อความ และการ์ดระบุไว้เช่นนั้น

LFM2.5-2.6B-Baseมีพารามิเตอร์ 2.69B ใน 30 เลเยอร์ — บล็อกคอนโวลูชันสั้นแบบดับเบิลเกต 22 บล็อก และบล็อกแอตเทนชันแบบกลุ่มคิวรี 8 บล็อก — ฝึกด้วยโทเคน 34 ล้านล้านโทเคน และขยายเป็นบริบท 131,072 โทเคนระหว่างการฝึกช่วงกลาง โดยใช้คลังคำศัพท์ 128,000 โทเคนชุดเดียวกันและภาษา 16 ภาษาเดียวกัน เป็นเช็กพอยต์ข้อความล้วนที่ผ่านการฝึกมาก่อน โดยไม่มีการปรับจูนตามคำสั่ง ไม่มีผลทดสอบมาตรฐานบนการ์ดของมัน และมีคำแนะนำที่อ่านแล้วเหมือนคำเตือน: ใช้มันเฉพาะกับงานที่ต้องอาศัยการปรับจูนละเอียดอย่างหนักเท่านั้น มันเติมข้อความให้สมบูรณ์ มันไม่ปฏิบัติตามคำสั่ง

ทั้งคู่เป็นดาวน์โหลดแบบไม่ต้องผ่านการลงทะเบียน ภายใต้สัญญาอนุญาตเปิดของ Liquid เอง ทั้งคู่เน้นข้อความเป็นหลัก ทั้งสองรายการไม่มีอยู่ในแคตตาล็อกของเรา และไม่มีข้อความใดในที่นี้เป็นการอ้างถึงความพร้อมให้บริการสำหรับรายการใดรายการหนึ่ง

A two-column scoreboard for Liquid AI d1-3B and LFM2.5-2.6B-Base. The d1-3B column reads: role post-trained decision model; 3.12B parameters; 32,768-token context; text and image input; Decision Index 48.57 (vendor); answers a question in 8 ms. The base column reads: role raw pre-trained base; 2.69B parameters; 131,072-token context; text-only input; Decision Index not scoreable; answers a question only after you fine-tune. The footer reads 'd1-3B figures vendor-reported; the base checkpoint publishes no benchmark table.'

ส่วนที่น่าสนใจคือเชื้อสาย

Liquid ไม่ได้ fine-tune โมเดลใหม่เพื่อทำการเปิดตัว d1 แต่พวกเขาเฉลี่ยเช็กพอยต์สองตัว — LFM2.5-2.6B และ text tower ของ LFM2.5-VL-3B — เพื่อให้ได้จุดเริ่มต้นที่ดีขึ้น จากนั้น fine-tune หลายรอบด้วย seed สุ่มและส่วนผสมข้อมูลที่แตกต่างกัน แล้ว merge กลับเข้าด้วยกัน คำอธิบายของผู้ขายเกี่ยวกับสิ่งที่ทำให้ผลลัพธ์ดีขึ้นนั้นไม่มีเทคนิคแปลกใหม่เลยอย่างเห็นได้ชัด: การฝึกบนอินพุตยาว การสลับลำดับที่ตัวเลือกคำตอบปรากฏ และการเอาทางลัดออกจากข้อมูลฝึก ให้ผลมากกว่าวิธีขั้นสูงใด ๆ ที่พวกเขาลอง

รายละเอียดเรื่องการกำจัดทางลัดนี้น่าจะหยุดคิดสักหน่อย เพราะมันระบุถึงความล้มเหลวที่หมวดหมู่นี้ตั้งขึ้นมาเพื่อหลีกเลี่ยง โมเดลที่ถูกฝึกให้ตอบคำถามแบบปรนัยจะเรียนรู้อย่างสบายใจว่าตัวเลือก B มักเป็นคำตอบที่ถูก หรือตัวเลือกที่ยาวที่สุดชนะ การสุ่มสลับลำดับตัวเลือกในระหว่างการฝึกคือสิ่งที่หยุดเรื่องนั้นไว้ โมเดลตัดสินใจที่เรียนรู้ position prior แทนที่จะอ่านสภาวะนั้นแย่กว่าไร้ประโยชน์ — มันผิดอย่างมั่นใจในวงกว้าง — และมันคือสิ่งเฉพาะที่แยกโมเดลตัดสินใจจริงออกจากตัวจำแนกประเภทที่มีพรอมป์ต์

ยังมีภาวะถดถอยอีกอย่างที่ควรเอ่ยถึงให้ตรง ๆ เพราะผู้ขายไม่ยอมพูดถึง: เช็กพอยต์ฐานมีหน้าต่างบริบท 131,072 โทเค็น และ Liquid AI d1-3B มี 32,768 การทำโพสต์เทรนให้เป็นโมเดลตัดสินใจทำให้ต้องสูญเสียบริบทที่ใช้งานได้ไปสามในสี่ ถ้าคุณคิดว่าโมเดลรุ่นลูกหลานจะเหนือกว่ารุ่นบรรพบุรุษอย่างเด็ดขาดในทุกแกน มันไม่ได้เป็นเช่นนั้น และการตัดสินใจกับเอกสารยาวคือแกนที่เช็กพอยต์รุ่นเก่ามีพื้นที่มากกว่า — ในทางทฤษฎี ถึงแม้ว่ามันจะไม่มีเฮดตัดสินใจให้ใช้กับพื้นที่นั้นก็ตาม

กระดานคะแนน พร้อมด้วยความไม่สมมาตรที่แนบมาด้วย

การนำสองสิ่งนี้มาเปรียบเทียบบนเบนช์มาร์กเป็นความผิดพลาดเชิงหมวดหมู่ แต่เป็นความผิดพลาดเชิงหมวดหมู่ที่มีรูปร่างให้ข้อมูลได้ ดังนั้นนี่คือมันพร้อมข้อควรระวังที่กำกับไว้แล้ว ทุกตัวเลขของ d1-3B เป็นของ Liquid เอง ซึ่งผู้ขายเป็นผู้ให้คะแนนด้วยตัวให้คะแนนทางการ แทนที่จะส่งเข้าลีดเดอร์บอร์ดสาธารณะ และไม่มีบุคคลที่สามรายใดทำซ้ำได้ ทุกตัวเลขของ LFM2.5-2.6B-Base หายไป เพราะโมเดลฐานไม่มีอะไรให้วัด

• Decision Index 0.2.1 — Liquid AI d1-3B 48.57 เป็นอันดับหนึ่งในบรรดาทุกอย่างที่ต่ำกว่า 10B ในตารางของผู้ขาย และนำหน้าโมเดลตัดสินใจที่มีขนาดใหญ่กว่ามันถึงสิบสองเท่า LFM2.5-2.6B-Base — ไม่ถูกให้คะแนน และไม่สามารถให้คะแนนได้หากไม่มี decision head

• เกณฑ์มาตรฐานด้านข้อความ — Liquid AI d1-3B เฉลี่ย 82.9 จากเกณฑ์มาตรฐานสาธารณะเจ็ดรายการ ซึ่งครอบคลุมความเข้าใจ ความเป็นพิษ เจตนา การถามตอบทางการแพทย์ และความเข้าใจข้ามภาษา ส่วน LFM2.5-2.6B-Base ไม่เผยแพร่ตารางเกณฑ์มาตรฐานใด ๆ เลย

• วิชัน — Liquid AI d1-3B มีค่าเฉลี่ย 74.1 จากแบบทดสอบภาพสิบเอ็ดรายการที่ตีความเป็นการตัดสินใจ; การลบภาพออกทำให้คำถามเดียวกันลดลงเหลือ 45.1 LFM2.5-2.6B-Base เป็นข้อความล้วน โดยไม่มีเสาวิชัน

• พารามิเตอร์ — 3.12B เทียบกับ 2.69B โมเดลตัดสินใจเป็นโมเดลที่ใหญ่กว่าของทั้งสอง ซึ่งตรงข้ามกับเรื่องเล่าหลังการฝึกโดยทั่วไป

• บริบท — 32,768 โทเค็น เทียบกับ 131,072 โทเค็น บรรพบุรุษชนะแถวนี้ และเป็นแถวเดียวที่มันชนะ

• เวลาแฝง — Liquid AI d1-3B ตอบคำถามข้อเดียวใน 8 ms บน RTX 4090 และ 50 ms บน Jetson Orin Nano และรันสถานะแพ็ก 64 สถานะที่อัตรา 475 ต่อวินาทีบน 4090 LFM2.5-2.6B-Base ไม่มีค่าเวลาแฝงให้อ้างอิงจนกว่าคุณจะไฟน์จูนมันให้กลายเป็นสิ่งที่ตอบคำถามได้ ซึ่งเมื่อถึงตอนนั้น ตัวเลขนั้นก็เป็นของไฟน์จูนของคุณเอง

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

สิ่งที่คุณกำลังเลือกระหว่างนั้น ในทางปฏิบัติ

กฎการตัดสินใจในกรณีนี้เรียบง่ายอย่างผิดปกติ เพราะจุดตรวจสอบทั้งสองไม่ได้แย่งชิงงบประมาณรายการเดียวกัน

ใช้ Liquid AI d1-3B เมื่อคำถามมีอยู่แล้วและเป็นหนึ่งในสามรูปแบบที่โมเดลการตัดสินใจจัดการได้: ใช่หรือไม่ใช่, การเลือกจากชุดที่ระบุชื่อ, หรือการให้คะแนนบนมาตรวัดแบบเรียงลำดับ แอปพลิเคชันที่เผยแพร่ล้วนเป็นงานประจำในสายการผลิตที่รู้จักกันดี — การคัดแยกและกำหนดเส้นทาง, การกลั่นกรอง, การจำแนกเจตนาและหัวข้อ, การตรวจสอบการสกัด, การจัดอันดับใหม่, การ์ดเรลของเอเจนต์, และการตรวจสอบด้วยภาพ ตัวเลขจากการสาธิตที่ผู้ขายรันเมื่อวันที่ 5 ตุลาคม นำ d1 ไปเทียบกับ GPT-6.1 Sol และ Claude Opus 5.5 บนงานดังกล่าวหกงาน และอ้างว่ามันเทียบเท่าหรือเอาชนะ GPT-6.1 Sol ได้ในสี่งาน โดยมีค่าใช้จ่ายน้อยกว่า 19 ถึง 200 เท่า; หน้าวิธีวิทยาระบุอย่างชัดเจนว่าแต่ละแอปพลิเคชันถูกรันหนึ่งครั้งต่อโมเดล ดังนั้นให้ถือรูปแบบของข้อกล่าวอ้างเป็นข้อค้นพบ ไม่ใช่ตำแหน่งทศนิยม สิ่งที่สะดุดตาจริง ๆ คือการสาธิตการตรวจสอบ: การคัดแยกของดีเทียบกับของเสียในสี่สายการผลิตด้วยความแม่นยำ 85 ถึง 97% ในงานที่โมเดลไม่เคยได้รับการฝึกฝน โดยเข้าใจจากคำอธิบายสั้น ๆ

LFM2.5-2.6B-Baseเลือกใช้เมื่อโจทย์นั้นยังไม่มีอยู่ มันเป็นจุดเริ่มต้นที่ถูกกว่าสำหรับการไฟน์จูนที่คุณตั้งใจจะเป็นเจ้าของเอง — ไม่ว่าจะเป็นหัวตัดสินใจเฉพาะโดเมน ตัวจำแนกประเภทที่สร้างขึ้นเฉพาะทาง หรืองานที่ยังไม่มีใครมีเช็กพอยต์ให้ใช้ คุณได้สืบทอดสถาปัตยกรรม โทเคไนเซอร์ และบริบทแบบยาวมา และคุณจ่ายด้วยพลังประมวลผล ข้อมูล และการประเมินผล สองในสี่แอปพลิเคชันที่ผู้ขายสร้างขึ้นรอบ ๆ d1 เริ่มต้นจากโปรเจกต์โอเพนซอร์สแทนที่จะเริ่มจากศูนย์ ซึ่งสะท้อนภาพที่เที่ยงตรงว่าเช็กพอยต์ฐานบวกกับวินัยนั้นให้ผลลัพธ์ออกมาอย่างไรจริง ๆ

กับดักในทางปฏิบัติคือการมองว่า base checkpoint นั้นใช้แทนกันได้ทันที มันไม่ใช่ผู้ช่วย มันจะไม่ทำตามพรอมป์ต์ และเมื่อประเมินในฐานะโมเดลแชต มันได้คะแนนใกล้ศูนย์ — ซึ่งนั่นไม่ใช่ข้อเท็จจริงเกี่ยวกับคุณภาพของมัน แต่เป็นข้อเท็จจริงเกี่ยวกับความหมายของคำว่า "base" ต่างหาก

การโฮสต์เองไม่ว่าจะตัวไหน และเลเยอร์ที่อยู่เหนือขึ้นไป

ทั้งคู่มาในรูปแบบเวต และผู้จำหน่ายได้ทำงานด้านการดีพลอยสำหรับฝั่ง d1 ไว้แล้ว: การรองรับ llama.cpp ตั้งแต่วันแรก สแตก NVIDIA แบบครบวงจรตั้งแต่ DGX ลงไปจนถึง Jetson การควอนไทซ์ NVFP4 ตัวแปรแบบ 8-บิตของเวตและแอกติเวชัน และการแปลง GGUF บน Hugging Face เช็กพอยต์ฐานยังมีตัวแปร GGUF, ONNX และ MLX ของตัวเองผ่านตระกูล LFM2.5 ที่กว้างกว่า หากคุณไม่อยากโฮสต์สิ่งใดด้วยตัวเอง Liquid ให้บริการแบบโฮสต์ d1ผ่าน API ของตัวเอง โดยคิดราคาตามโทเคนอินพุตเท่านั้น โดยรูปภาพคิดค่าบริการ 1.5 โทเคนต่อแพตช์ขนาด 32×32 พิกเซล; การเข้าถึงแบบข้อความล้วนก็มีให้ใช้ผ่านแพลตฟอร์มของบุคคลที่สามเช่นกัน

สิ่งที่ไม่มีเส้นทางใดเปลี่ยนแปลงคือส่วนที่เหลือของสแตก โมเดลที่คุณโฮสต์เองก็คือโมเดลที่คุณต้องดูแลให้ยังทำงานอยู่ อัปเดตเวอร์ชัน และสลับไปใช้ตัวสำรองเมื่อล่ม — และการตัดสินใจที่มันป้อนให้ก็ยังไปอยู่เคียงข้างการเรียกใช้โมเดลเชิงสร้างที่คุณไม่ได้โฮสต์เอง การผสมผสานแบบนี้คือชั้นที่เราเตอร์ยุบรวมให้เหลือสิ่งเดียว: เอนด์พอยต์เดียวครอบคลุมโมเดลกว่า 200 ตัว ราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยไม่บวกกำไร 0% ดังนั้นเมื่อผู้ให้บริการเปลี่ยนราคา ฝั่งคุณก็อัปเดตทันทีในวันเดียวกัน และ การสลับไปใช้ระบบสำรองอัตโนมัติ ดังนั้นช่วงบ่ายที่ย่ำแย่ของผู้ให้บริการต้นทางรายหนึ่งจึงไม่กลายเป็นเหตุขัดข้องของคุณ การโฮสต์โมเดลตัดสินใจขนาด 3B ไว้ข้าง ๆ ยิ่งทำให้คำถามเรื่องการจัดเส้นทางคมชัดขึ้น ไม่ใช่เบาลง เพราะตอนนี้คุณเป็นเจ้าของไปป์ไลน์ครึ่งหนึ่งและเช่าอีกครึ่งหนึ่ง

อันไหน สำหรับใคร

ถ้าคำถามที่คุณต้องได้คำตอบภายในสัปดาห์นี้ เป็นหนึ่งในสามรูปแบบที่โมเดลการตัดสินใจเป็นอยู่ และเป็นคำถามที่คนอื่นจินตนาการไว้แล้ว ทายาทตัวนั้นก็เสร็จสมบูรณ์ ใช้ฟรี และรันได้ใน 50 มิลลิวินาทีบนอุปกรณ์ที่ไม่มี GPU — หยิบ Liquid AI d1-3B มาใช้แล้วจบเรื่องได้เลย

ถ้าคุณกำลังสร้างสิ่งที่ตอบคำถามที่ยังไม่มีใครถาม และคุณมีข้อมูลและพลังประมวลผลที่จะเป็นเจ้าของสิ่งนั้น LFM2.5-2.6B-Base คือจุดเริ่มต้นที่ตรงไปตรงมา และน่าจะรู้ไว้ด้วยว่าทายาทในบทความนี้ถูกสร้างขึ้นจากมันด้วยเส้นทางเดียวกับที่คุณกำลังจะเดิน

และถ้าคุณไม่แน่ใจว่าตัวเองอยู่ในสถานการณ์ไหนจากสองสถานการณ์นั้น คำตอบก็เกือบจะเสมอว่า การทำ post-training ให้กลายเป็นการตัดสินใจเป็นทางเลือกที่แพง ส่วนการรันของคนอื่นนั้นฟรี

A capture of our own models catalogue page, showing the filter rail for input modalities, context length, input price, status, series and supported parameters, a header reading '207 models, 16 providers, one API key, one bill', sort control set to Newest, a model listing beginning with openai/gpt-5-search-api-2025-10-14, and a 'How to call any model' panel with the OpenAI-compatible endpoint https://api.orcarouter.ai/v1/chat/completions.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube