การ์ดชื่อหลักสำหรับโมเดลการตัดสินใจแบบเปิดน้ำหนักของ Liquid AI มีหัวข้อว่า 'สองโมเดลที่ไม่เคยเขียนคำใดเลย' พร้อมคำโปรย 'Liquid AI d1-3B และ d1-omni-600M, น้ำหนักเปิด, 7 ตุลาคม 2026' ชิปสามชิ้นที่ติดป้ายว่า ใช่/ไม่ใช่ เลือกป้ายกำกับและให้คะแนนบนสเกล และแผนภาพของสถานะหนึ่งที่เข้าสู่ forward pass เพียงครั้งเดียวซึ่งคืนค่าความน่าจะเป็น ป้ายกำกับ และคะแนน
Guides & Insights

Liquid AI d1-3B และ d1-omni-600M: น้ำหนักแบบเปิดสำหรับโมเดลที่ไม่เคยเขียนสักคำ

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Liquid AI d1-3B และ Liquid AI d1-omni-600M ขึ้นบน Hugging Face เมื่อวันที่ 7 ตุลาคม 2026 และเช็กพอยต์ทั้งสองมีคุณสมบัติที่ทำให้ตารางเปรียบเทียบทุกตารางที่คุณอ่านมาปีนี้มีรูปร่างผิดไป ทั้งสองไม่ได้สร้างข้อความ คุณป้อนสถานะให้ Liquid AI d1-3B — ใบแจ้งปัญหา เพย์โหลด JSON ภาพถ่าย หรือทั้งสามอย่างพร้อมกัน — และชุดคำถามที่มีชื่อ แล้วมันจะส่งคำตอบที่ดึงมาจากการแจกแจงของโมเดลเหนือตัวเลือกของคุณโดยตรง ใช่/ไม่ใช่เป็นค่าความน่าจะเป็น การเลือกจากป้ายกำกับพร้อมค่าความเชื่อมั่นและเวกเตอร์ความน่าจะเป็นแบบเต็ม ตำแหน่งบนสเกลแบบเรียงลำดับ ไม่มีขั้นตอนการสุ่ม ไม่มี JSON ให้แยกวิเคราะห์ ไม่มีการสร้างข้อความที่หลุดควบคุม และตัวนับการใช้งานของผู้จำหน่ายรายงานสิ่งนี้อย่างตรงไปตรงมา: output_tokens: 0. โมเดล 3B เป็นจุดเด่น — มันทำคะแนน 48.57 บน Decision Index 0.2.1 ที่ผู้จำหน่ายให้คะแนน นำหน้าทุกอย่างที่ต่ำกว่า 10B และนำหน้าโมเดลตัดสินใจที่มีขนาดใหญ่กว่าสิบสองเท่า โมเดลพี่น้อง 600M คือตัวที่ควรจับตา: มันอ่านภาพและเสียงพูดได้นานถึงสามสิบวินาทีผ่านน้ำหนักทรังค์เดียวกัน และถูกระบุว่าเป็นรุ่นวิจัยระยะแรก

แบบจำลองการตัดสินใจคืออะไร ในหนึ่งย่อหน้า

หมวดหมู่นี้ก่อตัวมานานหนึ่งปีภายใต้ชื่ออย่างโมเดลระบบหนึ่งและตัวจำแนกที่ไม่ใช่ตัวจำแนก และคู่ d1 คือคำอธิบายที่ชัดเจนที่สุดของหมวดนี้จนถึงตอนนี้ โมเดลเชิงสร้างจะถูกถามคำถามและเขียนคำตอบ คำตอบนั้นต้องถูกแยกวิเคราะห์ การแยกวิเคราะห์อาจล้มเหลว และทุกโทเคนที่มันเขียนทำให้คุณเสียเงินและเวลา โมเดลตัดสินใจจะถูกถามคำถามและรายงานสิ่งที่มันเชื่ออยู่แล้ว คำถามของ Liquid มีสามประเภท noul เป็นคำถามแบบใช่/ไม่ใช่ โดยตอบด้วย P(yes) ระหว่าง 0 ถึง 1 choice เลือกหนึ่งป้ายกำกับจากชุดที่มีชื่อ และคืนค่าป้ายกำกับ ค่าความเชื่อมั่น และความน่าจะเป็นของแต่ละตัวเลือก score จัดวางสถานะบนสเกลแบบเรียงลำดับที่มีสองถึงสิบระดับ และคืนค่าระดับที่คาดหมายพร้อมการกระจายและคำอธิบายสัญลักษณ์ สถานะหนึ่งสามารถมีคำถามหลายข้อได้ในคราวเดียว และสถานะกับภาพของสถานะนั้นถูกอ่านเพียงครั้งเดียวสำหรับคำถามทั้งหมดเหล่านั้น

คุณสมบัติข้อสุดท้ายนั่นแหละคือเหตุผลทางธุรกิจทั้งหมด การถามสามคำถามเกี่ยวกับตั๋วใบเดียวใช้เวลาเป็น 1.3 เท่าของการถามหนึ่งคำถาม ไม่ใช่ 3 เท่า เพราะโมเดลทำ forward pass เพียงครั้งเดียวบนอินพุต แล้วอ่านคำตอบหลายคำตอบออกมาจากอินพุตนั้น ไม่มีอะไรต้องเขียน ดังนั้นจึงไม่มีอะไรที่ต้องเขียนได้แย่

3B และ 600M ถูกสร้างขึ้นจากทิศทางที่ตรงกันข้าม

นี่คือจุดที่การเปิดตัวครั้งนี้กลายเป็นเรื่องน่าสนใจในทางเทคนิค และเป็นส่วนที่สื่อที่รายงานข่าวการเปิดตัวมักข้ามไปเสียเป็นส่วนใหญ่ โมเดลทั้งสองไม่ได้สืบสายมาจากต้นตระกูลเดียวกัน

Liquid AI d1-3B สืบทอดมาจาก LFM2.5-VL-3B ซึ่งเป็นโมเดลภาพ-ภาษาแบบ decoder-only ของผู้จำหน่าย โดยมีพารามิเตอร์ 3.12B พร้อมตัวเข้ารหัสภาพ SigLIP2 NaFlex ขนาด 400M ที่ปรับแต่งรูปร่างให้เหมาะสม หน้าต่างบริบท 32,768 โทเคน คำศัพท์ 128,000 โทเคน และภาษาที่มีเอกสารรองรับ 16 ภาษา ในการสร้างมัน Liquid ได้เฉลี่ยค่าน้ำหนักของ LFM2.5-2.6B กับแกนข้อความของ LFM2.5-VL-3B ปรับแต่งเช็กพอยต์จากเมล็ดสุ่มและส่วนผสมข้อมูลหลายชุด แล้วรวมผลลัพธ์อีกครั้ง บทสรุปของผู้จำหน่ายเองเกี่ยวกับสิ่งที่สำคัญนั้นเรียบง่ายอย่างน่าสดชื่น: การฝึกด้วยอินพุตยาว การสลับลำดับตัวเลือกคำตอบ และการตามล่าหาทางลัดในข้อมูลฝึก ช่วยผลลัพธ์สุดท้ายได้มากกว่าเทคนิคขั้นสูงใด ๆ

Liquid AI d1-omni-600M สืบทอดมาจาก LFM2.5-Encoder-350M ซึ่งเป็นเอนโคเดอร์แบบสองทิศทาง — เป็นเครือข่ายต่างชนิดกันโดยสิ้นเชิง โดยมีพารามิเตอร์รวม 587 ล้าน แบ่งเป็นทรังก์ร่วมและหัวตัดสินใจ 381 ล้าน เอนโคเดอร์ภาพ 94 ล้านที่ยืมมาจาก LFM2.5-VL-450M และเอนโคเดอร์เสียง 112 ล้านที่สร้างจาก FastConformer 17 ชั้น ทุกโมดัลวิ่งผ่านน้ำหนักทรังก์ชุดเดียวกัน คอนเท็กซ์ของมันคือ 16,384 โทเคน ครอบคลุมตำแหน่งของข้อความ ภาพ และเสียงรวมกัน และเมื่อแนบภาพมา ข้อความสถานะและคำถามจะถูกตัดเหลือ 896 โทเคน เพราะนั่นคือสิ่งที่มันถูกเทรนมา ส่วนเสียงมีการเตือนหนึ่งข้อที่การ์ดระบุไว้อย่างไม่ลังเลว่า ความสามารถนี้ถูกเทรนจากคำขอระหว่างผู้พูดภาษาอังกฤษกับผู้ช่วย และคลิปจะถูกตัดที่สามสิบวินาที

ดังนั้น ตระกูลนี้จึงไม่ใช่โมเดลเดียวที่มีสองขนาด แต่เป็นตัวถอดรหัสและตัวเข้ารหัสที่ถูกฝึกภายหลังให้ทำงานเดียวกันด้วยกลไกที่แตกต่างกันอย่างสิ้นเชิงสองแบบ โดยตัวหนึ่งมองเห็น และอีกตัวหนึ่งได้ยิน

A two-column scoreboard for Liquid AI d1-3B and d1-omni-600M showing d1-3B at Decision Index 48.57 with 3.12B parameters, text and image input and 8 ms per question on an RTX 4090, against d1-omni-600M at 15.95 with 587M parameters, text, image and audio input and no reported latency, footed 'All figures vendor-reported by Liquid AI, Oct 7 2026; no independent reproduction.'

ตัวเลข และของใคร

ทุกตัวเลขในส่วนนี้เป็นของ Liquid เอง แถว Decision Index สำหรับโมเดล d1 ถูกให้คะแนนโดยผู้ขายโดยใช้ตัวให้คะแนนอย่างเป็นทางการ — ไม่ได้ส่งไปยังลีดเดอร์บอร์ด — ในขณะที่แถวของคู่แข่งทุกแถวมาจากลีดเดอร์บอร์ดสาธารณะที่ v0.2.1 ยังไม่มีแล็บอิสระใดทำซ้ำข้อมูลใด ๆ เหล่านี้ได้ และโมเดลมีอายุได้สองวัน ณ เวลาที่เขียนข้อความนี้

• Decision Index 0.2.1 — Liquid AI d1-3B ได้คะแนน 48.57 โดยมีคะแนนย่อย ได้แก่ ความรู้ 23.8, ภาษา 56.4, การค้นคืน 52.8, เครื่องมือ 74.5 และศิลปะ 36.3 Liquid AI d1-omni-600M ได้คะแนน 15.95 โดยเครื่องมืออยู่ที่ 15.1

• ตำแหน่งที่ 48.57 อยู่ — เป็นอันดับหนึ่งในทุกอย่างที่ต่ำกว่า 10B ในตารางที่ผู้ขายเผยแพร่ และนำหน้า Decider 35B-A3B ที่ 47.11 โดยรวมแล้วเป็นอันดับสอง รองจาก Winnow-12B ที่ 50.02 ซึ่งมีขนาดใหญ่เป็นสี่เท่า

• เกณฑ์มาตรฐานด้านข้อความ ตามรายงานของผู้ขาย — d1-3B เฉลี่ย 82.9 จากเกณฑ์มาตรฐานสาธารณะเจ็ดรายการ สูงกว่า 81.1 ของ Decider 4B; d1-omni-600M เฉลี่ย 78.4 ซึ่งเอาชนะ 77.1 ของ Decider 2B ด้วยจำนวนพารามิเตอร์เพียงประมาณหนึ่งในสี่ ส่วน 600M ทำคะแนนความเป็นพิษดีที่สุดในตาราง (Civil Comments 95.8) และคะแนนการถอดความดีที่สุด (PAWS-X 79.5)

• ความสามารถด้านการมองเห็น ตามที่ผู้ขายรายงาน — d1-3B มีค่าเฉลี่ย 74.1 จากเบนช์มาร์กภาพสาธารณะ 11 รายการ โดยอ่านผลเป็นการตัดสินใจเลือกจากตัวเลือกของแต่ละเบนช์มาร์ก เทียบกับ 73.9 สำหรับแบ็กโบน LFM2.5-VL-3B ของมัน การเอารูปภาพออกทำให้คำถามชุดเดียวกันลดลงเหลือ 45.1 ซึ่งเป็นวิธีที่ผู้ขายแสดงให้เห็นว่าคำตอบมาจากพิกเซล

• ความหน่วงที่วัดโดยผู้จำหน่าย — หนึ่งคำถามใช้เวลา 8 มิลลิวินาทีบน RTX 4090 และ 9 มิลลิวินาทีบน AMD MI325X; 16 มิลลิวินาทีบน Jetson AGX Thor, 26 มิลลิวินาทีบน Jetson AGX Orin 64 GB, 50 มิลลิวินาทีบน Jetson Orin Nano รุ่นเล็กที่สุด และ 30 มิลลิวินาทีบน Apple M5 Pro การประมวลผล 64 สถานะที่อัดแน่นในพาสเดียวทำได้ 475 ครั้งต่อวินาทีบน 4090

• สิ่งที่ขาดหายไป — d1-omni-600M ไม่มีตารางการอนุมานเลย Liquid กล่าวว่ายังอยู่ระหว่างการพัฒนาอย่างต่อเนื่อง และเพียงไม่รายงานค่าความหน่วงของมัน นอกจากนี้ยังไม่มีเบนช์มาร์กการตัดสินใจด้านเสียงที่ใดเลยในเวอร์ชันเผยแพร่นี้ เพราะตามคำพูดของผู้ขาย เบนช์มาร์กการตัดสินใจด้านเสียงโดยเฉพาะในปัจจุบันยังเป็นปัญหาที่เปิดอยู่

คำกล่าวอ้างที่การเปิดตัวนี้กำลังสื่อออกมาจริง ๆ

สองวันก่อนที่น้ำหนักโมเดลจะถูกเผยแพร่ Liquid ได้เผยแพร่เวอร์ชันโฮสต์ของโมเดลนี้ และทดสอบเทียบกับ GPT-6.1 Sol และ Claude Opus 5.5 บนแอปพลิเคชันหกตัว สรุปของมันคือ: d1 ทำได้เทียบเท่าหรือดีกว่า GPT-6.1 Sol ในสี่จากหกตัว มีต้นทุนต่ำกว่า 19 เท่าถึง 200 เท่า และตอบเร็วกว่าในทุกงาน ระเบียบวิธีที่เผยแพร่นั้นน่าอ่านก่อนจะกล่าวซ้ำเรื่องใด ๆ เหล่านั้น — แอปพลิเคชันแต่ละตัวถูกรันหนึ่งครั้งต่อโมเดลเมื่อวันที่ 5 ตุลาคม 2026 โมเดลแชตตอบเป็น JSON ด้วยการตั้งค่าการให้เหตุผลเริ่มต้น และต้นทุนของ d1 คำนวณที่ $0.04 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น

เดโมคือครึ่งที่โน้มน้าวใจกว่า การแยกชิ้นส่วนดีและชำรุดจากสี่สายการผลิต — แผงวงจร เทียน เม็ดมะม่วงหิมพานต์ หมากฝรั่ง — ด้วยความแม่นยำ 85 ถึง 97% บนโมเดลที่ไม่เคยถูกฝึกมาสำหรับงานนี้และเข้าใจงานได้จากคำอธิบายสั้น ๆ เพรดิเคต SQL ที่ตอบใช่หรือไม่ใช่สำหรับตั๋วสนับสนุน 150 ใบ ลูปการบีบอัดบริบทที่อ่านเอาต์พุตของเครื่องมือแต่ละรายการในเซสชันของเอเจนต์เขียนโค้ด แล้วเก็บ ตัดทอน หรือทิ้งมัน โดยกำจัด 52% ของโทเคน ขณะที่ยังคงเอาต์พุตทุกอย่างที่งานต้องการไว้ ใน Tetris การเพิ่มหน้าจอให้เกมที่อธิบายเป็นข้อความได้ทั้งหมดทำให้คะแนนเพิ่มจาก 70 เส้นที่เคลียร์เป็น 81 — ผลลัพธ์ด้านวิชันที่คุณไม่สามารถได้จากตัวจำแนกแบบข้อความล้วน ไม่ว่ามันจะเก่งแค่ไหน

เหล่านั้นเป็นการสาธิตที่ผู้ขายจัดทำขึ้นเอง โดยมีงานที่ผู้ขายเป็นผู้เลือก และส่วนระเบียบวิธีวิจัยก็ระบุไว้เช่นนั้น กระนั้น สิ่งเหล่านี้ก็ยังเป็นภาพที่ชัดเจนที่สุดเท่าที่ใคร ๆ เคยเผยแพร่ ว่าแบบจำลองการตัดสินใจมีไว้เพื่ออะไร

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57, and its latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

รันที่ไหน และมีค่าใช้จ่ายเท่าไรในการเรียก

เวตแบบเปิดถูกสร้างขึ้นสำหรับการรันในเครื่อง และผู้ขายได้ทำงานผสานรวมไว้ล่วงหน้าแล้ว: รองรับ llama.cpp ตั้งแต่วันแรก สแตก NVIDIA แบบครบชุดตั้งแต่ DGX ลงไปจนถึง Jetson การควอนไทซ์ NVFP4 และเวอร์ชันเวต/แอ็กติเวชันแบบ 8 บิตที่เผยแพร่เคียงข้างเช็กพอยต์พื้นฐาน การแปลงเป็น GGUF มีอยู่แล้วบน Hugging Face หากคุณไม่อยากโฮสต์อะไรด้วยตัวเอง Liquid ให้บริการ d1 แบบโฮสต์จาก API ของตัวเอง — คิดเฉพาะโทเคนอินพุต ไม่คิดโทเคนเอาต์พุต โดยรูปภาพคิดเป็นอินพุตที่ 1.5 โทเคนต่อแพตช์ขนาด 32×32 พิกเซล ซึ่งทำให้รูปภาพขนาด 1024×1024 คิดเป็น 1,536 โทเคน นอกจากนี้ยังมีการเข้าถึงแบบข้อความล้วนผ่านแพลตฟอร์มของบุคคลที่สามด้วย

บันทึกการจัดเส้นทางตามจริง: ทั้ง Liquid AI d1-3B และ Liquid AI d1-omni-600M ต่างก็ไม่ได้อยู่ในแคตตาล็อกของเรา และบทความนี้ไม่ใช่การยืนยันความพร้อมใช้งานสำหรับตัวใดตัวหนึ่ง สิ่งที่คู่ d1 เปลี่ยนแปลงสำหรับเราเตอร์คือรูปร่างของไปป์ไลน์ที่อยู่รอบ ๆ มัน โมเดลตัดสินใจที่ตอบในระดับมิลลิวินาทีและไม่มีค่าใช้จ่ายในโทเคนเอาต์พุตคือตัวกรอง ไม่ใช่สิ่งทดแทน — การคัดแยกของดีและของเสียและการคัดแยกตั๋วเกิดขึ้นก่อนการเรียกใช้แบบเจเนอเรทีฟ และการเรียกใช้แบบเจเนอเรทีฟคือจุดที่ปลายทางเดียวที่ครอบคลุม 200+ โมเดล, ราคาตามรายการที่ส่งผ่านที่มาร์กอัป 0% และ การสลับไปยังระบบสำรองอัตโนมัติจึงคุ้มค่าจริง ๆ ต่างเลเยอร์ ไปป์ไลน์เดียวกัน

อะไรจะทำให้ข้อโต้แย้งยุติลง

ยังมีสามเรื่องที่ยังไม่คลี่คลาย และทั้งสามก็เป็นเรื่องประเภทที่ต้องอาศัยเวลาเท่านั้นจึงจะปิดลงได้

ข้อแรกคือการทำซ้ำโดยอิสระ ตัวเลข Decision Index ถูกสร้างโดยผู้จำหน่ายด้วยตัวให้คะแนนอย่างเป็นทางการ และทุกแถวของคู่แข่งถูกหยิบมาจากลีดเดอร์บอร์ดสาธารณะ ซึ่งเป็นวิธีที่ปกป้องได้และไม่ใช่สิ่งเดียวกับการที่บุคคลที่สามเป็นผู้รันโมเดลของคุณ ข้อที่สองคือเสียง เช็กพอยต์ขนาด 600M ที่จัดเส้นทางคำสั่งเสียงในฟอร์เวิร์ดพาสเดียวเป็นความสามารถใหม่จริง ๆ และไม่มีเบนช์มาร์กใดในโลกที่วัดว่ามันทำสิ่งนั้นได้ดีเพียงใด ข้อที่สามคือหมวดหมู่เอง เมื่อคำตอบถูกอ่านออกมาจากการแจกแจงแทนที่จะเขียนออกมา โหมดความล้มเหลวตามปกติของโมเดลขนาดเล็ก — วนซ้ำ, หลุดประเด็น, ปฏิเสธ, หลอนรูปแบบ — ย่อมเกิดขึ้นไม่ได้ และยังไม่มีใครเผยแพร่คำอธิบายที่ดีว่าอะไรเข้ามาแทนที่สิ่งเหล่านั้น ค่าความผิดพลาดจากการคาลิเบรตเป็นตัวเลือกที่ชัดเจน และมันเป็นสิ่งที่ฟิลด์ความเชื่อมั่นบนทุกคำตอบเชิญชวนให้คุณวัดด้วยตัวคุณเอง

เดโมสิบตัวรัน Liquid AI d1-3B วนซ้ำกับอินพุตจากกล้องสดใน Hugging Face space สาธารณะ ซึ่งเป็นวิธีที่ถูกที่สุดในการสร้างความเห็นของคุณเอง ค่าน้ำหนักนั้นฟรี และคำถามก็เจาะจง นั่นเป็นจุดเริ่มต้นที่ดีกว่าที่การเปิดตัวส่วนใหญ่ในปีนี้มอบให้

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube