
Liquid AI d1-3B และ d1-omni-600M: น้ำหนักแบบเปิดสำหรับโมเดลที่ไม่เคยเขียนสักคำ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Liquid AI d1-3B และ Liquid AI d1-omni-600M ขึ้นบน Hugging Face เมื่อวันที่ 7 ตุลาคม 2026 และเช็กพอยต์ทั้งสองมีคุณสมบัติที่ทำให้ตารางเปรียบเทียบทุกตารางที่คุณอ่านมาปีนี้มีรูปร่างผิดไป ทั้งสองไม่ได้สร้างข้อความ คุณป้อนสถานะให้ Liquid AI d1-3B — ใบแจ้งปัญหา เพย์โหลด JSON ภาพถ่าย หรือทั้งสามอย่างพร้อมกัน — และชุดคำถามที่มีชื่อ แล้วมันจะส่งคำตอบที่ดึงมาจากการแจกแจงของโมเดลเหนือตัวเลือกของคุณโดยตรง ใช่/ไม่ใช่เป็นค่าความน่าจะเป็น การเลือกจากป้ายกำกับพร้อมค่าความเชื่อมั่นและเวกเตอร์ความน่าจะเป็นแบบเต็ม ตำแหน่งบนสเกลแบบเรียงลำดับ ไม่มีขั้นตอนการสุ่ม ไม่มี JSON ให้แยกวิเคราะห์ ไม่มีการสร้างข้อความที่หลุดควบคุม และตัวนับการใช้งานของผู้จำหน่ายรายงานสิ่งนี้อย่างตรงไปตรงมา: output_tokens: 0. โมเดล 3B เป็นจุดเด่น — มันทำคะแนน 48.57 บน Decision Index 0.2.1 ที่ผู้จำหน่ายให้คะแนน นำหน้าทุกอย่างที่ต่ำกว่า 10B และนำหน้าโมเดลตัดสินใจที่มีขนาดใหญ่กว่าสิบสองเท่า โมเดลพี่น้อง 600M คือตัวที่ควรจับตา: มันอ่านภาพและเสียงพูดได้นานถึงสามสิบวินาทีผ่านน้ำหนักทรังค์เดียวกัน และถูกระบุว่าเป็นรุ่นวิจัยระยะแรก
แบบจำลองการตัดสินใจคืออะไร ในหนึ่งย่อหน้า
หมวดหมู่นี้ก่อตัวมานานหนึ่งปีภายใต้ชื่ออย่างโมเดลระบบหนึ่งและตัวจำแนกที่ไม่ใช่ตัวจำแนก และคู่ d1 คือคำอธิบายที่ชัดเจนที่สุดของหมวดนี้จนถึงตอนนี้ โมเดลเชิงสร้างจะถูกถามคำถามและเขียนคำตอบ คำตอบนั้นต้องถูกแยกวิเคราะห์ การแยกวิเคราะห์อาจล้มเหลว และทุกโทเคนที่มันเขียนทำให้คุณเสียเงินและเวลา โมเดลตัดสินใจจะถูกถามคำถามและรายงานสิ่งที่มันเชื่ออยู่แล้ว คำถามของ Liquid มีสามประเภท noul เป็นคำถามแบบใช่/ไม่ใช่ โดยตอบด้วย P(yes) ระหว่าง 0 ถึง 1 choice เลือกหนึ่งป้ายกำกับจากชุดที่มีชื่อ และคืนค่าป้ายกำกับ ค่าความเชื่อมั่น และความน่าจะเป็นของแต่ละตัวเลือก score จัดวางสถานะบนสเกลแบบเรียงลำดับที่มีสองถึงสิบระดับ และคืนค่าระดับที่คาดหมายพร้อมการกระจายและคำอธิบายสัญลักษณ์ สถานะหนึ่งสามารถมีคำถามหลายข้อได้ในคราวเดียว และสถานะกับภาพของสถานะนั้นถูกอ่านเพียงครั้งเดียวสำหรับคำถามทั้งหมดเหล่านั้น
คุณสมบัติข้อสุดท้ายนั่นแหละคือเหตุผลทางธุรกิจทั้งหมด การถามสามคำถามเกี่ยวกับตั๋วใบเดียวใช้เวลาเป็น 1.3 เท่าของการถามหนึ่งคำถาม ไม่ใช่ 3 เท่า เพราะโมเดลทำ forward pass เพียงครั้งเดียวบนอินพุต แล้วอ่านคำตอบหลายคำตอบออกมาจากอินพุตนั้น ไม่มีอะไรต้องเขียน ดังนั้นจึงไม่มีอะไรที่ต้องเขียนได้แย่
3B และ 600M ถูกสร้างขึ้นจากทิศทางที่ตรงกันข้าม
นี่คือจุดที่การเปิดตัวครั้งนี้กลายเป็นเรื่องน่าสนใจในทางเทคนิค และเป็นส่วนที่สื่อที่รายงานข่าวการเปิดตัวมักข้ามไปเสียเป็นส่วนใหญ่ โมเดลทั้งสองไม่ได้สืบสายมาจากต้นตระกูลเดียวกัน
Liquid AI d1-3B สืบทอดมาจาก LFM2.5-VL-3B ซึ่งเป็นโมเดลภาพ-ภาษาแบบ decoder-only ของผู้จำหน่าย โดยมีพารามิเตอร์ 3.12B พร้อมตัวเข้ารหัสภาพ SigLIP2 NaFlex ขนาด 400M ที่ปรับแต่งรูปร่างให้เหมาะสม หน้าต่างบริบท 32,768 โทเคน คำศัพท์ 128,000 โทเคน และภาษาที่มีเอกสารรองรับ 16 ภาษา ในการสร้างมัน Liquid ได้เฉลี่ยค่าน้ำหนักของ LFM2.5-2.6B กับแกนข้อความของ LFM2.5-VL-3B ปรับแต่งเช็กพอยต์จากเมล็ดสุ่มและส่วนผสมข้อมูลหลายชุด แล้วรวมผลลัพธ์อีกครั้ง บทสรุปของผู้จำหน่ายเองเกี่ยวกับสิ่งที่สำคัญนั้นเรียบง่ายอย่างน่าสดชื่น: การฝึกด้วยอินพุตยาว การสลับลำดับตัวเลือกคำตอบ และการตามล่าหาทางลัดในข้อมูลฝึก ช่วยผลลัพธ์สุดท้ายได้มากกว่าเทคนิคขั้นสูงใด ๆ
Liquid AI d1-omni-600M สืบทอดมาจาก LFM2.5-Encoder-350M ซึ่งเป็นเอนโคเดอร์แบบสองทิศทาง — เป็นเครือข่ายต่างชนิดกันโดยสิ้นเชิง โดยมีพารามิเตอร์รวม 587 ล้าน แบ่งเป็นทรังก์ร่วมและหัวตัดสินใจ 381 ล้าน เอนโคเดอร์ภาพ 94 ล้านที่ยืมมาจาก LFM2.5-VL-450M และเอนโคเดอร์เสียง 112 ล้านที่สร้างจาก FastConformer 17 ชั้น ทุกโมดัลวิ่งผ่านน้ำหนักทรังก์ชุดเดียวกัน คอนเท็กซ์ของมันคือ 16,384 โทเคน ครอบคลุมตำแหน่งของข้อความ ภาพ และเสียงรวมกัน และเมื่อแนบภาพมา ข้อความสถานะและคำถามจะถูกตัดเหลือ 896 โทเคน เพราะนั่นคือสิ่งที่มันถูกเทรนมา ส่วนเสียงมีการเตือนหนึ่งข้อที่การ์ดระบุไว้อย่างไม่ลังเลว่า ความสามารถนี้ถูกเทรนจากคำขอระหว่างผู้พูดภาษาอังกฤษกับผู้ช่วย และคลิปจะถูกตัดที่สามสิบวินาที
ดังนั้น ตระกูลนี้จึงไม่ใช่โมเดลเดียวที่มีสองขนาด แต่เป็นตัวถอดรหัสและตัวเข้ารหัสที่ถูกฝึกภายหลังให้ทำงานเดียวกันด้วยกลไกที่แตกต่างกันอย่างสิ้นเชิงสองแบบ โดยตัวหนึ่งมองเห็น และอีกตัวหนึ่งได้ยิน

ตัวเลข และของใคร
ทุกตัวเลขในส่วนนี้เป็นของ Liquid เอง แถว Decision Index สำหรับโมเดล d1 ถูกให้คะแนนโดยผู้ขายโดยใช้ตัวให้คะแนนอย่างเป็นทางการ — ไม่ได้ส่งไปยังลีดเดอร์บอร์ด — ในขณะที่แถวของคู่แข่งทุกแถวมาจากลีดเดอร์บอร์ดสาธารณะที่ v0.2.1 ยังไม่มีแล็บอิสระใดทำซ้ำข้อมูลใด ๆ เหล่านี้ได้ และโมเดลมีอายุได้สองวัน ณ เวลาที่เขียนข้อความนี้
• Decision Index 0.2.1 — Liquid AI d1-3B ได้คะแนน 48.57 โดยมีคะแนนย่อย ได้แก่ ความรู้ 23.8, ภาษา 56.4, การค้นคืน 52.8, เครื่องมือ 74.5 และศิลปะ 36.3 Liquid AI d1-omni-600M ได้คะแนน 15.95 โดยเครื่องมืออยู่ที่ 15.1
• ตำแหน่งที่ 48.57 อยู่ — เป็นอันดับหนึ่งในทุกอย่างที่ต่ำกว่า 10B ในตารางที่ผู้ขายเผยแพร่ และนำหน้า Decider 35B-A3B ที่ 47.11 โดยรวมแล้วเป็นอันดับสอง รองจาก Winnow-12B ที่ 50.02 ซึ่งมีขนาดใหญ่เป็นสี่เท่า
• เกณฑ์มาตรฐานด้านข้อความ ตามรายงานของผู้ขาย — d1-3B เฉลี่ย 82.9 จากเกณฑ์มาตรฐานสาธารณะเจ็ดรายการ สูงกว่า 81.1 ของ Decider 4B; d1-omni-600M เฉลี่ย 78.4 ซึ่งเอาชนะ 77.1 ของ Decider 2B ด้วยจำนวนพารามิเตอร์เพียงประมาณหนึ่งในสี่ ส่วน 600M ทำคะแนนความเป็นพิษดีที่สุดในตาราง (Civil Comments 95.8) และคะแนนการถอดความดีที่สุด (PAWS-X 79.5)
• ความสามารถด้านการมองเห็น ตามที่ผู้ขายรายงาน — d1-3B มีค่าเฉลี่ย 74.1 จากเบนช์มาร์กภาพสาธารณะ 11 รายการ โดยอ่านผลเป็นการตัดสินใจเลือกจากตัวเลือกของแต่ละเบนช์มาร์ก เทียบกับ 73.9 สำหรับแบ็กโบน LFM2.5-VL-3B ของมัน การเอารูปภาพออกทำให้คำถามชุดเดียวกันลดลงเหลือ 45.1 ซึ่งเป็นวิธีที่ผู้ขายแสดงให้เห็นว่าคำตอบมาจากพิกเซล
• ความหน่วงที่วัดโดยผู้จำหน่าย — หนึ่งคำถามใช้เวลา 8 มิลลิวินาทีบน RTX 4090 และ 9 มิลลิวินาทีบน AMD MI325X; 16 มิลลิวินาทีบน Jetson AGX Thor, 26 มิลลิวินาทีบน Jetson AGX Orin 64 GB, 50 มิลลิวินาทีบน Jetson Orin Nano รุ่นเล็กที่สุด และ 30 มิลลิวินาทีบน Apple M5 Pro การประมวลผล 64 สถานะที่อัดแน่นในพาสเดียวทำได้ 475 ครั้งต่อวินาทีบน 4090
• สิ่งที่ขาดหายไป — d1-omni-600M ไม่มีตารางการอนุมานเลย Liquid กล่าวว่ายังอยู่ระหว่างการพัฒนาอย่างต่อเนื่อง และเพียงไม่รายงานค่าความหน่วงของมัน นอกจากนี้ยังไม่มีเบนช์มาร์กการตัดสินใจด้านเสียงที่ใดเลยในเวอร์ชันเผยแพร่นี้ เพราะตามคำพูดของผู้ขาย เบนช์มาร์กการตัดสินใจด้านเสียงโดยเฉพาะในปัจจุบันยังเป็นปัญหาที่เปิดอยู่
คำกล่าวอ้างที่การเปิดตัวนี้กำลังสื่อออกมาจริง ๆ
สองวันก่อนที่น้ำหนักโมเดลจะถูกเผยแพร่ Liquid ได้เผยแพร่เวอร์ชันโฮสต์ของโมเดลนี้ และทดสอบเทียบกับ GPT-6.1 Sol และ Claude Opus 5.5 บนแอปพลิเคชันหกตัว สรุปของมันคือ: d1 ทำได้เทียบเท่าหรือดีกว่า GPT-6.1 Sol ในสี่จากหกตัว มีต้นทุนต่ำกว่า 19 เท่าถึง 200 เท่า และตอบเร็วกว่าในทุกงาน ระเบียบวิธีที่เผยแพร่นั้นน่าอ่านก่อนจะกล่าวซ้ำเรื่องใด ๆ เหล่านั้น — แอปพลิเคชันแต่ละตัวถูกรันหนึ่งครั้งต่อโมเดลเมื่อวันที่ 5 ตุลาคม 2026 โมเดลแชตตอบเป็น JSON ด้วยการตั้งค่าการให้เหตุผลเริ่มต้น และต้นทุนของ d1 คำนวณที่ $0.04 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น
เดโมคือครึ่งที่โน้มน้าวใจกว่า การแยกชิ้นส่วนดีและชำรุดจากสี่สายการผลิต — แผงวงจร เทียน เม็ดมะม่วงหิมพานต์ หมากฝรั่ง — ด้วยความแม่นยำ 85 ถึง 97% บนโมเดลที่ไม่เคยถูกฝึกมาสำหรับงานนี้และเข้าใจงานได้จากคำอธิบายสั้น ๆ เพรดิเคต SQL ที่ตอบใช่หรือไม่ใช่สำหรับตั๋วสนับสนุน 150 ใบ ลูปการบีบอัดบริบทที่อ่านเอาต์พุตของเครื่องมือแต่ละรายการในเซสชันของเอเจนต์เขียนโค้ด แล้วเก็บ ตัดทอน หรือทิ้งมัน โดยกำจัด 52% ของโทเคน ขณะที่ยังคงเอาต์พุตทุกอย่างที่งานต้องการไว้ ใน Tetris การเพิ่มหน้าจอให้เกมที่อธิบายเป็นข้อความได้ทั้งหมดทำให้คะแนนเพิ่มจาก 70 เส้นที่เคลียร์เป็น 81 — ผลลัพธ์ด้านวิชันที่คุณไม่สามารถได้จากตัวจำแนกแบบข้อความล้วน ไม่ว่ามันจะเก่งแค่ไหน
เหล่านั้นเป็นการสาธิตที่ผู้ขายจัดทำขึ้นเอง โดยมีงานที่ผู้ขายเป็นผู้เลือก และส่วนระเบียบวิธีวิจัยก็ระบุไว้เช่นนั้น กระนั้น สิ่งเหล่านี้ก็ยังเป็นภาพที่ชัดเจนที่สุดเท่าที่ใคร ๆ เคยเผยแพร่ ว่าแบบจำลองการตัดสินใจมีไว้เพื่ออะไร

รันที่ไหน และมีค่าใช้จ่ายเท่าไรในการเรียก
เวตแบบเปิดถูกสร้างขึ้นสำหรับการรันในเครื่อง และผู้ขายได้ทำงานผสานรวมไว้ล่วงหน้าแล้ว: รองรับ llama.cpp ตั้งแต่วันแรก สแตก NVIDIA แบบครบชุดตั้งแต่ DGX ลงไปจนถึง Jetson การควอนไทซ์ NVFP4 และเวอร์ชันเวต/แอ็กติเวชันแบบ 8 บิตที่เผยแพร่เคียงข้างเช็กพอยต์พื้นฐาน การแปลงเป็น GGUF มีอยู่แล้วบน Hugging Face หากคุณไม่อยากโฮสต์อะไรด้วยตัวเอง Liquid ให้บริการ d1 แบบโฮสต์จาก API ของตัวเอง — คิดเฉพาะโทเคนอินพุต ไม่คิดโทเคนเอาต์พุต โดยรูปภาพคิดเป็นอินพุตที่ 1.5 โทเคนต่อแพตช์ขนาด 32×32 พิกเซล ซึ่งทำให้รูปภาพขนาด 1024×1024 คิดเป็น 1,536 โทเคน นอกจากนี้ยังมีการเข้าถึงแบบข้อความล้วนผ่านแพลตฟอร์มของบุคคลที่สามด้วย
บันทึกการจัดเส้นทางตามจริง: ทั้ง Liquid AI d1-3B และ Liquid AI d1-omni-600M ต่างก็ไม่ได้อยู่ในแคตตาล็อกของเรา และบทความนี้ไม่ใช่การยืนยันความพร้อมใช้งานสำหรับตัวใดตัวหนึ่ง สิ่งที่คู่ d1 เปลี่ยนแปลงสำหรับเราเตอร์คือรูปร่างของไปป์ไลน์ที่อยู่รอบ ๆ มัน โมเดลตัดสินใจที่ตอบในระดับมิลลิวินาทีและไม่มีค่าใช้จ่ายในโทเคนเอาต์พุตคือตัวกรอง ไม่ใช่สิ่งทดแทน — การคัดแยกของดีและของเสียและการคัดแยกตั๋วเกิดขึ้นก่อนการเรียกใช้แบบเจเนอเรทีฟ และการเรียกใช้แบบเจเนอเรทีฟคือจุดที่ปลายทางเดียวที่ครอบคลุม 200+ โมเดล, ราคาตามรายการที่ส่งผ่านที่มาร์กอัป 0% และ การสลับไปยังระบบสำรองอัตโนมัติจึงคุ้มค่าจริง ๆ ต่างเลเยอร์ ไปป์ไลน์เดียวกัน
อะไรจะทำให้ข้อโต้แย้งยุติลง
ยังมีสามเรื่องที่ยังไม่คลี่คลาย และทั้งสามก็เป็นเรื่องประเภทที่ต้องอาศัยเวลาเท่านั้นจึงจะปิดลงได้
ข้อแรกคือการทำซ้ำโดยอิสระ ตัวเลข Decision Index ถูกสร้างโดยผู้จำหน่ายด้วยตัวให้คะแนนอย่างเป็นทางการ และทุกแถวของคู่แข่งถูกหยิบมาจากลีดเดอร์บอร์ดสาธารณะ ซึ่งเป็นวิธีที่ปกป้องได้และไม่ใช่สิ่งเดียวกับการที่บุคคลที่สามเป็นผู้รันโมเดลของคุณ ข้อที่สองคือเสียง เช็กพอยต์ขนาด 600M ที่จัดเส้นทางคำสั่งเสียงในฟอร์เวิร์ดพาสเดียวเป็นความสามารถใหม่จริง ๆ และไม่มีเบนช์มาร์กใดในโลกที่วัดว่ามันทำสิ่งนั้นได้ดีเพียงใด ข้อที่สามคือหมวดหมู่เอง เมื่อคำตอบถูกอ่านออกมาจากการแจกแจงแทนที่จะเขียนออกมา โหมดความล้มเหลวตามปกติของโมเดลขนาดเล็ก — วนซ้ำ, หลุดประเด็น, ปฏิเสธ, หลอนรูปแบบ — ย่อมเกิดขึ้นไม่ได้ และยังไม่มีใครเผยแพร่คำอธิบายที่ดีว่าอะไรเข้ามาแทนที่สิ่งเหล่านั้น ค่าความผิดพลาดจากการคาลิเบรตเป็นตัวเลือกที่ชัดเจน และมันเป็นสิ่งที่ฟิลด์ความเชื่อมั่นบนทุกคำตอบเชิญชวนให้คุณวัดด้วยตัวคุณเอง
เดโมสิบตัวรัน Liquid AI d1-3B วนซ้ำกับอินพุตจากกล้องสดใน Hugging Face space สาธารณะ ซึ่งเป็นวิธีที่ถูกที่สุดในการสร้างความเห็นของคุณเอง ค่าน้ำหนักนั้นฟรี และคำถามก็เจาะจง นั่นเป็นจุดเริ่มต้นที่ดีกว่าที่การเปิดตัวส่วนใหญ่ในปีนี้มอบให้

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
