
Liquid AI d1-omni-600M vs Liquid AI d1-3B: ครึ่งไหนของตระกูล d1 ที่คุณต้องการจริง ๆ?
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Liquid AI d1-omni-600M และ Liquid AI d1-3B ถูกอัปโหลดขึ้น Hugging Face ห่างกันภายในแปดชั่วโมงเมื่อวันที่ 5 ตุลาคม 2026 และเปิดตัวพร้อมกันในประกาศเดียวกันเมื่อวันที่ 7 ตุลาคม ซึ่งทำให้คำถามปกติ — อันไหนใหม่กว่า อันไหนดีกว่า — กลายเป็นคำถามที่ผิด พวกมันคือสองปลายของข้อแลกเปลี่ยนที่จงใจ Liquid AI d1-3B คือชิ้นงานที่เสร็จสมบูรณ์: พารามิเตอร์ 3.12B, คะแนน 48.57 บน Decision Index 0.2.1 ที่ผู้ขายให้คะแนน, ตาราง benchmark, ความหน่วงที่วัดลงไปถึง Jetson Orin Nano และตำแหน่งที่โพสต์เปิดตัวบรรยายว่าเป็นคุณภาพการตัดสินใจสูงสุดในขนาดของมัน Liquid AI d1-omni-600M คือการทดลอง: พารามิเตอร์ 587M, คะแนน 15.95 บนดัชนีเดียวกัน, อินพุตเสียงที่รุ่น 3B ไม่มี และการ์ดโมเดลที่บอกตรง ๆ ว่าเป็นรุ่นวิจัยช่วงต้นที่ไม่มีตัวเลข inference เพราะยังอยู่ระหว่างการพัฒนาอย่างต่อเนื่อง การเลือกระหว่างสองรุ่นนี้ไม่ใช่การตัดสินใจเรื่องคุณภาพ แต่เป็นการตัดสินใจว่าคุณต้องการมัลติโมดัลลิตีเพิ่มเติมที่ปลายล่างของตระกูล หรือความแม่นยำเพิ่มเติมที่ปลายบน และตัวเลขต่าง ๆ สอดคล้องไปกับจุดแยกนั้นแทนที่จะทำให้มันพร่ามัว
ทุกสิ่งด้านล่างนี้มาจากการ์ดโมเดลทั้งสองใบและโพสต์เปิดตัววันที่ 7 ตุลาคม โดยยึดตามการติดป้ายชื่อของโพสต์เปิดตัวเอง: แถว d1 บน Decision Index ถูกให้คะแนนโดย Liquid AI ด้วยตัวให้คะแนนอย่างเป็นทางการ แทนที่จะถูกส่งเข้าสู่กระดานผู้นำสาธารณะ และไม่มีสิ่งใดในนี้ที่ถูกทำซ้ำขึ้นมาอย่างอิสระ
แกนหลักสองแกนที่ไม่มีทางมาบรรจบกัน
ตระกูล d1 ไม่ได้ย่อสูตรใดสูตรหนึ่งลงเลย เช็กพอยต์ทั้งสองเริ่มจากปลายตรงข้ามของแค็ตตาล็อกโมเดลของ Liquid และมาบรรจบกันตรงกลาง
Liquid AI d1-3Bสร้างขึ้นบนพื้นฐานของ LFM2.5-VL-3B ซึ่งเป็นโมเดลภาษา-ภาพแบบ decoder-only ของผู้พัฒนา ตั้งแต่เดือนสิงหาคม 2026 ฐานของมันสร้างขึ้นโดยการเฉลี่ยค่าน้ำหนักของ LFM2.5-2.6B กับแกนหลักทางข้อความของ LFM2.5-VL-3B จากนั้นจึงปรับแต่ง checkpoint ภายใต้ random seed และส่วนผสมข้อมูลที่แตกต่างกัน ก่อนจะรวมเข้าด้วยกันอีกครั้ง โดยมีตัวเข้ารหัสภาพขนาด 400M แบบ SigLIP2 NaFlex ที่ปรับให้เหมาะกับรูปร่าง上下文 32,768 โทเค็น คำศัพท์ 128,000 โทเค็น และภาษาที่มีเอกสารรองรับ 16 ภาษา
Liquid AI d1-omni-600M มาจากอีกทิศทางหนึ่ง ลำตัวหลักของมันคือ LFM2.5-Encoder-350M ซึ่งเป็นตัวเข้ารหัสแบบสองทิศทาง ถูกปรับละเอียดบนงานตัดสินใจก่อน จากนั้นจึงขยายเป็นระยะ ๆ — ตัวเข้ารหัส FastConformer 17 เลเยอร์บวกอะแดปเตอร์สำหรับเสียง โดยตัวเข้ารหัสเสียงถูกปรับละเอียดในภายหลังกับแกนข้อความที่ถูกแช่แข็ง จากนั้นหอคอย SigLIP2 ที่ยกมาจาก LFM2.5-VL-450M พร้อมอะแดปเตอร์และการอัปเดต LoRA ไปยังแกนหลักสำหรับภาพ โมเดลสุดท้ายถูกรวมจากการอัปเดต LoRA และเฉลี่ยกับเช็กพอยต์ก่อนหน้า มันลงเอยที่ 587M พารามิเตอร์ทั้งหมด: แกนร่วมและหัวตัดสินใจ 381M ตัวเข้ารหัสภาพ 94M และตัวเข้ารหัสเสียง 112M
Decoder-only กับ bidirectional คือส่วนที่ต้องยึดไว้ให้แน่น 3B อ่านสถานะและสร้างการตัดสินใจในลักษณะเดียวกับที่โมเดลภาษาสร้างลำดับโทเคน ทีละทิศทาง ส่วน 600M อ่านสถานะทั้งหมดในครั้งเดียวแล้วตัดสินใจ ซึ่งเป็นสิ่งที่คุณคาดว่าจะเห็นได้จาก encoder ที่ไม่ได้ถูกออกแบบมาให้สร้างข้อความ ทั้งคู่ได้รับการฝึกให้รายงานคำตอบจากการแจกแจงของโมเดลโดยไม่มีโทเคนเอาต์พุต แต่กลไกเบื้องหลังไม่ใช่โมเดลประเภทเดียวกัน และช่องว่างความแม่นยำด้านล่างคือต้นทุนที่มองเห็นได้ของดีไซน์ที่เล็กกว่าและมีรูปทรงแบบ encoder
การกระจายของ Decision Index กว้าง และคะแนนย่อยน่าสนใจกว่าคะแนนรวม
บน Decision Index 0.2.1 Liquid รายงาน 48.57 สำหรับ Liquid AI d1-3B และ 15.95 สำหรับ Liquid AI d1-omni-600M เทียบกับ 50.02 สำหรับ Winnow-12B นั่นคือช่องว่าง 32 จุดระหว่างเช็กพอยต์สองตัวที่เปิดตัววันเดียวกันโดยแล็บเดียวกัน และการอ่านคะแนนย่อยทั้งห้าอธิบายได้ว่ามันมาจากไหน
• ความรู้ — 23.8 สำหรับ Liquid AI d1-3B เทียบกับ 8.3 สำหรับ Liquid AI d1-omni-600M
• ภาษา — 56.4 เทียบกับ 12.9
• การดึงข้อมูล — 52.8 เทียบกับ 35.0
• เครื่องมือ — 74.5 เทียบกับ 15.1
• ศิลปะ — 36.3 เทียบกับ 6.8
การค้นคืนเป็นจุดเดียวที่โมเดลขนาดเล็กยืนหยัดได้ โดยสูญเสียคะแนนน้อยกว่าหนึ่งในสามของคะแนนที่ 3B ทำได้ ในขณะที่อีกสี่หมวดหมู่ที่เหลือ มันสูญเสียไป 60 ถึง 80 เปอร์เซ็นต์ รูปแบบนั้นสอดคล้องกับสิ่งที่ 600M เป็น: เอนโคเดอร์ที่ผ่านการฝึกซึ่งมีความสามารถในการเป็นตัวแทนจริงสำหรับการจับคู่สถานะกับเนื้อหา และมีความสามารถแบบหลายชั้นน้อยกว่ามาก ซึ่ง 3B สืบทอดมาจากเดคโคเดอร์ที่ถูกฝึกมาก่อนด้วยข้อมูลภาษาที่มากกว่ามาก ถ้าภาระงานของคุณเป็นการตัดสินใจในรูปแบบการค้นคืน — ข้อความนี้ตอบคำถามนี้หรือไม่ เอกสารใดในบรรดาเอกสารเหล่านี้ที่เกี่ยวข้อง — โปรไฟล์ของ 600M ก็แย่น้อยกว่าที่คะแนนรวมบ่งชี้ ถ้าภาระงานของคุณเป็นการตัดสินใจจัดเส้นทางเครื่องมือ ช่องว่าง 51 จุดในคอลัมน์นั้นคือตัวเลขที่ต้องจ้องไว้
ตาราง benchmark ด้านข้อความเล่าเรื่องที่อ่อนกว่าดัชนี ซึ่งเป็นสิ่งที่ควรรู้ก่อนที่จะนำตัวเลขใดตัวเลขหนึ่งไปใช้เพื่อสนับสนุนข้อโต้แย้ง บน benchmark สาธารณะเจ็ดรายการ 3B นำด้วยค่าเฉลี่ย 82.9 และ 600M ทำได้ถึง 78.4 อันที่จริง 600M แพ้อย่างหวุดหวิดบน SQuAD 2.0 (74.0 ต่อ 85.3), PubMedQA (61.3 ต่อ 66.0), BoolQ (77.7 ต่อ 86.7) และ XNLI (74.7 ต่อ 85.0) แต่ชนะบนการตรวจจับความเป็นพิษของ Civil Comments (95.8 ต่อ 93.0) และบนการระบุข้อความถอดความ PAWS-X (79.5 ต่อ 76.9) กรอบที่ Liquid เองวางไว้คือ 600M เอาชนะค่าเฉลี่ย 77.1 ของ Decider 2B ได้ด้วยพารามิเตอร์เพียงหนึ่งในสี่ benchmark สองชุด คำตัดสินที่ดูเหมือนต่างกันสองแบบ ทั้งคู่ถูกรายงานโดยผู้ขาย — นั่นคือสิ่งที่หลักฐานสนับสนุน และไม่มากไปกว่านั้น

สิ่งที่ 600M มี แต่ 3B ไม่มี
เหตุผลที่ยอมรับช่องว่างดัชนี 32 จุดได้ก็คือ Liquid AI d1-omni-600M ทำสิ่งหนึ่งที่ Liquid AI d1-3B ทำไม่ได้ และมันไม่ใช่ความแตกต่างด้านความเที่ยงตรง
• เสียง — Liquid AI d1-omni-600M รองรับคำพูดได้สูงสุด 30 วินาทีต่อคำขอผ่านตัวเข้ารหัส FastConformer ของตน; Liquid AI d1-3B ไม่รองรับเลย
• การผสมโมดาลิตี — รุ่น 600M ยอมรับข้อความพร้อมรูปภาพ หรือข้อความพร้อมเสียง และจะเกิด ValueError หากทั้งสองมาพร้อมกัน; รุ่น 3B รับข้อความและรูปภาพ
• หน้าต่างบริบท — 16,384 โทเคนครอบคลุมตำแหน่งข้อความ รูปภาพ และเสียงสำหรับรุ่น 600M โดยข้อความจะถูกตัดให้เหลือ 896 โทเคนเมื่อมีรูปภาพ; 32,768 โทเคนสำหรับรุ่น 3B
• คำศัพท์ — 65,536 สำหรับรุ่น 600M, 128,000 สำหรับรุ่น 3B
• ความแม่นยำ — การ์ด 600M แนะนำให้ใช้ float16 บน GPU และเตือนว่า bfloat16 เปลี่ยนคำตอบอันดับต้นในบางแถว; 3B มาพร้อมการควอนไทซ์ 15 แบบ รวมถึงบิลด์ w8a8
• ภาษา — 600M ระบุ 16 ภาษาในชุดที่ต่างจาก 16 ภาษาของ 3B และเสียงของมันถูกอธิบายว่าฝึกจากบทสนทนาโต้ตอบระหว่างผู้พูดภาษาอังกฤษกับผู้ช่วย ซึ่งเป็นเพียงเสี้ยวแคบ ๆ ของสิ่งที่ฟีดเสียงสำหรับการใช้งานจริงมีอยู่
โน้ตเกี่ยวกับการฝึกด้วยเสียงเป็นสิ่งที่เผลอมองข้ามได้ง่าย และไม่ควรเป็นเช่นนั้น โมเดลที่ฝึกด้วยบทสนทนาภาษาอังกฤษระหว่างผู้พูดกับผู้ช่วยได้เห็นโครงแบบตำแหน่งผู้พูดแบบเดียว โครงสร้างการผลัดกันพูดแบบเดียว และการกระจายสำเนียงแบบเดียว การนำไปใช้กับเสียงคอลเซ็นเตอร์หรือการบันทึกภาคสนามเท่ากับเป็นการเรียกร้องพฤติกรรมที่การ์ดโมเดลไม่ได้กล่าวอ้าง และโพสต์เปิดตัวก็ตรงไปตรงมาว่าไม่มีเกณฑ์มาตรฐานการตัดสินใจด้านเสียงใด ๆ ให้ใช้ตรวจสอบเทียบเคียง — Liquid เรียกสิ่งนั้นว่า "ปัญหาที่ยังเปิดอยู่ในปัจจุบัน" และเชิญชวนชุมชนให้สร้างเกณฑ์ดังกล่าวขึ้นมา

เวลาแฝง: พี่น้องตัวหนึ่งมีตาราง อีกตัวหนึ่งมีเชิงอรรถ
สำหรับโมเดลเพื่อการตัดสินใจ ตัวเลขที่น่าสนใจคือความหน่วงแบบต้นทางถึงปลายทาง เพราะไม่มีขั้นตอนถอดรหัสให้วัดเวลา Liquid เผยแพร่ชุดเต็มสำหรับ 3B และไม่เผยแพร่เลยสำหรับ 600M
• หนึ่งคำถาม — 8 มิลลิวินาทีบน RTX 4090, 9 มิลลิวินาทีบน MI325X, 16 มิลลิวินาทีบน Jetson AGX Thor, 26 มิลลิวินาทีบน Jetson AGX Orin 64 GB, 50 มิลลิวินาทีบน Orin Nano, 30 มิลลิวินาทีบน Apple M5 Pro
• สามคำถามบนสถานะเดียว — 21 ms บน RTX 4090 และ 20 ms บน AGX Thor คิดเป็นประมาณ 1.3 เท่าของต้นทุนคำถามเดียว แทนที่จะเป็น 3 เท่า
• สถานะขนาด 3.4K โทเคน — 102 มิลลิวินาทีบน 4090, 220 มิลลิวินาทีบน Thor, 1,640 มิลลิวินาทีบน Orin Nano
• ปริมาณงานแบบอัดแน่น — 475 การตัดสินใจต่อวินาทีบน RTX 4090, 1,106 ต่อวินาทีบน MI325X
• รูปภาพขนาด 384px — 17 ms บน 4090, 18 ms บน MI325X
ตัวเลขเหล่านั้นอธิบายเฉพาะ Liquid AI d1-3B เท่านั้น สำหรับ Liquid AI d1-omni-600M การ์ดโมเดลระบุว่าไม่มีการรายงานตัวเลขการอนุมาน เนื่องจากโมเดลนี้เป็นรุ่นวิจัยช่วงแรกที่อยู่ระหว่างการพัฒนาอย่างต่อเนื่อง ไม่ใช่ว่าโมเดลเล็กจะช้ากว่า — ตรงกันข้ามเกือบจะแน่นอน เพราะพารามิเตอร์เพียงหนึ่งในห้าไม่ได้ทำให้ช้าลงที่ความแม่นยำเดียวกัน — แต่เป็นเพราะไม่มีตัวเลขอยู่เลย และการอ้างค่ามิลลิวินาทีของ 3B ให้กับ 600M จะเป็นการกุข้อมูลขึ้นมาที่ดูน่าเชื่อถือ สิ่งที่พูดได้โดยไม่ต้องประดิษฐ์อะไรขึ้นมาคือ ที่ความแม่นยำ float16 ซึ่งการ์ดแนะนำ พารามิเตอร์ 587M คิดเป็นน้ำหนักราว 1.2 GB ก่อนแอกติเวชัน ซึ่งเป็นการคำนวณทางคณิตศาสตร์จากจำนวนพารามิเตอร์ที่เผยแพร่ ไม่ใช่การวัด
คาสเคดคือคำตอบที่แท้จริงสำหรับภาระงานส่วนใหญ่
เนื่องจากเช็คพอยต์ทั้งสองถูกปล่อยออกมาพร้อมกัน และคืนค่าอ็อบเจ็กต์ชนิดเดียวกัน — ความน่าจะเป็น, ป้ายกำกับพร้อมค่าความเชื่อมั่น, หรือคะแนนแบบเรียงลำดับ — พวกมันจึงประกอบกันได้ในลักษณะที่โมเดลทั่วไปสองตัวทำไม่ได้ ตัว 600M สามารถคัดกรอง และตัว 3B สามารถตัดสินชี้ขาด ให้คะแนนรายการที่เข้ามาด้วย Liquid AI d1-omni-600M และส่งต่อรายการที่มันจัดไว้ใกล้กึ่งกลางสเกลของตัวเองไปยัง Liquid AI d1-3B เพื่อการตัดสินใจที่แม่นยำยิ่งขึ้น กฎการส่งต่อคือค่าความเชื่อมั่นและการกระจายที่ 600M คืนค่าอยู่แล้ว ดังนั้นตรรกะการจัดเส้นทางจึงไม่ต้องใช้โมเดลเพิ่ม ในเวิร์กโหลดที่มีรายการง่าย ๆ ครองสัดส่วนส่วนใหญ่ที่ชัดเจน ทราฟฟิกส่วนใหญ่จะไม่เคยไปถึง 3B และเงินส่วนใหญ่ก็จะไม่เคยถูกใช้ไป
รูปแบบนี้ยังเป็นเหตุผลที่โมเดลทั้งสองนี้คุ้มค่าที่จะรันอยู่เบื้องหลังเราเตอร์ ผ่าน OrcaRouter ทั้งคู่จะอยู่เบื้องหลัง API key เดียวที่ ราคาตามรายการของผู้ให้บริการแต่ละรายถูกส่งต่อโดยบวกเพิ่ม 0% ดังนั้น cascade จึงเป็นเพียงกฎการจัดเส้นทาง ไม่ใช่การเชื่อมต่อครั้งที่สอง และการยกระดับที่ล้มเหลวในชั้นผู้ให้บริการจะถูกลองใหม่บนตัวสำรองแทนที่จะทำให้คำขอล้มเหลว การสลับไปใช้ตัวสำรองอัตโนมัติสำคัญในกรณีนี้มากกว่าเมื่อเทียบกับโมเดลที่นิ่งแล้ว เพราะครึ่งหนึ่งของคู่นี้เป็น checkpoint ที่ผู้ขายเองก็ระบุว่าพฤติกรรมยังอยู่ระหว่างการพัฒนาอย่างต่อเนื่อง
ไม่มีข้อใดในนั้นเป็นการอ้างความพร้อมใช้งาน และความแตกต่างนี้ควรกล่าวให้ชัดเจนว่า เช็กพอยต์ d1 แบบเปิดไม่ได้อยู่ในแค็ตตาล็อกของเรา แนวทางของผู้จำหน่ายคือดาวน์โหลดเวตและรันในเครื่อง — การรองรับ llama.cpp พร้อมใช้งานตั้งแต่วันแรกบนฮาร์ดแวร์ Apple, AMD, Qualcomm และ NVIDIA — หรือเข้าถึงผ่าน API ของผู้จำหน่ายเองและแพลตฟอร์มของบุคคลที่สาม
การเลือกในครั้งเดียว
หากคุณต้องการข้อความและรูปภาพ และคำตอบต้องถูกต้อง ให้เลือก Liquid AI d1-3B มันมีผลการวัดประสิทธิภาพ ตารางความหน่วง บริบทที่กว้างขึ้น คำศัพท์ที่ใหญ่ขึ้น และการควอนไทซ์ และมันเป็นสมาชิกของคู่ที่ Liquid วางตำแหน่งให้เป็นผู้นำด้านคุณภาพในขนาดของมัน
ถ้าคุณจำเป็นต้องใช้เสียงพูดในเส้นทางการตัดสินใจ ให้ใช้ Liquid AI d1-omni-600M เพราะมันเป็นตัวเลือกแบบโอเพนเวตเพียงตัวเดียวในตระกูลนี้ที่รองรับเสียงได้ด้วยซ้ำ และยอมรับว่าคุณกำลังนำมันมาใช้โดยอาศัยความรู้สึกและเดโมเท่านั้น จนกว่าจะมีใครเผยแพร่ benchmark การตัดสินใจด้านเสียง หรือ vision split ที่ยังไม่เปิดเผย
ถ้าคุณยังไม่รู้ว่าข้อใดในนั้นอธิบายลักษณะงานของคุณ ให้เริ่มจาก 3B และวัดค่าความเชื่อมั่นที่มันส่งกลับมา คะแนนย่อยคือตัวบ่งชี้: งานที่อยู่ในคอลัมน์ Tools หรือ Language จะได้รับบริการที่แย่จาก 600M ขณะที่งานที่มีลักษณะเป็นการค้นคืนคือจุดเดียวที่ checkpoint ขนาดเล็กเข้าใกล้ได้มากกว่าที่คะแนนรวมบอกเป็นนัย ตระกูลนี้มีอยู่เพื่อให้คุณแลกความแม่นยำกับขนาดพื้นที่ และการแลกเปลี่ยนนี้จะปลอดภัยก็ต่อเมื่อคุณรู้ว่างานของคุณอยู่ในคอลัมน์ใด

ผ่าน OrcaRouter โมเดลทั้งสองอยู่เบื้องหลัง API key เดียวที่กฎการกำหนดเส้นทาง แทนที่จะเป็นการผสานรวมชุดที่สอง และหากการยกระดับที่ล้มเหลวในชั้นผู้ให้บริการ จะถูกลองใหม่กับ fallback แทนที่จะทำให้คำขอล้มเหลว
