การ์ดชื่อเรื่องแบบฮีโร่ที่มีหัวข้อว่า 'หนึ่งตัดสินใจ หนึ่งบรรยาย' พร้อมหัวข้อย่อย 'Liquid AI d1-omni-600M vs LFM2.5-VL-3B - open weights, ตุลาคม 2026' และการ์ดสองใบ: Liquid AI d1-omni-600M ที่ 587M พารามิเตอร์ คืนค่าป้ายกำกับหรือคะแนนโดยมี 0 โทเคนเอาต์พุต เทียบกับ LFM2.5-VL-3B ที่ 3.1B พารามิเตอร์ เขียนข้อความและอ่านภาพเพื่อคืนข้อความร้อยแก้ว
Guides & Insights

Liquid AI d1-omni-600M กับ LFM2.5-VL-3B: ตัวหนึ่งตัดสินใจ อีกตัวอธิบาย

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Liquid AI d1-omni-600M และ LFM2.5-VL-3B ต่างก็เป็นโมเดลขนาดเล็ก ทั้งคู่เป็นแบบมัลติโมดัล ทั้งคู่เผยแพร่โดยแล็บเดียวกันบน Hugging Face ภายใต้ลิขสิทธิ์ lfm1.0 เดียวกัน — และการนำมาใช้คู่กันเป็นข้อผิดพลาดเชิงหมวดหมู่ที่กลับกลายเป็นประโยชน์ LFM2.5-VL-3B เปิดตัวเมื่อวันที่ 12 สิงหาคม 2026 ในฐานะโมเดลภาษาภาพสำหรับ Edge ของ Liquid AI: พารามิเตอร์ 3.1B, หน้าต่าง 32,768 โทเคน และเอาต์พุตที่เป็นข้อความร้อยเรียง ป้อนหน้าสแกนให้มัน แล้วมันจะส่งคืนข้อความที่ถอดความพร้อมเลย์เอาต์ออกมาเป็นข้อความ Liquid AI d1-omni-600M ถูกอัปโหลดเมื่อวันที่ 7 ตุลาคม 2026 พร้อมกับสมาชิกอื่นๆ ในตระกูล d1 โอเพน และมันทำสิ่งที่ตรงกันข้ามกับอินพุตเดียวกัน มันเป็นโมเดลการตัดสินใจขนาด 587M พารามิเตอร์: คุณแนบคำถามที่มีชื่อกำกับเข้ากับสถานะ แล้วมันจะรายงานสิ่งที่มันเชื่ออยู่แล้ว — P(yes), ป้ายกำกับที่เลือกพร้อมค่าความเชื่อมั่น, ตำแหน่งบนสเกลเรียงลำดับตั้งแต่สองถึงสิบ — ในการส่งผ่านไปข้างหน้าครั้งเดียว โดยไม่มีโทเคนเอาต์พุตเลย และไม่มีอะไรให้ต้องแยกวิเคราะห์ในขั้นถัดไป ถ้าคุณค้นหา "โมเดล Liquid มัลติโมดัลขนาดเล็ก" ตอนนี้คุณมีสองรูปร่างอยู่ตรงหน้า และรูปทรงนั้นคือการตัดสินใจ

หน้านี้คือสิ่งที่การ์ดโมเดลทั้งสอง โพสต์เปิดตัววันที่ 7 ตุลาคม และตัวคลังเก็บโค้ดเองยืนยันไว้จริง และยังระบุชัดเจนว่าสิ่งเหล่านั้นหยุดอยู่ตรงไหน ไม่มีสิ่งใดในการเปรียบเทียบนี้ที่ถูกทำซ้ำนอก Liquid AI และสำหรับหนึ่งในสองโมเดลนั้น ผู้ขายยังไม่ได้เผยแพร่เกณฑ์วัดความแม่นยำใด ๆ ที่เจาะจงกับความสามารถหลักที่เป็นจุดขายของตัวเองเลย

จุดตรวจทั้งสองแห่งที่วางเคียงข้างกัน

เอกสารข้อมูลจำเพาะแตกต่างกันในแทบทุกมิติ ซึ่งเป็นสิ่งที่คุณคาดว่าจะพบได้จากสองรุ่นที่ไม่เคยถูกออกแบบมาให้แข่งขันกันในตำแหน่งเดียวกัน

• คืออะไร — LFM2.5-VL-3B เป็นโมเดลภาษาภาพเชิงสร้างสรรค์ที่เขียนข้อความ; Liquid AI d1-omni-600M เป็นโมเดลตัดสินใจที่ส่งคืนคำตอบแบบมีโครงสร้างและไม่ปล่อยโทเค็น

• พารามิเตอร์ — 3.1B ใน BF16 สำหรับ LFM2.5-VL-3B เทียบกับ 587M สำหรับ Liquid AI d1-omni-600M ซึ่งตัวมันเองประกอบด้วย shared trunk และ decision head ขนาด 381M บวกกับ vision encoder ขนาด 94M และ audio encoder ขนาด 112M

• โครงข่ายหลัก — LFM2.5-VL-3B จับคู่โมเดลภาษา LFM2.5-2.6B กับตัวเข้ารหัสภาพ SigLIP2 NaFlex ขนาด 400M ที่ปรับให้เหมาะกับรูปร่าง; Liquid AI d1-omni-600M ได้รับการฝึกจาก LFM2.5-Encoder-350M ซึ่งเป็นตัวเข้ารหัสแบบสองทิศทาง โดยมีทาวเวอร์ SigLIP2 ที่นำมาจาก LFM2.5-VL-450M และ FastConformer 17 ชั้นสำหรับเสียง

• อินพุต — ข้อความและรูปภาพสำหรับ LFM2.5-VL-3B; ข้อความพร้อมรูปภาพ หรือ ข้อความพร้อมเสียงพูดไม่เกิน 30 วินาทีสำหรับ Liquid AI d1-omni-600M ซึ่งจะทำให้เกิด ValueError หากรูปภาพและเสียงมาพร้อมกันในคำขอเดียวกัน

• บริบท — 32,768 โทเค็นสำหรับ LFM2.5-VL-3B เทียบกับ 16,384 ตำแหน่งรวมสำหรับข้อความ รูปภาพ และเสียงของ Liquid AI d1-omni-600M ซึ่งการ์ดระบุเพิ่มเติมว่าเมื่อมีรูปภาพอยู่ ข้อความสถานะและข้อความคำถามจะถูกตัดให้เหลือ 896 โทเค็นเพื่อให้ตรงกับการฝึก

• คำศัพท์ — 128,000 โทเค็นสำหรับ LFM2.5-VL-3B, 65,536 สำหรับ Liquid AI d1-omni-600M

• รันไทม์ — LFM2.5-VL-3B ทำงานใน transformers และ vLLM และมีโมเดลร่าง DSpark แยกต่างหากสำหรับการถอดรหัสแบบคาดการณ์; Liquid AI d1-omni-600M มาพร้อมโค้ดที่กำหนดเอง ต้องใช้ trust_remote_code=True และการ์ดของมันแนะนำให้ใช้ float16 บน GPU ขณะที่เตือนว่า bfloat16 เปลี่ยนคำตอบสูงสุดในบางแถว

• ใบอนุญาต — lfm1.0 สำหรับทั้งสอง ซึ่งอนุญาตให้ทำไฟน์ทูนและการนำไปใช้งาน

มีบรรทัดหนึ่งในรายการนั้นที่ทำงานหนักกว่าส่วนที่เหลือ Liquid AI d1-omni-600M ถูกสร้างบนเอนโคเดอร์แบบสองทิศทาง แทนที่จะเป็นดีโคเดอร์ นั่นไม่ใช่การลดขนาดของ LFM2.5-VL-3B แต่เป็นเชื้อสายที่แตกต่าง และเป็นเหตุผลเชิงสถาปัตยกรรมที่ทำให้ทั้งสองโมเดลสลับกันไม่ได้ ไม่ว่าจะอ่านตาราง benchmark อย่างไร

สัญญาเอาต์พุตตัดสินใจได้มากกว่าที่เกณฑ์มาตรฐานทำ

ถาม LFM2.5-VL-3B เกี่ยวกับรูปภาพ แล้วคุณจะได้ภาษากลับมา สิ่งนี้มีมูลค่าเป็นเงินเมื่อคำตอบต้องถูกอ่านโดยมนุษย์ บันทึกเป็นสตริง หรือส่งต่อไปยังขั้นตอนที่คาดหวังข้อความร้อยเรียง มันยังเป็นความเสี่ยงที่คุณต้องออกแบบรองรับ: เอาต์พุตที่สร้างขึ้นอาจคลาดเคลื่อน คำขอที่อยู่ในรูป JSON อาจได้กลับมาในรูปแบบที่ต่างจากที่คุณขอ และทุกโทเค็นมีค่าใช้จ่ายและต้องรอ โมเดลนี้ถูกกำหนดขอบเขตไว้อย่างชัดเจนสำหรับงานด้านภาพแบบเทิร์นเดียว ปริมาณงานสูง ความหน่วงต่ำ — เช่น OCR แบบเป็นชุดของเอกสารสแกน การตรวจจับแบบเรียลไทม์ในยานพาหนะ การแปลป้ายบนอุปกรณ์ — และถูกเบี่ยงเบนออกจากคำถามที่ต้องใช้บริบทยาวและการให้เหตุผลหนัก ๆ อย่างชัดเจน เช่น "อะไรผิดปกติกับพิมพ์เขียวนี้"

Liquid AI d1-omni-600M ตอบคำถามที่แคบกว่าอย่างเคร่งครัดในขอบเขตที่เชื่อถือได้มากกว่าอย่างเคร่งครัด อินเทอร์เฟซของมันคือสถานะ — ข้อความ, JSON, รูปภาพหนึ่งรูปหรือมากกว่า, หรือเสียงพูดไม่เกิน 30 วินาที — บวกกับชุดคำถามที่มีชื่อ แต่ละคำถามประกาศชนิดของตัวเอง คำถาม noulเป็นแบบใช่/ไม่ใช่ และส่งกลับเป็น P(yes) ระหว่าง 0 ถึง 1 คำถาม choiceเลือกหนึ่งป้ายจากชุดที่คุณตั้งชื่อ และส่งกลับป้ายนั้น, ความมั่นใจ, และความน่าจะเป็นของแต่ละตัวเลือก คำถาม scoreวางสถานะบนมาตราส่วนเรียงลำดับสองถึงสิบระดับ และส่งกลับระดับที่คาดหวังพร้อมการกระจายของมัน คำถามหลายข้อสามารถแขวนอยู่กับสถานะเดียวและถูกอ่านจากการประมวลผลครั้งเดียว ดังนั้นตัวนับการใช้งานบนการ์ดโมเดลรายงาน output_tokens: 0 ไม่มีขั้นตอนการสร้าง ซึ่งหมายความว่าไม่มีสิ่งที่เรียกว่าเอาต์พุตที่แยกวิเคราะห์ไม่สำเร็จ

สิ่งที่คุณต้องแลกไปคือทุกอย่างที่คำตอบแบบสร้างขึ้นมี แต่ป้ายกำกับไม่มี: การให้เหตุผล คำพูดแบบไม่ฟันธง ข้อความที่คุณคัดลอกไปแปะในตั๋วงานได้ และความสามารถในการถามต่อในบทสนทนาเดิม Liquid ระบุไว้ตรง ๆ ว่า โมเดลนี้ไม่ใช่โมเดลแชต และไม่เขียนข้อความ หากไปป์ไลน์ของคุณต้องการคำอธิบายข้าง ๆ คำตัดสิน Liquid AI d1-omni-600M ก็เป็นครึ่งที่ผิดของคู่นี้ และคำตอบที่ซื่อตรงคือให้รันทั้งคู่: LFM2.5-VL-3B เพื่อสร้างการอ่านภาพ และ Liquid AI d1-omni-600M เพื่อสร้างการตัดสินใจเกี่ยวกับภาพนั้น

A two-column scoreboard for Liquid AI d1-omni-600M and LFM2.5-VL-3B showing the 600M at 587M parameters, output of label, score and 0 tokens, text plus image or audio input, no published vision benchmark, up to 30 seconds of speech and a 16,384-token context, against the 3B at 3.1B parameters, generated text output, text plus image input, RefCOCO 87.9 and OCRBench v2 47.5 on vision, no audio and a 32,768-token context, footed 'All figures vendor-reported by Liquid AI; none independently reproduced. October 2026.'

ไม่มีตัวเลขวิสัยทัศน์แบบเปรียบเทียบโดยตรง และนั่นคือข้อค้นพบ

สัญชาตญาณถัดไปคือการเทียบเคียงกับมาตรฐานวัดความสามารถด้านภาพ แต่ทำแบบนั้นไม่ได้ สำหรับ LFM2.5-VL-3B ผู้ขายเผยแพร่ชุดผลครบทั้งหมด — RefCOCO Macro Precision@1 อยู่ที่ 87.9, ScreenSpot-v2 ที่ 80.7, ChartQA ที่ 81.3, POPE ที่ 88.7, MMStar ที่ 63.3, BLINK ที่ 61.5, MuirBench ที่ 58.3, ToolSandBox ที่ 59.5, OCRBench v2 ภาษาอังกฤษที่ 47.5 และ RealWorldQA ที่ 73.1 ซึ่งแซงค่า 71.1 ของ LFM2-VL-3B รุ่นก่อนหน้าเล็กน้อย ทั้งหมดนี้เป็นตัวเลขที่ผู้ขายรายงานเอง ไม่มีข้อใดถูกนำมาทดสอบซ้ำโดยอิสระ และถึงกระนั้นก็ยังเป็นข้ออ้างที่เจาะจงเกี่ยวกับความสามารถเฉพาะด้านซึ่งผู้อ่านสามารถใช้ตรวจสอบทีมแล็บได้

สำหรับ Liquid AI d1-omni-600M โพสต์เปิดตัวระบุว่า Decision Index v0.3 มี private vision split "ซึ่งเราไม่ได้รายงานในรุ่นนี้" และแทนที่จะเป็นเช่นนั้น Liquid ได้ตรวจสอบว่าเช็กพอยต์ 600M "รองรับทั้งสามโมดัล" โดยมีหลักฐานอยู่ในเดโมของ playground นั่นคือบันทึกด้าน vision ที่เผยแพร่ทั้งหมด ไม่มีตัวเลข benchmark ด้านภาพสำหรับเช็กพอยต์นี้ ไม่ว่าจะใน model card หรือโพสต์เปิดตัว โพสต์เดียวกันยังยืนยันสิ่งที่ขาดหายไปในด้านเสียงอย่างตรงไปตรงมามากกว่าเดิมว่า benchmark การตัดสินใจด้านเสียงโดยเฉพาะนั้น ในคำพูดของเจ้าของผลิตภัณฑ์เอง "ปัจจุบันเป็นปัญหาที่ยังเปิดอยู่"

ดังนั้นการตีความการเปรียบเทียบครั้งนี้ที่ถูกต้องจึงเป็นแบบไม่สมมาตร และควรระบุให้เป็นเช่นนั้น LFM2.5-VL-3B ได้แสดงความสามารถด้านการมองเห็นพร้อมตัวเลขประกอบ ส่วน Liquid AI d1-omni-600M มีตัวเข้ารหัสการมองเห็นที่ยืมมาจากโมเดลพี่น้อง มีอะแดปเตอร์ที่ฝึกกับแบ็กโบนแบบแช่แข็ง มีเดโม และมีคำสัญญา หากการใช้งานของคุณต้องการให้โมเดลให้ผลที่ถูกต้องเกี่ยวกับภาพภายในเดือนนี้ 3B คือเพียงหนึ่งเดียวในสองตัวที่มีอะไรให้ยืนหยัดได้

ความเร็ว: มีเพียงหนึ่งในสิ่งเหล่านี้เท่านั้นที่ได้รับการวัด

เนื่องจากโมเดลสำหรับตัดสินใจไม่ได้สร้างสิ่งใดขึ้นมา ความหน่วงจึงเป็นตัวเลขที่สำคัญ และเช่นเคย มีเพียงด้านเดียวเท่านั้นที่ได้รับการบันทึกไว้ LFM2.5-VL-3B ถูกอ้างอิงว่าอยู่ที่ 228 โทเค็นต่อวินาทีบน Apple M5 Max และ 116 โทเค็นต่อวินาทีบน AMD Ryzen AI Max+ 395 โดยทั้งคู่อยู่ภายในหน่วยความจำ 3.3 GB พร้อมกับประมาณ 20 โทเค็นต่อวินาทีบน Galaxy S26 Ultra และราว 11,000 โทเค็นต่อวินาทีบน H100 เพียงตัวเดียวภายใต้ vLLM ตัวเลขเหล่านี้อธิบายอัตราการประมวลผลถอดรหัส (decode throughput) ซึ่งเป็นการวัดที่เหมาะสมสำหรับโมเดลที่เขียนงานออกมา

สำหรับ Liquid AI d1-omni-600M การ์ดระบุว่าตัวเลขการอนุมานไม่ได้รับการรายงานเนื่องจากโมเดลนี้เป็นการเปิดตัวเพื่อการวิจัยระยะเริ่มต้นและอยู่ระหว่างการพัฒนาอย่างแข็งขัน โมเดลพี่น้อง d1-3B ในตระกูลเดียวกันมีตารางความหน่วง — 8 ms สำหรับหนึ่งคำถามบน RTX 4090, 16 ms บน Jetson AGX Thor, 26 ms บน Jetson AGX Orin 64 GB, 50 ms บน Orin Nano โดยสามคำถามในหนึ่งสถานะใช้เวลาประมาณ 1.3 เท่าของเวลาที่ใช้สำหรับหนึ่งคำถาม ตัวเลขเหล่านั้นเป็นของโมเดลการตัดสินใจ 3B และต้องไม่นำมาใช้กับ 600M สำหรับ Liquid AI d1-omni-600M จุดยืนที่ตรงไปตรงมาคือสถาปัตยกรรมบ่งบอกถึงโมเดลขนาดเล็กที่รวดเร็ว และยังไม่มีผู้ใดภายนอกห้องแล็บเผยแพร่ตัวเลขระดับมิลลิวินาที

อย่างน้อยก็สามารถประมาณพื้นที่หน่วยความจำของน้ำหนักได้ ที่ความแม่นยำ float16 ซึ่งการ์ดแนะนำ พารามิเตอร์ 587M คิดเป็นน้ำหนักประมาณ 1.2 GB ก่อนแอกติเวชัน — เป็นการคำนวณจากจำนวนพารามิเตอร์ที่เผยแพร่ ไม่ใช่การวัดจากผู้ขาย — เทียบกับที่ Liquid รายงานว่าไม่ถึง 3.3 GB สำหรับ LFM2.5-VL-3B บนอุปกรณ์ที่ข้อจำกัดอยู่ที่ระดับเมกะไบต์ ความต่างนี้คือเหตุผลที่สนับสนุนรุ่น 600M

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

จะเลือกระหว่างมันได้อย่างไร

ทาง انتخابนี้จะคลี่คลายได้อย่างลงตัว เมื่อสัญญาว่าด้วยผลลัพธ์ถูกถือว่าเป็นสิ่งที่กำหนดตายตัวแล้ว ไม่ใช่สิ่งที่ต่อรองได้

เลือกใช้ LFM2.5-VL-3Bเมื่อสิ่งที่ต้องส่งมอบเป็นข้อความ: OCR ทั้งหน้าพร้อมการกำกับเลย์เอาต์, การกราวด์และการตรวจจับจากคิวรีภาษาธรรมชาติ, การแปลป้ายบนอุปกรณ์, ทุกขั้นตอนที่มนุษย์หรือโมเดลภาษาปลายทางนำคำตอบไปใช้ นอกจากนี้ยังมีบริบทที่กว้างขึ้นที่ 32,768 โทเคน และความครอบคลุมภาษาที่ลึกกว่าในทางปฏิบัติ เพราะคำตอบของมันเป็นภาษา ไม่ใช่ป้ายกำกับ

เลือกใช้ Liquid AI d1-omni-600M เมื่อสิ่งที่ต้องส่งมอบคือการตัดสินใจ: การจัดเส้นทางตั๋ว, การคัดแยกเฟรม, การกลั่นกรองคลิป, การตั้งเงื่อนไขกับ guardrail, การให้คะแนนคำตอบบนสเกลสองถึงสิบ — และด้วยคุณสมบัติเฉพาะระหว่างสองตัวนี้ เมื่ออินพุตเป็นเสียงพูด มันเป็นเพียงตัวเดียวในทั้งคู่ที่รับเสียงได้เลย สูงสุด 30 วินาทีต่อคำขอ ถึงแม้ว่าการ์ดของมันจะระบุว่าเสียงนั้นถูกฝึกจากบทสนทนาแลกเปลี่ยนระหว่างผู้พูดภาษาอังกฤษกับผู้ช่วย ซึ่งเป็นคำอธิบายที่แคบมากเมื่อเทียบกับโลกที่การเรียกใช้ของคุณจะมาจาก

อย่าเลือกใช้ทั้งสองตัวนั้น และให้ใช้โมเดล vision-language แบบทั่วไปแทน หากงานนั้นต้องอาศัยการให้เหตุผลเกี่ยวกับภาพ มากกว่าการอ่านภาพหรือการตัดสินเกี่ยวกับภาพนั้น การ์ดโมเดลทั้งสองชี้ไปในทางที่ไม่ใช่กรณีการใช้งานดังกล่าว และ Liquid AI d1-omni-600M ก็ไม่มีกลไกที่จะทำเช่นนั้นได้

ลองใช้เช็กพอยต์แบบทดลอง โดยไม่เอาไปป์ไลน์ทั้งระบบไปเสี่ยงกับมัน

Liquid AI d1-omni-600M เป็นรุ่นวิจัยระยะเริ่มต้นตามที่ผู้ขายระบุไว้เอง และพฤติกรรมด้านภาพและเสียงของมันยังไม่ผ่านการทดสอบมาตรฐาน นั่นก็คือลักษณะเฉพาะของโมเดลที่คุณอยากประเมินไว้หลังระบบสำรอง มากกว่าจะวางไว้หน้าลูกค้าโดยตรง OrcaRouter เชื่อมต่อโมเดลกว่า 200 รายการผ่านคีย์ API เดียว พร้อมการสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดปัญหา ซึ่งเป็นวิธีราคาถูกในการนำเช็กพอยต์แบบนี้ขึ้นสู่เส้นทางจริง ถ้าเส้นทางทดลองมีประสิทธิภาพลดลงหรือผู้ให้บริการรายใดล่ม คำขอจะตกลงที่ระบบสำรองโดยไม่ต้องแก้โค้ดเลย คีย์เดียวกันนี้รองรับทุกโมเดลที่ไปป์ไลน์ส่งต่อไปยังผู้ให้บริการแต่ละราย ในราคาตามที่ผู้ให้บริการนั้นประกาศไว้บวกเพิ่ม 0% ดังนั้นหากผู้ขายลดราคา คุณก็ได้ราคานั้นในวันเดียวกัน

ข้อควรระวังหนึ่งประการ ที่ต้องระบุไว้เพราะมันเป็นสาระสำคัญ: โมเดล d1 แบบเปิดและตระกูล LFM2.5-VL ยังไม่มีอยู่ในแค็ตตาล็อกของเราในวันนี้ การโฮสต์เวตด้วยตนเองเป็นเส้นทางที่ผู้ขายแนะนำสำหรับทั้งสองกรณี โดยมีการรองรับ llama.cpp ตั้งแต่วันแรกบนฮาร์ดแวร์ของ Apple, AMD, Qualcomm และ NVIDIA ส่วนการรันบนปลายทางแบบโฮสต์หมายถึงการใช้ API ของผู้ขายเองหรือแพลตฟอร์มของบุคคลที่สาม การตีความหน้านี้ว่าเป็นคำยืนยันเรื่องความพร้อมใช้งานถือเป็นความเข้าใจผิด

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

ดูอะไรดี

คำถามที่น่าสนใจไม่ใช่ว่าในที่สุด 600M จะเอาชนะ 3B ได้ในเรื่องใดเรื่องหนึ่งหรือไม่ — มันจะไม่ และมันไม่ได้ถูกสร้างมาเพื่อสิ่งนั้น คำถามคือ Liquid AI จะเผยแพร่ชุดข้อมูลวิชันแบบไพรเวตที่มันเก็บงำไว้หรือไม่ และจะมีใครสร้างเบนช์มาร์กการตัดสินใจจากเสียงที่แล็บบอกว่ายังไม่มีอยู่จริงหรือไม่ จนกว่าหนึ่งในนั้นจะเกิดขึ้น การเปรียบเทียบระหว่าง Liquid AI d1-omni-600M กับ LFM2.5-VL-3B ก็คือการเปรียบเทียบระหว่างโมเดลที่ถูกวัดผลแล้วกับโมเดลที่ดูเป็นไปได้ สำหรับงานที่ยังไม่ได้วัดผล — เสียงเข้า คำตัดสินออก เล็กพอที่จะอยู่ในอุปกรณ์ — 600M เป็นเช็กพอยต์แบบโอเพนเวตเพียงตัวเดียวในตระกูลนี้ที่ลองทำสิ่งนี้ และการเป็นรายแรกโดยไม่มีสกอร์บอร์ดก็ยังคงเป็นการเป็นรายแรก

OrcaRouter ให้บริการโมเดลกว่า 200 รายการผ่านคีย์ API เดียว โดยราคาตามรายการของผู้ให้บริการแต่ละรายถูกส่งต่อโดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ขายลดราคา ราคาของคุณก็ลดตามในวันเดียวกัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube