
Liquid AI d1-3B vs Gemma 4 12B: โมเดลเพื่อการตัดสินใจปะทะโมเดลเอนกประสงค์
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
วิธีที่เร็วที่สุดที่จะทำให้การเปรียบเทียบนี้ผิดคือการเอา Liquid AI d1-3B กับ Gemma 4 12B ไปวางบน benchmark เดียวกันแล้วรอหาผู้ชนะ พวกมันไม่ได้ตอบคำถามเดียวกัน Liquid AI d1-3B เป็นโมเดลตัดสินใจขนาด 3.12B ที่เผยแพร่เป็น open weights เมื่อวันที่ 7 ตุลาคม 2026: คุณป้อนสถานะและชุดคำถามที่มีชื่อกำกับให้มัน แล้วมันจะคืนค่าความน่าจะเป็น ป้ายกำกับที่เลือก และค่าความมั่นใจ โดยมีโทเคนเอาต์พุตเป็นศูนย์และไม่มีขั้นตอนการสร้างข้อความ Gemma 4 12B เป็นโมเดลทั่วไปแบบ any-to-any ที่ไม่มี encoder ของ Google เป็น checkpoint ขนาด 11.96B ที่รับข้อความ ภาพ เสียง และวิดีโอ แล้วเขียนคำตอบภายในหน้าต่าง 256,000 โทเคน ในมากกว่า 140 ภาษา ตัวหนึ่งบอกคุณว่าแผงวงจรเป็นหนึ่งในสี่สิ่งใด อีกตัวบอกคุณว่าทำไม หากเปรียบเทียบกันเฉพาะคุณภาพ คุณจะไม่ได้เรียนรู้อะไรเลย เพราะผลลัพธ์ไม่สามารถเทียบเคียงกันได้ — และผู้ขายก็ไม่เคย benchmark พวกมันเทียบกัน เปรียบเทียบกันในสิ่งที่การเรียกหนึ่งครั้งคืนค่ากลับมาจริง ค่าใช้จ่าย และจุดที่แต่ละตัวไปได้สุดทาง การจับคู่นี้ก็จะกลายเป็นการทดสอบขอบเขตที่มีประโยชน์อย่างแท้จริง
สัญญาเอาต์พุตที่แตกต่างกันสองแบบ
ความแตกต่างที่ทำหน้าที่ทั้งหมดตรงนี้ คือสิ่งที่ส่งกลับมาบนสาย
Liquid AI d1-3B ส่งคืนออบเจ็กต์คำตอบแบบมีโครงสร้าง ทุกคำถามในคำขอหนึ่ง ๆ จะประกาศประเภทของตัวเอง — noul สำหรับคำตอบใช่/ไม่ใช่ พร้อมค่า P(yes) choice สำหรับการเลือกหนึ่งตัวจากชุดตัวเลือกที่มีชื่อ พร้อมค่าความเชื่อมั่นและความน่าจะเป็นของแต่ละตัวเลือก หรือ score สำหรับตำแหน่งบนมาตรวัดแบบเรียงลำดับตั้งแต่สองถึงสิบระดับ พร้อมระดับที่คาดหมายและการแจกแจงของระดับนั้น โมเดลรายงาน output_tokens: 0 เนื่องจากไม่มีอะไรถูกเขียนออกมา คำถามหลายข้อที่อ้างอิงสถานะเดียวกันจะถูกอ่านจากการส่งผ่านไปข้างหน้าครั้งเดียว และสถานะพร้อมภาพของสถานะนั้นจะถูกเข้ารหัสเพียงครั้งเดียวสำหรับคำถามทั้งหมดเหล่านั้น
Gemma 4 12Bจะตอบกลับเป็นร้อยแก้ว บางครั้งก็ส่งคืน JSON ที่คุณขอ บางครั้งก็ส่งคืน JSON ที่คุณไม่ได้ขออย่างตรงเป๊ะ และสามารถให้เหตุผลก่อนจะตอบได้ มันเป็นโมเดลภาษาเป็นอันดับแรก: อะไรก็ตามที่มันรู้วิธีจำแนกประเภท มันจะแสดงออกมาเป็นข้อความ นั่นเป็นจุดแข็งเมื่อคำตอบต้องถูกอธิบายให้มนุษย์ฟัง หรือส่งต่อไปยังขั้นตอนปลายทางที่คาดหวังภาษา และเป็นต้นทุนเมื่อสิ่งเดียวที่คุณต้องการคือความน่าจะเป็น
ทุกสิ่งที่อยู่ปลายน้ำล้วนสืบเนื่องจากสิ่งนั้น คำตอบของ d1-3B ไม่มีทางแยกวิเคราะห์ไม่สำเร็จ มันไม่อาจอธิบายตัวเองได้ และ model card ก็ระบุไว้ตรง ๆ ว่า มันไม่ใช่โมเดลแชต และมันไม่เขียนข้อความ
ร่องรอยหลักฐานอยู่ตรงไหน
ที่มาของชุดตัวเลขทั้งสองชุดไม่เทียบเท่ากัน และในที่นี้ เรื่องนั้นสำคัญยิ่งกว่าตัวเลขเอง
• Decision Index 0.2.1 — Liquid AI d1-3B ได้ 48.57 คะแนน โดยได้รับการให้คะแนนจากผู้จำหน่ายด้วยตัวให้คะแนนอย่างเป็นทางการ เป็นอันดับหนึ่งในบรรดาโมเดลที่ต่ำกว่า 10B และนำหน้า Decider 35B-A3B ที่ 47.11 Gemma 4 12B ไม่ได้ถูกให้คะแนนบน Decision Index เลย ดังนั้นแถวนี้จึงไม่มีคู่เทียบ
• เกณฑ์มาตรฐานการให้เหตุผล — Gemma 4 12B ทำคะแนนได้ 77.5 ใน AIME 2026, 78.8 ใน GPQA Diamond และ 1,659 Codeforces ELO และมี Artificial Analysis Intelligence Index อยู่ที่ 22 ในโหมดให้เหตุผล และ 13 เมื่อปิดการให้เหตุผล Liquid AI d1-3B ไม่มีเกณฑ์มาตรฐานการให้เหตุผล เนื่องจากโมเดลการตัดสินใจไม่ได้สร้างร่องรอยการให้เหตุผลเพื่อให้คะแนน
• บริบทแบบยาว — Gemma 4 12B รองรับ 256,000 โทเค็น และได้คะแนน 43.4% ใน MRCR v2 eight-needle ที่ 128k บนการ์ดของ Google เอง Liquid AI d1-3B รองรับ 32,768 โทเค็น หาก "state" ของคุณคือเอกสารสี่สิบหน้าและการสแกน ช่องว่างนั้นคือการตัดสินใจทั้งหมดและไม่ใกล้เคียง
• ด้านภาพ — Liquid AI d1-3B มีค่าเฉลี่ย 74.1 จากเกณฑ์มาตรฐานภาพสาธารณะสิบเอ็ดรายการ โดยตีความเป็นการตัดสินใจเลือกจากชุดตัวเลือกของแต่ละเกณฑ์ เทียบกับ 73.9 ของแกนหลัก LFM2.5-VL-3B ที่ใช้สร้างขึ้นมา และผู้จำหน่ายรายงานว่าเมื่อนำภาพออก คำถามชุดเดียวกันจะลดลงเหลือ 45.1 ด้านภาพของ Gemma 4 12B นั้นแข็งแกร่งและกว้างขวางกว่า แต่ถูก รายงานในฐานะคุณภาพการสร้าง ไม่ใช่ความแม่นยำในการตัดสินใจจากตัวเลือกที่ระบุชื่อ
• ภาษา — สิบหกภาษาที่ได้รับการบันทึกไว้สำหรับ Liquid AI d1-3B; มากกว่า 140 สำหรับ Gemma 4 12B
• ความเร็ว — Liquid AI d1-3B ตอบหนึ่งครั้งใน 8 ms บน RTX 4090, 16 ms บน Jetson AGX Thor, 26 ms บน Jetson AGX Orin 64 GB และ 50 ms บน Jetson Orin Nano และบรรจุ 64 สถานะในรอบเดียวที่อัตรา 475 ครั้งต่อวินาทีบน 4090 Gemma 4 12B สร้างข้อความ ดังนั้นความหน่วงของมันจึงเป็นฟังก์ชันของจำนวนโทเค็นที่มันเขียน
• คุณภาพของหลักฐาน — ผลลัพธ์ของ Gemma 4 12B เป็นของ Google เผยแพร่เมื่อเดือนมิถุนายน 2026 และหลังจากนั้นก็ถูกนำไปลองใช้ ควอนไทซ์ และรันซ้ำโดยชุมชนขนาดใหญ่ ส่วนผลลัพธ์ของ Liquid AI d1-3B เป็นของ Liquid เผยแพร่เมื่อสองวันก่อน ยังไม่มีใครนอกรีเสิร์ชแล็บทำซ้ำได้ โปรดอ่านคอลัมน์ที่สองโดยคำนึงถึงเรื่องนี้

จุดเดียวที่พวกเขาแข่งขันกันอย่างแท้จริง
มีความทับซ้อนอยู่จริง และมันไม่ได้อยู่บนลีดเดอร์บอร์ด มันคือการเรียกใช้ LLM-as-a-judge
ไปป์ไลน์การผลิตจำนวนมากใช้โมเดลทั่วไปขนาดกลางเป็นเลเยอร์การประเมินอยู่แล้ว: ให้คะแนนความเร่งด่วนของตั๋วนี้ ตัดสินว่าผลลัพธ์นี้ผ่านเกณฑ์หรือไม่ เลือกว่าเอเจนต์ควรเรียกเครื่องมือใดต่อไป ตรวจว่าท่อนข้อความที่ดึงมาตอบคำถามได้หรือไม่ ทุกวันนี้การเรียกเหล่านั้นส่วนใหญ่ไปที่โมเดลแบบสร้างสรรค์ที่ถูกขอให้ส่งออกตัวเลขหรือป้ายกำกับเป็นข้อความ และตัวเลขที่มันส่งออกมาก็คือสิ่งที่ตัวสุ่มสร้างขึ้น ไม่ใช่ซอฟต์แมกซ์เหนือชุดตัวเลือกของคุณ นั่นคือเวิร์กโฟลว์ที่ Liquid AI d1-3B ถูกฝึกหลังการฝึกเพื่อแทนที่ และเดโมที่เผยแพร่ก็เป็นเวอร์ชันของมัน — เพรดิเคต SQL ที่ตอบใช่หรือไม่ใช่สำหรับตั๋วสนับสนุน 150 ใบ, ลูปการบีบอัดบริบทของเอเจนต์ที่เก็บ ตัดทอน หรือทิ้งเอาต์พุตของเครื่องมือแต่ละรายการ และลบโทเค็นออก 52%, แอปตรวจสอบด้วยภาพที่แยกชิ้นส่วนดีและชำรุดจากสายการผลิตสี่สายด้วยความแม่นยำ 85 ถึง 97% ในงานที่มันไม่เคยถูกฝึกมา
Gemma 4 12B ทำงานทั้งหมดเหล่านั้น และทำได้มากกว่างานเหล่านั้นด้วย นอกจากนี้ยังเขียนสรุปได้ ถือเอกสาร 256K ไว้ในมุมมอง รับสายโทรศัพท์ที่บันทึกไว้เป็นอินพุตได้ และตอบกลับได้เป็นหนึ่งในกว่า 140 ภาษา หากไปป์ไลน์ของคุณต้องการการประเมิน และ การบรรยาย 12B กำลังทำสองงานด้วยการเรียกครั้งเดียว และโมเดลการตัดสินใจ 3B กำลังทำหนึ่งในนั้น
เส้นแบ่งอยู่ที่ความยาวบริบทและรูปร่างของเอาต์พุต สถานะยาว อินพุตเสียงพูด หลายภาษา หรือคำอธิบายที่ผู้อ่านคาดหวัง — Gemma 4 12B ชนะขาด สถานะสั้น ชุดตัวเลือกคงที่ งบความหน่วงต่อคำขอในระดับมิลลิวินาทีหลักเดียว หรือการรับประกันแบบเด็ดขาดว่าคำตอบจะแยกวิเคราะห์ได้ — นั่นคือคอลัมน์ d1-3B และโมเดลเอนกประสงค์กำลังจ่ายไปกับความสามารถที่คุณจะไม่ได้ใช้
แต่ละอันมีค่าใช้จ่ายในการโทรเท่าไร
ทั้งสองโมเดลไม่ได้อยู่ในแคตตาล็อกของเรา จึงไม่มีราคาการจัดเส้นทางให้เสนอสำหรับทั้งคู่ — Gemma 4 12B ไม่ได้อยู่ในขนาด Gemma ที่เราให้บริการ และ Liquid AI d1-3B เป็นโมเดลแบบเปิดน้ำหนักที่คุณโฮสต์เองหรือเข้าถึงผ่าน API ของผู้จำหน่ายเองและแพลตฟอร์มของบุคคลที่สาม สำหรับบริบทในฝั่งที่ใกล้เคียงกับ Gemini ของตระกูลนี้ ขนาด Gemma 4 สองขนาดที่เราให้บริการจัดเส้นทางมีราคาระบุอยู่ที่ $0.06 ต่อล้านโทเค็นอินพุต และ $0.33 ต่อล้านโทเค็นเอาต์พุตสำหรับ Gemma 4 26B A4B และ $0.13 กับ $0.38 สำหรับ Gemma 4 31B ทั้งคู่มีบริบทขนาด 262,144 โทเค็น และรองรับอินพุตข้อความ รูปภาพ และวิดีโอ ราคามัธยฐานของผู้ให้บริการที่อ้างอิงสำหรับ Gemma 4 12B ในที่อื่นอยู่ที่ประมาณ $0.10 และ $0.30
โฮสต์ของ Liquidd1 เรียกเก็บเฉพาะโทเคนอินพุต ในราคา $0.04 ต่อล้าน โดยนับรูปภาพเป็นอินพุตที่ 1.5 โทเคนต่อแพตช์ขนาด 32×32 พิกเซล ดังนั้นคำขอแบบตัดสินใจจึงไม่มีบรรทัดโทเคนเอาต์พุตเลย ซึ่งเป็นเหตุผลเชิงโครงสร้างที่ทำให้การเปรียบเทียบต้นทุนของผู้ขายเองกับโมเดลที่ใหญ่กว่ามากออกมาอย่างที่มันเป็น เวตแบบเปิดไม่มีราคาต่อการเรียกใช้ คุณจ่ายด้วยฮาร์ดแวร์ ทั้งสองต้องอยู่ในไปป์ไลน์เดียวกับทุกอย่างอื่นที่คุณเรียกใช้ ซึ่งเป็นชั้นที่เราเตอร์มีไว้เพื่อรองรับ — API เดียวครอบคลุมโมเดล 200+ ตัว ราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยคิดมาร์กอัป 0% และ การสลับไปใช้ระบบสำรองอัตโนมัติ เพื่อให้ความสะดุดเพียงครั้งเดียวจากต้นทางไม่กลายเป็นระบบล่มของคุณ นั่นคือระบบพื้นฐานรอบ ๆ การเปรียบเทียบ ไม่ใช่ตัวการเปรียบเทียบเอง

จะตัดสินใจยังไงดี พูดตามตรง
เริ่มจากรูปแบบคำตอบแทนที่จะเริ่มจากโมเดล หากระบบดาวน์สตรีมสามารถใช้ค่าความน่าจะเป็น ป้ายกำกับ และค่าความเชื่อมั่นได้ และชุดคำตอบมีขนาดเล็กและเป็นที่รู้จักอยู่แล้ว Liquid AI d1-3B ก็ไม่ใช่การดาวน์เกรดจากโมเดล 12B — มันเป็นเครื่องมือคนละแบบ และตัวเลขเวลาแฝงทำให้มันเป็นการดีพลอยที่ต่างประเภทกันโดยสิ้นเชิง: 50 ms บน Jetson Orin Nano คืออุปกรณ์ที่ไม่ควรมีธุระต้องรัน 12B เลยด้วยซ้ำ
ถ้าคำตอบต้องเป็นประโยค หรือสถานะยาวกว่าสามหมื่นสองพันโทเค็น หรือมีคนจะพูดมันออกมา หรือภาษาที่ส่งออกเป็นภาษาเบงกาลี แล้ว Gemma 4 12B เป็นเพียงหนึ่งเดียวจากสองตัวที่สามารถทำงานนี้ได้ และการเปรียบเทียบก็จบลงก่อนที่จะเริ่ม
ตำแหน่งที่ให้ประโยชน์อย่างแท้จริงสำหรับทีมส่วนใหญ่คือทั้งสองแบบ ในตำแหน่งที่แตกต่างกัน โดยมีโมเดลตัดสินใจอยู่ด้านหน้าการเรียกใช้งานที่มีค่าใช้จ่ายสูง คอยทำหน้าที่คัดแยก จัดเส้นทาง และตรวจสอบ guardrail ที่ไม่ต้องใช้ภาษา ส่วนโมเดลอเนกประสงค์อยู่เบื้องหลังสำหรับงานที่ต้องใช้ภาษา ทั้งสองเป็นไปป์ไลน์เดียวกัน ตัวหนึ่งเป็นตัวกรอง อีกตัวเป็นเพย์โหลด — และทีมที่จะได้ประโยชน์สูงสุดจากการเปิดตัว d1 คือทีมที่จ่ายค่าโมเดล 12B เพื่อตอบว่าใช่หรือไม่อยู่แล้ว

