
Liquid AI d1-3B vs Granite 4.2 3B: สองโมเดล 3B ที่ไม่เคยทำงานแบบเดียวกัน
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
วาง Liquid AI d1-3B และ Granite 4.2 3B ไว้บน GPU ตัวเดียวกันเพียงตัวเดียว แล้วทั้งคู่จะพอดีได้อย่างสบาย — ฝั่งหนึ่งมีพารามิเตอร์ 3.12B อีกฝั่งมี 3B ทั้งคู่ยังจะทำงานราวกับว่ามาจากคนละสาขาวิชา Granite 4.2 3B ซึ่งโมเดลการ์ดของ IBM เองระบุวันที่ 25 สิงหาคม 2026 เป็นโมเดลสำหรับการให้เหตุผล: มีโหมดการคิดสามแบบ, <think> บล็อก และคำตอบที่คุณอ่าน Liquid AI d1-3B ซึ่งอัปโหลดขึ้น Hugging Face เมื่อวันที่ 5 ตุลาคม 2026 และ Liquid ประกาศเปิดตัวสองวันถัดมา เป็นโมเดลสำหรับการตัดสินใจ: มันรับสถานะพร้อมกับชุดคำถามแบบมีชนิดที่ระบุไว้อย่างชัดเจน และคืนค่าความน่าจะเป็น ป้ายกำกับ หรือตำแหน่งบนสเกล ในการส่งผ่านไปข้างหน้าหนึ่งครั้ง โดยรายงาน output_tokens: 0 เพราะมันไม่เคยเขียนอะไรเลย คำถามที่มีประโยชน์ไม่ใช่ว่าตัวไหนดีกว่า แต่คือการเรียกใช้ของคุณอันไหนกันแน่ที่เป็นการตัดสินใจ เพราะสอง repo นี้ถูกสร้างมาสำหรับคนละครึ่งที่ตรงข้ามกันของการแบ่งนั้น
จริงๆ แล้วมีอะไรอยู่ในแต่ละรีโพซิทอรี
ทุกอย่างด้านล่างนี้มาจากการ์ดโมเดลสองใบและโพสต์ประกาศของ Liquid ไม่มีสิ่งใดที่นี่ถูกทำซ้ำโดยอิสระ ไม่มีบุคคลที่สามรายใดให้คะแนนโมเดลใดโมเดลหนึ่งจากทั้งสองด้วยชุดทดสอบเดียวกัน และตัวเลขในการ์ดเป็นของผู้ขายเอง
• ขนาด — Liquid AI d1-3B รวม 3.12B สร้างบน LFM2.5-VL-3B ของ Liquid; Granite 4.2 3B เป็นทรานส์ฟอร์มเมอร์แบบ dense decoder-only ขนาด 3B ที่สร้างบน granite-4.1-3b-base
• เอาต์พุต — d1-3B ส่งคืนค่าความน่าจะเป็น ป้ายกำกับ และค่าความเชื่อมั่น โดยไม่เขียนข้อความใด ๆ เลย ส่วน Granite 4.2 3B สร้างโทเค็น รวมถึงสายการคิดแบบเลือกได้ที่อยู่ภายใน <think>แท็ก
• บริบท — d1-3B 32,768 โทเคน; Granite 4.2 3B 128K โดยกำเนิด พร้อมส่วนขยายบริบทยาวถึง 512K บนการ์ด
• อินพุต — ข้อความ d1-3B, JSON, รูปภาพ หรือแบบผสม ผ่านตัวเข้ารหัสภาพ SigLIP2 NaFlex 400M; Granite 4.2 3B รองรับเฉพาะข้อความ
• สัญญาอนุญาต — d1-3B ภายใต้ Liquid's LFM Open License v1.0; Granite 4.2 3B ภายใต้ Apache 2.0
• ภาษา — d1-3B ระบุ 16 ภาษา; Granite 4.2 3B ระบุสิบสองภาษาที่ผ่านการทดสอบ โดยการ์ดระบุว่าภาษาอื่น ๆ ยังไม่ได้ทดสอบ
• การให้บริการ — d1-3B มาพร้อมโค้ดแบบกำหนดเอง (trust_remote_code=True, transformers>=5.14), โดยมี repo GGUF และ w8a8 อยู่ในตระกูลเดียวกัน และการ์ดที่มีเอกสารประกอบสำหรับ llama.cpp, Ollama และ LM Studio; Granite 4.2 3B ทำงานบน vLLM 0.20+ หรือ SGLang 0.5.18+ พร้อมตัวแยกวิเคราะห์ thinking แบบกำหนดเอง
สองในบรรทัดเหล่านั้นทำงานมากกว่าบรรทัดที่เหลือ แถวเอาต์พุตคือข้อโต้แย้งทั้งหมดของบทความนี้ และแถวไลเซนส์คือแถวที่ไม่มีใครใส่ไว้ในตารางเปรียบเทียบ

คนหนึ่งเขียนห่วงโซ่ความคิด แต่อีกคนปฏิเสธที่จะเขียน
Granite 4.2 3B คุ้มค่าที่จะใช้งานก็เพราะมันคิดออกมาให้เห็นเป็นขั้นตอน การ์ดของโมเดลระบุโหมดไว้สามโหมด ได้แก่ โหมดคิดซึ่งเปิดเป็นค่าเริ่มต้น โหมดไม่คิด และโหมดใช้ความพยายามต่ำที่ยังคงร่องรอยการให้เหตุผลไว้แต่ย่อให้สั้นลง สแต็กการให้บริการแยกร่องรอยการให้เหตุผลออกจากคำตอบสุดท้าย เพื่อให้แอปพลิเคชันของคุณได้รับเนื้อหาที่สะอาดพร้อมฟิลด์การให้เหตุผลแยกต่างหาก นั่นเป็นการออกแบบที่ดีสำหรับคำถามที่ต้องคิดให้ออก เช่น โจทย์คณิตศาสตร์ ตรรกะแขนงหนึ่ง หรือโค้ดชิ้นหนึ่งที่ต้องเขียนก่อนจึงจะตัดสินได้
d1-3B ไม่มีโหมดดังกล่าว และการ์ดของมันระบุตรง ๆ ว่า "มันไม่ใช่โมเดลแชตและไม่เขียนข้อความ" การเรียกหนึ่งครั้งจะประกาศคำถามพร้อมระบุชนิด noul เป็นแบบใช่/ไม่ใช่ ที่คืนค่า P(yes) ระหว่าง 0 ถึง 1 choice เลือกหนึ่งป้ายชื่อจากชุดตัวเลือกที่ตั้งชื่อไว้ และคืนค่าป้ายชื่อ ความเชื่อมั่น และความน่าจะเป็นของแต่ละตัวเลือก score วางสถานะบนสเกลเรียงลำดับตั้งแต่สองถึงสิบ และคืนค่าระดับที่คาดหวังพร้อมการแจกแจงและคำอธิบายสัญลักษณ์ สัญญาณถูกอ่านจาก logits ณ ตำแหน่งตัวแทนในรอบเดียว ไม่ได้สุ่มตัวอย่างทีละโทเค็น ซึ่งเป็นเหตุผลว่าทำไมบล็อกการใช้งานจึงรายงานโทเค็นเอาต์พุตเป็นศูนย์ได้โดยไม่โกหก
ความแตกต่างนั้นเปลี่ยนบิลของคุณก่อนที่มันจะเปลี่ยนความแม่นยำของคุณ การเรียกใช้การจำแนกประเภทของ Granite ที่คิดเป็น 400 โทเคน คือการเรียกที่คุณจ่ายสำหรับโทเคนเอาต์พุต 400 โทเคน และป้ายกำกับที่คุณต้องการก็ถูกฝังอยู่ในข้อความร้อยแก้วที่ตัวแยกวิเคราะห์ต้องไปดึงออกมา การเรียก d1-3B คิดค่าใช้จ่ายเฉพาะอินพุตเท่านั้น หากทราฟฟิกส่วนใหญ่ของคุณเป็นป้ายกำกับที่มีกฎแนบอยู่ คุณก็กำลังจ่ายสำหรับการให้เหตุผล ไม่ว่ามันจะเปลี่ยนป้ายกำกับหรือไม่ก็ตาม
ในกรณีที่ Granite 4.2 3B เป็นตัวเลือกที่เหนือกว่าอย่างชัดเจน
หากมอง benchmark ด้าน reasoning ตามที่รายงานไว้ — พวกมันเป็นของ IBM เอง รันผ่านไปป์ไลน์ NeMo Evaluator ภายใน และไม่มีบุคคลภายนอกใดทำซ้ำได้ — และรุ่น 3B ก็แข็งแกร่งผิดปกติเมื่อเทียบกับขนาดของมัน: AIME25 78.33, HMMT February 2025 66.67, GPQA 54.80, LiveCodeBench v6 69.71, MMLU-Pro 67.84, IFBench 74.33, BFCL v4 52.41, tau3-bench 45.78 และ RULER 64K 67.52 ลดลงเหลือ 55.30 ที่ 128K
จากรายการนั้นมีงานสี่งานตามมา และ d1-3B ไม่ได้อยู่ในงานใดในนั้นเลย
• บริบท 128K โดยกำเนิด ขยายได้ถึง 512K เทียบกับ 32,768 โทเค็นบน d1-3B — ถ้าสถานะของคุณเป็นเอกสารยาว ตัวเลือกก็ถูกกำหนดให้คุณแล้ว
• การเรียกใช้เครื่องมือเชิงเอเจนต์พร้อม parser ที่มีเอกสารกำกับและการผสานรวมฮาร์เนสสำหรับ OpenCode, Pi และ OpenHands ซึ่งโมเดลสำหรับการตัดสินใจไม่มีสิ่งที่เทียบเท่า
• งานใดก็ตามที่คำตอบเป็นย่อหน้า: การสรุปความ การร่าง การดึงข้อมูลออกมาเป็นโครงสร้างแบบอิสระ การสร้างโค้ด
• การปรับแต่งละเอียดและการเผยแพร่ต่อโดยไม่มีเพดานรายได้ เนื่องจาก Apache 2.0 ไม่มีข้อกำหนดเรื่องเกณฑ์
สังเกตว่าสิ่งใดไม่ปรากฏอยู่บนการ์ด Granite: แถว SWE-Bench และ Terminal-Bench ถูกทำเครื่องหมายเป็น NA สำหรับรุ่น 3B ขั้นตอนการเรียนรู้แบบเสริมกำลังเชิงเอเจนต์ของ IBM ถูกนำมาใช้กับสมาชิกขนาด 8B และ 30B ของตระกูลเท่านั้น ดังนั้นโมเดลที่เล็กที่สุดจึงไม่ได้มีคะแนนเชิงเอเจนต์แบบที่พี่น้องขนาดใหญ่มี ทีมที่อ่าน "Granite 4.2" แล้วสันนิษฐานว่ารุ่น 3B สืบทอดโปรไฟล์เชิงเอเจนต์ของตระกูลจะประหลาดใจ

จุดที่ d1-3B ชนะก่อนที่ Granite จะคิดเสร็จ
ตารางค่า latency ของ Liquid เอง ซึ่งวัดแบบอุ่นเครื่อง ทีละคำขอ เป็นส่วนที่แข็งแรงที่สุดของข้อโต้แย้ง: คำถามเดียวใช้เวลา 8 ms บน RTX 4090 และ 9 ms บน AMD MI325X, 16 ms บน Jetson AGX Thor และ 26 ms บน Jetson AGX Orin 64GB โดยอัด 64 สถานะไว้ในหนึ่งพาสที่ 475/s บน 4090 และ 1,106/s บน MI325X เพื่อให้เห็นสเกล นั่นคือเวลาประมาณที่ Granite 4.2 3B ต้องใช้เพื่อปล่อยโทเคนไม่กี่ตัวจากร่องรอยการให้เหตุผลของมัน
การถามสามประเภทบน state เดียวทำให้ d1-3B ใช้เวลาเพียง 21 ms บน 4090 แทนที่จะต้องเรียกแยกกันสามครั้ง เพราะ state และอิมเมจของ state ถูกอ่านเพียงครั้งเดียวสำหรับทุกคำถาม ในสแต็กด้าน moderation หรือ routing ที่เคยยิง HTTP request หนึ่งครั้งต่อหนึ่งกฎ นั่นคือความแตกต่างระหว่างการเรียกที่เรียงเป็นคิวกัยการเรียกเพียงครั้งเดียว
มันยังมองเห็นได้อีกด้วย d1-3B ทำคะแนนเฉลี่ย 74.1 จากเกณฑ์มาตรฐานภาพสาธารณะ 11 รายการ เทียบกับ 73.9 ของโมเดลฐาน และการ์ดระบุว่าเมื่อนำภาพออก คำถามเดียวกันได้คะแนน 45.1 — คำตอบมาจากภาพ ไม่ใช่จากพรอมป์ต์ข้อความ แต่ละแถวให้ผลทั้งสองทาง (CV-Bench 82.1 เทียบกับ 87.6 ของโมเดลฐาน, POPE 88.5 เทียบกับ 90.1) ดังนั้นข้ออ้างเรื่องความสามารถด้านภาพจึงเป็น "อยู่ในระดับเดียวกับโมเดลฐาน" ไม่ใช่ "ดีกว่า"
ข้อถ่วงดุลที่ตรงไปตรงมา: ค่า 48.57 ของ d1-3B บน Decision Index 0.2.1 เกิดจาก Liquid ที่รันตัวให้คะแนนอย่างเป็นทางการด้วยตัวเอง แทนที่จะมาจากการส่งเข้าลีดเดอร์บอร์ด และแถวที่แข่งขันกันนั้นมาจากลีดเดอร์บอร์ดสาธารณะ ค่าเฉลี่ย 77.1 ของมันจากงานแบบ benchmark-as-decision แปดงาน และค่า 71.8 บน DecisionBench ก็มาจากเจ้าของเองเช่นกัน ทุกอย่างในฝั่ง d1 ของการเปรียบเทียบนี้ยังไม่ได้รับการตรวจสอบยืนยัน

ทำไมตัวให้เหตุผลขนาด 3B จึงไม่ใช่โมเดลตัดสินใจขนาด 3B
แนวทางที่ชวนให้เลือกคือการมอง Granite 4.2 3B เป็นตัวแทนที่ถูกกว่าของ d1-3B หรือกลับกัน ทั้งสองอย่างล้มเหลว และความล้มเหลวนี้เป็นเชิงโครงสร้างมากกว่าจะเป็นเรื่องของคุณภาพ
ขอให้ Granite ตัดสินใจ แล้วคุณจะได้ผลลัพธ์ที่ต้องแยกวิเคราะห์ ใบเรียกเก็บเงินที่เพิ่มขึ้นตามความยากของคำถามที่โมเดลมองว่าเป็น และความหน่วงที่ขึ้นอยู่กับโหมดคิดที่คุณเลือก ขอให้ d1-3B คิดวิเคราะห์ แล้วคุณจะไม่ได้อะไรเลย — มันไม่มีสตรีมโทเคนให้ใช้คิดวิเคราะห์ โมเดลทั้งสองอยู่คนละฝั่งของเส้นแบ่งที่ไปป์ไลน์ส่วนใหญ่ข้ามไปมาหลายครั้งต่อคำขอ: ต้องมีบางอย่างตัดสินใจ และต้องมีบางอย่างพูดออกมา d1-3B ควรอยู่ด้านหน้า ซึ่งกฎคัดกรองจะเลือกเส้นทางและคืนค่าความเชื่อมั่นที่ปรับเทียบแล้ว Granite 4.2 3B ควรอยู่ถัดจากมัน บนสาขาที่ต้องเขียนคำตอบ
ยังมีกับดักอีกอย่างที่เงียบกว่า คุณค่าของโมเดลตัดสินใจอยู่ที่การสอบเทียบ นั่นคือความมั่นใจ 0.9 ที่ถูกต้องเก้าครั้งในสิบ การ์ดของ Granite 4.2 3B ไม่ได้เผยแพร่ตัวชี้วัดการสอบเทียบและไม่เผยแพร่ความน่าจะเป็น แต่เผยแพร่คะแนนความแม่นยำและคะแนนการให้เหตุผล การเปรียบเทียบทั้งสองบนลีดเดอร์บอร์ดของเบนช์มาร์กไม่ได้บอกอะไรเลยว่าคุณควรไว้วางใจตัวไหนเมื่อต้องใช้กับเกณฑ์ตัดสิน
บรรทัดสัญญาอนุญาตที่ไม่มีใครใส่ไว้ในตาราง
Granite 4.2 3B เผยแพร่ภายใต้ Apache 2.0 ส่วน d1-3B เผยแพร่ภายใต้ LFM Open License v1.0 ซึ่งอ่านดูผ่อนปรนจนถึงข้อ 5: การใช้เชิงพาณิชย์ได้รับอนุญาตโดยมีเงื่อนไขว่าคุณหรือนิติบุคคลของคุณต้องมีรายได้ต่อปีต่ำกว่าเกณฑ์ที่กำหนดไว้ในเอกสารเดียวกัน ซึ่งระบุว่าเป็นรายได้ต่อปีสิบล้านดอลลาร์สหรัฐหรือมากกว่า และการใช้เชิงพาณิชย์ใด ๆ ที่เกินเส้นนั้นก็ไม่ได้รับอนุญาตเลย องค์กรไม่แสวงหากำไรและผู้ใช้เพื่อการวิจัยได้รับการยกเว้นไว้
สำหรับนักทำงานอดิเรกหรือสตาร์ทอัพแล้ว เรื่องนี้ไม่ใช่ปัญหา สำหรับบริษัทที่ข้ามเส้นนั้นกลางปี — หรือที่อาจถูกบริษัทแบบนั้นเข้าซื้อ — รีโปทั้งสองไม่ใช่ชิ้นงานที่เทียบเท่ากัน ไม่ว่าจำนวนพารามิเตอร์ของพวกมันจะดูใกล้เคียงกันแค่ไหน และการตรวจสอบสัญญาอนุญาตก็เกิดขึ้นนานหลังจากที่มีคนส่งต้นแบบออกไปแล้ว มันเป็นสิ่งที่สุดบนหน้านี้ที่ถูกที่สุดในการตรวจสอบตั้งแต่เนิ่น ๆ
การรันทั้งคู่เป็นไปป์ไลน์เดียว
ปัจจุบันไม่มีโมเดลใดในสองรุ่นนี้อยู่ในแคตตาล็อกของเรา ดังนั้นนี่จึงไม่ใช่การรับประกันเรื่องความพร้อมให้บริการ ทั้งสองรุ่นเป็นอาร์ติแฟกต์ที่โฮสต์เอง และ Granite 4.2 3B โดยเฉพาะไม่มีผู้ให้บริการการอนุมาน (inference) ระบุอยู่ในบัตรโมเดลเลยแม้แต่รายเดียว แต่รูปแบบที่ทีมหนึ่ง ๆ ลงเอยด้วยจริง ๆ คือการเรียกหนึ่งครั้งที่ตัดสินใจ และอีกครั้งที่พูดออกมา และรูปแบบนี้เองคือจุดที่เลเยอร์การจัดเส้นทางพิสูจน์คุณค่าของตัวเอง OrcaRouter วางโมเดลมากกว่า 200 รุ่นไว้เบื้องหลังคีย์ API เดียว โดยราคาตามรายการของผู้ให้บริการถูกส่งต่อโดยไม่บวกเพิ่ม 0% ดังนั้นการลดราคาจากผู้ขายจึงสะท้อนมาถึงใบเรียกเก็บเงินของคุณภายในวันเดียวกัน แทนที่จะรอถึงการต่อสัญญาครั้งถัดไป และ การสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดความขัดข้อง หมายความว่าองค์ประกอบที่ใช้ร่วมกันตรงกลางไปป์ไลน์จะไม่กลายเป็นจุดล้มเหลวจุดเดียวในขณะที่คุณยังประเมินมันอยู่ หากคุณต้องการทดสอบ A/B d1-3B เทียบกับโมเดลเอนกประสงค์ที่โฮสต์ให้บริการ ด้วยทราฟฟิกของคุณเอง ก่อนตัดสินใจใช้งานแบบโฮสต์เอง เพื่อนบ้านที่ใกล้เคียงที่สุดในเส้นทางที่จัดให้และใกล้เคียงสายตระกูลของ Granite ก็คือ Gemma 4 31B ในราคา 0.13 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเคน และ 0.38 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน — เป็นโมเดลที่ใหญ่กว่ามาก แต่ทำหน้าที่ "โมเดลเอนกประสงค์ที่เขียนเก่ง" ในไปป์ไลน์เช่นเดียวกัน
คำตัดสิน ซึ่งระบุไว้เป็นกฎ
ถ้าสิ่งที่คุณต้องการคือการตัดสินใจ — สแปมหรือไม่, ควรเข้าคิวไหน, เร่งด่วนแค่ไหน, ภาพนี้ตรงกับคำอธิบายนั้นหรือไม่ — d1-3B เป็นเพียงตัวเดียวในสองตัวที่ทำงานนั้นได้ในรอบเดียว และทำได้ภายในเวลาไม่ถึง 10 มิลลิวินาที ถ้าสิ่งที่คุณต้องการคือคำตอบที่เป็นข้อเขียน, การอ่านเอกสารยาว ๆ, การเรียกใช้เครื่องมือ หรือโค้ดสักชิ้น Granite 4.2 3B คือตัวที่มีสตรีมโทเคนอยู่จริง และคะแนนการให้เหตุผลของ 3B ก็น่าประทับใจจริง ๆ สำหรับขนาดของมัน — ในการประเมินของ IBM เอง โดยที่ยังไม่มีใครตรวจสอบคะแนนเหล่านั้นเลย
สิ่งที่ทำให้ภาพเปลี่ยนไปไม่ใช่แถวเบนช์มาร์กแถวใหม่ แต่คือบุคคลที่สามที่ให้คะแนนทั้งสองโมเดลบนชุดทดสอบคาลิเบรชันเดียวกัน เพราะคุณสมบัติที่ตัดสินว่าคุณจะกำหนดเกณฑ์ให้โมเดลได้หรือไม่ คือคุณสมบัติที่การ์ดทั้งสองใบไม่ได้ทำให้คุณเปรียบเทียบได้ในวันนี้
