
MiniCPM5-2B เทียบกับ Granite 4.2 3B: ผู้เชี่ยวชาญด้านการให้เหตุผลขนาด 3B เทียบกับสแตกเอเจนต์ขนาด 2.5B ตัวใหม่
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ModelBest เอา Granite 4.2 3B ไปวางบนกระดานคะแนนของ MiniCPM5-2B เองก่อนที่ใครจะขอเสียอีก โมเดลการ์ดของ MiniCPM5-2B ที่ OpenBMB เผยแพร่ตอนที่น้ำหนักโมเดลถูกปล่อยลง Hugging Face แบบเงียบ ๆ นั้นระบุโมเดล reasoning ขนาดเล็กที่สุดของ IBM ไว้ในกลุ่ม baseline สำหรับการเปรียบเทียบ และในชุดทดสอบนั้นแสดงให้เห็นว่า MiniCPM5-2B ทำคะแนนเฉลี่ย 53.9 ขณะที่ Granite 4.2 3B ได้ 42.7 นี่เป็นตัวเลขการเปรียบเทียบแบบตัวต่อตัวเพียงชุดเดียวที่ทั้งสองผู้จำหน่ายเผยแพร่สำหรับคู่นี้ ซึ่งทำให้เป็นจุดเริ่มต้นที่เป็นธรรมชาติ — และเป็นจุดที่ควรระมัดระวังเช่นกัน โมเดลทั้งสองมีขนาดเล็ก ใช้สัญญาอนุญาต Apache-2.0 และเป็น open-weights ที่โฮสต์เอง มุ่งเป้าไปที่งานเดียวกันในช่วงปลายปี 2026 แต่ใช้แนวทางคนละทาง โดยตัวหนึ่งถูกฝึกให้คิดให้เหตุผล ส่วนอีกตัวถูกฝึกให้ลงมือทำ
ทั้งสองรุ่นที่ปล่อยออกมานี้มีความคล้ายคลึงกันมากกว่าที่การตลาดของผู้จำหน่ายจะบอกเป็นนัย MiniCPM5-2B ถูกเปิดตัวที่งาน World Artificial Intelligence Conference เมื่อวันที่ 19 กรกฎาคม ในฐานะเรือธงสำหรับอุปกรณ์ของ ModelBest และ OpenBMB — โมเดลแบบ dense ระดับ 2B ที่วางตำแหน่งให้เป็นฐานเอเจนต์สำหรับโทรศัพท์ พีซี และสมาร์ทค็อกพิท — และค่าน้ำหนักของมันปรากฏขึ้นในวันที่ 6 และ 7 กันยายนโดยไม่มีงานเปิดตัวใด ๆ ภายใต้ Apache-2.0 พร้อมกับ GGUF, MLX, GPTQ, base, SFT และ draft checkpoints รวมถึงข้อมูลการฝึกที่อยู่เบื้องหลัง Granite 4.2 3B คือโมเดลให้เหตุผลขนาดแล็ปท็อปของ IBM ซึ่งค่าน้ำหนักไปถึง Hugging Face ในช่วงต้นเดือนสิงหาคม และ model card พร้อมบล็อกเทคนิคถูกเผยแพร่ในวันที่ 25 สิงหาคม ทั้งคู่ยังไม่ถูกแตะต้องโดยเกณฑ์วัดอิสระเลย นั่นคือเหตุผลว่าทำไมป้ายแหล่งที่มาด้านล่างจึงสำคัญกว่าตัวเลข
สองรีลีสที่คล้องจองกัน
Granite 4.2 3B เป็นโมเดล reasoning แบบ dense สแตนด์อโลน ซึ่งผ่านการ post-training ต่อจาก Granite-4.1-3B-Base ตัวโมเดลมี 40 เลเยอร์พร้อม attention แบบ grouped-query มี native context ขนาด 128K ซึ่ง IBM ขยายเป็น 512K ในเฟส pre-training ที่ 5 และมีโหมดการคิด 3 โหมดต่อหนึ่งคำสั่ง ได้แก่ การคิดเต็มรูปแบบซึ่งเป็นค่าเริ่มต้น โหมดใช้ความพยายามต่ำ และโหมดไม่คิด การ์ดโมเดลของมันระบุไว้ชัดเจนว่าโมเดลนี้ไม่ใช่อะไร: ไม่เหมือน Granite 4.2 รุ่นพี่น้องขนาด 8B และ 30B รุ่น 3B นี้จงใจข้ามบล็อก reinforcement learning เชิงเอเจนต์เฉพาะทางซึ่งถูกฝึกในสภาพแวดล้อมของ SWE-agent เทอร์มินัล และการค้นหา ด้วยเหตุนี้ IBM จึงไม่รายงานผลลัพธ์ SWE-bench และวางตำแหน่งโมเดลนี้เป็นผู้เชี่ยวชาญด้าน reasoning มากกว่าจะเป็นเอเจนต์ โมเดลให้บริการผ่าน vLLM, SGLang, Transformers, GGUF และ Ollama (granite4.2:3b) ใช้หน่วยความจำราว 6–8GB ในรูปแบบ bfloat16 หรือต่ำกว่า 2GB เมื่อทำ quantization และไม่มี API แบบโฮสต์ให้บริการ ตัวเลขเด่น — AIME 2025 ที่ 78.33, GPQA ที่ 54.80, LiveCodeBench v6 ที่ 69.71, MMLU-Pro ที่ 67.84 — เป็นตัวเลขที่ IBM รายงาน และยังไม่มีการตรวจสอบซ้ำโดยอิสระ ณ วันนี้

MiniCPM5-2B เป็นโมเดลเชิงเอเจนต์ (agent-oriented) ที่เสร็จสมบูรณ์แล้วแทน การ์ดโมเดลระบุว่าเป็น dense transformer ที่มีพารามิเตอร์รวม 2.52 พันล้าน (1.98 พันล้านไม่นับส่วน embedding) 42 เลเยอร์ ขนาด hidden 2048 ใช้ grouped-query attention ที่มี query heads 16 ตัวและ KV heads 2 ตัว และใช้สถาปัตยกรรม LlamaForCausalLM มาตรฐานโดยไม่มี custom kernels จุดขายตอนเปิดตัวเน้นความสามารถเชิงเอเจนต์ — agent mid-training ระดับ 200B ชุด agent-SFT ขนาดใหญ่ และการปรับเทียบ RL เชิงเอเจนต์ ปิดท้ายด้วย On-Policy Distillation ที่รวมโมเดลผู้เชี่ยวชาญ RL สิบหกตัวกลับเข้าเป็นเครือข่าย dense เล็กหนึ่งตัว — บวกกับบริบทยาวแบบเนทีฟและโหมดตอบสนองแบบไฮบริด (เร็ว/ไตร่ตรอง) คอนฟิกที่ปล่อยออกมาระบุหน้าต่างบริบท 131,072 โทเคน (เอกสารเดือนกรกฎาคมอวดอ้าง 512K แต่คอนฟิกที่ปล่อยจริงไม่มีค่านั้น) และการ์ดอ้างว่ารองรับการเรียกใช้เครื่องมือแบบ XML กับตัวแยกวิเคราะห์ SGLang ในตัว ในตารางประเมินของตัวเอง รายงานค่าเฉลี่ยภายใน 53.9 ในชุดเปรียบเทียบที่ผู้จำหน่ายคัดเลือกไว้ในการ์ด AIME 2025/2026 เท่ากับ 86.5 MATH-500 เท่ากับ 94.6 และผล vendor-run เท่ากับ 46.4 บน SWE-bench Verified ซึ่งจะน่าทึ่งมากสำหรับโมเดล dense ขนาด 2.5 พันล้านพารามิเตอร์ หากผ่านการทดสอบจากหน่วยงานอิสระ

การเปรียบเทียบตัวต่อตัวที่มีคนพิมพ์ไว้แล้ว
เนื่องจากสกอร์บอร์ดข้ามผู้ผลิตส่วนใหญ่เทียบกันแบบแอปเปิลกับส้ม สิ่งที่มีประโยชน์ที่สุดเพียงอย่างเดียวในการประลองครั้งนี้คือสิ่งที่ ModelBest พิมพ์ออกมาเอง นั่นคือ การ์ดของ MiniCPM5-2B ระบุ granite-4.2-3B ไว้ในกลุ่ม baseline และรายงานว่า MiniCPM5-2B ทำค่าเฉลี่ย 53.9 ขณะที่ Granite ได้ 42.7 ในชุดทดสอบนั้น จงอ่านมันตามที่มันเป็นจริง ๆ เป๊ะ ๆ — ผู้ผลิตรายหนึ่งเป็นคนรันโมเดลทั้งสองตัวบนชุดทดสอบชุดเดียวที่ตัวเองเลือก ยังไม่มีการรันซ้ำเพื่อยืนยัน และมีแรงจูงใจเต็มที่ที่จะให้โมเดลของตัวเองชนะ มันไม่ใช่คำตัดสิน สิ่งที่มันบอกคุณได้ก็คือ ModelBest มั่นใจพอที่จะเอาโมเดล 3B ของคู่แข่งมาแสดงไว้บนการ์ดของตัวเอง และช่องว่างที่มันกล่าวอ้างว่ามากที่สุดก็อยู่ตรงจุดที่การเทรนของตัวเองทุ่มเทลงไปพอดี นั่นคือแถว agentic และ long-context จงถือว่ามันเป็นเพียงคำกล่าวอ้างเชิงทิศทาง และชั่งน้ำหนักคำกล่าวอ้างบนการ์ดฉบับแยกต่างหากของ IBM เองก่อนคุณจะตัดสินใจอะไรจากมัน
กระดานคะแนนที่ระบุอย่างตรงไปตรงมา
• เปิดตัว — MiniCPM5-2B: ประกาศเมื่อวันที่ 19 กรกฎาคม 2026; เผยแพร่ weights ในวันที่ 6–7 กันยายน แบบเงียบ ๆ ส่วน Granite 4.2 3B: weights ออกช่วงต้นเดือนสิงหาคม; การ์ดโมเดลและบล็อกเทคนิคในวันที่ 25 สิงหาคม 2026
• บทบาท — MiniCPM5-2B: เน้นเอเจนต์บนอุปกรณ์และการใช้เครื่องมือ ตาม ModelBest ส่วน Granite 4.2 3B: ผู้เชี่ยวชาญด้านการให้เหตุผล จงใจไม่เป็นเอเจนต์ ตาม IBM
• ขนาด — MiniCPM5-2B: ทั้งหมด 2.52B / ไม่รวม embedding 1.98B, 42 ชั้น Granite 4.2 3B: ~3B แบบ dense, 40 ชั้น
• บริบท — MiniCPM5-2B: 131,072 โทเค็นในการกำหนดค่าที่มาพร้อมเครื่อง Granite 4.2 3B: 128K ดั้งเดิม ขยายได้ถึง 512K
• Post-training — MiniCPM5-2B: SFT แบบคิดเชิงลึก, RL เฉพาะทาง, On-Policy Distillation. Granite 4.2 3B: SFT สำหรับการให้เหตุผล, GRPO RL และ RLHF; ไม่มีบล็อก agentic-RL
• หลักฐาน — MiniCPM5-2B: คำกล่าวอ้างจากการ์ดของ ModelBest ยังไม่มีการรันเพื่อตรวจสอบแบบอิสระ Granite 4.2 3B: คำกล่าวอ้างจากการ์ดของ IBM ยังไม่มีการทำซ้ำเพื่อยืนยันผล; AIME 2025 ได้ 78.33, GPQA ได้ 54.80, LiveCodeBench v6 ได้ 69.71

ป้ายคะแนนด้านบนมีแหล่งข้อมูลเดียวกันกับเนื้อหาร้อยแก้ว: ทุกตัวเลขบนนั้นมาจากรายงานของผู้ขาย และการเปรียบเทียบภายในชุดเครื่องมือเดียวกันเพียงอย่างเดียวที่ผู้ขายรายใดเผยแพร่คือการเปรียบเทียบบนการ์ดของ ModelBest เอง
ผู้เชี่ยวชาญด้านการใช้เหตุผลเทียบกับสแตกเอเจนต์
ก่อนที่จะพูดถึงคะแนน ให้ตัดสินใจก่อนว่างานของคุณต้องการโมเดลขนาดเล็กแบบใด เพราะสองรุ่นนี้ตอบคำถามคนละข้อ Granite 4.2 3B ถูกสร้างขึ้นมาเพื่อการให้เหตุผลและการรองรับคอนเท็กซ์ยาวบนฮาร์ดแวร์ที่มีทรัพยากรจำกัด พร้อมด้วยหน้าต่างคอนเท็กซ์แบบเนทีฟขนาด 128K ที่ขยายได้ถึง 512K, โหมดการคิดสามแบบ, ขนาดที่เล็กพอจะรันบนแล็ปท็อปได้ และการตัดสินใจอย่างชัดเจนที่จะข้ามการฝึกแบบเอเจนต์ หากงานของคุณคือการวิเคราะห์เอกสารยาวๆ คอนเท็กซ์ระดับรีพอซิทอรี หรือการให้เหตุผลหลายขั้นตอนที่เชื่อถือได้บนเครื่องเล็กๆ นี่คือตัวเลือกที่เข้ากันได้อย่างลงตัว และการที่ IBM ตัดสินใจไม่กล่าวอ้างความสามารถแบบเอเจนต์บนรุ่น 3B ก็เป็นเหตุผลให้เชื่อถือการ์ดของมัน ไม่ใช่ข้อบกพร่อง MiniCPM5-2B ถูกสร้างขึ้นมาโดยเน้นในทางตรงข้าม: พฤติกรรมแบบเอเจนต์และการใช้เครื่องมือบนอุปกรณ์ — ไพพ์ไลน์การฝึกของมันอ่านแล้วเหมือนกับรายการสิ่งที่ Granite 4.2 3B จงใจตัดทิ้ง หากงานของคุณคือลูปเอเจนต์บนอุปกรณ์ที่ต้องเรียกใช้เครื่องมือ สนทนายาวๆ และสลับระหว่างการตอบแบบเร็วกับการตอบแบบไตร่ตรอง นี่คือสแตกที่ออกแบบมาเพื่อคุณ และมันมาพร้อมกับความไม่แน่นอนที่เพิ่มขึ้นของเช็คพอยต์อายุหนึ่งสัปดาห์ซึ่งการ์ดของมันยังไม่ผ่านการตรวจสอบ
ข้อมูลที่ OpenBMB เปิดเผย IBM ไม่ได้เปิดเผย
ความต่างที่น่าตื่นเต้นน้อยที่สุดกลับเป็นเรื่องที่สำคัญที่สุดสำหรับทีมที่ต้องการ fine-tune โมเดล OpenBMB ปล่อยชุดข้อมูลฝึกของ MiniCPM5-2B ออกมาพร้อมกับค่าน้ำหนัก — ตระกูล UltraData ที่รวม Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math และชุด SFT กับ RL สำหรับเอเจนต์ — ทั้งหมดอยู่ภายใต้ใบอนุญาต Apache-2.0 นั่นทำให้โมเดล 2B เปลี่ยนจากกล่องดำเป็นสูตรสำเร็จที่ทำซ้ำได้: คุณเห็นว่าการ post-training เชิงเอเจนต์ถูกสร้างบนอะไร แล้วนำไปฝึกต่อบนโดเมนของคุณเองได้ IBM เปิดซอร์สค่าน้ำหนักของ Granite 4.2 3B พร้อมให้คำอธิบายทางเทคนิคว่าโมเดลถูกสร้างมาอย่างไร แต่ไม่เปิดเผยข้อมูลฝึก สำหรับองค์กรที่ต้องการเป็นเจ้าของโมเดลมากกว่าเช่าใช้ ความไม่สมมาตรนี้มีอยู่จริง และ MiniCPM5-2B ยังมาพร้อมกับศักยภาพด้านการปรับใช้ที่ Granite ซึ่งมีขนาดไล่เลี่ยกันยังเทียบไม่ได้: รองรับตั้งแต่วันแรก (day-zero) บนตระกูลชิปเก้าตระกูล ผ่านคอมมูนิตี้ FlagOS ของ ModelBest ไล่ตั้งแต่ Huawei Ascend, NVIDIA ไปจนถึงตัวเร่งประมวลผลภายในประเทศจีนหลายรุ่น รวมถึง ARM — ซึ่งเป็นสัญญาณว่า ModelBest คาดหวังให้โมเดล 2B นี้รันบนฮาร์ดแวร์อื่นนอกเหนือจาก GPU ของ NVIDIA
ความจริงของการกำหนดเส้นทาง
ทั้งสองโมเดลไม่ได้อยู่ในแคตตาล็อกแบบโฮสต์ในปัจจุบัน การเปรียบเทียบนี้จึงเกิดขึ้นในโลก self-hosted — แต่นั่นคือจุดที่เลเยอร์การจัดเส้นทางยังคงแสดงคุณค่าในฐานะตาข่ายนิรภัย มากกว่าที่จะเป็นกลไกส่งมอบ เมื่อทีมต้องการทดลองใช้โมเดล agentic 2B ที่เพิ่งออกมาได้หนึ่งสัปดาห์ เทียบกับโมเดล reasoning 3B บนเวิร์กโหลดที่ทีมให้บริการอยู่แล้ว ทางเลือกที่ย้อนกลับได้คือการชี้เส้นทางทดสอบไปที่บิลด์ MiniCPM5-2B แบบ self-hosted ผ่าน API เพียงตัวเดียวที่มีการ failover อัตโนมัติ ขณะที่โปรดักชันยังคงอยู่บนโมเดลที่ผ่านการพิสูจน์แล้ว — สแตกใหม่สามารถหยุดชะงักได้โดยไม่ทำให้อะไรล่ม และราคารายการของผู้ให้บริการสำหรับโมเดลแบบโฮสต์ที่คุณนำมาเปรียบเทียบจะถูกส่งผ่านที่มาร์กอัป 0% ทำให้การทดสอบ A/B ยังคงมีต้นทุนต่ำ เลเยอร์นี้ไม่ได้โฮสต์โมเดลทั้งสองตัว แต่มันทำให้การทดลองนี้ปลอดภัยที่จะรันและง่ายต่อการย้อนกลับ
คุณควรจะรันโมเดลเล็กตัวไหนจริงๆ
ให้รัน Granite 4.2 3B หากเวิร์กโหลดของคุณคือการให้เหตุผลบนบริบทยาว (long-context reasoning) บนเครื่องระดับแล็ปท็อป และคุณต้องการโหมดการคิดสามโหมด เพดาน 512K และการ์ดข้อมูลที่ตรงไปตรงมาซึ่งบอกชัดว่าโมเดล 3B ไม่ได้รับการฝึกให้ทำอะไรบ้าง ให้รัน MiniCPM5-2B หากเวิร์กโหลดของคุณคือเอเจนต์บนอุปกรณ์แบบโต้ตอบที่เรียกใช้เครื่องมือได้ ซึ่งโมเดลขนาด 2.5B พอดีกับงบประมาณหน่วยความจำของคุณ — แต่ต้องกันเวลาไว้เพื่อทำซ้ำตัวเลขสำคัญของมันก่อนจะเชื่อถือ เพราะค่าเฉลี่ย 53.9 และค่าอ้าง 46.4 จาก SWE-bench ยังเป็นของทางผู้ผลิตเท่านั้น ยังไม่มีใครอื่นยืนยัน สองสิ่งจะตัดสินการแข่งครั้งนี้ได้เร็วกว่าความคิดเห็นใดๆ นั่นคือการรัน MiniCPM5-2B อย่างอิสระซึ่งจะยืนยันหรือหักล้างข้อกล่าวอ้างด้านเอเจนต์ และตัวเลขการให้เหตุผลของ IBM ที่ต้องผ่านการทำซ้ำโดยชุมชนให้ได้ จนกว่าหนึ่งในสองอย่างนี้จะเกิดขึ้น Granite 4.2 3B คือโมเดลเล็กที่ปลอดภัยกว่าและมีเอกสารครบถ้วนกว่าในปัจจุบัน ส่วน MiniCPM5-2B คือการเดิมพันที่น่าสนใจกว่า
