
MiniCPM5-2B-DSpark vs Granite 4.2 3B: สองการเปิดตัว Apache-2.0 แบบเงียบ ๆ สำหรับการให้บริการโมเดลขนาดเล็กที่รวดเร็วและโฮสต์ด้วยตนเอง
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
เดือนสิงหาคมและต้นเดือนกันยายน 2026 มีเวอร์ชัน Apache-2.0 ที่เงียบ ๆ สองเวอร์ชันออกมาเพื่อจุดประสงค์เดียวกัน นั่นคือโมเดลขนาดเล็กที่คุณโฮสต์เอง — และทั้งคู่ใช้แนวทางจากคนละขั้ว Granite 4.2 3B คือโมเดลเหตุผลขนาดเท่าแล็ปท็อปของ IBM ซึ่งน้ำหนักโมเดลลงบน Hugging Face ในช่วงต้นเดือนสิงหาคม และบัตรโมเดลกับบล็อกเทคนิคออกเมื่อวันที่ 25 สิงหาคม 2026 MiniCPM5-2B-DSpark ไม่ใช่โมเดลในความหมายเดียวกันเลย: มันคือดราฟต์เช็คพอยต์ DSpark ขนาด 323.8M พารามิเตอร์ ซึ่ง OpenBMB โพสต์เมื่อวันที่ 6 กันยายน 2026 โดยไม่มีการประกาศใด ๆ สร้างขึ้นเพื่อทำให้ MiniCPM5-2B — โมเดลหนาแน่นสำหรับอุปกรณ์ขนาด 2.52B ที่ ModelBest ประกาศที่ WAIC เมื่อวันที่ 19 กรกฎาคม 2026 — สร้างโทเคนได้เร็วขึ้นผ่าน speculative decoding หนึ่งคือโมเดลเหตุผลขนาดเล็กที่ standalone; อีกตัวคืออุปกรณ์เสริมเร่งความเร็วสำหรับโมเดลขนาดเล็ก ทั้งคู่อยู่ภายใต้ Apache-2.0 ทั้งคู่โฮสต์เองเท่านั้น และยังไม่มีตัวใดถูกทดสอบด้วยเบนช์มาร์กอิสระเลย
เมื่อลอกชั้นการตลาดออกไป คำถามเชิงปฏิบัติที่ทีมต้องเผชิญก็ตรงไปตรงมา: สำหรับปริมาณงานเสิร์ฟแบบโฮสต์เองขนาดเล็กในช่วงปลายปี 2026 คุณต้องการโมเดลผู้เชี่ยวชาญด้านการให้เหตุผลขนาด 3B ของ IBM หรือสแตกเชิงเอเจนต์ขนาด 2B ของ ModelBest ที่มีดราฟต์โมเดลฟรีแถมติดมาด้วย? หลักฐานที่มีอยู่นั้นบางเบากว่าที่สเปกชีตของเวนเดอร์ทั้งสองชี้แนะ บทความนี้จึงพาไปดูข้อเท็จจริงเรื่องการเปิดตัว ตัวเลขจากชุดเบนช์มาร์กเดียวกันชุดเดียวที่มีอยู่จริง และความแตกต่างของลักษณะงานที่ควรเป็นตัวกำหนดการเลือก
การเปิดตัวทั้งสองครั้ง สิ่งที่ทราบได้
Granite 4.2 3B เป็นโมเดล reasoning ที่เล็กที่สุดของ IBM ซึ่งผ่านการ post-trained จาก Granite-4.1-3B-Base โมเดลนี้เป็นแบบ dense และรองรับข้อความเท่านั้น ประกอบด้วย 40 เลเยอร์, grouped-query attention, บริบทพื้นเมือง 128K ที่ขยายเป็น 512K ในช่วง pre-training ระยะที่ห้า และมีโหมด reasoning สามโหมด: การคิดแบบเต็มรูปแบบเป็นค่าเริ่มต้น, โหมดใช้ความพยายามต่ำ และเส้นทางแบบไม่คิด เอกสารของ IBM ระบุชัดเจนว่าโมเดล 3B จงใจข้ามบล็อก agentic reinforcement-learning ที่พี่น้อง Granite 4.2 รุ่นใหญ่ได้รับ ดังนั้นจึงไม่มีผลลัพธ์ SWE-Bench และเป็นโมเดล reasoning มากกว่าโมเดล agent โมเดลนี้ให้บริการผ่าน vLLM, SGLang, Transformers, GGUF และ Ollama (granite4.2:3b) และไม่มี hosted API ตัวเลขเด่นบนการ์ดโมเดล — 78.33 ใน AIME 2025, 54.80 ใน GPQA, 69.71 ใน LiveCodeBench v6 — เป็นค่าที่รายงานโดยผู้จำหน่ายและยังไม่มีการตรวจสอบซ้ำจนถึงปัจจุบัน

การ์ด ibm-granite/granite-4.2-3b ด้านบนคือหน้าตาสาธารณะของการเปิดตัวครั้งนั้น: โมเดล 3B ที่ปรับจูนมาเพื่อการให้เหตุผล มีจุดเด่นด้านบริบทยาว และไม่มีการอ้างสิทธิ์ด้านเอเจนต์
ในทางตรงกันข้าม MiniCPM5-2B-DSpark มีไว้เพื่อรับใช้เป้าหมายของมันเพียงอย่างเดียว ตัวดราฟต์ประกอบด้วยเลเยอร์ full-attention ห้าชั้น มีพารามิเตอร์ 323,776,001 ตัว ขนาดบล็อกคือโทเคนตัวเลือกเจ็ดตัวต่อ forward pass ฝึกเป็นเวลาหก epochs บนโทเคน 7.05 พันล้านตัวจากคำตอบที่สร้างโดย MiniCPM5-2B ที่เก็บโค้ดของมันรายงานความยาวการยอมรับ — โทเคนที่ยอมรับเฉลี่ย 5.52 ตัวต่อขั้นตอนการตรวจสอบโดยรวมเมื่อใช้ greedy decoding และ 6.11 ตัวสำหรับโค้ด — แต่ไม่มีตัวเลขโทเคนต่อวินาที เป้าหมายที่มันเร่งความเร็วคือ MiniCPM5-2B ซึ่งเป็นผลิตภัณฑ์ที่น่าสนใจกว่า: โมเดลแบบ dense ที่มีพารามิเตอร์ 2.52B จำนวน 42 เลเยอร์ รองรับบริบท 128K เอกสารเปิดตัวเน้นความสามารถเชิงเอเจนต์ — การเทรนกลางระดับ 200B สำหรับเอเจนต์ ชุด agent-SFT ขนาดใหญ่ และการจัดแนว RL ของเอเจนต์ ตามประกาศของ ModelBest ในเดือนกรกฎาคม — พร้อมทั้งบริบทยาวแบบเนทีฟและโหมดไฮบริดแบบเร็ว/รอบคอบ ในชุดเปรียบเทียบของ ModelBest เอง โมเดลเป้าหมายได้คะแนนเฉลี่ย 53.9 เทียบกับโมเดลเปิดระดับเดียวกัน ตัวเลขทุกตัวเหล่านี้ล้วนมาจากผู้จำหน่าย

การ์ด openbmb/MiniCPM5-2B-DSpark ด้านบนคือทั้งหมดที่ปล่อยออกมา: โมเดลคาร์ด, คอนฟิก, ไฟล์ Safetensors หนึ่งไฟล์ และไม่มีการประกาศใดๆ
การเปรียบเทียบภายในชุดเดียวกันเพียงหนึ่งเดียวที่มีอยู่
กระดานคะแนนข้ามผู้จำหน่ายส่วนใหญ่เปรียบเทียบแอปเปิลกับส้ม แต่มีจุดเดียวที่ Granite 4.2 3B และ MiniCPM5-2B ถูกวัดร่วมกัน นั่นคือตารางประเมินของ ModelBest สำหรับ MiniCPM5-2B ซึ่งระบุ granite-4.2-3B ไว้ในบรรดาเกณฑ์พื้นฐาน ในชุดทดสอบนั้น MiniCPM5-2B ได้ค่าเฉลี่ย 53.9 ขณะที่ Granite 4.2 3B ได้ 42.7 จงอ่านตัวเลขนั้นตามที่เป็นจริง — ผู้จำหน่ายรายหนึ่งเป็นคนรันโมเดลทั้งสองบนชุดทดสอบชุดเดียว ไม่มีการตรวจสอบซ้ำ และถูกเลือกขึ้นมาเพื่อให้โมเดลของตัวเองดูดี มันไม่ใช่คำตัดสิน สิ่งที่มันบอกคุณคือ ModelBest มั่นใจพอที่จะนำโมเดล 3B ของคู่แข่งขึ้นการ์ด และช่องว่างที่มันอ้างว่ามากที่สุดนั้นอยู่ตรงจุดที่บริษัทลงทุนในการฝึกโมเดลของตัวเองพอดี นั่นคือแถวบริบทยาวและแถวเชิงเอเจนต์ (agentic) จงถือว่ามันเป็นข้อกล่าวอ้างเชิงทิศทาง พิสูจน์กับข้อมูลของคุณเอง และชั่งน้ำหนักข้อกล่าวอ้างบนการ์ดแยกต่างหากของ IBM ก่อนตัดสินใจใดๆ จากข้อมูลนี้
กระดานคะแนนที่ระบุอย่างตรงไปตรงมา
• เรือรุ่นใด — MiniCPM5-2B-DSpark: draft ขนาด 324M สำหรับ MiniCPM5-2B (target แบบ dense 2.52B) ไม่ได้ใช้งานเดี่ยว {{1}}Granite 4.2 3B:{{/1}} โมเดลแบบ dense {{2}}~3B{{/2}} ที่ใช้งานเดี่ยวได้และเน้นการให้เหตุผล
• บทบาท — สแตก MiniCPM5-2B: เน้นเอเจนต์บนอุปกรณ์และการใช้เครื่องมือ ตามที่ ModelBest ระบุ ส่วน Granite 4.2 3B: ผู้เชี่ยวชาญด้านการให้เหตุผล ซึ่งจงใจไม่เป็นเอเจนต์
• บริบท — MiniCPM5-2B เป้าหมาย: 128K แบบเนทีฟ Granite 4.2 3B: 128K แบบเนทีฟ ขยายได้ถึง 512K
• การเร่งความเร็ว — MiniCPM5-2B-DSpark: ใช้ DSpark ภายนอกเป็นตัวร่าง (draft) เจ็ดโทเคนต่อรอบ อัตราการยอมรับแบบ greedy อยู่ที่ ~5.5 ต่อขั้น (ตามรายงานใน repo) ส่วน Granite 4.2 3B: ไม่มีการส่งมาพร้อมกับรุ่นนี้
• สัญญาอนุญาต — ทั้งสองเป็น Apache-2.0.
• หลักฐาน — ตัวเลขของ MiniCPM เป็นค่าที่อ้างบนการ์ดโมเดลของ ModelBest (ชุดรวม: 53.9 เทียบกับ Granite 42.7); ตัวเลขของ Granite เป็นค่าที่อ้างบนการ์ดโมเดลของ IBM (AIME 2025 78.33, GPQA 54.80) ไม่มีการรันทดสอบอิสระของทั้งสองตัวนี้

ตารางคะแนนด้านบนมีแหล่งข้อมูลเดียวกันกับบทความ: ทุกตัวเลขที่แสดงเป็นข้อมูลที่ผู้จำหน่ายรายงาน และตัวเลขจากชุดเดียวกันเพียงตัวเดียวที่ผู้จำหน่ายรายใดรายหนึ่งเผยแพร่คือตัวเลขของ ModelBest เอง
ความแตกต่างที่เหนือกว่าเกณฑ์มาตรฐานทุกข้อ
ก่อนจะพูดถึงคะแนน ขอให้ตัดสินใจก่อนว่าเวิร์กโหลดของคุณต้องการโมเดลเล็กแบบใด เพราะสองรุ่นนี้ตอบคำถามคนละข้อ Granite 4.2 3B ถูกสร้างมาสำหรับการให้เหตุผลและบริบทยาวบนฮาร์ดแวร์ที่มีข้อจำกัด: หน้าต่างบริบทดั้งเดิม 128K ที่ขยายได้ถึง 512K โหมดการคิดสามแบบต่อเคียวรี ฟุตพริ้นท์ที่รันบนแล็ปท็อปได้ และการตัดสินใจอย่างชัดเจนที่จะข้ามการฝึกแบบเอเจนต์ หากงานของคุณคือการวิเคราะห์เอกสารยาว บริบทระดับรีโพซิทอรี หรือการให้เหตุผลที่เชื่อถือได้บนเครื่องเล็ก ๆ ก็นับว่าเข้ากันได้อย่างลงตัว MiniCPM5-2B ถูกสร้างขึ้นมาโดยเน้นด้านตรงข้าม: พฤติกรรมแบบเอเจนต์และการใช้เครื่องมือบนอุปกรณ์ — การที่มีดราฟต์อยู่เลยก็ส่งสัญญาณว่า ModelBest คาดหวังให้โมเดลนี้ถูกใช้งานแบบอินเทอร์แอกทีฟ และต้องการได้โทเคนต่อวินาทีกลับคืนมา หากงานของคุณคือลูปเอเจนต์บนอุปกรณ์ที่เรียกใช้เครื่องมือและสนทนายาว ๆ นั่นคือสแตกที่มุ่งเป้ามาที่คุณ
ร่างนี้เปลี่ยนแปลงความคุ้มค่าทางเศรษฐศาสตร์ของทางเลือกที่สองในแบบที่การเปิดตัวของ Granite ไม่ได้กล่าวถึง MiniCPM5-2B เป็นโมเดลแบบ dense และ speculative decoding ให้ผลตอบแทนสูงสุดในขอบเขตที่หน่วยความจำเป็นตัวจำกัดและเป็นแบบ dense พอดี — โมเดลคงที่ขนาดเล็กที่ใช้เสนอ tokens ให้กับโมเดลคงที่ที่ใหญ่กว่าเล็กน้อย ตัว draft ภายนอกที่เพิ่มน้ำหนัก BF16 ประมาณ 650MB ให้กับโมเดลเป้าหมาย ~5GB พร้อมเส้นทางให้บริการ SGLang ที่มีเอกสารรองรับ และอัตราการยอมรับแบบ greedy ที่ราวห้าครึ่ง tokens ต่อขั้นตอนการตรวจสอบ เป็นกลไกช่วยเพิ่มปริมาณงานที่น่าเชื่อถือสำหรับโมเดลที่คุณให้บริการแบบรับคำขอครั้งละหนึ่งรายการ แต่ข้อแม้ที่หลีกเลี่ยงไม่ได้คือ OpenBMB ยังไม่ได้เผยแพร่ตัวเลขการเร่งความเร็วแบบ end-to-end ดังนั้นกลไกนี้จึงยังไม่ได้ถูกปรับเทียบ IBM ไม่ได้จัดส่งตัว draft ภายนอกเทียบเท่าสำหรับ Granite 4.2 3B ในการเปิดตัวครั้งนี้ — คุณต้องรันมันแบบ dense และเรื่องความเร็วของมันก็เป็นเพียงว่าโมเดล 3B มีขนาดเล็กเท่านั้น
ใครควรดำเนินการอันไหน
• รัน Granite 4.2 3B หากงานของคุณคือการให้เหตุผลแบบบริบทยาวบนเครื่องระดับแล็ปท็อป — เช่น เอกสาร คลังโค้ด หรือการวิเคราะห์เชิงลึกแบบเธรดเดียว — และคุณต้องการโหมดคิดสามโหมดพร้อมเพดานบริบท 512K บนโมเดล Apache-2.0 ที่คุณควบคุมได้เต็มที่ ทั้งนี้ต้องยอมรับว่าไม่มีทั้ง agentic training และ hosted API
• รันสแต็ก MiniCPM5-2B พร้อมดราฟต์ DSpark ของมัน หากเวิร์กโหลดของคุณคือเอเจนต์บนอุปกรณ์แบบอินเทอร์แอกทีฟที่เรียกใช้เครื่องมือ โดยที่โมเดลเป้าหมายอยู่ในงบประมาณหน่วยความจำของคุณ และคุณต้องการปริมาณงานที่ดราฟต์ช่วยคืนกลับมาได้ จองเวลาเพื่อวัดความเร็วที่เพิ่มขึ้นจริงของดราฟต์บนบิลด์ SGLang ของคุณเอง เพราะยังไม่มีตัวเลขสำหรับมันถูกเผยแพร่
• รันทั้งสองไว้เบื้องหลังเลเยอร์การจัดเส้นทางหากคุณไม่แน่ใจจริงๆ ไม่มีโมเดลใดอยู่ในแคตตาล็อกที่โฮสต์ในปัจจุบันนี้ รวมถึง OrcaRouter ด้วย — ทั้งคู่เป็นข้อเสนอแบบโฮสต์เอง — แต่เราเตอร์ที่อยู่หน้าเอนด์พอยต์ของคุณเองพร้อมระบบเฟลโอเวอร์อัตโนมัติจะช่วยให้สแตกฉบับร่างตั้งอยู่บนเส้นทางทดสอบ ขณะที่โปรดักชันยังคงอยู่บนเส้นทางที่พิสูจน์แล้ว และการส่งผ่านมาร์กอัป 0% บนโมเดลที่โฮสต์โดยรอบช่วยให้การเปรียบเทียบ A/B มีต้นทุนต่ำ ประเด็นคือความสามารถในการย้อนกลับ: สลับชื่อโมเดล วัดผล แล้วสลับกลับหากเช็กพอยต์อายุหนึ่งวันหยุดชะงัก
สิ่งที่ควรดูต่อไป
สองสิ่งนี้จะตัดสินการเทียบเคียงครั้งนี้ได้เร็วกว่าความเห็นใด ๆ ประการแรก การรัน MiniCPM5-2B อย่างอิสระที่จะยืนยันหรือหักล้างค่าเฉลี่ย 53.9 และข้อกล่าวอ้างเชิงเอเจนต์ — โมเดล 2B ที่ทำคะแนนได้ดีถึงเพียงนั้นในงานแนว SWE-Bench จะกลายเป็นจุดข้อมูลใหม่ของกลุ่มโมเดลบนอุปกรณ์อย่างแท้จริง ประการที่สอง ตัวเลขผลลัพธ์ของโมเดลสายเหตุผลของ IBM เองต้องผ่านการทำซ้ำโดยชุมชน เพราะคะแนน 78.33 AIME 2025 ของรุ่น 3B เป็นข้อกล่าวอ้างประเภทที่มักขยับเมื่อคนอื่นเป็นคนรัน และจนกว่าปัจจัยใดปัจจัยหนึ่งจะเกิดขึ้นจริง จุดยืนที่ตรงไปตรงมาก็คือ Granite 4.2 3B เป็นโมเดลเล็กที่ปลอดภัยกว่าและมีเอกสารรองรับครบถ้วนกว่าในวันนี้ ขณะที่สแตก MiniCPM5-2B กลับเป็นเดิมพันที่น่าสนใจกว่า — เอเจนต์ที่รันบนอุปกรณ์ได้เร็วกว่าหากข้อกล่าวอ้างเป็นจริง และยังเป็นฉบับร่างที่แม้แต่บริษัทผู้พัฒนาของมันเองก็ยังไม่ได้ประเมินผลลัพธ์
