การ์ดไตเติลหลักสำหรับการเปรียบเทียบ MiniCPM5-2B-DSpark กับ Granite 4.2 3B พร้อมคำบรรยายใต้ชื่อว่า “การปล่อย Apache-2.0 เงียบๆ สองตัวสำหรับการเสิร์ฟขนาดเล็กที่รวดเร็ว” โดยแสดงกล่องกระดาษแข็งเปิดสองใบวางเคียงข้างกัน — กล่องด้านซ้ายปล่อยสายฟ้าที่มีป้ายว่า DSpark draft และกล่องด้านขวาแสดงเฟืองที่มีป้ายว่าโหมดการให้เหตุผล — พร้อมริบบิ้น Apache-2.0 พาดอยู่ด้านล่าง และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

MiniCPM5-2B-DSpark vs Granite 4.2 3B: สองการเปิดตัว Apache-2.0 แบบเงียบ ๆ สำหรับการให้บริการโมเดลขนาดเล็กที่รวดเร็วและโฮสต์ด้วยตนเอง

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เดือนสิงหาคมและต้นเดือนกันยายน 2026 มีเวอร์ชัน Apache-2.0 ที่เงียบ ๆ สองเวอร์ชันออกมาเพื่อจุดประสงค์เดียวกัน นั่นคือโมเดลขนาดเล็กที่คุณโฮสต์เอง — และทั้งคู่ใช้แนวทางจากคนละขั้ว Granite 4.2 3B คือโมเดลเหตุผลขนาดเท่าแล็ปท็อปของ IBM ซึ่งน้ำหนักโมเดลลงบน Hugging Face ในช่วงต้นเดือนสิงหาคม และบัตรโมเดลกับบล็อกเทคนิคออกเมื่อวันที่ 25 สิงหาคม 2026 MiniCPM5-2B-DSpark ไม่ใช่โมเดลในความหมายเดียวกันเลย: มันคือดราฟต์เช็คพอยต์ DSpark ขนาด 323.8M พารามิเตอร์ ซึ่ง OpenBMB โพสต์เมื่อวันที่ 6 กันยายน 2026 โดยไม่มีการประกาศใด ๆ สร้างขึ้นเพื่อทำให้ MiniCPM5-2B — โมเดลหนาแน่นสำหรับอุปกรณ์ขนาด 2.52B ที่ ModelBest ประกาศที่ WAIC เมื่อวันที่ 19 กรกฎาคม 2026 — สร้างโทเคนได้เร็วขึ้นผ่าน speculative decoding หนึ่งคือโมเดลเหตุผลขนาดเล็กที่ standalone; อีกตัวคืออุปกรณ์เสริมเร่งความเร็วสำหรับโมเดลขนาดเล็ก ทั้งคู่อยู่ภายใต้ Apache-2.0 ทั้งคู่โฮสต์เองเท่านั้น และยังไม่มีตัวใดถูกทดสอบด้วยเบนช์มาร์กอิสระเลย

เมื่อลอกชั้นการตลาดออกไป คำถามเชิงปฏิบัติที่ทีมต้องเผชิญก็ตรงไปตรงมา: สำหรับปริมาณงานเสิร์ฟแบบโฮสต์เองขนาดเล็กในช่วงปลายปี 2026 คุณต้องการโมเดลผู้เชี่ยวชาญด้านการให้เหตุผลขนาด 3B ของ IBM หรือสแตกเชิงเอเจนต์ขนาด 2B ของ ModelBest ที่มีดราฟต์โมเดลฟรีแถมติดมาด้วย? หลักฐานที่มีอยู่นั้นบางเบากว่าที่สเปกชีตของเวนเดอร์ทั้งสองชี้แนะ บทความนี้จึงพาไปดูข้อเท็จจริงเรื่องการเปิดตัว ตัวเลขจากชุดเบนช์มาร์กเดียวกันชุดเดียวที่มีอยู่จริง และความแตกต่างของลักษณะงานที่ควรเป็นตัวกำหนดการเลือก

การเปิดตัวทั้งสองครั้ง สิ่งที่ทราบได้

Granite 4.2 3B เป็นโมเดล reasoning ที่เล็กที่สุดของ IBM ซึ่งผ่านการ post-trained จาก Granite-4.1-3B-Base โมเดลนี้เป็นแบบ dense และรองรับข้อความเท่านั้น ประกอบด้วย 40 เลเยอร์, grouped-query attention, บริบทพื้นเมือง 128K ที่ขยายเป็น 512K ในช่วง pre-training ระยะที่ห้า และมีโหมด reasoning สามโหมด: การคิดแบบเต็มรูปแบบเป็นค่าเริ่มต้น, โหมดใช้ความพยายามต่ำ และเส้นทางแบบไม่คิด เอกสารของ IBM ระบุชัดเจนว่าโมเดล 3B จงใจข้ามบล็อก agentic reinforcement-learning ที่พี่น้อง Granite 4.2 รุ่นใหญ่ได้รับ ดังนั้นจึงไม่มีผลลัพธ์ SWE-Bench และเป็นโมเดล reasoning มากกว่าโมเดล agent โมเดลนี้ให้บริการผ่าน vLLM, SGLang, Transformers, GGUF และ Ollama (granite4.2:3b) และไม่มี hosted API ตัวเลขเด่นบนการ์ดโมเดล — 78.33 ใน AIME 2025, 54.80 ใน GPQA, 69.71 ใน LiveCodeBench v6 — เป็นค่าที่รายงานโดยผู้จำหน่ายและยังไม่มีการตรวจสอบซ้ำจนถึงปัจจุบัน

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b (reused from a published sibling) showing the Model Overview with the 3B dense decoder-only architecture, 128K native context extending to 512K, and the Apache-2.0 license.

การ์ด ibm-granite/granite-4.2-3b ด้านบนคือหน้าตาสาธารณะของการเปิดตัวครั้งนั้น: โมเดล 3B ที่ปรับจูนมาเพื่อการให้เหตุผล มีจุดเด่นด้านบริบทยาว และไม่มีการอ้างสิทธิ์ด้านเอเจนต์

ในทางตรงกันข้าม MiniCPM5-2B-DSpark มีไว้เพื่อรับใช้เป้าหมายของมันเพียงอย่างเดียว ตัวดราฟต์ประกอบด้วยเลเยอร์ full-attention ห้าชั้น มีพารามิเตอร์ 323,776,001 ตัว ขนาดบล็อกคือโทเคนตัวเลือกเจ็ดตัวต่อ forward pass ฝึกเป็นเวลาหก epochs บนโทเคน 7.05 พันล้านตัวจากคำตอบที่สร้างโดย MiniCPM5-2B ที่เก็บโค้ดของมันรายงานความยาวการยอมรับ — โทเคนที่ยอมรับเฉลี่ย 5.52 ตัวต่อขั้นตอนการตรวจสอบโดยรวมเมื่อใช้ greedy decoding และ 6.11 ตัวสำหรับโค้ด — แต่ไม่มีตัวเลขโทเคนต่อวินาที เป้าหมายที่มันเร่งความเร็วคือ MiniCPM5-2B ซึ่งเป็นผลิตภัณฑ์ที่น่าสนใจกว่า: โมเดลแบบ dense ที่มีพารามิเตอร์ 2.52B จำนวน 42 เลเยอร์ รองรับบริบท 128K เอกสารเปิดตัวเน้นความสามารถเชิงเอเจนต์ — การเทรนกลางระดับ 200B สำหรับเอเจนต์ ชุด agent-SFT ขนาดใหญ่ และการจัดแนว RL ของเอเจนต์ ตามประกาศของ ModelBest ในเดือนกรกฎาคม — พร้อมทั้งบริบทยาวแบบเนทีฟและโหมดไฮบริดแบบเร็ว/รอบคอบ ในชุดเปรียบเทียบของ ModelBest เอง โมเดลเป้าหมายได้คะแนนเฉลี่ย 53.9 เทียบกับโมเดลเปิดระดับเดียวกัน ตัวเลขทุกตัวเหล่านี้ล้วนมาจากผู้จำหน่าย

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

การ์ด openbmb/MiniCPM5-2B-DSpark ด้านบนคือทั้งหมดที่ปล่อยออกมา: โมเดลคาร์ด, คอนฟิก, ไฟล์ Safetensors หนึ่งไฟล์ และไม่มีการประกาศใดๆ

การเปรียบเทียบภายในชุดเดียวกันเพียงหนึ่งเดียวที่มีอยู่

กระดานคะแนนข้ามผู้จำหน่ายส่วนใหญ่เปรียบเทียบแอปเปิลกับส้ม แต่มีจุดเดียวที่ Granite 4.2 3B และ MiniCPM5-2B ถูกวัดร่วมกัน นั่นคือตารางประเมินของ ModelBest สำหรับ MiniCPM5-2B ซึ่งระบุ granite-4.2-3B ไว้ในบรรดาเกณฑ์พื้นฐาน ในชุดทดสอบนั้น MiniCPM5-2B ได้ค่าเฉลี่ย 53.9 ขณะที่ Granite 4.2 3B ได้ 42.7 จงอ่านตัวเลขนั้นตามที่เป็นจริง — ผู้จำหน่ายรายหนึ่งเป็นคนรันโมเดลทั้งสองบนชุดทดสอบชุดเดียว ไม่มีการตรวจสอบซ้ำ และถูกเลือกขึ้นมาเพื่อให้โมเดลของตัวเองดูดี มันไม่ใช่คำตัดสิน สิ่งที่มันบอกคุณคือ ModelBest มั่นใจพอที่จะนำโมเดล 3B ของคู่แข่งขึ้นการ์ด และช่องว่างที่มันอ้างว่ามากที่สุดนั้นอยู่ตรงจุดที่บริษัทลงทุนในการฝึกโมเดลของตัวเองพอดี นั่นคือแถวบริบทยาวและแถวเชิงเอเจนต์ (agentic) จงถือว่ามันเป็นข้อกล่าวอ้างเชิงทิศทาง พิสูจน์กับข้อมูลของคุณเอง และชั่งน้ำหนักข้อกล่าวอ้างบนการ์ดแยกต่างหากของ IBM ก่อนตัดสินใจใดๆ จากข้อมูลนี้

กระดานคะแนนที่ระบุอย่างตรงไปตรงมา

• เรือรุ่นใด — MiniCPM5-2B-DSpark: draft ขนาด 324M สำหรับ MiniCPM5-2B (target แบบ dense 2.52B) ไม่ได้ใช้งานเดี่ยว {{1}}Granite 4.2 3B:{{/1}} โมเดลแบบ dense {{2}}~3B{{/2}} ที่ใช้งานเดี่ยวได้และเน้นการให้เหตุผล

• บทบาท — สแตก MiniCPM5-2B: เน้นเอเจนต์บนอุปกรณ์และการใช้เครื่องมือ ตามที่ ModelBest ระบุ ส่วน Granite 4.2 3B: ผู้เชี่ยวชาญด้านการให้เหตุผล ซึ่งจงใจไม่เป็นเอเจนต์

• บริบท — MiniCPM5-2B เป้าหมาย: 128K แบบเนทีฟ Granite 4.2 3B: 128K แบบเนทีฟ ขยายได้ถึง 512K

• การเร่งความเร็ว — MiniCPM5-2B-DSpark: ใช้ DSpark ภายนอกเป็นตัวร่าง (draft) เจ็ดโทเคนต่อรอบ อัตราการยอมรับแบบ greedy อยู่ที่ ~5.5 ต่อขั้น (ตามรายงานใน repo) ส่วน Granite 4.2 3B: ไม่มีการส่งมาพร้อมกับรุ่นนี้

• สัญญาอนุญาต — ทั้งสองเป็น Apache-2.0.

• หลักฐาน — ตัวเลขของ MiniCPM เป็นค่าที่อ้างบนการ์ดโมเดลของ ModelBest (ชุดรวม: 53.9 เทียบกับ Granite 42.7); ตัวเลขของ Granite เป็นค่าที่อ้างบนการ์ดโมเดลของ IBM (AIME 2025 78.33, GPQA 54.80) ไม่มีการรันทดสอบอิสระของทั้งสองตัวนี้

A two-column scoreboard for MiniCPM5-2B-DSpark vs Granite 4.2 3B: left column MiniCPM5-2B-DSpark with What it is: 324M draft + 2.52B dense target, on-device agent and tool-use role, 128K native context, DSpark acceleration at 7 tokens per pass, Apache-2.0 license, and own-suite average 53.9; right column Granite 4.2 3B with a standalone ~3B dense reasoning model, non-agentic role, 128K native / 512K extended context, no shipped acceleration, Apache-2.0 license, and AIME 2025 78.33 / GPQA 54.80, with a footer reading All figures vendor-reported; no independent run of either and the OrcaRouter logo in the bottom-right corner.

ตารางคะแนนด้านบนมีแหล่งข้อมูลเดียวกันกับบทความ: ทุกตัวเลขที่แสดงเป็นข้อมูลที่ผู้จำหน่ายรายงาน และตัวเลขจากชุดเดียวกันเพียงตัวเดียวที่ผู้จำหน่ายรายใดรายหนึ่งเผยแพร่คือตัวเลขของ ModelBest เอง

ความแตกต่างที่เหนือกว่าเกณฑ์มาตรฐานทุกข้อ

ก่อนจะพูดถึงคะแนน ขอให้ตัดสินใจก่อนว่าเวิร์กโหลดของคุณต้องการโมเดลเล็กแบบใด เพราะสองรุ่นนี้ตอบคำถามคนละข้อ Granite 4.2 3B ถูกสร้างมาสำหรับการให้เหตุผลและบริบทยาวบนฮาร์ดแวร์ที่มีข้อจำกัด: หน้าต่างบริบทดั้งเดิม 128K ที่ขยายได้ถึง 512K โหมดการคิดสามแบบต่อเคียวรี ฟุตพริ้นท์ที่รันบนแล็ปท็อปได้ และการตัดสินใจอย่างชัดเจนที่จะข้ามการฝึกแบบเอเจนต์ หากงานของคุณคือการวิเคราะห์เอกสารยาว บริบทระดับรีโพซิทอรี หรือการให้เหตุผลที่เชื่อถือได้บนเครื่องเล็ก ๆ ก็นับว่าเข้ากันได้อย่างลงตัว MiniCPM5-2B ถูกสร้างขึ้นมาโดยเน้นด้านตรงข้าม: พฤติกรรมแบบเอเจนต์และการใช้เครื่องมือบนอุปกรณ์ — การที่มีดราฟต์อยู่เลยก็ส่งสัญญาณว่า ModelBest คาดหวังให้โมเดลนี้ถูกใช้งานแบบอินเทอร์แอกทีฟ และต้องการได้โทเคนต่อวินาทีกลับคืนมา หากงานของคุณคือลูปเอเจนต์บนอุปกรณ์ที่เรียกใช้เครื่องมือและสนทนายาว ๆ นั่นคือสแตกที่มุ่งเป้ามาที่คุณ

ร่างนี้เปลี่ยนแปลงความคุ้มค่าทางเศรษฐศาสตร์ของทางเลือกที่สองในแบบที่การเปิดตัวของ Granite ไม่ได้กล่าวถึง MiniCPM5-2B เป็นโมเดลแบบ dense และ speculative decoding ให้ผลตอบแทนสูงสุดในขอบเขตที่หน่วยความจำเป็นตัวจำกัดและเป็นแบบ dense พอดี — โมเดลคงที่ขนาดเล็กที่ใช้เสนอ tokens ให้กับโมเดลคงที่ที่ใหญ่กว่าเล็กน้อย ตัว draft ภายนอกที่เพิ่มน้ำหนัก BF16 ประมาณ 650MB ให้กับโมเดลเป้าหมาย ~5GB พร้อมเส้นทางให้บริการ SGLang ที่มีเอกสารรองรับ และอัตราการยอมรับแบบ greedy ที่ราวห้าครึ่ง tokens ต่อขั้นตอนการตรวจสอบ เป็นกลไกช่วยเพิ่มปริมาณงานที่น่าเชื่อถือสำหรับโมเดลที่คุณให้บริการแบบรับคำขอครั้งละหนึ่งรายการ แต่ข้อแม้ที่หลีกเลี่ยงไม่ได้คือ OpenBMB ยังไม่ได้เผยแพร่ตัวเลขการเร่งความเร็วแบบ end-to-end ดังนั้นกลไกนี้จึงยังไม่ได้ถูกปรับเทียบ IBM ไม่ได้จัดส่งตัว draft ภายนอกเทียบเท่าสำหรับ Granite 4.2 3B ในการเปิดตัวครั้งนี้ — คุณต้องรันมันแบบ dense และเรื่องความเร็วของมันก็เป็นเพียงว่าโมเดล 3B มีขนาดเล็กเท่านั้น

ใครควรดำเนินการอันไหน

• รัน Granite 4.2 3B หากงานของคุณคือการให้เหตุผลแบบบริบทยาวบนเครื่องระดับแล็ปท็อป — เช่น เอกสาร คลังโค้ด หรือการวิเคราะห์เชิงลึกแบบเธรดเดียว — และคุณต้องการโหมดคิดสามโหมดพร้อมเพดานบริบท 512K บนโมเดล Apache-2.0 ที่คุณควบคุมได้เต็มที่ ทั้งนี้ต้องยอมรับว่าไม่มีทั้ง agentic training และ hosted API

• รันสแต็ก MiniCPM5-2B พร้อมดราฟต์ DSpark ของมัน หากเวิร์กโหลดของคุณคือเอเจนต์บนอุปกรณ์แบบอินเทอร์แอกทีฟที่เรียกใช้เครื่องมือ โดยที่โมเดลเป้าหมายอยู่ในงบประมาณหน่วยความจำของคุณ และคุณต้องการปริมาณงานที่ดราฟต์ช่วยคืนกลับมาได้ จองเวลาเพื่อวัดความเร็วที่เพิ่มขึ้นจริงของดราฟต์บนบิลด์ SGLang ของคุณเอง เพราะยังไม่มีตัวเลขสำหรับมันถูกเผยแพร่

• รันทั้งสองไว้เบื้องหลังเลเยอร์การจัดเส้นทางหากคุณไม่แน่ใจจริงๆ ไม่มีโมเดลใดอยู่ในแคตตาล็อกที่โฮสต์ในปัจจุบันนี้ รวมถึง OrcaRouter ด้วย — ทั้งคู่เป็นข้อเสนอแบบโฮสต์เอง — แต่เราเตอร์ที่อยู่หน้าเอนด์พอยต์ของคุณเองพร้อมระบบเฟลโอเวอร์อัตโนมัติจะช่วยให้สแตกฉบับร่างตั้งอยู่บนเส้นทางทดสอบ ขณะที่โปรดักชันยังคงอยู่บนเส้นทางที่พิสูจน์แล้ว และการส่งผ่านมาร์กอัป 0% บนโมเดลที่โฮสต์โดยรอบช่วยให้การเปรียบเทียบ A/B มีต้นทุนต่ำ ประเด็นคือความสามารถในการย้อนกลับ: สลับชื่อโมเดล วัดผล แล้วสลับกลับหากเช็กพอยต์อายุหนึ่งวันหยุดชะงัก

สิ่งที่ควรดูต่อไป

สองสิ่งนี้จะตัดสินการเทียบเคียงครั้งนี้ได้เร็วกว่าความเห็นใด ๆ ประการแรก การรัน MiniCPM5-2B อย่างอิสระที่จะยืนยันหรือหักล้างค่าเฉลี่ย 53.9 และข้อกล่าวอ้างเชิงเอเจนต์ — โมเดล 2B ที่ทำคะแนนได้ดีถึงเพียงนั้นในงานแนว SWE-Bench จะกลายเป็นจุดข้อมูลใหม่ของกลุ่มโมเดลบนอุปกรณ์อย่างแท้จริง ประการที่สอง ตัวเลขผลลัพธ์ของโมเดลสายเหตุผลของ IBM เองต้องผ่านการทำซ้ำโดยชุมชน เพราะคะแนน 78.33 AIME 2025 ของรุ่น 3B เป็นข้อกล่าวอ้างประเภทที่มักขยับเมื่อคนอื่นเป็นคนรัน และจนกว่าปัจจัยใดปัจจัยหนึ่งจะเกิดขึ้นจริง จุดยืนที่ตรงไปตรงมาก็คือ Granite 4.2 3B เป็นโมเดลเล็กที่ปลอดภัยกว่าและมีเอกสารรองรับครบถ้วนกว่าในวันนี้ ขณะที่สแตก MiniCPM5-2B กลับเป็นเดิมพันที่น่าสนใจกว่า — เอเจนต์ที่รันบนอุปกรณ์ได้เร็วกว่าหากข้อกล่าวอ้างเป็นจริง และยังเป็นฉบับร่างที่แม้แต่บริษัทผู้พัฒนาของมันเองก็ยังไม่ได้ประเมินผลลัพธ์

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube