การ์ดหัวเรื่องหลักสำหรับการเปรียบเทียบ 'MiniCPM5-2B-DSpark vs Qwen3-8B' พร้อมคำบรรยายรอง 'สแตกออนดีไวซ์ขนาด 2.5B ตัวใหม่ เทียบกับม้าทำงานโมเดลโอเพนเวต' โดยแสดงโครงโทรศัพท์มือถือทางด้านซ้ายซึ่งภายในมีชิปขนาดเล็กติดป้ายว่า '2.5B + draft' และแร็กเซิร์ฟเวอร์ทางด้านขวาติดป้ายว่า '8B workhorse' พร้อมมิเตอร์วัดแบนด์วิดท์หน่วยความจำอยู่ระหว่างกลาง และโลโก้ OrcaRouter อยู่ที่มุมขวาล่าง
Guides & Insights

MiniCPM5-2B-DSpark เทียบกับ Qwen3-8B: สแตกออนดีไวซ์ 2.5B ตัวใหม่ ปะทะ ม้าศึกโอเพนเวตส์

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

การเปรียบเทียบโมเดลทุกครั้งซ่อนคำถามเรื่องฮาร์ดแวร์ไว้เสมอ และการเทียบ {{1}}MiniCPM5-2B-DSpark{{/1}} กับ {{2}}Qwen3-8B{{/2}} ก็คือคำถามข้อนั้นที่มาในคราบของการวัดประสิทธิภาพ {{3}}Qwen3-8B{{/3}} คือโมเดลโอเพนเวตต์ตัวหลักของ {{4}}Alibaba{{/4}} ที่เปิดตัวในเดือน {{5}}เมษายน 2025{{/5}} — มีพารามิเตอร์แบบ Dense ราว {{6}}8.2B{{/6}} รองรับ {{7}}119 ภาษา{{/7}} บริบทดั้งเดิมขนาด {{8}}32K{{/8}} ขยายได้ถึง {{9}}131K{{/9}} โหมดการคิดแบบไฮบริด และมีหลักฐานจากชุมชนหนุนหลังมาสิบหกเดือน ส่วน {{10}}MiniCPM5-2B-DSpark{{/10}} ไม่ใช่โมเดลเดี่ยวที่จะยกมาเทียบเคียงข้างกับมันได้: มันคือดราฟต์เช็กพอยต์ขนาด {{11}}323.8M{{/11}} พารามิเตอร์ของ {{12}}DSpark{{/12}} ที่ {{13}}OpenBMB{{/13}} อัปโหลดอย่างเงียบ ๆ ไปยัง {{14}}Hugging Face{{/14}} เมื่อวันที่ {{15}}6 กันยายน 2026{{/15}} เพื่อเร่งความเร็ว {{16}}MiniCPM5-2B{{/16}} ซึ่งเป็นโมเดลออนดีไวซ์แบบ Dense ขนาด {{17}}2.52B{{/17}} ที่ {{18}}ModelBest{{/18}} ประกาศเปิดตัวที่งาน {{19}}WAIC{{/19}} เมื่อวันที่ {{20}}19 กรกฎาคม 2026{{/20}} และเมื่อนำทั้งคู่มาวางเทียบกัน คำถามจริงก็ผุดขึ้น: เวิร์กโหลดที่ตอนนี้รันบนโมเดล {{21}}8B{{/21}} ควรย้ายไปรันบนฮาร์ดแวร์ที่รับได้เพียงโมเดล {{22}}2B{{/22}} หรือไม่ — แล้วโมเดล {{23}}2.5B{{/23}} ที่มีดราฟต์ให้ใช้ฟรีนั้นดีพอจะตัดสินใจย้ายครั้งนี้ได้หรือไม่

คำตอบสั้นๆ คือยังไม่ใช่สำหรับเวิร์กโหลดส่วนใหญ่ แต่เหตุผลนั้นแคบกว่าที่ขนาดของโมเดลชี้ให้เห็น และมีการปรับใช้ในประเภทหนึ่งที่ 8B ไม่มีคำตอบเลย ทุกอย่างเชิงปริมาณในบทความนี้เป็นข้อมูลที่ผู้ขายรายงาน — ตัวเลขของ MiniCPM เป็นของ ModelBest เอง ยังไม่มีการตรวจสอบซ้ำ ส่วนของ Qwen3-8B เป็นของ Alibaba ที่ถูกใช้งานในชุมชนมานาน — ดังนั้นป้ายกำกับจึงสำคัญกว่าตัวเลข

โมเดลสองตัวที่อยู่ในตำแหน่งต่างกันบนเส้นโค้งความจำ

MiniCPM5-2B เป็นทรานส์ฟอร์เมอร์แบบ dense causal ที่มีขนาดหนึ่งในสามของโมเดล 8B — มี 42 เลเยอร์, grouped-query attention, ภายใต้ Apache-2.0 — สร้างขึ้นสำหรับอุปกรณ์ระดับที่โมเดลขนาดใหญ่ไม่สามารถเข้าถึงได้: โทรศัพท์มือถือ, ห้องโดยสารอัจฉริยะ และกล่องเอจขนาดเล็ก ซึ่งบัสหน่วยความจำจะรับมือกับน้ำหนักของพารามิเตอร์แปดพันล้านไม่ไหว เอกสารเปิดตัวของโมเดลเน้นการทำงานแบบเอเจนต์และบริบทยาว มากกว่าความครอบคลุมกว้างในเชิงดิบ: รองรับบริบทดั้งเดิม 128K และ ModelBest อ้างว่าในชุดการประเมินของตนเอง โมเดลทำคะแนนเฉลี่ย 53.9 — ซึ่งผู้จำหน่ายระบุว่าเป็น SOTA โอเพนซอร์สระดับ 2B รวมถึงคะแนน 46.4 จากการทดสอบ SWE-bench Verified ที่ผู้จำหน่ายดำเนินการเอง ซึ่งน่าทึ่งสำหรับโมเดล 2B หากผ่านการทดสอบโดยอิสระ ร่าง DSpark คือคำตอบด้านทรูพุตสำหรับข้อโต้แย้งที่เห็นได้ชัดว่าโมเดล dense ขนาดเล็กโหลดเร็วแต่สร้างข้อความช้า เพราะทุกโทเคนต้องลากน้ำหนักของตัวเองข้ามบัสหน่วยความจำ ร่างนี้เสนอให้สร้างโทเคนพร้อมกันสูงสุดเจ็ดโทเคนเพื่อให้โมเดลเป้าหมายตรวจสอบ และคลังเก็บโค้ดรายงานอัตราการยอมรับแบบ greedy ที่ 5.52 โทเคนต่อขั้นตอนการตรวจสอบโดยรวม — และ 6.11 สำหรับโค้ด ตัวเลขดังกล่าวคือคุณภาพของร่าง ส่วนอัตราเร่งความเร็วยังไม่ได้ถูกวัด และยังไม่มีตัวเลขโทเคนต่อวินาทีถูกเผยแพร่

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the 'DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B' description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

การ์ด openbmb/MiniCPM5-2B-DSpark ด้านบนคือภาพรวมทั้งหมดที่เผยแพร่สู่สาธารณะของการเปิดตัวเงียบๆ เมื่อวันที่ 6 กันยายน ซึ่งก็คืออุปกรณ์เสริมสำหรับการให้บริการที่รายงานความยาวที่ยอมรับได้ โดยไม่มีการประกาศและไม่มีการเพิ่มความเร็วตามเวลาจริง

Qwen3-8B เป็นโมเดลในตระกูลสถาปัตยกรรมเดียวกัน ที่มีขนาดใหญ่กว่าสามเท่าและเก่ากว่าสิบหกเดือน โดยเป็น dense causal Transformer ที่ใช้ grouped-query attention ฝึกบนคลังข้อมูลหลายภาษาขนาด 36 ล้านล้านโทเค็น อยู่ภายใต้สัญญาอนุญาต Apache-2.0 และเป็นหนึ่งในโมเดล 8B ที่ถูก self-host และให้บริการอย่างกว้างขวางที่สุดในวงการโอเพนเวต จุดเด่นคือโหมดการให้เหตุผลแบบไฮบริดของ Qwen3 ที่เปิดหรือปิดการคิดได้ตามแต่ละคำขอ และภาพรวมของมันถูกวางให้กว้างโดยเจตนา: คะแนน MMLU ในช่วง 70 ปลาย ๆ ผลลัพธ์ GSM8K และการเขียนโค้ดที่แข็งแกร่ง รองรับ 119 ภาษา มันต้องใช้ GPU จริงหรืออุปกรณ์เอดจ์สเปกสูง เพราะเมื่อควอนไทซ์ในระดับที่ใช้งานจริง มันจะใช้หน่วยความจำไม่กี่กิกะไบต์ รันบนการ์ดระดับกลางตัวเดียวได้อย่างสบาย ๆ แต่ไม่ใช่บนโทรศัพท์

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B (reused from a published sibling) showing Alibaba's Apache-2.0 generalist model card with its 8.2B parameters, 119 languages, and hybrid thinking mode.

โมเดลการ์ดของ Alibaba สำหรับ Qwen3-8B ข้างต้นคือใบหน้าของผู้ครองตำแหน่งปัจจุบัน: พฤติกรรมที่ได้รับการบันทึกและทดสอบโดยชุมชนมาเป็นเวลาสิบหกเดือนใน 119 ภาษา

จุดที่ 8B ยังชนะ

เลื่อนลงมาหนึ่งคลาสน้ำหนัก คุณจะสละสิ่งที่เป็นรูปธรรมสามอย่าง อย่างแรกคือภาษา: Qwen3-8B ครอบคลุม 119 ภาษา; การ์ดและชุดข้อมูลของ MiniCPM5-2B เน้นที่ภาษาอังกฤษและจีนเป็นหลัก และไม่ได้อ้างความกว้างขวางหลายภาษา สำหรับผลิตภัณฑ์ที่ให้บริการภาษากลุ่มทางยาว (long tail of languages) นั่นคือกำแพงแข็ง ไม่ใช่กำแพงอ่อน อย่างที่สองคือหลักฐาน: ตัวเลขของ Qwen3-8B ถูกทดสอบ ปรับลดความแม่นยำ (quantized) ฟีนิวน (fine-tuned) และให้บริการในวงกว้างมาเป็นเวลาสิบหกเดือน; รูปแบบความล้มเหลวเป็นที่รู้จัก การปรับลดความแม่นยำมีอยู่จริง ระบบนิเวศแพร่หลายทั่วไป MiniCPM5-2B เป็นเวอร์ชันเผยแพร่เดือนกรกฎาคม 2026 พร้อมกระดานคะแนนที่ผู้ขายจัดทำขึ้นเองและไม่มีการทำซ้ำโดยอิสระ และดราฟต์มีอายุเพียงหนึ่งวัน อย่างที่สามคือสแตกการให้บริการ: ทุกอย่างที่เชื่อมต่อกับ Qwen3-8B อยู่แล้ว — vLLM, SGLang, llama.cpp, ฟีนิวนอีกนับพัน — ต่างเชื่อมต่อกับเป้าหมายที่เติบโตเต็มที่ ในขณะที่ดราฟต์ของ MiniCPM ต้องสร้างเอ็นจินการถอดรหัสแบบคาดเดา (speculative-decoding engine) (อัลกอริทึม DSPARK ของ SGLang) ซึ่งที่เก็บโค้ดระบุไว้แต่ระบบนิเวศที่กว้างขึ้นยังไม่นำมาใช้อย่างเต็มที่

ในกรณีที่ 2B stack เป็นเพียงตัวเลือกเดียว

สิ่งเหล่านั้นไม่สำคัญเลยบนกลุ่มอุปกรณ์ที่โมเดล 8B ใส่ลงไปไม่ได้ตั้งแต่แรก บนโทรศัพท์หรือบอร์ดเอดจ์ที่มี DRAM เพียงไม่กี่กิกะไบต์ Qwen3-8B ไม่ได้แข่งขันกับ MiniCPM5-2B — มันไม่สามารถปรับใช้ให้ทำงานด้วยความเร็วที่เป็นประโยชน์ได้เลยแม้แต่น้อย นั่นคือเหตุผลทั้งหมดที่สแตก 2B มีตัวตนอยู่ และเป็นเหตุผลว่าทำไมตัวร่าง (draft) จึงเป็นส่วนที่รับน้ำหนักหลักของการปล่อยรุ่นนี้ ไม่ใช่แค่ของตกแต่ง การถอดรหัสแบบคาดเดา (speculative decoding) จะมีประสิทธิภาพสูงสุดก็ต่อเมื่ออยู่ในระบอบการทำงานแบบ dense ที่ถูกจำกัดด้วยหน่วยความจำ อันเป็นสภาพแวดล้อมที่โมเดลเล็กบนซิลิคอนขนาดเล็กต้องอยู่: ตัวร่างขนาดกะทัดรัดเสนอหนึ่งบล็อก ตัวเป้าหมายตรวจสอบมันในหนึ่งรอบ และต้นทุนการโหลดน้ำหนักถูกจ่ายหนึ่งครั้งต่อบล็อก แทนที่จะเป็นหนึ่งครั้งต่อโทเคน วิธี DSpark ซึ่งมีต้นกำเนิดจาก DeepSeek (arXiv 2607.05147) ถูกออกแบบมาสำหรับระบบเซิร์ฟวิ่งที่รองรับการทำงานพร้อมกันสูง แต่กลไกของมัน — และตัวเลขอัตราการยอมรับบนรีโพนี้ — คือคันโยกที่สำคัญสำหรับโมเดล 2B ที่ต้องให้ความรู้สึกตอบสนองได้แบบอินเทอร์แอกทีฟบนฮาร์ดแวร์ที่มีข้อจำกัด เพียงแค่จำข้อควรระวังที่ตรงไปตรงมาไว้เสมอ: OpenBMB วัดอัตราการยอมรับของตัวร่าง ไม่ใช่วัดความเร็วที่เพิ่มขึ้น ดังนั้น อัตราการเพิ่มของโทเคนต่อวินาทีบนอุปกรณ์เป้าหมายของคุณจึงยังคงเป็นสิ่งที่คุณต้องวัดเอง

กระดานคะแนนที่ระบุอย่างตรงไปตรงมา

• การเปิดตัว — MiniCPM5-2B: 19 กรกฎาคม 2026 (ประกาศ); MiniCPM5-2B-DSpark: 6 กันยายน 2026, เงียบๆ; Qwen3-8B: เมษายน 2025, ประกาศ.

• ขนาด — MiniCPM5-2B: 2.52B แบบ dense บวกดราฟต์ 324M ส่วน Qwen3-8B: ~8.2B แบบ dense

• บริบท — MiniCPM5-2B: 128K เนทีฟ Qwen3-8B: 32K เนทีฟ, 131K ผ่าน YaRN

• ภาษา — MiniCPM5-2B: เน้นภาษาอังกฤษ/จีน Qwen3-8B: 119.

• การให้เหตุผล — MiniCPM5-2B: มีโหมดไฮบริดแบบเร็วและแบบไตร่ตรองตามเอกสารเปิดตัว Qwen3-8B: เปิดหรือปิดการคิดได้ตามคำขอ

• หลักฐาน — ตัวเลขของ MiniCPM เป็นค่าที่อ้างในบัตรข้อมูลของ ModelBest (ค่าเฉลี่ย 53.9 ในชุดทดสอบของตนเองเท่านั้น ไม่มีการรันทดสอบอย่างอิสระ) ตัวเลขของ Qwen3-8B เป็นข้อมูลที่ Alibaba รายงาน ซึ่งชุมชนได้ตรวจสอบมาเป็นเวลาสิบหกเดือนแล้ว

A two-column scoreboard for MiniCPM5-2B-DSpark vs Qwen3-8B: left column MiniCPM5-2B-DSpark with 'Release: Jul 19 + Sep 6 2026', size 2.52B plus 324M draft, 128K native context, English and Chinese centered languages, hybrid fast-and-deliberate reasoning, and own-suite average 53.9; right column Qwen3-8B with 'Release: April 2025', ~8.2B dense, 32K native / 131K YaRN context, 119 languages, thinking on or off, and 16 months of community-exposed evidence, with a footer reading 'MiniCPM figures vendor-reported; Qwen figures Alibaba-reported' and the OrcaRouter logo in the bottom-right corner.

ตารางด้านบนคือภาพของความไม่สอดคล้องที่วาดขึ้นอย่างตรงไปตรงมา โดยในแทบทุกจุดคอลัมน์ต่างก็แตกต่างกัน ยกเว้นใบอนุญาต Apache-2.0 แบบเปิด และคลาสอุปกรณ์ที่คุณจะจัดส่งไปให้นั้นเป็นตัวกำหนดว่าคุณจะเลือกคอลัมน์ใดได้หรือไม่ได้ด้วยซ้ำ

ความจริงของการกำหนดเส้นทาง

ทั้งสองโมเดลไม่ได้อยู่ในแคตตาล็อกแบบโฮสต์บน OrcaRouter ในขณะนี้ การเปรียบเทียบนี้จึงเกิดขึ้นในโลกเซล์ฟโฮสต์ทั้งหมด — แต่นั่นคือจุดที่เลเยอร์การจัดเส้นทางยังคงพิสูจน์คุณค่าของมันได้ Qwen3-8B ให้บริการโดยผู้พัฒนาของโมเดลและแพลตฟอร์มบุคคลที่สามหลายแห่ง ส่วน MiniCPM5-2B และดราฟต์ของมันเป็นสิ่งที่คุณต้องรันเอง เมื่อทีมต้องการทดสอบว่าสแต็ก 2.5B จะรองรับเวิร์กโหลดของ 8B ได้บางส่วนหรือไม่ ขั้นตอนที่ย้อนกลับได้คือการชี้เส้นทางทดสอบไปที่บิลด์ SGLang แบบ MiniCPM5-2B พร้อมดราฟต์ที่โฮสต์เอง ผ่าน API เดียวที่มีการเฟลโอเวอร์อัตโนมัติ — ระบบโปรดักชันยังคงอยู่กับโมเดลเดิม สแต็กใหม่สามารถหยุดชะงักได้โดยไม่ทำให้อะไรล่ม และราคาตามประกาศของผู้ให้บริการตลอดการเปรียบเทียบทั้งหมดถูกส่งผ่านด้วยมาร์กอัป 0% การทดสอบ A/B จึงมีต้นทุนต่ำและย้อนกลับได้ ไม่ใช่การเดิมพัน เลเยอร์นี้ไม่ได้โฮสต์โมเดลใดโมเดลหนึ่ง ทว่ามันทำให้การทดลองปลอดภัยที่จะรัน

ใครควรย้าย และใครควรรอ

จงอยู่กับ Qwen3-8B สำหรับงานทุกอย่างที่ต้องใช้หลายภาษา ทุกอย่างที่ต้องการพฤติกรรมที่รู้จักดีมาหนึ่งปีสี่เดือน หรือเวิร์กโหลดใด ๆ ที่ให้บริการอยู่แล้วบนฮาร์ดแวร์ซึ่งรัน 8B ได้อย่างสบาย — ช่องว่างของขนาดไม่ใช่เหตุผลที่จะย้าย และช่องว่างของหลักฐานก็ไม่สนับสนุนให้ย้ายเช่นกัน ให้จริงจังกับการทดสอบสแตก MiniCPM5-2B พร้อมกับ DSpark draft ก็ต่อเมื่ออุปกรณ์เป้าหมายของคุณไม่สามารถรัน 8B ได้เลย หรือหากโมเดล 2.5B ที่ตามทันงานแบบ agentic และงานบริบทยาวจะช่วยให้คุณลดหน่วยความจำและการใช้พลังงานบนฮาร์ดแวร์ที่คุณส่งออกอยู่แล้ว และก่อนที่คุณจะตัดสินใจใช้ draft ให้รันการวัดผลที่ OpenBMB ไม่ได้เผยแพร่: acceptance length ไม่ใช่ latency และอัตรา tokens ต่อวินาทีที่เพิ่มขึ้นบนอุปกรณ์ของคุณคือตัวเลขที่ชี้ขาดจริง ๆ ว่า checkpoint เล็ก ๆ ที่เงียบเชียบอยู่บน Hugging Face นั้นคุ้มค่ากับการดาวน์โหลดหรือไม่

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube