
MiniCPM5-2B-DSpark เทียบกับ Qwen3-8B: สแตกออนดีไวซ์ 2.5B ตัวใหม่ ปะทะ ม้าศึกโอเพนเวตส์
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
การเปรียบเทียบโมเดลทุกครั้งซ่อนคำถามเรื่องฮาร์ดแวร์ไว้เสมอ และการเทียบ {{1}}MiniCPM5-2B-DSpark{{/1}} กับ {{2}}Qwen3-8B{{/2}} ก็คือคำถามข้อนั้นที่มาในคราบของการวัดประสิทธิภาพ {{3}}Qwen3-8B{{/3}} คือโมเดลโอเพนเวตต์ตัวหลักของ {{4}}Alibaba{{/4}} ที่เปิดตัวในเดือน {{5}}เมษายน 2025{{/5}} — มีพารามิเตอร์แบบ Dense ราว {{6}}8.2B{{/6}} รองรับ {{7}}119 ภาษา{{/7}} บริบทดั้งเดิมขนาด {{8}}32K{{/8}} ขยายได้ถึง {{9}}131K{{/9}} โหมดการคิดแบบไฮบริด และมีหลักฐานจากชุมชนหนุนหลังมาสิบหกเดือน ส่วน {{10}}MiniCPM5-2B-DSpark{{/10}} ไม่ใช่โมเดลเดี่ยวที่จะยกมาเทียบเคียงข้างกับมันได้: มันคือดราฟต์เช็กพอยต์ขนาด {{11}}323.8M{{/11}} พารามิเตอร์ของ {{12}}DSpark{{/12}} ที่ {{13}}OpenBMB{{/13}} อัปโหลดอย่างเงียบ ๆ ไปยัง {{14}}Hugging Face{{/14}} เมื่อวันที่ {{15}}6 กันยายน 2026{{/15}} เพื่อเร่งความเร็ว {{16}}MiniCPM5-2B{{/16}} ซึ่งเป็นโมเดลออนดีไวซ์แบบ Dense ขนาด {{17}}2.52B{{/17}} ที่ {{18}}ModelBest{{/18}} ประกาศเปิดตัวที่งาน {{19}}WAIC{{/19}} เมื่อวันที่ {{20}}19 กรกฎาคม 2026{{/20}} และเมื่อนำทั้งคู่มาวางเทียบกัน คำถามจริงก็ผุดขึ้น: เวิร์กโหลดที่ตอนนี้รันบนโมเดล {{21}}8B{{/21}} ควรย้ายไปรันบนฮาร์ดแวร์ที่รับได้เพียงโมเดล {{22}}2B{{/22}} หรือไม่ — แล้วโมเดล {{23}}2.5B{{/23}} ที่มีดราฟต์ให้ใช้ฟรีนั้นดีพอจะตัดสินใจย้ายครั้งนี้ได้หรือไม่
คำตอบสั้นๆ คือยังไม่ใช่สำหรับเวิร์กโหลดส่วนใหญ่ แต่เหตุผลนั้นแคบกว่าที่ขนาดของโมเดลชี้ให้เห็น และมีการปรับใช้ในประเภทหนึ่งที่ 8B ไม่มีคำตอบเลย ทุกอย่างเชิงปริมาณในบทความนี้เป็นข้อมูลที่ผู้ขายรายงาน — ตัวเลขของ MiniCPM เป็นของ ModelBest เอง ยังไม่มีการตรวจสอบซ้ำ ส่วนของ Qwen3-8B เป็นของ Alibaba ที่ถูกใช้งานในชุมชนมานาน — ดังนั้นป้ายกำกับจึงสำคัญกว่าตัวเลข
โมเดลสองตัวที่อยู่ในตำแหน่งต่างกันบนเส้นโค้งความจำ
MiniCPM5-2B เป็นทรานส์ฟอร์เมอร์แบบ dense causal ที่มีขนาดหนึ่งในสามของโมเดล 8B — มี 42 เลเยอร์, grouped-query attention, ภายใต้ Apache-2.0 — สร้างขึ้นสำหรับอุปกรณ์ระดับที่โมเดลขนาดใหญ่ไม่สามารถเข้าถึงได้: โทรศัพท์มือถือ, ห้องโดยสารอัจฉริยะ และกล่องเอจขนาดเล็ก ซึ่งบัสหน่วยความจำจะรับมือกับน้ำหนักของพารามิเตอร์แปดพันล้านไม่ไหว เอกสารเปิดตัวของโมเดลเน้นการทำงานแบบเอเจนต์และบริบทยาว มากกว่าความครอบคลุมกว้างในเชิงดิบ: รองรับบริบทดั้งเดิม 128K และ ModelBest อ้างว่าในชุดการประเมินของตนเอง โมเดลทำคะแนนเฉลี่ย 53.9 — ซึ่งผู้จำหน่ายระบุว่าเป็น SOTA โอเพนซอร์สระดับ 2B รวมถึงคะแนน 46.4 จากการทดสอบ SWE-bench Verified ที่ผู้จำหน่ายดำเนินการเอง ซึ่งน่าทึ่งสำหรับโมเดล 2B หากผ่านการทดสอบโดยอิสระ ร่าง DSpark คือคำตอบด้านทรูพุตสำหรับข้อโต้แย้งที่เห็นได้ชัดว่าโมเดล dense ขนาดเล็กโหลดเร็วแต่สร้างข้อความช้า เพราะทุกโทเคนต้องลากน้ำหนักของตัวเองข้ามบัสหน่วยความจำ ร่างนี้เสนอให้สร้างโทเคนพร้อมกันสูงสุดเจ็ดโทเคนเพื่อให้โมเดลเป้าหมายตรวจสอบ และคลังเก็บโค้ดรายงานอัตราการยอมรับแบบ greedy ที่ 5.52 โทเคนต่อขั้นตอนการตรวจสอบโดยรวม — และ 6.11 สำหรับโค้ด ตัวเลขดังกล่าวคือคุณภาพของร่าง ส่วนอัตราเร่งความเร็วยังไม่ได้ถูกวัด และยังไม่มีตัวเลขโทเคนต่อวินาทีถูกเผยแพร่

การ์ด openbmb/MiniCPM5-2B-DSpark ด้านบนคือภาพรวมทั้งหมดที่เผยแพร่สู่สาธารณะของการเปิดตัวเงียบๆ เมื่อวันที่ 6 กันยายน ซึ่งก็คืออุปกรณ์เสริมสำหรับการให้บริการที่รายงานความยาวที่ยอมรับได้ โดยไม่มีการประกาศและไม่มีการเพิ่มความเร็วตามเวลาจริง
Qwen3-8B เป็นโมเดลในตระกูลสถาปัตยกรรมเดียวกัน ที่มีขนาดใหญ่กว่าสามเท่าและเก่ากว่าสิบหกเดือน โดยเป็น dense causal Transformer ที่ใช้ grouped-query attention ฝึกบนคลังข้อมูลหลายภาษาขนาด 36 ล้านล้านโทเค็น อยู่ภายใต้สัญญาอนุญาต Apache-2.0 และเป็นหนึ่งในโมเดล 8B ที่ถูก self-host และให้บริการอย่างกว้างขวางที่สุดในวงการโอเพนเวต จุดเด่นคือโหมดการให้เหตุผลแบบไฮบริดของ Qwen3 ที่เปิดหรือปิดการคิดได้ตามแต่ละคำขอ และภาพรวมของมันถูกวางให้กว้างโดยเจตนา: คะแนน MMLU ในช่วง 70 ปลาย ๆ ผลลัพธ์ GSM8K และการเขียนโค้ดที่แข็งแกร่ง รองรับ 119 ภาษา มันต้องใช้ GPU จริงหรืออุปกรณ์เอดจ์สเปกสูง เพราะเมื่อควอนไทซ์ในระดับที่ใช้งานจริง มันจะใช้หน่วยความจำไม่กี่กิกะไบต์ รันบนการ์ดระดับกลางตัวเดียวได้อย่างสบาย ๆ แต่ไม่ใช่บนโทรศัพท์

โมเดลการ์ดของ Alibaba สำหรับ Qwen3-8B ข้างต้นคือใบหน้าของผู้ครองตำแหน่งปัจจุบัน: พฤติกรรมที่ได้รับการบันทึกและทดสอบโดยชุมชนมาเป็นเวลาสิบหกเดือนใน 119 ภาษา
จุดที่ 8B ยังชนะ
เลื่อนลงมาหนึ่งคลาสน้ำหนัก คุณจะสละสิ่งที่เป็นรูปธรรมสามอย่าง อย่างแรกคือภาษา: Qwen3-8B ครอบคลุม 119 ภาษา; การ์ดและชุดข้อมูลของ MiniCPM5-2B เน้นที่ภาษาอังกฤษและจีนเป็นหลัก และไม่ได้อ้างความกว้างขวางหลายภาษา สำหรับผลิตภัณฑ์ที่ให้บริการภาษากลุ่มทางยาว (long tail of languages) นั่นคือกำแพงแข็ง ไม่ใช่กำแพงอ่อน อย่างที่สองคือหลักฐาน: ตัวเลขของ Qwen3-8B ถูกทดสอบ ปรับลดความแม่นยำ (quantized) ฟีนิวน (fine-tuned) และให้บริการในวงกว้างมาเป็นเวลาสิบหกเดือน; รูปแบบความล้มเหลวเป็นที่รู้จัก การปรับลดความแม่นยำมีอยู่จริง ระบบนิเวศแพร่หลายทั่วไป MiniCPM5-2B เป็นเวอร์ชันเผยแพร่เดือนกรกฎาคม 2026 พร้อมกระดานคะแนนที่ผู้ขายจัดทำขึ้นเองและไม่มีการทำซ้ำโดยอิสระ และดราฟต์มีอายุเพียงหนึ่งวัน อย่างที่สามคือสแตกการให้บริการ: ทุกอย่างที่เชื่อมต่อกับ Qwen3-8B อยู่แล้ว — vLLM, SGLang, llama.cpp, ฟีนิวนอีกนับพัน — ต่างเชื่อมต่อกับเป้าหมายที่เติบโตเต็มที่ ในขณะที่ดราฟต์ของ MiniCPM ต้องสร้างเอ็นจินการถอดรหัสแบบคาดเดา (speculative-decoding engine) (อัลกอริทึม DSPARK ของ SGLang) ซึ่งที่เก็บโค้ดระบุไว้แต่ระบบนิเวศที่กว้างขึ้นยังไม่นำมาใช้อย่างเต็มที่
ในกรณีที่ 2B stack เป็นเพียงตัวเลือกเดียว
สิ่งเหล่านั้นไม่สำคัญเลยบนกลุ่มอุปกรณ์ที่โมเดล 8B ใส่ลงไปไม่ได้ตั้งแต่แรก บนโทรศัพท์หรือบอร์ดเอดจ์ที่มี DRAM เพียงไม่กี่กิกะไบต์ Qwen3-8B ไม่ได้แข่งขันกับ MiniCPM5-2B — มันไม่สามารถปรับใช้ให้ทำงานด้วยความเร็วที่เป็นประโยชน์ได้เลยแม้แต่น้อย นั่นคือเหตุผลทั้งหมดที่สแตก 2B มีตัวตนอยู่ และเป็นเหตุผลว่าทำไมตัวร่าง (draft) จึงเป็นส่วนที่รับน้ำหนักหลักของการปล่อยรุ่นนี้ ไม่ใช่แค่ของตกแต่ง การถอดรหัสแบบคาดเดา (speculative decoding) จะมีประสิทธิภาพสูงสุดก็ต่อเมื่ออยู่ในระบอบการทำงานแบบ dense ที่ถูกจำกัดด้วยหน่วยความจำ อันเป็นสภาพแวดล้อมที่โมเดลเล็กบนซิลิคอนขนาดเล็กต้องอยู่: ตัวร่างขนาดกะทัดรัดเสนอหนึ่งบล็อก ตัวเป้าหมายตรวจสอบมันในหนึ่งรอบ และต้นทุนการโหลดน้ำหนักถูกจ่ายหนึ่งครั้งต่อบล็อก แทนที่จะเป็นหนึ่งครั้งต่อโทเคน วิธี DSpark ซึ่งมีต้นกำเนิดจาก DeepSeek (arXiv 2607.05147) ถูกออกแบบมาสำหรับระบบเซิร์ฟวิ่งที่รองรับการทำงานพร้อมกันสูง แต่กลไกของมัน — และตัวเลขอัตราการยอมรับบนรีโพนี้ — คือคันโยกที่สำคัญสำหรับโมเดล 2B ที่ต้องให้ความรู้สึกตอบสนองได้แบบอินเทอร์แอกทีฟบนฮาร์ดแวร์ที่มีข้อจำกัด เพียงแค่จำข้อควรระวังที่ตรงไปตรงมาไว้เสมอ: OpenBMB วัดอัตราการยอมรับของตัวร่าง ไม่ใช่วัดความเร็วที่เพิ่มขึ้น ดังนั้น อัตราการเพิ่มของโทเคนต่อวินาทีบนอุปกรณ์เป้าหมายของคุณจึงยังคงเป็นสิ่งที่คุณต้องวัดเอง
กระดานคะแนนที่ระบุอย่างตรงไปตรงมา
• การเปิดตัว — MiniCPM5-2B: 19 กรกฎาคม 2026 (ประกาศ); MiniCPM5-2B-DSpark: 6 กันยายน 2026, เงียบๆ; Qwen3-8B: เมษายน 2025, ประกาศ.
• ขนาด — MiniCPM5-2B: 2.52B แบบ dense บวกดราฟต์ 324M ส่วน Qwen3-8B: ~8.2B แบบ dense
• บริบท — MiniCPM5-2B: 128K เนทีฟ Qwen3-8B: 32K เนทีฟ, 131K ผ่าน YaRN
• ภาษา — MiniCPM5-2B: เน้นภาษาอังกฤษ/จีน Qwen3-8B: 119.
• การให้เหตุผล — MiniCPM5-2B: มีโหมดไฮบริดแบบเร็วและแบบไตร่ตรองตามเอกสารเปิดตัว Qwen3-8B: เปิดหรือปิดการคิดได้ตามคำขอ
• หลักฐาน — ตัวเลขของ MiniCPM เป็นค่าที่อ้างในบัตรข้อมูลของ ModelBest (ค่าเฉลี่ย 53.9 ในชุดทดสอบของตนเองเท่านั้น ไม่มีการรันทดสอบอย่างอิสระ) ตัวเลขของ Qwen3-8B เป็นข้อมูลที่ Alibaba รายงาน ซึ่งชุมชนได้ตรวจสอบมาเป็นเวลาสิบหกเดือนแล้ว

ตารางด้านบนคือภาพของความไม่สอดคล้องที่วาดขึ้นอย่างตรงไปตรงมา โดยในแทบทุกจุดคอลัมน์ต่างก็แตกต่างกัน ยกเว้นใบอนุญาต Apache-2.0 แบบเปิด และคลาสอุปกรณ์ที่คุณจะจัดส่งไปให้นั้นเป็นตัวกำหนดว่าคุณจะเลือกคอลัมน์ใดได้หรือไม่ได้ด้วยซ้ำ
ความจริงของการกำหนดเส้นทาง
ทั้งสองโมเดลไม่ได้อยู่ในแคตตาล็อกแบบโฮสต์บน OrcaRouter ในขณะนี้ การเปรียบเทียบนี้จึงเกิดขึ้นในโลกเซล์ฟโฮสต์ทั้งหมด — แต่นั่นคือจุดที่เลเยอร์การจัดเส้นทางยังคงพิสูจน์คุณค่าของมันได้ Qwen3-8B ให้บริการโดยผู้พัฒนาของโมเดลและแพลตฟอร์มบุคคลที่สามหลายแห่ง ส่วน MiniCPM5-2B และดราฟต์ของมันเป็นสิ่งที่คุณต้องรันเอง เมื่อทีมต้องการทดสอบว่าสแต็ก 2.5B จะรองรับเวิร์กโหลดของ 8B ได้บางส่วนหรือไม่ ขั้นตอนที่ย้อนกลับได้คือการชี้เส้นทางทดสอบไปที่บิลด์ SGLang แบบ MiniCPM5-2B พร้อมดราฟต์ที่โฮสต์เอง ผ่าน API เดียวที่มีการเฟลโอเวอร์อัตโนมัติ — ระบบโปรดักชันยังคงอยู่กับโมเดลเดิม สแต็กใหม่สามารถหยุดชะงักได้โดยไม่ทำให้อะไรล่ม และราคาตามประกาศของผู้ให้บริการตลอดการเปรียบเทียบทั้งหมดถูกส่งผ่านด้วยมาร์กอัป 0% การทดสอบ A/B จึงมีต้นทุนต่ำและย้อนกลับได้ ไม่ใช่การเดิมพัน เลเยอร์นี้ไม่ได้โฮสต์โมเดลใดโมเดลหนึ่ง ทว่ามันทำให้การทดลองปลอดภัยที่จะรัน
ใครควรย้าย และใครควรรอ
จงอยู่กับ Qwen3-8B สำหรับงานทุกอย่างที่ต้องใช้หลายภาษา ทุกอย่างที่ต้องการพฤติกรรมที่รู้จักดีมาหนึ่งปีสี่เดือน หรือเวิร์กโหลดใด ๆ ที่ให้บริการอยู่แล้วบนฮาร์ดแวร์ซึ่งรัน 8B ได้อย่างสบาย — ช่องว่างของขนาดไม่ใช่เหตุผลที่จะย้าย และช่องว่างของหลักฐานก็ไม่สนับสนุนให้ย้ายเช่นกัน ให้จริงจังกับการทดสอบสแตก MiniCPM5-2B พร้อมกับ DSpark draft ก็ต่อเมื่ออุปกรณ์เป้าหมายของคุณไม่สามารถรัน 8B ได้เลย หรือหากโมเดล 2.5B ที่ตามทันงานแบบ agentic และงานบริบทยาวจะช่วยให้คุณลดหน่วยความจำและการใช้พลังงานบนฮาร์ดแวร์ที่คุณส่งออกอยู่แล้ว และก่อนที่คุณจะตัดสินใจใช้ draft ให้รันการวัดผลที่ OpenBMB ไม่ได้เผยแพร่: acceptance length ไม่ใช่ latency และอัตรา tokens ต่อวินาทีที่เพิ่มขึ้นบนอุปกรณ์ของคุณคือตัวเลขที่ชี้ขาดจริง ๆ ว่า checkpoint เล็ก ๆ ที่เงียบเชียบอยู่บน Hugging Face นั้นคุ้มค่ากับการดาวน์โหลดหรือไม่
