
MiniCPM5-2B เทียบกับ Qwen 3 8B: งานที่รันบน 8B ควรย้ายลงไปใช้ 2.5B หรือไม่?
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
การเปรียบเทียบโมเดลทุกครั้งแฝงคำถามเรื่องฮาร์ดแวร์ไว้เสมอ และ MiniCPM5-2B กับ Qwen 3 8B ก็คือคำถามนั้นที่สวมชุดเบนช์มาร์กมา Qwen 3 8B คือโมเดลโอเพนเวตของอาลีบาบาที่เปิดตัวในเดือนเมษายน 2025 — พารามิเตอร์หนาแน่นประมาณ 8.2B รองรับ 119 ภาษา โหมดคิดแบบผสมเปิดหรือปิดได้ตามคำขอ และมีหลักฐานจากชุมชนผู้ใช้ยาวนานสิบหกเดือนรองรับอยู่เบื้องหลัง MiniCPM5-2B คือโมเดลที่ ModelBest และ OpenBMB เปิดตัวในงานประชุมปัญญาประดิษฐ์โลกเมื่อวันที่ 19 กรกฎาคม ในฐานะโมเดลอันดับหนึ่งในกลุ่มขนาดต่ำกว่า 4B บนลีดเดอร์บอร์ดของ Artificial Analysis ซึ่งโอเพนเวตของโมเดลถูกปล่อยลง Hugging Face อย่างเงียบ ๆ ในวันที่ 6 และ 7 กันยายน คำถามที่ทำให้ทั้งสองโมเดลมาอยู่บนหน้าเดียวกันจริง ๆ คือคำถามที่ทีมส่วนใหญ่ที่รันโอเพน 8B ตัวหนึ่งถามตัวเองอยู่ไม่วันใดก็วันหนึ่ง: เวิร์กโหลดที่ฉันให้บริการบน 8B นั้นย้ายลงไปอยู่ที่ 2.5B ได้ไหม — และถ้าย้ายได้ ฉันจะต้องยอมสละอะไรบ้าง?
คำตอบสั้นๆ คือยังไม่ใช่สำหรับเวิร์กโหลดส่วนใหญ่ แต่เหตุผลแคบกว่าช่องว่างขนาดสี่เท่าที่ดูเผินๆ และมีการใช้งานรูปแบบหนึ่งที่ 8B ไม่มีคำตอบเลย ตัวเลขเชิงปริมาณทั้งหมดด้านล่างนี้เป็นข้อมูลที่ผู้ผลิตแจ้งและระบุไว้เช่นนั้น: ตัวเลขของ MiniCPM5-2B เป็นข้ออ้างบนการ์ดของ ModelBest เอง อายุหนึ่งสัปดาห์และยังไม่มีใครนอกแล็บทำซ้ำได้ ส่วนของ Qwen 3 8B เป็นของ Alibaba ถูกตรวจสอบ ควอนไทซ์ และรันซ้ำโดยชุมชนขนาดใหญ่มานานแล้ว ความไม่สมดุลของหลักฐานนั่นคือประเด็นหลักที่แท้จริงของการเปรียบเทียบครั้งนี้
สิบหกเดือนกับ Qwen 3 8B
Qwen 3 8B อยู่ในตระกูลสถาปัตยกรรมเดียวกันกับคู่แข่ง แต่มีขนาดใหญ่กว่าสามเท่าและเก่ากว่า 16 เดือน มันเป็นทรานส์ฟอร์เมอร์แบบ Dense Causal ที่ใช้กลไกแอตเทนชันแบบ Grouped-Query ผ่านการเทรนล่วงหน้าด้วยคลังข้อมูลหลายภาษาขนาดประมาณ 36 ล้านล้านโทเคน ใช้สัญญาอนุญาต Apache-2.0 และเป็นหนึ่งในโมเดล 8B แบบเปิดเผยน้ำหนัก (open-weights) ที่ถูกนำไปโฮสต์ด้วยตัวเองและให้บริการกันอย่างแพร่หลายที่สุดในโลก จุดเด่นของมันคือโหมดการคิดแบบผสมของ Qwen3 ซึ่งสามารถเปิดหรือปิดการใช้ความคิดได้ตามคำขอ ทำให้การติดตั้งชุดเดียวตอบคำถามที่ต้องการความรวดเร็วได้ในทันที แล้วสลับไปใช้การคิดแบบเป็นขั้นตอน (chain-of-thought) อย่างรอบคอบสำหรับโจทย์คณิตศาสตร์หรือการเขียนโค้ด ตัวโมเดลรองรับ Model Context Protocol และการเรียกใช้ฟังก์ชันในระดับเนทีฟ มีบริบทดั้งเดิม 32K ซึ่ง Alibaba ยืนยันว่าสามารถขยายได้ถึง 131K ด้วยเทคนิค YaRN scaling และครอบคลุม 119 ภาษาและภาษาถิ่น ผ่านมา 16 เดือน ข้อบกพร่องของมันได้รับการบันทึกไว้แล้ว มีเวอร์ชันควอนไทซ์วางจำหน่ายครอบคลุม และชุดซอฟต์แวร์สำหรับเสิร์ฟโมเดลรอบตัวมัน อย่าง vLLM, SGLang, llama.cpp และโมเดล fine-tune อีกเป็นพัน ก็มีความสมบูรณ์เต็มที่ เมื่อใช้ควอนไทเซชันในทางปฏิบัติ มันกินหน่วยความจำเพียงไม่กี่กิกะไบต์ วิ่งได้อย่างสบายบน GPU ระดับกลางหนึ่งตัว ไม่ใช่บนโทรศัพท์

สิ่งที่ MiniCPM5-2B กล่าวอ้างในโลกนั้น
MiniCPM5-2B มาจากทิศทางตรงกันข้าม: เล็กโดยการออกแบบ แต่เป็น agentic โดยการฝึกฝน มันเป็น dense transformer ที่มีพารามิเตอร์รวม 2.52B (ไม่รวม embedding 1.98B) 42 ชั้น ขนาด hidden 2048, grouped-query attention, สถาปัตยกรรม LlamaForCausalLM มาตรฐานโดยไม่มี custom kernels และหน้าต่างบริบท 131,072 โทเค็นในคอนฟิกที่จัดส่ง (เอกสารเปิดตัวเดือนกรกฎาคมอ้างถึง 512K แต่คอนฟิกที่เผยแพร่จริงไม่มีค่านั้น) ในขณะที่ Qwen 3 8B ได้ความกว้างจากการฝึก pretraining แบบหลายภาษาด้วยโทเค็น 36 ล้านล้าน MiniCPM5-2B ได้รูปทรงจาก post-training: SFT บนข้อมูล deep-thinking 400B โทเค็น จากนั้น On-Policy Distillation ที่รวมโมเดลผู้เชี่ยวชาญ RL สิบหกตัว โดยห้าตัวเป็น agentic กลับเข้าไปในเครือข่าย dense เล็ก ๆ หนึ่งเครือข่าย จุดขายตอนเปิดตัวคือฐานเอเจนต์บนอุปกรณ์ (on-device agent base) — การเรียกใช้เครื่องมือแบบเนทีฟผ่านการเรียกสไตล์ XML, การปรับใช้ตั้งแต่วันแรกบนชิปตระกูลเก้าตระกูลบวก ARM, โหมดไฮบริดเร็ว/รอบคอบ (fast/deliberate) — และการ์ดข้อมูลอ้างว่าค่าเฉลี่ยภายใน 53.9 ในชุดเปรียบเทียบ 2B-4B ที่ผู้ผลิตเลือก, คะแนน AIME 2025/2026 ที่ 86.5 และ 46.4 ที่ผู้ผลิตเป็นคนรันบน SWE-bench Verified ซึ่งจะน่าทึ่งสำหรับโมเดล 2.5B หากผ่านการทดสอบอิสระ

ความไม่ตรงกัน ทีละมิติ
• กำหนดการเปิดตัว — MiniCPM5-2B: ประกาศเมื่อวันที่ 19 กรกฎาคม 2026; เปิดตัว weights ในวันที่ 6–7 กันยายน Qwen 3 8B: ประกาศเมื่อเดือนเมษายน 2025
• ขนาด — MiniCPM5-2B: 2.52B ทั้งหมด / 1.98B ไม่รวมเอมเบดดิ้ง, เป็น dense ส่วน Qwen 3 8B: ~8.2B เป็น dense
บริบท — MiniCPM5-2B: 131,072 โทเคนในการตั้งค่าที่มาพร้อมกับตัวแบบ Qwen 3 8B: 32K โดยกำเนิด, 131K ผ่านการตรวจสอบด้วย YaRN
• ภาษา — MiniCPM5-2B: เน้นภาษาอังกฤษและภาษาจีนเป็นหลัก Qwen 3 8B: 119 ภาษาและภาษาถิ่น
การใช้เหตุผล — MiniCPM5-2B: โหมดเร็ว/ไตร่ตรองแบบผสม ตามเอกสารเผยแพร่ Qwen 3 8B: เปิดหรือปิด Qwen3 คิดตามคำขอ
• หลักฐาน — MiniCPM5-2B: การ์ดข้อมูลจากผู้จำหน่าย ยังไม่มีการทดสอบรันอิสระ Qwen 3 8B: รายงานจาก Alibaba มีการทำซ้ำและปรับใช้โดยชุมชนเป็นเวลาสิบหกเดือน

ตารางด้านบนคือภาพของความไม่สอดคล้องที่วาดขึ้นอย่างตรงไปตรงมา โดยในแทบทุกจุดคอลัมน์ต่างก็แตกต่างกัน ยกเว้นใบอนุญาต Apache-2.0 แบบเปิด และคลาสอุปกรณ์ที่คุณจะจัดส่งไปให้นั้นเป็นตัวกำหนดว่าคุณจะเลือกคอลัมน์ใดได้หรือไม่ได้ด้วยซ้ำ
จุดที่ 8B ยังชนะ
เมื่อลดคลาสน้ำหนักลงมาหนึ่งขั้น คุณต้องสละสิ่งที่เป็นรูปธรรมสามอย่าง ประเด็นแรกคือภาษา: Qwen 3 8B ครอบคลุม 119 ภาษา ในขณะที่การ์ดโมเดลและข้อมูลของ MiniCPM5-2B มุ่งเน้นที่ภาษาอังกฤษและภาษาจีน และไม่มีการอ้างว่าครอบคลุมภาษาหลากหลาย สำหรับผลิตภัณฑ์ที่ให้บริการภาษากลุ่มหางยาว นั่นคือกำแพงแข็ง ไม่ใช่กำแพงที่ยืดหยุ่น ประเด็นที่สองคือหลักฐานเชิงประจักษ์: การทดสอบจากชุมชนเป็นเวลาสิบหกเดือนหมายความว่าพฤติกรรมของ Qwen 3 8B เป็นที่รู้จักกันดี และระบบนิเวศของมันก็กระจายอยู่ทั่วทุกที่แล้ว ขณะที่ MiniCPM5-2B เป็นที่เก็บโค้ดอายุหนึ่งสัปดาห์พร้อมการ์ดที่ยังไม่ผ่านการตรวจสอบ — และถ้าตัวเลขเด่นของมันไม่รอดผ่านการรันอย่างอิสระ ตัวเลขเหล่านั้นก็คือประเภทที่มักถูกแก้ไขกันเงียบ ๆ ประเด็นที่สามคือสแตกการเสิร์ฟ: ทุกอย่างที่คุยกับ Qwen 3 8B ได้อยู่แล้วกำลังคุยกับเป้าหมายที่เติบโตเต็มที่ ในขณะที่เช็คพอยต์คลาส 2B ใหม่เอี่ยมหมายถึงการต้องตรวจสอบการควอนไทซ์ การตั้งค่าการเสิร์ฟ และพฤติกรรมการเรียกใช้เครื่องมือใหม่ทั้งหมดตั้งแต่ต้น ไม่มีข้อใดที่บอกว่าโมเดล 2B จะชนะบนเกณฑ์วัดเฉพาะไม่ได้ แต่ข้อเหล่านี้คือเหตุผลที่ 8B เป็นตัวเลือกเริ่มต้นที่มีความเสี่ยงต่ำกว่าในทุกจุดที่มันลงตัว
ที่ซึ่ง 2B คือคำตอบเดียว
ทั้งหมดนั้นไม่สำคัญเลยสำหรับอุปกรณ์คลาสที่รุ่น 8B ใส่ไม่ลงตั้งแต่แรก บนโทรศัพท์ บอร์ดสมาร์ทค็อกพิท หรือเอดจ์บ็อกซ์ขนาดเล็กที่มี DRAM ไม่กี่กิกะไบต์ Qwen 3 8B ไม่ได้แข่งขันกับ MiniCPM5-2B ด้วยซ้ำ — มันไม่สามารถนำไปใช้งานได้ที่ความเร็วอันเป็นประโยชน์เลยแม้แต่น้อย นั่นคือเหตุผลทั้งหมดที่รุ่น 2B ถูกสร้างขึ้นมา และเป็นเหตุผลว่าทำไมการวางกรอบการเปรียบเทียบนี้อย่างซื่อตรงจึงไม่ใช่ “รุ่น 2B ดีเท่ารุ่น 8B หรือไม่” แต่เป็น “การใช้งานของฉันแบบไหนที่มีเพียงรุ่นใดรุ่นหนึ่งในสองรุ่นนี้เท่านั้นที่รองรับได้” หากคุณกำลังส่งมอบเอเจนต์บนอุปกรณ์ซึ่งบัสหน่วยความจำจะรับน้ำหนักแปดพันล้านค่าไม่ไหว MiniCPM5-2B คือหนึ่งในตัวเลือกคลาส 2B ที่ถูกเทรนอย่างเข้มข้นที่สุดที่มีอยู่ และคำถามเดียวที่คุ้มค่าจะถามคือข้อกล่าวอ้างด้านเอเจนต์ของมันจะรอดเมื่อคุณลองทำซ้ำผลด้วยตัวเองหรือไม่ หากเวิร์กโหลดของคุณรันบนฮาร์ดแวร์ที่แบกรับรุ่น 8B ได้อย่างสบายอยู่แล้ว ช่องว่างของขนาดเพียงอย่างเดียวไม่ใช่เหตุผลที่จะย้าย — และช่องว่างของหลักฐานก็เป็นเหตุผลที่คัดค้านการย้าย
หากคุณกำลังคิดที่จะเปลี่ยน
วิธีที่ปลอดภัยในการทดสอบการเปลี่ยนแปลงนี้คือมองว่ามันเป็นการทดลอง ไม่ใช่การย้ายระบบ โฮสต์ MiniCPM5-2B บนฮาร์ดแวร์ของคุณเอง ป้อนทราฟฟิกจริงส่วนหนึ่งผ่าน API เดียวที่มีการสลับอัตโนมัติเมื่อขัดข้อง (failover) แล้ววัดเทียบกับรุ่น 8B บนคำขอเดียวกัน — เลเยอร์การกำหนดเส้นทางคุ้มค่าตรงนี้ เพราะเช็คพอยต์ที่อายุแค่หนึ่งสัปดาห์อาจค้างหรือวนซ้ำได้โดยไม่ทำให้ระบบโปรดักชันล่ม และราคาในรายการของผู้ให้บริการสำหรับโมเดลโฮสต์ที่คุณเปรียบเทียบด้วยนั้นส่งผ่านที่มาร์กอัป 0% สิ่งที่คุณทดสอบจริงๆ คือสามอย่าง: ความแม่นยำของรุ่น 2B ยังคงอยู่กับข้อมูลของคุณหรือไม่ ความหน่วงของมันบนคลาสอุปกรณ์ของคุณชนะรุ่น 8B บนฮาร์ดแวร์ที่คุณจะต้องซื้อเป็นอย่างอื่นหรือไม่ และโปรไฟล์ภาษาอังกฤษ-จีนครอบคลุมผู้ใช้จริงที่คุณมีหรือไม่ รัน SWE-bench ซ้ำหรือทดสอบชุดประเมินของคุณเองบางส่วนก่อน — สองชั่วโมงที่ใช้นั้นคือประกันที่ถูกที่สุดที่การจับคู่นี้ให้มา
คำตัดสิน
ใช้ Qwen 3 8B ต่อไปสำหรับงานที่ต้องใช้หลายภาษา งานที่ต้องอาศัยพฤติกรรมที่เป็นที่รู้จักกันดีมายาวนานสิบหกเดือน หรือเวิร์กโหลดใดๆ ที่ทำงานบนฮาร์ดแวร์ซึ่งรองรับ 8B ได้อย่างสบายอยู่แล้ว จงทดสอบ MiniCPM5-2B อย่างจริงจังก็ต่อเมื่ออุปกรณ์เป้าหมายของคุณไม่สามารถรองรับ 8B ได้เลย หรือหากโมเดล 2.5B ที่ตามทันทั้งงานแบบ agentic และงานบริบทยาว จะช่วยให้คุณลดหน่วยความจำและพลังงานบนฮาร์ดแวร์ที่คุณจัดส่งอยู่แล้วได้ การครองตำแหน่งผู้นำอันดับโมเดลต่ำกว่า 4B ถือเป็นความสำเร็จที่แท้จริง และการปล่อยน้ำหนักแบบเปิด (open weights) ทำให้สามารถทดสอบได้ในวันนี้ เพียงแต่จากหลักฐานที่มีอยู่ มันยังไม่ใช่เหตุผลที่จะปลดระวางโมเดล 8B ผู้ทำงานหนักที่ได้ที่ทางของมันไปแล้ว
