
น้ำหนัก MiniCPM5-2B พร้อมใช้งานแล้ว: โมเดลขนาดเล็กที่คว้ามงกุฎ Sub-4B เปิดเป็นโอเพนซอร์ส
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0455ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0247ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0247ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0157ความฉลาด82การเขียนโค้ด
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2646ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1849ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1541ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1251ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0547ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0347ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2140ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128ความฉลาด49การเขียนโค้ด
ตัวโมเดลเองมีอายุเพียงเจ็ดสัปดาห์ MiniCPM5-2B เปิดตัวครั้งแรกในงานประชุมปัญญาประดิษฐ์โลกปี 2026 เมื่อวันที่ 19 กรกฎาคม ซึ่ง ModelBest และ OpenBMB เรียกมันว่าเป็นโมเดลอันดับสูงสุดที่มีพารามิเตอร์ต่ำกว่า 4B ในลีดเดอร์บอร์ดของ Artificial Analysis และสัญญาว่าน้ำหนักของโมเดล (weights) จะตามมา "ในอนาคตอันใกล้นี้" สิ่งที่เกิดขึ้นสุดสัปดาห์นี้คือ อนาคตอันใกล้นั้นมาถึงโดยปราศจากพิธีรีตองการเปิดตัวใดๆ: คลังเก็บ MiniCPM5-2B เปิดใช้งานบน Hugging Face เมื่อวันที่ 6 กันยายน และบันทึกการเปลี่ยนแปลง (changelog) ของ OpenBMB ระบุวันเผยแพร่เป็นวันที่ 7 กันยายน ภายใต้สัญญาอนุญาต Apache-2.0 พร้อมด้วยแพ็กเกจครบชุด — น้ำหนักแบบ BF16, GGUF, การควอนไทซ์แบบ MLX และ GPTQ, เช็คพอยต์ทั้งแบบฐานและแบบ SFT, โมเดลร่าง DSpark สำหรับ speculative decoding และชุดข้อมูลฝึกอบรมที่อยู่เบื้องหลัง
ไม่มีข่าวประชาสัมพันธ์มาพร้อมกับมัน และไม่มีงานเปิดตัว มันเพียงแค่ปรากฏขึ้น: หนึ่งวันมีรีโพของ Hugging Face วันถัดมามีบรรทัดใน changelog นั่นทำให้บทความนี้เป็นบทความแนว “สิ่งที่เรารู้จนถึงตอนนี้” — พร้อมอัปเดตช่วงแรกหนึ่งรายการ รีโพบอกอะไรเราได้มาก: โมเดลดาวน์โหลดได้และรันได้จริงในวันนี้ และเอกสารสเปกก็เปิดเผยต่อสาธารณะ และคะแนนจากภายนอกก็ออกมาแล้ว: Artificial Analysis จัดอันดับ MiniCPM5-2B บน Intelligence Index v4.2 ที่ 15 ซึ่งเป็นผลลัพธ์แบบเปิดน้ำหนักสูงสุดภายใต้พารามิเตอร์รวมต่ำกว่า 4B บนดัชนีนั้น การจัดอันดับต่ำกว่า 4B จึงไม่ได้ขึ้นอยู่กับคำกล่าวของผู้พัฒนาเพียงฝ่ายเดียวอีกต่อไป สิ่งที่ยังไม่ได้รับการยืนยันคือตัวเลขหลักบนโมเดลการ์ด ซึ่ง OpenBMB ทำซ้ำในชุดทดสอบของตัวเอง และไม่มีใครนอกห้องแล็บได้รันซ้ำ นี่คือสิ่งที่ทราบได้จากรีโพ สิ่งที่ถูกวัดอย่างอิสระแล้ว และสิ่งที่ยังต้องตรวจสอบก่อนที่คุณจะนำไปต่อยอด
เมื่อกี้เกิดอะไรขึ้น
MiniCPM5-2B เป็นโมเดลตัวที่สองในซีรีส์ MiniCPM5 ต่อจาก MiniCPM5-1B ซึ่ง OpenBMB เปิดเผยซอร์สโค้ดเมื่อวันที่ 19 พฤษภาคม เมื่อ 2B วางจำหน่ายเป็นผลิตภัณฑ์ที่งาน WAIC เรื่องราวนั้นเป็นเรื่องของชิปไม่แพ้เรื่องของโมเดล — ModelBest นำเสนอว่าเป็นฐานเอเจนต์บนอุปกรณ์สำหรับโทรศัพท์มือถือ พีซี และห้องนักบินอัจฉริยะ พร้อมระบุชื่อชิปเก้าตัวที่รองรับตั้งแต่วันแรกผ่านชุมชน FlagOS ตั้งแต่ Huawei Ascend ไปจนถึง NVIDIA และตัวเร่งประมวลผลในประเทศอีกหลายตัว การเปิดเผยซอร์สโค้ดถูกระบุว่าจะเกิดขึ้นในเร็วๆ นี้ เจ็ดสัปดาห์ผ่านไป
เมื่อวันที่ 6 กันยายน repo openbmb/MiniCPM5-2B ได้ปรากฏขึ้น ณ เวลาที่เขียนนี้ การ์ดโมเดลคือประกาศการเผยแพร่ และถือว่าครบถ้วนอย่างผิดปกติสำหรับการปล่อยแบบเงียบ ๆ:
น้ำหนัก (Weights) — เช็คพอยต์สุดท้ายที่ผ่านการเทรนหลัง (post-trained) ด้วย RL + OPD ในรูปแบบ BF16 อยู่ภายใต้ใบอนุญาต Apache-2.0 และไม่มีการจำกัดการเข้าถึง — ใครก็สามารถดาวน์โหลดได้
• เช็คพอยต์คู่หู — MiniCPM5-2B-SFT, -Midtrain และ -Base สำหรับผู้ที่ต้องการโมเดลก่อนขั้นตอน RL/OPD รวมถึง -GGUF, -MLX, -GPTQ และโมเดลฉบับร่าง -DSpark ทั้งหมดมีอยู่ในคอลเลกชัน MiniCPM5 บน Hugging Face
• ข้อมูล — คลังข้อมูลสำหรับฝึกก็เปิดให้ใช้เช่นกัน โดยเผยแพร่เป็นส่วนหนึ่งของตระกูล UltraData: Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-Agent-2609 และ UltraData-RL-2609
• มิเรอร์ — README อ้างอิงถึงทั้ง Hugging Face และ ModelScope
หนึ่งบรรทัดในหน้าการ์ดข้อมูลสำคัญมากกว่าที่เห็น: "ไม่ใช้เคอร์เนลแบบกำหนดเอง และไม่มีการฟอร์กโค้ดโมเดล" MiniCPM5-2B ใช้สถาปัตยกรรม LlamaForCausalLM มาตรฐาน ทำให้เอ็นจินใดก็ตามที่รองรับโมเดลตระกูล Llama อยู่แล้วสามารถโหลดมันได้ทันทีโดยไม่ต้องรอการรองรับที่เขียนขึ้นเป็นพิเศษ
ทำไมโมเดล 2.5B จึงควรค่าแก่การมองอีกครั้ง
การนำเสนอที่งาน WAIC เป็นการนำเสนอที่เน้นการจัดอันดับ ModelBest กล่าวว่า MiniCPM5-2B ได้คะแนน Artificial Analysis Intelligence Index อยู่ที่ 17 ทำให้เป็นอันดับหนึ่งในบรรดาโมเดลที่มีพารามิเตอร์ต่ำกว่า 4B บนกระดานผู้นำของ AA ในช่วงเปิดตัว มีข้อควรระวังสองข้อที่ต้องจับคู่กับตัวเลขนี้ ประการแรก คะแนนดัชนีใช้เปรียบเทียบกันได้ก็เฉพาะภายในเวอร์ชันของวิธีวิทยาเดียวกันเท่านั้น ค่า 17.9 ก่อนหน้าของ MiniCPM5-1B มาจาก snapshot ของ AA รุ่นก่อนหน้า จึงไม่ใช่หลักฐานว่าโมเดลที่เล็กกว่า "ได้คะแนนสูงกว่า" และด้วยกฎเดียวกัน คะแนนใหม่ภายใต้วิธีวิทยาใหม่ก็ไม่ได้หมายถึงการถดถอย ประการที่สอง ตัวเลขของ AA ถูกป้อนเข้าสู่โมเดลการ์ด แต่ค่าเฉลี่ยที่เป็นหัวข้อหลักของการ์ดนั้นเป็นของ OpenBMB เอง ซึ่งสร้างขึ้นด้วยแฮร์เนสของ OpenBMB เอง ความแตกต่างนี้สำคัญ เพราะหลังจากนั้น AA ได้เปลี่ยนไปใช้วิธีวิทยาใหม่และเผยแพร่คะแนนใหม่ — นี่คือการตรวจสอบจากภายนอกครั้งแรกต่อการนำเสนอครั้งนั้น นับตั้งแต่การเปิดตัวแบบ open-weights
ตัวเลขจากภายนอกปรากฏขึ้นในสัปดาห์เดียวกับที่น้ำหนักโมเดลถูกเผยแพร่ เมื่อวันที่ 4 กันยายน Artificial Analysis ปล่อย Intelligence Index v4.2 ซึ่งเป็นการปรับปรุงวิธีการวัดที่เพิ่มน้ำหนักให้การทดสอบแบบส่วนตัวและแบบแยกออกมา (held-out) เป็น 40% และเพิ่มองค์ประกอบใหม่สองรายการ ได้แก่ AA-Briefcase ซึ่งเป็นการประเมินแบบเอเจนต์ และ GDP.pdf ของ Surge ซึ่งเป็นงานเหตุผลจากเอกสารบริบทยาว รายการดัชนีของ AA สำหรับ MiniCPM5-2B ตอนนี้ได้คะแนน v4.2 ที่ 15 ซึ่งเป็นผลลัพธ์สูงสุดในบรรดาโมเดลเปิดน้ำหนักที่มีพารามิเตอร์รวมต่ำกว่า 4B และเป็นอันดับหนึ่งในบรรดาโมเดลเปิด 47 รุ่นในระดับขนาดเดียวกันบนรายชื่อของ AA ทำให้โมเดลยังคงอยู่ในตำแหน่งที่การโปรโมตเมื่อเดือนกรกฎาคมวางไว้ ทว่าครั้งนี้มาพร้อมวิธีการที่ยากต่อการโกง และน้ำหนักที่ใครก็สามารถดาวน์โหลดไปตรวจสอบซ้ำได้ คะแนน 15 ไม่สามารถเทียบกับ 17 ในยุคเปิดตัวซึ่งมาจาก v4.1 เนื่องจากวิธีการเข้มงวดขึ้น ไม่ใช่โมเดลอ่อนแอลง และคะแนนรวมไม่ได้ยืนยันแต่ละแถวในตารางอีกครั้ง ซึ่งส่วนใหญ่ OpenBMB ทำซ้ำได้ในระบบทดสอบของตนเอง สิ่งที่มันทำได้คือตรงกับสองมิติที่ OpenBMB กล่าวว่าโมเดลถูกปรับให้เหมาะสม กล่าวคือ v4.2 เน้นงานแบบเอเจนต์มากขึ้น และการติดตามความยาวข้อความของ AA แสดงให้เห็นว่า MiniCPM5-2B สร้างโทเค็นเอาต์พุต 57 ล้านโทเค็นในงานดัชนีทั้งหมด ถือเป็นโมเดลที่สั้นกระชับที่สุดในระดับเดียวกัน เทียบกับค่ามัธยฐานที่ 72 ล้าน OpenBMB ขอบคุณ AA สำหรับการทดสอบครั้งนี้ และอธิบายผลในแง่ดังกล่าวพอดี โดยกล่าวว่าประสิทธิภาพแบบเอเจนต์และประสิทธิภาพการใช้โทเค็นที่ 2.6B คือสิ่งที่โมเดลถูกปรับให้เหมาะสม
ข้อกล่าวอ้างที่สำคัญคือความสามารถเชิงเอเจนต์ในแพ็กเกจขนาดเล็ก: {{1}}การเรียกใช้เครื่องมือแบบเนทีฟ การค้นหาเชิงลึก และการสร้างโค้ด ซึ่งถูกฝึกฝนเข้ามาตั้งแต่พื้นฐาน ไม่ใช่ถูกเสริมเข้ามาทีหลัง{{/1}} การ์ดดังกล่าวอธิบายไปป์ไลน์สามขั้นตอน — {{2}}การฝึกขั้นพื้นฐาน การฝึกช่วงกลาง และการฝึกหลังด้วยวิธี SFT บนโทเคนข้อมูลการคิดเชิงลึก 400B ตัว โมเดลครู RL เฉพาะทาง และการกลั่นแบบ On-Policy (OPD){{/2}} ซึ่งหลอมรวมโมเดลผู้เชี่ยวชาญ RL สิบหกโมเดล โดยห้าโมเดลเป็นแบบเอเจนต์ กลับเข้าสู่เครือข่ายหนาแน่นขนาดเล็กหนึ่งเดียว OpenBMB ระบุว่าขั้นตอน{{3}}RL + OPD ให้คะแนนเพิ่มขึ้นเฉลี่ย 10.96 จุดในงานเหตุผลและงานทั่วไป และ 6.96 จุดในงานเอเจนต์{{/3}} — {{4}}ซึ่งล้วนเป็นผลต่างภายใน แต่ก็อธิบายรูปร่างที่ผิดปกติของโมเดลนี้ได้{{/4}}: {{5}}เครือข่ายพารามิเตอร์ 2.5B ที่สร้างขึ้นในแบบโมเดลเชิงเหตุผล แต่มุ่งไปที่การใช้เครื่องมือ{{/5}}

สิ่งที่ repo มีอยู่จริง
เอกสารข้อมูลจำเพาะมีความชัดเจนไม่กำกวม เพราะมันคือไฟล์คอนฟิกนั่นเอง MiniCPM5-2B มีพารามิเตอร์ 2,516,756,480 ตัว โดย 1,981,982,720 ตัวเป็นส่วนที่ไม่ใช่เอมเบดดิ้ง — ผู้จำหน่ายนับตัวเลขส่วนที่ไม่ใช่เอมเบดดิ้งเมื่อกล่าวถึง "คลาส 2B" มันเป็นทรานส์ฟอร์เมอร์แบบหนาแน่นที่มี 42 เลเยอร์ ขนาดซ่อนเร้น (hidden size) 2048, grouped-query attention ที่มี query heads 16 ตัว และ KV heads เพียง 2 ตัว, คำศัพท์ 130,560 คำ และเทนเซอร์ BF16 ทั้งชุดจัดส่งเป็น safetensors shard ไฟล์เดียว เล็กพอที่จะดาวน์โหลดผ่านการเชื่อมต่อของโน้ตบุ๊กและรันบน GPU ระดับกลางตัวเดียวหรือ NPU ระดับสมาร์ตโฟน
• พารามิเตอร์ — ทั้งหมด 2,516,756,480; ไม่ใช่เอมเบดดิ้ง 1,981,982,720
สถาปัตยกรรม — หนาแน่น LlamaForCausalLM, 42 ชั้น, hidden 2048, GQA 16 เฮดคำถาม / 2 เฮด KV, คำศัพท์ 130,560
• บริบท — กำหนดค่าโทเค็น 131,072 ตัว (max_position_embeddings) โดยไม่มีการปรับขนาด RoPE ในคอนฟิก
• สัญญาอนุญาต — Apache-2.0 สำหรับทั้งโมเดลและข้อมูลฝึกอบรมที่เผยแพร่แล้ว
• รูปแบบ — BF16; เวอร์ชัน GGUF, MLX และ GPTQ เผยแพร่แยกต่างหาก

ตัวเลขหนึ่งจากสไลด์เดือนกรกฎาคมไม่ปรากฏใน checkpoint เอกสารของ WAIC เน้นย้ำหน้าต่างบริบทขนาด 512K โทเคน แต่คอนฟิกที่เผยแพร่จริงกำหนด max_position_embeddings เป็น 131,072 (128K) โดยไม่มีรายการ rope_scaling เป็นไปได้ว่าตัวเลข 512K นั้นตั้งใจให้ไปถึงได้ผ่านการขยายบริบทในขั้น inference (inference-time extension) ในแบบเดียวกับที่โมเดลเล็กหลายตัวยืดหน้าต่างบริบทของตน แต่ในสภาพที่เผยแพร่จริง repo ระบุค่า 131,072 ซึ่งเป็นตัวเลขที่ต้องใช้เป็นเกณฑ์ในการออกแบบ จนกว่า OpenBMB จะเผยแพร่แนวทางการขยายบริบทอย่างเป็นทางการ
ตัวเลขที่จัดเรียงตามผู้ที่วัด
การ์ดโมเดลนี้ใส่ใจเรื่องที่มาของข้อมูลอย่างรอบคอบ และคุ้มค่าที่จะอ่านเชิงอรรถ คะแนนที่การ์ดกำกับด้วยสัญลักษณ์กริช (dagger) ไว้ว่า “มาจากผลเผยแพร่อย่างเป็นทางการของ Artificial Analysis” เช่นแถว GPQA-Diamond 70.2, HLE 8.9, AA-LCR 59.0, Terminal-Bench v2.1 8.6 และ GDPval-AA v2 19.6 ส่วนที่เหลือทั้งหมดถูกอธิบายไว้ว่า “ทำซ้ำภายใน” ซึ่งหมายความว่า OpenBMB เป็นผู้รันการประเมินเหล่านั้นในระบบของตนเอง หมวดหมู่นั้นรวมถึงตัวเลขที่ดึงดูดความสนใจ: ค่าเฉลี่ยภายในที่ 53.9 จากชุดเปรียบเทียบของการ์ด, AIME 2025/2026 ที่ 86.5, MATH-500 ที่ 94.6, LiveCodeBench v6 ที่ 69.1, SWE-bench Verified ที่ 46.4, BFCL v4 ที่ 66.6, τ²-Bench Telecom ที่ 97.1, GAIA (Text-103) ที่ 88.7 และ MMLU-Pro ที่ 70.8
มีสามสิ่งที่ทำให้ตัวเลขเหล่านั้นอ่านได้อย่างตรงไปตรงมา ค่าเฉลี่ย 53.9 เป็นคะแนนเชิงสัมพัทธ์ ไม่ใช่คะแนนเชิงสัมบูรณ์ โดยการ์ดข้อมูลของโมเดลนี้จะปรับแกนเรดาร์แต่ละแกนให้เป็นมาตรฐานเดียวกัน เพื่อให้โมเดลที่ทำได้ดีที่สุดในชุดเปรียบเทียบได้ 100 คะแนน ชุดเปรียบเทียบนี้ถูกคัดเลือกโดยผู้พัฒนาโมเดลเอง ประกอบด้วยโมเดลโอเพนขนาด 2B-4B ตัวอื่น ๆ ได้แก่ Qwen3.5-2B, Qwen3.5-4B, Gemma-4-E2B-it, granite-4.2-3B, LFM2.5-2.6B และ LFM2.5-8B-A1B ภายในชุดนี้ การ์ดแสดงให้เห็นว่า MiniCPM5-2B ทำคะแนนแซงหน้า Qwen3.5-4B ซึ่งเป็นรองอันดับหนึ่งที่ 51.1 ซึ่งนับเป็นผลลัพธ์ที่น่าทึ่งอย่างยิ่งสำหรับโมเดลที่มีขนาดเพียงครึ่งเดียว และเป็นผลลัพธ์ประเภทที่ต้องมีการทำซ้ำโดยอิสระก่อนที่ใครจะนำไปต่อยอดจริง ๆ และแถวข้อมูลบางแถวก็ยากที่จะสอดคล้องกับคำโฆษณาทางการตลาด อาทิ คะแนน SWE-bench Verified 46.4 จากโมเดล dense ขนาด 2.5B จะน่าทึ่งมากหากทำซ้ำแล้วยังได้ผลเช่นเดิม ขณะที่ HLE 8.9 เป็นเครื่องเตือนว่า “ผู้นำกลุ่มต่ำกว่า 4B” กับ “โมเดลระดับแนวหน้า” นั้นคนละลีกกัน ไม่มีประเด็นใดในนี้ที่ขัดแย้งกับ repo และค่าคอมโพสิต v4.2 ของ AA ก็ยืนยันในเวลาต่อมาว่าโมเดลนี้มีตำแหน่งโดยรวมอยู่ด้านบนสุดของกลุ่มโมเดลโอเพนเวตที่เล็กกว่า 4B แต่แถวตัวเลขเฉพาะเหล่านี้เป็นข้อมูลของ OpenBMB เอง ซึ่งยังไม่มีใครนอกห้องแล็บตรวจสอบยืนยัน
วันนี้กำลังรัน MiniCPM5-2B
เนื่องจากสถาปัตยกรรมเป็น Llama ธรรมดา เอนจินหลักจึงโหลดได้โดยตรง README ของ OpenBMB มีคำแนะนำเริ่มต้นสำหรับ vLLM (0.21 หรือใหม่กว่า), SGLang (0.5.16 หรือใหม่กว่า) และ Transformers (5.6 หรือใหม่กว่า) พร้อมการสุ่มตัวอย่างที่แนะนำที่อุณหภูมิ 1.0 และ top-p 0.95 และเปิด enable_thinking เมื่อต้องการให้ผ่านกระบวนการคิด คู่หู GGUF และ MLX ครอบคลุม llama.cpp, Ollama, LM Studio และ Apple Silicon; การ์ดยังระบุรันไทม์ ArcLight และสแตกการปรับแต่งทั่วไป (TRL + PEFT, LLaMA-Factory, ms-swift, unsloth)
ก่อนเริ่มต้น มีรายละเอียดการปรับใช้สองประการที่ควรทราบ สำหรับการเรียกใช้เครื่องมือและฟังก์ชัน SGLang คือแบ็กเอนด์ที่แนะนำ: โมเดลจะส่งการเรียกใช้เครื่องมือในรูปแบบ XML และพาร์เซอร์ minicpm5 ที่มีอยู่ในตัวของ SGLang จะแปลงเป็นการเรียก tool_calls ที่เข้ากันได้กับ OpenAI ได้โดยตรง ซึ่งหมายความว่าไคลเอนต์การเรียกใช้เครื่องมือมาตรฐานสามารถทำงานได้โดยไม่ต้องใช้ชิมแบบกำหนดเอง และโมเดลร่าง DSpark ถูกสร้างขึ้นเพื่อทำให้ขั้นตอนการให้เหตุผลมีต้นทุนถูกลง: เมื่อเปิดใช้ใน SGLang ด้วยอัลกอริทึม DSPARK speculative-decoding จะช่วยเร่งการถอดรหัส ในขณะที่ผลลัพธ์ของโมเดลเป้าหมายยังคงไม่เปลี่ยนแปลง — เป็นปัจจัยที่ตัดสินว่าวงวนเอเจนต์ที่มีบริบท 128K บนแล็ปท็อปนั้นใช้งานได้จริงหรือเป็นเพียงแค่ความเป็นไปได้เท่านั้น

ถ้าคุณอยากประเมินโมเดลเปิดขนาดเล็กเป็นชุดมากกว่าจะปรับแต่งตัวเดียวด้วยมือ ชั้นการจัดเส้นทางก็พิสูจน์ความคุ้มค่าได้ตรงนี้ เมื่อผู้ให้บริการลงรายการ MiniCPM5-2B เราเตอร์คือวิธีประหยัดในการทำ A/B กับ Qwen3.5-2B และเช็คพอยต์เปิดที่ต่ำกว่า 4B ตัวอื่น ๆ บนงานเดียวกันโดยไม่ต้องผสานรวมเพิ่มเติม บน OrcaRouter นั่นหมายถึง API เดียวที่ครอบคลุมโมเดล 200+ ตัว ราคาตามรายการผู้ให้บริการถูกส่งผ่านโดยมาร์กอัป 0% และมีการเฟลโอเวอร์อัตโนมัติหากเช็คพอยต์ใหม่เอี่ยมค้างหรือวนซ้ำบนเส้นทางในโปรดักชัน รีโปนี้เพิ่งเกิดได้แค่สองวัน และยังไม่มี hosted API ที่เราพอจะชี้ได้ตัวใดระบุ MiniCPM5-2B ในรายการเลย ดังนั้นค่าเริ่มต้นที่ตรงไปตรงมาที่สุดในวันนี้คือมองมันเป็นการทดลองแบบโฮสต์เอง ไม่ใช่สิ่งที่ต้องพึ่งพา
ใครควรยกน้ำหนักเหล่านี้
ดึงมาใช้ได้เลยวันนี้ หากงานของคุณคือเอเจนต์บนอุปกรณ์ (on-device agents), การเรียกใช้เครื่องมือที่ขอบ (edge tool-calling) หรือการทดลองด้านการเขียนโค้ดและการให้เหตุผลด้วยโมเดลขนาดเล็ก และคุณต้องการตัวเลือกคลาส 2B ที่ถูกเทรนอย่างเข้มข้นที่สุดที่มีอยู่บนโต๊ะ ลิขสิทธิ์ Apache-2.0 และข้อมูลฝึกอบรมแบบเปิดช่วยขจัดเหตุผลสองข้อที่ทำให้ทีมส่วนใหญ่ลังเลใจกับโมเดลเล็กจากห้องแล็บจีน นั่นคือ ไม่มีข้อจำกัดด้านการใช้เชิงพาณิชย์ และไม่มีคลังข้อมูลกล่องดำ (black-box corpus) จงดึงมาใช้อย่างระมัดระวัง หากคุณกำลังเลือกโมเดลสำหรับการผลิตโดยอาศัยตาราง benchmark เพียงอย่างเดียว เพราะแถวหัวข้อของการ์ดเป็นผลงานการทำซ้ำของ OpenBMB เอง และคะแนนรวม v4.2 ของ AA — ซึ่งเป็นการวัดจากภายนอกเพียงหนึ่งเดียวเท่าที่มีมา — ไม่ได้รับรองตัวเลขเหล่านั้น โมเดล 2.5B ที่รายงานว่าทำได้เหนือกว่า Qwen3.5-4B เป็นข้อกล่าวอ้างที่สมควรใช้เวลาสองชั่วโมงที่ต้องใช้ในการทำซ้ำ SWE-bench ด้วยตัวเอง
สิ่งที่น่าจับตามองต่อไป. repo เพิ่งมีอายุได้เพียงสองวัน สัญญาณระยะใกล้จึงยังเป็นเชิงกลไกอยู่: ว่า llama.cpp และไลบรารี Ollama จะรองรับ GGUF หรือไม่ ว่ามิเรอร์ ModelScope และบิลด์สำหรับชิป FlagOS จะปล่อยออกมาอย่างราบรื่นหรือไม่ และว่า API แบบโฮสต์จะขึ้นบัญชี MiniCPM5-2B หรือไม่ — นั่นคือจังหวะที่มันจะไม่ได้ถูกจำกัดให้โฮสต์ด้วยตัวเองอีกต่อไป สัญญาณเชิงเนื้อหาที่บทความชิ้นนี้เคยชี้ว่าขาดหายไป — การรันทดสอบอย่างอิสระโดย Artificial Analysis หรือห้องแล็บมหาวิทยาลัย — ได้มาถึงแล้วในรูปของคะแนนดัชนี v4.2 และมันยังคงทำให้ MiniCPM5-2B อยู่อันดับหนึ่งในบรรดาโมเดลโอเพนเวตที่ต่ำกว่า 4B สิ่งที่ยังค้างอยู่คือการตรวจสอบระดับแถวข้อมูล: ยังไม่มีใครนอกเหนือจาก OpenBMB ที่ทำซ้ำตัวเลขภายในของการ์ดโมเดลได้ โดยเฉพาะ SWE-bench Verified ที่ 46.4 และค่าเฉลี่ยภายในที่ 53.9 จนกว่าจะมีการรันแถวข้อมูลเหล่านั้นซ้ำ จงปฏิบัติต่อ MiniCPM5-2B แบบเดียวกับที่คุณปฏิบัติต่อโมเดลที่ปล่อยออกมาอย่างเงียบ ๆ พร้อมการ์ดที่น่าประทับใจ: มองมันเป็นสมมติฐานที่ดูมีอนาคตมากซึ่งคุณสามารถรันบนเครื่องท้องถิ่นได้ในคืนนี้ และเป็นโมเดลที่คุณควรตรวจสอบตัวเลขที่โดดเด่นที่สุดก่อนจะไว้วางใจให้ทำงานจริง
