การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความว่า 'Intern-Decision-2B vs MiniCPM5-2B' โดยมีคำบรรยายใต้ภาพว่า 'งบประมาณ 2B สองชุด ห่างกันยี่สิบวัน' พร้อมแบดจ์ 'ตัวให้คะแนนการตัดสินใจ' และ 'โมเดลทั่วไปแบบเดนส์' โดยมีโลโก้ OrcaRouter ประกอบไว้ที่มุม
Guides & Insights

Intern-Decision-2B กับ MiniCPM5-2B: เช็กพอยต์ 2B สองตัว ห่างกันยี่สิบวัน กับวิธีจัดสรรพารามิเตอร์ที่ตรงกันข้าม

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

internlm/Intern-Decision-2B และ openbmb/MiniCPM5-2Bมีขนาดเท่ากัน เปิดตัวห่างกันยี่สิบวัน ได้รับสัญญาอนุญาตแบบเดียวกัน และถูกสร้างขึ้นเพื่องานที่ไม่มีส่วนใดคล้ายกันเลย เช็กพอยต์ของ InternLM คือตัวให้คะแนนการตัดสินใจขนาด 2,213,241,664 พารามิเตอร์: รับสเตตและคำถามที่ระบุชนิด รัน forward pass เพียงครั้งเดียว แล้วคืนค่าความน่าจะเป็นที่ปรับเทียบแล้วโดยไม่สร้างโทเคนแม้แต่ตัวเดียว พร้อมปฏิเสธอินพุตใด ๆ ที่เกิน 8,192 โทเคน ส่วนของ OpenBMB คือโมเดลทั่วไปแบบ dense ขนาด 2,516,756,480 พารามิเตอร์: Llama 42 ชั้นที่ต่อยอดจากสูตรของ MiniCPM5 รับบริบทได้ 131,072 โทเคน เขียนโค้ด เรียกใช้เครื่องมือ และทำงานคณิตศาสตร์ โดยมี Artificial Analysis Intelligence Index อยู่ที่ 12.5 และมียอดดาวน์โหลด 726,518 ครั้งเมื่อเดือนที่แล้ว ทั้งสองมีค่าใช้จ่ายในการดาวน์โหลดเท่ากัน แต่ให้สิ่งที่แตกต่างกันโดยสิ้นเชิง

ส่วนที่น่าสนใจของการจับคู่นี้ไม่ใช่ช่องว่างของเบนช์มาร์ก — แทบไม่มีเบนช์มาร์กที่ทับซ้อนกันให้เปรียบเทียบได้เลย แต่เป็นเรื่องที่งบประมาณพารามิเตอร์ 2.2 พันล้านกับ 2.5 พันล้านนั้นใช้ไปกับอะไรได้บ้าง และทางเลือกนั้นบอกอะไรคุณเกี่ยวกับว่าตัวไหนเสร็จสมบูรณ์แล้ว MiniCPM5-2B เป็นโมเดลตัวที่สองในซีรีส์ ต่อจาก MiniCPM5-1B เมื่อเดือนพฤษภาคม และมันมาพร้อมกับชุดกลไกการเปิดตัวแบบเต็มรูปแบบ Intern-Decision-2B เป็นขนาดกลางจากสามขนาดที่ InternLM อัปโหลดขึ้น Hugging Face เมื่อเวลา 05:36 UTC วันที่ 26 กันยายน 2026 โดยไม่มีการประกาศ และชุดกลไกการเปิดตัวของมัน — ฐานโค้ดสำหรับการเทรน ชุดประเมินที่ตรวจสอบด้วยแฮช เบนช์มาร์กคาลิเบรชัน 96 เคส — เพิ่งเปิดเผยต่อสาธารณะเมื่อเช้านี้เวลา 08:58 UTC

งบประมาณทั้งสองไปไหน

โมเดลทั้งสองเป็นไฟน์จูนของสถาปัตยกรรมของผู้อื่น และทั้งคู่มีพารามิเตอร์ประมาณ 2.5 พันล้านตัว นั่นคือจุดที่ความคล้ายคลึงกันสิ้นสุดลง

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the OpenBMB organisation, the tags Text Generation, Transformers, Safetensors, English, Chinese, llama, minicpm5, long-context, tool-calling, on-device and edge-ai, an Apache 2.0 licence, the MiniCPM Tech Report, MiniCPM Wiki, GitHub Repo, UltraData and Online Demo links, and the model title.

MiniCPM5-2B เป็น Transformer แบบ dense ที่มี 42 เลเยอร์ ขนาด hidden 2,048, attention head 16 หัว ขนาด intermediate 6,144, คำศัพท์ 130,560 โทเคน และบริบท 131,072 โทเคน ฝึกบนส่วนผสมของคลังข้อมูลเปิดที่ OpenBMB เผยแพร่มาพร้อมกัน ได้แก่ UltraX สำหรับการ pre-training บนเว็บ, UltraData-Code ที่มีการจัดการโค้ดแบบแบ่งระดับ L0–L3, UltraData-Math และตัวอย่าง SFT สำหรับ agent 500,000 ตัวอย่าง พร้อมตัวอย่าง RL มากกว่า 80,000 ตัวอย่างใน UltraData-RL-2609 การ post-training ของมันรัน SFT จากนั้นใช้ครู RL เฉพาะทางด้านคณิตศาสตร์ โค้ด และงาน agentic แล้วจึงทำ on-policy distillation กลับเข้าเป็นโมเดลเดียว มันเป็นโมเดลอเนกประสงค์ที่งบพารามิเตอร์ทั้งหมดถูกเปิดออกมาเป็นความสามารถที่คุณพรอมป์ได้

Intern-Decision-2B เป็น Qwen3_5ForConditionalGeneration ที่มี 24 เลเยอร์ — รูปแบบที่เกิดซ้ำของเลเยอร์ linear-attention สามชั้นต่อเลเยอร์ full-attention หนึ่งชั้น — hidden size 2,048, 8 query heads กับ 2 key-value heads, head dimension 256, เลเยอร์ multi-token-prediction ที่คงอยู่ และเพดาน embedding 262,144 ตำแหน่ง มันมาพร้อมกับ vision tower ขนาด 612.5 MB และ projector ขนาด 50.3 MB แทบไม่มีงบประมาณส่วนนั้นให้คุณใช้เป็นพรอมต์เลย: โมเดลตอบสคีมาคำถามแบบคงที่ และสถาปัตยกรรมของมันเป็นกลไกการส่งมอบสำหรับ softmax ไม่ใช่เครื่องสร้างข้อความ

รายละเอียดหนึ่งจากรีโพซิทอรีที่เพิ่งเผยแพร่ของ InternLM น่าดึงออกมาพิจารณา เพราะมันทำให้กรอบความหมายของแท็ก multimodal บนการ์ดโมเดลเปลี่ยนไป decision tuning "ไฟน์จูนแบ็กโบนภาษาของ Qwen3.5 โดยแช่แข็งวิสชันทาวเวอร์และโปรเจกเตอร์" ทั้งเช็คพอยต์ decision ขนาด 2B และ 4B ต่างมี vision shard ขนาด 612,517,440 ไบต์พอดี — เท่ากันทั้งคู่ — ซึ่งสอดคล้องกับว่าคอมโพเนนต์เหล่านั้นสืบทอดมาจากฐาน Qwen แทนที่จะถูกเทรน เส้นทางภาพนั้นมีจริงและใช้งานได้ แต่ไม่ใช่สิ่งที่ decision tuning ของ InternLM ทุ่มเทความพยายามไปด้วย ถ้างานของคุณเป็นการให้คะแนน decision แบบข้อความล้วน ประมาณ 660 MB จากดาวน์โหลด 4.46 GB นั้นไม่ได้ทำประโยชน์อะไรให้คุณเลย

สกอร์บอร์ด

A two-column comparison scoreboard titled 'Intern-Decision-2B vs MiniCPM5-2B'. The left column reads: Parameters 2,213,241,664 plus vision tower; Context 8,192 tokens, refused above; Output calibrated probabilities, no text; Modality text plus up to 8 images; Published evidence vendor table, unreproduced; Adoption one like, zero downloads. The right column reads: Parameters 2,516,756,480 dense; Context 131,072 tokens; Output generated text, token by token; Modality text only; Published evidence OpenBMB card, AA Index 12.5; Adoption 726,518 downloads last month. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the MiniCPM5-2B figures are OpenBMB's own card plus an independent Artificial Analysis index.

• พารามิเตอร์ — Intern-Decision-2B 2,213,241,664 ใน BF16 บวกกับ vision tower และโปรเจกเตอร์ประมาณ 660 MB คิดเป็นรีโพซิทอรีประมาณ 4.46 GB; MiniCPM5-2B 2,516,756,480 ใน BF16 ไฟล์ safetensors ขนาด 5.03 GB หนึ่งไฟล์

• บริบท — 8,192 โทเค็นสำหรับ Intern-Decision-2B โดยจะถูกปฏิเสธโดยไม่มีการตัดทอนเมื่อเกินกว่านั้น; 131,072 โทเค็นสำหรับ MiniCPM5-2B

• เอาต์พุต — การแจกแจงที่ปรับคาลิเบรตแล้ว พร้อมค่า argmax ต่อฟิลด์ ไม่มีข้อความใด ๆ ทั้งสิ้น; ข้อความที่สร้างขึ้น ทีละโทเคน

• การฝึก — การปรับแต่งการตัดสินใจของแบ็กโบน Qwen3.5-2B โดยตรึงวิชันทาวเวอร์ไว้ ไม่เปิดเผยข้อมูลการฝึก; มีการทำ pre-train เต็มรูปแบบ, mid-train และ SFT แบบคิดเชิงลึกจำนวน 400 พันล้านโทเคน ตามด้วย RL และ on-policy distillation พร้อมเผยแพร่คลังข้อมูลควบคู่กัน

• หลักฐานที่เผยแพร่ — ตารางผู้ขายแบบเจ็ดชุดทดสอบที่เฉลี่ย 84.68 โดยมี Brier 0.437 และ ECE 0.100 ซึ่งไม่มีบุคคลที่สามรายใดทำซ้ำได้ มี 1 ไลก์ และ 0 ดาวน์โหลด; การ์ด OpenBMB ที่เฉลี่ย 53.9 ภายในชุดเปรียบเทียบของตัวเอง และดัชนี Artificial Analysis Intelligence Index อิสระที่ 12.5 โดยมียอดดาวน์โหลด 726,518 ครั้งในเดือนที่ผ่านมา

• สัญญาอนุญาต — Apache-2.0 โดยเก็บข้อกำหนดของ Qwen ต้นทางไว้เป็น LICENSE-QWEN และไม่มีการระบุสัญญาอนุญาตใด ๆ ไว้เลยบนที่เก็บโค้ด; ใช้ Apache-2.0 ตลอดทั้งโปรเจกต์ รวมถึงโค้ดด้วย

แต่ละอันเก่งกว่ากันจริง ๆ ในเรื่องไหน และมันไม่ใกล้เคียงกันเลย

การเปรียบเทียบนี้ไม่สมมาตรถึงขั้นถือเป็นความผิดพลาดเชิงหมวดหมู่ จึงเป็นประโยชน์กว่าที่จะระบุให้ชัดว่างานแต่ละอย่างคืออะไร

MiniCPM5-2B ชนะในทุกงานที่ต้องสร้างคำตอบ มากกว่าการเลือกคำตอบ มันเขียนโค้ดได้ ส่วน Intern-Decision-2B ไม่มีเส้นทางสำหรับโค้ด มันรองรับคอนเท็กซ์ 131,072 โทเคน ส่วน Intern-Decision-2B หยุดที่ 8,192 และล้มเหลวอย่างชัดเจน มันเรียกใช้เครื่องมือได้ โดยมีคะแนน BFCL v4 ที่ 66.6 บนตารางของ OpenBMB เอง และมันทำคณิตศาสตร์ได้ โดยได้ MATH-500 ที่ 94.6 และ GPQA-Diamond ที่ 70.2 — ตัวเลขจากการ์ดของผู้ขาย โดยแถว GPQA มีเชิงอรรถที่การ์ดนั้นให้มาเอง มันทำคะแนนได้ 70.8 บน MMLU-Pro และ 84.7 บน MMLU-Redux มันรันบน llama.cpp และ MLX มีให้ใช้ในรูปแบบ GGUF, GPTQ และ DSpark และมีเดโม Space บน Hub ที่เป็นสาธารณะ ต่างจาก 401 ที่การ์ดของ Intern-Decision ชี้ไป

Intern-Decision-2B ได้เปรียบเพียงสองประการเท่านั้น และสองประการนั้นคือเหตุผลที่มันมีอยู่ ประการแรก การตัดสินใจแบบเซตปิดด้วยสคีมาที่คุณเขียน จะคืนค่าความน่าจะเป็นที่คุณตั้งเกณฑ์ได้ ในการส่งผ่านไปข้างหน้าครั้งเดียว ภายในเวลาประมาณ 33 มิลลิวินาที โดยไม่ต้องมีตัวแยกวิเคราะห์และไม่ต้องมีการสุ่มตัวอย่าง — เป็นรูปแบบที่ MiniCPM5-2B ไม่สามารถสร้างได้ นอกจากจะสร้างข้อความแล้วหวังว่าตัวเลขที่อยู่ภายในนั้นจะอยู่ในเกณฑ์ดี ประการที่สอง มันเป็นชิ้นงานที่ทำซ้ำได้: ตอนนี้รีโพซิทอรีมีฟังก์ชันวัตถุประสงค์การฝึก ชุดความแม่นยำเจ็ดชุดพร้อมแฮช SHA-256 และจำนวนแถวต่อชุด โค้ดให้คะแนน สคริปต์ปรับอุณหภูมิและรีเพลย์ และเกณฑ์มาตรฐานการปรับเทียบการแจกแจง 96 กรณีพร้อมตัวสร้างและตัวให้คะแนนแบบออฟไลน์ของตัวเอง คู่มือการประเมินของ InternLM ระบุว่าพรีเซ็ตที่เผยแพร่นั้นผูกกับแบ็กเอนด์ XTuner และผลลัพธ์ HF ควรถูกรายงานเป็นการตั้งค่าการทำงานที่แตกต่างออกไป — ซึ่งเป็นข้อแม้แบบที่ชุดเครื่องมือทำซ้ำมีอยู่เพื่อทำให้ตรวจสอบได้พอดี

A screenshot of the GitHub repository page for InternLM/Intern-Decision, showing the organisation and repository breadcrumb, the description 'Fast multi-modal decision model', 5 stars and 0 forks, the file tree with assets, benchmarks, configs, docs, runtime, scripts, src and tests directories plus a release-manifest.json, and a commit list headed by 'Add demonstration videos and centered README links' roughly an hour old.

ใครควรดาวน์โหลดอันไหน

หากคุณมีงานที่ต้องอ่านอะไรยาว ๆ เขียนบางอย่าง หรือตอบคำถามที่คุณไม่ได้ระบุตัวเลือกไว้ล่วงหน้า MiniCPM5-2B คือโมเดลที่ใช่ และไม่ต้องตัดสินใจอะไรอีก มันเป็นโมเดลอเนกประสงค์ระดับ 2B ที่สมบูรณ์แล้ว มีระบบนิเวศจริง มีข้อมูลเปิดรองรับ และมีรายการประเมินที่เป็นอิสระ แถมยังลองใช้ได้ฟรี — บิลด์ GGUF และ MLX มีอยู่บน Hub แล้ว

หากคุณมีงานที่เป็นการเลือกจากคำตอบที่รู้อยู่แล้วอย่างแท้จริง — เช่น การจัดเส้นทางตั๋ว การจำแนกอีเมลสนับสนุน การติดป้ายผู้สมัคร หรือการให้คะแนนเจตนาบนมาตรวัดแบบอันดับ — โมเดลแบบสร้างข้อความก็เป็นเครื่องมือที่ผิด และ Intern-Decision-2B ก็เป็นตัวที่น่าสนใจกว่าในสองตัวนี้ ถึงแม้แทบไม่มีใครได้รันมันก็ตาม ความน่าจะเป็นที่คุณตั้งเกณฑ์ตัดได้นั้นมีต้นทุนดำเนินงานต่ำกว่า ตรวจสอบง่ายกว่า และเป็นไปไม่ได้ที่จะหลอนขึ้นมา และการที่เช็กพอยต์นี้มาพร้อมชุดจำลองการทำซ้ำแทนที่จะเป็นโพสต์บนลีดเดอร์บอร์ด ทำให้มันเป็นตัวที่มีเอกสารประกอบครบถ้วนกว่าในสองตัว บนแกนที่สำคัญเมื่อคุณต้องปกป้องทางเลือกนั้น

ไม่มีโมเดลใดในสองโมเดลนี้อยู่บน OrcaRouter หน้าของโมเดล Intern-Decision-2B ของเราส่งคืน 404 และไม่มีเส้นทาง MiniCPM5-2B; ไม่มีสิ่งใดที่นี่เป็นการอ้างว่าพร้อมใช้งาน และทั้งสองกรณีหมายถึงคุณต้องรัน inference ด้วยตัวเอง ทางเลือกที่ใช้ได้จริงอยู่ที่โมเดลสำหรับการตัดสินใจแบบโฮสต์: TypeSafe's Jev 1.13 ซึ่งเป็นโมเดลที่ InternLM ใช้เปรียบเทียบทั้งตระกูลของตนด้วย อยู่ในแค็ตตาล็อกที่ $0.042 ต่อล้านโทเคนอินพุต พร้อมคอนเท็กซ์ 65K และ P50 time-to-first-token ที่ 178 ms และถ้าสิ่งที่คุณต้องการจริง ๆ คือโมเดลอเนกประสงค์ในระดับขนาดเดียวกับ MiniCPM5-2B โดยไม่ต้องทำงานด้านปฏิบัติการ เส้นทาง Qwen แบบโฮสต์ที่เล็กที่สุดของเรามีขนาดใหญ่กว่าหลายเท่า แต่เป็นคีย์เดียวในบรรดาโมเดลกว่า 200 รายการ ที่ ราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยไม่บวกเพิ่ม และมี การ failover อัตโนมัติรองรับอยู่เบื้องหลัง

ตัวเลขเดียวที่ชี้ขาด

มันไม่ใช่ 84.68 เทียบกับ 53.9 ค่าเฉลี่ยสองนั้นมาจากชุดทดสอบที่ต่างกัน วัดโดยแล็บที่ต่างกัน และในกรณีหนึ่งโดยแล็บที่ไม่เคยมีใครตรวจสอบตัวเลขของมันเลย ตัวเลขที่ชี้ขาดคือ 8,192 ถ้า state ของคุณพอดีภายในแปดพันโทเค็น และคำตอบของคุณเป็นรายการอยู่แล้ว Intern-Decision-2B เป็นเครื่องมือที่แม่นยำพร้อมชุดทำซ้ำ (reproduction kit) และความผิดปกติในการสอบเทียบ (calibration anomaly) ที่คุณควรทราบ — ค่าความคลาดเคลื่อนในการสอบเทียบที่คาดหวัง (expected calibration error) ของมันคือ 0.100 ซึ่งแย่ที่สุดในสามขนาดที่ InternLM เผยแพร่ เทียบกับ 0.066 สำหรับโมเดลที่มีขนาดครึ่งหนึ่ง ดังนั้นจงปรับ temperature ของคุณเองก่อนที่จะเชื่อค่าความมั่นใจ ถ้า state ของคุณไม่พอดี คำถามก็จบก่อนที่การทดสอบจะเริ่ม และ MiniCPM5-2B คือคำตอบ

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube