การ์ดชื่อเรื่องหลักที่อ่านว่า 'Kolibri vs MiniCPM5 2B' ด้วยตัวอักษรขนาดใหญ่ตัวหนา โดยมีข้อความบรรทัดเล็กลงเพียงบรรทัดเดียวด้านล่างว่า 'โมเดลระดับเซิร์ฟเวอร์เทียบกับเอเจนต์บนอุปกรณ์' และไอคอนเส้นแบบแบนขนาดเล็กสองไอคอนวางเรียงข้างกัน — รูปนกฮัมมิงเบิร์ดทางซ้าย และโครงร่างชิปมือถือขนาดเล็กทางขวา — คั่นด้วยเส้นแบ่งแนวตั้งแบบบาง วางอยู่บนพื้นหลังสีขาวพร้อมแอ็กเซนต์ไล่ระดับสีฟ้าและสีฟ้าอมเขียวแบบนุ่มนวล และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Kolibri vs MiniCPM5-2B: พารามิเตอร์ 78 พันล้านเทียบกับ 2.5 และทำไมตัวเล็กจึงไม่ใช่ตัวเลือกที่ประหยัด

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วางKolibriไว้ข้าง ๆMiniCPM5-2B แล้วการอ่านโดยสัญชาตญาณก็คือว่านี่คือการเปรียบเทียบขนาด และโมเดลขนาด 2.5 พันล้านพารามิเตอร์คือตัวเลือกที่ประหยัด การอ่านแบบนั้นผิดในแบบที่ให้บทเรียน Kolibri คือโมเดล mixture-of-experts ขนาด 78.1 พันล้านพารามิเตอร์ของ Aleph Alpha เปิดตัวเมื่อวันที่ 3 ตุลาคม 2026 เปิดใช้งาน 3.46 พันล้านพารามิเตอร์ต่อโทเค็น โดยมีพื้นที่ FP8 ประมาณ 78 GB และต้องใช้การ์ด A100 80 GB สองใบเป็นคอนฟิกูเรชันขั้นต่ำในการให้บริการ MiniCPM5-2B คือโมเดล dense ขนาด 2.52 พันล้านพารามิเตอร์ของ ModelBest และ OpenBMB เปิดตัวที่งาน World Artificial Intelligence Conference เมื่อวันที่ 19 กรกฎาคม 2026 โดยมีเวตเผยแพร่บน Hugging Face เมื่อวันที่ 6 กันยายน MiniCPM5-2B มีขนาดเล็กกว่า 31 เท่าเมื่อนับตามจำนวนพารามิเตอร์ มันยังเป็นตัวที่ต้องมีงบประมาณสำหรับการประเมินก่อนที่คุณจะเชื่อถือ เพราะตัวเลขที่ถูกอ้างอิงมากที่สุดของมันมาจากการรันโดยผู้ขายและยังไม่มีการทำซ้ำ — ซึ่งเป็นสิ่งที่ตรงกันข้ามกับสิ่งที่ “โมเดลขนาดเล็ก” มักสื่อเกี่ยวกับความเสี่ยงโดยทั่วไป

ทั้งคู่เปิดตัวไปอย่างเงียบ ๆ; มีเพียงหนึ่งในนั้นที่เพิ่งเปิดตัวเมื่อเร็ว ๆ นี้

他们有相似的起源故事,但年龄相差很大,而年龄很重要。Aleph Alpha 的 Kolibri 仓库创建于 2026 年 10 月 2 日,声明的发布日期为 10 月 3 日,而该供应商自己的新闻中心公告也在当天早上发布,恰逢德国统一日。通用 AI 媒体当天基本上错过了它,这就是“安静发布”这一说法的由来,但模型卡、技术报告和供应商帖子并不是无声上线。MiniCPM5-2B 确实更安静:7 月的 WAIC 公告只是对宣传要点和规格的会议发布,真正的权重直到 9 月 6 日才出现,发布时没有启动活动,同时还附带了 GGUF、MLX、GPTQ、base、SFT 和 draft 检查点,以及支撑它们的训练语料。

ช่องว่างห้าสัปดาห์ระหว่างการประกาศกับเวตนั้นน่าจดจำ เพราะมันเป็นเหตุผลว่าทำไมตัวเลขสองชุดที่ต่างกันจึงยังถูกพูดถึงสำหรับโมเดลนี้ เอกสารเดือนกรกฎาคมโฆษว่ามีหน้าต่างบริบท 512K โทเคน ส่วนคอนฟิกที่จัดส่งจริงกำหนดไว้ที่ 131,072 อาร์ติแฟกต์ที่เผยแพร่คือสิ่งที่สำคัญ

แต่ละโมเดลใช้สำหรับอะไรจริงๆ

Kolibri ถูกสร้างขึ้นเพื่องานเอกสารภาษาเยอรมันและอังกฤษ และ Aleph Alpha ให้รายละเอียดเฉพาะเจาะจงอย่างผิดปกติว่าเหตุใดสิ่งนั้นจึงต้องใช้วิศวกรรมจริง ๆ การทดลองกับโมเดลพร็อกซีขนาดเล็กกำหนดเป้าหมายสัดส่วนภาษาเยอรมันในส่วนผสมการฝึกไว้ที่ประมาณ 20 เปอร์เซ็นต์ ซึ่งสำหรับการรันด้วยโทเคน 20 ล้านล้านโทเคนหมายถึงการต้องหาโทเคนภาษาเยอรมัน 4 ล้านล้านโทเคน ชุดข้อมูลภาษาเยอรมันแบบเปิดที่ผ่านการกำจัดข้อมูลซ้ำและกรองแล้วให้ผล 390 พันล้านโทเคน — ซึ่งขาดไปหนึ่งอันดับขนาด — ดังนั้นแล็บจึงปรับจูนตัวกรอง Common Crawl สำหรับภาษาเยอรมันโดยเฉพาะ ทำให้ได้โทเคนออร์แกนิกที่ไม่ซ้ำกัน 1.3 ล้านล้านโทเคน และนำเอกสารภาษาเยอรมันที่มีอยู่มาเขียนใหม่เป็นรายการสารานุกรม บทสนทนา และข้อความ ได้อีกประมาณหนึ่งล้านล้านโทเคน ซึ่งกลายเป็นแหล่งภาษาเยอรมันแหล่งเดียวที่ใหญ่ที่สุด การแปล ซึ่งใช้กับรุ่นก่อนหน้าอย่าง Kolibri Origin ถูกตัดออกไปสำหรับ Kolibri รายละเอียดเกี่ยวกับตัวกรองคือสิ่งที่ควรจดจำไว้: ไปป์ไลน์ข้อมูลภาษามาตรฐานจะทิ้งเอกสารที่มีคำยาวมากเกินไป และงานเขียนเชิงบริหารราชการภาษาเยอรมันมักเกินขีดจำกัดค่าเฉลี่ยความยาวคำของภาษาอังกฤษเป็นประจำ ดังนั้นการตั้งค่าเริ่มต้นจึงลบระดับภาษาที่ภาครัฐใช้เขียนออกไปอย่างเงียบ ๆ

MiniCPM5-2B ถูกสร้างขึ้นสำหรับปลายทางตรงกันข้าม — เอเจนต์บนอุปกรณ์ การ์ดโมเดลระบุถึงทรานส์ฟอร์เมอร์แบบเดนส์ที่มีพารามิเตอร์รวม 2.52 พันล้านตัว, 1.98 พันล้านตัวที่ไม่ใช่ embedding, 42 ชั้นที่ขนาด hidden 2048, attention แบบ grouped-query ที่มี 16 หัว query และ 2 หัว KV และสถาปัตยกรรม LlamaForCausalLM มาตรฐานโดยไม่มีเคอร์เนลที่กำหนดเอง ไปป์ไลน์การฝึกเอนไปทางการเป็นเอเจนต์: การฝึกกลางทางสำหรับเอเจนต์ในระดับ 2 แสนล้าน, ชุด agent-SFT ขนาดใหญ่, การจัดแนว RL สำหรับเอเจนต์ และขั้นตอน On-Policy Distillation ขั้นสุดท้ายที่พับรวมโมเดลผู้เชี่ยวชาญ RL จำนวนสิบหกโมเดลกลับเป็นเครือข่ายเดนส์ขนาดเล็กหนึ่งเครือข่าย โดยมาพร้อมการเรียกใช้เครื่องมือแบบ XML พร้อมตัวแยกวิเคราะห์ SGLang ในตัว และคอนฟิกที่เผยแพร่กำหนดหน้าต่าง 131,072 โทเคน

• พารามิเตอร์ — Kolibri: รวม 78,103,074,560, ใช้งาน 3,457,573,120, sparsity 22.6:1 MiniCPM5-2B: รวม 2,516,756,480, ไม่ใช่ embedding 1.98B, แบบ dense

• เผยแพร่ — Kolibri: 3 ตุลาคม 2026 MiniCPM5-2B: ประกาศเมื่อ 19 กรกฎาคม 2026 น้ำหนักโมเดล 6 กันยายน 2026

• บริบท — Kolibri: 16,384 ผ่านการฝึก, 65,536 ผ่านการฝึกระยะกลาง, 262,144 เนทีฟ, 1,048,576 ผ่านการตรวจสอบ MiniCPM5-2B: 131,072 ในคอนฟิกที่จัดส่ง; คำกล่าวอ้าง 512K จากเดือนกรกฎาคมไม่มีอยู่ในนั้น

• ขนาดหน่วยความจำที่ใช้ — Kolibri: ประมาณ 78 GB ใน FP8; ต้องมีอย่างน้อย A100 80 GB สองตัว, H100 SXM5 สองตัว, H200 หนึ่งตัว, B200 หนึ่งตัว หรือ B300 หนึ่งตัว. MiniCPM5-2B: BF16 shard เดียว ระดับแล็ปท็อป

• ภาษา — Kolibri: เยอรมันและอังกฤษ โดยการออกแบบและไม่มีอย่างอื่น MiniCPM5-2B: อังกฤษและจีน โดยชุดการประเมินที่เผยแพร่ทั้งหมดเป็นภาษาอังกฤษ

• การเรียกใช้เครื่องมือ — Kolibri: สไตล์ Hermes พร้อมตัวแยกวิเคราะห์ vLLM ที่มาพร้อมในตัว MiniCPM5-2B: สไตล์ XML พร้อมตัวแยกวิเคราะห์ SGLang

• สัญญาอนุญาต — ทั้งคู่เป็น Apache 2.0 ทั้งคู่ไม่มีข้อกำหนดแนบท้ายเกี่ยวกับการใช้งานที่ยอมรับได้

A two-column comparison scoreboard titled 'Kolibri vs MiniCPM5 2B'. Left column Kolibri: Parameters 78.1B MoE / 3.46B active, Context 262,144 native / 1M validated, Footprint about 78 GB in FP8, Languages German and English, Tool calling Hermes-style with a vLLM parser, Licence Apache 2.0. Right column MiniCPM5 2B: Parameters 2.52B total / 1.98B non-embedding, Context 131,072 in the shipped config, Footprint a single BF16 shard, laptop-class, Languages English and Chinese, Tool calling XML-style with an SGLang parser, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; MiniCPM5 2B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

กระดานคะแนน และการจัดหาที่อยู่เบื้องหลัง

ไม่ว่าที่ไหน ในเอกสารของทั้งสองผู้ขาย ก็ไม่มีตัวเลขเปรียบเทียบแบบตัวต่อตัวสำหรับคู่นี้ และเราจะไม่เอาผลจากชุดทดสอบสองแบบที่ต่างกันมาประกอบเป็นตัวเลขเดียวแล้วเรียกมันว่าการเปรียบเทียบ สิ่งที่แต่ละฝ่ายเผยแพร่สมควรถูกแยกออกจากกันอย่างระมัดระวัง เพราะชุดตัวเลขทั้งสองชุดมีหลักฐานรองรับมากน้อยต่างกันมาก

ตัวเลขของ Kolibri มาจากตารางเปรียบเทียบสิบสี่โมเดลของ Aleph Alpha เอง โดยรันบนฮาร์เนสเดียวกับ Kolibri ที่ reasoning effort ระดับ high: 75.5 สำหรับค่าเฉลี่ยภาษาอังกฤษ และ 70.8 สำหรับค่าเฉลี่ยภาษาเยอรมัน ตารางนั้นไม่ได้ยกยอ subjects ของตัวเอง — Qwen3.8 27B ทำได้ 80.2 และ 79.9 บนค่าเฉลี่ยสองตัวเดียวกัน และนำใน GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified และเบนช์มาร์กบริบทยาวทั้งสองรายการ ขณะที่เปิดใช้งานพารามิเตอร์ประมาณหนึ่งในแปดของ Kolibri กรอบที่ผู้ขายวางไว้สำหรับช่องว่างนั้นคือ Pareto frontier ของคุณภาพเทียบกับจำนวนโทเค็นที่ถอดรหัสต่อวินาทีต่อ GPU ซึ่งไม่มีโมเดลใดในบรรดาที่เปรียบเทียบกันเอาชนะได้ มันเป็นข้อโต้แย้งเชิงเศรษฐศาสตร์ของการให้บริการ ไม่ใช่ข้อโต้แย้งด้านความสามารถ และยังไม่มีบุคคลที่สามรายใดวัดมัน: ไม่มีรายการของ Kolibri ใน Artificial Analysis และไม่มีการทำซ้ำฮาร์เนส

ตัวเลขของ MiniCPM5-2B มาจากโมเดลการ์ดของมันเอง: ค่าเฉลี่ยภายในที่ 53.9 จากชุดเปรียบเทียบที่ผู้ขายเลือกเอง, AIME 2025/2026 ที่ 86.5, MATH-500 ที่ 94.6 และผล 46.4 บน SWE-bench Verified ที่ผู้ขายรันเอง ซึ่งน่าทึ่งมากสำหรับโมเดล dense ขนาด 2.5 พันล้านพารามิเตอร์ ถ้ามันผ่านการทดสอบโดยอิสระได้ บนการ์ดนั้น Granite 4.2 3B ของ IBM อยู่ที่ 42.7 เทียบกับ 53.9 ของ MiniCPM5-2B — ผู้ขายรายเดียวกันรันทั้งสองโมเดลบนชุดทดสอบเดียวที่ตัวเองเลือก คนละชุดทดสอบ คนละฮาร์เนส คนละผู้ขาย ทั้งหมดนี้ไม่ใช่คำตัดสินสำหรับการจับคู่นี้

สิ่งที่มีประโยชน์จริง ๆ ในฝั่งของ MiniCPM5-2B คือการเปิดเผย OpenBMB ได้ปล่อยคลังข้อมูลการฝึก UltraData ควบคู่ไปกับน้ำหนักโมเดล — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, ชุด agent SFT และ RL — ทั้งหมดอยู่ภายใต้ Apache 2.0 ซึ่งเปลี่ยนกล่องดำให้เป็นสูตรที่คุณสามารถตรวจสอบและต่อยอดในโดเมนของคุณเองได้ โมเดลนี้ยังมาพร้อมการปรับตัวตั้งแต่ Day 0 ข้ามตระกูลชิปเก้าตระกูลผ่านชุมชน FlagOS ของ ModelBest ตั้งแต่ Huawei Ascend ไปจนถึง NVIDIA และ ARM ซึ่งเป็นคำกล่าวเกี่ยวกับการปรับใช้มากกว่าการวัดประสิทธิภาพ เมื่อเทียบกับสิ่งนั้น IBM เผยแพร่น้ำหนักของ Granite 4.2 3B และรายละเอียดทางเทคนิคของการสร้างอย่างละเอียด แต่ไม่เปิดเผยข้อมูลการฝึกของโมเดล และ Aleph Alpha เผยแพร่ไปป์ไลน์ข้อมูลและการบัญชีพลังงานของ Kolibri — โทเค็นก่อนการฝึก 20 ล้านล้านโทเค็น, 9.5×10² MWh รวมค่าใช้จ่ายส่วนเกินของศูนย์ข้อมูล และไม่รวม supervised fine-tuning และ reinforcement learning — แต่ไม่ใช่ตัวคลังข้อมูลเอง

จุดที่ความต่างของขนาดปรากฏชัดจริง ๆ

วิธีที่มีประโยชน์ที่สุดในการนำสองสิ่งนี้มาเทียบเคียงกันคือการวางบนแกนสองแกนที่กำหนดการนำไปใช้งานจริง: สิ่งที่ต้องมีอยู่ในห้อง และสิ่งที่เกิดขึ้นเมื่อโมเดลผิด

ในด้านฮาร์ดแวร์ MiniCPM5-2B เป็นผู้ชนะอย่างชัดเจน โมเดล dense ขนาด 2.52 พันล้านพารามิเตอร์ใน BF16 เพียงชาร์ดเดียวรันได้บนแล็ปท็อป อุปกรณ์ Edge หรือ GPU สำหรับผู้บริโภคเพียงตัวเดียว และการรองรับ FlagOS ทั่วเก้าตระกูลชิปหมายความว่ามันรันบนฮาร์ดแวร์ที่ไม่ใช่ตัวเร่งความเร็ว NVIDIA เลยด้วยซ้ำ ข้อกำหนดขั้นต่ำของ Kolibri คือการ์ด A100 80 GB สองใบ หรือ B200 หนึ่งใบ โดยมีน้ำหนัก FP8 ประมาณ 78 GB ให้บริการผ่านปลั๊กอิน vLLM ของ aleph-alpha-inference หรือคอนเทนเนอร์ที่เผยแพร่แล้ว สำหรับงานสมาร์ตค็อกพิตหรือภาระงานที่ใกล้เคียงกับงานบนโทรศัพท์ 2B เป็นเพียงตัวเดียวในสองตัวที่ผ่านเกณฑ์ และ Kolibri ไม่เคยถูกออกแบบมาให้แข่งขันในด้านนั้น

ในด้านความสามารถตรวจสอบยืนยันได้ Kolibri ชนะด้วยเหตุผลที่ละเอียดอ่อนกว่า ข้ออ้างที่ถูกอ้างถึงมากที่สุดของมัน — เศรษฐศาสตร์ของการให้บริการ — ยังไม่ได้รับการทดสอบ แต่ตัวเลขด้านคุณภาพของมันอย่างน้อยก็ถูกเผยแพร่เทียบกับคู่แข่งที่มีชื่อสิบสามรายบนฮาร์เนสเดียวโดยเปิดเผยการตั้งค่า และตารางของผู้ขายเองก็ยกชัยชนะในแถวส่วนใหญ่ให้ฝ่ายตรงข้าม ตัวเลขพาดหัวของ MiniCPM5-2B เป็นของผู้ขาย บนชุดทดสอบของผู้ขาย โดยไม่เปิดเผยฮาร์เนสเปรียบเทียบ และโมเดลยังแบกความไม่แน่นอนเพิ่มเติมจากเช็กพอยต์ที่เก่าหลายสัปดาห์แทนที่จะเป็นไม่กี่วัน ไม่มีโมเดลใดถูกวัดประสิทธิภาพอย่างอิสระ ความแตกต่างคือผู้ขายรายหนึ่งเขียนการเปรียบเทียบที่ทำให้โมเดลของตัวเองแพ้ และอีกรายเขียนสิ่งที่ทำให้โมเดลของตัวเองชนะอย่างท่วมท้น

โดยเจตนาแล้ว ไม่มีการแข่งขันกันเลยแม้แต่น้อย Kolibri มีไว้สำหรับการประมวลผลเอกสารภาษาเยอรมันแบบติดตั้งภายในองค์กร โดยมีโทเคไนเซอร์สองภาษา ซึ่ง Aleph Alpha รายงานว่าอยู่ที่ค่าเฉลี่ย 4.90 ไบต์ต่อโทเคนบนข้อความเว็บภาษาเยอรมัน เทียบกับ 4.35 ของ GPT-5 และ 3.28 ของ Kimi K3 — ทั้งหมดวัดโดยผู้จำหน่าย และเป็นผลต่อต้นทุนต่อโทเคนมากกว่าจะเป็นการกล่าวอ้างเรื่องคุณภาพ MiniCPM5-2B มีไว้สำหรับเอเจนต์ที่เรียกใช้เครื่องมือในภาษาอังกฤษและภาษาจีนบนฮาร์ดแวร์ที่มีข้อจำกัด ทีมที่มีสัญญาภาษาเยอรมันและข้อกำหนดด้านการปฏิบัติตามกฎระเบียบไม่ได้เลือกระหว่างสองตัวนี้

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the card header with the OpenBMB organisation and its like count, the TextGeneration, Transformers and Safetensors tags, the English and Chinese language tags, the on-device and tool-calling tags, the Apache 2.0 licence, and the model-size line reading 3B parameters in BF16 tensor type.

ความจริงของการกำหนดเส้นทาง และการทดลองที่คุ้มค่าที่จะลงมือทำ

โมเดลทั้งสองยังไม่ปรากฏอยู่ในแคตตาล็อกแบบโฮสต์ในตอนนี้ และเราได้ตรวจสอบทั้งคู่จริง ๆ แทนที่จะสันนิษฐานเอาเอง Kolibri ไม่มี SKU ของ API จากผู้จำหน่าย — สิ่งที่เผยแพร่ออกมาคือไฟล์เวต รายงานทางเทคนิค และอิมเมจคอนเทนเนอร์ — และมันก็ไม่ได้อยู่ใน OrcaRouter ด้วย เราไล่ค้นแคตตาล็อกโดยใช้ทุกรูปแบบการสะกดของคำนำหน้าผู้จำหน่ายและชื่อโมเดล แล้วผลลัพธ์คือไม่พบ ส่วน MiniCPM5-2B ก็ไม่มีปลายทางแบบโฮสต์จาก ModelBest เช่นกัน และไม่ได้ถูกจัดเส้นทางไว้กับเรา ทั้งสองเป็นข้อเสนอแบบโฮสต์เอง และเราขอเลือกที่จะบอกตามตรงมากกว่าจะทำให้เข้าใจว่าเราให้บริการตัวใดตัวหนึ่ง

จุดที่น่าสนใจอยู่ที่การทดลองนี้ โมเดลเอเจนต์ขนาด 2.5 พันล้านพารามิเตอร์กับโมเดลเอกสารขนาด 78 พันล้านพารามิเตอร์แก้ปัญหาคนละแบบ และวิธีเดียวที่จะรู้ว่าเวิร์กโหลดของคุณต้องการตัวไหน คือการรันทั้งสองตัวกับมัน ซึ่งเป็นสถานการณ์ที่เลเยอร์จัดเส้นทางถูกสร้างขึ้นมาเพื่อรองรับพอดี แม้ตัวมันเองจะไม่ได้บรรจุโมเดลทั้งสองตัวก็ตาม จงชี้เส้นทางทดสอบไปที่บิลด์ MiniCPM5-2B ที่โฮสต์เอง ผ่านเอนด์พอยต์ที่เข้ากันได้กับ OpenAI หนึ่งจุด ที่มีการสลับไปใช้ระบบสำรองอัตโนมัติ โดยปล่อยให้โปรดักชันอยู่บนโมเดลที่จัดเส้นทางและผ่านการพิสูจน์แล้ว สแตกใหม่ก็อาจค้างหรือสร้างผลลัพธ์ไร้สาระได้โดยไม่ทำให้อะไรล่ม ราคาตามรายการของผู้ให้บริการสำหรับโมเดลที่คุณนำมาเปรียบเทียบจะถูกส่งผ่านโดยไม่คิดมาร์กอัปเพิ่ม ดังนั้นการทดสอบ A/B จึงยังคงถูกและย้อนกลับได้ และหากสิ่งที่การทดลองเปิดเผยจริง ๆ คือเวิร์กโหลดภาษาเยอรมันของคุณไม่จำเป็นต้องใช้โมเดลที่โฮสต์เองทั้งสองตัวนั้น คีย์เดียวกันก็เข้าถึงระดับมิกซ์เจอร์ออฟเอกซ์เพิร์ตส์ขนาดเล็กที่จัดเส้นทางไว้แล้วได้ — ตัวแปร Gemma 4 26B-A4B ในราคา $0.06 ต่อล้านโทเคนอินพุต และ $0.33 ต่อล้านโทเคนเอาต์พุต พร้อมหน้าต่าง 262,144 โทเคน และรองรับอินพุตแบบข้อความ รูปภาพ และวิดีโอ — ซึ่งเป็นวิธีที่ถูกที่สุดในการหาคำตอบก่อนที่คุณจะซื้อ GPU สองตัว

อันไหน และอะไรจะทำให้คำตอบเปลี่ยนไป

รัน MiniCPM5-2B หากข้อจำกัดคืออุปกรณ์ ด้วยพารามิเตอร์ 2.52 พันล้านตัว มันเป็นตัวเดียวในสองตัวที่พอดีกับแล็ปท็อป ห้องนักบิน หรือกล่อง Edge และหากภาระงานของคุณคือเอเจนต์เรียกเครื่องมือแบบโต้ตอบในภาษาอังกฤษหรือภาษาจีน นั่นคือโมเดลที่มุ่งเป้าไปที่งานนี้ กันเวลาไว้เพื่อทำซ้ำตัวเลขของมันก่อน — ค่าเฉลี่ย 53.9 และคำกล่าวอ้าง SWE-bench ที่ 46.4 เป็นของ ModelBest เพียงผู้เดียว และการที่ชุดข้อมูลฝึกเปิดเผยทำให้การทำซ้ำนั้นเป็นไปได้จริง ไม่ใช่แค่ในทางทฤษฎี

รัน Kolibri หากคลังข้อมูลเป็นภาษาเยอรมัน ฮาร์ดแวร์มีอยู่ และน้ำหนักโมเดลต้องไม่ออกจากอาคาร หน้าต่างเนทีฟขนาด 262,144 โทเคน แคช KV แบบ FP8 ระดับความพยายามในการให้เหตุผลสี่ระดับ และการเรียกใช้เครื่องมือของ Hermes เป็นรูปแบบที่เหมาะสมสำหรับงานเอกสารที่มีการควบคุม และข้อกำหนด Apache 2.0 บวกกับไปป์ไลน์ข้อมูลที่เผยแพร่เป็นส่วนที่ผ่านการตรวจสอบจัดซื้อจัดจ้าง

สองสิ่งจะช่วยยุติเรื่องนี้ได้เร็วกว่าการโต้แย้งใด ๆ การรัน SWE-bench Verified แบบอิสระบน MiniCPM5-2B จะยืนยันหรือล้มข้ออ้างที่น่าประหลาดใจที่สุดเพียงข้อเดียวที่การ์ดใบใดใบหนึ่งกล่าวอ้าง และการวัดทรูพุตแบบอิสระของ Kolibri ในการกำหนดค่าสอง H100 ที่แนะนำ — หรือรายการจาก Artificial Analysis ซึ่งยังไม่มีอยู่ในปัจจุบัน — จะเปลี่ยน "พารามิเตอร์ 7.8 หมื่นล้าน" จากข้อกำหนดทางเทคนิคให้กลายเป็นต้นทุน ซึ่งเป็นตัวเลขที่ใครก็ตามที่กำลังชั่งน้ำหนักการเปรียบเทียบนี้กับฮาร์ดแวร์กำลังมองหาอยู่จริง ๆ จนกว่าจะถึงตอนนั้น ช่องว่างด้านขนาดเป็นเรื่องจริง ช่องว่างด้านวัตถุประสงค์ยิ่งใหญ่กว่า และตัวเลือกที่ดูเหมือนราคาถูกคือตัวที่แบกข้ออ้างที่ยังไม่ได้รับการยืนยันไว้

A screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the model header under Google, the 262K-token context badge, the input line reading text plus image plus video, and the community description noting 25.2B total parameters with 3.8B activated per token during inference.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube