
Kolibri vs MiniCPM5-2B: พารามิเตอร์ 78 พันล้านเทียบกับ 2.5 และทำไมตัวเล็กจึงไม่ใช่ตัวเลือกที่ประหยัด
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 217 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
วางKolibriไว้ข้าง ๆMiniCPM5-2B แล้วการอ่านโดยสัญชาตญาณก็คือว่านี่คือการเปรียบเทียบขนาด และโมเดลขนาด 2.5 พันล้านพารามิเตอร์คือตัวเลือกที่ประหยัด การอ่านแบบนั้นผิดในแบบที่ให้บทเรียน Kolibri คือโมเดล mixture-of-experts ขนาด 78.1 พันล้านพารามิเตอร์ของ Aleph Alpha เปิดตัวเมื่อวันที่ 3 ตุลาคม 2026 เปิดใช้งาน 3.46 พันล้านพารามิเตอร์ต่อโทเค็น โดยมีพื้นที่ FP8 ประมาณ 78 GB และต้องใช้การ์ด A100 80 GB สองใบเป็นคอนฟิกูเรชันขั้นต่ำในการให้บริการ MiniCPM5-2B คือโมเดล dense ขนาด 2.52 พันล้านพารามิเตอร์ของ ModelBest และ OpenBMB เปิดตัวที่งาน World Artificial Intelligence Conference เมื่อวันที่ 19 กรกฎาคม 2026 โดยมีเวตเผยแพร่บน Hugging Face เมื่อวันที่ 6 กันยายน MiniCPM5-2B มีขนาดเล็กกว่า 31 เท่าเมื่อนับตามจำนวนพารามิเตอร์ มันยังเป็นตัวที่ต้องมีงบประมาณสำหรับการประเมินก่อนที่คุณจะเชื่อถือ เพราะตัวเลขที่ถูกอ้างอิงมากที่สุดของมันมาจากการรันโดยผู้ขายและยังไม่มีการทำซ้ำ — ซึ่งเป็นสิ่งที่ตรงกันข้ามกับสิ่งที่ “โมเดลขนาดเล็ก” มักสื่อเกี่ยวกับความเสี่ยงโดยทั่วไป
ทั้งคู่เปิดตัวไปอย่างเงียบ ๆ; มีเพียงหนึ่งในนั้นที่เพิ่งเปิดตัวเมื่อเร็ว ๆ นี้
他们有相似的起源故事,但年龄相差很大,而年龄很重要。Aleph Alpha 的 Kolibri 仓库创建于 2026 年 10 月 2 日,声明的发布日期为 10 月 3 日,而该供应商自己的新闻中心公告也在当天早上发布,恰逢德国统一日。通用 AI 媒体当天基本上错过了它,这就是“安静发布”这一说法的由来,但模型卡、技术报告和供应商帖子并不是无声上线。MiniCPM5-2B 确实更安静:7 月的 WAIC 公告只是对宣传要点和规格的会议发布,真正的权重直到 9 月 6 日才出现,发布时没有启动活动,同时还附带了 GGUF、MLX、GPTQ、base、SFT 和 draft 检查点,以及支撑它们的训练语料。
ช่องว่างห้าสัปดาห์ระหว่างการประกาศกับเวตนั้นน่าจดจำ เพราะมันเป็นเหตุผลว่าทำไมตัวเลขสองชุดที่ต่างกันจึงยังถูกพูดถึงสำหรับโมเดลนี้ เอกสารเดือนกรกฎาคมโฆษว่ามีหน้าต่างบริบท 512K โทเคน ส่วนคอนฟิกที่จัดส่งจริงกำหนดไว้ที่ 131,072 อาร์ติแฟกต์ที่เผยแพร่คือสิ่งที่สำคัญ
แต่ละโมเดลใช้สำหรับอะไรจริงๆ
Kolibri ถูกสร้างขึ้นเพื่องานเอกสารภาษาเยอรมันและอังกฤษ และ Aleph Alpha ให้รายละเอียดเฉพาะเจาะจงอย่างผิดปกติว่าเหตุใดสิ่งนั้นจึงต้องใช้วิศวกรรมจริง ๆ การทดลองกับโมเดลพร็อกซีขนาดเล็กกำหนดเป้าหมายสัดส่วนภาษาเยอรมันในส่วนผสมการฝึกไว้ที่ประมาณ 20 เปอร์เซ็นต์ ซึ่งสำหรับการรันด้วยโทเคน 20 ล้านล้านโทเคนหมายถึงการต้องหาโทเคนภาษาเยอรมัน 4 ล้านล้านโทเคน ชุดข้อมูลภาษาเยอรมันแบบเปิดที่ผ่านการกำจัดข้อมูลซ้ำและกรองแล้วให้ผล 390 พันล้านโทเคน — ซึ่งขาดไปหนึ่งอันดับขนาด — ดังนั้นแล็บจึงปรับจูนตัวกรอง Common Crawl สำหรับภาษาเยอรมันโดยเฉพาะ ทำให้ได้โทเคนออร์แกนิกที่ไม่ซ้ำกัน 1.3 ล้านล้านโทเคน และนำเอกสารภาษาเยอรมันที่มีอยู่มาเขียนใหม่เป็นรายการสารานุกรม บทสนทนา และข้อความ ได้อีกประมาณหนึ่งล้านล้านโทเคน ซึ่งกลายเป็นแหล่งภาษาเยอรมันแหล่งเดียวที่ใหญ่ที่สุด การแปล ซึ่งใช้กับรุ่นก่อนหน้าอย่าง Kolibri Origin ถูกตัดออกไปสำหรับ Kolibri รายละเอียดเกี่ยวกับตัวกรองคือสิ่งที่ควรจดจำไว้: ไปป์ไลน์ข้อมูลภาษามาตรฐานจะทิ้งเอกสารที่มีคำยาวมากเกินไป และงานเขียนเชิงบริหารราชการภาษาเยอรมันมักเกินขีดจำกัดค่าเฉลี่ยความยาวคำของภาษาอังกฤษเป็นประจำ ดังนั้นการตั้งค่าเริ่มต้นจึงลบระดับภาษาที่ภาครัฐใช้เขียนออกไปอย่างเงียบ ๆ
MiniCPM5-2B ถูกสร้างขึ้นสำหรับปลายทางตรงกันข้าม — เอเจนต์บนอุปกรณ์ การ์ดโมเดลระบุถึงทรานส์ฟอร์เมอร์แบบเดนส์ที่มีพารามิเตอร์รวม 2.52 พันล้านตัว, 1.98 พันล้านตัวที่ไม่ใช่ embedding, 42 ชั้นที่ขนาด hidden 2048, attention แบบ grouped-query ที่มี 16 หัว query และ 2 หัว KV และสถาปัตยกรรม LlamaForCausalLM มาตรฐานโดยไม่มีเคอร์เนลที่กำหนดเอง ไปป์ไลน์การฝึกเอนไปทางการเป็นเอเจนต์: การฝึกกลางทางสำหรับเอเจนต์ในระดับ 2 แสนล้าน, ชุด agent-SFT ขนาดใหญ่, การจัดแนว RL สำหรับเอเจนต์ และขั้นตอน On-Policy Distillation ขั้นสุดท้ายที่พับรวมโมเดลผู้เชี่ยวชาญ RL จำนวนสิบหกโมเดลกลับเป็นเครือข่ายเดนส์ขนาดเล็กหนึ่งเครือข่าย โดยมาพร้อมการเรียกใช้เครื่องมือแบบ XML พร้อมตัวแยกวิเคราะห์ SGLang ในตัว และคอนฟิกที่เผยแพร่กำหนดหน้าต่าง 131,072 โทเคน
• พารามิเตอร์ — Kolibri: รวม 78,103,074,560, ใช้งาน 3,457,573,120, sparsity 22.6:1 MiniCPM5-2B: รวม 2,516,756,480, ไม่ใช่ embedding 1.98B, แบบ dense
• เผยแพร่ — Kolibri: 3 ตุลาคม 2026 MiniCPM5-2B: ประกาศเมื่อ 19 กรกฎาคม 2026 น้ำหนักโมเดล 6 กันยายน 2026
• บริบท — Kolibri: 16,384 ผ่านการฝึก, 65,536 ผ่านการฝึกระยะกลาง, 262,144 เนทีฟ, 1,048,576 ผ่านการตรวจสอบ MiniCPM5-2B: 131,072 ในคอนฟิกที่จัดส่ง; คำกล่าวอ้าง 512K จากเดือนกรกฎาคมไม่มีอยู่ในนั้น
• ขนาดหน่วยความจำที่ใช้ — Kolibri: ประมาณ 78 GB ใน FP8; ต้องมีอย่างน้อย A100 80 GB สองตัว, H100 SXM5 สองตัว, H200 หนึ่งตัว, B200 หนึ่งตัว หรือ B300 หนึ่งตัว. MiniCPM5-2B: BF16 shard เดียว ระดับแล็ปท็อป
• ภาษา — Kolibri: เยอรมันและอังกฤษ โดยการออกแบบและไม่มีอย่างอื่น MiniCPM5-2B: อังกฤษและจีน โดยชุดการประเมินที่เผยแพร่ทั้งหมดเป็นภาษาอังกฤษ
• การเรียกใช้เครื่องมือ — Kolibri: สไตล์ Hermes พร้อมตัวแยกวิเคราะห์ vLLM ที่มาพร้อมในตัว MiniCPM5-2B: สไตล์ XML พร้อมตัวแยกวิเคราะห์ SGLang
• สัญญาอนุญาต — ทั้งคู่เป็น Apache 2.0 ทั้งคู่ไม่มีข้อกำหนดแนบท้ายเกี่ยวกับการใช้งานที่ยอมรับได้

กระดานคะแนน และการจัดหาที่อยู่เบื้องหลัง
ไม่ว่าที่ไหน ในเอกสารของทั้งสองผู้ขาย ก็ไม่มีตัวเลขเปรียบเทียบแบบตัวต่อตัวสำหรับคู่นี้ และเราจะไม่เอาผลจากชุดทดสอบสองแบบที่ต่างกันมาประกอบเป็นตัวเลขเดียวแล้วเรียกมันว่าการเปรียบเทียบ สิ่งที่แต่ละฝ่ายเผยแพร่สมควรถูกแยกออกจากกันอย่างระมัดระวัง เพราะชุดตัวเลขทั้งสองชุดมีหลักฐานรองรับมากน้อยต่างกันมาก
ตัวเลขของ Kolibri มาจากตารางเปรียบเทียบสิบสี่โมเดลของ Aleph Alpha เอง โดยรันบนฮาร์เนสเดียวกับ Kolibri ที่ reasoning effort ระดับ high: 75.5 สำหรับค่าเฉลี่ยภาษาอังกฤษ และ 70.8 สำหรับค่าเฉลี่ยภาษาเยอรมัน ตารางนั้นไม่ได้ยกยอ subjects ของตัวเอง — Qwen3.8 27B ทำได้ 80.2 และ 79.9 บนค่าเฉลี่ยสองตัวเดียวกัน และนำใน GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified และเบนช์มาร์กบริบทยาวทั้งสองรายการ ขณะที่เปิดใช้งานพารามิเตอร์ประมาณหนึ่งในแปดของ Kolibri กรอบที่ผู้ขายวางไว้สำหรับช่องว่างนั้นคือ Pareto frontier ของคุณภาพเทียบกับจำนวนโทเค็นที่ถอดรหัสต่อวินาทีต่อ GPU ซึ่งไม่มีโมเดลใดในบรรดาที่เปรียบเทียบกันเอาชนะได้ มันเป็นข้อโต้แย้งเชิงเศรษฐศาสตร์ของการให้บริการ ไม่ใช่ข้อโต้แย้งด้านความสามารถ และยังไม่มีบุคคลที่สามรายใดวัดมัน: ไม่มีรายการของ Kolibri ใน Artificial Analysis และไม่มีการทำซ้ำฮาร์เนส
ตัวเลขของ MiniCPM5-2B มาจากโมเดลการ์ดของมันเอง: ค่าเฉลี่ยภายในที่ 53.9 จากชุดเปรียบเทียบที่ผู้ขายเลือกเอง, AIME 2025/2026 ที่ 86.5, MATH-500 ที่ 94.6 และผล 46.4 บน SWE-bench Verified ที่ผู้ขายรันเอง ซึ่งน่าทึ่งมากสำหรับโมเดล dense ขนาด 2.5 พันล้านพารามิเตอร์ ถ้ามันผ่านการทดสอบโดยอิสระได้ บนการ์ดนั้น Granite 4.2 3B ของ IBM อยู่ที่ 42.7 เทียบกับ 53.9 ของ MiniCPM5-2B — ผู้ขายรายเดียวกันรันทั้งสองโมเดลบนชุดทดสอบเดียวที่ตัวเองเลือก คนละชุดทดสอบ คนละฮาร์เนส คนละผู้ขาย ทั้งหมดนี้ไม่ใช่คำตัดสินสำหรับการจับคู่นี้
สิ่งที่มีประโยชน์จริง ๆ ในฝั่งของ MiniCPM5-2B คือการเปิดเผย OpenBMB ได้ปล่อยคลังข้อมูลการฝึก UltraData ควบคู่ไปกับน้ำหนักโมเดล — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, ชุด agent SFT และ RL — ทั้งหมดอยู่ภายใต้ Apache 2.0 ซึ่งเปลี่ยนกล่องดำให้เป็นสูตรที่คุณสามารถตรวจสอบและต่อยอดในโดเมนของคุณเองได้ โมเดลนี้ยังมาพร้อมการปรับตัวตั้งแต่ Day 0 ข้ามตระกูลชิปเก้าตระกูลผ่านชุมชน FlagOS ของ ModelBest ตั้งแต่ Huawei Ascend ไปจนถึง NVIDIA และ ARM ซึ่งเป็นคำกล่าวเกี่ยวกับการปรับใช้มากกว่าการวัดประสิทธิภาพ เมื่อเทียบกับสิ่งนั้น IBM เผยแพร่น้ำหนักของ Granite 4.2 3B และรายละเอียดทางเทคนิคของการสร้างอย่างละเอียด แต่ไม่เปิดเผยข้อมูลการฝึกของโมเดล และ Aleph Alpha เผยแพร่ไปป์ไลน์ข้อมูลและการบัญชีพลังงานของ Kolibri — โทเค็นก่อนการฝึก 20 ล้านล้านโทเค็น, 9.5×10² MWh รวมค่าใช้จ่ายส่วนเกินของศูนย์ข้อมูล และไม่รวม supervised fine-tuning และ reinforcement learning — แต่ไม่ใช่ตัวคลังข้อมูลเอง
จุดที่ความต่างของขนาดปรากฏชัดจริง ๆ
วิธีที่มีประโยชน์ที่สุดในการนำสองสิ่งนี้มาเทียบเคียงกันคือการวางบนแกนสองแกนที่กำหนดการนำไปใช้งานจริง: สิ่งที่ต้องมีอยู่ในห้อง และสิ่งที่เกิดขึ้นเมื่อโมเดลผิด
ในด้านฮาร์ดแวร์ MiniCPM5-2B เป็นผู้ชนะอย่างชัดเจน โมเดล dense ขนาด 2.52 พันล้านพารามิเตอร์ใน BF16 เพียงชาร์ดเดียวรันได้บนแล็ปท็อป อุปกรณ์ Edge หรือ GPU สำหรับผู้บริโภคเพียงตัวเดียว และการรองรับ FlagOS ทั่วเก้าตระกูลชิปหมายความว่ามันรันบนฮาร์ดแวร์ที่ไม่ใช่ตัวเร่งความเร็ว NVIDIA เลยด้วยซ้ำ ข้อกำหนดขั้นต่ำของ Kolibri คือการ์ด A100 80 GB สองใบ หรือ B200 หนึ่งใบ โดยมีน้ำหนัก FP8 ประมาณ 78 GB ให้บริการผ่านปลั๊กอิน vLLM ของ aleph-alpha-inference หรือคอนเทนเนอร์ที่เผยแพร่แล้ว สำหรับงานสมาร์ตค็อกพิตหรือภาระงานที่ใกล้เคียงกับงานบนโทรศัพท์ 2B เป็นเพียงตัวเดียวในสองตัวที่ผ่านเกณฑ์ และ Kolibri ไม่เคยถูกออกแบบมาให้แข่งขันในด้านนั้น
ในด้านความสามารถตรวจสอบยืนยันได้ Kolibri ชนะด้วยเหตุผลที่ละเอียดอ่อนกว่า ข้ออ้างที่ถูกอ้างถึงมากที่สุดของมัน — เศรษฐศาสตร์ของการให้บริการ — ยังไม่ได้รับการทดสอบ แต่ตัวเลขด้านคุณภาพของมันอย่างน้อยก็ถูกเผยแพร่เทียบกับคู่แข่งที่มีชื่อสิบสามรายบนฮาร์เนสเดียวโดยเปิดเผยการตั้งค่า และตารางของผู้ขายเองก็ยกชัยชนะในแถวส่วนใหญ่ให้ฝ่ายตรงข้าม ตัวเลขพาดหัวของ MiniCPM5-2B เป็นของผู้ขาย บนชุดทดสอบของผู้ขาย โดยไม่เปิดเผยฮาร์เนสเปรียบเทียบ และโมเดลยังแบกความไม่แน่นอนเพิ่มเติมจากเช็กพอยต์ที่เก่าหลายสัปดาห์แทนที่จะเป็นไม่กี่วัน ไม่มีโมเดลใดถูกวัดประสิทธิภาพอย่างอิสระ ความแตกต่างคือผู้ขายรายหนึ่งเขียนการเปรียบเทียบที่ทำให้โมเดลของตัวเองแพ้ และอีกรายเขียนสิ่งที่ทำให้โมเดลของตัวเองชนะอย่างท่วมท้น
โดยเจตนาแล้ว ไม่มีการแข่งขันกันเลยแม้แต่น้อย Kolibri มีไว้สำหรับการประมวลผลเอกสารภาษาเยอรมันแบบติดตั้งภายในองค์กร โดยมีโทเคไนเซอร์สองภาษา ซึ่ง Aleph Alpha รายงานว่าอยู่ที่ค่าเฉลี่ย 4.90 ไบต์ต่อโทเคนบนข้อความเว็บภาษาเยอรมัน เทียบกับ 4.35 ของ GPT-5 และ 3.28 ของ Kimi K3 — ทั้งหมดวัดโดยผู้จำหน่าย และเป็นผลต่อต้นทุนต่อโทเคนมากกว่าจะเป็นการกล่าวอ้างเรื่องคุณภาพ MiniCPM5-2B มีไว้สำหรับเอเจนต์ที่เรียกใช้เครื่องมือในภาษาอังกฤษและภาษาจีนบนฮาร์ดแวร์ที่มีข้อจำกัด ทีมที่มีสัญญาภาษาเยอรมันและข้อกำหนดด้านการปฏิบัติตามกฎระเบียบไม่ได้เลือกระหว่างสองตัวนี้

ความจริงของการกำหนดเส้นทาง และการทดลองที่คุ้มค่าที่จะลงมือทำ
โมเดลทั้งสองยังไม่ปรากฏอยู่ในแคตตาล็อกแบบโฮสต์ในตอนนี้ และเราได้ตรวจสอบทั้งคู่จริง ๆ แทนที่จะสันนิษฐานเอาเอง Kolibri ไม่มี SKU ของ API จากผู้จำหน่าย — สิ่งที่เผยแพร่ออกมาคือไฟล์เวต รายงานทางเทคนิค และอิมเมจคอนเทนเนอร์ — และมันก็ไม่ได้อยู่ใน OrcaRouter ด้วย เราไล่ค้นแคตตาล็อกโดยใช้ทุกรูปแบบการสะกดของคำนำหน้าผู้จำหน่ายและชื่อโมเดล แล้วผลลัพธ์คือไม่พบ ส่วน MiniCPM5-2B ก็ไม่มีปลายทางแบบโฮสต์จาก ModelBest เช่นกัน และไม่ได้ถูกจัดเส้นทางไว้กับเรา ทั้งสองเป็นข้อเสนอแบบโฮสต์เอง และเราขอเลือกที่จะบอกตามตรงมากกว่าจะทำให้เข้าใจว่าเราให้บริการตัวใดตัวหนึ่ง
จุดที่น่าสนใจอยู่ที่การทดลองนี้ โมเดลเอเจนต์ขนาด 2.5 พันล้านพารามิเตอร์กับโมเดลเอกสารขนาด 78 พันล้านพารามิเตอร์แก้ปัญหาคนละแบบ และวิธีเดียวที่จะรู้ว่าเวิร์กโหลดของคุณต้องการตัวไหน คือการรันทั้งสองตัวกับมัน ซึ่งเป็นสถานการณ์ที่เลเยอร์จัดเส้นทางถูกสร้างขึ้นมาเพื่อรองรับพอดี แม้ตัวมันเองจะไม่ได้บรรจุโมเดลทั้งสองตัวก็ตาม จงชี้เส้นทางทดสอบไปที่บิลด์ MiniCPM5-2B ที่โฮสต์เอง ผ่านเอนด์พอยต์ที่เข้ากันได้กับ OpenAI หนึ่งจุด ที่มีการสลับไปใช้ระบบสำรองอัตโนมัติ โดยปล่อยให้โปรดักชันอยู่บนโมเดลที่จัดเส้นทางและผ่านการพิสูจน์แล้ว สแตกใหม่ก็อาจค้างหรือสร้างผลลัพธ์ไร้สาระได้โดยไม่ทำให้อะไรล่ม ราคาตามรายการของผู้ให้บริการสำหรับโมเดลที่คุณนำมาเปรียบเทียบจะถูกส่งผ่านโดยไม่คิดมาร์กอัปเพิ่ม ดังนั้นการทดสอบ A/B จึงยังคงถูกและย้อนกลับได้ และหากสิ่งที่การทดลองเปิดเผยจริง ๆ คือเวิร์กโหลดภาษาเยอรมันของคุณไม่จำเป็นต้องใช้โมเดลที่โฮสต์เองทั้งสองตัวนั้น คีย์เดียวกันก็เข้าถึงระดับมิกซ์เจอร์ออฟเอกซ์เพิร์ตส์ขนาดเล็กที่จัดเส้นทางไว้แล้วได้ — ตัวแปร Gemma 4 26B-A4B ในราคา $0.06 ต่อล้านโทเคนอินพุต และ $0.33 ต่อล้านโทเคนเอาต์พุต พร้อมหน้าต่าง 262,144 โทเคน และรองรับอินพุตแบบข้อความ รูปภาพ และวิดีโอ — ซึ่งเป็นวิธีที่ถูกที่สุดในการหาคำตอบก่อนที่คุณจะซื้อ GPU สองตัว
อันไหน และอะไรจะทำให้คำตอบเปลี่ยนไป
รัน MiniCPM5-2B หากข้อจำกัดคืออุปกรณ์ ด้วยพารามิเตอร์ 2.52 พันล้านตัว มันเป็นตัวเดียวในสองตัวที่พอดีกับแล็ปท็อป ห้องนักบิน หรือกล่อง Edge และหากภาระงานของคุณคือเอเจนต์เรียกเครื่องมือแบบโต้ตอบในภาษาอังกฤษหรือภาษาจีน นั่นคือโมเดลที่มุ่งเป้าไปที่งานนี้ กันเวลาไว้เพื่อทำซ้ำตัวเลขของมันก่อน — ค่าเฉลี่ย 53.9 และคำกล่าวอ้าง SWE-bench ที่ 46.4 เป็นของ ModelBest เพียงผู้เดียว และการที่ชุดข้อมูลฝึกเปิดเผยทำให้การทำซ้ำนั้นเป็นไปได้จริง ไม่ใช่แค่ในทางทฤษฎี
รัน Kolibri หากคลังข้อมูลเป็นภาษาเยอรมัน ฮาร์ดแวร์มีอยู่ และน้ำหนักโมเดลต้องไม่ออกจากอาคาร หน้าต่างเนทีฟขนาด 262,144 โทเคน แคช KV แบบ FP8 ระดับความพยายามในการให้เหตุผลสี่ระดับ และการเรียกใช้เครื่องมือของ Hermes เป็นรูปแบบที่เหมาะสมสำหรับงานเอกสารที่มีการควบคุม และข้อกำหนด Apache 2.0 บวกกับไปป์ไลน์ข้อมูลที่เผยแพร่เป็นส่วนที่ผ่านการตรวจสอบจัดซื้อจัดจ้าง
สองสิ่งจะช่วยยุติเรื่องนี้ได้เร็วกว่าการโต้แย้งใด ๆ การรัน SWE-bench Verified แบบอิสระบน MiniCPM5-2B จะยืนยันหรือล้มข้ออ้างที่น่าประหลาดใจที่สุดเพียงข้อเดียวที่การ์ดใบใดใบหนึ่งกล่าวอ้าง และการวัดทรูพุตแบบอิสระของ Kolibri ในการกำหนดค่าสอง H100 ที่แนะนำ — หรือรายการจาก Artificial Analysis ซึ่งยังไม่มีอยู่ในปัจจุบัน — จะเปลี่ยน "พารามิเตอร์ 7.8 หมื่นล้าน" จากข้อกำหนดทางเทคนิคให้กลายเป็นต้นทุน ซึ่งเป็นตัวเลขที่ใครก็ตามที่กำลังชั่งน้ำหนักการเปรียบเทียบนี้กับฮาร์ดแวร์กำลังมองหาอยู่จริง ๆ จนกว่าจะถึงตอนนั้น ช่องว่างด้านขนาดเป็นเรื่องจริง ช่องว่างด้านวัตถุประสงค์ยิ่งใหญ่กว่า และตัวเลือกที่ดูเหมือนราคาถูกคือตัวที่แบกข้ออ้างที่ยังไม่ได้รับการยืนยันไว้

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
