
Kolibri vs Granite 4.2 3B: การเดิมพันสแปร์ซิตี้ 78B และโมเดล 3B ที่ปฏิเสธที่จะเล่นเกมเดียวกัน
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 217 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
วาง Kolibri และ Granite 4.2 3B ไว้ข้างๆ กัน และข้อสังเกตแรกที่ซื่อสัตย์ก็คือ นี่ไม่ใช่การต่อสู้ที่ยุติธรรม และไม่เป็นไปในทิศทางที่คุณคิด Kolibri เป็นโมเดล mixture-of-experts ขนาด 78.1 พันล้านพารามิเตอร์ของ Aleph Alpha เปิดตัวเมื่อวันที่ 3 ตุลาคม 2026 เปิดใช้งาน 3.46 พันล้านพารามิเตอร์ต่อโทเค็น Granite 4.2 3B เป็นโมเดลให้เหตุผลแบบ dense ขนาดประมาณสามพันล้านพารามิเตอร์ของ IBM ซึ่งน้ำหนักของโมเดลไปถึง Hugging Face เมื่อวันที่ 7 สิงหาคม 2026 โดยมี model card และบล็อกทางเทคนิคตามมาในวันที่ 25 สิงหาคม หนึ่งในนั้นมีจำนวนพารามิเตอร์รวมมากกว่าอีกหนึ่งถึงยี่สิบหกเท่า เหตุผลที่ทั้งสองอยู่ในการตัดสินใจเดียวกันคือ ทั้งคู่เป็น Apache 2.0, ทั้งคู่เป็นแบบ text-only, ทั้งคู่ถูกออกแบบมาให้ self-hosted และทั้งคู่มุ่งเป้าไปที่ผู้ซื้อรายเดียวกัน: ทีมที่ต้องการ document intelligence บนฮาร์ดแวร์ที่ควบคุมเอง โดยมี provenance ที่จะผ่านการตรวจสอบจัดซื้อจัดจ้าง คำถามที่น่าสนใจไม่ใช่ว่าอันไหนดีกว่า แต่เป็นว่างบประมาณพารามิเตอร์ที่มากกว่ายี่สิบหกเท่านั้นซื้ออะไรได้จริง และมีค่าใช้จ่ายในการแบกรับเท่าไหร่
ความไม่สอดคล้องกัน กล่าวอย่างตรงไปตรงมา
Granite 4.2 3B เป็นโมเดล dense แบบสแตนด์อโลนที่ผ่านการฝึกแบบ post-trained จาก Granite-4.1-3B-Base ซึ่งเป็นส่วนหนึ่งของตระกูล Granite 4.2 ที่ IBM เปิดตัวจนถึงเดือนสิงหาคม โมเดลนี้มี 40 เลเยอร์พร้อม grouped-query attention, บริบทเนทีฟ 128K ที่ IBM ขยายเป็น 512K ในเฟส pre-training ครั้งที่ห้า และโหมดการคิดต่อหนึ่งคำถามสามแบบ: โหมดคิดเต็มเป็นค่าเริ่มต้น, เส้นทางที่ใช้ความพยายามต่ำ และเส้นทางที่ไม่คิด การ์ดของ IBM ตรงไปตรงมาอย่างผิดปกติเกี่ยวกับสิ่งที่ 3B ไม่ใช่ ต่างจากรุ่นพี่น้อง 8B และ 30B โมเดลนี้จงใจข้ามบล็อกการเรียนรู้แบบเสริมกำลังเชิงตัวแทน (agentic reinforcement learning) เฉพาะทางที่ฝึกในสภาพแวดล้อม SWE-agent, เทอร์มินัล และการค้นหา ซึ่งเป็นเหตุผลว่าทำไม IBM จึงไม่ระบุตัวเลข SWE-bench สำหรับโมเดลนี้เลย และวางตำแหน่งโมเดลนี้ว่าเป็นผู้เชี่ยวชาญด้านการใช้เหตุผลมากกว่าจะเป็นเอเจนต์
Kolibri ไปในทิศทางตรงกันข้ามในทุกแกน ห้าสิบเลเยอร์ ทุกเลเยอร์เป็น mixture-of-experts ผู้เชี่ยวชาญ 384 คนต่อเลเยอร์ โดยมีหนึ่งแบบใช้ร่วมกันและหกแบบกำหนดเส้นทาง และอัตราส่วนความเบาบางประมาณ 22.6 ต่อ 1 บริบทของมันเป็น 262,144 โทเค็นโดยธรรมชาติ ตรวจสอบแล้วถึง 1,048,576 โดยการ์ดแนะนำให้คุณอยู่ที่หรือต่ำกว่า 262,144 สำหรับงานที่ไวต่อเวลา ระดับความพยายามในการให้เหตุผลสี่ระดับ การเรียกใช้เครื่องมือแบบ Hermes พร้อมตัวแยกวิเคราะห์ vLLM ที่จัดส่งในที่เก็บเดียวกันกับน้ำหนัก และมีขนาดประมาณ 78 GB ใน FP8 โดยการกำหนดค่าขั้นต่ำของการ์ดคือการ์ด A100 80 GB สองใบ, H100 SXM5 สองใบ, H200 หนึ่งใบ, B200 หนึ่งใบ หรือ B300 หนึ่งใบ
• พารามิเตอร์ — Kolibri: 78,103,074,560 ทั้งหมด, 3,457,573,120 ที่ใช้งานต่อโทเคน Granite 4.2 3B: ประมาณ 3B แบบ dense, พารามิเตอร์ทั้งหมดทำงานในทุกโทเคน
• บริบท — Kolibri: 16,384 ผ่านการฝึก, 65,536 ฝึกระดับกลาง, 262,144 เนทีฟ, 1,048,576 ผ่านการตรวจสอบแล้ว Granite 4.2 3B: 128K เนทีฟ, ขยายถึง 512K
• โหมดการคิด — Kolibri: ไม่มี, ต่ำ, กลาง, สูง, ตั้งค่าผ่านเทมเพลตแชต Granite 4.2 3B: เต็ม, ใช้ความพยายามต่ำ และไม่คิด, ต่อคำถาม
• การเรียกใช้เครื่องมือ — Kolibri: สไตล์ Hermes พร้อมตัวแยกวิเคราะห์ที่มีมาให้แล้ว Granite 4.2 3B: ใช่ แต่ไม่ใช่เส้นทางที่ฝึกด้วย agentic RL แบบที่รุ่นพี่ที่ใหญ่กว่าได้รับ
• ภาษา — Kolibri: เยอรมันและอังกฤษ โดยการออกแบบและไม่มีภาษาอื่น Granite 4.2 3B: ให้ความสำคัญกับภาษาอังกฤษเป็นอันดับแรก โดยมีเบื้องหลังเป็นการฝึกอบรมหลายภาษาที่กว้างขวางยิ่งขึ้นของ IBM
• ขนาดหน่วยความจำ — Kolibri: ประมาณ 78 GB ใน FP8 ต้องใช้ GPU อย่างน้อยสองตัว Granite 4.2 3B: ประมาณ 6–8 GB ใน bfloat16, ต่ำกว่า 2 GB เมื่อทำ quantization, ระดับแล็ปท็อป
• สัญญาอนุญาต — ทั้งคู่ใช้ Apache 2.0 ทั้งคู่ไม่มีข้อกำหนดเพิ่มเติมว่าด้วยการใช้งานที่ยอมรับได้ หรือเกณฑ์จำนวนผู้ใช้ที่ใช้งานต่อเดือน
• การให้บริการ — Kolibri: ปลั๊กอิน vLLM ของ aleph-alpha-inference หรืออิมเมจคอนเทนเนอร์ที่เผยแพร่แล้ว Granite 4.2 3B: vLLM, SGLang, Transformers, GGUF และ Ollama ภายใต้ granite4.2:3b

สิ่งที่พารามิเตอร์เพิ่มอีก 75 พันล้านตัวมอบให้
สามเรื่อง และเป็นเรื่องที่ควรระบุให้ชัดเจนว่าเรื่องใดในนั้นเป็นสิ่งที่ยืนยันแล้ว และเรื่องใดเป็นเพียงข้อกล่าวอ้าง
อย่างแรกคือภาษาเยอรมัน นี่คือความแตกต่างที่แท้จริงและชัดเจนที่สุดระหว่างสองโมเดล และไม่ใช่แถวในตาราง benchmark Aleph Alpha สร้าง Kolibri โดยใช้คลังข้อมูลสองภาษาคือเยอรมัน-อังกฤษเป็นแกนหลัก โดยตั้งเป้าไว้ว่าประมาณ 20 เปอร์เซ็นต์จะเป็นภาษาเยอรมันในการรันพรีเทรนที่มีโทเคน 20 ล้านล้านโทเคน และจบลงด้วยคลังภาษาเยอรมันขนาด 2.4 ล้านล้านโทเคน ซึ่ง 80 เปอร์เซ็นต์ของคลังนั้นเป็นข้อมูลที่ห้องแล็บคัดสรรหรือสร้างขึ้นเอง การ์ดอธิบายว่าทำไมเรื่องนั้นถึงต้องใช้ความพยายาม: ชุดข้อมูลภาษาเยอรมันแบบเปิดที่ผ่านการตัดข้อมูลซ้ำมีให้เพียง 390 พันล้านโทเคน ซึ่งขาดไปหนึ่งอันดับขนาด ดังนั้นห้องแล็บจึงปรับแต่งตัวกรอง Common Crawl สำหรับภาษาเยอรมันโดยเฉพาะ และเขียนเอกสารภาษาเยอรมันที่มีอยู่ใหม่ให้เป็นรายการสารานุกรม บทสนทนา และข้อความตอน รายละเอียดเกี่ยวกับตัวกรองคือสิ่งที่ควรจดจำ ไปป์ไลน์ข้อมูลภาษามาตรฐานจะตัดเอกสารที่มีคำยาวมากเกินไปออก และร้อยแก้วเชิงบริหารของเยอรมันมักเกินขอบเขตความยาวคำเฉลี่ยของภาษาอังกฤษ — ดังนั้นการตั้งค่าเริ่มต้นจึงลบรูปแบบภาษาที่หน่วยงานราชการใช้เขียนโดยไม่รู้ตัว IBM ไม่ได้สร้าง Granite สำหรับคลังข้อมูลนั้น Granite 4.2 3B จะรองรับภาษาเยอรมันได้ มันไม่ได้ถูกออกแบบโดยอิงกับรูปแบบภาษากฎหมายและการบริหารของเยอรมัน และไม่มี leaderboard ใดจะบอกความแตกต่างนี้ให้คุณได้
อย่างที่สองคือบริบทยาวที่ยังใช้งานได้กับเอกสารจริง เพดาน 512K ของ Granite นั้นใหญ่จริง แต่ทั้งสองโมเดลไปถึงจุดนั้นด้วยวิธีที่ต่างกัน และการออกแบบตำแหน่งของ Kolibri ก็เป็นข้อโต้แย้งเรื่องบริบทยาวที่เป็นแบบแผนมากกว่า จงมองตัวเลข RULER ของ IBM — 67.52 ที่ 64K และ 55.30 ที่ 128K ในเอกสารเผยแพร่ของตระกูล 4.2 — ว่าเป็นการเปิดเผยอย่างตรงไปตรงมาว่าคุณภาพการดึงข้อมูลเสื่อมลงมากแค่ไหนเมื่อถึง 128K และจำไว้ว่า Kolibri ไม่มีเส้นโค้งการเสื่อมคุณภาพที่เผยแพร่เทียบเท่าเลยแม้แต่เส้นเดียว
ข้อที่สามคือศักยภาพการให้เหตุผลแบบดิบที่เหลืออยู่ และนี่คือจุดที่คำตอบที่ตรงไปตรงมาคือ “ไม่มากเท่าที่อัตราส่วนพารามิเตอร์บ่งชี้” ไปป์ไลน์การฝึกของ Kolibri ทำให้มันได้การรันพรีเทรน 20 ล้านล้านโทเคนบน NVIDIA B200 จำนวน 768 ตัวเป็นเวลา 21 วัน และตารางเปรียบเทียบของ Aleph Alpha เอง โดยให้ Kolibri ที่ reasoning effort สูง อยู่ที่ 75.5 ในค่าเฉลี่ยภาษาอังกฤษ และ 70.8 ในค่าเฉลี่ยภาษาเยอรมันของการเปรียบเทียบสิบสี่โมเดล — ซึ่งมันแพ้โมเดลแบบ dense ขนาด 27 พันล้านพารามิเตอร์จาก Alibaba ในแถวส่วนใหญ่ ข้ออ้างหลักของ Granite 4.2 3B เป็นของตัวเอง: AIME 2025 ที่ 78.33, GPQA ที่ 54.80, LiveCodeBench v6 ที่ 69.71 และ MMLU-Pro ที่ 67.84 ทั้งหมดเป็นตัวเลขที่ IBM รายงานและยังไม่มีการทำซ้ำ ชุดทดสอบต่างกัน ฮาร์เนสต่างกัน ผู้จำหน่ายต่างกัน ไม่มีตัวเลขที่ใช้ฮาร์เนสเดียวกันสำหรับการจับคู่นี้ที่ไหนเลย และเราจะไม่ประดิษฐ์ตัวเลขขึ้นมา
จุดที่แต่ละตัวชนะจริง ๆ
รัน Granite 4.2 3B หากข้อจำกัดของคุณคือตัวเครื่อง ที่ขนาด 6–8 GB ใน bfloat16 หรือต่ำกว่า 2 GB เมื่อทำควอนไทซ์ มันพอดีกับแล็ปท็อป, GPU ของเวิร์กสเตชันเครื่องเดียว หรือกล่องเอดจ์แบบแยกเครือข่ายที่ไม่มีวันได้เห็น H100 สองตัว มันให้บริการผ่านรันไทม์ที่แตกต่างกันห้าแบบ รวมถึง Ollama และ GGUF ซึ่งสำคัญเมื่อเป้าหมายการติดตั้งใช้งานคือแล็ปท็อปของคนอื่น ไม่ใช่แร็คของคุณเอง และโมเดลการ์ดของมันน่าเชื่อถือเป็นพิเศษก็เพราะ IBM ได้เขียนบันทึกไว้อย่างชัดเจนว่ามันละเว้นสิ่งใดไป ผู้ขายรายหนึ่งที่ปฏิเสธที่จะอ้างผลลัพธ์ SWE-bench สำหรับโมเดลขนาด 3B กำลังบอกคุณว่าโมเดลไปถึงขีดจำกัดตรงไหน
รัน Kolibri หากคลังข้อมูลคือประเด็นหลักและฮาร์ดแวร์มีพร้อม ทีมที่มีสัญญาภาษาเยอรมัน เอกสารทางเทคนิค หรือเอกสารทางราชการ มีโหนดสอง GPU อยู่แล้ว และมีข้อกำหนดว่าน้ำหนักโมเดลต้องไม่ออกจากอาคารเลย คือกลุ่มเป้าหมายที่รีลีสนี้ถูกออกแบบมาเพื่อโดยเฉพาะ หน้าต่างเนทีฟ 262,144 โทเคน, FP8 KV cache, ระดับความพยายามสี่ระดับ และเส้นทางการเรียกใช้เครื่องมือของ Hermes ล้วนชี้ไปที่เวิร์กโฟลว์เอกสารมากกว่าการแชต โทเคนไนเซอร์สองภาษาก็เป็นส่วนหนึ่งของข้อโต้แย้งเดียวกัน: Aleph Alpha รายงานค่าเฉลี่ย 4.90 ไบต์ต่อโทเคนบนข้อความเว็บภาษาเยอรมัน เทียบกับ 4.35 สำหรับ GPT-5 และ 3.28 สำหรับ Kimi K3 ทั้งหมดวัดโดยผู้ขายบนคลังข้อมูลของผู้ขายเอง และการได้อักขระต่อโทเคนมากขึ้นเป็นผลโดยตรงต่อต้นทุนการอนุมาน ไม่ใช่คะแนน หากข้อนี้เป็นจริง มันจะทบต้นไปในทุกหน้าที่คุณประมวลผล
ความไม่สมมาตรที่ไม่มีใครโฆษณาก็คือข้อมูล IBM เผยแพร่เวตของ Granite 4.2 3B และคำอธิบายทางเทคนิคโดยละเอียดเกี่ยวกับวิธีการสร้างโมเดล แต่ไม่ได้เผยแพร่ข้อมูลการฝึก Aleph Alpha เผยแพร่ไปป์ไลน์ แหล่งที่มาของข้อมูล และตัวเลขพลังงาน ควบคู่ไปกับเวตของ Kolibri — 20 ล้านล้านโทเคนก่อนการฝึก, 9.5×10² MWh ซึ่งรวมค่าใช้จ่ายส่วนเกินของศูนย์ข้อมูลและไม่รวมการปรับละเอียดแบบมีผู้สอนและการเรียนรู้แบบเสริมกำลัง สำหรับทีมที่ต้องตอบคำถามว่า "ข้อความของโมเดลนี้มาจากไหน" ความแตกต่างนั้นไม่ใช่เรื่องผิวเผิน

ความเป็นจริงของการกำหนดเส้นทางสำหรับทั้งสอง
ปัจจุบันไม่มีโมเดลใดอยู่ในแคตตาล็อกแบบโฮสต์ Kolibri ไม่มี API SKU จากผู้ขายเลย การเปิดตัวคือเวตพร้อมรายงานทางเทคนิค และ Granite 4.2 3B ถูกส่งมอบเป็นเวตสำหรับรันไทม์สแต็ก 5 แบบ โดยไม่มีเอนด์พอยต์แบบโฮสต์จาก IBM ทั้งสองเป็นข้อเสนอแบบโฮสต์เอง และคำถามเชิงปฏิบัติสำหรับทีมส่วนใหญ่ไม่ใช่ว่าจะเลือกตัวไหนมาใช้ แต่เป็นว่างานเวิร์กโหลดนั้นสมเหตุสมผลที่จะเป็นเจ้าของตัวใดตัวหนึ่งหรือไม่
นั่นคือจุดที่เลเยอร์การจัดเส้นทางพิสูจน์คุณค่าของตัวเอง แม้กับโมเดลที่มันไม่ได้ให้บริการ เราได้ตรวจสอบแคตตาล็อกของ OrcaRouter ด้วยทุกรูปแบบการสะกดของชื่อโมเดลทั้งสองชื่อ และไม่มีทั้ง Kolibri และ Granite 4.2 3B อยู่ในนั้น เราจึงไม่แกล้งทำเป็นว่าเป็นอย่างอื่น สิ่งที่ OrcaRouter ให้คุณได้จริงคือวิธีราคาถูกในการหาคำตอบว่าการตัดสินใจเรื่องฮาร์ดแวร์นั้นสมเหตุสมผลหรือไม่ก่อนที่คุณจะตัดสินใจ ลองชี้เส้นทางทดสอบไปที่ระดับ mixture-of-experts ขนาดเล็กที่ถูกจัดเส้นทางไว้แล้ว — ตัวแปร Gemma 4 26B-A4B ในราคา $0.06 ต่ออินพุตหนึ่งล้านโทเค็น และ $0.33 ต่อเอาต์พุตหนึ่งล้านโทเค็น พร้อมหน้าต่าง 262,144 โทเค็น — แล้วดูว่าปริมาณงานเอกสารภาษาเยอรมันของคุณต้องการสิ่งที่ Kolibri ให้จริงหรือไม่ บนคีย์เดียวที่เข้ากันได้กับ OpenAI ในราคาตามที่ผู้ให้บริการระบุโดยไม่มีอะไรเพิ่มเติม ถ้าใช่ คุณก็ซื้อ GPU ด้วยหลักฐานแทนที่จะเดา ถ้าไม่ใช่ คุณก็เพิ่งประหยัดคำสั่งซื้อฮาร์ดแวร์ไปได้หนึ่งครั้ง
คำตัดสิน และสิ่งที่อาจทำให้มันเปลี่ยนแปลง
นี่ไม่ใช่การเปรียบเทียบที่ต้องมีผู้ชนะ Kolibri กับ Granite 4.2 3B ตอบคำถามคนละแบบในระดับราคาที่ต่างกัน และการจัดอันดับอย่างซื่อสัตย์มีเพียงการจัดตามข้อจำกัด: ถ้าข้อจำกัดคือฮาร์ดแวร์ Granite 4.2 3B เป็นเพียงหนึ่งเดียวในสองตัวที่เข้าเกณฑ์ ถ้าข้อจำกัดคืองานเอกสารด้านทะเบียนตามกฎระเบียบของเยอรมนี Granite 4.2 3B ยังอยู่ในตัวเลือกที่พิจารณา และ Kolibri เป็นชิ้นงานที่น่าสนใจกว่า — การเปิดตัวแบบ open-weights ขนาด 78B ที่ถูกต้องตามกฎหมาย ใช้ Apache 2.0 โดยมีไปป์ไลน์ข้อมูลและโทเคไนเซอร์เผยแพร่เคียงคู่กับน้ำหนักโมเดล
สองสิ่งนี้จะทำให้การเปรียบเทียบได้ข้อยุติ การรัน Kolibri แบบอิสระบนงาน QA เอกสารภาษาเยอรมันจะทดสอบข้ออ้างที่ตัวรีลีสนี้ถูกสร้างขึ้นมาเพื่อพิสูจน์จริง ๆ เพราะตอนนี้ยังไม่มีลีดเดอร์บอร์ดใดวัดเรื่องนี้ และการทำซ้ำอย่างอิสระของตัวเลขการให้เหตุผลของ Granite 4.2 3B จะบอกคุณว่าเครื่องระดับแล็ปท็อปจะยืนหยัดได้ด้วยตัวเองบนส่วนย่อยของงานของคุณที่ตั้งแต่แรกก็ไม่เคยต้องใช้พารามิเตอร์ 7.8 หมื่นล้านตัวหรือไม่ จนกว่าหนึ่งในนั้นจะเกิดขึ้นจริง ให้ซื้อโดยดูจากข้อจำกัด ไม่ใช่จากจำนวนพารามิเตอร์

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
