การ์ดชื่อเรื่องแบบฮีโร่ชื่อ 'Kolibri vs Granite 4.2 3B' พร้อมคำบรรยายใต้ชื่อ 'โมเดล sparse mixture-of-experts ขนาด 78B เทียบกับโมเดล reasoning แบบ dense ขนาด 3B' ป้ายแบบพิลที่ระบุว่า '78.1B ทั้งหมด | 3.46B ที่ใช้งาน', '~3B แบบ dense', 'Apache 2.0 ทั้งคู่' และบรรทัดท้ายที่ระบุว่า 'ตัวเลขที่ผู้ขายรายงานจากทั้งสองฝ่าย' โดยมีโลโก้ OrcaRouter ที่มุมล่างขวา
Guides & Insights

Kolibri vs Granite 4.2 3B: การเดิมพันสแปร์ซิตี้ 78B และโมเดล 3B ที่ปฏิเสธที่จะเล่นเกมเดียวกัน

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วาง Kolibri และ Granite 4.2 3B ไว้ข้างๆ กัน และข้อสังเกตแรกที่ซื่อสัตย์ก็คือ นี่ไม่ใช่การต่อสู้ที่ยุติธรรม และไม่เป็นไปในทิศทางที่คุณคิด Kolibri เป็นโมเดล mixture-of-experts ขนาด 78.1 พันล้านพารามิเตอร์ของ Aleph Alpha เปิดตัวเมื่อวันที่ 3 ตุลาคม 2026 เปิดใช้งาน 3.46 พันล้านพารามิเตอร์ต่อโทเค็น Granite 4.2 3B เป็นโมเดลให้เหตุผลแบบ dense ขนาดประมาณสามพันล้านพารามิเตอร์ของ IBM ซึ่งน้ำหนักของโมเดลไปถึง Hugging Face เมื่อวันที่ 7 สิงหาคม 2026 โดยมี model card และบล็อกทางเทคนิคตามมาในวันที่ 25 สิงหาคม หนึ่งในนั้นมีจำนวนพารามิเตอร์รวมมากกว่าอีกหนึ่งถึงยี่สิบหกเท่า เหตุผลที่ทั้งสองอยู่ในการตัดสินใจเดียวกันคือ ทั้งคู่เป็น Apache 2.0, ทั้งคู่เป็นแบบ text-only, ทั้งคู่ถูกออกแบบมาให้ self-hosted และทั้งคู่มุ่งเป้าไปที่ผู้ซื้อรายเดียวกัน: ทีมที่ต้องการ document intelligence บนฮาร์ดแวร์ที่ควบคุมเอง โดยมี provenance ที่จะผ่านการตรวจสอบจัดซื้อจัดจ้าง คำถามที่น่าสนใจไม่ใช่ว่าอันไหนดีกว่า แต่เป็นว่างบประมาณพารามิเตอร์ที่มากกว่ายี่สิบหกเท่านั้นซื้ออะไรได้จริง และมีค่าใช้จ่ายในการแบกรับเท่าไหร่

ความไม่สอดคล้องกัน กล่าวอย่างตรงไปตรงมา

Granite 4.2 3B เป็นโมเดล dense แบบสแตนด์อโลนที่ผ่านการฝึกแบบ post-trained จาก Granite-4.1-3B-Base ซึ่งเป็นส่วนหนึ่งของตระกูล Granite 4.2 ที่ IBM เปิดตัวจนถึงเดือนสิงหาคม โมเดลนี้มี 40 เลเยอร์พร้อม grouped-query attention, บริบทเนทีฟ 128K ที่ IBM ขยายเป็น 512K ในเฟส pre-training ครั้งที่ห้า และโหมดการคิดต่อหนึ่งคำถามสามแบบ: โหมดคิดเต็มเป็นค่าเริ่มต้น, เส้นทางที่ใช้ความพยายามต่ำ และเส้นทางที่ไม่คิด การ์ดของ IBM ตรงไปตรงมาอย่างผิดปกติเกี่ยวกับสิ่งที่ 3B ไม่ใช่ ต่างจากรุ่นพี่น้อง 8B และ 30B โมเดลนี้จงใจข้ามบล็อกการเรียนรู้แบบเสริมกำลังเชิงตัวแทน (agentic reinforcement learning) เฉพาะทางที่ฝึกในสภาพแวดล้อม SWE-agent, เทอร์มินัล และการค้นหา ซึ่งเป็นเหตุผลว่าทำไม IBM จึงไม่ระบุตัวเลข SWE-bench สำหรับโมเดลนี้เลย และวางตำแหน่งโมเดลนี้ว่าเป็นผู้เชี่ยวชาญด้านการใช้เหตุผลมากกว่าจะเป็นเอเจนต์

Kolibri ไปในทิศทางตรงกันข้ามในทุกแกน ห้าสิบเลเยอร์ ทุกเลเยอร์เป็น mixture-of-experts ผู้เชี่ยวชาญ 384 คนต่อเลเยอร์ โดยมีหนึ่งแบบใช้ร่วมกันและหกแบบกำหนดเส้นทาง และอัตราส่วนความเบาบางประมาณ 22.6 ต่อ 1 บริบทของมันเป็น 262,144 โทเค็นโดยธรรมชาติ ตรวจสอบแล้วถึง 1,048,576 โดยการ์ดแนะนำให้คุณอยู่ที่หรือต่ำกว่า 262,144 สำหรับงานที่ไวต่อเวลา ระดับความพยายามในการให้เหตุผลสี่ระดับ การเรียกใช้เครื่องมือแบบ Hermes พร้อมตัวแยกวิเคราะห์ vLLM ที่จัดส่งในที่เก็บเดียวกันกับน้ำหนัก และมีขนาดประมาณ 78 GB ใน FP8 โดยการกำหนดค่าขั้นต่ำของการ์ดคือการ์ด A100 80 GB สองใบ, H100 SXM5 สองใบ, H200 หนึ่งใบ, B200 หนึ่งใบ หรือ B300 หนึ่งใบ

• พารามิเตอร์ — Kolibri: 78,103,074,560 ทั้งหมด, 3,457,573,120 ที่ใช้งานต่อโทเคน Granite 4.2 3B: ประมาณ 3B แบบ dense, พารามิเตอร์ทั้งหมดทำงานในทุกโทเคน

• บริบท — Kolibri: 16,384 ผ่านการฝึก, 65,536 ฝึกระดับกลาง, 262,144 เนทีฟ, 1,048,576 ผ่านการตรวจสอบแล้ว Granite 4.2 3B: 128K เนทีฟ, ขยายถึง 512K

• โหมดการคิด — Kolibri: ไม่มี, ต่ำ, กลาง, สูง, ตั้งค่าผ่านเทมเพลตแชต Granite 4.2 3B: เต็ม, ใช้ความพยายามต่ำ และไม่คิด, ต่อคำถาม

• การเรียกใช้เครื่องมือ — Kolibri: สไตล์ Hermes พร้อมตัวแยกวิเคราะห์ที่มีมาให้แล้ว Granite 4.2 3B: ใช่ แต่ไม่ใช่เส้นทางที่ฝึกด้วย agentic RL แบบที่รุ่นพี่ที่ใหญ่กว่าได้รับ

• ภาษา — Kolibri: เยอรมันและอังกฤษ โดยการออกแบบและไม่มีภาษาอื่น Granite 4.2 3B: ให้ความสำคัญกับภาษาอังกฤษเป็นอันดับแรก โดยมีเบื้องหลังเป็นการฝึกอบรมหลายภาษาที่กว้างขวางยิ่งขึ้นของ IBM

• ขนาดหน่วยความจำ — Kolibri: ประมาณ 78 GB ใน FP8 ต้องใช้ GPU อย่างน้อยสองตัว Granite 4.2 3B: ประมาณ 6–8 GB ใน bfloat16, ต่ำกว่า 2 GB เมื่อทำ quantization, ระดับแล็ปท็อป

• สัญญาอนุญาต — ทั้งคู่ใช้ Apache 2.0 ทั้งคู่ไม่มีข้อกำหนดเพิ่มเติมว่าด้วยการใช้งานที่ยอมรับได้ หรือเกณฑ์จำนวนผู้ใช้ที่ใช้งานต่อเดือน

• การให้บริการ — Kolibri: ปลั๊กอิน vLLM ของ aleph-alpha-inference หรืออิมเมจคอนเทนเนอร์ที่เผยแพร่แล้ว Granite 4.2 3B: vLLM, SGLang, Transformers, GGUF และ Ollama ภายใต้ granite4.2:3b

A two-column comparison scoreboard titled 'Kolibri vs Granite 4.2 3B'. Left column Kolibri: Parameters 78.1B total / 3.46B active, Context 262,144 native / 1,048,576 validated, Thinking none / low / medium / high, Languages German and English, Licence Apache 2.0, Footprint about 78 GB FP8, two GPUs minimum. Right column Granite 4.2 3B: Parameters ~3B dense, Context 128K native / 512K extended, Thinking full / low / none, Languages English-first with IBM multilingual training, Licence Apache 2.0, Footprint 6-8 GB bfloat16 / under 2 GB quantized, laptop-class. Footer: 'Kolibri figures are Aleph Alpha's own; Granite 4.2 3B figures are IBM's own; nothing here is independently reproduced.' with the OrcaRouter logo in the bottom-right corner.

สิ่งที่พารามิเตอร์เพิ่มอีก 75 พันล้านตัวมอบให้

สามเรื่อง และเป็นเรื่องที่ควรระบุให้ชัดเจนว่าเรื่องใดในนั้นเป็นสิ่งที่ยืนยันแล้ว และเรื่องใดเป็นเพียงข้อกล่าวอ้าง

อย่างแรกคือภาษาเยอรมัน นี่คือความแตกต่างที่แท้จริงและชัดเจนที่สุดระหว่างสองโมเดล และไม่ใช่แถวในตาราง benchmark Aleph Alpha สร้าง Kolibri โดยใช้คลังข้อมูลสองภาษาคือเยอรมัน-อังกฤษเป็นแกนหลัก โดยตั้งเป้าไว้ว่าประมาณ 20 เปอร์เซ็นต์จะเป็นภาษาเยอรมันในการรันพรีเทรนที่มีโทเคน 20 ล้านล้านโทเคน และจบลงด้วยคลังภาษาเยอรมันขนาด 2.4 ล้านล้านโทเคน ซึ่ง 80 เปอร์เซ็นต์ของคลังนั้นเป็นข้อมูลที่ห้องแล็บคัดสรรหรือสร้างขึ้นเอง การ์ดอธิบายว่าทำไมเรื่องนั้นถึงต้องใช้ความพยายาม: ชุดข้อมูลภาษาเยอรมันแบบเปิดที่ผ่านการตัดข้อมูลซ้ำมีให้เพียง 390 พันล้านโทเคน ซึ่งขาดไปหนึ่งอันดับขนาด ดังนั้นห้องแล็บจึงปรับแต่งตัวกรอง Common Crawl สำหรับภาษาเยอรมันโดยเฉพาะ และเขียนเอกสารภาษาเยอรมันที่มีอยู่ใหม่ให้เป็นรายการสารานุกรม บทสนทนา และข้อความตอน รายละเอียดเกี่ยวกับตัวกรองคือสิ่งที่ควรจดจำ ไปป์ไลน์ข้อมูลภาษามาตรฐานจะตัดเอกสารที่มีคำยาวมากเกินไปออก และร้อยแก้วเชิงบริหารของเยอรมันมักเกินขอบเขตความยาวคำเฉลี่ยของภาษาอังกฤษ — ดังนั้นการตั้งค่าเริ่มต้นจึงลบรูปแบบภาษาที่หน่วยงานราชการใช้เขียนโดยไม่รู้ตัว IBM ไม่ได้สร้าง Granite สำหรับคลังข้อมูลนั้น Granite 4.2 3B จะรองรับภาษาเยอรมันได้ มันไม่ได้ถูกออกแบบโดยอิงกับรูปแบบภาษากฎหมายและการบริหารของเยอรมัน และไม่มี leaderboard ใดจะบอกความแตกต่างนี้ให้คุณได้

อย่างที่สองคือบริบทยาวที่ยังใช้งานได้กับเอกสารจริง เพดาน 512K ของ Granite นั้นใหญ่จริง แต่ทั้งสองโมเดลไปถึงจุดนั้นด้วยวิธีที่ต่างกัน และการออกแบบตำแหน่งของ Kolibri ก็เป็นข้อโต้แย้งเรื่องบริบทยาวที่เป็นแบบแผนมากกว่า จงมองตัวเลข RULER ของ IBM — 67.52 ที่ 64K และ 55.30 ที่ 128K ในเอกสารเผยแพร่ของตระกูล 4.2 — ว่าเป็นการเปิดเผยอย่างตรงไปตรงมาว่าคุณภาพการดึงข้อมูลเสื่อมลงมากแค่ไหนเมื่อถึง 128K และจำไว้ว่า Kolibri ไม่มีเส้นโค้งการเสื่อมคุณภาพที่เผยแพร่เทียบเท่าเลยแม้แต่เส้นเดียว

ข้อที่สามคือศักยภาพการให้เหตุผลแบบดิบที่เหลืออยู่ และนี่คือจุดที่คำตอบที่ตรงไปตรงมาคือ “ไม่มากเท่าที่อัตราส่วนพารามิเตอร์บ่งชี้” ไปป์ไลน์การฝึกของ Kolibri ทำให้มันได้การรันพรีเทรน 20 ล้านล้านโทเคนบน NVIDIA B200 จำนวน 768 ตัวเป็นเวลา 21 วัน และตารางเปรียบเทียบของ Aleph Alpha เอง โดยให้ Kolibri ที่ reasoning effort สูง อยู่ที่ 75.5 ในค่าเฉลี่ยภาษาอังกฤษ และ 70.8 ในค่าเฉลี่ยภาษาเยอรมันของการเปรียบเทียบสิบสี่โมเดล — ซึ่งมันแพ้โมเดลแบบ dense ขนาด 27 พันล้านพารามิเตอร์จาก Alibaba ในแถวส่วนใหญ่ ข้ออ้างหลักของ Granite 4.2 3B เป็นของตัวเอง: AIME 2025 ที่ 78.33, GPQA ที่ 54.80, LiveCodeBench v6 ที่ 69.71 และ MMLU-Pro ที่ 67.84 ทั้งหมดเป็นตัวเลขที่ IBM รายงานและยังไม่มีการทำซ้ำ ชุดทดสอบต่างกัน ฮาร์เนสต่างกัน ผู้จำหน่ายต่างกัน ไม่มีตัวเลขที่ใช้ฮาร์เนสเดียวกันสำหรับการจับคู่นี้ที่ไหนเลย และเราจะไม่ประดิษฐ์ตัวเลขขึ้นมา

จุดที่แต่ละตัวชนะจริง ๆ

รัน Granite 4.2 3B หากข้อจำกัดของคุณคือตัวเครื่อง ที่ขนาด 6–8 GB ใน bfloat16 หรือต่ำกว่า 2 GB เมื่อทำควอนไทซ์ มันพอดีกับแล็ปท็อป, GPU ของเวิร์กสเตชันเครื่องเดียว หรือกล่องเอดจ์แบบแยกเครือข่ายที่ไม่มีวันได้เห็น H100 สองตัว มันให้บริการผ่านรันไทม์ที่แตกต่างกันห้าแบบ รวมถึง Ollama และ GGUF ซึ่งสำคัญเมื่อเป้าหมายการติดตั้งใช้งานคือแล็ปท็อปของคนอื่น ไม่ใช่แร็คของคุณเอง และโมเดลการ์ดของมันน่าเชื่อถือเป็นพิเศษก็เพราะ IBM ได้เขียนบันทึกไว้อย่างชัดเจนว่ามันละเว้นสิ่งใดไป ผู้ขายรายหนึ่งที่ปฏิเสธที่จะอ้างผลลัพธ์ SWE-bench สำหรับโมเดลขนาด 3B กำลังบอกคุณว่าโมเดลไปถึงขีดจำกัดตรงไหน

รัน Kolibri หากคลังข้อมูลคือประเด็นหลักและฮาร์ดแวร์มีพร้อม ทีมที่มีสัญญาภาษาเยอรมัน เอกสารทางเทคนิค หรือเอกสารทางราชการ มีโหนดสอง GPU อยู่แล้ว และมีข้อกำหนดว่าน้ำหนักโมเดลต้องไม่ออกจากอาคารเลย คือกลุ่มเป้าหมายที่รีลีสนี้ถูกออกแบบมาเพื่อโดยเฉพาะ หน้าต่างเนทีฟ 262,144 โทเคน, FP8 KV cache, ระดับความพยายามสี่ระดับ และเส้นทางการเรียกใช้เครื่องมือของ Hermes ล้วนชี้ไปที่เวิร์กโฟลว์เอกสารมากกว่าการแชต โทเคนไนเซอร์สองภาษาก็เป็นส่วนหนึ่งของข้อโต้แย้งเดียวกัน: Aleph Alpha รายงานค่าเฉลี่ย 4.90 ไบต์ต่อโทเคนบนข้อความเว็บภาษาเยอรมัน เทียบกับ 4.35 สำหรับ GPT-5 และ 3.28 สำหรับ Kimi K3 ทั้งหมดวัดโดยผู้ขายบนคลังข้อมูลของผู้ขายเอง และการได้อักขระต่อโทเคนมากขึ้นเป็นผลโดยตรงต่อต้นทุนการอนุมาน ไม่ใช่คะแนน หากข้อนี้เป็นจริง มันจะทบต้นไปในทุกหน้าที่คุณประมวลผล

ความไม่สมมาตรที่ไม่มีใครโฆษณาก็คือข้อมูล IBM เผยแพร่เวตของ Granite 4.2 3B และคำอธิบายทางเทคนิคโดยละเอียดเกี่ยวกับวิธีการสร้างโมเดล แต่ไม่ได้เผยแพร่ข้อมูลการฝึก Aleph Alpha เผยแพร่ไปป์ไลน์ แหล่งที่มาของข้อมูล และตัวเลขพลังงาน ควบคู่ไปกับเวตของ Kolibri — 20 ล้านล้านโทเคนก่อนการฝึก, 9.5×10² MWh ซึ่งรวมค่าใช้จ่ายส่วนเกินของศูนย์ข้อมูลและไม่รวมการปรับละเอียดแบบมีผู้สอนและการเรียนรู้แบบเสริมกำลัง สำหรับทีมที่ต้องตอบคำถามว่า "ข้อความของโมเดลนี้มาจากไหน" ความแตกต่างนั้นไม่ใช่เรื่องผิวเผิน

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the card header, the Apache 2.0 licence tag, the twelve tested languages, and the links to the Granite 4.2 Collection, the technical blog and the GitHub repository.

ความเป็นจริงของการกำหนดเส้นทางสำหรับทั้งสอง

ปัจจุบันไม่มีโมเดลใดอยู่ในแคตตาล็อกแบบโฮสต์ Kolibri ไม่มี API SKU จากผู้ขายเลย การเปิดตัวคือเวตพร้อมรายงานทางเทคนิค และ Granite 4.2 3B ถูกส่งมอบเป็นเวตสำหรับรันไทม์สแต็ก 5 แบบ โดยไม่มีเอนด์พอยต์แบบโฮสต์จาก IBM ทั้งสองเป็นข้อเสนอแบบโฮสต์เอง และคำถามเชิงปฏิบัติสำหรับทีมส่วนใหญ่ไม่ใช่ว่าจะเลือกตัวไหนมาใช้ แต่เป็นว่างานเวิร์กโหลดนั้นสมเหตุสมผลที่จะเป็นเจ้าของตัวใดตัวหนึ่งหรือไม่

นั่นคือจุดที่เลเยอร์การจัดเส้นทางพิสูจน์คุณค่าของตัวเอง แม้กับโมเดลที่มันไม่ได้ให้บริการ เราได้ตรวจสอบแคตตาล็อกของ OrcaRouter ด้วยทุกรูปแบบการสะกดของชื่อโมเดลทั้งสองชื่อ และไม่มีทั้ง Kolibri และ Granite 4.2 3B อยู่ในนั้น เราจึงไม่แกล้งทำเป็นว่าเป็นอย่างอื่น สิ่งที่ OrcaRouter ให้คุณได้จริงคือวิธีราคาถูกในการหาคำตอบว่าการตัดสินใจเรื่องฮาร์ดแวร์นั้นสมเหตุสมผลหรือไม่ก่อนที่คุณจะตัดสินใจ ลองชี้เส้นทางทดสอบไปที่ระดับ mixture-of-experts ขนาดเล็กที่ถูกจัดเส้นทางไว้แล้ว — ตัวแปร Gemma 4 26B-A4B ในราคา $0.06 ต่ออินพุตหนึ่งล้านโทเค็น และ $0.33 ต่อเอาต์พุตหนึ่งล้านโทเค็น พร้อมหน้าต่าง 262,144 โทเค็น — แล้วดูว่าปริมาณงานเอกสารภาษาเยอรมันของคุณต้องการสิ่งที่ Kolibri ให้จริงหรือไม่ บนคีย์เดียวที่เข้ากันได้กับ OpenAI ในราคาตามที่ผู้ให้บริการระบุโดยไม่มีอะไรเพิ่มเติม ถ้าใช่ คุณก็ซื้อ GPU ด้วยหลักฐานแทนที่จะเดา ถ้าไม่ใช่ คุณก็เพิ่งประหยัดคำสั่งซื้อฮาร์ดแวร์ไปได้หนึ่งครั้ง

คำตัดสิน และสิ่งที่อาจทำให้มันเปลี่ยนแปลง

นี่ไม่ใช่การเปรียบเทียบที่ต้องมีผู้ชนะ Kolibri กับ Granite 4.2 3B ตอบคำถามคนละแบบในระดับราคาที่ต่างกัน และการจัดอันดับอย่างซื่อสัตย์มีเพียงการจัดตามข้อจำกัด: ถ้าข้อจำกัดคือฮาร์ดแวร์ Granite 4.2 3B เป็นเพียงหนึ่งเดียวในสองตัวที่เข้าเกณฑ์ ถ้าข้อจำกัดคืองานเอกสารด้านทะเบียนตามกฎระเบียบของเยอรมนี Granite 4.2 3B ยังอยู่ในตัวเลือกที่พิจารณา และ Kolibri เป็นชิ้นงานที่น่าสนใจกว่า — การเปิดตัวแบบ open-weights ขนาด 78B ที่ถูกต้องตามกฎหมาย ใช้ Apache 2.0 โดยมีไปป์ไลน์ข้อมูลและโทเคไนเซอร์เผยแพร่เคียงคู่กับน้ำหนักโมเดล

สองสิ่งนี้จะทำให้การเปรียบเทียบได้ข้อยุติ การรัน Kolibri แบบอิสระบนงาน QA เอกสารภาษาเยอรมันจะทดสอบข้ออ้างที่ตัวรีลีสนี้ถูกสร้างขึ้นมาเพื่อพิสูจน์จริง ๆ เพราะตอนนี้ยังไม่มีลีดเดอร์บอร์ดใดวัดเรื่องนี้ และการทำซ้ำอย่างอิสระของตัวเลขการให้เหตุผลของ Granite 4.2 3B จะบอกคุณว่าเครื่องระดับแล็ปท็อปจะยืนหยัดได้ด้วยตัวเองบนส่วนย่อยของงานของคุณที่ตั้งแต่แรกก็ไม่เคยต้องใช้พารามิเตอร์ 7.8 หมื่นล้านตัวหรือไม่ จนกว่าหนึ่งในนั้นจะเกิดขึ้นจริง ให้ซื้อโดยดูจากข้อจำกัด ไม่ใช่จากจำนวนพารามิเตอร์

A screenshot of IBM's technical blog announcing the Granite 4.2 family, showing the post header and the discussion of the family's dense and mixture-of-experts tiers and their reasoning and thinking modes.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube