สร้างการ์ดฮีโร่สำหรับ Kolibri vs Gemma 4 12B โดยมีหัวข้อ 'Kolibri vs Gemma 4 12B' พร้อมบรรทัดย่อย 'โมเดล MoE ขนาด 78B เทียบกับโมเดล dense ขนาด 11.95B' มีไอคอนนกฮัมมิงเบิร์ดทางซ้ายและรูปเพชรทางขวา อยู่คนละข้างของเส้นแบ่งบาง ๆ โลโก้ OrcaRouter อยู่ในแถบด้านล่างของอาร์ตเวิร์ก
Guides & Insights

Kolibri vs Gemma 4 12B: พารามิเตอร์ 78 พันล้าน เทียบกับ 12 และมีเพียงหนึ่งในนั้นเท่านั้นที่มีคะแนน

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Kolibri และ Gemma 4 12Bเป็นสองสุดขั้วของสเปกตรัมที่การเปิดตัวโมเดลแบบเปิดน้ำหนักมักไม่ให้คุณเปรียบเทียบกันบนเงื่อนไขที่เท่าเทียมกัน Kolibri ของ Aleph Alpha เปิดตัวเมื่อวันที่ 3 ตุลาคม 2026: พารามิเตอร์ทั้งหมด 78.1 พันล้าน, 3.46 พันล้านที่ใช้งานต่อโทเค็น, หน้าต่างบริบท 1,048,576 โทเค็นที่ผ่านการตรวจสอบแล้ว, รองรับเฉพาะภาษาเยอรมันและอังกฤษ, Apache 2.0 Gemma 4 12B เปิดตัวเมื่อวันที่ 3 มิถุนายน 2026: พารามิเตอร์แบบเดนส์ 11.95 พันล้าน, หน้าต่างบริบท 262,144 โทเค็น, อินพุตข้อความ รูปภาพ เสียง และวิดีโอ, Apache 2.0 หนึ่งในนั้นมีคะแนนที่เป็นอิสระและสามารถทำซ้ำได้โดยสาธารณะ อีกอันหนึ่งมีตารางเบนช์มาร์กจากผู้ขาย ความไม่สมมาตรนั้นไม่ใช่เชิงอรรถของการเปรียบเทียบนี้; มันคือการเปรียบเทียบเอง เพราะทุกสิ่งอื่นที่ผู้ซื้อให้ความสำคัญ — ต้นทุนต่องาน, คุณภาพต่อวัตต์, ไม่ว่าจะทำงานกับเอกสารของคุณได้หรือไม่ — ล้วนขึ้นอยู่กับมัน

เราควรพูดตรง ๆ พอ ๆ กันเกี่ยวกับลักษณะของการจับคู่ครั้งนี้ เพราะพาดหัวที่จับคู่โมเดล 78B กับโมเดล 12B ชวนให้สรุปผิด สองสิ่งนี้ไม่ใช่คู่แข่งกัน ตัวหนึ่งเป็นการติดตั้งขนาด 78 GB ที่มุ่งเป้างานเอกสารภาครัฐและอุตสาหกรรมของเยอรมนี บนแร็กที่ลูกค้าเป็นเจ้าของเอง ส่วนอีกตัวเป็นโมเดลมัลติโมดัลแบบรวมขนาด 12 พันล้านพารามิเตอร์ที่รันบนแล็ปท็อป และมีดัชนีอิสระที่ 14 ต่อไปนี้คือคำอธิบายว่าจริง ๆ แล้วแต่ละตัวมีไว้เพื่ออะไร ตัวเลขที่เผยแพร่ทำให้คุณจัดอันดับพวกมันได้ตรงไหนและไม่ได้ตรงไหน และต้องแลกด้วยอะไรหากไม่มีคะแนนอิสระ

ตัวเลขหนึ่งเดียวที่คุณไว้ใจได้ที่นี่ และอีกหนึ่งตัวเลขที่คุณไว้ใจไม่ได้

Artificial Analysis ได้วัดผล Gemma 4 12B ในคอนฟิกูเรชันแบบ reasoning ของโมเดลนี้ ข้อค้นพบตามที่เผยแพร่บนหน้าโมเดลของพวกเขาคือสิ่งที่ต้องใช้เป็นข้อมูลตั้งต้น:

• Intelligence — ดัชนี Artificial Analysis Intelligence Index อยู่ที่ 14 ซึ่งจัดอยู่ในกลุ่มระดับสูงสุด โดยอยู่อันดับ #21 จากทั้งหมด 142 โมเดลในการเปรียบเทียบนั้น เทียบกับค่ามัธยฐานที่ 8 ของโมเดลที่เทียบเคียงได้

• ความเร็ว — 112.5 โทเค็นเอาต์พุตต่อวินาที, อันดับที่ 21 จาก 142 ในมุมมองความเร็ว และสูงกว่าค่ามัธยฐาน 91 โทเค็นสำหรับโมเดลที่เทียบเคียงได้

• ราคา — $0.10 ต่อล้านโทเค็นอินพุต และ $0.30 ต่อล้านโทเค็นเอาต์พุต ซึ่งหน้าของพวกเขาระบุว่าค่อนข้างแพงเมื่อเทียบกับค่ามัธยฐานที่ $0.03 และ $0.15 สำหรับโมเดลที่มีขนาดและคลาสใกล้เคียงกัน

• ข้อมูลจำเพาะ — คอนเท็กซ์ 262,144 โทเคน, พารามิเตอร์ทั้งหมด 12B, Apache 2.0, อินพุตข้อความ รูปภาพ เสียง และวิดีโอ, เอาต์พุตข้อความ

คำตัดสินสรุปของ Artificial Analysis เองนั้นตรงไปตรงมาอย่างผิดปกติสำหรับหน้าตารางอันดับ และน่าจะกล่าวซ้ำได้ว่า Gemma 4 12B เป็นหนึ่งในโมเดลชั้นนำด้านความฉลาด แต่มีราคาค่อนข้างแพงเมื่อเทียบกับโมเดล open-weight อื่น ๆ ที่มีขนาดใกล้เคียงกัน นี่คือการประเมินที่แท้จริง เป็นอิสระ และทำซ้ำได้จากบุคคลที่สามซึ่งไม่มีส่วนได้ส่วนเสียกับผู้จำหน่ายรายใดเลย

Kolibri ไม่มีสิ่งที่เทียบเท่ากัน ไม่มีหน้าโมเดลของ Artificial Analysis สำหรับมัน และ ณ เวลาที่เขียนนี้ ยังไม่มีบุคคลที่สามรายใดทำซ้ำชุดการประเมินนี้ สิ่งที่มีอยู่คือตารางเปรียบเทียบของ Aleph Alpha เอง ซึ่ง Kolibri ได้คะแนน 75.5 สำหรับค่าเฉลี่ยภาษาอังกฤษ และ 70.8 สำหรับค่าเฉลี่ยภาษาเยอรมันทั่วทั้งชุดงานของมัน ค่าเหล่านี้เป็นค่าเฉลี่ยร้อยละแบบไม่ถ่วงน้ำหนักจากส่วนผสมของเบนช์มาร์กที่ผู้ขายเลือกเอง บนฮาร์เนสที่ผู้ขายเขียนขึ้น โดยตั้งค่าความพยายามในการใช้เหตุผลไว้สูง ค่าเหล่านี้ไม่ใช่ Intelligence Index และตัวเลขสองจำนวนนี้ไม่สามารถแปลงเป็นกันและกันหรือนำมาตั้งเทียบข้างกันได้ ใครก็ตามที่นำเสนอ "Kolibri 75.5 เทียบกับ Gemma 14" เป็นการจัดอันดับ กำลังเปรียบเทียบเปอร์เซ็นต์บนสเกลหนึ่งกับคะแนนบนอีกสเกลหนึ่ง จุดยืนที่ซื่อตรงคือคุณภาพของ Gemma 4 12B นั้นถูกวัดแล้ว ส่วนของ Kolibri เป็นเพียงคำกล่าวอ้าง

สิ่งที่ตารางของผู้ขายทำได้คือให้คุณอ่านข้ามแถวได้ Gemma 4 26B-A4B IT ซึ่งเป็นโมเดลแบบ mixture-of-experts ของ Google เองที่เป็นรุ่นพี่น้องกับ 12B ปรากฏอยู่ในตารางของ Aleph Alpha ที่ 71.9 ภาษาอังกฤษ และ 66.3 เยอรมัน ต่ำกว่า Kolibri ทั้งสองค่า นั่นคือสิ่งที่ใกล้เคียงที่สุดกับการตรวจสอบไขว้ที่มีอยู่ และมาพร้อมข้อแม้เดียวกัน: ชุดทดสอบของผู้ขาย ตัวเลขของผู้ขาย มันเป็นสัญญาณอ่อน ไม่ใช่หลักฐาน

Screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), marked 'Open weights model, Released June 2026', showing an Intelligence Index of 14 against a median of 8, a #21/142 intelligence rank and a #21/142 speed rank, 112.5 output tokens per second against a 91-token median, input pricing $0.10 per million tokens against a $0.03 median and output pricing $0.30 against a $0.15 median, a 262k-token context window, the summary verdict that the model is amongst the leading models in intelligence but somewhat expensive compared with other open-weight models of similar size, and the 142 models in this class count.

Dense 12B เมื่อเทียบกับ sparse 78B ไม่ได้เป็นความไม่ลงรอยกันอย่างที่ดูเหมือน

ช่องว่างทางสถาปัตยกรรมนั้นใหญ่กว่าช่องว่างทางพารามิเตอร์ เมื่อคุณพิจารณาถึงสิ่งที่คำนวณจริงต่อโทเคน

• การประมวลผลต่อโทเคน — Gemma 4 12B เปิดใช้งานพารามิเตอร์ทั้งหมด 11.95 พันล้านตัวในทุกโทเคน Kolibri เปิดใช้งาน 3,457,573,120 จาก 78,103,074,560 หรือประมาณหนึ่งในยี่สิบสองของโมเดล โดยมีผู้เชี่ยวชาญที่ใช้ร่วมกันหนึ่งรายและผู้เชี่ยวชาญแบบกำหนดเส้นทางหกรายต่อเลเยอร์จากทั้งหมด 384 ราย

• หน่วยความจำ — การแลกเปลี่ยนกลับทิศทางกันและมันโหดร้าย Gemma 4 12B ใน bfloat16 อยู่ที่ประมาณ 24 GB ของน้ำหนัก การ์ดของ Kolibri ระบุน้ำหนัก FP8 ไว้ที่ราว 78 GB โดยต้องมีอย่างน้อยสองการ์ด A100 80 GB, สอง H100 SXM5, หนึ่ง H200, หนึ่ง B200 หรือหนึ่ง B300

• แอตเทนชัน — Gemma 4 ใช้ไฮบริดของแอตเทนชันแบบหน้าต่างเลื่อนเฉพาะที่และแอตเทนชันแบบโกลบอลเต็มรูปแบบ โดยเลเยอร์สุดท้ายจะเป็นโกลบอลเสมอ Kolibri ใช้การแบ่งแบบหน้าต่างเลื่อนต่อ grouped-query ในอัตรา 4:1 กระจายไปทั่ว 50 เลเยอร์ที่เป็น MoE ทั้งหมด

• บริบท — 262,144 โทเคนสำหรับ Gemma 4 12B; 262,144 แบบเนทีฟสำหรับ Kolibri ซึ่งผ่านการตรวจสอบถึง 1,048,576 โดยไม่มีการปรับสเกลตำแหน่ง

ดังนั้นการวางกรอบอย่างตรงไปตรงมาของ "78B กับ 12B" ก็คือ Kolibri ชนะในเรื่องต้นทุนการเปิดใช้งานและแพ้ในเรื่องพื้นที่จัดเก็บน้ำหนัก และไม่มีข้อได้เปรียบใดที่ได้มาฟรี โมเดลแบบเบาบางที่เปิดใช้งาน 3.46 พันล้านพารามิเตอร์ต่อโทเคนยังคงต้องเก็บพารามิเตอร์ทั้งหมด 78 พันล้านตัวไว้ในหน่วยความจำ ซึ่งเป็นเหตุผลว่าทำไมขั้นต่ำในการติดตั้งใช้งานจึงเป็นตัวเร่งความเร็ว 80 GB สองตัวแทนที่จะเป็นการ์ดสำหรับผู้บริโภคหนึ่งใบ Gemma 4 12B ทำการแลกเปลี่ยนในทางตรงกันข้าม: สัดส่วนที่ใหญ่กว่าของโมเดลจะทำงานทุกโทเคน แต่ก็พอดีกับฮาร์ดแวร์ที่บุคคลทั่วไปสามารถซื้อได้

มีจุดซับซ้อนเฉพาะภาษาเยอรมันในฝั่ง Kolibri ที่เปลี่ยนตัวเลขการคำนวณมากกว่าการจัดอันดับ ตัวตัดโทเคนของมันให้ค่าเฉลี่ย 4.90 ไบต์ต่อโทเคนบนข้อความเว็บภาษาเยอรมัน เมื่อเทียบกับ 4.13 สำหรับ Gemini, 4.17 สำหรับตระกูล Qwen3.5–3.8 และ 4.35 สำหรับ GPT-5 จากการวัดของ Aleph Alpha เอง การมีจำนวนโทเคนต่อเอกสารภาษาเยอรมันน้อยลงเป็นการลดต้นทุนการอนุมานโดยตรง และสำหรับภาระงานที่เป็นข้อความทางธุรการภาษาเยอรมันนับล้านชิ้น ผลกระทบนั้นอาจมีค่ามากกว่าคะแนนดัชนีไม่กี่จุด นอกจากนี้ยังเป็นข้อมูลที่ผู้ขายรายงานเองทั้งหมด

Generated two-column scoreboard for Kolibri and Gemma 4 12B. Left column Kolibri: independent score 'none published', context '262,144 native, 1M validated', parameters '78.1B MoE, 3.46B active', modalities 'text only', licence Apache 2.0, price 'self-host, 78 GB'. Right column Gemma 4 12B: independent score 'AA Index 14', context 262,144, parameters '11.95B dense', modalities 'text, image, audio, video', licence Apache 2.0, price '$0.10 in / $0.30 out'. The footer reads 'Kolibri figures vendor-reported; Gemma 4 12B figures per Artificial Analysis.'

สิ่งที่แต่ละคนสามารถมองเห็นได้จริงๆ

นี่คือจุดที่การเปรียบเทียบไม่ใกล้เคียงอีกต่อไป และมันเป็นข้อเท็จจริงเชิงสเปกมากกว่าการอ้างถึงคุณภาพ Gemma 4 12B เป็นโมเดลมัลติโมดัลแบบรวม: การ์ดของมันอธิบายสถาปัตยกรรมที่ไม่มีเอนโคเดอร์ ซึ่งฉายแพตช์ภาพดิบและรูปคลื่นเสียงโดยตรงเข้าสู่พื้นที่ embedding ของโมเดลภาษา โดยรับข้อความ ภาพ เสียงพูด และวิดีโอเข้า และส่งข้อความออก มันถูกสร้างมาให้รันบนอุปกรณ์สำหรับผู้บริโภค โดยไม่ต้องจัดเตรียมเอนโคเดอร์แยกต่างหาก

Kolibri อ่านข้อความในสองภาษา และไม่มีอย่างอื่น Aleph Alpha กำหนดกรอบสิ่งนี้ว่าเป็นความลึกเหนือความกว้างอย่างจงใจ: สองภาษา คัดสรรมาอย่างเข้มข้น แทนที่จะเป็นส่วนผสมหลายภาษาที่กว้าง ไม่มี vision tower ไม่มีช่องทางเสียง ไม่มีวิดีโอ หากภาระงานของคุณรวมถึงแบบฟอร์มที่สแกน สายที่บันทึกไว้ หรือภาพถ่ายอุปกรณ์ Gemma 4 12B เป็นตัวเลือกหนึ่ง และ Kolibri ไม่ใช่ ไม่ว่าแถวผล benchmark จะบอกอย่างไร หากภาระงานของคุณคือคลังเอกสารภาษาเยอรมันและอังกฤษที่ต้องไม่ถูกนำออกจากอาคารเลย สิ่งที่ตรงกันข้ามจะใกล้เคียงกับความจริงมากกว่า — แต่โปรดทราบว่าข้อกำหนด "ไม่ถูกนำออกจากอาคารเลย" นั้น Gemma 4 12B ก็ตอบโจทย์ได้เช่นกัน เนื่องจากเวตเป็น Apache 2.0 และดาวน์โหลดได้

อันไหนถูกกว่าขึ้นอยู่กับว่าคุณกำลังซื้ออะไร

สองโมเดลนี้ตั้งราคาเป็นสกุลเงินที่แปลงกันไม่ได้ Gemma 4 12B มีอัตราตลาดอยู่ที่ 0.10 และ 0.30 ดอลลาร์ต่อหนึ่งล้านโทเค็น ตามที่ Artificial Analysis วัดจากผู้ให้บริการหลายราย และถูกกว่าในระดับ MoE บนเอนด์พอยต์แบบ routed ส่วน Kolibri ไม่มีอัตราเลย เพราะ Aleph Alpha ไม่ได้ขาย inference สำหรับโมเดลนี้ — สิ่งที่เปิดตัวคือค่าน้ำหนัก รายงานทางเทคนิค และการ์ดโมเดล

• Gemma 4 12B บนเส้นทางโฮสต์ — $0.10 ต่อล้านอินพุต และ $0.30 ต่อล้านเอาต์พุต ตามตัวเลขของ Artificial Analysis ในแคตตาล็อกของเราเอง โมเดลพี่น้อง MoE อย่าง Gemma 4 26B-A4B IT ถูกระบุไว้ที่ $0.06 ขาเข้า และ $0.33 ขาออก พร้อมหน้าต่าง 262,144 โทเค็น และ Gemma 4 31B IT รุ่น dense ที่ใหญ่กว่า ที่ $0.13 และ $0.38; นั่นคือราคาตามรายการของผู้ให้บริการที่ส่งผ่านมา ซึ่งเป็นตัวเลขเดียวที่เราไม่บวกเพิ่มใด ๆ

• Kolibri บนฮาร์ดแวร์ของคุณเอง — เวต 78 GB ปลั๊กอิน vLLM จากแพ็กเกจ aleph-alpha-inference ของผู้จำหน่าย และขั้นต่ำคือ H200 หรือ B200 หนึ่งตัว หรือ H100 SXM5 สองตัว ค่าใช้จ่ายประกอบด้วยการซื้อทรัพย์สินถาวร ช่องแร็กหนึ่งช่อง และคนหนึ่งคนที่สามารถรันการดีพลอย vLLM ได้ โดยตัดจำหน่ายเป็นต้นทุนต่อจำนวนโทเค็นที่คุณสร้าง

สิ่งเหล่านั้นไม่ใช่การซื้อแบบเดียวกัน และการเปรียบเทียบก็ไม่ใช่ว่า "แบบไหนถูกกว่า" แต่เป็นเรื่องว่าปริมาณงานมีลักษณะที่คุ้มค่าต่อการเป็นเจ้าของฮาร์ดแวร์หรือไม่ ทีมที่ประมวลผลคลังเอกสารที่คงที่และอ่อนไหวในปริมาณสูงอาจได้เปรียบอย่างมากในฝั่งที่โฮสต์เอง ทีมที่สร้างฟีเจอร์ผลิตภัณฑ์ซึ่งเรียกใช้โมเดลเพียงไม่กี่ล้านโทเคนต่อวันแทบจะไม่เป็นเช่นนั้น

ทางเลือกสายกลางที่ปฏิบัติได้จริงทางหนึ่ง: ระดับ Gemma อยู่บน OrcaRouter ในตอนนี้ บนปลายทางที่เข้ากันได้กับ OpenAI แบบเดียวกับทุกอย่างอื่น โดยมีการสลับไปใช้ผู้ให้บริการรายอื่นเมื่อเกิดปัญหา และราคาตามที่ผู้ให้บริการระบุไว้ถูกส่งผ่านโดยไม่บวกเพิ่มใด ๆ ต่อโทเคน นั่นทำให้มันเป็นวิธีที่ราคาถูกในการวัดปริมาณโทเคนจริงของคุณบนเส้นทางแบบโฮสต์ ก่อนตัดสินใจว่าการติดตั้งแบบ sovereign ขนาด 78 GB คุ้มค่าหรือไม่ ควรพูดให้ชัดเจนว่ามันไม่ใช่อะไร: เราไม่ได้จัดเส้นทางให้ Kolibri เราไล่ตรวจแคตตาล็อกด้วยทุกรูปแบบการสะกดชื่อผู้ขายและชื่อโมเดล และมันไม่มีอยู่ที่นั่น การโฮสต์เองเป็นวิธีเดียวในตอนนี้ที่จะเรียกใช้งานมันได้

Screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the 262K-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'Public benchmarks by Google - 2026-04-05', the description of Gemma 4 26B A4B IT as an instruction-tuned mixture-of-experts model from Google DeepMind with roughly 26B total parameters of which about 4B activate per token, the pricing tiles $0.06 and $0.33, and the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

ใครควรเลือกอันไหน

กฎการตัดสินใจสั้นพอที่จะระบุได้ในสามบรรทัด

เลือก Gemma 4 12B หากคุณต้องการข้อความภาษาอื่นนอกเหนือจากภาษาเยอรมันและภาษาอังกฤษ หากคุณต้องการตัวเลขคุณภาพที่วัดได้ก่อนตัดสินใจ หากโมเดลต้องรันบนฮาร์ดแวร์ที่คุณมีอยู่แล้ว หรือหากคุณยอมเช่าโทเค็นมากกว่าที่จะเป็นเจ้าของแร็กเอง มันเป็นเพียงตัวเดียวในสองตัวที่มีคะแนนอิสระ ความเร็วที่เปิดเผย และราคาตลาด

เลือก Kolibri หากความต้องการของคุณคือโมเดลการให้เหตุผลขนาด 78 พันล้านพารามิเตอร์ ซึ่งทั้งน้ำหนัก แหล่งที่มาของข้อมูลฝึก การใช้พลังงาน และสัญญาอนุญาต ถูกจัดทำเป็นเอกสารครบถ้วน ติดตั้งใช้งานภายในขอบเขตของคุณเอง พร้อมโทเคไนเซอร์ที่สร้างมาสำหรับข้อความภาษาเยอรมันเชิงราชการ และพฤติกรรมการงดตอบที่กระบวนการทำงานซึ่งมีการกำกับดูแลสามารถพึ่งพาได้ นั่นเป็นเป้าหมายที่แคบ และ Aleph Alpha ได้มุ่งเป้าไปที่มันอย่างตั้งใจ

อย่าเลือกอันใดอันหนึ่งโดยอาศัยแถวผลเบนช์มาร์กที่คุณเห็นในโพสต์เปิดตัว ค่า 14 ของ Gemma 4 12B เป็นการวัดที่คนอื่นทำไว้ และคุณตรวจสอบได้ ส่วนค่า 75.5 ของ Kolibri เป็นข้อกล่าวอ้างที่ผู้เขียนเป็นคนระบุ และคนเดียวที่สามารถพิสูจน์ว่ามันเป็นเท็จได้ในตอนนี้คือลูกค้าที่มี H100 สองเครื่องกับคลังเอกสาร

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube