
Kolibri อธิบาย: Aleph Alpha เปิดตัวโมเดลเยอรมัน-อังกฤษขนาด 78B ภายใต้ Apache 2.0
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 218 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Aleph Alpha เปิดตัว Kolibriเมื่อวันที่ 3 ตุลาคม 2026 เป็นโมเดลแบบ mixture-of-experts ขนาด 78.1 พันล้านพารามิเตอร์ ที่เปิดใช้งานพารามิเตอร์ 3.46 พันล้านตัวต่อโทเคนหนึ่งตัว มีหน้าต่างบริบทที่ผ่านการตรวจสอบแล้ว 1,048,576 โทเคน และจัดจำหน่ายพร้อมน้ำหนักโมเดลแบบเต็มบน Hugging Face ภายใต้สัญญาอนุญาต Apache 2.0 ห้องแล็บที่ไฮเดลเบิร์กเผยแพร่มันในวันรวมชาติเยอรมนี พร้อมกับรายงานทางเทคนิค การ์ดโมเดลภาษาทั้งเยอรมันและอังกฤษ และคำอธิบายที่ละเอียดอย่างผิดปกติว่าสิ่งนี้ถูกฝึกมาอย่างไร โมเดลที่ใช้อ้างอิงเปรียบเทียบตลอดเอกสารทั้งหมดของ Aleph Alpha เองคือ Kolibri Origin — รุ่นก่อนหน้าที่มี 30.6 พันล้านพารามิเตอร์และเปิดใช้งาน 3.27 พันล้านพารามิเตอร์ ซึ่งเสร็จสิ้นการฝึกก่อน (pre-training) เมื่อวันที่ 11 มิถุนายน 2026 และไม่เคยเปิดตัวต่อสาธารณะ สองโมเดล ห่างกันสามเดือน และระยะห่างระหว่างทั้งสองคือสิ่งที่น่าสนใจที่สุดในการเปิดตัวครั้งนี้
สิ่งที่ทำให้ Kolibri คุ้มค่าที่จะอ่านอย่างละเอียดไม่ใช่ว่ามันเป็นโมเดลที่แข็งแกร่งที่สุดที่มีอยู่ ในตารางเปรียบเทียบของ Aleph Alpha เอง มันไม่ใช่ และเราจะพูดถึงเรื่องนั้นต่อไป สิ่งที่น่าจับตาคือ ห้องแล็บจากยุโรปได้เปิดตัวโมเดล open-weight ในขนาดนี้เลย โดยมีไปป์ไลน์การฝึก ที่มาของข้อมูล และตัวเลขการใช้พลังงานเผยแพร่ไปพร้อมกัน และกำหนดใบอนุญาตเป็น Apache 2.0 แทนที่จะเป็นใบอนุญาตวิจัยเฉพาะทาง สำหรับทีมที่มีกฎการจัดซื้อจัดจ้างที่เริ่มต้นด้วยคำถามว่า "ข้อมูลไปอยู่ที่ไหน" การรวมกันนั้นคือผลิตภัณฑ์
สเปกชีต และตัวเลขสองตัวที่สำคัญ
ทุกอย่างด้านล่างนี้มาจากการ์ดโมเดลที่ Aleph Alpha เผยแพร่พร้อมกับน้ำหนักโมเดล; ยังไม่มีส่วนใดถูกทำซ้ำโดยอิสระจนถึงตอนนี้ และยังไม่มีแถวของ Kolibri ใน Artificial Analysis ณ เวลาที่เขียนนี้
• พารามิเตอร์ทั้งหมด — 78,103,074,560 โดยมี 3,457,573,120 ที่ทำงานต่อโทเค็น คิดเป็นอัตราส่วนประมาณ 22.6 ต่อ 1
• สถาปัตยกรรม — ทรานส์ฟอร์เมอร์ 50 ชั้น ทุกชั้นเป็น mixture-of-experts โดยแต่ละชั้นมี 384 experts ประกอบด้วย 1 shared และ 6 routed และมีอัตราส่วนผสม 4:1 ระหว่าง sliding-window ต่อ grouped-query attention ตลอดทั้งสแตก
• บริบท — ฝึกที่ 16,384 โทเค็น, ฝึกกลางทางที่ 65,536, และขยายเป็น 262,144 โทเค็นแบบเนทีฟ เนื่องจากการเข้ารหัสตำแหน่งถูกนำไปใช้เฉพาะในเลเยอร์หน้าต่างเลื่อน Aleph Alpha กล่าวว่าหน้าต่างสามารถขยายได้โดยไม่ต้องปรับขนาดตำแหน่ง และได้ตรวจสอบคุณภาพและประสิทธิภาพการให้บริการแล้วสูงถึง 1,048,576 โทเค็น การ์ดแนะนำให้อยู่ที่หรือต่ำกว่า 262,144 สำหรับงานที่ไวต่อเวลาแฝงและสำหรับงานที่ซับซ้อน
• ความแม่นยำ — น้ำหนัก FP8 ในบล็อกขนาด 128×128 พร้อมแอกติเวชันที่ควอนไทซ์แบบไดนามิก ประเมินด้วย KV cache แบบ FP8; embeddings, LM head, นอร์ม และ MoE router ยังคงเป็น bfloat16
• การให้เหตุผล — ระดับความพยายาม 4 ระดับ ได้แก่ ไม่มี ต่ำ ปานกลาง และสูง ตั้งค่าผ่านเทมเพลตแชต
• การเรียกใช้เครื่องมือ — ใช่ แบบ Hermes โดยมีพาร์เซอร์ vLLM ที่มาพร้อมในรีโพซิทอรีเดียวกับเวต
• ภาษา — เยอรมันและอังกฤษ และไม่มีภาษาอื่นอีก สิ่งนี้ถูกระบุไว้ว่าเป็นทางเลือกด้านการออกแบบ มากกว่าจะเป็นการละเว้น
• การฝึก — โทเค็นก่อนการฝึก 20 ล้านล้านโทเค็นบนคลังข้อความสองภาษาที่ผ่านการกรอง โดยประมาณ 62.5 เปอร์เซ็นต์เป็นภาษาอังกฤษ 23.9 เปอร์เซ็นต์เป็นภาษาเยอรมัน และ 13.6 เปอร์เซ็นต์เป็นโค้ด พร้อมด้วยโทเค็นระหว่างการฝึก 3.44 ล้านล้านโทเค็น และ 201 พันล้านโทเค็นสำหรับการขยายบริบทแบบยาว
• การประมวลผล — NVIDIA B200 จำนวน 768 ตัว กระจายอยู่บน 96 โหนด HGX, การพรีเทรน 21 วัน เป็นเวลา 511 ชั่วโมง และ 392,000 ชั่วโมง GPU โดยรายงานไว้ที่ 6.4×10²³ FLOPs การฝึกช่วงกลางเพิ่มอีกห้าวันและ 90,000 ชั่วโมง GPU; การขยายบริบทยาวเพิ่มอีก 13 ชั่วโมงและ 10,000 ชั่วโมง GPU
• พลังงาน — ประมาณ 9.5×10² MWh รวมภาระพลังงานส่วนเพิ่มของศูนย์ข้อมูล ครอบคลุมการฝึกล่วงหน้า การฝึกช่วงกลาง และการฝึกบริบทแบบยาว แต่ไม่รวมการปรับละเอียดแบบมีผู้สอนและการเรียนรู้แบบเสริมกำลัง
• สัญญาอนุญาต — Apache 2.0 ไม่มีเงื่อนไขแนบท้ายเกี่ยวกับการใช้งานที่ยอมรับได้ ไม่มีเกณฑ์จำนวนผู้ใช้งานที่ใช้งานจริงต่อเดือน ไม่มีข้อกำหนดทางการค้าแยกต่างหาก
สองในบรรทัดเหล่านั้นเป็นบรรทัดที่ผู้ซื้อควรอ่านสองครั้ง จำนวนพารามิเตอร์ที่ใช้งานจริงคือสิ่งที่คุณจ่ายตอนอินเฟอเรนซ์ และ 3.46 พันล้านที่ใช้งานจริงจากทั้งหมด 78 พันล้านถือเป็นอัตราส่วนความเบาบางที่สูงมาก — นี่คือเหตุผลทั้งหมดที่โมเดลขนาดนี้จึงสามารถให้บริการได้บน GPU เพียงสองตัว และตัวเลขบริบทระบุไว้ที่ 262,144 แบบเนทีฟ พร้อม 1,048,576 ที่ผ่านการตรวจสอบแล้ว ซึ่งเป็นข้อกล่าวอ้างที่ระมัดระวังมากกว่าคำว่า "บริบท 1M" แบบเหมารวมที่คุณจะเห็นในรายงานส่วนใหญ่เกี่ยวกับการเปิดตัวครั้งนี้

สองรุ่น ห่างกันสามเดือน
Kolibri เป็นโมเดลตัวที่สองจากสิ่งที่ Aleph Alpha เรียกว่า Model Factory ของตน และไทม์ไลน์ที่เผยแพร่ออกมาคือส่วนของการเปิดตัวที่การรายงานข่าวส่วนใหญ่ข้ามไป
งานด้านไปป์ไลน์การฝึกเริ่มต้นในเดือนมกราคม 2026 Kolibri Origin เสร็จสิ้นการฝึกก่อนที่ขนาดเป้าหมายเมื่อวันที่ 11 มิถุนายน 2026 — พารามิเตอร์ทั้งหมด 30.6 พันล้าน, 3.27 พันล้าน, หน้าต่างบริบทขนาด 65,536 โทเคน, โทเคนการฝึก 7.51 ล้านล้าน, 50 เลเยอร์ โดยสองเลเยอร์เป็นแบบ dense และ 48 เลเยอร์เป็น MoE และมีโหมดการให้เหตุผลเดียว มันได้รับการตรวจสอบภายในและไม่เคยเผยแพร่สู่สาธารณะ Kolibri เสร็จสิ้นการฝึกก่อนเมื่อวันที่ 11 กันยายน 2026
• พารามิเตอร์ — รวม 30.6B และแอ็กทีฟ 3.27B เทียบกับรวม 78.1B และแอ็กทีฟ 3.46B
• บริบท — 8,192 โทเคนของบริบทก่อนการฝึกบน Origin เทียบกับ 16,384 บน Kolibri โดยสิ้นสุดที่ 262,144 แบบเนทีฟ
• ข้อมูล — 7.51 ล้านล้านโทเคนพรีเทรนบน Origin เทียบกับ 20 ล้านล้าน ซึ่งดึงมาจากคลังดิบที่มีมากกว่า 200 ล้านล้านที่ไปป์ไลน์กรอง ลบข้อมูลซ้ำ และคัดสรรแล้ว
• สถาปัตยกรรม — เลเยอร์ dense สองเลเยอร์บวกกับเลเยอร์ MoE 48 เลเยอร์บน Origin เทียบกับเลเยอร์ MoE 50 เลเยอร์ โดยมีการออกแบบ attention ที่เปลี่ยนแปลงไป จำนวน expert สามเท่า sparsity ที่สูงขึ้น และอัลกอริทึม routing ที่ถูกแทนที่
• การให้เหตุผล — หนึ่งโหมดบน Origin เทียบกับไม่มี, ต่ำ, ปานกลาง และสูงบน Kolibri
• วางจำหน่าย — ไม่มีการเปิดตัวสู่สาธารณะสำหรับ Origin โดย Kolibri จะวางจำหน่ายในวันที่ 3 ตุลาคม 2026
ตัวเลขที่ขยับมากที่สุดคือตัวเลขของชุดงาน ซึ่งใช้ชุดประเมินเดียวกันให้คะแนนทั้งสองโมเดล ในค่าเฉลี่ยภาษาเยอรมันของชุดหลังการฝึก Origin ได้ 46.4 และ Kolibri ได้ 70.8; ในค่าเฉลี่ยภาษาอังกฤษ 54.1 เทียบกับ 75.5 บน AIME 2025 ภาษาเยอรมัน 73.5 เทียบกับ 87.5 บนเบนช์มาร์กตัวแทนลูกค้าภายในที่ผู้ขายเผยแพร่เป็นชุดเฉพาะอุตสาหกรรม ชุดซัพพลายเออร์ยานยนต์เพิ่มจาก 0.72 เป็น 0.99 เซมิคอนดักเตอร์จาก 0.35 เป็น 0.80 ภาครัฐของเยอรมนีจาก 0.54 เป็น 0.75 เทคโนโลยีระบบขับเคลื่อนอุตสาหกรรมจาก 0.31 เป็น 0.60 และการบินและอวกาศจาก 0.14 เป็น 0.59
ตัวเลขเฉพาะอุตสาหกรรมภายในเหล่านั้นดำเนินการโดยผู้ขาย บนชุดการประเมินที่ผู้ขายสร้างขึ้นซึ่งออกแบบโดยอิงกับลูกค้าของผู้ขาย ดังนั้นให้มองว่ามันเป็นคำอธิบายเจตนามากกว่าคะแนน จุดประสงค์ของการเผยแพร่คือเพื่ออธิบายว่าโมเดลนี้ถูกปรับให้เหมาะกับอะไร: ไม่ใช่ตารางจัดอันดับ แต่เป็นชุดเอกสารในอุตสาหกรรมที่มีการกำกับดูแล

ภาษาเยอรมันเป็นการตัดสินใจด้านการออกแบบในที่นี้ ไม่ใช่แท็กภาษา
การ์ดโมเดล “หลายภาษา” ส่วนใหญ่หมายถึงส่วนผสมการฝึกที่บังเอิญมีภาษาเยอรมันรวมอยู่ด้วยบางส่วน อันนี้กลับสร้างกันคนละทาง และการ์ดก็ระบุกลไกไว้อย่างเจาะจงชัดเจน
Aleph Alpha พบจากการทดลองกับโมเดลตัวแทนขนาดเล็กว่า ข้อมูลภาษาเยอรมันประมาณ 20 เปอร์เซ็นต์ในส่วนผสมให้ผลลัพธ์ที่ดีที่สุด ซึ่งสำหรับการรันที่ใช้โทเคน 20 ล้านล้านโทเคน หมายถึงการต้องหาโทเคนภาษาเยอรมันให้ได้ 4 ล้านล้านโทเคน ชุดข้อมูลภาษาเยอรมันแบบเปิดที่ผ่านการขจัดข้อมูลซ้ำและกรองแล้วให้มาเพียง 390 พันล้านโทเคน ซึ่งต่ำกว่าเป้าหมายถึงหนึ่งหลัก บริษัทปิดช่องว่างนี้ด้วยสามวิธี ได้แก่ การปรับแต่งตัวกรอง Common Crawl ให้เฉพาะเจาะจงกับภาษาเยอรมันใหม่ ซึ่งให้โทเคนออร์แกนิกที่ไม่ซ้ำกัน 1.3 ล้านล้านโทเคน; การเขียนเอกสารภาษาเยอรมันที่มีอยู่ใหม่ให้เป็นรายการแบบสารานุกรม บทสนทนาแบบถาม-ตอบ และท่อนข้อความ ซึ่งให้เพิ่มอีกประมาณ 1 ล้านล้านโทเคน และกลายเป็นแหล่งภาษาเยอรมันที่ใหญ่ที่สุดเพียงแหล่งเดียว; และการแปล ซึ่งใช้เฉพาะใน Kolibri Origin และตัดออกสำหรับ Kolibri ภาษาเยอรมันลงเอยเป็นพูลโทเคนที่ไม่ซ้ำกัน 2.4 ล้านล้านโทเคน โดย 80 เปอร์เซ็นต์ของพูลนี้ถูกคัดสรรหรือสร้างขึ้นภายในองค์กร และปรากฏอยู่ที่ 21.3 เปอร์เซ็นต์ของโทเคนก่อนการฝึกหลังการอัปแซมปลิง
รายละเอียดเกี่ยวกับตัวกรองนี้ควรค่าแก่การยกมาอ้าง เพราะมันเป็นแบบอย่างของสิ่งที่ปรากฏให้เห็นเฉพาะในแล็บที่ฝึกโมเดลด้วยข้อมูลภาษาเยอรมันจริง ๆ เท่านั้น ไปป์ไลน์ข้อมูลภาษามาตรฐานจะตัดเอกสารที่มีคำยาวมากเกินไปออก แต่ร้อยแก้วทางราชการของเยอรมันมักมีความยาวคำเฉลี่ยเกินขอบเขตที่กำหนดไว้สำหรับภาษาอังกฤษเป็นประจำ ดังนั้นการตั้งค่าเริ่มต้นจึงลบรูปแบบภาษาที่หน่วยงานรัฐใช้เขียนออกไปอย่างเงียบ ๆ ผลกระทบเชิงพาณิชย์ที่เห็นได้ชัดคือ โมเดลที่ฝึกด้วยตัวกรองภาษาอังกฤษแบบสำเร็จรูปจะแทบไม่มีคลังคำศัพท์ทางกฎหมายและการบริหารของเยอรมันให้พูดถึงเลย และไม่มีเบนช์มาร์กใดจะบอกคุณเรื่องนี้ได้
Tokenizer ก็ได้รับการจัดการแบบเดียวกัน Aleph Alpha ได้ฝึก tokenizer สองภาษาเยอรมัน-อังกฤษที่มีคลังคำ 128,000 โทเคน โดยใช้วิธีใหม่ที่บริษัทเรียกว่า UniBPE ซึ่งคงการรวมแบบล่างขึ้นบนของ byte-pair encoding ไว้ แต่เลือกการรวมด้วยวัตถุประสงค์แบบ unigram บนข้อความเว็บภาษาเยอรมัน รายงานค่าเฉลี่ย 4.90 ไบต์ต่อโทเคน นำหน้า GPT-5 ที่ 4.35, Gemini ที่ 4.13, Qwen3.5–3.8 ที่ 4.17, GLM 5.3 ที่ 3.93, DeepSeek V4 ที่ 3.72 และ Kimi K3 ที่ 3.28 — ตัวเลขทั้งหมดที่ผู้ขายรายงานในการเปรียบเทียบของผู้ขายเอง ข้อความต่อโทเคนที่มากขึ้นหมายถึงโทเคนต่องานที่น้อยลง ซึ่งเป็นผลโดยตรงต่อต้นทุนการอนุมาน มากกว่าที่จะเป็นคำกล่าวอ้างด้านคุณภาพ และเป็นความได้เปรียบด้านประสิทธิภาพแบบที่ทบต้นเมื่อใช้กับปริมาณงานประมวลผลเอกสาร
สิ่งที่ตารางของผู้ขายไม่ได้ตัดสิน
Aleph Alpha เผยแพร่บทเปรียบเทียบหลังการฝึกที่ครอบคลุมสิบสี่โมเดล และมันมีประโยชน์กว่าตารางเปิดตัวส่วนใหญ่ เพราะไม่ประจบประแจงฝ่ายที่ถูกพูดถึง
บนฮาร์เนสเดียวกัน โดยตั้งค่า reasoning effort ของ Kolibri ไว้ที่ระดับสูง Qwen3.8 27B ทำคะแนนเฉลี่ยภาษาอังกฤษ 80.2 เทียบกับ 75.5 ของ Kolibri และทำคะแนนเฉลี่ยภาษาเยอรมัน 79.9 เทียบกับ 70.8 นอกจากนี้ยังนำใน GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified และเบนช์มาร์กบริบทขนาดยาวทั้งสองรายการ Nemotron 3 Super 120B-A12B ทำคะแนนเฉลี่ยภาษาอังกฤษ 73.0 เทียบกับ 75.5 ของ Kolibri — ซึ่งใกล้กว่า และนำใน AIME 2025 ส่วน Gemma 4 26B-A4B IT ทำคะแนน 71.9 และ 66.3 บนค่าเฉลี่ยทั้งสอง
ดังนั้น สรุปอย่างตรงไปตรงมาของการเปิดตัวครั้งนี้จึงไม่ใช่ “ระดับแนวหน้าสุด” แต่เป็นว่า Kolibri อยู่ตรงกลางของกลุ่มโมเดลที่เปิดใช้งานระหว่างสามพันล้านถึงหนึ่งหมื่นสองพันล้านพารามิเตอร์ต่อโทเคน ว่าโมเดลนี้เอาชนะโมเดลที่เล็กกว่ามากได้อย่างชัดเจน และว่าโมเดลนี้แพ้โมเดลแบบ dense ขนาด 27 พันล้านพารามิเตอร์จาก Alibaba ในแถวส่วนใหญ่ของตารางของตัวเอง ขณะที่เปิดใช้งานพารามิเตอร์เพียงประมาณหนึ่งในแปด กรอบการนำเสนอของ Aleph Alpha สำหรับเรื่องนี้คือพรมแดน Pareto ของคุณภาพเทียบกับจำนวนโทเคนที่ถอดรหัสได้ต่อวินาทีต่อ GPU — ไม่มีโมเดลเปรียบเทียบตัวใดที่ให้คุณภาพมากกว่าเมื่อต้นทุนการให้บริการเท่ากัน หรือให้คุณภาพเท่ากันเมื่อต้นทุนต่ำกว่า นั่นคือข้อกล่าวอ้างที่ต้องตรวจสอบ และมันเป็นข้อกล่าวอ้างเชิงเศรษฐศาสตร์การให้บริการ ไม่ใช่ข้อกล่าวอ้างเชิงความสามารถ
ไม่มีตัวเลขใดในนี้ที่ได้รับการตรวจสอบอย่างอิสระ ไม่มีรายการ Artificial Analysis สำหรับ Kolibri ไม่มีการทำซ้ำกรอบการประเมินโดยบุคคลที่สาม และเบนช์มาร์กเฉพาะด้านก็สร้างขึ้นโดยผู้ขาย การเปรียบเทียบยังเอื้อประโยชน์ต่อ Kolibri ในเชิงโครงสร้างในด้านหนึ่ง และไม่เอื้อประโยชน์ในอีกด้านหนึ่ง: โมเดลทั้งสิบสี่ตัวถูกรันผ่านฮาร์เนสของ Aleph Alpha เองด้วยพรอมป์และค่าตั้ง few-shot ที่เหมือนกัน ซึ่งเป็นวิธีที่ถูกต้องในการทำ แต่ก็ยังคงเป็นฮาร์เนสของแล็บเดียว ให้ถือว่าตัวเลขทุกตัวในส่วนนี้เป็นข้อมูลที่ผู้ขายรายงาน จนกว่าจะมีคนอื่นรันมัน

สิ่งที่คุณต้องมีเพื่อรันมัน
Kolibri ไม่ใช่โมเดลที่คุณลองรันบนแล็ปท็อปได้ น้ำหนัก FP8 มีขนาดหน่วยความจำของโมเดลประมาณ 78 GB และการ์ดขั้นต่ำคือการ์ด A100 80 GB สองใบ, H100 SXM5 สองใบ, H200 หนึ่งใบ, B200 หนึ่งใบ หรือ B300 หนึ่งใบ; การกำหนดค่าที่แนะนำคือ H100 SXM5 สองใบ, H200 สองใบ, B200 หนึ่งใบ หรือ B300 หนึ่งใบ
การให้บริการมันหมายถึงการติดตั้งแพ็กเกจ aleph-alpha-inference ซึ่งให้ปลั๊กอิน Kolibri vLLM และตรึงเวอร์ชัน vLLM ที่รองรับ หรือดึงอิมเมจคอนเทนเนอร์ ghcr.io/aleph-alpha/aleph-alpha-inference จากจุดนั้นเป็นการเรียกใช้ vLLM มาตรฐานพร้อมกับ FP8 KV cache, ตัวแยกวิเคราะห์เหตุผล Kolibri และตัวแยกวิเคราะห์การเรียกเครื่องมือ Kolibri บริบทที่เกิน 262,144 โทเคนต้องใช้แฟล็ก maximum-model-length ที่ชัดเจนและการโอเวอร์ไรด์ position-embedding พารามิเตอร์การสุ่มตัวอย่างที่แนะนำคือ temperature 1.0, top-p 0.97 และ top-k 128
พื้นผิว API เข้ากันได้กับ OpenAI ซึ่งสำคัญกว่าที่ชื่อฟังดู: reasoning effort ถูกส่งผ่าน chat template ในรูปแบบค่า reasoning_effort และการเรียกใช้เครื่องมือถูกส่งออกมาในฟิลด์ tools มาตรฐาน ทีมที่ใช้รูปแบบ chat-completions อยู่แล้วสามารถชี้โค้ดที่มีอยู่ไปยัง endpoint ของ Kolibri บนเครื่องในอาคารของตนเองได้โดยไม่ต้องมีชั้น wrapper
สิ่งที่ Kolibri ยังไม่มี
มีสี่สิ่งที่ขาดหายไปซึ่งควรพูดให้ชัด เพราะการรายงานข่าวการเปิดตัวมักมองข้ามสิ่งเหล่านี้ไป
• ไม่มีการประเมินที่เป็นอิสระ Artificial Analysis ไม่มีหน้าโมเดลสำหรับ Kolibri และไม่มีบุคคลที่สามรายใดเผยแพร่การทำซ้ำตารางเบนช์มาร์กของผู้ขาย
• ไม่มี endpoint ที่โฮสต์จากผู้ขาย การเผยแพร่นี้คือเวตพร้อมรายงานทางเทคนิค; ไม่มี Aleph Alpha API SKU สำหรับ Kolibri ในเอกสารที่เผยแพร่พร้อมกับโมเดล
• ไม่มีเส้นทางบน OrcaRouter และไม่มีบน aggregator ใด ๆ ที่เราจะเอ่ยชื่อ เราตรวจสอบแคตตาล็อกภายใต้ทุกการสะกดของคำนำหน้าผู้ขายและชื่อโมเดล และ Kolibri ไม่ได้อยู่ที่นั่น — ดังนั้นหากคุณต้องการเรียกใช้มัน คุณต้องดาวน์โหลด 78 GB และรัน endpoint ของ vLLM ด้วยตัวเอง เรายอมพูดแบบนั้นมากกว่าจะบอกเป็นนัยว่าเราให้บริการมัน
• ไม่มีอินพุตแบบหลายรูปแบบ ข้อความเข้า ข้อความออก สองภาษา นั่นคือข้อแลกเปลี่ยนที่แล็บทำ เพื่อให้ได้ความลึกมากกว่าความกว้าง และสำหรับการนำไปใช้ประมวลผลเอกสารแล้ว มันน่าจะเป็นตัวเลือกที่ถูกต้อง แต่มันก็เป็นขอบเขตที่แท้จริง
หากสิ่งที่คุณต้องการจริง ๆ ในวันนี้คือโมเดล mixture-of-experts ขนาดเล็กที่เรียกใช้ได้โดยไม่ต้องซื้อ GPU สองตัว ระดับ Gemma 4 MoE ก็เป็นสิ่งที่ใกล้เคียงที่สุดที่มีอยู่แล้วบน endpoint แบบ routed ในราคา $0.06 ต่อล้านโทเคนอินพุต และ $0.33 ต่อล้านโทเคนเอาต์พุตสำหรับรุ่น 26B-A4B พร้อมหน้าต่าง 262,144 โทเคน สำหรับใครก็ตามที่กำลังชั่งน้ำหนักระหว่างการติดตั้งแบบ self-hosted ขนาด 78B ที่เป็น sovereign deployment กับการใช้ตัวนี้ การเปรียบเทียบที่มีประโยชน์ไม่ใช่แถวใน benchmark แต่คือ VRAM 78 GB และบทสนทนาเรื่องการจัดซื้อ เทียบกับค่าใช้จ่ายรายโทเคน OrcaRouter ให้บริการระดับนั้นผ่านคีย์เดียวที่เข้ากันได้กับ OpenAI โดยส่งต่อราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่มใด ๆ ซึ่งเป็นวิธีที่ประหยัดในการดูว่าภาระงานนั้นคุ้มค่ากับการเป็นเจ้าของฮาร์ดแวร์หรือไม่
Kolibri เองคือสิ่งประดิษฐ์ที่น่าสนใจกว่า โมเดลเยอรมัน-อังกฤษขนาด 78 พันล้านพารามิเตอร์ภายใต้ Apache 2.0 พร้อมไปป์ไลน์ข้อมูล วิธีการโทเคไนเซอร์ ตัวเลขพลังงาน และเรื่องราวการวนซ้ำสามเดือนที่เผยแพร่เคียงข้างเวต ถือเป็นการเปิดตัวที่แตกต่างจากการปล่อยเวตแบบเดิมๆ — การเปิดเผยข้อมูลเป็นส่วนหนึ่งของผลิตภัณฑ์ ไม่ใช่บล็อกโพสต์ที่เขียนถึงมัน ข้ออ้างเรื่อง Pareto จะยังยืนได้หรือไม่ ตอนนี้เป็นคำถามของคนที่มี H100 สองตัวกับนาฬิกาจับเวลา และคำตอบจะไม่มาจากใครก็ตามที่เขียนโมเดลการ์ด
