สร้างการ์ดฮีโร่สำหรับคำอธิบายของ Kolibri โดยมีหัวข้อว่า 'Kolibri: โมเดลน้ำหนักเปิด 78B จากเยอรมนี' พร้อมบรรทัดย่อย '78B ทั้งหมด / 3.46B ที่ใช้งาน / บริบท 1M โทเคน / Apache 2.0' และไอคอนเส้นแบนสามไอคอน: นกฮัมมิงเบิร์ด กองเลเยอร์ และแม่กุญแจทับบนเอกสาร โลโก้ OrcaRouter อยู่ในแถบด้านล่างของภาพอาร์ตเวิร์ก
Guides & Insights

Kolibri อธิบาย: Aleph Alpha เปิดตัวโมเดลเยอรมัน-อังกฤษขนาด 78B ภายใต้ Apache 2.0

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Aleph Alpha เปิดตัว Kolibriเมื่อวันที่ 3 ตุลาคม 2026 เป็นโมเดลแบบ mixture-of-experts ขนาด 78.1 พันล้านพารามิเตอร์ ที่เปิดใช้งานพารามิเตอร์ 3.46 พันล้านตัวต่อโทเคนหนึ่งตัว มีหน้าต่างบริบทที่ผ่านการตรวจสอบแล้ว 1,048,576 โทเคน และจัดจำหน่ายพร้อมน้ำหนักโมเดลแบบเต็มบน Hugging Face ภายใต้สัญญาอนุญาต Apache 2.0 ห้องแล็บที่ไฮเดลเบิร์กเผยแพร่มันในวันรวมชาติเยอรมนี พร้อมกับรายงานทางเทคนิค การ์ดโมเดลภาษาทั้งเยอรมันและอังกฤษ และคำอธิบายที่ละเอียดอย่างผิดปกติว่าสิ่งนี้ถูกฝึกมาอย่างไร โมเดลที่ใช้อ้างอิงเปรียบเทียบตลอดเอกสารทั้งหมดของ Aleph Alpha เองคือ Kolibri Origin — รุ่นก่อนหน้าที่มี 30.6 พันล้านพารามิเตอร์และเปิดใช้งาน 3.27 พันล้านพารามิเตอร์ ซึ่งเสร็จสิ้นการฝึกก่อน (pre-training) เมื่อวันที่ 11 มิถุนายน 2026 และไม่เคยเปิดตัวต่อสาธารณะ สองโมเดล ห่างกันสามเดือน และระยะห่างระหว่างทั้งสองคือสิ่งที่น่าสนใจที่สุดในการเปิดตัวครั้งนี้

สิ่งที่ทำให้ Kolibri คุ้มค่าที่จะอ่านอย่างละเอียดไม่ใช่ว่ามันเป็นโมเดลที่แข็งแกร่งที่สุดที่มีอยู่ ในตารางเปรียบเทียบของ Aleph Alpha เอง มันไม่ใช่ และเราจะพูดถึงเรื่องนั้นต่อไป สิ่งที่น่าจับตาคือ ห้องแล็บจากยุโรปได้เปิดตัวโมเดล open-weight ในขนาดนี้เลย โดยมีไปป์ไลน์การฝึก ที่มาของข้อมูล และตัวเลขการใช้พลังงานเผยแพร่ไปพร้อมกัน และกำหนดใบอนุญาตเป็น Apache 2.0 แทนที่จะเป็นใบอนุญาตวิจัยเฉพาะทาง สำหรับทีมที่มีกฎการจัดซื้อจัดจ้างที่เริ่มต้นด้วยคำถามว่า "ข้อมูลไปอยู่ที่ไหน" การรวมกันนั้นคือผลิตภัณฑ์

สเปกชีต และตัวเลขสองตัวที่สำคัญ

ทุกอย่างด้านล่างนี้มาจากการ์ดโมเดลที่ Aleph Alpha เผยแพร่พร้อมกับน้ำหนักโมเดล; ยังไม่มีส่วนใดถูกทำซ้ำโดยอิสระจนถึงตอนนี้ และยังไม่มีแถวของ Kolibri ใน Artificial Analysis ณ เวลาที่เขียนนี้

• พารามิเตอร์ทั้งหมด — 78,103,074,560 โดยมี 3,457,573,120 ที่ทำงานต่อโทเค็น คิดเป็นอัตราส่วนประมาณ 22.6 ต่อ 1

• สถาปัตยกรรม — ทรานส์ฟอร์เมอร์ 50 ชั้น ทุกชั้นเป็น mixture-of-experts โดยแต่ละชั้นมี 384 experts ประกอบด้วย 1 shared และ 6 routed และมีอัตราส่วนผสม 4:1 ระหว่าง sliding-window ต่อ grouped-query attention ตลอดทั้งสแตก

• บริบท — ฝึกที่ 16,384 โทเค็น, ฝึกกลางทางที่ 65,536, และขยายเป็น 262,144 โทเค็นแบบเนทีฟ เนื่องจากการเข้ารหัสตำแหน่งถูกนำไปใช้เฉพาะในเลเยอร์หน้าต่างเลื่อน Aleph Alpha กล่าวว่าหน้าต่างสามารถขยายได้โดยไม่ต้องปรับขนาดตำแหน่ง และได้ตรวจสอบคุณภาพและประสิทธิภาพการให้บริการแล้วสูงถึง 1,048,576 โทเค็น การ์ดแนะนำให้อยู่ที่หรือต่ำกว่า 262,144 สำหรับงานที่ไวต่อเวลาแฝงและสำหรับงานที่ซับซ้อน

• ความแม่นยำ — น้ำหนัก FP8 ในบล็อกขนาด 128×128 พร้อมแอกติเวชันที่ควอนไทซ์แบบไดนามิก ประเมินด้วย KV cache แบบ FP8; embeddings, LM head, นอร์ม และ MoE router ยังคงเป็น bfloat16

• การให้เหตุผล — ระดับความพยายาม 4 ระดับ ได้แก่ ไม่มี ต่ำ ปานกลาง และสูง ตั้งค่าผ่านเทมเพลตแชต

• การเรียกใช้เครื่องมือ — ใช่ แบบ Hermes โดยมีพาร์เซอร์ vLLM ที่มาพร้อมในรีโพซิทอรีเดียวกับเวต

• ภาษา — เยอรมันและอังกฤษ และไม่มีภาษาอื่นอีก สิ่งนี้ถูกระบุไว้ว่าเป็นทางเลือกด้านการออกแบบ มากกว่าจะเป็นการละเว้น

• การฝึก — โทเค็นก่อนการฝึก 20 ล้านล้านโทเค็นบนคลังข้อความสองภาษาที่ผ่านการกรอง โดยประมาณ 62.5 เปอร์เซ็นต์เป็นภาษาอังกฤษ 23.9 เปอร์เซ็นต์เป็นภาษาเยอรมัน และ 13.6 เปอร์เซ็นต์เป็นโค้ด พร้อมด้วยโทเค็นระหว่างการฝึก 3.44 ล้านล้านโทเค็น และ 201 พันล้านโทเค็นสำหรับการขยายบริบทแบบยาว

• การประมวลผล — NVIDIA B200 จำนวน 768 ตัว กระจายอยู่บน 96 โหนด HGX, การพรีเทรน 21 วัน เป็นเวลา 511 ชั่วโมง และ 392,000 ชั่วโมง GPU โดยรายงานไว้ที่ 6.4×10²³ FLOPs การฝึกช่วงกลางเพิ่มอีกห้าวันและ 90,000 ชั่วโมง GPU; การขยายบริบทยาวเพิ่มอีก 13 ชั่วโมงและ 10,000 ชั่วโมง GPU

• พลังงาน — ประมาณ 9.5×10² MWh รวมภาระพลังงานส่วนเพิ่มของศูนย์ข้อมูล ครอบคลุมการฝึกล่วงหน้า การฝึกช่วงกลาง และการฝึกบริบทแบบยาว แต่ไม่รวมการปรับละเอียดแบบมีผู้สอนและการเรียนรู้แบบเสริมกำลัง

• สัญญาอนุญาต — Apache 2.0 ไม่มีเงื่อนไขแนบท้ายเกี่ยวกับการใช้งานที่ยอมรับได้ ไม่มีเกณฑ์จำนวนผู้ใช้งานที่ใช้งานจริงต่อเดือน ไม่มีข้อกำหนดทางการค้าแยกต่างหาก

สองในบรรทัดเหล่านั้นเป็นบรรทัดที่ผู้ซื้อควรอ่านสองครั้ง จำนวนพารามิเตอร์ที่ใช้งานจริงคือสิ่งที่คุณจ่ายตอนอินเฟอเรนซ์ และ 3.46 พันล้านที่ใช้งานจริงจากทั้งหมด 78 พันล้านถือเป็นอัตราส่วนความเบาบางที่สูงมาก — นี่คือเหตุผลทั้งหมดที่โมเดลขนาดนี้จึงสามารถให้บริการได้บน GPU เพียงสองตัว และตัวเลขบริบทระบุไว้ที่ 262,144 แบบเนทีฟ พร้อม 1,048,576 ที่ผ่านการตรวจสอบแล้ว ซึ่งเป็นข้อกล่าวอ้างที่ระมัดระวังมากกว่าคำว่า "บริบท 1M" แบบเหมารวมที่คุณจะเห็นในรายงานส่วนใหญ่เกี่ยวกับการเปิดตัวครั้งนี้

Generated single-column scoreboard for Kolibri with six rows: total parameters 78.1B, active per token 3.46B, context 262,144 native and 1M validated, licence Apache 2.0, independent score 'none published', and deployment floor 2x H100 80GB. The footer reads 'All figures vendor-reported from the model card; no independent evaluation yet.'

สองรุ่น ห่างกันสามเดือน

Kolibri เป็นโมเดลตัวที่สองจากสิ่งที่ Aleph Alpha เรียกว่า Model Factory ของตน และไทม์ไลน์ที่เผยแพร่ออกมาคือส่วนของการเปิดตัวที่การรายงานข่าวส่วนใหญ่ข้ามไป

งานด้านไปป์ไลน์การฝึกเริ่มต้นในเดือนมกราคม 2026 Kolibri Origin เสร็จสิ้นการฝึกก่อนที่ขนาดเป้าหมายเมื่อวันที่ 11 มิถุนายน 2026 — พารามิเตอร์ทั้งหมด 30.6 พันล้าน, 3.27 พันล้าน, หน้าต่างบริบทขนาด 65,536 โทเคน, โทเคนการฝึก 7.51 ล้านล้าน, 50 เลเยอร์ โดยสองเลเยอร์เป็นแบบ dense และ 48 เลเยอร์เป็น MoE และมีโหมดการให้เหตุผลเดียว มันได้รับการตรวจสอบภายในและไม่เคยเผยแพร่สู่สาธารณะ Kolibri เสร็จสิ้นการฝึกก่อนเมื่อวันที่ 11 กันยายน 2026

• พารามิเตอร์ — รวม 30.6B และแอ็กทีฟ 3.27B เทียบกับรวม 78.1B และแอ็กทีฟ 3.46B

• บริบท — 8,192 โทเคนของบริบทก่อนการฝึกบน Origin เทียบกับ 16,384 บน Kolibri โดยสิ้นสุดที่ 262,144 แบบเนทีฟ

• ข้อมูล — 7.51 ล้านล้านโทเคนพรีเทรนบน Origin เทียบกับ 20 ล้านล้าน ซึ่งดึงมาจากคลังดิบที่มีมากกว่า 200 ล้านล้านที่ไปป์ไลน์กรอง ลบข้อมูลซ้ำ และคัดสรรแล้ว

• สถาปัตยกรรม — เลเยอร์ dense สองเลเยอร์บวกกับเลเยอร์ MoE 48 เลเยอร์บน Origin เทียบกับเลเยอร์ MoE 50 เลเยอร์ โดยมีการออกแบบ attention ที่เปลี่ยนแปลงไป จำนวน expert สามเท่า sparsity ที่สูงขึ้น และอัลกอริทึม routing ที่ถูกแทนที่

• การให้เหตุผล — หนึ่งโหมดบน Origin เทียบกับไม่มี, ต่ำ, ปานกลาง และสูงบน Kolibri

• วางจำหน่าย — ไม่มีการเปิดตัวสู่สาธารณะสำหรับ Origin โดย Kolibri จะวางจำหน่ายในวันที่ 3 ตุลาคม 2026

ตัวเลขที่ขยับมากที่สุดคือตัวเลขของชุดงาน ซึ่งใช้ชุดประเมินเดียวกันให้คะแนนทั้งสองโมเดล ในค่าเฉลี่ยภาษาเยอรมันของชุดหลังการฝึก Origin ได้ 46.4 และ Kolibri ได้ 70.8; ในค่าเฉลี่ยภาษาอังกฤษ 54.1 เทียบกับ 75.5 บน AIME 2025 ภาษาเยอรมัน 73.5 เทียบกับ 87.5 บนเบนช์มาร์กตัวแทนลูกค้าภายในที่ผู้ขายเผยแพร่เป็นชุดเฉพาะอุตสาหกรรม ชุดซัพพลายเออร์ยานยนต์เพิ่มจาก 0.72 เป็น 0.99 เซมิคอนดักเตอร์จาก 0.35 เป็น 0.80 ภาครัฐของเยอรมนีจาก 0.54 เป็น 0.75 เทคโนโลยีระบบขับเคลื่อนอุตสาหกรรมจาก 0.31 เป็น 0.60 และการบินและอวกาศจาก 0.14 เป็น 0.59

ตัวเลขเฉพาะอุตสาหกรรมภายในเหล่านั้นดำเนินการโดยผู้ขาย บนชุดการประเมินที่ผู้ขายสร้างขึ้นซึ่งออกแบบโดยอิงกับลูกค้าของผู้ขาย ดังนั้นให้มองว่ามันเป็นคำอธิบายเจตนามากกว่าคะแนน จุดประสงค์ของการเผยแพร่คือเพื่ออธิบายว่าโมเดลนี้ถูกปรับให้เหมาะกับอะไร: ไม่ใช่ตารางจัดอันดับ แต่เป็นชุดเอกสารในอุตสาหกรรมที่มีการกำกับดูแล

Screenshot of Aleph Alpha's newsroom post 'Kolibri Has Landed: A Sovereign Open-Weight Model', showing the opening lines dating the release to the Day of German Reunification, describing Kolibri as an English-German mixture-of-experts transformer with 78B total and 3B active parameters, context lengths up to 1M tokens, full weights on Hugging Face under Apache 2.0, and the paragraph on Kolibri Origin as the 30B total, 3B active predecessor with a 65k context window.

ภาษาเยอรมันเป็นการตัดสินใจด้านการออกแบบในที่นี้ ไม่ใช่แท็กภาษา

การ์ดโมเดล “หลายภาษา” ส่วนใหญ่หมายถึงส่วนผสมการฝึกที่บังเอิญมีภาษาเยอรมันรวมอยู่ด้วยบางส่วน อันนี้กลับสร้างกันคนละทาง และการ์ดก็ระบุกลไกไว้อย่างเจาะจงชัดเจน

Aleph Alpha พบจากการทดลองกับโมเดลตัวแทนขนาดเล็กว่า ข้อมูลภาษาเยอรมันประมาณ 20 เปอร์เซ็นต์ในส่วนผสมให้ผลลัพธ์ที่ดีที่สุด ซึ่งสำหรับการรันที่ใช้โทเคน 20 ล้านล้านโทเคน หมายถึงการต้องหาโทเคนภาษาเยอรมันให้ได้ 4 ล้านล้านโทเคน ชุดข้อมูลภาษาเยอรมันแบบเปิดที่ผ่านการขจัดข้อมูลซ้ำและกรองแล้วให้มาเพียง 390 พันล้านโทเคน ซึ่งต่ำกว่าเป้าหมายถึงหนึ่งหลัก บริษัทปิดช่องว่างนี้ด้วยสามวิธี ได้แก่ การปรับแต่งตัวกรอง Common Crawl ให้เฉพาะเจาะจงกับภาษาเยอรมันใหม่ ซึ่งให้โทเคนออร์แกนิกที่ไม่ซ้ำกัน 1.3 ล้านล้านโทเคน; การเขียนเอกสารภาษาเยอรมันที่มีอยู่ใหม่ให้เป็นรายการแบบสารานุกรม บทสนทนาแบบถาม-ตอบ และท่อนข้อความ ซึ่งให้เพิ่มอีกประมาณ 1 ล้านล้านโทเคน และกลายเป็นแหล่งภาษาเยอรมันที่ใหญ่ที่สุดเพียงแหล่งเดียว; และการแปล ซึ่งใช้เฉพาะใน Kolibri Origin และตัดออกสำหรับ Kolibri ภาษาเยอรมันลงเอยเป็นพูลโทเคนที่ไม่ซ้ำกัน 2.4 ล้านล้านโทเคน โดย 80 เปอร์เซ็นต์ของพูลนี้ถูกคัดสรรหรือสร้างขึ้นภายในองค์กร และปรากฏอยู่ที่ 21.3 เปอร์เซ็นต์ของโทเคนก่อนการฝึกหลังการอัปแซมปลิง

รายละเอียดเกี่ยวกับตัวกรองนี้ควรค่าแก่การยกมาอ้าง เพราะมันเป็นแบบอย่างของสิ่งที่ปรากฏให้เห็นเฉพาะในแล็บที่ฝึกโมเดลด้วยข้อมูลภาษาเยอรมันจริง ๆ เท่านั้น ไปป์ไลน์ข้อมูลภาษามาตรฐานจะตัดเอกสารที่มีคำยาวมากเกินไปออก แต่ร้อยแก้วทางราชการของเยอรมันมักมีความยาวคำเฉลี่ยเกินขอบเขตที่กำหนดไว้สำหรับภาษาอังกฤษเป็นประจำ ดังนั้นการตั้งค่าเริ่มต้นจึงลบรูปแบบภาษาที่หน่วยงานรัฐใช้เขียนออกไปอย่างเงียบ ๆ ผลกระทบเชิงพาณิชย์ที่เห็นได้ชัดคือ โมเดลที่ฝึกด้วยตัวกรองภาษาอังกฤษแบบสำเร็จรูปจะแทบไม่มีคลังคำศัพท์ทางกฎหมายและการบริหารของเยอรมันให้พูดถึงเลย และไม่มีเบนช์มาร์กใดจะบอกคุณเรื่องนี้ได้

Tokenizer ก็ได้รับการจัดการแบบเดียวกัน Aleph Alpha ได้ฝึก tokenizer สองภาษาเยอรมัน-อังกฤษที่มีคลังคำ 128,000 โทเคน โดยใช้วิธีใหม่ที่บริษัทเรียกว่า UniBPE ซึ่งคงการรวมแบบล่างขึ้นบนของ byte-pair encoding ไว้ แต่เลือกการรวมด้วยวัตถุประสงค์แบบ unigram บนข้อความเว็บภาษาเยอรมัน รายงานค่าเฉลี่ย 4.90 ไบต์ต่อโทเคน นำหน้า GPT-5 ที่ 4.35, Gemini ที่ 4.13, Qwen3.5–3.8 ที่ 4.17, GLM 5.3 ที่ 3.93, DeepSeek V4 ที่ 3.72 และ Kimi K3 ที่ 3.28 — ตัวเลขทั้งหมดที่ผู้ขายรายงานในการเปรียบเทียบของผู้ขายเอง ข้อความต่อโทเคนที่มากขึ้นหมายถึงโทเคนต่องานที่น้อยลง ซึ่งเป็นผลโดยตรงต่อต้นทุนการอนุมาน มากกว่าที่จะเป็นคำกล่าวอ้างด้านคุณภาพ และเป็นความได้เปรียบด้านประสิทธิภาพแบบที่ทบต้นเมื่อใช้กับปริมาณงานประมวลผลเอกสาร

สิ่งที่ตารางของผู้ขายไม่ได้ตัดสิน

Aleph Alpha เผยแพร่บทเปรียบเทียบหลังการฝึกที่ครอบคลุมสิบสี่โมเดล และมันมีประโยชน์กว่าตารางเปิดตัวส่วนใหญ่ เพราะไม่ประจบประแจงฝ่ายที่ถูกพูดถึง

บนฮาร์เนสเดียวกัน โดยตั้งค่า reasoning effort ของ Kolibri ไว้ที่ระดับสูง Qwen3.8 27B ทำคะแนนเฉลี่ยภาษาอังกฤษ 80.2 เทียบกับ 75.5 ของ Kolibri และทำคะแนนเฉลี่ยภาษาเยอรมัน 79.9 เทียบกับ 70.8 นอกจากนี้ยังนำใน GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified และเบนช์มาร์กบริบทขนาดยาวทั้งสองรายการ Nemotron 3 Super 120B-A12B ทำคะแนนเฉลี่ยภาษาอังกฤษ 73.0 เทียบกับ 75.5 ของ Kolibri — ซึ่งใกล้กว่า และนำใน AIME 2025 ส่วน Gemma 4 26B-A4B IT ทำคะแนน 71.9 และ 66.3 บนค่าเฉลี่ยทั้งสอง

ดังนั้น สรุปอย่างตรงไปตรงมาของการเปิดตัวครั้งนี้จึงไม่ใช่ “ระดับแนวหน้าสุด” แต่เป็นว่า Kolibri อยู่ตรงกลางของกลุ่มโมเดลที่เปิดใช้งานระหว่างสามพันล้านถึงหนึ่งหมื่นสองพันล้านพารามิเตอร์ต่อโทเคน ว่าโมเดลนี้เอาชนะโมเดลที่เล็กกว่ามากได้อย่างชัดเจน และว่าโมเดลนี้แพ้โมเดลแบบ dense ขนาด 27 พันล้านพารามิเตอร์จาก Alibaba ในแถวส่วนใหญ่ของตารางของตัวเอง ขณะที่เปิดใช้งานพารามิเตอร์เพียงประมาณหนึ่งในแปด กรอบการนำเสนอของ Aleph Alpha สำหรับเรื่องนี้คือพรมแดน Pareto ของคุณภาพเทียบกับจำนวนโทเคนที่ถอดรหัสได้ต่อวินาทีต่อ GPU — ไม่มีโมเดลเปรียบเทียบตัวใดที่ให้คุณภาพมากกว่าเมื่อต้นทุนการให้บริการเท่ากัน หรือให้คุณภาพเท่ากันเมื่อต้นทุนต่ำกว่า นั่นคือข้อกล่าวอ้างที่ต้องตรวจสอบ และมันเป็นข้อกล่าวอ้างเชิงเศรษฐศาสตร์การให้บริการ ไม่ใช่ข้อกล่าวอ้างเชิงความสามารถ

ไม่มีตัวเลขใดในนี้ที่ได้รับการตรวจสอบอย่างอิสระ ไม่มีรายการ Artificial Analysis สำหรับ Kolibri ไม่มีการทำซ้ำกรอบการประเมินโดยบุคคลที่สาม และเบนช์มาร์กเฉพาะด้านก็สร้างขึ้นโดยผู้ขาย การเปรียบเทียบยังเอื้อประโยชน์ต่อ Kolibri ในเชิงโครงสร้างในด้านหนึ่ง และไม่เอื้อประโยชน์ในอีกด้านหนึ่ง: โมเดลทั้งสิบสี่ตัวถูกรันผ่านฮาร์เนสของ Aleph Alpha เองด้วยพรอมป์และค่าตั้ง few-shot ที่เหมือนกัน ซึ่งเป็นวิธีที่ถูกต้องในการทำ แต่ก็ยังคงเป็นฮาร์เนสของแล็บเดียว ให้ถือว่าตัวเลขทุกตัวในส่วนนี้เป็นข้อมูลที่ผู้ขายรายงาน จนกว่าจะมีคนอื่นรันมัน

Screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the licence badge apache-2.0 and the Model overview block: architecture Mixture-of-Experts, 78B total parameters given as 78,103,074,560, active parameters per token 3,457,573,120, languages German and English, context length 1,048,576 tokens with a recommendation to stay at or below 262,144 for serving efficiency and complex tasks, float8_e4m3 weights in 128x128 blocks with an FP8 KV cache and embeddings, LM head, norms and MoE router in bfloat16, reasoning mode yes, tool calling yes, and the June 18 2026 knowledge cutoff.

สิ่งที่คุณต้องมีเพื่อรันมัน

Kolibri ไม่ใช่โมเดลที่คุณลองรันบนแล็ปท็อปได้ น้ำหนัก FP8 มีขนาดหน่วยความจำของโมเดลประมาณ 78 GB และการ์ดขั้นต่ำคือการ์ด A100 80 GB สองใบ, H100 SXM5 สองใบ, H200 หนึ่งใบ, B200 หนึ่งใบ หรือ B300 หนึ่งใบ; การกำหนดค่าที่แนะนำคือ H100 SXM5 สองใบ, H200 สองใบ, B200 หนึ่งใบ หรือ B300 หนึ่งใบ

การให้บริการมันหมายถึงการติดตั้งแพ็กเกจ aleph-alpha-inference ซึ่งให้ปลั๊กอิน Kolibri vLLM และตรึงเวอร์ชัน vLLM ที่รองรับ หรือดึงอิมเมจคอนเทนเนอร์ ghcr.io/aleph-alpha/aleph-alpha-inference จากจุดนั้นเป็นการเรียกใช้ vLLM มาตรฐานพร้อมกับ FP8 KV cache, ตัวแยกวิเคราะห์เหตุผล Kolibri และตัวแยกวิเคราะห์การเรียกเครื่องมือ Kolibri บริบทที่เกิน 262,144 โทเคนต้องใช้แฟล็ก maximum-model-length ที่ชัดเจนและการโอเวอร์ไรด์ position-embedding พารามิเตอร์การสุ่มตัวอย่างที่แนะนำคือ temperature 1.0, top-p 0.97 และ top-k 128

พื้นผิว API เข้ากันได้กับ OpenAI ซึ่งสำคัญกว่าที่ชื่อฟังดู: reasoning effort ถูกส่งผ่าน chat template ในรูปแบบค่า reasoning_effort และการเรียกใช้เครื่องมือถูกส่งออกมาในฟิลด์ tools มาตรฐาน ทีมที่ใช้รูปแบบ chat-completions อยู่แล้วสามารถชี้โค้ดที่มีอยู่ไปยัง endpoint ของ Kolibri บนเครื่องในอาคารของตนเองได้โดยไม่ต้องมีชั้น wrapper

สิ่งที่ Kolibri ยังไม่มี

มีสี่สิ่งที่ขาดหายไปซึ่งควรพูดให้ชัด เพราะการรายงานข่าวการเปิดตัวมักมองข้ามสิ่งเหล่านี้ไป

• ไม่มีการประเมินที่เป็นอิสระ Artificial Analysis ไม่มีหน้าโมเดลสำหรับ Kolibri และไม่มีบุคคลที่สามรายใดเผยแพร่การทำซ้ำตารางเบนช์มาร์กของผู้ขาย

• ไม่มี endpoint ที่โฮสต์จากผู้ขาย การเผยแพร่นี้คือเวตพร้อมรายงานทางเทคนิค; ไม่มี Aleph Alpha API SKU สำหรับ Kolibri ในเอกสารที่เผยแพร่พร้อมกับโมเดล

• ไม่มีเส้นทางบน OrcaRouter และไม่มีบน aggregator ใด ๆ ที่เราจะเอ่ยชื่อ เราตรวจสอบแคตตาล็อกภายใต้ทุกการสะกดของคำนำหน้าผู้ขายและชื่อโมเดล และ Kolibri ไม่ได้อยู่ที่นั่น — ดังนั้นหากคุณต้องการเรียกใช้มัน คุณต้องดาวน์โหลด 78 GB และรัน endpoint ของ vLLM ด้วยตัวเอง เรายอมพูดแบบนั้นมากกว่าจะบอกเป็นนัยว่าเราให้บริการมัน

• ไม่มีอินพุตแบบหลายรูปแบบ ข้อความเข้า ข้อความออก สองภาษา นั่นคือข้อแลกเปลี่ยนที่แล็บทำ เพื่อให้ได้ความลึกมากกว่าความกว้าง และสำหรับการนำไปใช้ประมวลผลเอกสารแล้ว มันน่าจะเป็นตัวเลือกที่ถูกต้อง แต่มันก็เป็นขอบเขตที่แท้จริง

หากสิ่งที่คุณต้องการจริง ๆ ในวันนี้คือโมเดล mixture-of-experts ขนาดเล็กที่เรียกใช้ได้โดยไม่ต้องซื้อ GPU สองตัว ระดับ Gemma 4 MoE ก็เป็นสิ่งที่ใกล้เคียงที่สุดที่มีอยู่แล้วบน endpoint แบบ routed ในราคา $0.06 ต่อล้านโทเคนอินพุต และ $0.33 ต่อล้านโทเคนเอาต์พุตสำหรับรุ่น 26B-A4B พร้อมหน้าต่าง 262,144 โทเคน สำหรับใครก็ตามที่กำลังชั่งน้ำหนักระหว่างการติดตั้งแบบ self-hosted ขนาด 78B ที่เป็น sovereign deployment กับการใช้ตัวนี้ การเปรียบเทียบที่มีประโยชน์ไม่ใช่แถวใน benchmark แต่คือ VRAM 78 GB และบทสนทนาเรื่องการจัดซื้อ เทียบกับค่าใช้จ่ายรายโทเคน OrcaRouter ให้บริการระดับนั้นผ่านคีย์เดียวที่เข้ากันได้กับ OpenAI โดยส่งต่อราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่มใด ๆ ซึ่งเป็นวิธีที่ประหยัดในการดูว่าภาระงานนั้นคุ้มค่ากับการเป็นเจ้าของฮาร์ดแวร์หรือไม่

Kolibri เองคือสิ่งประดิษฐ์ที่น่าสนใจกว่า โมเดลเยอรมัน-อังกฤษขนาด 78 พันล้านพารามิเตอร์ภายใต้ Apache 2.0 พร้อมไปป์ไลน์ข้อมูล วิธีการโทเคไนเซอร์ ตัวเลขพลังงาน และเรื่องราวการวนซ้ำสามเดือนที่เผยแพร่เคียงข้างเวต ถือเป็นการเปิดตัวที่แตกต่างจากการปล่อยเวตแบบเดิมๆ — การเปิดเผยข้อมูลเป็นส่วนหนึ่งของผลิตภัณฑ์ ไม่ใช่บล็อกโพสต์ที่เขียนถึงมัน ข้ออ้างเรื่อง Pareto จะยังยืนได้หรือไม่ ตอนนี้เป็นคำถามของคนที่มี H100 สองตัวกับนาฬิกาจับเวลา และคำตอบจะไม่มาจากใครก็ตามที่เขียนโมเดลการ์ด

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube