
วันแรกของ Kolibri: Aleph Alpha เปิดน้ำหนักภาษาเยอรมัน-อังกฤษจำนวน 78B และปฏิกิริยาตอบสนองกำลังไปไกลกว่าหลักฐาน
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 217 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ยี่สิบสี่ชั่วโมงหลังจากที่ Aleph Alpha เผยแพร่ Kolibri ปฏิกิริยาตกผลึกกลายเป็นประโยคเดียว และประโยคนั้นก็คุ้มค่าที่จะแกะออกมาพิจารณาทีละส่วน ห้องแล็บที่ไฮเดิลแบร์กนำโมเดล mixture-of-experts ขนาด 78.1 พันล้านพารามิเตอร์ขึ้น Hugging Face ภายใต้ Apache 2.0 เมื่อวันที่ 3 ตุลาคม 2026 ประกาศเรื่องนี้ในเช้าวันเดียวกันผ่านห้องข่าวของตนเองและจากบัญชีของตนเอง และภายในวันถัดมา สรุปที่วนเวียนอยู่ในฟีด AI ก็อ่านว่า: พารามิเตอร์รวม 78B, ใช้งานจริง 3.46B ต่อโทเคน, เวตแบบเปิดภายใต้ Apache 2.0, สร้างขึ้นสำหรับภาษาเยอรมันและภาษาอังกฤษ ทุกอนุประโยคของประโยคนั้นตรวจสอบได้จากรีโพซิทอรี สิ่งที่แทบจะไม่มีใครพูดถึงก็คือ ส่วนใดของการเปิดตัวครั้งนี้ที่เป็นข้อเท็จจริงจากการวัด และส่วนใดที่เป็นข้ออ้างที่ผู้เขียนกล่าวเกี่ยวกับโมเดลของตนเองซึ่งไม่มีใครนอกไฮเดิลแบร์กได้ลองรัน ช่องว่างตรงนั้นคือเรื่องราวตั้งแต่วันแรก และมันสำคัญยิ่งกว่าตัวเลขบนพาดหัวข่าว
เริ่มจากไทม์ไลน์ก่อน เพราะปฏิกิริยาจำนวนมากอย่างน่าประหลาดใจมองว่านี่เป็นการเปิดตัวแบบเงียบที่ลึกลับ และมันก็ไม่ใช่เช่นนั้น รีโพซิทอรี Hugging Face Aleph-Alpha/Kolibri-1ถูกสร้างขึ้นเมื่อวันที่ 2 ตุลาคม 2025 เวลา 05:54:02 UTC การ์ดโมเดลระบุวันเปิดตัวไว้ว่าวันที่ 3 ตุลาคม และโพสต์ในห้องข่าวของผู้พัฒนาก็เผยแพร่ในเช้าวันเดียวกันเมื่อเวลา 08:43:53 GMT — ตรงกับวันรวมประเทศเยอรมนี ซึ่งเป็นวันที่ทางแล็บเลือกอย่างชัดเจน บัญชีของ Aleph Alpha เองก็โพสต์เกี่ยวกับเรื่องนี้ภายในไม่กี่นาที ไม่มีการห้ามเผยแพร่ข่าวต่อสื่อและไม่มีงานเปิดตัว ซึ่งน่าจะเป็นที่มาของกรอบ “การเปิดตัวแบบเงียบ” แต่โพสต์ในห้องข่าวของผู้พัฒนา รายงานทางเทคนิค และประกาศอย่างเป็นทางการ ไม่ใช่การเปิดตัวแบบเงียบ พวกมันคือการเปิดตัวปกติที่สื่อสาย AI ทั่วไปเพียงแค่ไม่ได้รายงานในวันนั้น
ตัวเลขที่ปฏิกิริยากำลังทำซ้ำ
เหตุผลที่ 3.46B active เป็นตัวเลขที่ทุกคนอ้างถึงก็เพราะมันเป็นตัวเลขเดียวในประกาศนี้ที่เปลี่ยนสิ่งที่ผู้ซื้อต้องเป็นเจ้าของ Kolibri เป็น transformer 50 ชั้นที่ทุกชั้นเป็น mixture-of-experts โดยแต่ละชั้นมี 384 experts แบ่งเป็นหนึ่งตัวที่ใช้ร่วมกันและหกตัวที่ถูกจัดเส้นทาง รวมพารามิเตอร์ทั้งหมด 78,103,074,560 ตัว ต่อหนึ่งโทเคน มันเปิดใช้งาน 3,457,573,120 ตัว — อัตราส่วน sparsity ประมาณ 22.6 ต่อ 1 นั่นคือสิ่งที่ทำให้โมเดล 78 พันล้านพารามิเตอร์ให้บริการได้บน H100 สองตัวแทนที่จะต้องใช้ทั้งแร็ค และเป็นข้ออ้างที่มีนัยสำคัญที่สุดในประกาศนี้
รอบ ๆ มันมีตัวเลขเด่นอื่น ๆ ตั้งอยู่ โดยทั้งหมดมาจากการ์ดโมเดล ไม่ใช่จากการรันแบบอิสระ:
• บริบท — ฝึกที่ 16,384 โทเค็น, ฝึกกลางทางที่ 65,536, เนทีฟที่ 262,144 และตรวจสอบยืนยันได้ถึง 1,048,576 การ์ดแนะนำให้อยู่ที่หรือต่ำกว่า 262,144 สำหรับงานที่ไวต่อความหน่วง โปรดสังเกตอย่างระมัดระวังว่า "1M context" แบบคงที่ที่คุณจะเห็นในสรุปนั้นเป็นเพดานที่ตรวจสอบยืนยันแล้ว ไม่ใช่หน้าต่างเนทีฟ
• ความแม่นยำ — น้ำหนัก FP8 ในบล็อกขนาด 128x128 พร้อมแอกติเวชันที่ควอนไทซ์แบบไดนามิก ประเมินด้วย KV cache แบบ FP8 ส่วน embeddings, LM head, norms และ MoE router ยังคงเป็น bfloat16
• การให้เหตุผล — ระดับความพยายามสี่ระดับ — ไม่มี, ต่ำ, ปานกลาง, สูง — กำหนดผ่านเทมเพลตแชต พร้อมการเรียกใช้เครื่องมือแบบ Hermes และตัวแยกวิเคราะห์ vLLM ที่จัดส่งอยู่ในรีโพซิทอรีเดียวกับน้ำหนักโมเดล
• ภาษา — เยอรมันและอังกฤษ และไม่มีภาษาอื่นใดอีก
• การฝึก — โทเคนก่อนการฝึก 20 ล้านล้านโทเคนบนคลังข้อความสองภาษาที่ผ่านการกรอง ซึ่งมีสัดส่วนประมาณ 62.5 เปอร์เซ็นต์เป็นภาษาอังกฤษ 23.9 เปอร์เซ็นต์เป็นภาษาเยอรมัน และ 13.6 เปอร์เซ็นต์เป็นโค้ด บวกกับโทเคนสำหรับการฝึกช่วงกลางอีก 3.44 ล้านล้านโทเคน และ 201 พันล้านโทเคนสำหรับการขยายบริบทยาว
• การประมวลผลและพลังงาน — NVIDIA B200 จำนวน 768 ตัว กระจายใน 96 โหนด HGX, การฝึกโมเดลล่วงหน้า 21 วัน รวม 511 ชั่วโมง และ 392,000 GPU-ชั่วโมง ที่รายงานไว้ 6.4x10^23 FLOPs และคาดว่าอยู่ที่ 9.5x10^2 MWh รวมภาระส่วนเกินของศูนย์ข้อมูล ไม่รวมการปรับละเอียดแบบมีผู้สอน (supervised fine-tuning) และการเรียนรู้แบบเสริมกำลัง (reinforcement learning)
• สัญญาอนุญาต — Apache 2.0 ไม่มีเงื่อนไขแนบท้ายเกี่ยวกับการใช้งานที่ยอมรับได้ ไม่มีเกณฑ์จำนวนผู้ใช้งานที่ใช้งานจริงต่อเดือน ไม่มีข้อกำหนดทางการค้าแยกต่างหาก
สองข้อกล่าวอ้างที่ยังไม่มีใครตรวจสอบ
นี่คือส่วนหนึ่งของวันแรกที่ปฏิกิริยาได้ข้ามไป และเป็นส่วนที่ตัดสินว่า Kolibri สำคัญหรือเพียงแค่น่าสนใจ
ข้อแรกคือข้อกล่าวอ้างด้านเศรษฐศาสตร์การให้บริการ การวางกรอบของ Aleph Alpha ไม่ใช่ว่า Kolibri เป็นโมเดลที่แข็งแกร่งที่สุดที่มีให้ใช้ — ในตารางเปรียบเทียบของห้องแล็บเองก็ไม่ใช่ และทางห้องแล็บก็บอกเช่นนั้น การวางกรอบของมันคือ ไม่มีโมเดลใดในบรรดาที่นำมาเปรียบเทียบที่มอบคุณภาพมากกว่า ณ ต้นทุนการให้บริการเท่ากัน หรือคุณภาพเท่ากัน ณ ต้นทุนที่ต่ำกว่า ตามเส้นพรมแดนพาเรโต (Pareto frontier) ของคุณภาพเทียบกับจำนวนโทเคนที่ถอดรหัสได้ต่อวินาทีต่อ GPU นั่นเป็นข้อกล่าวอ้างเกี่ยวกับอัตราการประมวลผลบนฮาร์ดแวร์เฉพาะ และเป็นข้อกล่าวอ้างประเภทที่เฉพาะบุคคลที่สามซึ่งมีนาฬิกาจับเวลาและ H100 สองตัวเท่านั้นจึงจะชี้ขาดได้ ยังไม่มีใครทำ ณ วันที่ 4 ตุลาคม 2026 ไม่มีรายการของ Kolibri ใน Artificial Analysis และไม่มีการทำซ้ำชุดทดสอบการประเมินโดยบุคคลที่สาม
ข้อที่สองคือข้ออ้างเรื่องโทเคน Aleph Alpha มีโทเคไนเซอร์แบบสองภาษาสำหรับเยอรมัน-อังกฤษที่มีคลังคำศัพท์ขนาด 128,000 โทเคน ด้วยวิธีที่มันเรียกว่า UniBPE และรายงานค่าเฉลี่ย 4.90 ต่อโทเคนบนข้อความเว็บภาษาเยอรมัน เทียบกับ GPT-5 ที่ 4.35, Gemini ที่ 4.13, Qwen 3.5-3.8 ที่ 4.17, GLM 5.3 ที่ 3.93, DeepSeek V4 ที่ 3.72 และ Kimi K3 ที่ 3.28 ตัวเลขทุกตัวนั้นเป็นของผู้ขายเอง วัดบนคลังข้อมูลของผู้ขายเอง เทียบกับคู่แข่งที่ผู้ขายเลือกเอง การมีข้อความต่อโทเคนมากขึ้นเป็นผลต่อต้นทุนการอนุมานจริง มากกว่าจะเป็นข้ออ้างด้านคุณภาพ และถ้ามันเป็นจริง ก็จะทบต้นไปทั่วทุกภาระงานประมวลผลเอกสาร — แต่มันเป็นการวัดของแล็บเดียว ไม่ใช่ผลการทดสอบมาตรฐาน
ประเด็นอยู่ที่เยอรมัน และนี่คือวิศวกรรมที่น่าสนใจที่สุดในการเปิดตัวครั้งนี้
การ์ดโมเดล “multilingual” ส่วนใหญ่อธิบายถึงส่วนผสมการฝึกที่บังเอิญรวมภาษาเยอรมันไว้ด้วย อันนี้กลับสร้างขึ้นในทางตรงกันข้าม และการ์ดนี้ระบุรายละเอียดเกี่ยวกับกลไกอย่างเจาะจงผิดปกติ
การทดลองกับโมเดลตัวแทนขนาดเล็กนำ Aleph Alpha ไปสู่เป้าหมายข้อมูลภาษาเยอรมันประมาณ 20 เปอร์เซ็นต์ในส่วนผสม ซึ่งสำหรับการรัน 20 ล้านล้านโทเค็นหมายถึงการต้องหาโทเค็นภาษาเยอรมัน 4 ล้านล้านโทเค็น ชุดข้อมูลภาษาเยอรมันแบบเปิดที่ผ่านการขจัดข้อมูลซ้ำและกรองให้ 390 พันล้าน — ซึ่งยังขาดไปหนึ่งอันดับขนาด ห้องแล็บปิดช่องว่างนี้ด้วยสามวิธี: การปรับแต่งตัวกรอง Common Crawl สำหรับภาษาเยอรมันโดยเฉพาะ ซึ่งสร้างโทเค็นออร์แกนิกที่ไม่ซ้ำกัน 1.3 ล้านล้านโทเค็น; การเขียนเอกสารภาษาเยอรมันที่มีอยู่ใหม่ให้เป็นรายการสารานุกรม บทสนทนาถาม-ตอบ และข้อความทั่วไป ซึ่งสร้างเพิ่มอีกราวหนึ่งล้านล้าน และกลายเป็นแหล่งภาษาเยอรมันที่ใหญ่ที่สุดเพียงแหล่งเดียว; และการแปล ซึ่งถูกใช้สำหรับโมเดลรุ่นก่อนหน้าและถูกตัดออกโดยเจตนาสำหรับ Kolibri ภาษาเยอรมันลงเอยเป็นพูลโทเค็นที่ไม่ซ้ำกัน 2.4 ล้านล้านโทเค็น โดย 80 เปอร์เซ็นต์ได้รับการคัดสรรหรือสร้างขึ้นภายในองค์กร ปรากฏอยู่ที่ 21.3 เปอร์เซ็นต์ของโทเค็นก่อนการฝึกหลังการอัปแซมปลิง
รายละเอียดของตัวกรองเป็นแบบที่ปรากฏให้เห็นเฉพาะในแล็บที่ฝึกกับภาษาเยอรมันจริง ๆ เท่านั้น ไปป์ไลน์ข้อมูลภาษามาตรฐานจะตัดเอกสารที่มีคำยาวมากเกินไปทิ้ง แต่ร้อยแก้วเชิงบริหารราชการภาษาเยอรมันมักเกินเกณฑ์ความยาวคำเฉลี่ยของภาษาอังกฤษอยู่เป็นประจำ ดังนั้นการตั้งค่าเริ่มต้นจึงลบระดับภาษาที่ฝ่ายปกครองใช้เขียนอย่างเงียบ ๆ โมเดลที่ฝึกด้วยตัวกรองภาษาอังกฤษสำเร็จรูปแทบไม่มีคลังคำศัพท์ด้านกฎหมายและการบริหารของเยอรมันให้พูดถึงเลย และไม่มีเบนช์มาร์กใดจะบอกคุณเรื่องนี้
สิ่งที่ตารางเปรียบเทียบแสดงให้เห็นจริง ๆ
Aleph Alpha เผยแพร่การเปรียบเทียบหลังการฝึกที่ครอบคลุมสิบสี่โมเดล และมีประโยชน์กว่าตารางเปิดตัวส่วนใหญ่ เพราะไม่ได้ยกยอตัวแบบที่ถูกประเมิน บนชุดทดสอบเดียวกันกับ Kolibri ที่ระดับความพยายามในการใช้เหตุผลสูง Qwen3.8 27B ทำคะแนนได้ 80.2 ในค่าเฉลี่ยภาษาอังกฤษ เทียบกับ 75.5 ของ Kolibri และ 79.9 ในค่าเฉลี่ยภาษาเยอรมัน เทียบกับ 70.8 และนำใน GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified และแบบทดสอบ long-context ทั้งสองรายการ Nemotron 3 Super 120B-A12B ทำคะแนนได้ 73.0 ภาษาอังกฤษ เทียบกับ 75.5 ของ Kolibri ส่วน Gemma 4 26B-A4B IT ทำคะแนนได้ 71.9 และ 66.3 ในสองค่าเฉลี่ย
ดังนั้น สรุปอย่างตรงไปตรงมาของการเปิดตัวครั้งนี้จึงไม่ใช่ “สุดยอดที่สุดในวงการ” แต่คือ Kolibri อยู่ตรงกลางของกลุ่มโมเดลที่เปิดใช้งานพารามิเตอร์ระหว่าง 3 ถึง 12 พันล้านตัวต่อโทเคน ว่า它เอาชนะโมเดลที่เล็กกว่ามากได้อย่างชัดเจน และแพ้โมเดลแบบ dense ขนาด 27 พันล้านพารามิเตอร์จาก Alibaba ในแถวส่วนใหญ่ของตารางของตัวเอง ขณะที่เปิดใช้งานพารามิเตอร์เพียงราวหนึ่งในแปดเท่านั้น ข้ออ้างแบบ Pareto คือคำถามว่าความคุ้มค่าทางเศรษฐศาสตร์จะช่วยชดเชยช่องว่างนั้นหรือไม่ และข้ออ้างแบบ Pareto นี้ยังไม่ได้รับการทดสอบ

คุณจะเรียกมันว่าอะไรจริง ๆ ในวันนี้
ไม่มีโมเดลแบบโฮสต์จากผู้จำหน่าย — การเปิดตัวครั้งนี้คือชุดน้ำหนักโมเดลพร้อมรายงานทางเทคนิค โดยมีเพียง SKU ของ Aleph Alpha API สำหรับ Kolibri เท่านั้น และยังไม่มีเส้นทางบน Orca Router ด้วย เราได้ตรวจสอบทุกการสะกดของชื่อผู้จำหน่ายและชื่อโมเดลแล้ว แต่ไม่พบ Kolibri อยู่ที่นั่น ดังนั้นการเรียกใช้งานในวันนี้จึงหมายถึงการดาวน์โหลดน้ำหนัก FP8 ประมาณ 78 GB และรัน vLLM endpoint ด้วยตัวคุณเองจากแพ็กเกจaleph-alpha-inference หรืออิมเมจคอนเทนเนอร์ที่เผยแพร่
นั่นคือการตัดสินใจจัดซื้อจัดหาจริง ๆ ไม่ใช่เชิงอรรถ และนั่นคือจุดที่ชั้นการจัดเส้นทางพิสูจน์คุณค่าของตัวเอง แม้กับโมเดลที่มันไม่ได้ให้บริการเอง การเปรียบเทียบอย่างตรงไปตรงมาสำหรับใครก็ตามที่กำลังชั่งน้ำหนักการติดตั้งแบบโฮสต์เองขนาด 78B ที่เป็น sovereign deployment ไม่ใช่แถวในตาราง benchmark — แต่คือ VRAM 78 GB และบทสนทนาเรื่องการจัดซื้อ เทียบกับค่าใช้จ่ายรายโทเคนบนฮาร์ดแวร์ที่คนอื่นเป็นเจ้าของ หากสิ่งที่คุณต้องการจริง ๆ ในเดือนนี้คือโมเดล mixture-of-experts ขนาดเล็กที่เรียกใช้ได้โดยไม่ต้องซื้อ GPU สองตัว ระดับ Gemma 4 26B-A4B คือสิ่งที่ใกล้เคียงที่สุดที่มีอยู่แล้วบนเอนด์พอยต์ที่จัดเส้นทางไว้ ในราคา $0.06 ต่อล้านโทเคนขาเข้า และ $0.33 ต่อล้านโทเคนขาออก พร้อมหน้าต่าง 262,144 โทเคน และ OrcaRouter จัดเส้นทางระดับนั้นบนคีย์เดียวที่เข้ากันได้กับ OpenAI ในราคาตามที่ผู้ให้บริการกำหนด โดยไม่บวกเพิ่มใด ๆ นั่นคือวิธีราคาถูกในการค้นหาว่าภาระงานนี้คุ้มค่าที่จะถือครองฮาร์ดแวร์เองหรือไม่ ก่อนที่ฮาร์ดแวร์จะมาถึง

สิ่งที่ต้องจับตา และสิ่งที่อาจเปลี่ยนคำตัดสิน
สามสิ่ง เรียงตามว่ามันจะเปลี่ยนภาพได้มากแค่ไหน
การวัดปริมาณงานอิสระที่การกำหนดค่าสอง-H100 ที่แนะนำของการ์ดจะยืนยันหรือล้มล้างข้อกล่าวอ้างแบบพาเรโต ซึ่งเป็นข้อกล่าวอ้างเดียวในข่าวประชาสัมพันธ์ที่เป็นของใหม่จริง ๆ แทนที่จะเป็นการทบทวนสเปกชีตซ้ำ การทำซ้ำค่าเฉลี่ยชุดงานภาษาเยอรมันและอังกฤษอย่างอิสระจะบอกคุณว่าช่องว่างกับ Qwen3.8 27B แคบอย่างที่ตารางของผู้ขายเองเสนอแนะหรือแคบกว่านั้นหรือไม่ และการประเมินภาษาเยอรมันบนข้อความทางปกครองจริง — ไม่ใช่แบบทดสอบทั่วไปที่แปลมา — จะทดสอบสิ่งที่ข่าวประชาสัมพันธ์นี้ถูกสร้างขึ้นมาจริง ๆ ซึ่งไม่มีกระดานผู้นำใดวัดอยู่ในปัจจุบัน
จนกว่าหนึ่งในนั้นจะเกิดขึ้นจริง กรอบการอธิบายที่ถูกต้องก็คือกรอบที่ตัวรีโพซิทอรีเองสนับสนุน Kolibri เป็นการเปิดตัวแบบ open-weights ของแท้จากห้องแล็บยุโรป ในระดับที่ห้องแล็บยุโรปไม่เคยส่งมอบมาก่อน พร้อมเงื่อนไข Apache 2.0 ที่ไม่มีผู้ครองตลาดรายเดิมรายใดเทียบได้ มีไปป์ไลน์ข้อมูลที่เผยแพร่พร้อมกับเวต และมีเรื่องราวการวนซ้ำแบบสองโมเดลที่น่าสนใจกว่าตัวเลขบนพาดหัวข่าว และในตอนนี้ มันยังเป็นโมเดลที่ตัวเลขซึ่งถูกอ้างอิงมากที่สุดนั้นมาจากผู้เขียนของมันเอง ทั้งสองประโยคนั้นเป็นจริงตั้งแต่วันแรก และประโยคที่สองคือประโยคที่ปฏิกิริยาตอบสนองมองข้ามไป

