Thẻ hero được tạo cho phần giải thích Kolibri, với tiêu đề 'Kolibri: một mô hình trọng số mở 78B đến từ Đức' cùng dòng phụ '78B tổng / 3.46B hoạt động / ngữ cảnh 1M token / Apache 2.0' và ba biểu tượng đường nét phẳng: một con chim ruồi, một chồng lớp, và một ổ khóa trên tài liệu. Logo OrcaRouter nằm ở dải bên dưới hình minh họa.
Guides & Insights

Kolibri, Giải thích: Aleph Alpha phát hành mô hình Đức-Anh 78B theo Apache 2.0

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Aleph Alpha đã phát hành Kolibri vào ngày 3 tháng 10 năm 2026, một mô hình mixture-of-experts 78,1 tỷ tham số, kích hoạt 3,46 tỷ tham số mỗi token, sở hữu cửa sổ ngữ cảnh đã được kiểm chứng là 1.048.576 token, và được phát hành kèm trọng số đầy đủ trên Hugging Face theo giấy phép Apache 2.0. Phòng thí nghiệm Heidelberg đã công bố nó vào đúng Ngày Thống nhất nước Đức, cùng với một báo cáo kỹ thuật, một model card bằng tiếng Đức và tiếng Anh, và một bản tường thuật chi tiết đến mức bất thường về cách mô hình này được huấn luyện. Mô hình được dùng làm tham chiếu so sánh xuyên suốt tài liệu của chính Aleph Alpha là Kolibri Origin — phiên bản tiền nhiệm 30,6 tỷ tham số, 3,27 tỷ tham số hoạt động, đã hoàn tất tiền huấn luyện vào ngày 11 tháng 6 năm 2026 và chưa từng được phát hành công khai. Hai mô hình, cách nhau ba tháng, và khoảng cách giữa chúng chính là điều thú vị nhất trong lần phát hành này.

Điều khiến Kolibri đáng để đọc kỹ không phải là nó là mô hình mạnh nhất hiện có. Trên chính các bảng so sánh của Aleph Alpha thì nó không phải, và chúng ta sẽ bàn tới điều đó. Điều đáng chú ý là một phòng thí nghiệm châu Âu đã phát hành một mô hình trọng số mở ở quy mô này, với quy trình huấn luyện, nguồn gốc dữ liệu và số liệu năng lượng được công bố kèm theo, và đặt giấy phép thành Apache 2.0 thay vì một giấy phép nghiên cứu riêng. Đối với các nhóm mà quy tắc mua sắm bắt đầu bằng "dữ liệu đi đâu", sự kết hợp đó chính là sản phẩm.

Bảng thông số, và hai con số đáng quan tâm

Tất cả nội dung bên dưới đều lấy từ thẻ mô hình mà Aleph Alpha đã công bố cùng với các trọng số; chưa có phần nào trong đó được tái lập một cách độc lập, và vào thời điểm viết bài, không có dòng nào về Kolibri trên Artificial Analysis.

• Tổng số tham số — 78.103.074.560, với 3.457.573.120 tham số hoạt động trên mỗi token, tỷ lệ khoảng 22,6:1.

• Kiến trúc — một transformer 50 lớp, tất cả các lớp đều là mixture-of-experts, 384 chuyên gia mỗi lớp với 1 chia sẻ và 6 định tuyến, và tỷ lệ 4:1 giữa sliding-window và grouped-query attention xuyên suốt stack.

• Bối cảnh — được huấn luyện ở 16.384 token, huấn luyện giữa chừng ở 65.536, và mở rộng đến mức gốc 262.144. Vì mã hóa vị trí chỉ được áp dụng trong các lớp cửa sổ trượt, Aleph Alpha cho biết cửa sổ có thể được mở rộng mà không cần chia tỷ lệ vị trí, và đã xác thực chất lượng cùng hiệu quả phục vụ lên tới 1.048.576 token. Thẻ khuyến nghị duy trì ở mức bằng hoặc dưới 262.144 đối với công việc nhạy cảm với độ trễ và đối với các tác vụ phức tạp.

• Độ chính xác — trọng số FP8 trong các khối 128×128 với activation được lượng tử hóa động, được đánh giá bằng bộ đệm KV FP8; embedding, LM head, các norm và router MoE vẫn giữ ở bfloat16.

• Suy luận — bốn mức độ nỗ lực: không, thấp, trung bình và cao, được thiết lập thông qua chat template.

• Gọi công cụ — có, theo kiểu Hermes, với bộ phân tích cú pháp vLLM đi kèm trong cùng kho lưu trữ với trọng số.

• Ngôn ngữ — tiếng Đức và tiếng Anh, và không gì khác. Điều đó được nêu rõ như một lựa chọn thiết kế chứ không phải là một thiếu sót.

• Huấn luyện — 20 nghìn tỷ token tiền huấn luyện trên một kho ngữ liệu song ngữ đã lọc, khoảng 62,5% tiếng Anh, 23,9% tiếng Đức và 13,6% mã, cộng thêm 3,44 nghìn tỷ token huấn luyện trung gian và 201 tỷ token cho mở rộng ngữ cảnh dài.

Tính toán — 768 NVIDIA B200 trên 96 nút HGX, 21 ngày tiền huấn luyện trong 511 giờ và 392.000 giờ GPU, được báo cáo ở mức 6,4×10²³ FLOPs. Huấn luyện giữa bổ sung năm ngày và 90.000 giờ GPU; mở rộng ngữ cảnh dài bổ sung 13 giờ và 10.000 giờ GPU.

• Năng lượng — ước tính 9,5×10² MWh, bao gồm chi phí phụ trợ của trung tâm dữ liệu, tính cả tiền huấn luyện, huấn luyện trung gian và huấn luyện ngữ cảnh dài, nhưng không tính tinh chỉnh có giám sát và học tăng cường.

• Giấy phép — Apache 2.0. Không có phụ lục sử dụng được chấp nhận, không có ngưỡng người dùng hoạt động hằng tháng, không có điều khoản thương mại riêng.

Hai trong số những dòng đó là những dòng mà người mua nên đọc hai lần. Số lượng tham số hoạt động là thứ bạn phải trả giá khi suy luận, và 3,46 tỷ tham số hoạt động trên tổng 78 tỷ là một tỷ lệ thưa đầy tham vọng — đó chính là lý do duy nhất khiến một mô hình cỡ này có thể được phục vụ trên chỉ hai GPU. Và con số ngữ cảnh được nêu là 262.144 gốc với 1.048.576 đã kiểm chứng, một tuyên bố cẩn trọng hơn so với cụm “ngữ cảnh 1M” chung chung mà bạn sẽ thấy trong hầu hết các bài đưa tin về bản phát hành này.

Generated single-column scoreboard for Kolibri with six rows: total parameters 78.1B, active per token 3.46B, context 262,144 native and 1M validated, licence Apache 2.0, independent score 'none published', and deployment floor 2x H100 80GB. The footer reads 'All figures vendor-reported from the model card; no independent evaluation yet.'

Hai mẫu, cách nhau ba tháng

Kolibri là mô hình thứ hai ra đời từ thứ mà Aleph Alpha gọi là Model Factory của mình, và dòng thời gian mà nó công bố là phần của đợt ra mắt mà hầu hết các bài đưa tin đều bỏ qua.

Công việc trên pipeline huấn luyện bắt đầu vào tháng 1 năm 2026. Kolibri Origin đã hoàn tất tiền huấn luyện ở quy mô mục tiêu vào ngày 11 tháng 6 năm 2026 — tổng cộng 30,6 tỷ tham số, 3,27 tỷ tham số hoạt động, cửa sổ ngữ cảnh 65.536 token, 7,51 nghìn tỷ token huấn luyện, 50 lớp trong đó hai lớp là dense và 48 lớp là MoE, cùng một chế độ suy luận duy nhất. Mô hình này đã được xác thực nội bộ và chưa từng được phát hành công khai. Kolibri đã hoàn tất tiền huấn luyện vào ngày 11 tháng 9 năm 2026.

• Tham số — tổng 30,6B và 3,27B hoạt động, so với tổng 78,1B và 3,46B hoạt động.

• Ngữ cảnh — 8.192 token ngữ cảnh tiền huấn luyện trên Origin, so với 16.384 trên Kolibri, kết thúc ở mức gốc 262.144.

• Dữ liệu — 7,51 nghìn tỷ token tiền huấn luyện trên Origin, so với 20 nghìn tỷ, được lấy từ một nguồn thô hơn 200 nghìn tỷ mà pipeline đã lọc, khử trùng lặp và tuyển chọn.

• Kiến trúc — hai lớp dense cộng với 48 lớp MoE trên Origin, so với 50 lớp MoE, với thiết kế attention được thay đổi, số lượng expert gấp ba, độ thưa cao hơn và thuật toán định tuyến được thay thế.

• Suy luận — một chế độ trên Origin, so với không có, thấp, trung bình và cao trên Kolibri.

• Phát hành — không phát hành công khai cho Origin, 3 tháng 10 năm 2026 cho Kolibri.

Những con số thay đổi nhiều nhất là các con số thuộc bộ nhiệm vụ, nơi cùng một khung đánh giá đã chấm điểm cả hai mô hình. Trên mức trung bình tiếng Đức của bộ hậu huấn luyện, Origin đạt 46,4 và Kolibri đạt 70,8; trên mức trung bình tiếng Anh, 54,1 so với 75,5. Trên AIME 2025 bằng tiếng Đức, 73,5 so với 87,5. Trên các chuẩn đánh giá đại diện khách hàng nội bộ mà nhà cung cấp công bố dưới dạng một bộ theo ngành dọc, bộ dành cho nhà cung cấp ô tô đã tăng từ 0,72 lên 0,99, chất bán dẫn từ 0,35 lên 0,80, khu vực công của Đức từ 0,54 lên 0,75, công nghệ truyền động công nghiệp từ 0,31 lên 0,60 và hàng không vũ trụ từ 0,14 lên 0,59.

Những con số theo ngành dọc nội bộ đó do nhà cung cấp tự thực hiện trên các bộ đánh giá do nhà cung cấp tự xây dựng, được thiết kế xoay quanh khách hàng của nhà cung cấp, nên hãy coi chúng như một mô tả về ý định hơn là một điểm số. Mục đích của việc công bố chúng là để giải thích mô hình được tối ưu hóa cho điều gì: không phải một bảng xếp hạng, mà là một tập hợp các tài liệu thuộc ngành được quản lý chặt chẽ.

Screenshot of Aleph Alpha's newsroom post 'Kolibri Has Landed: A Sovereign Open-Weight Model', showing the opening lines dating the release to the Day of German Reunification, describing Kolibri as an English-German mixture-of-experts transformer with 78B total and 3B active parameters, context lengths up to 1M tokens, full weights on Hugging Face under Apache 2.0, and the paragraph on Kolibri Origin as the 30B total, 3B active predecessor with a 65k context window.

Tiếng Đức ở đây là một quyết định thiết kế, không phải thẻ ngôn ngữ.

Hầu hết các thẻ mô hình "đa ngôn ngữ" thực ra chỉ nói về một hỗn hợp huấn luyện tình cờ có bao gồm chút tiếng Đức. Còn cái này được xây dựng theo chiều ngược lại, và thẻ mô hình nói rõ ràng cụ thể về cơ chế.

Aleph Alpha phát hiện từ các thí nghiệm với mô hình proxy nhỏ rằng khoảng 20% dữ liệu tiếng Đức trong hỗn hợp tạo ra kết quả tốt nhất, mà với một lần chạy 20 nghìn tỷ token thì có nghĩa là phải tìm được 4 nghìn tỷ token tiếng Đức. Các bộ dữ liệu tiếng Đức mở đã được khử trùng lặp và lọc mang lại 390 tỷ token — thiếu mục tiêu một bậc độ lớn. Họ thu hẹp khoảng cách theo ba cách: tinh chỉnh lại bộ lọc Common Crawl dành riêng cho tiếng Đức, qua đó tạo ra 1,3 nghìn tỷ token hữu cơ duy nhất; diễn đạt lại các tài liệu tiếng Đức hiện có thành các mục kiểu bách khoa toàn thư, các đoạn hội thoại hỏi đáp và các đoạn văn bản, qua đó tạo thêm khoảng 1 nghìn tỷ token và trở thành nguồn tiếng Đức lớn nhất; và dịch thuật, chỉ được dùng trong Kolibri Origin và bị loại bỏ đối với Kolibri. Cuối cùng, tiếng Đức là một tập hợp token duy nhất gồm 2,4 nghìn tỷ token, 80% trong đó được tuyển chọn hoặc tạo nội bộ, xuất hiện ở mức 21,3% số token tiền huấn luyện sau khi tăng mẫu.

Chi tiết về bộ lọc đáng để trích dẫn vì đó là kiểu điều chỉ xuất hiện trong một phòng thí nghiệm thực sự đã huấn luyện trên tiếng Đức. Một pipeline dữ liệu ngôn ngữ tiêu chuẩn sẽ loại bỏ các tài liệu có quá nhiều từ dài — nhưng văn xuôi hành chính tiếng Đức thường xuyên vượt ngưỡng tiếng Anh về độ dài từ trung bình, nên các thiết lập mặc định âm thầm xóa mất văn phong mà nền hành chính công viết bằng. Hệ quả thương mại hiển nhiên là một mô hình được huấn luyện trên bộ lọc tiếng Anh có sẵn chẳng có vốn từ vựng pháp lý - hành chính tiếng Đức đáng kể nào, và không có benchmark nào sẽ nói cho bạn điều đó.

Bộ tokenizer cũng nhận được cách xử lý tương tự. Aleph Alpha đã huấn luyện một tokenizer song ngữ Đức–Anh với vốn từ vựng 128.000 token bằng một phương pháp mới mà họ gọi là UniBPE, phương pháp này vẫn giữ cơ chế hợp nhất từ dưới lên của mã hóa byte-pair nhưng chọn các phép hợp nhất theo một mục tiêu unigram. Trên văn bản web tiếng Đức, nó báo cáo trung bình 4,90 byte mỗi token, vượt trên GPT-5 với 4,35, Gemini với 4,13, Qwen3.5–3.8 với 4,17, GLM 5.3 với 3,93, DeepSeek V4 với 3,72 và Kimi K3 với 3,28 — tất cả đều là những con số do nhà cung cấp công bố trong phần so sánh của chính nhà cung cấp đó. Nhiều văn bản hơn trên mỗi token nghĩa là ít token hơn cho mỗi tác vụ, đây là một tác động trực tiếp lên chi phí suy luận chứ không phải là một tuyên bố về chất lượng, và đây là kiểu thắng lợi về hiệu quả có thể cộng dồn tích lũy qua một khối lượng công việc xử lý tài liệu.

Điều mà bảng của nhà cung cấp không giải quyết được

Aleph Alpha đã công bố một so sánh hậu huấn luyện bao gồm mười bốn mô hình, và nó hữu ích hơn hầu hết các bảng ra mắt vì không tô hồng đối tượng.

Trên cùng một harness, với Kolibri ở mức nỗ lực suy luận cao, Qwen3.8 27B đạt 80,2 trên trung bình tiếng Anh so với 75,5 của Kolibri, và 79,9 trên trung bình tiếng Đức so với 70,8. Nó cũng dẫn đầu ở GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified và hai benchmark ngữ cảnh dài. Nemotron 3 Super 120B-A12B đạt 73,0 tiếng Anh so với 75,5 của Kolibri — sát hơn, và dẫn trước ở AIME 2025. Gemma 4 26B-A4B IT đạt 71,9 và 66,3 trên hai mức trung bình.

Vậy nên bản tóm tắt trung thực về bản phát hành này không phải là “tiên tiến nhất”. Đó là việc Kolibri nằm ở giữa một nhóm mô hình kích hoạt từ ba đến mười hai tỷ tham số mỗi token, rằng nó đánh bại rõ ràng những mô hình nhỏ hơn nhiều, và rằng nó thua một mô hình dày đặc 27 tỷ tham số của Alibaba trên hầu hết các hàng trong bảng của chính nó trong khi chỉ kích hoạt khoảng một phần tám số tham số. Cách Aleph Alpha định khung điều đó là đường biên Pareto về chất lượng so với token được giải mã mỗi giây trên mỗi GPU — không mô hình nào trong số được so sánh mang lại chất lượng cao hơn ở cùng chi phí phục vụ, hoặc cùng chất lượng với chi phí thấp hơn. Đó là tuyên bố cần được chất vấn, và đây là tuyên bố về kinh tế phục vụ, không phải tuyên bố về năng lực.

Không có con số nào trong số này được xác minh độc lập. Không có mục Artificial Analysis nào cho Kolibri, không có bên thứ ba nào tái lập khung đánh giá, và các benchmark theo ngành dọc là do nhà cung cấp tự xây dựng. Việc so sánh cũng mang tính cấu trúc có lợi cho Kolibri theo một hướng và bất lợi theo hướng khác: cả mười bốn mô hình đều được chạy qua bộ khung riêng của Aleph Alpha với các prompt giống hệt nhau và cùng cài đặt few-shot, đó là cách đúng để làm, nhưng nó vẫn chỉ là bộ khung của một phòng thí nghiệm. Hãy coi mọi con số trong phần này là do nhà cung cấp báo cáo cho đến khi có người khác chạy lại.

Screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the licence badge apache-2.0 and the Model overview block: architecture Mixture-of-Experts, 78B total parameters given as 78,103,074,560, active parameters per token 3,457,573,120, languages German and English, context length 1,048,576 tokens with a recommendation to stay at or below 262,144 for serving efficiency and complex tasks, float8_e4m3 weights in 128x128 blocks with an FP8 KV cache and embeddings, LM head, norms and MoE router in bfloat16, reasoning mode yes, tool calling yes, and the June 18 2026 knowledge cutoff.

Những gì bạn cần để chạy nó

Kolibri không phải là mô hình để bạn thử trên laptop. Trọng số FP8 có dung lượng bộ nhớ mô hình khoảng 78 GB, và mức tối thiểu cho card là hai card A100 80 GB, hai H100 SXM5, một H200, một B200 hoặc một B300; cấu hình được khuyến nghị là hai H100 SXM5, hai H200, một B200 hoặc một B300.

Phục vụ nó có nghĩa là cài đặt gói aleph-alpha-inference, gói này cung cấp plugin Kolibri vLLM và cố định phiên bản vLLM mà nó hỗ trợ, hoặc kéo image container ghcr.io/aleph-alpha/aleph-alpha-inference. Từ đó, đó là một lệnh gọi vLLM tiêu chuẩn với bộ nhớ đệm KV FP8, trình phân tích lý luận Kolibri và trình phân tích gọi công cụ Kolibri. Các ngữ cảnh vượt quá 262.144 token cần một cờ độ dài mô hình tối đa rõ ràng và một ghi đè nhúng vị trí. Các tham số lấy mẫu được đề xuất là temperature 1.0, top-p 0.97 và top-k 128.

Bề mặt API tương thích với OpenAI, điều này quan trọng hơn nghe tưởng: reasoning effort được truyền qua chat template dưới dạng giá trị reasoning_effort, và các lệnh gọi công cụ được phát ra trong trường tools tiêu chuẩn. Một nhóm đã quen với định dạng chat-completions có thể trỏ mã hiện có tới một endpoint Kolibri trên một máy trong tòa nhà của chính họ mà không cần lớp wrapper.

Những gì Kolibri chưa có

Bốn sự thiếu vắng đáng được nói thẳng, vì các bài đưa tin về ra mắt thường bỏ qua chúng.

• Không có đánh giá độc lập. Artificial Analysis không có trang model nào cho Kolibri, và chưa có bên thứ ba nào công bố bản tái tạo bảng benchmark của nhà cung cấp.

• Không có endpoint được lưu trữ từ nhà cung cấp. Bản phát hành bao gồm trọng số cùng một báo cáo kỹ thuật; không có SKU API Aleph Alpha nào cho Kolibri trong tài liệu được công bố cùng với mô hình.

• Không có route nào trên OrcaRouter, và cũng không có trên bất kỳ aggregator nào mà chúng tôi muốn nêu tên. Chúng tôi đã dò catalogue theo mọi cách viết của vendor prefix và tên model, và Kolibri không có ở đó — vì vậy nếu bạn muốn gọi nó, bạn sẽ phải tự tải 78 GB và tự chạy một endpoint vLLM. Chúng tôi thà nói thẳng như vậy còn hơn ngụ ý rằng chúng tôi phục vụ nó.

• Không có đầu vào đa phương thức. Văn bản vào, văn bản ra, hai ngôn ngữ. Đó là sự đánh đổi mà phòng thí nghiệm đã thực hiện để lấy chiều sâu thay vì bề rộng, và đối với một triển khai xử lý tài liệu thì có lẽ đó là lựa chọn đúng, nhưng nó là một ranh giới thực sự.

Nếu điều bạn thực sự cần hôm nay là một mô hình mixture-of-experts nhỏ mà bạn có thể gọi mà không phải mua hai GPU, thì bậc Gemma 4 MoE là thứ gần nhất đã có sẵn trên một endpoint được định tuyến, với giá $0.06 mỗi triệu token đầu vào và $0.33 mỗi triệu token đầu ra ở biến thể 26B-A4B, cùng cửa sổ 262.144 token. Với bất kỳ ai đang cân nhắc một triển khai sovereign 78B tự host so với điều đó, phép so sánh hữu ích không phải là các hàng benchmark — mà là 78 GB VRAM và một cuộc trao đổi về mua sắm so với một khoản mục chi phí theo từng token. OrcaRouter định tuyến bậc đó trên một khóa tương thích OpenAI duy nhất, với giá niêm yết của nhà cung cấp được chuyển tiếp nguyên vẹn và không cộng thêm gì, đây là cách rẻ để tìm hiểu liệu khối lượng công việc có biện minh cho việc sở hữu phần cứng hay không.

Bản thân Kolibri mới là hiện vật thú vị hơn. Một mô hình tiếng Đức-tiếng Anh 78 tỷ tham số theo Apache 2.0, với pipeline dữ liệu, phương pháp tokenizer, con số năng lượng và câu chuyện lặp lại trong ba tháng được công bố ngay cạnh phần trọng số, là một kiểu phát hành khác với kiểu tung trọng số thông thường — việc công bố thông tin là một phần của sản phẩm, chứ không phải một bài blog nói về sản phẩm đó. Liệu tuyên bố Pareto có đứng vững hay không giờ là câu hỏi dành cho những người có hai chiếc H100 và một chiếc đồng hồ bấm giây, và câu trả lời sẽ không đến từ bất kỳ ai đã viết model card.