Thẻ tiêu đề hero ghi 'Kolibri: một mô hình trọng số mở 78B đến từ Đức' bằng chữ in đậm cỡ lớn, với một dòng nhỏ hơn duy nhất bên dưới ghi 'tổng 78B / 3.46B hoạt động / ngữ cảnh 1M token / Apache 2.0', và ba biểu tượng đường nét phẳng nhỏ xếp thành một hàng, đặt trên nền trắng với các điểm nhấn chuyển sắc xanh lam và xanh lơ dịu nhẹ cùng logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Ngày đầu tiên của Kolibri: Aleph Alpha đã mở 78B trọng số Đức-Anh, và phản ứng đang đi trước bằng chứng

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mươi bốn giờ sau khi Aleph Alpha công bố Kolibri, phản ứng đã cô đọng lại thành một câu duy nhất, và đáng để mổ xẻ câu đó. Phòng thí nghiệm Heidelberg đã đưa một mô hình mixture-of-experts 78,1 tỷ tham số lên Hugging Face theo giấy phép Apache 2.0 vào ngày 3 tháng 10 năm 2026, công bố nó vào sáng cùng ngày trong newsroom của chính mình và từ tài khoản của chính mình, và đến ngày hôm sau, bản tóm tắt lan truyền trên các nguồn tin AI đọc là: tổng cộng 78 tỷ tham số, 3,46 tỷ tham số hoạt động mỗi token, trọng số mở theo Apache 2.0, được xây dựng cho tiếng Đức và tiếng Anh. Mọi mệnh đề của câu đó đều có thể kiểm chứng được từ kho lưu trữ. Điều phần lớn chưa được nói tới là phần nào của bản phát hành là những dữ kiện đã được đo lường, và phần nào là những tuyên bố mà các tác giả đưa ra về mô hình của chính họ mà chưa ai ngoài Heidelberg chạy thử. Khoảng trống đó chính là câu chuyện của ngày đầu tiên, và nó quan trọng hơn con số trên tiêu đề.

Bắt đầu với dòng thời gian, vì một lượng đáng ngạc nhiên các phản ứng đã coi đây là một bản phát hành âm thầm đầy bí ẩn, và nó không phải như vậy. Kho lưu trữ Hugging Face Aleph-Alpha/Kolibri-1 được tạo vào ngày 2 tháng 10 năm 2026 lúc 05:54:02 UTC, thẻ mô hình ghi ngày phát hành là 3 tháng 10, và bài đăng trên trang tin tức của nhà cung cấp được phát đi cùng sáng hôm đó lúc 08:43:53 GMT — vào Ngày Thống nhất nước Đức, một ngày mà phòng thí nghiệm rõ ràng đã chọn. Tài khoản của chính Aleph Alpha đã đăng về điều này trong vòng vài phút. Không có lệnh cấm báo chí và không có sự kiện ra mắt, đó có lẽ là nguồn gốc của cách gọi "phát hành âm thầm", nhưng một bài đăng trên trang tin tức của nhà cung cấp, một báo cáo kỹ thuật và một thông báo chính thức thì không phải là một bản phát hành âm thầm. Đó là một bản phát hành bình thường mà báo chí AI nói chung đơn giản là đã không đưa tin trong ngày hôm đó.

Số mà phản ứng đang lặp lại

Lý do 3,46B hoạt động là con số mà mọi người đều nhắc đến nằm ở chỗ nó là con số duy nhất trong bản phát hành làm thay đổi thứ mà người mua phải sở hữu. Kolibri là một transformer 50 lớp, trong đó mỗi lớp là hỗn hợp các chuyên gia, với 384 chuyên gia mỗi lớp, một chia sẻ và sáu định tuyến, trên tổng cộng 78.103.074.560 tham số. Mỗi token, nó kích hoạt 3.457.573.120 trong số đó — tỷ lệ thưa thớt vào khoảng 22,6 trên 1. Đó là điều giúp một mô hình 78 tỷ tham số có thể phục vụ trên một cặp H100s thay vì cả một giá rack, và đây là tuyên bố có sức ảnh hưởng lớn nhất trong bản phát hành.

Xung quanh nó là những con số nổi bật khác, tất cả đều đến từ thẻ mô hình chứ không phải từ một lần chạy độc lập:

• Ngữ cảnh — được huấn luyện ở 16.384 token, huấn luyện trung gian ở 65.536, gốc ở 262.144 và được xác thực tới 1.048.576. Thẻ khuyến nghị nên duy trì ở mức bằng hoặc dưới 262.144 cho công việc nhạy cảm với độ trễ. Lưu ý kỹ rằng cụm "1M context" đơn giản mà bạn sẽ thấy trong các bản tóm tắt là mức trần đã được xác thực, chứ không phải cửa sổ gốc.

• Độ chính xác — trọng số FP8 trong các khối 128x128 với các activation được lượng tử hóa động, được đánh giá bằng KV cache FP8; embeddings, LM head, các norm và MoE router vẫn ở bfloat16.

• Suy luận — bốn mức độ nỗ lực — không, thấp, trung bình, cao — được thiết lập thông qua mẫu trò chuyện, với gọi công cụ kiểu Hermes và một trình phân tích cú pháp vLLM được đóng gói trong cùng kho lưu trữ với trọng số.

• Ngôn ngữ — tiếng Đức và tiếng Anh, và không có gì khác.

• Huấn luyện — 20 nghìn tỷ token tiền huấn luyện trên một kho ngữ liệu song ngữ đã được lọc, trong đó khoảng 62,5% là tiếng Anh, 23,9% là tiếng Đức và 13,6% là mã, cộng thêm 3,44 nghìn tỷ token huấn luyện trung gian và 201 tỷ token cho việc mở rộng ngữ cảnh dài.

• Tính toán và năng lượng — 768 NVIDIA B200 trên 96 nút HGX, 21 ngày tiền huấn luyện trong 511 giờ và 392.000 giờ GPU ở mức được báo cáo là 6,4x10^23 FLOPs, cùng mức ước tính 9,5x10^2 MWh bao gồm chi phí phụ trợ của trung tâm dữ liệu, không bao gồm tinh chỉnh có giám sát và học tăng cường.

• Giấy phép — Apache 2.0. Không có phụ lục sử dụng được chấp nhận, không có ngưỡng người dùng hoạt động hằng tháng, không có điều khoản thương mại riêng.

Hai tuyên bố chưa ai kiểm chứng

Đây là phần của ngày đầu tiên mà phản ứng đã bỏ qua, và chính là phần quyết định liệu Kolibri có quan trọng hay chỉ đơn thuần là thú vị.

Đầu tiên là tuyên bố về kinh tế phục vụ. Cách định khung của Aleph Alpha không phải là Kolibri là mô hình mạnh nhất hiện có — trên bảng so sánh của chính phòng thí nghiệm, nó không phải vậy, và phòng thí nghiệm cũng nói như thế. Điều họ định khung là không có mô hình nào được so sánh mang lại chất lượng cao hơn với cùng chi phí phục vụ, hoặc cùng chất lượng với chi phí thấp hơn, dọc theo một biên Pareto giữa chất lượng và số token được giải mã mỗi giây trên mỗi GPU. Đó là một tuyên bố về thông lượng trên phần cứng cụ thể, và đúng là kiểu tuyên bố mà chỉ một bên thứ ba với đồng hồ bấm giây và hai chiếc H100 mới có thể phân xử. Chưa ai làm được. Không có mục Artificial Analysis nào cho Kolibri tính đến ngày 4 tháng 10 năm 2026 và không có bản tái lập nào của bên thứ ba đối với bộ khung đánh giá.

Thứ hai là tuyên bố về tokenizer. Aleph Alpha đã huấn luyện một tokenizer song ngữ Đức-Anh với vốn từ 128.000 token bằng phương pháp mà họ gọi là UniBPE, và báo cáo 4,90 byte trung bình mỗi token trên văn bản web tiếng Đức, so với GPT-5 ở 4,35, Gemini ở 4,13, Qwen 3.5-3.8 ở 4,17, GLM 5.3 ở 3,93, DeepSeek V4 ở 3,72 và Kimi K3 ở 3,28. Mỗi một con số trong số đó đều là của chính nhà cung cấp, được đo trên chính kho ngữ liệu của nhà cung cấp, so với các đối thủ do nhà cung cấp lựa chọn. Nhiều văn bản hơn trên mỗi token là một hiệu ứng chi phí suy luận thực sự chứ không phải một tuyên bố về chất lượng, và nếu điều đó đúng thì nó sẽ cộng dồn trên bất kỳ khối lượng công việc xử lý tài liệu nào — nhưng đó là phép đo của một phòng thí nghiệm, không phải kết quả benchmark.

Đức mới là điểm nhấn, và đó là phần kỹ thuật thú vị nhất trong bản phát hành

Hầu hết các thẻ mô hình “đa ngôn ngữ” mô tả một hỗn hợp huấn luyện mà tình cờ bao gồm tiếng Đức. Cái này được xây dựng theo chiều ngược lại, và thẻ này đặc biệt cụ thể về các cơ chế.

Các thí nghiệm nhỏ với mô hình đại diện đã dẫn Aleph Alpha đến mục tiêu khoảng 20 phần trăm dữ liệu tiếng Đức trong hỗn hợp, mà đối với một lần chạy 20 nghìn tỷ token có nghĩa là phải tìm 4 nghìn tỷ token tiếng Đức. Các bộ dữ liệu tiếng Đức mở đã được khử trùng lặp và lọc cung cấp 390 tỷ — thiếu một bậc độ lớn. Phòng thí nghiệm đã thu hẹp khoảng cách bằng ba cách: tinh chỉnh lại bộ lọc Common Crawl dành riêng cho tiếng Đức, tạo ra 1,3 nghìn tỷ token hữu cơ duy nhất; diễn đạt lại các tài liệu tiếng Đức hiện có thành các mục từ điển bách khoa, hội thoại hỏi đáp và đoạn văn bản, tạo ra thêm khoảng một nghìn tỷ và trở thành nguồn tiếng Đức lớn nhất; và dịch thuật, vốn được dùng cho mô hình tiền nhiệm và đã bị loại bỏ có chủ đích đối với Kolibri. Tiếng Đức cuối cùng trở thành một kho token duy nhất 2,4 nghìn tỷ, 80 phần trăm trong đó được tuyển chọn hoặc tạo nội bộ, chiếm 21,3 phần trăm token tiền huấn luyện sau khi tăng mẫu.

Chi tiết về bộ lọc là kiểu chuyện chỉ lộ ra trong một phòng thí nghiệm thực sự đã huấn luyện trên tiếng Đức. Một pipeline dữ liệu ngôn ngữ tiêu chuẩn sẽ loại bỏ các tài liệu có quá nhiều từ dài — nhưng văn xuôi hành chính tiếng Đức thường xuyên vượt quá giới hạn tiếng Anh về độ dài từ trung bình, nên các cài đặt mặc định âm thầm xóa mất ngữ vực mà nền hành chính công viết bằng. Một mô hình được huấn luyện trên bộ lọc tiếng Anh có sẵn thì không có vốn từ vựng pháp lý - hành chính tiếng Đức đáng kể nào, và không một benchmark nào sẽ cho bạn biết điều đó.

Bảng so sánh thực sự cho thấy điều gì

Aleph Alpha đã công bố một so sánh sau huấn luyện bao quát mười bốn mô hình, và nó hữu ích hơn hầu hết các bảng công bố khi ra mắt vì không tô hồng đối tượng được đánh giá. Trên cùng một khung đánh giá với Kolibri ở mức nỗ lực suy luận cao, Qwen3.8 27B đạt 80,2 trên điểm trung bình tiếng Anh so với 75,5 của Kolibri, và 79,9 trên điểm trung bình tiếng Đức so với 70,8, đồng thời dẫn đầu ở GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified và cả hai bài kiểm tra ngữ cảnh dài. Nemotron 3 Super 120B-A12B đạt 73,0 tiếng Anh so với 75,5 của Kolibri. Gemma 4 26B-A4B IT đạt 71,9 và 66,3 trên hai điểm trung bình.

Vậy nên bản tóm tắt trung thực về bản phát hành này không phải là "state of the art". Đó là việc Kolibri nằm ở giữa một loạt các mô hình kích hoạt từ ba đến mười hai tỷ tham số mỗi token, rằng nó đánh bại rõ ràng những mô hình nhỏ hơn nhiều, và rằng nó thua một mô hình dense 27 tỷ tham số của Alibaba trên hầu hết các dòng trong bảng của chính nó trong khi chỉ kích hoạt khoảng một phần tám số tham số. Liệu khía cạnh kinh tế có cứu vãn được khoảng cách đó hay không chính là tuyên bố Pareto, và tuyên bố Pareto thì chưa được kiểm chứng.

A single-column specification scoreboard titled 'Kolibri — the scoreboard', with six rows reading 'Total parameters: 78.1B', 'Active per token: 3.46B', 'Context: 262,144 native, 1M validated', 'Licence: Apache 2.0', 'Independent score: none published' and 'Deployment floor: 2x H100 80GB', and a footer line reading 'All figures vendor-reported from the model card; no independent evaluation yet.' OrcaRouter logo in the bottom-right corner.

Cách bạn thực sự sẽ gọi nó, ngày nay

Không có endpoint được lưu trữ nào từ nhà cung cấp — bản phát hành chỉ gồm trọng số cùng một báo cáo kỹ thuật, và không có SKU API Aleph Alpha cho Kolibri trong tài liệu đã công bố. Cũng không có tuyến nào dành cho nó trên OrcaRouter: chúng tôi đã dò danh mục dưới mọi cách viết của tiền tố nhà cung cấp và tên mô hình, và Kolibri không có ở đó, nên muốn gọi nó hôm nay đồng nghĩa với việc tải xuống khoảng 78 GB trọng số FP8 và tự chạy một endpoint vLLM từ aleph-alpha-inference gói hoặc image container đã công bố.

That is a real procurement decision, not a footnote, and it is where a routing layer earns its place even for a model it does not carry. The honest comparison for anyone weighing a self-hosted 78B sovereign deployment is not benchmark rows — it is 78 GB of VRAM and a procurement conversation against a per-token line item on hardware someone else owns. If what you actually need this month is a small mixture-of-experts model you can call without buying two GPUs, the Gemma 4 26B-A4B tier is the nearest thing already on a routed endpoint, at $0.06 per million input tokens and $0.33 per million output with a 262,144-token window, and OrcaRouter routes that tier on one OpenAI-compatible key at the provider's list price with nothing added. That is the cheap way to find out whether the workload justifies owning the hardware before the hardware arrives.

A screenshot of Aleph Alpha's newsroom post for Kolibri, showing the vendor headline about a sovereign open-weight model, the 78B parameter figure and the one-million-token context line, and the architecture comparison between Kolibri and Kolibri Origin.

Những điều cần theo dõi, và điều gì sẽ thay đổi phán quyết

Ba điều, xếp theo mức độ chúng có thể làm thay đổi cục diện.

Một phép đo thông lượng độc lập ở cấu hình hai H100 được khuyến nghị của card sẽ xác nhận hoặc đánh đổ tuyên bố Pareto, vốn là tuyên bố duy nhất trong bản phát hành thực sự mới mẻ chứ không phải chỉ là sự nhắc lại một bảng thông số kỹ thuật. Việc tái lập độc lập các mức trung bình của bộ tác vụ tiếng Đức và tiếng Anh sẽ cho bạn biết liệu khoảng cách với Qwen3.8 27B có hẹp như chính bảng của nhà cung cấp gợi ý hay còn hẹp hơn. Và một đánh giá bằng tiếng Đức trên văn bản hành chính thực tế — chứ không phải một bộ chuẩn đánh giá tổng quát đã được dịch — sẽ kiểm tra đúng thứ mà bản phát hành này thực sự được xây dựng để làm, điều mà hiện chưa có bảng xếp hạng nào đo lường.

Cho đến khi một trong những điều đó thành hiện thực, cách diễn giải đúng là cách mà chính kho lưu trữ ủng hộ. Kolibri là một bản phát hành open-weights chính hiệu từ một phòng thí nghiệm châu Âu, ở quy mô mà các phòng thí nghiệm châu Âu chưa từng tung ra trước đây, với các điều khoản Apache 2.0 mà không đối thủ đương nhiệm nào sánh bằng, một pipeline dữ liệu được công bố cùng với trọng số, và một câu chuyện về hai mô hình nối tiếp nhau còn thú vị hơn con số trên tiêu đề. Hiện tại, nó cũng là một mô hình mà những con số được trích dẫn nhiều nhất đến từ chính các tác giả của nó. Cả hai câu đó đều đúng ngay từ ngày đầu tiên, và câu thứ hai chính là câu mà phản ứng đã bỏ sót.

A screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the repository header, the Apache 2.0 licence tag, the stated release date of 3 October 2026, and the parameter, context and FP8 precision lines in the card body.