
Kolibri vs Qwen 3.8: Mô hình Đức thua ngay trên bàn của chính mình, và đó chính là điểm mấu chốt
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 218 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Hãy bắt đầu bằng câu mà hầu hết các bài đưa tin về màn ra mắt của Kolibri đã bỏ qua. Trên bảng benchmark mà Aleph Alpha công bố cùng mô hình của mình vào ngày 3 tháng 10 năm 2026, mô hình được đem ra so sánh nhiều nhất không phải một đối thủ châu Âu, cũng không phải một đối thủ Mỹ. Đó là Qwen3.8 27B, phiên bản trọng số mở thuộc thế hệ đó của nhà cung cấp, phát hành ngày 13 tháng 8 năm 2026 — và theo chính số liệu của Aleph Alpha, nó thắng. Qwen3.8 27B đạt 80,2 ở mức trung bình tiếng Anh và 79,9 ở mức trung bình tiếng Đức trong cùng bộ đánh giá mà Kolibri chỉ đạt 75,5 và 70,8. Nó dẫn đầu ở GPQA Diamond, 89,2 so với 84,3. Nó dẫn đầu ở LiveCodeBench v6, 93,8 so với 85,9. Nó dẫn đầu ở SWE-Bench Verified, 72,6 so với 66,4, và ở cả hai benchmark ngữ cảnh dài, 76,9 so với 64,5 trên LongBench Pro và 81,3 so với 68,3 trên AA-LCR. Một mô hình Trung Quốc dạng dense 27 tỷ tham số, được đánh giá bởi một phòng thí nghiệm Đức, lại đánh bại mô hình chủ lực 78 tỷ tham số của chính phòng thí nghiệm đó trên phần lớn bảng so sánh của họ. Đó không phải là một vụ bê bối. Đó là sự thật hữu ích nhất trong lần ra mắt này, bởi nó buộc ta phải đặt câu hỏi Kolibri thực sự để làm gì.
Một điểm cần làm rõ trước khi so sánh đi xa hơn, bởi "Qwen 3.8" là tên của cả một dòng mô hình chứ không phải một mô hình đơn lẻ, và những khác biệt này rất quan trọng ở đây. Qwen3.8-Max là mô hình chủ lực chạy trên hạ tầng của Alibaba, hoạt động từ ngày 3 tháng 8 năm 2026 với cửa sổ ngữ cảnh 1M token, mức giá 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho token đầu ra. Qwen3.8-27B là phiên bản trọng số mở, phát hành ngày 13 tháng 8 năm 2026 với cửa sổ 262.144 token. Qwen3.8-Flash là phiên bản dành cho khối lượng lớn, phát hành ngày 26 tháng 8 năm 2026 với cửa sổ 1M token và mức giá thấp hơn nhiều. Còn Qwen3.8 không có hậu tố — được công bố ngày 19 tháng 7 năm 2026 dưới dạng một mô hình trọng số mở chủ lực 2,4 nghìn tỷ tham số — vẫn chưa phát hành; nó chỉ tồn tại dưới dạng một trang danh mục theo dõi và một thông báo. Tất cả nội dung bên dưới đều nói về phiên bản có trọng số mà bạn có thể tải về và chạy, tức bản 27B.
Kolibri thực sự thắng ở đâu, hãy đọc từ cùng bảng đó
Những dòng mà Kolibri dẫn trước Qwen3.8 27B không hề nằm rải rác một cách ngẫu nhiên. Chúng tụ lại thành cụm, và chính cụm đó là sản phẩm.
• Từ chối trả lời — trên RGB Negative, Kolibri đạt 85,6 so với 70,6. Khi ngữ cảnh không chứa câu trả lời, Kolibri nói rõ điều đó thường xuyên hơn nhiều.
• Gọi công cụ trong điều kiện ràng buộc — trên τ²-bench telecom, 94,7 so với 82,5; trên bộ kiểm thử theo ngành dọc cho nhà cung cấp ô tô, 99,0 so với 97,3.
• Ngữ cảnh rất dài — trên SealQA không có distractor vượt quá 24k token, 100.0 so với 94.4.
• Kinh tế phục vụ tiếng Đức — một tokenizer song ngữ đạt trung bình 4,90 byte mỗi token trên văn bản web tiếng Đức, so với 4,17 đối với dòng Qwen3.5–3.8 theo đo lường của chính Aleph Alpha. Ít token hơn cho mỗi tài liệu tiếng Đức là mức giảm chi phí suy luận trực tiếp, điều thể hiện trên hóa đơn và không xuất hiện ở hàng nào trong bảng xếp hạng.
Ba trong bốn điều đó nói về hành vi chứ không phải năng lực. Khả năng không trả lời, gọi công cụ có ràng buộc và truy xuất ngữ cảnh dài có căn cứ là những gì bạn cần ở một mô hình đọc tài liệu của chính tổ chức bạn và được kỳ vọng sẽ thừa nhận khi tài liệu không trả lời được câu hỏi. Aleph Alpha đã xây dựng toàn bộ bản phát hành xoay quanh canh bạc đó, và bảng cho thấy canh bạc ấy đang thành công.

Những hàng mà Qwen3.8 27B thắng đều xoay quanh độ bao phủ: kiến thức ở cả hai ngôn ngữ, câu hỏi khoa học trình độ sau đại học, lập trình thi đấu, kỹ thuật phần mềm cấp kho lưu trữ, và khả năng hiểu tài liệu dài. Nếu yêu cầu của bạn là một mô hình tổng quát mạnh với mức giá trên mỗi token thấp cùng trọng số mở, thì Qwen3.8 27B là mô hình tốt hơn, và bảng này nói điều đó bằng chính ngòi bút của nhà cung cấp.
Cách lý giải đó được củng cố, còn cách của Kolibri thì không. Artificial Analysis đã đo Qwen3.8 27B một cách độc lập, trong cấu hình suy luận Xhigh của nó, và báo cáo Chỉ số Thông minh là 34, đứng #1 trong số 142 mô hình trong so sánh đó, 45,4 token đầu ra mỗi giây, ngữ cảnh 256.000 token và giấy phép Apache 2.0. Ghi chú của họ không mấy hay ho theo một kiểu quen thuộc — rất dài dòng với 200 triệu token được tạo ra trong quá trình đánh giá chỉ số, so với mức trung vị 82 triệu, và chậm — nhưng bản thân điểm số là phép đo của bên thứ ba đối với đối thủ. Kolibri hoàn toàn không có trang nào trên Artificial Analysis. Vậy nên mô hình mạnh nhất trong so sánh này đã được xác minh độc lập, còn mô hình yếu hơn chỉ là lời của nhà cung cấp, điều này ngược lại với cách một flagship châu Âu thế hệ đầu thường được định hình.
Hai kiểu tuyên bố về chuỗi cung ứng, hướng theo hai hướng trái ngược nhau
Cả hai bản phát hành này đều là những lập luận về việc một mô hình đến từ đâu, và các lập luận này là hình ảnh phản chiếu của nhau.
Trường hợp của Aleph Alpha là việc nguồn gốc xuất xứ được coi như một tính năng. Kolibri được các nhóm người Đức huấn luyện trên hạ tầng ở Đức và Phần Lan, theo luật EU và luật Đức. Thẻ mô hình này công bố hỗn hợp tiền huấn luyện — 20 nghìn tỷ token với khoảng 62,5% tiếng Anh, 23,9% tiếng Đức và 13,6% mã — các ngân sách huấn luyện trung gian và ngữ cảnh dài, cấu hình tính toán chính xác 768 NVIDIA B200 trên 96 nút HGX trong 21 ngày, và mức năng lượng ước tính 9,5×10² MWh bao gồm cả chi phí phụ trợ của trung tâm dữ liệu. Thẻ nêu rõ phương pháp huấn luyện đến từng lớp: một transformer hỗn hợp chuyên gia 50 lớp với tỷ lệ phân chia 4:1 giữa attention cửa sổ trượt và attention truy vấn nhóm, Muon và Exact Quantile Balancing trên 384 chuyên gia với 1 chuyên gia dùng chung và 6 chuyên gia định tuyến. Mười hai nghìn từ công bố đi kèm bản tải xuống 78 GB, cùng lập trường bên ký kết được nêu rõ đối với Quy tắc thực hành AI đa dụng của EU.
Trường hợp của Alibaba thì khác về bản chất: không phải "chúng tôi có thể giải trình cho mọi quyết định" mà là "đây là các trọng số, hãy lấy chúng". Trọng số mở được cấp phép Apache ở quy mô và chất lượng khiến Qwen trở thành mặc định hiệu dụng trên khắp thế giới, một từ vựng 248.077 token bao quát hơn một trăm ngôn ngữ, và một hệ sinh thái phục vụ đã được tinh chỉnh xung quanh các checkpoint đó đủ lâu đến mức gần như mọi ngăn xếp suy luận đều hỗ trợ chúng ngay khi dùng. Lập luận chủ quyền ở đây là về tính khả dụng: không nhà cung cấp nào có thể thu hồi mô hình, bởi vì bạn đã có tệp rồi.
Cả hai tuyên bố đều trung thực và chúng giải đáp những nỗi lo khác nhau. Một người mua thuộc khu vực công ở Baden-Württemberg lo về quyền tài phán và khả năng kiểm toán, và Kolibri hướng đến nỗi lo đó. Một nhóm nghiên cứu ở Nairobi hay São Paulo lo về việc một mô hình bị chặn sau thẻ tín dụng bằng một loại tiền họ không thể thanh toán, và các trọng số Qwen mở hướng đến nỗi lo đó. Điều không trung thực là giả vờ rằng một trong hai là so sánh năng lực, bởi vì bảng năng lực đã đưa ra câu trả lời của nó rồi.

Khoảng trống về giấy phép là có thật nhưng hẹp hơn so với cảm nhận.
Kolibri là Apache 2.0. Qwen3.8 27B là trọng số mở được cấp phép Apache. Cả hai đều không kèm theo điều khoản bổ sung về sử dụng được chấp nhận, không có ngưỡng người dùng hoạt động hàng tháng và không có điều khoản thương mại riêng — điều này đưa chúng vào một nhóm nhỏ và nghĩa là cả hai đều không cần đánh giá pháp lý trước khi sử dụng cho mục đích thương mại.
Điều phân biệt chúng chính là mọi thứ đi kèm sau giấy phép. Kolibri đi kèm với một plugin vLLM và gói parser từ nhà cung cấp, một container image, bốn mức độ nỗ lực suy luận có thể cấu hình thông qua chat template, một hành vi từ chối trả lời rõ ràng, và một cấu hình lấy mẫu được khuyến nghị. Qwen3.8 27B đến dưới dạng trọng số mà Transformers, vLLM và SGLang đã biết cách phục vụ, với một định dạng gọi công cụ mà hệ sinh thái rộng lớn hơn đã có nhiều tháng để thích ứng.
Phần cứng triển khai cũng khác nhau theo cùng những đường phân chia đó. Trọng số FP8 của Kolibri có dung lượng khoảng ~78 GB, với mức sàn là hai card A100 80 GB, hai H100 SXM5, một H200, một B200 hoặc một B300. Qwen3.8 27B ở dạng bfloat16 có khoảng 54 GB trọng số, tức là chỉ cần một accelerator 80 GB ở độ chính xác đầy đủ, hoặc một bản lượng tử hóa trên phần cứng nhỏ hơn đáng kể. Mô hình Đức tốn nhiều phần cứng hơn mà lại trả về ít benchmark hơn. Đó chỉ là một sự đánh đổi tồi nếu bạn đang mua benchmark.
Những gì thẻ giá cho bạn biết và không cho bạn biết
Kolibri không có giá, vì Aleph Alpha không bán dịch vụ suy luận cho nó. Bản phát hành gồm trọng số, một báo cáo kỹ thuật và một card; không có SKU nào được cung cấp trên máy chủ. Mọi con số chi phí cho Kolibri đều là một phép tính khấu hao phần cứng do bạn tự thực hiện.
Qwen3.8 được công bố giá công khai theo ba bậc, và bậc giữa chính là bậc quan trọng đối với một đội ngũ đang so sánh giữa tự vận hành và thuê.
• Qwen3.8-Max — 2,00 đô la cho mỗi triệu token đầu vào và 6,00 đô la cho đầu ra, ngữ cảnh 1 triệu token, đọc bộ nhớ đệm ở mức 0,25 đô la, phát hành ngày 3 tháng 8 năm 2026.
• Qwen3.8-27B — 0,33 đô la cho đầu vào và 2,40 đô la cho đầu ra, ngữ cảnh 262.144 token, phát hành ngày 13 tháng 8 năm 2026. Đây là các trọng số mở, nên mức giá này là số tiền bạn phải trả nếu bạn không muốn tự chạy chúng.
Qwen3.8-Flash — $0.15 cho đầu vào và $0.47 cho đầu ra với cửa sổ 1M token, phát hành ngày 26 tháng 8 năm 2026.
Đó là giá niêm yết của nhà cung cấp trên OrcaRouter, được chuyển nguyên vẹn, không cộng thêm gì cho mỗi token, và đây chính là đặc tính hữu ích khi câu hỏi đặt ra là liệu một triển khai tự vận hành có hoàn vốn hay không: bạn có thể đo khối lượng token thực tế của mình ở các gói dịch vụ lưu trữ trước khi quyết định đầu tư vào phần cứng. Chúng tôi không cộng thêm biên lợi nhuận, nên khi nhà cung cấp giảm giá thì bên chúng tôi áp dụng ngay trong cùng ngày. Cả ba gói Qwen3.8 đều có thể định tuyến ngay hôm nay trên một khóa tương thích OpenAI với tính năng tự động chuyển đổi dự phòng giữa các nhà cung cấp, và mẫu Qwen3.8 2,4 nghìn tỷ tham số sắp ra mắt đã có sẵn một trang trong danh mục để chờ trọng số, thay vì một trang giữ chỗ giả vờ phục vụ chúng.
Kolibri không thể định tuyến. Chúng tôi đã dò danh mục theo mọi cách viết của nhà cung cấp và model, và nó không xuất hiện — vì vậy cách duy nhất để gọi nó là bản tải xuống 78 GB. Nếu bạn muốn biết mô hình Đức sẽ tốn bao nhiêu cho khối lượng công việc của bạn, câu trả lời là một rack và một người có thể chạy vLLM, và hiện không bên thứ ba nào có thể báo giá cho bạn bất cứ thứ gì khác.

Ai nên mua loại nào
Quyết định không xoay quanh chất lượng, bởi vì câu hỏi đó đã được chính bảng của nhà cung cấp giải đáp theo hướng có lợi cho Alibaba. Nó xoay quanh việc bạn đang mua bảo hiểm cho rủi ro nào.
• Chọn Kolibri nếu ràng buộc mang tính quyết định là quyền tài phán, tài liệu chứng minh nguồn gốc hoặc khả năng kiểm toán — nếu bạn cần có thể trả lời dữ liệu huấn luyện đến từ đâu, việc tính toán được thực hiện ở đâu và theo luật nào, và nếu khối lượng công việc là tài liệu tiếng Đức và tiếng Anh được xử lý bên trong ranh giới của riêng bạn. Bạn đang trả một khoản phụ trội về năng lực cho điều đó, và khoản phụ trội này được thể hiện rõ trong bảng ở trên.
• Chọn Qwen3.8 27B nếu ràng buộc quyết định là năng lực trên mỗi đô-la, độ rộng ngôn ngữ hay hỗ trợ hệ sinh thái. Đây là mô hình mạnh hơn theo đánh giá của chính Aleph Alpha, nó được cấp phép Apache, chạy trên một bộ tăng tốc và các gói dịch vụ lưu trữ bắt đầu từ 0,33 USD mỗi triệu token đầu vào nếu bạn không muốn tự vận hành nó.
• Hãy cân nhắc cả hai trong cùng một kiến trúc nếu khối lượng công việc có một lõi chịu quy định và một ngoại vi tổng quát. Những tài liệu không thể rời khỏi tòa nhà sẽ đi đến một endpoint Kolibri tự vận hành; phần tóm tắt, dịch thuật và mã sẽ đi đến một tầng Qwen3.8 được định tuyến với giá một phần ba xu cho mỗi nghìn token. Một khóa API, một quy tắc định tuyến, giá niêm yết của nhà cung cấp được chuyển thẳng, và việc chuyển đổi dự phòng được xử lý thay bạn — một cách sắp xếp hữu ích hơn đáng kể so với việc chọn một trong hai cái này và giả vờ rằng cái còn lại không tồn tại.
