Đã tạo thẻ hero cho Kolibri vs Qwen 3.8, có tiêu đề 'Kolibri vs Qwen 3.8' cùng dòng phụ 'sovereign German serving against an open Chinese family', một biểu tượng chim ruồi ở bên trái và một đường viền đám mây ở bên phải, hai bên của một đường phân cách mảnh. Logo OrcaRouter nằm trong dải bên dưới hình minh họa.
Guides & Insights

Kolibri vs Qwen 3.8: Mô hình Đức thua ngay trên bàn của chính mình, và đó chính là điểm mấu chốt

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hãy bắt đầu bằng câu mà hầu hết các bài đưa tin về màn ra mắt của Kolibri đã bỏ qua. Trên bảng benchmark mà Aleph Alpha công bố cùng mô hình của mình vào ngày 3 tháng 10 năm 2026, mô hình được đem ra so sánh nhiều nhất không phải một đối thủ châu Âu, cũng không phải một đối thủ Mỹ. Đó là Qwen3.8 27B, phiên bản trọng số mở thuộc thế hệ đó của nhà cung cấp, phát hành ngày 13 tháng 8 năm 2026 — và theo chính số liệu của Aleph Alpha, nó thắng. Qwen3.8 27B đạt 80,2 ở mức trung bình tiếng Anh và 79,9 ở mức trung bình tiếng Đức trong cùng bộ đánh giá mà Kolibri chỉ đạt 75,5 và 70,8. Nó dẫn đầu ở GPQA Diamond, 89,2 so với 84,3. Nó dẫn đầu ở LiveCodeBench v6, 93,8 so với 85,9. Nó dẫn đầu ở SWE-Bench Verified, 72,6 so với 66,4, và ở cả hai benchmark ngữ cảnh dài, 76,9 so với 64,5 trên LongBench Pro và 81,3 so với 68,3 trên AA-LCR. Một mô hình Trung Quốc dạng dense 27 tỷ tham số, được đánh giá bởi một phòng thí nghiệm Đức, lại đánh bại mô hình chủ lực 78 tỷ tham số của chính phòng thí nghiệm đó trên phần lớn bảng so sánh của họ. Đó không phải là một vụ bê bối. Đó là sự thật hữu ích nhất trong lần ra mắt này, bởi nó buộc ta phải đặt câu hỏi Kolibri thực sự để làm gì.

Một điểm cần làm rõ trước khi so sánh đi xa hơn, bởi "Qwen 3.8" là tên của cả một dòng mô hình chứ không phải một mô hình đơn lẻ, và những khác biệt này rất quan trọng ở đây. Qwen3.8-Max là mô hình chủ lực chạy trên hạ tầng của Alibaba, hoạt động từ ngày 3 tháng 8 năm 2026 với cửa sổ ngữ cảnh 1M token, mức giá 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho token đầu ra. Qwen3.8-27B là phiên bản trọng số mở, phát hành ngày 13 tháng 8 năm 2026 với cửa sổ 262.144 token. Qwen3.8-Flash là phiên bản dành cho khối lượng lớn, phát hành ngày 26 tháng 8 năm 2026 với cửa sổ 1M token và mức giá thấp hơn nhiều. Còn Qwen3.8 không có hậu tố — được công bố ngày 19 tháng 7 năm 2026 dưới dạng một mô hình trọng số mở chủ lực 2,4 nghìn tỷ tham số — vẫn chưa phát hành; nó chỉ tồn tại dưới dạng một trang danh mục theo dõi và một thông báo. Tất cả nội dung bên dưới đều nói về phiên bản có trọng số mà bạn có thể tải về và chạy, tức bản 27B.

Kolibri thực sự thắng ở đâu, hãy đọc từ cùng bảng đó

Những dòng mà Kolibri dẫn trước Qwen3.8 27B không hề nằm rải rác một cách ngẫu nhiên. Chúng tụ lại thành cụm, và chính cụm đó là sản phẩm.

• Từ chối trả lời — trên RGB Negative, Kolibri đạt 85,6 so với 70,6. Khi ngữ cảnh không chứa câu trả lời, Kolibri nói rõ điều đó thường xuyên hơn nhiều.

• Gọi công cụ trong điều kiện ràng buộc — trên τ²-bench telecom, 94,7 so với 82,5; trên bộ kiểm thử theo ngành dọc cho nhà cung cấp ô tô, 99,0 so với 97,3.

• Ngữ cảnh rất dài — trên SealQA không có distractor vượt quá 24k token, 100.0 so với 94.4.

• Kinh tế phục vụ tiếng Đức — một tokenizer song ngữ đạt trung bình 4,90 byte mỗi token trên văn bản web tiếng Đức, so với 4,17 đối với dòng Qwen3.5–3.8 theo đo lường của chính Aleph Alpha. Ít token hơn cho mỗi tài liệu tiếng Đức là mức giảm chi phí suy luận trực tiếp, điều thể hiện trên hóa đơn và không xuất hiện ở hàng nào trong bảng xếp hạng.

Ba trong bốn điều đó nói về hành vi chứ không phải năng lực. Khả năng không trả lời, gọi công cụ có ràng buộc và truy xuất ngữ cảnh dài có căn cứ là những gì bạn cần ở một mô hình đọc tài liệu của chính tổ chức bạn và được kỳ vọng sẽ thừa nhận khi tài liệu không trả lời được câu hỏi. Aleph Alpha đã xây dựng toàn bộ bản phát hành xoay quanh canh bạc đó, và bảng cho thấy canh bạc ấy đang thành công.

Generated two-column scoreboard for Kolibri and Qwen3.8 27B. Left column Kolibri: English average 75.5, German average 70.8, abstention 85.6, GPQA Diamond 84.3, SWE-Bench Verified 66.4, licence Apache 2.0. Right column Qwen3.8 27B: English average 80.2, German average 79.9, abstention 70.6, GPQA Diamond 89.2, SWE-Bench Verified 72.6, licence Apache 2.0. The footer reads 'Both columns from Aleph Alpha's published table, vendor harness; no independent reproduction.'

Những hàng mà Qwen3.8 27B thắng đều xoay quanh độ bao phủ: kiến thức ở cả hai ngôn ngữ, câu hỏi khoa học trình độ sau đại học, lập trình thi đấu, kỹ thuật phần mềm cấp kho lưu trữ, và khả năng hiểu tài liệu dài. Nếu yêu cầu của bạn là một mô hình tổng quát mạnh với mức giá trên mỗi token thấp cùng trọng số mở, thì Qwen3.8 27B là mô hình tốt hơn, và bảng này nói điều đó bằng chính ngòi bút của nhà cung cấp.

Cách lý giải đó được củng cố, còn cách của Kolibri thì không. Artificial Analysis đã đo Qwen3.8 27B một cách độc lập, trong cấu hình suy luận Xhigh của nó, và báo cáo Chỉ số Thông minh là 34, đứng #1 trong số 142 mô hình trong so sánh đó, 45,4 token đầu ra mỗi giây, ngữ cảnh 256.000 token và giấy phép Apache 2.0. Ghi chú của họ không mấy hay ho theo một kiểu quen thuộc — rất dài dòng với 200 triệu token được tạo ra trong quá trình đánh giá chỉ số, so với mức trung vị 82 triệu, và chậm — nhưng bản thân điểm số là phép đo của bên thứ ba đối với đối thủ. Kolibri hoàn toàn không có trang nào trên Artificial Analysis. Vậy nên mô hình mạnh nhất trong so sánh này đã được xác minh độc lập, còn mô hình yếu hơn chỉ là lời của nhà cung cấp, điều này ngược lại với cách một flagship châu Âu thế hệ đầu thường được định hình.

Hai kiểu tuyên bố về chuỗi cung ứng, hướng theo hai hướng trái ngược nhau

Cả hai bản phát hành này đều là những lập luận về việc một mô hình đến từ đâu, và các lập luận này là hình ảnh phản chiếu của nhau.

Trường hợp của Aleph Alpha là việc nguồn gốc xuất xứ được coi như một tính năng. Kolibri được các nhóm người Đức huấn luyện trên hạ tầng ở Đức và Phần Lan, theo luật EU và luật Đức. Thẻ mô hình này công bố hỗn hợp tiền huấn luyện — 20 nghìn tỷ token với khoảng 62,5% tiếng Anh, 23,9% tiếng Đức và 13,6% mã — các ngân sách huấn luyện trung gian và ngữ cảnh dài, cấu hình tính toán chính xác 768 NVIDIA B200 trên 96 nút HGX trong 21 ngày, và mức năng lượng ước tính 9,5×10² MWh bao gồm cả chi phí phụ trợ của trung tâm dữ liệu. Thẻ nêu rõ phương pháp huấn luyện đến từng lớp: một transformer hỗn hợp chuyên gia 50 lớp với tỷ lệ phân chia 4:1 giữa attention cửa sổ trượt và attention truy vấn nhóm, Muon và Exact Quantile Balancing trên 384 chuyên gia với 1 chuyên gia dùng chung và 6 chuyên gia định tuyến. Mười hai nghìn từ công bố đi kèm bản tải xuống 78 GB, cùng lập trường bên ký kết được nêu rõ đối với Quy tắc thực hành AI đa dụng của EU.

Trường hợp của Alibaba thì khác về bản chất: không phải "chúng tôi có thể giải trình cho mọi quyết định" mà là "đây là các trọng số, hãy lấy chúng". Trọng số mở được cấp phép Apache ở quy mô và chất lượng khiến Qwen trở thành mặc định hiệu dụng trên khắp thế giới, một từ vựng 248.077 token bao quát hơn một trăm ngôn ngữ, và một hệ sinh thái phục vụ đã được tinh chỉnh xung quanh các checkpoint đó đủ lâu đến mức gần như mọi ngăn xếp suy luận đều hỗ trợ chúng ngay khi dùng. Lập luận chủ quyền ở đây là về tính khả dụng: không nhà cung cấp nào có thể thu hồi mô hình, bởi vì bạn đã có tệp rồi.

Cả hai tuyên bố đều trung thực và chúng giải đáp những nỗi lo khác nhau. Một người mua thuộc khu vực công ở Baden-Württemberg lo về quyền tài phán và khả năng kiểm toán, và Kolibri hướng đến nỗi lo đó. Một nhóm nghiên cứu ở Nairobi hay São Paulo lo về việc một mô hình bị chặn sau thẻ tín dụng bằng một loại tiền họ không thể thanh toán, và các trọng số Qwen mở hướng đến nỗi lo đó. Điều không trung thực là giả vờ rằng một trong hai là so sánh năng lực, bởi vì bảng năng lực đã đưa ra câu trả lời của nó rồi.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B (Xhigh), marked 'Open weights model, Released August 2026', showing an Intelligence Index of 34 against a median of 8, a #1/142 intelligence rank, a #55/142 speed rank at 45 tokens per second against a 91-token median, input pricing $0.50 per million tokens against a $0.03 median and output pricing $3.00 against a $0.15 median, an average cost of $1.01 per task on the Intelligence Index, a verbosity rank of #22/142 having generated 200M tokens during the index evaluation against a median of 82M, a 256k-token context window, and the Apache 2.0 licence badge.

Khoảng trống về giấy phép là có thật nhưng hẹp hơn so với cảm nhận.

Kolibri là Apache 2.0. Qwen3.8 27B là trọng số mở được cấp phép Apache. Cả hai đều không kèm theo điều khoản bổ sung về sử dụng được chấp nhận, không có ngưỡng người dùng hoạt động hàng tháng và không có điều khoản thương mại riêng — điều này đưa chúng vào một nhóm nhỏ và nghĩa là cả hai đều không cần đánh giá pháp lý trước khi sử dụng cho mục đích thương mại.

Điều phân biệt chúng chính là mọi thứ đi kèm sau giấy phép. Kolibri đi kèm với một plugin vLLM và gói parser từ nhà cung cấp, một container image, bốn mức độ nỗ lực suy luận có thể cấu hình thông qua chat template, một hành vi từ chối trả lời rõ ràng, và một cấu hình lấy mẫu được khuyến nghị. Qwen3.8 27B đến dưới dạng trọng số mà Transformers, vLLM và SGLang đã biết cách phục vụ, với một định dạng gọi công cụ mà hệ sinh thái rộng lớn hơn đã có nhiều tháng để thích ứng.

Phần cứng triển khai cũng khác nhau theo cùng những đường phân chia đó. Trọng số FP8 của Kolibri có dung lượng khoảng ~78 GB, với mức sàn là hai card A100 80 GB, hai H100 SXM5, một H200, một B200 hoặc một B300. Qwen3.8 27B ở dạng bfloat16 có khoảng 54 GB trọng số, tức là chỉ cần một accelerator 80 GB ở độ chính xác đầy đủ, hoặc một bản lượng tử hóa trên phần cứng nhỏ hơn đáng kể. Mô hình Đức tốn nhiều phần cứng hơn mà lại trả về ít benchmark hơn. Đó chỉ là một sự đánh đổi tồi nếu bạn đang mua benchmark.

Những gì thẻ giá cho bạn biết và không cho bạn biết

Kolibri không có giá, vì Aleph Alpha không bán dịch vụ suy luận cho nó. Bản phát hành gồm trọng số, một báo cáo kỹ thuật và một card; không có SKU nào được cung cấp trên máy chủ. Mọi con số chi phí cho Kolibri đều là một phép tính khấu hao phần cứng do bạn tự thực hiện.

Qwen3.8 được công bố giá công khai theo ba bậc, và bậc giữa chính là bậc quan trọng đối với một đội ngũ đang so sánh giữa tự vận hành và thuê.

• Qwen3.8-Max — 2,00 đô la cho mỗi triệu token đầu vào và 6,00 đô la cho đầu ra, ngữ cảnh 1 triệu token, đọc bộ nhớ đệm ở mức 0,25 đô la, phát hành ngày 3 tháng 8 năm 2026.

• Qwen3.8-27B — 0,33 đô la cho đầu vào và 2,40 đô la cho đầu ra, ngữ cảnh 262.144 token, phát hành ngày 13 tháng 8 năm 2026. Đây là các trọng số mở, nên mức giá này là số tiền bạn phải trả nếu bạn không muốn tự chạy chúng.

Qwen3.8-Flash — $0.15 cho đầu vào và $0.47 cho đầu ra với cửa sổ 1M token, phát hành ngày 26 tháng 8 năm 2026.

Đó là giá niêm yết của nhà cung cấp trên OrcaRouter, được chuyển nguyên vẹn, không cộng thêm gì cho mỗi token, và đây chính là đặc tính hữu ích khi câu hỏi đặt ra là liệu một triển khai tự vận hành có hoàn vốn hay không: bạn có thể đo khối lượng token thực tế của mình ở các gói dịch vụ lưu trữ trước khi quyết định đầu tư vào phần cứng. Chúng tôi không cộng thêm biên lợi nhuận, nên khi nhà cung cấp giảm giá thì bên chúng tôi áp dụng ngay trong cùng ngày. Cả ba gói Qwen3.8 đều có thể định tuyến ngay hôm nay trên một khóa tương thích OpenAI với tính năng tự động chuyển đổi dự phòng giữa các nhà cung cấp, và mẫu Qwen3.8 2,4 nghìn tỷ tham số sắp ra mắt đã có sẵn một trang trong danh mục để chờ trọng số, thay vì một trang giữ chỗ giả vờ phục vụ chúng.

Kolibri không thể định tuyến. Chúng tôi đã dò danh mục theo mọi cách viết của nhà cung cấp và model, và nó không xuất hiện — vì vậy cách duy nhất để gọi nó là bản tải xuống 78 GB. Nếu bạn muốn biết mô hình Đức sẽ tốn bao nhiêu cho khối lượng công việc của bạn, câu trả lời là một rack và một người có thể chạy vLLM, và hiện không bên thứ ba nào có thể báo giá cho bạn bất cứ thứ gì khác.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the 1M-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, a p50 time-to-first-token of 2.35 seconds, the attribution 'Public benchmarks by Qwen - 2026-08-03', the description as Alibaba's newest flagship in the Qwen line positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the pricing tiles $2.00 and $6.00, and the OpenAI-compatible and Anthropic-compatible base URLs at https://api.orcarouter.ai/v1 and https://api.orcarouter.ai.

Ai nên mua loại nào

Quyết định không xoay quanh chất lượng, bởi vì câu hỏi đó đã được chính bảng của nhà cung cấp giải đáp theo hướng có lợi cho Alibaba. Nó xoay quanh việc bạn đang mua bảo hiểm cho rủi ro nào.

• Chọn Kolibri nếu ràng buộc mang tính quyết định là quyền tài phán, tài liệu chứng minh nguồn gốc hoặc khả năng kiểm toán — nếu bạn cần có thể trả lời dữ liệu huấn luyện đến từ đâu, việc tính toán được thực hiện ở đâu và theo luật nào, và nếu khối lượng công việc là tài liệu tiếng Đức và tiếng Anh được xử lý bên trong ranh giới của riêng bạn. Bạn đang trả một khoản phụ trội về năng lực cho điều đó, và khoản phụ trội này được thể hiện rõ trong bảng ở trên.

• Chọn Qwen3.8 27B nếu ràng buộc quyết định là năng lực trên mỗi đô-la, độ rộng ngôn ngữ hay hỗ trợ hệ sinh thái. Đây là mô hình mạnh hơn theo đánh giá của chính Aleph Alpha, nó được cấp phép Apache, chạy trên một bộ tăng tốc và các gói dịch vụ lưu trữ bắt đầu từ 0,33 USD mỗi triệu token đầu vào nếu bạn không muốn tự vận hành nó.

• Hãy cân nhắc cả hai trong cùng một kiến trúc nếu khối lượng công việc có một lõi chịu quy định và một ngoại vi tổng quát. Những tài liệu không thể rời khỏi tòa nhà sẽ đi đến một endpoint Kolibri tự vận hành; phần tóm tắt, dịch thuật và mã sẽ đi đến một tầng Qwen3.8 được định tuyến với giá một phần ba xu cho mỗi nghìn token. Một khóa API, một quy tắc định tuyến, giá niêm yết của nhà cung cấp được chuyển thẳng, và việc chuyển đổi dự phòng được xử lý thay bạn — một cách sắp xếp hữu ích hơn đáng kể so với việc chọn một trong hai cái này và giả vờ rằng cái còn lại không tồn tại.