Thẻ tiêu đề hero với dòng chữ 'Kolibri vs Intern-Decision 4B' in kiểu chữ đậm lớn, cùng một dòng nhỏ hơn bên dưới ghi 'văn bản được tạo dựa trên phân phối xác suất đã hiệu chỉnh', và hai biểu tượng đường nét phẳng nhỏ nằm cạnh nhau — một con chim ruồi ở bên trái và một biểu đồ đường cong hình chuông nhỏ ở bên phải — được phân cách bằng một vạch chia dọc mảnh, đặt trên nền trắng với các điểm nhấn gradient xanh dương và xanh lơ nhẹ và logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

Kolibri so với Intern-Decision 4B: Một bên viết tài liệu, bên kia từ chối viết bất cứ thứ gì.

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Điều hữu ích nhất cần lưu ý về Kolibri và Intern-Decision-4B là chúng không phải cùng một loại đối tượng, và coi đây là so sánh mô hình với mô hình sẽ là một lỗi phạm trù. Kolibri là mô hình ngôn ngữ mixture-of-experts 78,1 tỷ tham số của Aleph Alpha, ra mắt ngày 3 tháng 10 năm 2026, kích hoạt 3,46 tỷ tham số mỗi token và viết văn bản tiếng Đức và tiếng Anh. Intern-Decision-4B là mô hình quyết định có cấu trúc đa phương thức 4,54 tỷ tham số của nhóm InternLM, được tải lên Hugging Face ngày 26 tháng 9 năm 2026, mà thẻ mô hình ghi rõ rằng nó "hoàn toàn không gọi generate() hay lấy mẫu văn bản tự do". Một mô hình tạo ra văn xuôi. Mô hình kia tạo ra phân phối xác suất trên các lựa chọn do bạn cung cấp, chỉ trong một lượt truyền xuôi, và không có khả năng viết thành câu. Chúng chỉ trở thành đối thủ của nhau trong một tình huống hẹp, và việc biết chính xác đó là tình huống nào hóa ra lại là điều hữu ích nhất trong cả hai bản phát hành.

Hai bản phát hành, hai tuyên bố ngắn gọn hoàn toàn khác biệt

Model card của Kolibri là bản đặc tả của một mô hình ngôn ngữ thưa lớn: 50 lớp, mỗi lớp đều là mixture-of-experts, 384 chuyên gia mỗi lớp với một chuyên gia chia sẻ và sáu chuyên gia định tuyến, ngữ cảnh gốc 262.144 token đã được xác thực tới 1.048.576, bốn mức nỗ lực suy luận, gọi công cụ kiểu Hermes với trình phân tích cú pháp vLLM đi kèm, trọng số FP8 theo khối 128×128, và các điều khoản Apache 2.0. Quá trình huấn luyện của nó chạy 20 nghìn tỷ token trên 768 NVIDIA B200 trong 21 ngày — 392.000 giờ GPU ở mức được báo cáo 6,4×10²³ FLOPs và ước tính 9,5×10² MWh bao gồm cả hao phí của trung tâm dữ liệu, không bao gồm tinh chỉnh có giám sát và học tăng cường. Cấu hình phục vụ tối thiểu của model card là hai card A100 80 GB, hai H100 SXM5, một H200, một B200 hoặc một B300, và kích thước FP8 khoảng 78 GB. Đây là một phần hạ tầng nghiêm túc, và nó trả lời câu hỏi bằng cách sinh văn bản.

Intern-Decision-4B là một loại đối tượng ngược lại và thẻ mô hình thẳng thắn một cách sảng khoái về điều đó. Nó là một bản fine-tune của Qwen3.5-4B, trong đó tháp thị giác (vision tower) và projector bị đóng băng và chỉ có phần xương sống ngôn ngữ (language backbone) được huấn luyện. Bạn đưa cho nó một trạng thái, một lược đồ (schema) gồm các câu hỏi có tên, và tùy chọn tối đa tám hình ảnh, và nó trả về một phân phối trên các câu trả lời ứng viên cho mọi câu hỏi cùng một lúc. Cơ chế này khá bất thường và cần được nêu chính xác: các tùy chọn được ánh xạ tới các ký hiệu đơn token trải dài từ A đến Z, a đến z và 0 đến 9 — 62 ứng viên, do đó tối đa 62 tùy chọn mỗi câu hỏi — prompt được kết xuất với một placeholder cho mỗi trường, và mô hình đọc logits tại vị trí ngay trước mỗi placeholder. Softmax chỉ chạy trên các logits ký hiệu được phép của trường đó, một nhiệt độ đặc thù cho checkpoint hiệu chỉnh kết quả, và các ký hiệu được ánh xạ trở lại các giá trị tùy chọn ban đầu của bạn dưới dạng JSON có kiểu. Không có vòng lặp giải mã, không lấy mẫu và không có văn xuôi.

• Đầu ra — Kolibri: văn bản tiếng Đức hoặc tiếng Anh được tạo tự do, các lệnh gọi công cụ, dấu vết suy luận. Intern-Decision-4B: câu trả lời JSON được định kiểu với xác suất cho mỗi lựa chọn.

• Tham số — Kolibri: tổng cộng 78,103,074,560, 3,457,573,120 hoạt động. Intern-Decision-4B: 4.54 tỷ trải trên bốn phân mảnh safetensors ở định dạng bfloat16, với một tháp thị giác đóng băng.

• Đầu vào — Kolibri: chỉ văn bản. Intern-Decision-4B: văn bản cùng tối đa tám hình ảnh.

• Dung lượng câu hỏi — Intern-Decision-4B: tối đa 62 tùy chọn mỗi trường, trong một lượt truyền xuôi, với các loại câu hỏi 'choice', 'score' và 'noul' (có/không). Kolibri: về nguyên tắc là không giới hạn, trên thực tế là từng token một.

• Ngôn ngữ — Kolibri: tiếng Đức và tiếng Anh theo thiết kế. Intern-Decision-4B: bất kể Qwen3.5-4B mang những gì, với tất cả các bộ đánh giá đã công bố bằng tiếng Anh.

• Độ trễ — Intern-Decision-4B: trung bình 44,16 ms, trung vị 44,03 ms và P95 44,60 ms mỗi truy vấn trên một RTX 4090 duy nhất, theo đo lường của chính nó. Kolibri: hoàn toàn không có số liệu công bố nào cho mỗi truy vấn.

• Giấy phép — cả hai đều dùng Apache 2.0; Intern-Decision-4B được phát hành kèm theo tệp giấy phép Qwen vẫn được giữ nguyên.

A two-column comparison scoreboard titled 'Kolibri vs Intern-Decision 4B'. Left column Kolibri: Output freely generated text, Parameters 78.1B MoE / 3.46B active, Input text only, Context 262,144 native / 1M validated, Latency none published, Licence Apache 2.0. Right column Intern-Decision 4B: Output typed JSON with a probability per option, Parameters 4.54B bfloat16 with a frozen vision tower, Input text plus up to eight images, Options up to 62 per field in one forward pass, Latency 44.16 ms mean on one RTX 4090, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; Intern-Decision 4B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

Tại sao lại tồn tại một bộ chấm điểm 4B

Luận điểm dành cho Intern-Decision-4B không nằm ở chỗ nó nhỏ. Mà ở chỗ hỏi một mô hình tạo sinh lớn để lấy một xác suất không giống với việc đo lường một xác suất, và sự khác biệt đó có thể đo lường được.

Bảng benchmark của chính model card đưa ra lập luận với mức độ tự tiết lộ bất thường. Trên bảy bộ kiểm thử độ chính xác, Intern-Decision-4B đạt trung bình 90,02 — so với 88,74 của baseline mạnh nhất mà nó so sánh, một mô hình tên là Jev. Nhưng độ chính xác chỉ là nửa phần kém thú vị. Bảng cũng báo cáo điểm Brier và sai số hiệu chuẩn kỳ vọng, và ở đó bức tranh khắt khe hơn. Mô hình 4B ghi nhận Brier 0,347 và ECE 0,065, so với 0,358 và 0,095 của Jev. Các mô hình anh em nhỏ hơn mới là nơi câu chuyện hiệu chuẩn trở nên thực sự đáng chú ý. Intern-Decision-2B đạt trung bình 84,68, vượt xa mô hình 0.8B với 79,38 — và thế mà ECE 0,100 của nó lại tệ hơn 0,066 của 0.8B và tệ hơn 0,065 của 4B, với Brier 0,437 so với 0,530 của 0.8B. Mô hình chính xác nhất trong hai mô hình nhỏ lại là mô hình kém trung thực nhất về độ tin cậy của chính nó. Nếu bạn từng cho rằng hiệu chuẩn cải thiện theo độ chính xác, hoặc theo số lượng tham số, thì bảng đó là phản ví dụ cho cả hai.

Một chẩn đoán thứ hai, riêng biệt bao gồm 96 trường hợp được xây dựng bằng các phân phối tham chiếu chính xác thay vì các nhãn cứng được lấy mẫu — các lần rút ngẫu nhiên, các sự kiện tổ hợp, lịch sử có điều kiện, các câu đố xác suất. Lỗi của mô hình 4B trên thử nghiệm thí điểm đó giảm từ 0.628 xuống 0.550 theo chỉ số được báo cáo, trong khi mô hình so sánh đứng ở 0.595. Thẻ nêu rõ rằng thử nghiệm thí điểm này không được dùng để khớp hoặc chọn nhiệt độ đã công bố; nhiệt độ 1.992418 của 4B được khớp riêng trên một tập hiệu chuẩn. Đội ngũ InternLM cũng đã đưa chính bộ đánh giá vào kho GitHub — trình tạo tất định, các tham chiếu và trình chấm điểm ngoại tuyến — nghĩa là tuyên bố hiệu chuẩn thuộc loại hiếm hoi mà bên thứ ba thực sự có thể chạy lại thay vì phải tin tưởng.

Không có gì trong bản phát hành của Kolibri cung cấp một thứ tương đương. Bảng so sánh của nó báo cáo độ chính xác nhiệm vụ của mười bốn mô hình trên một khung đánh giá của nhà cung cấp, và độ chính xác là thứ có thể dùng để đo một mô hình sinh. Không có con số hiệu chuẩn nào, không có Brier hay ECE ở bất kỳ đâu trong tài liệu, và không có cách nào để yêu cầu nó đưa ra "xác suất rằng điều khoản hợp đồng này có thể được thi hành" mà không phải lấy mẫu một câu và đọc nó.

Đường nối duy nhất nơi chúng gặp nhau

Đặt hai công cụ cạnh nhau trong một pipeline thực tế, hình dạng của chúng lập tức lộ rõ. Một quy trình xử lý tài liệu tiếng Đức cần cả hai nửa, và không công cụ nào đảm nhiệm được nửa của công cụ kia.

Kolibri là nửa đảm nhiệm việc đọc và viết. Một nhóm có hợp đồng tiếng Đức hoặc tài liệu kỹ thuật sẽ nhận được cửa sổ gốc 262.144 token, bộ đệm KV FP8, một tokenizer song ngữ mà Aleph Alpha báo cáo đạt trung bình 4,90 byte mỗi token trên văn bản web tiếng Đức, cùng khả năng gọi công cụ Hermes — nghĩa là, một mô hình có thể tóm tắt hồ sơ, soạn thảo phản hồi và điều khiển một vòng lặp công cụ. Điều nó không thể làm là cho bạn biết độ tin cậy của chính nó theo cách bạn có thể kiểm toán, bởi vì mọi thứ nó phát ra đều là một chuỗi được lấy mẫu.

Intern-Decision-4B là một nửa đảm nhiệm việc quyết định. Khi được đưa một trang văn bản tiếng Đức và một tập lựa chọn cố định, nó trả về một phân phối đã được hiệu chỉnh trong 44 mili giây trên một GPU tiêu dùng, không có bước sinh nào và do đó hoàn toàn không có phương sai lấy mẫu. Điều nó không thể làm là tạo ra chính văn bản tiếng Đức ngay từ đầu, và các bộ đánh giá đã công bố của nó đều bằng tiếng Anh — hành vi tiếng Đức của nó được kế thừa từ nền tảng Qwen3.5-4B chứ không phải được huấn luyện cho việc đó, một hạn chế thực sự đối với triển khai bằng tiếng Đức và là hạn chế chưa từng ai đánh giá.

Vậy nên câu trả lời kỹ thuật trung thực cho một quy trình làm việc bằng tiếng Đức chịu sự quản lý chặt chẽ là đây là hai giai đoạn của cùng một pipeline, chứ không phải hai ứng viên cho cùng một vị trí. Câu hỏi thực tế là mỗi cái chạy ở đâu. Kolibri cần hai H100 hoặc một B200 và khoảng 78 GB. Intern-Decision-4B cần một RTX 4090 và chạy một truy vấn trong dưới 45 mili giây. Sự bất đối xứng về chi phí là khoảng hai bậc độ lớn trên phần cứng, và nó chỉ ra một thiết kế trong đó một bộ chấm điểm nhỏ chạy liên tục trên mọi trường hợp còn bộ sinh lớn chỉ được gọi khi một trường hợp thực sự cần văn xuôi. Đó là một dạng rẻ hơn và dễ kiểm toán hơn so với việc định tuyến mọi trường hợp qua mô hình 78B để nhận được câu trả lời mà sau đó bạn phải diễn giải.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the card header, the description of it as a multimodal structured decision model fine-tuned from Qwen3.5-4B that returns an answer distribution in one forward pass, and the numbered 'How inference works' steps mapping each question's options to single-token symbols.

Thực tế lưu trữ của cả hai, và lớp này dùng để làm gì

Cả hai mô hình đều không có sẵn dưới dạng API được host, và chúng tôi đã kiểm tra chứ không phải giả định. Intern-Decision-4B không có endpoint của nhà cung cấp; bản phát hành gồm trọng số, một kho GitHub và một Hugging Face Space. Số lượt tải xuống và lượt thích của nó đã thay đổi kể từ giữa tuần, điều đó cho thấy mọi người đang đón nhận nó, nhưng vẫn chưa có route gọi được có trả phí ở bất kỳ đâu mà chúng tôi có thể kể tên.

Kolibri tương tự cũng không có SKU API Aleph Alpha — bản phát hành gồm trọng số, một báo cáo kỹ thuật và một container image tại ghcr.io/aleph-alpha/aleph-alpha-inference. Và nó không có trên OrcaRouter: chúng tôi đã dò danh mục theo mọi cách viết của tiền tố nhà cung cấp và tên mô hình, và kết quả trả về là không tìm thấy, điều mà chúng tôi thà nói thẳng còn hơn ngụ ý điều khác.

Điều mà một lớp định tuyến thay đổi ở đây không phải là khả năng truy cập vào hai mô hình này, mà là bài toán kinh tế của việc quyết định có nên mua phần cứng cho một trong hai mô hình hay không. Phép thử trung thực trước khi mua đối với nửa sinh tạo là chạy khối lượng công việc đó trên một tầng mixture-of-experts nhỏ đã được định tuyến sẵn — biến thể Gemma 4 26B-A4B với giá 0,06 USD cho mỗi triệu token đầu vào và 0,33 USD cho mỗi triệu token đầu ra, cửa sổ 262.144 token cùng đầu vào văn bản, hình ảnh và video — trên một khóa tương thích OpenAI theo giá niêm yết của nhà cung cấp mà không thêm gì cả, rồi xem liệu khối lượng công việc tài liệu tiếng Đức có thực sự cần 78 tỷ tham số trước khi đặt mua GPU hay không. Nửa quyết định thì không có lối tắt như vậy, bởi hành vi phân phối đã hiệu chỉnh chính là toàn bộ mục đích của mô hình và không có tầng định tuyến nào làm được điều đó. Nhưng bản thân điều đó đã là một phát hiện: nó cho bạn biết rằng bộ chấm điểm 4B chính là phần bạn thực sự sẽ tự vận hành, còn bộ sinh tạo là phần đáng để kiểm thử lại với một thứ bạn có thể thuê ngay chiều nay.

Điều gì sẽ giải quyết được nó?

Hai phép đo, và cả hai đều chưa tồn tại.

Đầu tiên là Intern-Decision-4B trên đầu vào tiếng Đức. Mọi bộ đánh giá đã công bố đều bằng tiếng Anh và mô hình là một bản tinh chỉnh của một mô hình nền đa ngôn ngữ, nên hiệu chuẩn tiếng Đức của nó là chưa biết — và hiệu chuẩn chính là thuộc tính không thể chuyển giao miễn phí qua các ngôn ngữ. Một phiên bản tiếng Đức của thử nghiệm thí điểm phân bố 96 trường hợp sẽ là tài liệu duy nhất giàu thông tin nhất mà bất kỳ ai có thể công bố về mô hình này.

Thứ hai là chi phí cho mỗi quyết định của Kolibri. Tuyên bố về kinh tế phục vụ của nó là một đường biên Pareto giữa chất lượng và số token được giải mã mỗi giây trên mỗi GPU, và không có trang Artificial Analysis nào cho Kolibri cũng như không có bản sao bên thứ ba nào của bộ khung kiểm thử. Cho đến khi ai đó chạy nó, "78 tỷ tham số" là một thông số kỹ thuật chứ không phải là một chi phí, và lập luận cho việc giữ một bộ chấm điểm 44 mili giây ở phía trước nó vẫn là một lập luận thiết kế chứ không phải là một lập luận đã được đo lường.

Cho đến lúc đó, cách đúng đắn để nhìn nhận sự kết hợp này không phải là một cuộc thi đấu. Intern-Decision-4B là bản phát hành thú vị hơn về mặt kỹ thuật trong hai bản, bởi vì đầu ra có cấu trúc nhận biết hiệu chuẩn là một năng lực mà gần như không mô hình sinh nào cung cấp, và thẻ của nó cho phép bạn kiểm chứng tuyên bố đó. Kolibri là bản phát hành có hệ quả lớn hơn, bởi vì một phòng thí nghiệm châu Âu phát hành một mô hình Apache 2.0 với 78 tỷ tham số cùng đường ống dữ liệu được công bố song song là một sự kiện chuỗi cung ứng hơn là một sự kiện mô hình. Không cái nào thay thế cái kia. Các nhóm cần cả hai nên lập kế hoạch cho cả hai và định cỡ phần cứng tương ứng, và harness bao quanh chúng mới là nơi nỗ lực kỹ thuật thực sự được dồn vào.

A screenshot of the InternLM 'Intern Large Models' organisation page on Hugging Face, showing the organisation header, its stated affiliation with Shanghai AI Laboratory, and a recent-activity feed listing models published within the last hour.