Thẻ tiêu đề kiểu sơ đồ cho 'Tiny Aya Base 32K vs Tiny Aya En-Thinker'. Hai thẻ bo tròn nằm cạnh nhau, được nối từ trái sang phải bằng một mũi tên dán nhãn 'huấn luyện sau'. Thẻ bên trái, 'Tiny Aya Base 32K', mang các dòng 'mô hình nền đã tiền huấn luyện' và 'không có mẫu chat'; thẻ bên phải, 'Tiny Aya En-Thinker', mang 'đã huấn luyện sau' và 'bao gồm chế độ suy nghĩ'. Một dòng căn giữa bên dưới cả hai thẻ ghi 'cùng kiến trúc 3.35B, cùng cửa sổ 32K'. Logo OrcaRouter được ghép vào góc dưới bên phải.
Guides & Insights

Tiny Aya Base 32K so với Tiny Aya En-Thinker: Cha và con, không phải đối thủ

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai kho lưu trữ Hugging Face, mỗi kho có bốn shard safetensors, và kích thước các shard khớp đến từng byte — 1.998.698.496 / 1.996.494.056 / 1.996.494.088 / 708.852.792. Tiny Aya Base 32KTiny Aya En-Thinker không phải là câu trả lời của hai phòng thí nghiệm cho cùng một câu hỏi. Chúng là cùng một kiến trúc Cohere2 3,35B ở hai giai đoạn khác nhau, và chính model card của Cohere Labs nói rõ điều đó: checkpoint gốc "được dùng làm mô hình nền cho Tiny Aya L2-Thinker và Tiny Aya En-Thinker."

Điều đó khiến cách đặt vấn đề đối đầu trực diện thông thường trở nên sai. Bạn không phải đang chọn giữa hai mô hình đa ngôn ngữ 3B cạnh tranh với nhau. Bạn đang chọn giữa một điểm khởi đầu và một phiên bản đã hoàn thiện — và câu hỏi thú vị là bước hậu huấn luyện ở giữa thực sự đã đem lại gì, đã tốn kém ra sao, và liệu một trong hai có dùng được cho điều bạn đang nghĩ tới hay không, khi cả hai đều nằm sau cùng một giấy phép phi thương mại và không cái nào có dù chỉ một benchmark được công bố.

Câu nói duy nhất định đoạt mối quan hệ

Thông thường, một bài "vs" phải suy ra mối quan hệ giữa hai checkpoint từ kiến trúc và số lượng tham số. Ở đây thì bạn không cần phải làm vậy.

Thẻ của Tiny Aya Base 32K nói thẳng điều đó, và thật đáng đọc kỹ vì vị trí của câu ấy — không phải trong chú thích cuối trang, mà trong phần tóm tắt mô hình, giữa phần mô tả checkpoint và phần ghi công nhà phát triển:

"Đây là một mô hình được huấn luyện trước cơ bản và chưa được tinh chỉnh theo chỉ dẫn hay căn chỉnh theo sở thích. Điểm kiểm tra (checkpoint) này được dùng làm mô hình cơ sở cho Tiny Aya L2-Thinker và Tiny Aya En-Thinker."

Điều khiến nó đáng cả một đoạn văn là sự mâu thuẫn mà nó phơi bày. Thẻ mẫu của chính En-Thinker không hề nêu tên Base 32K. Dòng kết của nó dẫn người đọc đến "tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker" — và tiny-aya-base là checkpoint tháng Hai, được ghi trong tài liệu với ngữ cảnh 8K, chứ không phải biến thể 32K vốn tự nhận mình là mô hình cha của En-Thinker. En-Thinker tự nhận 32K ngay trên thẻ của chính nó. Một mô hình không thể được hậu huấn luyện để có cửa sổ rộng gấp bốn lần cửa sổ mà nó được tiền huấn luyện. Vậy nên base 8K sẽ chẳng bao giờ là câu trả lời, và tuyên bố của base 32K khớp với phép tính, còn con trỏ của chính En-Thinker thì không.

Lời giải thích khả dĩ nhất thì rất đời thường: Base 32K được tải lên vào ngày 8 tháng 9 năm 2026, sáu ngày sau khi Thinkers xuất hiện, nên thẻ của En-Thinker được viết trước khi mô hình cha của nó tồn tại và đã không được cập nhật kể từ đó. Đó là suy luận từ dấu thời gian, chứ không phải tuyên bố từ nhà cung cấp — nhưng đó là cách diễn giải cần ít giả định nhất, và điều đó có nghĩa tài liệu mới nhất trong nhóm chính là tài liệu mang nhiều thông tin nhất.

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-base-32K. The page is licence-gated, and the card summary states Model Size 3.35B and Context Length 32K (input + output), followed by the line 'This checkpoint is used as the base model for Tiny Aya L2-Thinker and Tiny Aya En-Thinker' and 'For the 8K release, see tiny-aya-base.' The tags row includes long-context and 46 languages, and the Inference Providers panel reads 'This model isn't deployed by any Inference Provider.'

Từng chiều một

Tất cả nội dung dưới đây là những gì hai model card nêu, trừ phần trùng lặp — cả hai đều là 3.35B, BF16, chỉ văn bản, Cohere2ForCausalLM, CC-BY-NC-4.0, có kiểm soát truy cập và chưa được đánh giá benchmark.

• Giai đoạn — Tiny Aya Base 32K là một mô hình nền được huấn luyện trước, "không được tinh chỉnh theo hướng dẫn hoặc căn chỉnh theo sở thích"; Tiny Aya En-Thinker được huấn luyện sau trên dữ liệu suy luận đa ngôn ngữ với các dấu vết suy luận tiếng Anh.

• Mẫu trò chuyện — Base 32K không cung cấp chat_template.jinja nào cả; En-Thinker cung cấp một mẫu, và thẻ của nó dành hẳn một mục để nói về cách nó kết xuất các lượt.

• Phong cách prompting — ví dụ của chính Base 32K là completion (prompt = "Thủ đô của Tây Ban Nha là"); En-Thinker mong đợi apply_chat_template() với một danh sách tin nhắn.

• Chế độ suy luận — Base 32K không có chế độ suy luận; En-Thinker có hai chế độ, thêm /think theo mặc định và phát ra dấu vết suy nghĩ bằng tiếng Anh, hoặc /no_think với enable_thinking=False để có câu trả lời trực tiếp.

• Phạm vi ngôn ngữ — thẻ của Base 32K tuyên bố huấn luyện trên hơn 70 ngôn ngữ và liệt kê rõ 67 ngôn ngữ; En-Thinker bao gồm "44 ngôn ngữ cộng với tiếng Anh" cùng các vết suy luận bằng tiếng Anh, mở rộng thêm hơn 20 ngôn ngữ nữa thông qua dữ liệu hướng dẫn không suy luận bổ sung.

• Dấu chân kiến trúc — giống hệt nhau. Cùng bốn kích thước shard, cùng số lượng tham số, cùng độ dài tệp cấu hình.

• Ngữ cảnh — đầu vào 32K cộng với đầu ra trên cả hai card. Không cái nào có thể xác minh được: cả hai cấu hình đều nằm sau cổng giấy phép.

• Điểm chuẩn — không có trên cả hai card. Không có đánh giá nào từ bên thứ ba về cả hai mô hình.

• Sức hút — Base 32K hiển thị 0 lượt tải xuống và một lượt thích; En-Thinker hiển thị bảy lượt tải xuống và hai lượt thích. Cả hai đều không xuất hiện trong danh mục của một nhà cung cấp dịch vụ suy luận.

Bước hậu huấn luyện đã mang lại những gì

Ba điều, tất cả đều mang tính hành vi chứ không phải cấu trúc.

Cái đầu tiên là một giao diện dùng được. Một checkpoint không có chat template không phải là mô hình để bạn đưa lời nhắc; nó là mô hình để bạn viết tiếp. Mọi cuộc hội thoại bạn có với Base 32K đều phải do chính bạn tuần tự hóa thành văn bản, và thẻ mô hình cũng nói đúng như vậy: "lời nhắc nên dùng hoàn thành văn bản thay vì chat template. Nên huấn luyện thêm trước khi triển khai nó như một trợ lý hội thoại." En-Thinker đã đưa ra quyết định đó thay bạn, cho tới tận cách bố trí token.

Điều thứ hai là suy luận như một công tắc. Ở En-Thinker, /think/no_think là hai chế độ cho phép cùng một bộ trọng số hoặc tạo ra một chuỗi suy luận hiển thị giữa các thẻ thinking, hoặc trả lời trực tiếp, và thẻ mô hình ghi lại việc đưa một khối suy luận trước đó trở lại cuộc trò chuyện như một lượt của trợ lý. Đó là một sản phẩm của quá trình hậu huấn luyện — không có gì trong một checkpoint cơ sở có thể phản hồi lại điều đó.

Thứ ba là canh bạc thiết kế ở trung tâm của En-Thinker: rằng suy luận diễn ra bằng tiếng Anh ngay cả khi câu hỏi và câu trả lời bằng một ngôn ngữ khác. Thẻ nêu rõ rằng điều này phân biệt nó với Tiny Aya L2-Thinker, "thứ suy nghĩ bằng cùng ngôn ngữ với lời nhắc." Liệu việc lập kế hoạch bằng một ngôn ngữ giàu tài nguyên và trả lời bằng một ngôn ngữ ít tài nguyên có thực sự hữu ích hay không là một câu hỏi nghiên cứu mở, và En-Thinker tồn tại để cho mọi người kiểm chứng điều đó thay vì giải quyết nó. Base 32K, vốn không có chế độ suy luận nào cả, im lặng về câu hỏi này — đó chính xác là lý do nó là đối chứng phù hợp cho bất kỳ ai đang cố gắng trả lời câu hỏi đó.

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-en-thinker, also licence-gated. The tags row reads Text Generation, Transformers, Safetensors, 46 languages, cohere2, aya, reasoning, tiny-aya, conversational and License: cc-by-nc-4.0, and the safetensors panel additionally shows a Chat template entry. The summary describes a 3.35 billion parameter multilingual reasoning model trained with English reasoning traces for 44 languages plus English, and the card lists Model Size 3.35B and Context Length 32K (input + output). The closing line points readers to tiny-aya-global, tiny-aya-base and tiny-aya-l2-thinker, and the sidebar shows 7 downloads last month and 'This model isn't deployed by any Inference Provider.'

Bước hậu huấn luyện tốn bao nhiêu chi phí

Câu trả lời trung thực là không ai có thể định lượng được điều đó, bởi vì cả hai mô hình đều chưa từng được đánh giá trên bất cứ thứ gì. Nhưng hai tấm thẻ đặt cạnh nhau gợi ý về nơi sự đánh đổi tồn tại, và đó không phải là nơi bạn sẽ ngờ tới.

Đó không phải là độ phủ ngôn ngữ. Phạm vi suy luận hẹp 44+ tiếng Anh của En-Thinker là một đặc tính của dữ liệu huấn luyện suy luận của nó, và thẻ cho biết độ phủ mở rộng tới hơn 20 ngôn ngữ khác nữa “thông qua dữ liệu hướng dẫn không suy luận bổ sung” — nên mô hình vẫn xử lý được chúng, chỉ là không có đường suy nghĩ. Đó cũng không phải là cửa sổ ngữ cảnh; cả hai đều công bố 32K.

Đó là độ bao quát về hành vi. Thẻ của Base 32K liệt kê "tiền huấn luyện liên tục, tinh chỉnh theo chỉ dẫn và nghiên cứu về mô hình ngôn ngữ đa ngữ và ngữ cảnh dài" là các mục đích sử dụng dự kiến, với tạo văn bản đa ngữ, tóm tắt, dịch và thích ứng xuyên ngôn ngữ đều được nêu là các ứng dụng hạ nguồn. Thẻ của En-Thinker hẹp hơn: "các tác vụ toán học, khoa học và suy luận tổng quát, cũng như tuân theo chỉ dẫn và tạo sinh mở đa ngữ." Một checkpoint đã qua huấn luyện hậu kỳ mang tính định hướng theo cách một checkpoint cơ sở không có, và hạn chế mà thẻ của Base 32K nêu ra — "Các tác vụ suy luận theo chuỗi suy nghĩ như toán đa ngữ tương đối yếu hơn" — chính là điểm yếu mà huấn luyện hậu kỳ nhắm khắc phục.

Vậy nên dòng họ này được hiểu như một sự phân công lao động hơn là một cuộc cạnh tranh. Bản nền thì rộng và chưa hoàn thiện; En-Thinker thì hẹp và đã hoàn thiện; và chính phần chữ trên thẻ của bản nền gọi nó đúng như nó là — nền tảng cơ sở mà cả hai Thinker đều được định hình từ đó.

Giấy phép mới là ràng buộc thực sự có hiệu lực

Cả hai mô hình đều là CC-BY-NC-4.0 với Chính sách Sử dụng Chấp nhận được của Cohere Labs được xếp lên trên, cả hai đều nằm sau cùng một cổng yêu cầu bạn chấp nhận điều khoản và đăng ký trước khi các tệp được tải xuống, và cả hai đều chuyển các câu hỏi thương mại đến Cohere Sales.

Điều này đáng được nói rõ trước bất kỳ so sánh kỹ thuật nào, vì nó định đoạt câu hỏi cho một phần lớn độc giả. Nếu kế hoạch là một sản phẩm thương mại, thì cả hai checkpoint đều không phải là ứng viên nếu không có một cuộc trao đổi với Cohere, và không mức độ hành vi ngữ cảnh dài hay tính linh hoạt của chế độ suy luận nào có thể thay đổi được điều đó. Ở những nơi mà phi thương mại thực sự ổn — công việc học thuật, nghiên cứu nội bộ, một bộ khung đánh giá chuẩn, một so sánh với mô hình của chính bạn — thì giấy phép không còn liên quan và lựa chọn kỹ thuật là toàn bộ quyết định.

Cả hai đều chưa được benchmark. Đây là cách để lựa chọn dù sao đi nữa.

Việc thiếu vắng các con số là có thật, và nó sẽ không được giải quyết bằng cách đọc kỹ lưỡng hơn. Cả hai card đều không đưa ra bất kỳ tuyên bố nào về hiệu năng, không có bảng xếp hạng nào liệt kê một trong hai mô hình, và không mô hình nào có nhà cung cấp suy luận đứng sau — nghĩa là chưa có nhà cung cấp nào công bố thông lượng hay mức giá vốn thường thay thế cho một phép đo chuẩn. Điều bạn có thể làm là bắt bẻ vào phần cấu trúc, nơi mà bằng chứng rất vững chắc.

• Hãy chọn Tiny Aya Base 32K nếu bạn định huấn luyện. Tiền huấn luyện tiếp diễn, tinh chỉnh theo chỉ dẫn hoặc thích ứng miền trên một mô hình đa ngôn ngữ 3,35B chính là mục đích mà thẻ mô hình nói nó hướng tới, và bắt đầu từ một checkpoint cơ sở nghĩa là bạn không phải đối đầu với quá trình hậu huấn luyện mà bạn không chọn. Cửa sổ 32K cũng hỗ trợ nghiên cứu ngữ cảnh dài mà bản cơ sở 8K tháng Hai không thể.

• Hãy chọn Tiny Aya En-Thinker nếu hôm nay bạn muốn gửi một lời nhắc. Đây là mẫu duy nhất trong hai mẫu có thể trò chuyện và là mẫu duy nhất có chế độ suy luận.

• Hãy chọn cả hai nếu câu hỏi mang tính khoa học hơn là thực tiễn. Cặp này là một so sánh có kiểm soát — cùng kiến trúc, cùng kích thước, cùng cửa sổ, chủ yếu khác ở việc liệu hậu huấn luyện có xảy ra hay không — để đặt câu hỏi liệu các dấu vết lý luận tiếng Anh có cải thiện câu trả lời đa ngôn ngữ hay không. Đó là câu hỏi mà En-Thinker được phát hành để cho phép mọi người thăm dò, và chính mô hình cha của nó là đường cơ sở sạch nhất.

A two-column scoreboard titled 'Tiny Aya Base 32K vs Tiny Aya En-Thinker — the scoreboard'. Both columns use the same six labels. The 'Tiny Aya Base 32K' column reads 'Stage: Pretrained base', 'Chat template: none', 'Reasoning mode: none', 'Languages: 70+ claimed', 'Benchmarks: none published' and 'Providers: none'. The 'Tiny Aya En-Thinker' column reads 'Stage: Post-trained SFT', 'Chat template: included', 'Reasoning mode: thinking mode', 'Languages: 44 + English', 'Benchmarks: none published' and 'Providers: none'. A footer reads 'Both cards stated by Cohere Labs; neither model has any independent benchmark.' The OrcaRouter logo is composited in the bottom-right corner.

Một lưu ý thực tế khi đánh giá cả hai: chúng là những checkpoint nghiên cứu chưa được kiểm chứng, không có lịch sử triển khai, và việc tải xuống 6,7 GB BF16 cùng thời gian GPU là một chi phí thực sự để bỏ ra cho một mô hình chưa từng được chạy độc lập. Chạy so sánh đó qua một endpoint duy nhất thay vì dựng trọng số cho từng ứng viên sẽ rẻ hơn — OrcaRouter mang 195 mô hình sau một API với 0% phụ phí trên giá niêm yết của nhà cung cấp và tự động chuyển đổi dự phòng giữa các nhà cung cấp, nên một checkpoint nghiên cứu mà bạn chỉ đang thử nghiệm sẽ không bao giờ nằm trên đường dẫn sản xuất. Tiny Aya không có trên đó và chúng tôi không lưu trữ nó; vấn đề chỉ là hầu hết những mô hình mà bạn sẽ đem nó ra thử nghiệm với đều có mặt.

Điều gì sẽ giải quyết việc này?

Hai thứ, và cả hai đều rẻ cho Cohere Labs để công bố và đắt đỏ để bất kỳ ai khác tạo ra.

Việc đầu tiên là một benchmark — bất kỳ benchmark nào. Một đánh giá suy luận đa ngôn ngữ duy nhất được chạy trên cả hai checkpoint sẽ chuyển toàn bộ họ mô hình từ "được nêu trên thẻ" sang "được đo lường", và nó sẽ trả lời ngay liệu thiết kế suy nghĩ bằng tiếng Anh có đánh bại cùng mô hình không qua hậu huấn luyện hay không, vốn là câu hỏi nghiên cứu mà bản phát hành này xoay quanh.

Thứ hai là một tệp cấu hình. Tuyên bố 32K trên cả hai card là không thể kiểm chứng khi các kho lưu trữ vẫn bị giới hạn truy cập, và sự khác biệt giữa một lần tiền huấn luyện ngữ cảnh dài đúng nghĩa với một phần mở rộng mã hóa vị trí được áp lên một checkpoint 8K là rất lớn trên thực tế, dù cả hai đều tạo ra một mô hình chấp nhận 32K token. Việc mở hai tệp cấu hình sẽ thu hẹp khoảng cách đó theo cách mà không nội dung quảng cáo nào có thể làm được.

Cho đến lúc đó, câu trả lời chính xác cho "Tiny Aya Base 32K hay Tiny Aya En-Thinker" là: sự so sánh là thật, nhưng cuộc thi thì không. Cùng trọng số, cùng cửa sổ, cùng giấy phép, cùng sự im lặng từ tất cả những ai chưa tải chúng về — một trong hai chỉ có mẫu chat và các thẻ suy nghĩ, còn cái kia là thứ mà nó được tạo ra từ đó.