Thẻ tiêu đề chính cho 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B' với phụ đề 'Điểm ngọt của mô hình Dense hay Mô hình hàng đầu MoE với cùng mức giá', hiển thị hai biểu tượng ngăn xếp mô hình với dấu bằng giữa chúng và hai chip thẻ giá giống hệt nhau được gắn nhãn $0.074 / $0.295, với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Tencent Hy-MT2-7B so với Tencent Hy-MT2-30B-A3B: Điểm tối ưu của mô hình Dense hay mô hình MoE hàng đầu ở cùng mức giá

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đây chính là điều bất ngờ cốt lõi của cuộc so tài này: cả Tencent Hy-MT2-7B, mô hình dense 7B, lẫn Tencent Hy-MT2-30B-A3B, mô hình flagship mixture-of-experts với tổng cộng 30 tỷ tham số và khoảng 3 tỷ tham số hoạt động, đều đã trở nên có thể gọi qua API lưu trữ trong tuần này — bản 7B vào khoảng ngày 19 tháng 8 năm 2026, bản 30B-A3B một ngày sau đó, cả hai đều do Tencent Cloud cung cấp — với mức giá hoàn toàn giống nhau: 0,074 USD cho mỗi triệu token đầu vào và 0,295 USD cho mỗi triệu token đầu ra. Gia đình mô hình này được công bố mã nguồn mở cùng nhau vào ngày 21 tháng 5 năm 2026, nên cả hai mô hình đều không phải là mới; chính mức giá API giống hệt nhau mới là điều khiến phép so sánh này thực sự kỳ lạ. Thông thường, mô hình lớn hơn sẽ đắt hơn và bạn cân nhắc mức phí chênh lệch so với lợi ích đạt được. Còn ở đây, flagship không tốn thêm chi phí nào cho mỗi token, và quyết định thu gọn lại thành một câu hỏi duy nhất: bản 7B phải đánh đổi điều gì, nếu có, khi là một mô hình dense và nhỏ?

Bất ngờ về cùng mức giá

Sự ngang giá của 30B-A3B là món hời của MoE đang phát huy tác dụng. Kiến trúc của nó chứa 30B kiến thức lưu trữ nhưng chỉ kích hoạt khoảng 3B cho mỗi token, vì vậy Tencent Cloud có thể phục vụ nó với mức giá trên mỗi token tương đương với 7B — cùng mức $0,074 / $0,295, cùng ngữ cảnh 8.192 token, cùng hỗ trợ đầu ra có cấu trúc, cùng hạn chế không hỗ trợ gọi hàm. Trên API, mô hình "chuyên nghiệp" không đắt hơn. Điểm hạn chế chuyển sang nơi khác: sang mức chiếm dụng bộ nhớ, độ phức tạp khi phục vụ và độ trễ — nơi thiết kế dày đặc và đơn giản hơn của 7B có lợi thế về mặt cấu trúc mà mức giá trên mỗi token không thể hiện được.

So sánh thông số kỹ thuật

Kiến trúc — dense ~7B so với MoE 30B tổng cộng / ~3B hoạt động.

Giá API — $0.074 / $0.295 so với $0.074 / $0.295 mỗi 1M token (giống hệt).

Ngữ cảnh — cả hai đều 8.192 token.

Định vị — điểm cân bằng lý tưởng so với flagship cấp chuyên nghiệp.

FLORES-200 — 7B: 86.89 XCOMET-XXL, ≈97.9% so với Gemini 3.1 Pro (Think); 30B-A3B: điểm dịch tổng quát tốt nhất của dòng model này (số liệu do nhà cung cấp báo cáo).

So sánh Deep​Seek / K​imi — cả hai đều vượt qua DeepSeek-V4-ProKimi K2.6 ở chế độ tư duy nhanh, theo báo cáo của nhà cung cấp.

Kích thước — một A100 / RTX 4090 so với trọng số quy mô 30B (một bản lượng tử hóa mức 18GB trên đĩa và nhiều hơn trong VRAM).

Cài đặt mặc định suy luận — temp 0.7, top_p 0.6, top_k 20 so với temp 0.7, top_p 1.0, top_k -1.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B — the scoreboard'. Left column Hy-MT2-7B: Architecture dense 7B; API price $0.074 / $0.295; FLORES-200 86.89; Context 8,192; Footprint single GPU; Role balanced sweet spot. Right column Hy-MT2-30B-A3B: Architecture MoE 30B / 3B active; API price $0.074 / $0.295; FLORES-200 tops the family; Context 8,192; Footprint data-center VRAM; Role professional-grade. Footer: Prices identical as listed Aug 2026; figures vendor-reported.

Nơi mà 30B-A3B thực sự chiến thắng

Tencent định vị 30B-A3B là thành viên cấp chuyên nghiệp của dòng sản phẩm, và bằng chứng họ công bố ủng hộ nhãn này cho một loại văn bản cụ thể. Trên các tài liệu nặng về chuyên ngành — điều khoản pháp lý, văn bản y khoa, tài liệu kỹ thuật — đường GEMBA của nó trên DomainMTBench là mạnh nhất trong dòng, được báo cáo ở khoảng 99% so với đường cơ sở Gemini 2.5 Pro, và điểm dịch thuật tổng quát của nó vượt qua bản 7B trên đường cong FLORES của chính dòng sản phẩm. 27B kiến thức bổ sung đang ngủ yên đó chính là loại năng lực thể hiện khi một câu mang thuật ngữ dày đặc thay vì văn xuôi thông thường: một hợp đồng có điều khoản "bồi thường sẽ vẫn còn hiệu lực sau khi chấm dứt" không gây quá nhiều sức ép cho mô hình 7B, nhưng một tài liệu M&A đầy đủ kèm bảng chú giải thì có. 30B-A3B cũng là lựa chọn an toàn nhất cho các cặp ngôn ngữ từ tiếng Trung sang tiếng dân tộc thiểu số (Tây Tạng, Duy Ngô Nhĩ, Mông Cổ), nơi Tencent báo cáo các con số tốt nhất của họ.

Nơi mà 7B vẫn thắng

Những lợi thế của 7B mang tính vận hành, và chúng là thật. Thứ nhất, tự lưu trữ: 7B nằm gọn trên một chiếc A100 hoặc RTX 4090 duy nhất và có độ phủ framework rộng nhất — Transformers, vLLM, SGLang và llama.cpp qua GGUF đều được vận hành. 30B-A3B, kể cả khi đã lượng tử hóa, vẫn đòi hỏi VRAM cấp trung tâm dữ liệu và ít người đã đưa nó qua các ngăn xếp serving sản xuất. Thứ hai, độ trễ và sự đơn giản khi serving: một 7B dense dễ giữ nóng hơn, và cấu hình sampling được khuyến nghị của nó gần với kiểu giải mã chuẩn hơn. Thứ ba, trên API, mức giá giống hệt nghĩa là 7B có chi phí mỗi token chính xác bằng mẫu chủ lực — vậy nên lý do duy nhất để chọn mô hình nhỏ hơn là vì với văn bản tổng quát sạch, khoảng cách chất lượng quá mỏng để nhận ra. 7B vốn đã đạt khoảng 97,9% của Gemini 3.1 Pro (Think) trên FLORES-200; các điểm số tăng thêm của mẫu chủ lực nằm ở phần đỉnh của một đường cong nơi mỗi điểm càng khó nhận thấy hơn trong thực tế.

Khoảng cách, được đo lường một cách trung thực

Mọi thứ trong hai phần cuối đều là đánh giá của chính Tencent, và cách đọc trung thực là hai mô hình đủ sát nhau về dịch thuật thông thường đến mức ngữ liệu của bạn mới là yếu tố quyết định. Trên văn bản sạch thông thường, điểm ~97,9% so với Gemini của bản 7B có nghĩa là khoảng cách của bản flagship chỉ được đo bằng những chênh lệch nhỏ trên thang XCOMET — có thật trên bảng xếp hạng, nhưng khó cảm nhận khi xử lý một ticket hỗ trợ. Trên văn bản chuyên ngành dày đặc và các cặp ngôn ngữ thiểu số, các lợi thế GEMBA và FLORES mà bản flagship báo cáo chính là nơi một dịch giả chuyên nghiệp (con người hay mô hình) chứng minh được giá trị của mình, và cũng là nơi việc dịch lại tốn kém nhất. Tính đến thời điểm viết bài, chưa có điểm chuẩn độc lập nào cho một trong hai mô hình; điều duy nhất mà cả hai thẻ thông số của nhà cung cấp đều thống nhất là mỗi phiên bản kích thước đều vượt qua DeepSeek-V4-Pro và Kimi K2.6 ở chế độ tư duy nhanh của dòng mô hình này.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-30B-A3B (captured August 23 2026) showing the MoE architecture (30B total / 3B active), Apache-2.0 license, and the professional-grade positioning.

Điều hướng gia đình

Cả hai mô hình đều không nằm trong danh mục của OrcaRouter tính đến thời điểm bài viết này, vì vậy cả hai đều được phục vụ thông qua cloud riêng của Tencent và một số nền tảng bên thứ ba. Bài học định tuyến vẫn là bài học thực tiễn. Vì giá API là giống hệt nhau, đây là một trường hợp kinh điển cho việc định tuyến khối lượng công việc thay vì chọn một mô hình duy nhất: gửi phân đoạn dịch tổng quát có khối lượng lớn đến mô hình 7B và phân đoạn mật độ cao, nặng về chuyên ngành đến mô hình 30B-A3B, với cơ chế chuyển đổi dự phòng tự động để độ trễ tăng vọt trên endpoint MoE không bao giờ làm trì hoãn đường ống xử lý. Đó là mẫu hình mà DSL định tuyến của OrcaRouter kết hợp trên hơn 200 mô hình chúng tôi đang cung cấp — điều phối theo trọng số chi phí, giá niêm yết của nhà cung cấp được truyền thẳng với mức phụ giá 0% — và nó phù hợp với dòng mô hình này hơn hầu hết các dòng khác, vì nhà cung cấp đã định giá hai tầng để việc phân chia trở nên trung lập về mặt kinh tế.

Bản án

Với cùng mức giá API, câu trả lời mặc định là bản 7B: chi phí mỗi token như nhau, đơn giản hơn khi tự lưu trữ, và gần như ngang bằng trên văn bản thông thường. Hãy dùng bản 30B-A3B khi kho ngữ liệu mang tính chuyên môn cao — luật, y khoa, kỹ thuật, hoặc dịch thuật ngôn ngữ thiểu số — nơi lợi thế về lĩnh vực được công bố của bản chủ lực xứng đáng với dung lượng lớn hơn và độ trễ. Còn nếu khối lượng công việc của bạn là sự kết hợp cả hai, đừng chọn: hãy định tuyến phần thông thường sang bản 7B và phần khó sang bản chủ lực. Đó không phải là sự thỏa hiệp giữa hai bản; đó là cách duy nhất để có được cả hai ở mức giá mà Tencent đặt ra.

A generated infographic titled 'Same price, different model' with two identical cards both labelled '$0.074 / $0.295 per 1M tokens': one 'Dense 7B — simpler to serve, near-flagship on clean text', the other 'MoE 30B-A3B — 30B knowledge, 3B active, professional domains', with the footer 'The MoE bargain: bigger model, same per-token cost.'

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube