
Tencent Hy-MT2-7B so với Tencent Hy-MT2-30B-A3B: Điểm tối ưu của mô hình Dense hay mô hình MoE hàng đầu ở cùng mức giá
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
Đây chính là điều bất ngờ cốt lõi của cuộc so tài này: cả Tencent Hy-MT2-7B, mô hình dense 7B, lẫn Tencent Hy-MT2-30B-A3B, mô hình flagship mixture-of-experts với tổng cộng 30 tỷ tham số và khoảng 3 tỷ tham số hoạt động, đều đã trở nên có thể gọi qua API lưu trữ trong tuần này — bản 7B vào khoảng ngày 19 tháng 8 năm 2026, bản 30B-A3B một ngày sau đó, cả hai đều do Tencent Cloud cung cấp — với mức giá hoàn toàn giống nhau: 0,074 USD cho mỗi triệu token đầu vào và 0,295 USD cho mỗi triệu token đầu ra. Gia đình mô hình này được công bố mã nguồn mở cùng nhau vào ngày 21 tháng 5 năm 2026, nên cả hai mô hình đều không phải là mới; chính mức giá API giống hệt nhau mới là điều khiến phép so sánh này thực sự kỳ lạ. Thông thường, mô hình lớn hơn sẽ đắt hơn và bạn cân nhắc mức phí chênh lệch so với lợi ích đạt được. Còn ở đây, flagship không tốn thêm chi phí nào cho mỗi token, và quyết định thu gọn lại thành một câu hỏi duy nhất: bản 7B phải đánh đổi điều gì, nếu có, khi là một mô hình dense và nhỏ?
Bất ngờ về cùng mức giá
Sự ngang giá của 30B-A3B là món hời của MoE đang phát huy tác dụng. Kiến trúc của nó chứa 30B kiến thức lưu trữ nhưng chỉ kích hoạt khoảng 3B cho mỗi token, vì vậy Tencent Cloud có thể phục vụ nó với mức giá trên mỗi token tương đương với 7B — cùng mức $0,074 / $0,295, cùng ngữ cảnh 8.192 token, cùng hỗ trợ đầu ra có cấu trúc, cùng hạn chế không hỗ trợ gọi hàm. Trên API, mô hình "chuyên nghiệp" không đắt hơn. Điểm hạn chế chuyển sang nơi khác: sang mức chiếm dụng bộ nhớ, độ phức tạp khi phục vụ và độ trễ — nơi thiết kế dày đặc và đơn giản hơn của 7B có lợi thế về mặt cấu trúc mà mức giá trên mỗi token không thể hiện được.
So sánh thông số kỹ thuật
• Kiến trúc — dense ~7B so với MoE 30B tổng cộng / ~3B hoạt động.
• Giá API — $0.074 / $0.295 so với $0.074 / $0.295 mỗi 1M token (giống hệt).
• Ngữ cảnh — cả hai đều 8.192 token.
• Định vị — điểm cân bằng lý tưởng so với flagship cấp chuyên nghiệp.
• FLORES-200 — 7B: 86.89 XCOMET-XXL, ≈97.9% so với Gemini 3.1 Pro (Think); 30B-A3B: điểm dịch tổng quát tốt nhất của dòng model này (số liệu do nhà cung cấp báo cáo).
• So sánh DeepSeek / Kimi — cả hai đều vượt qua DeepSeek-V4-Pro và Kimi K2.6 ở chế độ tư duy nhanh, theo báo cáo của nhà cung cấp.
• Kích thước — một A100 / RTX 4090 so với trọng số quy mô 30B (một bản lượng tử hóa mức 18GB trên đĩa và nhiều hơn trong VRAM).
• Cài đặt mặc định suy luận — temp 0.7, top_p 0.6, top_k 20 so với temp 0.7, top_p 1.0, top_k -1.

Nơi mà 30B-A3B thực sự chiến thắng
Tencent định vị 30B-A3B là thành viên cấp chuyên nghiệp của dòng sản phẩm, và bằng chứng họ công bố ủng hộ nhãn này cho một loại văn bản cụ thể. Trên các tài liệu nặng về chuyên ngành — điều khoản pháp lý, văn bản y khoa, tài liệu kỹ thuật — đường GEMBA của nó trên DomainMTBench là mạnh nhất trong dòng, được báo cáo ở khoảng 99% so với đường cơ sở Gemini 2.5 Pro, và điểm dịch thuật tổng quát của nó vượt qua bản 7B trên đường cong FLORES của chính dòng sản phẩm. 27B kiến thức bổ sung đang ngủ yên đó chính là loại năng lực thể hiện khi một câu mang thuật ngữ dày đặc thay vì văn xuôi thông thường: một hợp đồng có điều khoản "bồi thường sẽ vẫn còn hiệu lực sau khi chấm dứt" không gây quá nhiều sức ép cho mô hình 7B, nhưng một tài liệu M&A đầy đủ kèm bảng chú giải thì có. 30B-A3B cũng là lựa chọn an toàn nhất cho các cặp ngôn ngữ từ tiếng Trung sang tiếng dân tộc thiểu số (Tây Tạng, Duy Ngô Nhĩ, Mông Cổ), nơi Tencent báo cáo các con số tốt nhất của họ.
Nơi mà 7B vẫn thắng
Những lợi thế của 7B mang tính vận hành, và chúng là thật. Thứ nhất, tự lưu trữ: 7B nằm gọn trên một chiếc A100 hoặc RTX 4090 duy nhất và có độ phủ framework rộng nhất — Transformers, vLLM, SGLang và llama.cpp qua GGUF đều được vận hành. 30B-A3B, kể cả khi đã lượng tử hóa, vẫn đòi hỏi VRAM cấp trung tâm dữ liệu và ít người đã đưa nó qua các ngăn xếp serving sản xuất. Thứ hai, độ trễ và sự đơn giản khi serving: một 7B dense dễ giữ nóng hơn, và cấu hình sampling được khuyến nghị của nó gần với kiểu giải mã chuẩn hơn. Thứ ba, trên API, mức giá giống hệt nghĩa là 7B có chi phí mỗi token chính xác bằng mẫu chủ lực — vậy nên lý do duy nhất để chọn mô hình nhỏ hơn là vì với văn bản tổng quát sạch, khoảng cách chất lượng quá mỏng để nhận ra. 7B vốn đã đạt khoảng 97,9% của Gemini 3.1 Pro (Think) trên FLORES-200; các điểm số tăng thêm của mẫu chủ lực nằm ở phần đỉnh của một đường cong nơi mỗi điểm càng khó nhận thấy hơn trong thực tế.
Khoảng cách, được đo lường một cách trung thực
Mọi thứ trong hai phần cuối đều là đánh giá của chính Tencent, và cách đọc trung thực là hai mô hình đủ sát nhau về dịch thuật thông thường đến mức ngữ liệu của bạn mới là yếu tố quyết định. Trên văn bản sạch thông thường, điểm ~97,9% so với Gemini của bản 7B có nghĩa là khoảng cách của bản flagship chỉ được đo bằng những chênh lệch nhỏ trên thang XCOMET — có thật trên bảng xếp hạng, nhưng khó cảm nhận khi xử lý một ticket hỗ trợ. Trên văn bản chuyên ngành dày đặc và các cặp ngôn ngữ thiểu số, các lợi thế GEMBA và FLORES mà bản flagship báo cáo chính là nơi một dịch giả chuyên nghiệp (con người hay mô hình) chứng minh được giá trị của mình, và cũng là nơi việc dịch lại tốn kém nhất. Tính đến thời điểm viết bài, chưa có điểm chuẩn độc lập nào cho một trong hai mô hình; điều duy nhất mà cả hai thẻ thông số của nhà cung cấp đều thống nhất là mỗi phiên bản kích thước đều vượt qua DeepSeek-V4-Pro và Kimi K2.6 ở chế độ tư duy nhanh của dòng mô hình này.

Điều hướng gia đình
Cả hai mô hình đều không nằm trong danh mục của OrcaRouter tính đến thời điểm bài viết này, vì vậy cả hai đều được phục vụ thông qua cloud riêng của Tencent và một số nền tảng bên thứ ba. Bài học định tuyến vẫn là bài học thực tiễn. Vì giá API là giống hệt nhau, đây là một trường hợp kinh điển cho việc định tuyến khối lượng công việc thay vì chọn một mô hình duy nhất: gửi phân đoạn dịch tổng quát có khối lượng lớn đến mô hình 7B và phân đoạn mật độ cao, nặng về chuyên ngành đến mô hình 30B-A3B, với cơ chế chuyển đổi dự phòng tự động để độ trễ tăng vọt trên endpoint MoE không bao giờ làm trì hoãn đường ống xử lý. Đó là mẫu hình mà DSL định tuyến của OrcaRouter kết hợp trên hơn 200 mô hình chúng tôi đang cung cấp — điều phối theo trọng số chi phí, giá niêm yết của nhà cung cấp được truyền thẳng với mức phụ giá 0% — và nó phù hợp với dòng mô hình này hơn hầu hết các dòng khác, vì nhà cung cấp đã định giá hai tầng để việc phân chia trở nên trung lập về mặt kinh tế.
Bản án
Với cùng mức giá API, câu trả lời mặc định là bản 7B: chi phí mỗi token như nhau, đơn giản hơn khi tự lưu trữ, và gần như ngang bằng trên văn bản thông thường. Hãy dùng bản 30B-A3B khi kho ngữ liệu mang tính chuyên môn cao — luật, y khoa, kỹ thuật, hoặc dịch thuật ngôn ngữ thiểu số — nơi lợi thế về lĩnh vực được công bố của bản chủ lực xứng đáng với dung lượng lớn hơn và độ trễ. Còn nếu khối lượng công việc của bạn là sự kết hợp cả hai, đừng chọn: hãy định tuyến phần thông thường sang bản 7B và phần khó sang bản chủ lực. Đó không phải là sự thỏa hiệp giữa hai bản; đó là cách duy nhất để có được cả hai ở mức giá mà Tencent đặt ra.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
