
Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B: Chọn chất lượng phía máy chủ hay một trình dịch 440MB trên mọi điện thoại?
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
Tencent Hy-MT2-7B và Tencent Hy-MT2-1.8B là hai đầu mút của cùng một dòng mô hình, được mở mã nguồn cùng nhau vào ngày 21 tháng 5 năm 2026, và cả hai đều có thể gọi qua API lưu trữ trong tuần này — bản 7B vào khoảng ngày 19 tháng 8 và bản 1.8B sau đó một ngày, mỗi bản đều do Tencent Cloud phục vụ. Chúng không phải là đối thủ theo nghĩa thông thường, vì mục đích sử dụng của chúng gần như không trùng nhau. Bản 7B là lựa chọn chất lượng: một mô hình đặc (dense) chạy trên một GPU duy nhất hoặc qua API với giá 0,074 USD mỗi triệu token đầu vào và 0,295 USD mỗi triệu token đầu ra. Bản 1.8B là lựa chọn chạy trên thiết bị: một mô hình được lượng tử hóa xuống còn 440 megabyte, chạy trên điện thoại, hoàn toàn ngoại tuyến, với giá 0,044 / 0,177 USD mỗi triệu token ở gói API. Nếu bạn đang chọn giữa hai bản, câu trả lời phần lớn phụ thuộc vào nơi bản dịch cần được thực hiện — và chỉ thứ yếu dựa trên điểm chuẩn, vốn gần nhau hơn nhiều so với khoảng cách tham số gấp bốn lần.
Câu trả lời một dòng
Chọn bản 7B khi việc dịch thuật diễn ra trong trung tâm dữ liệu và bạn muốn chất lượng tốt nhất trên mỗi đô la máy chủ — thông qua API hoặc trên một GPU lớp A100 duy nhất. Chọn bản 1.8B khi việc dịch thuật phải diễn ra trên thiết bị, ngoại tuyến, hoặc với chi phí thấp nhất có thể trên mỗi token. Nếu cả hai cùng nằm trên một đám mây và ngân sách không phải là yếu tố quyết định, thì bản 7B thắng về chất lượng. Nếu nội dung là bí mật, bị quản lý, hoặc cần hoạt động mà không có mạng, thì bản 1.8B là lựa chọn duy nhất trong hai bản.
So sánh thông số kỹ thuật
• Tham số — 7B dense so với 1.8B dense.
• Dung lượng lượng tử hóa — FP8 và GGUF giảm xuống còn vài GB so với 440MB nhờ lượng tử hóa AngelSlim 1.25-bit.
• FLORES-200 (XX⇔XX) — 86.89 so với 79.77 của XCOMET-XXL, xấp xỉ 97.9% so với 89.9% của Gemini 3.1 Pro (Think), theo công bố của nhà cung cấp.
• WMT25 — 7B: 63.86/71.21/82.24; bản 1.8B vượt qua các API thương mại của Microsoft và Doubao trên cả ba chỉ số.
• DomainMTBench (GEMBA) — 92.79 so với 91.08, do nhà cung cấp báo cáo.
• giá API — $0.074 / $0.295 so với $0.044 / $0.177 trên 1 triệu token (đầu vào/đầu ra).
• Ngữ cảnh — cả hai đều 8.192 token.
• Triển khai — một A100 / RTX 4090 hoặc API đám mây so với chip trên thiết bị của Apple, Qualcomm và MediaTek, hoạt động ngoại tuyến.

Khoảng cách chất lượng là thực tế nhưng hẹp hơn khoảng cách kích thước
Tất cả những điều dưới đây là đánh giá của chính Tencent, chưa được tái lập. Trên FLORES-200, bản 7B vượt bản 1.8B tới tám điểm XCOMET (86,89 so với 79,77) — khoảng cách mà định vị "cân bằng" so với "trên thiết bị" dựa vào. Nhưng trên DomainMTBench — chuẩn đánh giá dịch thuật theo lĩnh vực bao gồm tài chính, chính trị và giáo dục — bản 1.8B chỉ kém bản 7B 1,7 điểm GEMBA (91,08 so với 92,79). Và vị thế của bản 1.8B trước thế giới rộng lớn hơn chính là chi tiết khiến người ta mãi bất ngờ: Tencent báo cáo rằng mô hình này đánh bại các API dịch thuật thương mại của Microsoft và Doubao trên cả ba chỉ số WMT25, đồng thời vượt qua Tower-Plus-72B, một mô hình lớn gấp bốn mươi lần. Vì vậy, trên văn bản lĩnh vực thông thường, mô hình nhỏ gần với người anh em lớn của nó hơn nhiều so với những gì mức chênh lệch tham số gấp bốn lần gợi ý. Lợi thế thực sự của bản 7B thể hiện ở phần đuôi dịch thuật tổng quát và ở các chỉ dẫn khó, nơi lợi thế FLORES và điểm số tác vụ phức tạp IFMTBench cao hơn của nó tạo ra khoảng cách rõ ràng giữa hai bản.
Nhánh triển khai
Mô hình 7B cần cơ sở hạ tầng — hoặc một API đám mây hoặc một GPU cấp A100, cùng với các thao tác vận hành thông thường đi kèm. Mô hình 1.8B, chỉ 440MB với lượng tử hóa 1.25-bit của AngelSlim, chạy trên cùng loại chip như một ứng dụng điện thoại thông thường, nhanh hơn 1,5 lần so với thế hệ Hy-MT1.5 trước đó và hoàn toàn không cần mạng. Điều đó biến quyền riêng tư từ một tính năng thành một mặc định: đối với hợp đồng, hồ sơ y tế hay bất kỳ lĩnh vực được quản lý nào, dữ liệu không bao giờ rời khỏi thiết bị — một đặc tính mà không một mức giá cho mỗi token nào có thể mua được về phía máy chủ. Sự đánh đổi thể hiện rõ ở bản dịch tổng hợp kiểu FLORES, nơi dung lượng bổ sung của 7B bộc lộ — và trên bất kỳ hướng dẫn nào đủ phức tạp để đẩy tổng điểm 83,14 IFMTBench của 1.8B chạm trần cao hơn của 7B.

Phép tính chi phí
Ở phân khúc API, cả hai mô hình đều rẻ; bản 1.8B rẻ hơn. Với mức $0.044 / $0.177 so với $0.074 / $0.295 mỗi triệu token, mô hình nhỏ thấp hơn khoảng 40% so với bản 7B ở cả hai phía chi phí — với tốc độ xuất ra ổn định một triệu token mỗi ngày, khoảng $70 mỗi ngày so với $118. Khi chạy trên thiết bị, bản 1.8B tốn 0 đồng mỗi token, con số chi phối mọi so sánh máy chủ ở quy mô lớn. Lý lẽ ủng hộ bản 7B không nằm ở giá mà ở dư địa: nếu kho ngữ liệu của bạn thiên về kỹ thuật, pháp lý hoặc hướng dẫn, lợi thế chất lượng của bản 7B chính là thứ thể hiện qua số lần dịch lại ít hơn — và dịch lại chính là chi phí đơn vị thực sự trong dịch máy chuyên nghiệp.

Định tuyến hai kích thước
Không mô hình nào nằm trong danh mục của OrcaRouter tại thời điểm viết bài này, nên cách trình bày trung thực là cả hai đều được phục vụ qua đám mây của chính Tencent và một số nền tảng bên thứ ba. Cuộc so tài vẫn truyền tải bài học định tuyến mà blog này được xây dựng xoay quanh: khi hai mô hình trùng lặp về năng lực nhưng khác nhau về giá và độ trễ, việc triển khai hợp lý không phải là "chọn một" mà là "định tuyến theo khối lượng công việc" — phân khúc khối lượng lớn, độ khó thấp cho mô hình nhỏ giá rẻ, phân khúc khó cho mô hình chất lượng, chuyển đổi dự phòng tự động để sự cố gián đoạn ở bên nào cũng không bao giờ làm tắc nghẽn đường ống. Đó chính xác là mẫu hình mà DSL định tuyến của OrcaRouter tổ hợp trên hơn 200 mô hình chúng tôi đang cung cấp, với giá niêm yết của từng nhà cung cấp được chuyển qua với mức phụ phí 0%. Nếu dòng mô hình dịch thuật của Tencent gia nhập danh mục, đó sẽ là khách thuê tiếp theo tự nhiên.
Bản án
Nếu quá trình dịch diễn ra trong trung tâm dữ liệu của bạn, hãy chọn Tencent Hy-MT2-7B — qua API nếu bạn muốn không cần vận hành gì, trên một GPU duy nhất nếu bạn muốn tự sở hữu — và thôi đọc tiếp. Nếu việc dịch phải diễn ra trên thiết bị, ngoại tuyến hoặc trong điều kiện yêu cầu bảo mật, hãy chọn Tencent Hy-MT2-1.8B, và dung lượng 440MB hiển nhiên giành chiến thắng. Trường hợp khó thực sự duy nhất là khối lượng công việc đám mây ở mức trung bình, nơi chất lượng của bản 7B và mức giá của bản 1.8B đều có thể bảo vệ được. Ở đó, đừng quyết định dựa trên benchmark của nhà cung cấp: khoảng cách GEMBA được công bố dưới hai điểm, vì vậy hãy chạy cả hai trên văn bản thuộc lĩnh vực của riêng bạn và để dữ liệu của bạn chọn.
