Một thẻ tiêu đề hero cho 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B' với phụ đề 'Lựa chọn chất lượng phía máy chủ hay một trình dịch 440MB trên mọi điện thoại', hiển thị biểu tượng máy chủ và biểu tượng điện thoại thông minh với chiếc cân ở giữa, một chip 440MB, và hai nhãn tên mô hình, với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B: Chọn chất lượng phía máy chủ hay một trình dịch 440MB trên mọi điện thoại?

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tencent Hy-MT2-7B và Tencent Hy-MT2-1.8B là hai đầu mút của cùng một dòng mô hình, được mở mã nguồn cùng nhau vào ngày 21 tháng 5 năm 2026, và cả hai đều có thể gọi qua API lưu trữ trong tuần này — bản 7B vào khoảng ngày 19 tháng 8 và bản 1.8B sau đó một ngày, mỗi bản đều do Tencent Cloud phục vụ. Chúng không phải là đối thủ theo nghĩa thông thường, vì mục đích sử dụng của chúng gần như không trùng nhau. Bản 7B là lựa chọn chất lượng: một mô hình đặc (dense) chạy trên một GPU duy nhất hoặc qua API với giá 0,074 USD mỗi triệu token đầu vào và 0,295 USD mỗi triệu token đầu ra. Bản 1.8B là lựa chọn chạy trên thiết bị: một mô hình được lượng tử hóa xuống còn 440 megabyte, chạy trên điện thoại, hoàn toàn ngoại tuyến, với giá 0,044 / 0,177 USD mỗi triệu token ở gói API. Nếu bạn đang chọn giữa hai bản, câu trả lời phần lớn phụ thuộc vào nơi bản dịch cần được thực hiện — và chỉ thứ yếu dựa trên điểm chuẩn, vốn gần nhau hơn nhiều so với khoảng cách tham số gấp bốn lần.

Câu trả lời một dòng

Chọn bản 7B khi việc dịch thuật diễn ra trong trung tâm dữ liệu và bạn muốn chất lượng tốt nhất trên mỗi đô la máy chủ — thông qua API hoặc trên một GPU lớp A100 duy nhất. Chọn bản 1.8B khi việc dịch thuật phải diễn ra trên thiết bị, ngoại tuyến, hoặc với chi phí thấp nhất có thể trên mỗi token. Nếu cả hai cùng nằm trên một đám mây và ngân sách không phải là yếu tố quyết định, thì bản 7B thắng về chất lượng. Nếu nội dung là bí mật, bị quản lý, hoặc cần hoạt động mà không có mạng, thì bản 1.8B là lựa chọn duy nhất trong hai bản.

So sánh thông số kỹ thuật

Tham số — 7B dense so với 1.8B dense.

Dung lượng lượng tử hóa — FP8 và GGUF giảm xuống còn vài GB so với 440MB nhờ lượng tử hóa AngelSlim 1.25-bit.

FLORES-200 (XX⇔XX) — 86.89 so với 79.77 của XCOMET-XXL, xấp xỉ 97.9% so với 89.9% của Gemini 3.1 Pro (Think), theo công bố của nhà cung cấp.

WMT25 — 7B: 63.86/71.21/82.24; bản 1.8B vượt qua các API thương mại của Microsoft và Doubao trên cả ba chỉ số.

DomainMTBench (GEMBA) — 92.79 so với 91.08, do nhà cung cấp báo cáo.

giá API — $0.074 / $0.295 so với $0.044 / $0.177 trên 1 triệu token (đầu vào/đầu ra).

Ngữ cảnh — cả hai đều 8.192 token.

Triển khai — một A100 / RTX 4090 hoặc API đám mây so với chip trên thiết bị của Apple, Qualcomm và MediaTek, hoạt động ngoại tuyến.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B — the scoreboard'. Left column Hy-MT2-7B: Params 7B dense; FLORES-200 86.89; DomainMTBench GEMBA 92.79; API price $0.074 / $0.295; Deployment GPU or API; Best for quality in the cloud. Right column Hy-MT2-1.8B: Params 1.8B dense; FLORES-200 79.77; DomainMTBench GEMBA 91.08; API price $0.044 / $0.177; Deployment 440MB on-device; Best for offline and edge. Footer: Figures vendor-reported, unreproduced.

Khoảng cách chất lượng là thực tế nhưng hẹp hơn khoảng cách kích thước

Tất cả những điều dưới đây là đánh giá của chính Tencent, chưa được tái lập. Trên FLORES-200, bản 7B vượt bản 1.8B tới tám điểm XCOMET (86,89 so với 79,77) — khoảng cách mà định vị "cân bằng" so với "trên thiết bị" dựa vào. Nhưng trên DomainMTBench — chuẩn đánh giá dịch thuật theo lĩnh vực bao gồm tài chính, chính trị và giáo dục — bản 1.8B chỉ kém bản 7B 1,7 điểm GEMBA (91,08 so với 92,79). Và vị thế của bản 1.8B trước thế giới rộng lớn hơn chính là chi tiết khiến người ta mãi bất ngờ: Tencent báo cáo rằng mô hình này đánh bại các API dịch thuật thương mại của Microsoft và Doubao trên cả ba chỉ số WMT25, đồng thời vượt qua Tower-Plus-72B, một mô hình lớn gấp bốn mươi lần. Vì vậy, trên văn bản lĩnh vực thông thường, mô hình nhỏ gần với người anh em lớn của nó hơn nhiều so với những gì mức chênh lệch tham số gấp bốn lần gợi ý. Lợi thế thực sự của bản 7B thể hiện ở phần đuôi dịch thuật tổng quát và ở các chỉ dẫn khó, nơi lợi thế FLORES và điểm số tác vụ phức tạp IFMTBench cao hơn của nó tạo ra khoảng cách rõ ràng giữa hai bản.

Nhánh triển khai

Mô hình 7B cần cơ sở hạ tầng — hoặc một API đám mây hoặc một GPU cấp A100, cùng với các thao tác vận hành thông thường đi kèm. Mô hình 1.8B, chỉ 440MB với lượng tử hóa 1.25-bit của AngelSlim, chạy trên cùng loại chip như một ứng dụng điện thoại thông thường, nhanh hơn 1,5 lần so với thế hệ Hy-MT1.5 trước đó và hoàn toàn không cần mạng. Điều đó biến quyền riêng tư từ một tính năng thành một mặc định: đối với hợp đồng, hồ sơ y tế hay bất kỳ lĩnh vực được quản lý nào, dữ liệu không bao giờ rời khỏi thiết bị — một đặc tính mà không một mức giá cho mỗi token nào có thể mua được về phía máy chủ. Sự đánh đổi thể hiện rõ ở bản dịch tổng hợp kiểu FLORES, nơi dung lượng bổ sung của 7B bộc lộ — và trên bất kỳ hướng dẫn nào đủ phức tạp để đẩy tổng điểm 83,14 IFMTBench của 1.8B chạm trần cao hơn của 7B.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-1.8B (captured August 23 2026) showing the model name and the on-device positioning with 33-language support and the 440MB AngelSlim quantization claim.

Phép tính chi phí

Ở phân khúc API, cả hai mô hình đều rẻ; bản 1.8B rẻ hơn. Với mức $0.044 / $0.177 so với $0.074 / $0.295 mỗi triệu token, mô hình nhỏ thấp hơn khoảng 40% so với bản 7B ở cả hai phía chi phí — với tốc độ xuất ra ổn định một triệu token mỗi ngày, khoảng $70 mỗi ngày so với $118. Khi chạy trên thiết bị, bản 1.8B tốn 0 đồng mỗi token, con số chi phối mọi so sánh máy chủ ở quy mô lớn. Lý lẽ ủng hộ bản 7B không nằm ở giá mà ở dư địa: nếu kho ngữ liệu của bạn thiên về kỹ thuật, pháp lý hoặc hướng dẫn, lợi thế chất lượng của bản 7B chính là thứ thể hiện qua số lần dịch lại ít hơn — và dịch lại chính là chi phí đơn vị thực sự trong dịch máy chuyên nghiệp.

A generated infographic titled 'The deployment fork' with two branches: a cloud-server card labelled 'Hy-MT2-7B — server: one GPU or the API, $0.074 / $0.295' and a smartphone card labelled 'Hy-MT2-1.8B — on-device: 440MB, offline, free per token', with the footer 'Same family, released May 21 2026; both now API-callable.'

Định tuyến hai kích thước

Không mô hình nào nằm trong danh mục của OrcaRouter tại thời điểm viết bài này, nên cách trình bày trung thực là cả hai đều được phục vụ qua đám mây của chính Tencent và một số nền tảng bên thứ ba. Cuộc so tài vẫn truyền tải bài học định tuyến mà blog này được xây dựng xoay quanh: khi hai mô hình trùng lặp về năng lực nhưng khác nhau về giá và độ trễ, việc triển khai hợp lý không phải là "chọn một" mà là "định tuyến theo khối lượng công việc" — phân khúc khối lượng lớn, độ khó thấp cho mô hình nhỏ giá rẻ, phân khúc khó cho mô hình chất lượng, chuyển đổi dự phòng tự động để sự cố gián đoạn ở bên nào cũng không bao giờ làm tắc nghẽn đường ống. Đó chính xác là mẫu hình mà DSL định tuyến của OrcaRouter tổ hợp trên hơn 200 mô hình chúng tôi đang cung cấp, với giá niêm yết của từng nhà cung cấp được chuyển qua với mức phụ phí 0%. Nếu dòng mô hình dịch thuật của Tencent gia nhập danh mục, đó sẽ là khách thuê tiếp theo tự nhiên.

Bản án

Nếu quá trình dịch diễn ra trong trung tâm dữ liệu của bạn, hãy chọn Tencent Hy-MT2-7B — qua API nếu bạn muốn không cần vận hành gì, trên một GPU duy nhất nếu bạn muốn tự sở hữu — và thôi đọc tiếp. Nếu việc dịch phải diễn ra trên thiết bị, ngoại tuyến hoặc trong điều kiện yêu cầu bảo mật, hãy chọn Tencent Hy-MT2-1.8B, và dung lượng 440MB hiển nhiên giành chiến thắng. Trường hợp khó thực sự duy nhất là khối lượng công việc đám mây ở mức trung bình, nơi chất lượng của bản 7B và mức giá của bản 1.8B đều có thể bảo vệ được. Ở đó, đừng quyết định dựa trên benchmark của nhà cung cấp: khoảng cách GEMBA được công bố dưới hai điểm, vì vậy hãy chạy cả hai trên văn bản thuộc lĩnh vực của riêng bạn và để dữ liệu của bạn chọn.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube