Một thẻ tiêu đề chính cho 'Tencent Hy-MT2-7B Hiện đã có API lưu trữ' với phụ đề 'Điều mà một trình dịch với giá $0.295 mỗi triệu token đầu ra thay đổi', hiển thị biểu tượng dịch vụ đám mây, một ký hiệu dịch thuật, một đường kết nối API, và một thẻ giá có nhãn $0.074 / $0.295 mỗi 1 triệu token, với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Tencent Hy-MT2-7B hiện đã có API lưu trữ: Trình dịch giá 0,295 đô la cho mỗi triệu token đầu ra thay đổi điều gì?

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tencent Hy-MT2-7B, mô hình dịch mã nguồn mở do Tencent Hunyuan phát hành ngày 21/5/2026, đã có thể được gọi qua API được lưu trữ trong tuần này: khoảng ngày 19/8/2026, mô hình 7B dense đã hoạt động trên điểm cuối được lưu trữ của Tencent Cloud với giá $0,074 cho mỗi triệu token đầu vào và $0,295 cho mỗi triệu token đầu ra, cùng cửa sổ ngữ cảnh 8.192 token. Nó không đến một mình — Tencent Hy-MT2-1.8B và Tencent Hy-MT2-30B-A3B cũng xuất hiện trên cùng một backend trong vòng một ngày. Các trọng số đã có trên Hugging Face và ModelScope suốt ba tháng; điều mới ở đây là một nhóm giờ đây có thể gọi công cụ này mà không cần thuê GPU, tự biên dịch llama.cpp từ mã nguồn, hay triển khai chuỗi công cụ 1.25-bit trên thiết bị. Đối với khối lượng công việc dịch thuật, đó chính là sự khác biệt giữa một thử nghiệm và một quyết định sản phẩm.

Những gì vừa mới được phát hành

Điểm cuối thương mại là của riêng Tencent Cloud, được cung cấp thông qua API của nhà cung cấp và một số nền tảng bên thứ ba. Ba kích thước mỗi loại chạy trong ngữ cảnh 8K với số token hoàn thành là 4,096; cả ba đều chấp nhận đầu ra có cấu trúc thông qua lược đồ JSON trong trường response_format của chúng, và không cái nào triển khai tính năng gọi hàm. Thông số kỹ thuật thực tế, trong một dòng cho mỗi chiều:

Tencent Hy-MT2-7B — $0.074 đầu vào / $0.295 đầu ra trên 1M token, ngữ cảnh 8,192, dense ~7B, hỗ trợ đầu ra có cấu trúc, không gọi công cụ.

Tencent Hy-MT2-1.8B — $0.044 đầu vào / $0.177 đầu ra trên 1 triệu token, ngữ cảnh 8.192, dense 1.8B, không hỗ trợ gọi công cụ.

Tencent Hy-MT2-30B-A3B — 0,074 USD đầu vào / 0,295 USD đầu ra cho mỗi 1 triệu token, ngữ cảnh 8.192, MoE 30B tổng / 3B kích hoạt, hỗ trợ đầu ra có cấu trúc, không hỗ trợ gọi công cụ.

Điểm giá nổi bật là tốc độ xuất ra của mô hình 7B: dưới ba phần mười xu cho mỗi nghìn token đầu ra, dành cho một mô hình mà Tencent tuyên bố có thể sánh ngang với các mô hình lớn hơn gấp mười lần. Dịch thuật là một trong số ít khối lượng công việc LLM mà {{2}}token đầu ra gần như chiếm toàn bộ hóa đơn{{/2}}, vì vậy giá đầu ra chính là con số quyết định liệu một pipeline có khả thi ở quy mô lớn hay không.

A single-column scoreboard titled 'Tencent Hy-MT2-7B — the scoreboard' listing six rows: Params dense 7B; Price $0.074 / $0.295 per 1M; Context 8,192 tokens; FLORES-200 86.89 (~97.9% of Gemini 3.1 Pro Think); WMT25 63.86 / 71.21 / 82.24; License Apache-2.0, with the footer 'All figures vendor-reported; API price as listed Aug 2026.'

Mô hình đằng sau endpoint

Hy-MT2 là dòng mô hình "suy nghĩ nhanh" của Tencent: thay vì dành chuỗi suy luận dài cho từng câu, nó được thiết kế để phản ứng như một dịch giả chuyên nghiệp — cân nhắc kỹ khi nguồn có sự mơ hồ, nhanh gọn khi nguồn rõ ràng. Bản 7B là mức cân bằng giữa của dòng, một mô hình đặc được cấp phép Apache-2.0, bao phủ 33 ngôn ngữ cộng với năm cặp ngôn ngữ thiểu số và phương ngữ Trung Quốc (trong đó có Tây Tạng, Kazakh, Mông Cổ, Duy Ngô Nhĩ, Quảng Đông). Điều khiến nó khác biệt so với một LLM dịch thuật thông thường là khả năng làm theo chỉ dẫn: nó giữ thuật ngữ chú giải xuyên suốt tài liệu, áp dụng văn phong được chỉ định, giữ nguyên dấu phân cách và khóa JSON, đồng thời tiếp nhận các chỉ dẫn cá nhân hóa bằng ngôn ngữ tự nhiên. Tencent đã phát hành IFMTBench, một bộ chuẩn mở dành chính xác cho kỹ năng đó, cùng với bộ trọng số, và mặt ứng dụng dành cho người dùng — chương trình nhỏ Tencent Hy Translate, cùng với các ứng dụng iOS và Android đang được triển khai — được xây dựng trên dòng mô hình này.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-7B (captured August 23 2026) showing the model name, Apache-2.0 license, and the family description covering 33 languages plus five minority-language and dialect pairs.

Các con số, với dấu hoa thị đính kèm

Mọi thứ dưới đây là đánh giá của chính Tencent, {{1}}được công bố trên thẻ mô hình{{/1}} và trong báo cáo kèm theo; chưa có nội dung nào trong số đó được tái lập độc lập tại thời điểm viết bài này. Trên hạng mục dịch thuật tổng quát XX⇔XX của FLORES-200, mô hình 7B đạt 86.89 XCOMET-XXL, {{2}}mà Tencent đánh giá tương đương khoảng 97.9% hiệu năng của Gemini 3.1 Pro (Think){{/2}}. Ở chế độ "suy nghĩ nhanh", {{3}}mô hình này được cho là vượt trội hơn các mô hình tổng quát mã nguồn mở{{/3}} bao gồm DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17BGemma4-26B-A4B. Trên WMT25, {{4}}điểm số của nó được cải thiện toàn diện so với thế hệ trước{{/4}} — 63.86/71.21/82.24 so với mức 61.59/68.85/75.91 của Hy-MT1.5-7B, {{5}}với mức tăng lớn nhất ở GEMBA{{/5}} — và trên DomainMTBench (tài chính, chính trị, giáo dục), mô hình đạt 94.92 XCOMET / 92.79 GEMBA. {{6}}Khả năng tuân theo chỉ dẫn chính là điểm khác biệt rõ rệt nhất so với các mô hình ngôn ngữ dịch thuật của một năm trước{{/6}}: 89.73 đơn giản / 72.67 phức tạp / 83.14 tổng thể trên IFMTBench.

API lưu trữ thay đổi điều gì đối với quy trình dịch thuật

Tự lưu trữ mô hình 7B thực sự dễ dàng so với mặt bằng chung — nó chạy được trên một chiếc A100 hoặc RTX 4090, và có sẵn các bản dựng lượng tử hóa FP8 lẫn GGUF. Nhưng "dễ tự lưu trữ" không đồng nghĩa với "không cần vận hành." Đường dẫn GGUF hiện phụ thuộc vào llama.cpp với kernel STQ của Tencent, đường dẫn FP8 cần một bộ công nghệ phù hợp, và vẫn phải có người trông chừng. Một endpoint lưu trữ có sẵn giúp loại bỏ toàn bộ những thứ đó: không cần GPU, không cần build kernel, không cần lên kế hoạch dung lượng, và giá mỗi token cố định bất kể mức độ sử dụng. Đối với một đội ngũ xử lý hàng triệu câu dịch mỗi ngày, sự ổn định đó quan trọng hơn các chỉ số benchmark nổi bật — và đó là lý do tuần này quan trọng hơn cả sự ra mắt vào tháng Năm.

A screenshot of the Tencent Cloud techpedia page for Hy-MT2 (captured August 23 2026, English) showing the header 'Hy-MT2: High-Performance Multilingual Translation Model', the 2026-05-21 publication date, and a summary line about translating across 33 languages.

Câu hỏi về định tuyến mà chưa ai đặt ra

Vì mô hình mới chỉ có ba ngày tuổi ở phía API, cách thực tế để áp dụng nó là cách bạn áp dụng bất kỳ nhà cung cấp hoàn toàn mới nào: đặt nó sau một quy tắc định tuyến có chuyển đổi dự phòng tự động để một endpoint chưa được kiểm thử không bao giờ có thể làm sập một đường production, và để khối lượng sử dụng quyết định xem nó có xứng đáng được giữ một vị trí cố định hay không. Đó chính xác là mẫu hình mà DSL định tuyến của OrcaRouter dựng lên cho hơn 200 mô hình chúng tôi hiện cung cấp — và cần phải nói chính xác ở đây: Tencent Hy-MT2-7B không nằm trong danh mục của OrcaRouter tại thời điểm viết bài này, nên đây không phải câu chuyện "gọi qua chúng tôi". Điều đáng bàn ở đây là mô hình định giá. OrcaRouter truyền thẳng giá niêm yết của từng nhà cung cấp với mức tăng 0%, nên khi nhà cung cấp giảm giá, mức giảm có hiệu lực trên nền tảng ngay trong ngày. Với khối lượng dịch thuật lớn, câu hỏi cần đặt ra cho bất kỳ endpoint nào không phải là "hôm nay giá trên cổng là bao nhiêu" mà là "giá niêm yết thực tế trên mỗi token nhà cung cấp tính là bao nhiêu, và có gì đứng giữa nhà cung cấp và tôi hay không". Với mức $0.295/M output, Tencent Hy-MT2-7B vừa khiến câu hỏi đó trở nên đáng quan tâm.

Xem gì tiếp theo

Ba điều được rút ra từ tuần này. Thứ nhất, hai phiên bản mô hình 1.8B và 30B-A3B hiện đều có thể gọi tương đương nhau, vì vậy quyết định "chọn kích thước nào" là một câu hỏi API thực sự thay vì quyết định tự lưu trữ (dòng mô hình này có các trang so sánh riêng, nhưng tóm lại: 1.8B dành cho thiết bị di động và mức giá rẻ nhất, 30B-A3B cho các lĩnh vực chuyên nghiệp, 7B nằm ở giữa). Thứ hai, quan hệ đối tác WMT26 của Tencent trao giải thưởng cho các đội sử dụng mô hình Hy-MT trong các tác vụ Dịch máy tổng quát và Dịch phụ đề video — một tín hiệu cho thấy Tencent muốn dòng mô hình này trở thành lựa chọn dịch mã nguồn mở mặc định trong MT cạnh tranh. Thứ ba, các ứng dụng iOS và Android có suy luận trên thiết bị, nếu được phát hành như đã công bố, sẽ khiến 1.8B trở thành mô hình dịch mã nguồn mở được cài đặt nhiều nhất thế giới. API được lưu trữ là phần đã thay đổi trong tuần này; quỹ đạo phát triển của dòng mô hình đã được định hình từ tháng Năm.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube