
Tencent Hy-MT2-7B hiện đã có API lưu trữ: Trình dịch giá 0,295 đô la cho mỗi triệu token đầu ra thay đổi điều gì?
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenMỚIQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekMỚIDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokMỚISpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
Tencent Hy-MT2-7B, mô hình dịch mã nguồn mở do Tencent Hunyuan phát hành ngày 21/5/2026, đã có thể được gọi qua API được lưu trữ trong tuần này: khoảng ngày 19/8/2026, mô hình 7B dense đã hoạt động trên điểm cuối được lưu trữ của Tencent Cloud với giá $0,074 cho mỗi triệu token đầu vào và $0,295 cho mỗi triệu token đầu ra, cùng cửa sổ ngữ cảnh 8.192 token. Nó không đến một mình — Tencent Hy-MT2-1.8B và Tencent Hy-MT2-30B-A3B cũng xuất hiện trên cùng một backend trong vòng một ngày. Các trọng số đã có trên Hugging Face và ModelScope suốt ba tháng; điều mới ở đây là một nhóm giờ đây có thể gọi công cụ này mà không cần thuê GPU, tự biên dịch llama.cpp từ mã nguồn, hay triển khai chuỗi công cụ 1.25-bit trên thiết bị. Đối với khối lượng công việc dịch thuật, đó chính là sự khác biệt giữa một thử nghiệm và một quyết định sản phẩm.
Những gì vừa mới được phát hành
Điểm cuối thương mại là của riêng Tencent Cloud, được cung cấp thông qua API của nhà cung cấp và một số nền tảng bên thứ ba. Ba kích thước mỗi loại chạy trong ngữ cảnh 8K với số token hoàn thành là 4,096; cả ba đều chấp nhận đầu ra có cấu trúc thông qua lược đồ JSON trong trường response_format của chúng, và không cái nào triển khai tính năng gọi hàm. Thông số kỹ thuật thực tế, trong một dòng cho mỗi chiều:
• Tencent Hy-MT2-7B — $0.074 đầu vào / $0.295 đầu ra trên 1M token, ngữ cảnh 8,192, dense ~7B, hỗ trợ đầu ra có cấu trúc, không gọi công cụ.
• Tencent Hy-MT2-1.8B — $0.044 đầu vào / $0.177 đầu ra trên 1 triệu token, ngữ cảnh 8.192, dense 1.8B, không hỗ trợ gọi công cụ.
• Tencent Hy-MT2-30B-A3B — 0,074 USD đầu vào / 0,295 USD đầu ra cho mỗi 1 triệu token, ngữ cảnh 8.192, MoE 30B tổng / 3B kích hoạt, hỗ trợ đầu ra có cấu trúc, không hỗ trợ gọi công cụ.
Điểm giá nổi bật là tốc độ xuất ra của mô hình 7B: dưới ba phần mười xu cho mỗi nghìn token đầu ra, dành cho một mô hình mà Tencent tuyên bố có thể sánh ngang với các mô hình lớn hơn gấp mười lần. Dịch thuật là một trong số ít khối lượng công việc LLM mà {{2}}token đầu ra gần như chiếm toàn bộ hóa đơn{{/2}}, vì vậy giá đầu ra chính là con số quyết định liệu một pipeline có khả thi ở quy mô lớn hay không.

Mô hình đằng sau endpoint
Hy-MT2 là dòng mô hình "suy nghĩ nhanh" của Tencent: thay vì dành chuỗi suy luận dài cho từng câu, nó được thiết kế để phản ứng như một dịch giả chuyên nghiệp — cân nhắc kỹ khi nguồn có sự mơ hồ, nhanh gọn khi nguồn rõ ràng. Bản 7B là mức cân bằng giữa của dòng, một mô hình đặc được cấp phép Apache-2.0, bao phủ 33 ngôn ngữ cộng với năm cặp ngôn ngữ thiểu số và phương ngữ Trung Quốc (trong đó có Tây Tạng, Kazakh, Mông Cổ, Duy Ngô Nhĩ, Quảng Đông). Điều khiến nó khác biệt so với một LLM dịch thuật thông thường là khả năng làm theo chỉ dẫn: nó giữ thuật ngữ chú giải xuyên suốt tài liệu, áp dụng văn phong được chỉ định, giữ nguyên dấu phân cách và khóa JSON, đồng thời tiếp nhận các chỉ dẫn cá nhân hóa bằng ngôn ngữ tự nhiên. Tencent đã phát hành IFMTBench, một bộ chuẩn mở dành chính xác cho kỹ năng đó, cùng với bộ trọng số, và mặt ứng dụng dành cho người dùng — chương trình nhỏ Tencent Hy Translate, cùng với các ứng dụng iOS và Android đang được triển khai — được xây dựng trên dòng mô hình này.

Các con số, với dấu hoa thị đính kèm
Mọi thứ dưới đây là đánh giá của chính Tencent, {{1}}được công bố trên thẻ mô hình{{/1}} và trong báo cáo kèm theo; chưa có nội dung nào trong số đó được tái lập độc lập tại thời điểm viết bài này. Trên hạng mục dịch thuật tổng quát XX⇔XX của FLORES-200, mô hình 7B đạt 86.89 XCOMET-XXL, {{2}}mà Tencent đánh giá tương đương khoảng 97.9% hiệu năng của Gemini 3.1 Pro (Think){{/2}}. Ở chế độ "suy nghĩ nhanh", {{3}}mô hình này được cho là vượt trội hơn các mô hình tổng quát mã nguồn mở{{/3}} bao gồm DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B và Gemma4-26B-A4B. Trên WMT25, {{4}}điểm số của nó được cải thiện toàn diện so với thế hệ trước{{/4}} — 63.86/71.21/82.24 so với mức 61.59/68.85/75.91 của Hy-MT1.5-7B, {{5}}với mức tăng lớn nhất ở GEMBA{{/5}} — và trên DomainMTBench (tài chính, chính trị, giáo dục), mô hình đạt 94.92 XCOMET / 92.79 GEMBA. {{6}}Khả năng tuân theo chỉ dẫn chính là điểm khác biệt rõ rệt nhất so với các mô hình ngôn ngữ dịch thuật của một năm trước{{/6}}: 89.73 đơn giản / 72.67 phức tạp / 83.14 tổng thể trên IFMTBench.
API lưu trữ thay đổi điều gì đối với quy trình dịch thuật
Tự lưu trữ mô hình 7B thực sự dễ dàng so với mặt bằng chung — nó chạy được trên một chiếc A100 hoặc RTX 4090, và có sẵn các bản dựng lượng tử hóa FP8 lẫn GGUF. Nhưng "dễ tự lưu trữ" không đồng nghĩa với "không cần vận hành." Đường dẫn GGUF hiện phụ thuộc vào llama.cpp với kernel STQ của Tencent, đường dẫn FP8 cần một bộ công nghệ phù hợp, và vẫn phải có người trông chừng. Một endpoint lưu trữ có sẵn giúp loại bỏ toàn bộ những thứ đó: không cần GPU, không cần build kernel, không cần lên kế hoạch dung lượng, và giá mỗi token cố định bất kể mức độ sử dụng. Đối với một đội ngũ xử lý hàng triệu câu dịch mỗi ngày, sự ổn định đó quan trọng hơn các chỉ số benchmark nổi bật — và đó là lý do tuần này quan trọng hơn cả sự ra mắt vào tháng Năm.

Câu hỏi về định tuyến mà chưa ai đặt ra
Vì mô hình mới chỉ có ba ngày tuổi ở phía API, cách thực tế để áp dụng nó là cách bạn áp dụng bất kỳ nhà cung cấp hoàn toàn mới nào: đặt nó sau một quy tắc định tuyến có chuyển đổi dự phòng tự động để một endpoint chưa được kiểm thử không bao giờ có thể làm sập một đường production, và để khối lượng sử dụng quyết định xem nó có xứng đáng được giữ một vị trí cố định hay không. Đó chính xác là mẫu hình mà DSL định tuyến của OrcaRouter dựng lên cho hơn 200 mô hình chúng tôi hiện cung cấp — và cần phải nói chính xác ở đây: Tencent Hy-MT2-7B không nằm trong danh mục của OrcaRouter tại thời điểm viết bài này, nên đây không phải câu chuyện "gọi qua chúng tôi". Điều đáng bàn ở đây là mô hình định giá. OrcaRouter truyền thẳng giá niêm yết của từng nhà cung cấp với mức tăng 0%, nên khi nhà cung cấp giảm giá, mức giảm có hiệu lực trên nền tảng ngay trong ngày. Với khối lượng dịch thuật lớn, câu hỏi cần đặt ra cho bất kỳ endpoint nào không phải là "hôm nay giá trên cổng là bao nhiêu" mà là "giá niêm yết thực tế trên mỗi token nhà cung cấp tính là bao nhiêu, và có gì đứng giữa nhà cung cấp và tôi hay không". Với mức $0.295/M output, Tencent Hy-MT2-7B vừa khiến câu hỏi đó trở nên đáng quan tâm.
Xem gì tiếp theo
Ba điều được rút ra từ tuần này. Thứ nhất, hai phiên bản mô hình 1.8B và 30B-A3B hiện đều có thể gọi tương đương nhau, vì vậy quyết định "chọn kích thước nào" là một câu hỏi API thực sự thay vì quyết định tự lưu trữ (dòng mô hình này có các trang so sánh riêng, nhưng tóm lại: 1.8B dành cho thiết bị di động và mức giá rẻ nhất, 30B-A3B cho các lĩnh vực chuyên nghiệp, 7B nằm ở giữa). Thứ hai, quan hệ đối tác WMT26 của Tencent trao giải thưởng cho các đội sử dụng mô hình Hy-MT trong các tác vụ Dịch máy tổng quát và Dịch phụ đề video — một tín hiệu cho thấy Tencent muốn dòng mô hình này trở thành lựa chọn dịch mã nguồn mở mặc định trong MT cạnh tranh. Thứ ba, các ứng dụng iOS và Android có suy luận trên thiết bị, nếu được phát hành như đã công bố, sẽ khiến 1.8B trở thành mô hình dịch mã nguồn mở được cài đặt nhiều nhất thế giới. API được lưu trữ là phần đã thay đổi trong tuần này; quỹ đạo phát triển của dòng mô hình đã được định hình từ tháng Năm.
