
Tencent HY-MT2 1.8B có API lưu trữ: Trình dịch 440MB của Tencent lên đám mây
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 426 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 183 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
{{1}}Tencent HY-MT2 1.8B, thành viên nhỏ gọn của dòng mô hình dịch thuật Hy-MT2 mà Tencent Hunyuan đã mã nguồn mở vào ngày 21 tháng 5 năm 2026{{/1}}, {{2}}hiện có thể được gọi qua một API thương mại được lưu trữ thay vì chỉ tự lưu trữ{{/2}} — {{3}}mục API của mô hình đã chính thức đi vào hoạt động vào ngày 20 tháng 8 năm 2026{{/3}}, {{4}}với mức giá khoảng 0,044 USD cho mỗi triệu token đầu vào và 0,177 USD cho mỗi triệu token đầu ra{{/4}}. {{5}}Ngày niêm yết đó lại quan trọng hơn so với thông thường{{/5}}, {{6}}vì bản 1.8B chưa bao giờ chỉ là một checkpoint mã nguồn mở đơn thuần{{/6}}: {{7}}đây là mô hình Tencent xây dựng để chứng minh rằng một mô hình dịch thuật lượng tử hóa 440MB có thể chạy hoàn toàn trên điện thoại{{/7}}, {{8}}và trong ba tháng kể từ khi phát hành mã nguồn mở{{/8}} {{9}}nó cũng đã được tích hợp bên trong mini-program HyTranslate của chính Tencent cùng các ứng dụng iOS và Android ra mắt sau đó{{/9}}. {{10}}Bài viết này bàn về những gì việc ra mắt API lưu trữ thay đổi{{/10}}, {{11}}bản chất thực sự của mô hình{{/11}}, {{12}}và những con số nào bạn nên tin cậy{{/12}}.
Điều gì thực sự đã thay đổi vào ngày 20 tháng 8
Cho đến nay, việc sử dụng Tencent HY-MT2 1.8B đồng nghĩa với một trong hai điều: tự tải trọng số Apache-2.0 vào transformers, vLLM, SGLang hoặc llama.cpp, hoặc dùng các sản phẩm dịch thuật tiêu dùng của Tencent. API được lưu trữ là con đường thứ ba — bạn gửi văn bản qua HTTP và Tencent Cloud phục vụ endpoint 1.8B. Mô hình giữ nguyên ngữ cảnh 8.192 token và giới hạn đầu ra 4.096 token, chỉ xử lý văn bản và có giá khoảng 0,044 USD mỗi triệu token đầu vào, 0,177 USD mỗi triệu token đầu ra. Với các nhóm có nhu cầu dịch thuật biến động thất thường, điều này gỡ bỏ rào cản tối thiểu "phải vận hành GPU" khi dùng thử mô hình.

Nửa còn lại của câu chuyện là các ứng dụng. Mini-program HyTranslate ra mắt cùng với bản phát hành mã nguồn mở vào tháng 5, với tính năng nhập liệu bằng giọng nói, các cài đặt phong cách và chế độ ngoại tuyến. Các ứng dụng iOS và Android — vốn tải mô hình về thiết bị để dịch không cần mạng — đã được phát hành. Mô hình 1.8B là trụ cột của câu chuyện ngoại tuyến đó: với lượng tử hóa cực đoan 1.25-bit của AngelSlim, nó giảm xuống còn khoảng 440MB dung lượng lưu trữ và chạy cục bộ trên chip điện thoại của Apple, Qualcomm và MediaTek, với Tencent báo cáo tốc độ suy luận nhanh gấp 1,5 lần so với bản dựng 4-bit của thế hệ trước trên Apple A15.
1.8B là gì?
{{1}}HY-MT2-1.8B{{/1}} là một mô hình ngôn ngữ nhân quả (causal LM) dạng dense, chỉ dùng decoder, được xây dựng trên kiến trúc {{2}}hunyuan_v1_dense{{/2}} — thực tế có khoảng 2 tỷ tham số dù tên gọi là {{3}}1.8B{{/3}} — kèm theo một mẫu trò chuyện (chat template) và không có system prompt mặc định. Mô hình dịch giữa {{4}}33 ngôn ngữ{{/4}} cộng thêm {{5}}năm{{/5}} cặp ngôn ngữ thiểu số và phương ngữ, bao gồm {{6}}tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Hàn, tiếng Pháp, tiếng Tây Ban Nha, tiếng Nga, tiếng Ả Rập, tiếng Thái, tiếng Việt, tiếng Indonesia, tiếng Hindi, tiếng Bengal, tiếng Tamil, cùng các cặp phương ngữ tiếng Tây Tạng, tiếng Duy Ngô Nhĩ, tiếng Kazakh, tiếng Mông Cổ và tiếng Quảng Đông{{/6}}. Khác với các mô hình dịch encoder-decoder cổ điển, mô hình này được tinh chỉnh theo hướng dẫn (instruction-tuned): bạn có thể ra lệnh cho nó bằng ngôn ngữ đích và các hướng dẫn tùy chọn, và nó có thể giữ nguyên cấu trúc JSON và HTML, tôn trọng bảng thuật ngữ (glossary), khớp văn phong (register), và dùng ngữ cảnh xung quanh để phân giải nghĩa. Khả năng thuộc lớp này chính là điểm chung mà các mô hình anh em {{7}}7B{{/7}} và {{8}}30B-A3B{{/8}} chia sẻ, đồng thời cũng là lý do Tencent phát hành bộ benchmark {{9}}IFMTBench{{/9}} kèm theo để chấm điểm.
Các điểm chuẩn đang ở mức nào
Các tuyên bố về chất lượng đáng được đọc kỹ vì gần như tất cả đều do chính Tencent đưa ra, chưa được phòng thí nghiệm độc lập nào kiểm chứng lại tính đến thời điểm viết bài. Tencent báo cáo HY-MT2-1.8B đạt 89,9% điểm FLORES-200 trung bình của Gemini 3.1 Pro (bản 7B đạt 97,9%, bản 30B-A3B đạt 98,6%), đạt 96,7% so với Gemini trên bộ kiểm tra kiểu GEMBA trong thực tế, và đạt 96,2% trên DomainMTBench ở tám lĩnh vực chuyên môn. Một số bài báo đã làm tròn giảm con số FLORES-200 xuống 88,1%; tệp README của nhà cung cấp ghi là 89,9%. Tencent cũng tuyên bố bản 1.8B nhìn chung vượt trội hơn các API dịch thuật thương mại phổ biến từ các nhà cung cấp như Microsoft và Doubao. Các kết quả tái lập độc lập chưa tồn tại, vì vậy hãy coi tất cả những điều đó là bằng chứng mang tính định hướng do nhà cung cấp báo cáo, chứ không phải sự thật đã được kiểm toán. Điều không phụ thuộc vào nhà cung cấp: bộ ngôn ngữ 33+5 là cố định, giấy phép Apache-2.0 là có thật, và một checkpoint lượng tử hóa 440MB chạy được trên điện thoại là điều có thể tự kiểm chứng độc lập.

Cách bạn sẽ sử dụng nó và chi phí của nó
• Tự lưu trữ — trọng số Apache-2.0 từ Hugging Face hoặc ModelScope; chạy với transformers (>=5.6.0), vLLM, SGLang, hoặc bản dựng GGUF của llama.cpp. Chi phí là hóa đơn GPU của bạn; bản dựng 1.25-bit chạy được trên các thiết bị thuộc phân khúc CPU.

• API được lưu trữ — Tencent Cloud cung cấp mô hình 1.8B với giá khoảng $0.044 cho mỗi triệu token đầu vào và $0.177 cho mỗi triệu token đầu ra tính đến thời điểm viết bài này; API của chính nhà cung cấp và một số nền tảng của bên thứ ba đều hỗ trợ mô hình này.
• Người tiêu dùng — Tiện ích nhỏ HyTranslate và các ứng dụng iOS/Android, bao gồm dịch ngoại tuyến thông qua mô hình đã tải về trên thiết bị.
Sampling được khuyến nghị cho bản 1.8B: temperature 0.7, top-p 0.6, top-k 20, repetition penalty 1.05, max tokens 4096.
Nếu bạn đang xây dựng một quy trình dịch thuật thay vì phát hành một ứng dụng tiêu dùng, điều thú vị về một mô hình như thế này là giá của nó luôn thay đổi — Tencent đã cắt giảm giá API Hy-MT2-Pro vào tháng Sáu. Đó chính xác là tình huống mà một bộ định tuyến phụ giá 0% tồn tại: bởi vì việc chuyển tiếp theo giá niêm yết của nhà cung cấp, một đợt giảm giá từ nhà cung cấp sẽ xuất hiện trên hóa đơn cùng ngày thay vì sau khi cổng của bạn định giá lại. Bản thân mô hình không có trong danh sách của OrcaRouter tại thời điểm viết bài, vì vậy bạn sẽ tự lưu trữ trọng số hoặc gọi trực tiếp API của Tencent Cloud; lập luận về dự phòng và một khóa duy nhất áp dụng cho ngăn xếp dịch thuật rộng hơn mà bạn xây dựng xung quanh nó, nơi việc kết hợp một mô hình nhỏ trên thiết bị cho lưu lượng lớn giá rẻ với một mô hình lớn hơn cho các cặp ngôn ngữ khó là kiểu tổ hợp mà định tuyến được tạo ra để thể hiện.
Điểm mấu chốt
Tencent HY-MT2 1.8B vốn đã đáng chú ý từ tháng 5 với tư cách một trình dịch cỡ điện thoại dưới giấy phép Apache-2.0; việc niêm yết API lưu trữ ngày 20 tháng 8 khiến nó trở thành lựa chọn tiềm năng cho những nhóm muốn đánh giá mô hình mà không cần tự dựng hạ tầng. Các con số chất lượng do chính nhà cung cấp công bố, phạm vi ngôn ngữ được chủ đích giới hạn ở các ngôn ngữ phổ biến thay vì phủ rộng tối đa, và mức chiếm dụng tài nguyên khi chạy trên thiết bị mới chính là điểm thực sự khác biệt. Nếu cặp ngôn ngữ của bạn nằm trong số 33 ngôn ngữ hỗ trợ, thì giờ đây việc kiểm chứng xem các tuyên bố đó có đúng với nội dung của bạn hay không chưa bao giờ rẻ hơn.
