
У Tencent Hy-MT2-7B теперь есть размещенный API: что меняет переводчик стоимостью $0.295 за миллион выходных данных
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
Tencent Hy-MT2-7B — открытая модель машинного перевода, выпущенная Tencent Hunyuan 21 мая 2026 года, — на этой неделе стала доступна через хостируемый API: примерно 19 августа 2026 года плотная модель на 7B параметров появилась на хостируемой конечной точке Tencent Cloud по цене $0,074 за миллион входных токенов и $0,295 за миллион выходных токенов, с контекстным окном в 8 192 токена. Она пришла не одна — Tencent Hy-MT2-1.8B и Tencent Hy-MT2-30B-A3B появились на том же бэкенде в течение суток. Веса уже три месяца лежат на Hugging Face и ModelScope; новость в том, что теперь команда может вызывать модель без аренды GPU, сборки llama.cpp из исходников или развёртывания тулчейна 1.25-bit-on-device. Для задач перевода это разница между экспериментом и продуктовым решением.
Что только что вышло
Коммерческий endpoint принадлежит самому Tencent Cloud и доступен через API поставщика и несколько сторонних платформ. Все три размера работают в контексте 8K с завершениями на 4096 токенов; все три поддерживают структурированный вывод через JSON-схему в поле response_format, и ни один из них не реализует вызов функций. Практическая спецификация по одной строке на каждое измерение:
• Tencent Hy-MT2-7B — $0.074 за вход / $0.295 за выход за 1M токенов, контекст 8,192, плотный ~7B, поддерживается структурированный вывод, вызовы инструментов не поддерживаются.
• Tencent Hy-MT2-1.8B — $0.044 за вход / $0.177 за выход на 1 млн токенов, контекст 8 192, плотная модель 1.8B, без вызовов инструментов.
• Tencent Hy-MT2-30B-A3B — $0,074 вход / $0,295 выход за 1M токенов, контекст 8 192, MoE 30B всего / 3B активных, поддержка структурированного вывода, без вызова инструментов.
Ключевая цена — это скорость вывода модели 7B: менее трёх десятых цента за тысячу выходных токенов, при этом Tencent утверждает, что модель не уступает моделям на порядок крупнее. Перевод — одна из немногих задач для LLM, где выходные токены составляют почти весь счёт, поэтому цена вывода — это тот показатель, который определяет, будет ли pipeline жизнеспособен в масштабе.

Модель, лежащая в основе конечной точки
Hy-MT2 — это семейство моделей Tencent, ориентированных на «быстрое мышление»: вместо того чтобы тратить длинные цепочки рассуждений на каждое предложение, она реагирует так, как это делает профессиональный переводчик — обдумывает там, где исходный текст неоднозначен, и действует быстро там, где он однозначен. Версия 7B — это сбалансированная середина семейства, плотная модель с лицензией Apache-2.0, поддерживающая 33 языка, а также пять пар для языков меньшинств и диалектов Китая (включая тибетский, казахский, монгольский, уйгурский и кантонский). От обычной LLM, выполняющей перевод, её отличает следование инструкциям: она удерживает термин из глоссария по всему документу, применяет заданный стиль, не трогает разделители и ключи JSON, а также принимает инструкции по персонализации на простом языке. Tencent выпустила IFMTBench — открытый бенчмарк именно для этого навыка, вместе с весами, а потребительский продукт — мини-программа Tencent Hy Translate, для которой уже готовятся приложения для iOS и Android, — построен на этом семействе.

Числа со звездочкой
Всё нижеследующее — собственная оценка Tencent, опубликованная в карточке модели и в сопроводительном отчёте; на момент написания ни один из этих результатов не был независимо воспроизведён. На треке общей трансляции XX⇔XX в FLORES-200 модель 7B набирает 86,89 XCOMET-XXL, что Tencent оценивает примерно в 97,9 % от результата Gemini 3.1 Pro (Think). В режиме «быстрого мышления» она, по заявлению, превосходит открытые универсальные модели, включая DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B и Gemma4-26B-A4B. На WMT25 её результаты улучшаются по всем параметрам относительно предыдущего поколения — 63,86/71,21/82,24 против 61,59/68,85/75,91 у Hy-MT1.5-7B, с наибольшим приростом на GEMBA, — а на DomainMTBench (финансы, политика, образование) она показывает 94,92 XCOMET / 92,79 GEMBA. Именно следование инструкциям наиболее заметно отличает её от переводческих языковых моделей годичной давности: 89,73 (простые) / 72,67 (сложные) / 83,14 (всего) на IFMTBench.
Что меняет размещенный API для конвейера перевода
Самостоятельный хостинг 7B — это действительно легко по сравнению с другими подобными вещами: модель работает на одном A100 или RTX 4090, а также существуют квантованные сборки FP8 и GGUF. Но «легко задеплоить у себя» — не значит «без эксплуатации». Путь GGUF в настоящее время зависит от llama.cpp с ядром STQ от Tencent, путь FP8 требует правильного стека, и за всем этим нужен присмотр. Хостируемый эндпоинт снимает все эти проблемы: не нужен GPU, не нужна сборка ядра, не нужно планировать мощности, а цена за токен фиксирована независимо от нагрузки. Для команды, которая обрабатывает миллионы переведённых предложений в день, эта предсказуемость важнее, чем громкий бенчмарк, — и именно поэтому эта неделя важнее, чем майский запуск.

Вопрос маршрутизации, который пока никто не задаёт
Поскольку модели всего три дня на стороне API, реалистичный способ её внедрения — это тот же способ, каким внедряют любого совершенно нового провайдера: поместить её за правило маршрутизации с автоматическим переключением при сбое, чтобы непротестированная конечная точка никогда не могла обрушить продакшн-путь, и позволить объёму трафика решить, заслуживает ли она постоянного места. Именно такой паттерн и реализует маршрутизирующий DSL OrcaRouter на более чем 200 моделях, которые мы поддерживаем, — и здесь стоит быть точным: по состоянию на текущий момент Tencent Hy-MT2-7B отсутствует в каталоге OrcaRouter, так что это не история «подключайтесь через нас». Релевантна здесь модель ценообразования. OrcaRouter передаёт опубликованную цену каждого провайдера без наценки (0%), поэтому, когда вендор снижает тариф, снижение вступает в силу на платформе в тот же день. Для высоконагруженного перевода вопрос к любой конечной точке не «какая цена на портале сегодня», а «какова фактическая попозиционная цена, которую выставляет провайдер, и есть ли что-то между мной и ею». При цене $0,295 за миллион выходных токенов Tencent Hy-MT2-7B только что сделала этот вопрос интересным.
Что посмотреть дальше
Из этой недели следует три вещи. Во-первых, модели-«родственники» 1.8B и 30B-A3B теперь одинаково доступны через API, так что вопрос «какой размер выбрать» — это настоящий вопрос API, а не решение о самостоятельном хостинге (у семейства есть собственные страницы сравнения, но если коротко: 1.8B — для устройств и самого дешёвого тарифа, 30B-A3B — для профессиональных задач, 7B — средний вариант). Во-вторых, партнёрство Tencent с WMT26 предусматривает награды командам, использующим модели Hy-MT в задачах общего машинного перевода и перевода субтитров для видео, — сигнал о том, что Tencent намерена сделать это семейство стандартом открытого перевода в конкурентной сфере машинного перевода. В-третьих, приложения для iOS и Android с инференсом на устройстве, если они выйдут, как объявлено, сделают 1.8B самой устанавливаемой открытой моделью перевода в мире. Размещённый API — это та часть, которая изменилась на этой неделе; траектория семейства была задана в мае.
