Qwen3.8-Max — новейшая флагманская модель Alibaba в линейке Qwen и её самый мощный на сегодняшний день уровень. В своём руководстве по миграции Alibaba позиционирует её как прямого конкурента GPT-5.5, Claude Opus 4.7 и Gemini 3.1 Pro, рекомендуя её всякий раз, когда задача требует самых сильных доступных рассуждений — сложного многошагового анализа, глубокого логического вывода и требовательной агентной работы. Модель изначально мультимодальна: Alibaba относит её как к генерации текста, так и к пониманию изображений и видео. Она принимает текст, изображения и видео и возвращает текст, с контекстным окном в 1M токенов. Официальная матрица возможностей подтверждает полную поддержку режима размышления, вызова функций, встроенных инструментов и структурированных выходных данных, что делает её полностью готовой заменой для агентных фреймворков и пайплайнов вызова инструментов. Qwen3.8-Max доступна через три формата передачи данных — совместимый с OpenAI, совместимый с Anthropic и нативный DashScope — в Пекине, Сингапуре, Токио, Франкфурте и Вирджинии. Режим размышления переключается параметром enable_thinking (или reasoning.effort в Responses API). Это премиальный уровень семейства: выбирайте её, когда корректность решения сложных задач важнее стоимости, и переходите на Qwen3.7-Plus или Qwen3.7-Flash для повседневных объёмов.
Qwen3.8 Max — это мультимодальная большая языковая модель из семейства Qwen, доступная через OrcaRouter с идентификатором модели 'qwen/qwen3.8-max'. Провайдер — qwen. Она имеет контекстное окно в 1…
Основываясь на данных каталога, Qwen3.8 Max — это мультимодальная языковая модель, которая принимает текстовые, графические и видео-входные данные. Это делает её подходящей для таких задач, как обобщение длинного документа, ответы на вопросы об изображении или анализ видеоконтента. Ожидается, что модель справится с генерацией текста и рассуждениями общего характера, поскольку она входит в семейство больших языковых моделей Qwen. Однако в списке OrcaRouter не указан конкретный перечень задач или результаты бенчмарков. Вам следует протестировать модель с собственными запросами, чтобы убедиться, что она выдаёт нужный вам стиль и точность. Поскольку API совместим с OpenAI, вы можете отправить небольшой запрос через OrcaRouter без изменения существующего кода. Выходные токены модели тарифицируются по ставке $6.00 за 1 млн токенов, поэтому учитывайте затраты на генерацию, а также затраты на входные данные. Для наилучших результатов формулируйте чёткие запросы и включайте только релевантный контекст.
Чтобы использовать изображения и видео с Qwen3.8 Max, отправляйте их как части содержимого внутри сообщения чата в OpenAI-совместимый API OrcaRouter. Стандартный формат чата OpenAI допускает массив содержимого с текстовой частью и частью image_url. Видеовход может требовать особого формата, который не описан в записи каталога; провайдер qwen указывает видео как поддерживаемую модальность. Обычный подход — передавать кадры видео как последовательность изображений или использовать специфическую для провайдера кодировку видео, если OrcaRouter её поддерживает. Затем модель обработает визуальную информацию вместе с текстовым запросом. Помните, что весь визуальный ввод учитывается как токены, и токены тарифицируются по $2.00 за 1M входных токенов. Если ваше видео длинное, количество токенов может быть большим, поэтому сначала протестируйте на небольшом образце. Подтвердите точную схему сообщения в документации OrcaRouter перед написанием производственного кода.
Qwen3.8 Max стоит $2.00 за 1M входных токенов и $6.00 за 1M выходных токенов. Если ваши запросы короткие, данные содержат только текст, или вам не нужен контекст на 1,000,000 токенов, более дешевая модель, скорее всего, даст похожие результаты за меньшую стоимость. Многие текстовые модели на OrcaRouter имеют более низкие ставки за токен и более быстрое время ответа для таких задач, как классификация, извлечение, суммаризация и обычный чат. Вам следует выбирать Qwen3.8 Max, когда задача действительно выигрывает от большого контекста или от объединения текста с изображениями или видео. Вам также следует сравнить качество вывода на вашей конкретной нагрузке, потому что цена — не единственный фактор. Для приложений с большим объемом дешевая модель с приемлемым качеством часто является лучшим бизнес-решением. Оцените средний размер входных данных на запрос и умножьте на ставку, чтобы увидеть, где находится точка безубыточности.
Наилучшие сценарии использования Qwen3.8 Max вытекают из заявленных возможностей: контекстное окно на 1 000 000 токенов и ввод текста, изображений и видео. Это включает ответы на вопросы по длинным документам, суммаризацию целых книг, анализ контрактов, ревью кодовой базы и мультимодальные задачи, где нужно понимать скриншоты, диаграммы или кадры видео. Модель также полезна для обработки полной расшифровки видео за один вызов, а не разбиения её на сегменты. Поскольку стоимость вывода составляет $6.00 за 1M токенов, следует стремиться к лаконичным ответам, даже если входные данные длинные. Если вам нужно лишь ответить на короткий вопрос по небольшому абзацу, эта модель избыточна и дорога. Модель отлично подходит, когда входные данные большие, мультимодальные или и то и другое, а ответ зависит от всего этого содержимого. Для задач с высокой генерацией объёма используйте модели поменьше.
Запись в каталоге Qwen3.8 Max на OrcaRouter не содержит оценок по бенчмаркам. Мы не предоставляем цифры из внешних оценок, поскольку ни одна из них не основана на имеющихся фактах. В целом, оценки по бенчмаркам измеряют производительность модели на таких задачах, как общие знания, рассуждение, программирование и мультимодальное понимание, в зависимости от конкретного бенчмарка. Без официальных оценок для Qwen3.8 Max вы не можете полагаться на какой-либо единственный показатель. Правильный способ оценить модель — запустить её на собственном валидационном наборе, используя OpenAI-совместимый API OrcaRouter. Сравните результаты на нескольких промптах и проверьте согласованность. Если позже вы увидите опубликованные провайдером оценки по бенчмаркам, рассматривайте их как один из многих сигналов, а не как доказательство того, что ваш сценарий использования будет работать. Модель, получившая высокие баллы по широкому бенчмарку, всё равно может давать сбои на входных данных из конкретной предметной области, поэтому прямое тестирование имеет значение.
Никаких показателей задержки или пропускной способности для Qwen3.8 Max в каталоге OrcaRouter не указано. Скорость ответа зависит от инфраструктуры провайдера qwen, размера вашего ввода и текущей нагрузки на OrcaRouter. Запрос с 1 000 000 входных токенов займёт больше времени, чем короткий промпт, потому что модель должна обработать весь контекст перед генерацией ответа. Длина ответа также влияет на общее время; генерация большого количества токенов требует времени. Если скорость критична, старайтесь делать входные и выходные данные как можно меньше. Вы можете измерить время до первого токена, используя потоковую передачу ответа через API OrcaRouter. Поскольку официальных показателей скорости не существует, не предполагайте конкретное время ответа. Проведите собственный тест с реалистичным размером промпта и измерьте его. Задержка также может варьироваться в зависимости от региона и времени суток. Провайдер может ограничивать большие запросы.
Сильные стороны Qwen3.8 Max основаны на записи в каталоге: контекстное окно в 1 000 000 токенов и поддержка ввода текста, изображений и видео. Эта комбинация полезна для задач, требующих чтения большого объёма разнообразного контента за один запрос. Честные ограничения заключаются в том, что не указаны ни показатели бенчмарков, ни цифры скорости, поэтому вы не можете проверить качество, полагаясь только на каталог. Цена ввода в размере $2.00 за 1 млн токенов выше, чем у многих более мелких моделей, а цена вывода в размере $6.00 за 1 млн токенов означает, что длинные ответы обходятся недёшево. Эта модель может не быть лучшим выбором для коротких, текстовых или чувствительных к задержке приложений. Вам следует оценить Qwen3.8 Max на собственных данных через OrcaRouter, прежде чем делать его зависимостью в производстве. Полагайтесь на прямое наблюдение, а не на маркетинговые заявления. Для задач, которые помещаются в небольшое окно, предпочтительнее более дешёвая модель.
Qwen3.8 Max тарифицируется по тарифу провайдера: $2.00 за 1 млн входных токенов и $6.00 за 1 млн выходных токенов. OrcaRouter применяет нулевую наценку, поэтому цена токена, которую вы видите, — это цена токена, которую вы платите. В описании в каталоге не указана фиксированная плата за запрос. Стоимость запроса рассчитывается путём подсчёта каждого входного токена, включая текстовые, графические и видеотокены, и умножения на $2.00 за 1 млн токенов. Выходные токены подсчитываются отдельно и умножаются на $6.00 за 1 млн токенов. Например, запрос с 250 000 входных токенов и 5 000 выходных токенов стоит $0.50 за входные и $0.03 за выходные. Фактические платежи появятся в вашем счёте OrcaRouter. Если вы используете полный контекст в 1 млн, только стоимость входных токенов составит $2.00. Других указанных комиссий нет.
Полное контекстное окно Qwen3.8 Max составляет 1 000 000 токенов. При цене $2,00 за 1M входных токенов запрос, использующий всё окно, обойдётся в $2,00 за вход до генерации любого вывода. Если вывод значительный, вы также платите $6,00 за 1M выходных токенов. Визуальные входные данные расходуют токены быстро, поэтому включение видеокадров или множества изображений может поднять количество входных токенов намного выше, чем вы могли бы ожидать от одного текста. Такая модель ценообразования означает, что фиксированной стоимости за вызов нет; вы платите только за использованные токены. Это также означает, что промпт на 100 000 токенов стоит $0,20, а промпт на 1 000 000 токенов — $2,00. Если вашей задаче нужно всего несколько тысяч токенов контекста, ценность Qwen3.8 Max обосновать сложнее. В таких случаях рассмотрите модели поменьше.
В записи каталога для Qwen3.8 Max не упоминается кэширование. OpenAI-совместимый API OrcaRouter может поддерживать стандартные сообщаемые провайдером попадания в кэш, но сведения о модели этого не подтверждают. Без подтверждённого кэширования следует исходить из того, что каждый входной токен тарифицируется по стандартной ставке $2.00 за 1 млн токенов. Некоторые провайдеры автоматически кэшируют префикс вашего запроса и берут меньше за повторяющиеся токены, но для этой модели это не заявлено. Вы можете проверить объект usage в ответе API OrcaRouter на наличие полей cached_token; если провайдер их сообщает, вы увидите скидку. Если нет — закладывайте в бюджет полную стоимость входных данных за каждый запрос. Самый безопасный план — протестировать с повторяющимися идентичными запросами и изучить данные об использовании токенов в ответе. Если кэширование отсутствует, оно не снизит ваш счёт.
Чтобы вызвать Qwen3.8 Max, используйте OpenAI-совместимый API OrcaRouter по базовому URL https://api.orcarouter.ai/v1. Установите идентификатор модели 'qwen/qwen3.8-max' в теле запроса. Конечная точка — https://api.orcarouter.ai/v1/chat/completions. Вы отправляете JSON-объект с массивом messages, где каждое сообщение имеет role и content. Для текстового ввода content — это обычная строка. Для ввода изображений или видео content может быть массивом частей, следуя формату OpenAI vision. Аутентифицируйтесь с помощью вашего API-ключа OrcaRouter в заголовке Authorization. OrcaRouter направляет запрос провайдеру qwen. Отдельный базовый URL, специфичный для провайдера, не требуется. Используйте стандартный OpenAI SDK и установите base_url на URL OrcaRouter, чтобы быстро начать работу. Ответ следует тому же формату chat completions, который вы уже знаете.
Через OpenAI-совместимый API OrcaRouter вы можете задавать такие параметры, как temperature, top_p, max_tokens и stop sequences. Поддерживаемые параметры могут зависеть от бэкенда провайдера qwen. Qwen3.8 Max имеет контекстное окно в 1 000 000 токенов, поэтому суммарное количество входных и выходных токенов должно оставаться в пределах этого лимита. Максимальная длина выходных данных не указана в описании каталога; проверьте документацию модели или сообщения об ошибках для получения этого ограничения. Вы можете использовать параметр stream для получения токенов по мере их генерации, что может улучшить воспринимаемую задержку. Для мультимодальных входных данных массив содержимого сообщения должен включать правильные типы частей. Если параметр не поддерживается, OrcaRouter вернёт ошибку, и вы сможете скорректировать свой запрос. Сначала протестируйте с небольшим запросом, чтобы подтвердить поведение параметров. Это стандартная практика при интеграции любой новой модели.
Если ваше приложение уже использует OpenAI chat completions API, миграция на Qwen3.8 Max на OrcaRouter не составит труда. Измените базовый URL на https://api.orcarouter.ai/v1 и установите API-ключ на ваш ключ OrcaRouter. Установите поле модели на 'qwen/qwen3.8-max'. Структура сообщений остаётся прежней, включая системные, пользовательские и ассистентские сообщения. Для мультимодальных запросов используйте тот же формат частей контента, что и в vision API от OpenAI. Возможно, вам потребуется обновить промпты, поскольку Qwen3.8 Max — это другая модель и может отвечать иначе. Протестируйте несколько примеров запросов перед переключением продакшн-трафика. Также обратите внимание, что идентификатор модели включает префикс 'qwen/', с помощью которого OrcaRouter определяет провайдера. Переписывать код не нужно, если ваш SDK позволяет задавать пользовательский базовый URL. Это сокращает затраты на миграцию. Вы можете сохранить ту же логику повторов и обработки ошибок.
Qwen3.8 Max отличается окном контекста в 1 000 000 токенов и поддержкой текста, изображений и видео. Меньшие модели Qwen обычно имеют более короткие окна контекста и могут не принимать все три модальности. Поскольку на OrcaRouter не указаны результаты бенчмарков для Qwen3.8 Max, прямое сравнение качества с меньшими моделями по данным каталога невозможно. Разница в цене очевидна: Qwen3.8 Max стоит $2.00 за 1 млн входных токенов и $6.00 за 1 млн выходных токенов. Меньшие модели обычно стоят меньше за токен и могут быть быстрее, но их ограничения могут вынудить вас разбивать ввод на части или отбрасывать визуальные данные. Если ваш проект укладывается в меньший контекст и не требует видео, меньшая модель, скорее всего, будет более экономичной. Если вам нужно рассуждать по длинному документу или видео, Qwen3.8 Max — это вариант, созданный для этого.
OrcaRouter размещает несколько моделей от разных провайдеров, и Qwen3.8 Max является одним из мультимодальных вариантов. Его определяющие особенности — окно контекста на 1 000 000 токенов и возможность ввода текста, изображений и видео. Другие мультимодальные модели могут иметь меньшие окна контекста или иные цены на токены. В каталоге Qwen3.8 Max указано $2.00 за 1 млн входных токенов и $6.00 за 1 млн выходных токенов, без наценки в OrcaRouter. Без результатов бенчмарков нельзя сделать вывод, какая модель более производительная. Вы можете сравнить их напрямую, отправляя одинаковые запросы каждой модели через OpenAI-совместимый API OrcaRouter и сравнивая качество вывода, время ответа и стоимость. Выбор зависит от вашей конкретной рабочей нагрузки и того, какой объём контекста вам действительно нужен. Поддержка видео не универсальна, поэтому это ключевое различие. Модель с более низкой ценой может оказаться лучше, если ваши запросы небольшие.
Выбирайте Qwen3.8 Max, когда задача требует большого контекстного окна до 1,000,000 токенов или мультимодального ввода с текстом, изображением и видео. Это разумный выбор для анализа длинных документов, понимания целых видео и рассуждений на основе изображений и текста. Выбирайте альтернативу, когда ваши запросы короткие, только текстовые или чувствительные к задержке, а также когда модель меньшего размера с более низкой ценой за токен может обеспечить приемлемое качество. Также рассмотрите альтернативы, если вам нужны опубликованные результаты бенчмарков или гарантированная пропускная способность, поскольку они не указаны для Qwen3.8 Max. Правильное решение зависит от ожидаемого использования токенов, допустимых затрат и требований к качеству. Проведите небольшую оценку на OrcaRouter с обеими моделями и рассчитайте общую стоимость успешного ответа перед запуском в производство. Не существует единственной лучшей модели для каждой задачи.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Ввод / 1M токенов | $2.00 |
| Вывод / 1M токенов | $6.00 |
| Чтение кэша / 1M | $0.250 |
| Запись кэша / 1M | $2.50 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
О чём говорят разработчики на этой неделе
GET /api/public/models/qwen/qwen3.8-maxОткрыть @misc{orcarouter_qwen3_8_max,
title = {Qwen3.8 Max API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max}
}Qwen. (2026). Qwen3.8 Max API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max