Снимок от 2 сентября 2026 года модели Qwen3.8 Max, флагманской мультимодальной модели рассуждений Alibaba: вход — текст + изображение + видео, выход — текст, контекст на 1 млн токенов. Те же возможности и цены, что и у базовой модели; закрепите её для воспроизводимого поведения.
Qwen3.8 Max (0902) — это запись модели на OrcaRouter от провайдера qwen, опубликованная с идентификатором модели qwen/qwen3.8-max-0902. Обозначение 0902 указано в списке, однако предоставленные факты…
Модель поддерживает контекстное окно размером в 1,000,000 токенов. Это общий объём входных данных, которые модель может обработать в одном запросе, включая текстовое, графическое и видеосодержимое промпта. В фактах не указано дополнительных ограничений, поэтому практические пределы зависят от того, как OrcaRouter и провайдер реализуют токенизацию и таймауты запросов. Для длинных текстов 1,000,000 токенов позволяет включить в один запрос множество значительных по объёму документов, снижая необходимость разбивать или резюмировать их перед вызовом модели. Что касается видео, в фактах не указано, сколько токенов расходуется на секунду, кадр или видеофайл, поэтому следует оценивать это по метаданным или тестовым запросам. Также важно помнить, что размер контекстного окна не показывает, насколько точна модель при обработке промпта на 1,000,000 токенов; никаких данных бенчмарков не предоставлено. Если вашему приложению требуется точная работа с длинным контекстом, протестируйте модель на выборке ваших собственных документов перед запуском в производство.
Когда в качестве входных данных принимаются текст, изображения и видео, модель может быть использована для рассуждений над исходным материалом, сочетающим эти типы в одном запросе. Примеры включают чтение инструкций в тексте, изучение изображения и обращение к видео при формировании ответа. В информационном листе поставщика не указаны задачи конкретного типа, такие как OCR, обнаружение объектов или темпоральное рассуждение по видео, поэтому предполагать наличие таких возможностей не следует. Что можно ожидать от модели, зависит главным образом от её обученных способностей, которые не задокументированы в предоставленных фактах. Безопасный подход — использовать её для задач, требующих текстового вывода из запроса со смешанной модальностью и способных выдержать стоимость хранения изображений и видео в качестве входных токенов. Если рабочая нагрузка является текстовой, другая модель без поддержки изображений и видео может оказаться проще. Если задача требует точных видеоопераций на уровне временных меток, карточка модели не даёт доказательств надёжности такого поведения.
Choosing a cheaper model makes sense when the task does not require the features that define this listing. A short text question does not need a 1,000,000-token context or a 131,072-token output ceiling. A text-only workflow does not need image or video input. OrcaRouter bills this model at $2.00 per 1,000,000 input tokens and $6.00 per 1,000,000 output tokens. If a cheaper alternative has lower per-token prices and adequate context and modality support, it will reduce cost. There are no quality or speed benchmarks in the supplied facts, so choosing this model over other models cannot be justified by measured accuracy; it should be justified by explicit product requirements: large context, mixed text/image/video input, or long output in one generation. Because the input price applies to every token in the context, very large context calls can cost more than smaller calls even when the user question is short, so avoid padding prompts.
Предоставленные факты о модели Qwen3.8 Max (0902) не включают результаты бенчмарков, наборы для оценки или показатели точности. По этой причине любое утверждение о качестве модели было бы спекуляцией, и OrcaRouter не публикует выведенные (предполагаемые) оценки. Если вам нужно число для сравнения кандидатов, проведите собственные тесты на репрезентативных входных данных, включая случаи с изображениями и видео, которые вы планируете отправлять. Такой бенчмарк, как публичный тест знаний, не покажет, насколько хорошо модель обрабатывает конкретный видеопромпт на 1 000 000 токенов. Имейте в виду, что название модели вроде Max — это лишь ярлык, а не доказательство качества. Измеримыми параметрами в этом списке являются окно контекста, максимальная длина вывода, модальности ввода и цена. Эти атрибуты определяют, подходит ли рабочая нагрузка, но они не описывают точность, глубину рассуждений, следование инструкциям или поведение с точки зрения безопасности. Считайте возможности в этих областях непроверенными, пока вы не проведёте собственную оценку.
Факты о модели не содержат показателей скорости в токенах в секунду, времени до первого токена, рекомендаций по таймауту запросов или любых других измерений производительности. OrcaRouter не заявляет показатель задержки для данной модели провайдера. Скорость будет зависеть от серверной инфраструктуры провайдера, размера входных данных и объёма запрашиваемого вывода. Вход из 1 000 000 токенов и выход из 131 072 токенов, скорее всего, займут больше времени, чем короткий запрос, но в описании не приводится точной зависимости. Видеовход также может увеличить задержку, поскольку его необходимо обработать в токены до того, как модель сможет его воспринять; факты не дают количественной оценки этого этапа. Рецензентам не следует предполагать, что низкая цена за токен подразумевает быстрое декодирование. Единственное решение, связанное со скоростью, которое поддерживается фактами, — это протестировать репрезентативные размеры запросов при ожидаемой нагрузке. Не делайте выводов о пригодности для работы в реальном времени на основании размера контекстного окна или названия модели.
Заявленные преимущества носят структурный характер. Модель имеет контекстное окно на 1,000,000 токенов, высокий максимальный выход в 131,072 токена и принимает текст, изображения и видео в качестве входных данных. Это полезно для приложений, которым требуется один вызов модели, чтобы просмотреть большой или смешанный массив материала перед написанием длинного ответа. Ограничения также легче сформулировать на основе фактов, чем преимущества. Опубликованных бенчмарков качества нет, поэтому точность, рассуждения и безопасность не задокументированы. Нет отдельного перечня обучающих данных, примечаний к выпуску или методологии обновления, стоящих за меткой 0902. Ввод изображений и видео не гарантирует точного визуального или временного понимания. Пределы контекста и вывода — это максимумы, а не рекомендованный режим использования; очень большие выходные данные могут стоить дорого — $6.00 за 1,000,000 выходных токенов. Запрос, заполняющий контекст на 1,000,000 токенов, потребует $2.00 на входные токены до генерации какого-либо вывода, что является значительной операционной стоимостью.
Указанные цены за единицу составляют $2.00 за каждые 1 000 000 входных токенов и $6.00 за каждые 1 000 000 выходных токенов. OrcaRouter выставляет счет за модель по тарифу провайдера без наценки, поэтому указанная цена является тарифом провайдера, передаваемым напрямую. Входные токены включают текстовые, графические и видео токены, отправленные в запросе. Выходные токены — это сгенерированные токены ответа. При таких тарифах 1 000 000 входных токенов стоят $2.00; 1 000 000 выходных токенов стоят $6.00. Меньший запрос стоит пропорционально меньше: 100 000 входных токенов будут стоить $0.20, а 100 000 выходных токенов — $0.60, при условии, что эти объемы измеряются провайдером. Карточка модели не включает отдельные цены для кэшированных входных данных, пакетных запросов или интерактивных тарифов, поэтому такие цены предполагать не следует. Точное количество оплачиваемых токенов следует проверять в ответе об использовании OrcaRouter или в журналах для каждого вызова.
Когда OrcaRouter указывает, что модель тарифицируется по ставке провайдера без наценки, это означает, что OrcaRouter не добавляет собственную комиссию за токен к ставке провайдера для данного предложения. Таким образом, итоговая сумма за использование токенов должна рассчитываться на основе указанных цен $2.00 за миллион токенов на входе и $6.00 за миллион токенов на выходе. Это не обязательно означает, что в итоговом счете не будет других платежей; налоги или комиссии на уровне аккаунта могут применяться в зависимости от ваших договоренностей, однако в данных фактах такие комиссии не задокументированы. Это также не означает, что модель бесплатна для использования, поскольку ставка за токен по-прежнему применяется. При сравнении провайдеров цена, отображаемая OrcaRouter для этой модели, должна представлять те же единицы измерения, что и в данном предложении. Если другой шлюз указывает иную цену, разница обусловлена структурой выставления счетов, а не изменением контекстного окна модели.
Управление затратами должно начинаться с длины промпта. Поскольку ввод стоит $2.00 за 1 000 000 токенов, каждый дополнительный токен увеличивает плату за ввод, а каждое изображение или видео, отправленное в запросе, конвертируется в токены по правилам, не указанным в этом описании. Сокращение нерелевантного исходного материала может снизить затраты. Вывод стоит в три раза дороже цены за единицу ввода, поэтому ограничение запрашиваемой длины вывода также контролирует расходы. Модель с лимитом вывода в 131 072 токена может генерировать ответы, которые стоят денег; при $6.00 за 1 000 000 токенов 131 072 выходных токена обойдутся примерно в $0.79 только за выходные токены. Генерация такого количества токенов не происходит автоматически, потому что размер ответа контролируется промптом. Для этой модели не опубликована цена кэша, поэтому не предполагайте, что повторяющийся контекст получает скидку. Отсутствие информации о кэше или пакетных ценах в фактах не является доказательством того, что такие опции не существуют; это просто означает, что они не входят в данное описание.
Qwen3.8 Max (0902) доступен через OpenAI-совместимый API OrcaRouter. Задайте клиенту базовый URL https://api.orcarouter.ai/v1 и используйте точный идентификатор модели qwen/qwen3.8-max-0902. В SDK, совместимом с OpenAI, структура запроса практически такая же, как при любом вызове chat-completions: передайте API-ключ OrcaRouter, указанный выше базовый URL и идентификатор модели в теле запроса. Не используйте общее имя вроде Qwen3.8 Max или qwen3.8; в листинге требуется qwen/qwen3.8-max-0902. Тот же идентификатор модели следует использовать в прямых HTTP-запросах к базовому URL, где путь и полезная нагрузка соответствуют OpenAI-совместимому контракту, предоставляемому OrcaRouter. Поскольку API совместим с OpenAI, существующий код, написанный для chat completions от OpenAI, обычно можно перенести, изменив параметры base_url и model, хотя детали аутентификации должны соответствовать требованиям OrcaRouter.
Для чат-завершений, совместимых с OpenAI, такие параметры, как model, messages и лимит выходных токенов, обрабатываются так же, как и для других совместимых моделей. Согласно фактам, максимальный объем выходных данных составляет 131 072 токена, поэтому если вы задаете лимит выходных данных, он не должен превышать 131 072; значение лимита выходных данных по умолчанию в фактах не указано. Температура, top-p, stop и другие параметры выборки не задокументированы в предоставленных фактах о модели, поэтому следуйте документации API OrcaRouter и стандартной семантике параметров OpenAI. Для ввода изображений и видео используйте мультимодальный формат контента, ожидаемый API OrcaRouter; в фактах пример не приводится. Если API возвращает ошибку о неподдерживаемых именах параметров, проверьте, не отправляет ли ваш SDK устаревшие параметры. Контекстное окно составляет 1 000 000 токенов, поэтому в запросе все входные токены, включая токены изображений и видео, должны оставаться ниже этого лимита. Ответы учитываются отдельно в пределах максимума в 131 072 токена.
Поскольку OrcaRouter предлагает OpenAI-совместимый API по адресу https://api.orcarouter.ai/v1, миграция в основном сводится к изменению конфигурации. Замените базовый URL на https://api.orcarouter.ai/v1, замените поле API-ключа на ключ OrcaRouter и укажите модель qwen/qwen3.8-max-0902. Если ваш код использует клиентскую библиотеку, совместимую с OpenAI, обновите base_url и api_key клиента, сохранив структуру сообщений в основном без изменений, при условии, что мультимодальный формат соответствует этой модели. В фактах не указано, поддерживает ли эта модель все специфичные для OpenAI параметры, поэтому перед миграцией проверьте параметры, которые отправляет ваше приложение. Кроме того, поскольку лимит контекста составляет 1 000 000, а максимальный объем выходных данных — 131 072, скорректируйте логику обрезки запросов в соответствии с этими лимитами. Любой существующий код, в котором жестко задана другая максимальная длина контекста, возможно, потребуется обновить. Наконец, убедитесь, что ожидания вашего приложения по обработке данных соответствуют условиям OrcaRouter, поскольку в фактах о самой модели не обсуждается хранение данных.
Основным критерием сравнения является входной контракт. Qwen3.8 Max (0902) принимает текст, изображения и видео, поэтому текстовая альтернатива исключила бы эти модальности. Если ваш реальный рабочий процесс содержит только текст, текстовая модель с достаточно большим контекстом, скорее всего, подойдёт более точно и может иметь другую цену. Фактические данные о модели не включают сравнения точности или скорости с какой-либо другой моделью, поэтому вы не можете выбирать на основе публичных показателей качества. Вы можете сравнивать структурные атрибуты: текстовая альтернатива может иметь меньший контекст, более короткий лимит выходных данных или более низкую цену за входные токены. OrcaRouter тарифицирует эту модель по $2.00 за входные и $6.00 за выходные токены на 1 000 000 токенов. Тот факт, что модель поддерживает ввод изображений и видео, полезен только в том случае, если эти входные данные используются. Если эти входные данные не используются, вы можете платить за мультимодальную мощность, которая не имеет отношения к задаче.
Выбирайте Qwen3.8 Max (0902), когда профиль задачи соответствует перечисленным характеристикам. Во-первых, вам нужен контекст на 1 000 000 токенов, потому что исходный материал невозможно сократить, чтобы он уместился в окно меньшего размера. Во-вторых, вам нужен ввод изображений и видео в одном промпте, или вы ожидаете такие модальности в будущих запросах. В-третьих, вам нужен максимальный выход до 131 072 токенов. Если ваша рабочая нагрузка не соответствует ни одному из этих требований, многие преимущества, указанные в этом описании, останутся неиспользованными. Не выбирайте её только потому, что название Max звучит убедительно; в описании нет данных бенчмарков. Поскольку OrcaRouter предоставляет доступ к моделям через один и тот же OpenAI-совместимый API, замена идентификаторов моделей выполняется легко, поэтому вы можете протестировать эту модель в сравнении с другим кандидатом на своей собственной задаче. Просто помните, что цены на входные и выходные токены различаются, и для этой модели не указаны цены на кэширование.
При сравнении стоимости сначала приведите показатели к одной и той же токенной базе. Тарифы этой модели — $2.00 за 1 000 000 входных токенов и $6.00 за 1 000 000 выходных токенов; они передаются от провайдера без наценки. Конкурирующая модель с более низкой ценой за входной токен может действительно оказаться дешевле для запроса с полным контекстом, однако при этом необходимо учитывать и окно контекста, и максимальное количество выходных токенов. Например, запрос на 1 000 000 токенов может использовать полный контекст этой модели за один вызов; модели с контекстом на 200 000 токенов потребуется несколько вызовов, а дополнительные проходы для вывода или суммаризации могут изменить итоговую цену. Предоставленные сведения не содержат объективных значений точности или задержки, поэтому любое сравнение стоимости за правильный ответ должно опираться на ваши собственные тесты. Проверьте также, не взимает ли конкурирующая модель отдельную плату за токены изображений или видео, — здесь такие условия не описаны. Если сомневаетесь, прогоните типичную рабочую нагрузку на OrcaRouter и сравните замеренное потребление токенов и качество ответов, а не полагайтесь только на цены из прайс-листа.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Ввод / 1M токенов | $2.00 |
| Вывод / 1M токенов | $6.00 |
| Чтение кэша / 1M | $0.250 |
| Запись кэша / 1M | $2.50 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
О чём говорят разработчики на этой неделе
GET /api/public/models/qwen/qwen3.8-max-0902Открыть @misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902