Qwen3-VL 235B-A22B Instruct — визуально-языковая модель с открытым весом, 235B всего / 22B активных параметров, контекст 256k, без режима размышления.
Qwen3 VL 235B A22B Instruct — это визуально-языковая версия серии моделей Qwen3, созданная Alibaba Cloud. В ней используется архитектура смеси экспертов (MoE) с общим количеством параметров в 235…
Модель отлично справляется с задачами, где взаимодействуют изображения и текст. Она может отвечать на вопросы о содержании изображения, подробно описывать сцены, читать текст с документов или вывесок, а также анализировать взаимосвязи между объектами на картинке. Кроме того, она обрабатывает несколько изображений в одном разговоре, что позволяет проводить сравнительный анализ или последовательные рассуждения. Тюнинг с помощью инструкций позволяет модели следовать сложным мультимодальным подсказкам, таким как «Объясни, почему на этом графике наблюдается тенденция» или «Извлеки все числовые значения из этой таблицы». Эти возможности обусловлены большим бэкбоном MoE и специализированным обучением на зрительно-языковых данных.
Будучи вариантом Instruct, модель была донастроена для точного следования инструкциям пользователя как в текстовых, так и в мультимодальных запросах. Она может обрабатывать многоходовые диалоги, в которых изображения добавляются постепенно, поддерживать контекст на протяжении нескольких обменов и следовать инструкциям по форматированию (например, вывод в формате JSON, маркированный список или пошагово). Она хорошо справляется с задачами, требующими соблюдения ограничений, таких как 'Отвечай только если на изображении есть собака'. Это делает её подходящей для приложений, где важно последовательное, соблюдающее правила поведение.
Для задач, включающих только текст и не имеющих визуальной составляющей, модель 235B MoE может быть избыточной; более эффективными с точки зрения затрат будут маленькие плотные модели или другие текстовые варианты Qwen. Аналогично, если ваши изображения просты (например, простые логотипы, одиночные объекты) или вам нужна чрезвычайно высокая пропускная способность в рамках бюджета, может быть достаточно меньшей модели зрения, такой как Qwen2-VL 7B. Эта модель наиболее оправдана, когда вам нужно обрабатывать сложные изображения с высоким разрешением, документы с плотным текстом или задачи, требующие глубокого мультимодального рассуждения. В OrcaRouter вы можете легко сравнивать цены и переключать идентификаторы моделей.
Нет. Qwen3 VL 235B A22B Instruct — это модель генерации текста, которая принимает только изображения на вход. Она не генерирует изображения, аудио или любые другие модальности. Вывод всегда представляет собой текстовую строку. Если вам нужна генерация изображений, вам следует использовать отдельную модель. Сильная сторона этой модели заключается в понимании и рассуждении о визуальном вводе. Например, она может описать, как выглядит изображение, или ответить на вопросы о нем, но она не может создавать, редактировать или преобразовывать изображения сама.
Сообщённый показатель MMLU-Pro для этой модели составляет 82,3. MMLU-Pro — это улучшенная версия бенчмарка Massive Multitask Language Understanding, охватывающая 57 дисциплин в областях STEM, гуманитарных и социальных наук. Оценка 82,3 свидетельствует о сильных общих знаниях и способности рассуждать в разнообразных темах. Это единый агрегированный показатель; производительность может варьироваться в зависимости от предмета. Данный результат ставит модель в число лучших в своём классе по размеру, особенно учитывая архитектуру MoE, которая активирует лишь часть от общего числа параметров на каждый запрос.
К сильным сторонам относятся высокая точность на бенчмарках мультимодального рассуждения, хорошее следование инструкциям и экономическая эффективность по сравнению с плотными моделями аналогичного общего количества параметров. Архитектура MoE позволяет масштабировать емкость без пропорционального увеличения вычислительных затрат. К ограничениям относятся более высокая абсолютная стоимость по сравнению с меньшими моделями, потенциальное увеличение задержки из-за большого числа общих параметров (хотя активны только 22B, полная модель должна быть загружена в память). Она также может иногда галлюцинировать мелкие детали на изображениях или не справляться с очень неоднозначными визуальными входными данными. Производительность на специфических задачах предметной области (например, медицинская визуализация) не гарантируется.
Скорость инференса зависит от аппаратного бэкенда, используемого OrcaRouter, и текущей нагрузки. Как MoE-модель с общим количеством 235 миллиардов параметров, она требует значительного объема памяти GPU, хотя на каждый токен активируется только 22 миллиарда параметров. Обычно это приводит к более высокой задержке на запрос по сравнению с меньшими плотными моделями (например, 7B-70B параметров). Пропускная способность также зависит от размера пакета и длины последовательности. Для приложений, чувствительных к задержке, рассмотрите использование меньшей модели или оптимизацию для более коротких промптов. OrcaRouter не предоставляет конкретных гарантий задержки, но стремится к отзывчивости на уровне промышленного использования.
OrcaRouter взимает ровно указанную провайдером ставку: $0.40 за 1 миллион входных токенов и $1.60 за 1 миллион выходных токенов. Никакой дополнительной наценки нет. Как входные, так и выходные токены подсчитываются по правилам токенизации OpenAI, которые могут незначительно отличаться от внутреннего токенизатора модели. Изображения также тарифицируются как токены на основе их размеров и уровня детализации, согласно политике провайдера. Вы можете оценить затраты, умножив ожидаемое использование токенов на эти тарифы.
Стоимость за токен выше, чем у меньших или плотных моделей, но архитектура MoE обеспечивает большую ёмкость на активный параметр по сравнению с плотной моделью эквивалентного активного размера. Для сложных мультимодальных задач эта модель может выполнить задачу за меньшее количество токенов или с более высокой точностью, что потенциально снижает общие затраты. Однако для простых задач более дешёвая модель позволит сократить расходы. На OrcaRouter вы можете переключать модели на лету, используя эту модель только когда необходимо. Никаких минимальных ежемесячных обязательств или скрытых платежей.
OrcaRouter в настоящее время не раскрывает конкретные политики кэширования для этой модели. Кэширование на уровне токенов может применяться основным провайдером, но не гарантируется. Скидки за объем или многоуровневые тарифы не упоминаются; тарифы фиксированы за токен. Для пользователей с высокими объемами может быть целесообразно связаться со службой поддержки OrcaRouter для возможных индивидуальных договоренностей. В целом, ценообразование прозрачно и основано на использовании.
Изображения преобразуются в количество токенов на основе их разрешения и настройки детализации. Точная формула определяется провайдером (Qwen) и может варьироваться. Как правило, изображения с более высоким разрешением потребляют больше токенов. OrcaRouter передает токенизацию провайдера без изменений. Вы можете контролировать расходы, изменяя размер изображений или используя режим низкой детализации, если модель это поддерживает. Всегда обращайтесь к документации провайдера для точного расчета токенов изображения. Входные токены для изображений учитываются по ставке $0.40 за миллион.
Вы отправляете POST-запрос на https://api.orcarouter.ai/v1/chat/completions с JSON-полезной нагрузкой, совместимой с OpenAI. Установите поле model в "qwen/qwen3-vl-235b-a22b-instruct". Включите массив messages, где каждое сообщение может содержать текст и/или изображения. Для изображений используйте стандартный формат контента изображений OpenAI (URL или base64). Аутентификация осуществляется через Bearer-токен (ваш API-ключ). Примеры параметров: temperature, max_tokens, top_p и стоп-последовательности работают идентично OpenAI API. Документация OrcaRouter содержит полную информацию.
Поддерживаются все стандартные параметры завершения чата: temperature (0-2, по умолчанию 1), top_p (0-1, по умолчанию 1), max_tokens (количество выходных токенов), stop (список строк), presence_penalty, frequency_penalty и seed для воспроизводимости. Модель также учитывает системные сообщения для настройки поведения. Для мультимодальных запросов вы включаете часть изображения в содержимое сообщения пользователя. Открытых параметров, специфичных для модели, нет; API сохраняется общим для совместимости. Если вам нужно управлять маршрутизацией MoE, это обрабатывается внутренне.
Да. Поскольку OrcaRouter использует формат API OpenAI, миграция проходит без проблем. Замените ваш текущий базовый URL и идентификатор модели на конечную точку OrcaRouter и "qwen/qwen3-vl-235b-a22b-instruct". Убедитесь, что ваш API-ключ действителен и у вас достаточно кредитов. Формат сообщений для изображений идентичен формату OpenAI (с использованием типа контента 'image_url'). Возможно, потребуется скорректировать оценки количества токенов из-за разной токенизации. Никаких изменений в логику вашего приложения, кроме конечной точки и имени модели, не требуется.
Qwen3 VL 235B A22B Instruct и GPT-4V оба обрабатывают мультимодальные входные данные. Ключевые различия: Qwen3 VL использует MoE с 22B активными параметрами, в то время как GPT-4V — это проприетарная плотная модель нераскрытого размера. Ценообразование Qwen3 VL через OrcaRouter составляет $0.40/$1.60 за миллион токенов, что значительно ниже типичных тарифов GPT-4V. Результаты бенчмарков не поддаются прямому сравнению, поскольку MMLU-Pro и другие тесты используют разные подмножества. GPT-4V имеет более широкую экосистему поддержки, но Qwen3 VL предлагает преимущество по стоимости для высокообъемных мультимодальных рабочих нагрузок в OrcaRouter.
Claude 3.5 Sonnet — это плотная модель от Anthropic с сильными возможностями текста и зрения. Она не использует MoE, поэтому её общий объем меньше, чем общее количество параметров Qwen3 VL, но её активная пропускная способность на один вывод выше, чем 22B. Цены на Claude 3.5 Sonnet обычно выше за токен (примерно $3.00/$15.00 на миллион токенов). Qwen3 VL предлагает гораздо более низкую стоимость для мультимодальных задач. Однако модели Claude имеют больший контекстный окно (200K токенов). Выбор зависит от бюджета, потребностей в длине контекста и предпочтительного провайдера.
OrcaRouter предлагает и другие модели Qwen, такие как Qwen2.5 7B, Qwen2.5 72B или варианты Qwen2-VL. Qwen3 VL 235B A22B Instruct — крупнейшая мультимодальная MoE-модель в линейке Qwen. По сравнению с Qwen2-VL 72B, она имеет больше общих параметров и архитектуру MoE, что может обеспечить лучшую производительность при выполнении сложных задач, сохраняя при этом приемлемую стоимость вывода. Эта модель дороже за токен, чем меньшие модели Qwen, но может быть экономически оправданной, если позволяет сократить количество отдельных вызовов или общее потребление токенов.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Ввод / 1M токенов | $0.400 |
| Вывод / 1M токенов | $1.60 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instructОткрыть @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct