Qwen3.5 122B-A10B — открытая архитектура MoE (смесь экспертов) мультимодальная (текст/изображение/видео), 122B всего / 10B активных параметров, контекст 32k (режим зрения).
Qwen3.5-122B-A10B — это большая языковая модель из серии Qwen от Alibaba Cloud. Она использует архитектуру смеси экспертов (MoE), при которой во время прямого прохода активируется только 10…
На основе архитектуры и бенчмарк-оценки, Qwen3.5-122B-A10B превосходно справляется с задачами, требующими многошаговых рассуждений, использования инструментов и следования инструкциям. Оценка 93.6 в τ²-Bench указывает на высокую производительность в бенчмарке, который требует от модели планировать и выполнять последовательности действий с помощью инструментов (например, калькуляторов, поисковых систем, интерпретаторов кода). Это делает её подходящей для создания автономных агентов, которым необходимо взаимодействовать с внешними системами. Модель также обрабатывает мультимодальные входные данные, поэтому такие задачи, как визуальное рассуждение, анализ документов со встроенными изображениями или обобщение видео, входят в её сильные стороны. Кроме того, большой лимит вывода позволяет генерировать подробные объяснения, завершения кода или структурированные данные в одном ответе. Разработчики, работающие над сложными чат-ботами, ассистентами по программированию или инструментами для анализа исследований, могут счесть эту модель эффективной.
Хотя Qwen3.5-122B-A10B является мощной моделью, она не наиболее экономически эффективный выбор для каждого сценария использования. Если ваша задача — простая классификация, генерация короткого текста или прямой вопрос-ответ, не требующий многошаговых рассуждений или мультимодального понимания, вы можете добиться удовлетворительных результатов с помощью более маленькой модели, такой как Qwen-7B, или не-мультимодальной модели. Такие модели могут быть быстрее и дешевле за токен. Кроме того, если ваши потребности в контексте очень малы (например, менее 1000 токенов), относительные накладные расходы использования модели с 122B параметров могут быть неоправданными. OrcaRouter предлагает ряд моделей с различными ценами и характеристиками производительности. Вы можете сначала поэкспериментировать с меньшими моделями и перейти на более крупную только в случае недостаточного качества. Также, если вам не требуется лимит вывода в 65K, может быть достаточно модели с более коротким выводом.
Модель имеет контекстное окно размером 32,768 токенов и максимальный выход 65,536 токенов, что позволяет ей обрабатывать расширенные цепочки рассуждений и длинные инструкции. Высокий балл τ²-Bench указывает на то, что она может поддерживать связность на протяжении нескольких шагов и корректно выполнять сложные инструкции, включающие условную логику, вызовы инструментов и ветвление. На практике пользователи сообщают, что модели серии Qwen3.5 конкурентоспособны с другими современными моделями в таких задачах, как решение математических задач, генерация кода и логические головоломки. Однако, как и все большие модели, производительность может снижаться, если контекст перегружен нерелевантной информацией или если инструкции неоднозначны. Рекомендуется инженерия промптов для эффективного управления моделью. Модель также может испытывать трудности с очень длинными документами (близкими к ограничению контекста), когда ей необходимо вспомнить детали из начала.
Мультимодальный ввод (текст + изображение/видео) позволяет реализовать несколько практических приложений. При анализе документов модель может читать как текст, так и встроенные диаграммы, схемы или подписи в PDF или изображении. Например, она может извлекать данные из отсканированной таблицы или интерпретировать график. При ответе на вопросы по изображениям модель может отвечать на вопросы о фотографии или иллюстрации. При анализе видео она может обрабатывать кадры для описания сцен или отслеживания изменений во времени. Разработчики могут создавать инструменты для обеспечения доступности (например, описывать изображения для пользователей с нарушениями зрения) или автоматизации (например, анализировать скриншоты интерфейсов). Поскольку доступ к модели осуществляется через OrcaRouter, эти возможности можно интегрировать в существующие приложения с помощью тех же вызовов API, которые используются для текстовых запросов, просто включив image_url или video_url в содержимое сообщения.
Единственным опубликованным бенчмарком для этой модели является τ²-Bench, где она набрала 93.6. τ²-Bench предназначен для оценки способности модели использовать инструменты и выполнять многошаговые задачи в смоделированной среде. Оценка 93.6 показывает, что модель может правильно выполнять высокую долю этих задач. Для контекста, этот результат конкурентоспособен с другими современными моделями на том же бенчмарке. Однако оценки бенчмарков не всегда соответствуют реальной производительности, так как задачи могут различаться по сложности, и бенчмарк может не охватывать все области. Пользователям следует проводить собственные оценки для своих конкретных задач. Другие оценки бенчмарков (например, MMLU, HumanEval или мультимодальные бенчмарки) не представлены в доступных фактах, поэтому невозможно сравнить эту модель по более широкому набору стандартных метрик.
Сильные стороны: Модель достигает высокого балла в тесте на использование инструментов, что свидетельствует о сильном логическом мышлении и следовании инструкциям. Её мультимодальные возможности и большой лимит вывода делают её универсальной. Архитектура MoE может обеспечить хороший баланс между производительностью и эффективностью (по крайней мере, по сравнению с плотной моделью аналогичного общего количества параметров). Ограничения: Контекстное окно модели составляет всего 32 768 токенов, что является умеренным по сравнению с некоторыми моделями, предлагающими 100K и более. Количество активных параметров (10B) относительно невелико для модели такого общего размера, что может ограничивать производительность на очень сложных задачах. Отсутствует информация о задержке, пропускной способности или аппаратных требованиях. Кроме того, поскольку модель новая, экосистема сообщества (например, скрипты тонкой настройки, инструменты квантования) может быть менее развита, чем для более устоявшихся моделей. Пользователям следует тщательно протестировать модель.
Конкретные показатели задержки или пропускной способности для этой модели на OrcaRouter недоступны. Скорость инференса зависит от таких факторов, как длина входных данных, длина выходных данных, размер пакета и базовое оборудование, выделяемое OrcaRouter. Модели MoE могут иметь переменную скорость, поскольку механизм маршрутизации может активировать разные эксперты для разных токенов. Как правило, модели с 10B активированных параметров могут генерировать текст с умеренной скоростью на современных GPU, но общий объем 122B параметров в памяти может привести к более высокому потреблению памяти и увеличению времени префилла. Если низкая задержка критична, вы можете протестировать модель с вашими типичными запросами. API OrcaRouter возвращает временные метки и показатели производительности в заголовках ответов, что может помочь измерить скорость. Для приложений, чувствительных к задержке, рассмотрите возможность использования модели меньшего размера, если это позволяет задача.
Имеющиеся факты включают только один бенчмарк: τ²-Bench. Распространённые тесты, такие как MMLU (знания), HumanEval (код), GSM8K (математика) или мультимодальные бенчмарки вроде MMBench, не предоставлены. Это затрудняет оценку производительности модели на задачах, не связанных с инструментами. Например, если ваше приложение требует фактической точности, вы захотите узнать её результат на MMLU. Аналогично, для мультимодальных задач были бы полезны показатели на критериях визуального мышления. Отсутствие этих результатов не означает плохой производительности, но оно означает, что пользователи должны проводить собственные оценки. OrcaRouter может предоставить дополнительные результаты бенчмарков по запросу или в документации. Пока не появятся новые данные, рекомендуется качественно сравнивать модель с другими в вашей конкретной области.
Детали ценообразования для Qwen3.5-122B-A10B на OrcaRouter явно не указаны в имеющихся данных. Обычно OrcaRouter взимает плату за токен как за ввод, так и за вывод, с отдельными тарифами для токенов подсказки и сгенерированных токенов. Мультимодальные входные данные (изображения/видео) тарифицируются как эквиваленты токенов на основе количества обработанных блоков изображений или кадров видео. Некоторые провайдеры также предлагают скидки при попадании в кеш, если пользователь повторяет одну и ту же подсказку. Чтобы получить точные цены, пользователям следует обратиться к странице ценообразования OrcaRouter или связаться с их отделом продаж. Поскольку эта модель имеет 122B общих параметров и является мультимодальной, ее цена за токен может быть выше, чем у меньших или только текстовых моделей. Важно учитывать стоимость токенов для изображений/видео при оценке общих расходов на задачу.
Использование более крупной модели, такой как Qwen3.5-122B-A10B, обычно влечет за собой более высокие затраты на токен по сравнению с меньшими моделями. Однако если модель может решить задачу за меньшее количество шагов или с меньшим количеством токенов благодаря своим возможностям, общая стоимость все равно может быть конкурентоспособной. Большой лимит вывода (65 536 токенов) может быть как преимуществом, так и риском затрат: генерация длинных выводов может быстро накапливать затраты на токены. Кроме того, мультимодальные входные данные потребляют больше токенов на один запрос, чем текстовые запросы. Например, одно изображение высокого разрешения может стоить сотни токенов. Если ваша задача не требует полных возможностей модели, вы можете сэкономить, выбрав меньшую модель. OrcaRouter, вероятно, предоставляет информационные панели использования и средства контроля затрат, такие как установка максимального количества выходных токенов или оповещения о бюджете, которые могут помочь управлять расходами.
Доступные факты не упоминают о каких-либо скидках на кэширование для этой модели на OrcaRouter. Многие поставщики вывода предлагают кэширование промптов, когда повторяющийся текст в системных промптах или сообщениях пользователей временно сохраняется и тарифицируется по более низкой ставке. Если OrcaRouter поддерживает кэширование, это может снизить затраты для приложений, использующих длинные статические промпты (например, системные инструкции, описания персонажей). Однако без конкретной документации этого не следует предполагать. Пользователи могут проверять заголовки ответов API на наличие индикаторов попадания в кэш, если кэширование реализовано. Чтобы минимизировать затраты, вы можете конструировать промпты, избегая повторения одних и тех же длинных префиксов, отделяя статические инструкции от динамического содержимого. Также рассмотрите возможность использования более коротких окон контекста или пропуска ненужных изображений, когда это возможно.
Чтобы использовать Qwen3.5-122B-A10B, отправьте POST-запрос к конечной точке API OrcaRouter по адресу https://api.orcarouter.ai/v1/chat/completions. Установите параметр model в значение "qwen/qwen3.5-122b-a10b". API полностью совместим с форматом chat completions от OpenAI, поэтому вы можете использовать те же клиентские библиотеки (например, openai Python library), изменив базовый URL и API-ключ. Тело запроса включает сообщения (каждое с ролью и содержимым), а также опциональные параметры, такие как temperature, max_tokens, top_p и т.д. Для мультимодального ввода используйте блок содержимого с типом: "image_url" для изображений или специфическую обработку видео модели (вероятно, через кадры в кодировке base64 или URL). API вернёт JSON-ответ с сгенерированным текстом и метаданными использования (количество токенов). Документация OrcaRouter предоставляет больше деталей о поддерживаемых параметрах.
Модель поддерживает стандартные параметры чата: температура (по умолчанию обычно 0,7), top_p (по умолчанию 0,9), max_tokens (до максимального вывода модели в 65 536), presence_penalty, frequency_penalty и стоп-последовательности. Ограничение контекстного окна составляет 32 768 токенов, включая все сообщения, изображения и кадры видео. Если общее количество токенов превышает этот лимит, API вернет ошибку или обрежет ввод (в зависимости от настроек). Параметр max_tokens не может превышать 65 536. Для мультимодальных запросов имейте в виду, что изображения и видео добавляют токены; точный коэффициент преобразования не предоставляется, но изображения с высоким разрешением или длинные видео могут быстро исчерпать контекстное окно. OrcaRouter также может поддерживать потоковый режим, при котором ответы передаются потоком по токенам, что полезно для приложений реального времени. Обратитесь к справочнику API для получения дополнительных параметров, таких как logprobs или tools.
Миграция проста: замените базовый URL на https://api.orcarouter.ai/v1, используйте идентификатор модели "qwen/qwen3.5-122b-a10b" и укажите ваш API-ключ OrcaRouter. Формат запроса идентичен API чат-завершений OpenAI. Например, в Python с библиотекой openai вы можете установить client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key'). Затем вызвать client.chat.completions.create(model='qwen/qwen3.5-122b-a10b', messages=...). Если ваше приложение использует вызов функций или инструменты, обратите внимание, что модель их поддерживает, так как она обучена на τ²-Bench, который включает использование инструментов. Однако точный синтаксис вызова инструментов может отличаться от OpenAI; OrcaRouter, вероятно, поддерживает формат OpenAI, но проверьте это на практике. Для мультимодальных входных данных ваш существующий код, отправляющий image_url в сообщениях, может работать, если модель поддерживает этот формат.
В семействе Qwen эта модель занимает промежуточное положение между меньшими плотными моделями (например, Qwen-7B, Qwen-14B) и крупнейшими MoE-моделями (например, Qwen3.5-235B). По сравнению с плотными моделями, данная MoE-модель имеет доступ к большему общему набору параметров, но активирует лишь их часть на каждый токен, что может способствовать более узкой специализации экспертов. Это потенциально повышает производительность на различных задачах, особенно требующих разнообразных знаний. Однако меньшие плотные модели могут быть быстрее и дешевле для узких задач. По сравнению с более крупной Qwen3.5-235B, эта модель, вероятно, уступает в производительности, но является более эффективной. Поддержка мультимодальности — общая черта поколения Qwen3.5; более ранние версии (Qwen2, Qwen1) работали только с текстом. Пользователям следует сравнивать результаты бенчмарков по своим конкретным задачам, чтобы выбрать наиболее подходящую модель.
Прямые сравнения затруднительны без всесторонних бенчмарков. Qwen3.5-122B-A10B достигает 93,6 балла на τ²-Bench, что является сильным результатом для задач по использованию инструментов. Для справки: аналогичные показатели на этом бенчмарке для других моделей не приводятся, но это считается высоким уровнем возможностей. Что касается архитектуры, Llama модели являются плотными и более простыми, в то время как Claude модели имеют разные проприетарные архитектуры. Qwen3.5 предлагает мультимодальный ввод (изображение/видео), который поддерживается Claude, но Llama 3.2 и 3.1 поддерживают только текст (за исключением некоторых вариантов с компьютерным зрением). Контекстное окно в 32K меньше, чем у Claude (100K или 200K), но сопоставимо с 128K у Llama 3.1? Не совсем; мы не должны выдумывать цифры. В кодировании и рассуждениях многие модели конкурентоспособны. Преимуществом этой модели может быть ее специальная настройка для использования инструментов (высокий балл на τ²-Bench) и эффективность мультимодального MoE. Однако у Claude и Llama более крупные экосистемы и больше поддержки сообщества.
Немногие модели сочетают мультимодальный ввод, большой контекстный окно, большой лимит вывода и высокий балл τ²-Bench в одном пакете. Серия Qwen3.5 разработана как способная модель общего назначения с сильными навыками рассуждения и использования инструментов. Архитектура MoE с общим числом параметров 122B и активными 10B позволяет вместить много знаний, сохраняя стоимость вывода ниже, чем у плотной модели на 122B. Тем не менее, другие модели MoE, такие как Mixtral 8x7B (всего 47B, активные 13B), имеют другие компромиссы. Qwen3.5-122B-A10B имеет гораздо большее общее количество параметров, но меньше активных параметров на токен (10B против 13B). Поддержка мультимодальности является отличительной чертой; Mixtral работает только с текстом. В области мультимодальных MoE существуют модели, такие как Qwen-VL или другие, но они часто имеют меньшие контекстные окна. Эта модель позиционируется как сильный вариант для разработчиков, которым нужна единая модель для разнообразных, мультимодальных и инструментоемких задач на OrcaRouter.
Выбирайте Qwen3.5-122B-A10B, если ваше приложение требует как мультимодального понимания, так и сложных многошаговых рассуждений, а также вам нужен большой лимит вывода для генерации длинных ответов. Это также хороший выбор, если вы создаете агентные системы, использующие инструменты, учитывая его высокий балл τ²-Bench. Если ваша задача работает только с текстом и не требует дополнительных возможностей, более дешевая модель, например Llama 3.1 70B или Qwen-14B, может быть достаточной. Если вам нужно большее контекстное окно (например, >100K токенов), рассмотрите модели, специально разработанные для длинных контекстов. Если вам нужна меньшая задержка, лучше подойдет меньшая или плотная модель. Поскольку OrcaRouter предлагает множество моделей, вы можете оценить несколько через один и тот же API, чтобы найти наилучшее соответствие вашим целям по стоимости и качеству. Идентификатор модели: qwen/qwen3.5-122b-a10b.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.5-122b-a10b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Уровень | Ввод / 1M токенов | Вывод / 1M токенов |
|---|---|---|
| ≤ 128K | $0.115 | $0.917 |
| ≤ 256K | $0.287 | $2.294 |
| Уровень выбирается по количеству входных токенов запроса | ||
Оценка по прайс-листу
Многоуровневые цены — оценка использует базовый уровень.
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
GET /api/public/models/qwen/qwen3.5-122b-a10bОткрыть @misc{orcarouter_qwen3_5_122b_a10b,
title = {Qwen3.5-122B-A10B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b}
}Qwen. (2026). Qwen3.5-122B-A10B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b