Qwen3.5-27B vs Qwen3.5 397B A17B: бенчмарки, цены и скорость (сентябрь 2026 г.)

Прямое сравнение Qwen3.5-27B (qwen) и Qwen3.5 397B A17B (qwen) на OrcaRouter — цены, контекстное окно, задержка, пропускная способность и качество benchmark бок о бок, чтобы вы могли выбрать подходящую модель для своей нагрузки.

Итог

По цене Qwen3.5-27B — более дешёвый вариант, примерно на 50% ниже Qwen3.5 397B A17B по входным tokens. Для нагрузок, чувствительных к задержке, Qwen3.5 397B A17B возвращает первый token быстрее. По качеству benchmark Qwen3.5 397B A17B лидирует в сводном индексе. Выбирайте Qwen3.5-27B, чтобы минимизировать затраты, или Qwen3.5 397B A17B, когда скорость ответа важнее всего.

Бесплатный старт · обе модели по одному ключу · оплата по цене провайдера, без наценки на токены

И Qwen3.5-27B, и Qwen3.5 397B A17B доступны через один и тот же эндпоинт OrcaRouter по цене провайдера с нулевой наценкой на токены, поэтому переключение между ними — это изменение в одну строку, а цифры ниже — это то, что вы платите на самом деле.

Читать полный разбор

Это сравнение подтягивает актуальные цены, опубликованное context window, а также собственные замеры latency и throughput OrcaRouter, чтобы вы могли взвесить стоимость и производительность под свою конкретную нагрузку, а не полагаться на витринный benchmark поставщика. Правильный выбор почти всегда зависит от формы вашего трафика — длины промпта, объёма генерируемого текста, того, насколько ваши пользователи чувствительны к latency, и насколько тяжело рассуждение, — поэтому разделы ниже разбирают решение по одному измерению за раз и завершаются конкретной рекомендацией. Везде, где для одной из двух моделей метрика отсутствует, соответствующая строка опускается, а не додумывается, так что каждое утверждение здесь подкреплено реальным числом.

Кратко

  • Ввод $/млн$0.09Qwen3.5-27B 50%
  • Задержка p503663 msQwen3.5 397B A17B 7%
  • Качество8.0Qwen3.5 397B A17B 33%

Сравнение моделей

Цены, контекст, задержка, пропускная способность и качество для Qwen3.5-27B и Qwen3.5 397B A17B.
МетрикаQwen3.5-27BQwen3.5 397B A17BВывод
Ввод $/млн$0.09$0.17Qwen3.5-27B на 50% дешевле, чем Qwen3.5 397B A17B, по входным tokens.
Вывод $/млн$0.69$1.03Qwen3.5-27B на 33% дешевле, чем Qwen3.5 397B A17B, по выходным tokens.
Контекст33K33KQwen3.5-27B и Qwen3.5 397B A17B имеют одинаковое контекстное окно.
Задержка p503956 ms3663 msQwen3.5 397B A17B отвечает на 7% быстрее, чем Qwen3.5-27B, по медиане.
Пропускная способность66 tok/s857 tok/sQwen3.5 397B A17B стримит tokens на 1206% быстрее, чем Qwen3.5-27B.
Качество6.08.0Qwen3.5 397B A17B набирает на 33% больше, чем Qwen3.5-27B, по сводному индексу качества.

По цене Qwen3.5-27B — более дешёвый вариант, примерно на 50% ниже Qwen3.5 397B A17B по входным tokens. Для нагрузок, чувствительных к задержке, Qwen3.5 397B A17B возвращает первый token быстрее. По качеству benchmark Qwen3.5 397B A17B лидирует в сводном индексе. Выбирайте Qwen3.5-27B, чтобы минимизировать затраты, или Qwen3.5 397B A17B, когда скорость ответа важнее всего.

Обе модели, один API-ключ. Начните с любой и переключайтесь, изменив одну строку.

Получить API-ключ

Используйте Qwen3.5-27B и Qwen3.5 397B A17B по одному API-ключу

Выбирать не обязательно. Обе модели доступны через один и тот же OpenAI-совместимый эндпоинт OrcaRouter и тарифицируются по цене вышестоящего провайдера без наценки на токены. Переключение — это смена имени модели: без второго аккаунта, второго SDK и отдельных учётных данных.

Именно это делает описанный выше компромисс управляемым в продакшене: направляйте основную часть трафика в модель, которая выигрывает по важному для вас параметру, оставляйте вторую для запросов, которым она действительно нужна, и меняйте пропорцию, как только меняются ваши цифры.

curl
# Один ключ, один эндпоинт, обе модели.
curl https://api.orcarouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $ORCAROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen/qwen3.5-27b",
    "messages": [{"role":"user","content":"..."}]
  }'

# Смените модель, изменив одну строку.
#     "model": "qwen/qwen3.5-397b-a17b"

Живой тест: Qwen3.5-27B vs Qwen3.5 397B A17B в режиме Battle

Режим битвы — попробуйте оба, бок о бокВ эфире
Открыть в песочнице
Qwen: Qwen3.5-27B
$0.09 /M · p50 3956ms
Qwen: Qwen3.5 397B A17B
$0.17 /M · p50 3663ms

Цены и анализ затрат

На входных токенах Qwen3.5-27B стоит $0.09 за 1 млн против $0.17 у Qwen3.5 397B A17B, а на выходе $0.69 против $1.03 за 1 млн.

Читать полный разбор

Счёт обычно решается на выходных токенах: нагрузка чата или agent, генерирующая длинные ответы, определяется выходной ставкой, поэтому модель, выглядящая дешевле на входе, всё равно может оказаться более дорогим выбором от начала до конца. Оцените своё реальное соотношение вход-выход, прежде чем выбирать только по цене — промпт с интенсивным поиском и коротким ответом и короткий промпт с длинной генерацией оказываются на противоположных краях этой таблицы. Практический способ оценить это — взять репрезентативную выборку своих промптов, посчитать среднее число входных и выходных токенов и умножить каждое на соответствующие ставки двух моделей; модель с меньшей смешанной (blended) стоимостью на вашем реальном наборе — та, которую нужно превзойти. Помните, что обе цены здесь — это чистая ставка провайдера — OrcaRouter не добавляет наценки, — так что сравнение честное, и рассчитанная экономия — это та экономия, которую вы оставляете себе.

Qwen3.5-27B принимает до 33K токенов контекста, а Qwen3.5 397B A17B принимает 33K. Context window ограничивает, сколько исходного материала — документов, кода, предыдущего диалога — вы можете отправить в одном запросе.

Читать полный разбор

Более крупное окно позволяет обойтись без чанкинга и обвязки для поиска при длинных входах, но вы всё равно платите по ставке входных токенов за всё отправленное, поэтому большее окно — это возможность, а не скидка. Подбирайте окно под самый длинный одиночный запрос, который ваша нагрузка реально порождает, а не под самое большое число на странице. Учитывайте также, что на любой модели качество может ухудшаться к концу очень длинного контекста, поэтому большое окно лучше рассматривать как запас для эпизодических длинных входов, а не как разрешение забивать каждый запрос до предела.

Обе ставки — это чистая цена провайдера: OrcaRouter не добавляет наценку, поэтому рассчитанная экономия остаётся у вас.

Начать бесплатно

Ставки за токены рядом

Ввод $/млн
Qwen3.5-27B$0.09
Qwen3.5 397B A17B$0.17
Вывод $/млн
Qwen3.5-27B$0.69
Qwen3.5 397B A17B$1.03

за 1 млн tokens

Скорость и задержка

Latency и throughput определяют, каково работать с моделью в продакшене. Медианная (p50) latency отклика — это время ожидания типичного запроса до первого токена; throughput (токенов в секунду) задаёт, как быстро ответ стримится после начала.

Читать полный разбор

Для интерактивного чата и циклов agent важнее всего низкая p50 latency, потому что пользователь ждёт первый токен; для пакетной генерации и длинных выводов общее время определяет throughput, потому что ответ длинный. Графики трендов за 7 дней выше показывают, стабильна latency каждой модели или дрейфует — то, что единичное громкое число скрывает: модель с отличным средним, но шумным хвостом всё равно может не уложиться в строгий p95 SLA. Если у вашего продукта есть бюджет latency, читайте и медиану, и форму кривой, и помните, что сквозная latency включает также ваш сетевой хоп и любые запросы поиска или вызовы инструментов, которые вы делаете вокруг модели.

За последние 7 дней Qwen3.5 397B A17B удерживает более низкую медианную задержку ответа.

Qwen3.5-27B
Qwen3.5 397B A17B

Бенчмарки и качество

Оценки benchmark приближают способности, но не заменяют тестирование на ваших собственных промптах.

Читать полный разбор

Показанные здесь сводные индексы агрегируют несколько публичных оценок, а перцентиль отмечает, где каждая модель находится среди всех сопоставимых моделей каталога — полезный сигнал для короткого списка, но не гарантия для вашей задачи. Модель, лидирующая по индексу общего интеллекта, всё равно может отставать в вашей области (кодинг, извлечение, многоязычность, рассуждение на длинном контексте), поэтому используйте benchmark, чтобы сузить круг, а затем прогоните обе модели на репрезентативном срезе вашего трафика. Обращайте внимание на конкретный индекс, соответствующий вашему сценарию, а не на итоговое число: продукту с упором на код стоит взвешивать индекс кодинга, исследовательскому ассистенту — индекс рассуждения. Benchmark к тому же устаревают по мере обновления моделей, поэтому относитесь к ним как к стартовой гипотезе, которую вы подтверждаете собственным набором для оценки.

Qwen3.5-27B
59.3
AA Coding
Лучше, чем 69% сравниваемых моделей
43 из 138
22.9
AA Intelligence
Лучше, чем 40% сравниваемых моделей
85 из 141
62.3
AA Math
Лучше, чем 48% сравниваемых моделей
43 из 82
Qwen3.5 397B A17B
48.2
AA Coding
Лучше, чем 51% сравниваемых моделей
68 из 138
18.4
AA Intelligence
Лучше, чем 30% сравниваемых моделей
98 из 141
Прямое сравнение сообществом (Design Arena)Источник: Elo из Design Arena
Qwen3.5-27B1430Рейтинг Elo80.4% побед
Qwen3.5 397B A17B1239Рейтинг Elo56.7% побед

В командных турнирах сообщества по прямым поединкам Qwen3.5-27B имеет более высокий рейтинг Elo (1430 против 1239), а значит, чаще побеждает в прямых сравнениях с сопоставимыми моделями.

Что выбрать?

Если стоимость — жёсткое ограничение, начните с более дешёвой модели на вашем реальном сочетании вход-выход и переходите выше только если не хватает качества.

Читать полный разбор

Если приоритет — отзывчивость (чат для пользователей, agent, любой случай, где кто-то ждёт), придавайте p50 latency и throughput больший вес, чем небольшой разнице в цене. Если вы выжимаете самое тяжёлое рассуждение, кодинг или работу на длинном контексте, пусть ведёт победитель по benchmark и context window, и принимайте более высокую ставку там, где она себя окупает. Поскольку обе модели стоят за одним и тем же API, малорисковый ход — направить часть реального трафика на каждую и сравнить стоимость, latency и качество ответов на своих промптах, прежде чем определяться. Распространённый приём — многоуровневость (tier): отправляйте основную массу простых, высокочастотных запросов на более дешёвую или быструю модель, а более сильную модель приберегите для запросов, которым она действительно нужна, — это забирает большую часть выигрыша в качестве за долю стоимости. Что бы вы ни выбрали, держите переключение обратимым — вы вернёте трафик обратно, как только цифры или ваши требования изменятся.

Или не выбирайте — маршрутизируйте по каждому запросу между обеими, с одним ключом и одним эндпоинтом.

Получить обе

Лучше подходит для

  • Чувствительные к цене, большие объёмыQwen3.5-27B
  • Чат и агенты, критичные к задержкеQwen3.5 397B A17B
  • Сложные рассуждения и кодQwen3.5 397B A17B

Qwen3.5-27B vs Qwen3.5 397B A17B — часто задаваемые вопросы

Что дешевле, Qwen3.5-27B или Qwen3.5 397B A17B?
Qwen3.5-27B дешевле по входным tokens — $0.09 за 1M против $0.17 за 1M.
Что дешевле на выходных токенах, Qwen3.5-27B или Qwen3.5 397B A17B?
У Qwen3.5-27B ниже цена вывода — $0.69 за 1 млн против $1.03 за 1 млн. Для нагрузок с большой генерацией цена вывода обычно важнее входа, поэтому взвешивайте соответственно.
Что быстрее, Qwen3.5-27B или Qwen3.5 397B A17B?
Qwen3.5 397B A17B имеет более низкую медианную (p50) задержку ответа по данным живых измерений OrcaRouter.
Что стримит быстрее, Qwen3.5-27B или Qwen3.5 397B A17B?
У Qwen3.5 397B A17B выше измеренный throughput (токенов в секунду), поэтому длинные ответы завершаются раньше после начала генерации.
Что набирает больше в benchmark, Qwen3.5-27B или Qwen3.5 397B A17B?
Qwen3.5 397B A17B лидирует по сводному индексу качества, показанному выше, но лидерство в benchmark не всегда переносится на конкретную область — проверьте на своих промптах, прежде чем стандартизировать.
Кто чаще побеждает в прямых поединках — Qwen3.5-27B или Qwen3.5 397B A17B?
Qwen3.5-27B имеет более высокий рейтинг Elo в Design Arena (1430 против 1239), поэтому чаще побеждает в слепых прямых сравнениях с сопоставимыми моделями.
Что мне использовать, Qwen3.5-27B или Qwen3.5 397B A17B?
Выбирайте Qwen3.5-27B или Qwen3.5 397B A17B в зависимости от вашего приоритета: стоимость, контекстное окно, задержка или качество benchmark. Таблица выше показывает, какая модель побеждает по каждому критерию; сопоставьте победителя с наиболее важным для вашей нагрузки параметром.
Как тарифицируются Qwen3.5-27B и Qwen3.5 397B A17B в OrcaRouter?
Обе тарифицируются по ставке вышестоящего провайдера с нулевой наценкой на токены — вы платите ту же цену за токен, что платили бы провайдеру напрямую, через один API-ключ и эндпоинт OrcaRouter.
Могу ли я вызывать и Qwen3.5-27B, и Qwen3.5 397B A17B одним и тем же кодом?
Да. Обе доступны через OpenAI-compatible API OrcaRouter, поэтому вы меняете только имя модели, чтобы маршрутизировать между ними — без смены SDK, без отдельных учётных данных.

Начните с Qwen3.5-27B или Qwen3.5 397B A17B

Один ключ. Обе модели. Более 40 провайдеров.

Оплата по цене провайдера, без наценки на токены. Начните бесплатно, меняйте модель одной строкой и сохраняйте решение обратимым.

Создать бесплатный аккаунт