
Qwen3.8-27B: компактная мультимодальная модель в линейке Qwen3.8 от Alibaba
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 316 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 196 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
Qwen3.8-27B — плотный, одноузловой представитель поколения Qwen3.8 от Alibaba: нативная визуально-языковая модель с 27 млрд параметров, опубликованная на Hugging Face под Apache 2.0, которая принимает текст, изображения и видео и возвращает текст с контекстным окном в 262 144 токена. Это справочная страница для этой модели — каноническое описание того, чем она является, сколько стоит её вызов и на что она способна, — и стоит сразу сказать, почему страница существует для модели, чьи веса впервые появились в августе 2026 года, а не за последние семь дней. Мы не сообщаем о запуске. Мы отвечаем на постоянный вопрос: читатели обращаются к нам по названию «Qwen3.8-27B» тысячи раз в месяц, и до сих пор ни одна наша страница не содержала этого ответа. Собственный релиз модели, датированный на карточке Qwen и зафиксированный Artificial Analysis как 2026-08-14, — это факт, который эта страница использует для датировки модели, а не событие, о котором она сообщает.
Считайте это исключением, которым оно и является: при строгом семидневном прочтении модель середины августа 2026 года не является свежей, и этот материал был бы пропущен как новость. Обоснование здесь другое. Это справочная страница, чьи цифры были сверены с собственной карточкой модели Qwen, файлом лицензии репозитория, тарифной картой Qwen Cloud и Artificial Analysis 2026-09-28, и чья причина существования — поисковый спрос, который мы измерили собственными силами в тот же день. Это не повторное объявление, и никто не должен воспринимать его как таковое.
Где 27B находится в линейке Qwen3.8
Поколение Qwen3.8 — это не одна модель, и суффикс размера — в этом весь смысл названия. Собственные заметки в репозитории Qwen по всему семейству делают это разделение явным:
• Qwen3.8-27B — 27B плотных параметров, нативный ввод изображений и видео, Apache 2.0. Удобный для развёртывания представитель: модель, рассчитанная на запуск на одном GPU или небольшом узле, и предмет этой страницы.
• Qwen3.8-Max, созданная на базе Qwen3.8-2.4T-A95B — 2,4 триллиона общих параметров при 95B активных, модель класса Qwen-Max, которую Alibaba впервые открыла в этом поколении. Её репозиторий содержит специальную qwen3.8-max лицензию, а не Apache 2.0.
• Qwen3.8-Flash-Next — экспериментальное превью архитектуры, которое, по словам Qwen, ляжет в основу Qwen4, выпущенное под qwen-community-1.0. Размещённый Qwen3.8-Flash построен на ней.
«27B» — это не уровень комплектации модели Max; это размерный класс, который действительно может обслуживать одна команда. Что, как утверждает Alibaba, наследует эта модель, так это рецепт обучения: в карточке Qwen3.8-27B описывается, что она берёт достижения поколения в программировании, профессиональной работе, исследованиях и агентных задачах с длинным горизонтом и сжимает их в плотный чекпойнт.

Архитектура, которую публикует Qwen
Все приведённые ниже показатели взяты из карточки модели Qwen/Qwen3.8-27B — официальной документации самого производителя:
• Параметры — 27B, как заявлено. Собственные метаданные safetensors репозитория в сумме насчитывают 27 781 427 952 параметров в BF16, распределённых по 18 шардам, так что с учётом визуальной башни получается примерно 27,8B. Здесь нет смеси экспертов: все параметры активны на каждом токене.
• Форма — 64 слоя, размерность скрытого пространства 5 120, промежуточная размерность прямой связи 17 408, эмбеддинги токенов и выход LM 248 320 (с дополнением).
• Гибридное внимание — вот схема, которую выводит Qwen: 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))три блока линейного внимания на каждый блок полного внимания — соотношение 3:1. Gated DeltaNet использует 48 голов линейного внимания для V и 16 для QK при размерности головы 128; Gated Attention использует 24 головы запросов против 4 голов KV при размерности головы 256, при этом размерность rotary равна 64. Именно это соотношение делает окно в 262K доступным для модели на 27B, и именно это семейство Qwen3.8-Flash-Next расширяет с помощью разреженного внимания.
• Мультитокенное предсказание — в карточке модели указано, что она обучена с MTP на нескольких шагах: это тот самый приём с драфтингом, который ускоряет генерацию в сервинг-стеках, поддерживающих MTP.
• Управление режимом мышления — режим мышления включён по умолчанию, и его можно отключить для отдельного запроса. reasoning_effort принимает xhigh (значение по умолчанию), medium или low, а preserve_thinking включён по умолчанию, поэтому цепочки рассуждений сохраняются между ходами, а не создаются заново.
Контекстное окно и потолок вывода
В карточке указано 262 144 токена нативно, с расширением до 1 000 000 с помощью масштабирования RoPE (YaRN). Собственные рекомендации Qwen по обслуживанию для длительных агентных запусков в пределах этого 1M-конверта — разрешать до 262 144 токенов для содержимого рассуждений и до 131 072 токенов для финального ответа; верхний предел — это конфигурация обслуживания, а не фиксированное свойство чекпоинта.
Два окна стоит различать, потому что их легко спутать. Открытые веса нативно работают с 262 144; размещённая версия в Qwen Cloud, которую карточка модели описывает как ещё не выпущенную («сервис скоро появится»), указана на странице модели Qwen Cloud с контекстом 1M, максимальным вводом 991K, максимальным выводом 131K и максимальным бюджетом рассуждений 262K. Спецификация размещённого продукта — не спецификация чекпоинта.
Модальности: что на входе и что на выходе
Входными данными являются текст, изображение и видео; выходные данные — только текст. Карточка называет Qwen3.8-27B «нативной визуально-языковой моделью, которая понимает изображения и видео», и её пример кода принимает все три типа входных данных. Нет аудиовхода, генерации изображений и речевого вывода. Запись Artificial Analysis о модели для того же чекпоинта согласуется с этим охватом — на входе изображение, видео и текст, на выходе текст — что является полезным вторым мнением, поскольку это не собственная страница Alibaba.
Что на самом деле разрешает релиз Apache 2.0
Лицензия — это не краткое изложение в посте блога; репозиторий содержит сам текст Apache License, Version 2.0, а метаданные карточки указывают license: apache-2.0. Что это даёт, если читать текст лицензии: бессрочная, всемирная, безвозмездная лицензия на авторские права, позволяющая воспроизводить произведение, создавать его производные, публично демонстрировать, сублицензировать и распространять произведение и его производные, а также патентная лицензия от участников — причём коммерческое использование входит в число разрешённых целей, нет ограничений по области применения, нет порога по числу пользователей и не требуется отдельное коммерческое соглашение. Apache 2.0 также является пермиссивной в том смысле, который важен для выпуска продуктов: производные веса можно распространять на иных условиях при условии, что вы сохраняете уведомления о лицензии и об авторстве и указываете, что именно изменили (разделы 4a–4c). Раздел 6 не предоставляет никаких прав на название Qwen или товарные знаки, поэтому форк под Apache-2.0 не может продвигать себя под именем Qwen.
Сравнение внутри семейства показательно, и это видно из репозиториев, а не из освещения: чекпоинт 2.4T-A95B называет себя other с лицензией qwen3.8-max, а Qwen3.8-Flash-Next использует qwen-community-1.0. 27B — единственная из трёх, которая поставляется под простой Apache 2.0.
Независимая позиция бенчмарка
Artificial Analysis запустила модель, и её результат стоит отделять от собственной таблицы Alibaba, потому что эти два источника отвечают на разные вопросы. Независимый индекс, измеренный в xhigh-конфигурации:
• Индекс интеллекта 33.7 — сохранённое значение Artificial Analysis, которое на странице модели Artificial Analysis выводится округлённым до 34. Публикуются два рейтинга, и они рассчитываются по разным совокупностям: собственная сводная плитка той страницы ставит модель на 1-е место из 142 моделей в её размерном классе, в сравнении с моделями того же класса, описанном во всплывающей подсказке страницы, тогда как строка нашего каталога, источником которой является Artificial Analysis, указывает 45-е место из 145, примерно 67-й процентиль. Ни один из них не является местом в рейтинге по тому же набору участников, что и другой, поэтому не следует читать их как одно число в двух форматах.
• Индекс программирования 68.1 — внесён в наш каталог, где в качестве указанного источника используется artificialanalysis.ai, занимает 35-е место из 138 в пуле этого индекса. По программированию модель показывает более высокий результат, чем по общему интеллекту, что согласуется с формой собственной таблицы поставщика.
• Лестница усилий, тот же стенд — снижение усилий на рассуждения сильно смещает индекс: 33,7 при xhigh, 27,6 при medium, 26,2 при low, и 20,2 при полностью отключённых рассуждениях. Это измеренный разброс в 13,5 пункта, и это самый убедительный аргумент за настройку усилий под рабочую нагрузку, а не под модель.
• Где два источника совпадают, а где расходятся — на GPQA Diamond карточка Alibaba сообщает 89,2, а Artificial Analysis измеряет 90,5. На Humanity's Last Exam карточка сообщает 30,8, а Artificial Analysis — 33,9. Близко, но это не одно и то же число, и это нормально: разные харнессы, разные прогоны. Одно предостережение заслуживает места в статье, а не в сноске: ни одна третья сторона не опубликовала прямого сравнения между Qwen3.8-27B и какой-либо из моделей в таблице сравнения Alibaba, запущенных с сопоставимым усилием на сопоставимом харнессе, поэтому каждое межмодельное сравнение на этой странице — это сравнение отдельных измерений, а не результат.

Что сообщает Qwen и как это читать
В карточке модели приведено около двух десятков оценок со столбцами сравнения для Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B и Opus4.6 Max. Все они заявлены производителем и не воспроизведены — это собственная оценка Alibaba, опубликованная Alibaba, — а в нескольких строках используется стенд Claude Code, оцениваемый сборкой GPT-5.4, о чём указано в сносках карточки. Ключевые заявленные производителем цифры на этой основе:
• Агентное программирование в терминале — Terminal Bench 2.1 (Terminus): 73,0 против 63,4 у Qwen3.6-27B, который он заменяет, при этом Opus4.6 Max возглавляет строку с 78,2.
• Агентное программирование — SWE-bench Pro 61.7, QwenSWEBench 79.0, DeepSWE 1.1 42.2, NL2Repo-Bench 42.3, LiveCodeBench v6 90.3.
• Агенты и офисная работа — CoWorkBench 70,7, JobBench 33,4, Agents' Last Exam 42,9 по баллам (Pass@1 20,4).
• Общие рассуждения — GPQA Diamond 89.2, HLE 30.8, IFBench 79.5. Opus4.6 Max лидирует в обеих строках рассуждений в собственной таблице вендора с показателями 91.3 и 40.0.
• Зрение и использование компьютера — OSWorld-Verified 84.3, AndroidWorld 81.9, WebArena-Verified 64.8, OmniDocBench 1.5 91.1, RealWorldQA 85.9.
Честное резюме этой таблицы уже, чем выглядит сама таблица. По сравнению с непосредственным предшественником улучшения значительны и последовательны — QwenSWEBench 79.0 против 49.3, DeepSWE 42.2 против 13.3 — и это утверждение об одном поколении изменения рецепта. В сравнении с фронтирными моделями в соседних столбцах она выигрывает в одних строках и проигрывает в других, по собственным цифрам Alibaba's, по собственному выбору тестового стенда Alibaba's.
его запуск
Веса — это 18 BF16-шардов в формате Transformers, а в карточке в качестве поддерживаемых стеков указаны Hugging Face Transformers, vLLM, SGLang и TokenSpeed. Мы описали локальное развёртывание и квантование в отдельных материалах, и именно там уместны эти детали: Qwen3.8-27B на Ollama для локального демона, а в руководстве по бенчмаркам — полная сводка результатов, включая то, что изменилось по сравнению с Qwen3.6-27B. Эта страница посвящена самой модели.
Qwen3.8-27B в нашем каталоге
Сегодня на OrcaRouter бок о бок представлены две карточки, и обе были перечитаны 2026-09-28 перед написанием этого абзаца. qwen/qwen3.8-27b оценивается в $0.33 за миллион входных токенов и $2.40 за миллион выходных токенов при полном окне в 262 144 токена, поддержке текста, изображений и видео на входе, а возможности reasoning, инструментов, структурированного вывода и JSON доступны в виде параметров. Его собрат obsidian/Qwen3.8-27B — те же веса, обслуживаемые в block-FP8, при этом vision-башня сохранена в полной точности, и, по словам самой карточки, «разработан для предоставления прямых, полных ответов на широкий спектр запросов» — оценивается в $0.40 на входе и $4.21 на выходе. Оба поддерживают chat completions и Responses API, поэтому задачу разбора документов или обработки скриншотов можно направить на любую из моделей под одним ключом и одним эндпоинтом, без второго контракта и без изменений в коде.
Для понимания масштаба: наша собственная площадка за последние семь дней пропустила через qwen/qwen3.8-27b 105,1 млн токенов, при медианном времени до первого байта 3,8 секунды и доле ошибок 3,3% за тот же период. Это наши показатели обслуживания, а не вердикт о модели.

Поисковые запросы, которые привели сюда
Спрос, стоящий за этой страницей, размазан тонким слоем и находится как раз за пределами клика. За 28 дней по состоянию на 2026-09-25 наш ресурс получил 8 931 показ и 273 клика по 69 различным точным написаниям названия модели — "qwen3.8 27b", "qwen3.8-27b", "qwen 3.8 27b" и ещё десятки способов записать те же три токена. Наша лучшая позиция по самым частотным написаниям колебалась от 9,0 до 10,6. Это позиции, которые достались нам случайно из-за других страниц, — и именно эту проблему исправляет каноническая страница: на девятом месте вы попадаете на страницу, но никто не кликает. Единственное место, где трафик конвертируется, — неанглоязычное: русскоязычное написание названия находится у нас на позиции 1,8 и конвертируется на 14,4%.
Ничто из этого не является свидетельством о модели. Это свидетельство о том, что вводят люди, и именно поэтому эта страница существует.
Что это даёт в сумме: плотный чекпоинт на 27B с действительно необычной схемой внимания, разрешительная лицензия, нативное понимание видео, условия Apache-2.0, позволяющие выпускать производные, независимый рейтинг по кодингу в верхней четверти того, что измеряет Artificial Analysis, и таблица производителя, которая сильна по сравнению с предшественником и неоднозначна по сравнению с фронтиром. Открытый вопрос — тот, на который пока никто за пределами Alibaba не может ответить: как хостинговый путь с 1M токенов ведёт себя в продакшене и окажется ли архитектура Flash-Next в модели такого размера.
Ядро 2.4T-A95B, лежащее в основе Qwen3.8-Max, доступно в том же каталоге: qwen/qwen3.8-max по цене $2.00 / $6.00 за миллион токенов — если 27B не тот размер, который вам нужен.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
