
Бенчмарки Qwen3.8-27B: Полная таблица со всеми оговорками
- obsidianНОВИНКАQwen3.8 27B Uncensored (Aggressive)2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
Qwen3.8-27Bнабирает 73.0 в Terminal-Bench 2.1, 61.7 в SWE-bench Pro, 90.3 в LiveCodeBench v6 и 84.3 в OSWorld-Verified — и каждое из этих чисел получено самой Alibaba. Модель с открытыми весами и 27 миллиардами параметров появилась на Hugging Face 14 августа 2026 года под лицензией Apache 2.0, и по состоянию на 15 августа никто, кроме Alibaba, независимо не оценивал её качество. Эта страница — полный обзор с источниками: все 25 официальных бенчмарков из карточки модели, что изменилось по сравнению с предшественником Qwen3.6-27B, что показал независимый тест пропускной способности от AMD и какие заявления следует считать предварительными.
Небольшое пояснение перед цифрами: «официальный» здесь означает оценку Alibaba, указанную на карточке модели Qwen/Qwen3.8-27B. Она предоставлена производителем и не воспроизведена независимо. «Независимый» означает, что ее измерил кто-то за пределами лаборатории — пока это касается только пропускной способности оборудования, а не каких-либо показателей качества. Бенчмарки, для которых важна среда выполнения, отмечены прямо в тексте.
Модель, одна строка на спецификацию
27B плотных параметров (28B с учётом энкодера зрения), 64 слоя, размер скрытого слоя 5120.
• Гибридное внимание — 48 слоев линейного внимания Gated DeltaNet плюс 16 слоев полного внимания, соотношение 3:1 — именно это делает окно из 262K токенов доступным для запуска.
• 262,144 токена нативного контекста, расширяемого до 1,000,000 с помощью масштабирования YaRN.
• Встроенный ввод изображений и видео (вывод текста), веса Apache 2.0, примерно 55,6 ГБ в BF16.
Краткая версия: это модель, призванная взять то, что Alibaba узнала при создании Qwen3.8-Max с 2,4 триллиона параметров, и сжать это в то, что может работать на одном GPU.
Таблица результатов: все бенчмарки из карточки модели
Все приведенные ниже показатели взяты из карточки модели Alibaba от 14 августа, при этом показатель Qwen3.6-27B, который заменяет данная модель, указан в скобках.
Программирование. Terminal-Bench 2.1 (агентное терминальное программирование) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Прогоны SWE-bench Pro и QwenSWEBench использовали испытательный стенд Claude Code, согласно сноске в карточке модели — это стоит учитывать перед сравнением с моделью, оценённой на другом стенде.
Агенты с длинным горизонтом и офисная работа. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / балл 42.9 (10.6 / 27.3).
Рассуждение и знания. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench следование инструкциям 79.5 (69.1). HLE оценивается GPT-4o, согласно карточке.
Зрение и использование компьютера.OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 с CI / 90.0 без (85.1); BabyVision 85.6 с CI / 65.7 без (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). «CI» — это улучшение инференса от Alibaba; разрыв между его включённым и выключенным состояниями — это самое информативное число на карточке о том, сколько очков можно получить за счёт дополнительных вычислительных ресурсов инференса.

Что на самом деле изменилось по сравнению с Qwen3.6-27B
Все бенчмарки на карточке выросли, но дельты неодинаковы — и именно форма улучшения здесь главное. Улучшения сосредоточены в агентном кодировании и использовании компьютера, а не в воспроизведении знаний:
• DeepSWE 1.1 (агентное кодирование) 13.3 → 42.2, примерно трехкратный рост
• QwenSWEBench 49.3 → 79.0
• Результат Agents' Last Exam: 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 и AndroidWorld 70.3 → 81.9
• BabyVision (с CI) 28.9 → 85.6 — наибольший относительный прирост на карточке
Тем временем GPQA Diamond вырос с 87.8 → 89.2, а RealWorldQA — с 84.1 → 85.9: реально, но незначительно. Это не релиз «умнее во всём». Это релиз, ориентированный squarely на агентов, которые читают экраны, используют инструменты и пишут код на протяжении многих шагов.

Честные пробелы: где всё ещё проигрывает, и методологические оговорки
На фоне фронтира картина лестная, но не односторонняя. Там, где пересекаются Qwen3.8-27B и Claude Opus 4.6 Max, Qwen побеждает в большинстве — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench и весь блок vision. Против Meta Muse Glimmer-30B, естественного конкурента локального класса, она выигрывает все восемь пересекающихся бенчмарков безоговорочно. Но она всё ещё уступает Claude Opus 4.6 Max на Terminal-Bench 2.1 (73.0 против 78.2), GPQA Diamond (89.2 против 91.3), Humanity's Last Exam (30.8 против 40.0) и NL2Repo-Bench (42.3 против 47.6). Если ваша рабочая нагрузка — это самые сложные задачи фронтира: фронтирная математика, массово междисциплинарные вопросы — 27B пока не дотягивает.
Три оговорки, прежде чем цитировать что-либо из этого. Во-первых, ничто из этого не подтверждено независимо; нет индекса Artificial Analysis и нет прогона LMArena для 27B по состоянию на 15 августа, а собственные харнессы Alibaba — не те, что будут использовать третьи стороны. Во-вторых, в карточке модели используется харнесс Claude Code для SWE-bench Pro и QwenSWEBench и судья GPT-4o для Humanity's Last Exam — сравнения с моделями, оценёнными на других настройках, изменят цифры. В-третьих, прогон MathVision от Alibaba использовал фиксированный промпт, тогда как конкуренты получали более высокий из двух вариантов. Ничто из этого не означает, что результаты неверны; это означает, что они являются потолком, а не полом, пока кто-то другой не запустит модель.
Что нужно, чтобы запустить это
Qwen3.8-27B — это локальная модель, которая меняет смысл понятия «производительность»: теперь это пропускная способность на вашем собственном оборудовании, а не строчка в прайс-листе. Веса в формате BF16 занимают примерно 55,6 ГБ; в 4-битном квантовании она помещается в 24 ГБ видеопамяти, например на RTX 3090 или 4090. AMD обеспечила поддержку Day-0 в день запуска, и её собственные замеры llama.cpp/Vulkan — август 2026 года, усреднённые по трём и более запускам — показали 24,5 токена/с на Ryzen AI Max+ 395 и 51,8 токена/с на Radeon AI PRO R9700 с 32 ГБ, в системах с более чем примерно 24 ГБ переменной видеопамяти или VRAM. Тесты сообщества FP8-сборки на NVIDIA GH200 выдержали 10 одновременных запросов с контекстом 262K при времени до первого токена менее 10 мс. Ваши собственные цифры будут другими — это чужие GPU, — но тенденция реальна: это первый релиз Qwen в этом классе, который работает не только в обзоре, но и на одной рабочей станции.
Свободные веса или платный API?
Решение, которое навязывает эта модель, — это то самое решение, что разделяет локальное и облачное размещение: веса ничего не стоят, но ваши GPU не бесплатны. Самостоятельный хостинг означает владение кремнием — одна карта на 24 ГБ, если вы согласны на 4-битное квантование и более медленную генерацию, или что-то мощнее, если нужен полный контекст на 262K токенов в полном качестве. Облачная альтернатива на OrcaRouter стоит $0.33 за миллион входных токенов и $2.40 за миллион выходных, с тем же контекстом на 262K и вводом изображений и видео, а p50 время до первого токена составляет 225 мс за последние семь дней — не нужно покупать GPU и следить за VRAM. Арифметика здесь та же, что и всегда с открытыми весами: нужная вам пропускная способность по токенам, умноженная на стоимость токена, против фиксированной цены карты. При высокой постоянной нагрузке выигрывает самостоятельный хостинг; при пиковой или умеренной нагрузке платить $0.33/$2.40 выгоднее, чем покупать кремний, который в основном простаивает.

Суть
Qwen3.8-27B — самая сильная модель с открытыми весами, которую Alibaba выпустила в этом классе размеров, по собственным данным Alibaba: лучшие показатели в таблице по агентному кодированию, использованию компьютера и визуальному рассуждению, с контекстным окном 262K и весами Apache 2.0. Правильное чтение таблицы результатов условно — каждая цифра предоставлена вендором, привязана к конкретному тесту и пока не воспроизведена, а самые сложные бенчмарки на рассуждение по-прежнему выигрывают передовые модели. Если вы решаете, развернуть ли её у себя или вызывать через API, рассматривайте таблицу бенчмарков как обещание, а показатели пропускной способности AMD — как единственное независимое измерение, которое существует на сегодняшний день. Мы обновим эту страницу в день, когда независимая лаборатория опубликует оценку.
