
Бенчмарки Qwen3.8-27B: Полная таблица со всеми оговорками
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 219 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Qwen/Qwen3.8-27B набирает 73,0 на Terminal-Bench 2.1, 61,7 на SWE-bench Pro, 90,3 на LiveCodeBench v6 и 84,3 на OSWorld-Verified — и каждое из этих чисел получено самой Alibaba. Модель с открытыми весами на 27 миллиардов параметров появилась на Hugging Face 14 августа 2026 года под лицензией Apache 2.0, и за первые две недели получила три независимых сторонних результата: первое место среди моделей с открытыми весами в бенчмарке Legal Agent от Harvey — в исследовании, проведённом юридической ИИ-компанией Harvey и компанией Engram, специализирующейся на технологиях памяти; девятое место в общем рейтинге лидерборда WebDev от Code Arena — единственная модель своего размерного класса в первой десятке, согласно объявлению Alibaba от 25 августа; и, как было объявлено 26 августа, первое место среди моделей с открытыми весами в лидерборде Image-to-WebDev от Arena.ai, с общим 7-м местом и заявленным результатом 1 574. Эта страница — полный сводный обзор со ссылками на источники: все 25 официальных бенчмарков из карточки модели, что изменилось по сравнению с предшественником Qwen3.6-27B, что показал независимый тест пропускной способности от AMD, результаты в Legal Agent и на webdev-аренах, а также какие утверждения пока стоит считать предварительными.
Перед цифрами — небольшой пояснительный текст: «официальный» здесь означает оценку Alibaba, напечатанную в карточке модели на Qwen/Qwen3.8-27B. Это данные от вендора, никем не воспроизведённые. «Независимый» значит, что замер сделан кем-то вне лаборатории — пока сюда входят тест аппаратной пропускной способности, исследование агента в юридической области и места на двух лидербордах по веб-разработке от Arena.ai: Code Arena's WebDev и Image-to-WebDev арене. Бенчмарки, где важна система запуска, отмечены прямо в тексте.
Модель, одна строка на спецификацию
27B плотных параметров (28B с учётом энкодера зрения), 64 слоя, размер скрытого слоя 5120.
• Гибридное внимание — 48 слоев линейного внимания Gated DeltaNet плюс 16 слоев полного внимания, соотношение 3:1 — именно это делает окно из 262K токенов доступным для запуска.
• 262,144 токена нативного контекста, расширяемого до 1,000,000 с помощью масштабирования YaRN.
• Встроенный ввод изображений и видео (вывод текста), веса Apache 2.0, примерно 55,6 ГБ в BF16.
Краткая версия: это модель, призванная взять то, что Alibaba узнала при создании Qwen3.8-Max с 2,4 триллиона параметров, и сжать это в то, что может работать на одном GPU.
Таблица результатов: все бенчмарки из карточки модели
Все приведенные ниже показатели взяты из карточки модели Alibaba от 14 августа, при этом показатель Qwen3.6-27B, который заменяет данная модель, указан в скобках.
Программирование. Terminal-Bench 2.1 (агентное терминальное программирование) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Прогоны SWE-bench Pro и QwenSWEBench использовали испытательный стенд Claude Code, согласно сноске в карточке модели — это стоит учитывать перед сравнением с моделью, оценённой на другом стенде.
Агенты с длинным горизонтом и офисная работа. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / балл 42.9 (10.6 / 27.3).
Рассуждение и знания. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench следование инструкциям 79.5 (69.1). HLE оценивается GPT-4o, согласно карточке.
Зрение и использование компьютера.OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 с CI / 90.0 без (85.1); BabyVision 85.6 с CI / 65.7 без (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). «CI» — это улучшение инференса от Alibaba; разрыв между его включённым и выключенным состояниями — это самое информативное число на карточке о том, сколько очков можно получить за счёт дополнительных вычислительных ресурсов инференса.

Что на самом деле изменилось по сравнению с Qwen3.6-27B
Все бенчмарки на карточке выросли, но дельты неодинаковы — и именно форма улучшения здесь главное. Улучшения сосредоточены в агентном кодировании и использовании компьютера, а не в воспроизведении знаний:
• DeepSWE 1.1 (агентное кодирование) 13.3 → 42.2, примерно трехкратный рост
• QwenSWEBench 49.3 → 79.0
• Результат Agents' Last Exam: 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 и AndroidWorld 70.3 → 81.9
• BabyVision (с CI) 28.9 → 85.6 — наибольший относительный прирост на карточке
Тем временем GPQA Diamond вырос с 87.8 → 89.2, а RealWorldQA — с 84.1 → 85.9: реально, но незначительно. Это не релиз «умнее во всём». Это релиз, ориентированный squarely на агентов, которые читают экраны, используют инструменты и пишут код на протяжении многих шагов.

Первый независимый результат: #1 среди моделей с открытыми весами на бенчмарке Harvey's Legal Agent.
Главное событие после публикации этой страницы — юридическое, а не техническое. Alibaba объявила, что Qwen3.8-27B является моделью с открытыми весами №1 в бенчмарке Legal Agent от Harvey — это заявление о позиции в рейтинге от самого вендора, так что относитесь к нему как к утверждению Alibaba. За этим результатом стоит исследование, которое проведено не Alibaba: Harvey, компания в сфере юридического ИИ, и Engram, стартап в области ИИ-памяти, создали синтетическую юридическую фирму Calderwood & Harkness на основе более чем 100 млн токенов, охватывающих примерно 10 000 документов и 266 дел, а затем адаптировали Qwen3.8-27B для неё с помощью параметрической памяти, сжатых заметок и инструмента поиска.
На 250 юридических задачах адаптированная модель 27B показала в среднем 67%, опередив все модели, протестированные в исследовании, включая Claude Opus 4.8. По строгому критерию «всё или ничего» она превзошла Opus 4.8 с результатом 30% против 25%, при этом стоимость составила примерно $0,13 за запрос против $1,32 у Opus 4.8. Эти цифры предоставлены Harvey/Engram и пока не воспроизведены независимо. До обучения на документах самой фирмы та же модель набирала всего 4,7% на вопросах, специфичных для фирмы; после их изучения — 72,6%.
Прочитайте #1 с одной большой оговоркой: модель, занявшая первое место в бенчмарке, заранее изучила тестовый корпус — её дообучили на 100M токенах фирмы перед оценкой. Так что это демонстрация того, что 27B способна впитать при доменной настройке, а не оценка стандартных весов Apache-2.0 на нейтральном стенде — и она покрывает одну область, право, а не общее качество. Что это действительно подтверждает, так это посыл того твита: 27B достаточно мала, чтобы запускаться на локальной машине, и достаточно сильна для профессиональной работы, если у неё есть нужные знания.
Второй независимый результат: #9 в общем зачете на Code Arena по WebDev.
Второй независимый результат относится к программированию — и именно из-за него эта страница изменилась 25 августа. Code Arena — это рейтинг веб-разработки от Arena.ai, проект, ранее известный как WebDev Arena, на сайте, ранее известном как LMArena, где пользователи создают реальные приложения с анонимизированными парами моделей и голосуют за результат, который они предпочли бы выпустить. В этом публичном рейтинге Qwen3.8-27B занимает 9-е место в общем зачёте с результатом 1595, будучи единственной моделью своего класса размеров в десятке лучших.
Позиция — независимая часть: она находится на стороннем рейтинге, который может открыть любой. Формулировка вокруг этого — от Alibaba: подача «единственная маленькая модель в топ-10» и сопутствующие позиции взяты из объявления Qwen от 25 августа. Их стоит повторять с такой пометкой. Модель 27B занимает место на шесть позиций ниже гораздо более крупной Qwen3.8-Max (которую в объявлении ставят на #3 в общем зачёте) и значительно опережает модель аналогичного размера Gemma 4-31B (которую в том же объявлении ставят на #80). Дело не в том, что 27B превосходит передовые модели в создании веб-приложений; дело в том, что модель, достаточно маленькая для работы на одном GPU, входит в десятку лучших слепой арены кодинга, где остальные участники — гораздо более крупные модели.
Третий независимый результат: #1 открытая модель на Image-to-WebDev от Arena.ai
Третий независимый результат пришёл 26 августа, и он самый сильный на данный момент для модели такого размера. Image-to-WebDev — это родственная доска для WebDev от Code Arena на Arena.ai — арена, где модели дают скриншот или другое визуальное изображение, и она должна превратить его в работающий веб-интерфейс, а анонимные люди-голосовальщики выбирают результат, который они предпочли бы выпустить. На этом публичном лидерборде Qwen3.8-27B занимает #1 среди открытых моделей и #7 в целом, с заявленным аренным баллом 1,574.
Позиция — это независимая часть: она находится на стороннем лидерборде, который может открыть любой желающий. Заголовок вокруг этого принадлежит Alibaba: в анонсе команды Qwen от 26 августа модель 27B описывается как «на уровне моделей, которые в 100 раз больше неё», в этом тесте — сравнение, которого лидерборд не содержит. И рейтинг предпочтений — это не вердикт о качестве кода: голоса Image-to-WebDev показывают, какой результат человек скорее предпочёл бы выпустить, а не то, является ли HTML безопасным, доступным или поддерживаемым. Что результат действительно устанавливает — так это то, что модель с открытыми весами 27B теперь лидирует во всём открытом поле по превращению картинки в страницу, — именно на этом навыке построена растущая категория продуктов «скриншот в сайт».
Честные пробелы: где всё ещё проигрывает, и методологические оговорки
На фоне фронтира картина лестная, но не односторонняя. Там, где Qwen3.8-27B и Claude Opus 4.6 Max пересекаются, Qwen побеждает в большинстве — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench и весь блок компьютерного зрения. Против Muse Glimmer-30B от Meta, естественного соперника локального класса, он выигрывает вчистую все восемь пересекающихся бенчмарков. Но он всё ещё уступает Claude Opus 4.6 Max на Terminal-Bench 2.1 (73.0 против 78.2), GPQA Diamond (89.2 против 91.3), Humanity's Last Exam (30.8 против 40.0) и NL2Repo-Bench (42.3 против 47.6). Если ваша рабочая нагрузка — это сложнейшие фронтирные рассуждения — фронтирная математика, массово междисциплинарные вопросы — то 27B пока до этого не дотягивает.
Три оговорки, прежде чем цитировать что-либо из этого. Во-первых, таблица карточки модели выше по-прежнему целиком основана на данных Alibaba — для 27B индекса Artificial Analysis пока нет. Сейчас есть три независимых сторонних результата, но каждый из них узок: рейтинг Code Arena измеряет создание веб-приложений по текстовым запросам, рейтинг Image-to-WebDev измеряет превращение скриншота в работающую страницу — оба оцениваются слепым голосованием по анонимизированным результатам, а исследование юридического агента Harvey охватывает единственную область с моделью, обученной для этого теста. Ни один из них не является прогоном штатных весов на универсальном бенчмарке. Во-вторых, карточка модели использует харнесс Claude Code для SWE-bench Pro и QwenSWEBench и судью GPT-4o для Humanity's Last Exam — сравнения с моделями, оценёнными на других установках, изменят цифры. В-третьих, прогон MathVision от Alibaba использовал фиксированный промпт, тогда как конкуренты получили лучший из двух вариантов. Ничто из этого не означает, что результаты неверны; это означает, что они являются потолком, а не полом, пока независимые лаборатории не прогонят модель на нейтральных универсальных бенчмарках.
Что нужно, чтобы запустить это
Qwen3.8-27B — это локальная модель, что меняет смысл слова «производительность»: пропускная способность на вашем собственном оборудовании вместо ценника. Веса BF16 весят примерно 55,6 ГБ; в 4-битном квантовании она помещается на карту с 24 ГБ, например RTX 3090 или 4090. AMD выпустила поддержку Day-0 в день запуска, и её собственные измерения llama.cpp/Vulkan — август 2026 года, усреднённые по трём и более запускам — показали 24,5 токена/с на Ryzen AI Max+ 395 и 51,8 токена/с на Radeon AI PRO R9700 с 32 ГБ, на системах с более чем примерно 24 ГБ переменной графической памяти или VRAM. Тесты сообщества сборки FP8 на NVIDIA GH200 выдержали 10 одновременных запросов с контекстом 262K и временем до первого токена менее 10 мс. Ваши собственные цифры будут отличаться — это чужие GPU, — но суть реальна: это первый релиз Qwen в этом классе, который работает, а не только в обзоре, на одной рабочей станции.
Свободные веса или платный API?
Решение, которое навязывает эта модель, — это то самое решение, что разделяет локальное и облачное размещение: веса ничего не стоят, но ваши GPU не бесплатны. Самостоятельный хостинг означает владение кремнием — одна карта на 24 ГБ, если вы согласны на 4-битное квантование и более медленную генерацию, или что-то мощнее, если нужен полный контекст на 262K токенов в полном качестве. Облачная альтернатива на OrcaRouter стоит $0.33 за миллион входных токенов и $2.40 за миллион выходных, с тем же контекстом на 262K и вводом изображений и видео, а p50 время до первого токена составляет 225 мс за последние семь дней — не нужно покупать GPU и следить за VRAM. Арифметика здесь та же, что и всегда с открытыми весами: нужная вам пропускная способность по токенам, умноженная на стоимость токена, против фиксированной цены карты. При высокой постоянной нагрузке выигрывает самостоятельный хостинг; при пиковой или умеренной нагрузке платить $0.33/$2.40 выгоднее, чем покупать кремний, который в основном простаивает.

Итог
Qwen3.8-27B — самая сильная модель с открытыми весами, которую Alibaba выпустила в этом классе размеров, по собственным данным Alibaba: лучшие показатели в таблице для агентного программирования, использования компьютера и визуальных рассуждений, с окном контекста 262K и весами Apache 2.0. Правильное чтение таблицы результатов условно — каждая цифра в карточке модели сообщается вендором, зависит от конкретного испытательного стенда и пока не воспроизведена независимо, а самые сложные бенчмарки на рассуждения по-прежнему выигрывает фронтир. Если вы решаете, развернуть ли её у себя или вызывать через API, относитесь к таблице бенчмарков как к обещанию, к показателям пропускной способности AMD — как к первому независимому измерению аппаратного обеспечения, к результату Harvey legal-agent — как к первому независимому признаку того, что возможности модели сохраняются за пределами собственных испытательных стендов Alibaba, а к двум позициям в webdev-арене — #9 в общем зачёте Code Arena WebDev и #1 открытая модель в Arena.ai Image-to-WebDev — как к первому независимому подтверждению этих возможностей в рейтингах кода. Мы будем обновлять эту страницу по мере публикации результатов независимыми лабораториями.
