Титульная карточка для сводки бенчмарков Qwen3.8-27B, демонстрирующая табель бенчмарков с печатью OPEN WEIGHTS и значками для кодирования, пропускной способности, компьютерного зрения, длинного контекста и локального оборудования, с плашками 27B DENSE, 262K CONTEXT и APACHE 2.0.
Guides & Insights

Бенчмарки Qwen3.8-27B: Полная таблица со всеми оговорками

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Qwen/Qwen3.8-27B набирает 73,0 на Terminal-Bench 2.1, 61,7 на SWE-bench Pro, 90,3 на LiveCodeBench v6 и 84,3 на OSWorld-Verified — и каждое из этих чисел получено самой Alibaba. Модель с открытыми весами на 27 миллиардов параметров появилась на Hugging Face 14 августа 2026 года под лицензией Apache 2.0, и за первые две недели получила три независимых сторонних результата: первое место среди моделей с открытыми весами в бенчмарке Legal Agent от Harvey — в исследовании, проведённом юридической ИИ-компанией Harvey и компанией Engram, специализирующейся на технологиях памяти; девятое место в общем рейтинге лидерборда WebDev от Code Arena — единственная модель своего размерного класса в первой десятке, согласно объявлению Alibaba от 25 августа; и, как было объявлено 26 августа, первое место среди моделей с открытыми весами в лидерборде Image-to-WebDev от Arena.ai, с общим 7-м местом и заявленным результатом 1 574. Эта страница — полный сводный обзор со ссылками на источники: все 25 официальных бенчмарков из карточки модели, что изменилось по сравнению с предшественником Qwen3.6-27B, что показал независимый тест пропускной способности от AMD, результаты в Legal Agent и на webdev-аренах, а также какие утверждения пока стоит считать предварительными.

Перед цифрами — небольшой пояснительный текст: «официальный» здесь означает оценку Alibaba, напечатанную в карточке модели на Qwen/Qwen3.8-27B. Это данные от вендора, никем не воспроизведённые. «Независимый» значит, что замер сделан кем-то вне лаборатории — пока сюда входят тест аппаратной пропускной способности, исследование агента в юридической области и места на двух лидербордах по веб-разработке от Arena.ai: Code Arena's WebDev и Image-to-WebDev арене. Бенчмарки, где важна система запуска, отмечены прямо в тексте.

Модель, одна строка на спецификацию

27B плотных параметров (28B с учётом энкодера зрения), 64 слоя, размер скрытого слоя 5120.

• Гибридное внимание — 48 слоев линейного внимания Gated DeltaNet плюс 16 слоев полного внимания, соотношение 3:1 — именно это делает окно из 262K токенов доступным для запуска.

• 262,144 токена нативного контекста, расширяемого до 1,000,000 с помощью масштабирования YaRN.

• Встроенный ввод изображений и видео (вывод текста), веса Apache 2.0, примерно 55,6 ГБ в BF16.

Краткая версия: это модель, призванная взять то, что Alibaba узнала при создании Qwen3.8-Max с 2,4 триллиона параметров, и сжать это в то, что может работать на одном GPU.

Таблица результатов: все бенчмарки из карточки модели

Все приведенные ниже показатели взяты из карточки модели Alibaba от 14 августа, при этом показатель Qwen3.6-27B, который заменяет данная модель, указан в скобках.

Программирование. Terminal-Bench 2.1 (агентное терминальное программирование) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Прогоны SWE-bench Pro и QwenSWEBench использовали испытательный стенд Claude Code, согласно сноске в карточке модели — это стоит учитывать перед сравнением с моделью, оценённой на другом стенде.

Агенты с длинным горизонтом и офисная работа. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / балл 42.9 (10.6 / 27.3).

Рассуждение и знания. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench следование инструкциям 79.5 (69.1). HLE оценивается GPT-4o, согласно карточке.

Зрение и использование компьютера.OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 с CI / 90.0 без (85.1); BabyVision 85.6 с CI / 65.7 без (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). «CI» — это улучшение инференса от Alibaba; разрыв между его включённым и выключенным состояниями — это самое информативное число на карточке о том, сколько очков можно получить за счёт дополнительных вычислительных ресурсов инференса.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

Что на самом деле изменилось по сравнению с Qwen3.6-27B

Все бенчмарки на карточке выросли, но дельты неодинаковы — и именно форма улучшения здесь главное. Улучшения сосредоточены в агентном кодировании и использовании компьютера, а не в воспроизведении знаний:

• DeepSWE 1.1 (агентное кодирование) 13.3 → 42.2, примерно трехкратный рост

• QwenSWEBench 49.3 → 79.0

• Результат Agents' Last Exam: 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 и AndroidWorld 70.3 → 81.9

• BabyVision (с CI) 28.9 → 85.6 — наибольший относительный прирост на карточке

Тем временем GPQA Diamond вырос с 87.8 → 89.2, а RealWorldQA — с 84.1 → 85.9: реально, но незначительно. Это не релиз «умнее во всём». Это релиз, ориентированный squarely на агентов, которые читают экраны, используют инструменты и пишут код на протяжении многих шагов.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

Главное событие после публикации этой страницы — юридическое, а не техническое. Alibaba объявила, что Qw​en3.8-27B является моделью с открытыми весами №1 в бенчмарке Legal Agent от Harvey — это заявление о позиции в рейтинге от самого вендора, так что относитесь к нему как к утверждению Alibaba. За этим результатом стоит исследование, которое проведено не Alibaba: Harvey, компания в сфере юридического ИИ, и Engram, стартап в области ИИ-памяти, создали синтетическую юридическую фирму Calderwood & Harkness на основе более чем 100 млн токенов, охватывающих примерно 10 000 документов и 266 дел, а затем адаптировали Qw​en3.8-27B для неё с помощью параметрической памяти, сжатых заметок и инструмента поиска.

На 250 юридических задачах адаптированная модель 27B показала в среднем 67%, опередив все модели, протестированные в исследовании, включая Claude Opus 4.8. По строгому критерию «всё или ничего» она превзошла Opus 4.8 с результатом 30% против 25%, при этом стоимость составила примерно $0,13 за запрос против $1,32 у Opus 4.8. Эти цифры предоставлены Harvey/Engram и пока не воспроизведены независимо. До обучения на документах самой фирмы та же модель набирала всего 4,7% на вопросах, специфичных для фирмы; после их изучения — 72,6%.

Прочитайте #1 с одной большой оговоркой: модель, занявшая первое место в бенчмарке, заранее изучила тестовый корпус — её дообучили на 100M токенах фирмы перед оценкой. Так что это демонстрация того, что 27B способна впитать при доменной настройке, а не оценка стандартных весов Apache-2.0 на нейтральном стенде — и она покрывает одну область, право, а не общее качество. Что это действительно подтверждает, так это посыл того твита: 27B достаточно мала, чтобы запускаться на локальной машине, и достаточно сильна для профессиональной работы, если у неё есть нужные знания.

Второй независимый результат: #9 в общем зачете на Code Arena по WebDev.

Второй независимый результат относится к программированию — и именно из-за него эта страница изменилась 25 августа. Code Arena — это рейтинг веб-разработки от Arena.ai, проект, ранее известный как WebDev Arena, на сайте, ранее известном как LMArena, где пользователи создают реальные приложения с анонимизированными парами моделей и голосуют за результат, который они предпочли бы выпустить. В этом публичном рейтинге Qw​en3.8-27B занимает 9-е место в общем зачёте с результатом 1595, будучи единственной моделью своего класса размеров в десятке лучших.

Позиция — независимая часть: она находится на стороннем рейтинге, который может открыть любой. Формулировка вокруг этого — от Alibaba: подача «единственная маленькая модель в топ-10» и сопутствующие позиции взяты из объявления Qw​en от 25 августа. Их стоит повторять с такой пометкой. Модель 27B занимает место на шесть позиций ниже гораздо более крупной Qwen3.8-Max (которую в объявлении ставят на #3 в общем зачёте) и значительно опережает модель аналогичного размера Gemma 4-31B (которую в том же объявлении ставят на #80). Дело не в том, что 27B превосходит передовые модели в создании веб-приложений; дело в том, что модель, достаточно маленькая для работы на одном GPU, входит в десятку лучших слепой арены кодинга, где остальные участники — гораздо более крупные модели.

Третий независимый результат: #1 открытая модель на Image-to-WebDev от Arena.ai

Третий независимый результат пришёл 26 августа, и он самый сильный на данный момент для модели такого размера. Image-to-WebDev — это родственная доска для WebDev от Code Arena на Arena.ai — арена, где модели дают скриншот или другое визуальное изображение, и она должна превратить его в работающий веб-интерфейс, а анонимные люди-голосовальщики выбирают результат, который они предпочли бы выпустить. На этом публичном лидерборде Qw​en3.8-27B занимает #1 среди открытых моделей и #7 в целом, с заявленным аренным баллом 1,574.

Позиция — это независимая часть: она находится на стороннем лидерборде, который может открыть любой желающий. Заголовок вокруг этого принадлежит Alibaba: в анонсе команды Qw​en от 26 августа модель 27B описывается как «на уровне моделей, которые в 100 раз больше неё», в этом тесте — сравнение, которого лидерборд не содержит. И рейтинг предпочтений — это не вердикт о качестве кода: голоса Image-to-WebDev показывают, какой результат человек скорее предпочёл бы выпустить, а не то, является ли HTML безопасным, доступным или поддерживаемым. Что результат действительно устанавливает — так это то, что модель с открытыми весами 27B теперь лидирует во всём открытом поле по превращению картинки в страницу, — именно на этом навыке построена растущая категория продуктов «скриншот в сайт».

Честные пробелы: где всё ещё проигрывает, и методологические оговорки

На фоне фронтира картина лестная, но не односторонняя. Там, где Qw​en3.8-27B и Claude Opus 4.6 Max пересекаются, Qw​en побеждает в большинстве — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench и весь блок компьютерного зрения. Против Muse Glimmer-30B от Meta, естественного соперника локального класса, он выигрывает вчистую все восемь пересекающихся бенчмарков. Но он всё ещё уступает Claude Opus 4.6 Max на Terminal-Bench 2.1 (73.0 против 78.2), GPQA Diamond (89.2 против 91.3), Humanity's Last Exam (30.8 против 40.0) и NL2Repo-Bench (42.3 против 47.6). Если ваша рабочая нагрузка — это сложнейшие фронтирные рассуждения — фронтирная математика, массово междисциплинарные вопросы — то 27B пока до этого не дотягивает.

Три оговорки, прежде чем цитировать что-либо из этого. Во-первых, таблица карточки модели выше по-прежнему целиком основана на данных Alibaba — для 27B индекса Artificial Analysis пока нет. Сейчас есть три независимых сторонних результата, но каждый из них узок: рейтинг Code Arena измеряет создание веб-приложений по текстовым запросам, рейтинг Image-to-WebDev измеряет превращение скриншота в работающую страницу — оба оцениваются слепым голосованием по анонимизированным результатам, а исследование юридического агента Harvey охватывает единственную область с моделью, обученной для этого теста. Ни один из них не является прогоном штатных весов на универсальном бенчмарке. Во-вторых, карточка модели использует харнесс Claude Code для SWE-bench Pro и QwenSWEBench и судью GPT-4o для Humanity's Last Exam — сравнения с моделями, оценёнными на других установках, изменят цифры. В-третьих, прогон MathVision от Alibaba использовал фиксированный промпт, тогда как конкуренты получили лучший из двух вариантов. Ничто из этого не означает, что результаты неверны; это означает, что они являются потолком, а не полом, пока независимые лаборатории не прогонят модель на нейтральных универсальных бенчмарках.

Что нужно, чтобы запустить это

Qw​en3.8-27B — это локальная модель, что меняет смысл слова «производительность»: пропускная способность на вашем собственном оборудовании вместо ценника. Веса BF16 весят примерно 55,6 ГБ; в 4-битном квантовании она помещается на карту с 24 ГБ, например RTX 3090 или 4090. AMD выпустила поддержку Day-0 в день запуска, и её собственные измерения llama.cpp/Vulkan — август 2026 года, усреднённые по трём и более запускам — показали 24,5 токена/с на Ryzen AI Max+ 395 и 51,8 токена/с на Radeon AI PRO R9700 с 32 ГБ, на системах с более чем примерно 24 ГБ переменной графической памяти или VRAM. Тесты сообщества сборки FP8 на NVIDIA GH200 выдержали 10 одновременных запросов с контекстом 262K и временем до первого токена менее 10 мс. Ваши собственные цифры будут отличаться — это чужие GPU, — но суть реальна: это первый релиз Qw​en в этом классе, который работает, а не только в обзоре, на одной рабочей станции.

Свободные веса или платный API?

Решение, которое навязывает эта модель, — это то самое решение, что разделяет локальное и облачное размещение: веса ничего не стоят, но ваши GPU не бесплатны. Самостоятельный хостинг означает владение кремнием — одна карта на 24 ГБ, если вы согласны на 4-битное квантование и более медленную генерацию, или что-то мощнее, если нужен полный контекст на 262K токенов в полном качестве. Облачная альтернатива на OrcaRouter стоит $0.33 за миллион входных токенов и $2.40 за миллион выходных, с тем же контекстом на 262K и вводом изображений и видео, а p50 время до первого токена составляет 225 мс за последние семь дней — не нужно покупать GPU и следить за VRAM. Арифметика здесь та же, что и всегда с открытыми весами: нужная вам пропускная способность по токенам, умноженная на стоимость токена, против фиксированной цены карты. При высокой постоянной нагрузке выигрывает самостоятельный хостинг; при пиковой или умеренной нагрузке платить $0.33/$2.40 выгоднее, чем покупать кремний, который в основном простаивает.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

Итог

Qw​en3.8-27B — самая сильная модель с открытыми весами, которую Alibaba выпустила в этом классе размеров, по собственным данным Alibaba: лучшие показатели в таблице для агентного программирования, использования компьютера и визуальных рассуждений, с окном контекста 262K и весами Apache 2.0. Правильное чтение таблицы результатов условно — каждая цифра в карточке модели сообщается вендором, зависит от конкретного испытательного стенда и пока не воспроизведена независимо, а самые сложные бенчмарки на рассуждения по-прежнему выигрывает фронтир. Если вы решаете, развернуть ли её у себя или вызывать через API, относитесь к таблице бенчмарков как к обещанию, к показателям пропускной способности AMD — как к первому независимому измерению аппаратного обеспечения, к результату Harvey legal-agent — как к первому независимому признаку того, что возможности модели сохраняются за пределами собственных испытательных стендов Alibaba, а к двум позициям в webdev-арене — #9 в общем зачёте Code Arena WebDev и #1 открытая модель в Arena.ai Image-to-WebDev — как к первому независимому подтверждению этих возможностей в рейтингах кода. Мы будем обновлять эту страницу по мере публикации результатов независимыми лабораториями.