Титульная карточка обзора Qwen3.8-27B, озаглавленная «Обзор Qwen3.8-27B», с подзаголовком «Открытая 27B-модель — это Opus для дома: проверено на фоне ажиотажа», показывает бейдж открытых весов, бейдж Apache 2.0 и набор иконок GPU и сервера на чистом белом фоне с мягкими голубыми градиентными акцентами.
Guides & Insights

Обзор Qwen3.8-27B: открытая модель на 27B, которая «Опус дома», — проверяем, насколько она соответствует хайпу.

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Qwen3.8 27B — лучшая открытая 27B-модель, которую вы можете развернуть у себя прямо сейчас, и это не особенно близко. Веса вышли 14 августа 2026 года под лицензией Apache 2.0: плотная модель на 27B (28B с учётом энкодера зрения) с нативным контекстом 262K, нативным вводом изображений и видео, а также заявленными вендором показателями агентного кодинга, которые находятся на уровне или выше Cla​ude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. Заявленная цена — ноль: скачайте 55,6 ГБ и запустите. Предостережения тоже реальны — независимое тестирование показывает, что она примерно в три раза медленнее и требует больше токенов, чем её предшественница, каждый бенчмарк на карточке по-прежнему представлен Ali​baba, а контекст 1M доступен только в хостированной версии. Вердикт: если у вас есть GPU от 24 ГБ и вы хотите возможности, близкие к передовым моделям, без счетчика за использование, разворачивайте её у себя — но входите с пониманием, где именно цифры неточны.

Сначала вердикт: стоит ли вам использовать Qwen3.8 27B?

Краткий ответ — да для локальных и частных рабочих нагрузок; подождите сторонних цифр перед принятием решения о закупке. Qwen3.8 27B — редкая модель, где открытые веса являются продуктом, а API — удобством. Поскольку лицензия Apache 2.0, цена за токен навсегда равна нулю, если у вас есть оборудование, и ничто из созданного на её основе не может быть перелицензировано или выставлено задним числом. Вы теряете скорость, проверяемость и удобство.

Если вы уже запускаете Qwen3.6-27B и он вас устраивает, апгрейд реален, но не бесплатен в пересчёте на реальное время. Если вы пришли сюда с запуска Qwen3.8-Max, то это меньшая модель того же поколения, которую можно развернуть самостоятельно, — другой инструмент для другой задачи.

Краткие факты, проверено 15 августа 2026 года

Выпущено — веса стали доступны 14 августа 2026 года на Qwen/Qwen3.8-27B в Hugging Face, зеркально на ModelScope; в отчётах с учётом часовых поясов также указано 13 августа, а релиз вышел примерно через неделю после анонса поколения Qwen3.8.

Лицензия — Apache 2.0: скачивание, изменение, распространение, коммерческое использование, с явным предоставлением патентных прав. Бессрочная.

Параметры — 27B плотная модель (28B с учётом зрительного энкодера), 64 слоя, скрытый размер 5 120, словарь 248 320.

Архитектура — гибридное внимание: 48 слоёв линейного внимания Gated DeltaNet против 16 полных слоёв Gated Attention (соотношение 3:1). Именно поэтому плотная модель на 27B может обрабатывать нативный контекст из 262K токенов.

Контекст — 262 144 токена изначально; расширяется до 1 000 000 через YaRN в размещенной версии.

Вход — нативные изображения и видео наряду с текстом; возвращает текст. Именно из-за визуального энкодера количество параметров составляет 28B.

Мышление — режим рассуждения включён по умолчанию и может быть отключён по запросу; reasoning_effort (низкий/средний/высокий) и preserve_thinking для длительных запусков агентов.

Веса — 55,6 ГБ BF16 safetensors в 18 шардах; также доступны FP8 и GGUF от сообщества.

Приведённые выше характеристики взяты из карточки модели и конфигурации Hugging Face для Qwen3.8 27B, которые были прочитаны сегодня. Заявленные показатели бенчмарков предоставлены Ali​baba; на сегодняшний день ни одна независимая лаборатория их не воспроизвела.

Чем Qwen3.8 27B действительно хорош

Самый веский аргумент — агентная разработка ПО. Alibaba сообщает о трёхкратном росте на DeepSWE 1.1 по сравнению с предыдущей 27B-моделью (42.2 против 13.3) и результате выше, чем у Claude Opus 4.6 Max, на SWE-bench Pro (61.7 против 53.4). Именно эти цифры принесли ей прозвище «Opus at home» — плотная 27B-модель, выполняющая близкую к передовому краю работу по кодингу на оборудовании, которое человек реально может себе позволить.

Benchmark scoreboard card comparing Qwen3.8-27B with Qwen3.6-27B and Claude Opus 4.6 Max: SWE-bench Pro 61.7 vs 53.5 vs 53.4; DeepSWE 1.1 42.2 vs 13.3 vs n/a; LiveCodeBench v6 90.3 vs 83.9 vs 88.8; Terminal Bench 2.1 73.0 vs 63.4 vs 78.2; GPQA Diamond 89.2 vs 87.8 vs 91.3; OSWorld-Verified 84.3 vs 63.9 vs 72.7; QwenSWEBench 79.0 vs 49.3 vs 63.8; CoWorkBench 70.7 vs 61.0 vs 68.2. Footer: all figures Alibaba-reported, not yet independently reproduced.

Три вещи, помимо сырых чисел, делают это оправданной покупкой:

Нативная мультимодальность. Изображения и видео на входе, текст на выходе — документ с диаграммами или видеоинструкция не является отдельной моделью. Показатели визуального мышления (85,6 при включённой функции цепочки рассуждений, 94,6 — визуальная математика, оба заявлены производителем) — вот где визуальный энкодер оправдывает своё существование.

262K нативного контекста.Долгосрочные задачи агентов, большие кодовые базы и многочасовые транскрипты помещаются в одном окне. Гибридная архитектура с линейным вниманием сохраняет стоимость KV-кэша для этого контекста ниже, чем у чистой модели с полным вниманием того же размера.

Бесплатные, постоянные веса. В этом весь смысл категории: закрытая API-модель арендуется; Qwen3.8 27B принадлежит. В 4-битном формате он работает на видеокарте с 24 ГБ (класса RTX 3090/4090), а AMD выпустила поддержку с первого дня (до 24,5 токенов/с на Ryzen AI Max+ 395 и 51,8 токенов/с на Radeon AI PRO R9700, согласно собственному блогу AMD).

Где обзор становится неприглядным: скорость, токены и проверка

Независимое тестирование пока что является стендом одного тестировщика, а не лабораторией — но это лучший сигнал, который у нас есть. Запуск Qwen3.8 27B против Qwen3.6-27B на десяти реальных задачах (оценённых GPT-5.5 через стенд llmcompare) показал, что 3.8 выиграл девять из десяти и набрал в среднем 8.838 против 6.862 — «один из самых впечатляющих приростов интеллекта», которые тестировщик видел. Он также использовал почти в три раза больше токенов и был заметно медленнее; одна задача заняла примерно на 600% больше времени. Так что рост качества реален, и цена в виде затраченного времени — тоже.

Ещё четыре вещи, которые можно поставить ему в вину:

Сторонних бенчмарков пока нет. Все ключевые показатели в этой статье предоставлены Ali​baba по состоянию на 15 августа. Карточка вендора подробна, но воспроизведение независимой лабораторией не проводилось. Если ваше решение зависит от проверенных цифр, подождите их — веса никуда не денутся.

Порог по VRAM реален. BF16 требует GPU класса 80 ГБ. Чтобы уместиться в карту на 24 ГБ, нужно использовать 4-битный режим, а по сообщениям сообщества (обсуждение в комментариях на dev.to через несколько дней после релиза) квантованные сборки «теряют фокус после длинного контекста». Используйте официальные веса, если у вас есть VRAM; квантованные — если нет.

Контекст 1M доступен только в хостинговой версии. Открытые веса ограничены 262K. Заявленная возможность расширения до 1M — это функция облачного хостинга Qwen Cloud, а не то, что локальная копия делает из коробки.

"Beats Opus" нуждается в оговорках. Агентные бенчмарки вознаграждают специфичное для конкретной обвязки поведение, и главный комментарий к анонсу на dev.to выразился прямо: "они не превосходят Opus в реальном использовании". Воспринимайте табло как верхнюю границу в лучшем случае, а не как обещание.

Как это вписывается в семейство Qwe​n 3.8

против Qwen3.6-27B — тот же класс оборудования и контекст 262K, но значительный скачок возможностей ценой скорости и эффективности токенов. Если вы уже используете 3.6 и упираетесь в пропускную способность, оставаться на нём оправдано.

vs Qwen3-Coder-30B-A3B — Coder — это MoE с примерно 3,3 млрд активных параметров, который работает намного быстрее (~90–110 токенов/с). Плотная модель 27B медленнее в расчёте на токен, но наследует агентные преимущества поколения; если показатели 27B в разработке ПО подтвердятся при независимом тестировании, роль Coder-30B уменьшится.

против Qwen3.8-Max — флагман 2.4T MoE — это модель для дата-центра (только через API, около $2/$6 за миллион токенов по опубликованным данным) с контекстом 1M и видео. 27B — развертываемая версия. Они отвечают на разные вопросы.

Стоимость: локально или API — вопрос решён.

Для закрытой модели вы сравниваете цены за токен. Для Qwen3.8 27B предельный токен ничего не стоит на вашем собственном оборудовании — реальная цена — это первоначальные затраты на GPU и ваше время. В 4-битном формате это карта на 24 ГБ; в BF16 — машина класса 80 ГБ. Если вам нужно только оценить модель или у вас нет необходимого оборудования, существует хостинговая опция: OrcaRouter теперь предлагает Qwen3.8 27B с бесплатным тарифом с ограничением частоты запросов, который списывает $0 и возвращает HTTP 429 при превышении лимита, а также платным тарифом по $0,33 за миллион входных и $2,40 за миллион выходных токенов (проверено 15 августа). Хостинговая версия Qwe​n Cloud с контекстом 1M помечена как «скоро появится».

Cost comparison card for Qwen3.8-27B titled 'Self-host vs hosted — the real price': Apache 2.0 weights at $0 license plus your own GPU and electricity; a 4-bit GGUF of roughly 17 GB that fits a 24 GB card; BF16 at 55.6 GB needing an 80 GB-class GPU; a free rate-limited hosted tier at $0 with HTTP 429 past the cap; and a paid hosted tier at $0.33 input / $2.40 output per million tokens with a 262K context window. Footer: prices from the OrcaRouter model page, read August 15, 2026.

Честная постановка вопроса: для модели с открытыми весами провайдер — это удобство, а не зависимость. Бесплатный тариф — самый дешёвый способ решить, стоит ли загрузка 55.6 GB того. Но как только вы решились, главное — это веса, а они бесплатны.

Как на самом деле попробовать это

Самая быстрая оценка — воспользуйтесь бесплатным размещённым тарифом с ограничением частоты запросов; если он отвечает на то, что вам нужно, на этом всё, и это ничего не стоит.

Реальная проверка на вашем оборудовании — скачайте GGUF от сообщества (сборка Q4_K_M весит примерно 17 ГБ и помещается на 24-гигабайтную видеокарту) и запустите её в llama.cpp или Ollama. Передайте Jinja chat-шаблон, иначе модель будет отвечать в тегах thought. Для vision из GGUF также понадобится отдельный файл mmproj. Наше руководство по локальному запуску Qwen3.8 27B проведёт вас через все шаги.

Полная точность — huggingface-cli download Qwen/Qwen3.8-27B на GPU класса 80 ГБ.

Проверьте скачанное — убедитесь, что издателем является организация Qwe​n, и сверьте шарды с crc32.txt; похожие репозитории появлялись до релиза.

Когда этот обзор ошибочен (и кому следует пропустить Qwen3.8 27B)

У вас нет GPU, и вы не будете его арендовать. Бесплатный тариф ограничен по скорости, а платный стоит $0.33/$2.40 за миллион — небольшая API-модель может обслуживать вас дешевле и надёжнее. Эта модель для тех, кто хочет владеть инференсом.

Вам нужно соглашение об уровне обслуживания (SLA). Хостинговая версия появилась всего несколько дней назад; страница модели OrcaRouter, прочитанная сегодня, показывает уровень ошибок 33,3% за последние семь дней и p50 задержки первого токена 225 мс. Это совершенно новая модель, работающая в условиях ранней нагрузки, а не производственный контракт. Тем, кто хостит самостоятельно, следует зафиксировать коммит загрузки и сохранить запасной вариант.

Вам нужны проверенные бенчмарки для принятия решения о покупке. Цифры от вендоров полезны как ориентир, но не являются основанием для закупки. Дождитесь независимого воспроизведения.

Контекста 262K для моделей с открытыми весами недостаточно. Расширение 1M сегодня доступно только в хостинговой версии.

Пропускная способность — ваше узкое место. Массовая суммаризация или большие пакеты навредят: это плотная модель на 27B, которая также расходует примерно в 3 раза больше токенов, чем её предшественница. Для дешёвой массовой работы выигрывает модель поменьше или побыстрее.

У вас видеокарта на 12 ГБ. 2-битные GGUF влезают, но с заметной потерей качества; это не та модель для вас.

Verdict infographic titled 'Use it if / Skip it if' for Qwen3.8-27B: left lane in soft blue labeled 'Use it if' with three items — '24 GB GPU', 'Free Apache 2.0 weights', '262K context + image/video'; right lane in soft gray labeled 'Skip it if' with three items — 'No GPU', 'Need an SLA', 'Need verified benchmarks'.

Суть

Qwen3.8 27B — самая мощная из доступных сегодня открытых 27B-моделей, и она навсегда бесплатна под лицензией Apache 2.0. Если у вас есть GPU с 24 ГБ+ и вы хотите агентный кодинг, контекст 262K и нативный ввод изображений/видео без оплаты по счётчику — берите её. Причины подождать столь же конкретны: вам нужно подтверждение от независимых бенчмарков, SLA, контекст более 262K в модели с открытыми весами или более высокая пропускная способность, чем у плотной 27B-модели. Модель вышла, веса реальны, и цифры хорошие — просто помните, чьи это цифры.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube