
Boreal против Qwen3.8 Max: строка, которую каждый вендор предпочёл бы, чтобы вы пропустили
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Каждый запуск модели публикует карточку с цифрами, и в каждой карточке есть строка, на которой поставщик предпочёл бы, чтобы вы не задерживались. Qwen3.8 Max, выпущенной 3 августа 2026 года, лестные строки найти легко: она заняла первое место в рейтинге CodeArena по фронтенду с 1 691 баллом, достигла индекса агентности Artificial Analysis в 58, сравнявшись с Claude Opus 5 при высоком уровне усилий — ближайший результат, которого китайская лаборатория достигала на вершине этой таблицы, — и получила оценку GDPval-AA в 1 739 Elo, опередив GPT-5.6 Sol. Строку под ними читать труднее. В том же наборе тестов того же оценщика измеренный уровень галлюцинаций вырос с 23% у предыдущего поколения до 40%, а показатель извлечения из длинного контекста у модели упал на два пункта. Boreal, рекламная видеомодель Creatify, выпущенная 15 сентября 2026 года по цене один цент в секунду, имеет в своей карточке строку того же рода — и она конкретнее, потому что поставщик её опубликовал.
Ни одна из строк не является дисквалифицирующей. Обе информативнее, чем оценки в заголовках, поэтому их стоит сопоставить рядом, а не сравнивать баннеры.
В чём Qwen3.8 Max по-настоящему силён
Победы реальны, и они немалые.
Qwen3.8 Max — это модель смеси экспертов с 2,4 трлн параметров, из которых примерно 95 млрд активны на каждый токен, и это первый Qwen класса Max, о котором Alibaba заявила, что он будет выпущен с открытыми весами — анонсировано на неделю с 10 августа 2026 года, без лицензии и без точной даты; деталь, которую стоит отметить, ведь анонс — это ещё не релиз. Модель обладает контекстным окном на 1 млн токенов при потолке вывода в 131 072 токена и принимает на вход текст, изображения и видео. Последний пункт заслуживает особого внимания именно в этом сравнении: из четырёх передовых текстовых моделей, которые эта серия противопоставляет Boreal, Qwen3.8 Max — одна из лишь двух, которой можно передать готовый видеоклип и задать о нём вопрос.
Цены агрессивны настолько, что это перекроило сегмент. При $2,00 за миллион входных токенов и $6,00 за миллион выходных токенов, при чтении из кэша по $0,25, они на 20% дешевле предыдущего поколения, при этом удваивая максимальную длину вывода. На нашей панели это составляет $2,00 и $6,00, контекст в 1M токенов, p50 времени до первого токена — 10,00 секунд — потолок, о котором сообщает наша система измерений, так что воспринимайте это как «медленно», а не как точное значение — и 183,0 миллиона токенов трафика за последние семь дней.
И строка под ней
Вот та часть, которая не попала в заголовок поста о запуске.
Независимая оценка Artificial Analysis зафиксировала два регресса между Qwen3.7-Max и Qwen3.8 Max. Показатель извлечения информации из длинного контекста снизился на два пункта. Показатель всезнания упал на десять, а измеряемая оценщиком частота галлюцинаций выросла с 23% до 40%. В то же время стоимость одной задачи модели в индексе интеллекта выросла с $0.53 до $1.14 — на задачу уходило примерно 64 хода, тогда как у её предшественника — 14.
Если прочитать их вместе, складывается целостная картина. Qwen3.8 Max — это модель, которая стала лучше в том, что могут измерять бенчмарки с единственным правильным ответом, — код, выполнение агентных задач, решение структурированных задач, — и стала хуже в том, что труднее всего оценить: в понимании того, когда она не знает. Модель, которая больше размышляет и больше галлюцинирует, не противоречит себе. Более длинные цепочки рассуждений создают больше возможностей остановиться на уверенном неправильном ответе, а бенчмарк, который вознаграждает выполнение задачи, не штрафует за это до тех пор, пока у задачи не появится скрытый инвариант, который можно нарушить.
Для покупателя практическое следствие узкое и конкретное. Если вы используете модель для генерации кода или в агентном рабочем процессе, где неверный ответ громко проваливается — тест не проходит, сборка ломается, — регрессии в значительной степени незаметны, а весь смысл — в улучшениях. Если вы используете её для поиска, реферирования или чего-либо ещё, где гладко сформулированный неверный ответ доходит до человека без проверки, то переход с 23 до 40 — вот показатель, который должен определять вашу оценку, а не место в CodeArena.
Худшая строка самого Boreal, опубликованная вендором
Контраст, который делает это сопоставление полезным, заключается в том, что Creatify сделала то, чего не делают большинство поставщиков: она поместила свой самый слабый результат в тот же пост, что и самый сильный.
Boreal протестировали вслепую против его собственной нетронутой базовой модели, зафиксировав промпт, разрешение, количество кадров и seed, на 40 производственных кейсах. Creatify сообщает о 81% предпочтений в пользу Boreal — 25 против 6 при 9 ничьих, критерий знаков p<0,001 — а затем разбивает это среднее значение. Реклама продуктов: 83%. Сцены авторов и UGC: 85%. Видеоклипы, где говорит один человек: 60%.
Последняя цифра — это и есть строка. «Говорящие головы» — один из самых распространённых форматов рекламы прямого отклика, и именно в нём преимущество модели над собственной базой минимально — едва лучше подбрасывания монеты в сравнении с моделью, которую никто не собирался выпускать. Рендеринг заявлен как 1:1 с реальным временем в классе 720p, а сохранение мелких деталей улучшилось на 11,3% при p=0,004, так что совокупная картина действительно положительная. Разбивка просто говорит о том, для какой половины категории была настроена эта модель, и это не та половина, где человек говорит в камеру.
Обратите также внимание на то, какого рода доказательством является каждая из этих строк. Регрессию Qwen3.8 Max обнаружил независимый оценщик, запускавший собственный тестовый стенд. Слабую строку Boreal раскрыл вендор — в тесте, который вендор разработал и провёл. Второе более достоверно как констатация факта и менее информативно как сравнение, потому что в файле Boreal нигде нет независимой цифры.

Контраст спецификации
• Вывод — Boreal: отрендеренное видео класса 720p, текст-в-видео и изображение-в-видео. Qwen3.8 Max: только текст, до 131 072 токенов.
• Ввод — Boreal: текстовый запрос или статичное изображение. Qwen3.8 Max: текст, изображения и видео.
• Цена — Boreal: $0,01 за секунду готового видео. Qwen3.8 Max: $2,00 за 1 млн входных / $6,00 за 1 млн выходных, чтение из кэша — $0,25.
• Контекст — Boreal: не опубликовано. Qwen3.8 Max: 1 млн токенов на входе, 131 тыс. на выходе.
• Задержка — Boreal: заявлена как 1:1 с реальным временем. Qwen3.8 Max: p50 времени до первого токена — 10,00 секунды на нашем стенде.
• Веса — Boreal: проприетарные, принадлежат Creatify и предоставляются ею. Qwen3.8 Max: проприетарная на момент запуска; Alibaba объявила о выпуске с открытыми весами для первой модели Qwen класса Max, при этом ни лицензия, ни дата не подтверждены.
• Доказательства — Boreal: слепое тестирование на 40 кейсах, проведённое вендором, без независимой оценки. Qwen3.8 Max: независимое покрытие бенчмарков, включая две измеренные регрессии, наряду с вендорскими строками 86,1 в OSWorld-Verified и 86,6 в Terminal-Bench 2.1.
Чего стоит регрессия для покупателя
Регрессии в таблицах лидеров обычно считают чем-то незначительным. На самом деле они ближе к самому важному для принятия решений, что публикует бенчмарк, потому что это единственные строки, которые говорят, чем пожертвовал вендор.
Полезный ход — не читать ни одну из карточек, а прогнать обе модели на собственном трафике, — а практическое препятствие в том, что обычно это означает два контракта, два SDK и два биллинговых соглашения, а это уже настолько неудобно, что большинство команд пропускает проверку и покупает, ориентируясь на показатель из заголовка.
Именно это трение и устраняет слой маршрутизации. Qwen3.8 Max есть в нашем каталоге наряду с предыдущим поколением, поэтому сравнить их на вашем собственном наборе для оценки — это изменение одной строки с названием модели, а не цикл закупки, и тот же ключ открывает доступ к остальному каталогу, когда сравнение показывает, что для другой стадии пайплайна вам нужна другая модель. Он предлагается по тарифу провайдера из прайс-листа с наценкой 0%, что здесь важно по конкретной причине: Qwen3.8 Max появился примерно на 20% дешевле поколения, которое он заменил, и такое изменение цен поставщиком должно попадать в ваш счёт тогда, когда оно происходит, а не при следующем продлении.
Boreal отсутствует в нашем каталоге. OrcaRouter не предоставляет модели генерации видео, и ничто здесь не должно восприниматься как утверждение об обратном. Мы предоставляем слой над этим — тексты, варианты, проверку на соответствие требованиям, анализ того, что сработало, — а двум моделям из этой серии, в том числе Qwen3.8 Max, можно передать готовый клип на проверку.

Как прочитать любую из двух карт
Qwen3.8 Max — более выгодная покупка, если ваша работа — это код, агенты или структурированные рассуждения, причём по цене, которая оказалась ниже, чем у его собственного предшественника, а две независимые регрессии — это повод протестировать модель на вашем трафике поиска и суммаризации, прежде чем направлять туда продакшен. Показатель галлюцинаций в 40% — не причина избегать модели; это причина понимать, какие из ваших рабочих нагрузок способны его выдержать.
Boreal — единственный из двух, кто создаёт артефакт, о котором номинально идёт речь в этом сравнении, и это самый дешёвый из заслуживающих доверия вариантов по опубликованным тарифам для короткометражного рекламного видео. Его ограничение связано с конкретным форматом и указано самим поставщиком: 60%-ное предпочтение у клипов с одним говорящим человеком. Протестируйте этот формат до рекламы продуктов, потому что именно там запас меньше всего.
Две вещи изменили бы расклад. Если Alibaba выпустит открытые веса, которые анонсировала для Qwen3.8 Max, изменятся и цена, и жизнеспособность модели, а лицензия, под которой они выйдут, будет важнее даты. А для Boreal первая независимая оценка — вообще любая, от кого угодно — заменила бы вендорский тест из 40 кейсов, который сейчас несёт всю доказательную нагрузку за модель, продающуюся в формат, где бренды необычайно чувствительны к тому, как выглядит их продукт.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
