
Qwen 3.8 против Claude Opus 4.8: Недорогое масштабирование встречает специалиста по рассуждениям
- metaНОВИНКАMeta: Muse Spark 1.22026-08-05$1.25 / $4.25 за 1 млн токенов · 819 tok/s
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 за 1 млн токенов · 56 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3150Интеллект69Кодинг
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 198 tok/s
- orcaНОВИНКАOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicНОВИНКАAnthropic: Claude Opus 52026-07-2461Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2150Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1651Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1557Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0854Интеллект72Кодинг
- tencentTencent: Hy32026-07-0641Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3053Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1651Интеллект69Кодинг60Математика
Alibaba представила Qwen3.8-Max в Шанхае 19 июля 2026 года как модель с 2,4 триллиона параметров, созданную для масштабности и тщательности. Что касается Anthropic, её Claude Opus 4.8 — совсем другой зверь: флагманская модель глубокого рассуждения премиум-класса, к которой команды обращаются, когда задача требует множества шагов и неверный ответ обходится дорого.
В течение двух недель честно провести это сравнение было трудно, поскольку у Qwen не было ни опубликованной цены, ни опубликованных бенчмарков.Это изменилось 3 августа 2026 года, когда Qwen3.8-Max вышел в общий доступ с тарифом $2 / $6 за миллион токенов и полной таблицей бенчмарков. Философский вопрос остаётся прежним — сырой масштаб и открытость против надёжности рассуждений — но теперь по обе стороны есть цифры.
Заметка для разработчиков — самый быстрый способ решить подобный вопрос — прогнать оба варианта на своих рабочих процессах. OrcaRouter предоставляет доступ к 200+ моделям через один эндпоинт, совместимый с OpenAI, так что вы можете сравнить Qwen 3.8 Max и Opus 4.8 на одной и той же задаче, не подключая два SDK.
TL;DR вердикт. Opus 4.8 остаётся специалистом по рассуждениям: по итогам аудита он входит в верхний кластер Artificial Analysis Intelligence Index, и ему доверяют в длинных агентных цепочках, где уверенно неверный ответ стоит дороже, чем счёт за токены. Его слабости — стоимость и многословность: AA оценивает его средневзвешенную ставку примерно в $3,85/1M при максимальных усилиях, и он расходует много токенов: Grok 4.5, по сообщениям, выполняет сопоставимые задачи, используя примерно в 4 раза меньше выходных токенов. Qwen3.8-Max теперь отвечает тем, чего ему не хватало в июле: реальной низкой ценой $2 / $6 фиксированно за 1M токенов, кэшированным входом по $0,25 и таблицей бенчмарков вендора, которую возглавляют Terminal-Bench 2.1 86.6 и OSWorld-Verified 86.1. Он также проявил подлинное агентное усердие в единственном доступном стороннем тесте. Но его всё ещё не оценил ни один независимый эксперт. Opus — для рассуждений, которым нужно доверять; Qwen — для работы, где важны бюджет и тщательность.
Основные выводы
• Qwen3.8-Max доступен в GA с 3 августа 2026 года по цене $2 / $6 за 1 млн токенов, единая ставка для полного контекста в 1 млн токенов — реальный тариф, заменяющий временную июльскую скидку на превью.
• Opus 4.8 существенно дороже: Artificial Analysis оценивает его смешанную стоимость примерно в $3.85/1M при максимальных усилиях, и он токеноёмкий — по сообщениям, примерно в 4 раза больше выходных токенов на задачу, чем Grok 4.5, поэтому длительные агентные прогоны усугубляют разрыв.
• Источники расходятся в точном значении AA для Opus 4.8. На AA v4.1 Kimi K3 (57.1) указан сразу над ним, поэтому достоверная формулировка — «верхняя группа, ниже лидеров Fable 5 / GPT-5.6 Sol», а не единая точная оценка.
• Qwen теперь сообщает о своих агентных показателях (по собственной отчетности): Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (у предшественника — 40.7). Ни один из них не был независимо проверен.
• Один сторонний агентный показатель Qwen благоприятен: против Kimi K3 он показал 354 цитаты репозиториев против 274, использовал 22 запроса к шлюзу против 53, и зафиксировал 0 неудачных вызовов инструментов против 2 — при этом набрав 80/100 против 83 у Kimi.
• Открытость окончательно расходится: Qwen обещает открытые веса в течение недели плюс Qwen3.8-27B с ~17 ГБ видеопамяти; Opus 4.8 закрыт и доступен только через API.
Примечание о точности: все показатели качества Qwen3.8-Max приведены по данным Alibaba и не проверены третьими сторонами. Показатели Opus 4.8 приписываются Artificial Analysis и названным источникам и могут отличаться от собственных данных Anthropic; поскольку трекеры расходятся в точном значении индекса Opus, мы указываем его относительную позицию, а не одно конкретное число. Цены на Qwen указаны по тарифной карте GA и заменяют июльскую превью-скидку.
Характеристики и цена, бок о бок
Вот конкретные данные, каждая цифра привязана к своему источнику.
• Производитель / статус — Qwen3.8-Max: Alibaba; GA (3 августа 2026 г.); Claude Opus 4.8: Anthropic; GA-флагман глубокого рассуждения
• Архитектура — Qwen3.8-Max: суммарно ~2.4T, разреженный MoE (активные параметры всё ещё не раскрыты); Opus 4.8: закрытая; архитектура не раскрыта
• Контекстное окно — Qwen3.8-Max: 1M токенов (983,616 с мышлением; максимальный вывод 131,072); Opus 4.8: флагманская модель с длинным контекстом
• AA Intelligence Index — Qwen3.8-Max: Всё ещё не оценено; Opus 4.8: Топ-кластер, ниже лидеров (Artificial Analysis; Kimi K3 с результатом 57.1 указан чуть выше)
• Основная сила — Qwen3.8-Max: масштаб, тщательность, экономичность длинного контекста; Opus 4.8: глубокое многошаговое рассуждение + агентная надёжность
• Заявленные вендором агентные показатели — Qwen3.8-Max: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (заявлено Alibaba); Opus 4.8: н/д — репутация зарабатывается в продакшене
• Цены (вход / выход) — Qwen3.8-Max: $2.00 / $6.00 за 1M, фикс.; кэшированный ввод $0.25; Opus 4.8: Premium — AA blended ~$3.85/1M при максимальном усилии
• Эффективность использования токенов — Qwen3.8-Max: многословен; IFBench 82.8 — его самый слабый заявленный показатель; Opus 4.8: токенозатратен — ~4× больше выходных данных, чем у Grok 4.5 (по заявлению)
• Открытые веса — Qwen3.8-Max: Обещано в течение недели (лицензии пока нет); Opus 4.8: Нет — закрытый / только API
Две вещи задают рамки сравнения, и обе изменились 3 августа.
Во-первых, разница в стоимости теперь измерима, а не умозрительна. В июле преимущество Qwen было скидкой, под которую нельзя было заложить бюджет. Теперь это ставка, и форма разрыва необычна: Opus дороги требует много токенов, а значит, эти два фактора перемножаются. Если Opus генерирует в четыре раза больше выходных токенов для той же задачи и берет надбавку за каждый токен, длительный агентный прогон может стоить в разы больше, чем предполагают заявленные тарифы. Выходная ставка Qwen $6, контекст 1M без надбавок и кэшированный ввод $0.25 бьют именно по этому умножению.
Во-вторых, колонка бенчмарков Qwen больше не пуста — и наконец-то часть её напрямую релевантна. Вся заявка Opus 4.8 — надёжность агентов, и Alibaba теперь опубликовала агентные показатели: Terminal-Bench 2.1 — 86,6 для работы с оболочкой, OSWorld-Verified — 86,1 для управления реальным GUI. Они измеряют именно то, что нужно. Оговорка касается происхождения, а не релевантности: Alibaba получила их на собственном стенде, и ни одна третья сторона их не воспроизвела. Между тем репутация Opus опирается на то, что сложнее опубликовать, но, возможно, ценнее — на длительное использование в продакшене многими командами, что является свидетельством, которое не может сфабриковать ни одна таблица вендора.

Надежность рассуждений vs сырая тщательность
Интересное различие между этими двумя заключается не в качестве одноразового выполнения, а в том, как они ведут себя, когда задача состоит из множества шагов и предполагает использование реальных инструментов.
Репутация Opus 4.8 строится на агентной надёжности: длинных цепочках рассуждений, в которых модель отслеживает контекст, находит выход из тупиков и возвращает ответы, на которые можно опираться без перепроверки каждого шага. Именно за это свойство команды платят повышенную цену, потому что в продакшене стоимость уверенно неверного многошагового ответа намного превышает счёт за токены. Обратная сторона в том, что Opus тратит много токенов — Grok 4.5, по сообщениям, выполняет сопоставимые задачи примерно с 4× меньшим количеством выходных токенов — поэтому его надёжность сопряжена с реальными постоянными издержками.
Qwen 3.8 отвечает с иной силой: абсолютной тщательностью, и теперь на это есть сторонний показатель. В тесте на понимание архитектуры, проведённом Trilogy AI (Qwen3.8-Max против Kimi K3), Qwen набрал 80/100 против 83 у Kimi — уступив в заголовке, — но был более прилежным агентом, выдав 354 ссылки на репозитории против 274 у Kimi, использовав 22 запроса к шлюзу против 53 и зафиксировав 0 неудачных вызовов инструментов против 2. Обе модели пришли к одному и тому же основному архитектурному выводу; Qwen просто проделал больше работы по обоснованию, чтобы к нему прийти, с более чистым использованием инструментов.
Результат с нулём неудачных вызовов инструментов — самый обнадёживающий агентный сигнал, который есть у Qwen, ведь именно неудачные вызовы инструментов ломают продакшн-агентов. Но это лишь один тест, одна задача и один оценщик — и это ни в какое сравнение не идёт с доказательной базой, стоящей за репутацией Opus.
Платой за основательность Qwen стали задержка и токены. Рецензенты эпохи предварительного просмотра находили её «очень хорошей и очень медленной» — 30+ минут на сборку веб-сайта, более часа на симуляцию покера, самая медленная модель, которую тот рецензент использовал. Теперь действуют две оговорки. Это была превью-инфраструктура, а обслуживание GA — это другая система; 7-дневная телеметрия OrcaRouter в настоящее время показывает p50 время до первого токена 1,64 секунды, хотя TTFT и сквозная пропускная способность при часовых сборках — разные величины. Этот результат заслуживает повторной проверки, а не повторения.
Стоит также назвать одну структурную проблему: самый слабый заявленный показатель Alibaba — это IFBench 82.8, то есть следование инструкциям при ограничениях. Для агентных конвейеров, которые разбирают выходные данные модели на каждом шаге, модель, которая выходит за рамки и добавляет незапрошенную работу, является обузой, какой бы тщательной она ни была. Именно здесь дисциплина Opus оправдывает свою цену.

Стоимость на практике: где 4× разрыв в токенах дает о себе знать
Возьмём многошаговый прогон агента: 80 000 входных токенов контекста и — это ключевая переменная — разные объёмы вывода, поскольку Opus, по сообщениям, выдаёт примерно в 4 раза больше.
• Qwen3.8-Max при 8 000 выходных токенах: 0,08M × $2 = $0,16, плюс 0,008M × $6 = $0,048. ≈ $0,21 за запуск.
• Opus 4.8 по смешанной ставке ~$3.85/1M на 80,000 входных + ~32,000 выходных токенов (4× количество токенов): примерно $0.43 за запуск при смешанной тарификации — и значительно больше, если считать входные и выходные токены отдельно по тарифам премиум-уровня.
• При 3 000 запусках в день: Qwen ≈ $630/day; Opus ≈ $1,290/day или выше.
• При кэшированном вводе Qwen по цене $0.25/1M в стабильном контексте, стоимость его запуска снижается до ≈ $0.07 — примерно в 6 раз дешевле, чем Opus.
Честный противовес — это тот, который всегда применим к сравнениям с Opus: если Opus решает задачу с одной попытки, а более дешёвая модель требует двух попыток плюс проверки человеком, то более дешёвая модель на самом деле не дешевле. Многословность Opus — отчасти механизм его надёжности: он рассуждает вслух, а это стоит токенов. Вопрос для вашей рабочей нагрузки: платите ли вы за обдумывание, которое вам нужно. В задачах с высокой ценой ошибки и небольшим объёмом рассуждений — вероятно, да. При высокообъёмном анализе, где вы всё равно проверяете результаты на следующем этапе — вероятно, нет.
Открытость и вопрос об on-premise
Opus 4.8 закрыта и доступна только через API, навсегда. Qwen3.8-Max, возможно, нет — веса обещают в течение недели, — но флагман не является реалистичной целью для самостоятельного хостинга: примерно 1,2 ТБ в 4-битном формате против примерно 141 ГБ на один H200 означает восемь или более топовых ускорителей, а поскольку количество активных параметров до сих пор не раскрыто, вы не можете оценить пропускную способность, которую обеспечит такое вложение. Кроме того, текста лицензии пока нет, поэтому коммерческое использование формально не определено.
Одновременно анонсированная Qwen3.8-27B — это практичный релиз для команд, которым важнее контроль, чем сырая производительность. Она также выходит с открытыми весами и, по сообщениям, ей требуется примерно 17 ГБ видеопамяти — это одна топовая видеокарта. Если вы сравниваете с Opus, потому что вам нужны рассуждения внутри собственной сети, 27B — это модель, которую стоит оценить; открытость флагмана 2.4T в основном теоретическая.
Часто задаваемые вопросы
Qwen 3.8 лучше, чем Claude Opus 4.8?
Не на основании имеющихся доказательств. Opus 4.8 входит в верхний кластер проверенного индекса Artificial Analysis Intelligence Index и подтверждён в глубоких агентных рассуждениях в продакшене. У Qwen3.8-Max сильные заявленные показатели (Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1) и один положительный сторонний агентный тест, но независимых оценок нет. Qwen выигрывает по цене; Opus — по доказанности и надёжности рассуждений.
Почему число в бенчмарке Opus 4.8 описано так расплывчато?
Поскольку трекеры действительно конфликтуют. На AA v4.1 Kimi K3 (57.1) указан чуть выше Opus 4.8, что помещает Opus в верхний кластер, но ниже лидеров Fable 5 / GPT-5.6 Sol — однако разные источники сообщают об этом по-разному, поэтому цитировать одно точное число было бы вводящим в заблуждение. Его относительное положение — это надёжное утверждение.
Насколько Qwen 3.8 дешевле, чем Claude Opus 4.8?
Значительно, и разрыв увеличивается на длинных дистанциях. Qwen3.8-Max стоит $2 / $6 за 1M по фиксированной ставке, с кэшированным вводом по $0.25. Artificial Analysis оценивает смешанную стоимость Opus примерно в $3.85/1M при максимальных усилиях, а Opus, по сообщениям, потребляет примерно в 4 раза больше токенов, чем Grok 4.5 — так что ценовой разрыв умножается с объёмом вывода. При типичном многошаговом прогоне Qwen оказывается примерно в 2–6 раз дешевле в зависимости от кэширования.
Qwen 3.8 Max вышла из предварительной версии?
Да, 3 августа 2026 года. У него есть опубликованный прайс-лист и совместимый с OpenAI и DashScope эндпоинт, поэтому июльская кампания кредитов Qoder и подача со скидкой 90% больше не описывают, как он продаётся.
Надёжен ли Qwen 3.8 для агентной работы?
Ранние сигналы обнадеживают, но их мало. Alibaba сообщает о результатах Terminal-Bench 2.1 — 86.6 и OSWorld-Verified — 86.1, а в одном стороннем тесте она зафиксировала ноль неудачных вызовов инструментов против двух у конкурента. С другой стороны, ее самый низкий самостоятельно заявленный показатель — IFBench 82.8 по следованию инструкциям, и тестировщики предварительной версии неоднократно наблюдали, как она выходит за рамки — реальный риск для конвейеров, которые анализируют вывод каждого шага.
Могу ли я разместить Qwen 3.8 на собственном сервере, чтобы избежать премиальной цены Opus?
Реалистично говоря, это не флагман. Веса обещают в течение недели, но лицензия не опубликована, а при ~1,2 ТБ в 4-битном формате понадобится восемь или более GPU класса H200. Одновременно анонсированная Qwen3.8-27B, которой, по сообщениям, нужно ~17 ГБ видеопамяти, — жизнеспособный вариант. Opus 4.8 закрыт, так что пути для самостоятельного хостинга там нет вообще.
Что мне использовать сегодня?
Opus 4.8 — для критически важных задач рассуждения или агентной производственной работы, которой можно доверять, где неверный многошаговый ответ обходится дорого. Qwen3.8-Max — для работы, чувствительной к затратам и ориентированной на тщательность, особенно для анализа длинных контекстов: фиксированная ставка 1M и кэшированный ввод за $0,25 делают экономическую выгоду неоспоримой.
Суть
Qwen 3.8 против Claude Opus 4.8по-прежнему представляет собой противопоставление философий, но экономика больше не гипотетична. Qwen3.8-Max вышел в GA с реальными ценами, которые значительно занижают цену Opus, и разрыв увеличивается, потому что Opus одновременно имеет премиальную цену и требует много токенов. Qwen также опубликовал агентные показатели, которые напрямую бьют по родной территории Opus, и его единственный сторонний агентный тест показал более чистое использование инструментов, чем у сильного конкурента.
Opus сохраняет преимущество там, где он всегда был силён: подтверждённая аудитом позиция в верхнем кластере и производственный послужной список надёжных многошаговых рассуждений, который не заменит ни одна таблица от вендора. Оставшиеся пробелы Qwen — хорошо знакомые: нет независимой оценки, не раскрыто количество активных параметров, пока нет лицензии, а также собственная заявленная слабость в следовании инструкциям, что критично именно для агентных пайплайнов, ради которых выбирают Opus. Следите за двумя событиями: первым независимым результатом Intelligence Index и выходом весов с лицензией. До тех пор Opus — модель, которой доверяют дорогие решения, а Qwen 3.8 — та, на которую направляют основной объём, протестировав её на своих собственных рабочих процессах.

Сравнение в этой статье4
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
