
GPT-6.1 Sol против Qwen3.8-Max: счёт, а не прайс-лист
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Возьмите одну ночную задачу по обслуживанию репозитория, запускайте её раз в ночь в течение месяца и поставьте на неё GPT-6.1 Sol и Qwen3.8-Max по очереди. Согласно показателям Artificial Analysis v4.3.2 по задачам, GPT-6.1 Sol стоит $21,72 за эти тридцать ночей, а Qwen3.8-Max — $162,27: разница $140,55 в месяц, около $1 690 в год, для задачи, в прайс-листе которой указаны цены за токен: $2,00 на входе и $10,00 на выходе против $2,00 на входе и $6,00 на выходе. Тарифы за миллион токенов на входе отличаются друг от друга в пределах ошибки округления, а китайская модель на 40% дешевле на выходе, но счёт отличается в 7,5 раза. Поставщик выпустил GPT-6.1 Sol 29 сентября 2026 года; Qwen3.8-Max работает с 3 августа 2026 года.
Этот разрыв — не ценовой трюк и не артефакт бенчмарка — это всё, что может сказать данное сравнение, и он происходит от одного числа, которое не показывает вам ни один прайс-лист.
Что представляет собой каждая модель
GPT-6.1 Sol — текущий флагман OpenAI в области рассуждений и программирования, выпущенный через неделю после GPT-6 Sol, на смену которому он приходит, по той же прейскурантной цене $2.00 / $10.00, со ставкой $0.10 за кэшированный ввод и окном контекста на 1 050 000 токенов. Он продаётся для агентной работы: его теги «лучше всего подходит для» в нашей собственной карточке модели указывают на рассуждения, программирование и агентные задачи, и у него оценка качества высшего уровня.
Qwen3.8-Max — флагманская агентная модель Alibaba: закрытая модель, доступная только через API, которая принимает на вход текст, изображения и видео и поддерживает контекст в 1 000 000 токенов. В отличие от меньших релизов Qwen, у этой модели нет опубликованных весов. В Artificial Analysis она набирает 45,42 балла в Intelligence Index, занимая 17-е место из 147 моделей, а её индекс программирования 76,2 ставит её на 9-е место в этой области. Это не слабая модель. Просто позволять ей думать — дорогое удовольствие.
Номер, которого нет в тарифной карте

Artificial Analysis фиксирует 107 730 выходных токенов на задачу для Qwen3.8-Max, из которых 70 830 — токены рассуждений. GPT-6.1 Sol выдаёт 38 128 выходных токенов, 25 190 из них — рассуждения. Китайская модель пишет в 2,8 раза больше токенов, чтобы ответить на тот же вопрос, и пишет их на 40% дешевле за токен.
• Токены вывода на задачу — 38 128 против 107 730; Qwen пишет в 2,8 раза больше
• Из них рассуждения — 25 190 против 70 830
• Стоимость за задачу — $0,724 против $5,409; Qwen стоит в 7,5 раза больше
• Время на задачу — 640 с против 2 152 с; около 11 минут против около 36
• Время до первого токена ответа — 332,0 с против 55,1 с
• Индекс интеллекта — 51,83 против 45,42
• Контекстное окно — 1 050 000 против 1 000 000 токенов
• Поддерживаемые входные данные — текст, изображение и файл против текста, изображения и видео
Выполните умножение — и скидка исчезнет. Модель, которая выдаёт почти в три раза больше токенов по цене на 40% ниже, не обходится дешевле — только на выходе она стоит примерно в 1,7 раза дороже, а измеренный показатель на задачу показывает истинную кратность 7,5, если учесть вход, кэшированные чтения и длину полезного ответа.
Обратите внимание на четвёртую и пятую строки, потому что они указывают в противоположные стороны и вместе объясняют, что такое Qwen3.8-Max. Он выдаёт свой первый токен за 55 секунд, тогда как у GPT-6.1 Sol на это уходит пять с половиной минут, а затем тратит тридцать шесть минут на выполнение задачи, тогда как модель OpenAI завершает её за одиннадцать минут. Это модель, которая сразу начинает говорить и размышляет очень долго. Для чат-интерфейса с потоковым ответом это воспринимается как отзывчивость. А для ночного задания без присмотра это реальное время, за которое вы тоже платите.
Три области, где Qwen3.8-Max действительно впереди
Разрыв в индексе составляет 6,4 пункта по всему набору, и это как раз тот показатель, который цитируют так, будто он единообразен. Это не так, и это расхождение поучительно:
• GPQA Diamond — Qwen3.8-Max 0.9283 против GPT-6.1 Sol, не опубликовано в этом прогоне
• GDPval — 1,671.4 против 1,575.09
• Terminal-Bench 2.1 — 0.8876 против не опубликовано в этом запуске
• AutomationBench — 0.5619 против 0.6487
• SciCode — не опубликовано в этом запуске против 0,5417 у GPT-6.1 Sol
• CritPT — 0.1771 против 0.3171
Qwen3.8-Max побеждает в вопросах по науке уровня выпускника и в выборке профессиональных задач, что является реальным результатом для модели своего поколения и причиной, по которой её индекс программирования занимает 9-е место из 138. Он проигрывает более сложным оценкам, близким к исследованиям, — CritPT с отрывом в 14 баллов — и проигрывает AutomationBench на 8.7, а это та оценка, которая больше всего напоминает работу за компьютером без присмотра. Что из этих двух, по вашему мнению, важнее для вашей рабочей нагрузки, и есть настоящее решение; главный результат в 6.4 балла — это среднее по разногласию, а не вердикт.
Что дают дополнительные токены, а что не дают
Длинные цепочки рассуждений не являются пустой тратой по определению. Модель, которая тратит 70 830 токенов на размышления над сложной задачей, делает то, что более лаконичная модель, возможно, пропускает; и в тех оценках, где Qwen3.8-Max впереди, эти размышления, вероятно, и есть причина. Режим отказа состоит в том, что вы платите за это на каждой задаче, а не только на сложных. Количество токенов рассуждений — это свойство калибровки модели, а не сложности вопроса, и модель, которая чрезмерно обдумывает однострочное извлечение, выставляет вам за это счёт.
Чтобы разобраться, что есть что среди ваших задач, нужно перестать рассматривать выбор модели как глобальный. И это подводит нас к той части, которая представляет собой изменение конфигурации.
Наша собственная карточка модели для GPT-6.1 Sol содержит предоставляемые субъектом числовые показатели: тариф $2.00 / $10.00, окно контекста в 1 050 000 токенов, p50 времени до первого токена, равное 4,54 секунды, и сохранённый блок индекса Artificial Analysis на той же странице, что и тарифы, на которые приложение фактически будет ориентироваться при маршрутизации.

Один ключ, один метр, две модели
Обе модели доступны через единую конечную точку OrcaRouter — один API для более чем 200 моделей, прейскурантная цена провайдера передаётся без наценки (0%). В карточке OrcaRouter для Qwen3.8-Max указана применяемая ставка наряду с контекстным окном на 1 000 000 токенов, входными модальностями текст/изображение/видео и семидневным объёмом в 101,4 млн токенов — это цифры, по которым приложение принимает решения о маршрутизации, рядом с теми, о которых спорит статья. Такая сквозная передача особенно важна именно для Qwen3.8-Max, потому что модель, экономика которой определяется объёмом выходных токенов, — это модель, чей поставщик может в любой момент пересмотреть на неё цену, а сквозной счётчик означает, что изменение дойдёт до вашего счёта в тот день, когда Alibaba его опубликует, а не по графику реселлера.

Более интересное применение слоя маршрутизации здесь — это DSL маршрутизации, который позволяет объединять модели в одном вызове, а не выбирать одну для всего приложения. Разделите ночную задачу: дешёвая модель классифицирует и извлекает данные, GPT-6.1 Sol отвечает за этапы рассуждения и проверки, а Qwen3.8-Max зарезервирована для задач, где её длительное обдумывание и научная сила уровня GPQA действительно меняют ответ. Автоматическое переключение при сбое покрывает остальное — если провайдер деградирует во время выполнения, запрос переносится, а не приводит к сбою всего пакета.
Ни то, ни другое не является причиной выбирать модель. Они — причина того, что вам не нужно делать этот выбор один раз и жить с ним.
Звонок и то, на что стоит обратить внимание
Платите в 7,5 раза больше только там, где рассуждение это оправдывает. На обычной ночной задаче общего назначения GPT-6.1 Sol по $0,724 за задачу — это оправданный выбор по умолчанию, и $1690 в год — реальная сумма. Там, где задача относится к сложной науке или профессиональному рассуждению с проверяемым ответом, показатель Qwen3.8-Max — 0,9283 на GPQA Diamond — оправдывает расход токенов: именно это она делает лучше.
Следить нужно за тем, пересмотрит ли Alibaba цены. Модель с 2,8-кратным числом токенов по цене $2,00/$6,00 оценена так, будто токены — дефицитный ресурс; само поведение модели делает токены изобильными. Если ставка за вывод существенно изменится, арифметика в этой статье изменится вместе с ней, и индикатор pass-through покажет вам это в тот же день, когда это произойдёт.
Сравнение в этой статье3
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
