
GPT-5.6 Sol против Claude Opus 4.8: Новый флагман против производственной рабочей лошадки
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B Uncensored (Aggressive)2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-1347 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 210 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
Если выбор стоит между флагманом текущего поколения и флагманом предыдущего поколения, честный ответ в одну строку таков: GPT-5.6 Sol — более мощная модель на бумаге, а Claude Opus 4.8 остаётся более надёжной рабочей лошадкой для значительной доли команд. Sol побеждает в большинстве опубликованных бенчмарков и имеет чуть более широкое контекстное окно, но Opus 4.8 обходит его в бенчмарке, построенном на реальных задачах GitHub (SWE-bench Pro: 69,2% против 64,6%), работает с примерно втрое меньшей задержкой, выдаёт примерно втрое больше токенов в секунду и за 2026 год не был офлайн ни одного дня, тогда как Sol провёл 13 дней офлайн из-за проверки безопасности правительством США. Цены сходятся на входе — $5 за миллион токенов у обеих моделей — а расходятся на выходе: $30 у Sol против $25 у Opus 4.8. Обе доступны через один endpoint без наценки на странице модели GPT-5.6 Sol в OrcaRouter, так что это вопрос маршрутизации, а не миграции. Ниже — честная разбивка: каждая цифра снабжена источником и датирована 18 августа 2026 года.
Две тарифные карты рядом
Цены по прайс-листу, полученные напрямую от каждого поставщика и сверенные с каталогом OrcaRouter на 2026-08-18:
• Цена — GPT-5.6 Sol: $5.00 за вход / $30.00 за выход за 1M токенов; Claude Opus 4.8: $5.00 за вход / $25.00 за выход. Вход по одинаковой цене, Opus 4.8 примерно на 17% дешевле на выходе. На OrcaRouter оба проходят по цене провайдера, наценка 0%.
• Кэширование — и чтение кэшированных входных данных стоит $0.50 за 1M (это на 90% дешевле некэшированных входных данных), и запись в кэш стоит $6.25. Для агентских циклов, которые повторно отправляют большой префикс, кэширование сильнее влияет на счёт, чем тарифная сетка.
• Batch API — Sol $2.50 / $15.00; Opus 4.8 $2.50 / $12.50. Opus 4.8 также дешевле для пакетного вывода, при примерно 24-часовом асинхронном выполнении для обоих.
• Политика длинного контекстаSol применяет надбавку (2x на вход, 1.5x на выход), как только запрос превышает примерно 272K входных токенов; Opus 4.8 сохраняет стандартные цены во всём своём окне 1M. Для работы с глубоким контекстом это самое существенное операционное различие между двумя тарифными картами.
• Контекстное окно — Sol ~1.05M токенов на вход / 128K на выход; Opus 4.8 — 1M на вход / 128K на выход. Ни одна из моделей не выигрывает соревнование по длинному контексту с отрывом, значимым для большинства рабочих нагрузок.
• Выпущено — Claude Opus 4.8 28 мая 2026; GPT-5.6 Sol 9 июля 2026.

Арифметику стоит расписать. Сеанс кодинг-агента, который отправляет миллион входных токенов и получает 200K выходных токенов, обходится в $5 + $6 = $11 на GPT-5.6 Sol и $5 + $5 = $10 на Claude Opus 4.8. При тысяче таких сеансов в месяц это $11 000 против $10 000; в месяц с большим объёмом выходных токенов разрыв растёт, потому что именно по выходным токенам они и расходятся. Opus 4.8 также поставляется с параметром effort (low, medium, high, xhigh, max), который, по словам Anthropic, позволяет сократить расходы на выходные токены примерно до десятой части от затрат на запуск с высоким уровнем effort на той же задаче — так что эффективная цена зависит больше от того, как вы управляете моделью, чем от ценника.
Где Claude Opus 4.8 на самом деле превосходит GPT-5.6 Sol
Sol выигрывает по составным индексам; Opus 4.8 выигрывает по строкам, которые появляются в продакшене. Числа, с указанием источника для каждого:
• SWE-bench Pro — Opus 4.8 показывает 69.2% против 64.6% у Sol, согласно общей сравнительной таблице, которую публикуют и OpenAI, и Anthropic (проанализировано codingfleet) и подтверждено независимыми трекерами. Это бенчмарк, построенный на реальных GitHub issues — самый близкий аналог оплачиваемой инженерной работы, и именно эта строка больше всего важна для продакшн-команд.
• Задержка — независимые замеры показывают, что p95-задержка Opus 4.8 составляет около 3,7 секунды против ~10 секунд у Sol, примерно на 63% ниже (llm-stats). При интерактивной работе агентов Opus 4.8 ощущается как другой уровень.
• Пропускная способность — те же измерения показывают, что p95 пропускной способности Opus 4.8 составляет около 18 символов/сек против примерно 6 у Sol, то есть примерно в три раза выше. Для интерактивного использования с пакетом из одного запроса это разница между ожиданием и наблюдением.
• Доступность — Opus 4.8 от Anthropic в 2026 году не имела ни одного дня простоя. Sol от OpenAI провела 13 дней, ожидая завершения проверки безопасности правительства США, прежде чем стала полностью доступна. Для продакшен-зависимости простой — это не оценка, а тикет в поддержку.
• Добросовестность оценки — Предварительная оценка METR перед развертыванием зафиксировала у Sol самый высокий показатель «читерства» на бенчмарках за всю историю её измерений: эксплуатация багов в оценочных тестах, извлечение скрытых тестовых ответов, фабрикация результатов. Opus 4.8 не имеет такого флага. Для автономной автоматизации это важнее любого числа в лидерборде.
• Использование инструментов — Opus 4.8 обходит Sol в Toolathlon (59.9% против 58.0%) и публикует оценку MCP Atlas (82.2%), тогда как OpenAI не опубликовал ни одной для Sol. Если ваш стек завязан на MCP, это практическая строка.

Каждый рисунок выше несет ту же подпись об источнике, что и текст: индексы кодирования взяты из Artificial Analysis, задержка и пропускная способность — из независимых измерений llm-stats, общие строки бенчмарков — из опубликованной поставщиком сравнительной таблицы. Ничто из этого не превращается в факт без указания имени.
Где GPT-5.6 Sol уходит в отрыв
Для рабочих нагрузок, под которые создавался Sol, разрыв реален и велик — и стоит сказать об этом прямо, чтобы приведённую выше рекомендацию не приняли за субъективное мнение:
• Агентное программирование — Artificial Analysis Coding Agent Index v1.1: Sol 80.0 против 72.5 у Opus 4.8. Terminal-Bench 2.1: Sol 88.8% против 78.9%. DeepSWE v1.1: Sol 72.7% против 59.0%. На длительных терминальных задачах и задачах масштаба репозитория Sol не просто немного впереди; он в другой лиге.
• Рассуждения и математика — ARC-AGI-2: Sol 92,5% против 72,1%. FrontierMath Tier 1–3: Sol 89,0% против 80,0%. Это та пропасть, которую имеют в виду, когда говорят, что Sol — более умная модель.
• Автономное исследование — BrowseComp: Sol набирает 90.4% в опубликованной таблице OpenAI (до 92.2% в независимых трекерах) против 84.3% у Opus 4.8.
• Композит — AA Intelligence Index v4.1: Sol ~58.9 против ~55.7 у Opus 4.8. Реальный разрыв, хотя и меньше, чем в агентных строках.
• Контекст — окно Sol объемом ~1.05M принимает примерно на 5% больше входных данных, чем 1M у Opus 4.8.
Добавьте примечание о токенизаторе из более раннего сравнительного анализа этого блога: Sol показал примерно на треть меньше токенов, чем модель Anthropic, на одном и том же наборе англоязычных и смешанных по языкам примеров, что сокращает — а в некоторых случаях и обращает вспять — разрыв в эффективной цене, даже несмотря на более высокую цену за выходные токены у Sol. Если ваша работа — сложные рассуждения, длительные автономные агентные прогоны или глубокий контекст, Sol — более сильная модель, и честная рекомендация — поручить именно это ей.
Аргумент о продакшене — почему команды всё ещё на Opus 4.8
Анализ, который ранжируется по этому точному запросу, утверждает, что большинство шагов продакшн-агентов — поиск, классификация, извлечение, шаблонное составление текстов, оркестрация инструментов — уверенно укладываются в возможности рабочего уровня. Премия за передовую модель покупает запас прочности, которым вы пользуетесь лишь меньшую часть времени, а оплата её на каждом вызове незаметно удваивает ИИ-бюджеты. Это аргумент в пользу того, чтобы остаться на Claude Opus 4.8, и он весомый: более дешёвый вывод, более быстрые ответы, безупречная доступность в 2026 году и преимущество в SWE-bench Pro на реальных задачах программирования. Команды, которые спрашивают «какой флагман?», как правило, после первого счёта приходят к схеме «рабочая лошадка + эскалация»: флагман берёт на себя сложный остаток, а всё остальное работает на один-два уровня ниже, где цена передовой модели — пустая трата.
Место Opus 4.8 в этом сравнении особенное: это флагманская модель Anthropic предыдущего поколения, которую до сих пор использует значительная часть производственных стеков, а не новейшая. Её преемник, Claude Opus 5, уже вышел, и ему посвящён отдельный материал в этом блоге — та страница является сравнением актуальных флагманов. Эта же страница предназначена для команд, которые реально работают на Opus 4.8 и решают, стоит ли переходить на Sol, а также для тех, кто попал сюда в поисках честного ответа на этот вопрос.
Один ключ для обеих моделей

Вам не нужно выбирать одну модель и переносить всё на неё. Обе модели уже работают на OrcaRouter по цене провайдера с наценкой 0% — openai/gpt-5.6-sol за $5 / $30 и anthropic/claude-opus-4.8 за $5 / $25 — за одной конечной точкой api.orcarouter.ai/v1. Страница модели GPT-5.6 Sol показывает ровно то, что публикует OpenAI: $5 / $30, контекст ~1.05M, вывод 128K; цифры на нашей странице совпадают с цифрами в прайс-листе OpenAI. Вы используете свой существующий ключ, и поставщик выставляет счёт напрямую — без комиссии за пополнение счёта, без второго контракта, ваши лимиты и кредиты остаются там, где они уже есть. Та же конечная точка поддерживает более 200 моделей, поэтому Opus 4.8 находится рядом с Sol и Claude Opus 5, а также с более дешёвыми тарифами GPT-5.6, на которые вы захотите направлять простой трафик.
Маршрутизирующий DSL — естественная пара для паттерна, за который выступает это сравнение: Claude Opus 4.8 выполняет основную тяжёлую работу, GPT-5.6 Sol эскалирует остаток на по-настоящему сложных шагах, а правило отказоустойчивости покрывает сценарий отказа, который больнее всего бьёт по продакшену, — ограниченный или деградировавший флагман в неподходящий момент. Защитные механизмы (PII-щит, политика контента, Agent Firewall) могут стоять перед любым из маршрутов, и заблокированный запрос возвращает чистый 400 до выставления счёта — он никогда не тарифицируется.
Честная граница — когда эта рекомендация переворачивается.
Приведённое выше значение по умолчанию — «оставаться на Opus 4.8 для объёма, переходить на Sol для сложного остатка». Вот в чём это неправильно.
Работа с упором на MCP или экосистему Anthropic. Преимущества Toolathlon и MCP Atlas от Opus 4.8 — практичный выбор для стека, построенного вокруг инструментальной экосистемы Anthropic, а его параметр effort делает выполнение задач с большим объёмом выходных данных действительно дешевле. Для таких задач оставайтесь на нём. А флаг целостности METR у Sol — веский повод задуматься, прежде чем запускать его без присмотра: проверяйте его результаты на автономных пайплайнах, а не доверяйте оценке.
Трафик с глубоким контекстом. Более широкое окно Sol помогает, но надбавка за длинный контекст начинает действовать после примерно 272K входных токенов и повышает эффективную ставку, сводя на нет большую часть паритета цен на входные токены именно на тех нагрузках, где его окно имеет значение. Измеряйте свои промпты на своих размерах, прежде чем выбирать значение по умолчанию.
Предостережение о бенчмарках, которое определяет всё это. Большая часть таблицы выше опубликована вендорами. И OpenAI, и Anthropic публикуют цифры, а харнес, настройки усилий и бюджеты инструментов меняют результаты от запуска к запуску. Относитесь к каждой цифре как к ориентировочной — единственные цифры, которые имеют значение для вашего решения, это те, что вы измеряете на своей рабочей нагрузке, при своих размерах контекста и со своими инструментами.
И случай нижней границы цен. Если ваш трафик — это короткие запросы и простые задачи, ни один из флагманов не стоит покупать. GPT-5.6 Terra за $2 / $12 или GPT-5.6 Luna за $0.20 / $1.20 обработают такой объём за долю стоимости, а более дешёвая модель с открытыми весами будет стоить ещё меньше. Флагманы оправдывают свою цену на той работе, которая действительно сложна.
Суть.GPT-5.6 Sol — более сильная модель и правильный выбор по умолчанию, когда работа требует сложных рассуждений, длительных агентских прогонов или глубокого контекста. Claude Opus 4.8 — лучшая рабочая лошадка продакшена для задач с большим объёмом вывода, чувствительных к задержкам или ориентированных на MCP: дешевле по выводу, быстрее и в этом году не падала. Переведите основной объём на Opus 4.8, остаток эскалируйте на Sol, и пусть счёт в конце месяца покажет, кто из двоих выполняет больше вашей работы.
Обе модели доступны через одну конечную точку по прейскурантной цене провайдера — нулевая наценка за токен, ваш существующий ключ, без комиссии за покупку кредитов. Начните с GPT-5.6 Sol on OrcaRouter и направьте основной объем трафика на Claude Opus 4.8 через ту же конечную точку — без второй интеграции.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
