
GPT-6.1 Sol против GPT-5.6 Sol: четыре с половиной индексных пункта, вдвое меньший счёт, две регрессии
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
OpenAI выпустила GPT-6.1 Sol 29 сентября 2026 года, через одиннадцать недель после GPT-5.6 Sol, вышедшей 9 июля 2026 года в качестве флагмана предыдущего поколения. Обе модели всё ещё продаются, обе по-прежнему доступны для вызова, а разница между ними в нейтральном рейтинге составляет 4,8 балла — 51,8 против 47,0 в Intelligence Index от Artificial Analysis, причём оба результата получены при максимальном усилии рассуждения на одном и том же наборе из десяти тестов. Разница в цене куда больше, чем разница в баллах: $0,72 за выполненную задачу индекса против $1,99 и $2,00/$10,00 за миллион токенов против $4,00/$20,00. Это короткая версия. Длинная версия такова: обновление неравномерно, и два теста из набора даже откатились назад.
Что представляет собой каждая модель и что пришло на смену чему
GPT-5.6 Sol был вершиной линейки 5.6 — закрытая модель, доступная только через API, с контекстным окном в 1 050 000 токенов, потолком вывода в 128 000 токенов, поддержкой ввода текста, изображений и файлов и линейкой рассуждений от none до max. OpenAI описывала её как уровень, созданный для самой сложной работы: длительные агентные рабочие процессы, многофайловая разработка ПО, глубокие рассуждения — и цена соответствовала этому: $4,00 и $20,00 за миллион токенов, кэшированный ввод — $0,40, запись в кэш — $5,00. Свыше 272 000 входных токенов цена менялась на $8,00 и $30,00, а также имелся пакетный уровень за $2,50 и $15,00.
GPT-6.1 Sol — это модель среднего уровня в поколении, пришедшем после: ниже GPT-6 Astra, выше GPT-6 Luna, и теперь именно на неё OpenAI указывает разработчикам, чувствительным к стоимости. Она сохраняет окно в 1 050 000 токенов и лимит вывода в 128 000 токенов, продлевает дату отсечки знаний с 20 апреля до 30 апреля 2026 года и сокращает лестницу усилий с шести ступеней до пяти — low, medium (по умолчанию), high, xhigh, max. Значение none, которое принимал GPT-5.6 Sol, теперь возвращает ошибку, и руководство OpenAI по миграции прямо указывает, что замена — это low, а не тихое повышение.
На этом стоит задержаться, потому что это единственное изменение в релизе, которое стоит денег, а не экономит их. Пайплайн, который обращался к none, чтобы получить дешёвый, быстрый вызов без рассуждений, больше не имеет такой конфигурации — ни в одном из семейств моделей. Самая дешёвая ступень в GPT-6.1 Sol — это ступень с рассуждениями, а токены рассуждений тарифицируются как выходные токены, независимо от того, видите вы их или нет.
Лестница, перекладина за перекладиной
Независимый совет публикует оценку и стоимость запуска для каждой настройки усилий в обеих моделях, что превращает прямое сравнение в нечто более полезное, чем одно-единственное сопоставление. Выстроенные при эквивалентных настройках:
• Шкала усилий, GPT-6.1 Sol — макс. 51,8 при $0,72 за задачу индекса; xhigh 51,0 при $0,39; высокий 50,2 при $0,32; средний (по умолчанию) 47,8 при $0,21 • Скорость вывода — 59,7 токенов в секунду для GPT-6.1 Sol против 87,8 для GPT-5.6 Sol
• Время до первого чанка — 332 секунды для GPT-6.1 Sol против более быстрого показателя для GPT-5.6 Sol, при медиане по таблице около 4 секунд
• Токены вывода на прогоне индекса — 67,2 млн для GPT-6.1 Sol против 90,0 млн для GPT-5.6 Sol
• Цена ввода / вывода — $2,00 / $10,00 против $4,00 / $20,00
• Кэшированный ввод — $0,10 против $0,40; запись в кэш $2,50 против $5,00
• Ставка пакетной обработки — не опубликована для GPT-6.1 Sol против $2,50 / $15,00 для GPT-5.6 Sol
• Порог длинного контекста — при превышении 272 000 входных токенов GPT-6.1 Sol переоценивается в $4,00 / $15,00 за весь запрос против $8,00 / $30,00 у GPT-5.6 Sol
• Нижняя граница усилий — низкий против отсутствия
Из этого списка следуют две вещи. Первое: снижение цены носит структурный, а не промоционный характер: стандартная ставка GPT-6.1 Sol в размере $2,00 и $10,00 ниже, чем ставка GPT-5.6 Sol при пакетной обработке в размере $2,50 и $15,00, так что даже скидочный тариф старой модели дороже, чем прейскурантная цена новой модели. Второе: обновление не даёт линейного улучшения по задержке. GPT-6.1 Sol генерирует вывод примерно на треть медленнее, а на тестах доски с длинными промптами первый фрагмент появился только через 332 секунды — это тот же порядок величины, что и 107 секунд у GPT-6 Sol, и примерно в восемьдесят раз больше медианы по доске. Если вы создали интерактивный продукт на GPT-5.6 Sol, это функциональная регрессия, не зависящая от каких-либо бенчмарков, и исправление здесь архитектурное, а не параметрическое.

Две оценки изменились не в ту сторону.
Совокупный прирост составляет 4,8 пункта. Компоненты не являются равномерно положительными, и оценки совета по каждому оцениванию это подтверждают:
• SciCode — GPT-6.1 Sol 0,542 против GPT-5.6 Sol 0,571. Регрессия на 2,9 пункта в научном программировании.
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575,1 против GPT-5.6 Sol Elo 1611,3. Регрессия Elo на 36 пунктов в экономически ценной интеллектуальной работе.
• Humanity's Last Exam — GPT-6.1 Sol 0,529 против GPT-5.6 Sol 0,495. Прирост на 3,4 пункта.
• Terminal-Bench 4.0 — GPT-6.1 Sol 0,561 против GPT-5.6 Sol 0,399. Прирост на 16 пунктов, самое крупное единичное изменение в этой паре.
• AA-Omniscience — GPT-6.1 Sol 41,5 против GPT-5.6 Sol 22,0; здесь речь о надежности знаний и галлюцинациях, а не о простом воспроизведении.
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — оставшиеся пять, которые дополняют композитный показатель и на которых получена остальная часть прироста в 4,8 пункта.
Модель, которая значимо лучше в работе с терминалом, существенно лучше в фактологической надёжности и измеримо хуже в научном программировании и в Elo для профессиональной работы, не является строго лучшей моделью. Это другая точка на фронтире, и её поместили туда намеренно: собственное позиционирование OpenAI при запуске GPT-6.1 Sol — это стоимость за выполненную задачу при почти максимальном балле. Если ваша рабочая нагрузка имеет форму SciCode или GDPval, то сводная цифра — не та, что к вам применима, а регрессия — та.
У GPT-5.6 Sol всё ещё есть опубликованный результат по длинному контексту
Единственное место, где у старой модели есть числовой показатель, которого нет у новой, — это точность извлечения в том диапазоне контекста, где меняется тарифная сетка GPT-6.1 Sol. GPT-5.6 Sol имеет опубликованный результат MRCR v2 с восемью иглами — 91,5% в диапазоне от 256 000 до 512 000 токенов. У GPT-6.1 Sol нет опубликованного аналога, а свыше 272 000 входных токенов весь её запрос пересчитывается по тарифу 2× за вход и кэш и 1,5× за выход.
Сложите эти два факта вместе — и сегмент, где экономика новой модели слабее всего, оказывается ровно тем сегментом, где у старой модели есть единственное документально подтверждённое преимущество. Экономия не исчезает — $4.00 и $15.00 на переоценённом тарифе против $8.00 и $30.00 на собственном тарифе GPT-5.6 Sol для длинного контекста — это всё ещё сокращение вдвое, — но история о половине цены — это история для общих рабочих нагрузок, а конвейер поиска по длинному контексту — не она. Если это ваша рабочая нагрузка, GPT-5.6 Sol за $4.00 и $20.00 с опубликованными 91,5% — это защитимое место, где можно остаться.
Другие опубликованные результаты GPT-5.6 Sol остаются неизменными, и именно из-за них некоторые команды не станут переходить: BrowseComp — 90.4 для агентов веб-исследований, Terminal-Bench 2.1 — 88.8 и 88.0, SWE-Bench Pro — 64.6, Agents' Last Exam — 53.6, OSWorld 2.0 — 62.6. Это результаты, заявленные OpenAI и полученные на её тестовом стенде, и они были опубликованы в июле. С тех пор изменилось то, что совет теперь оценивает обе модели на одном наборе тестов при одном наборе настроек, и более старая модель проигрывает по композитному показателю и по стоимости.
Сама миграция — это изменение строки, за одним исключением.
Тот же вендор, та же поверхность API, соседние позиции в рейтинге, то же окно и ограничение вывода — так что для большинства стеков это идентификатор модели и цена, которая падает вдвое. Исключения конкретны, и их стоит назвать, прежде чем вы переключитесь.
Если ваш код задаёт reasoning.effort в none или minimal, он не деградирует, а откажет, и low — это документированная замена. Если ваш трафик превышает 272 000 входных токенов, проверьте тариф после пересмотра цен, прежде чем оценивать экономию. Если для вашего продукта важно время до первого токена, измерьте его до релиза, потому что цифра в 332 секунды с табло — не ошибка округления. А если в ваших evals есть фрагмент в форме SciCode или GDPval, прогоните этот фрагмент на обеих моделях, а не доверяйте композитной оценке.
Обе модели доступны на OrcaRouter по собственным прайс-листовым ценам OpenAI — GPT-6.1 Sol по $2,00 и $10,00 при кэшированном вводе по $0,10, GPT-5.6 Sol по $4,00 и $20,00 при кэшированном вводе по $0,40 — в рамках сквозной модели, которая переносит изменение цен OpenAI на нашу сторону в тот же день, когда оно вступает в силу, а не после того, как реселлер пересмотрит условия. Поскольку прайс-лист передаётся без изменений, а не с наценкой, арифметика в этой статье — это та арифметика, которую вы получаете: та же модель с $0,72 за задачу, то же сокращение вдвое, никакой платформенной надбавки, наложенной ни с одной из сторон.

Практический смысл того, что оба находятся за одним эндпоинтом, в том, что сравнение остаётся живым. Направляйте новый трафик в GPT-6.1 Sol, держите GPT-5.6 Sol на расстоянии одного изменения конфигурации как резервный вариант и как путь для длинного контекста, а автоматическое переключение при сбое пусть покрывает окно, в котором доступность двухмесячного флагмана и его готовность для Enterprise всё ещё стабилизируются. Миграция, которая вдвое сокращает счёт и отодвигает два суббенчмарка назад, — это не решение, которое принимают один раз и забывают; его принимают для каждого маршрута, и именно слой маршрутизации делает это дешёвым.

Где каждому из них место
• Общая агентная и терминальная работа — GPT-6.1 Sol. Шестнадцать пунктов на Terminal-Bench 4.0 и вдвое меньшая цена — тут не может быть двух мнений.
• Фактологическая надёжность, продукты на основе извлечённых ответов — GPT-6.1 Sol, при разрыве почти в двадцать пунктов по AA-Omniscience.
• Научное программирование — сначала проверьте собственные оценки. На табло видна регрессия в 2,9 пункта, и сводный показатель её не отразит.
• Экономически ценная интеллектуальная работа — та же осторожность. Регрессия Elo в GDPval-AA составляет 36 пунктов.
• Извлечение при длинном контексте свыше 272 000 токенов — GPT-5.6 Sol, пока у GPT-6.1 Sol не появится опубликованный показатель в этом диапазоне.
• Интерактивные интерфейсы, чувствительные к задержке — измерьте перед миграцией. Вывод быстрее, но первый токен намного медленнее.
• Самый дешёвый вызов без рассуждений — ни то, ни другое. Такой конфигурации в этом семействе больше не существует.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
