
GPT-6.1 Sol против GPT-6 Luna: тринадцать индексных пунктов, в десять раз больше денег и два теста, где это не работает
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
OpenAI выпустила GPT-6.1 Sol29 сентября 2026 года, через неделю после того, как GPT-6 Lunaпоявилась 22 сентября в том же цикле презентаций. Это два конца одного поколения: Luna — дешёвый тариф, Sol — средний тариф над ним, а GPT-6 Astra находится выше обоих. Разница в цене между ними — на порядок: 0,10 и 0,50 доллара за миллион токенов против 2,00 и 10,00 долларов, кэшированный ввод — 0,01 против 0,10 доллара — а разница в возможностях на независимом рейтинге составляет 13,7 пункта Intelligence Index: 51,8 против 38,1 при максимальном усилии рассуждения. В десять раз больше денег за тринадцать пунктов — это, пожалуй, худший обменный курс в текущей линейке OpenAI. Что делает это сравнение достойным статьи, так это следующий вопрос на сорок долларов: какие именно тринадцать пунктов?
Две модели и неделя между ними
GPT-6 Luna — это малая модель поколения GPT-6, та самая, которую OpenAI описывает как созданную для высоконагруженной работы, чувствительной к задержкам: классификация, извлечение данных, маршрутизация, массовое суммирование, внутренний цикл агента. У неё контекстное окно на 1,050,000 токенов и потолок вывода на 128,000 токенов, она принимает на вход текст, изображения и файлы и сохраняет полную шестиступенчатую шкалу усилий, включая none, которую убрал уровень 6.1. Тарифная сетка — причина её существования: $0.10 за вход и $0.50 за выход за миллион токенов, кэшированный ввод — $0.01, запись в кэш — $0.125, а при длинном контексте свыше 272,000 входных токенов тарифы повышаются до $0.20, $0.75 и $0.02 за кэшированный.
GPT-6.1 Sol — это обновление среднего уровня, выпущенное неделю спустя. То же окно, тот же лимит вывода, те же входные модальности, дата отсечки знаний — 30 апреля 2026 года, в отличие от Luna, и лестница усилий, которая начинается с низкого, потому что нет и минимальный сразу отклоняются. Цена — $2.00 и $10.00, кэшированный ввод — $0.10 — в двадцать раз выше входной ставки Luna и в двадцать раз выше её выходной ставки, а строка кэша стоит в десять раз дороже за попадание.
Оба доступны, оба есть в ChatGPT Work и Codex, а также в API, и оба вызываются через один и тот же ключ на нашей стороне. Ничто в этой паре не требует выбора.
Что на самом деле дают тринадцать пунктов индекса
Сводный показатель — наименее информативное число в этом сравнении, поскольку он усредняет задачи, которые ведут себя очень по-разному. При оценке по каждому отдельному тесту при максимальном уровне рассуждений на Artificial Analysis v4.3.2 картина представляет собой не наклон, а разрыв:
• AA-LCR v1.1, рассуждение с длинным контекстом — GPT-6 Luna 0,833 против GPT-6.1 Sol 0,830. Luna незначительно впереди.
• SciCode — GPT-6 Luna 0.546 против GPT-6.1 Sol 0.542. Снова фактически на одном уровне, и снова более дешёвая модель номинально впереди.
• Terminal-Bench 4.0 — GPT-6 Luna 0.126 против GPT-6.1 Sol 0.561. Разрыв в 43 пункта; эти две модели находятся в разных лигах по работе с терминалом.
• Humanity's Last Exam — GPT-6 Luna 0,385 против GPT-6.1 Sol 0,529.
• AutomationBench-AA — GPT-6 Luna 0,532 против GPT-6.1 Sol 0,649.
• GDPval-AA v2.1 — GPT-6 Luna Elo 1437,1 против GPT-6.1 Sol Elo 1575,1: разрыв в 138 пунктов Elo в профессиональной интеллектуальной работе.
• GDP.pdf — GPT-6 Luna 0.228 против GPT-6.1 Sol 0.310.
• CritPt — GPT-6 Luna 0.194 против GPT-6.1 Sol 0.317.
• AA-Omniscience — GPT-6 Luna 0.65 против GPT-6.1 Sol 41.5. По шкале, где ноль означает столько же правильных ответов, сколько и неправильных, Luna находится на ватерлинии, а Sol — заметно выше неё.
• MMMU-Pro — GPT-6 Luna 0.797 против GPT-6.1 Sol 0.860.
• Стоимость за задачу индексации, независимо — GPT-6 Luna $0,068 против GPT-6.1 Sol $0,72; примерно десятикратный разрыв в пользу дешёвой модели
• Выходные токены в прогоне индекса — GPT-6 Luna 144 миллиона против GPT-6.1 Sol 67 миллионов, при медиане по классу в 100 миллионов для Luna и около 81 миллиона для Sol
Две из десяти оценок — ничья в пользу дешёвой модели. Восемь достаются дорогой, и в шести из этих восьми разрыв отнюдь не мал. Таково честное прочтение тринадцати баллов: это не равномерный градиент качества, это две способности — длительное агентное выполнение и фактологическая надёжность — в которых Luna просто не относится к тому же классу моделей, и широкая середина, где разница реальна, но достаточно мала, чтобы остаться незаметной в вашем собственном наборе оценок.
Результат AA-LCR заслуживает одной оговорки, потому что это показатель, который больше всего льстит Luna. Рассуждение на длинном контексте с 0,833 — сильный результат, и две модели отстоят друг от друга меньше чем на половину балла, но этот бенчмарк измеряет извлечение информации и рассуждение на длинных входных данных, а не способность действовать на протяжении длинной сессии. Разрыв в Terminal-Bench 4.0 — это то, как выглядит «действие на протяжении длинной сессии», когда его оценивают, и он составляет 43 балла.

Арифметика стоимости на одну задачу — и где она перестаёт быть верной
Artificial Analysis рассчитывает стоимость каждого прогона индекса исходя из измеренного потребления токенов, поэтому показатель затрат не является выводом из тарифной сетки. Прогон GPT-6 Luna стоил $0,068 за задачу; прогон GPT-6.1 Sol — $0,72. Соотношение составляет 10,7×, и оно лишь немного хуже номинального двадцатикратного соотношения цен только потому, что Luna сгенерировала 144 миллиона выходных токенов за прогон против 67 миллионов у Sol — дешёвая модель более чем вдвое разговорчивее, и это подтачивает её собственное преимущество. Тем не менее разрыв между ними не мал, а в сценарии с короткими ответами он бы увеличился: меньший объём вывода означает, что штраф Luna за многословность уменьшается, тогда как её ценовое преимущество остаётся неизменным.
Арифметика перестаёт быть верной для любой рабочей нагрузки, на которую индекс не похож. Если ваша задача — правка в масштабе репозитория, требующая удерживать двадцать вызовов инструментов в согласованном состоянии, модель за $0,07, которая проваливает задачу, стоит вам целого цикла повторных попыток плюс реального времени, а модель за $0,72, которая завершает её с первого раза, обходится дешевле. Само позиционирование запуска GPT-6.1 Sol целиком строится на этой идее — стоимость за выполненную задачу — и это правильная рамка: релевантное сравнение — не цена за токен, а ожидаемая стоимость на результат, а на задачах, которые Luna не может выполнить, эта ожидаемая стоимость не ограничена.
Две структурные детали делают эту границу более резкой. Во-первых, шаг длинного контекста: обе модели переоцениваются выше 272 000 входных токенов — Luna до $0.20 и $0.75, а Sol до $4.00 и $15.00, поэтому абсолютный разрыв на границе скорее расширяется, чем сокращается, но тариф Luna после переоценки всё ещё на порядок ниже стандартного у Sol. Во-вторых, и это легко упустить: лестница уровней усилий имеет не ту же форму. Luna принимает none; Sol — нет. Каскад, который сначала направляет запрос в Sol и при ошибке или тайм-ауте откатывается на Luna, не должен переносить reasoning.effort запроса без изменений, потому что конфигурация, допустимая для одной модели, возвращает ошибку для другой. Это забота уровня маршрутизации, а не вопрос качества модели, и именно такого рода вещи единая конечная точка с правилом маршрутизации и должна поглощать.
Вести оба — в этом суть, а не перестраховка.
Обе модели доступны на OrcaRouter по собственным прайс-листовым ценам OpenAI без каких-либо наценок: GPT-6 Luna — $0.10 и $0.50, с кэшированным вводом за $0.01, GPT-6.1 Sol — $2.00 и $10.00, с кэшированным вводом за $0.10, а шаг в 272 000 токенов для каждой модели передаётся точно так, как указано у поставщика. Поскольку платформа передаёт прайс-листовую цену провайдера без наценки, двадцатикратное соотношение в этой статье — это то соотношение, которое вы действительно платите, с обеих сторон.

Причина, которая здесь особенно важна, заключается в том, что эта пара — это каскад, который только и ждёт, чтобы его написали. Классификатор, маршрутизатор, задача массового извлечения данных и агент для написания кода в масштабе репозитория не должны работать на одной и той же модели, и разрыв в цене достаточно велик, чтобы ошибка в любую сторону обошлась дорого — в одном направлении двадцатикратная переплата за вызов, в другом — проваленная задача. Один ключ, две модели и правило, которое направляет простой трафик в Luna и переводит на Sol, когда меняется класс задачи или когда вывод Luna не проходит проверку, — это изменение конфигурации на нашей стороне, а не второй контракт с поставщиком. Автоматическое переключение при сбое покрывает случай, когда одна из двух моделей деградировала, что для модели, выпущенной восемь дней назад, всё ещё остаётся реальной возможностью.

Решение, за один проход
• Классификация, извлечение, маршрутизация, массовое суммирование, внутренние циклы агентов — GPT-6 Luna, и дальше можно не читать. При цене $0.10/$0.50 и одном центе за кэшированное чтение тринадцать индексных пунктов общей способности не стоят десятикратного счёта на работе, где ответ короткий и проверяемый.
• Программирование в масштабе репозитория, терминальные агенты, многошаговое выполнение — GPT-6.1 Sol. Разрыв в 43 балла в Terminal-Bench 4.0 — это и есть весь аргумент; именно за эту возможность и платят эту цену.
• Вопросы интеллектуального труда, где неверный ответ дорого обходится — GPT-6.1 Sol, о разрывах в AA-Omniscience и GDPval-AA. Показатель фактической надёжности Luna — на самой ватерлинии.
• Длинные входные данные при коротком сгенерированном ответе — GPT-6 Luna. Она рассуждает в условиях длинного контекста на уровне модели, которая стоит в двадцать раз дороже, а её штраф за многословность в 144 миллиона токенов так и не успевает вступить в силу.
• Всё, что уже установлено в none — оставайтесь на Luna или закладывайте бюджет на переход. На GPT-6.1 Sol такой ступени нет.
• Интерфейсы, чувствительные к задержке — GPT-6 Luna, по собственным измерениям совета: 129,4 выходных токена в секунду и 100 секунд до первого чанка против 59,7 и 332 у Sol.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
