
GPT-5.6 Luna Max: как разработчики на самом деле используют его в Codex — и где он дает сбой
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 221 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
1 августа в X начал распространяться конфигурационный файл из четырёх строк. Он создаёт агента Codex по имени luna_worker, устанавливает его модель на gpt-5.6-luna, задаёт уровень усилий рассуждений на max, и передаёт ему скучную половину вашей работы, пока GPT-5.6 Sol держит план. За несколько дней тот же рецепт переопубликовали на английском, китайском, японском, корейском, испанском и арабском языках, а плагин, построенный на той же идее, за четыре дня набрал более 1300 звёзд на GitHub. При этом — примерно в тот день, когда он стал вирусным, — это неправильный способ подключения: автор того плагина публично убрал GPT-5.6 Luna из собственного проекта в течение 48 часов, потому что коллега сказал ему, что тот не работает как субагент Codex, — а через два дня вернул его, подключив совершенно иначе.
Весь этот сюжет уложился в одну неделю, и это самое полезное, что кто-либо опубликовал об этой модели. Он показывает, что паттерн дешёвого работника реален, что очевидный способ подключения — неправильный, и что разница между этими двумя подходами и составляет большую часть ценности. Всё, что в этой статье касается техники, взято из публикаций практиков, делившихся собственными результатами в период с 30 июля по 5 августа 2026 года, — а не из документации компании, которая описывает GPT-5.6 Luna как модель для «высокообъёмных нагрузок, чувствительных к стоимости» и не говорит об этом ничего. Где число получено независимой третьей стороной, мы так и говорим; где это журнал сессии одного разработчика, мы говорим и это, в том числе когда они противоречат друг другу. Они противоречат, и часто.
Что такое «Luna Max» и почему большинство людей никогда его не видят
Модели Luna Max не существует. Есть два регулятора, и Luna Max — это одна из их комбинаций: самый дешёвый уровень семейства GPT-5.6, работающий при самом глубоком режиме рассуждений. Регулятор уровня выбирает между GPT-5.6 Sol, GPT-5.6 Terra и GPT-5.6 Luna. Регулятор усилий имеет шесть позиций — none, low, medium, high, xhigh и max — и он определяет, сколько модель думает перед ответом.
Почти никто не сочетал дешёвый тариф с глубокой настройкой по прозаической причине: max скрыт по умолчанию. В десктопном приложении ChatGPT/Codex он находится в Settings → Configuration → Available reasoning efforts, где верхний пункт списка по умолчанию не отмечен. Шесть отдельных разработчиков опубликовали одно и то же исправление в три клика в первую неделю августа, что хорошо показывает, сколько людей запускали Luna с глубиной по умолчанию и судили о модели на основе этого. На стороне API нет переключателя: вы передаёте идентификатор модели gpt-5.6-luna и устанавливаете reasoning effort в max в теле запроса, и это всё изменение.
Одно следствие, которое стоит усвоить, прежде чем читать любой бенчмарк: когда Artificial Analysis публикует показатель интеллекта для этой модели, страница озаглавлена GPT-5.6 Luna (max). Независимый показатель, который все цитируют для Luna, — это конфигурация с максимальным усилием. Если вы запускали версию по умолчанию и недоумевали, почему ваш опыт не совпадает с лидербордом, — вот почему.
Регулятор, который никто не объясняет: усилие меняет количество токенов, а не цену токена
Повышение усилия рассуждения не переводит вас на более дорогой тарифный план. GPT-5.6 Luna стоит $0.20 за миллион входных токенов и $1.20 за миллион выходных токенов при любом уровне усилия. Меняется лишь то, сколько токенов модель тратит на получение ответа — а на максимуме она тратит очень много.
Artificial Analysis измерил это в ходе работы над своим Intelligence Index, и эти цифры являются самым ясным независимым подтверждением того, на что жаловались практики:
• Балл — 51 по индексу Artificial Analysis Intelligence, при медиане 17 для моделей, которые он оценивает в этом классе.
• Многословность — за время индексного прогона было сгенерировано 130 млн выходных токенов при медиане в 61 млн. Artificial Analysis отмечает модель как «очень многословную».
• Сырая скорость — 182,5 выходных токенов в секунду, 16-е место из 163 моделей. Быстро на токен.
• Время до первого токена — примерно 136 секунд при максимальном усилии, что, как отмечает Artificial Analysis, находится на верхней границе даже для моделей рассуждений в этом ценовом диапазоне.
• Общие расходы — $174.06 на оценку модели на всём индексе.
Прочитайте третью и четвёртую строки вместе, потому что эта пара и есть весь пользовательский опыт. Luna на максимуме быстро стримит токены, но запускается несколько минут, а затем выдаёт примерно вдвое больше токенов, чем типичная модель на той же работе. Вот почему самая распространённая жалоба в полевых отчётах — не «это неправильно», а «это медленно» — и почему низкая цена не превращается в пропорционально дешёвую сессию. Вы покупаете низкую ставку при большом количестве токенов.
Для сравнения: на нашей собственной странице модели GPT-5.6 Luna наблюдаемое медианное время до первого токена за семь дней реального трафика составляет 1,78 секунды, а 95-й процентиль — 9,26 секунды. Это не противоречит показателю в 136 секунд — это та же модель, измеренная при различных настройках усилий, большинство из которых не максимальны. Задержка, которую вы получаете, — это свойство установленного вами параметра, а не вызываемой конечной точки.

Действительно ли Luna Max — это «Sol Medium за шестую часть стоимости»?
Это утверждение, сделавшее этот паттерн вирусным, исходит от Дэна МакАтира, который оценил его так: Luna при максимальном reasoning достигает примерно уровня GPT-5.6, Sol при среднем уровне — или Claude Opus 5 при среднем уровне — примерно за шестую часть стоимости. Его повторяли многие аккаунты, иногда без оговорок, и стоит отделять то, что измерено, от того, что основано на ощущениях.
Независимый рейтинг решительно подтверждает половину утверждения о стоимости и лишь частично — половину о производительности. При прогоне одного и того же набора бенчмарков с максимальной нагрузкой по всем уровням Artificial Analysis зафиксировала Luna на индексе 51 за $174, Terra — 55 за $1,403, Kimi K3 — 57 за $2,437 и Sol — 59 за $2,824. Luna уступает Sol восемь пунктов индекса, а стоимость её прогона через ту же работу примерно в шестнадцать раз ниже.

Независимая таблица результатов стала более точной 13 августа, когда DeepSWE выпустила v1.1 — пересмотренную версию своего бенчмарка для долгосрочных инженерных задач, которая сохраняет 113 исходных заданий из 91 репозитория на пяти языках, но теперь оценивает каждое исправление, запуская применённый дифф в изолированном контейнере, что сложнее обмануть. В обновлённой таблице все три уровня GPT-5.6 с максимальными усилиями оказались на тех же местах, что и в июльском отчёте: Luna Max — 67,2% pass@1 и $0,61 за задачу, Terra Max — около 70%, Sol Max — 73% за $8,39 — шесть процентных пунктов успешности примерно за четырнадцать раз больше денег.
Сравнение, заслуживающее второго взгляда, находится ниже Luna, а не выше. Claude Sonnet 5 Max набирает 54% на тех же 113 задачах — примерно на тринадцать баллов позади Luna Max — при цене $26,40 за задачу, что примерно в 44 раза больше, чем Luna заплатила за то же решение. Luna Max также обходит Gemini 3.7 Flash (65% для конфигурации с высокими усилиями на той же доске); сообщение сообщества, отметившее этот раунд, оценивает разрыв с Gemini 3.7 Flash Medium примерно в 1,7 балла. DeepSWE — это независимый испытательный стенд Datacurve, а не корпоративная оценка — собственное заявление компании о том, что семейство GPT-5.6 установило передовые результаты на Terminal-Bench 2.1 и DeepSWE, остается отдельным утверждением, сообщенным поставщиком.
Далее — полевые данные, которые действительно расходятся. Павел Хурин прогнал собственный бенчмарк по исправлению багов — 105 намеренно внедрённых багов в двух реальных кодовых базах, слепая оценка результатов, один раунд на модель — и сообщил, что Luna в режиме максимальных усилий исправила 33 бага за $1,80, тогда как Claude Fable 5 — 24 за $68. С другой стороны, Диего Хас провёл два дня, прогоняя сопоставимые сессии, и выступил против этой закономерности: Luna в среднем стоила $1,20 за сессию, а Sol — $29, но ему пришлось переделывать большую часть выдачи Luna, и для своих сценариев использования он не получил ничего пригодного к релизу, что делает экономию иллюзией, а не скидкой. Другой разработчик, запускавший тот же тестовый стенд, сообщил, что Sol на среднем уровне выдал заметно лучший результат, чем Luna на максимуме, примерно за вдвое меньшее время. Китайскоязычное соревнование на единственной задаче с 3D-сценой дало этой картине конкретные цифры: Sol Medium завершил задачу за 21 мин 30 с — с наивысшей оценкой качества и наименьшим количеством токенов; Luna Max затратила 40 мин 55 с, сожгла около 130 тыс. токенов, получила самую низкую оценку качества и израсходовала половину недельного лимита подписки.
Честное резюме позиции сообщества после недели: Luna Max — это не Sol Medium. Она значительно дешевле Sol Medium и хуже, и является ли такой размен выгодным, полностью зависит от того, насколько точно поставлена задача, чтобы «хуже» не имело значения. Именно для этого и предназначены схемы подключения ниже.
Паттерн, переживший контакт: Sol планирует, Luna реализует, свежий Sol проверяет
Никто из тех, кто продолжает использовать Luna Max, не использует её как универсального агента для программирования. Рабочая конфигурация, на которой сошлись практики во всех версиях, включает четыре роли:
• Оркестратор — GPT-5.6 Sol с высоким уровнем усилий, оставаясь в главном потоке. Он отвечает за требования, архитектуру, декомпозицию задач и финальную приёмку. Он не пишет код.
• Рутинный исполнитель — GPT-5.6 Luna при максимальном усилии, на ограниченной, полностью специфицированной работе: механические рефакторинги, написание тестов, анализ модулей, проходы по документации — тот тип задач, где конечный результат однозначен.
• Жёсткий исполнитель — GPT-5.6 Terra на максимальном усилии, для сборок с тяжёлым контекстом, где дрейф инструкций Луны становится дорогостоящим.
• Ревьюер — свежий инстанс GPT-5.6 Sol в режиме только для чтения, который видит только итоговый diff и больше ничего. Смысл «свежего» в том, что ревьюер, владеющий контекстом реализации, склонен одобрять собственные рассуждения.
Эталонная реализация — sol-advisor, плагин для Codex под лицензией MIT от Дэна МакАтира, набравший за первую неделю около 1 400 звёзд. Вы устанавливаете его через маркетплейс плагинов Codex добавлением DannyMac180/sol-advisor-репозитория и последующим добавлением sol-advisor-плагина. Его текущая структура поучительна: встроенный трек закрепляет исполнителя Terra/High, за которым следует свежий рецензент Sol/High, тогда как Luna на максимуме — это явно подключаемый опциональный трек, работающий как отдельная видимая пользователю задача, при этом основная сессия Sol напрямую проверяет и принимает его работу, а не передаёт её встроенному рецензенту.
Если вы предпочитаете ничего не устанавливать, часто копируемая минимальная версия — это определение пользовательского агента в ~/.codex/agents/luna-worker.toml, содержащее два параметра — model = "gpt-5.6-luna" и model_reasoning_effort = "max" — а также описание и инструкции, которые ограничивают его делегированной работой с чёткими границами, запрещают ему менять общую цель или расширять собственную область действий и отправляют архитектурные решения и неоднозначные требования обратно основному агенту. Распространённый совет — попросить Sol написать этот файл за вас, проверить его на установленной версии Codex и показать вам diff перед принятием, что разумно независимо от того, доверяете ли вы рецепту.
Ловушка субагентов и решение, к которому пришло сообщество
Именно здесь вирусная версия этого паттерна и рабочая версия расходятся.
Нативная система субагентов Codex не рассматривает GPT-5.6 Luna как полноправного участника. МакАтир столкнулся с жёстким ограничением — Luna не разрешена в качестве субагента — и обошёл его, объявив её кастомным агентом, а затем публично указал на цену этого обходного пути: кастомный агент не делится контекстом с основным агентом так, как это делает нативный субагент. Несколько дней спустя он полностью убрал Luna из sol-advisor, сославшись на вывод другого разработчика, специализирующегося на Codex, о том, что Luna плохо ведёт себя в роли субагента, и предположив, что она не была дообучена для мультиагентного протокола v2. Диего Хаз независимо описал ту же стену с другой стороны: Sol не может создать Luna как субагента, поэтому Luna должна жить в треде верхнего уровня, что делает координацию запутанной.
Решение, которое теперь является позицией большинства, состоит в том, чтобы прекратить борьбу с этим:
• Выделите Luna Max отдельный поток, а не слот в графе субагентов. Поручите оркестратору Sol запустить отдельную задачу Codex верхнего уровня на Luna, отслеживать её и забирать результат обратно. Именно это Макатир снова добавил в sol-advisor 4 августа, и к этому же несколько других пришли независимо.
• Примите изоляцию контекста как цену. Отдельный поток означает отдельную историю. Это тот налог, который вы платите, и именно поэтому передача, описанная ниже, здесь важнее, чем в нативной настройке субагентов.
• Если вам нужно во что бы то ни стало включить его в multi-agent v2, то отфильтровывается он именно из-за каталога.Один разработчик связал исключение с тем, что стандартный каталог моделей помечает Luna как v1, и сообщил об обходном решении: скопируйте ~/.codex/models_cache.json, установите для Luna multi_agent_version в значение v2, направьте model_catalog_json на вашу копию, перезапустите Codex, а затем заставьте оркестратор запускать Luna на максимуме с быстрым уровнем обслуживания и отключите форкинг. Относитесь к этому как к неофициальному хаку одного человека во внутреннем файле — это как раз то, что ломается при обновлении Codex.
Пакет передачи: пять вопросов, которые устраняют самую распространенную жалобу
Самая часто упоминаемая проблема Luna Max — это то, что она недостаточно точно следует инструкциям, особенно когда вы передаёте ей конкретный рабочий процесс или цикл итераций для выполнения. Эта жалоба встречается и у разработчиков, которым модель нравится, и у тех, кто от неё отказался. Решение, к которому практикующие специалисты в итоге приходят, — это не улучшенный промпт в смысле стиля написания, а более строгий контракт. Прежде чем начнётся ветка Luna, ответьте на пять вещей:
• Какую именно задачу должен завершить этот агент? Не область работы — конечное состояние.
• Какие файлы, документы или системы входят в область действия? Перечисленные, а не подразумеваемые.
• Что оно не должно менять? Интерфейсы, миграции, конфигурации и публичные контракты, которые изменять нельзя.
• Что доказывает завершение работы? Именованный тест, вывод конкретной команды, diff, затрагивающий только перечисленные файлы.
• Какое недостающее решение должно заставить его остановиться? Триггер, который заставляет вернуться, а не гадать, — именно он не позволяет слишком ретивой дешёвой модели выдумывать архитектуру.
Именно здесь стоит учесть и собственные рекомендации компании по промптингу, отдав им должное: компания сообщает, что в её внутренних оценках кодинг-агентов более компактные системные промпты повысили показатели eval на 10–15%, сократив при этом общее количество токенов на 41–66%, а затраты — на 33–67%. Компания также советует проверять промпты, унаследованные от GPT-5.5 или GPT-5.4, а не переносить их в новую версию как есть. Это цифры, заявленные вендором. Но направление совпадает с выводами сообщества: точно описывайте пункт назначения и удаляйте повествование о каждом шаге. Обратите внимание на противоречие с абзацем выше — точность в отношении границ и ограничений — это не то же самое, что многословие, и консенсус сообщества таков: Luna Max нужно больше первого и меньше второго.
Режимы отказов, которые следует учитывать при планировании
• Отклонение от инструкций. Подтверждено несколькими разработчиками: игнорируются части исходного брифа, и хуже всего, когда бриф — это процедура, которой нужно следовать, а не результат, которого нужно достичь.
• Медлительность по реальному времени. Неоднократно отмечалась и согласуется с ~136-секундным временем до первого токена, замеренным Artificial Analysis при максимальном усилии. Подходит для работы, которую можно запустить и оставить; мучительно в интерактивном цикле.
• Сжигание контекста. Один разработчик сообщил, что Luna Max съедает окно потока Codex на 258k токенов с тревожной скоростью, и предположил, что потребление квоты резко возрастает, когда Codex начинает сжатие вблизи лимита. Часть про сжатие — это его впечатление, а не измеренный результат, но скорость сжигания — ожидаемое следствие многословности, которую Artificial Analysis измерила независимо. На стороне API следите за шагом длинного контекста: сквозной тариф для этой модели переходит с $0.20/$1.20 на $0.40/$1.80, как только запрос пересекает примерно 272k токенов, так что постоянно растущий поток становится дороже за токен, а не просто дороже в сумме.
• Всё визуальное. Это самая чёткая граница в отчётах с полей. Один широко читаемый практик, отменяя подписку на кодинг Kimi K3 в пользу Luna Max, оценил её как не уступающую тому, от чего он отказывался, и гораздо более дешёвую — с явным исключением для фронтенда. Другой был более прямолинеен: не используйте Luna для дизайна, графики, оформления или слайдов; разделение «планируй с Sol — выполняй с Luna» предназначено для пошаговых обучающих задач, а не для эстетических.
• Каталог субагентов. Рассмотрено выше — если Луна молча так и не выбирается в многоагентном запуске, это фильтрация, а не сбой.
• Ложная экономия. Единственный тип отказа, который не проявляется ни в одном бенчмарке: сеанс, который стоил $1.20 вместо $29 и выдал работу, которую вы переделывали вручную, обошёлся вам в $1.20 плюс ваша вторая половина дня.
Когда не следует стремиться к максимуму
Max — это не бесплатное обновление, и руководство, которое сохранило актуальность, — это скорее лестница, а не настройка:
• Простые преобразования — переименование поля, механическое извлечение, проход форматирования. Низкая или средняя трудоёмкость на Luna. Сделайте прохождение именованного теста обязательным условием.
• Стандартная реализацияhigh или xhigh. Значение по умолчанию, принятое сообществом для воркера Luna, — xhigh, а не max, именно потому, что max тратит время и токены на задачи, которые никогда не были сложными.
• Ограниченная, но по-настоящему сложная — это и есть настоящая работа max. Пакет должен быть одновременно трудным и чётко определённым, чтобы дополнительное рассуждение превращалось в лучший результат.
• Неоднозначное расследование — меняйте уровень, а не регулятор. Если проблема в неверной оценке, а не в недостаточном планировании, больше размышлений на более дешёвой модели не поможет; это задача для Sol.
• Расплывчатое ТЗ — исправляйте контракт, а не модель. Никакая настройка усилий не компенсирует несформулированный критерий приёмки.
Предупреждение, касающееся именно подписок, из стороннего руководства — эту деталь легко упустить: кредитные ставки, которые Codex взимает за каждую модель, не находятся в тех же соотношениях, что и цены из прайс-листа API, поэтому нельзя взять соотношение цен API и использовать его как правило маршрутизации подписки. Заявленные лимиты сообщений за пять часов на тарифе Plus иллюстрируют это: примерно 15–90 локальных сообщений на Sol, 20–110 на Terra, 50–280 на Luna, а диапазоны такие широкие, потому что «сообщение» — не фиксированная единица работы. Если ваши решения о маршрутизации определяются лимитом подписки, а не выставленным счётом, измеряйте относительно лимита.
Помимо Codex: на что ещё люди направляют это
Сочетание дешевизны и глубокого мышления оказывается полезным и за пределами агентов для программирования, и вот подтверждённые варианты применения:
• Браузерные агенты. Один разработчик запустил стек браузерной автоматизации на GPT-5.6 Luna: открыл 15 лучших постов Hacker News, прочитал все связанные страницы и написал отчёт — общая стоимость 3 цента. Долгий горизонт, низкие риски, большой расход токенов — именно под такой профиль и рассчитана цена этой модели.
• Цепочки навыков.Два практика независимо сообщили, что с помощью одной цели Luna Max они запустили конвейер из двух навыков — генерацию изображения и преобразование его в Three.js — и получили интерактивный low-poly 3D-объект, отметив, что это почти не изменило их недельный счётчик использования. Это стоит прочитать вместе с предупреждением «не используйте Luna для визуальной работы»: Luna лишь координировала инструменты, которые выполняли визуальную работу, а не оценивала эстетику сама.
• Держите одну сессию активной.Кэшированный ввод для этой модели стоит $0,02 за миллион токенов против $0,20 за свежий — скидка 90%, которую Artificial Analysis указывает на своей панели цен, — а окно кэша составляет около 30 минут. Практический вывод, к которому независимо приходят несколько руководств: одна длительная сессия, которая постоянно перечитывает одну и ту же кодовую базу, обходится значительно дешевле, чем создание новой сессии для каждой задачи.
• Арбитраж квот. Самое смелое утверждение во всём наборе, и оно явно обозначено как утверждение: один разработчик сообщает, что, поскольку усилия почти бесплатны, а множитель тарифа велик, он, используя максимальное усилие на дешёвом тарифе, смог прогнать 4,9 миллиарда токенов за три недели на плане за $200 — по ценам API это шестизначная сумма — и что он держит модели Kimi K3, Grok и DeepSeek в одном списке выбора за локальным роутером, чтобы достижение лимита одного провайдера не останавливало работу. Никто независимо не воспроизвёл эту цифру по токенам. Однако привычка к маршрутизации, стоящая за этим, заслуживает подражания.
Запуск того же сплита без подписки Codex
Всё вышеописанное — это история в форме подписки: причина, по которой людям важен Luna Max, — в том, что он расширяет недельный лимит. На стороне API та же архитектура проще в создании и легче для понимания, потому что вы оплачиваете счёт, а не управляете квотой — и разделение на оркестратор/воркер перестаёт быть плагином и становится обычной маршрутизацией.
GPT-5.6 Luna доступна через OrcaRouter по цене $0.20 за миллион входных токенов и $1.20 за миллион выходных — это цена провайдера, переданная с нулевой наценкой, поэтому снижение цен 30 июля уже действовало у нас в тот день, когда компания объявила о нём, а не через биллинговый цикл. Она предоставляется через совместимый API на /v1/chat/completions и /v1/responses, поэтому поле reasoning-effort передаётся в теле запроса точно так же, как и при прямом обращении, а идентификатор модели — openai/gpt-5.6-luna. GPT-5.6 Sol и GPT-5.6 Terra доступны по тому же ключу, что и является ключевым для этого паттерна: оркестратор на одном уровне и воркер на другом — это два идентификатора модели в одной интеграции, а не два контракта с вендорами. Маршрутизирующий DSL позволяет выразить это разделение одним вызовом, а не склеивать потоки вручную, а автоматический фейловер покрывает тот случай, который любители арбитража квот решают с помощью локального роутера — когда один провайдер деградирует, запрос направляется в другое место, а не останавливается.

Два честных предостережения. Специфические для Codex механизмы — граф субагентов, маркетплейс плагинов, каталог моделей, еженедельный лимит — принадлежат компании, и ничто из этого не идёт в комплекте с API-ключом; если нужный вам паттерн — это sol-advisor внутри приложения Codex, вам нужна подписка Codex. А описанные выше режимы отказов — свойства модели, а не транспорта: маршрутизация меняет стоимость вызова и то, что происходит при падении провайдера, но не то, следует ли Luna вашим инструкциям.
Кому стоит это копировать, а кому нет.
Если ваша работа высокообъёмна и механически формализуема — рефакторинг, создание тестовых каркасов, извлечение кода, документация, аналитические проходы по большому репозиторию, — включайте max, помещайте Luna в отдельный поток с передачей из пяти вопросов, держите инстанс Sol перед ней для планирования и за ней для проверки — и рассчитывайте на порядок меньшие затраты. Те, кто сообщает о самых больших результатах, все делают что-то в этом духе, и независимые цифры затрат подтверждают направление, даже если не подтверждают формулировку «так же хорош, как Sol».
Если ваша работа исследовательская, эстетическая или приходит как расплывчатое ТЗ, которое проясняется по ходу дела, полевые отчёты прямо говорят: вы потратите сэкономленные средства дважды на переделку результата. А если вы работаете интерактивно — сидите и смотрите — двухминутный холодный старт на максимальной мощности будет раздражать вас сильнее, чем радовать цена.
На что обратить внимание: будет ли компания дообучать Luna для протокола субагентов v2. Каждый неудобный аспект текущего плейбука — отдельный тред, потерянный общий контекст, хак с каталогом, весь эпизод с отзывом и перенастройкой — существует из-за этого одного пробела. Устраните его, и лучшая версия этого паттерна станет на несколько шагов проще.
Вопросы, заслуживающие настоящего ответа
Стоит ли максимальное усилие рассуждения дороже за токен, чем по умолчанию?
Нет, и это самое распространённое заблуждение насчёт этой настройки. GPT-5.6 Luna тарифицируется по $0.20 за входные и $1.20 за выходные токены за миллион, независимо от усилия. Максимум меняет лишь число затрачиваемых токенов: модель планирует больше, проверяет себя и вносит правки перед ответом. Artificial Analysis измерила, что эта модель генерирует 130M выходных токенов на бенчмарк-наборе, где медианная модель генерирует 61M. Поэтому сессия с максимальным усилием стоит дороже, чем со средним, на той же задаче — исключительно за счёт объёма — и первый токен тоже появляется дольше. Усилие — это регулятор количества токенов с ярлыком качества.
Может ли GPT-5.6 Luna уже работать как нативный субагент Codex?
По состоянию на 5 августа 2026 года — нет, и сообщество перестало пытаться. Встроенный механизм субагентов Codex не принимает Luna; обходное решение с пользовательским агентом запускает её, но теряет общий контекст с основным агентом; а разработчик самого известного плагина для этого шаблона удалил Luna, затем добавил её обратно как отдельно создаваемую задачу верхнего уровня, за которой следит оркестратор. Если вы видите мультиагентный запуск, в котором Luna никогда не выбирается, вероятно, она отфильтровывается, потому что стандартный каталог моделей помечает её как v1, а не v2, что один разработчик исправил вручную на свой собственный риск. Это самый вероятный пункт в списке, который изменится с обновлением Codex, поэтому сверьте это с вашей установленной версией, а не доверяйте любому рецепту, включая этот.
Достаточно ли он хорош, чтобы заменить подписку на Claude или Kimi K3 для программирования?
Несколько разработчиков публично отменили подписку за $200 в месяц именно из-за этого. Пост, который вывел вопрос на поверхность, написал иммунолог, ежедневно пишущий код: он отказался от своей подписки на Kimi K3 для кодинга не потому, что она была плохой, а потому, что не мог её оправдать, когда GPT-5.6 Luna, по его опыту, была так же хороша для его работы и гораздо дешевле — за исключением фронтенда. Независимые данные о стоимости не позволяют просто отмахнуться от этого аргумента: на одном и том же наборе бенчмарков Kimi K3 на максимуме набрала 57 за $2 437, а GPT-5.6 Luna на максимуме — 51 за $174. Но прежде чем что-либо отменять, прочитайте возражения. Разработчики, которые сравнивали сопоставимые сессии и получили отрицательный результат, тестировали не другую модель; они тестировали другой тип задач — открытых, визуальных или слабо формализованных — и на таких задачах более дешёвая модель проигрывала настолько сильно, что экономия исчезала. Разумный ответ таков: Luna Max заменяет большую часть вашей программистской работы, но не обязательно вашу лучшую кодовую модель, и что те, кто выжимает из неё максимум, — это те, кто оставил топовый тариф под рукой, чтобы планировать и проверять.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
