Титульная карточка для GPT-6 Luna против GPT-5.6 Luna со значком 'GA 22 сент. 2026', заголовком 'GPT-6 Luna против GPT-5.6 Luna', подзаголовком 'То же название, половина цены, худший результат' и тремя карточками статистики с надписями 'Вход: $0.10 против $0.20 за MTok', 'Выход: $0.50 против $1.20 за MTok' и 'Индекс AA: 37.26 против 37.32', с логотипом OrcaRouter, наложенным в правом нижнем углу.
Guides & Insights

GPT-6 Luna vs GPT-5.6 Luna: то же название, вдвое ниже цена и худший результат

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Две модели, одно общее слово и независимая оценка, которая фактически идентична. GPT-6 Luna достигает 37,26 в Индексе интеллекта Artificial Analysis; GPT-5.6 Luna достигла 37,32. Разница в 0,07 пункта — это не измерение, это шум, и это самый важный факт об этой паре. Что отличает две модели — не возможности, а 0,0681 доллара за выполненную задачу индекса против 0,1783, а также набор регрессий в интеллектуальной работе, о которых снижение цены умалчивает.

Даты важны для понимания этих цифр. GPT-5.6 Luna вышла 9 июля 2026 года по цене $0,20 за миллион входных токенов и $1,20 за миллион выходных. GPT-6 Luna вышла 22 сентября 2026 года по цене $0,10 и $0,50 — ровно половина ставки за вход и на 58% меньше ставки за выход, что OpenAI охарактеризовала как постоянное, а не промоакционное снижение. Это настоящее снижение, и в то же время это лишь меньшая часть истории. Большая часть в том, что новая модель — это другая модель, а не та же самая с новой ценой.

Two-column comparison scoreboard titled 'GPT-6 Luna vs GPT-5.6 Luna - the scoreboard'. Left column 'GPT-6 Luna': Input per MTok $0.10; Output per MTok $0.50; Cost per index task $0.0681; Hallucination rate 76.7%; AA-Briefcase Elo 1,299.23; AA Intelligence Index 37.26. Right column 'GPT-5.6 Luna': Input per MTok $0.20; Output per MTok $1.20; Cost per index task $0.1783; Hallucination rate 92.6%; AA-Briefcase Elo 1,345.38; AA Intelligence Index 37.32. Footer reads 'Vendor price lines per OpenAI; independent figures per Artificial Analysis.' OrcaRouter logo composited bottom-right.

Что на самом деле даёт миграция, в цифрах

Сопоставьте эти два варианта по параметрам, которые определяют миграцию, — и картина получится неравномерной. Одни строки улучшаются, другие регрессируют, а одна улучшается очень значительно.

• Цена — GPT-6 Luna: $0.10 за вход / $0.50 за выход за миллион токенов против $0.20 / $1.20 у GPT-5.6 Luna. Вдвое дешевле на входе, на 58% — на выходе.

• Кэшированный ввод — $0,01 за миллион против $0,02. Та же скидка 90% на вдвое меньшей базе, поэтому повторяющийся префикс стоит вдвое меньше, чем в июле.

• Стоимость за выполненную задачу — $0,0681 против $0,1783 на том же наборе. Снижение на 62%, что больше, чем снижение цены токенов, поскольку состав задач не идентичен.

• Выходные токены на задачу — 50 537 против 41 235. Новая модель на 23 % более многословна на каждую завершённую задачу, а 78 % её вывода — это рассуждения, которые никогда не попадают в ответ.

• Контекстное окно — 1 050 000 токенов против 1 000 000. Тот же практический потолок; у обоих ограничение вывода — 128 000 токенов.

• Воздержание — уровень галлюцинаций 76,7% на AA-Omniscience против 92,6%. Это самое крупное единичное улучшение в наборе, и это не прирост знаний: точность меняется с 42,7% до 43,8%, практически без изменений. Новая модель отказывается вместо того, чтобы выдумывать, что является изменением поведения, а не возможностей.

• Результаты интеллектуальной работы — AA-Briefcase v1.1 падает с 1 345,38 Elo до 1 299,23, а GDPval-AA v2.1 — с 1 443,14 до 1 367,09. Оба показателя снизились примерно на 46 и 76 пунктов.

• Программирование и долгосрочные задачи — Terminal-Bench 4.0 поднимается с 11,6% до 12,6%, а SciCode — с 53,6% до 54,6%; это две строки, которые здесь растут. В противовес этому Coding Agent Index падает с 43 до 41, и агентные оценки в стиле SWE движутся в том же направлении.

• AutomationBench-AA — 53,2% против 50,2%. Рост, причём больший, чем у любого другого агентного показателя в наборе.

Screenshot of the Artificial Analysis page for GPT-6 Luna (max), dated September 2026, showing a proprietary model that accepts text and image input and outputs text with a 1M-token context window, an Artificial Analysis Intelligence Index score of 37, pricing of $0.10 per million input tokens and $0.50 per million output tokens, a 90% cache discount, and a cost rank of 20th of 183 models in its class.

Регрессия — в артефакте, а не в рассуждении.

Закономерность в этих последних двух строках стоит назвать, потому что это и есть всё решение. Новая модель лучше справляется с одношаговыми агентными действиями и хуже — с выдачей готового документа. Artificial Analysis объясняет снижение в работе со знаниями качеством подачи и итоговыми материалами, в которых пропущены обязательные элементы рубрики, а не фактическими ошибками или сбоями в рассуждениях, — и это как раз тот тип регрессии, который проходит дымовой тест, но проваливает проверку.

Сопоставьте эти два факта — и миграция чётко разделяется по тому, что именно потребляет выходные данные. Если ваш пайплайн читает структурированный вывод — JSON, классификацию, извлечённое поле, решение о маршрутизации, — регрессия подачи не стоит вам ничего, улучшение показателя воздержания от ответа — реальный выигрыш, а 62%-ное снижение стоимости задачи достаётся вам в полном объёме. Если же результат читает человек — отчёт, служебную записку, документ для клиента, — новая модель измеримо хуже именно в том, за что вы платите, а экономия покупает вам рецензента.

Показатель отказов заслуживает такого же подхода. Модель, которая переходит от выдумывания в 93% случаев того, чего не знает, к выдумыванию в 77% случаев, — это существенно иной объект для защитного барьера, проверки на соответствие требованиям или любого конвейера, где уверенный неверный ответ распространяется дальше. Это улучшение реально, оно измерено независимо, и это сильнейший аргумент в пользу перевода работы на новую модель, который вообще не зависит от цены.

Что меняется в вашем коде, а что — нет

Меньше, чем подразумевает снижение цены такого масштаба, — и это хорошая новость. Контекстное окно — того же класса, максимальный объём вывода идентичен и составляет 128 000 токенов, а условие семейства о пересмотре цен для длинного контекста не изменилось: запросы объёмом свыше 272 000 входных токенов тарифицируются по удвоенным ставкам за ввод и кэш и по ставке 1,5× за вывод — для всего запроса, а не только для части, превышающей порог. Запрос, который был дорогим при 300 000 токенов на GPT-5.6 Luna, остаётся дорогим и на GPT-6 Luna — вдвое ниже ставка, тот же ценовой скачок, поэтому рабочую нагрузку, которую следовало разделить в июле, следует разделить и сейчас.

Лестница усилий — это то, где меняется поведение, а не стоимость. GPT-6 Luna предлагает none, low, medium (по умолчанию), high, xhigh и max, и значение по умолчанию имеет значение: конвейер, настроенный под усилие по умолчанию одной модели, не обязательно будет автоматически настроен под усилие другой. Команды, которые явно зафиксировали настройку, не затронуты. Команды, которые использовали значение по умолчанию, работают с другой конфигурацией, чем в июле, и видимым симптомом будет объём токенов, а не качество.

Об одной ловушке стоит сказать ещё раз, потому что с новой моделью она не исчезает. На эндпоинте Chat Completions вызов функций работает только тогда, когда reasoning effort имеет значение none; любой другой уровень effort и любой встроенный инструмент требуют Responses API. Команда, переносящая цикл вызова инструментов простой сменой строки модели, обнаружит, что при стандартном уровне medium её инструменты молча недоступны, а исправление потребует переписать поверхность вызовов, а не поменять параметр.

Что вы можете маршрутизировать сегодня, а что — нет

Это та часть миграции, которая никак не связана с бенчмарками. GPT-5.6 Luna доступна на OrcaRouter по своей цене из прайс-листа — $0,20 за миллион входных токенов, $1,20 за миллион выходных, контекстное окно на 1 000 000 токенов, максимальный объём вывода 128 000 токенов и p50 времени до первого токена 1,60 секунды, измеренный по живому трафику на нашей собственной странице модели. Мы транслируем цены провайдера из прайс-листа без наценки, так что в день, когда OpenAI изменила цены на это семейство, изменения сразу вступили в силу на нашей стороне, а не в следующем расчётном цикле.

Screenshot of the OrcaRouter model page for openai/gpt-5.6-luna, showing GPT-5.6 Luna by OpenAI dated 2026-07-09, Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 128K maximum output, text, image and file input, pricing of $0.20 input and $1.20 output per million tokens, a p50 time to first token of 1.60 seconds and a p95 of 10.00 seconds, and the description 'GPT-5.6 Luna is the fast, cost-efficient model in OpenAI's GPT-5.6 series — tuned for high-volume, latency-sensitive workloads while retaining genuinely capable reasoning.'

GPT-6 Luna не маршрутизируется через OrcaRouter по состоянию на 23 сентября 2026 года. Доступность обеспечивают собственный API OpenAI и облачные каталоги, поддерживающие это семейство, а мы не включаем в список модель, которую не можем обслуживать. Практическое следствие: команда, планирующая эту миграцию, может сегодня изменить ценообразование и не может сегодня изменить маршрутизацию — две половины изменения приходятся на разные даты.

То, что это делает возможным тем временем, — это схема, к которой большинство команд в итоге всё равно захочет прийти. Оставьте GPT-5.6 Luna на путях, где результат и есть продукт, запускайте GPT-6 Luna там, где вывод потребляется кодом, и рассматривайте эту границу как уровень, а не как переписывание. Поскольку доступные вам модели находятся за одним эндпоинтом, где более 200 моделей используют один и тот же ключ и автоматическое переключение между провайдерами, добавление или удаление уровня — это запись в конфигурации, а не вторая интеграция, — и путь эскалации перестаёт зависеть от доступности какой-либо одной модели.

Миграционное решение, изложенное прямо

Перенесите работу туда, где вывод считывается машиной, а условие успеха проверяемо. Классификация, извлечение, решения о маршрутизации, вызовы защитных ограничений, массовые проходы преобразования и одношаговые действия агентов — всё это подходит: композитный показатель не изменился, поведение при воздержании от ответа стало существенно лучше, а стоимость задачи снизилась примерно на 62%. При Batch по половине стандартных расценок и кэшированном вводе по одной десятой от уменьшенной вдвое базовой ставки конвейер, который в июле был на грани, теперь может стать вполне очевидным.

Не переносите работу, где человек утверждает артефакт, и не переносите вслепую пути кодирующих агентов. Падение на 46 пунктов по AA-Briefcase и падение на 76 пунктов по GDPval — это небольшие числа, указывающие в ту же сторону, что и падение на два пункта по Coding Agent Index, а режим отказа, который описывает Artificial Analysis, — пропущенные элементы рубрики, более слабая подача, — невидим для автоматической проверки. Оставьте предыдущую модель там, где результатом является отточенность.

И относитесь к ничьей в индексе с разницей 0,07 пункта как к выводу, которым она является. Это не более умная модель по более низкой цене. Это модель другой формы по более низкой цене, и вопрос, на который должен ответить план миграции, — какую форму потребляет ваша рабочая нагрузка, а не какая оценка выше, потому что, согласно независимым данным, эти две оценки — одно и то же число.