
GPT-5.6 Luna против Claude Haiku 4.5: дешёвый уровень, очень разные счета
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
GPT-5.6 Luna и Claude Haiku 4.5 — это дешёвые уровни двух разных передовых семейств, и разрыв между ними полностью зависит от того, на какой показатель вы смотрите. По заявленной цене это разгром: $0,20 за миллион входных токенов против $1,00. По стоимости одной выполненной задачи Intelligence Index от Artificial Analysis — $0,18 против $0,21, разница около 14%. Одни и те же две модели, два честных ответа, и причина их расхождения — это самое полезное, что стоит понять, прежде чем выбирать одну из них.
Коротко: Luna — более сильная модель на бумаге и более быстрая по пропускной способности, но она долго размышляет и выставляет за это счёт. Haiku 4.5 — старше, менее масштабна и значительно более предсказуема в том, сколько будет стоить запрос. Что из этого важнее — свойство вашей рабочей нагрузки, а не моделей.
Краткий обзор
• Поставщик — OpenAI против Anthhropic
• Выпущено — 9 июля 2026 г. против 15 октября 2025 г.
• Контекстное окно — 1M токенов против 200K токенов
• Максимальный вывод — 128K токенов против 64K токенов
• Ввод — текст, изображение и файл против текста, изображения и PDF
• Цена за миллион токенов — $0,20 за вход / $1,20 за выход против $1,00 за вход / $5,00 за выход
• Artificial Analysis Intelligence Index — 38, 4-е из 177 против 18, 138-е из 200 (оба в конфигурации рассуждений)
• Стоимость одной задачи Intelligence Index — $0.18 против $0.21
• Скорость вывода — 109.4 токенов/с против 84.7 токенов/с
• Управление рассуждением — регулятор усилий от «нет» до «максимум» в отличие от расширенного мышления, включаемого вручную, без параметра усилий
• Надёжная дата отсечки знаний — февраль 2026 г. против февраля 2025 г. (данные обучения по июль 2025 г.)
• Обязательство по выходу на пенсию — не опубликовано против не ранее 15 октября 2026 г.
Где GPT-5.6 Luna действительно побеждает

По возможностям — с большим отрывом. Индекс интеллекта 38 против 18 — это не близкое сравнение. Luna превосходит Haiku по композитному показателю, который Artificial Analysis строит на основе оценок рассуждений, знаний, математики и программирования, и при этом является более дешёвой моделью за токен. Тем, кто в последний раз сравнивал эти два семейства по индексу до сентября — где Luna показывала 51 и 52, — стоит учесть, что всю шкалу пересчитали в сентябре 2026 года, и преимущество Luna сохранилось после пересчёта.
Контекст — в пять раз больше. Окно в 1M токенов против 200K само по себе определяет целую категорию работ: проходы по всему репозиторию, длинные наборы документов, расширенные транскрипты агентов, которые на Haiku потребовали бы суммаризации. Если ваше приложение определяется тем, сколько контекста оно должно удерживать, сравнение на этом заканчивается.
Запас по объёму вывода — вдвое больше. Максимум в 128K выходных токенов против 64K важен для генерации длинных текстов и для агентных циклов, возвращающих структурированные планы, а не ответы в одну строку.
Пропускная способность. 109,4 выходных токена в секунду против 84,7 — это реальная разница для потоковых интерфейсов, хотя это не то же самое, что отзывчивость, — см. раздел о задержке ниже.
Цена — на ценнике. В пять раз дешевле на входе и примерно в четыре раза дешевле на выходе — это не погрешность округления, а для работы с коротким выводом это и есть всё решение.
Где Claude Haiku 4.5 всё ещё заслуживает своё место
Предсказуемая стоимость. Рассуждения Haiku 4.5 — это расширенное мышление, которое вы включаете вручную. Если его не включить, модель отвечает напрямую и тарифицируется предсказуемо. У GPT-5.6 Luna регулятор усилий можно выкрутить на максимум, и каждый шаг вверх — это больше выходных токенов по тарифу за вывод. Команде, которой нужен потолок расходов, который можно назвать заранее, будет проще рассуждать о Haiku, даже при более высокой заявленной цене.
Конфигурация без рассуждений действительно недорога в эксплуатации. Artificial Analysis присваивает конфигурации Claude 4.5 Haiku без рассуждений 15 баллов по Индексу интеллекта, не публикуя при этом показатель стоимости выполнения задачи, и она вполне подходит для задач, где планка — просто «разобрать это правильно» — классификация намерений, извлечение полей, решения о маршрутизации, триаж модерации. На таких задачах разрыв по индексу между 15 и 38 в основном не имеет значения, потому что ни от одной из моделей не требуется думать.
Кэширование и пакетные скидки — уже зрелые решения. Haiku 4.5 предоставляет 90%-ную скидку на чтение из кэша промптов и 50%-ную скидку на Batch API. У Luna сопоставимая экономика кэширования, так что это скорее паритет, чем преимущество, — но если ваш конвейер уже работает с пакетами через инструменты Anthropic, затраты на миграцию с Haiku — это реальные издержки, и они не проявятся ни в одном бенчмарке.
Проверенный опыт эксплуатации. Haiku 4.5 находится в продакшене с октября 2025 года, и для него опубликовано обязательство по выводу из эксплуатации не ранее 15 октября 2026 года. Luna существует всего два месяца. Для рабочей нагрузки, где модель — деталь, а не продукт, одиннадцатимесячная история эксплуатации в продакшене значит нечто такое, чего не выразить никаким бенчмарком.
Это более правдивая модель — по той единственной оси, которая это измеряет. В прямом сравнении от Artificial Analysis Luna опережает почти по каждому показателю способностей — AA-Briefcase 1 339 против 614, GDPval-AA v2 1 489 против 854, AutomationBench-AA 50% против 3%, Humanity's Last Exam 39% против 10%, GDPpdf 24% против 4%. Исключение — AA-Omniscience, который штрафует за уверенные неверные ответы на вопросы о знаниях: там Luna набирает -10 против -4 у Haiku. Отрицательный балл означает, что штраф за галлюцинации перевешивает начисление за точность, и у Luna этот штраф больше. Более высокий сводный индекс — не то же самое, что более надёжный ответ, и в единственном тесте, созданном, чтобы разделить эти две вещи, более старая модель показывает лучший результат.
Расчёт затрат на реальной рабочей нагрузке
Возьмём конвейер, который потребляет 100 млн входных токенов и выдаёт 20 млн выходных токенов в месяц.
• GPT-5.6 Luna — 100 × $0.20 = $20, плюс 20 × $1.20 = $24. Итого $44 в месяц.
• Claude Haiku 4.5 — 100 × $1,00 = $100, плюс 20 × $5,00 = $100. Итого $200 в месяц.
При таких соотношениях Luna примерно в 4,5 раза дешевле, и именно такой расчёт публикует большинство сравнений. Теперь измените одно допущение. Если повысить уровень усилий Luna на рассуждение, количество её выходных токенов растёт, а выход — это дорогая сторона: при $1.20 он стоит в шесть раз дороже, чем вход. Доведите Luna до точки, когда она выдаёт 150 млн выходных токенов на тот же объём работы, как это происходит в оценочном наборе Artificial Analysis, и $44 превращаются в уверенно более $180. Разница в 4,5 раза схлопывается почти до паритета.
Урок не в том, что Luna дорогая. А в том, что ценовое преимущество Luna зависит от того, сколько она говорит, а это параметр, которым управляете вы. Снизьте уровень рассуждений для извлечения и классификации — и скидка станет реальной. Оставьте его на максимуме для всего — и вы купили более способную модель по цене, которая уже не похожа на ценник.
Задержка и число, которому не стоит доверять
Опубликованные показатели времени до первого токена для этих двух моделей практически бесполезны, и стоит понять почему. На Artificial Analysis конфигурации рассуждений обеих моделей демонстрируют задержку до первого токена в десятки или даже сотни секунд, поскольку тестовый стенд не выдаёт токен, пока модель не завершит рассуждения. Этот показатель характеризует настройку оценки, а не отзывчивость модели.
Телеметрия маршрутизации — более подходящий источник, поскольку она измеряет модель в продакшене. Собственные данные OrcaRouter показывают, что у GPT-5.6 Luna медиана времени до первого токена составляет 1,83 секунды, а 95-й процентиль — 10,00 секунды, тогда как у Claude Haiku 4.5 медиана равна 3,81 секунды, а 95-й процентиль — 9,47 секунды. При правильном прочтении это означает, что две модели ближе друг к другу, чем предполагают таблицы лидеров: Luna выигрывает на типичном запросе, а хвосты различаются примерно на полсекунды. Если вас беспокоит худший случай, а не средний, между ними почти нет разницы.
Какой выбрать?
Выбирайте GPT-5.6 Luna, если у вас длинный контекст, если задаче идёт на пользу настоящее рассуждение, если вывод длинный или структурированный либо если вам нужна самая мощная модель из доступных в нижней части ценового диапазона. Это также более естественный выбор, если остальная часть вашего стека уже работает по логике семейства OpenAI.
Выберите Claude Haiku 4.5, если ваша работа предполагает короткий вывод и большие объёмы, если вам нужен потолок затрат, который можно указать до выполнения запроса, если ваш конвейер уже построен вокруг пакетной обработки и кэширования Anthropic, или если вы цените модель с историей работы в продакшене и опубликованным жизненным циклом больше, чем модель, которой всего два месяца.
Не выбирайте ни того, ни другого для задачи, с которой справилась бы небольшая модель рассуждений или дообученный классификатор. Значительная часть трафика, которую поглощают эти два уровня, — это классификация и извлечение, которые дешевле было бы выполнять на чём-то более узком, — а самая дешёвая модель — всегда та, которая вам не понадобилась.
Запуск обоих на одном ключе

Противостояние перестаёт быть эксклюзивным, как только обе модели становятся доступны через единый эндпоинт. В OrcaRouter Claude Haiku 4.5 и GPT-5.6 Luna находятся за одним и тем же базовым URL, совместимым с OpenAI — один API для 200+ моделей, один ключ, одна строка биллинга, никакого второго контракта и никаких изменений в коде, кроме идентификатора модели. Для решения о тарифе, в котором вы ещё не уверены, это превращает миграцию в значение конфигурации.
Две функции здесь реально работают. Автоматическое переключение при сбое между провайдерами означает, что недорогой уровень может обслуживать продакшен-трафик без зависимости от одного вендора — это полезно, когда модель достаточно дешёвая, чтобы вы отправляли ей тысячи вызовов в час, а не один важный. А DSL маршрутизации позволяет составлять вызов из нескольких моделей: направлять простую большую часть запросов в Luna, эскалировать остаток в GPT-5.6 Terra и держать Haiku 4.5 в пуле как резервный вариант, когда вам нужен ответ второго вендора, а не повторная попытка.
Проверьте актуальную ставку за токен для GPT-5.6 Luna и Claude Haiku 4.5, прежде чем выбирать один из них для продакшена — обе ставки передаются с наценкой 0%, поэтому они меняются в тот же день, когда их меняет поставщик, а сторонние сервисы отслеживания цен отстают на дни или недели.
Вопросы, на которые действительно стоит отвечать
Действительно ли GPT-5.6 Luna в пять раз дешевле Claude Haiku 4.5? По входным токенам — да: $0.20 против $1.00. По стоимости выполнения той же оцениваемой задачи — нет: $0.18 против $0.21. Разрыв между этими двумя утверждениями — это многословность Luna. Для выполнения той же работы она выдаёт примерно вдвое больше выходных токенов, чем Haiku, а выходные токены стоят в шесть раз дороже входных. Для коротких ответов ценник в целом честен. Для работы, требующей интенсивных рассуждений, — нет.
Можно ли настраивать стоимость одинаково в обоих?Нет, и это самое часто упускаемое из виду различие между ними. Luna предоставляет регулятор усилия рассуждений с настройками от none до max, так что стоимость и качество явно соотносятся друг с другом в каждом запросе. Расширенное мышление Haiku 4.5 либо включено, с бюджетом токенов, либо нет — параметра усилия не существует. Если вам важен контроль стоимости на уровне отдельного запроса, только один из этих двух даёт вам такой рычаг.
А что насчёт высоконагруженного классификатора, выполняющего несколько миллионов вызовов в день? Ни одной из этих моделей для этого не требуется рассуждение. Запустите Haiku 4.5 с отключённым расширенным мышлением или Luna с параметром effort, установленным на none, и сравнивайте по задержке и длине вывода, а не по составному индексу — на этом этапе важные вопросы — как быстро приходит первый токен и сколько токенов занимает ответ, а бенчмарки интеллекта перестают различать их между собой.

Какая из них всё ещё будет доступна через год?У Claude Haiku 4.5 есть опубликованное обязательство: модель не будет выведена из эксплуатации до 15 октября 2026 года. OpenAI не публикует аналогичную дату для GPT-5.6 Luna, а у линейки GPT-5.6 уже есть более новое поколение выше неё — GPT-6 Astra. Ни то, ни другое не является поводом избегать Luna, но если ваш роадмап исходит из одиннадцатимесячного горизонта планирования, это повод хранить идентификатор модели в конфигурации, а не задавать его жёстко в коде.
Актуальная ставка за токен для GPT-5.6 Luna на том же ключе, передаётся с наценкой 0% и без второго биллингового отношения.
Актуальная цена за токен для Claude Haiku 4.5 на том же эндпоинте, чтобы два тарифа можно было сравнить без второго договора.
