Титульная карточка, сравнивающая GPT-5.6 Luna и Claude Haiku 4.5: у Luna индекс интеллекта 38, контекстное окно на 1 млн токенов и цена $0,20 за вход и $1,20 за выход за миллион токенов, а у Haiku 4.5 — индекс интеллекта 18, контекст на 200 тыс. токенов и цена $1,00 за вход и $5,00 за выход.
Guides & Insights

GPT-5.6 Luna против Claude Haiku 4.5: дешёвый уровень, очень разные счета

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

GPT-5.6 Luna и Claude Haiku 4.5 — это дешёвые уровни двух разных передовых семейств, и разрыв между ними полностью зависит от того, на какой показатель вы смотрите. По заявленной цене это разгром: $0,20 за миллион входных токенов против $1,00. По стоимости одной выполненной задачи Intelligence Index от Artificial Analysis — $0,18 против $0,21, разница около 14%. Одни и те же две модели, два честных ответа, и причина их расхождения — это самое полезное, что стоит понять, прежде чем выбирать одну из них.

Коротко: Luna — более сильная модель на бумаге и более быстрая по пропускной способности, но она долго размышляет и выставляет за это счёт. Haiku 4.5 — старше, менее масштабна и значительно более предсказуема в том, сколько будет стоить запрос. Что из этого важнее — свойство вашей рабочей нагрузки, а не моделей.

Краткий обзор

Поставщик — Open​AI против Anth​hropic

Выпущено — 9 июля 2026 г. против 15 октября 2025 г.

Контекстное окно — 1M токенов против 200K токенов

Максимальный вывод — 128K токенов против 64K токенов

Ввод — текст, изображение и файл против текста, изображения и PDF

Цена за миллион токенов — $0,20 за вход / $1,20 за выход против $1,00 за вход / $5,00 за выход

Artificial Analysis Intelligence Index — 38, 4-е из 177 против 18, 138-е из 200 (оба в конфигурации рассуждений)

Стоимость одной задачи Intelligence Index — $0.18 против $0.21

Скорость вывода — 109.4 токенов/с против 84.7 токенов/с

Управление рассуждением — регулятор усилий от «нет» до «максимум» в отличие от расширенного мышления, включаемого вручную, без параметра усилий

Надёжная дата отсечки знаний — февраль 2026 г. против февраля 2025 г. (данные обучения по июль 2025 г.)

Обязательство по выходу на пенсию — не опубликовано против не ранее 15 октября 2026 г.

Где GPT-5.6 Luna действительно побеждает

Screenshot of an Artificial Analysis head-to-head between GPT-5.6 Luna (max) and Claude 4.5 Haiku (Reasoning). The Intelligence Index row reads 38 against 18, AA-Briefcase 1339 against 614, GDPval-AA v2 1489 against 854, AutomationBench-AA 50% against 3%, Terminal-Bench v4.0 12% against 0%, SciCode 54% against 42%, Humanity's Last Exam 39% against 10%, GDPpdf 24% against 4%, CritPt 21% against 0%, AA-Omniscience -10 against -4, and AA-LCR v1.1 84% against 74%. The Cost section shows a blended price per 1M tokens of $0.174 against $0.77.

По возможностям — с большим отрывом. Индекс интеллекта 38 против 18 — это не близкое сравнение. Luna превосходит Haiku по композитному показателю, который Artificial Analysis строит на основе оценок рассуждений, знаний, математики и программирования, и при этом является более дешёвой моделью за токен. Тем, кто в последний раз сравнивал эти два семейства по индексу до сентября — где Luna показывала 51 и 52, — стоит учесть, что всю шкалу пересчитали в сентябре 2026 года, и преимущество Luna сохранилось после пересчёта.

Контекст — в пять раз больше. Окно в 1M токенов против 200K само по себе определяет целую категорию работ: проходы по всему репозиторию, длинные наборы документов, расширенные транскрипты агентов, которые на Haiku потребовали бы суммаризации. Если ваше приложение определяется тем, сколько контекста оно должно удерживать, сравнение на этом заканчивается.

Запас по объёму вывода — вдвое больше. Максимум в 128K выходных токенов против 64K важен для генерации длинных текстов и для агентных циклов, возвращающих структурированные планы, а не ответы в одну строку.

Пропускная способность. 109,4 выходных токена в секунду против 84,7 — это реальная разница для потоковых интерфейсов, хотя это не то же самое, что отзывчивость, — см. раздел о задержке ниже.

Цена — на ценнике. В пять раз дешевле на входе и примерно в четыре раза дешевле на выходе — это не погрешность округления, а для работы с коротким выводом это и есть всё решение.

Где Claude Haiku 4.5 всё ещё заслуживает своё место

Предсказуемая стоимость. Рассуждения Haiku 4.5 — это расширенное мышление, которое вы включаете вручную. Если его не включить, модель отвечает напрямую и тарифицируется предсказуемо. У GPT-5.6 Luna регулятор усилий можно выкрутить на максимум, и каждый шаг вверх — это больше выходных токенов по тарифу за вывод. Команде, которой нужен потолок расходов, который можно назвать заранее, будет проще рассуждать о Haiku, даже при более высокой заявленной цене.

Конфигурация без рассуждений действительно недорога в эксплуатации. Artificial Analysis присваивает конфигурации Claude 4.5 Haiku без рассуждений 15 баллов по Индексу интеллекта, не публикуя при этом показатель стоимости выполнения задачи, и она вполне подходит для задач, где планка — просто «разобрать это правильно» — классификация намерений, извлечение полей, решения о маршрутизации, триаж модерации. На таких задачах разрыв по индексу между 15 и 38 в основном не имеет значения, потому что ни от одной из моделей не требуется думать.

Кэширование и пакетные скидки — уже зрелые решения. Haiku 4.5 предоставляет 90%-ную скидку на чтение из кэша промптов и 50%-ную скидку на Batch API. У Luna сопоставимая экономика кэширования, так что это скорее паритет, чем преимущество, — но если ваш конвейер уже работает с пакетами через инструменты Anthropic, затраты на миграцию с Haiku — это реальные издержки, и они не проявятся ни в одном бенчмарке.

Проверенный опыт эксплуатации. Haiku 4.5 находится в продакшене с октября 2025 года, и для него опубликовано обязательство по выводу из эксплуатации не ранее 15 октября 2026 года. Luna существует всего два месяца. Для рабочей нагрузки, где модель — деталь, а не продукт, одиннадцатимесячная история эксплуатации в продакшене значит нечто такое, чего не выразить никаким бенчмарком.

Это более правдивая модель — по той единственной оси, которая это измеряет. В прямом сравнении от Artificial Analysis Luna опережает почти по каждому показателю способностей — AA-Briefcase 1 339 против 614, GDPval-AA v2 1 489 против 854, AutomationBench-AA 50% против 3%, Humanity's Last Exam 39% против 10%, GDPpdf 24% против 4%. Исключение — AA-Omniscience, который штрафует за уверенные неверные ответы на вопросы о знаниях: там Luna набирает -10 против -4 у Haiku. Отрицательный балл означает, что штраф за галлюцинации перевешивает начисление за точность, и у Luna этот штраф больше. Более высокий сводный индекс — не то же самое, что более надёжный ответ, и в единственном тесте, созданном, чтобы разделить эти две вещи, более старая модель показывает лучший результат.

Расчёт затрат на реальной рабочей нагрузке

Возьмём конвейер, который потребляет 100 млн входных токенов и выдаёт 20 млн выходных токенов в месяц.

GPT-5.6 Luna — 100 × $0.20 = $20, плюс 20 × $1.20 = $24. Итого $44 в месяц.

Claude Haiku 4.5 — 100 × $1,00 = $100, плюс 20 × $5,00 = $100. Итого $200 в месяц.

При таких соотношениях Luna примерно в 4,5 раза дешевле, и именно такой расчёт публикует большинство сравнений. Теперь измените одно допущение. Если повысить уровень усилий Luna на рассуждение, количество её выходных токенов растёт, а выход — это дорогая сторона: при $1.20 он стоит в шесть раз дороже, чем вход. Доведите Luna до точки, когда она выдаёт 150 млн выходных токенов на тот же объём работы, как это происходит в оценочном наборе Artificial Analysis, и $44 превращаются в уверенно более $180. Разница в 4,5 раза схлопывается почти до паритета.

Урок не в том, что Luna дорогая. А в том, что ценовое преимущество Luna зависит от того, сколько она говорит, а это параметр, которым управляете вы. Снизьте уровень рассуждений для извлечения и классификации — и скидка станет реальной. Оставьте его на максимуме для всего — и вы купили более способную модель по цене, которая уже не похожа на ценник.

Задержка и число, которому не стоит доверять

Опубликованные показатели времени до первого токена для этих двух моделей практически бесполезны, и стоит понять почему. На Artificial Analysis конфигурации рассуждений обеих моделей демонстрируют задержку до первого токена в десятки или даже сотни секунд, поскольку тестовый стенд не выдаёт токен, пока модель не завершит рассуждения. Этот показатель характеризует настройку оценки, а не отзывчивость модели.

Телеметрия маршрутизации — более подходящий источник, поскольку она измеряет модель в продакшене. Собственные данные OrcaRouter показывают, что у GPT-5.6 Luna медиана времени до первого токена составляет 1,83 секунды, а 95-й процентиль — 10,00 секунды, тогда как у Claude Haiku 4.5 медиана равна 3,81 секунды, а 95-й процентиль — 9,47 секунды. При правильном прочтении это означает, что две модели ближе друг к другу, чем предполагают таблицы лидеров: Luna выигрывает на типичном запросе, а хвосты различаются примерно на полсекунды. Если вас беспокоит худший случай, а не средний, между ними почти нет разницы.

Какой выбрать?

Выбирайте GPT-5.6 Luna, если у вас длинный контекст, если задаче идёт на пользу настоящее рассуждение, если вывод длинный или структурированный либо если вам нужна самая мощная модель из доступных в нижней части ценового диапазона. Это также более естественный выбор, если остальная часть вашего стека уже работает по логике семейства Open​AI.

Выберите Claude Haiku 4.5, если ваша работа предполагает короткий вывод и большие объёмы, если вам нужен потолок затрат, который можно указать до выполнения запроса, если ваш конвейер уже построен вокруг пакетной обработки и кэширования Anthropic, или если вы цените модель с историей работы в продакшене и опубликованным жизненным циклом больше, чем модель, которой всего два месяца.

Не выбирайте ни того, ни другого для задачи, с которой справилась бы небольшая модель рассуждений или дообученный классификатор. Значительная часть трафика, которую поглощают эти два уровня, — это классификация и извлечение, которые дешевле было бы выполнять на чём-то более узком, — а самая дешёвая модель — всегда та, которая вам не понадобилась.

Запуск обоих на одном ключе

Screenshot of the OrcaRouter model page for Claude Haiku 4.5, showing the model identifier anthropic/claude-haiku-4.5, a release date of 2025-10-15, a 200K-token context window, 64K maximum output, input pricing of $1.00 per million tokens, output pricing of $5.00, a median time to first token of 3.81 seconds and a 95th percentile of 9.47 seconds.

Противостояние перестаёт быть эксклюзивным, как только обе модели становятся доступны через единый эндпоинт. В OrcaRouter Claude Haiku 4.5 и GPT-5.6 Luna находятся за одним и тем же базовым URL, совместимым с OpenAIодин API для 200+ моделей, один ключ, одна строка биллинга, никакого второго контракта и никаких изменений в коде, кроме идентификатора модели. Для решения о тарифе, в котором вы ещё не уверены, это превращает миграцию в значение конфигурации.

Две функции здесь реально работают. Автоматическое переключение при сбое между провайдерами означает, что недорогой уровень может обслуживать продакшен-трафик без зависимости от одного вендора — это полезно, когда модель достаточно дешёвая, чтобы вы отправляли ей тысячи вызовов в час, а не один важный. А DSL маршрутизации позволяет составлять вызов из нескольких моделей: направлять простую большую часть запросов в Luna, эскалировать остаток в GPT-5.6 Terra и держать Haiku 4.5 в пуле как резервный вариант, когда вам нужен ответ второго вендора, а не повторная попытка.

Проверьте актуальную ставку за токен для GPT-5.6 Luna и Claude Haiku 4.5, прежде чем выбирать один из них для продакшена — обе ставки передаются с наценкой 0%, поэтому они меняются в тот же день, когда их меняет поставщик, а сторонние сервисы отслеживания цен отстают на дни или недели.

Вопросы, на которые действительно стоит отвечать

Действительно ли GPT-5.6 Luna в пять раз дешевле Claude Haiku 4.5? По входным токенам — да: $0.20 против $1.00. По стоимости выполнения той же оцениваемой задачи — нет: $0.18 против $0.21. Разрыв между этими двумя утверждениями — это многословность Luna. Для выполнения той же работы она выдаёт примерно вдвое больше выходных токенов, чем Haiku, а выходные токены стоят в шесть раз дороже входных. Для коротких ответов ценник в целом честен. Для работы, требующей интенсивных рассуждений, — нет.

Можно ли настраивать стоимость одинаково в обоих?Нет, и это самое часто упускаемое из виду различие между ними. Luna предоставляет регулятор усилия рассуждений с настройками от none до max, так что стоимость и качество явно соотносятся друг с другом в каждом запросе. Расширенное мышление Haiku 4.5 либо включено, с бюджетом токенов, либо нет — параметра усилия не существует. Если вам важен контроль стоимости на уровне отдельного запроса, только один из этих двух даёт вам такой рычаг.

А что насчёт высоконагруженного классификатора, выполняющего несколько миллионов вызовов в день? Ни одной из этих моделей для этого не требуется рассуждение. Запустите Haiku 4.5 с отключённым расширенным мышлением или Luna с параметром effort, установленным на none, и сравнивайте по задержке и длине вывода, а не по составному индексу — на этом этапе важные вопросы — как быстро приходит первый токен и сколько токенов занимает ответ, а бенчмарки интеллекта перестают различать их между собой.

A two-column comparison scoreboard for GPT-5.6 Luna and Claude Haiku 4.5. Luna's column reads Intelligence Index 38, context window 1M tokens, price $0.20/$1.20, cost per index task $0.18, output speed 109.4 tokens per second, reasoning control an effort dial from none to max. Haiku 4.5's column reads Intelligence Index 18, context window 200K tokens, price $1.00/$5.00, cost per index task $0.21, output speed 84.7 tokens per second, reasoning control extended thinking on or off.

Какая из них всё ещё будет доступна через год?У Claude Haiku 4.5 есть опубликованное обязательство: модель не будет выведена из эксплуатации до 15 октября 2026 года. OpenAI не публикует аналогичную дату для GPT-5.6 Luna, а у линейки GPT-5.6 уже есть более новое поколение выше неё — GPT-6 Astra. Ни то, ни другое не является поводом избегать Luna, но если ваш роадмап исходит из одиннадцатимесячного горизонта планирования, это повод хранить идентификатор модели в конфигурации, а не задавать его жёстко в коде.

Актуальная ставка за токен для GPT-5.6 Luna на том же ключе, передаётся с наценкой 0% и без второго биллингового отношения.

Актуальная цена за токен для Claude Haiku 4.5 на том же эндпоинте, чтобы два тарифа можно было сравнить без второго договора.