Сгенерирована титульная hero-карточка с заголовком «GPT-6 Luna vs Qwen3.8-Max», подзаголовком «Самая дешёвая модель здесь — не та, что смотрит видео», нижним колонтитулом с надписью «Цены по данным OpenAI и Alibaba Cloud; показатели индекса по данным Artificial Analysis.» и логотипом OrcaRouter, наложенным в правом нижнем углу.
Guides & Insights

GPT-6 Luna против Qwen3.8-Max: самая дешёвая модель в этом сравнении также является единственной, которая смотрит видео

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Очевидная трактовка этой пары — неверная. Qwen3.8-Max стоит $2.00 за миллион входных токенов и $6.00 за миллион выходных, а чтение из кэша — $0.25. GPT-6 Luna стоит $0.10 и $0.50, а чтение из кэша — один цент. В двадцать раз выше на входе, в двенадцать раз выше на выходе, в пятьдесят раз выше на кэшированном входе — ценовой разрыв настолько широк, что сравнение кажется предрешённым ещё до его начала.

Это не решено, потому что две модели не конкурируют за один и тот же запрос. Qwen3.8-Max принимает текст, изображения и видео, а его потолок вывода в 131 072 токена немного выше, чем 128 000 у GPT-6 Luna. GPT-6 Luna принимает только текст и изображения. Модель Alibaba набирает 58 баллов в независимом Intelligence Index — первое место в своём классе на агентной панели — а GPT-6 Luna набирает 37 при максимальном усилии и 29 при настройке по умолчанию. Одна — флагман с происхождением из открытых весов и модальностью видео на входе. Другая — массовый уровень с показателем скорости и ценой кэша в один цент. Разрыв в цене — это не скидка на одно и то же; это описание двух разных вещей.

Что представляет собой каждый из этих двух

Qwen3.8-Max — флагман Alibaba поколения 3.8, чекпойнт класса Max, базовая модель которого — Qwen3.8-2.4T-A95B — была публично выпущена по кастомной лицензии 12 августа 2026 года, что делает его первым Qwen класса Max, у которого вообще есть открытые веса. Сам хостируемый флагман по-прежнему числится независимым советом как проприетарный. Он несёт контекстное окно в 1 000 000 токенов, потолок вывода в 131 072 токена, приём текста, изображений и видео, а также выбираемое усилие рассуждений на низком, среднем и сверхвысоком уровнях. Закреплённая ревизия Qwen3.8-Max-0902 доступна по той же цене — небольшая деталь с реальной операционной ценностью.

GPT-6 Luna — это уровень эффективности от OpenAI от 22 сентября 2026 года, расположенный ниже GPT-6 Sol за $2.00/$10.00 и флагманской GPT-6 Astra за $10.00/$50.00. Ввод текста и изображений, вывод текста, окно размером 1 050 000 токенов с максимальным вводом 922 000, потолок вывода 128 000 токенов, а также уровни усилий от none до low, medium, high, xhigh и max, при этом medium используется по умолчанию. Закрытая, с единым идентификатором, доступна любому, у кого есть API-ключ.

Один поддерживает видео и может быть загружен в своей базовой версии. Один поддерживает изображения и работает быстро. Оба имеют цену, рассчитанную на использование в больших объёмах. Совпадение между этими двумя утверждениями меньше, чем можно предположить по соотношению цен.

Карточки, строка за строкой

По одной строке на каждое измерение, обе стороны — на каждом:

• Ввод за 1 млн — GPT-6 Luna $0.10 против Qwen3.8-Max $2.00

• Вывод за 1M — GPT-6 Luna $0.50 против Qwen3.8-Max $6.00

• Кэшированный ввод на 1 млн — GPT-6 Luna $0.01 против Qwen3.8-Max $0.25 за неявные чтения из кэша, при этом явное чтение из кэша — $0.17, а явная запись в кэш — $2.50

• Условие для длинного контекста — GPT-6 Luna удваивает входные данные и кэш и повышает объём вывода в 1,5 раза при превышении 272 000 входных токенов, применяясь ко всему запросу, тогда как у Qwen3.8-Max по всему окну действует единый тариф; и это единственное место, где карточка Qwen структурно лучше, а не просто немного дешевле.

• Контекстное окно — GPT-6 Luna 1 050 000 токенов против Qwen3.8-Max 1 000 000 токенов

• Максимальный вывод — 128 000 токенов у GPT-6 Luna против 131 072 токенов у Qwen3.8-Max

• Входные модальности — текст и изображение GPT-6 Luna в сравнении с текстом, изображением и видео Qwen3.8-Max

• Усилие рассуждения — GPT-6 Luna: none, low, medium (по умолчанию), high, xhigh, max против Qwen3.8-Max: low, medium и extra-high

• Индекс интеллекта, независимый — GPT-6 Luna 37 при максимальном усилии против Qwen3.8-Max 58

• Agentic Index, независимый — Qwen3.8-Max 58, первый в своём классе; сопоставимый показатель GPT-6 Luna не опубликован

• Балл при стандартном усилии — GPT-6 Luna 29 на его среднем уровне по умолчанию против Qwen3.8-Max, измеренного на максимальной настройке

• Стоимость одной задачи Index, независимо — GPT-6 Luna около $0.07 против Qwen3.8-Max $5.41

• GDPval, независимая оценка — Qwen3.8-Max: 1 739 Elo при 64 ходах на задачу, что составляет примерно $1,14 за выполненную задачу в рамках этой оценки; сопоставимый прогон GPT-6 Luna не опубликован.

• Уровень галлюцинаций в AA-Omniscience — Qwen3.8-Max 40%, регресс с 23% у предыдущего поколения; GPT-6 Luna 77%, снижение с 93%

• Снимок на дату — GPT-6 Luna: единый «плавающий» идентификатор против Qwen3.8-Max-0902, доступного в виде закреплённой ревизии от 2 сентября 2026 года по той же цене

• Веса — GPT-6 Luna закрыты, доступ только через API, в отличие от Qwen3.8-Max: базовый чекпойнт Qwen3.8-2.4T-A95B публично доступен под кастомной лицензией с 12 августа 2026 года, тогда как хостируемый флагман указан как проприетарный

• В OrcaRouter: GPT-6 Luna отсутствует в нашем каталоге, тогда как Qwen3.8-Max доступна для маршрутизации по прейскурантной цене Alibaba.

Generated two-column scoreboard titled 'GPT-6 Luna vs Qwen3.8-Max - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index 37 at max effort, Context 1,050,000, Input text + image, Cost per index task $0.07. Right column Qwen3.8-Max rows: Price in/out $2.00 / $6.00, Cached input $0.25, AA Index 58, Context 1,000,000, Input text + image + video, Cost per index task $5.41. Footer: 'Prices per OpenAI and Alibaba Cloud; index figures per Artificial Analysis.'

Видео — это не линейка функций, это другая рабочая нагрузка.

Строка модальности — это та, которая определяет больше реальных сравнений, чем строка цены, и обычно читается как флажок.

Qwen3.8-Max принимает видео. GPT-6 Luna — нет. Если ваш пайплайн должен анализировать запись экрана, демонстрацию продукта, запись лекции, фрагмент с камеры наблюдения или обзор интерфейса, сравнение заканчивается на этой границе, и двадцатикратная разница в цене становится несущественной — вы выбираете не между дорогим вариантом и дешёвым, а между вариантом и его отсутствием. Извлечение кадров и передача их в виде изображений — это обходной путь, а не эквивалент, и любой, кто его строил, знает разницу как в стоимости, так и в качестве.

Если ваш пайплайн работает с текстом и изображениями, строка модальности молчит, а строка цены говорит. Это честное разделение, и стоит прямо сказать, на какой его стороне вы находитесь, прежде чем читать что-либо ещё на этой странице.

Агентный разрыв реален, и именно на него приходится дорогая половина разницы в цене.

Qwen3.8-Max набирает 58 баллов в независимом Intelligence Index. GPT-6 Luna набирает 37 при максимальном усилии и 29 при стандартном medium. Двадцать один балл при одинаковых настройках, двадцать девять при настройках по умолчанию — в составном показателе, где один балл укладывается в шум повторного прогона, разрыв такого размера не является шумом.

Позиционирование Qwen3.8-Max сосредоточено на агентной работе. Он набирает 58 баллов в независимом Agentic Index, занимая первое место в своём классе, и 1 739 Elo в GDPval при 64 ходах на задачу. Последняя цифра — самая говорящая: это измерение того, как модель удерживает задачу как единое целое на протяжении шестидесяти четырёх последовательных решений, и к этому прилагается ценник — примерно $1,14 за завершённую задачу в этой оценке. Сравните это с ценой GPT-6 Luna за задачу в индексе — около $0,07, и честное утверждение не в том, что Qwen дорогой. А в том, что Qwen просят делать гораздо более сложную вещь — и он её делает.

Следствие состоит в том, что отставание GPT-6 Luna в двадцать один пункт также распределено по вашей рабочей нагрузке неравномерно. На короткой, хорошо специфицированной задаче, потребляемой программой — извлечь это поле, классифицировать эту заявку, маршрутизировать этот запрос — обе модели будут выдавать один и тот же пригодный ответ почти всегда, и разрыв в индексе будет незаметен в вашей оценке. На задаче, требующей шестидесяти четырёх последовательных действий с контрольной точкой в конце, разрыв — это разница между завершением и тихой остановкой на полпути, и именно для такой задачи был создан Qwen3.8-Max, а GPT-6 Luna — нет.

Одна цифра свидетельствует об обратном и заслуживает того, чтобы её озвучили, а не замолчали. Уровень галлюцинаций Qwen3.8-Max на табло всеведения составляет 40%, что выше 23% у предыдущего поколения — существенная регрессия, причём такая, которая проявляется в продакшене как уверенные неверные ответы, а не как строка в бенчмарке. У GPT-6 Luna — 77%, снижение с 93%. Оба показателя высоки в абсолютных величинах, и более дешёвая модель по-прежнему хуже из этих двух по данному критерию. Ни одна из этих цифр не является причиной предпочесть одну модель; обе — причины держать человека или верификатора в контуре всего, где сфабрикованный факт дорого обходится.

Пункт о длинном контексте — это единственная строка, где Qwen выигрывает по структуре.

В GPT-6 Luna есть пункт, которого нет в Qwen3.8-Max: запросы свыше 272 000 входных токенов тарифицируются по удвоенным ставкам за входные токены и кэш и по ставке за вывод, умноженной на 1,5, причём это применяется ко всему запросу, а не только к части, превышающей порог. Вызов на 300 000 токенов в GPT-6 Luna тарифицируется по 0,20 $ за миллион входных токенов для всех 300 000 токенов, потому что превышение составило 28 000. Разделите один и тот же документ на два вызова — и стоимость снизится вдвое без изменения промпта.

У Qwen3.8-Max цена не меняется на всём его окне в 1 000 000 токенов. Для по-настоящему огромных одиночных запросов это делает двенадцатикратный разрыв в цене вывода меньше, чем он кажется, и может его перевернуть: после 272 000 входных токенов эффективная ставка за ввод у GPT-6 Luna удваивается до $0,20, а ставка за вывод возрастает до $0,75 — против неизменных $2,00 и $6,00 у Qwen. Разрыв сокращается с двадцатикратного до десятикратного по вводу и с двенадцатикратного до восьмикратного по выводу. Всё ещё велик — но нагрузки, у которых с наибольшей вероятностью будет рабочий контекст в 300 000 токенов, — это ровно те агентные сценарии, в которые оба вендора продают свои решения, а команды, которые их запускают, — это именно те команды, которые это заметят.

Другая структурная строка — это закреплённая ревизия. Qwen3.8-Max-0902 доступна по той же цене, что и плавающий идентификатор, а значит, команда, которой нужно воспроизводимое поведение при обновлении модели, может получить его без дополнительной платы. GPT-6 Luna не предлагает аналога. Это маленькая строка в тарифной карте и большая строка в постмортеме.

Запуск одного из них или обоих

Qwen3.8-Max доступен на OrcaRouter по каталожной цене Alibaba; при сквозном ценообразовании это означает, что изменение тарифа поставщика вступает в силу на нашей стороне в тот же день. Две вещи в нашем слое маршрутизации оправдывают своё место для этой конкретной модели: автоматическое переключение при сбое, потому что хостируемый флагман с опубликованной открытой весовой базой имеет больше апстримов, чем закрытая модель одного поставщика, и больше способов для одного из них деградировать; и обработка закреплённой ревизии, которая позволяет маршруту явно удерживать Qwen3.8-Max-0902, а не наследовать то, во что разрешится плавающий идентификатор на следующей неделе.

GPT-6 Luna на момент написания этого текста отсутствует в нашем каталоге, и доступ к ней осуществляется через собственный API OpenAI, поэтому команда, которой нужны обе модели, использует один ключ для Qwen3.8-Max наряду с тем, что она уже использует для OpenAI. Это также та пара, где DSL маршрутизации ценнее статического разделения, потому что граница между двумя моделями — это проверка модальности и проверка длины, а не предпочтение: запросы с видео идут в Qwen3.8-Max, потому что больше ничто не может их обслужить; запросы, превышающие 272,000 входных токенов, идут в Qwen3.8-Max, потому что из-за ценового обрыва у другой модели они обходятся там дороже; а всё остальное идёт к модели, которая стоит в двадцать раз дешевле. Это правило, и его место — в конфигурации, а не в ветке приложения.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

Какой именно, и когда

Выбирайте Qwen3.8-Max, если верно хотя бы одно из следующего. Вашему пайплайну нужен видеовход. Ваши запросы регулярно превышают 272 000 входных токенов, где его фиксированный тариф превосходит пересмотренное ценообразование GPT-6 Luna. Ваш вывод превышает 128 000 токенов. Ваша работа — это долгосрочное агентное выполнение с проверяемой конечной точкой, где его 58 в агентном рейтинге и 1 739 Elo в GDPval при 64 ходах на задачу — это доказательства, которые имеют значение. Или вам нужна закреплённая ревизия для воспроизводимости, и вы готовы за неё платить — что при той же цене, что и у плавающего идентификатора, означает, что вы не готовы.

Выбирайте GPT-6 Luna, если ничего из перечисленного не подходит, а ваша рабочая нагрузка отличается большим объёмом, потребляется программами, включает текст и изображения и является короткой. Классификация, извлечение, маршрутизация, массовая суммаризация, внутренний цикл агента, которому нужен быстрый ответ, а не тщательный. При $0.10/$0.50, чтении из кэша за один цент и стоимости выполнения одной задачи примерно в пятнадцать раз ниже, чем у Qwen3.8-Max, арифметика не оставляет шансов. Задавайте параметр effort явно — по умолчанию используется medium, а заявленное значение 37 — это показатель при максимальном усилии — и держите длинные вызовы в пределах 272 000 токенов.

Ошибка, к которой подталкивает это сравнение, — воспринимать двадцатикратную цену ввода как вердикт. Это вердикт об одной форме нагрузки, и он молчит о трёх условиях, которые определяют другую: несёт ли запрос видео, переходит ли он порог в 272 000 токенов и должен ли ответ выдержать шестьдесят четыре последовательных шага.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) showing the breadcrumb Home > Models > Qwen > Qwen3.8 Max (0902), a NEW badge, the model id qwen/qwen3.8-max-0902, Vision, Tools, JSON and Reasoning chips, a Qwen attribution dated 2026-09-02, the description of a September 2, 2026 snapshot accepting text, image and video input with a 1M-token context, input pricing of $2.00 and output of $6.00 per 1M tokens, a p50 time to first token of 3.50s, a p95 of 9.38s, and traffic of 196.6M tokens over seven days.

Сравнение в этой статье3

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно