Сгенерированная hero-карточка для GPT-6.1 Sol с заголовком «Независимая оценка получена», со значками «Дата выпуска: 29 сентября 2026 г.», «Индекс интеллекта: 52 при максимальном усилии» и «Стоимость одной задачи индекса: $0.72», нижним колонтитулом с текстом «Независимые показатели по данным Artificial Analysis, индекс v4.3.2, считаны 30 сентября 2026 г.» и логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Опубликована первая независимая оценка GPT-6.1 Sol: отставание от Astra — 0,84 балла при менее чем четверти затрат на задачу

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Каждая публикация о GPT-6.1 Sol, опубликованная в дни после выпуска Ope​nAI на DevDay 29 сентября 2026 года — включая этот блог — содержала ту же оговорку: цифры возможностей были от поставщика, и ни одна третья сторона не оценивала модель. Эта оговорка теперь устарела. Artificial Analysis имеет строку GPT-6.1 Sol в своём Intelligence Index, полученную при максимальных усилиях рассуждения, и это первая цифра за короткую жизнь этой модели, которую Ope​nAI не получила. Она показывает 51,8 против 52,7 для GPT-6 Astra и 47,5 для GPT-6 Sol — разрыв менее одного балла до флагмана стоимостью $10/$50, и рост на 4,3 балла по сравнению с моделью, которую заменяет GPT-6.1 Sol. Цифра, которая делает строку интересной, — это та, что рядом с ней: табло указывает стоимость оценочного запуска, стоящего за каждой оценкой, и индексный запуск GPT-6.1 Sol стоил $0,72 за задачу, тогда как у Astra он стоил $3,26. Четыре с половиной раза больше денег за 0,84 балла — это всё сравнение в одной строке, и теперь это измеренная строка, а не представление поставщика о ней.

Сама строка и то, на чём она выполнялась

A screenshot of the Artificial Analysis model page for GPT-6.1 Sol at maximum reasoning effort, headed 'GPT-6.1 Sol (max) Intelligence, Performance & Price Analysis', with a class-rank strip above the summary naming the model's Intelligence, Speed, Cost and Verbosity positions out of 221 models. The summary paragraph reports an Intelligence Index score of 52 against a median of 26 across 221 models in the class, $2.00 per million input tokens and $10.00 per million output tokens, $0.72 per task to evaluate on the Intelligence Index, and 67 tokens per second against an average of 74, with 67 million output tokens generated against a board median of 82 million; a panel to its right lists a 1M-token context window together with text-and-image input. The page names Intelligence Index v4.3.2 and its ten constituent evaluations.

Artificial Analysis публикует свой Intelligence Index как композит из десяти оценок, и версия, работавшая 30 сентября 2026 года, была v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience и AA-LCR v1.1. Все три модели OpenAI в этом материале относятся к той же версии, поэтому приведённое ниже сравнение является сопоставимым так, как никогда не бывает в собственной таблице запуска вендора. В рейтинге также указана дата выпуска, которая у него есть для модели, — 2026-09-29, дата DevDay, — и она оценивается в конфигурации max-effort, то есть в настройке, которую страница называет в собственном заголовке.

• Intelligence Index — 51,8 для GPT-6.1 Sol (max), 52,7 для GPT-6 Astra (max), 47,5 для GPT-6 Sol (max).
• Стоимость одной задачи индекса — $0,72 для GPT-6.1 Sol, $3,26 для Astra, $1,05 для GPT-6 Sol. Это собственная цифра лидерборда за то, во сколько обошёлся запуск одной полной оценки индекса, а не прайс-лист.
• Выходные токены, израсходованные за запуск — 67,2 миллиона для GPT-6.1 Sol, 60,0 миллиона для Astra, 76,8 миллиона для GPT-6 Sol. Собственный комментарий AA называет 67 миллионов «довольно лаконичными» на фоне медианы по лидерборду в 82 миллиона, и это вторая, более тихая победа над моделью, которую он заменяет.
• Скорость вывода — 66,8 токена в секунду для GPT-6.1 Sol, 57,0 для Astra, 76,2 для GPT-6 Sol.
• Цены в том виде, в каком их приводит лидерборд — $2,00 за ввод и $10,00 за вывод за миллион токенов для GPT-6.1 Sol, при этом кэшированный ввод — $0,10, а записи в кэш — $2,50. Эти четыре числа в точности совпадают с прайс-листом вендора, и это самое недраматичное и самое полезное в этой строке: независимый перечень тарифов, которые мы уже приводили.

Одно вводное замечание, прежде чем эти числа начнут использовать как оружие. Индекс AA состоит из десяти оценок, и оценки, которыми OpenAI открыла собственный анонс, — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1, — в него не входят. AA использует собственный вариант AutomationBench, и это не тот же самый испытательный стенд, что версия AutomationBench, на которую ссылался вендор. Так что независимые данные не подтверждают и не опровергают четыре главных утверждения из поста о запуске; они измеряют во многом другой набор задач, и их стоит читать как второе мнение об облике модели, а не как вердикт по этим конкретным фразам.

Astra всё равно побеждает, пусть и с преимуществом менее одного балла, но зато за сумму в четыре с половиной раза больше.

A generated scoreboard titled 'GPT-6.1 Sol - the independent scoreboard', listing six rows: Intelligence Index 51.8 at maximum effort, cost per index task $0.72 against GPT-6 Astra's $3.26, output tokens on the run 67.2 million, output speed 66.8 tokens per second, price $2.00 input and $10.00 output per million tokens with cached input at $0.10, and release date September 29, 2026. A footer reads that all figures are per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.

Обе модели предлагают лестницу уровней усилий, и совет теперь опубликовал оценку и стоимость запуска для каждой ступени обеих. Выстроенные рядом, эти лестницы говорят то, чего не может сказать одно сравнение по главному показателю: лучшая конфигурация GPT-6.1 Sol соревнуется не с лучшей конфигурацией Astra. Она соревнуется со второй по силе конфигурацией Astra.

• GPT-6.1 Sol, макс. — 51,8, $0,72 за задачу индексирования. GPT-6 Astra, макс. — 52,7, $3,26.
• GPT-6.1 Sol, сверхвысокий — 51,0, $0,39. GPT-6 Astra, сверхвысокий — 52,4, $2,31.
• GPT-6.1 Sol, высокий — 50,2, $0,32. GPT-6 Astra, высокий — 50,9, $1,73.
• GPT-6.1 Sol, средний — 47,8, $0,21. GPT-6 Astra, средний — 49,6, $1,54.
• GPT-6.1 Sol, низкий — 42,1, $0,13. GPT-6 Astra, низкий — 45,8, $0,82.

Astra лидирует на каждой ступени — это честная сводка противостояния, а также самая неинтересная его часть. Интересная часть — это обменный курс. Если вам нужна самая дешёвая конфигурация Astra, которая обходит лучший результат GPT-6.1 Sol, это Astra на xhigh: 52,4 против 51,8, за $2,31 против $0,72. Это 0,56 пункта индекса за дополнительные $1,59 на каждый прогон оценки — примерно в 3,2 раза дороже за менее чем один процент от счёта. Двигайтесь в другую сторону и опустите GPT-6.1 Sol до xhigh — и вы отдаёте 0,8 пункта, тогда как счёт падает до $0,39, что в 5,9 раза дешевле, чем Astra на xhigh, и составляет одну девятую стоимости прогона Astra с максимальными усилиями.

Есть второе прочтение той же лестницы, которое говорит против покупки Astra на максимальном усилии. Четыре нижние ступени Astra все дешевле её максимума, а её xhigh на 0,29 балла ниже максимума — чуть больше половины процента оценки за сокращение стоимости запуска на 29%. Любой разговор о закупке об этой паре, который начинается с «Astra на максимуме» и заканчивается на «Astra стоит в 4,5 раза больше», оставляет собственные более дешёвые ступени Astra за рамками сравнения.

Шесть оценок достаются Astra, две — GPT-6.1 Sol, две — ничья

Сводная оценка скрывает разброс. Если оценивать каждую проверку по отдельности при максимальном уровне усилий, GPT-6.1 Sol — не равномерно немного худшая Astra: он лучше в двух вещах и хуже в шести.

• GDPval-AA — Elo 1575,1 у GPT-6.1 Sol против 1541,9 у Astra, преимущество в 33 пункта в задачах профессиональной работы. Это самая крупная отдельная независимая победа более дешёвой модели.
• AA-LCR v1.1, длинноконтекстное рассуждение — 0,830 против 0,807. GPT-6.1 Sol лидирует.
• AA-Briefcase v1.1 — Elo 1564,2 против 1568,9. Astra опережает на 4,7 пункта.
• AutomationBench-AA — 0,649 против 0,685. Astra опережает на 3,6 пункта.
• Terminal-Bench 4.0 — 0,561 против 0,591. Astra опережает на 3,0 пункта.
• SciCode — 0,542 против 0,565. Astra опережает на 2,3 пункта.
• Humanity's Last Exam — 0,529 против 0,547. Astra опережает на 1,8 пункта.
• AA-Omniscience — 41,5 против 43,4. Astra опережает на 1,9 пункта.
• GDP.pdf и CritPt — абсолютные ничьи на уровне 0,310 и 0,317 соответственно, у обеих моделей.

Две из этих строк значат больше, чем их позиция в списке. Разрыв в GDPval-AA — единственное место, где преимущество более дешёвой модели достаточно велико, чтобы сохраниться при смене харнесса, и он приходится ровно на ту рабочую нагрузку, которую заявляет позиционирование вендора — профессиональная работа с большим объёмом документов. А две абсолютные ничьи — на оценках с самым узким разбросом, что служит напоминанием о том, что совокупный разрыв в 0,84 балла собирается из строк, которые по отдельности варьируются от выигрыша в 33 балла до проигрыша в 3,6 балла.

По сравнению с моделью, которую он заменяет, прирост реален, но неравномерен.

Сравнение, которое важно для всех, кто уже использует GPT-6 Sol в продакшене, — это то, которое 6.1 Sol проводит со своим предшественником, и независимые данные говорят об этом точнее, чем публикация вендора. Восемь из десяти оценок улучшаются. Две — ухудшаются.

• SciCode — GPT-6.1 Sol набирает 0.542, тогда как GPT-6 Sol набирал 0.576. Новая модель хуже в научном коде на 3.5 пункта.
• AA-LCR v1.1 — 0.830 у 6.1 Sol против 0.837 у GPT-6 Sol. На волосок, но не в ту сторону, в оценке длинного контекста.
• AA-Omniscience — 41.5 против 27.1. Это самый крупный сдвиг в строке: скачок на 14.4 пункта в оценке знаний, а точность на этом наборе выросла с 0.545 до 0.621.
• Частота галлюцинаций на том же наборе — 0.543 у GPT-6.1 Sol, снижение с 0.601 у GPT-6 Sol, но всё ещё выше 0.513 у GPT-6 Astra. AA-Omniscience делит свою оценку на «правильно ответил» и «уверенно ошибся», и именно в этом разбиении обновление 6.1 оправдывает себя: это заметно менее нечестная модель, чем Sol, и при этом она всё ещё самая нечестная из трёх.
• Terminal-Bench 4.0 — 0.561 против 0.439, прирост на 12.2 пункта. AA-Briefcase — с 1482.8 до 1564.2 Elo. GDP.pdf — с 0.248 до 0.310.

Трактовка такова: это было обновление знаний и инструментария в большей степени, чем обновление рассуждений. Сильнее всего изменились те оценки, которые вознаграждают знание фактов, а не их выдумывание; упавшая оценка — узкая и техническая. Любой, кто перешёл на 6.1 Sol ради экономии кэша, получает прирост знаний в качестве бонуса и не должен считать, что этот прирост распространяется на каждый тестовый стенд, который он запускает.

Где совет директоров ставит его в рейтинге, и что находится выше

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol — the independent scoreboard', with both columns carrying the same six labels. Left column 'GPT-6.1 Sol (max)': Intelligence Index 51.8, cost per index task $0.72, SciCode 0.542, long-context reasoning 0.830, AA-Omniscience 41.5, hallucination rate 0.543. Right column 'GPT-6 Sol (max)': Intelligence Index 47.5, cost per index task $1.05, SciCode 0.576, long-context reasoning 0.837, AA-Omniscience 27.1, hallucination rate 0.601. A footer reads 'Figures per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.'

В стандартном порядке таблицы лидеров по Intelligence Index GPT-6 Astra при максимальном усилии занимает 7-е место, а GPT-6.1 Sol при максимальном усилии — 10-е, при этом GPT-6 Sol при максимальном усилии — на 20-м месте. Девять строк выше GPT-6.1 Sol — это две конфигурации Astra, три конфигурации Claude Opus 5.5, одна конфигурация Claude Sonnet 5.5 и две конфигурации Claude Fable 5.1 — таким образом, модель, к которой GPT-6.1 Sol ближе всего, — это флагман его собственного семейства, а модель, которую он фактически вытеснил в этом порядке, — это его собственный предшественник, на тринадцать позиций ниже.

Уберите настройку уровня усилий — и порядок сжимается так, что это важно для планирования затрат: GPT-6.1 Sol при xhigh занимает 13-е место, при high — 15-е, при medium — 19-е и при low — 35-е, тогда как Astra находится на 14-м месте при high, 16-м при medium и 26-м при low. Иными словами, GPT-6.1 Sol при xhigh опережает Astra при high в таблице, а GPT-6.1 Sol при medium опережает Astra при low. Уровень усилий здесь — более значимый рычаг, чем выбор модели, по крайней мере среди этих двух.

Что делать с числом, если честно

Заявление вендора, которое проверялось в этой строке, состояло в том, что GPT-6.1 Sol почти не уступает флагману при цене примерно в одну пятую от флагманской. Независимая версия этого утверждения такова: его разрыв с флагманом составляет не более 0,84 индексного пункта, а прогон оценки, давший его балл, обошёлся в 22% от стоимости такого прогона у флагмана. Это достаточно близко к заявлению, чтобы никто не почувствовал себя введённым в заблуждение, и это более сильное утверждение, чем «не проверено», во всех отношениях, важных для покупателя.

Чего эта строка не делает — так это не рассчитывает стоимость вашей рабочей нагрузки. Прогон по индексу — это конкретный набор задач, а число, определяющее реальный счёт, — это тарифная сетка, сопоставленная с вашим собственным профилем токенов; именно поэтому строка кэша по-прежнему остаётся той строкой, которую стоит моделировать: $0,10 за кэшированный ввод у GPT-6.1 Sol против $1,00 у Astra — это десятикратная разница, которой не касается ни один индексный балл. С нашей стороны действует тот же сквозной принцип: OrcaRouter предоставляет GPT-6 Astra, GPT-6 Sol и GPT-6 Luna по собственным прайс-листовым ценам OpenAI без добавления наценки, так что в день, когда тариф поставщика меняется, тариф на нашей стороне меняется вместе с ним, а не ждёт второго контракта. GPT-6.1 Sol отсутствует на наших маршрутах — публичный каталог сегодня возвращает «model not found» для openai/gpt-6.1-sol, и нет честного способа описать модель, которую мы не можем обслуживать. Что действительно даёт вам один API-ключ прямо сейчас — так это пара, о которой, собственно, и спорит бенчмарк — Astra для самой сложной работы, Sol для объёма — с прайс-листовыми ценами провайдеров, передаваемыми без наценки, и автоматическим переключением между провайдерами при ошибке одного из них.

Две вещи сделали бы это ещё точнее. Второй независимый тестовый стенд на той же модели сказал бы нам, является ли преимущество GDPval-AA свойством модели или того оценивания, и это — самая полезная недостающая точка данных в строке. А независимое измерение уровня длинного контекста в 272 000 токенов значило бы больше, чем ещё одна составная точка, потому что именно там ценообразование этого семейства перестаёт быть дешёвым.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно