
Опубликована первая независимая оценка GPT-6.1 Sol: отставание от Astra — 0,84 балла при менее чем четверти затрат на задачу
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 397 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 195 tok/s
- OrcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- xAISpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
Каждая публикация о GPT-6.1 Sol, опубликованная в дни после выпуска OpenAI на DevDay 29 сентября 2026 года — включая этот блог — содержала ту же оговорку: цифры возможностей были от поставщика, и ни одна третья сторона не оценивала модель. Эта оговорка теперь устарела. Artificial Analysis имеет строку GPT-6.1 Sol в своём Intelligence Index, полученную при максимальных усилиях рассуждения, и это первая цифра за короткую жизнь этой модели, которую OpenAI не получила. Она показывает 51,8 против 52,7 для GPT-6 Astra и 47,5 для GPT-6 Sol — разрыв менее одного балла до флагмана стоимостью $10/$50, и рост на 4,3 балла по сравнению с моделью, которую заменяет GPT-6.1 Sol. Цифра, которая делает строку интересной, — это та, что рядом с ней: табло указывает стоимость оценочного запуска, стоящего за каждой оценкой, и индексный запуск GPT-6.1 Sol стоил $0,72 за задачу, тогда как у Astra он стоил $3,26. Четыре с половиной раза больше денег за 0,84 балла — это всё сравнение в одной строке, и теперь это измеренная строка, а не представление поставщика о ней.
Сама строка и то, на чём она выполнялась

Artificial Analysis публикует свой Intelligence Index как композит из десяти оценок, и версия, работавшая 30 сентября 2026 года, была v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience и AA-LCR v1.1. Все три модели OpenAI в этом материале относятся к той же версии, поэтому приведённое ниже сравнение является сопоставимым так, как никогда не бывает в собственной таблице запуска вендора. В рейтинге также указана дата выпуска, которая у него есть для модели, — 2026-09-29, дата DevDay, — и она оценивается в конфигурации max-effort, то есть в настройке, которую страница называет в собственном заголовке.
• Intelligence Index — 51,8 для GPT-6.1 Sol (max), 52,7 для GPT-6 Astra (max), 47,5 для GPT-6 Sol (max).
• Стоимость одной задачи индекса — $0,72 для GPT-6.1 Sol, $3,26 для Astra, $1,05 для GPT-6 Sol. Это собственная цифра лидерборда за то, во сколько обошёлся запуск одной полной оценки индекса, а не прайс-лист.
• Выходные токены, израсходованные за запуск — 67,2 миллиона для GPT-6.1 Sol, 60,0 миллиона для Astra, 76,8 миллиона для GPT-6 Sol. Собственный комментарий AA называет 67 миллионов «довольно лаконичными» на фоне медианы по лидерборду в 82 миллиона, и это вторая, более тихая победа над моделью, которую он заменяет.
• Скорость вывода — 66,8 токена в секунду для GPT-6.1 Sol, 57,0 для Astra, 76,2 для GPT-6 Sol.
• Цены в том виде, в каком их приводит лидерборд — $2,00 за ввод и $10,00 за вывод за миллион токенов для GPT-6.1 Sol, при этом кэшированный ввод — $0,10, а записи в кэш — $2,50. Эти четыре числа в точности совпадают с прайс-листом вендора, и это самое недраматичное и самое полезное в этой строке: независимый перечень тарифов, которые мы уже приводили.
Одно вводное замечание, прежде чем эти числа начнут использовать как оружие. Индекс AA состоит из десяти оценок, и оценки, которыми OpenAI открыла собственный анонс, — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1, — в него не входят. AA использует собственный вариант AutomationBench, и это не тот же самый испытательный стенд, что версия AutomationBench, на которую ссылался вендор. Так что независимые данные не подтверждают и не опровергают четыре главных утверждения из поста о запуске; они измеряют во многом другой набор задач, и их стоит читать как второе мнение об облике модели, а не как вердикт по этим конкретным фразам.
Astra всё равно побеждает, пусть и с преимуществом менее одного балла, но зато за сумму в четыре с половиной раза больше.

Обе модели предлагают лестницу уровней усилий, и совет теперь опубликовал оценку и стоимость запуска для каждой ступени обеих. Выстроенные рядом, эти лестницы говорят то, чего не может сказать одно сравнение по главному показателю: лучшая конфигурация GPT-6.1 Sol соревнуется не с лучшей конфигурацией Astra. Она соревнуется со второй по силе конфигурацией Astra.
• GPT-6.1 Sol, макс. — 51,8, $0,72 за задачу индексирования. GPT-6 Astra, макс. — 52,7, $3,26.
• GPT-6.1 Sol, сверхвысокий — 51,0, $0,39. GPT-6 Astra, сверхвысокий — 52,4, $2,31.
• GPT-6.1 Sol, высокий — 50,2, $0,32. GPT-6 Astra, высокий — 50,9, $1,73.
• GPT-6.1 Sol, средний — 47,8, $0,21. GPT-6 Astra, средний — 49,6, $1,54.
• GPT-6.1 Sol, низкий — 42,1, $0,13. GPT-6 Astra, низкий — 45,8, $0,82.
Astra лидирует на каждой ступени — это честная сводка противостояния, а также самая неинтересная его часть. Интересная часть — это обменный курс. Если вам нужна самая дешёвая конфигурация Astra, которая обходит лучший результат GPT-6.1 Sol, это Astra на xhigh: 52,4 против 51,8, за $2,31 против $0,72. Это 0,56 пункта индекса за дополнительные $1,59 на каждый прогон оценки — примерно в 3,2 раза дороже за менее чем один процент от счёта. Двигайтесь в другую сторону и опустите GPT-6.1 Sol до xhigh — и вы отдаёте 0,8 пункта, тогда как счёт падает до $0,39, что в 5,9 раза дешевле, чем Astra на xhigh, и составляет одну девятую стоимости прогона Astra с максимальными усилиями.
Есть второе прочтение той же лестницы, которое говорит против покупки Astra на максимальном усилии. Четыре нижние ступени Astra все дешевле её максимума, а её xhigh на 0,29 балла ниже максимума — чуть больше половины процента оценки за сокращение стоимости запуска на 29%. Любой разговор о закупке об этой паре, который начинается с «Astra на максимуме» и заканчивается на «Astra стоит в 4,5 раза больше», оставляет собственные более дешёвые ступени Astra за рамками сравнения.
Шесть оценок достаются Astra, две — GPT-6.1 Sol, две — ничья
Сводная оценка скрывает разброс. Если оценивать каждую проверку по отдельности при максимальном уровне усилий, GPT-6.1 Sol — не равномерно немного худшая Astra: он лучше в двух вещах и хуже в шести.
• GDPval-AA — Elo 1575,1 у GPT-6.1 Sol против 1541,9 у Astra, преимущество в 33 пункта в задачах профессиональной работы. Это самая крупная отдельная независимая победа более дешёвой модели.
• AA-LCR v1.1, длинноконтекстное рассуждение — 0,830 против 0,807. GPT-6.1 Sol лидирует.
• AA-Briefcase v1.1 — Elo 1564,2 против 1568,9. Astra опережает на 4,7 пункта.
• AutomationBench-AA — 0,649 против 0,685. Astra опережает на 3,6 пункта.
• Terminal-Bench 4.0 — 0,561 против 0,591. Astra опережает на 3,0 пункта.
• SciCode — 0,542 против 0,565. Astra опережает на 2,3 пункта.
• Humanity's Last Exam — 0,529 против 0,547. Astra опережает на 1,8 пункта.
• AA-Omniscience — 41,5 против 43,4. Astra опережает на 1,9 пункта.
• GDP.pdf и CritPt — абсолютные ничьи на уровне 0,310 и 0,317 соответственно, у обеих моделей.
Две из этих строк значат больше, чем их позиция в списке. Разрыв в GDPval-AA — единственное место, где преимущество более дешёвой модели достаточно велико, чтобы сохраниться при смене харнесса, и он приходится ровно на ту рабочую нагрузку, которую заявляет позиционирование вендора — профессиональная работа с большим объёмом документов. А две абсолютные ничьи — на оценках с самым узким разбросом, что служит напоминанием о том, что совокупный разрыв в 0,84 балла собирается из строк, которые по отдельности варьируются от выигрыша в 33 балла до проигрыша в 3,6 балла.
По сравнению с моделью, которую он заменяет, прирост реален, но неравномерен.
Сравнение, которое важно для всех, кто уже использует GPT-6 Sol в продакшене, — это то, которое 6.1 Sol проводит со своим предшественником, и независимые данные говорят об этом точнее, чем публикация вендора. Восемь из десяти оценок улучшаются. Две — ухудшаются.
• SciCode — GPT-6.1 Sol набирает 0.542, тогда как GPT-6 Sol набирал 0.576. Новая модель хуже в научном коде на 3.5 пункта.
• AA-LCR v1.1 — 0.830 у 6.1 Sol против 0.837 у GPT-6 Sol. На волосок, но не в ту сторону, в оценке длинного контекста.
• AA-Omniscience — 41.5 против 27.1. Это самый крупный сдвиг в строке: скачок на 14.4 пункта в оценке знаний, а точность на этом наборе выросла с 0.545 до 0.621.
• Частота галлюцинаций на том же наборе — 0.543 у GPT-6.1 Sol, снижение с 0.601 у GPT-6 Sol, но всё ещё выше 0.513 у GPT-6 Astra. AA-Omniscience делит свою оценку на «правильно ответил» и «уверенно ошибся», и именно в этом разбиении обновление 6.1 оправдывает себя: это заметно менее нечестная модель, чем Sol, и при этом она всё ещё самая нечестная из трёх.
• Terminal-Bench 4.0 — 0.561 против 0.439, прирост на 12.2 пункта. AA-Briefcase — с 1482.8 до 1564.2 Elo. GDP.pdf — с 0.248 до 0.310.
Трактовка такова: это было обновление знаний и инструментария в большей степени, чем обновление рассуждений. Сильнее всего изменились те оценки, которые вознаграждают знание фактов, а не их выдумывание; упавшая оценка — узкая и техническая. Любой, кто перешёл на 6.1 Sol ради экономии кэша, получает прирост знаний в качестве бонуса и не должен считать, что этот прирост распространяется на каждый тестовый стенд, который он запускает.
Где совет директоров ставит его в рейтинге, и что находится выше

В стандартном порядке таблицы лидеров по Intelligence Index GPT-6 Astra при максимальном усилии занимает 7-е место, а GPT-6.1 Sol при максимальном усилии — 10-е, при этом GPT-6 Sol при максимальном усилии — на 20-м месте. Девять строк выше GPT-6.1 Sol — это две конфигурации Astra, три конфигурации Claude Opus 5.5, одна конфигурация Claude Sonnet 5.5 и две конфигурации Claude Fable 5.1 — таким образом, модель, к которой GPT-6.1 Sol ближе всего, — это флагман его собственного семейства, а модель, которую он фактически вытеснил в этом порядке, — это его собственный предшественник, на тринадцать позиций ниже.
Уберите настройку уровня усилий — и порядок сжимается так, что это важно для планирования затрат: GPT-6.1 Sol при xhigh занимает 13-е место, при high — 15-е, при medium — 19-е и при low — 35-е, тогда как Astra находится на 14-м месте при high, 16-м при medium и 26-м при low. Иными словами, GPT-6.1 Sol при xhigh опережает Astra при high в таблице, а GPT-6.1 Sol при medium опережает Astra при low. Уровень усилий здесь — более значимый рычаг, чем выбор модели, по крайней мере среди этих двух.
Что делать с числом, если честно
Заявление вендора, которое проверялось в этой строке, состояло в том, что GPT-6.1 Sol почти не уступает флагману при цене примерно в одну пятую от флагманской. Независимая версия этого утверждения такова: его разрыв с флагманом составляет не более 0,84 индексного пункта, а прогон оценки, давший его балл, обошёлся в 22% от стоимости такого прогона у флагмана. Это достаточно близко к заявлению, чтобы никто не почувствовал себя введённым в заблуждение, и это более сильное утверждение, чем «не проверено», во всех отношениях, важных для покупателя.
Чего эта строка не делает — так это не рассчитывает стоимость вашей рабочей нагрузки. Прогон по индексу — это конкретный набор задач, а число, определяющее реальный счёт, — это тарифная сетка, сопоставленная с вашим собственным профилем токенов; именно поэтому строка кэша по-прежнему остаётся той строкой, которую стоит моделировать: $0,10 за кэшированный ввод у GPT-6.1 Sol против $1,00 у Astra — это десятикратная разница, которой не касается ни один индексный балл. С нашей стороны действует тот же сквозной принцип: OrcaRouter предоставляет GPT-6 Astra, GPT-6 Sol и GPT-6 Luna по собственным прайс-листовым ценам OpenAI без добавления наценки, так что в день, когда тариф поставщика меняется, тариф на нашей стороне меняется вместе с ним, а не ждёт второго контракта. GPT-6.1 Sol отсутствует на наших маршрутах — публичный каталог сегодня возвращает «model not found» для openai/gpt-6.1-sol, и нет честного способа описать модель, которую мы не можем обслуживать. Что действительно даёт вам один API-ключ прямо сейчас — так это пара, о которой, собственно, и спорит бенчмарк — Astra для самой сложной работы, Sol для объёма — с прайс-листовыми ценами провайдеров, передаваемыми без наценки, и автоматическим переключением между провайдерами при ошибке одного из них.
Две вещи сделали бы это ещё точнее. Второй независимый тестовый стенд на той же модели сказал бы нам, является ли преимущество GDPval-AA свойством модели или того оценивания, и это — самая полезная недостающая точка данных в строке. А независимое измерение уровня длинного контекста в 272 000 токенов значило бы больше, чем ещё одна составная точка, потому что именно там ценообразование этого семейства перестаёт быть дешёвым.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
