Сгенерированная титульная карточка с заголовком «Unbiased's Pareto 26.10 Preview» и подзаголовком «Подмена 1M-контекста при той же строке модели», над тремя карточками с текстом «Выпущено: 1 октября 2026 г.», «Контекст: 1 048 576 токенов» и «Цена маршрутизации: $0.80 / $3.20 за 1 млн», с нижним колонтитулом «Бенчмарки проведены вендором и являются предварительными; независимые оценки по состоянию на 1 октября 2026 г. не опубликованы».
Guides & Insights

Превью Pareto 26.10 от Unbiased: подмена 1M-контекста за той же строкой модели

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Интеграция не меняется. А модель за ней — меняется. 1 октября 2026 года Unbiased перевела свою строку модели — pareto — на Pareto 26.10 Preview, новую версию с в четыре раза большим контекстным окном, более низкой ценой в маршрутизируемом каталоге и таблицей бенчмарков, которая, по собственному признанию вендора, предварительна и не опубликована в окончательном виде. Если вы сегодня вызываете Pareto по имени, вы вызываете 26.10 Preview, и в журнале изменений вендора об этом сказано предельно простыми словами: «Pareto 26.10 Preview теперь является текущим релизом Pareto… Строка модели остаётся pareto».

Эта единственная строка — это вся история для любого, у кого Pareto в стеке. Это не второй продукт, выпущенный вместе с первым. Это первый продукт, заменённый на месте, под именем, которое не изменилось — что означает, что версия, которую вы получаете, определяется календарём релизов, а не чем-либо в вашем запросе.

Что на самом деле изменилось 1 октября?

Четыре вещи сдвинулись, и не все они указывают в одном направлении.

• Контекстное окно — 262 144 токена в сентябрьском релизе Pareto, теперь 1 048 576. В собственной документации Unbiased эта цифра никогда не указывается; число взято из публичного технического описания модели, где это лимит на один запрос, и более скромного тарифа не предлагается.
• Цена с учётом маршрутизации — для Pareto обычно приводят пару: $2,50 за миллион входных токенов и $7,50 за миллион выходных, при этом кэшированный ввод — $0,25. В описании 26.10 Preview указаны $0,80, $3,20 и $0,03 соответственно — примерно треть ставки за ввод и чуть более 40% ставки за вывод.
• Оценки по бенчмаркам — впервые опубликованы для этого релиза и, по собственному определению поставщика, являются предварительными.
• Стабильный вариант — 26.10 Preview — это предварительная версия. В тексте каталога Unbiased сказано, что она «может измениться без предупреждения», и всем, кому нужно предсказуемое поведение, предлагается вместо неё предыдущий релиз.

Всё остальное осталось неизменным. Максимальный вывод по-прежнему составляет 131 072 токена. Ввод по-прежнему — текст и изображение; вывод по-прежнему — только текст. В листинге по-прежнему нет идентификатора Hugging Face, поэтому веса остаются закрытыми. И по-прежнему есть ровно один провайдер обслуживания — сама Unbiased — без второго хоста внутри листинга.

A generated single-column card titled "Pareto 26.10 Preview - what changed" with six rows reading "Context: 262K to 1M", "Max output: 131,072 (unchanged)", "Input price: $2.50 to $0.80 per 1M", "Output price: $7.50 to $3.20 per 1M", "Benchmarks: four, preliminary" and "Providers: one, the vendor", with a footer reading "Preview figures per the public listing; the vendor's own site keeps the $2.50 / $7.50 card."

Цена — это то, что стоит перечитать дважды.

На собственной платформе Unbiased тарифная сетка не изменилась. Карточка модели и страница цен по-прежнему показывают $2.50 за миллион входных, $0.25 за кэшированные, $7.50 за выходные — те же три числа, что и в сентябрьском релизе — и поскольку строка модели осталась pareto, клиент, использующий API вендора, платит по этим тарифам за 26.10 Preview. Более низкие цифры — это те, что указаны в листинге маршрутизированного каталога, и разрыв между ними — именно то, что определяет миграцию.

Возможны два толкования, и поставщик не сказал, какое из них верно. Либо 26.10 Preview действительно предлагается дешевле через этот канал в рамках вводной промоакции, либо в листинге отражена иная коммерческая схема, чем на прямой платформе. Unbiased не публикует дату окончания промоакции, а цена, установленная в день запуска, не является обязательством.

Это та единственная часть истории, форму которой меняет роутер. OrcaRouter передаёт прайс-лист провайдера напрямую с 0% наценки, поэтому снижение цены поставщиком становится доступным на нашей стороне в тот же день, когда оно происходит, а не по циклу контракта — а автоматическое переключение при сбое означает, что preview-релиз, который на следующей неделе будет вести себя иначе, можно заменить без изменения кода. Мы не предоставляем Unbiased's Pareto 26.10 Preview, поэтому честная версия такова: если вам нужна именно эта модель, вызывайте её через собственный API Unbiased. Смысл только в том, что на preview-релизе и цена, и версия являются переменными, и ни одну из них не следует жёстко фиксировать в коде.

Таблица бенчмарка, с теми метками, с которыми она поставлялась

Unbiased опубликовал четыре оценки для 26.10 Preview, каждая в паре с измеренной стоимостью за задачу, и каждая содержит оговорку, которую написал сам вендор. Воспринимайте их как проведённые вендором и невоспроизведённые, потому что это именно так:

• DeepSWE v1.1 (агентное программирование) — 69,9%, при $0,24 за задачу
• Terminal-Bench 4.0 (агентное использование терминала) — 50,8%, при $0,48 за задачу
• Humanity's Last Exam, только текст (экспертное рассуждение) — 49,9%, при $0,008 за задачу
• GPQA-Diamond (научное рассуждение) — 92,4%, при $0,004 за задачу

A generated single-column scoreboard titled "Pareto 26.10 Preview - the benchmark sheet" listing six rows: "DeepSWE v1.1: 69.9% at $0.24 per task", "Terminal-Bench 4.0: 50.8% at $0.48 per task", "HLE text-only: 49.9% at $0.008 per task", "GPQA-Diamond: 92.4% at $0.004 per task", "Context: 1,048,576 tokens" and "Independent scores: none yet", with a footer reading "Vendor-run, preliminary results; not independently validated."

Формулировка поставщика такова: 26.10 Preview «достигает границы Парето или устанавливает её на всех четырёх бенчмарках». Таблица, которую он публикует вместе с этим утверждением, более конкретна, и уже то, что она вообще опубликована, делает честь Unbiased: в Terminal-Bench 4.0 GPT 6 Astra указан с 58, а Fable 5.1 — с 56, оба выше 50,8 у Pareto, и собственный раздел поставщика «где другие модели набирают больше» прямо об этом говорит. В DeepSWE v1.1 релиз находится в кластере — GLM-5.3 и Kimi K3 указаны по 69,0 против 69,9 у Pareto, — что на практике означает ничью и укладывается в любую погрешность, которую несёт одиночный запуск.

У чисел сравнения есть вторая оговорка, которая важнее первой: они перенесены из сравнения от 21 сентября и, по словам поставщика, «не подтверждены независимо», к тому же они были получены в рамках отдельной оценки отдельных моделей — поэтому их не следует сопоставлять с показателями стоимости за задачу от Pareto так, будто и те и другие получены на одном и том же стенде. Поставщик говорит об этом в подробностях оценки. Читатель, который пропустит эту строку, переоценит график.

Чего во всём этом нет — так это независимости. Artificial Analysis — рейтинг, который большинство команд проверяет, прежде чем довериться новому имени в прайс-листе, — вообще не имеет страницы о Pareto. Каждое число выше было получено компанией, продающей модель. Единственное, что это смягчает, — то, что тестовый стенд для оценки открыт: вендор публикует воспроизводимый набор для прямого сравнения, который любой может направить на эндпоинт, — и это превращает «доверьтесь нашей оценке» в «перезапустите нашу оценку». Это реальное предложение, и оно не то же самое, что подтверждённое число. Пока никто не опубликовал повторный прогон.

Что означает «preview» в договоре

Слово здесь делает больше работы, чем примечания к выпуску. Собственная документация Unbiased описывает текущий доступ как доступ для оценки в соответствии с её условиями и заявляет, что коммерческое или производственное использование требует отдельного письменного соглашения. Новые учётные записи проверяются вручную, прежде чем выдаётся API-ключ. API совместим с OpenAI и Anthropic — базовый URL, ключ, строка модели, без переписывания — но документированная поверхность — это только chat completions и messages, с известными пробелами, которые поставщик открыто перечисляет: GET /v1/models не реализован, и неизвестные идентификаторы моделей не отклоняются, поэтому клиенты должны явно отправлять pareto, а не выяснять, что доступно.

Сложите ярлык предварительной версии и договор частной беты вместе — и эксплуатационная рекомендация напишется сама. Это модель, которую стоит оценивать на собственной нагрузке за слоем маршрутизации, а не та, которую ставят перед трафиком, приносящим доход, и забывают о ней. Механизм для этого непригляден: цепочка резервных вариантов, настроенная один раз, так что релиз, который меняется у вас под ногами в середине недели, становится изменением конфигурации, а не инцидентом. Unbiased потратила сентябрь на исправление именно этого класса проблем на своей стороне — запись в журнале изменений от 16 сентября фиксирует, что примерно 13% длинных нестриминговых запросов упирались в 120-секундный тайм-аут, а потолок шлюза был поднят до 300 секунд. Это вендор, откровенно говорящий о шероховатости. Это также напоминание о том, что эксплуатационный профиль предварительной версии всё ещё пишется.

A screenshot of the Unbiased Pareto 26.10 Preview model card page, headed "Pareto 26.10 Preview model card" and subtitled "Pareto is our blended AI model, available through the Unbiased AI platform. Send one request and receive one answer.", showing the DeepSWE v1.1 and Terminal-Bench cost-per-score chart with the Pareto 26.10 Preview point at 69.9% and $0.24 alongside other labs' published points, over an evaluation-details block stating the Pareto 26.10 Preview results are from October 1, 2026 runs and may change before final publication.

На что обратить внимание, прежде чем взять на себя обязательства

Три конкретные вещи сняли бы открытые вопросы, и каждую из них можно проверить.

Первый — независимая оценка. Пока третья сторона не запустит 26.10 Preview на опубликованном тестовом стенде, 92,4 на GPQA-Diamond и 50,8 на Terminal-Bench — это заявления вендора о собственной работе: достаточно, чтобы решить, стоит ли тестировать, но недостаточно, чтобы решить, стоит ли мигрировать.

Второе — это то, как предпросмотр влияет на цену. Если листинг, прошедший маршрутизацию, остаётся на уровне $0,80 и $3,20, тогда как собственная платформа продавца удерживает $2,50 и $7,50, эта разница — решение по каналу, которое стоит понять, прежде чем строить модель затрат на любом из этих чисел.

Третье — это то, что «может измениться без уведомления» означает на практике. Предварительная версия, которую пересматривают дважды в месяц, — это иной инструмент, нежели та, которую замораживают и переименовывают в конце квартала, и именно в журнале изменений это проявится в первую очередь.

Ничто из этого не говорит против того, чтобы попробовать. Мультимодальная модель на 1M токенов, показывающая результаты, близкие к фронтирным, при цене $0,24 за задачу, стоит того, чтобы потратить полдня на реальную работу с собственными промптами, а такая проверка обходится дешевле, чем спор о ней. Это довод против предположения, что модель, которую вы тестируете на этой неделе, — это модель, которую вы получите на следующей неделе, — а для релиза, который сам вендор называет предварительной версией, это единственное предположение, которое должно быть верным.

Предварительный выпуск — как раз тот случай, для которого и было создано автоматическое переключение при сбое: автоматическое переключение при сбое превращает модель, которая меняется у вас под руками посреди недели, в изменение конфигурации, а не в простой.