Pokee-Isaac 28B-1
Engineering & Research

Pokee-Isaac 28B: 10 миллионов токенов контекста и архитектура, которую Pokee не станет описывать.

Автор

Jim Song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Есть колонка у Pokee-Isaac 28B в сравнительной таблице запуска, где пять из шести моделей набирают 0,0, и сноска под ней интереснее, чем число над ней. При длине контекста в 10 миллионов токенов новая модель 28B от Pokee AI набирает 93,3 на RULER, а каждый базовый уровень, против которого она измерялась — GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super 120B, Qwen 3.5 122B — не даёт ничего пригодного к использованию. Сноска объясняет, что три из этих пяти вообще нельзя приобрести с длиной контекста выше 262K. Так что оценка реальна, и комната пуста. Это два разных утверждения, и большинство публикаций, вышедших с момента появления модели 5 августа 2026 года, смешали их.

Это не повод отвергать то, что выпустила Pokee. Это повод быть точными в отношении того, какие её части продемонстрированы, какие просто никем не оспариваются, а какие вообще не описаны. Всё нижеследующее взято из четырёх первоисточников: страницы модели Pokee-Isaac в собственной консоли Pokee, документации разработчика Pokee, карточки модели у реселлера на NanoGPT и заявлений, сделанных при запуске компанией Pokee AI и основателем Чжэцином (Биллом) Чжу. Каждая цифра в бенчмарках в этой статье получена компанией Pokee AI. Pokee говорит об этом прямо — в консоли указано, что каждая цифра «была измерена Pokee AI в единой контролируемой среде, одинаково для Isaac и для каждой базовой модели, если не указано иное», — и, к их чести, это означает, что базовые показатели были пересчитаны, а не скопированы из анонсов других вендоров. Это также означает, что ни одна независимая лаборатория ничего из этого не воспроизвела, и на сегодняшний день никто не опубликовал попытку такой проверки.

Что Pokee на самом деле выпустил

Публичная поверхность модели необычно хорошо документирована для столь недавнего запуска, поэтому её стоит изложить, прежде чем мы перейдём к спорным частям.

Модель — Pokee-Isaac 28B, версия v0, предоставляется как pokee-isaac из api.pokee.ai через совместимую конечную точку.

Размер и контекст — 28 миллиардов параметров при входном окне в 10 000 000 токенов; Pokee описывает его как «работоспособное от начала до конца, а не просто адресуемое».

Output — 60 000 токенов, что одновременно является и значением по умолчанию, и жёстким лимитом.

Модальности — текст на входе, текст на выходе. Ввод изображений, аудио и видео не поддерживается, что стоит отметить, учитывая, на чём построена модель.

Цена — $0,15 за миллион входных токенов и $1,00 за миллион выходных токенов, по собственному списку Pokee.

Агентные возможности — вызов функций и структурированный вывод в стандартной схеме chat-completions; модель позиционируется как агент планирования, исполнения и проверки, а не как чат-модель.

Лимиты запросов — ограничение размера тела запроса в 45 МиБ, при этом всё, что превышает 16 МиБ, должно использовать потоковую передачу SSE (stream: true плюс Accept: text/event-stream — заголовок).

Лимиты запросов — 500 запросов и 20 миллионов токенов в минуту, при этом 10 одновременных запросов на бесплатных аккаунтах и 25 на платных.

Развертывание — datacenter B200, рабочие станции RTX 4090/5090, клиентские карты Intel Arc Pro, периферийные NPU (Qualcomm и Intel Panther Lake, с AMD в статусе ожидания), а также on-device, с лицензированием VPC и on-premises, при котором, по словам Pokee, «ни один запрос не покидает ваш периметр».

Серверные стеки — поддержка с первого дня в vLLM и SGLang.

Компания — Pokee AI, основанная в 2024 году Чжэцином (Биллом) Чжу, ранее возглавлявшим направление прикладного обучения с подкреплением в Meta; посевной раунд в размере $12 млн возглавила Point72 Ventures при участии Qualcomm Ventures и Samsung NEXT.

Веса закрыты. Coverage описала модель как закрытую «пока что» — это собственная оговорка Pokee, а не обязательство, и не объявлено ни даты, ни лицензии для выпуска.

Pokee-Isaac 28B-2

Архитектура, которую никто не опишет

Pokee объясняет окно в 10M токенов «проприетарной архитектурой, не ограничивающейся только декодером». Эта фраза — и есть всё техническое раскрытие. Консоль содержит ссылку на технический отчёт под названием Pokee-Isaac 28B v0: A 10M-Token Context Efficient Agentic Model, датированный 3 августа 2026 года; нам не удалось получить доступ к его публичной копии, а доступные материалы запуска не называют ни механизм внимания, ни схему памяти, ни методику обучения.

То, что Pokee сказал о происхождении, более конкретно, и это несколько неловко говорить: часть весов Isaac дообучена на основе Qwen3.6-27B под лицензией Apache-2.0, другие веса были обучены Pokee с нуля, и результат — «не обычный файн-тюн». Это осторожная формулировка. Она одновременно признаёт основу и отрицает такую характеристику.

Этого также достаточно, чтобы сузить пространство догадок, чем исследовательское сообщество ИИ немедленно и занялось. Исследователь, публикующийся под ником @teortaxesTex, в день запуска изложил набор ограничений — частично дообученная на основе Qwen3.6-27B, не только декодер, контекст 10M, всего 28B — и предложил два варианта: «какая-то прокачанная Memory Sparse Attention» или «просто 1B-энкодер документов». Обе догадки стоит понять, потому что они не праздные.

Начнём с арифметики. Qwen3.6-27B — плотная модель на 27B параметров с нативным окном 262K, гибридным gated-delta вниманием и визуальным энкодером, который можно отключить, чтобы запускать модель в текстовом режиме. Isaac — 28B и только текст. Если убрать визуальную башню базовой модели и добавить около миллиарда параметров чего-то ещё, получится ровно 28B. Энкодер документов или памяти на ~1B параметров, прикрученный к декодеру на 27B, — наиболее экономное прочтение количества параметров, которое опубликовал Pokee, и это сделало бы ярлык «не только декодер» буквально верным, не будучи новым утверждением.

Предположение насчёт Memory Sparse Attention указывает на реальное и недавнее направление работы: статья MSA (arXiv:2603.23516) сочетает масштабируемое разреженное внимание с документным RoPE, чтобы получить линейную сложность при обучении и инференсе, добавляет сжатие KV-кэша и схему «Memory Parallel», и сообщает о менее чем 9% деградации от 16K до 100M токенов, при этом инференс на 100M токенов выполняется на двух A800. Это та же форма результатов, которую заявляет Pokee, на порядок дальше, от другой группы. Ничто не связывает их, кроме формы: MSA — это не работа Pokee, и Pokee не ссылался на неё, — но это подтверждает, что дизайн с разнесённой памятью, достигающий таких длин на скромном оборудовании, является опубликованным и правдоподобным результатом, а не маркетинговой невозможностью.

В собственных материалах Pokee есть одна цифра, которая незаметно поддерживает прочтение с отдельным энкодером. Производительность prefill на одном B200 составляет 42,400 токенов/секунду при контексте в 1M токенов и 137,200 токенов/секунду при 10M. Производительность растёт более чем втрое при удлинении контекста в десять раз. Декодер, платящий квадратичные издержки внимания, делает обратное. Что бы ни потребляло эти токены, оно становится эффективнее в расчёте на токен по мере их добавления — это признак массового кодирующего прохода по документам, а не обычного prefill.

Почему это важно для того, кто решает, использовать ли модель: если окно в 10M — это энкодер документов плюс сжатая память, а не KV-кэш на 10M записей, то «контекст» здесь — не тот объект, вокруг которого строятся ваши интуиции. Как модель ведёт себя при добавлении сообщения в диалог, при редактировании одного документа в середине корпуса или при ожидании работы префиксного кэширования, не определено, а документация Pokee вообще не описывает никакого механизма кэширования. Вы не можете рассуждать об этих поведениях, исходя из спецификации, и сейчас вы не можете рассуждать о них и исходя из архитектуры.

RULER at 10M — это действительное число в пустой комнате.

Доказательством длинного контекста Pokee является RULER, запущенный на 256K, 512K, 1M, 2M, 4M и 10M, с десятью сэмплами на конфигурацию. Isaac набирает 96.9, 96.7, 95.0, 95.8, 96.7 и 93.3 на этих шести длинах — единственная модель в панели, которая возвращает оценку на каждой из них.

Панель ниже 1M — это место, где находится честное показание:

При 256K — Isaac 96.9, Nemotron 3 Super 120B 96.3, GPT-5.6 Luna 95.0, Gemini 3.5 Flash Lite 94.5, и 0.0 для обоих Claude Haiku 4.5 и Qwen 3.5 122B, чьи окна заканчиваются ниже этой длины.

При 512K — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.

При 1M — Isaac 95.0, Nemotron 91.8, Gemini 3.5 Flash Lite 29.4 и GPT-5.6 Luna 0.0, причём обе последние помечены как ошибки переполнения контекста.

На 2M и далее — только Isaac, всё остальное 0.0.

Далее следуют три вещи. Во-первых, до 1M отрыв Айзека от остальных — это одно-два очка, а не целое поколение, и единственный базовый показатель, который остаётся близким, Nemotron 3 Super 120B, представляет собой модель на 120B, чьи цифры в диапазоне 256K-to-1M являются собственными самоотчётными данными NVIDIA, которые Pokee помечает и исключает из сравнения строк, а не выдаёт за измеренные. Так что ближайший конкурент на этих длинах на самом деле не является сопоставимым измерением ни в ту, ни в другую сторону.

Во-вторых, по крайней мере один из пропусков выглядит как артефакт развертывания, а не как ограничение модели. Pokee запустил GPT-5.6 Luna через Azure и пометил её окно как «>272K контекст», зафиксировав ошибку переполнения контекста на 1M. Собственное документированное окно вендора для этой модели составляет около 1.05M токенов, что и указано на нашей странице этой модели. Читатель, который воспринимает колонку 1M за чистую монету, пришёл бы к выводу, что Luna не может работать с 1M; более обоснованный вывод — что развертывание Azure, которое тестировал Pokee, не смогло.

В-третьих, RULER — это синтетический набор для извлечения и агрегации, а не бенчмарк для рассуждений. Pokee также прозрачен в отношении методологической особенности: столбцы 256K и 512K усредняют все 13 конфигураций задач, но извлечение общих слов недоступно начиная с 1M, поэтому длинные столбцы усредняют оставшиеся 12. Таким образом, показатели 93.3 при 10M и 96.9 при 256K получены не на совершенно одинаковом наборе задач.

Более сложный тест на длинный контекст останавливается на 1M.

Более показательный бенчмарк на странице Pokee — это не RULER. Это MRCR v2, задача на кореференцию с восемью «иглами» и несколькими раундами, где несколько целей разбросаны по длинному диалогу, и модель должна найти и разрешить указанную цель, так что и частичное извлечение, и взаимная интерференция «игл» снижают результат. По шкале от 0 до 1 при 1M токенов:

Pokee-Isaac 28B — 0.500

Gemini 3.5 Flash Lite — 0.205

Nemotron 3 Super 120B — 0.067

GPT-5.6 Luna — 0.050

Claude Haiku 4.5 и Qwen 3.5 122B — 0.000, ничего полезного при такой длине

Это гораздо более широкий и гораздо более убедительный разрыв, чем тот, что обеспечивает RULER, и именно здесь предложение модели действительно реализуется. Luna набирает 95.0 на RULER при 256K и 0.050 на MRCR при 1M; извлечение единственной цели и дизамбигуация нескольких игл — это не один и тот же навык, и второй отказывает первым. Isaac деградирует гораздо более плавно.

Это также самая крупная доказательная дыра в запуске. MRCR v2 прогнали на 256K, 512K и 1M — и остановились. Собственные результаты Айзека там: 0,607, 0,743 и 0,500 — немонотонные, а на 1M он извлекает половину игл. Никто, включая Pokee, не публиковал результатов многоигольного теста на 2M, 4M или 10M. Утверждение про 10M целиком опирается на более лёгкий из двух тестов, причём ровно на тех длинах, где более сложный тест не проводился. Если вы рассматриваете эту модель, потому что хотите поместить корпус из 25 000 страниц в один промпт и задать вопрос, ответ на который собирается из четырёх мест в нём, — то эта конкретная способность не измерена на этой конкретной длине.

Pokee-Isaac 28B-3

В агентной работе Исаак — ровня Луне, а не лучше неё.

Pokee прогнал четыре агентных бенчмарка, и вот в чём откровенность компании действительно необычна: её собственная страница резюмирует результат так: Isaac лидирует в двух, занимает второе место в одном и третье в одном. Это точное описание, и это не то описание, которое приводится в освещении запуска.

BFCL v4, вызов функций(оценка по AST и сопоставлению переходов состояний, а не LLM-судьёй) — Isaac 70.94 против GPT-5.6 Luna 70.61, при этом Claude Haiku 4.5 — 67.52, Qwen 3.5 122B — 64.88, Gemini 3.5 Flash Lite — 64.85, Nemotron 3 Super — 33.13.

τ³-bench, среднее по четырём доменам (многоходовые задачи обслуживания клиентов с симулированным пользователем, чьи требования меняются по ходу диалога) — Isaac 0.662 против Gemini 3.5 Flash Lite 0.631, Qwen 3.5 122B 0.611, GPT-5.6 Luna 0.527, Nemotron 0.426, Claude Haiku 4.5 0.408.

Terminal-Bench 2.1, текстовое подмножество — GPT-5.6 Luna 69.8% против Isaac 65.1%, затем Gemini 3.5 Flash Lite и Qwen 3.5 122B с одинаковым результатом 46.5%, Claude Haiku 4.5 34.9%, Nemotron 24.4%.

MCP-Atlas: охват утверждений на живых серверах инструментов — GPT-5.6 Luna 77,90%, Gemini 3.5 Flash Lite 76,67%, Isaac 74,59%, Qwen 3.5 122B 70,24%, Claude Haiku 4.5 56,45%, Nemotron 48,95%.

Разница в 0,33 пункта на BFCL v4 — это паритет, и страница Pokee говорит именно об этом, а не называет это победой. Если смотреть на все четыре задачи, модель на 28B обменивается победами с быстрым уровнем фронтирного вендора в агентных задачах. Для модели на 28B это сильный результат. Это не тот результат, который большинство читателей подразумевают под «фронтирной агентной моделью», и это означает, что причина выбрать Isaac — это окно контекста и границы развёртывания, а не агентность.

Номер безопасности — лучшее, что есть у панели, но он всё равно недостаточно хорош.

В DTAP — наборе тестов на промпт-инъекции — Isaac демонстрирует самый низкий совокупный показатель успешных атак среди участников панели: 35,6, опережая Claude Haiku 4.5 (37,9), GPT-5.6 Luna (50,1), Qwen 3.5 122B (54,0), Nemotron (60,4) и Gemini 3.5 Flash Lite (66,3). Показатели прямых и непрямых атак различаются менее чем на один пункт, поэтому устойчивость как минимум одинакова по обоим векторам.

Три оговорки, и все они — из собственных отчётов Pokee, а не от критиков. Косвенные измерения проводились при отключённых защитных механизмах. Явные отказы сработали лишь на 1,5% вредоносных задач, что Pokee описывает так: бо́льшая часть текущей защиты — «случайность, а не осознанный отказ». Модель не столько распознаёт и отклоняет атаки, сколько не поддаётся полезному управлению с их стороны. А на более широкой таблице лидеров из 16 систем, а не на этой панели из шести моделей, Isaac занимает пятое место по прямым атакам, шестое — по косвенным и девятое — по возможностям: середина списка, а не лидирующие позиции.

Есть и цена за безопасность. Успешность Isaac на безвредных запросах — 82,5, что ниже 85,1 у GPT-5.6 Luna: она отказывается или слегка ошибается на чуть большем объёме легитимной работы, чем модель, которую она превосходит по атакам. А 35,6 означает, что примерно одна из трёх попыток инъекции всё ещё достигает цели. Для модели, вся суть которой — чтение десяти миллионов токенов документов, которые вы не писали, это цифра, вокруг которой нужно строить защитные механизмы, а не цифра, которая должна успокаивать. Сам DTAP заслуживает отдельного упоминания: в отличие от RULER, BFCL и τ³-bench, это не устоявшийся публичный лидерборд, и нам не удалось найти независимую документацию этого набора тестов.

Сколько стоит запрос на десять миллионов токенов и как долго придется ждать

Десять миллионов токенов — это примерно 7,5 миллиона слов, или около 25 000 страниц. При цене Pokee {{1}}$0.15 за миллион{{/1}} однократное заполнение окна обойдётся в {{2}}$1.50{{/2}}. Добавьте ответ максимальной длины на 60 000 токенов по цене {{3}}$1.00 за миллион{{/3}}, и один максимальный вызов составит около {{4}}$1.56{{/4}}. Это действительно дёшево для такого объёма текста, и это самый весомый простой аргумент в пользу модели.

Время — это настоящая цена. На одном B200 Pokee сообщает о 72,9 секундах до первого токена при 10M — что ровно равно 10 000 000, делённым на показатель prefill в 137 200 токенов в секунду, так что это показатель эталонного оборудования, а не измеренная задержка API. Собственная документация Pokee для разработчиков рассказывает другую историю: предусматривайте как минимум десятиминутный тайм-аут клиента для промптов с многомиллионным количеством токенов, поскольку большой промпт может занять «около семи минут при 10 миллионах токенов». Это примерно шестикратный разрыв между слайдом о пропускной способности и руководством по интеграции. Обе цифры принадлежат Pokee, но ваш конфиг тайм-аута должен верить той, что в документации.

Decode работает на стабильных ~335 токенах в секунду независимо от объёма резидентного контекста — это хорошая новость с архитектурной точки зрения и неудобная с практической: полный вывод на 60 000 токенов занимает около трёх минут в дополнение к prefill. На потребительском железе картина снова меняется — на Intel Arc Pro B70 Pokee сообщает о 1 087–1 500 токенах в секунду на prefill (в 3,6–5 раз быстрее стокового llama.cpp) и 58,8 токена в секунду на decode. Это достойные показатели для клиентского GPU, но это не цифры уровня 10 миллионов токенов.

Из размера самих входных данных вытекают два практических ограничения. Десять миллионов токенов английского текста — это примерно 38 МиБ, что укладывается в лимит тела запроса в 45 МиБ, но значительно превышает порог в 16 МиБ, поэтому каждый действительно полный вызов с полным окном должен передаваться потоково — не существует непотокового пути к этой флагманской функции. А при отсутствии документированного кэширования подсказок в API Pokee каждый повторный запрос того же корпуса обходится ещё в 1,50 доллара и ещё в многоминутную предварительную загрузку. В листинге реселлера на NanoGPT действительно публикуется ставка чтения из кэша в 0,079 доллара за миллион, и если она применима к Isaac, то кэшированное повторное чтение обойдётся примерно в 0,79 доллара — это примерно вдвое дешевле, а не скидка на порядок, которую кэширование подсказок подразумевает в других местах.

{{1}}Одна поправка к сравнению цен, потому что она меняет заголовок.{{/1}} {{2}}Pokee устанавливает цену GPT-5.6 Luna в $0,40/$1,80 за миллион токенов, по данным Azure.{{/2}} {{3}}Собственная прейскурантная цена вендора на Luna после снижения 31 июля 2026 года составляет $0,20/$1,20,{{/3}} {{4}}что и отображается на нашей странице этой модели, поскольку OrcaRouter передаёт цены провайдеров без наценки (0%), а не перепродаёт с маржой.{{/4}} {{5}}В сравнении с корректной цифрой Isaac на 25% дешевле по входным токенам и на 17% дешевле по выходным, чем уровень fast frontier{{/5}} {{6}}— по-прежнему дешевле, но преимущество гораздо уже, чем предполагает панель,{{/6}} {{7}}и самая низкая цена на выходные токены на панели в целом — у Nemotron 3 Super: $0,65.{{/7}} {{8}}Ценовое преимущество Isaac реально; просто это не та часть запуска, которая примечательна.{{/8}}

Pokee-Isaac 28B-4

Та часть, которая действительно новая.

Уберите обрамление бенчмарком — и останется кое-что необычное. Модель на 28B параметров с очень длинным контекстом, работающая внутри VPC, на рабочей станции с RTX 4090, на карте Intel Arc Pro и на мобильном кремнии NPU-класса, с поддержкой vLLM и SGLang с первого дня и локальной лицензией, — такая комбинация почти недоступна где-либо ещё. Pokee также заявляет о примерно 5× эффективности KV-кэша по сравнению со стандартными реализациями; это цифра от вендора без воспроизведения, но это та цифра, которая должна быть верной, чтобы вся история с развёртыванием имела смысл.

Покупатель здесь — не тот, кто ищет агента получше. Это тот, у кого есть большой, чувствительный, в основном статичный корпус — пакеты контрактов, материалы дел, монолитная кодовая база, месяцы логов, — который по юридическим или политическим причинам не может пересечь границу и кто в противном случае строил бы поисковый пайплайн, чтобы обойти окно в 200K. В сравнении с этой альтернативой суть предложения не в том, что это «дешевле RAG». Эмбеддинг и поиск по более чем 25 000 страниц стоит центы за запрос и всегда будет стоить. Суть в том, что не нужно настраивать стратегию чанкинга, не теряется полнота поиска и нет второй системы, которую нужно синхронизировать с первой. Стоит ли такой размен $1.50 и нескольких минут на запрос — зависит исключительно от того, как часто вы делаете запросы.

Кому стоит попробовать это сейчас, а кому подождать

Попробуйте сейчас, если вы прототипируете на корпусе в диапазоне 1M–4M, где {{1}}у Isaac самые сильные показатели{{/1}} и {{2}}альтернативы действительно скудны{{/2}}, или если {{3}}развертывание on-premises на 28B{{/3}} — это требование, которое {{4}}вас блокирует{{/4}}. На бесплатном тарифе {{5}}десяти одновременных запросов{{/5}} достаточно, чтобы выяснить, {{6}}читает ли модель ваши документы так, как вам нужно{{/6}}.

Подождите, если вам нужно именно число 10M, и ваши вопросы являются многошаговыми, потому что именно эту комбинацию никто не измерял. Подождите, если вам нужен мультимодальный ввод, который модель не принимает. Подождите, если важна задержка, поскольку вызов с полным окном занимает минуты, а не секунды. И взвесьте очевидный риск зависимости: это модель v0, с закрытыми весами, от компании с посевным раундом в $12M, и это единственная модель в мире, которая предоставляет эту возможность, которую она продаёт. Если она исчезнет, не будет второго провайдера, на которого можно переключиться.

Этот последний пункт — практическая причина, по которой сравнение стоит держать честным. Pokee-Isaac 28B сейчас нет на OrcaRouter: если он вам нужен, он живёт в собственном API Pokee или у реселлера. Но три из пяти бейзлайнов, с которыми он себя сравнивает, — GPT-5.6 Luna, Gemini 3.5 Flash Lite и Claude Haiku 4.5 — доступны по одному ключу OrcaRouter по цене провайдера, что делает полезный эксперимент дешёвым в запуске: прогоните вашу реальную задачу с длинным контекстом на этих трёх на поддерживаемых ими длинах и посмотрите, нужны ли вашему корпусу действительно десять миллионов токенов или хватит 400 000 токенов и более качественного промпта. Если нужны десять миллионов — вы узнали то, что стоит $1.50 за вызов. Если нет — вы избежали построения продакшн-пути на v0 от единственного поставщика.

Три вопроса, на которые стоит ответить

Pokee-Isaac 28B — это просто дообученная модель?

Не в обычном понимании этой фразы, хотя и не независимо от этой базы. Позиция Pokee заключается в том, что одни веса дообучены на основе Qwen3.6-27B под лицензией Apache-2.0, а другие обучены с нуля, и что архитектура не является decoder-only. Обе части этой позиции согласуются с количеством параметров: Qwen3.6-27B — это плотная модель на 27B с пропускаемым визуальным энкодером, Isaac — 28B и только текстовая, так что около миллиарда параметров нового механизма заменили визуальную башню. Что это за механизм, не раскрыто, и пока это не сделано, утверждение «не обычный fine-tune» основывается на слове Pokee, а не на чём-то проверяемом. Лицензия Apache-2.0 на базовую модель делает производную работу легальной; она не делает закрытый выпуск результата необычным, что стоит отметить главным образом потому, что такую конкретную родословную редко раскрывают добровольно.

Может ли он действительно обработать 10 миллионов токенов на RTX 4090?

Утверждение об одной видеокарте и утверждение о 10M исходят из одного анонса, но не из одного измерения. Все показатели пропускной способности, которые Pokee публикует для контекста 10M — 137 200 токенов в секунду на этапе prefill, 72,9 секунды до первого токена — получены на одной B200. Показатели для RTX 4090 и Arc Pro реальны, но приведены в гораздо меньшем масштабе; цифры Arc Pro B70 составляют 1 087–1 500 токенов в секунду на prefill, что превратило бы prefill для 10M токенов в часы. «Развертывание на одной видеокарте, начиная с RTX 4090», лучше всего понимать как утверждение о том, что веса помещаются и модель может полезно обслуживать запросы, а не о том, что заявленная длина контекста практична на этой карте.

Стоит ли мне заменить RAG-пайплайн на него?

Не на основании этих данных, за одним исключением. Довод в пользу замены поиска сильнее всего, когда запросы многошаговые — это как раз тот сценарий отказа, с которым поиск по чанкам справляется плохо, — а производительность на многошаговых запросах на объёмах более 1 млн токенов — то, что Pokee не измерял. MRCR v2 останавливается на 1 млн, и там Isaac находит половину иголок. Исключение — корпус, который целиком помещается в 1–2 млн токенов: там измеренные показатели Isaac убедительны, ожидание занимает десятки секунд, а не минуты, а удаление слоя поиска устраняет реальную эксплуатационную сложность. Выше этого объёма рассматривайте окно как способ не строить поиск для прототипа, а не как повод удалять работающий.

Что бы это уладило

Четыре вещи, ни одна из которых не требует доверия ни к кому. Независимый прогон {{1}}RULER или MRCR{{/1}} на 2M или выше, кем угодно, через публичный API. Результат MRCR v2 от Pokee на длинах, которые он уже заявляет. Доступный технический отчёт, в котором назван механизм, — после чего вопрос об энкодере перестаёт быть арифметикой и становится фактом. И публикация весов, на которую «закрытый исходный код на данный момент» намекает, ничего не обещая.

А пока честный итог скромнее анонса и убедительнее скепсиса. Pokee AI выпустила модель 28B, которая измеримо удерживает извлечение из длинного контекста дальше, чем всё, что сейчас можно купить, не уступает быстрому флагманскому уровню на агентных задачах, оказывается самой безопасной в собственной панели и в середине поля против более широкой, и работает там, где не работает ничто с её возможностями. Компания также решила опубликовать единственные существующие цифры о возможности, которую больше никто не предлагает, и не рассказывать, как она работает. Оба решения — право молодой компании. Но ни то, ни другое не заменяет теста, проведённого кем-то за пределами компании.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube