Pokee-Isaac 28B-1
Engineering & Research

Pokee-Isaac 28B: 10 milionów tokenów kontekstu i architektura, której Pokee nie chce opisać

Autor

Jim Song

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

W tabeli porównawczej z premiery Pokee-Isaac 28Bznajduje się kolumna, w której pięć z sześciu modeli uzyskuje wynik 0,0, a przypis pod nią jest ciekawszy niż liczba nad nią. Przy długości kontekstu 10 milionów tokenów nowy model Pokee AI o wielkości 28B uzyskuje 93,3 w RULER, a każdy baseline, z którym go porównano — GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super 120B, Qwen 3.5 122B — nie zwraca niczego użytecznego. Przypis wyjaśnia, że trzech z tych pięciu modeli w ogóle nie można kupić przy żadnej długości kontekstu powyżej 262K. Wynik jest więc prawdziwy, a sala pusta. To dwie różne tezy, a większość publikacji, które ukazały się od czasu pojawienia się modelu 5 sierpnia 2026 r., zlewa je ze sobą.

To nie powód, by lekceważyć to, co wypuściło Pokee. To powód, by precyzyjnie określić, które części tego produktu są wykazane, które są jedynie niekwestionowane, a które po prostu nieopisane. Wszystko poniżej pochodzi z czterech głównych źródeł: strony modelu Pokee-Isaac we własnej konsoli Pokee, dokumentacji deweloperskiej Pokee, wpisu modelu w ofercie resellera na NanoGPT oraz oficjalnych wypowiedzi z okazji premiery ze strony Pokee AI i założyciela Zheqinga (Billa) Zhu. Każdy wynik benchmarkowy w tym artykule został wygenerowany przez Pokee AI. Pokee mówi to wprost — konsola stwierdza, że każda liczba „została zmierzona przez Pokee AI w jednym kontrolowanym środowisku, zarówno dla Isaaca, jak i dla każdego modelu bazowego, chyba że zaznaczono inaczej" — i, co trzeba zaliczyć im na plus, oznacza to, że modele bazowe zostały uruchomione ponownie, a nie skopiowane z zapowiedzi innych dostawców. To również znaczy, że żadne niezależne laboratorium nie odtworzyło żadnego z tych wyników i że na dzień dzisiejszy żadne nie opublikowało takiej próby.

Co Pokee tak naprawdę dostarczyło

Publiczna powierzchnia modelu jest niezwykle dobrze udokumentowana jak na tak młodą premierę, więc warto ją przedstawić, zanim przejdziemy do spornych kwestii.

Model — Pokee-Isaac 28B, w wersji v0, udostępniany jako pokee-isaac z api.pokee.ai za pośrednictwem kompatybilnego punktu końcowego.

Rozmiar i kontekst — 28 miliardów parametrów przy oknie wejściowym 10 000 000 tokenów; Pokee opisuje to jako „użyteczne od początku do końca, a nie tylko adresowalne."

Wyjście — 60 000 tokenów, co jest zarówno wartością domyślną, jak i twardym limitem.

Modalności — tekst na wejściu, tekst na wyjściu. Wejścia obrazu, dźwięku i wideo nie są obsługiwane, co warto zauważyć, biorąc pod uwagę, z czego zbudowany jest model.

Cena — $0.15 za milion tokenów wejściowych i $1.00 za milion wyjściowych, według własnej listy Pokee.

Funkcje agentowe — wywoływanie funkcji i ustrukturyzowane odpowiedzi w standardowym schemacie chat-completions; model pozycjonowany jest jako agent planujący-wykonujący-przeglądający, a nie jako model czatu.

Limity żądań — maksymalny rozmiar treści żądania to 45 MiB, a wszystko powyżej 16 MiB wymaga użycia strumieniowania SSE (stream: true oraz nagłówek Accept: text/event-stream).

Limity żądań — 500 żądań i 20 milionów tokenów na minutę, z 10 jednoczesnymi żądaniami na kontach darmowych i 25 na płatnych.

Wdrożenie — centrum danych B200, stacje robocze RTX 4090/5090, karty klienckie Intel Arc Pro, brzegowe NPU (Qualcomm i Intel Panther Lake, z AMD wymienionym jako oczekujące), a także na urządzeniu, z licencjonowaniem VPC i on-premises, zgodnie z którym, jak ujął to Pokee, „żadne żądanie nie opuszcza Twojego obwodu”.

Stacki serwujące — wsparcie od pierwszego dnia w vLLM i SGLang.

Firma — Pokee AI, założona w 2024 roku przez Zheqing (Bill) Zhu, wcześniej szefa działu stosowanego uczenia przez wzmacnianie w Meta; 12 mln USD finansowania zalążkowego prowadzonego przez Point72 Ventures z udziałem Qualcomm Ventures i Samsung NEXT.

Wagi są zamknięte. Relacje prasowe opisywały model jako o zamkniętym kodzie źródłowym „na razie”, co jest własnym zastrzeżeniem Pokee, a nie zobowiązaniem, i nie ogłoszono daty ani licencji udostępnienia.

Pokee-Isaac 28B-2

Architektura, której nikt nie opisze

Pokee przypisuje okno 10M „zastrzeżonej architekturze nieopartej wyłącznie na dekoderze”. To sformułowanie stanowi całość technicznego ujawnienia. Konsola zawiera link do raportu technicznego zatytułowanego Pokee-Isaac 28B v0: Model agentowy z efektywnym kontekstem 10M tokenów, datowanego na 3 sierpnia 2026; nie udało nam się dotrzeć do jego publicznej kopii, a dostępne materiały z premiery nie wymieniają mechanizmu uwagi, schematu pamięci ani receptury treningu.

To, co {{1}}Pokee{{/1}} powiedział o {{2}}rodowodzie{{/2}}, jest bardziej konkretne i jest to nieco niezręczne stwierdzenie: część wag {{3}}Isaaca{{/3}} jest dostrojona na bazie {{4}}Qwen3.6-27B{{/4}} na licencji {{5}}Apache-2.0{{/5}}, inne wagi zostały wytrenowane od podstaw przez {{6}}Pokee{{/6}}, a rezultat to {{7}}"nie konwencjonalny fine-tuning".{{/7}} To ostrożne zdanie. Uznaje bazę i jednocześnie zaprzecza temu określeniu.

To również wystarczy, aby ograniczyć zgadywanie, co społeczność badaczy AI natychmiast zaczęła robić. Badacz publikujący jako @teortaxesTex przedstawił zestaw ograniczeń w dniu premiery — częściowo dostrojony na bazie Qwen3.6-27B, nie wyłącznie dekoderowy, kontekst 10M, łącznie 28B — i zaproponował dwóch kandydatów: „jakiegoś ulepszonego Memory Sparse Attention” albo „po prostu enkoder dokumentów 1B”. Obie hipotezy warto zrozumieć, ponieważ nie są bezpodstawne.

Zacznij od arytmetyki. Qwen3.6-27B to gęsty model 27B z natywnym oknem 262K, hybrydowym mechanizmem uwagi gated-delta i enkoderem wizyjnym, który można pominąć, aby uruchomić model w trybie tekstowym. Isaac ma 28B i jest wyłącznie tekstowy. Jeśli usuniesz wieżę wizyjną bazowego modelu i dodasz mniej więcej miliard parametrów czegoś innego, trafisz dokładnie na 28B. Enkoder dokumentów lub pamięci o ~1B parametrów doklejony do dekodera 27B to najbardziej oszczędna interpretacja liczby parametrów opublikowanej przez Pokee, która czyniłaby etykietę „non-decoder-only” dosłownie prawdziwą, nie będąc przy tym nowatorskim twierdzeniem.

Przypuszczenie o Memory Sparse Attention wskazuje na autentyczny i niedawny nurt prac: artykuł o MSA (arXiv:2603.23516) łączy skalowalną rzadką uwagę z RoPE dla poszczególnych dokumentów, uzyskując liniową złożoność podczas treningu i wnioskowania, dodaje kompresję pamięci podręcznej KV oraz schemat „Memory Parallel”, i raportuje degradację poniżej 9% od 16K aż do 100M tokenów, przy czym wnioskowanie na 100M tokenów działa na dwóch kartach A800. To ten sam kształt wyniku, jaki deklaruje Pokee, o rząd wielkości dalej, od innej grupy badawczej. Nic nie łączy tych dwóch rzeczy poza kształtem — MSA nie jest pracą Pokee i Pokee jej nie cytuje — ale potwierdza to, że konstrukcja z odseparowaną pamięcią osiągająca takie długości na skromnym sprzęcie jest opublikowaną, realną możliwością, a nie marketingową niemożliwością.

W materiałach Pokee jest jedna liczba, która po cichu potwierdza interpretację oddzielnego enkodera. Przepustowość prefillu na pojedynczym B200 wynosi 42 400 tokenów na sekundę przy kontekście 1M tokenów i 137 200 tokenów na sekundę przy kontekście 10M. Przepustowość wzrasta ponad trzykrotnie, gdy kontekst staje się dziesięć razy dłuższy. Dekoder ponoszący kwadratowe koszty uwagi działa odwrotnie. Cokolwiek konsumuje te tokeny, staje się bardziej wydajne na token, gdy ich dodajesz, co jest sygnaturą zbiorczego przebiegu kodowania dokumentów, a nie zwykłego prefillu.

Dlaczego ma to znaczenie dla kogoś, kto zastanawia się nad użyciem modelu: jeśli okno 10M jest enkoderem dokumentów plus skompresowaną pamięcią, a nie pamięcią podręczną KV o 10M wpisach, to „kontekst” nie jest tutaj obiektem, na którym opierają się twoje intuicje. Zachowanie w przypadku dopisywania do rozmowy, edycji jednego dokumentu w środku korpusu lub oczekiwania, że buforowanie prefiksów zadziała, jest nieokreślone, a dokumentacja Pokee nie wymienia żadnego mechanizmu buforowania. Nie można wywnioskować tych zachowań z samej specyfikacji, a obecnie nie można ich też wywnioskować z architektury.

RULER przy 10M to liczba rzeczywista w pustym pokoju

{{1}}Dowodem na długi kontekst Pokee jest RULER{{/1}}, {{2}}uruchamiany przy 256K, 512K, 1M, 2M, 4M i 10M{{/2}}, z {{3}}dziesięcioma próbkami na konfigurację{{/3}}. {{4}}Isaac uzyskuje 96.9, 96.7, 95.0, 95.8, 96.7 i 93.3 dla tych sześciu długości{{/4}} — {{5}}jako jedyny model w panelu, który uzyskuje wynik dla każdej z nich{{/5}}.

Panel poniżej 1M to miejsce, gdzie znajduje się prawdziwy odczyt:

Przy 256K — Isaac 96.9, Nemotron 3 Super 120B 96.3, GPT-5.6 Luna 95.0, Gemini 3.5 Flash Lite 94.5, oraz 0.0 dla obu modeli Claude Haiku 4.5 i Qwen 3.5 122B, których okna kończą się poniżej tej długości.

Przy 512K — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.

Przy 1M — Isaac 95.0, Nemotron 91.8, Gemini 3.5 Flash Lite 29.4 oraz GPT-5.6 Luna 0.0, przy czym oba ostatnie oznaczono jako błędy przepełnienia kontekstu.

Od 2M wzwyż — sam Isaac, wszystko inne 0.0.

Trzy rzeczy następują po kolei. Po pierwsze, do 1M przewaga Isaaca nad konkurencją wynosi punkt lub dwa, a nie pokolenie — a jedyna linia bazowa, która pozostaje blisko, Nemotron 3 Super 120B, to model 120B, którego wyniki od 256K do 1M to liczby raportowane przez samo NVIDIA, które Pokee flaguje i wyklucza z porównania wierszy, zamiast podawać je jako zmierzone. Tak więc najbliższy konkurent przy tych długościach nie jest właściwie dopasowanym pomiarem, w żadną stronę.

Po drugie, co najmniej jedno z pustych pól wygląda na artefakt wdrożenia, a nie ograniczenie modelu. Pokee uruchomił GPT-5.6 Luna na Azure i oznaczył jego okno jako „>272K kontekstu”, odnotowując błąd przepełnienia kontekstu przy 1M. Okno udokumentowane przez samego dostawcę dla tego modelu wynosi około 1,05 mln tokenów, co podaje też nasza własna strona modelu. Czytelnik, który weźmie kolumnę 1M za dobrą monetę, uznałby, że Luna nie obsłuży 1M; bardziej uzasadniony wniosek jest taki, że wdrożenie Azure, które testował Pokee, nie mogło obsłużyć 1M.

Po trzecie, RULER to syntetyczny zestaw do wyszukiwania i agregacji, a nie benchmark rozumowania. Pokee jest tu również przejrzysty co do pewnej metodologicznej zawiłości: kolumny 256K i 512K uśredniają wszystkie 13 konfiguracji zadań, ale ekstrakcja popularnych słów jest niedostępna od 1M wzwyż, więc długie kolumny uśredniają pozostałe 12. Wyniki 93,3 przy 10M i 96,9 przy 256K nie są zatem oceniane na dokładnie tym samym zestawie zadań.

Trudniejszy test długiego kontekstu kończy się na 1M.

Bardziej odkrywczym benchmarkiem na stronie Pokee nie jest RULER. Jest nim MRCR v2, ośmioigłowe, wieloturowe zadanie koreferencyjne, w którym kilka celów jest rozrzuconych w długiej rozmowie, a model musi odnaleźć i jednoznacznie wskazać ten określony, więc zarówno częściowe przywołanie, jak i interferencja między igłami działają na niekorzyść. W skali 0–1 przy 1M tokenów:

Pokee-Isaac 28B — 0.500

Gemini 3.5 Flash Lite — 0,205

Nemotron 3 Super 120B — 0.067

GPT-5.6 Luna — 0.050

Claude Haiku 4.5 i Qwen 3.5 122B — 0,000, nic użytecznego przy tej długości

To znacznie szersza i znacznie bardziej wiarygodna przepaść niż ta, którą generuje RULER, i to właśnie tutaj propozycja modelu faktycznie się urzeczywistnia. Luna uzyskuje 95.0 na RULER przy 256K i 0.050 na MRCR przy 1M; przywołanie pojedynczego celu i dezambiguacja wielu igieł to nie ta sama umiejętność, a ta druga załamuje się jako pierwsza. Isaac degraduje się znacznie bardziej łagodnie.

To także największa luka dowodowa w całej tej premierze. MRCR v2 uruchomiono przy 256K, 512K i 1M — i na tym poprzestano. Wyniki samego Isaaca to 0.607, 0.743 i 0.500: niemonotoniczne, a przy 1M odnajduje połowę igieł. Nie ma opublikowanych wyników multi-needle przy 2M, 4M ani 10M od nikogo, w tym od Pokee. Twierdzenie o 10M opiera się w całości na łatwiejszym z dwóch testów, dokładnie przy tych długościach, dla których nie podjęto trudniejszego testu. Jeśli rozważasz ten model, ponieważ chcesz umieścić korpus liczący 25 000 stron w jednym prompcie i zadać pytanie, na które odpowiedź składa się z czterech miejsc w tym korpusie, to ta konkretna zdolność nie została zmierzona przy tej konkretnej długości.

Pokee-Isaac 28B-3

Jeśli chodzi o pracę agentową, Isaac jest równy Lunie, a nie od niej lepszy.

Pokee przeprowadził cztery benchmarki agentowe i właśnie tutaj szczerość firmy jest naprawdę niezwykła: jej własna strona podsumowuje wynik jako: Isaac prowadzi w dwóch, jest drugi w jednym i trzeci w jednym. To dokładny opis, ale nie jest to opis z relacji z premiery.

BFCL v4, wywoływanie funkcji (oceniane na podstawie dopasowania AST i przejść stanów, a nie przez sędziego LLM) — Isaac 70.94 vs GPT-5.6 Luna 70.61, z Claude Haiku 4.5 na 67.52, Qwen 3.5 122B na 64.88, Gemini 3.5 Flash Lite na 64.85, Nemotron 3 Super na 33.13.

τ³-bench, średnia z czterech domen (wieloturowe zadania obsługi klienta z symulowanym użytkownikiem, którego wymagania zmieniają się w trakcie rozmowy) — Isaac 0.662 vs Gemini 3.5 Flash Lite 0.631, Qwen 3.5 122B 0.611, GPT-5.6 Luna 0.527, Nemotron 0.426, Claude Haiku 4.5 0.408.

Terminal-Bench 2.1, podzbiór tylko tekstowy — GPT-5.6 Luna 69.8% vs Isaac 65.1%, następnie Gemini 3.5 Flash Lite i Qwen 3.5 122B ex aequo z 46.5%, Claude Haiku 4.5 34.9%, Nemotron 24.4%.

MCP-Atlas — zgłaszaj pokrycie na żywych serwerach narzędzi — GPT-5.6 Luna 77.90%, Gemini 3.5 Flash Lite 76.67%, Isaac 74.59%, Qwen 3.5 122B 70.24%, Claude Haiku 4.5 56.45%, Nemotron 48.95%.

Margines 0,33 punktu w BFCL v4 to parytet, a strona Pokee mówi to wprost, zamiast nazywać to zwycięstwem. Patrząc na wszystkie cztery testy, model 28B wymienia się zwycięstwami z szybką warstwą czołowego dostawcy w zadaniach agentowych. Dla modelu 28B to mocny wynik. Nie jest to jednak wynik, jaki dla większości czytelników implikuje określenie „model agentowy klasy frontier”, i oznacza, że powodem wyboru Isaaca jest okno kontekstowe i zakres wdrożenia, a nie zdolności agentowe.

Numer bezpieczeństwa jest najlepszy w panelu i wciąż nie jest dobry.

Na DTAP, zestaw prompt-injection, Isaac odnotowuje najniższy wskaźnik skuteczności ataków w panelu – 35,6 łącznie, przed Claude Haiku 4.5 z 37,9, GPT-5.6 Luna z 50,1, Qwen 3.5 122B z 54,0, Nemotron z 60,4 i Gemini 3.5 Flash Lite z 66,3. Wskaźniki bezpośrednie i pośrednie różnią się o mniej niż punkt, więc odporność jest co najmniej wyrównana w obu wektorach.

Trzy zastrzeżenia, wszystkie pochodzące z raportów samego Pokee, a nie od krytyków. Pomiary pośrednie przeprowadzono przy nieaktywnych zabezpieczeniach. Jawne odmowy pojawiły się tylko w 1,5% złośliwych zadań, co Pokee opisuje jako większość obecnej obrony będącą „przypadkową, a nie wynikającą z odmowy” — model nie tyle rozpoznaje i odrzuca ataki, ile po prostu nie daje się nimi użytecznie sterować. A na szerszej liście rankingowej 16 systemów, a nie w tym sześciomodelowym panelu, Isaac zajmuje piąte miejsce w atakach bezpośrednich, szóste w pośrednich i dziewiąte pod względem możliwości: środek stawki, a nie czołówka.

Jest też koszt bezpieczeństwa. Skuteczność Isaaca w przypadku legalnych zapytań wynosi 82,5, poniżej 85,1 Luny GPT-5.6 — odmawia lub gorzej radzi sobie z nieco większą liczbą legalnych zadań niż model, który pokonuje pod względem ataków. A 35,6 oznacza, że mniej więcej jedna na trzy próby wstrzyknięcia wciąż trafia do celu. Dla modelu, którego całe założenie polega na czytaniu dziesięciu milionów tokenów dokumentów, których nie napisałeś, to jest liczba, wokół której należy projektować zabezpieczenia, a nie liczba, która ma nas uspokajać. Sam DTAP również zasługuje na flagę: w przeciwieństwie do RULER, BFCL i τ³-bench nie jest uznanym publicznym rankingiem i nie udało nam się znaleźć niezależnej dokumentacji tego zestawu.

Ile kosztuje wywołanie dziesięciu milionów tokenów i jak długo trzeba czekać

Dziesięć milionów tokenów to mniej więcej 7,5 miliona słów, czyli około 25 000 stron. Przy stawce Pokee wynoszącej 0,15 $ za milion, jednorazowe wypełnienie okna kosztuje 1,50 $. Dodając odpowiedź o maksymalnej długości 60 000 tokenów po 1,00 $ za milion, jedno maksymalne wywołanie to około 1,56 $. To naprawdę tanio jak na ilość tekstu, i to najmocniejszy prosty argument za tym modelem.

Czas to prawdziwa cena. Na pojedynczym B200, Pokee podaje 72,9 sekundy do pierwszego tokena przy 10M — co wynika dokładnie z podzielenia 10 000 000 przez 137 200 tokenów/sekundę (wartość prefillu), więc jest to liczba dla sprzętu benchmarkowego, a nie zmierzona latencja API. Własna dokumentacja deweloperska Pokee mówi jednak deweloperom co innego: należy ustawić limit czasu klienta na co najmniej dziesięć minut dla promptów o wielomilionowej liczbie tokenów, ponieważ duży prompt może zająć „około siedmiu minut przy 10 milionach tokenów”. To mniej więcej sześciokrotna rozbieżność między slajdem o przepustowości a przewodnikiem integracyjnym. Obie to liczby Pokee; ta z dokumentacji jest tą, której musi uwierzyć Twoja konfiguracja limitu czasu.

Dekodowanie utrzymuje stałe tempo około 335 tokenów/sekundę niezależnie od ilości załadowanego kontekstu, co jest dobrą wiadomością architektonicznie, a kłopotliwą w praktyce: pełne 60 000 tokenów wyjścia zajmuje około trzech minut oprócz prefillu. Na sprzęcie konsumenckim obraz znów się zmienia — na Intel Arc Pro B70 Pokee raportuje 1 087–1 500 tokenów/sekundę prefillu (3,6–5× względem standardowego llama.cpp) i 58,8 tokenów/sekundę dekodowania. To przyzwoite wyniki jak na konsumenckie GPU, ale to nie są wyniki dla 10 mln tokenów.

Dwie praktyczne granice wynikają z rozmiaru samego wejścia. Dziesięć milionów tokenów angielskiego to mniej więcej 38 MiB tekstu, co mieści się w limicie 45 MiB treści żądania, ale znacznie przekracza próg 16 MiB, więc każde w pełni wykorzystujące okno wywołanie musi być strumieniowane — nie ma ścieżki niestrumieniowej do tej flagowej funkcji. A przy braku udokumentowanego buforowania podpowiedzi w API Pokee każde ponowne zapytanie o ten sam korpus to kolejne 1,50 USD i kolejny wielominutowy prefill. Wykaz resellerów na NanoGPT publikuje jednak stawkę odczytu z pamięci podręcznej wynoszącą 0,079 USD za milion, co w przypadku Isaaca oznaczałoby ponowny odczyt z pamięci podręcznej za około 0,79 USD — mniej więcej o połowę taniej, a nie zniżkę o rząd wielkości, jaką buforowanie podpowiedzi daje gdzie indziej.

Jedna korekta do porównania cen, ponieważ zmienia ona nagłówek. Pokee wycenia GPT-5.6 Luna na $0.40/$1.80 za milion, według danych z Azure. Własna cena katalogowa dostawcy dla Luny po obniżce z 31 lipca 2026 r. wynosi $0.20/$1.20 i to właśnie ona widnieje na naszej stronie modelu, ponieważ OrcaRouter przekazuje ceny katalogowe dostawców z 0% marżą, zamiast odsprzedawać je z narzutem. W porównaniu z prawidłową wartością, Isaac jest o 25% tańszy na wejściu i o 17% tańszy na wyjściu niż szybki poziom frontier — wciąż tańszy, ale przewaga jest znacznie węższa, niż sugeruje panel, a najtańsza cena wyjściowa w panelu należy do Nemotron 3 Super i wynosi $0.65. Przewaga cenowa Isaaca jest realna; po prostu nie jest to część tej premiery, która jest niezwykła.

Pokee-Isaac 28B-4

Część, która jest naprawdę nowa

Usuń otoczkę benchmarkową, a zostaje coś niezwykłego. Model 28B z bardzo długim kontekstem, który działa wewnątrz VPC, na stacji roboczej z RTX 4090, na karcie Intel Arc Pro oraz na mobilnym krzemie klasy NPU, z obsługą vLLM i SGLang od pierwszego dnia i licencją on-premises — takie połączenie jest niemal niedostępne gdzie indziej. Pokee twierdzi również, że osiąga około 5-krotnie większą wydajność pamięci podręcznej KV niż standardowe implementacje — to dane producenta bez niezależnej reprodukcji, ale to ten rodzaj liczby, który musiałby być prawdziwy, aby opowieść o wdrożeniu się trzymała.

Docelowy klient to nie ktoś, kto szuka lepszego agenta. To ktoś z dużym, wrażliwym, w większości statycznym korpusem — zestawami umów, aktami spraw, monolitycznym kodem źródłowym, miesiącami logów — który prawnie lub politycznie nie może opuścić granicy, i kto w przeciwnym razie budowałby potok wyszukiwania, aby obejść okno kontekstowe 200K. W porównaniu z tą alternatywą argumentem nie jest „tańszy niż RAG”. Embedding i wyszukiwanie w zbiorze ponad 25 000 stron kosztują centy za zapytanie i zawsze będą kosztować. Argumentem jest to, że nie ma strategii chunkowania do dostrajania, nie ma żadnego recallu do stracenia i nie ma drugiego systemu, który należałoby synchronizować z pierwszym. To, czy ten kompromis jest wart 1,50 dolara i kilka minut na zapytanie, zależy wyłącznie od tego, jak często zadajesz zapytania.

Kto powinien spróbować teraz, a kto powinien poczekać?

Wypróbuj to teraz, jeśli prototypujesz na korpusie w zakresie 1M–4M, gdzie wyniki Isaaca są najmocniejsze, a realnie dostępnych alternatyw jest niewiele, albo jeśli wdrożenie on-premises przy 28B to wymóg, który Cię blokował. Dziesięć równoczesnych żądań w darmowej wersji wystarczy, aby sprawdzić, czy model czyta Twoje dokumenty tak, jak tego potrzebujesz.

Zaraz, jeśli potrzebujesz konkretnie liczby 10M, a zadawane pytania są wieloetapowe, bo właśnie tego połączenia nikt dotąd nie zmierzył. Zaraz, jeśli potrzebujesz wejścia multimodalnego, którego model nie akceptuje. Zaraz, jeśli liczy się opóźnienie, bo wywołanie pełnego okna trwa minuty, a nie sekundy. I rozważ oczywiste ryzyko zależności: to model w wersji v0, z zamkniętymi wagami, od firmy z rundą seed o wartości 12 mln USD, i to jedyny model na świecie, który oferuje możliwość, którą sprzedaje. Nie ma żadnego drugiego dostawcy, na którego można się przełączyć, jeśli zniknie.

Ten ostatni punkt jest praktycznym powodem, dla którego warto zachować uczciwe porównanie. Pokee-Isaac 28B nie jest dziś dostępny w OrcaRouter — jeśli go chcesz, znajdziesz go we własnym API Pokee lub u resellera. Ale trzy z pięciu modeli bazowych, z którymi się mierzy, czyli GPT-5.6 Luna, Gemini 3.5 Flash Lite i Claude Haiku 4.5, są dostępne na jednym kluczu OrcaRouter w cenie producenta, co sprawia, że ten użyteczny eksperyment jest tani do przeprowadzenia: uruchom swoje rzeczywiste zadanie z długim kontekstem na tych trzech modelach przy długościach, które obsługują, i sprawdź, czy Twój korpus naprawdę potrzebuje dziesięciu milionów tokenów, czy wystarczy 400 000 i lepszy prompt. Jeśli potrzebuje dziesięciu milionów, dowiedziałeś się czegoś warte 1,50 dolara za wywołanie. Jeśli nie, uniknąłeś budowania ścieżki produkcyjnej na pojedynczym źródle v0.

Trzy pytania warte odpowiedzi

Czy Pokee-Isaac 28B to tylko fine-tuning?

Nie w żadnym normalnym znaczeniu tego wyrażenia, choć nie jest to też niezależne od tej bazy. Stanowisko Pokee jest takie, że niektóre wagi powstały przez fine-tuning Qwen3.6-27B na licencji Apache-2.0, podczas gdy inne zostały wytrenowane od zera, a architektura nie jest typu decoder-only. Obie części tego stanowiska są zgodne z liczbą parametrów: Qwen3.6-27B to 27B dense z pomijalnym enkoderem wizyjnym, Isaac to 28B i wyłącznie tekstowy, więc około miliarda parametrów nowej mechaniki zastąpiło wieżę wizyjną. Czym jest ta mechanika, nie zostało ujawnione, a dopóki to nie nastąpi, „niekonwencjonalny fine-tune” to twierdzenie oparte na słowie Pokee, a nie na czymkolwiek weryfikowalnym. Licencja Apache-2.0 na bazie czyni pochodną legalną; nie czyni jednak zamkniętego wydania wyniku niczym niezwykłym, co warto zauważyć głównie dlatego, że tak konkretny rodowód rzadko bywa dobrowolnie ujawniany.

Czy naprawdę może uruchomić 10 milionów tokenów na RTX 4090?

Twierdzenie o działaniu na pojedynczym GPU i twierdzenie o 10M pochodzą z tej samej premiery, ale nie z tego samego pomiaru. Każda wartość przepustowości, którą Pokee publikuje dla kontekstu 10M — 137 200 tokenów/sekundę prefill, 72,9 sekundy do pierwszego tokena — dotyczy pojedynczego B200. Wartości dla RTX 4090 i Arc Pro są prawdziwe, ale dotyczą znacznie mniejszej skali; wartości dla Arc Pro B70 to 1 087–1 500 tokenów/sekundę prefill, co oznaczałoby, że prefill 10M tokenów trwałby godzinami. „Możliwy do wdrożenia na pojedynczym GPU, począwszy od RTX 4090” najlepiej rozumieć jako twierdzenie o tym, że wagi mieszczą się w pamięci, a model działa w użyteczny sposób, a nie o tym, że reklamowana długość kontekstu jest praktyczna na tej karcie.

Czy powinienem zastąpić nim pipeline RAG?

Nie na podstawie tych dowodów, z jednym wyjątkiem. Argument za zastąpieniem wyszukiwania jest najsilniejszy, gdy zapytania są wieloskokowe — dokładnie ten tryb awarii, z którym porcjowane wyszukiwanie radzi sobie słabo — a wydajność wieloskokowa powyżej 1M tokenów to rzecz, której Pokee nie zmierzył. MRCR v2 zatrzymuje się na 1M, gdzie Isaac znajduje połowę igieł. Wyjątkiem jest korpus, który wygodnie mieści się w przedziale 1M–2M tokenów, gdzie zmierzone wyniki Isaaca są mocne, oczekiwanie trwa dziesiątki sekund, a nie minuty, a usunięcie warstwy wyszukiwania eliminuje realną złożoność operacyjną. Powyżej tego progu traktuj okno jako sposób na uniknięcie budowania wyszukiwania dla prototypu, a nie jako powód do usunięcia działającego rozwiązania.

Co by to rozstrzygnęło

Cztery rzeczy, z których żadna nie wymaga ufania komukolwiek. Niezależny przebieg RULER lub MRCR przy 2M lub więcej, przez kogokolwiek, na publicznym API. Wynik MRCR v2 od Pokee przy długościach, które już reklamuje. Osiągalny raport techniczny nazywający mechanizm — w tym momencie pytanie o enkoder przestaje być arytmetyką, a staje się faktem. Oraz wydanie wag, na które „zamknięte źródło na razie” wskazuje, niczego nie obiecując.

Do tego czasu uczciwe podsumowanie jest węższe niż premiera i bardziej interesujące niż sceptycyzm. Pokee AI wypuściło model 28B, który mierzalnie utrzymuje wyszukiwanie w długim kontekście dalej niż cokolwiek, co można obecnie kupić, dorównuje szybkiej warstwie czołowych modeli w zadaniach agentowych, jest najbezpieczniejszy w swoim panelu i plasuje się w środku stawki w szerszym porównaniu, a także działa w miejscach, w których nic o podobnych możliwościach nie działa. Firma zdecydowała się również opublikować jedyne liczby, jakie istnieją na temat możliwości, której nikt inny nie oferuje, i nie zdradzać, jak to działa. Obie to decyzje, które młoda firma ma prawo podjąć. Żadna z nich nie zastępuje testu przeprowadzonego przez kogoś spoza firmy.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube