Pokee-Isaac 28B-1
Engineering & Research

Pokee-Isaac 28B: 10 Juta Token Konteks, dan Arsitektur yang Tidak Akan Dijelaskan Pokee

Penulis

Jim Song

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ada sebuah kolom dalam Pokee-Isaac 28B perbandingan peluncurannya di mana lima dari enam model mendapat skor 0.0, dan catatan kaki di bawahnya lebih menarik daripada angka di atasnya. Pada panjang konteks 10 juta token, model 28B baru Pokee AI mencetak 93.3 di RULER dan setiap baseline yang diukur dengannya — GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super 120B, Qwen 3.5 122B — tidak mengembalikan apa pun yang dapat digunakan. Catatan kaki menjelaskan bahwa tiga dari lima model tersebut bahkan tidak dapat dibeli pada panjang konteks apa pun di atas 262K. Jadi skornya nyata, dan ruangannya kosong. Itu adalah dua klaim yang berbeda, dan sebagian besar liputan yang diterbitkan sejak model tersebut muncul pada 5 Agustus 2026 telah menggabungkan keduanya.

Itu bukan alasan untuk mengesampingkan apa yang dirilis Pokee. Itu adalah alasan untuk bersikap presisi tentang bagian mana yang telah didemonstrasikan, mana yang sekadar tidak disengketakan, dan mana yang sama sekali tidak dijelaskan. Segala hal di bawah ini berasal dari empat sumber utama: halaman model Pokee-Isaac di konsol Pokee sendiri, dokumentasi pengembang Pokee, daftar pengecer model di NanoGPT, dan pernyataan peluncuran dari Pokee AI serta pendiri Zheqing (Bill) Zhu. Setiap angka tolok ukur dalam artikel ini dihasilkan oleh Pokee AI. Pokee mengatakannya dengan terus terang — konsol tersebut menyatakan bahwa setiap angka "diukur oleh Pokee AI dalam satu lingkungan yang terkendali, untuk Isaac dan untuk setiap garis dasar (baseline) sama halnya, kecuali ditandai lain" — dan perlu diakui, itu berarti garis dasar dijalankan ulang, bukan disalin dari pengumuman vendor lain. Itu juga berarti tidak ada laboratorium independen yang mereproduksi semuanya, dan hingga saat ini belum ada yang memublikasikan upaya untuk melakukannya.

Apa yang sebenarnya dikirim oleh Pokee

Permukaan publik model ini terdokumentasi dengan sangat baik untuk peluncuran yang masih semuda ini, jadi ada baiknya kita memaparkannya sebelum sampai pada bagian-bagian yang diperdebatkan.

Model — Pokee-Isaac 28B, versi v0, disajikan sebagai pokee-isaac dari api.pokee.ai melalui endpoint yang kompatibel.

Ukuran dan konteks — 28 miliar parameter dengan jendela input 10,000,000 token; Pokee menggambarkannya sebagai "dapat digunakan dari ujung ke ujung, bukan sekadar dapat dialamatkan."

Output — 60.000 token, yang merupakan nilai default sekaligus batas maksimum.

Modalitas — teks masuk, teks keluar. Input gambar, audio, dan video tidak didukung, yang perlu diperhatikan mengingat dari apa model ini dibangun.

Harga — $0.15 per juta token input dan $1.00 per juta output, pada daftar Pokee sendiri.

Fitur agentik — pemanggilan fungsi dan keluaran terstruktur dalam skema chat-completions standar; model ini diposisikan sebagai agen perencana-pelaksana-peninjau, bukan sebagai model percakapan.

Batas permintaan — batas badan permintaan 45 MiB, dengan apa pun yang melebihi 16 MiB harus menggunakan streaming SSE (stream: true serta Accept: text/event-stream header).

Batas laju — 500 permintaan dan 20 juta token per menit, dengan 10 permintaan bersamaan pada akun gratis dan 25 pada akun berbayar.

Penerapan — datacenter B200, workstation RTX 4090/5090, kartu klien Intel Arc Pro, NPU edge (Qualcomm dan Intel Panther Lake, dengan AMD terdaftar sebagai tertunda), dan on-device, dengan lisensi VPC dan on-premises yang, menurut Pokee, "tidak ada permintaan yang keluar dari perimeter Anda."

Stack penyajian — dukungan hari pertama di vLLM dan SGLang.

Perusahaan — Pokee AI, didirikan pada 2024 oleh Zheqing (Bill) Zhu, sebelumnya kepala pembelajaran penguatan terapan di Meta; pendanaan awal $12M dipimpin oleh Point72 Ventures dengan Qualcomm Ventures dan Samsung NEXT.

Bobot modelnya tertutup. Liputan menggambarkan model tersebut sebagai sumber tertutup "untuk saat ini," yang merupakan sikap hati-hati Pokee sendiri, bukan komitmen, dan belum ada tanggal atau lisensi yang diumumkan untuk rilis.

Pokee-Isaac 28B-2

Arsitektur yang tidak akan dideskripsikan oleh siapa pun

Pokee mengaitkan jendela 10M dengan "arsitektur proprietary non-decoder-only." Ungkapan itu adalah keseluruhan pengungkapan teknis. Konsol tersebut menautkan sebuah laporan teknis berjudul Pokee-Isaac 28B v0: A 10M-Token Context Efficient Agentic Model, bertanggal 3 Agustus 2026; kami tidak dapat mengakses salinan publiknya, dan materi peluncuran yang dapat diakses tidak menyebutkan mekanisme perhatian, skema memori, atau resep pelatihan.

{{1}}Apa yang dikatakan Pokee tentang garis keturunan lebih spesifik, dan ini agak canggung untuk dikatakan:{{/1}} sebagian bobot Isaac merupakan hasil fine-tuning dari {{KEEP}}Qwen3.6-27B{{/KEEP}} di bawah lisensi {{KEEP}}Apache-2.0{{/KEEP}}, bobot lainnya dilatih dari awal oleh Pokee, dan hasilnya adalah "{{2}}bukan fine-tune konvensional.{{/2}}" {{3}}Itu adalah kalimat yang hati-hati.{{/3}} Kalimat itu mengakui basisnya dan sekaligus menyangkal karakterisasi tersebut.

Ini juga cukup untuk membatasi dugaan, yang langsung dilakukan oleh komunitas riset AI. Peneliti yang memposting sebagai @teortaxesTex memaparkan rangkaian batasan pada hari peluncuran — sebagian di-fine-tune dari Qwen3.6-27B, non-decoder-only, konteks 10M, total 28B — dan mengusulkan dua kandidat: "semacam Memory Sparse Attention yang dimodifikasi" atau "hanya encoder dokumen 1B." Kedua tebakan ini layak dipahami, karena bukan sekadar iseng.

Mulailah dengan aritmetika. Qwen3.6-27B adalah model 27B yang padat dengan jendela asli 262K, perhatian hibrida gated-delta, dan encoder visi yang dapat dilewati untuk menjalankan model hanya-teks. Isaac berukuran 28B dan hanya-teks. Jika Anda membuang menara visi model dasar dan menambahkan sekitar satu miliar parameter dari hal lain, 28B adalah tempat Anda mendarat. Encoder dokumen atau memori ~1B yang dipasang pada decoder 27B adalah pembacaan paling hemat dari jumlah parameter yang diterbitkan Pokee, dan itu akan membuat label 'non-decoder-only' benar secara harfiah tanpa menjadi klaim baru.

Tebakan Memory Sparse Attention menunjuk pada lini riset yang nyata dan terbaru: makalah MSA (arXiv:2603.23516) menggabungkan sparse attention yang skalabel dengan RoPE per-dokumen untuk mendapatkan kompleksitas linear dalam pelatihan dan inferensi, menambahkan kompresi KV-cache beserta skema "Memory Parallel", dan melaporkan degradasi di bawah 9% dari 16K hingga 100M token, dengan inferensi 100M token yang berjalan di dua A800. Itu adalah bentuk hasil yang sama dengan yang diklaim Pokee, satu orde magnitudo lebih jauh lagi, dari kelompok yang berbeda. Tidak ada yang menghubungkan keduanya selain bentuknya — MSA bukan karya Pokee dan Pokee tidak mengutipnya — tetapi hal ini menegaskan bahwa desain memori terdekopel yang mencapai panjang tersebut pada perangkat keras sederhana adalah sesuatu yang telah dipublikasikan dan masuk akal, bukan sekadar ketidakmungkinan pemasaran.

Ada satu angka dalam materi Pokee sendiri yang secara halus mendukung pembacaan encoder terpisah. Throughput prefill pada satu B200 adalah 42.400 token/detik pada konteks 1M token dan 137.200 token/detik pada 10M. Throughput meningkat lebih dari tiga kali lipat seiring konteksnya menjadi sepuluh kali lebih panjang. Decoder yang menanggung biaya attention kuadratik melakukan hal yang sebaliknya. Apa pun yang mengonsumsi token-token tersebut menjadi lebih efisien per token seiring Anda menambahkannya, yang merupakan ciri khas dari proses encoding massal atas dokumen-dokumen, bukan prefill biasa.

Mengapa semua ini penting bagi seseorang yang memutuskan apakah akan menggunakan model ini: jika jendela 10M adalah encoder dokumen ditambah memori terkompresi, bukan cache KV dengan 10M entri, maka "konteks" di sini bukanlah objek yang menjadi dasar intuisi Anda. Bagaimana perilakunya saat Anda menambahkan ke percakapan, mengedit satu dokumen di tengah korpus, atau mengharapkan cache prefiks berfungsi tidak ditentukan, dan dokumentasi Pokee tidak mencantumkan mekanisme cache sama sekali. Anda tidak dapat menalar perilaku tersebut dari lembar spesifikasi, dan saat ini Anda juga tidak dapat menalarnya dari arsitekturnya.

RULER pada 10M adalah bilangan real di ruangan kosong.

Bukti konteks panjang Pokee adalah RULER, dijalankan pada 256K, 512K, 1M, 2M, 4M, dan 10M, dengan sepuluh sampel per konfigurasi. Isaac mencetak 96.9, 96.7, 95.0, 95.8, 96.7, dan 93.3 pada enam panjang tersebut — satu-satunya model dalam panel yang mengembalikan skor pada setiap panjang.

Panel di bawah 1M adalah tempat bacaan yang jujur berada:

Pada 256K — Isaac 96.9, Nemotron 3 Super 120B 96.3, GPT-5.6 Luna 95.0, Gemini 3.5 Flash Lite 94.5, dan 0.0 untuk Claude Haiku 4.5 dan Qwen 3.5 122B, yang jendela konteksnya berhenti di bawah panjang tersebut.

Pada 512K — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.

Pada 1M — Isaac 95.0, Nemotron 91.8, Gemini 3.5 Flash Lite 29.4, dan GPT-5.6 Luna 0.0, keduanya yang terakhir ditandai sebagai kesalahan overflow konteks.

Pada 2M dan seterusnya — Isaac sendiri, semua yang lain 0.0.

Tiga hal menyusul. Pertama, hingga 1M, keunggulan Isaac atas yang lain hanyalah satu atau dua poin, bukan satu generasi — dan satu-satunya baseline yang tetap dekat, Nemotron 3 Super 120B, adalah model 120B yang angka 256K-ke-1M-nya merupakan angka laporan mandiri NVIDIA sendiri, yang Pokee tandai dan kecualikan dari perbandingan baris, bukan menganggapnya sebagai hasil pengukuran. Jadi pesaing terdekat pada panjang tersebut sebenarnya bukanlah pengukuran yang sepadan, di kedua arah.

Kedua, setidaknya salah satu bagian yang kosong tampak seperti artefak penerapan, bukan batasan model. Pokee menjalankan GPT-5.6 Luna melalui Azure dan menandai jendela konteksnya sebagai ">272K konteks," mencatat kesalahan overflow konteks pada 1M. Jendela yang didokumentasikan vendor untuk model tersebut adalah sekitar 1,05 juta token, dan itulah yang dilaporkan oleh halaman model kami sendiri untuk model itu. Pembaca yang menganggap kolom 1M itu begitu saja akan menyimpulkan bahwa Luna tidak dapat melakukan 1M; kesimpulan yang lebih dapat dipertahankan adalah bahwa penerapan Azure yang diuji Pokee tidak dapat melakukannya.

Ketiga, RULER adalah rangkaian sintetis untuk pengambilan-dan-agregasi, bukan tolok ukur penalaran. Pokee juga transparan tentang kerumitan metodologis di sini: kolom 256K dan 512K merata-ratakan semua 13 konfigurasi tugas, tetapi ekstraksi kata-kata umum tidak tersedia mulai dari 1M ke atas, sehingga kolom panjang merata-ratakan 12 sisanya. Oleh karena itu, 93.3 pada 10M dan 96.9 pada 256K tidak dinilai dengan campuran tugas yang benar-benar sama.

Tes konteks panjang yang lebih sulit berhenti di 1M

Benchmark yang lebih mengungkap di halaman Pokee bukanlah RULER. Itu adalah MRCR v2, sebuah tugas co-reference multi-ronde dengan 8 jarum di mana beberapa target tersebar dalam percakapan panjang dan model harus mengambil serta mendisambiguasi satu target yang ditentukan, sehingga recall parsial dan interferensi antar-jarum sama-sama merugikan Anda. Pada skala 0–1, pada 1M token:

Pokee-Isaac 28B — 0.500

Gemini 3.5 Flash Lite — 0.205

Nemotron 3 Super 120B — 0.067

GPT-5.6 Luna — 0.050

Claude Haiku 4.5 dan Qwen 3.5 122B — 0.000, tidak ada yang dapat digunakan pada panjang tersebut

Ini adalah kesenjangan yang jauh lebih lebar dan jauh lebih kredibel daripada yang dihasilkan RULER, dan di sinilah tawaran model tersebut benar-benar terwujud. Luna mencetak 95,0 pada RULER di 256K dan 0,050 pada MRCR di 1M; pengingatan target tunggal dan disambiguasi multi-jarum bukanlah keterampilan yang sama, dan yang kedua runtuh lebih dulu. Isaac menurun jauh lebih anggun.

Hal ini juga merupakan lubang bukti terbesar dalam peluncuran tersebut. MRCR v2 dijalankan pada 256K, 512K, dan 1M — lalu berhenti. Skor Isaac sendiri di sana adalah 0,607, 0,743, dan 0,500: non-monotonik, dan pada 1M ia mengambil setengah jarumnya. Tidak ada hasil multi-jarum yang dipublikasikan pada 2M, 4M, atau 10M dari siapa pun, termasuk Pokee. Klaim 10M sepenuhnya bertumpu pada yang lebih mudah dari dua tes, tepatnya pada panjang di mana tes yang lebih sulit tidak dicoba. Jika Anda mempertimbangkan model ini karena ingin menempatkan korpus 25.000 halaman dalam satu prompt dan mengajukan pertanyaan yang jawabannya dirangkai dari empat tempat di dalamnya, kemampuan spesifik itu tidak terukur pada panjang spesifik itu.

Pokee-Isaac 28B-3

Dalam kerja agen, Isaac setara dengan Luna, bukan lebih unggul darinya.

Pokee menjalankan empat tolok ukur agentik, dan di sinilah keterusterangan perusahaan benar-benar tidak biasa: halaman mereka sendiri merangkum hasilnya sebagai Isaac unggul di dua, menempati posisi kedua di satu, dan ketiga di satu. Itu adalah deskripsi yang akurat, dan itu bukan deskripsi yang ada dalam liputan peluncuran.

BFCL v4, pemanggilan fungsi (dinilai dengan pencocokan AST dan transisi status, bukan dengan juri LLM) — Isaac 70.94 vs GPT-5.6 Luna 70.61, dengan Claude Haiku 4.5 pada 67.52, Qwen 3.5 122B pada 64.88, Gemini 3.5 Flash Lite pada 64.85, Nemotron 3 Super pada 33.13.

τ³-bench, rata-rata empat domain (tugas layanan pelanggan multi-putaran terhadap pengguna simulasi yang kebutuhannya berubah di tengah percakapan) — Isaac 0.662 vs Gemini 3.5 Flash Lite 0.631, Qwen 3.5 122B 0.611, GPT-5.6 Luna 0.527, Nemotron 0.426, Claude Haiku 4.5 0.408.

Terminal-Bench 2.1, subset teks saja — GPT-5.6 Luna 69.8% vs Isaac 65.1%, lalu Gemini 3.5 Flash Lite dan Qwen 3.5 122B seri di 46.5%, Claude Haiku 4.5 34.9%, Nemotron 24.4%.

MCP-Atlas, klaim cakupan di seluruh server alat langsung — GPT-5.6 Luna 77.90%, Gemini 3.5 Flash Lite 76.67%, Isaac 74.59%, Qwen 3.5 122B 70.24%, Claude Haiku 4.5 56.45%, Nemotron 48.95%.

Margin 0,33 poin pada BFCL v4 adalah paritas, dan halaman Pokee menyatakan hal itu daripada menyebutnya sebagai kemenangan. Jika dibaca keempat-empatnya, model 28B saling menang dengan tingkatan cepat vendor terdepan pada tugas-tugas agentik. Untuk model 28B, itu adalah hasil yang kuat. Itu bukan hasil yang tersirat oleh "model agentik kelas frontier" bagi kebanyakan pembaca, dan itu berarti alasan memilih Isaac adalah jendela konteks dan batas penerapannya, bukan kemampuan agennya.

Angka keamanan adalah yang terbaik dari panel dan masih belum bagus.

Pada DTAP, sebuah suite injeksi prompt, Isaac memperoleh tingkat keberhasilan serangan terendah di panel dengan total 35,6, mengungguli Claude Haiku 4.5 dengan 37,9, GPT-5.6 Luna dengan 50,1, Qwen 3.5 122B dengan 54,0, Nemotron dengan 60,4, dan Gemini 3.5 Flash Lite dengan 66,3. Tingkat serangan langsung dan tidak langsung berbeda kurang dari satu poin, sehingga ketahanannya setidaknya merata di kedua vektor tersebut.

Tiga catatan, semuanya berasal dari laporan Pokee sendiri, bukan dari para kritikus. Pengukuran tidak langsung dilakukan saat pengaman tidak aktif. Penolakan eksplisit hanya terjadi pada 1,5% tugas berbahaya, yang oleh Pokee digambarkan sebagai sebagian besar pertahanan saat ini bersifat "insidental, bukan penolakan" — model ini bukannya mengenali dan menolak serangan, melainkan gagal untuk diarahkan secara berguna oleh serangan-serangan tersebut. Dan terhadap papan peringkat 16 sistem yang lebih luas, alih-alih panel enam model ini, Isaac menempati posisi kelima untuk serangan langsung, keenam untuk serangan tidak langsung, dan kesembilan untuk kapabilitas: posisi tengah, bukan terdepan.

Ada juga biaya untuk keamanan. Tingkat keberhasilan untuk permintaan normal Isaac adalah 82,5, di bawah GPT-5.6 Luna yang 85,1 — ia menolak atau gagal menangani sedikit lebih banyak pekerjaan sah daripada model yang dikalahkannya dalam serangan. Dan 35,6 berarti kira-kira satu dari tiga percobaan injeksi masih berhasil. Untuk model yang premis utamanya adalah membaca sepuluh juta token dokumen yang tidak Anda tulis, itulah angka yang harus dirancang untuk guardrails, bukan angka yang seharusnya meyakinkan. DTAP sendiri layak untuk ditandai: tidak seperti RULER, BFCL, dan τ³-bench, ia bukan papan peringkat publik yang mapan, dan kami tidak dapat menemukan dokumentasi independen untuk rangkaian tersebut.

Berapa biaya panggilan sepuluh juta token, dan berapa lama Anda menunggu

Sepuluh juta token kira-kira 7,5 juta kata, atau sekitar 25.000 halaman. Dengan harga Pokee $0,15 per juta, mengisi jendela sekali memakan biaya $1,50. Tambahkan jawaban dengan panjang maksimum 60.000 token seharga $1,00 per juta, dan satu panggilan maksimum mencapai sekitar $1,56. Itu benar-benar murah untuk volume teks yang terlibat, dan itu adalah argumen sederhana terkuat untuk model ini.

Waktu adalah harga yang sesungguhnya. Pada satu B200, Pokee melaporkan 72,9 detik hingga token pertama pada 10M — yang merupakan 10.000.000 dibagi angka prefill 137.200 token/detik, jadi itu adalah angka benchmark perangkat keras, bukan latensi API yang terukur. Dokumentasi pengembang Pokee sendiri menceritakan kisah yang berbeda kepada para pengembang: berikan setidaknya timeout klien sepuluh menit untuk prompt dengan jutaan token, karena prompt besar dapat memakan waktu "sekitar tujuh menit pada 10 juta token." Itu kira-kira kesenjangan enam kali lipat antara slide throughput dan panduan integrasi. Keduanya adalah angka Pokee; yang ada di dokumentasi itulah yang harus dipercaya oleh konfigurasi timeout Anda.

Decode stabil di sekitar 335 token/detik berapa pun banyaknya konteks yang berada di memori, yang merupakan kabar baik secara arsitektural dan kabar janggal secara praktis: output penuh 60.000 token membutuhkan sekitar tiga menit di luar waktu prefill. Pada perangkat keras konsumen, situasinya bergeser lagi — pada Intel Arc Pro B70, Pokee melaporkan prefill 1.087–1.500 token/detik (3,6–5× llama.cpp standar) dan decode 58,8 token/detik. Itu angka yang lumayan untuk GPU klien, dan itu bukan angka 10 juta token.

Dua batasan praktis muncul dari ukuran masukan itu sendiri. Sepuluh juta token bahasa Inggris kira-kira setara 38 MiB teks, yang muat di bawah batas badan permintaan 45 MiB tetapi berada jauh di atas ambang 16 MiB, sehingga setiap panggilan jendela penuh yang sesungguhnya harus dialirkan — tidak ada jalur non-streaming menuju fitur utama tersebut. Dan tanpa caching prompt yang terdokumentasi di API Pokee, setiap permintaan ulang terhadap korpus yang sama berarti $1,50 lagi dan prefill multi-menit lagi. Daftar pengecer di NanoGPT memang memublikasikan tarif pembacaan cache sebesar $0,079 per juta, yang jika berlaku untuk Isaac menjadikan pembacaan ulang cache sekitar $0,79 — kira-kira setengah harga, bukan diskon orde besaran yang tersirat oleh caching prompt di tempat lain.

Satu koreksi untuk perbandingan harga, karena itu mengubah judul utamanya. Pokee memberi harga GPT-5.6 Luna sebesar $0,40/$1,80 per juta, bersumber dari Azure. Harga daftar vendor sendiri untuk Luna setelah pemotongan 31 Juli 2026 adalah $0,20/$1,20, yang itulah yang ditampilkan halaman model kami untuk Luna, karena OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, bukan menjualnya kembali dengan margin. Dibandingkan angka yang benar, Isaac lebih murah 25% untuk input dan 17% untuk output daripada tier frontier cepat — masih lebih murah, tetapi keunggulannya jauh lebih tipis daripada yang disarankan panel, dan harga output termurah panel secara keseluruhan adalah Nemotron 3 Super sebesar $0,65. Keunggulan harga Isaac nyata; hanya saja itu bukan bagian dari peluncuran ini yang luar biasa.

Pokee-Isaac 28B-4

Bagian yang sebenarnya baru.

Buang kerangka tolok ukurnya, dan yang tersisa adalah sesuatu yang tidak biasa. Model 28B dengan konteks yang sangat panjang yang berjalan di dalam VPC, di workstation RTX 4090, di kartu Intel Arc Pro, dan di silikon mobile kelas NPU, dengan dukungan vLLM dan SGLang sejak hari pertama serta lisensi on-premises — kombinasi itu hampir tidak tersedia di tempat lain. Pokee juga mengklaim efisiensi cache KV sekitar 5× dibandingkan implementasi standar, yang merupakan angka dari vendor tanpa reproduksi, tetapi itu adalah jenis angka yang harus benar agar cerita penerapan ini masuk akal.

Pelanggan untuk ini bukanlah seseorang yang sedang mencari agen yang lebih baik. Ia adalah seseorang dengan korpus yang besar, sensitif, dan sebagian besar statis — kumpulan kontrak, berkas perkara, basis kode monolitik, log berbulan-bulan — yang secara hukum atau politik tidak boleh keluar dari batas, dan yang sebaliknya akan membangun pipeline pengambilan untuk mengakali jendela 200K. Dibandingkan dengan alternatif itu, tawarannya bukan "lebih murah daripada RAG." Melakukan embedding dan retrieval terhadap lebih dari 25.000 halaman memakan biaya beberapa sen per kueri dan akan selalu begitu. Tawarannya adalah tidak ada strategi chunking yang perlu disetel, tidak ada recall pengambilan yang hilang, dan tidak ada sistem kedua yang harus dijaga sinkron dengan sistem pertama. Apakah trade-off itu sebanding dengan $1,50 dan beberapa menit per kueri sepenuhnya bergantung pada seberapa sering Anda mengajukan kueri.

Siapa yang harus mencobanya sekarang, dan siapa yang harus menunggu

Cobalah sekarang jika Anda membuat prototipe terhadap korpus dalam rentang 1M–4M, di mana angka-angka Isaac paling kuat dan alternatifnya benar-benar minim, atau jika penerapan on-premises pada 28B adalah persyaratan yang selama ini menghambat Anda. Sepuluh permintaan bersamaan di tingkat gratis cukup untuk mengetahui apakah model membaca dokumen Anda sesuai yang Anda butuhkan.

Tunggu, jika Anda memang membutuhkan angka 10M secara spesifik dan pertanyaan yang Anda ajukan bersifat multi-hop, karena kombinasi itulah yang justru belum pernah diukur oleh siapa pun. Tunggu, jika Anda membutuhkan input multimodal, yang tidak diterima oleh model ini. Tunggu, jika latensi penting, karena panggilan dengan jendela penuh memakan waktu menit, bukan detik. Dan pertimbangkan risiko ketergantungan yang jelas: ini adalah model v0, dengan bobot tertutup, dari perusahaan dengan pendanaan awal $12M, dan ini adalah satu-satunya model di dunia yang menyediakan kemampuan yang dijualnya. Tidak ada penyedia kedua untuk dijadikan cadangan jika model ini hilang.

Poin terakhir itulah alasan praktis untuk menjaga perbandingan tetap jujur. Pokee-Isaac 28B belum tersedia di OrcaRouter saat ini — jika Anda menginginkannya, API milik Pokee sendiri atau reseller adalah tempatnya. Namun tiga dari lima baseline yang digunakannya untuk mengukur dirinya sendiri, GPT-5.6 Luna, Gemini 3.5 Flash Lite, dan Claude Haiku 4.5, tersedia dalam satu kunci OrcaRouter dengan harga sesuai daftar penyedia, yang membuat eksperimen yang berguna ini murah untuk disiapkan: jalankan tugas long-context Anda yang sebenarnya terhadap ketiga model tersebut pada panjang yang mereka dukung, dan lihat apakah korpus Anda benar-benar membutuhkan sepuluh juta token atau hanya 400.000 dengan prompt yang lebih baik. Jika membutuhkan sepuluh juta, Anda telah mempelajari sesuatu yang bernilai $1,50 per panggilan. Jika tidak, Anda telah menghindari membangun jalur produksi pada v0 sumber tunggal.

Tiga pertanyaan yang layak dijawab

Apakah Pokee-Isaac 28B hanyalah fine-tuning?

Bukan dalam penggunaan frasa yang wajar, meskipun hal itu juga tidak terlepas dari basis tersebut. Posisi Pokee adalah bahwa sebagian bobot di-fine-tune dari Qwen3.6-27B di bawah lisensi Apache-2.0 sementara sebagian lainnya dilatih dari awal, dan bahwa arsitekturnya bukan decoder-only. Kedua bagian pernyataan itu konsisten dengan jumlah parameter: Qwen3.6-27B adalah 27B dense dengan vision encoder yang dapat dilewati, Isaac adalah 28B dan khusus teks, sehingga sekitar satu miliar parameter mekanisme baru menggantikan menara visi tersebut. Mekanisme apa itu belum diungkapkan, dan sampai diungkapkan, klaim "bukan fine-tune konvensional" hanyalah pernyataan yang bertumpu pada perkataan Pokee, bukan pada sesuatu yang dapat diverifikasi. Lisensi Apache-2.0 pada model dasar membuat derivasi tersebut legal; lisensi itu tidak membuat rilis tertutup dari hasilnya menjadi sesuatu yang tidak lazim, yang perlu dicatat terutama karena garis keturunan sespesifik ini jarang diungkapkan secara sukarela.

Benarkah bisa menjalankan 10M token di RTX 4090?

Klaim GPU tunggal dan klaim 10M berasal dari peluncuran yang sama tetapi bukan dari pengukuran yang sama. Setiap angka throughput yang dipublikasikan Pokee pada konteks 10M — 137,200 token/detik prefill, waktu ke token pertama 72,9 detik — berada pada satu B200. Angka RTX 4090 dan Arc Pro memang nyata tetapi dikutip pada skala yang jauh lebih kecil; angka Arc Pro B70 adalah 1,087–1,500 token/detik prefill, yang akan menempatkan prefill 10M-token dalam hitungan jam. "Dapat digunakan di satu GPU mulai dari RTX 4090" paling baik dipahami sebagai klaim tentang bobot yang muat dan model yang melayani secara berguna, bukan tentang panjang konteks unggulan yang praktis di kartu tersebut.

Haruskah saya mengganti pipeline RAG dengan itu?

Tidak berdasarkan bukti ini, dengan satu pengecualian. Kasus untuk mengganti retrieval paling kuat ketika query Anda multi-hop — persis mode kegagalan yang ditangani retrieval terpotong (chunked retrieval) dengan buruk — dan performa multi-hop di atas 1M token adalah hal yang tidak diukur oleh Pokee. MRCR v2 berhenti di 1M, di mana Isaac mengambil setengah jarumnya. Pengecualiannya adalah korpus yang muat dengan nyaman dalam 1M–2M token, di mana angka terukur Isaac kuat, waktu tunggunya puluhan detik, bukan menit, dan menghilangkan lapisan retrieval menghapus kompleksitas operasional yang nyata. Di atas itu, perlakukan jendela tersebut sebagai cara untuk menghindari membangun retrieval untuk prototipe, bukan sebagai alasan untuk menghapus yang sudah berfungsi.

Apa yang bisa menyelesaikannya

Empat hal, {{1}}yang tak satu pun mengharuskan kepercayaan kepada siapa pun{{/1}}. Sebuah pengujian RULER atau MRCR independen {{2}}pada 2M atau lebih, oleh siapa pun, di API publik{{/2}}. Sebuah hasil MRCR v2 dari Pokee {{3}}pada panjang yang sudah diiklankannya{{/3}}. Sebuah laporan teknis yang dapat diakses yang menyebutkan mekanismenya, {{4}}pada titik di mana pertanyaan encoder bukan lagi soal aritmetika, melainkan fakta{{/4}}. Dan sebuah rilis bobot, {{5}}yang diisyaratkan oleh 'closed-source untuk saat ini' tanpa dijanjikan{{/5}}.

Sampai saat itu, {{1}}ringkasan yang adil lebih sempit daripada peluncurannya dan lebih menarik daripada skeptisismenya.{{/1}} Pokee AI telah merilis model 28B yang secara terukur mempertahankan pengambilan konteks panjang lebih jauh daripada apa pun yang saat ini dapat Anda beli, berimbang dengan tier cepat frontier pada pekerjaan agenik, menjadi yang teraman di panelnya sendiri dan kelas menengah melawan panel yang lebih luas, serta berjalan di tempat-tempat yang tidak dapat dijalankan oleh apa pun dengan kemampuan setara. Mereka juga telah memilih untuk memublikasikan satu-satunya angka yang ada tentang kemampuan yang tidak ditawarkan orang lain, dan tidak menjelaskan cara kerjanya. Keduanya adalah pilihan yang boleh diambil oleh perusahaan muda. Keduanya bukan pengganti bagi seseorang di luar gedung yang menjalankan tes.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube