Pokee-Isaac 28B-1
Engineering & Research

Pokee-Isaac 28B: 10 Triệu Token Ngữ Cảnh, và Một Kiến Trúc Mà Pokee Sẽ Không Mô Tả

Tác giả

Jim Song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Có một cột trong bảng so sánh Pokee-Isaac 28B khi ra mắt, nơi năm trong sáu mô hình đạt 0.0, và phần chú thích bên dưới thú vị hơn con số phía trên. Với độ dài ngữ cảnh 10 triệu token, mô hình 28B mới của Pokee AI đạt 93.3 trên RULER, còn mọi baseline mà nó được đem ra so sánh — GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super 120B, Qwen 3.5 122B — đều không trả về kết quả dùng được. Phần chú thích giải thích rằng ba trong năm mô hình đó thậm chí ngay từ đầu đã không thể mua được ở bất kỳ độ dài ngữ cảnh nào trên 262K. Vì vậy, con số là thật, và căn phòng trống rỗng. Đó là hai tuyên bố khác nhau, và hầu hết các bài tường thuật được đăng tải kể từ khi mô hình xuất hiện vào ngày 5 tháng 8 năm 2026 đã gộp chúng lại với nhau.

Đó không phải là lý do để bác bỏ những gì Pokee đã phát hành. Đó là lý do để chính xác về việc phần nào trong số đó đã được chứng minh, phần nào chỉ đơn thuần là không bị phản bác, và phần nào đơn giản là không được mô tả. Mọi thứ dưới đây đến từ bốn nguồn chính: trang mô hình Pokee-Isaac trên bảng điều khiển của chính Pokee, tài liệu dành cho nhà phát triển của Pokee, danh sách đại lý bán lại của mô hình trên NanoGPT, và các tuyên bố ra mắt từ Pokee AI và nhà sáng lập Zheqing (Bill) Zhu. Mọi con số điểm chuẩn trong bài viết này đều do Pokee AI tạo ra. Pokee nói rõ điều đó — bảng điều khiển ghi rằng mỗi con số "được đo bởi Pokee AI trong một môi trường được kiểm soát duy nhất, cho Isaac và cho mọi đường cơ sở như nhau, trừ khi được ghi chú khác" — và đáng ghi nhận cho họ, điều đó có nghĩa là các đường cơ sở đã được chạy lại thay vì sao chép từ thông báo của các nhà cung cấp khác. Điều đó cũng có nghĩa là chưa có phòng thí nghiệm độc lập nào tái tạo lại bất kỳ kết quả nào trong số đó, và tính đến hôm nay, chưa ai công bố một nỗ lực nào.

Pokee thực sự đã phát hành những gì

Bề mặt công khai của mô hình được ghi chép đầy đủ một cách bất thường đối với một sản phẩm ra mắt còn non trẻ như vậy, nên việc trình bày rõ trước khi đi vào những phần còn gây tranh cãi là điều đáng làm.

Mô hình — Pokee-Isaac 28B, phiên bản v0, được phục vụ dưới tên pokee-isaac từ api.pokee.ai thông qua một endpoint tương thích.

Kích thước và ngữ cảnh — 28 tỷ tham số với cửa sổ đầu vào 10.000.000 token; Pokee mô tả nó là "sử dụng được từ đầu đến cuối, không chỉ đơn thuần là truy cập được".

Đầu ra — 60.000 token, vừa là mặc định vừa là giới hạn tối đa.

Phương thức — văn bản vào, văn bản ra. Đầu vào hình ảnh, âm thanh và video không được hỗ trợ, điều đáng chú ý khi xét đến những gì mô hình được xây dựng từ đó.

Giá — $0.15 cho mỗi triệu token đầu vào và $1.00 cho mỗi triệu token đầu ra, theo danh sách riêng của Pokee.

Các tính năng tác tử — gọi hàm và đầu ra có cấu trúc theo lược đồ chat-completions chuẩn; mô hình được định vị như một tác tử lập kế hoạch–thực thi–đánh giá thay vì một mô hình trò chuyện.

Giới hạn yêu cầu — giới hạn kích thước thân yêu cầu là 45 MiB, với mọi thân yêu cầu vượt quá 16 MiB bắt buộc phải sử dụng SSE streaming (stream: true cộng với một Accept: text/event-stream tiêu đề).

Giới hạn tốc độ — 500 yêu cầu và 20 triệu token mỗi phút, với 10 yêu cầu đồng thời trên tài khoản miễn phí và 25 trên tài khoản trả phí.

Triển khai — trung tâm dữ liệu B200, máy trạm RTX 4090/5090, card client Intel Arc Pro, NPU biên (Qualcomm và Intel Panther Lake, với AMD được xếp vào danh sách đang chờ), và trên thiết bị, với cấp phép VPC và tại chỗ, theo đó, như Pokee nói, "không có yêu cầu nào rời khỏi ranh giới của bạn."

Bộ công cụ phục vụ — hỗ trợ ngay từ ngày đầu trên vLLM và SGLang.

Công ty — Pokee AI, được thành lập vào năm 2024 bởi Zheqing (Bill) Zhu, trước đây là trưởng bộ phận học tăng cường ứng dụng tại Meta; vòng hạt giống 12 triệu USD do Point72 Ventures dẫn đầu cùng với Qualcomm Ventures và Samsung NEXT.

Các trọng số vẫn bị đóng. Các bài phủ sóng mô tả mô hình này là mã nguồn đóng "trong thời điểm hiện tại," đây là lời bảo lưu của chính Pokee chứ không phải cam kết, và chưa có ngày phát hành hay giấy phép nào được công bố.

Pokee-Isaac 28B-2

Kiến trúc mà không ai sẽ mô tả

Pokee quy cửa sổ 10M cho một "kiến trúc độc quyền không chỉ dành cho bộ giải mã." Cụm từ đó là toàn bộ phần tiết lộ kỹ thuật. Bảng điều khiển liên kết đến một báo cáo kỹ thuật có tựa đề Pokee-Isaac 28B v0: A 10M-Token Context Efficient Agentic Model, đề ngày 3 tháng 8 năm 2026; chúng tôi không thể tiếp cận bản sao công khai của nó, và các tài liệu ra mắt có thể truy cập được không nêu tên cơ chế chú ý, cơ chế bộ nhớ, hoặc công thức huấn luyện.

Những gì Pokee nói về nguồn gốc cụ thể hơn, và đó là một điều hơi khó nói: một số trọng số của Isaac được tinh chỉnh từ Qwen3.6-27B theo giấy phép Apache-2.0 của nó, những trọng số khác do Pokee tự huấn luyện từ đầu, và kết quả là "không phải một bản tinh chỉnh thông thường." Đó là một câu thận trọng. Nó vừa thừa nhận nền tảng, vừa phủ nhận cách định nghĩa đó.

Điều đó cũng đủ để thu hẹp phạm vi phỏng đoán, và đó chính là điều cộng đồng nghiên cứu AI ngay lập tức bắt tay vào làm. Nhà nghiên cứu đăng bài với tên @teortaxesTex đã vạch ra bộ ràng buộc ngay trong ngày ra mắt — một phần được tinh chỉnh từ Qwen3.6-27B, không phải decoder-only, ngữ cảnh 10M, tổng cộng 28B — và đề xuất hai ứng viên: "một loại Memory Sparse Attention được nâng cấp" hoặc "chỉ là một bộ mã hóa tài liệu 1B." Cả hai phỏng đoán đều đáng để tìm hiểu, vì chúng không phải là những phỏng đoán suông.

Hãy bắt đầu với phép tính. Qwen3.6-27B là một mô hình dense 27B với cửa sổ gốc 262K, cơ chế chú ý lai gated-delta, và một bộ mã hóa thị giác có thể bỏ qua để chạy mô hình chỉ với văn bản. Isaac có 28B và chỉ xử lý văn bản. Nếu bạn bỏ đi phần tháp thị giác của mô hình cơ sở và thêm khoảng một tỷ tham số của thứ gì đó khác, bạn sẽ đạt đúng con số 28B. Một bộ mã hóa tài liệu hoặc bộ nhớ ~1B gắn thêm vào bộ giải mã 27B là cách diễn giải tiết kiệm nhất về số tham số mà Pokee công bố, và điều đó sẽ khiến nhãn "không chỉ là bộ giải mã" trở nên đúng theo nghĩa đen mà không phải là một tuyên bố mới lạ.

Suy đoán về Memory Sparse Attention chỉ tới một hướng nghiên cứu có thật và mới đây: bài báo MSA (arXiv:2603.23516) kết hợp sparse attention có khả năng mở rộng với RoPE theo từng văn bản để đạt độ phức tạp tuyến tính trong cả huấn luyện lẫn suy luận, đồng thời bổ sung nén KV-cache cùng cơ chế "Memory Parallel", và báo cáo mức suy giảm dưới 9% từ 16K lên tới 100 triệu token, với suy luận 100 triệu token chạy trên hai chiếc A800. Đó là dạng kết quả tương tự mà Pokee đang tuyên bố, xa hơn một bậc độ lớn, đến từ một nhóm nghiên cứu khác. Không có gì liên kết hai thứ này ngoài hình dạng đó — MSA không phải công trình của Pokee và Pokee cũng không trích dẫn nó — nhưng điều đó xác lập rằng một thiết kế bộ nhớ tách rời đạt tới những độ dài như vậy trên phần cứng khiêm tốn là một thứ đã được công bố và hoàn toàn khả thi, chứ không phải một lời tiếp thị bất khả thi.

Trong chính tài liệu của Pokee, có một con số âm thầm ủng hộ cách hiểu về encoder riêng biệt. Thông lượng prefill trên một B200 là 42.400 token/giây ở ngữ cảnh 1M token và 137.200 token/giây ở 10M. Thông lượng tăng hơn ba lần khi ngữ cảnh dài gấp mười lần. Một bộ giải mã phải chịu chi phí chú ý bậc hai thì sẽ làm điều ngược lại. Bất kỳ thứ gì đang tiêu thụ những token đó cũng trở nên hiệu quả hơn trên mỗi token khi bạn thêm chúng, đó là dấu hiệu đặc trưng của một lượt mã hóa hàng loạt trên các tài liệu chứ không phải là prefill thông thường.

Bất kỳ điều nào trong số này có ý nghĩa như thế nào đối với người đang quyết định có nên sử dụng mô hình hay không: nếu cửa sổ 10M là một bộ mã hóa tài liệu cộng với bộ nhớ nén chứ không phải là bộ đệm KV có 10M mục, thì "context" ở đây không phải là đối tượng mà trực giác của bạn được dựa vào. Cách nó hành xử khi bạn nối thêm vào một cuộc trò chuyện, chỉnh sửa một tài liệu ở giữa kho ngữ liệu, hay mong đợi prefix caching hoạt động là không được xác định, và tài liệu của Pokee không liệt kê bất kỳ cơ chế lưu bộ đệm nào cả. Bạn không thể suy luận về những hành vi đó từ bảng thông số kỹ thuật, và hiện tại bạn cũng không thể suy luận về chúng từ kiến trúc.

RULER ở 10M là một số thực trong một căn phòng trống.

Bằng chứng ngữ cảnh dài của Pokee là RULER, chạy ở 256K, 512K, 1M, 2M, 4M và 10M, với mười mẫu cho mỗi cấu hình. Isaac đạt 96.9, 96.7, 95.0, 95.8, 96.7 và 93.3 qua sáu độ dài đó — là mô hình duy nhất trong nhóm có điểm số ở mọi mức.

Bảng điều khiển bên dưới {{1}}1M{{/1}} là nơi hiển thị số liệu trung thực:

Ở 256K — Isaac 96.9, Nemotron 3 Super 120B 96.3, GPT-5.6 Luna 95.0, Gemini 3.5 Flash Lite 94.5, và 0.0 cho cả Claude Haiku 4.5 và Qwen 3.5 122B, vì cửa sổ ngữ cảnh của chúng dừng dưới độ dài đó.

Với 512K — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.

Ở mức 1M — Isaac 95.0, Nemotron 91.8, Gemini 3.5 Flash Lite 29.4, và GPT-5.6 Luna 0.0, cả hai mô hình cuối đều bị gắn cờ là lỗi tràn ngữ cảnh.

Tại mốc 2M và xa hơn — chỉ có Isaac, mọi thứ khác đều là 0.0.

Sau đây là ba điều. Thứ nhất, lên đến 1M, khoảng cách của Isaac so với các đối thủ chỉ là một hoặc hai điểm, không phải một thế hệ — và một baseline duy nhất bám sát, Nemotron 3 Super 120B, là mô hình 120B có các số liệu 256K-to-1M là số liệu tự báo cáo của NVIDIA, mà Pokee gắn cờ và loại khỏi so sánh theo hàng thay vì coi là số liệu đo được. Vì vậy, đối thủ gần nhất ở các độ dài đó thực chất không phải là một phép đo tương xứng, theo cả hai chiều.

Thứ hai, ít nhất một trong các ô trống trông giống một hiện vật triển khai hơn là một giới hạn của mô hình. Pokee đã chạy GPT-5.6 Luna qua Azure và ghi chú cửa sổ ngữ cảnh của nó là ">272K context," đồng thời ghi lại lỗi tràn ngữ cảnh ở mức 1M. Cửa sổ ngữ cảnh được nhà cung cấp tự công bố cho mô hình đó là khoảng 1,05M token, khớp với những gì trang mô hình của chính chúng tôi báo cáo cho nó. Một độc giả nhìn vào cột 1M theo giá trị bề mặt sẽ kết luận rằng Luna không thể xử lý 1M; kết luận đáng bảo vệ hơn là triển khai Azure mà Pokee đã kiểm thử không thể.

Thứ ba, RULER là một bộ truy xuất và tổng hợp dữ liệu nhân tạo, không phải là một chuẩn đánh giá suy luận. Pokee cũng minh bạch về một điểm phức tạp về phương pháp luận ở đây: các cột 256K và 512K lấy trung bình tất cả 13 cấu hình nhiệm vụ, nhưng tính năng trích xuất từ thông dụng không khả dụng từ mốc 1M trở lên, vì vậy các cột dài chỉ lấy trung bình trên 12 cấu hình còn lại. Do đó, con số 93,3 ở 10M và 96,9 ở 256K không hẳn được chấm điểm trên cùng một tổ hợp nhiệm vụ.

Bài kiểm tra ngữ cảnh dài khó hơn dừng ở 1M

Chỉ số đánh giá bộc lộ rõ hơn trên trang của Pokee không phải là RULER. Đó là MRCR v2, một bài toán đồng tham chiếu đa vòng 8-needle, trong đó nhiều mục tiêu được rải rác trong một cuộc hội thoại dài và mô hình phải truy xuất và phân biệt đúng một mục tiêu được chỉ định, nên việc nhớ một phần và sự can thiệp chéo giữa các mục tiêu đều khiến bạn mất điểm. Trên thang điểm 0–1, ở 1M token:

Pokee-Isaac 28B — 0.500

Gemini 3.5 Flash Lite — 0.205

Nemotron 3 Super 120B — 0.067

GPT-5.6 Luna — 0.050

Claude Haiku 4.5Qwen 3.5 122B — 0.000, không có gì dùng được ở độ dài đó

Đây là một khoảng cách rộng hơn nhiều và đáng tin cậy hơn nhiều so với những gì RULER tạo ra, và đây là nơi luận điểm của mô hình thực sự được hiện thực hóa. Luna đạt 95.0 trên RULER ở 256K và 0.050 trên MRCR ở 1M; truy hồi một mục tiêu và giải mơ hồ đa kim không phải là cùng một kỹ năng, và kỹ năng thứ hai sụp đổ trước. Isaac suy giảm mượt mà hơn nhiều.

Đây cũng là lỗ hổng bằng chứng lớn nhất trong đợt ra mắt. {{1}}MRCR v2 được chạy ở 256K, 512K và 1M — rồi dừng lại.{{/1}} {{2}}Điểm số của chính Isaac tại đó là 0,607, 0,743 và 0,500: không đơn điệu, và ở mức 1M nó truy xuất được một nửa số needle.{{/2}} {{3}}Không có kết quả multi-needle nào được công bố ở mức 2M, 4M hay 10M từ bất kỳ ai, kể cả Pokee.{{/3}} {{4}}Tuyên bố 10M hoàn toàn dựa vào bài kiểm tra dễ hơn trong hai bài, ở chính những độ dài mà bài kiểm tra khó hơn chưa từng được thử.{{/4}} {{5}}Nếu bạn đang cân nhắc mô hình này vì muốn đưa một kho ngữ liệu 25.000 trang vào một prompt rồi hỏi một câu mà câu trả lời được ghép từ bốn chỗ trong đó, thì khả năng cụ thể đó vẫn chưa được đo ở đúng độ dài cụ thể đó.{{/5}}

Pokee-Isaac 28B-3

Trong công việc agentic, Isaac ngang hàng với Luna, không phải là người vượt trội hơn nó.

Pokee đã chạy bốn điểm chuẩn tác nhân, và đây là chỗ mà sự thẳng thắn của công ty thực sự khác thường: trang của chính họ tóm tắt kết quả là Isaac đứng đầu hai, xếp thứ hai một, và thứ ba một. Đó là một mô tả chính xác, và đó không phải là mô tả trong bài đưa tin ra mắt.

BFCL v4, gọi hàm (được chấm điểm bằng cách khớp AST và chuyển trạng thái thay vì dùng LLM làm giám khảo) — Isaac 70.94 so với GPT-5.6 Luna 70.61, trong khi Claude Haiku 4.5 đạt 67.52, Qwen 3.5 122B đạt 64.88, Gemini 3.5 Flash Lite đạt 64.85, Nemotron 3 Super đạt 33.13.

τ³-bench, trung bình bốn lĩnh vực (các tác vụ chăm sóc khách hàng đa lượt với người dùng mô phỏng có yêu cầu thay đổi giữa cuộc trò chuyện) — Isaac 0.662 so với Gemini 3.5 Flash Lite 0.631, Qwen 3.5 122B 0.611, GPT-5.6 Luna 0.527, Nemotron 0.426, Claude Haiku 4.5 0.408.

Terminal-Bench 2.1, tập con chỉ có văn bản — GPT-5.6 Luna 69.8% so với Isaac 65.1%, sau đó Gemini 3.5 Flash Lite và Qwen 3.5 122B hòa nhau ở 46.5%, Claude Haiku 4.5 34.9%, Nemotron 24.4%.

MCP-Atlas, tuyên bố phạm vi bao phủ trên các máy chủ công cụ trực tiếp — GPT-5.6 Luna 77.90%, Gemini 3.5 Flash Lite 76.67%, Isaac 74.59%, Qwen 3.5 122B 70.24%, Claude Haiku 4.5 56.45%, Nemotron 48.95%.

Biên độ 0,33 điểm trên BFCL v4 là ngang bằng, và trang của Pokee nói rõ điều đó thay vì gọi đây là một chiến thắng. Xét qua cả bốn, một mô hình 28B so kè thắng thua với phiên bản nhanh của nhà cung cấp tiên phong trong các tác vụ agent. Với một mô hình 28B, đó là một kết quả mạnh. Đó không phải là kết quả mà cụm từ "mô hình agent đẳng cấp tiên phong" hàm ý với hầu hết độc giả, và điều đó có nghĩa lý do để chọn Isaac là cửa sổ ngữ cảnh và phạm vi triển khai, chứ không phải khả năng agent.

Điểm an toàn là mức cao nhất của hội đồng nhưng vẫn chưa tốt.

Trên DTAP, một bộ kiểm thử tiêm prompt, Isaac đạt tỷ lệ tấn công thành công thấp nhất trong bảng xếp hạng với 35,6 tổng hợp, xếp trên Claude Haiku 4.5 ở mức 37,9, GPT-5.6 Luna ở mức 50,1, Qwen 3.5 122B ở mức 54,0, Nemotron ở mức 60,4 và Gemini 3.5 Flash Lite ở mức 66,3. Tỷ lệ trực tiếp và gián tiếp chênh lệch chưa đến một điểm, vì vậy độ bền vững ít nhất là đồng đều trên cả hai vectơ.

Ba lưu ý, tất cả đều đến từ báo cáo của chính Pokee chứ không phải từ các nhà phê bình. Các phép đo gián tiếp được thực hiện khi cơ chế bảo vệ không hoạt động. Mô hình chỉ từ chối rõ ràng 1,5% các tác vụ độc hại, điều mà Pokee mô tả là phần lớn biện pháp phòng thủ hiện tại mang tính "ngẫu nhiên hơn là chủ động từ chối" — mô hình không nhận diện và bác bỏ các cuộc tấn công mà đúng hơn là không bị chúng điều hướng một cách hữu ích. Và khi so với bảng xếp hạng rộng hơn gồm 16 hệ thống thay vì nhóm sáu mô hình này, Isaac xếp thứ năm về tấn công trực tiếp, thứ sáu về tấn công gián tiếp và thứ chín về năng lực: ở giữa bảng, không dẫn đầu.

Cũng có một cái giá phải trả cho sự an toàn. Tỷ lệ thành công lành tính của Isaac là 82,5, thấp hơn mức 85,1 của GPT-5.6 Luna — nó từ chối hoặc xử lý kém hơn một chút các tác vụ hợp lệ so với mô hình mà nó đánh bại về khả năng chống tấn công. Và con số 35,6 nghĩa là cứ khoảng ba lần thử tiêm nhiễm thì vẫn có một lần trúng đích. Đối với một mô hình có toàn bộ tiền đề là đọc mười triệu token tài liệu mà bạn không viết, đó là con số để thiết kế rào chắn bảo vệ xung quanh, chứ không phải con số để trấn an. Bản thân DTAP cũng đáng bị gắn cờ: không giống như RULER, BFCL và τ³-bench, nó không phải là một bảng xếp hạng công khai đã được thiết lập, và chúng tôi không thể tìm thấy tài liệu độc lập nào về bộ công cụ này.

Chi phí cho một cuộc gọi mười triệu token là bao nhiêu, và bạn phải chờ bao lâu

Mười triệu token tương đương khoảng 7.5 triệu từ, hoặc khoảng 25,000 trang. Với mức giá $0.15 mỗi triệu token của Pokee, việc lấp đầy cửa sổ một lần tốn $1.50. Thêm một câu trả lời có độ dài tối đa 60,000 token với giá $1.00 mỗi triệu và một lượt gọi tối đa sẽ tốn khoảng $1.56. Điều đó thực sự rẻ so với khối lượng văn bản liên quan, và đó là lập luận đơn giản mạnh nhất cho mô hình.

Thời gian chính là cái giá thực sự. Trên một chiếc B200 duy nhất, Pokee báo cáo 72,9 giây để có token đầu tiên ở mức 10M — con số này chính xác là 10.000.000 chia cho chỉ số prefill 137.200 token/giây, vì vậy đây là con số từ phần cứng benchmark chứ không phải độ trễ API đo được. Tài liệu dành cho nhà phát triển của chính Pokee lại kể một câu chuyện khác với các nhà phát triển: hãy cho phép timeout phía máy khách tối thiểu mười phút đối với các prompt hàng triệu token, vì một prompt lớn có thể mất "khoảng bảy phút ở mức 10 triệu token." Đó là khoảng cách gấp sáu lần giữa slide về thông lượng và hướng dẫn tích hợp. Cả hai đều là số liệu của Pokee; con số trong tài liệu là con số mà cấu hình timeout của bạn phải tin tưởng.

Tốc độ decode ổn định ở mức khoảng 335 token/giây bất kể bao nhiêu ngữ cảnh đang lưu trú, đây là tin tốt về mặt kiến trúc nhưng lại là tin bất tiện về mặt thực tế: một đầu ra đầy đủ 60.000 token mất khoảng ba phút, chưa kể thời gian prefill. Trên phần cứng tiêu dùng, bức tranh lại thay đổi — trên Intel Arc Pro B70, Pokee báo cáo tốc độ prefill 1.087–1.500 token/giây (gấp 3,6–5 lần llama.cpp gốc) và tốc độ decode 58,8 token/giây. Đó là những con số đáng nể đối với GPU client và chúng không phải là những con số 10 triệu token.

Hai giới hạn thực tế xuất phát từ chính kích thước của đầu vào. Mười triệu token tiếng Anh tương đương khoảng 38 MiB văn bản, nằm dưới giới hạn 45 MiB của thân yêu cầu nhưng cao hơn hẳn ngưỡng 16 MiB, vì vậy mọi lệnh gọi cửa sổ đầy đủ thực sự phải được truyền phát — không có đường dẫn không truyền phát nào tới tính năng chính. Và với việc không có bộ nhớ đệm prompt được ghi nhận trên API của Pokee, mỗi lần truy vấn lại cùng một kho văn bản tốn thêm 1,50 đô la và thêm một lần prefill kéo dài nhiều phút. Danh sách nhà bán lại trên NanoGPT có công bố tỷ lệ đọc bộ nhớ đệm là 0,079 đô la mỗi triệu, nếu áp dụng cho Isaac thì một lần đọc lại có bộ nhớ đệm là khoảng 0,79 đô la — gần bằng nửa giá, không phải mức giảm theo bậc độ lớn mà bộ nhớ đệm prompt ngụ ý ở nơi khác.

Một sửa đổi cho bảng so sánh giá, vì nó thay đổi tiêu đề. Pokee định giá GPT-5.6 Luna ở mức $0.40/$1.80 cho mỗi triệu, lấy nguồn từ Azure. Giá niêm yết của chính nhà cung cấp cho Luna sau khi cắt giảm vào ngày 31 tháng 7 năm 2026 là $0.20/$1.20, đó là những gì trang mô hình của chúng tôi hiển thị, vì OrcaRouter chuyển giá niêm yết của nhà cung cấp với mức tăng 0% thay vì bán lại với biên lợi nhuận. So với con số chính xác, Isaac rẻ hơn 25% ở đầu vào và rẻ hơn 17% ở đầu ra so với bậc frontier nhanh nhất — vẫn rẻ hơn, nhưng chênh lệch hẹp hơn nhiều so với bảng đề xuất, và giá đầu ra rẻ nhất tổng thể của bảng thuộc về Nemotron 3 Super ở mức $0.65. Lợi thế giá của Isaac là có thật; chỉ là nó không phải là phần đáng chú ý trong ngày ra mắt này.

Pokee-Isaac 28B-4

Phần thực sự mới

Bỏ qua phần khung benchmark đi, và thứ còn lại khá bất thường. Một mô hình 28B với ngữ cảnh rất dài chạy được trong VPC, trên máy trạm RTX 4090, trên card Intel Arc Pro, và trên silicon di động lớp NPU, với hỗ trợ vLLM và SGLang ngay từ ngày đầu tiên cùng giấy phép on-premises — tổ hợp này gần như không thể tìm thấy ở nơi nào khác. Pokee cũng tuyên bố hiệu suất KV-cache cao gấp khoảng 5 lần so với các triển khai tiêu chuẩn, đây là con số từ phía nhà cung cấp chưa được kiểm chứng lại, nhưng nó là kiểu con số mà nếu không đúng thì câu chuyện triển khai sẽ không thể đứng vững.

Khách hàng cho sản phẩm này không phải là người đang tìm mua một agent tốt hơn. Đó là người sở hữu một kho ngữ liệu lớn, nhạy cảm, phần lớn là tĩnh — các bộ hợp đồng, hồ sơ vụ án, một kho mã nguồn nguyên khối, nhiều tháng nhật ký hệ thống — mà vì lý do pháp lý hoặc chính trị không thể vượt ra khỏi một ranh giới nhất định, và nếu không có sản phẩm này thì họ sẽ phải tự xây dựng một pipeline truy xuất để vòng qua giới hạn cửa sổ 200K. So với phương án thay thế đó, lời chào hàng không phải là "rẻ hơn RAG." Việc nhúng và truy xuất trên hơn 25.000 trang chỉ tốn vài xu cho mỗi truy vấn và sẽ luôn như vậy. Lời chào hàng nằm ở chỗ: không có chiến lược chunking nào để tinh chỉnh, không có độ thu hồi truy xuất nào để đánh mất, và không có hệ thống thứ hai nào phải giữ đồng bộ với hệ thống thứ nhất. Sự đánh đổi đó có đáng giá 1,50 đô la và vài phút cho mỗi truy vấn hay không hoàn toàn phụ thuộc vào tần suất bạn truy vấn.

Ai nên thử ngay bây giờ, và ai nên chờ đợi

Hãy dùng thử ngay nếu bạn đang xây dựng nguyên mẫu với một kho ngữ liệu trong phạm vi 1M–4M, nơi điểm số của Isaac là mạnh nhất và các lựa chọn thay thế thực sự ít ỏi, hoặc nếu triển khai tại chỗ ở mức 28B là yêu cầu đang chặn bạn. Mười yêu cầu đồng thời của gói miễn phí là đủ để bạn tìm hiểu xem mô hình có đọc tài liệu theo cách bạn cần hay không.

Chờ đã, nếu bạn cần con số 10 triệu cụ thể và các câu hỏi bạn đặt ra là đa bước, bởi vì sự kết hợp đó chính là thứ chưa ai đo lường. Chờ đã, nếu bạn cần đầu vào đa phương thức, điều mà mô hình này không chấp nhận. Chờ đã, nếu độ trễ quan trọng, vì một lần gọi toàn cửa sổ mất vài phút chứ không phải vài giây. Và hãy cân nhắc rủi ro phụ thuộc hiển nhiên: đây là mô hình v0, có trọng số đóng, từ một công ty với vòng gọi vốn hạt giống 12 triệu đô la, và nó là mô hình duy nhất trên thế giới phục vụ khả năng mà nó đang bán. Không có nhà cung cấp thứ hai để chuyển sang nếu nó biến mất.

Điểm cuối cùng đó là lý do thực tế để giữ cho sự so sánh được trung thực. Pokee-Isaac 28B hiện không có trên OrcaRouter — nếu bạn muốn dùng nó, API riêng của Pokee hoặc một nhà bán lại là nơi có thể cung cấp. Nhưng ba trong năm mốc so sánh mà nó tự đối chiếu, GPT-5.6 Luna, Gemini 3.5 Flash Lite và Claude Haiku 4.5, đều nằm trên một khóa OrcaRouter với giá niêm yết của nhà cung cấp, điều này khiến cho thí nghiệm hữu ích trở nên rẻ để thiết lập: chạy tác vụ ngữ cảnh dài thực tế của bạn trên ba mô hình đó ở các độ dài mà chúng hỗ trợ, và xem liệu kho ngữ liệu của bạn có thực sự cần mười triệu token hay chỉ cần 400,000 và một prompt tốt hơn. Nếu nó cần mười triệu, bạn đã học được điều gì đó đáng giá $1.50 cho mỗi lần gọi. Nếu không, bạn đã tránh được việc xây dựng một lộ trình sản xuất dựa trên v0 từ một nguồn duy nhất.

Ba câu hỏi đáng trả lời

Pokee-Isaac 28B có chỉ là một bản fine-tune không?

Không phải theo bất kỳ cách dùng thông thường nào của cụm từ này, mặc dù nó cũng không độc lập với nền tảng đó. Quan điểm của Pokee là một số trọng số được tinh chỉnh từ Qwen3.6-27B theo giấy phép Apache-2.0 trong khi những trọng số khác được huấn luyện từ đầu, và kiến trúc không chỉ là decoder-only. Cả hai nửa của điều đó đều nhất quán với số tham số: Qwen3.6-27B là 27B dense với bộ mã hóa thị giác có thể bỏ qua, Isaac là 28B và chỉ dành cho văn bản, vì vậy khoảng một tỷ tham số của cơ chế mới đã thay thế tháp thị giác. Cơ chế đó là gì vẫn chưa được tiết lộ, và cho đến khi được tiết lộ, "không phải là một tinh chỉnh thông thường" là một tuyên bố dựa vào lời nói của Pokee chứ không phải bất cứ điều gì có thể kiểm chứng. Giấy phép Apache-2.0 trên nền tảng làm cho việc phái sinh là hợp pháp; nó không làm cho việc phát hành đóng kết quả trở nên bất thường, điều đáng chú ý chủ yếu vì một dòng dõi cụ thể như vậy hiếm khi được tự nguyện cung cấp.

Liệu nó có thực sự chạy được 10M token trên RTX 4090 không?

Tuyên bố về GPU đơn và tuyên bố về 10M đến từ cùng một lần ra mắt nhưng không phải từ cùng một phép đo. Mọi con số thông lượng mà Pokee công bố ở ngữ cảnh 10M — prefill 137,200 token/giây, thời gian đến token đầu tiên 72.9 giây — đều dựa trên một B200 duy nhất. Các con số RTX 4090 và Arc Pro là thực nhưng được trích dẫn ở quy mô nhỏ hơn nhiều; số liệu Arc Pro B70 là 1,087–1,500 token/giây prefill, điều này sẽ khiến một lần prefill 10M token mất hàng giờ. “Có thể triển khai trên một GPU đơn lẻ bắt đầu từ RTX 4090” tốt nhất nên được hiểu là tuyên bố về việc trọng số vừa vặn và mô hình phục vụ hữu ích, chứ không phải về việc độ dài ngữ cảnh nổi bật kia khả thi trên card đó.

Tôi có nên thay thế pipeline RAG bằng nó không?

Không phải dựa trên bằng chứng này, với một ngoại lệ. Trường hợp để thay thế retrieval là mạnh nhất khi truy vấn của bạn là đa bước — chính xác là chế độ lỗi mà retrieval theo khối xử lý kém — và hiệu suất đa bước vượt quá 1M token là thứ mà Pokee đã không đo lường. MRCR v2 dừng ở 1M, nơi Isaac truy xuất được một nửa số kim. Ngoại lệ là một kho ngữ liệu nằm gọn trong khoảng 1M–2M token, nơi các số liệu đo được của Isaac là mạnh, thời gian chờ là hàng chục giây thay vì hàng phút, và việc bỏ đi một lớp retrieval loại bỏ độ phức tạp vận hành thực sự. Trên mức đó, hãy coi cửa sổ này như một cách để tránh xây dựng retrieval cho một bản thử nghiệm, không phải là lý do để xóa bỏ một hệ thống đang hoạt động.

Điều gì sẽ giải quyết được nó?

Bốn điều, không điều nào đòi hỏi phải tin tưởng bất kỳ ai. Một lần chạy RULER hoặc MRCR độc lập ở mức 2M trở lên, do bất kỳ ai thực hiện, trên API công khai. Một kết quả MRCR v2 từ Pokee ở các độ dài mà nó đã quảng cáo. Một báo cáo kỹ thuật có thể truy cập được, nêu rõ cơ chế, tại đó câu hỏi về encoder không còn là phép tính số học mà trở thành một sự thật. Và một bản phát hành trọng số, mà cụm từ "đóng mã nguồn tạm thời" ám chỉ nhưng không hứa hẹn.

Cho đến lúc đó, bản tóm tắt công bằng hẹp hơn buổi ra mắt và thú vị hơn sự hoài nghi. Pokee AI đã phát hành một mô hình 28B có khả năng duy trì truy xuất ngữ cảnh dài ở khoảng cách xa hơn một cách đo lường được so với bất kỳ thứ gì bạn có thể mua hiện tại, ngang sức với tầng nhanh tiên tiến trong các tác vụ agent, an toàn nhất trong nhóm đánh giá riêng của mình và ở mức giữa bảng khi so với một nhóm rộng hơn, đồng thời chạy được ở những nơi mà không mô hình nào cùng đẳng cấp chạy được. Công ty cũng đã chọn công bố những con số duy nhất tồn tại về khả năng mà không ai khác cung cấp, và không nói rõ cách nó hoạt động. Cả hai đều là những lựa chọn mà một công ty trẻ có quyền thực hiện. Nhưng không điều nào thay thế được việc một người bên ngoài công ty tự mình chạy thử nghiệm.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube