Pokee-Isaac 28B-1
Engineering & Research

Pokee-Isaac 28B: 1천만 토큰의 컨텍스트, 그리고 Pokee가 설명하지 않을 아키텍처

작성자

Jim Song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

한 열이 있는데, Pokee-Isaac 28B의 출시 비교에서 여섯 모델 중 다섯 개가 0.0점을 기록했다. 그 아래 주석이 위 숫자보다 더 흥미롭다. 1천만 토큰 컨텍스트 길이에서 Pokee AI의 새 28B 모델은 RULER에서 93.3점을 기록했고, 비교 대상이었던 모든 기준 모델 — GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super 120B, Qwen 3.5 122B — 는 아무것도 쓸 만한 결과를 내지 못했다. 주석에 따르면 그 다섯 중 세 개는 애초에 262K를 초과하는 컨텍스트 길이로는 구매할 수 없다. 따라서 점수는 진짜지만, 방은 비어 있다. 이 둘은 서로 다른 두 주장이며, 이 모델이 2026년 8월 5일에 등장한 이후 발표된 대부분의 보도는 이 둘을 하나로 뭉뚱그렸다.

그것은 Pokee가 출시한 것을 무시할 이유가 아니다. 그것은 그중 어느 부분이 입증되었고, 어느 부분이 단지 이의가 제기되지 않았을 뿐이며, 어느 부분이 그저 설명되지 않았는지 정확히 구분해야 할 이유다. 아래의 모든 내용은 네 가지 주요 출처에서 나온 것이다: Pokee 자체 콘솔의 Pokee-Isaac 모델 페이지, Pokee 개발자 문서, NanoGPT의 모델 리셀러 목록, 그리고 Pokee AI와 창립자 저칭(빌) 주의 출시 성명서. 이 글의 모든 벤치마크 수치는 Pokee AI가 산출한 것이다. Pokee는 이를 분명히 밝힌다 — 콘솔에는 각 수치가 "달리 표시되지 않는 한 Isaac은 물론 모든 기준선에 대해 Pokee AI가 단일 통제 환경에서 측정했다"고 명시되어 있다 — 그리고 공정하게 평가하자면 이는 기준선이 다른 업체의 발표에서 복사된 것이 아니라 재실행되었음을 의미한다. 이는 또한 어떤 독립 연구소도 그 어느 것도 재현하지 못했으며, 현재까지 아무도 재현 시도를 발표하지 않았음을 의미한다.

Pokee가 실제로 출시한 것

이 모델의 공개된 표면은 이렇게 얼마 되지 않은 출시작치고는 이례적으로 잘 문서화되어 있으므로, 논란이 되는 부분으로 넘어가기 전에 그것을 정리해 두는 것이 좋다.

모델 — Pokee-Isaac 28B, 버전 v0, pokee-isaac으로 api.pokee.ai에서 호환 엔드포인트를 통해 제공됩니다.

크기 및 컨텍스트 — 280억 개의 파라미터와 10,000,000-토큰 입력 창; Pokee는 이를 "처음부터 끝까지 사용 가능하며 단순히 주소 지정만 가능한 것이 아니다"라고 설명합니다.

출력 — 60,000 토큰으로, 기본값이자 상한값입니다.

모달리티 — 텍스트 입력, 텍스트 출력. 이미지, 오디오 및 비디오 입력은 지원되지 않습니다. 이는 모델이 무엇을 기반으로 구축되었는지를 고려할 때 주목할 만한 점입니다.

가격 — 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $1.00 (Pokee 자체 요금제 기준).

에이전틱 기능표준 chat-completions 스키마에서의 함수 호출 및 구조화된 출력; 모델은 채팅 모델이 아닌 계획-실행-검토 에이전트로 자리매김합니다.

요청 한도 — 45MiB 요청 본문 상한이 적용되며, 16MiB를 초과하는 경우 SSE 스트리밍(stream: trueAccept: text/event-stream 헤더)을 사용해야 합니다.

요청 한도 — 분당 500회 요청 및 2천만 개 토큰, 무료 계정은 동시 요청 10회, 유료 계정은 25회.

배포 — 데이터센터 B200, RTX 4090/5090 워크스테이션, Intel Arc Pro 클라이언트 카드, 엣지 NPU(Qualcomm 및 Intel Panther Lake, AMD는 대기 중으로 등록됨), 온디바이스, 그리고 Pokee의 말에 따르면 "어떤 요청도 경계 밖으로 나가지 않습니다"라는 조건 하에 VPC 및 온프레미스 라이선스.

서빙 스택 — vLLM 및 SGLang에서 출시 당일 지원.

회사Pokee AI는 이전에 Meta에서 응용 강화 학습 책임자를 지낸 Zheqing (Bill) Zhu가 2024년에 설립했습니다. 1,200만 달러 규모의 시드 투자는 Point72 Ventures가 주도했으며 Qualcomm Ventures와 Samsung NEXT가 참여했습니다.

모델 가중치는 비공개로 유지됩니다. 언론에서는 이 모델이 '당분간' 비공개 소스라고 설명했는데, 이는 Pokee가 확정적인 약속이 아닌 자체적으로 유보적인 입장을 밝힌 것이며, 공개 일정이나 라이선스에 대한 발표는 아직 없습니다.

Pokee-Isaac 28B-2

아무도 설명하지 않을 아키텍처

Pokee는 10M 윈도우를 "독점적인 디코더 전용이 아닌 아키텍처" 덕분으로 돌린다. 그 문구가 기술 공개의 전부다. 콘솔은 제목이 Pokee-Isaac 28B v0: A 10M-Token Context Efficient Agentic Model인 기술 보고서(2026년 8월 3일자)를 링크한다. 우리는 그 보고서의 공개 사본을 구할 수 없었고, 접근 가능한 출시 자료에는 어텐션 메커니즘, 메모리 구조, 학습 레시피가 밝혀져 있지 않다.

Pokee가 계보에 대해 말한 것은 더 구체적이며, 말하기에는 약간 어색한 점이 있습니다. Isaac의 가중치 중 일부는 Apache-2.0 라이선스 하에 Qwen3.6-27B에서 파인튜닝되었고, 다른 가중치는 Pokee가 처음부터 훈련시킨 것으로, 그 결과는 "전통적인 파인튜닝이 아니다"라는 것입니다. 그것은 신중한 문장입니다. 기반을 인정하면서 동시에 그 성격 규정을 부인하는 것입니다.

또한 추측을 제약하기에 충분한데, AI 연구 커뮤니티가 즉시 그렇게 하기 시작했다. @teortaxesTex라는 이름으로 게시하는 연구자는 출시 당일 제약 조건 세트를 정리했다 — 부분적으로 Qwen3.6-27B에서 파인튜닝되었고, 디코더 전용이 아닌, 10M 컨텍스트, 총 28B — 그리고 두 가지 후보를 제안했다: "일종의 강화된 메모리 스파스 어텐션" 또는 "단지 1B 문서 인코더." 두 추측 모두 이해할 가치가 있다. 그것들이 공허하지 않기 때문이다.

계산부터 시작하자. Qwen3.6-27B는 262K 네이티브 윈도우, 게이티드-델타 하이브리드 어텐션, 그리고 텍스트 전용으로 모델을 실행할 때 건너뛸 수 있는 비전 인코더를 갖춘 덴스 27B 모델이다. Isaac은 28B이며 텍스트 전용이다. 기본 모델의 비전 타워를 제거하고 다른 무언가의 파라미터를 약 10억 개 추가하면 정확히 28B에 도달한다. 27B 디코더에 약 1B 규모의 문서 또는 메모리 인코더를 부착한 구조는 Pokee가 공개한 파라미터 수에 대한 가장 간결한 해석이며, 이는 새로운 주장 없이도 '비-디코더-전용'이라는 라벨을 문자 그대로 사실로 만들 것이다.

Memory Sparse Attention 추측은 실제이자 최근의 연구 흐름을 가리킨다: MSA 논문(arXiv:2603.23516)은 확장 가능한 희소 어텐션과 문서별 RoPE를 결합하여 훈련 및 추론에서 선형 복잡도를 얻고, KV-캐시 압축과 "Memory Parallel" 방식을 추가하며, 16K에서 1억 토큰에 이르기까지 9% 미만의 성능 저하를 보고하고, 1억 토큰 추론이 A800 두 대에서 실행된다. 이는 Pokee가 주장하는 결과와 같은 형태로, 한 자릿수 더 확장된 것이며, 다른 그룹의 것이다. 두 결과를 연결하는 것은 형태뿐이다 — MSA는 Pokee의 작업이 아니며 Pokee는 이를 인용하지 않았다 — 그러나 이는 적당한 하드웨어에서 이러한 길이에 도달하는 분리형 메모리 설계가 마케팅상 불가능한 것이 아니라 출판되고 그럴듯한 것임을 입증한다.

Pokee 자체 자료에는 별도 인코더 해석을 조용히 뒷받침하는 숫자가 하나 있다. 단일 B200에서 프리필 처리량은 1M 토큰 컨텍스트에서 초당 42,400토큰, 10M에서 초당 137,200토큰이다. 처리량은 증가하며 컨텍스트가 10배 길어지면 3배 이상이 된다. 2차 어텐션 비용을 지불하는 디코더는 그 반대다. 그 토큰들을 소비하는 대상은 토큰을 추가할수록 토큰당 효율이 좋아지는데, 이는 일반적인 프리필이 아니라 문서에 대한 대량 인코딩 패스의 특징이다.

모델 사용 여부를 결정하는 사람에게 이 모든 것이 왜 중요한가: 10M 윈도우가 10M 항목 KV 캐시라기보다 문서 인코더와 압축 메모리라면, 여기서 말하는 "컨텍스트"는 당신의 직관이 기반을 둔 대상이 아니다. 대화에 내용을 추가하거나, 말뭉치 중간의 문서 하나를 편집하거나, 프리픽스 캐싱이 작동할 것이라고 기대할 때 모델이 어떻게 동작하는지는 명시되어 있지 않으며, Pokee의 문서에는 캐싱 메커니즘이 전혀 언급되어 있지 않다. 사양서만으로는 그러한 동작을 추론할 수 없고, 지금으로서는 아키텍처만으로도 추론할 수 없다.

10M의 RULER는 빈 방 안의 실수이다.

Pokee의 긴 문맥 증거는 RULER이며, 256K, 512K, 1M, 2M, 4M 및 10M에서 실행되었고, 구성당 10개의 샘플이 있습니다. Isaac은 여섯 길이에 걸쳐 96.9, 96.7, 95.0, 95.8, 96.7 및 93.3을 기록했습니다 — 패널에서 모든 길이에 점수를 반환하는 유일한 모델입니다.

1M 아래 패널이 정직한 판독값이 존재하는 곳입니다:

256K에서 — Isaac 96.9, Nemotron 3 Super 120B 96.3, GPT-5.6 Luna 95.0, Gemini 3.5 Flash Lite 94.5, 그리고 Claude Haiku 4.5와 Qwen 3.5 122B는 둘 다 0.0인데, 이들의 윈도우는 그 길이에 미치지 못한다.

512K에서 — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.

1M에서 — Isaac 95.0, Nemotron 91.8, Gemini 3.5 Flash Lite 29.4 및 GPT-5.6 Luna 0.0이며, 마지막 두 개는 모두 컨텍스트 오버플로 오류로 표시되었습니다.

2M 이상에서는 — Isaac 단독, 나머지는 모두 0.0.

세 가지가 이어집니다. 첫째, 최대 1M까지 Isaac의 경쟁자들에 대한 우위는 한두 포인트이지 세대 차이가 아닙니다. 그리고 근접하게 유지되는 유일한 기준선인 Nemotron 3 Super 120B는 120B 모델로, 256K~1M 수치는 NVIDIA가 자체 보고한 숫자이며, Pokee는 이를 측정값으로 가장하지 않고 표시해 행 비교에서 제외합니다. 따라서 그 길이에서 가장 가까운 경쟁자는 실제로 어느 방향으로든 일치하는 측정값이 아닙니다.

둘째, 그 공백들 중 적어도 하나는 모델 한계라기보다는 배포 산출물로 보입니다. Pokee는 Azure를 통해 GPT-5.6 Luna를 실행하고 해당 윈도우를 ">272K context"로 표시하면서 1M에서 컨텍스트 오버플로 오류를 기록했습니다. 벤더가 해당 모델에 대해 문서화한 윈도우는 약 1.05M 토큰이며, 이는 우리 자체 모델 페이지에서도 보고하는 값입니다. 1M 열을 액면 그대로 받아들이는 독자는 Luna가 1M을 처리할 수 없다고 결론 내릴 것입니다. 그러나 더 타당한 결론은 Pokee가 테스트한 Azure 배포가 그렇게 할 수 없었다는 것입니다.

셋째, RULER는 합성 검색 및 집계 스위트이지 추론 벤치마크가 아닙니다. Pokee도 여기서 방법론적 문제에 대해 투명하게 밝히고 있습니다. 256K와 512K 열은 13가지 작업 구성의 평균이지만, 일반 단어 추출은 1M 이상에서는 사용할 수 없으므로 긴 열은 나머지 12개의 평균입니다. 따라서 10M에서의 93.3과 256K에서의 96.9는 완전히 동일한 작업 구성으로 평가된 것이 아닙니다.

더 어려운 긴 컨텍스트 테스트는 1M에서 멈춘다

Pokee 페이지에서 더 의미 있는 벤치마크는 RULER가 아닙니다. 바로 MRCR v2입니다. 이는 8-needle 다중 라운드 상호참조 작업으로, 긴 대화 속에 여러 대상이 흩어져 있고 모델은 지정된 대상을 검색하여 모호성을 해소해야 하므로, 부분 회상과 교차 니들 간섭이 모두 비용으로 작용합니다. 0–1 척도에서 1M 토큰 기준:

Pokee-Isaac 28B — 0.500

Gemini 3.5 Flash Lite — 0.205

Nemotron 3 Super 120B — 0.067

GPT-5.6 Luna — 0.050

Claude Haiku 4.5Qwen 3.5 122B — 0.000, 그 길이에서는 사용 가능한 것이 없음

이것은 RULER가 만들어내는 격차보다 훨씬 더 크고 훨씬 더 신뢰할 만한 격차이며, 모델의 핵심 주장이 실제로 결실을 맺는 지점이다. Luna는 256K에서 RULER 95.0점, 1M에서 MRCR 0.050점을 기록한다. 단일 대상 회상과 다중 니들 구분은 결코 같은 능력이 아니며, 후자가 먼저 무너진다. Isaac은 훨씬 더 우아하게 성능이 저하된다.

이것은 또한 이번 출시에서 가장 큰 증거상의 공백이기도 합니다. MRCR v2는 256K, 512K 및 1M에서 실행되었고 — 거기서 멈췄습니다. Isaac 자신의 점수는 0.607, 0.743, 0.500으로 비단조적이며, 1M에서는 바늘의 절반만 검색합니다. 2M, 4M 또는 10M에서의 다중 바늘 결과는 Pokee를 포함한 누구에게서도 발표된 적이 없습니다. 10M 주장은 전적으로 두 테스트 중 더 쉬운 테스트에만 의존하며, 더 어려운 테스트가 시도되지 않은 바로 그 길이에서만 그렇습니다. 이 모델을 고려하는 이유가 25,000페이지 분량의 말뭉치를 하나의 프롬프트에 넣고 그 안의 네 군데에서 조합된 답을 요구하는 질문을 하기 위해서라면, 그 특정 능력은 그 특정 길이에서 측정된 바 없습니다.

Pokee-Isaac 28B-3

에이전트 작업에 있어서, Isaac은 Luna와 동등한 존재이지, 그보다 우월한 존재가 아니다.

Pokee는 네 가지 에이전트 벤치마크를 실행했는데, 회사의 솔직함이 정말 이례적인 부분은 바로 여기다. 자체 페이지에서는 결과를 Isaac이 두 개에서 1위, 하나에서 2위, 하나에서 3위를 차지한 것으로 요약한다. 그것은 정확한 설명이며, 출시 보도에 실린 설명과는 다르다.

BFCL v4, 함수 호출 (LLM 심사자가 아닌 AST 및 상태 전환 매칭으로 평가됨) — Isaac 70.94 vs GPT-5.6 Luna 70.61, Claude Haiku 4.5 67.52, Qwen 3.5 122B 64.88, Gemini 3.5 Flash Lite 64.85, Nemotron 3 Super 33.13.

τ³-bench, 4개 도메인 평균 (대화 중간에 요구사항이 바뀌는 시뮬레이션 사용자를 상대하는 다중 턴 고객 서비스 태스크) — Isaac 0.662 vs Gemini 3.5 Flash Lite 0.631, Qwen 3.5 122B 0.611, GPT-5.6 Luna 0.527, Nemotron 0.426, Claude Haiku 4.5 0.408.

Terminal-Bench 2.1, 텍스트 전용 하위 집합 — GPT-5.6 Luna 69.8% 대 Isaac 65.1%, 그 다음 Gemini 3.5 Flash Lite와 Qwen 3.5 122B가 46.5%로 동률, Claude Haiku 4.5 34.9%, Nemotron 24.4%.

MCP-Atlas, 라이브 도구 서버 전반 커버리지 확보 — GPT-5.6 Luna 77.90%, Gemini 3.5 Flash Lite 76.67%, Isaac 74.59%, Qwen 3.5 122B 70.24%, Claude Haiku 4.5 56.45%, Nemotron 48.95%.

BFCL v4에서 0.33포인트 차이는 동등함을 의미하며, Pokee의 페이지는 이를 승리라고 부르기보다 그렇게 밝히고 있습니다. 네 가지 모두를 살펴보면, 28B 모델은 에이전트 작업에서 프런티어 공급업체의 빠른 티어와 승부를 주고받습니다. 28B 모델로서는 강력한 결과입니다. 이는 대부분의 독자들이 '프런티어급 에이전트 모델'이라는 표현에서 암시하는 결과가 아니며, Isaac을 선택하는 이유는 자율성이 아니라 윈도우와 배포 환경이라는 것을 의미합니다.

안전 수치는 패널 중 최고지만 여전히 좋지 않아

DTAP(프롬프트 인젝션 스위트)에서 Isaac은 패널 중 가장 낮은 공격 성공률(통합 35.6)을 기록했으며, Claude Haiku 4.5(37.9), GPT-5.6 Luna(50.1), Qwen 3.5 122B(54.0), Nemotron(60.4), Gemini 3.5 Flash Lite(66.3)이 그 뒤를 이었습니다. 직접 및 간접 공격 성공률의 차이는 1포인트 미만이므로, 두 벡터 모두에서 견고성은 최소한 균등합니다.

세 가지 주의할 점이 있는데, 모두 비평가가 아닌 Pokee 자체의 보고에서 비롯된 것이다. 간접 측정은 가드가 비활성화된 상태에서 이루어졌다. 명시적 거부는 악성 작업의 단 1.5%에서만 발동했는데, Pokee는 현재 방어의 대부분이 '거부(declined)라기보다는 우연적(incidental)인 것'이라고 설명한다. 즉, 모델이 공격을 인식하고 거부하는 것이 아니라, 공격에 의해 유용하게 유도되지 못하고 있는 것이다. 또한 이 6개 모델 패널이 아닌 더 포괄적인 16개 시스템 리더보드를 기준으로 보면, Isaac은 직접 공격에서 5위, 간접 공격에서 6위, 역량에서 9위를 기록하여 중위권에 머물렀지 선두가 아니다.

{{1}}안전에도 비용이 따릅니다.{{/1}} {{2}}Isaac의 정상 성공률은 82.5로, GPT-5.6 Luna의 85.1보다 낮습니다. 공격에서는 앞서는 모델보다 정상적인 작업을 약간 더 거부하거나 실수합니다.{{/2}} {{3}}그리고 35.6은 대략 세 번의 인젝션 시도 중 한 번은 여전히 성공한다는 뜻입니다.{{/3}} {{4}}당신이 작성하지 않은 문서의 천만 토큰을 읽는 것을 전체 전제로 하는 모델에게, 그 숫자는 안심할 수치가 아니라 가드레일을 설계할 수치입니다.{{/4}} {{5}}DTAP 자체도 주목할 가치가 있습니다. RULER, BFCL, τ³-bench와 달리, 이는 공인된 공개 리더보드가 아니며, 우리는 이 스위트에 대한 독립적인 문서를 찾을 수 없었습니다.{{/5}}

천만 토큰 호출의 비용과 대기 시간

1천만 토큰은 대략 750만 단어, 즉 약 25,000페이지에 해당합니다. Pokee의 백만 토큰당 $0.15 기준으로 창을 한 번 채우는 데 $1.50가 듭니다. 여기에 백만 토큰당 $1.00의 최대 길이 60,000토큰 응답을 추가하면, 최대 호출 한 번은 약 $1.56이 됩니다. 이는 관련된 텍스트의 양에 비해 확실히 저렴하며, 이 모델을 지지하는 가장 강력한 단순한 논거입니다.

시간이 곧 실제 비용이다. 단일 B200에서 Pokee는 10M 토큰 기준 첫 토큰까지 72.9초를 보고하는데, 이는 정확히 10,000,000을 137,200 tokens/초 프리필 수치로 나눈 값이므로, 측정된 API 지연 시간이 아니라 벤치마크 하드웨어 수치다. Pokee 자체 개발자 문서는 개발자에게 다른 이야기를 전한다. 수백만 토큰 규모의 프롬프트에는 최소 10분의 클라이언트 타임아웃을 허용하라. 큰 프롬프트는 "1,000만 토큰에서 약 7분"이 걸릴 수 있기 때문이다. 이는 처리량 슬라이드와 통합 가이드 사이에 약 6배의 차이다. 둘 다 Pokee의 수치이며, 문서에 있는 수치가 바로 타임아웃 설정이 신뢰해야 하는 값이다.

디코드는 상주 컨텍스트의 양과 관계없이 초당 약 335토큰으로 일정합니다. 이는 아키텍처적으로는 좋은 소식이지만 실용적으로는 난처한 소식입니다. 전체 60,000토큰 출력은 프리필 시간에 더해 약 3분이 걸립니다. 컨슈머 하드웨어에서는 상황이 다시 달라집니다 — Intel Arc Pro B70에서 Pokee는 초당 1,087~1,500토큰의 프리필(기존 llama.cpp 대비 3.6~5배)과 초당 58.8토큰의 디코드를 보고했습니다. 이는 클라이언트 GPU로서는 괜찮은 수치이며, 1,000만 토큰 수준의 수치는 아닙니다.

입력 자체의 크기에서 두 가지 실질적인 한계가 드러난다. 영어 1천만 토큰은 대략 38 MiB의 텍스트로, 45 MiB 요청 본문 상한에는 맞지만 16 MiB 임계값보다 훨씬 위에 있어, 모든 진정한 전체 창 호출은 반드시 스트리밍되어야 한다. — 헤드라인 기능으로 가는 비스트리밍 경로는 없다. 또한 Pokee의 API에는 문서화된 프롬프트 캐싱이 없으므로, 동일한 코퍼스를 다시 쿼리할 때마다 또 $1.50와 또 몇 분의 프리필이 필요하다. NanoGPT의 리셀러 목록에는 백만 개당 $0.079의 캐시 읽기 요금이 게시되어 있는데, 이것이 Isaac에 적용된다면 캐시 재읽기는 약 $0.79가 된다. — 대략 절반 가격이지, 다른 곳에서 프롬프트 캐싱이 시사하는 자릿수 차이의 할인은 아니다.

가격 비교에 한 가지 정정 사항이 있습니다. 헤드라인이 바뀌기 때문입니다. Pokee는 Azure에서 공급받은 GPT-5.6 Luna를 백만 개당 $0.40/$1.80으로 책정했습니다. 2026년 7월 31일 인하 이후 Luna에 대한 공급업체 자체 목록 가격은 $0.20/$1.20이며, OrcaRouter는 공급업체 목록 가격을 0% 마크업으로 그대로 전달하고 마진을 붙여 재판매하지 않기 때문에 당사 모델 페이지에도 이 가격이 표시됩니다. 올바른 수치와 비교하면, Isaac은 패스트 프런티어 등급보다 입력에서 25%, 출력에서 17% 더 저렴합니다. 여전히 더 저렴하지만, 패널이 시사하는 것보다 훨씬 좁은 격차입니다. 그리고 패널 전체에서 가장 저렴한 출력 가격은 $0.65의 Nemotron 3 Super입니다. Isaac의 가격 이점은 실제입니다. 다만 이번 출시에서 주목할 만한 부분은 아닐 뿐입니다.

Pokee-Isaac 28B-4

실제로 새로운 부분

벤치마크 구도를 빼면 남는 것은 좀 이례적이다. 매우 긴 컨텍스트를 가진 28B 모델이 VPC 내부, 워크스테이션 RTX 4090, Intel Arc Pro 카드, 그리고 NPU급 모바일 실리콘에서 실행되고, 출시 당일 vLLM 및 SGLang 지원과 온프레미스 라이선스를 갖춘 조합은 다른 곳에서는 거의 찾아보기 어렵다. Pokee는 또한 표준 구현 대비 약 5배의 KV 캐시 효율성을 주장하는데, 이는 재현되지 않은 공급업체 수치이지만, 배포 스토리가 성립하려면 사실이어야 하는 종류의 수치이기도 하다.

이 제품의 고객은 더 나은 에이전트를 찾는 사람이 아닙니다. 이들은 법적 또는 정책적 이유로 경계 밖으로 나갈 수 없는 대규모의 민감하고 대부분 변하지 않는 코퍼스(계약서 세트, 사건 파일, 모놀리식 코드베이스, 수개월치 로그)를 보유한 사람들이며, 그렇지 않았다면 200K 윈도우를 우회하기 위해 검색 파이프라인을 구축하고 있었을 사람들입니다. 그 대안과 비교할 때, 핵심 제안은 'RAG보다 저렴하다'는 것이 아닙니다. 25,000페이지 이상을 임베딩하고 검색하는 비용은 쿼리당 몇 센트에 불과하며, 앞으로도 그럴 것입니다. 핵심 제안은 튜닝할 청킹 전략도, 잃을 검색 재현율도, 첫 번째 시스템과 동기화해야 할 두 번째 시스템도 없다는 것입니다. 그러한 트레이드오프가 쿼리당 1.50달러와 수 분의 시간을 들일 가치가 있는지 여부는 전적으로 쿼리 빈도에 달려 있습니다.

지금 시도해 봐야 할 사람은 누구이고, 기다려야 할 사람은 누구인가?

1M–4M 범위의 코퍼스를 대상으로 프로토타이핑을 하고 있다면(이 범위에서 Isaac의 수치가 가장 강력하고 대안이 정말로 부족합니다), 또는 28B 온프레미스 배포가 당신을 막고 있는 요구 사항이라면, 지금 시도해 보세요. 무료 티어의 동시 요청 10개는 모델이 당신이 필요로 하는 방식으로 문서를 읽는지 확인하기에 충분합니다.

잠깐, 특히 10M이라는 숫자가 필요하고 묻는 질문이 멀티홉이라면, 그 조합은 정확히 아무도 측정하지 않았기 때문입니다. 잠깐, 모델이 받아들이지 않는 멀티모달 입력이 필요하다면. 잠깐, 전체 창 호출이 수 초가 아니라 수 분이 걸리므로 지연 시간이 중요하다면. 그리고 명백한 의존성 위험을 저울질하세요: 이건 v0 모델이고, 가중치가 공개되지 않았으며, $12M 시드 펀딩을 받은 회사의 제품입니다. 그리고 이 모델은 자신이 판매하는 기능을 제공하는 세계 유일의 모델입니다. 그것이 사라지면 장애 조치할 두 번째 제공업체가 없습니다.

그 마지막 요점은 비교를 정직하게 유지해야 하는 실질적인 이유입니다. Pokee-Isaac 28B는 현재 OrcaRouter에 없습니다 — 원한다면 Pokee 자체 API나 리셀러에서 제공합니다. 하지만 그것이 스스로 비교하는 다섯 가지 기준선 중 세 가지, 즉 GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5는 하나의 OrcaRouter 키로 제공업체 공시 가격에 접근할 수 있어서, 유용한 실험을 저렴하게 구성할 수 있습니다: 실제 긴 컨텍스트 작업을 그 세 모델이 지원하는 길이로 실행하고, 자사의 말뭉치가 정말로 천만 개의 토큰을 필요로 하는지, 아니면 40만 개와 더 나은 프롬프트만으로 충분한지 확인해 보세요. 천만 개가 필요하다면, 호출당 1.50달러의 가치가 있는 것을 배운 것입니다. 그렇지 않다면, 단일 소스 v0에 프로덕션 경로를 구축하는 것을 피한 것입니다.

답할 가치가 있는 세 가지 질문

Pokee-Isaac 28B는 그냥 파인튠인가요?

일상적인 의미에서의 그 표현과는 거리가 있지만, 그 기반과 완전히 무관한 것도 아니다. Pokee의 입장은 일부 가중치는 Apache-2.0 라이선스 하의 Qwen3.6-27B로부터 파인튜닝되었고, 다른 일부는 처음부터 학습되었으며, 아키텍처는 디코더 전용(decoder-only)이 아니라는 것이다. 이 두 주장 모두 파라미터 수와 일치한다. Qwen3.6-27B는 생략 가능한 비전 인코더를 가진 27B 밀집 모델이고, Isaac은 28B 텍스트 전용 모델이므로, 약 10억 개의 새로운 메커니즘 파라미터가 비전 타워를 대체한 셈이다. 그 메커니즘이 무엇인지는 공개되지 않았으며, 공개되기 전까지 "종래의 파인튜닝이 아니다"라는 주장은 검증 가능한 사실이 아닌 Pokee의 말에 기댄 것이다. 베이스 모델의 Apache-2.0 라이선스는 파생을 합법적으로 만들 뿐, 결과물의 비공개 출시를 이례적으로 만들지는 않는다. 이 점을 언급할 가치가 있는 주된 이유는 이렇게 특정한 계보가 자발적으로 공개되는 경우가 드물기 때문이다.

정말로 {{1}}RTX 4090{{/1}}에서 {{2}}10M{{/2}} 토큰을 실행할 수 있나요?

{{1}}단일 GPU 주장과 10M 주장{{/1}}은 같은 출시에서 나온 것이지만 같은 측정에서 나온 것은 아닙니다. {{2}}Pokee가 10M 컨텍스트에서 공개하는 모든 처리량 수치 — 프리필 137,200 tokens/second, 최초 토큰까지 72.9초{{/2}} — 는 단일 B200 기준입니다. {{3}}RTX 4090과 Arc Pro 수치{{/3}}는 실제지만 훨씬 더 작은 규모로 인용된 것입니다. Arc Pro B70의 수치는 프리필 1,087–1,500 tokens/second로, 10M 토큰 프리필은 몇 시간이 걸릴 것입니다. {{4}}"RTX 4090부터 시작하는 단일 GPU에서 배포 가능"{{/4}}은 가중치가 맞고 모델이 유용하게 서빙된다는 주장으로 읽는 것이 가장 좋으며, 해당 카드에서 헤드라인 컨텍스트 길이가 실용적이라는 의미는 아닙니다.

RAG 파이프라인을 그것으로 대체해야 할까요?

이 증거만으로는 그렇지 않습니다. 단, 한 가지 예외가 있습니다. 검색을 대체해야 하는 근거는 쿼리가 다중 홉일 때 가장 강력합니다. 이는 정확히 청크 기반 검색이 취약하게 처리하는 실패 모드이며, 1M 토큰을 초과하는 다중 홉 성능은 Pokee가 측정하지 않은 부분입니다. MRCR v2는 1M에서 멈추며, 그 지점에서 Isaac은 바늘의 절반을 검색합니다. 예외는 1M~2M 토큰 안에 충분히 들어맞는 코퍼스입니다. 이 경우 Isaac의 측정 수치는 우수하고, 대기 시간은 수 분이 아닌 수십 초에 불과하며, 검색 계층을 제거하면 실제 운영 복잡성이 사라집니다. 그 이상의 규모라면, 그 윈도우를 프로토타입을 위해 검색을 구축하지 않아도 되는 방편으로 취급하되, 정상 작동하는 검색을 삭제할 이유로는 삼지 마십시오.

무엇이 그것을 해결할까요?

네 가지가 있는데, 그중 어느 것도 누구를 신뢰할 필요가 없습니다. 공개 API에서 누구든 2M 이상으로 실행하는 독립적인 RULER 또는 MRCR. Pokee가 이미 광고하는 길이에서의 MRCR v2 결과. 메커니즘을 명명하는 접근 가능한 기술 보고서, 그 시점에서 인코더 질문은 산수가 아니라 사실이 됩니다. 그리고 '당분간 폐쇄 소스'라고 암시하지만 약속하지 않는 가중치 공개.

그때까지의 공정한 요약은 출시가 내세운 것보다는 범위가 좁고, 회의론보다는 더 흥미롭다. Pokee AI는 현재 구매할 수 있는 어떤 모델보다 긴 컨텍스트 검색을 측정 가능할 정도로 더 먼 곳까지 유지하고, 에이전트 작업에서는 프런티어 패스트 티어와 호각을 이루며, 자체 패널에서는 안전성이 가장 높고 더 넓은 패널에서는 중위권이며, 그 성능 수준의 어떤 모델도 실행되지 않는 곳에서 실행되는 28B 모델을 출시했다. 또한 다른 누구도 제공하지 않는 그 능력에 대해 존재하는 유일한 수치를 공개하는 한편, 작동 방식은 밝히지 않기로 선택했다. 이 두 선택은 모두 젊은 회사가 내릴 수 있는 선택이다. 그러나 어느 것도 회사 외부의 누군가가 테스트를 실행하는 것을 대신할 수는 없다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube