Pokee-Isaac 28B-1
Engineering & Research

Pokee-Isaac 28B: 10 ล้านโทเคนของบริบท และสถาปัตยกรรมที่ Pokee จะไม่อธิบาย

ผู้เขียน

Jim Song

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ในตารางเปรียบเทียบการเปิดตัวของPokee-Isaac 28Bมีคอลัมน์หนึ่งที่ห้าในหกโมเดลได้คะแนน 0.0 และเชิงอรรถใต้ตารางน่าสนใจกว่าตัวเลขด้านบนเสียอีก ที่ความยาวบริบท 10 ล้านโทเค็น โมเดล 28B ใหม่ของ Pokee AI ได้คะแนน 93.3 บน RULER และทุกโมเดลอ้างอิงที่นำมาเทียบวัดด้วย — GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super 120B และ Qwen 3.5 122B — ต่างก็ไม่ให้ผลลัพธ์ที่ใช้งานได้เลย เชิงอรรถอธิบายว่าสามในห้ารุ่นดังกล่าวไม่สามารถซื้อได้ที่ความยาวบริบทเกิน 262K ตั้งแต่แรก ดังนั้นคะแนนจึงเป็นเรื่องจริง และห้องก็ว่างเปล่า นั่นคือข้อกล่าวอ้างสองข้อที่แตกต่างกัน และบทความส่วนใหญ่ที่เผยแพร่ตั้งแต่วันที่โมเดลดังกล่าวปรากฏเมื่อวันที่ 5 สิงหาคม 2026 ต่างก็รวมสองข้อกล่าวอ้างนี้เข้าเป็นเรื่องเดียวกัน

นั่นไม่ใช่เหตุผลที่จะมองข้ามสิ่งที่ Pokee เปิดตัวออกมา หากแต่เป็นเหตุผลที่ต้องระบุให้ชัดเจนว่าส่วนใดของมันที่ได้รับการพิสูจน์แล้ว ส่วนใดที่เพียงแค่ไม่มีผู้ใดโต้แย้ง และส่วนใดที่ไม่ได้มีการอธิบายไว้เลย ทุกอย่างด้านล่างนี้มาจากแหล่งข้อมูลหลักสี่แหล่ง ได้แก่ หน้าโมเดล Pokee-Isaac บนคอนโซลของ Pokee เอง เอกสารสำหรับนักพัฒนาของ Pokee รายชื่อตัวแทนจำหน่ายของโมเดลบน NanoGPT และแถลงการณ์เปิดตัวจาก Pokee AI และผู้ร่วมก่อตั้ง Zheqing (Bill) Zhu ตัวเลขการวัดประสิทธิภาพทุกตัวในบทความนี้ถูกจัดทำขึ้นโดย Pokee AI Pokee กล่าวไว้อย่างตรงไปตรงมา — คอนโซลระบุว่าตัวเลขแต่ละตัว “ถูกวัดโดย Pokee AI ในสภาพแวดล้อมที่มีการควบคุมเพียงหนึ่งเดียว สำหรับ Isaac และสำหรับทุกเกณฑ์พื้นฐานอย่างเท่าเทียมกัน เว้นแต่จะระบุไว้เป็นอย่างอื่น” — และต้องยกความดีความชอบให้พวกเขาตรงที่ว่า นั่นหมายความว่าเกณฑ์พื้นฐานถูกนำมาวัดใหม่แทนที่จะคัดลอกมาจากประกาศของผู้จำหน่ายรายอื่น และยังหมายความอีกด้วยว่าไม่มีห้องปฏิบัติการอิสระแห่งใดที่ทำซ้ำผลลัพธ์เหล่านี้ได้ และจนถึงวันนี้ก็ยังไม่มีผู้ใดเผยแพร่ความพยายามในการทำเช่นนั้น

สิ่งที่ Pokee ส่งมอบจริงๆ

พื้นผิวสาธารณะของโมเดลได้รับการบันทึกไว้เป็นอย่างดีผิดปกติสำหรับการเปิดตัวที่เพิ่งเกิดขึ้นไม่นานนี้ ดังนั้นจึงควรกล่าวถึงก่อนที่จะไปถึงส่วนที่มีการโต้แย้ง

โมเดล — Pokee-Isaac 28B เวอร์ชัน v0 ให้บริการเป็น pokee-isaac จาก api.pokee.ai ผ่านเอนด์พอยต์ที่เข้ากันได้.

ขนาดและบริบท — 28 พันล้านพารามิเตอร์กับหน้าต่างอินพุตขนาด 10,000,000 โทเคน; Pokee อธิบายว่า "ใช้งานได้ตั้งแต่ต้นจนจบ ไม่ใช่เพียงแค่ระบุตำแหน่งได้"

เอาต์พุต — 60,000 โทเคน ซึ่งเป็นทั้งค่าเริ่มต้นและค่าสูงสุด.

รูปแบบ — ข้อความเข้าและข้อความออก ไม่รองรับรูปภาพ เสียง และวิดีโอ ซึ่งน่าสังเกตเนื่องจากแบบจำลองถูกสร้างขึ้นจากข้อความ

ราคา — $0.15 ต่อล้านโทเคนอินพุต และ $1.00 ต่อล้านเอาต์พุต ตามรายการของ Pokee เอง

ฟีเจอร์แบบเอเจนต์ — การเรียกใช้ฟังก์ชันและเอาต์พุตแบบมีโครงสร้างในสคีมา chat-completions มาตรฐาน โดยโมเดลถูกวางตำแหน่งให้เป็นเอเจนต์ที่วางแผน-ลงมือปฏิบัติ-ทบทวน มากกว่าจะเป็นแชทโมเดล

ข้อจำกัดคำขอ — ขีดจำกัดขนาดตัวคำขอ 45 MiB โดยข้อมูลที่เกิน 16 MiB ต้องใช้การสตรีมแบบ SSE (stream: true พร้อมกับAccept: text/event-stream ส่วนหัว).

ขีดจำกัดอัตรา — 500 คำขอและ 20 ล้านโทเคนต่อนาที โดยมีคำขอพร้อมกัน 10 รายการสำหรับบัญชีฟรี และ 25 รายการสำหรับบัญชีแบบชำระเงิน

การปรับใช้ — ดาตาเซ็นเตอร์ B200, เวิร์กสเตชัน RTX 4090/5090, การ์ดไคลเอ็นต์ Intel Arc Pro, เอจ NPU (Qualcomm และ Intel Panther Lake โดยมี AMD ระบุว่าอยู่ระหว่างการพิจารณา) และบนอุปกรณ์ พร้อมใบอนุญาต VPC และ on-premises ซึ่งตามคำพูดของ Pokee "ไม่มีคำขอใดออกไปนอกขอบเขตระบบของคุณ"

สแตกสำหรับการให้บริการ — รองรับได้ตั้งแต่วันแรกใน vLLM และ SGLang

บริษัท — Pokee AI ก่อตั้งในปี 2024 โดย Zheqing (Bill) Zhu อดีตหัวหน้าฝ่ายการเรียนรู้แบบเสริมกำลังประยุกต์ที่ Meta; เงินทุนเริ่มต้น 12 ล้านดอลลาร์นำโดย Point72 Ventures ร่วมกับ Qualcomm Ventures และ Samsung NEXT

น้ำหนักโมเดลถูกปิดไว้ Coverage บรรยายว่าโมเดลเป็นซอร์สปิด "ในตอนนี้" ซึ่งเป็นการพูดเลี่ยงของ Pokee เอง ไม่ใช่ข้อผูกมัด และยังไม่มีการประกาศวันหรือใบอนุญาตสำหรับการเผยแพร่

Pokee-Isaac 28B-2

สถาปัตยกรรมที่ไม่มีใครจะบรรยาย

Pokee ระบุว่าหน้าต่างบริบท 10M มาจาก "สถาปัตยกรรมแบบ non-decoder-only ที่เป็นกรรมสิทธิ์" ซึ่งวลีดังกล่าวคือข้อมูลทางเทคนิคทั้งหมดที่เปิดเผย คอนโซลมีลิงก์ไปยังรายงานทางเทคนิคชื่อว่า Pokee-Isaac 28B v0: A 10M-Token Context Efficient Agentic Model ลงวันที่ 3 สิงหาคม 2026; เราไม่สามารถเข้าถึงสำเนาสาธารณะของรายงานดังกล่าวได้ และเอกสารเปิดตัวที่เข้าถึงได้ก็ไม่ได้ระบุกลไกความสนใจ (attention mechanism) โครงสร้างหน่วยความจำ หรือสูตรการฝึกอบรม

สิ่งที่ Pokee กล่าวเกี่ยวกับที่มา (lineage) นั้นเฉพาะเจาะจงกว่า และเป็นสิ่งที่พูดออกมาแล้วค่อนข้างเก้ๆ กังๆ เล็กน้อย: น้ำหนักบางส่วนของ Isaac ถูกปรับแต่งละเอียด (fine-tune) มาจาก Qwen3.6-27B ภายใต้สัญญาอนุญาต Apache-2.0 ส่วนน้ำหนักอื่นๆ ถูกฝึกจากศูนย์โดย Pokee และผลลัพธ์คือ "ไม่ใช่การ fine-tune ทั่วไป" นั่นเป็นประโยคที่ใช้ถ้อยคำอย่างระมัดระวัง มันยอมรับฐานที่มาแต่ปฏิเสธการให้ลักษณะนิยามในเวลาเดียวกัน

นอกจากนี้ยังเพียงพอที่จะจำกัดการคาดเดา ซึ่งเป็นสิ่งที่ชุมชนนักวิจัย AI เริ่มทำทันที นักวิจัยที่โพสต์ในชื่อ @teortaxesTex ได้วางชุดข้อจำกัดในวันเปิดตัว — ส่วนหนึ่งปรับแต่งจาก Qwen3.6-27B, ไม่ใช่แบบ decoder-only, บริบท 10M, รวม 28B — และเสนอตัวเลือกสองอย่าง: "Memory Sparse Attention ที่ได้รับการปรับปรุงขึ้น" หรือ "document encoder ขนาด 1B" การคาดเดาทั้งสองแบบนี้ควรค่าแก่การทำความเข้าใจ เพราะไม่ใช่การเดาที่ไร้สาระ

เริ่มจากเลขคณิตก่อน Qwen3.6-27B เป็นโมเดลหนาแน่นขนาด 27B พร้อมหน้าต่างบริบทดั้งเดิม 262K, แอตเทนชันไฮบริดแบบ gated-delta และตัวเข้ารหัสภาพที่สามารถข้ามไปได้เพื่อให้โมเดลทำงานแบบข้อความเท่านั้น Isaac เป็นโมเดลขนาด 28B และเป็นข้อความเท่านั้น หากคุณถอดหอคอยภาพ (vision tower) ของโมเดลฐานออก แล้วเพิ่มพารามิเตอร์อื่นๆ อีกประมาณพันล้านตัว คุณจะได้ขนาด 28B พอดี ตัวเข้ารหัสเอกสารหรือหน่วยความจำขนาด ~1B ที่ต่อเข้ากับดีโค้ดเดอร์ขนาด 27B เป็นการตีความจำนวนพารามิเตอร์ที่ Pokee เผยแพร่ที่ประหยัดที่สุด และมันจะทำให้ฉลาก "ไม่ใช่ดีโค้ดเดอร์เท่านั้น" เป็นจริงตามตัวอักษรโดยไม่ใช่ข้อกล่าวอ้างใหม่

{{1}}จุดคาดเดาเกี่ยวกับ Memory Sparse Attention ชี้ไปที่งานวิจัยจริงและเพิ่งเกิดขึ้นไม่นาน: 論文 MSA (arXiv:2603.23516) ผสาน sparse attention ที่ปรับขนาดได้เข้ากับ RoPE แบบรายเอกสาร เพื่อให้ได้ความซับซ้อนเชิงเส้นทั้งในการฝึกและอนุมาน {{2}}เพิ่มการบีบอัด KV-cache เข้ากับแผน "Memory Parallel" {{3}}และรายงานความเสื่อมคุณภาพต่ำกว่า 9% ตั้งแต่ 16K ไปจนถึง 100M โทเค็น {{4}}โดยการอนุมาน 100M โทเค็นทำงานบน A800 เพียงสองเครื่อง {{5}}นั่นเป็นลักษณะผลลัพธ์แบบเดียวกับที่ Pokee อ้าง แต่ไกลออกไปอีกหนึ่งลำดับความสำคัญ และมาจากกลุ่มวิจัยคนละกลุ่ม {{6}}ไม่มีอะไรเชื่อมโยงทั้งสองสิ่งนอกจากรูปร่างของผลลัพธ์ — MSA ไม่ใช่งานของ Pokee และ Pokee ก็ไม่ได้อ้างอิงถึง — {{7}}แต่มันยืนยันว่าการออกแบบหน่วยความจำแบบแยกส่วนที่เข้าถึงความยาวระดับนี้บนฮาร์ดแวร์ขนาดพอประมาณนั้นเป็นสิ่งที่ตีพิมพ์และเป็นไปได้จริง ไม่ใช่เรื่องที่เป็นไปไม่ได้ทางการตลาด

ในเอกสารของ Pokee เอง มีตัวเลขหนึ่งที่สนับสนุนการอ่านแบบแยกเอนโค้ดเดอร์อย่างเงียบๆ ปริมาณงานพรีฟิลบน B200 ตัวเดียวคือ 42,400 โทเคน/วินาที ที่บริบท 1M โทเคน และ 137,200 โทเคน/วินาที ที่ 10M ปริมาณงานเพิ่มขึ้นมากกว่าสามเท่าเมื่อบริบทยาวขึ้นสิบเท่า ตัวถอดรหัสที่จ่ายต้นทุนความสนใจแบบกำลังสองให้ผลตรงกันข้าม สิ่งที่ใช้โทเคนเหล่านั้นจะยิ่งมีประสิทธิภาพต่อโทเคนมากขึ้นเมื่อคุณเพิ่มโทเคน ซึ่งเป็นลักษณะเฉพาะของการเข้ารหัสเอกสารแบบเป็นชุดมากกว่าการพรีฟิลทั่วไป

เหตุผลว่าทำไมเรื่องนี้ถึงสำคัญสำหรับคนที่กำลังตัดสินใจว่าจะใช้โมเดลหรือไม่: ถ้าหน้าต่าง 10M เป็นเอกสารเอนโค้ดเดอร์บวกกับหน่วยความจำแบบบีบอัด มากกว่าเป็นแคช KV ขนาด 10M รายการ 'บริบท' ในที่นี้ก็ไม่ใช่สิ่งที่จะใช้สัญชาตญาณเดิมของคุณได้ พฤติกรรมเมื่อคุณต่อบทสนทนา แก้ไขเอกสารหนึ่งฉบับกลางคลังเอกสาร หรือคาดหวังให้ prefix caching ทำงานนั้นไม่ถูกกำหนดไว้ และเอกสารของ Pokee ก็ไม่ได้ระบุกลไกการแคชใดๆ เลย คุณไม่สามารถให้เหตุผลเกี่ยวกับพฤติกรรมเหล่านั้นจากสเปกชีตได้ และตอนนี้คุณก็ไม่สามารถให้เหตุผลจากสถาปัตยกรรมได้เช่นกัน

ไม้บรรทัดที่ระยะ 10 เมตรเป็นจำนวนจริงในห้องว่าง

หลักฐานบริบทระยะยาวของ Pokee คือ RULER ซึ่งรันที่ 256K, 512K, 1M, 2M, 4M และ 10M โดยมีตัวอย่างสิบตัวอย่างต่อการกำหนดค่า Isaac ได้คะแนน 96.9, 96.7, 95.0, 95.8, 96.7 และ 93.3 ในหกความยาวดังกล่าว — เป็นโมเดลเดียวในกลุ่มที่ได้คะแนนในทุกระยะ

แผงด้านล่าง 1M คือจุดที่ค่าที่อ่านได้จริงปรากฏอยู่:

ที่ 256K — Isaac 96.9, Nemotron 3 Super 120B 96.3, GPT-5.6 Luna 95.0, Gemini 3.5 Flash Lite 94.5 และ 0.0 สำหรับทั้ง Claude Haiku 4.5 และ Qwen 3.5 122B ซึ่งหน้าต่างบริบทสั้นกว่าความยาวนั้น

ที่ 512K — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.

ที่ 1M — Isaac 95.0, Nemotron 91.8, Gemini 3.5 Flash Lite 29.4 และ GPT-5.6 Luna 0.0 โดยทั้งสองรุ่นหลังถูกระบุว่าเป็นข้อผิดพลาด context-overflow.

ที่ 2M และมากกว่านั้น — Isaac เพียงลำพัง ที่เหลือทั้งหมด 0.0.

สามสิ่งที่ตามมามีดังนี้ ประการแรก ถึงความยาว 1M ส่วนต่างของ Isaac เหนือคู่แข่งมีเพียงหนึ่งหรือสองจุด ไม่ใช่ระดับข้ามรุ่น และเกณฑ์อ้างอิงเดียวที่ยังคงใกล้เคียงคือ Nemotron 3 Super 120B ซึ่งเป็นโมเดล 120B ที่ตัวเลขจาก 256K ถึง 1M เป็นค่าที่ NVIDIA รายงานเอง Pokee จึงทำเครื่องหมายและแยกออกจากการเปรียบเทียบในแถว แทนที่จะนำเสนอราวกับว่าเป็นค่าที่วัดได้ ดังนั้นคู่แข่งที่ใกล้เคียงที่สุดที่ความยาวเหล่านั้นจึงไม่ใช่การวัดที่เทียบเคียงกันได้จริง ไม่ว่าจะในทิศทางใด

ประการที่สอง อย่างน้อยหนึ่งในช่องว่างดูเหมือนเป็นสิ่งที่เกิดจากการปรับใช้ (deployment artifact) มากกว่าข้อจำกัดของโมเดล {{1}}Pokee รัน GPT-5.6 Luna ผ่าน Azure และระบุหน้าต่างบริบทของมันว่า ">272K context," พร้อมบันทึกข้อผิดพลาด context-overflow ที่ 1M.{{/1}} หน้าต่างที่ผู้จำหน่ายระบุไว้ในเอกสารของตนเองสำหรับโมเดลนั้นอยู่ที่ประมาณ 1.05M โทเคน ซึ่งตรงกับที่หน้าข้อมูลโมเดลของเราเองรายงานไว้ {{2}}ผู้อ่านที่เชื่อถือคอลัมน์ 1M ตามที่เห็นจะสรุปว่า Luna ไม่สามารถรองรับ 1M ได้ ข้อสรุปที่สมเหตุสมผลกว่าคือการปรับใช้บน Azure ที่ Pokee ทดสอบนั้นไม่สามารถรองรับได้.{{/2}}

ประการที่สาม RULER คือชุดการดึงข้อมูลและการรวมข้อมูลแบบสังเคราะห์ ไม่ใช่เกณฑ์ชี้วัดสำหรับการให้เหตุผล Pokee เองก็โปร่งใสเกี่ยวกับจุดบกพร่องเชิงวิธีการตรงนี้เช่นกัน: คอลัมน์ 256K และ 512K เฉลี่ยการกำหนดค่างานทั้ง 13 แบบ แต่การสกัดคำสามัญไม่สามารถใช้ได้ตั้งแต่ 1M เป็นต้นไป ดังนั้นคอลัมน์ระยะยาวจึงเฉลี่ยจาก 12 งานที่เหลือ ด้วยเหตุนี้ ค่า 93.3 ที่ 10M และ 96.9 ที่ 256K จึงไม่ได้ถูกประเมินบนส่วนผสมของงานเดียวกันทั้งหมด

การทดสอบบริบทระยะยาวที่ยากขึ้นจะหยุดที่ 1M

ตัวชี้วัดที่เปิดเผยกว่าบนหน้าของ Pokee ไม่ใช่ RULER แต่เป็น MRCR v2 ซึ่งเป็นงาน co-reference แบบหลายรอบที่มีเข็ม 8 อัน โดยเป้าหมายหลายตัวกระจายอยู่ในการสนทนาที่ยาว และโมเดลต้องดึงข้อมูลและแยกแยะเป้าหมายที่ระบุให้ชัดเจน ดังนั้นการเรียกคืนได้บางส่วนและการรบกวนข้ามเข็มจะส่งผลเสียต่อคะแนนทั้งคู่ ในมาตราส่วน 0–1 ที่ 1M โทเค็น:

Pokee-Isaac 28B — 0.500

Gemini 3.5 Flash Lite — 0.205

Nemotron 3 Super 120B — 0.067

GPT-5.6 Luna — 0.050

Claude Haiku 4.5 และ Qwen 3.5 122B — 0.000 ไม่มีอะไรที่ใช้ได้ที่ความยาวนั้น

นี่เป็นช่องว่างที่กว้างกว่าและน่าเชื่อถือกว่ามากเมื่อเทียบกับที่ RULER ให้ผล และเป็นจุดที่ข้อเสนอของโมเดลเกิดผลจริง Luna ได้คะแนน 95.0 บน RULER ที่ 256K และ 0.050 บน MRCR ที่ 1M; การเรียกคืนเป้าหมายเดียวและการแยกความกำกวมแบบหลายเข็มไม่ใช่ทักษะเดียวกัน และทักษะที่สองล่มสลายก่อน Isaac เสื่อมคุณภาพอย่างค่อยเป็นค่อยไปกว่า

มันยังเป็น{{1}}ช่องโหว่หลักฐานที่ใหญ่ที่สุดเพียงหนึ่งเดียวในการเปิดตัว{{/1}}อีกด้วย MRCR v2 ถูกทดสอบที่{{2}}256K, 512K และ 1M{{/2}} — แล้วก็หยุดเพียงเท่านั้น คะแนนของไอแซคเองที่ระดับนั้นคือ {{3}}0.607, 0.743 และ 0.500{{/3}}: {{4}}ไม่เป็นโมโนโทนิก{{/4}} และที่ 1M มันดึงเข็มออกมาได้เพียงครึ่งหนึ่ง ไม่มีผลการทดสอบแบบหลายเข็มที่เผยแพร่ที่{{5}}2M, 4M หรือ 10M{{/5}} จากใครเลย รวมถึง{{6}}Pokee{{/6}} ด้วย การอ้างสิทธิ์ที่ 10M อาศัย{{7}}การทดสอบที่ง่ายกว่าจากสองแบบ{{/7}}เท่านั้น ในความยาวที่การทดสอบที่ยากกว่าไม่มีการพยายามทำเลย หากคุณกำลังพิจารณาโมเดลนี้เพราะต้องการใส่{{8}}คลังเอกสาร 25,000 หน้า{{/8}}ในพรอมป์เดียวแล้วถามคำถามที่คำตอบถูก{{9}}ประกอบจากสี่ตำแหน่งในนั้น{{/9}} ความสามารถเฉพาะนั้น{{10}}ไม่เคยถูกวัดที่ความยาวเฉพาะนั้น{{/10}}

Pokee-Isaac 28B-3

ในงานแบบ agentic นั้น Isaac เทียบเท่ากับ Luna ไม่ใช่เหนือกว่า

Pokee รันการวัดสมรรถนะแบบ agentic สี่ชุด และนี่คือจุดที่ความตรงไปตรงมาของบริษัทผิดปกติอย่างแท้จริง: หน้าของบริษัทเองสรุปผลว่า Isaac นำในสองชุด ได้ที่สองในหนึ่งชุด และได้ที่สามในหนึ่งชุด นั่นคือคำอธิบายที่แม่นยำ และไม่ใช่คำอธิบายในรายงานข่าวการเปิดตัว

BFCL v4, การเรียกใช้ฟังก์ชัน (ให้คะแนนโดยการจับคู่ AST และการเปลี่ยนสถานะ แทนที่จะใช้ LLM เป็นผู้ตัดสิน) — Isaac 70.94 เทียบกับ GPT-5.6 Luna 70.61, โดย Claude Haiku 4.5 ได้ 67.52, Qwen 3.5 122B ได้ 64.88, Gemini 3.5 Flash Lite ได้ 64.85, Nemotron 3 Super ได้ 33.13.

τ³-bench ค่าเฉลี่ยสี่โดเมน (งานบริการลูกค้าแบบหลายเทิร์นกับผู้ใช้จำลองซึ่งความต้องการเปลี่ยนไประหว่างการสนทนา) — Isaac 0.662 เทียบกับ Gemini 3.5 Flash Lite 0.631, Qwen 3.5 122B 0.611, GPT-5.6 Luna 0.527, Nemotron 0.426, Claude Haiku 4.5 0.408.

Terminal-Bench 2.1, ชุดย่อยเฉพาะข้อความ — GPT-5.6 Luna 69.8% เทียบกับ Isaac 65.1% จากนั้น Gemini 3.5 Flash Lite และ Qwen 3.5 122B เสมอกันที่ 46.5%, Claude Haiku 4.5 34.9%, Nemotron 24.4%.

MCP-Atlas, ความครอบคลุมข้อกล่าวอ้างบนเซิร์ฟเวอร์เครื่องมือสด — GPT-5.6 Luna 77.90%, Gemini 3.5 Flash Lite 76.67%, Isaac 74.59%, Qwen 3.5 122B 70.24%, Claude Haiku 4.5 56.45%, Nemotron 48.95%.

คะแนนที่ห่างกัน 0.33 จุดบน BFCL v4 ถือว่าเสมอกัน และหน้าของ Pokee ก็พูดเช่นนั้นแทนที่จะเรียกว่าชนะ เมื่ออ่านทั้งสี่รายการ โมเดล 28B แลกชัยชนะกับระดับความเร็วสูงของผู้จำหน่ายระดับแนวหน้าในงานด้านตัวแทน สำหรับโมเดล 28B นั่นเป็นผลลัพธ์ที่แข็งแกร่ง มันไม่ใช่ผลลัพธ์ที่คำว่า "frontier-class agentic model" สื่อถึงผู้อ่านส่วนใหญ่ และมันหมายความว่าเหตุผลที่เลือก Isaac คือหน้าต่างบริบทและขอบเขตการปรับใช้ ไม่ใช่ความเป็นตัวแทน

คะแนนความปลอดภัยเป็นคะแนนที่ดีที่สุดของคณะกรรมการ แต่ก็ยังไม่ดี

บน DTAP ซึ่งเป็นชุดทดสอบการฉีดพรอมต์ (prompt-injection suite) Isaac มีอัตราความสำเร็จในการโจมตีต่ำที่สุดในกลุ่มที่ 35.6 โดยรวม รองลงมาคือ Claude Haiku 4.5 ที่ 37.9, GPT-5.6 Luna ที่ 50.1, Qwen 3.5 122B ที่ 54.0, Nemotron ที่ 60.4 และ Gemini 3.5 Flash Lite ที่ 66.3 อัตราทางตรงและทางอ้อมต่างกันไม่ถึงหนึ่งจุด ดังนั้นความแข็งแกร่งจึงเท่ากันอย่างน้อยในทั้งสองเวกเตอร์

ข้อควรระวังสามประการ ซึ่งทั้งหมดมาจากรายงานของ Pokee เอง ไม่ใช่จากนักวิจารณ์ การวัดทางอ้อมทำในขณะที่ระบบป้องกันไม่ทำงาน การปฏิเสธอย่างชัดเจนเกิดขึ้นเพียง 1.5% ของงานที่เป็นอันตราย ซึ่ง Pokee อธิบายว่าการป้องกันในปัจจุบันส่วนใหญ่เป็น "เรื่องบังเอิญมากกว่าการปฏิเสธ" — โมเดลไม่ได้จดจำและปฏิเสธการโจมตี แต่มันล้มเหลวในการถูกชักนำให้มีประโยชน์ และเมื่อเทียบกับตารางอันดับระบบ 16 ระบบที่กว้างขึ้น แทนที่จะเป็นกลุ่มโมเดลหกตัวนี้ Isaac อยู่อันดับที่ห้าในการโจมตีโดยตรง อันดับที่หกในการโจมตีทางอ้อม และอันดับที่เก้าด้านความสามารถ: อยู่กลางสนาม ไม่ใช่ผู้นำ

ความปลอดภัยก็มีต้นทุนเช่นกัน อัตราความสำเร็จในงานปกติของ Isaac อยู่ที่ 82.5 ซึ่งต่ำกว่า 85.1 ของ GPT-5.6 Luna — มันปฏิเสธหรือทำพลาดในงานที่ถูกต้องมากกว่าเล็กน้อยเมื่อเทียบกับโมเดลที่มันเอาชนะในด้านการโจมตี และค่า 35.6 หมายความว่าการพยายามฉีด prompt ประมาณหนึ่งในสามครั้งยังคงสำเร็จ สำหรับโมเดลที่แก่นของแนวคิดคือการอ่านโทเค็นนับสิบล้านตัวจากเอกสารที่คุณไม่ได้เขียน ตัวเลขนั้นคือสิ่งที่ควรออกแบบมาตรการป้องกันโดยรอบ ไม่ใช่ตัวเลขที่ควรทำให้อุ่นใจ DTAP เองก็เป็นสิ่งที่ควรตั้งข้อสังเกต: ต่างจาก RULER, BFCL และ τ³-bench ตรงที่มันไม่ใช่ลีดเดอร์บอร์ดสาธารณะที่ได้รับการยอมรับ และเราไม่พบเอกสารอิสระของชุดทดสอบดังกล่าว

การเรียกใช้ 10 ล้านโทเคนมีค่าใช้จ่ายเท่าไร และต้องรอนานแค่ไหน

สิบล้านโทเคนมีประมาณ 7.5 ล้านคำ หรือประมาณ 25,000 หน้า ที่ราคา $0.15 ต่อล้านโทเคนของ Pokee การเติมหน้าต่างครั้งเดียวมีค่าใช้จ่าย $1.50 เพิ่มคำตอบความยาวสูงสุด 60,000 โทเคนที่ $1.00 ต่อล้าน และการเรียกใช้สูงสุดหนึ่งครั้งจะอยู่ที่ประมาณ $1.56 นั่นถือว่าถูกจริงๆ สำหรับปริมาณข้อความที่เกี่ยวข้อง และเป็นข้อโต้แย้งที่เรียบง่ายแต่แข็งแกร่งที่สุดสำหรับโมเดลนี้

เวลาคือราคาที่แท้จริง บน B200 ตัวเดียว Pokee รายงานเวลา 72.9 วินาทีจนถึงโทเคนแรกที่ 10M ซึ่งก็คือ 10,000,000 หารด้วยตัวเลข prefill ที่ 137,200 โทเคนต่อวินาที ดังนั้นมันจึงเป็นตัวเลขจากฮาร์ดแวร์ที่ใช้ benchmark ไม่ใช่ค่า latency ที่วัดจาก API จริง เอกสารสำหรับนักพัฒนาของ Pokee เองกลับบอกอีกเรื่องหนึ่ง: ให้ตั้งค่า client timeout อย่างน้อยสิบนาทีสำหรับพรอมพ์ที่มีหลายล้านโทเคน เพราะพรอมพ์ขนาดใหญ่อาจใช้เวลา "ประมาณเจ็ดนาทีที่ 10 ล้านโทเคน" นั่นคือช่องว่างประมาณหกเท่าระหว่างสไลด์ throughput กับคู่มือ integration ทั้งคู่เป็นตัวเลขของ Pokee ทั้งนั้น แต่ตัวเลขในเอกสารคือสิ่งที่คอนฟิก timeout ของคุณต้องเชื่อ

การถอดรหัส (decode) คงที่ที่ประมาณ 335 โทเคนต่อวินาที ไม่ว่าบริบทจะถูกโหลดอยู่ในหน่วยความจำมากน้อยเพียงใด ซึ่งเป็นข่าวดีในเชิงสถาปัตยกรรม แต่เป็นข่าวที่อึดอัดในทางปฏิบัติ: ผลลัพธ์เต็มรูปแบบ 60,000 โทเคนใช้เวลาประมาณสามนาทีเพิ่มจากขั้นตอน prefill บนฮาร์ดแวร์สำหรับผู้บริโภค ภาพจะเปลี่ยนไปอีกครั้ง — บน Intel Arc Pro B70 Pokee รายงาน prefill ที่ 1,087–1,500 โทเคนต่อวินาที (3.6–5 เท่าของ llama.cpp มาตรฐาน) และ decode ที่ 58.8 โทเคนต่อวินาที ตัวเลขเหล่านั้นน่านับถือสำหรับ GPU ฝั่งไคลเอนต์ และไม่ใช่ตัวเลขระดับ 10 ล้านโทเคน

ข้อจำกัดเชิงปฏิบัติสองข้อเกิดจากขนาดของอินพุตเอง โทเค็นภาษาอังกฤษหนึ่งล้านล้านคำคือ "Ten million tokens" แปลว่า สิบล้านโทเค็น คิดเป็นข้อความประมาณ 38 MiB ซึ่งอยู่ภายใต้เพดานขนาดบอดี้คำขอ 45 MiB แต่สูงเกินกว่าเกณฑ์ 16 MiB อย่างมาก ดังนั้นทุกการเรียกแบบเต็มหน้าต่างอย่างแท้จริงจึงต้องใช้การสตรีม — ไม่มีเส้นทางแบบไม่สตรีมไปยังฟีเจอร์หลักนี้ และเนื่องจากไม่มีเอกสารเกี่ยวกับการแคชพรอมป์ต์บน API ของ Pokee การสอบถามคลังข้อมูลชุดเดียวกันซ้ำแต่ละครั้งจึงคิดค่าใช้จ่ายอีก $1.50 และต้องทำ prefill ใช้เวลาหลายนาทีอีกรอบ รายชื่อตัวแทนจำหน่ายบน NanoGPT เผยแพร่อัตราการอ่านแคชที่ $0.079 ต่อล้าน ซึ่งหากใช้กับ Isaac จะทำให้การอ่านแคชซ้ำมีค่าใช้จ่ายประมาณ $0.79 — ราวครึ่งราคา ไม่ใช่ส่วนลดระดับเท่าตัวที่การแคชพรอมป์ต์ในที่อื่นๆ ให้

ข้อแก้ไขหนึ่งสำหรับการเปรียบเทียบราคา เพราะมันเปลี่ยนพาดหัวข่าว Pokee คิดราคา GPT-5.6 Luna ที่ $0.40/$1.80 ต่อล้านรายการ โดยอ้างอิงจาก Azure ราคาลิสต์ของตัวแทนจำหน่ายเองสำหรับ Luna หลังการปรับลดในวันที่ 31 กรกฎาคม 2026 คือ $0.20/$1.20 ซึ่งเป็นสิ่งที่หน้าตัวแบบของเราแสดงไว้ เพราะ OrcaRouter ส่งผ่านราคาลิสต์ของผู้ให้บริการด้วยมาร์กอัป 0% แทนที่จะขายต่อโดยบวกกำไร เทียบกับตัวเลขที่ถูกต้อง Isaac ถูกกว่าอินพุต 25% และถูกกว่าเอาต์พุต 17% เมื่อเทียบกับกลุ่ม frontier ระดับเร็ว — ยังถูกกว่า แต่ความได้เปรียบแคบกว่าที่แผงแสดงไว้มาก และราคาเอาต์พุตที่ถูกที่สุดโดยรวมของแผงเป็นของ Nemotron 3 Super ที่ $0.65 ข้อได้เปรียบด้านราคาของ Isaac มีจริง แต่มันไม่ใช่ส่วนที่น่าทึ่งของการเปิดตัวครั้งนี้

Pokee-Isaac 28B-4

ส่วนที่ใหม่จริงๆ

เมื่อตัดกรอบการวัดประสิทธิภาพออกไป ก็จะเหลือบางสิ่งที่ไม่ธรรมดา โมเดล 28B ที่มีบริบทยาวมาก ซึ่งทำงานภายใน VPC บนเวิร์กสเตชัน RTX 4090 บนการ์ด Intel Arc Pro และบนซิลิคอนมือถือระดับ NPU พร้อมการรองรับ vLLM และ SGLang ตั้งแต่วันแรก และใบอนุญาตแบบ on-premises การผสมผสานแบบนี้แทบจะหาที่อื่นไม่ได้ Pokee ยังอ้างว่ามีประสิทธิภาพ KV-cache ดีกว่า implementation มาตรฐานประมาณ 5 เท่า ซึ่งเป็นตัวเลขจากผู้ขายที่ไม่มีการทำซ้ำเพื่อยืนยัน แต่มันเป็นตัวเลขประเภทที่ต้องเป็นจริง เรื่องราวการปรับใช้ถึงจะสมเหตุสมผล

ลูกค้ารายนี้ไม่ใช่คนที่กำลังมองหาตัวแทนที่ดีกว่า แต่เป็นคนที่มีคลังข้อมูลขนาดใหญ่ อ่อนไหว และส่วนใหญ่คงที่ — ชุดสัญญา แฟ้มคดี โค้ดเบสก้อนใหญ่ บันทึกการทำงานหลายเดือน — ซึ่งไม่สามารถนำออกนอกขอบเขตได้ไม่ว่าด้วยเหตุผลทางกฎหมายหรือทางการเมือง และถ้าไม่มีทางเลือกนี้ก็คงต้องสร้างไปป์ไลน์สำหรับค้นคืนข้อมูลเพื่อเลี่ยงข้อจำกัดของหน้าต่าง 200K เมื่อเทียบกับทางเลือกนั้น จุดขายไม่ใช่ "ถูกกว่า RAG" เพราะการฝังและค้นคืนข้อมูลกว่า 25,000 หน้ามีค่าใช้จ่ายเพียงไม่กี่เซ็นต์ต่อคำสั่ง และจะเป็นเช่นนี้ตลอดไป จุดขายคือไม่มีกลยุทธ์การแบ่ง chunk ให้ต้องปรับแต่ง ไม่มีค่า recall ของการค้นคืนให้สูญเสีย และไม่มีระบบที่สองที่ต้องซิงก์ให้ตรงกับระบบแรก การแลกเปลี่ยนแบบนี้จะคุ้มกับ $1.50 และเวลาหลายนาทีต่อคำสั่งหรือไม่ ย่อมขึ้นอยู่กับว่าคุณใช้คำสั่งบ่อยแค่ไหน

ใครควรลองตอนนี้ และใครควรรอ

ลองเลยตอนนี้ หากคุณกำลังสร้างต้นแบบกับคลังข้อมูลในช่วง 1M–4M ซึ่งเป็นช่วงที่ตัวเลขของ Isaac แข็งแกร่งที่สุดและทางเลือกอื่น ๆ มีอยู่อย่างจำกัดจริง ๆ หรือหากการปรับใช้แบบ on-premises ที่ 28B เป็นข้อกำหนดที่กำลังขัดขวางคุณอยู่ คำขอพร้อมกันสิบรายการของระดับฟรีก็เพียงพอที่จะบอกได้ว่าโมเดลอ่านเอกสารของคุณในแบบที่คุณต้องการหรือไม่

เดี๋ยวก่อน หากคุณต้องการตัวเลข 10M โดยเฉพาะ และคำถามที่คุณถามเป็นแบบหลายขั้นตอน เพราะการรวมกันแบบนั้นคือสิ่งที่ยังไม่มีใครวัดได้อย่างแน่นอน เดี๋ยวก่อน หากคุณต้องการอินพุตแบบมัลติโมดัล ซึ่งโมเดลไม่รองรับ เดี๋ยวก่อน หากเวลาแฝงสำคัญ เนื่องจากการเรียกใช้แบบเต็มหน้าต่างใช้เวลาเป็นนาที ไม่ใช่วินาที และชั่งน้ำหนักความเสี่ยงด้านการพึ่งพาที่เห็นได้ชัด: นี่คือโมเดล v0 ที่มีน้ำหนักแบบปิด จากบริษัทที่ระดมทุนรอบเริ่มต้น 12 ล้านดอลลาร์ และมันเป็นโมเดลเดียวในโลกที่ให้บริการความสามารถที่มันขายอยู่ ไม่มีผู้ให้บริการรายที่สองให้เปลี่ยนไปใช้สำรองได้หากมันหายไป

ประเด็นสุดท้ายนั้นคือเหตุผลเชิงปฏิบัติที่จะรักษาความยุติธรรมในการเปรียบเทียบ Pokee-Isaac 28B ยังไม่ได้อยู่ใน OrcaRouter ในวันนี้ — หากคุณต้องการมัน API ของ Pokee เองหรือผู้จำหน่ายซ้ำคือที่ที่มันอยู่ แต่สามในห้าเส้นฐานที่มันใช้วัดตัวเอง ได้แก่ GPT-5.6 Luna, Gemini 3.5 Flash Lite และ Claude Haiku 4.5 อยู่ในคีย์ OrcaRouter เดียวในราคารายการของผู้ให้บริการ ซึ่งทำให้การทดลองที่มีประโยชน์มีค่าใช้จ่ายต่ำในการตั้งค่า: รันงาน context ยาวจริงของคุณกับสามตัวนั้นที่ความยาวที่รองรับ แล้วดูว่าคลังข้อความของคุณต้องการสิบล้านโทเคนจริงหรือไม่ หรือต้องการ 400,000 และพรอมต์ที่ดีกว่า หากต้องการสิบล้าน คุณได้เรียนรู้บางอย่างที่คุ้มค่า $1.50 ต่อการเรียก หากไม่ต้องการ คุณได้หลีกเลี่ยงการสร้างเส้นทางการผลิตบน v0 จากแหล่งเดียว

สามคำถามที่ควรค่าแก่การตอบ

Pokee-Isaac 28B เป็นแค่การ fine-tune หรือไม่?

ไม่ใช่ตามความหมายปกติของวลีนั้น แต่มันก็ไม่ได้เป็นอิสระจากฐานนั้นเช่นกัน จุดยืนของ Pokee คือ น้ำหนักบางส่วนถูกปรับละเอียด (fine-tune) มาจาก Qwen3.6-27B ภายใต้สัญญา Apache-2.0 ขณะที่บางส่วนถูกฝึกจากศูนย์ และสถาปัตยกรรมไม่ได้เป็นแบบ decoder-only ทั้งสองส่วนนี้สอดคล้องกับจำนวนพารามิเตอร์: Qwen3.6-27B เป็นโมเดล dense ขนาด 27B พร้อม vision encoder ที่ข้ามได้ ส่วน Isaac มีขนาด 28B และเป็น text-only ดังนั้นกลไกใหม่ประมาณพันล้านพารามิเตอร์จึงเข้ามาแทนที่ vision tower ยังไม่มีการเปิดเผยว่ากลไกนั้นคืออะไร และจนกว่าจะมีการเปิดเผย คำกล่าวที่ว่า "ไม่ใช่การ fine-tune ทั่วไป" จึงเป็นข้ออ้างที่อาศัยคำพูดของ Pokee มากกว่าสิ่งใดที่ตรวจสอบได้ สัญญาอนุญาต Apache-2.0 บนโมเดลฐานทำให้การดัดแปลงถูกต้องตามกฎหมาย แต่มันไม่ได้ทำให้การเผยแพร่ผลลัพธ์แบบปิดเป็นเรื่องผิดปกติ ซึ่งน่าสังเกตเป็นหลักเพราะที่มาที่จำเพาะขนาดนี้ไม่ค่อยถูกเปิดเผยด้วยความสมัครใจ

มันรัน 10M tokens บน RTX 4090 ได้จริงหรือ?

ข้อกล่าวอ้างเรื่อง “GPU ตัวเดียว” และข้อกล่าวอ้างเรื่อง “10M” มาจากการเปิดตัวครั้งเดียวกัน แต่ไม่ได้มาจากการวัดเดียวกัน ตัวเลข throughput ทุกตัวที่ Pokee เผยแพร่ที่ context 10M — 137,200 tokens/วินาทีสำหรับ prefill, 72.9 วินาทีสำหรับ time to first token — ล้วนวัดบน B200 ตัวเดียว ตัวเลขของ RTX 4090 และ Arc Pro เป็นของจริง แต่ถูกอ้างอิงที่ขนาดเล็กกว่ามาก ตัวเลขของ Arc Pro B70 คือ 1,087–1,500 tokens/วินาทีสำหรับ prefill ซึ่งจะทำให้ prefill ขนาด 10M tokens ใช้เวลานานเป็นชั่วโมง ข้อความที่ว่า “ปรับใช้ได้บน GPU ตัวเดียวโดยเริ่มจาก RTX 4090” ควรตีความได้ดีที่สุดว่าเป็นการกล่าวอ้างว่า weights บรรจุลงได้และโมเดลให้บริการได้อย่างมีประโยชน์ ไม่ใช่เกี่ยวกับความยาว context ที่เป็นจุดขายหลักจะใช้งานได้จริงบนการ์ดนั้น

ฉันควรแทนที่ RAG pipeline ด้วยมันหรือไม่?

ไม่ใช่จากหลักฐานนี้ แต่มียกเว้นหนึ่งกรณี เหตุผลในการแทนที่ retrieval จะแข็งแกร่งที่สุดเมื่อ query ของคุณเป็นแบบ multi-hop — ซึ่งเป็นโหมดความล้มเหลวที่ chunked retrieval จัดการได้ไม่ดี — และประสิทธิภาพแบบ multi-hop ที่เกิน 1M tokens คือสิ่งที่ Pokee ไม่ได้วัด MRCR v2 หยุดที่ 1M ซึ่ง Isaac ดึงเข็มออกมาได้เพียงครึ่งเดียว ข้อยกเว้นคือคลังข้อมูลที่พอดีในช่วง 1M–2M tokens ซึ่งตัวเลขที่ Isaac วัดได้นั้นแข็งแกร่ง การรอคอยเป็นหลักสิบวินาทีแทนที่จะเป็นนาที และการถอดชั้น retrieval ออกช่วยลดความซับซ้อนในการปฏิบัติงานจริง เหนือระดับนั้น ให้มอง window เป็นหนทางหลีกเลี่ยงการสร้าง retrieval สำหรับโปรโตไทป์ ไม่ใช่เหตุผลที่จะลบระบบที่ทำงานได้ดีอยู่แล้ว

อะไรจะยุติเรื่องนี้ได้

สี่สิ่ง ซึ่งไม่จำเป็นต้องเชื่อใจใครเลย: หนึ่ง การรัน RULER หรือ MRCR อย่างอิสระที่ระดับ 2M ขึ้นไป โดยใครก็ได้บน API สาธารณะ สอง ผลลัพธ์ MRCR v2 จาก Pokee ที่ความยาวตามที่มันประกาศไว้แล้ว สาม รายงานทางเทคนิคที่เข้าถึงได้ซึ่งระบุกลไก และเมื่อถึงจุดนั้น คำถามเรื่องเอนโค้ดเดอร์จะไม่ใช่เลขคณิตอีกต่อไป แต่จะกลายเป็นข้อเท็จจริง และสี่ การเปิดเผยน้ำหนัก (weights) ซึ่งคำว่า "ปิดซอร์สในตอนนี้" เอ่ยถึงเป็นนัยโดยไม่ได้ให้คำมั่นสัญญา

จนกว่าจะถึงเวลานั้น สรุปที่ยุติธรรมก็แคบกว่าการเปิดตัวและน่าสนใจกว่าความกังขา Pokee AI ได้ส่งมอบโมเดล 28B ที่วัดผลได้ว่าครองการดึงข้อมูลบริบทยาวได้ไกลกว่าสิ่งใดที่คุณซื้อได้ในปัจจุบัน ทำงานสูสีกับ fast tier ชั้นแนวหน้าในงานแบบ agentic ปลอดภัยที่สุดในแผงทดสอบของตัวเอง และอยู่กลางตารางเมื่อเทียบกับแผงที่กว้างกว่า และทำงานในที่ที่โมเดลความสามารถเทียบเท่าไม่สามารถทำงานได้ อีกทั้งยังเลือกที่จะเผยแพร่ตัวเลขเพียงชุดเดียวที่มีอยู่เกี่ยวกับความสามารถที่ไม่มีใครอื่นนำเสนอ และไม่บอกว่ามันทำงานอย่างไร ทั้งสองอย่างเป็นทางเลือกที่บริษัทอายุน้อยมีสิทธิ์เลือกได้ และไม่มีสิ่งใดทดแทนการที่คนนอกองค์กรลงมือทดสอบจริงได้

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube