
Inkling-Small: รุ่นขนาดหนึ่งในสี่ที่เอาชนะเรือธงของตัวเองได้ แต่ยังตามหลัง Index
- qwenใหม่Qwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 ต่อ 1 ล้านโทเค็น · 56 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4 Flash 07312026-07-3150ความฉลาด69การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 201 tok/s
- orcaใหม่OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicใหม่Anthropic: Claude Opus 52026-07-2461ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2150ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1651ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1557ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0951ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0955ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0959ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0854ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0641ความฉลาด59การเขียนโค้ด
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232ความฉลาด42การเขียนโค้ด
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226ความฉลาด39การเขียนโค้ด
- anthropicAnthropic: Claude Sonnet 52026-06-3053ความฉลาด72การเขียนโค้ด
- klingKling: Kling 3.0 Turbo2026-06-1757ความฉลาด52การเขียนโค้ด57คณิตศาสตร์
- z-aiZ.ai: GLM 5.22026-06-1651ความฉลาด69การเขียนโค้ด60คณิตศาสตร์
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242ความฉลาด61การเขียนโค้ด61คณิตศาสตร์
Thinking Machines Lab ใช้เวลาสองสัปดาห์หลังจากการเปิดตัวโมเดล open-weights ตัวแรกในการสร้างโมเดลที่มีขนาดประมาณหนึ่งในสี่ และในระบบการให้คะแนนของแล็บเอง โมเดลที่เล็กกว่าชนะ Inkling-Small รายงาน 80.2% บน SWE-bench Verified เมื่อเทียบกับ Inkling ที่ได้ 77.6%, 89.5% บน GPQA Diamond เทียบกับ 87.2%, 64.7% บน Terminal-Bench 2.1 เทียบกับ 63.8% และ 31.6% บน Humanity's Last Exam เทียบกับ 29.7% — จากพารามิเตอร์รวม 276B โดยมี 12B ที่ทำงานอยู่ แทนที่จะเป็น 975B กับ 41B ในบรรดาตัวเลขหลักที่โมเดลการ์ดทั้งสองมีร่วมกัน เรือธง 975B มีชัยเพียงหนึ่งเดียว: AIME 2026 ด้วยคะแนนนำ 1.6 จุด
จากนั้น Artificial Analysis ก็ได้ทดสอบทั้งสองรุ่นอย่างอิสระ และให้คะแนน Inkling-Small อยู่ที่ 40 ในดัชนีความฉลาด (Intelligence Index) เทียบกับ Inkling ที่ได้ 41 — โมเดลขนาดเล็กกว่า 1 คะแนน ตามหลัง. ผลลัพธ์ทั้งสองเป็นข้อมูลจริง และช่องว่างระหว่างสองค่านี้คือสิ่งที่มีประโยชน์ที่สุดในการเปิดตัวครั้งนี้ เนื้อหาด้านล่างทั้งหมดจะแยกแยะระหว่างสิ่งที่ Thinking Machines รายงานเกี่ยวกับโมเดลของตัวเอง กับสิ่งที่ผู้อื่นวัดได้: ตัวเลขจากผู้ผลิตมาจากประกาศเปิดตัวและการ์ดโมเดลสองใบบน Hugging Face ตัวเลขจากหน่วยงานอิสระมาจากการทดสอบของ Artificial Analysis เอง และตัวเลขราคาและความยาวบริบทมาจากข้อมูล endpoint สดของ OpenRouter ซึ่งตรวจสอบในวันที่เขียนบทความนี้ จุดที่ทั้งสามแหล่งข้อมูลไม่ตรงกัน — และในเรื่องความยาวบริบทก็ไม่ตรงกัน — เราก็บอกอย่างนั้น แทนที่จะเลือกตัวเลขที่ดูดีกว่า
สิ่งที่จัดส่งจริงเมื่อวันที่ 30 กรกฎาคม
Inkling-Small เป็นทรานส์ฟอร์เมอร์แบบ sparse mixture-of-experts: มีพารามิเตอร์ทั้งหมด 276B ใช้จริง 12B ต่อโทเคน 42 เลเยอร์ โดยแต่ละโทเคนจะถูกจัดเส้นทางไปยังผู้เชี่ยวชาญ 6 จาก 256 คน บวกกับผู้เชี่ยวชาญร่วม 2 คนที่ทำงานกับทุกอย่าง การทำ Attention สลับระหว่างเลเยอร์แบบ local และ global น้ำหนักโมเดลอยู่บน Hugging Face ภายใต้ Apache 2.0 โดยไม่มีข้อจำกัดทางการค้า สามารถปรับแต่งบน Tinker API ของ Thinking Machines และพูดคุยกับมันได้ทั้งข้อความ รูปภาพ และเสียงใน Tinker Playground ห้องปฏิบัติการระบุว่ามันถูกฝึกบนระบบ NVIDIA GB300 NVL72

ความสามารถแบบมัลติโมดัลเป็นคุณสมบัติโดยธรรมชาติ ไม่ใช่การเสริมเข้ามาทีหลัง และการ์ดโมเดลก็ระบุวิธีการไว้อย่างละเอียดผิดปกติ ไม่มีตัวเข้ารหัสภาพหรือเสียงแยกต่างหาก: เสียงจะถูกแปลงเป็นสเปกโตรแกรม dMel ภาพจะถูกแบ่งเป็นแพตช์ขนาด 40×40 พิกเซลและป้อนผ่าน hMLP สี่ชั้น และทั้งสองอย่างจะถูกฝังตรงเข้าสู่สตรีมโทเคนเดียวกับข้อความ ข้อมูลนำเข้าคือข้อความ ภาพ และเสียง; เอาต์พุตเป็นข้อความเท่านั้น ซึ่งสมควรกล่าวไว้อย่างตรงไปตรงมา เพราะคำว่า "มัลติโมดัล" มักถูกตีความว่า "มันพูดได้" บ่อยพอที่จะทำให้เสียทั้งบ่ายได้ ระดับการใช้ความคิดเป็นแป้นหมุนห้าตำแหน่ง — minimal, low, medium, high, xhigh — ดังนั้นเวทชุดเดียวกันจึงสามารถรันแบบประหยัดหรือแบบเต็มกำลังก็ได้
ส่วนที่น่าสนใจของสูตรนี้คือการฝึกหลัง (post-training) โดย Inkling-Small ถูกกลั่นแบบ on-policy โดยใช้ Inkling ตัวเต็มเป็นครูผู้สอน จากนั้นจึงถูกฝึกด้วย reinforcement learning เพิ่มอีกประมาณสองสัปดาห์ โดยขยายสเกลขึ้นกับงานเขียนโค้ดแบบ agentic ลำดับขั้นตอนนี้เองที่อธิบายรูปแบบของผลลัพธ์: นักเรียนสืบทอดความสามารถทั่วไปจากครู แล้วจึงได้รับการฝึกพิเศษในแกนที่ตอนนี้มันเอาชนะครูได้
กระดานคะแนนที่ Thinking Machines เผยแพร่
เกณฑ์วัดประสิทธิภาพจากผู้ขายเป็นเพียงการตลาดจนกว่าจะมีใครสักคนทำซ้ำได้ ดังนั้นจงอ่านส่วนนี้ในฐานะสิ่งที่ห้องปฏิบัติการอ้าง ไม่ใช่สิ่งที่ได้รับการยืนยันแล้ว ถึงกระนั้นก็ยังเป็นชุดที่กว้าง และกว้างในทิศทางที่ทำให้รุ่นเรือธงดูไม่ดี

นอกเหนือจากตัวเลขที่ใช้ร่วมกันสี่ตัวแล้ว การ์ดยังเติมเต็มภาพส่วนที่เหลือ — ทั้งหมดเป็นการรันของ Thinking Machines เอง:
• งานเชิงเอเจนต์ — 1269 Elo บน GDPval-AA v2 ซึ่งเป็นเกณฑ์ชี้วัดงานเศรษฐศาสตร์ที่สมจริง มากกว่าปริศนา
• แผนภูมิและเอกสาร — 77.4% บน CharXiv RQ เพิ่มขึ้นเป็น 81.3% เมื่อโมเดลได้รับอนุญาตให้เขียนและรัน Python การเพิ่มขึ้น 3.9 จุดนั้นเป็นสิ่งบ่งชี้ที่มีประโยชน์ว่าการเข้าถึงเครื่องมือให้ประโยชน์กับงานด้านการใช้เหตุผลทางภาพมากกว่าการปรับแต่งพรอมพ์ต์
• Vision — 74.0% บน MMMU Pro สูงกว่า 73.5% ของ Inkling เล็กน้อย
• เสียง — 90.1% VoiceBench และ 77.0% MMAU, ทั้งสองเพียงแค่ต่ำกว่า ของรุ่นเรือธงที่ 91.4% และ 77.2% เสียงเป็นหนึ่งในสองจุดที่การลดขนาดแลกมาด้วยความสูญเสียอย่างชัดเจน
• ความปลอดภัย — 98.4% StrongREJECT และ 96.9% บน FORTRESS สำหรับพรอมต์ที่ไม่เป็นอันตราย แต่ 71.6% บน FORTRESS แบบ adversarial เทียบกับ 78.0% ของรุ่นเรือธง นั่นคือต้นทุนอีกประการ: การถดถอย 6.4 จุดในความทนทานเชิง adversarial ซึ่งสำคัญกว่าประโยชน์ด้านการเขียนโค้ดใดๆ หากโมเดลจะถูกนำไปให้บริการเบื้องหลังกล่องข้อความสาธารณะ
• การพยากรณ์ — Brier Index 61.3 ± 0.46 บน ForecastBench โดยไม่มีการเข้าถึงการค้นหา และ Brier score 0.1238 ± 0.0086 บน Prophet Arena การรายงาน error bars ด้วยซ้ำ ถือว่ามีวินัยมากกว่าโพสต์เปิดตัวส่วนใหญ่จะทำได้
ช่องว่างหนึ่ง: การ์ดของรุ่นเรือธงระบุ 54.3% ใน SWE-bench Pro ซึ่งเป็นเวอร์ชันที่ยากกว่าของ SWE-bench Verified การ์ดของ Inkling-Small ไม่ได้รายงานผล SWE-bench Pro เมื่อพิจารณาว่าตัวเลข Verified ถูกเน้นอย่างโดดเด่นเพียงใด การไม่มีตัวเลขนี้จึงเป็นตัวเลขที่เราอยากเห็นถูกเติมเต็มมากที่สุด
สิ่งที่ดัชนีอิสระกล่าวแทน
Artificial Analysis จัดอันดับให้ Inkling-Small อยู่ที่ 40 ในเวอร์ชัน 4.1 ของ Intelligence Index ซึ่งต่ำกว่า Inkling ที่ 41 อยู่ 1 คะแนน ดัชนีนี้เป็นองค์ประกอบจากการประเมิน 9 รายการ ได้แก่ GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience และ AA-LCR และรายการดังกล่าวก็อธิบายความขัดแย้งที่เห็นได้ชัดส่วนใหญ่ มีเพียง 2 ใน 9 รายการเท่านั้นที่ทับซ้อนกับการสาธิตการใช้เหตุผลบนการ์ดของ Thinking Machines ส่วนที่เหลือให้ความสำคัญกับการใช้เครื่องมือแบบเอเจนต์ การค้นคืนบริบทยาว และความต้านทานต่อการหลอน และโมเดลหนึ่งอาจชนะเกณฑ์มาตรฐานที่ห้องแล็บเลือกจะพิมพ์ออกมา แต่แพ้เกณฑ์ที่บุคคลที่สามเลือกจะรัน ทั้งสองฝ่ายไม่ได้โกหก พวกเขาวัดสิ่งที่แตกต่างกัน

นอกจากนี้ ยังมีรายละเอียดในข้อความพิมพ์เล็กที่มีความหมายมากกว่าพาดหัวข่าวหนึ่งจุด: Artificial Analysis ระบุรายการของรุ่นเรือธงเป็น Inkling (xhigh) — ซึ่งเป็นการตั้งค่าระดับความพยายามคิดสูงสุด — ในขณะที่แถว Inkling-Small ไม่มีคำต่อท้ายระดับความพยายาม ดังนั้น คะแนนนำหนึ่งจุดของรุ่นเรือธงจึงถูกบันทึกโดยที่ปุ่มปรับการใช้เหตุผลถูกหมุนจนสุด หากการจับคู่ระดับความพยายามทำให้การเปรียบเทียบนั้นเปลี่ยนไปแม้เพียงเล็กน้อย ข้อโต้แย้งสุดท้ายสำหรับโมเดลขนาดใหญ่ในด้านความสามารถเพียงอย่างเดียวก็จะหายไปด้วย
จุดที่ข้อมูลอิสระไม่ได้ใกล้เคียงกันเลยก็คือความเร็วและต้นทุน และตรงนี้มันเอื้อประโยชน์ให้โมเดลขนาดเล็กด้วยส่วนต่างที่ไม่มีตาราง benchmark ใดๆ สื่อออกมาได้:
• ความเร็วเอาต์พุต — 133 โทเคนต่อวินาที เทียบกับ 80 สำหรับ Inkling (xhigh). Artificial Analysis จัดอันดับ Inkling-Small อยู่ที่ #7 จาก 101 โมเดลในระดับเดียวกันในด้านความเร็ว เมื่อเทียบกับค่ามัธยฐานของระดับที่ 66.
• เวลาจนถึงโทเค็นแรก — 1.63 วินาที เทียบกับ 1.84 วินาที. ความได้เปรียบที่แท้จริงแต่เล็กน้อย.
• ราคาแบบผสมต่อ 1M โทเคน — $0.22 เทียบกับ $0.72 ตามการถ่วงน้ำหนักของพวกเขา ราคาประมาณหนึ่งในสาม โดยแลกกับคะแนนดัชนีที่น้อยลงหนึ่งจุด
• อันดับความฉลาด — #15 จาก 101 เทียบกับคะแนนมัธยฐานของชั้นเรียนที่ 25 สูงกว่าค่าเฉลี่ยอย่างชัดเจน แต่ก็ยังห่างไกลจากแนวหน้า
• ความเยิ่นเย้อ — และนี่คือข้อแม้ มันใช้โทเค็นเอาต์พุตไป 130 ล้านโทเค็นเพื่อผ่านดัชนี เทียบกับค่ามัธยฐานที่ 100 ล้าน สรุปของ Artificial Analysis เองเรียกมันว่า "เร็วอย่างเห็นได้ชัด แต่ค่อนข้างเยิ่นเย้อ" มันคิดมากกว่าปกติประมาณ 30% ซึ่งแอบกินส่วนลดต่อโทเค็นไปบางส่วน
หมายเหตุเล็กๆ ด้านการจดบันทึกตัวเลข เนื่องจากใครก็ตามที่เปรียบเทียบแหล่งข้อมูลจะพบจุดนี้: Artificial Analysis ระบุจำนวนพารามิเตอร์รวมไว้ที่ 266B ในขณะที่ประกาศ โมเดลการ์ดทั้งสองตัว และ OpenRouter ต่างระบุว่า 276B เราใช้ 276B ตลอดทั้งเอกสาร ซึ่งไม่ได้เปลี่ยนข้อสรุปใดๆ แต่มันเป็นความคลาดเคลื่อนแบบที่ควรรู้ไว้ก่อนที่คุณจะอ้างอิงตัวเลขในเอกสารการออกแบบ
สิ่งที่คุณสามารถเช่าได้จริงในวันนี้ ซึ่งไม่ตรงกับสิ่งที่ระบุในสเปกชีต
ช่องว่างระหว่างการประกาศโมเดลน้ำหนักเปิดกับ endpoint ที่ใช้งานได้คือจุดที่การรายงานข่าวการเปิดตัวส่วนใหญ่หยุดให้ความสนใจ Thinking Machines โฆษณากรอบบริบทสูงสุด 1M โทเคน และ Artificial Analysis ก็ระบุ 1M เช่นกัน บน OpenRouter ผู้ให้บริการทั้งสองรายที่ให้บริการ Inkling-Small อยู่ในปัจจุบันจำกัดไว้ที่ 524,288 โทเคน — ครึ่งหนึ่งของตัวเลขที่โฆษณาไว้ นี่ไม่ใช่ความขัดแย้ง แต่เป็นความแตกต่างระหว่างสิ่งที่สถาปัตยกรรมรองรับกับสิ่งที่ใครก็ตามได้นำมาใช้งานจริงในระบบผลิต สำหรับการเปรียบเทียบ Inkling รุ่นเรือธงมี endpoint หนึ่งตัวที่ครบ 1,048,576 โทเคน แม้ว่า endpoint เดียวกันนั้นจะจำกัดการสร้างข้อความต่อเนื่องไว้ที่ 32,768 โทเคน
ส่วนที่เหลือของภาพสด อ่านจากข้อมูลเอนด์พอยต์ของ OpenRouter:
• ผู้ให้บริการสองราย ราคาสองแบบ — หนึ่งรายคิด $0.45 ต่ออินพุต 1M และ $1.20 ต่อเอาต์พุต 1M อีกรายคิด $0.50 และ $1.20 Artificial Analysis ระบุอัตราบริการโดยตรงจาก Thinking Machines เองที่ต่ำกว่านั้นอีก คือ $0.30 และ $1.20 โดยอินพุตแบบแคชอยู่ที่ $0.06 การโฮสต์จากบุคคลที่สามเรียกเก็บพรีเมียม 50–67% สำหรับอินพุต สำหรับชุดน้ำหนักเดียวกัน
• การแคชพรอมต์ — 0.10 ดอลลาร์ต่อ 1M โทเคนอินพุตที่แคชผ่าน OpenRouter เทียบกับ 0.17 ดอลลาร์สำหรับรุ่นเรือธง
• ตัวเลขที่คุณเช่าใช้ไม่ใช่ตัวเลขที่ถูก benchmark ไว้ — การ์ดโมเดลระบุ BF16 และ NVFP4 เอ็นด์พอยต์ที่ถูกกว่านั้นให้บริการ fp8 ส่วนอีกตัวไม่ได้ประกาศ quantization เลย คะแนน benchmark จากผู้ขายไม่ได้วัดบนการให้บริการ fp8 ของน้ำหนักเหล่านี้ และผลของ quantization ต่อการรันแบบ agentic ที่ยาวนานคือสิ่งที่ส่วนต่าง 0.9 คะแนนใน Terminal-Bench ไม่สามารถอยู่รอดได้ หากคุณต้องการอ้างอิงตัวเลข โปรดระบุเอ็นด์พอยต์ที่คุณใช้
• ความครอบคลุมของฟีเจอร์ไม่เท่ากันในแต่ละผู้ให้บริการ — เอนด์พอยต์ทั้งสองเปิดเผย reasoning และ reasoning_effort ดังนั้น ตัวปรับระดับความคิดแบบห้าระดับจึงทำงานได้ แต่มีเพียงรายเดียวที่ประกาศรองรับ tool calling และ logprobs และปัจจุบันไม่มีรายใดประกาศรองรับ response_format ซึ่งเป็นพารามิเตอร์สำหรับเอาต์พุตแบบมีโครงสร้าง/โหมด JSON เรือธง Inkling มีเอนด์พอยต์ที่รองรับสิ่งนี้ หากไปป์ไลน์ของคุณต้องพึ่งพา JSON ที่บังคับตามสคีมา รายละเอียดนี้จะทำให้เกิดปัญหาตั้งแต่วันแรก และเป็นข้อจำกัดของผู้ให้บริการ ไม่ใช่ของโมเดล
• เพดานการสร้างข้อความ — 262,144 โทเคนบนเอนด์พอยต์ fp8 ส่วนอีกตัวหนึ่งระบุว่าไม่มีขีดจำกัด
กรณีต้นทุนตามจำนวนโทเคนที่วัดได้
การเปรียบเทียบโมเดลการให้เหตุผลด้วยราคาต่อล้านโทเคนนั้นไม่ดี เพราะตัวแปรหลักคือจำนวนโทเคนที่โมเดลใช้ไปกับการคิด Artificial Analysis เผยแพร่ค่าใช้จ่ายจริงซึ่งเป็นเครื่องมือที่ดีกว่ามาก: การใช้ Inkling-Small ผ่านดัชนี Intelligence Index ทั้งหมดใช้โทเคนเอาต์พุตประมาณ 130M และมีค่าใช้จ่าย $192.37ซึ่งคิดเป็นประมาณ $0.07 ต่องาน ตามค่าเฉลี่ยถ่วงน้ำหนักของพวกเขา
เปรียบเทียบกับค่าที่วัดได้แบบเดียวกันสำหรับโมเดลที่ผู้คนใช้งานจริง: DeepSeek V4 Flash ที่ $0.03 ต่องาน, gpt-oss-120b ที่ $0.08, Gemini 3.6 Flash ที่ $0.56, GLM-5.2 ที่ $0.57, Kimi K3 ที่ $0.86, GPT-5.6 Sol ที่ $1.23, Claude Opus 5 ที่ $2.34, Claude Fable 5 ที่ $3.15. Inkling-Small เป็นโมเดลที่ถูกเป็นอันดับสองในกลุ่มนั้น และมีราคาถูกกว่า GPT-5.6 Sol ต่อหนึ่งงานประมาณ 18 เท่า โดย GPT-5.6 Sol ได้คะแนน 59 ส่วน Inkling-Small ได้ 40.
ยังมีวิธีที่ชัดเจนกว่านั้นในการทำความเข้าใจว่าราคาลดลงตรงจุดใด พารามิเตอร์ที่ใช้งานอยู่ลดลงจาก 41B เป็น 12B คิดเป็น 3.4 เท่า ราคาเอาต์พุตลดลงจาก $4.05 เป็น $1.20 ต่อล้าน คิดเป็น 3.375 เท่า ราคาเช่าของ MoE แบบ sparse โดยพื้นฐานแล้วเป็นเพียงค่าใช้จ่ายในการคำนวณต่อโทเค็น และ Thinking Machines ก็คิดค่าบริการตามนั้น แทนที่จะตั้งราคาตามเกณฑ์มาตรฐาน (benchmark)
หมายเหตุเชิงปฏิบัติประการหนึ่งเกี่ยวกับการทดสอบเปรียบเทียบด้วยตัวเอง: ปัจจุบัน Inkling-Small ไม่อยู่ในแคตตาล็อกของ OrcaRouter ดังนั้นคุณจะต้องเช่าจากเอนด์พอยต์ของมันเอง โมเดลแบบปิดที่คุณจะนำมาเปรียบเทียบด้วย — GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash และรายชื่อที่เหลือ — อยู่บน OrcaRouter โดยใช้คีย์เดียวที่มาร์กอัป 0% ซึ่งหมายความว่าคุณจ่ายราคาลิสต์ของผู้ให้บริการแต่ละรายโดยไม่มีอะไรบวกเพิ่ม นั่นสำคัญสำหรับโมเดลต้นทุนโดยเฉพาะ: ตัวเลขที่คุณใส่ในสเปรดชีตคือตัวเลขที่ถูกเรียกเก็บ และเมื่อผู้ให้บริการลดราคา มันจะไปถึงฝั่งของเราในวันเดียวกันแทนที่จะต้องรอการเจรจาใหม่ การเฟลโอเวอร์อัตโนมัติข้ามผู้ให้บริการครอบคลุมอีกครึ่งหนึ่งของการประเมิน ซึ่งก็คือแขนพื้นฐานที่ล่มกลางรันและค่อยๆ ทำลายตัวเลขของคุณอย่างเงียบๆ
ที่จริงแล้วมันอยู่ในตำแหน่งใดในบรรดาโมเดลเปิดน้ำหนัก
เมื่ออ่านเทียบกับเรือธง Inkling-Small ดูเหมือนจะเป็นชัยชนะที่ยิ่งใหญ่ แต่เมื่ออ่านเทียบกับรุ่นอื่นๆ ในตลาด มันก็เป็นเพียงโมเดล open-weights ระดับกลางๆ ที่มั่นคง และการรายงานข่าวการเปิดตัวส่วนใหญ่มักจะมองข้ามการอ่านครั้งที่สองนี้
บนดัชนี Artificial Analysis Intelligence โมเดลที่อยู่เหนือกว่า Inklings ทั้งสองรุ่น ได้แก่ Claude Opus 5 ที่ 61 คะแนน, Claude Fable 5 ที่ 60, GPT-5.6 Sol ที่ 59, Kimi K3 ที่ 57, Grok 4.5 ที่ 54, GLM-5.2 และ Muse Spark 1.1 ที่ 51 และ Gemini 3.6 Flash ที่ 50 ซึ่งเป็นสิ่งที่คาดหวังได้ — เพราะสิ่งเหล่านั้นคือระบบแนวหน้า ส่วนใหญ่เป็นระบบปิด และหลายระบบมีขนาดมหาศาล
ตัวที่ควรเปลี่ยนการตัดสินใจจริงๆ คือ DeepSeek V4 Flash ซึ่งได้คะแนน 50 เทียบกับ 40 ของ Inkling-Small ที่ขนาดรวม 284B และใช้งานจริง 13B — ถือเป็นรุ่นขนาดเดียวกันและเป็นข้อเสนอโอเพนเวตที่คุ้มค่าเหมือนกัน โดยมีต้นทุนต่องานต่ำกว่าครึ่งหนึ่ง หากสิ่งที่คุณต้องการคือโมเดลโอเพนเวตที่ถูกที่สุดแต่ยังมีความสามารถ ตัวเลขจากแหล่งอิสระชี้ไปที่นั่น ไม่ใช่ที่นี่ อีกทั้งยังต่างจาก Inkling-Small ตรงที่ DeepSeek V4 Flash ใช้งานได้ผ่าน OrcaRouter การทดสอบทางเลือกดังกล่าวกับเวิร์กโหลดของคุณจึงเป็นเพียงการเปลี่ยนสตริงโมเดล ไม่ใช่กระบวนการจัดซื้อจัดจ้าง
สิ่งที่ Inkling-Small มี แต่ DeepSeek V4 Flash ไม่มี คือการรองรับเสียงและภาพแบบเนทีฟในน้ำหนักเดียวกัน ตัวปรับระดับความคิดห้าระดับ และการปรับแต่งละเอียด Tinker จากห้องแล็บที่ฝึกโมเดลนั้น สิ่งเหล่านี้เป็นความแตกต่างที่แท้จริงสำหรับเอเจนต์มัลติโมดัล และเป็นเหตุผลที่ซื่อตรงในการเลือกมัน — ไม่ใช่คะแนนดัชนี
ใครควรย้าย และใครควรอยู่กับที่
การตัดสินใจแบ่งแยกออกอย่างชัดเจน ซึ่งผิดปกติพอที่จะกล่าวถึงเช่นนั้น
• Move from Inkling to Inkling-Small if you are running coding agents. The vendor numbers favour the small model on SWE-bench Verified and Terminal-Bench, the extra agentic RL is the documented reason, and it costs about a third as much and returns tokens 1.66× faster. Paying 3.3× for one index point measured at maximum thinking effort is a hard case to make.
• เลือกใช้หากต้นทุนต่องานให้เหตุผลเป็นข้อจำกัดหลัก และคุณพอรับได้กับคะแนน 40 ในดัชนี ราคา $0.07 ต่องาน พร้อมอัตรา cache-hit ที่ $0.06 ต่อล้านบนเอนด์พอยต์ของผู้ให้บริการโดยตรง ถือเป็นการตั้งราคาเชิงรุกสำหรับโมเดลที่รองรับเสียงและภาพในตัว
• ย้ายไปหากคุณกำลังปรับแต่ง โมเดล 276B/12B มีต้นทุนต่ำกว่าอย่างมากเมื่อเทียบกับ 975B/41B ทั้งในการปรับแต่งและการให้บริการ และ Tinker รองรับทั้งสองแบบ
• หากคุณต้องการเสียงยาว ให้ใช้ Inkling ต่อไป นี่คือการถดถอยที่รุนแรงที่สุดในรุ่นนี้ และมันถูกซ่อนอยู่ในบัตรข้อมูลโมเดล: โมเดลเรือธงแนะนำอินพุตเสียงที่ยาวไม่เกิน 20 นาที ขณะที่บัตรข้อมูลของ Inkling-Small แนะนำ ไม่เกิน 2 นาที. ซึ่งลดลงถึงสิบเท่า หากคุณถอดเสียงหรือวิเคราะห์การประชุม โมเดลขนาดเล็กไม่สามารถใช้แทนได้โดยตรงไม่ว่าราคาเท่าใด
• เลือกใช้บริการนี้ต่อหากคุณต้องการบริบทเกิน 512K จากโฮสต์เอนด์พอยต์หรือคอมพลีชันที่ยาวกว่า 262K โทเคน วันนี้มีเพียงรุ่นเรือธงเท่านั้นที่มีเอนด์พอยต์ที่รองรับเต็มล้าน
• อยู่กับมัน หากคุณต้องการ JSON ที่บังคับตาม schema โดยไม่ต้องเขียนลูปตรวจสอบและลองใหม่เอง จนกว่าผู้ให้บริการจะปล่อย response_format สำหรับโมเดลขนาดเล็ก
• คงไว้ถ้าความทนทานต่อการโจมตีแบบ adversarial เป็นเสาหลัก 71.6% เทียบกับ 78.0% บน FORTRESS adversarial เป็นทิศทางที่ผิดสำหรับสิ่งใดก็ตามที่ผู้ใช้ต้องเผชิญ และยังเป็นตัวเลขของห้องแล็บเอง
สามคำถามค้างคาจากการรายงานข่าวการเปิดตัว
Inkling-Small เป็นแค่ Inkling ที่ถูกกลั่นหรือ?
ส่วนหนึ่งใช่ และส่วนที่ไม่ใช่นั่นแหละคือส่วนที่สำคัญ การกลั่นความรู้แบบ on-policy โดยมี Inkling เป็นครูเป็นเพียงขั้นตอนหนึ่งของการฝึกหลังการเทรน ดังนั้นความสามารถทั่วไปส่วนใหญ่จึงถูกสืบทอดมาจริง ๆ แต่โมเดลนี้ถูกออกแบบสถาปัตยกรรมแยกต่างหาก — มี 42 ชั้นเทียบกับ 66 ชั้นของโมเดลเรือธง โดยมีโทโพโลยีการจัดเส้นทางเดียวกันคือ expert ที่ทำงานอยู่ 6 ตัวจากทั้งหมด 256 ตัว บวกกับ shared อีก 2 ตัว ซึ่งหมายความว่า expert แต่ละตัวแคบลงแทนที่จะมีจำนวนน้อยลง และมันได้รับการฝึก RL สำหรับการเขียนโค้ดแบบ agentic ประมาณสองสัปดาห์ ซึ่งครูไม่เคยได้รับการฝึก ขั้นตอนสุดท้ายนี่แหละคือเหตุผลที่นักเรียนที่ถูกกลั่นทำคะแนนเหนือกว่าครูของมันในเกณฑ์วัดการเขียนโค้ด ซึ่งไม่ควรเกิดขึ้นตามปกติ
ฉันสามารถโฮสต์มันด้วยตัวเองได้จริงหรือ?
เฉพาะบนฮาร์ดแวร์ระดับจริงจังเท่านั้น พารามิเตอร์ 276B คิดเป็นน้ำหนักประมาณ 276GB ที่ 8 บิต และประมาณ 552GB ที่ BF16 ก่อนนับ KV cache — ไม่ว่าจะทางใดก็ต้องใช้โหนด multi-GPU ไม่ใช่เวิร์กสเตชัน ข้อดีของ sparse MoE คือต้นทุนการอนุมาน ไม่ใช่ขนาดหน่วยความจำ คุณเก็บทั้งหมด 276B แต่คำนวณด้วย 12B การ์ดระบุ SGLang, vLLM, TokenSpeed, Unsloth และ Hugging Face Transformers เป็นเส้นทางให้บริการที่รองรับ และระบุรูปแบบตัวเลข BF16 และ NVFP4 หมายเหตุเพิ่มเติมว่าเอนด์พอยต์ที่โฮสต์ทั้งสองในปัจจุบันให้บริการเวอร์ชันควอนไทซ์ ดังนั้น "โมเดลเดียวกัน" ที่โฮสต์เองด้วย BF16 จะไม่ทำงานเหมือนกับ API ที่คุณทดสอบ
975B Inkling ยังมีเหตุผลที่ต้องมีอยู่หรือไม่
สาม และทั้งหมดล้วนเป็นแบบแคบๆ: บริบทที่ให้บริการเต็ม 1M โทเคน อินพุตเสียงที่ยาวเกินสองนาที และพฤติกรรมความปลอดภัยเชิง adversarial ที่ดีขึ้น ที่น่าสนใจคือ "มันฉลาดกว่า" ไม่ได้อยู่ในรายการนั้นอย่างมั่นใจ — การได้คะแนนดัชนีหนึ่งจุดที่ระดับการใช้ความคิดสูงสุด เทียบกับชุดเกณฑ์มาตรฐานจากผู้จำหน่ายที่โมเดลเล็กกว่าชนะเป็นส่วนใหญ่ ไม่ใช่ข้อโต้แย้งด้านความสามารถ สองสัปดาห์หลังเปิดตัวเรือธง 975B Thinking Machines ก็ปล่อยโมเดลที่ทำให้ยากจะแนะนำ นั่นคือความตรงไปตรงมาที่ผิดปกติหรือความรวดเร็วที่ผิดปกติ และไม่ว่าจะแบบไหน มันก็เป็นสัญญาณที่ดีเกี่ยวกับแล็บแห่งนี้
สิ่งที่ควรดูต่อไป
สามสิ่งจะเป็นตัวตัดสินว่าการเปิดตัวครั้งนี้จะถูกมองในระยะยาวอย่างไร ไม่ว่าจะมี endpoint ที่ให้บริการ context 1M ตามที่โฆษณา ซึ่งจะลบข้อได้เปรียบที่ชัดเจนที่สุดที่เหลืออยู่ของรุ่นเรือธง ไม่ว่าจะมีใครเผยแพร่การเปรียบเทียบอิสระที่ใช้ความพยายามเท่าเทียมกันของทั้งสองโมเดล ซึ่งเป็นวิธีเดียวที่จะรู้ว่าคะแนนดัชนีจุดนั้นเป็นจริงหรือไม่ และว่าคำแนะนำเสียง 2 นาทีเป็นข้อจำกัดของการเทรนหรือค่าเริ่มต้นของระบบให้บริการ — เพราะถ้าเป็นอย่างหลัง เหตุผลสำคัญที่สุดเพียงหนึ่งเดียวที่จะอยู่กับโมเดลใหญ่จะหายไป จนกว่าจะถึงตอนนั้น บทสรุปที่ตรงไปตรงมาคือ Thinking Machines ปล่อยโมเดลที่ราคาเพียงหนึ่งในสาม เร็วขึ้นสองในสาม เก่งด้านโค้ดตามหลักฐานของตัวเอง ตามหลังเล็กน้อยในการให้คะแนนรวมจากหน่วยงานอิสระ และตามหลังอย่างชัดเจนเมื่อเทียบกับคู่แข่งขนาดเท่ากันซึ่งสื่อส่วนใหญ่ไม่ได้กล่าวถึง
