Inkling-Small-1
Guides & Insights

Inkling-Small: รุ่นขนาดหนึ่งในสี่ที่เอาชนะเรือธงของตัวเองได้ แต่ยังตามหลัง Index

ผู้เขียน

Jim Song

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Thinking Machines Lab ใช้เวลาสองสัปดาห์หลังจากการเปิดตัวโมเดล open-weights ตัวแรกในการสร้างโมเดลที่มีขนาดประมาณหนึ่งในสี่ และในระบบการให้คะแนนของแล็บเอง โมเดลที่เล็กกว่าชนะ Inkling-Small รายงาน 80.2% บน SWE-bench Verified เมื่อเทียบกับ Inkling ที่ได้ 77.6%, 89.5% บน GPQA Diamond เทียบกับ 87.2%, 64.7% บน Terminal-Bench 2.1 เทียบกับ 63.8% และ 31.6% บน Humanity's Last Exam เทียบกับ 29.7% — จากพารามิเตอร์รวม 276B โดยมี 12B ที่ทำงานอยู่ แทนที่จะเป็น 975B กับ 41B ในบรรดาตัวเลขหลักที่โมเดลการ์ดทั้งสองมีร่วมกัน เรือธง 975B มีชัยเพียงหนึ่งเดียว: AIME 2026 ด้วยคะแนนนำ 1.6 จุด

จากนั้น Artificial Analysis ก็ได้ทดสอบทั้งสองรุ่นอย่างอิสระ และให้คะแนน Inkling-Small อยู่ที่ 40 ในดัชนีความฉลาด (Intelligence Index) เทียบกับ Inkling ที่ได้ 41 — โมเดลขนาดเล็กกว่า 1 คะแนน ตามหลัง. ผลลัพธ์ทั้งสองเป็นข้อมูลจริง และช่องว่างระหว่างสองค่านี้คือสิ่งที่มีประโยชน์ที่สุดในการเปิดตัวครั้งนี้ เนื้อหาด้านล่างทั้งหมดจะแยกแยะระหว่างสิ่งที่ Thinking Machines รายงานเกี่ยวกับโมเดลของตัวเอง กับสิ่งที่ผู้อื่นวัดได้: ตัวเลขจากผู้ผลิตมาจากประกาศเปิดตัวและการ์ดโมเดลสองใบบน Hugging Face ตัวเลขจากหน่วยงานอิสระมาจากการทดสอบของ Artificial Analysis เอง และตัวเลขราคาและความยาวบริบทมาจากข้อมูล endpoint สดของ OpenRouter ซึ่งตรวจสอบในวันที่เขียนบทความนี้ จุดที่ทั้งสามแหล่งข้อมูลไม่ตรงกัน — และในเรื่องความยาวบริบทก็ไม่ตรงกัน — เราก็บอกอย่างนั้น แทนที่จะเลือกตัวเลขที่ดูดีกว่า

สิ่งที่จัดส่งจริงเมื่อวันที่ 30 กรกฎาคม

Inkling-Small เป็นทรานส์ฟอร์เมอร์แบบ sparse mixture-of-experts: มีพารามิเตอร์ทั้งหมด 276B ใช้จริง 12B ต่อโทเคน 42 เลเยอร์ โดยแต่ละโทเคนจะถูกจัดเส้นทางไปยังผู้เชี่ยวชาญ 6 จาก 256 คน บวกกับผู้เชี่ยวชาญร่วม 2 คนที่ทำงานกับทุกอย่าง การทำ Attention สลับระหว่างเลเยอร์แบบ local และ global น้ำหนักโมเดลอยู่บน Hugging Face ภายใต้ Apache 2.0 โดยไม่มีข้อจำกัดทางการค้า สามารถปรับแต่งบน Tinker API ของ Thinking Machines และพูดคุยกับมันได้ทั้งข้อความ รูปภาพ และเสียงใน Tinker Playground ห้องปฏิบัติการระบุว่ามันถูกฝึกบนระบบ NVIDIA GB300 NVL72

Inkling-Small-2

ความสามารถแบบมัลติโมดัลเป็นคุณสมบัติโดยธรรมชาติ ไม่ใช่การเสริมเข้ามาทีหลัง และการ์ดโมเดลก็ระบุวิธีการไว้อย่างละเอียดผิดปกติ ไม่มีตัวเข้ารหัสภาพหรือเสียงแยกต่างหาก: เสียงจะถูกแปลงเป็นสเปกโตรแกรม dMel ภาพจะถูกแบ่งเป็นแพตช์ขนาด 40×40 พิกเซลและป้อนผ่าน hMLP สี่ชั้น และทั้งสองอย่างจะถูกฝังตรงเข้าสู่สตรีมโทเคนเดียวกับข้อความ ข้อมูลนำเข้าคือข้อความ ภาพ และเสียง; เอาต์พุตเป็นข้อความเท่านั้น ซึ่งสมควรกล่าวไว้อย่างตรงไปตรงมา เพราะคำว่า "มัลติโมดัล" มักถูกตีความว่า "มันพูดได้" บ่อยพอที่จะทำให้เสียทั้งบ่ายได้ ระดับการใช้ความคิดเป็นแป้นหมุนห้าตำแหน่ง — minimal, low, medium, high, xhigh — ดังนั้นเวทชุดเดียวกันจึงสามารถรันแบบประหยัดหรือแบบเต็มกำลังก็ได้

ส่วนที่น่าสนใจของสูตรนี้คือการฝึกหลัง (post-training) โดย Inkling-Small ถูกกลั่นแบบ on-policy โดยใช้ Inkling ตัวเต็มเป็นครูผู้สอน จากนั้นจึงถูกฝึกด้วย reinforcement learning เพิ่มอีกประมาณสองสัปดาห์ โดยขยายสเกลขึ้นกับงานเขียนโค้ดแบบ agentic ลำดับขั้นตอนนี้เองที่อธิบายรูปแบบของผลลัพธ์: นักเรียนสืบทอดความสามารถทั่วไปจากครู แล้วจึงได้รับการฝึกพิเศษในแกนที่ตอนนี้มันเอาชนะครูได้

กระดานคะแนนที่ Thinking Machines เผยแพร่

เกณฑ์วัดประสิทธิภาพจากผู้ขายเป็นเพียงการตลาดจนกว่าจะมีใครสักคนทำซ้ำได้ ดังนั้นจงอ่านส่วนนี้ในฐานะสิ่งที่ห้องปฏิบัติการอ้าง ไม่ใช่สิ่งที่ได้รับการยืนยันแล้ว ถึงกระนั้นก็ยังเป็นชุดที่กว้าง และกว้างในทิศทางที่ทำให้รุ่นเรือธงดูไม่ดี

Inkling-Small-3

นอกเหนือจากตัวเลขที่ใช้ร่วมกันสี่ตัวแล้ว การ์ดยังเติมเต็มภาพส่วนที่เหลือ — ทั้งหมดเป็นการรันของ Thinking Machines เอง:

งานเชิงเอเจนต์ — 1269 Elo บน GDPval-AA v2 ซึ่งเป็นเกณฑ์ชี้วัดงานเศรษฐศาสตร์ที่สมจริง มากกว่าปริศนา

แผนภูมิและเอกสาร — 77.4% บน CharXiv RQ เพิ่มขึ้นเป็น 81.3% เมื่อโมเดลได้รับอนุญาตให้เขียนและรัน Python การเพิ่มขึ้น 3.9 จุดนั้นเป็นสิ่งบ่งชี้ที่มีประโยชน์ว่าการเข้าถึงเครื่องมือให้ประโยชน์กับงานด้านการใช้เหตุผลทางภาพมากกว่าการปรับแต่งพรอมพ์ต์

Vision — 74.0% บน MMMU Pro สูงกว่า 73.5% ของ Inkling เล็กน้อย

เสียง — 90.1% VoiceBench และ 77.0% MMAU, ทั้งสองเพียงแค่ต่ำกว่า ของรุ่นเรือธงที่ 91.4% และ 77.2% เสียงเป็นหนึ่งในสองจุดที่การลดขนาดแลกมาด้วยความสูญเสียอย่างชัดเจน

ความปลอดภัย — 98.4% StrongREJECT และ 96.9% บน FORTRESS สำหรับพรอมต์ที่ไม่เป็นอันตราย แต่ 71.6% บน FORTRESS แบบ adversarial เทียบกับ 78.0% ของรุ่นเรือธง นั่นคือต้นทุนอีกประการ: การถดถอย 6.4 จุดในความทนทานเชิง adversarial ซึ่งสำคัญกว่าประโยชน์ด้านการเขียนโค้ดใดๆ หากโมเดลจะถูกนำไปให้บริการเบื้องหลังกล่องข้อความสาธารณะ

การพยากรณ์ — Brier Index 61.3 ± 0.46 บน ForecastBench โดยไม่มีการเข้าถึงการค้นหา และ Brier score 0.1238 ± 0.0086 บน Prophet Arena การรายงาน error bars ด้วยซ้ำ ถือว่ามีวินัยมากกว่าโพสต์เปิดตัวส่วนใหญ่จะทำได้

ช่องว่างหนึ่ง: การ์ดของรุ่นเรือธงระบุ 54.3% ใน SWE-bench Pro ซึ่งเป็นเวอร์ชันที่ยากกว่าของ SWE-bench Verified การ์ดของ Inkling-Small ไม่ได้รายงานผล SWE-bench Pro เมื่อพิจารณาว่าตัวเลข Verified ถูกเน้นอย่างโดดเด่นเพียงใด การไม่มีตัวเลขนี้จึงเป็นตัวเลขที่เราอยากเห็นถูกเติมเต็มมากที่สุด

สิ่งที่ดัชนีอิสระกล่าวแทน

Artificial Analysis จัดอันดับให้ Inkling-Small อยู่ที่ 40 ในเวอร์ชัน 4.1 ของ Intelligence Index ซึ่งต่ำกว่า Inkling ที่ 41 อยู่ 1 คะแนน ดัชนีนี้เป็นองค์ประกอบจากการประเมิน 9 รายการ ได้แก่ GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience และ AA-LCR และรายการดังกล่าวก็อธิบายความขัดแย้งที่เห็นได้ชัดส่วนใหญ่ มีเพียง 2 ใน 9 รายการเท่านั้นที่ทับซ้อนกับการสาธิตการใช้เหตุผลบนการ์ดของ Thinking Machines ส่วนที่เหลือให้ความสำคัญกับการใช้เครื่องมือแบบเอเจนต์ การค้นคืนบริบทยาว และความต้านทานต่อการหลอน และโมเดลหนึ่งอาจชนะเกณฑ์มาตรฐานที่ห้องแล็บเลือกจะพิมพ์ออกมา แต่แพ้เกณฑ์ที่บุคคลที่สามเลือกจะรัน ทั้งสองฝ่ายไม่ได้โกหก พวกเขาวัดสิ่งที่แตกต่างกัน

Inkling-Small-4

นอกจากนี้ ยังมีรายละเอียดในข้อความพิมพ์เล็กที่มีความหมายมากกว่าพาดหัวข่าวหนึ่งจุด: Artificial Analysis ระบุรายการของรุ่นเรือธงเป็น Inkling (xhigh) — ซึ่งเป็นการตั้งค่าระดับความพยายามคิดสูงสุด — ในขณะที่แถว Inkling-Small ไม่มีคำต่อท้ายระดับความพยายาม ดังนั้น คะแนนนำหนึ่งจุดของรุ่นเรือธงจึงถูกบันทึกโดยที่ปุ่มปรับการใช้เหตุผลถูกหมุนจนสุด หากการจับคู่ระดับความพยายามทำให้การเปรียบเทียบนั้นเปลี่ยนไปแม้เพียงเล็กน้อย ข้อโต้แย้งสุดท้ายสำหรับโมเดลขนาดใหญ่ในด้านความสามารถเพียงอย่างเดียวก็จะหายไปด้วย

จุดที่ข้อมูลอิสระไม่ได้ใกล้เคียงกันเลยก็คือความเร็วและต้นทุน และตรงนี้มันเอื้อประโยชน์ให้โมเดลขนาดเล็กด้วยส่วนต่างที่ไม่มีตาราง benchmark ใดๆ สื่อออกมาได้:

ความเร็วเอาต์พุต — 133 โทเคนต่อวินาที เทียบกับ 80 สำหรับ Inkling (xhigh). Artificial Analysis จัดอันดับ Inkling-Small อยู่ที่ #7 จาก 101 โมเดลในระดับเดียวกันในด้านความเร็ว เมื่อเทียบกับค่ามัธยฐานของระดับที่ 66.

เวลาจนถึงโทเค็นแรก — 1.63 วินาที เทียบกับ 1.84 วินาที. ความได้เปรียบที่แท้จริงแต่เล็กน้อย.

ราคาแบบผสมต่อ 1M โทเคน — $0.22 เทียบกับ $0.72 ตามการถ่วงน้ำหนักของพวกเขา ราคาประมาณหนึ่งในสาม โดยแลกกับคะแนนดัชนีที่น้อยลงหนึ่งจุด

อันดับความฉลาด — #15 จาก 101 เทียบกับคะแนนมัธยฐานของชั้นเรียนที่ 25 สูงกว่าค่าเฉลี่ยอย่างชัดเจน แต่ก็ยังห่างไกลจากแนวหน้า

ความเยิ่นเย้อ — และนี่คือข้อแม้ มันใช้โทเค็นเอาต์พุตไป 130 ล้านโทเค็นเพื่อผ่านดัชนี เทียบกับค่ามัธยฐานที่ 100 ล้าน สรุปของ Artificial Analysis เองเรียกมันว่า "เร็วอย่างเห็นได้ชัด แต่ค่อนข้างเยิ่นเย้อ" มันคิดมากกว่าปกติประมาณ 30% ซึ่งแอบกินส่วนลดต่อโทเค็นไปบางส่วน

หมายเหตุเล็กๆ ด้านการจดบันทึกตัวเลข เนื่องจากใครก็ตามที่เปรียบเทียบแหล่งข้อมูลจะพบจุดนี้: Artificial Analysis ระบุจำนวนพารามิเตอร์รวมไว้ที่ 266B ในขณะที่ประกาศ โมเดลการ์ดทั้งสองตัว และ OpenRouter ต่างระบุว่า 276B เราใช้ 276B ตลอดทั้งเอกสาร ซึ่งไม่ได้เปลี่ยนข้อสรุปใดๆ แต่มันเป็นความคลาดเคลื่อนแบบที่ควรรู้ไว้ก่อนที่คุณจะอ้างอิงตัวเลขในเอกสารการออกแบบ

สิ่งที่คุณสามารถเช่าได้จริงในวันนี้ ซึ่งไม่ตรงกับสิ่งที่ระบุในสเปกชีต

ช่องว่างระหว่างการประกาศโมเดลน้ำหนักเปิดกับ endpoint ที่ใช้งานได้คือจุดที่การรายงานข่าวการเปิดตัวส่วนใหญ่หยุดให้ความสนใจ Thinking Machines โฆษณากรอบบริบทสูงสุด 1M โทเคน และ Artificial Analysis ก็ระบุ 1M เช่นกัน บน OpenRouter ผู้ให้บริการทั้งสองรายที่ให้บริการ Inkling-Small อยู่ในปัจจุบันจำกัดไว้ที่ 524,288 โทเคน — ครึ่งหนึ่งของตัวเลขที่โฆษณาไว้ นี่ไม่ใช่ความขัดแย้ง แต่เป็นความแตกต่างระหว่างสิ่งที่สถาปัตยกรรมรองรับกับสิ่งที่ใครก็ตามได้นำมาใช้งานจริงในระบบผลิต สำหรับการเปรียบเทียบ Inkling รุ่นเรือธงมี endpoint หนึ่งตัวที่ครบ 1,048,576 โทเคน แม้ว่า endpoint เดียวกันนั้นจะจำกัดการสร้างข้อความต่อเนื่องไว้ที่ 32,768 โทเคน

ส่วนที่เหลือของภาพสด อ่านจากข้อมูลเอนด์พอยต์ของ OpenRouter:

ผู้ให้บริการสองราย ราคาสองแบบ — หนึ่งรายคิด $0.45 ต่ออินพุต 1M และ $1.20 ต่อเอาต์พุต 1M อีกรายคิด $0.50 และ $1.20 Artificial Analysis ระบุอัตราบริการโดยตรงจาก Thinking Machines เองที่ต่ำกว่านั้นอีก คือ $0.30 และ $1.20 โดยอินพุตแบบแคชอยู่ที่ $0.06 การโฮสต์จากบุคคลที่สามเรียกเก็บพรีเมียม 50–67% สำหรับอินพุต สำหรับชุดน้ำหนักเดียวกัน

การแคชพรอมต์ — 0.10 ดอลลาร์ต่อ 1M โทเคนอินพุตที่แคชผ่าน OpenRouter เทียบกับ 0.17 ดอลลาร์สำหรับรุ่นเรือธง

ตัวเลขที่คุณเช่าใช้ไม่ใช่ตัวเลขที่ถูก benchmark ไว้ — การ์ดโมเดลระบุ BF16 และ NVFP4 เอ็นด์พอยต์ที่ถูกกว่านั้นให้บริการ fp8 ส่วนอีกตัวไม่ได้ประกาศ quantization เลย คะแนน benchmark จากผู้ขายไม่ได้วัดบนการให้บริการ fp8 ของน้ำหนักเหล่านี้ และผลของ quantization ต่อการรันแบบ agentic ที่ยาวนานคือสิ่งที่ส่วนต่าง 0.9 คะแนนใน Terminal-Bench ไม่สามารถอยู่รอดได้ หากคุณต้องการอ้างอิงตัวเลข โปรดระบุเอ็นด์พอยต์ที่คุณใช้

ความครอบคลุมของฟีเจอร์ไม่เท่ากันในแต่ละผู้ให้บริการ — เอนด์พอยต์ทั้งสองเปิดเผย reasoning และ reasoning_effort ดังนั้น ตัวปรับระดับความคิดแบบห้าระดับจึงทำงานได้ แต่มีเพียงรายเดียวที่ประกาศรองรับ tool calling และ logprobs และปัจจุบันไม่มีรายใดประกาศรองรับ response_format ซึ่งเป็นพารามิเตอร์สำหรับเอาต์พุตแบบมีโครงสร้าง/โหมด JSON เรือธง Inkling มีเอนด์พอยต์ที่รองรับสิ่งนี้ หากไปป์ไลน์ของคุณต้องพึ่งพา JSON ที่บังคับตามสคีมา รายละเอียดนี้จะทำให้เกิดปัญหาตั้งแต่วันแรก และเป็นข้อจำกัดของผู้ให้บริการ ไม่ใช่ของโมเดล

เพดานการสร้างข้อความ — 262,144 โทเคนบนเอนด์พอยต์ fp8 ส่วนอีกตัวหนึ่งระบุว่าไม่มีขีดจำกัด

กรณีต้นทุนตามจำนวนโทเคนที่วัดได้

การเปรียบเทียบโมเดลการให้เหตุผลด้วยราคาต่อล้านโทเคนนั้นไม่ดี เพราะตัวแปรหลักคือจำนวนโทเคนที่โมเดลใช้ไปกับการคิด Artificial Analysis เผยแพร่ค่าใช้จ่ายจริงซึ่งเป็นเครื่องมือที่ดีกว่ามาก: การใช้ Inkling-Small ผ่านดัชนี Intelligence Index ทั้งหมดใช้โทเคนเอาต์พุตประมาณ 130M และมีค่าใช้จ่าย $192.37ซึ่งคิดเป็นประมาณ $0.07 ต่องาน ตามค่าเฉลี่ยถ่วงน้ำหนักของพวกเขา

เปรียบเทียบกับค่าที่วัดได้แบบเดียวกันสำหรับโมเดลที่ผู้คนใช้งานจริง: DeepSeek V4 Flash ที่ $0.03 ต่องาน, gpt-oss-120b ที่ $0.08, Gemini 3.6 Flash ที่ $0.56, GLM-5.2 ที่ $0.57, Kimi K3 ที่ $0.86, GPT-5.6 Sol ที่ $1.23, Claude Opus 5 ที่ $2.34, Claude Fable 5 ที่ $3.15. Inkling-Small เป็นโมเดลที่ถูกเป็นอันดับสองในกลุ่มนั้น และมีราคาถูกกว่า GPT-5.6 Sol ต่อหนึ่งงานประมาณ 18 เท่า โดย GPT-5.6 Sol ได้คะแนน 59 ส่วน Inkling-Small ได้ 40.

ยังมีวิธีที่ชัดเจนกว่านั้นในการทำความเข้าใจว่าราคาลดลงตรงจุดใด พารามิเตอร์ที่ใช้งานอยู่ลดลงจาก 41B เป็น 12B คิดเป็น 3.4 เท่า ราคาเอาต์พุตลดลงจาก $4.05 เป็น $1.20 ต่อล้าน คิดเป็น 3.375 เท่า ราคาเช่าของ MoE แบบ sparse โดยพื้นฐานแล้วเป็นเพียงค่าใช้จ่ายในการคำนวณต่อโทเค็น และ Thinking Machines ก็คิดค่าบริการตามนั้น แทนที่จะตั้งราคาตามเกณฑ์มาตรฐาน (benchmark)

หมายเหตุเชิงปฏิบัติประการหนึ่งเกี่ยวกับการทดสอบเปรียบเทียบด้วยตัวเอง: ปัจจุบัน Inkling-Small ไม่อยู่ในแคตตาล็อกของ OrcaRouter ดังนั้นคุณจะต้องเช่าจากเอนด์พอยต์ของมันเอง โมเดลแบบปิดที่คุณจะนำมาเปรียบเทียบด้วย — GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash และรายชื่อที่เหลือ — อยู่บน OrcaRouter โดยใช้คีย์เดียวที่มาร์กอัป 0% ซึ่งหมายความว่าคุณจ่ายราคาลิสต์ของผู้ให้บริการแต่ละรายโดยไม่มีอะไรบวกเพิ่ม นั่นสำคัญสำหรับโมเดลต้นทุนโดยเฉพาะ: ตัวเลขที่คุณใส่ในสเปรดชีตคือตัวเลขที่ถูกเรียกเก็บ และเมื่อผู้ให้บริการลดราคา มันจะไปถึงฝั่งของเราในวันเดียวกันแทนที่จะต้องรอการเจรจาใหม่ การเฟลโอเวอร์อัตโนมัติข้ามผู้ให้บริการครอบคลุมอีกครึ่งหนึ่งของการประเมิน ซึ่งก็คือแขนพื้นฐานที่ล่มกลางรันและค่อยๆ ทำลายตัวเลขของคุณอย่างเงียบๆ

ที่จริงแล้วมันอยู่ในตำแหน่งใดในบรรดาโมเดลเปิดน้ำหนัก

เมื่ออ่านเทียบกับเรือธง Inkling-Small ดูเหมือนจะเป็นชัยชนะที่ยิ่งใหญ่ แต่เมื่ออ่านเทียบกับรุ่นอื่นๆ ในตลาด มันก็เป็นเพียงโมเดล open-weights ระดับกลางๆ ที่มั่นคง และการรายงานข่าวการเปิดตัวส่วนใหญ่มักจะมองข้ามการอ่านครั้งที่สองนี้

บนดัชนี Artificial Analysis Intelligence โมเดลที่อยู่เหนือกว่า Inklings ทั้งสองรุ่น ได้แก่ Claude Opus 5 ที่ 61 คะแนน, Claude Fable 5 ที่ 60, GPT-5.6 Sol ที่ 59, Kimi K3 ที่ 57, Grok 4.5 ที่ 54, GLM-5.2 และ Muse Spark 1.1 ที่ 51 และ Gemini 3.6 Flash ที่ 50 ซึ่งเป็นสิ่งที่คาดหวังได้ — เพราะสิ่งเหล่านั้นคือระบบแนวหน้า ส่วนใหญ่เป็นระบบปิด และหลายระบบมีขนาดมหาศาล

ตัวที่ควรเปลี่ยนการตัดสินใจจริงๆ คือ DeepSeek V4 Flash ซึ่งได้คะแนน 50 เทียบกับ 40 ของ Inkling-Small ที่ขนาดรวม 284B และใช้งานจริง 13B — ถือเป็นรุ่นขนาดเดียวกันและเป็นข้อเสนอโอเพนเวตที่คุ้มค่าเหมือนกัน โดยมีต้นทุนต่องานต่ำกว่าครึ่งหนึ่ง หากสิ่งที่คุณต้องการคือโมเดลโอเพนเวตที่ถูกที่สุดแต่ยังมีความสามารถ ตัวเลขจากแหล่งอิสระชี้ไปที่นั่น ไม่ใช่ที่นี่ อีกทั้งยังต่างจาก Inkling-Small ตรงที่ DeepSeek V4 Flash ใช้งานได้ผ่าน OrcaRouter การทดสอบทางเลือกดังกล่าวกับเวิร์กโหลดของคุณจึงเป็นเพียงการเปลี่ยนสตริงโมเดล ไม่ใช่กระบวนการจัดซื้อจัดจ้าง

สิ่งที่ Inkling-Small มี แต่ DeepSeek V4 Flash ไม่มี คือการรองรับเสียงและภาพแบบเนทีฟในน้ำหนักเดียวกัน ตัวปรับระดับความคิดห้าระดับ และการปรับแต่งละเอียด Tinker จากห้องแล็บที่ฝึกโมเดลนั้น สิ่งเหล่านี้เป็นความแตกต่างที่แท้จริงสำหรับเอเจนต์มัลติโมดัล และเป็นเหตุผลที่ซื่อตรงในการเลือกมัน — ไม่ใช่คะแนนดัชนี

ใครควรย้าย และใครควรอยู่กับที่

การตัดสินใจแบ่งแยกออกอย่างชัดเจน ซึ่งผิดปกติพอที่จะกล่าวถึงเช่นนั้น

Move from Inkling to Inkling-Small if you are running coding agents. The vendor numbers favour the small model on SWE-bench Verified and Terminal-Bench, the extra agentic RL is the documented reason, and it costs about a third as much and returns tokens 1.66× faster. Paying 3.3× for one index point measured at maximum thinking effort is a hard case to make.

เลือกใช้หากต้นทุนต่องานให้เหตุผลเป็นข้อจำกัดหลัก และคุณพอรับได้กับคะแนน 40 ในดัชนี ราคา $0.07 ต่องาน พร้อมอัตรา cache-hit ที่ $0.06 ต่อล้านบนเอนด์พอยต์ของผู้ให้บริการโดยตรง ถือเป็นการตั้งราคาเชิงรุกสำหรับโมเดลที่รองรับเสียงและภาพในตัว

ย้ายไปหากคุณกำลังปรับแต่ง โมเดล 276B/12B มีต้นทุนต่ำกว่าอย่างมากเมื่อเทียบกับ 975B/41B ทั้งในการปรับแต่งและการให้บริการ และ Tinker รองรับทั้งสองแบบ

หากคุณต้องการเสียงยาว ให้ใช้ Inkling ต่อไป นี่คือการถดถอยที่รุนแรงที่สุดในรุ่นนี้ และมันถูกซ่อนอยู่ในบัตรข้อมูลโมเดล: โมเดลเรือธงแนะนำอินพุตเสียงที่ยาวไม่เกิน 20 นาที ขณะที่บัตรข้อมูลของ Inkling-Small แนะนำ ไม่เกิน 2 นาที. ซึ่งลดลงถึงสิบเท่า หากคุณถอดเสียงหรือวิเคราะห์การประชุม โมเดลขนาดเล็กไม่สามารถใช้แทนได้โดยตรงไม่ว่าราคาเท่าใด

เลือกใช้บริการนี้ต่อหากคุณต้องการบริบทเกิน 512K จากโฮสต์เอนด์พอยต์หรือคอมพลีชันที่ยาวกว่า 262K โทเคน วันนี้มีเพียงรุ่นเรือธงเท่านั้นที่มีเอนด์พอยต์ที่รองรับเต็มล้าน

อยู่กับมัน หากคุณต้องการ JSON ที่บังคับตาม schema โดยไม่ต้องเขียนลูปตรวจสอบและลองใหม่เอง จนกว่าผู้ให้บริการจะปล่อย response_format สำหรับโมเดลขนาดเล็ก

คงไว้ถ้าความทนทานต่อการโจมตีแบบ adversarial เป็นเสาหลัก 71.6% เทียบกับ 78.0% บน FORTRESS adversarial เป็นทิศทางที่ผิดสำหรับสิ่งใดก็ตามที่ผู้ใช้ต้องเผชิญ และยังเป็นตัวเลขของห้องแล็บเอง

สามคำถามค้างคาจากการรายงานข่าวการเปิดตัว

Inkling-Small เป็นแค่ Inkling ที่ถูกกลั่นหรือ?

ส่วนหนึ่งใช่ และส่วนที่ไม่ใช่นั่นแหละคือส่วนที่สำคัญ การกลั่นความรู้แบบ on-policy โดยมี Inkling เป็นครูเป็นเพียงขั้นตอนหนึ่งของการฝึกหลังการเทรน ดังนั้นความสามารถทั่วไปส่วนใหญ่จึงถูกสืบทอดมาจริง ๆ แต่โมเดลนี้ถูกออกแบบสถาปัตยกรรมแยกต่างหาก — มี 42 ชั้นเทียบกับ 66 ชั้นของโมเดลเรือธง โดยมีโทโพโลยีการจัดเส้นทางเดียวกันคือ expert ที่ทำงานอยู่ 6 ตัวจากทั้งหมด 256 ตัว บวกกับ shared อีก 2 ตัว ซึ่งหมายความว่า expert แต่ละตัวแคบลงแทนที่จะมีจำนวนน้อยลง และมันได้รับการฝึก RL สำหรับการเขียนโค้ดแบบ agentic ประมาณสองสัปดาห์ ซึ่งครูไม่เคยได้รับการฝึก ขั้นตอนสุดท้ายนี่แหละคือเหตุผลที่นักเรียนที่ถูกกลั่นทำคะแนนเหนือกว่าครูของมันในเกณฑ์วัดการเขียนโค้ด ซึ่งไม่ควรเกิดขึ้นตามปกติ

ฉันสามารถโฮสต์มันด้วยตัวเองได้จริงหรือ?

เฉพาะบนฮาร์ดแวร์ระดับจริงจังเท่านั้น พารามิเตอร์ 276B คิดเป็นน้ำหนักประมาณ 276GB ที่ 8 บิต และประมาณ 552GB ที่ BF16 ก่อนนับ KV cache — ไม่ว่าจะทางใดก็ต้องใช้โหนด multi-GPU ไม่ใช่เวิร์กสเตชัน ข้อดีของ sparse MoE คือต้นทุนการอนุมาน ไม่ใช่ขนาดหน่วยความจำ คุณเก็บทั้งหมด 276B แต่คำนวณด้วย 12B การ์ดระบุ SGLang, vLLM, TokenSpeed, Unsloth และ Hugging Face Transformers เป็นเส้นทางให้บริการที่รองรับ และระบุรูปแบบตัวเลข BF16 และ NVFP4 หมายเหตุเพิ่มเติมว่าเอนด์พอยต์ที่โฮสต์ทั้งสองในปัจจุบันให้บริการเวอร์ชันควอนไทซ์ ดังนั้น "โมเดลเดียวกัน" ที่โฮสต์เองด้วย BF16 จะไม่ทำงานเหมือนกับ API ที่คุณทดสอบ

975B Inkling ยังมีเหตุผลที่ต้องมีอยู่หรือไม่

สาม และทั้งหมดล้วนเป็นแบบแคบๆ: บริบทที่ให้บริการเต็ม 1M โทเคน อินพุตเสียงที่ยาวเกินสองนาที และพฤติกรรมความปลอดภัยเชิง adversarial ที่ดีขึ้น ที่น่าสนใจคือ "มันฉลาดกว่า" ไม่ได้อยู่ในรายการนั้นอย่างมั่นใจ — การได้คะแนนดัชนีหนึ่งจุดที่ระดับการใช้ความคิดสูงสุด เทียบกับชุดเกณฑ์มาตรฐานจากผู้จำหน่ายที่โมเดลเล็กกว่าชนะเป็นส่วนใหญ่ ไม่ใช่ข้อโต้แย้งด้านความสามารถ สองสัปดาห์หลังเปิดตัวเรือธง 975B Thinking Machines ก็ปล่อยโมเดลที่ทำให้ยากจะแนะนำ นั่นคือความตรงไปตรงมาที่ผิดปกติหรือความรวดเร็วที่ผิดปกติ และไม่ว่าจะแบบไหน มันก็เป็นสัญญาณที่ดีเกี่ยวกับแล็บแห่งนี้

สิ่งที่ควรดูต่อไป

สามสิ่งจะเป็นตัวตัดสินว่าการเปิดตัวครั้งนี้จะถูกมองในระยะยาวอย่างไร ไม่ว่าจะมี endpoint ที่ให้บริการ context 1M ตามที่โฆษณา ซึ่งจะลบข้อได้เปรียบที่ชัดเจนที่สุดที่เหลืออยู่ของรุ่นเรือธง ไม่ว่าจะมีใครเผยแพร่การเปรียบเทียบอิสระที่ใช้ความพยายามเท่าเทียมกันของทั้งสองโมเดล ซึ่งเป็นวิธีเดียวที่จะรู้ว่าคะแนนดัชนีจุดนั้นเป็นจริงหรือไม่ และว่าคำแนะนำเสียง 2 นาทีเป็นข้อจำกัดของการเทรนหรือค่าเริ่มต้นของระบบให้บริการ — เพราะถ้าเป็นอย่างหลัง เหตุผลสำคัญที่สุดเพียงหนึ่งเดียวที่จะอยู่กับโมเดลใหญ่จะหายไป จนกว่าจะถึงตอนนั้น บทสรุปที่ตรงไปตรงมาคือ Thinking Machines ปล่อยโมเดลที่ราคาเพียงหนึ่งในสาม เร็วขึ้นสองในสาม เก่งด้านโค้ดตามหลักฐานของตัวเอง ตามหลังเล็กน้อยในการให้คะแนนรวมจากหน่วยงานอิสระ และตามหลังอย่างชัดเจนเมื่อเทียบกับคู่แข่งขนาดเท่ากันซึ่งสื่อส่วนใหญ่ไม่ได้กล่าวถึง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube