
บทวิจารณ์โมเดล Inkling AI: โมเดล Open-Weights ตัวแรกของ Thinking Machines ที่ผ่านการทดสอบและอธิบายแล้ว
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekใหม่DeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 2030 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232ความฉลาด42การเขียนโค้ด
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226ความฉลาด39การเขียนโค้ด
- anthropicAnthropic: Claude Sonnet 52026-06-3055ความฉลาด72การเขียนโค้ด
- klingKling: Kling 3.0 Turbo2026-06-1757ความฉลาด52การเขียนโค้ด57คณิตศาสตร์
- z-aiZ.ai: GLM 5.22026-06-1653ความฉลาด69การเขียนโค้ด60คณิตศาสตร์
นี้ รีวิวโมเดล Inkling AIพิจารณาอย่างละเอียดเกี่ยวกับการเปิดตัวครั้งแรกของ Thinking Machines Lab, สตาร์ทอัพที่นำโดยอดีต CTO ของ OpenAI Mira Murati. Inkling เป็นโมเดล Mixture-of-Experts (MoE) แบบ multimodal ที่มี open-weights พร้อมหน้าต่างบริบท 1 ล้านโทเคน และแป้นปรับระดับ “thinking effort” ที่ควบคุมได้. มันรวดเร็ว ราคาถูกในการโฮสต์ด้วยตนเอง และถูกสร้างขึ้นเพื่อการปรับแต่งมากกว่าการครองอันดับบน Leaderboard. ด้านล่างนี้ เราแยกเกณฑ์มาตรฐานที่ผู้ขายรายงานเองออกจากการวัดผลที่เป็นอิสระ อธิบายสถาปัตยกรรม แสดงวิธีเรียกใช้ และอธิบายว่าใครควร (และไม่ควร) นำไปใช้
ณ วันที่: 2026-07-16 — หนึ่งวันหลังจากเปิดตัว นี่คือรีวิวที่ขับเคลื่อนด้วยงานวิจัย ยังไม่มีการทดสอบระยะยาวภาคปฏิบัติสำหรับรุ่นใหม่ขนาดนี้ และเราจะแจ้งเตือนทุกตัวเลขที่ไม่ได้รับการยืนยันด้านล่าง
หมายเหตุถึงนักพัฒนา: หากคุณต้องการลองใช้ Inkling ควบคู่ไปกับโมเดลอื่นๆ, OrcaRouter ทำหน้าที่เป็นส่วนหน้าสำหรับโมเดลที่เข้าถึงได้ผ่าน API โดยมีจุดสิ้นสุดที่เข้ากันได้กับ OpenAI เพียงจุดเดียว, ดังนั้นคุณสามารถเปรียบเทียบและสลับได้โดยไม่ต้องมีการผสานรวมใหม่.
- สรุป TL;DR: Inkling เป็นโมเดลเปิดที่มีความสามารถและประสิทธิภาพอย่างแท้จริง ซึ่งโดดเด่นในการปรับแต่งและการนำไปใช้ที่คำนึงถึงต้นทุน แต่มันไม่ใช่ผู้นำระดับแนวหน้า และผู้สร้างกล่าวอย่างเปิดเผยเช่นนั้น หากคุณต้องการฐานที่ปรับแต่งได้ ปลอดค่าลิขสิทธิ์ พร้อมหน้าต่างบริบทขนาดใหญ่ มันคือหนึ่งในการเปิดตัวที่น่าสนใจที่สุดของปี 2026 หากคุณต้องการโมเดลที่แข็งแกร่งที่สุดเพียงตัวเดียวที่มีอยู่ ให้มองหาที่อื่น
- มันคืออะไร: โมเดลการให้เหตุผลแบบ MoE แบบโอเพนเวท (Apache 2.0) เหมาะสำหรับใคร: ผู้ปฏิบัติที่ต้องการปรับแต่งและโฮสต์ด้วยตนเอง แทนที่จะจ่ายเงินสำหรับ API แนวหน้าปิด.
ประเด็นสำคัญ
ผู้ผลิตและวันที่: Thinking Machines Lab; เปิดตัวเมื่อวันที่ 15 กรกฎาคม 2026 ซึ่งเป็นโมเดลแรกของห้องปฏิบัติการ
สถาปัตยกรรม: Sparse MoE, พารามิเตอร์ทั้งหมด 975B / พารามิเตอร์ที่ใช้งาน 41B, 66 เลเยอร์, บริบทสูงสุด 1M โทเค็นในน้ำหนัก (256K ผ่าน API ที่โฮสต์)
ใบอนุญาต: Apache 2.0 — น้ำหนักเต็มบน Hugging Face ฟรีสำหรับการใช้งานเชิงพาณิชย์และการโฮสต์เอง
การวางตำแหน่งอย่างซื่อสัตย์: บริษัทระบุอย่างชัดเจนว่ามัน “ไม่ใช่โมเดลที่แข็งแกร่งที่สุดที่มีอยู่ในปัจจุบัน ไม่ว่าจะเป็นแบบปิดหรือเปิด”
คะแนนอิสระ: 41/100 ในดัชนี Artificial Analysis Intelligence — อันดับที่ 10 จาก 97 รุ่น และนำหน้าเพื่อนร่วมกลุ่มโอเพนซอร์สหลายรุ่น (ดู reconciliation ด้านล่าง)
ค่าใช้จ่าย: น้ำหนักปลอดค่าลิขสิทธิ์สำหรับโฮสต์เอง; การเข้าถึงผ่านโฮสต์เริ่มต้นที่ประมาณ $1.87 / 1M input tokens.
ข้อควรระวัง: เกณฑ์มาตรฐานสำคัญเกือบทั้งหมดถูกรายงานโดยผู้ขายเองและไม่ได้รับการตรวจสอบโดยอิสระ
ใครอยู่เบื้องหลัง Inkling
- Founder box.Inkling เป็นโมเดลแรกจาก Thinking Machines Lab (thinkingmachines.ai) ก่อตั้งโดย Mira Murati, อดีตประธานเจ้าหน้าที่ฝ่ายเทคโนโลยี (CTO) ของ OpenAI ห้องปฏิบัติการดำเนินการอย่างเงียบๆ ก่อนการเปิดตัวครั้งนี้ และได้ใช้ท่าทีแบบเปิดเผยน้ำหนัก (open-weights) ซึ่งตรงข้ามกับแนวทางรุ่นธงแบบปิดของนายจ้างคนก่อนของมูราติ Thinking Machines ไม่ สร้างรายได้จากโมเดลเอง — รายได้ไหลผ่าน Tinker แพลตฟอร์มปรับแต่ง (fine-tuning) และพาร์ทเนอร์โฮสติ้งบุคคลที่สาม โมเดลธุรกิจนั้นเป็นศูนย์กลางในการทำความเข้าใจ Inkling: น้ำหนัก (weights) เป็นทางเข้าฟรี และบริษัทจะได้เงินเมื่อคุณปรับแต่งหรือขยายขนาด
Inkling คืออะไร?
Inkling เป็นโมเดลภาษาและการให้เหตุผลขนาดใหญ่แบบโอเพนเวท มัลติโมดัล และผสมผสานผู้เชี่ยวชาญ ประกาศโดย Thinking Machines Lab เมื่อวันที่ 15 กรกฎาคม 2026 และเผยแพร่ภายใต้แบบอนุญาตเสรี Apache 2.0 ใบอนุญาตพร้อมน้ำหนักทั้งหมดบน Hugging Face.
สิ่งที่ทำให้การเปิดตัวครั้งนี้น่าสนใจคือวิธีการนำเสนอ แทนที่จะอ้างว่าเป็นผู้บุกเบิก Thinking Machines อธิบายว่า Inkling เป็นโมเดลแบบเปิดที่ยืดหยุ่น มีประสิทธิภาพ และปรับแต่งได้ ในการยอมรับที่ตรงไปตรงมาอย่างผิดปกติสำหรับวันเปิดตัว บริษัทระบุว่า Inkling “ไม่ใช่โมเดลที่แข็งแกร่งที่สุดที่มีอยู่ในปัจจุบัน ไม่ว่าจะเป็นแบบปิดหรือแบบเปิด” ความซื่อตรงนั้นเป็นตัวกำหนดโทนของรีวิวทั้งหมดนี้: Inkling เป็นเครื่องมือที่ออกแบบมาเพื่อปรับเปลี่ยน โฮสต์ด้วยตนเอง และปรับแต่งอย่างละเอียด ไม่ใช่ถ้วยรางวัลสำหรับเปรียบเทียบ
รายงานจาก Fortune และ TechCrunch สะท้อนการตีความนี้ TechCrunch ชี้ว่า Inkling ไม่ได้คุกคาม OpenAI, Anthropic หรือ Google ในระดับแนวหน้า แต่กลับกดดันผู้ให้บริการโฮสติ้งและแพลตฟอร์มปรับแต่งโมเดลโอเพนเวทในระดับกลางแทน Forbes มองว่ากลยุทธ์โอเพนเวทของ Murati ใกล้เคียงกับแนวทางโอเพนโมเดลของจีน (DeepSeek, Qwen, Kimi) มากกว่าเรือธงของสหรัฐฯ แบบปิด — ซึ่งเป็นวาทกรรมโอเพนเวทสหรัฐฯ เทียบจีนที่แผ่ซ่านไปทั่วคำวิจารณ์ในการเปิดตัวครั้งนี้
สถาปัตยกรรมและสเปก
เมื่อมองใต้ฝากระโปรง Inkling คือ sparse Mixture-of-Experts transformer มีเพียงสัดส่วนเล็กน้อยของพารามิเตอร์ที่ทำงานต่อโทเคน ซึ่งเป็นสิ่งที่ทำให้การอนุมานยังคงมีประสิทธิภาพแม้ว่าจำนวนพารามิเตอร์ทั้งหมดจะมีจำนวนมาก รายละเอียดถูกบันทึกไว้ใน official model card และ Hugging Face blog
พารามิเตอร์ทั้งหมด:975B
พารามิเตอร์ที่ทำงานอยู่: 41B (sparse MoE)
เลเยอร์: transformer เฉพาะตัวถอดรหัส 66 ชั้น
ผู้เชี่ยวชาญ:256 ตัวที่ถูกเลือก + 2 ตัวที่ใช้ร่วมกัน; 6 ใน 256 ตัวที่ถูกเลือกต่อโทเค็น (2 ตัวที่ใช้ร่วมกันทำงานตลอดเวลา)
การกำหนดเส้นทาง: Sigmoid / aux-loss-free
โปรดทราบ: ไฮบริด, 5:1 หน้าต่างเลื่อน (ท้องถิ่น) สู่ส่วนกลาง; 8 หัว KV
การเข้ารหัสตำแหน่ง: ที่เรียนรู้ การฝังตำแหน่งสัมพัทธ์ (ไม่ใช่ RoPE)
มัลติโมดาลิตี้: ไม่ใช้ตัวเข้ารหัส — เสียงเป็นสเปกโตรแกรม dMel, ภาพเป็นแพตช์ 40×40, ป้อนโดยตรง
ส่วนเสริม: การประสานแบบสั้น (SConv); เลเยอร์ MTP สำหรับการถอดรหัสแบบคาดเดา
ตัวเลข: BF16, MXFP8, NVFP4 (จุดตรวจสอบ NVFP4 สำหรับ NVIDIA Blackwell)
หน้าต่างบริบท: สูงถึง 1,000,000 โทเค็นในน้ำหนัก (256K บน API ที่โฮสต์)
รุ่นที่เล็กกว่า: Inkling-Small, รวม 276B / ใช้งาน 12B (ตัวอย่าง, ยังไม่ได้ปล่อยน้ำหนัก)

ตัวเลือกการออกแบบสองสามอย่างทำให้ Inkling แตกต่างจาก MoE ทั่วไป:
เค้าโครงผู้เชี่ยวชาญ. ด้วยผู้เชี่ยวชาญที่ถูกกำหนดเส้นทาง 256 ราย บวกกับผู้เชี่ยวชาญที่ใช้ร่วมกัน 2 ราย และผู้เชี่ยวชาญที่ถูกกำหนดเส้นทาง 6 รายที่ทำงานต่อโทเคน คู่ที่ใช้ร่วมกันจะทำหน้าที่เป็น “expert sink” ที่เปิดตลอดเวลา ซึ่งรวบรวมการคำนวณทั่วไป ในขณะที่ผู้เชี่ยวชาญที่ถูกกำหนดเส้นทางจะมีความเชี่ยวชาญเฉพาะด้าน การกำหนดเส้นทางแบบ sigmoid ที่ปลอด Aux-loss หลีกเลี่ยงเทอมการลงโทษการปรับสมดุลโหลดที่ใช้ในดีไซน์ MoE หลายแบบ
การฝังตำแหน่งสัมพัทธ์ ไม่ใช่ RoPE.โมเดลบริบทแบบยาวสมัยใหม่ส่วนใหญ่อาศัยการฝังแบบหมุน (Rotary Embeddings) แต่อิงคลิง (Inkling) กลับใช้การฝังตำแหน่งสัมพัทธ์ที่เรียนรู้ได้ ซึ่งเป็นทางเลือกที่ผิดปกติสำหรับขนาดนี้
มัลติโมดัลแบบไร้เอนโค้ดเดอร์. แทนที่จะต่อพ่วงเอนโค้ดเดอร์ภาพและเสียงแยกต่างหาก Inkling รับแพตช์ภาพขนาด 40×40 และสเปกโตรแกรมเสียง dMel เข้าสู่สแต็ก Transformer โดยตรง วิธีนี้ทำให้ไปป์ไลน์ง่ายขึ้น และเป็นส่วนหนึ่งที่ทำให้โมเดลนี้ถูกอธิบายว่าเป็นมัลติโมดัลโดยธรรมชาติ.
MTP สำหรับการถอดรหัสแบบคาดเดา เลเยอร์การทำนายหลายโทเค็น (MTP) ทำหน้าที่เป็นตัวร่างในตัว ช่วยเร่งการสร้างโดยไม่ต้องมีโมเดลร่างแยกต่างหาก
หมายเหตุบรรณาธิการ — เพิ่มภาพ: แผนภาพบล็อกที่มีป้ายกำกับของเลเยอร์ Inkling หนึ่งชั้น — ความสนใจแบบหน้าต่างเลื่อนเทียบกับความสนใจทั่วโลก (5:1), เราเตอร์ผู้เชี่ยวชาญ 256+2 โดยมีผู้เชี่ยวชาญที่ทำงานอยู่ 6 คนถูกเน้น, SConv, และส่วนหัวของ MTP drafter
การฝึกอบรมและตัวปรับ "ความพยายามในการคิด"
Inkling ถูก pretrained บน 45 ล้านล้านโทเค็นมัลติโมดัล ที่ครอบคลุมข้อความ ภาพ เสียง และวิดีโอ โดยใช้ตัวเพิ่มประสิทธิภาพแบบไฮบริด (Muon สำหรับน้ำหนักเมทริกซ์ขนาดใหญ่, Adam สำหรับส่วนที่เหลือ) บนระบบ NVIDIA GB300 NVL72. Post-training ใช้การเรียนรู้เสริมแรงแบบอะซิงโครนัสขนาดใหญ่ที่ปรับขนาดเกินกว่า 30M+ rollouts ในสองรันต่อเนื่องยาวนาน โดยเริ่มต้นจากการปรับแต่งแบบมีผู้สอนเบื้องต้นบนข้อมูลสังเคราะห์.
คุณลักษณะเด่นคือพารามิเตอร์การใช้เหตุผลที่ปรับได้ แสดงให้เห็นว่าสามารถปรับได้จากประมาณ 0.2 ถึง 0.99 โดยค่าที่สูงขึ้นหมายถึงการใช้เหตุผลมากขึ้นและต้นทุนที่มากขึ้น สิ่งนี้ช่วยให้ผู้ปฏิบัติงานสามารถแลกเปลี่ยนระหว่างความหน่วงเวลาและค่าใช้จ่ายกับความลึกของความคิด รูปแบบการวัดประสิทธิภาพทั้งหมดด้านล่างนี้รันที่ Effort = 0.99
ความพยายามคิดที่ควบคุมได้: คู่มือปฏิบัติการ
ในการปรับใช้ การควบคุม effort ถูกเปิดเผยเป็น enum ที่ชื่อ reasoning_effort ซึ่งมีระดับ none / minimal / low / medium / high / xhigh / max. ไม่มีการตั้งค่า “ถูกต้อง” เพียงอย่างเดียว — มันคือคันโยกที่ปรับเปลี่ยนได้สำหรับการแลกเปลี่ยนระหว่างเวลาแฝง ต้นทุน และคุณภาพ ใช้ตารางด้านล่างเป็นแผนที่เริ่มต้น (คำแนะนำเชิงสัมพันธ์; คุณภาพระดับเกณฑ์มาตรฐานวัดได้ที่ด้านบนของช่วง):
ไม่มี / น้อยที่สุด. ความหน่วงสัมพัทธ์และค่าโทเคน: ต่ำที่สุด; เหมาะสำหรับ: การจำแนก, การสกัด, การจัดรูปแบบ, การกำหนดเส้นทาง, ตัวเชื่อมการดึงข้อมูล
ต่ำ. ความหน่วงสัมพัทธ์และต้นทุนโทเค็น: ต่ำ; เหมาะสำหรับ: Q&A สั้น, การสรุปความแบบง่าย, งานแบตช์ปริมาณสูง
ปานกลาง. ความหน่วงสัมพัทธ์และต้นทุนโทเค็น: ปานกลาง; เหมาะสำหรับ: การแชททั่วไป, การร่าง, การเรียกใช้เครื่องมือเอเจนต์ส่วนใหญ่
สูง. เวลาแฝงสัมพัทธ์และต้นทุนโทเค็น: สูงกว่า; เหมาะสำหรับ: การให้เหตุผลแบบหลายขั้นตอน, การสร้างโค้ด, การวิเคราะห์
xhigh / max. ความหน่วงสัมพัทธ์และต้นทุนโทเค็น: สูงที่สุด; เหมาะสำหรับ: คณิตศาสตร์ยาก, การใช้เหตุผลแบบแข่งขัน, ความเท่าเทียมของเกณฑ์มาตรฐาน (Effort=0.99)

คุณสามารถรันมันในเครื่องได้หรือไม่? ฮาร์ดแวร์และ VRAM
เนื่องจาก Inkling เป็นโมเดลที่มีพารามิเตอร์ 975B คำว่า "local" ในความเป็นจริงหมายถึงเซิร์ฟเวอร์แบบหลาย GPU ไม่ใช่แล็ปท็อป ข้อกำหนดโดยประมาณ (ตามการรายงานการเปิดตัวและเครื่องมือของชุมชน):
BF16 (เต็ม). VRAM รวมโดยประมาณ: ~2 TB; ตัวอย่างการกำหนดค่า: 8× NVIDIA B300 หรือ 16× H200
NVFP4 (แบบควอนไทซ์). VRAM รวมโดยประมาณ: ~600 GB; ตัวอย่างการกำหนดค่า: 4× NVIDIA B300 หรือ 8× H200
GGUF (ชุมชน). VRAM รวมโดยประมาณ: แตกต่างตาม quant; ตัวอย่างการกำหนดค่า: มีบิลด์ Unsloth GGUF สำหรับฟุตพริ้นท์ที่เล็กลง/ควอนไทซ์
จุดตรวจสอบ NVFP4 — ที่จัดส่งมาเฉพาะสำหรับ NVIDIA Blackwell — ช่วยลดค่าใช้จ่ายด้านหน่วยความจำลงประมาณสองในสามเมื่อเทียบกับ BF16 ซึ่งเป็นความแตกต่างระหว่างโหนด B300 ที่มี GPU 8 ตัวและ GPU 4 ตัว สำหรับทีมส่วนใหญ่แล้ว สิ่งนี้ยังคงชี้ไปที่ผู้ให้บริการโฮสต์หรือโหนด GPU ที่เช่าแทนที่จะเป็นฮาร์ดแวร์ที่เป็นเจ้าของเอง การควอนไทซ์ GGUF ของ Unsloth ขยายขอบเขตการเข้าถึงลงไปอีกในระดับฮาร์ดแวร์สำหรับการทดลอง โดยมีค่าใช้จ่ายด้านคุณภาพบางส่วน
การปรับใช้เริ่มต้นด่วน
Inkling มี API ที่เข้ากันได้กับ OpenAI, ดังนั้นโค้ดไคลเอนต์ที่มีอยู่ส่วนใหญ่สามารถใช้แทนที่ได้ทันทีโดยการเปลี่ยน base URL และชื่อโมเดล เส้นทางการให้บริการที่พบบ่อยสามเส้นทาง:
vLLM — เซิร์ฟเวอร์คำสั่งเดียว (ค่าเริ่มต้นพอร์ต 8000):
vllm serve thinkingmachines/Inkling --port 8000
# จากนั้นเรียก endpoint ที่เข้ากันได้กับ OpenAI ได้ที่ http://localhost:8000/v1
SGLang — กระจายข้าม 8 GPU (ค่าเริ่มต้นพอร์ต 30000):
python -m sglang.launch_server \
--model-path thinkingmachines/Inkling \
--tp 8 --port 30000
Hugging Face transformers — โหลดโดยใช้ multimodal auto class:
จาก หม้อแปลง นำเข้า AutoModelForMultimodalLM, AutoProcessor
แบบจำลอง = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
ตัวประมวลผล = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# ส่งผ่าน reasoning_effort ใน {none, minimal, low, medium, high, xhigh, max}
เนื่องจาก endpoint รองรับการทำงานแบบ OpenAI-compatible การย้ายแอปที่มีอยู่มักจะเป็นการชี้ SDK ของคุณไปยัง base URL ใหม่และตั้งค่า reasoning_effort ตามต้องการ รันไทม์เพิ่มเติมเมื่อเปิดตัว ได้แก่ TokenSpeed และ Unsloth
ควรเรียกใช้ที่ไหน: ความพร้อมใช้งานของผู้ให้บริการ inference
ถ้าคุณไม่ต้องการจัดการกับ GPU มีพันธมิตรหลายรายที่โฮสต์ Inkling ตัวเลือก “Run Inkling on X” เมื่อเปิดตัว:
Tinker (Thinking Machines). บทบาท: การปรับแต่งละเอียด; หมายเหตุ: 64K and 256K ตัวเลือกคอนเทกซ์; ส่วนลดเปิดตัวแบบจำกัดเวลา 50% (แบบชำระเงิน)
Together AI. บทบาท: การอนุมานที่โฮสต์; หมายเหตุ: ปลายทางที่เข้ากันได้กับ OpenAI
พลุ. บทบาท: การอนุมานแบบโฮสต์; หมายเหตุ: —
Modal. บทบาท: โฮสต์อินเฟอเรนซ์ / GPU แบบไร้เซิร์ฟเวอร์; หมายเหตุ: —
Databricks. บทบาท: การอนุมานที่โฮสต์ไว้; หมายเหตุ: ผ่าน Unity AI Gateway
Baseten. บทบาท: การอนุมานที่โฮสต์; หมายเหตุ: —
เกณฑ์มาตรฐาน: การอ้างสิทธิ์ของผู้ขายเทียบกับการวัดผลที่เป็นอิสระ
นี่คือส่วนที่สำคัญที่สุดของซื่อสัตย์ใดๆ Inkling review 2026, เนื่องจากตัวเลขมาจากสถานที่ที่แตกต่างกันมากสองแห่ง
การเปิดเผยข้อมูล:ยกเว้นเฉพาะ Artificial Analysis Index แล้ว เกณฑ์มาตรฐาน Inkling ทุกรายการด้านล่างนี้เป็น การรายงานตนเองจากผู้จำหน่ายเมื่อเปิดตัว (Effort = 0.99, temperature 1.0) และมี ไม่ได้รับการตรวจสอบโดยอิสระ. ตัวเลขของคู่แข่งได้มาจากบุคคลที่สาม (MarkTechPost, Artificial Analysis) หรือดำเนินการซ้ำโดย Thinking Machines และเช่นเดียวกัน ไม่ได้รับการตรวจสอบโดยอิสระ ที่นี่. ตัวเลขบางตัวมีข้อกำหนดเกี่ยวกับฮาร์เนสหรือชุดย่อย. ให้ถือว่าทั้งหมดเป็นแนวทาง ไม่ใช่ความจริงที่แน่นอน.
คะแนนที่ผู้ขายรายงานตนเอง
ตามเอกสารเปิดตัวของ Thinking Machines เอง:
AIME 2026 (คณิตศาสตร์): 97.1%
GPQA Diamond (การใช้เหตุผลทางวิทยาศาสตร์): 87.2%
SWE-bench Verified (การเขียนโค้ด, harness เฉพาะ bash): 77.6%
SWE-bench Pro (Public): 54.3%
MMMU Pro (multimodal): 73.3%
VoiceBench (เสียง): 91.4%
MMAU (เสียง): 77.2%
IFBench (การทำตามคำสั่ง): 79.8%
Terminal Bench 2.1 (เทอร์มินัลแบบเอเจนต์): 63.8
FORTRESS ที่เป็นปรปักษ์: 78.0%
SimpleQA ที่ได้รับการยืนยัน: 43.9%
บนกระดาษตัวเลขเหล่านี้ดูดี โดยเฉพาะตัวเลขด้านเหตุผลทางคณิตศาสตร์และวิทยาศาสตร์ แต่บริษัทได้วัดประสิทธิภาพของ Inkling เทียบกับคู่แข่งเวอร์ชันที่ใกล้จะออก (GPT 5.6 Sol, Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Kimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra) โดยใช้คะแนนที่บริษัทสร้างขึ้นเอง ตัวเลขของคู่แข่งเหล่านี้อาจไม่ตรงกับตัวเลขที่คู่แข่งรายงานเอง ดังนั้นการเปรียบเทียบแบบเผชิญหน้าควรอ่านด้วยความระมัดระวัง
การเปรียบเทียบแบบตัวต่อตัวของหลายโมเดล (คู่แข่งที่เปิดเผยน้ำหนัก)
การเปรียบเทียบแบบเคียงข้างที่ชัดเจนที่สุดของ Inkling กับโมเดลโอเพนเวทอื่นๆ มาจาก ตารางเปรียบเทียบของ MarkTechPost (แสดงซ้ำด้านล่าง โดยให้เครดิต MarkTechPost) มันมีประโยชน์อย่างแม่นยำเพราะมันทำให้คู่แข่งอยู่ในกรอบเดียวกัน:
HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%
AIME 2026. Inkling: 97.1%; Nemotron 3 Ultra: 94.2%; Kimi K2.6: 96.4%; GLM 5.2: 99.2%; DeepSeek V4 Pro: 96.7%
SWE-bench Verified. Inkling: 77.6%; Nemotron 3 Ultra: 70.7%; Kimi K2.6: 80.2%; GLM 5.2: 80.0%; DeepSeek V4 Pro: 80.6%
Terminal Bench 2.1. Inkling: 63.8%; Nemotron 3 Ultra: 56.4%; Kimi K2.6: 71.3%; GLM 5.2: 82.7%; DeepSeek V4 Pro: 64%
FORTRESS (adversarial). Inkling: 78.0%; Nemotron 3 Ultra: 77.6%; Kimi K2.6: 65.6%; GLM 5.2: 71.3%; DeepSeek V4 Pro: 36.0%
MarkTechPost. ไม่ได้ผ่านการตรวจสอบอย่างอิสระ
รูปแบบชัดเจนและสอดคล้องกับความถ่อมตัวของ Thinking Machines เอง Inkling นำใน FORTRESS (ความปลอดภัยเชิงปฏิปักษ์) และเอาชนะ Nemotron 3 Ultra ในทุกด้าน แต่มันตามหลัง GLM 5.2, Kimi K2.6, และ DeepSeek V4 Pro ใน HLE, SWE-bench Verified และโดยเฉพาะอย่างยิ่งTerminal Bench 2.1 (63.8% เทียบกับ 82.7% ของ GLM 5.2) หากการเขียนโค้ดแบบเอเจนต์และงานเทอร์มินัลเป็นสิ่งที่คุณให้ความสำคัญ โมเดลโอเพนซอร์สชั้นนำของจีนอยู่ในตำแหน่งนำในวันนี้
การวัดโดยอิสระ (Artificial Analysis)
เพื่อการอ่านที่เป็นกลางมากขึ้น Artificial Analysis ได้ประเมิน Inkling เมื่อวันที่ 2026-07-15 และจัดอันดับให้อยู่ที่ 41/100 ในดัชนี Intelligence Index อยู่ในอันดับ #10 จาก 97 โมเดล. สองประเด็นเกี่ยวกับวิธีอ่านอันดับนั้นอย่างยุติธรรม:
มันเป็นการแสดงผลของโมเดลโอเพนที่แข็งแกร่ง ไม่ใช่ที่หนึ่งโดยรวมตามการวิเคราะห์ของ Artificial Analysis ดัชนีของ Inkling ที่ 41 อยู่เหนือกว่า Nemotron 3 Ultra (38), Gemma 4 31B (29) และ gpt-oss-120b (24) — ดังนั้นในกลุ่มโมเดลโอเพนเวท มันอยู่ในระดับแข่งขันถึงนำ แต่ที่ 10 จาก 97 หมายถึงมีเก้าโมเดลที่จัดอันดับสูงกว่าโดยรวม สอดคล้องกับกรอบ 'มีความสามารถ ไม่ใช่แนวหน้า'
ประสิทธิภาพคือจุดเด่นของมัน. Artificial Analysis ตั้งข้อสังเกตถึงประสิทธิภาพด้านโทเค็นที่แข็งแกร่ง — ประมาณ 25,000 โทเค็นในการทำชุดการประเมินให้เสร็จสมบูรณ์ เทียบกับ 37,000–43,000 โทเค็นสำหรับโมเดลเปรียบเทียบ — และมีค่า GDPval-AA v2 Elo อยู่ที่ 1238 ซึ่งนำหน้า Kimi (1190) และDeepSeek V4 Flash (1189) และมีความได้เปรียบเล็กน้อย (+2) บน AA-Omniscience.
วัดความเร็วเอาต์พุตได้ 72.7 โทเคนต่อวินาที โดยมีเวลาที่ใช้ในการสร้างโทเคนแรก 1.75 วินาที กล่าวโดยสรุป: เป็นการติดอันดับสิบที่น่านับถือ และมีประสิทธิภาพอย่างแท้จริง — แต่เราจงใจหลีกเลี่ยงการกล่าวเกินจริงว่าเป็นชัยชนะบนลีดเดอร์บอร์ด

ความสามารถแบบหลายรูปแบบและบริบทระยะยาว
Inkling รองรับข้อความ (UTF-8), รูปภาพ (40px ถึง 4096px ผ่าน hierarchical patch encoder), และเสียง (WAV 16kHz, ยาวสูงสุดประมาณ 20 นาที, ใช้ discrete token encoding) เอาต์พุตเป็นข้อความเท่านั้น — ไม่มีการสร้างรูปภาพหรือเสียง ดังนั้นให้วางแผนสำหรับโมเดลที่เข้าใจ (understanding model) ไม่ใช่โมเดลที่สร้าง (generation model) มีการใช้วิดีโอระหว่าง pretraining แต่ไม่ใช่อินพุตที่รองรับหรือประเมินผลเมื่อเปิดตัว ดังนั้นอย่าวางแผนโดยใช้วิดีโอในตอนนี้
ความสามารถเด่นคือ หน้าต่างบริบท 1 ล้านโทเคน ที่มีอยู่ในน้ำหนักที่เผยแพร่ ซึ่งเปิดทางไปสู่การวิเคราะห์โค้ดทั้งที่เก็บ การสังเคราะห์เอกสารยาว และเซสชันตัวแทนแบบหลายรอบที่ขยายออกไปโดยไม่ต้องแบ่งส่วนแบบรุนแรง หมายเหตุความละเอียดในทางปฏิบัติ: API ที่โฮสต์ไว้จะเปิดเผยได้สูงสุด 256K โทเคน ดังนั้น 1M เต็มรูปแบบเป็นคุณสมบัติที่โฮสต์เองในปัจจุบัน เมื่อรวมกับการออกแบบความสนใจแบบเลื่อนหน้าต่างและการถอดรหัสแบบคาดเดา เรื่องราวของบริบทระยะยาวยังคงเป็นหนึ่งในจุดขายที่ใช้งานได้จริงที่สุดของ Inkling
ราคา ระดับ และต้นทุนรวมในการเป็นเจ้าของ
Inkling เปิดกว้างอย่างแท้จริง น้ำหนักเต็ม (BF16 checkpoint และ NVFP4 checkpoint) อยู่บน Hugging Face ภายใต้ Apache 2.0 ดังนั้น การโฮสต์ด้วยตนเองปลอดค่าลิขสิทธิ์ — คุณจ่ายเฉพาะค่าคำนวณเท่านั้น Thinking Machines ไม่ได้สร้างรายได้จากโมเดลโดยตรง รายได้มาจาก Tinker และโฮสต์ของบุคคลที่สาม
ราคาแบบต่อโทเค็นที่โฮสต์ (ตามArtificial Analysis), ตามระดับบริบท:
64K. อินพุต / 1M: $1.87; อินพุตที่แคช / 1M: $0.374; เอาต์พุต / 1M: $4.68
256K. อินพุต / 1M: $3.74; อินพุตที่แคช / 1M: $0.748; เอาต์พุต / 1M: $9.36
สะท้อนถึงส่วนลดเปิดตัว 50% แบบจำกัดเวลา; ตัวเลขต่อโทเค็นของ Tinker ที่แน่นอนอยู่ในเอกสารและจะเปลี่ยนแปลง
Self-host เทียบกับ API — วิธีคิดเกี่ยวกับ TCO. เศรษฐศาสตร์ขึ้นอยู่กับปริมาณและการใช้งาน:
API (Tinker / พาร์ทเนอร์): ต้นทุนคงที่เป็นศูนย์ จ่ายต่อโทเค็น เริ่มต้นได้แทบจะทันที เหมาะกับปริมาณการใช้งานต่ำหรือที่พุ่งสูงเป็นพักๆ หรือในระหว่างการสร้างต้นแบบ
โฮสต์เอง (GPU ที่เช่าหรือเป็นเจ้าของ): คุณจ่ายค่าโหนด GPU 4–8 ตัวไม่ว่าจะมีการใช้งานหรือไม่ แต่ต้นทุนโทเค็นส่วนเพิ่มเข้าใกล้ค่าไฟฟ้าดิบ เนื่องจาก Inkling เปิดใช้งานเพียง 41B พารามิเตอร์และมีประสิทธิภาพด้านโทเค็น (~25K เทียบกับ 37–43K ต่อชุดข้อมูลของ Artificial Analysis) ปริมาณงานต่อชั่วโมง GPU จึงเป็นที่น่าพอใจ และภาระงานที่หนักและสม่ำเสมอสามารถมีราคาถูกกว่าราคา API ต่อโทเค็นอย่างมีนัยสำคัญเมื่อโหนดถูกใช้งานอย่างเต็มที่ ความคิดเห็นเกี่ยวกับการเปิดตัวระบุว่าการโฮสต์ open weights ด้วยตนเองนั้นถูกกว่าราว 40–60% เมื่อเทียบกับการใช้งาน closed-API ที่เทียบเคียงได้ในระดับใหญ่ — เป็นการอ้างแบบทิศทาง ไม่ใช่ตัวเลขที่ได้รับการตรวจสอบ
หมายเหตุบรรณาธิการ — เพิ่มภาพประกอบ: แผนภูมิจุดคุ้มทุน — ปริมาณโทเคนรายเดือน (แกน x) เทียบกับต้นทุนรวม (แกน y) โดยมีเส้นสามเส้น: closed frontier API, Inkling hosted API, และ Inkling self-hosted บนโหนด GPU เช่า — แสดงจุดตัดที่การโฮสต์ด้วยตนเองชนะ
ความปลอดภัย การจัดแนว และการเซ็นเซอร์
ความปลอดภัยเป็นหนึ่งในเรื่องราวที่แข็งแกร่งและแตกต่างมากขึ้นของ Inkling ในFORTRESS adversarial เกณฑ์มาตรฐานมันได้คะแนน 78.0% — ซึ่ง ดีที่สุดในบรรดาโมเดลน้ำหนักเปิด ในการเปรียบเทียบของ MarkTechPost นำหน้า GLM 5.2 (71.3%), Kimi K2.6 (65.6%) และนำหน้า DeepSeek V4 Pro (36.0%) อย่างมาก Thinking Machines ยังเน้นย้ำถึงความไม่แน่นอนที่ได้รับการปรับเทียบในผลลัพธ์ของโมเดล
การรายงานของ VentureBeat เน้นถึงคุณสมบัติที่เกี่ยวข้อง: การต่อต้านการเซ็นเซอร์. เมื่อรวมกับลิขสิทธิ์ Apache 2.0 ที่อนุญาตอย่างเสรี สิ่งนี้ทำให้ Inkling เป็นโมเดลเปิดที่ทีมสามารถปรับให้สอดคล้องกับนโยบายของตนเอง แทนที่จะรับช่วงต่อระบบควบคุมเนื้อหาที่คลุมเครือซึ่งถูกกำหนดโดยผู้จำหน่าย — ซึ่งเป็นข้อควรพิจารณาที่สำคัญสำหรับการปรับใช้ในอุตสาหกรรมที่มีการควบคุมหรือเฉพาะภูมิภาค เช่นเดียวกับโมเดลที่เปิดตัวในวันเปิดตัวเสมอ ไม่มีการตรวจสอบความปลอดภัยจากทีมแดงอิสระหรือบุคคลที่สามปรากฏขึ้น ณ เวลาที่เขียน ดังนั้นให้ถือว่าข้อมูลนำของ FORTRESS lead มาจากผู้จำหน่าย/บุคคลที่สาม แทนที่จะได้รับการรับรองจากภายนอก
คุณควรปรับแต่ง Inkling หรือไม่?
การปรับแต่งละเอียดเป็นเหตุผลที่ทำให้ Inkling ดำรงอยู่ได้ ต่อไปนี้คือกรอบการตัดสินใจอย่างรวดเร็ว:
ปรับแต่งละเอียด (ผ่าน Tinker หรือ pipeline ของคุณเอง) หาก: คุณมีข้อมูลที่เป็นกรรมสิทธิ์, โดเมนเฉพาะ, หรืองานที่โมเดลเฉพาะทางขนาดเล็กเอาชนะโมเดลทั่วไปได้; คุณต้องการเป็นเจ้าของน้ำหนัก; หรือคุณต้องการกำหนดโทนเสียง, รูปแบบ, หรือนโยบายที่เฉพาะเจาะจง ตัวเลือกบริบท Tinker 64K/256K และส่วนลดเปิดตัวช่วยลดอุปสรรค
ให้ใช้โมเดลพื้นฐาน (self-host หรือ API) ถ้า: ภารกิจของคุณเป็นแบบทั่วไป ปริมาณการใช้งานต่ำ หรือคุณยังไม่ได้ยืนยันว่าการ fine-tuning ช่วยปรับปรุงเมตริกของคุณได้ การปรับแต่ง prompt ร่วมกับปุ่ม reasoning_effort มักจะเพียงพอแล้ว
มองหาที่อื่นหาก: คุณต้องการการเขียนโค้ดแบบเอเจนต์ระดับแนวหน้าในวันนี้ (GLM 5.2 และ Kimi K2.6 เป็นผู้นำในเกณฑ์ชี้วัดเหล่านั้น) หรือคุณต้องการการรับประกันคุณภาพที่ผ่านการตรวจสอบโดยอิสระ
ข้อดีและข้อเสีย
ข้อดี
น้ำหนักแบบเปิดเต็มรูปแบบภายใต้ Apache 2.0, ปลอดค่าลิขสิทธิ์สำหรับการโฮสต์เองและฟรีสำหรับการใช้เชิงพาณิชย์.
MoE แบบสปาร์สที่มีประสิทธิภาพ (เฉพาะ 41B ที่ทำงาน) บวกกับประสิทธิภาพของโทเคนที่แข็งแกร่ง ทำให้ต้นทุนและความเร็วในการอนุมานยังคงแข่งขันได้
ขนาดใหญ่ บริบท 1M token ในน้ำหนัก (256K ผ่าน API).
ความหลากหลายรูปแบบที่แท้จริง (ข้อความ, รูปภาพ, เสียง อินพุต).
ตัวปรับระดับความพยายามในการให้เหตุผลที่ควบคุมได้ (ไม่มี → สูงสุด) สำหรับการแลกเปลี่ยนต้นทุน/คุณภาพแบบเรียลไทม์
ความปลอดภัยเชิงปรปักษ์แบบน้ำหนักเปิดระดับแนวหน้า (FORTRESS 78.0%, ตาม MarkTechPost) และ “การต้านทานการเซ็นเซอร์.”
ความแข็งแกร่งและความเป็นอิสระ — ติดอันดับ 1 ใน 10 จาก 97 บน Artificial Analysis Index นำหน้า Nemotron 3 Ultra, Gemma 4 31B และ gpt-oss-120b
ข้อเสีย
โดยชัดแจ้ง ไม่ โมเดลแนวหน้า, ตามที่ผู้สร้างยอมรับเอง.
ตามหลังคู่แข่งแบบเปิดชั้นนำ (GLM 5.2, Kimi K2.6, DeepSeek V4 Pro) ในการวัดผลด้านตัวแทนและการเขียนโค้ด (Terminal Bench 2.1, SWE-bench Verified, HLE)
เกณฑ์มาตรฐานส่วนใหญ่เป็นการรายงานตนเองจากผู้ขายและไม่ได้รับการตรวจสอบอย่างอิสระ
เอาต์พุตเฉพาะข้อความ; ไม่มีการสร้างภาพ/เสียง; ไม่มีอินพุตวิดีโอเมื่อเปิดตัว; Inkling-Small ยังอยู่ในช่วงพรีวิว
การใช้งาน “ท้องถิ่น” จริงๆ ต้องการโหนดที่มี GPU หลายตัว (VRAM ประมาณ 600GB แม้จะถูกควอนไทซ์แล้ว)
ไม่มีการตรวจสอบเชิงวิพากษ์อิสระที่มีสาระสำคัญ หรือการตรวจสอบด้านความปลอดภัย/ทีมแดง ปรากฏขึ้นเมื่อเปิดตัว
ใครควรใช้ Inkling?
Inkling เป็นตัวเลือกที่แข็งแกร่งหากคุณเป็นผู้ปฏิบัติงานหรือทีมที่ต้องการ เป็นเจ้าของและปรับแต่ง โมเดลของคุณแทนที่จะเช่า API แบบปิด. กรณีการใช้งานที่เหมาะสม ได้แก่:
ทีมปรับแต่งละเอียดที่สร้างโมเดลเฉพาะโดเมนผ่าน Tinker หรือไปป์ไลน์ของตนเอง
การปรับใช้ที่มีความไวต่อต้นทุนและปริมาณสูงที่ซึ่งการโฮสต์ด้วยตนเองแบบปลอดค่าลิขสิทธิ์เหนือกว่าการกำหนดราคาแบบต่อโทเค็นที่ล้ำสมัย
งานที่มีบริบทยาว เช่น การช่วยเขียนโค้ดทั้งฐานโค้ด การวิเคราะห์เอกสาร และเซสชันเอเจนต์ที่ยาว
แอปพลิเคชันแบบหลายรูปแบบที่ต้องการการเข้าใจข้อความ รูปภาพ และเสียงร่วมกัน
การปรับใช้ที่อ่อนไหวต่อนโยบาย ที่ต้องการฐานเปิดที่ปลอดภัยสูงและต้านทานการเซ็นเซอร์เพื่อปรับตัวให้สอดคล้อง.
มันไม่เหมาะสมหากคุณต้องการความสามารถในการใช้เหตุผลที่แข็งแกร่งที่สุดหรือประสิทธิภาพการเขียนโค้ดแบบเอเจนต์ ต้องการอินพุตวิดีโอหรือเอาต์พุตเชิงสร้างสรรค์ หรือต้องการเกณฑ์มาตรฐานที่ได้รับการตรวจสอบอย่างอิสระก่อนการปรับใช้
คำตัดสินและคะแนนสุดท้าย
มาจัดการกับประเด็นที่เห็นกันอยู่ตรงๆ กันดีกว่า: Inkling ไม่ใช่โมเดลที่แข็งแกร่งที่สุดที่มีอยู่ในปัจจุบัน, และ Thinking Machines ก็พูดอย่างนั้น ถ้าอ่านแบบมองโลกในแง่ร้าย ก็ถือว่าเป็นมาตรฐานที่ต่ำ ถ้าอ่านอย่างยุติธรรม ก็คือประเด็นทั้งหมด — Inkling ถูกปรับให้เหมาะกับวัตถุประสงค์ที่แตกต่างจากการเป็นอันดับหนึ่งบนลีดเดอร์บอร์ด มันมีประสิทธิภาพ (41B active, งบประมาณงาน ~25K token), มีใบอนุญาตแบบเปิด (Apache 2.0), ปลอดภัยตามมาตรฐานน้ำหนักแบบเปิด (FORTRESS 78%), และถูกสร้างมาเพื่อให้ปรับแต่งและโฮสต์เองได้ การผสมผสานนี้ทำให้มันเป็นการเปิดตัวโมเดลเปิดที่รอบคอบรุ่นหนึ่งของปี 2026 ถึงแม้ว่ามันจะตามหลัง GLM 5.2 และ Kimi K2.6 ในเกณฑ์วัดที่ยากที่สุดสำหรับการทำงานแบบตัวแทนและการเขียนโค้ด
เครื่องหมายดอกจันที่เหลือเป็นเกณฑ์มาตรฐานที่ส่วนใหญ่รายงานด้วยตนเอง และการขาดการตรวจสอบวิจารณ์อย่างอิสระในช่วงแรกนี้ แต่สำหรับกลุ่มเป้าหมายที่ตั้งใจไว้ — นักพัฒนาที่ให้ความสำคัญกับความเป็นเจ้าของ การปรับแต่ง การควบคุมต้นทุน และหน้าต่างบริบทขนาดใหญ่ มากกว่าสิทธิอวดอ้างแนวหน้า — Inkling ก็ตอบโจทย์
คะแนน: 4 จาก 5 สำหรับกลุ่มเป้าหมายที่เป็นผู้สร้างและผู้ปรับแต่ง; คะแนนจะต่ำลงหากคุณกำลังซื้อเพื่อความสามารถระดับแนวหน้าอย่างแท้จริง
คำถามที่พบบ่อย
Inkling คืออะไรและใครเป็นผู้สร้าง? Inkling เป็นโมเดลแรกจาก Thinking Machines Lab ซึ่งเป็นสตาร์ทอัพด้าน AI ที่นำโดย Mira Murati (อดีต CTO ของ OpenAI) เปิดตัวเมื่อวันที่ 15 กรกฎาคม 2026 ในรูปแบบโมเดล reasoning แบบ open-weights, multimodal Mixture-of-Experts.
Inkling เป็นโมเดล AI ที่ดีที่สุดหรือไม่? ไม่ และบริษัทก็ไม่ได้อ้างเช่นนั้น — ระบุว่า Inkling “ไม่ใช่โมเดลที่แข็งแกร่งที่สุดที่มีอยู่ในปัจจุบัน ไม่ว่าจะเป็นแบบปิดหรือเปิด” การวัดผลโดยอิสระ (Artificial Analysis) จัดอันดับให้มันอยู่ที่ #10 จากทั้งหมด 97 โดยรวม แม้ว่าจะนำหน้าโมเดลเปิดอื่นๆ หลายตัว
Inkling มีพารามิเตอร์กี่ตัว และหน้าต่างบริบทคืออะไร?รวม 975B พร้อม 41B ที่ทำงาน (sparse MoE) ครอบคลุม 66 เลเยอร์ หน้าต่างบริบทสูงสุด 1,000,000 โทเค็นในน้ำหนักที่ปล่อยออกมา และสูงสุด 256K บน API ที่โฮสต์
Inkling เป็นโอเพนซอร์สหรือไม่ และใบอนุญาตคืออะไร? น้ำหนักของโมเดลเผยแพร่ภายใต้ Apache 2.0 ซึ่งอนุญาตให้ใช้ในเชิงพาณิชย์และโฮสต์ด้วยตนเอง มันคือ “open weights” — น้ำหนักโมเดลเต็มอยู่บน Hugging Face.
Inkling ใช้งานได้ฟรีหรือไม่?น้ำหนัก (weights) ฟรีและปลอดค่าลิขสิทธิ์สำหรับการโฮสต์เอง การปรับแต่งบน Tinker และการอนุมานแบบโฮสต์ผ่านผู้ให้บริการอย่าง Together AI, Fireworks, Modal, Databricks หรือ Baseten เป็นบริการที่ต้องชำระเงิน การเข้าถึงแบบโฮสต์เริ่มต้นที่ประมาณ $1.87 ต่อ 1M อินพุตโทเคน (ส่วนลดเปิดตัวระยะเวลาจำกัด)
ฉันจะรันหรือดาวน์โหลด Inkling ได้อย่างไร และต้องใช้ฮาร์ดแวร์อะไรบ้างดาวน์โหลดน้ำหนักจาก Hugging Face และให้บริการด้วย vLLM, SGLang หรือ Hugging Face transformers ผ่าน API ที่เข้ากันได้กับ OpenAI คาดว่าจะใช้ VRAM รวมประมาณ ~2TB สำหรับ BF16 (8× B300 / 16× H200) หรือ ~600GB สำหรับ checkpoint ที่ควอนไทซ์ด้วย NVFP4 (4× B300 / 8× H200) เวอร์ชัน GGUF จาก Unsloth สำหรับชุมชนช่วยลดข้อจำกัดในการทดลอง
ฉันจะปรับแต่ง Inkling ได้อย่างไร ใช้ Thinking Machines’ Tinker แพลตฟอร์ม, ซึ่งมีตัวเลือกบริบท 64K และ 256K และมีส่วนลดเปิดตัว 50% ในระยะเวลาจำกัด หรือปรับแต่งน้ำหนักแบบเปิดในไปป์ไลน์ของคุณเอง.
ความพยายามในการคิดที่ควบคุมได้คืออะไร? การตั้งค่า reasoning_effort (none / minimal / low / medium / high / xhigh / max) ที่แลกเปลี่ยนระหว่างความหน่วงและต้นทุนโทเค็นกับความลึกของการใช้เหตุผล ระดับความพยายามต่ำเหมาะสำหรับการจำแนกประเภทและการแยกข้อมูล ระดับสูงสุดเหมาะสำหรับคณิตศาสตร์ยากและตรงกับการกำหนดค่ามาตรฐาน (Effort=0.99)
Inkling เปรียบเทียบกับ Kimi, GLM, DeepSeek และ Nemotron อย่างไร? ตามการเปรียบเทียบของ MarkTechPost, Inkling นำใน FORTRESS (ความปลอดภัย) และเอาชนะ Nemotron 3 Ultra ในวงกว้าง แต่ตามหลัง GLM 5.2, Kimi K2.6, และ DeepSeek V4 Pro ใน Terminal Bench 2.1, SWE-bench Verified, และ HLE มันมีการแข่งขันสูง แต่ไม่ใช่โมเดลโอเพนที่แข็งแกร่งที่สุดในด้านการเขียนโค้ดแบบ agentic
Inkling สามารถประมวลผลรูปภาพ เสียง และวิดีโอได้หรือไม่?มันรับข้อความ รูปภาพ (40px–4096px) และเสียง (16kHz WAV, สูงสุดประมาณ 20 นาที) เป็น ข้อมูลนำเข้า. ผลลัพธ์เป็นข้อความเท่านั้น — ไม่มีการสร้างรูปภาพหรือเสียง วิดีโอถูกใช้ในการฝึกอบรมล่วงหน้าแต่ไม่ใช่ข้อมูลนำเข้าที่รองรับในการเปิดตัว
คะแนนเกณฑ์มาตรฐานของ Inkling เชื่อถือได้หรือไม่? ควรปฏิบัติต่อสิ่งเหล่านี้ด้วยความระมัดระวัง นอกเหนือจากดัชนี Artificial Analysis Intelligence Index ที่เป็นอิสระแล้ว ตัวเลขหลักๆ นั้นเป็นข้อมูลที่ผู้ขายรายงานเองตั้งแต่เปิดตัว และไม่ได้รับการตรวจสอบโดยอิสระ ตัวเลขของคู่แข่งมาจากบุคคลที่สาม (MarkTechPost) หรือถูกดำเนินการใหม่โดย Thinking Machines และอาจไม่ตรงกับตัวเลขที่คู่แข่งรายงานเอง
อิงคลิง-สมอลคืออะไร และแผนงานในอนาคตเป็นอย่างไร? อิงคลิง-สมอลเป็นรุ่นย่อยที่เล็กกว่า (รวม 276B / ใช้งาน 12B) เมื่อเปิดตัวยังอยู่ในช่วงพรีวิว ยังไม่มีการเผยแพร่ค่าน้ำหนัก (weights) โมเดลหลักได้รวมเลเยอร์ MTP สำหรับ speculative decoding ไว้แล้ว
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
