
Intern-Decision-4B: InternLM เปิดตัวโมเดลตัดสินใจที่ตอบได้โดยไม่ต้องเขียนโทเคนแม้แต่ตัวเดียว
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 592 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 187 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
รีโพซิทอรีโมเดลสามแห่งปรากฏบนหน้า Hugging Face ของ InternLM ภายในสี่สิบวินาทีเมื่อวันที่ 26 กันยายน 2026: Intern-Decision-0.8B เมื่อเวลา 05:35:57 UTC, Intern-Decision-2B เมื่อเวลา 05:36:19 และ internlm/Intern-Decision-4B เมื่อเวลา 05:36:37 รุ่น 4B เป็นรุ่นที่น่าสนใจ มันเป็นไฟน์จูนของ Qwen3.5-4B ที่รับสถานะที่แชร์ร่วมกัน สคีมาของคำถามที่มีชื่อ และรูปภาพแบบไม่บังคับ และส่งคืนการกระจายคำตอบที่คาลิเบรตแล้วสำหรับทุกคำถามในการส่งผ่านไปข้างหน้าครั้งเดียว มันไม่สร้างข้อความเลย หมายเหตุการเผยแพร่ของมันเองระบุไว้ตรง ๆ ว่า: "API นี้ทำการให้คะแนนผู้สมัครแบบมีโครงสร้าง มันไม่เรียก generate() หรือสุ่มข้อความอิสระ" สี่สิบวินาทีของการอัปโหลด และไม่มีประกาศแม้แต่บรรทัดเดียวที่ไหนเลย — ไม่มีโพสต์บล็อก ไม่มีทวีต ไม่มีบันทึกการเปลี่ยนแปลง ไม่มีหน้าเปิดตัว สิ่งที่มีอยู่คือการ์ดโมเดล inference.py และชาร์ด safetensors สี่ชิ้น

สิ่งที่เปิดตัวแล้ว และสิ่งที่ยังไม่เปิดตัว
ตระกูลโมเดลคือสิ่งแรกที่ต้องทำให้ถูกต้อง เพราะการ์ดของ 4B มีข้อมูลนี้อยู่เงียบ ๆ ตาราง benchmark ของมันแสดงแถวสำหรับ Intern-Decision-0.8B และ Intern-Decision-2B ควบคู่ไปกับแถวของตัวเอง และเช็กพอยต์ทั้งสามก็ขึ้นสู่ฮับภายในนาทีเดียวกัน รีโพซิทอรีของ 2B ไม่เคยถูกลิงก์จากการ์ดของ 4B — คุณต้องหามันผ่านฟีดการอัปโหลดขององค์กร
สิ่งที่ไม่ได้ปล่อยออกมาก็คือเกือบทุกอย่างที่การปล่อยเวอร์ชันตามปกติจะนำมาด้วย:
• ไม่มีการประกาศ — ไม่มีการรายงานข่าวบนเว็บเลย ไม่มีแถลงการณ์จากผู้ขายในภาษาใดที่เราหาเจอ
• ไม่มีเดโม — การ์ดนี้ลิงก์ไปยัง Space ที่ huggingface.co/spaces/internlm/intern-decision ซึ่งปลายทางนั้นตอบกลับ HTTP 401 หมายความว่าไม่ได้เปิดเป็นสาธารณะ ไม่ได้หมายความว่ามันเสีย
• ไม่มีคอลเลกชัน — คอลเลกชันโมเดลที่โฆษณาไว้ที่ huggingface.co/collections/internlm/intern-decisionก็ส่งคืน 401 เช่นกัน
• ไม่มีที่เก็บโค้ด — ลิงก์ GitHub ของการ์ด, github.com/internlm/Intern-Decision เป็นข้อผิดพลาด 404 และรายการที่เก็บโค้ดขององค์กร InternLM ไม่มีโปรเจกต์ดังกล่าว
• ไม่มีการนำไปใช้ — ณ เวลาที่เขียนนี้ 4B มีหนึ่งไลก์และยอดดาวน์โหลดเป็นศูนย์
นั่นคือขอบเขตทั้งหมดที่สามารถรู้ได้ ให้ถือว่าตัวเลขทุกตัวด้านล่างนี้เป็นข้อมูลของผู้ขายเอง เพราะยังไม่มีใครอื่นรันสิ่งนี้มาก่อน

สัญญาการอนุมานคือตัวผลิตภัณฑ์
เนื้อหาส่วนใหญ่ของการ์ดใช้ไปกับขั้นตอนห้าขั้น ซึ่งบอกคุณว่าความพยายามทางวิศวกรรมไปอยู่ตรงไหน คำถามและตัวเลือกคงลำดับเดิม ตัวเลือกของแต่ละคำถามถูกแมปเข้ากับสัญลักษณ์แบบโทเคนเดียว — A ถึง Z จากนั้น a ถึง z จากนั้น 0 ถึง 9 นั่นคือ 62 สัญลักษณ์ และนั่นคือเหตุผลว่าทำไมการ์ดจึงจำกัดคำถามไว้ที่ 62 ตัวเลือก พรอมต์ถูกเรนเดอร์จากพรอมต์ระบบต้นฉบับ สถานะ สคีมาการตัดสินใจ และโครงร่าง JSON ของผู้ช่วยที่สมบูรณ์ โดยมีตัวแทน <decision> หนึ่งตัวต่อฟิลด์ โดยคงเทมเพลตแชตของเช็กพอยต์และบล็อกการคิดที่ว่างเปล่า จากนั้นทำ causal forward pass หนึ่งครั้ง ลอจิตถูกอ่านที่ตำแหน่งก่อนหน้าตัวแทนแต่ละตัวทันที ซอฟต์แมกซ์ทำงานบนลอจิตของสัญลักษณ์ผู้สมัครที่อนุญาตเฉพาะของฟิลด์นั้นเท่านั้น มีการปรับคาลิเบรชัน แล้วสัญลักษณ์จะแมปกลับไปยังค่าตัวเลือกของคุณ
ผลลัพธ์คือรูปแบบที่ตายตัว: ไม่มีลูปถอดรหัส ไม่มีการสุ่ม ไม่มีตัวแยกวิเคราะห์ ไม่มีพื้นผิวการหลอน และเพดานสูงสุดที่หนึ่งการตัดสินใจต่อคำถามต่อรอบ รองรับประเภทคำถามสามประเภท — choice พร้อมแผนที่เกณฑ์ที่มีลำดับ, score พร้อมรายการหรือแผนที่ที่ใช้ตัวเลขเป็นคีย์, และ noul, ไบนารีไม่/ใช่.
รายละเอียดในสเปกชีตที่สำคัญที่สุด
การ์ดระบุชัดเจนว่าอินพุตจะ "ถูกปฏิเสธโดยไม่มีการตัดทอน" เมื่อเกินDecisionEngine(max_length=8192). เมื่ออ่านสิ่งนี้ควบคู่กับคอนฟิก ก็มีบางอย่างแปลก ๆ ผุดขึ้นมา: text tower ที่อยู่เบื้องหลังประกาศmax_position_embeddings ไว้ที่ 262,144 แกนหลักสามารถเข้าถึงโทเคนได้ถึงหนึ่งในสี่ของล้าน ขณะที่ wrapper ที่เผยแพร่ปฏิเสธทุกอย่างที่เกิน 8,192 นี่ไม่ใช่โมเดลบริบทยาวที่มีค่าเริ่มต้นแบบอนุรักษ์นิยม — มันคือโมเดลให้คะแนนการตัดสินใจซึ่ง harness ของตัวมันเองจำกัดหลักฐานที่คุณป้อนให้มันได้ หากคำถามเรื่องการจัดเส้นทางของคุณต้องอาศัยสถานะมากกว่าประมาณแปดพันโทเคน เช็กพอยต์นี้ในเวอร์ชันที่จัดส่งจะไม่ตอบคำถามนั้น และมันจะปฏิเสธแทนที่จะตัดทอนอินพุตของคุณให้สั้นลง
อนุญาตให้มีรูปภาพได้สูงสุดแปดรูป และการ์ดระบุว่าโทเค็นของรูปภาพนั้นนับรวมกับขีดจำกัด 8,192 เดียวกันนั้น

ภายในน้ำหนัก
สี่ชาร์ด พารามิเตอร์ BF16 จำนวน 4.54 พันล้านตัว และคอนฟิกที่อธิบายชื่อขนาดไว้: มีเท็กซ์ทาวเวอร์ วิชันทาวเวอร์ราวสองโหลเลเยอร์ที่มีขนาดแพตช์ 16 พิกเซล และโปรเจกเตอร์คั่นกลางระหว่างทั้งสอง ฝั่งเท็กซ์มี 32 เลเยอร์ที่ขนาดฮิดเดน 2,560 โดยมี 16 เฮดความสนใจเทียบกับ 4 เฮดคีย์/แวลู คำศัพท์ 248,320 โทเคน และการฝังแบบผูก (tied embeddings) ประเภทเลเยอร์จะสลับกันตามช่วงคงที่ — สามเลเยอร์ linear attention แล้วตามด้วยหนึ่งเลเยอร์ full attention ทำซ้ำแบบนี้ มีเพียงเลเยอร์ full attention เท่านั้นที่พาความสนใจแบบโกลบอล และการฝังแบบโรตารีเป็นแบบบางส่วนที่แฟกเตอร์ 0.25 การโหลดต้องใช้ Python 3.12 หรือใหม่กว่า, PyTorch 2.9.1 และ Transformers 5.14.1 และรายการไฟล์ยังมีไฟล์ tokenizer, merges และ vocabulary อยู่ แทนที่จะพึ่ง tokenizer ฝั่งฮับ
ตัวเลข และใครเป็นผู้สร้างมันขึ้นมา
ทุกอย่างในส่วนนี้ถูกวัดโดย InternLM และเผยแพร่บนการ์ดโมเดล ไม่มีส่วนใดถูกทำซ้ำโดยบุคคลที่สาม และไม่มีรายการใน Artificial Analysis ไม่มีคะแนน arena และไม่มีแถวในลีดเดอร์บอร์ดสำหรับโมเดลนี้ที่ใดเลย
ในชุดการประเมินทั้งเจ็ด โมเดล 4B มีค่าเฉลี่ย 90.02 โดยมีคะแนน Brier 0.347 และค่าความคลาดเคลื่อนในการสอบเทียบที่คาดหวัง 0.065 ตารางเดียวกันแสดง Intern-Decision-0.8B ที่ 79.38 และ Intern-Decision-2B ที่ 84.68 ดังนั้นตระกูลนี้จึงมีแนวโน้มเพิ่มขึ้นตามขนาด — 4.7 คะแนนจาก 0.8B ไป 2B แล้วเพิ่มอีก 5.3 คะแนนไป 4B ตารางยังมีห้าแถวที่ผู้ขายไม่ได้ฝึก: Jev ที่ 88.74, JevK5 ที่ 85.16, SemIf ที่ 84.23, Kev ที่ 79.56 และ Laya ที่ 57.77 พวกนี้ถูกรันโดย InternLM บนฮาร์เนสของ InternLM เทียบกับเช็กพอยต์ของ InternLM พวกมันไม่ใช่ตัวเลขของโครงการเหล่านั้นเอง และการอ่านว่าพวกมันเป็นเช่นนั้นคือความผิดพลาดที่เกิดขึ้นได้ง่ายที่สุดตรงนี้
เวลาแฝงถูกวัดบน RTX 4090 ตัวเดียวผ่านเส้นทาง Hugging Face ภายในเครื่อง และการ์ดระบุว่าค่าเหล่านี้ขึ้นอยู่กับภาระงานและฮาร์ดแวร์ รุ่น 4B ทำงานที่ค่าเฉลี่ย 44.16 ms, มัธยฐาน 44.03 ms และ 44.60 ms ที่ P95 — โดยช่วงห่างระหว่างมัธยฐานกับหางต่ำกว่าหนึ่งมิลลิวินาทีอย่างมาก ซึ่งเป็นลักษณะของ forward pass ที่มีรูปร่างคงที่ เช็กพอยต์ที่เล็กกว่าสองตัวอยู่ที่ประมาณ 33 ms ทั้งคู่ โดย 2B นำหน้า 0.8B เล็กน้อยในค่าเฉลี่ยและมัธยฐาน ซึ่งควรค่าแก่การสังเกตมากกว่าที่จะกลบเกลื่อน: สองตัวนี้ใกล้กันพอที่จะอยู่ในช่วงสัญญาณรบกวนจากการวัดของกันและกัน
การสอบเทียบ และข้อควรระวังที่ตรงไปตรงมาที่มีอยู่ในนั้น
เช็กพอยต์นี้มาพร้อมอุณหภูมิค่าเริ่มต้น 1.99241824 ซึ่งปรับให้เหมาะสมแยกสำหรับโมเดลนี้โดยการลด negative-log-likelihood ให้ต่ำสุด บนเคสสำหรับการปรับเทียบที่กำหนดไว้ 1,728 เคส โดยกันไว้ 1,693 เคสสำหรับการตรวจสอบความถูกต้อง การ์ดระบุว่าป้ายกำกับของชุดทดสอบไม่ได้ถูกใช้เพื่อเลือกค่านี้ การนำไปใช้คือการปรับเทียบความน่าจะเป็นของผู้สมัคร ไม่ใช่อุณหภูมิสำหรับการสุ่ม: มันปรับความเชื่อมั่น ความน่าจะเป็นแบบไบนารี และคะแนนที่คาดหมาย โดยปล่อยให้การตัดสินใจแบบ argmax ไม่เปลี่ยนแปลง
การวินิจฉัยแยกต่างหาก 96 กรณีจะรายงานผลกระทบ ในคอลัมน์ก่อนและหลังของ InternLM เอง ค่า Brier และ ECE โดยรวมของ 4B เปลี่ยนจาก 0.628 / 0.213 เป็น 0.550 / 0.089 เทียบกับ 0.595 / 0.130 สำหรับ Jev การตีความอย่างตรงไปตรงมาสองแบบของตารางนั้น: การปรับเทียบได้ผลอย่างชัดเจน และคอลัมน์ "ก่อน" ไม่ใช่สิ่งที่ผู้ใช้จะได้เห็น เนื่องจากค่าเริ่มต้นที่จัดส่งคืออุณหภูมิที่ปรับพอดีแล้ว นอกจากนี้ยังน่าสังเกตว่า — หมวดหมู่การวินิจฉัยสองหมวดนั้นแย่กว่าสำหรับ 4B เมื่อเทียบกับ Jev และหมวดที่แย่ที่สุดในนั้น คือหลักฐานรายวันและอคติจากการสังเกต ดีขึ้นเป็น 0.575 / 0.210 แต่ยังตามหลัง Jev ที่ 0.603 / 0.114 ในส่วนนั้น การปรับเทียบช่วยลดช่องว่างลงแต่ไม่ได้ปิดช่องว่าง
จุดที่เราเตอร์ลงตัว และจุดที่ยังไม่ลงตัว
อุปสรรคในทางปฏิบัติในการใช้โมเดลนี้ไม่ใช่ความแม่นยำ แต่คือการแพ็กเกจ การเผยแพร่นี้ออกมาเป็นคลาส Python ที่คุณ import หลังจากดาวน์โหลดสี่ชาร์ด ไม่ใช่ปลายทาง HTTP ที่คุณเรียกใช้ได้ นั่นคือช่องว่างที่ชั้นการกำหนดเส้นทางถูกสร้างขึ้นมาเพื่อปิด — คีย์เดียวใช้ได้กับโมเดลมากกว่า 200 รายการ ส่งต่อราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% และ การ failover อัตโนมัติเมื่อผู้ให้บริการมีอาการสะดุด — แต่เราควรพูดตรง ๆ ว่า OrcaRouter ในปัจจุบันไม่ได้ให้บริการ Intern-Decision-4B หรือโมเดลประเภทเดียวกันนี้ แคตตาล็อกของเราไม่ได้ระบุโมเดลนี้ และไม่ควรตีความสิ่งใดที่นี่ว่าเป็นการอ้างว่ามีพร้อมใช้งาน สิ่งที่เรานำเสนอได้คือทางเลือกที่ประหยัดกว่า: หากคุณต้องการลองตัวให้คะแนนการตัดสินใจขนาด 4.5 พันล้านพารามิเตอร์ไว้หน้าพาธโปรดักชัน คุณสามารถสร้างมันเข้าไปในเราเตอร์โดยมี fallback ไปยังโมเดลทั่วไป เพื่อให้วันที่คาลิเบรชันออกมาแย่ทำให้คุณเสียแค่การลองใหม่ ไม่ใช่ระบบล่ม
อะไรจะทำให้ภาพเปลี่ยนไป
สามเรื่อง ตามลำดับความสำคัญ ต้องมีคนนอก InternLM ทำซ้ำค่าเฉลี่ย 90.02 และค่าความคลาดเคลื่อนการคาลิเบรตที่คาดหวัง 0.065 ให้ได้ — คำกล่าวอ้างเรื่องการคาลิเบรตที่ไม่เคยผ่านชุดทดสอบจากภายนอกเลย คือตัวเลขที่ถ่ายโอนได้น้อยที่สุดในแมชชีนเลิร์นนิง ร่องรอยของการ์ดเองต้องปรากฏ: Space, คอลเลกชัน, รีโพซิทอรี GitHub และผู้ขายต้องระบุว่านี่คือผลิตภัณฑ์หรืออาร์ติแฟกต์จากเปเปอร์ เพราะสัญญาอนุญาตแบบเพื่อการวิจัยเท่านั้นกับสัญญาอนุญาต Apache-2.0 ไม่ใช่ความมุ่งมั่นแบบเดียวกัน และโมเดล 4B เลือก Apache-2.0 โดยคงสัญญาอนุญาต Qwen ไว้ควบคู่กัน จนกว่าจะถึงตอนนั้น การวางกรอบที่ถูกต้องคือแบบที่การอัปโหลดเองชี้แนะ: นี่คือเช็กพอยต์จริงที่มีสัญญาการอนุมานจริง และมีสกอร์การ์ดที่ยังไม่ได้รับการตรวจสอบอย่างสมบูรณ์ ถูกเผยแพร่โดยไม่มีใครได้รับแจ้ง
สำหรับตอนนี้ บทสรุปที่ซื่อตรงนั้นแคบและมีประโยชน์ หากปัญหาของคุณคือ "เลือกหนึ่งในห้าป้ายกำหนดเส้นทาง แล้วบอกฉันว่าคุณมั่นใจแค่ไหน" โมเดล 4.5B ที่ส่งออก 62 ลอจิทและไม่มีข้อความบรรยาย ถือเป็นรูปแบบที่สมเหตุสมผลในการประเมิน หากปัญหาของคุณเกี่ยวข้องกับเอกสารยาว รูปภาพมากกว่าแปดรูป หรือความจำเป็นใด ๆ ในการอธิบายคำตอบเป็นคำพูด เช็คพอยต์นี้ที่จัดส่งมาเป็นเครื่องมือที่ผิด และไม่ว่าผู้ขายจะขัดเกลาเกณฑ์มาตรฐานมากแค่ไหน ก็ไม่เปลี่ยนสิ่งนั้น
