
Intern-Decision-2B เปิดตัวเงียบๆ บน Hugging Face ลิงก์ GitHub บนการ์ดของมันเพิ่งหยุดขึ้น 404
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 584 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 187 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
ช่วงเช้าวันนี้ การ์ดโมเดลของinternlm/Intern-Decision-2Bชี้ไปยังสามแห่งเพื่อดูข้อมูลเพิ่มเติม และสองในนั้นใช้งานไม่ได้: เดโม Space ตอบกลับ HTTP 401 และgithub.com/internlm/Intern-Decisionคืนค่า 404 ให้กับใครก็ตามที่คลิกเข้าไป ณ เวลา 08:58 UTC รีโพซิทอรีที่อยู่เบื้องหลังลิงก์ที่สองนั้นมีอยู่จริง — เปิดเป็นสาธารณะ ลึกสามคอมมิต มีโค้ดสำหรับฝึก แบ็กเอนด์สำหรับการอนุมานสองตัว ชุดประเมินที่มีแถวทดสอบ 10,751 แถว เบนช์มาร์กคาลิเบรชัน 96 เคส และคู่มือการทำซ้ำ นั่นคือสิ่งเดียวที่เปลี่ยนไปเกี่ยวกับโมเดลนี้ตั้งแต่ที่มันปรากฏบน Hugging Face เมื่อเวลา 05:36 UTC ของวันที่ 26 กันยายน 2026 และมันเพียงพอที่จะย้าย Intern-Decision-2B จาก "เช็กพอยต์ที่มี README เข้าไม่ถึง" ไปเป็น "เช็กพอยต์ที่คุณตรวจสอบได้จริง ทำซ้ำเทียบเคียงได้ และโต้แย้งด้วยได้"
ตัวน้ำหนักเองไม่เปลี่ยนแปลงและไม่กำกวม Intern-Decision-2B เป็นโมเดลการตัดสินใจแบบมีโครงสร้างหลายรูปแบบที่มีพารามิเตอร์ 2,213,241,664 ตัว ซึ่งปรับแต่งละเอียดมาจาก Qwen/Qwen3.5-2B — ฐานของ Alibaba จากวันที่ 28 กุมภาพันธ์ 2026 — เผยแพร่ภายใต้ Apache-2.0 โดยมีสัญญาอนุญาต Qwen ต้นทางเก็บรักษาไว้เคียงข้างเป็น LICENSE-QWEN เป็นขนาดกลางจากสามขนาดที่ InternLM ปล่อยออกมาในสี่สิบวินาที: Intern-Decision-0.8B เมื่อ 05:35:57, อันนี้เมื่อ 05:36:19, และ Intern-Decision-4B เมื่อ 05:36:37 ยังไม่มีประกาศใด ๆ อยู่เบื้องหลังการเปิดตัวเหล่านี้เลย
สิ่งที่ทำให้ขนาดกลางควรค่าแก่การมีบทความเป็นของตัวเองก็คือ มันเป็นจุดที่ตระกูลนี้เลิกทำตัวตามที่คาดเดาได้ จากตัวเลขของ InternLM เอง มันเป็นรุ่นที่เร็วที่สุดในบรรดาสามรุ่น และคาลิเบรตได้แย่ที่สุดในบรรดาสามรุ่น และทั้งสองข้อนี้ควรค่าแก่การทำความเข้าใจก่อนที่คุณจะดาวน์โหลดอะไรก็ตามสักสี่กิกะไบต์ครึ่ง
อะไรที่ได้รับการยืนยันแล้ว และอะไรที่เป็นเพียงคำกล่าวอ้างของผู้ขาย
สองประเภท และจำเป็นต้องแยกออกจากกัน
ยืนยันแล้ว เพราะมันเป็นรายการไฟล์หรือการตอบกลับ HTTP: จำนวนพารามิเตอร์ (2,592 F32 บวกน้ำหนัก BF16 2,213,239,072); แผนผังชาร์ด (ชาร์ดภาษาขนาด 3.76 GB, วิสชันทาวเวอร์ขนาด 612.5 MB, โปรเจกเตอร์ขนาด 50.3 MB, เทนเซอร์ราว 4.43 GB และรีพอซิทอรีราว 4.46 GB); คู่ใบอนุญาต; โมเดลฐาน; สถาปัตยกรรมที่อยู่เบื้องหลัง (Qwen3_5ForConditionalGeneration ที่มี 24 เลเยอร์, ขนาดฮิดเดน 2,048, 8 หัวคำค้นเทียบกับ 2 หัวคีย์-ค่า, มิติหัว 256, รูปแบบซ้ำของสามเลเยอร์ความสนใจเชิงเส้นต่อหนึ่งเลเยอร์ความสนใจเต็ม, หนึ่งเลเยอร์การทำนายหลายโทเคนที่คงไว้ และเพดานการฝังตำแหน่ง 262,144); การมีอยู่ของรีพอซิทอรี; และข้อเท็จจริงที่ว่าคอลเลกชันโมเดลที่ huggingface.co/collections/internlm/intern-decision ตอนนี้ resolve ได้และแสดงรายการเช็คพอยต์ทั้งสาม
ข้อมูลจากผู้จำหน่ายและยังทำซ้ำไม่ได้: ตัวเลขความแม่นยำทุกตัว ตัวเลขความหน่วงทุกค่า และอุณหภูมิการคาลิเบรต ไม่มีเปเปอร์ ไม่มีรายการบน arXiv ไม่มีโพสต์เปิดตัว ไม่มี changelog และไม่มีการประเมินที่เป็นอิสระ — การค้นหาสตริง "Intern-Decision" ไม่คืนผลลัพธ์ใดที่เป็นเกี่ยวกับโมเดลนี้ เดโม Space ยังตอบ 401 ซึ่งหมายความว่ามันไม่ใช่สาธารณะ ไม่ได้หมายความว่ามันเสีย เช็กพอยต์ 2B มีหนึ่งไลก์และศูนย์ดาวน์โหลด ไม่มีใครนอก InternLM ที่ได้รันมัน

สัญญาการอนุมาน ตามลำดับที่เกิดขึ้น
ไฟล์ที่ให้ข้อมูลมากที่สุดในรีโพซิทอรีไม่ใช่การ์ด แต่คือ src/inference/engine.py และ inference.py ที่บันเดิลมาบน Hub เพราะเมื่อรวมกันแล้ว ทั้งสองไม่ได้บันทึกพรอมป์ต์ แต่บันทึกสัญญา
• คุณระบุ สถานะ — เนื้อหาที่ถูกประเมิน — สคีมาคำถาม และอาจแนบรูปภาพได้ไม่เกินแปดรูป หนึ่งถึงสิบหกคำถาม โดยแต่ละข้อมีได้สูงสุด 62 ตัวเลือก
• ตัวเลือกของแต่ละคำถามจะถูกแมปไปยังสัญลักษณ์แบบโทเคนเดียว: A–Z จากนั้น a–z จากนั้น 0–9. เพดาน 62 ตัวเลือกนี้ไม่ใช่ความชอบด้านการออกแบบ แต่เป็นจำนวนสัญลักษณ์แบบโทเคนเดียวที่สัญญาสามารถอ้างอิงได้พอดี.
• พรอมต์ระบบ สถานะ สคีมา และโครงร่าง JSON ของผู้ช่วยที่สมบูรณ์จะถูกเรนเดอร์ด้วยหนึ่ง<decision> ตัวยึดตำแหน่งต่อฟิลด์ แม่แบบแชทของ checkpoint และบล็อกความคิดว่างเปล่าจะถูกเก็บไว้ตามเดิม
• มีการรัน forward pass แบบ causal หนึ่งครั้ง โดยอ่าน logits ณ ตำแหน่งที่อยู่ก่อนแต่ละ placeholder ทันที — ไม่ใช่หลังตำแหน่งนั้น และไม่ใช่ที่โทเคนที่ถูกสร้างขึ้น
• จะทำ softmax เฉพาะเหนือสัญลักษณ์ตัวเลือกที่ได้รับอนุญาตของฟิลด์นั้นเท่านั้น จากนั้นจึงใช้การปรับคาลิเบรชันของ checkpoint และสัญลักษณ์เหล่านั้นจะถูกแมปกลับไปยังค่าตัวเลือกดั้งเดิมของคุณ
การ์ดนี้ตรงไปตรงมาเกี่ยวกับสิ่งที่เป็น: "API นี้ทำการให้คะแนนผู้สมัครแบบมีโครงสร้าง มันไม่เรียก generate() หรือสุ่มข้อความอิสระ" DecisionEngine(max_length=8192) ปฏิเสธอินพุตที่มีขนาดใหญ่เกินไปแทนที่จะตัดทอนมัน ดังนั้นคำขอที่ไม่พอดีจะล้มเหลวอย่างชัดเจนแทนที่จะสูญเสียย่อหน้าสุดท้ายไปอย่างเงียบๆ รายการแบ็กเอนด์ก็ซื่อสัตย์เช่นกัน — backend="hf" เป็นค่าเริ่มต้นและเป็นเพียงหนึ่งเดียวที่มีให้ใช้ในที่เก็บ Hugging Face ซึ่งน่าจะรู้ไว้เพราะการเผยแพร่บน GitHub มีแบ็กเอนด์ XTuner ด้วยเช่นกัน และทั้งสองไม่ได้เหมือนกันในเชิงตัวเลข คู่มือการประเมินของ InternLM เองก็กล่าวไว้เช่นนั้น: "ความแตกต่างของ Kernel และ BF16 สามารถเปลี่ยนความน่าจะเป็นและบางครั้งก็เปลี่ยนป้ายกำกับ"
ความผิดปกติตรงกลาง
วางเช็คพอยต์ทั้งสามไว้เคียงข้างกันบนตารางของ InternLM เอง แล้วรูปร่างที่ได้ก็แปลกพอที่จะเป็นประเด็นหลัก
• ค่าเฉลี่ยจากเจ็ดชุดทดสอบ — Intern-Decision-0.8B 79.38, Intern-Decision-2B 84.68, Intern-Decision-4B 90.02 เรียงตามลำดับ อย่างที่คุณคาดไว้จากการเพิ่มขนาดน้ำหนัก
• ความหน่วงบน RTX 4090 หนึ่งตัว — ค่าเฉลี่ย 33.98 ms สำหรับ 0.8B, 33.28 ms สำหรับ 2B, 44.16 ms สำหรับ 4B ขนาดกลางเป็นรุ่นที่เร็วที่สุดในสามรุ่น โดยมีส่วนต่างเล็กพอที่จะเป็นสัญญาณรบกวนบน GPU ตัวเดียว แต่สม่ำเสมอทั้งค่าเฉลี่ย มัธยฐาน (33.15 ms) และ P95 (33.55 ms)
• คะแนน Brier ยิ่งต่ำยิ่งดี — 0.530, 0.437, 0.347 แปรผันแบบโมโนโทนตามขนาด อย่างที่กฎการให้คะแนนที่เหมาะสมมักเป็น
• ค่าความคลาดเคลื่อนการคาลิเบรตที่คาดหวัง ยิ่งต่ำยิ่งดี — 0.066 สำหรับ 0.8B, 0.100 สำหรับ 2B นี้, 0.065 สำหรับ 4B ขนาดกลางนั้นแย่ที่สุด และแย่ยิ่งกว่าโมเดลที่มีขนาดเพียงครึ่งหนึ่งของมัน
บรรทัดสุดท้ายคือบรรทัดที่น่าสนใจ และอุณหภูมิที่ฟิตได้ช่วยยืนยันมากกว่าจะอธิบายมัน แต่ละเช็กพอยต์มีอุณหภูมิที่ฟิตด้วย NLL ของตัวเอง: 2.747760550703 สำหรับ 0.8B, 2.100509348278 สำหรับ 2B, 1.992418 สำหรับ 4B ทุกค่าถูกฟิตบนเคสสอบเทียบที่กำหนดไว้ 1,728 เคส โดยกันไว้ 1,693 เคส ด้วยการลด negative log-likelihood ให้ต่ำที่สุดผ่านการค้นหาอุณหภูมิผกผันในช่วง [0.01, 100] โดยจงใจกันป้ายกำกับของชุดทดสอบออกจากการฟิต อุณหภูมิของ 2B อยู่ระหว่างพี่น้องสองตัวของมัน ซึ่งเป็นสิ่งที่คุณน่าจะคาดหมายหากความผิดปกตินั้นเป็นอาร์ติแฟกต์จากการฟิต แต่มันไม่ใช่: ค่าที่ฟิตได้เป็นโมโนโทนตามขนาด ขณะที่ข้อผิดพลาดหลังการสอบเทียบไม่เป็นเช่นนั้น จากการวัดของ InternLM เอง เช็กพอยต์ขนาด 2.2 พันล้านพารามิเตอร์เป็นตัวที่น่าเชื่อถือน้อยที่สุดในสามตัว เมื่อมันบอกคุณว่ามันมั่นใจแค่ไหน
ข้อควรระวังสองประการก่อนที่สิ่งนั้นจะกลายเป็นข้อสรุป ECE ที่ใช้สิบถังความกว้างเท่ากันและความเชื่อมั่นแบบความน่าจะเป็นสูงสุดเป็นสถิติที่มีสัญญาณรบกวนบนชุดทดสอบขนาดเล็กที่ตารางนี้ใช้ — Jevbench-Hard, 111 รายการ ดังนั้นคอลัมน์ ECE ทั้งหมดจึงขึ้นอยู่กับคำถามประมาณหนึ่งร้อยข้อและการเลือกถัง และ internlm/Intern-Decision-2Bเป็นการ์ดเพียงใบเดียวในสามใบที่ไม่มีส่วนการคาลิเบรตเพิ่มเติมที่การ์ด 4B มี ดังนั้นจึงมีเอกสารน้อยกว่าที่นี่ ไม่มากกว่า จงอ่านค่า 0.100 เป็นเหตุผลในการปรับอุณหภูมิของคุณเอง มากกว่าที่จะเป็นคำตัดสินเกี่ยวกับน้ำหนัก

สิ่งที่รีโพซิทอรีเพิ่มเข้ามา และสิ่งที่มันยังคงไม่เปิดเผย
รีลีสบน GitHub สมบูรณ์กว่าการ์ดโมเดล ซึ่งตัวมันเองก็ให้ข้อมูลที่มีประโยชน์อยู่แล้ว — ห้องแล็บที่ตั้งใจทำอาร์ติแฟกต์สำหรับเปเปอร์มักไม่ส่งตัวสร้างการปรับเทียบแบบดีเทอร์มินิสติกและชุดประเมินที่ตรวจสอบแฮชมาพร้อมกับตัวเรียกใช้การฝึก
สิ่งที่เปิดเผยต่อสาธารณะแล้ว: โค้ดการฝึกและวัตถุประสงค์แบบ masked-next-token (สัญลักษณ์คำตอบที่เป็นเฉลยปรากฏเฉพาะในป้ายกำกับ ไม่เคยอยู่ในอินพุต; คำตอบของแต่ละฟิลด์ถูกทำนายด้วย logit ที่อยู่ก่อนเครื่องหมายของฟิลด์นั้นทันที และทุกฟิลด์ใช้ forward pass ครั้งเดียวร่วมกัน); ชุดทดสอบความแม่นยำทั้งเจ็ดชุดพร้อมแฮชที่ตรวจสอบด้วย SHA-256 และจำนวนแถว; โค้ดการให้คะแนน; สคริปต์การปรับอุณหภูมิและการเล่นซ้ำ โดยการเล่นซ้ำได้รับการยืนยันว่าเปลี่ยนศูนย์การตัดสินใจ; เกณฑ์มาตรฐานการปรับเทียบการกระจายแบบ 96 กรณีพร้อมเครื่องมือสร้างและตัวให้คะแนนแบบออฟไลน์; และเดโมเบราว์เซอร์ที่ให้บริการบนลูปแบ็กด้วย POST /v1/decisions (มีนามแฝงเป็น /v1/jev).
สิ่งที่ถูกยกเว้นอย่างชัดเจน ตามถ้อยคำของรีพอซิทอรีเอง: "ข้อมูลสำหรับฝึก บันทึกการคาลิเบรชัน/ตรวจสอบภายใน รูปภาพ ไปป์ไลน์การเตรียมข้อมูล และน้ำหนักโมเดลไม่ถูกรวมไว้" รีพอซิทอรีนี้ไม่มีไฟล์สัญญาอนุญาตเลย ดังนั้นข้อกำหนดของโค้ดจึงไม่ถูกระบุ แม้ว่าน้ำหนักโมเดลจะเป็น Apache-2.0 และองค์ประกอบของการแบ่งชุดคาลิเบรชัน — ซึ่งมี 1,728 เคส จากที่ใด — ยังไม่ถูกเปิดเผย ซึ่งเป็นการละเว้นเพียงจุดเดียวที่จำกัดว่าค่า ECE จะถูกตรวจสอบได้มากเพียงใด
ขนาดที่เราเดินเส้นทางจริง และขนาดที่เราไม่ได้เดินเส้นทาง
Intern-Decision-2B ไม่ได้อยู่บน OrcaRouter หน้าโมเดลของเราสำหรับมันคืนค่า 404 ไม่มีเอนด์พอยต์ที่โฮสต์ไว้ที่ไหนเลยสำหรับมันที่เราหาเจอ และไม่มีอะไรในที่นี้ควรถูกตีความว่าเป็นการอ้างถึงความพร้อมใช้งาน วิธีเดียวที่จะเรียกใช้มันได้ในวันนี้คือดาวน์โหลดเช็กพอยต์และรัน inference.py ไว้ข้างไฟล์เวท
เรื่องนี้สำคัญต่อการตัดสินใจที่บทความนี้มุ่งเสนอจริง ๆ เพราะตัวให้คะแนนที่ไม่มีใครให้บริการ ก็คือตัวให้คะแนนที่คุณต้องดำเนินการเอง หากการตัดสินใจแบบเซตปิดที่คุณกำลังพยายามทำอยู่มีรูปแบบใกล้เคียงกับสิ่งที่ตระกูลนี้ทำ — สถานะ คำถามที่มีการระบุชนิด ความน่าจะเป็นที่คาลิเบรตแล้ว — ตัวเปรียบเทียบแบบโฮสต์คือ TypeSafe's Jev 1.13 ซึ่งเป็นโมเดลที่ InternLM ตั้งใจใช้เป็นคู่เปรียบเทียบโดยเจตนา และเป็นโมเดลที่อยู่บน OrcaRouter ในราคา $0.042 ต่ออินพุตหนึ่งล้านโทเคน พร้อมบริบท 65K และค่า P50 ของเวลาถึงโทเคนแรกที่ 178 ms

การรันเช็กพอยต์ขนาด 2.2 พันล้านพารามิเตอร์บนเครื่องโลคัล กับการเรียกตัวจำแนกประเภทที่โฮสต์ไว้ ไม่ใช่การซื้อแบบเดียวกัน แต่เป็นปัญหาเดียวกัน และการมีทั้งสองอย่างไว้บนคีย์เดียวด้วยราคาตั้งต้นของผู้ให้บริการที่ส่งผ่านโดยบวกเพิ่ม 0%คือเหตุผลที่ควรเปิดการเปรียบเทียบไว้ มากกว่าการเดิมพันสถาปัตยกรรมกับสิ่งใดสิ่งหนึ่งในสองสิ่งนั้น
อะไรจะเปลี่ยนแปลงภาพนี้
สามอย่าง ตามลำดับ
ใครที่อยู่นอก InternLM จำเป็นต้องทำซ้ำค่าเฉลี่ย 84.68 และ ECE 0.100 ให้ได้ และตอนนี้รีโพซิทอรีคือสิ่งที่ทำให้เรื่องนั้นเป็นไปได้ — ซึ่งนั่นคือข่าวจริงตรงนี้ ข้อสอบเปิดเผยต่อสาธารณะและตรวจสอบด้วยแฮชแล้ว สิ่งที่ยังขาดมีเพียงเฉลยเท่านั้น และเฉลยก็คือเช็กพอยต์ที่ใคร ๆ ก็ดาวน์โหลดได้แล้วในตอนนี้
ผู้ขายจำเป็นต้องบอกว่านี่มีไว้เพื่ออะไร โมเดลที่มีสแตกการฝึกที่ใช้งานได้ ชุดประเมินที่เผยแพร่แล้ว แต่ไม่มีการประกาศ ไม่มีสัญญาอนุญาตบนโค้ด และไม่มีเอนด์พอยต์ที่โฮสต์ไว้ ย่อมดูเหมือนเป็นการเผยแพร่เพื่อการวิจัยที่ยังไม่ได้ตัดสินใจให้เป็นผลิตภัณฑ์ น้ำหนัก Apache-2.0 ชี้ไปทางหนึ่ง ส่วนสัญญาอนุญาตโค้ดที่ขาดหายและ 401 Space ชี้ไปอีกทางหนึ่ง
และขนาดกลางจำเป็นต้องมีเหตุผลในการดำรงอยู่ หากความได้เปรียบด้านความเร็วของ 2B เหนือ 0.8B นั้นเป็นจริงแต่ก็เพียงเล็กน้อย และการคาลิเบรตของมันอ่อนแอที่สุดในบรรดาทั้งสามในทุกมาตรวัดที่ InternLM เผยแพร่ ดังนั้นคำแนะนำที่ตรงไปตรงมาสำหรับผู้อ่านส่วนใหญ่คือ จ่ายพื้นที่ดิสก์เพิ่มขึ้น 2.6 เท่าเพื่อใช้ 4B หรือยอมรับความแม่นยำที่อ่อนกว่าของโมเดลที่เล็กกว่า ข้อสนับสนุนสำหรับ 2B คือมันบังเอิญเป็นตัวที่เร็วที่สุดในกลุ่มที่เร็ว — และนั่นเป็นข้อสนับสนุนที่บางเบากว่าที่การวางกรอบแบบการตลาดของตระกูลนี้ชี้ให้เห็น
