
Intern-Decision-4B กับ Qwen 3.8: การส่งผ่านไปข้างหน้า 44 มิลลิวินาที เทียบกับพารามิเตอร์ 2.4 ล้านล้านตัว
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 592 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 187 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
InternLM เผยแพร่ Intern-Decision-4B บน Hugging Face เมื่อเช้าวันที่ 26 กันยายน 2026 — ไม่มีโพสต์เปิดตัว ไม่มีบล็อก ลิงก์ GitHub บนการ์ดโมเดลของตัวเองที่คืนค่า 404 และเดโม Space ที่คืนค่า 401 น้ำหนักเป็นของจริงและดาวน์โหลดได้ แต่ประกาศไม่มีอยู่ และโมเดลที่อยู่ข้างใต้พวกมันคือไฟน์จูนของ Qwen3.5-4B ซึ่งเป็นสิ่งที่ทำให้การเปรียบเทียบกับเรือธงที่โฮสต์ไว้มีค่ามากกว่าสเปกชีต สองสิ่งนี้ไม่ใช่คู่แข่ง พวกมันเป็นสองปลายทางของไปป์ไลน์เดียว และคำถามทั้งหมดคือเส้นแบ่งระหว่างพวกมันอยู่ตรงไหน แกนกลางที่แท้จริงคือโมเดล 2.4 ล้านล้านพารามิเตอร์ที่ผู้พัฒนเผยแพร่ในเดือนสิงหาคม และตอนนี้ให้บริการในชื่อ Qwen3.8-Max คิดค่าบริการที่ $2.00 และ $6.00 ต่อล้านโทเค็น; Intern-Decision-4B เป็นการสร้างใหม่แบบ 4.54 พันล้านพารามิเตอร์ของโมเดลฐานอายุเจ็ดเดือนนั้น ซึ่งไม่ปล่อยโทเค็นเลย ตอบคำถามที่มีชนิดได้ถึงสิบหกข้อในฟอร์เวิร์ดพาสครั้งเดียว และไม่มีค่าใช้จ่ายต่อการเรียกใช้เพราะไม่มีเอาต์พุตให้คิดค่าบริการ
คำตอบแบบบรรทัดเดียว: หากงานของคุณคือการตัดสินใจที่มีชุดคำตอบปิดตายตัว Intern-Decision-4B จะเร็วกว่าประมาณห้าสิบเท่าต่อการตัดสินใจหนึ่งครั้ง และมีต้นทุนต่ำกว่าในเชิงโครงสร้าง และจะไม่มีโมเดลระดับแนวหน้าใดเอาชนะมันได้ในแกนแคบ ๆ นั้น หากงานของคุณเป็นอย่างอื่น — การให้เหตุผล บริบทยาว การใช้เครื่องมือ อะไรก็ตามที่คำตอบยังไม่ได้ถูกแจกแจงไว้ในพรอมป์ตของคุณอยู่แล้ว — Qwen 3.8 ไม่ได้แค่ดีกว่าเท่านั้น แต่เป็นเพียงหนึ่งเดียวในสองตัวนี้ที่ทำงานนั้นได้เลย ทุกอย่างด้านล่างนี้是关于การระบุเส้นแบ่งนั้นให้แม่นยำ
อะไรที่ได้รับการยืนยันจริง ๆ และอะไรที่ยังไม่ได้รับการยืนยัน
เริ่มจากหลักฐานก่อน เพราะการวางกรอบเรื่องนี้สำคัญ ไม่มีประกาศจากผู้พัฒนาใด ๆ สำหรับ Intern-Decision-4B ไม่มีข่าวประชาสัมพันธ์ ไม่มีบทความ ไม่มีคำอธิบายรีโพซิทอรีให้อ่าน สิ่งที่มีอยู่ในวันนี้คือรีโพซิทอรี Hugging Face ที่เผยแพร่เมื่อเช้านี้ภายใต้องค์กร internlm — Intern Large Models กลุ่มของ Shanghai AI Laboratory — ซึ่งใช้สัญญาอนุญาต Apache 2.0 พร้อมกับสัญญาอนุญาต Qwen ต้นทางที่เก็บรักษาไว้เคียงข้างในชื่อ LICENSE-QWEN มีเช็กพอยต์พี่น้องสองตัวปรากฏขึ้นห่างกันภายในสี่สิบวินาที: Intern-Decision-0.8B ที่ 853 ล้านพารามิเตอร์ และ Intern-Decision-2B ที่ 2.21 พันล้าน ทั้งสามตัวมีแท็กเดียวกัน — การตัดสินใจ, มัลติโมดัล, การทำนายแบบมีโครงสร้าง — และทั้งสามตัวอยู่ภายใต้คอลเลกชันโมเดลเดียวที่ยังไม่สามารถเข้าถึงได้แบบสาธารณะ
สิ่งที่ยังไม่ได้รับการยืนยัน: นี่คือรุ่นที่เผยแพร่เสร็จสมบูรณ์แล้วหรือเป็นการปล่อยก่อนกำหนด รีโพซิทอรีถูกสร้างเมื่อ 05:36 UTC และถูกแก้ไขอีกครั้งก่อน 08:00 UTC ในวันเดียวกัน และกิจกรรมสาธารณะเพิ่มเติมบนเช็กพอยต์ที่อยู่ในกลุ่มเดียวกันยังคงดำเนินต่อไปหลัง 09:00 InternLM ยังไม่ได้ระบุว่าแผนการนำไปใช้งานที่ตั้งใจไว้คืออะไร ยังไม่ได้เผยแพร่รีโพซิทอรีที่ลิงก์ไปถึง และยังไม่ได้ระบุว่าจะมีเอนด์พอยต์แบบโฮสต์ตามมาหรือไม่ ให้ถือว่าตัวเลข benchmark ทุกตัวในบทความนี้เป็นข้อมูลที่ผู้ขายรายงานเองและยังไม่มีการทำซ้ำ — เพราะ ณ เวลาที่เขียนนี้ ไม่มีข้อความอื่นใดเลยเกี่ยวกับโมเดลนี้ถูกเขียนขึ้นที่ใดเลย เส้นทางการค้นหาสามเส้นทางที่แยกจากกันไม่ให้ผลลัพธ์ใด ๆ เกี่ยวกับชื่อนี้

เดิมพันเชิงสถาปัตยกรรม: ตัวให้คะแนน ไม่ใช่ตัวสร้าง
ประโยคที่สำคัญที่สุดในเอกสารของ Intern-Decision-4B เองคือประโยคปฏิเสธ: เส้นทางการอนุมาน "ไม่เรียก generate() หรือสุ่มข้อความแบบอิสระ" นั่นไม่ใช่รายละเอียดการอิมพลีเมนต์ แต่มันคือการออกแบบทั้งหมด และเป็นสิ่งที่ทำให้สิ่งนี้แตกต่างจากการเรียกใช้ Qwen3.8-Max ด้วย JSON schema แล้วหวังว่าวงเล็บปีกกาจะปิด
นี่คือกลไกอย่างที่การ์ดอธิบายไว้ คุณป้อนสถานะที่ใช้ร่วมกัน สคีมาของคำถามที่ตั้งชื่อไว้ และรูปภาพไม่เกินแปดรูป (เป็นทางเลือก) ให้กับโมเดล คำถามแต่ละข้อเป็นหนึ่งในสามประเภท: choice (เลือกหนึ่งจากชุดตัวเลือกที่มีลำดับ), score (ให้คะแนนบนมาตรวัดเชิงอันดับ โดยคืนค่าเป็นค่าคาดหวังถ่วงน้ำหนักด้วยความน่าจะเป็น) หรือ noul (ไบนารี ไม่/ใช่) พร้อมต์ระบบ สถานะ สคีมา และโครงร่าง JSON ของผู้ช่วยแบบสมบูรณ์จะถูกเรนเดอร์โดยมีที่ยึดตำแหน่งหนึ่งอันต่อหนึ่งฟิลด์ จากนั้น — และนี่คือกลเม็ด — โมเดลจะรัน causal forward pass เพียงครั้งเดียว และอ่านค่า logits ณ ตำแหน่งที่อยู่ก่อนหน้าตัวยึดตำแหน่งแต่ละอันทันที จากนั้นทำ softmax เฉพาะเหนือสัญลักษณ์ตัวเลือกที่ฟิลด์นั้นอนุญาต นำการปรับเทียบของเช็กพอยต์มาใช้ และแมปสัญลักษณ์กลับไปเป็นค่าตัวเลือกดั้งเดิมของคุณ
ผลที่ตามมานั้นเป็นรูปธรรม เพราะพื้นที่คำตอบของแต่ละฟิลด์ถูกประกอบขึ้นต่อคำขอ แทนที่จะถูกฝังตายตัวไว้ใน vocabulary head สคีมาที่คุณคิดขึ้นบ่ายนี้จึงไม่ต้องฝึกใหม่ — เพิ่มคำถาม ตัวเลือกก็กลายเป็นสัญลักษณ์ตัวเลือกสำหรับฟิลด์นั้น เพราะไม่มีลูปถอดรหัส จึงไม่มีโทเคนเอาต์พุต ไม่มีเครื่องหมายปีกกาที่ต้องลืม และไม่มีตรรกะการลองใหม่รอบ JSON ที่ผิดรูปแบบ และเพราะคำถามทั้งหมดถูกให้คะแนนจากการอ่านสถานะครั้งเดียวกัน คำถามสิบหกข้อจึงมีต้นทุนเป็น forward pass เพียงหนึ่งครั้ง ไม่ใช่สิบหกครั้ง
ขีดจำกัดก็ชัดเจนเป็นรูปธรรมไม่แพ้กัน และการ์ดก็ระบุไว้อย่างไม่มีการเลี่ยง หนึ่งถึงสิบหกคำถาม สูงสุด 62 ตัวเลือกต่อคำถาม สูงสุดแปดภาพ ค่าสูงสุดเริ่มต้นที่ 8,192 โทเคน — และอินพุตที่เกินกว่านั้นจะถูกปฏิเสธโดยไม่มีการตัดทอนอนุประโยคสุดท้ายนั้นเป็นการตัดสินใจเชิงออกแบบที่ควรค่าแก่การครุ่นคิด: การตัดทอนแบบเงียบคือวิธีที่ตัวจำแนกตอบคำถามที่แตกต่างจากคำถามที่คุณถามอย่างเงียบ ๆ และ InternLM เลือกที่จะล้มเหลวอย่างเสียงดังแทน มันเป็นการตัดสินใจที่ถูกต้อง และมันเป็นกับดักในการปฏิบัติงาน เพราะตั๋วแบบยาวบวกสคีมาบวกภาพจะเกิน 8,192 เร็วกว่าที่คุณคาด และไม่มีเส้นทางที่ราบรื่น — คุณจะเจอข้อผิดพลาด
จุดที่ Intern-Decision-4B ชนะ และไม่ได้สูสีเลย
สองแกน และทั้งสองเป็นเรื่องเชิงโครงสร้างมากกว่าการเพิ่มทีละน้อย
• ความหน่วงต่อการตัดสินใจ — ค่าเฉลี่ย 44.16 ms, มัธยฐาน 44.03 ms, 44.60 ms ที่ p95 วัดบน RTX 4090 ตัวเดียวผ่านเส้นทาง Hugging Face ภายในเครื่อง เมื่อเทียบกับ Qwen3.8-Max ซึ่งหน้าต่างเจ็ดวันแบบเรียลไทม์บน playground ของเราแสดงค่า p50 ที่ 2,474 ms และ p95 ที่ 9,789 ms ที่ 55.4 โทเคนเอาต์พุตต่อวินาที นั่นคิดเป็นประมาณ 56 เท่าที่มัธยฐาน และการเปรียบเทียบนี้ไม่ได้ไม่ยุติธรรมเท่าใดนัก หากแต่เป็นการเปรียบเทียบระหว่างการดำเนินการที่แตกต่างกันสองอย่าง: โมเดลหนึ่งจำแนกประเภท อีกโมเดลให้เหตุผลแล้วจึงเขียน ช่องว่างนี้มีอยู่จริง และเหตุผลของมันก็เช่นกัน
• ต้นทุนต่อการตัดสินใจ — และอันนี้เป็นเลขคณิต ไม่ใช่ความเห็น ลองนึกถึงการเรียกใช้คัดแยกงานสนับสนุนที่สมจริง: โทเค็นอินพุต 800 โทเค็นสำหรับ state และ schema และโทเค็นเอาต์พุต 150 โทเค็นสำหรับ JSON แบบมีโครงสร้าง บน Qwen3.8-Max นั่นคือ 800 × $2.00/M บวก 150 × $6.00/M หรือประมาณ $0.0025 ต่อการตัดสินใจ ก่อนจะนับโทเค็นการให้เหตุผลแม้แต่โทเค็นเดียว — และ Qwen3.8-Max เป็นโมเดลที่ให้เหตุผล ดังนั้นฝั่งเอาต์พุตจึงเล็กแบบมองในแง่ดี หนึ่งล้านการตัดสินใจมีค่าใช้จ่ายประมาณ $2,500 หนึ่งล้านการตัดสินใจเดียวกันบน Intern-Decision-4B มีค่าโทเค็นเป็นศูนย์ และใช้เวลา RTX 4090 ประมาณ 12.3 ชั่วโมง Intern-Decision-4B ไม่มีราคาเอาต์พุต เพราะมันไม่มีเอาต์พุต
ข้อแลกเปลี่ยนนี้ตรงไปตรงมาและชัดเจน: 4B ต้องใช้ GPU ที่คุณเป็นเจ้าของหรือเช่า มันครอบครอง GPU นั้น และมันทำได้เพียงสิ่งเดียวเท่านั้น แต่ถ้าสิ่งเดียวนั้นคือสิ่งที่ผลิตภัณฑ์ของคุณทำหลายล้านครั้งต่อวัน การคำนวณข้างต้นก็คือเหตุผลทางธุรกิจทั้งหมด และไม่ว่าความสามารถของโมเดลระดับแนวหน้าจะมีมากเพียงใดก็ไม่เปลี่ยนสิ่งนั้น
ตัวเลขที่ Qwen 3.8 ไม่เผยแพร่: การสอบเทียบ
นี่คือปัจจัยสร้างความแตกต่างแบบเงียบ ๆ และเป็นสิ่งหนึ่งที่การเปรียบเทียบส่วนใหญ่จะมองข้าม เพราะมันไม่ได้ดูเหมือนเกณฑ์มาตรฐาน
Intern-Decision-4B ส่งคืนการแจกแจงเหนือค่าของตัวเลือกคุณ ไม่ใช่แค่ป้ายกำกับ — พร้อมทั้งค่าความเชื่อมั่น และสำหรับคำถามnoul ความน่าจะเป็นของการตอบว่าใช่ที่ผ่านการคาลิเบรตแล้ว InternLM รายงานคะแนน Brier ที่ 0.347 และค่าความคลาดเคลื่อนคาลิเบรชันที่คาดหวังที่ 0.065 ทั่วชุดของตัวเอง และแนบอุณหภูมิที่ฟิตไว้ในเช็กพอยต์: 1.99241824 โดยฟิตแยกต่างหากสำหรับขนาดนี้ผ่านการลด negative log-likelihood ให้ต่ำสุดบน 1,728 กรณีคาลิเบรชันที่กำหนดไว้ พร้อมด้วย 1,693 กรณีตรวจสอบที่กันไว้ ไม่ได้ใช้ป้ายกำกับของชุดทดสอบในการเลือกค่านี้ มีการวินิจฉัยชุดที่สองที่เป็นอิสระจำนวน 96 กรณีในโมเดลการ์ด โดยใช้การแจกแจงอ้างอิงแบบแม่นตรงแทนป้ายกำกับที่สุ่มมา และแสดงให้เห็นว่า Brier/ECE โดยรวมเปลี่ยนจาก 0.628 / 0.213 ก่อนคาลิเบรชัน เป็น 0.550 / 0.089 หลังคาลิเบรชัน — ขั้นตอนคาลิเบรชันลดความคลาดเคลื่อนที่คาดหวังลงมากกว่าครึ่งอย่างชัดเจน
ตอนนี้ลองหาตัวเลขเดียวกันทางฝั่ง Qwen 3.8 ดูสิ มันไม่มีอยู่ตรงนั้น Alibaba เผยแพร่คะแนน Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking และ long-context recall ซึ่งล้วนเป็นตัวชี้วัดความสามารถทั้งสิ้น Alibaba ไม่เผยแพร่ตัวชี้วัดการปรับเทียบสำหรับสมาชิกใด ๆ ในตระกูล Qwen 3.8 เพราะความมั่นใจของโมเดลเจเนอเรทีฟไม่ใช่ปริมาณที่ผู้ขายส่งมอบมาให้ หากระบบของคุณต้องการความน่าจะเป็นที่ใช้กำหนดเกณฑ์ตัดสินหรือใช้จัดเส้นทาง แทนที่จะเป็นคำตอบที่ต้องเชื่อใจ ความแตกต่างนั้นไม่ใช่เรื่องของระดับความมากน้อย โมเดลหนึ่งให้ตัวเลขพร้อมอัตราความผิดพลาดที่มีการบันทึกเอกสารไว้ ส่วนอีกโมเดลให้ข้อความ และคุณต้องสร้างการประเมินความมั่นใจของคุณเองขึ้นมาครอบมัน
ในจุดที่ Qwen 3.8 ชนะ และไม่ใช่แบบสูสีเลยด้วย
พอวางสองอย่างนี้เทียบกันในเรื่องสิ่งที่อาจถูกขอให้ทำ เส้นแบ่งก็จะไม่ละเอียดอ่อนอีกต่อไป
• บริบท — Qwen3.8-Max มีหน้าต่างบริบทขนาด 1,000,000 โทเคน ส่วน Intern-Decision-4B จะปฏิเสธทุกอย่างที่เกิน 8,192 นั่นคิดเป็น 122 เท่า และไม่มีทางหลีกเลี่ยงได้ เพราะเพดานอินพุตถูกบังคับใช้จริง แทนที่จะตัดทอน
• รูปแบบอินพุต — Qwen3.8-Max รับข้อความ รูปภาพ และวิดีโอ ส่วน Intern-Decision-4B รับข้อความและรูปภาพ สูงสุดแปดรูป และโทเคนของรูปภาพจะนับรวมกับงบประมาณ 8,192 เดียวกัน
• การให้เหตุผลและเครื่องมือ — Qwen3.8-Max มีการใช้เครื่องมือ โหมด JSON และการให้เหตุผลอยู่ในขีดความสามารถที่ประกาศไว้ และมีคะแนน Artificial Analysis Intelligence Index ที่ 45.4 เป็นอันดับที่ 15 จาก 145 โมเดลที่ถูกจัดอันดับ โดยมีคะแนน AA Coding ที่ 76.2 อยู่ในอันดับที่ 9 จาก 138 ตัวเลขเหล่านี้เป็นตัวเลขอิสระที่เผยแพร่โดย Artificial Analysis ไม่ใช่คำกล่าวอ้างของผู้ขาย Intern-Decision-4B ไม่มีรายการใน Artificial Analysis ไม่มีคะแนนอิสระใด ๆ และไม่มีความสามารถในการให้เหตุผล วางแผน หรือเรียกใช้งานสิ่งใด
• เอาต์พุตแบบเปิดกว้าง — Qwen3.8-Max เขียนได้ ส่วน Intern-Decision-4B ไม่สามารถสร้างย่อหน้า เหตุผลประกอบ หรือแผนได้ มันทำได้เพียงให้คะแนนตัวเลือกที่คุณคิดจะระบุไว้แล้วเท่านั้น
น่าจดบันทึกไว้ในฝั่ง open-weights ด้วยเช่นกัน: หากคุณต้องการตัวคอร์ Qwen 3.8 เอง ไม่ใช่เส้นทางแบบ hosted แล้ว Qwen3.8-27B คือพี่น้องแบบ dense — 27.8 พันล้านพารามิเตอร์, Apache 2.0, คอนเท็กซ์ 262,144 โทเคน และประมาณ $0.33 / $2.40 ต่อล้านโทเคนในที่ที่ให้บริการ มันทำคะแนนได้ 33.7 บน AA Intelligence Index มันยังมีขนาดใหญ่กว่า Intern-Decision-4B ราวหนึ่งลำดับขนาด ยังเป็นแบบ generative และยังคงเป็นเครื่องมือที่ผิดสำหรับการตัดสินใจแบบ closed-set ในปริมาณมาก — แต่มันคือตัวเลือกตรงกลางที่ซื่อสัตย์ และเป็นตัวเดียวในสามตัวที่ทั้งถูกจริงและเก่งจริงพร้อมกันในคราวเดียว

อ่านตาราง benchmark ของ InternLM เองอย่างตรงไปตรงมา
การ์ดของ Intern-Decision-4B มีตารางเปรียบเทียบอยู่ และสิ่งที่ขาดหายไปจากตารางนั้นให้ข้อมูลได้มากกว่าสิ่งที่มีอยู่ในตารางเสียอีก แถวต่าง ๆ ได้แก่ Jev, Laya, SemIf, Kev, JevK5 และ 0.8B กับ 2B ของ InternLM เอง ทุกรายการล้วนเป็นรายการของ System One หรือโมเดลตัดสินใจอีกรายการหนึ่ง — Jev จาก TypeSafe AI, Laya จาก Convai Innovations และอีกสามรายการ ตัวเลขทุกตัวเป็นข้อมูลที่ผู้ขายรายงานบนฮาร์เนสของ InternLM เอง ไม่มีโมเดลระดับแนวหน้าในตารางเลยแม้แต่ตัวเดียว
นั่นไม่ใช่การมองข้าม มันคือขอบเขตของข้อกล่าวอ้างตามจริง ค่าเฉลี่ยหลักของ Intern-Decision-4B ที่ 90.02 จากเจ็ดชุดทดสอบ — Jevbench-Easy 100.00, Jevbench-Original 98.61, Jevbench-Hard 73.87, Typed Decision 80.55, ToolACE 96.45, AG News 90.82, WildJailBreak 89.86 — เป็นข้อกล่าวอ้างว่าจะเป็นผู้นำในหมวดหมู่โมเดลเพื่อการตัดสินใจ ซึ่งเป็นเช่นนั้นจริงในตารางนี้ โดยเอาชนะค่า 88.74 ของ Jev และค่า 57.77 ของ Laya ไม่ใช่ข้อกล่าวอ้างว่าจะแข่งขันกับ Qwen 3.8 และ InternLM ไม่ได้กล่าวอ้างเช่นนั้นที่ไหนเลย การ์ดโมเดลถูกจำกัดขอบเขตไว้ที่หมวดหมู่ของตัวเอง และการตีความชัยชนะในหมวดหมู่ให้เป็นชัยชนะด้านความสามารถคือความผิดพลาดที่ส่วนนี้มีอยู่เพื่อป้องกัน
ข้อควรระวังอีกสองประการ ตัวเลขความหน่วง — ค่าเฉลี่ย 44 มิลลิวินาทีบน 4090 — เป็นการวัดโดยผู้จำหน่าย ขึ้นอยู่กับภาระงานและฮาร์ดแวร์ และการทำ forward pass บน GPU ตัวเดียวไม่ใช่การวัดแบบเดียวกับการเรียก API ที่โฮสต์ไว้ซึ่งรวมการไปกลับผ่านเครือข่ายและการเข้าคิว และการนำร่องคาลิเบรชันมี 96 เคส เป็นการวินิจฉัย ไม่ใช่การวัดประสิทธิภาพ และการ์ดระบุไว้เช่นนั้น
คำถามเรื่องการนำไปใช้งาน ซึ่งเป็นทางแยกที่แท้จริง
ลืมเรื่องเบนช์มาร์กไปสักครู่ แล้วถามว่าจริง ๆ แล้วแต่ละอย่างเรียกร้องอะไรจากคุณในเชิงปฏิบัติ
Intern-Decision-4B มีขนาดประมาณ 9.1 GB บนดิสก์ที่ bf16 — สองแชร์ดภาษาที่ 4.26 GB และ 4.15 GB, วิชันทาวเวอร์ 612 MB และโปรเจกเตอร์ 54 MB มันโหลดผ่าน 16 KB inference.py ที่แนบมาในรีโพซิทอรีเอง โดยมี DecisionEngine คลาสที่คุณสร้างอินสแตนซ์ครั้งเดียวแล้วนำกลับมาใช้ซ้ำ ป้อน Python dict หนึ่งตัวเข้า รับ response dict หนึ่งตัวออก โดยต้องใช้ Python 3.12+ มันทำงานที่ 44 ms บน 4090 และรุ่นน้อง 0.8B นั้นเล็กพอที่จะให้เหตุผลบนเครื่องที่น้อยกว่ามาก แต่โมดูลคืออินเทอร์เฟซ — ไม่มีเซิร์ฟเวอร์ ไม่มีเอนด์พอยต์ที่เข้ากันได้กับ OpenAI และไม่มี API ที่โฮสต์ คุณกำลังสร้างบริการขึ้นมาครอบมัน และหากคุณต้องการสองตัวสำหรับ failover คุณก็ต้องสร้างส่วนนั้นด้วยเช่นกัน
ด้าน generative ของไปป์ไลน์เดียวกันเป็นการตัดสินใจที่แตกต่างออกไปโดยสิ้นเชิง และนั่นคือสิ่งที่เราเตอร์มีไว้เพื่อจริง ๆ Qwen3.8-Max และ Qwen3.8-27B ต่างก็เรียกใช้ได้บน OrcaRouter ภายใต้คีย์ที่เข้ากันได้กับ OpenAI คีย์เดียวกัน ในราคา ราคาตามรายการของผู้ให้บริการ โดยคิดกำไร 0% และส่งผ่านตรง — ดังนั้นเมื่อ Alibaba ปรับราคา Qwen ฝั่งเราก็อัปเดตทันทีในวันเดียวกัน ไม่ต้องรอรอบบิลถัดไป Intern-Decision-4B ไม่ใช่หนึ่งในเส้นทางของเรา และจะไม่เป็นจนกว่า InternLM จะโฮสต์มันที่ไหนสักแห่ง เราไม่คิดจะแกล้งทำเป็นอย่างอื่น สิ่งที่เราครอบคลุมคือครึ่งหนึ่งของไปป์ไลน์นี้ที่เป็นการเรียกผ่านเครือข่าย: คีย์เดียวสำหรับโมเดลกว่า 200 ตัว, การสลับสำรองอัตโนมัติหาก Qwen3.8-Max ทำงานเสื่อมลง — อัตราความผิดพลาดเจ็ดวันแบบเรียลไทม์ของมันอยู่ที่ 1.78% — และความสามารถในการทดสอบ A/B สองเทียร์ของ Qwen 3.8 เทียบกันในเส้นทางการร้องขอเดียวกันก่อนที่คุณจะตัดสินใจเลือกอันใดอันหนึ่ง
แพตเทิร์นไหนที่ควรค่าแก่การนำไปใช้ รันตัวให้คะแนนในเครื่อง เพราะมันถูกและเร็ว และทำงานแคบ ๆ อย่างหนึ่งได้ดี ส่วนขั้นตอนการให้เหตุผลให้จัดเส้นทางไปที่ผู้ให้บริการ เพราะนั่นคือจุดที่การเปลี่ยนผู้ขาย การตัดราคา และการล่มเกิดขึ้นจริง

อันไหนที่คุณควรเลือกจริง ๆ
เลือก Intern-Decision-4B หากการตัดสินใจของคุณเป็นแบบ closed-set คำตอบของคุณสามารถแจกแจงได้ครบทั้งหมดในพรอมต์ คุณต้องรันการตัดสินใจแบบเดิมในปริมาณมาก และคุณให้ความสำคัญกับความน่าจะเป็นพอ ๆ กับป้ายกำกับ การจัดเส้นทางตั๋ว การกลั่นกรองเนื้อหาตามอนุกรมวิธานที่กำหนดไว้ตายตัว การสกัดข้อมูลแบบมีโครงสร้างลงในสคีมาที่คุณควบคุมเอง เกณฑ์การให้คะแนน ประตูแบบไบนารี — อะไรก็ตามที่มนุษย์สามารถเขียนรายการตัวเลือกไว้ล่วงหน้าได้ พารามิเตอร์ 4.54 พันล้านตัวนั้นซื่อตรงเกี่ยวกับเพดานความสามารถ การ์ดของโมเดลเองแสดงให้เห็นว่า 4B ได้ 73.87 บน Jevbench-Hard เทียบกับ 100.00 บน Easy ดังนั้นยิ่งรูปแบบการตัดสินใจยากขึ้นเท่าใด โมเดลเล็กก็ยิ่งต้องยอมสละมากขึ้นเท่านั้น
เลือก Qwen 3.8 — หมายถึง Qwen3.8-Max หากคุณต้องการคอร์ที่โฮสต์ไว้ให้ หรือ Qwen3.8-27B หากคุณต้องการเวตที่คุณถือไว้เองได้ — หากคำตอบไม่สามารถแจกแจงล่วงหน้าได้ หากอินพุตยาวกว่า 8,192 โทเค็น หากคุณต้องการเหตุผลประกอบที่แสดงให้มนุษย์ดูได้ หากคุณต้องการการเรียกใช้เครื่องมือ หรือหากคุณต้องการวิดีโอ นอกจากนี้ยังเลือกมันได้หากคุณเพียงไม่ต้องการดูแล GPU: เวลาใช้งาน 4090 จำนวน 12.3 ชั่วโมงต่อการตัดสินใจหนึ่งล้านครั้งนั้นถูกก็ต่อเมื่อคุณมี 4090 อยู่แล้วและมีอย่างอื่นให้ทำกับมันในอีก 363 วัน
เลือกทั้งคู่ หากไปป์ไลน์ของคุณมีรูปร่างแบบที่ไปป์ไลน์ส่วนใหญ่เป็นจริง ๆ — ตัวจำแนกแบบเซตปิดราคาถูกอยู่ด้านหน้า และโมเดลระดับแนวหน้าอยู่ด้านหลังสำหรับเคสที่ตัวจำแนกไม่แน่ใจ นั่นคือการกำหนดค่าที่ความเชื่อมั่นที่ปรับเทียบแล้วของ Intern-Decision-4B ถูกสร้างมาเพื่อ และนั่นคือเหตุผลที่ตัวเลข ECE ข้างต้นสำคัญกว่าค่าเฉลี่ยพาดหัว
ดูอะไรดี
สามคำถามเปิดที่ทั้งหมดตอบได้ภายในไม่กี่วัน InternLM จะเผยแพร่ GitHub repository ที่การ์ดของตัวเองลิงก์ไปถึงหรือไม่ — ซึ่งตอนนี้เป็น 404 — พร้อมกับคำอธิบายการเทรนหรือไม่ จะมีประกาศตามหลังเวตหรือไม่ ซึ่งจะเปลี่ยนการ push เงียบ ๆ ให้กลายเป็น release ที่มีเอกสารกำกับหรือไม่ และมีสิ่งใดที่เป็นอิสระสามารถทำซ้ำค่าเฉลี่ย 90.02 หรือ Brier 0.347 บนฮาร์ดแวร์ที่ไม่ใช่ของ InternLM ได้หรือไม่
มีสิ่งที่ไม่สอดคล้องกันเล็กน้อยหนึ่งอย่างที่ควรสังเกตระหว่างที่คุณรอ เพราะมันเป็นเรื่องประเภทที่สำคัญเมื่อคุณกำลังประเมินขนาดการติดตั้งใช้งาน โมเดลนี้มีชื่อว่า 4B จำนวนพารามิเตอร์คือ 4,539,265,536 — 4.54 พันล้าน รุ่นพี่น้อง 0.8B มี 853 ล้าน และรุ่นพี่น้อง 2B มี 2.21 พันล้าน ทั้งคู่ปัดขึ้นหรือลงเพียงนิดเดียว มีเพียง 4B เท่านั้นที่ปัดลงมากกว่าครึ่งพันล้าน มันไม่ใช่ปัญหา มันเป็นเครื่องเตือนใจว่าในการเปิดตัวที่ยังไม่ประกาศ เอกสารคือสเปกเดียวที่คุณมี และแม้แต่เอกสารก็ยังถูกแก้ไขอยู่
