
Microsoft-Decision-1 vs Intern-Decision-0.8B: ครึ่งออนซ์แห่งปัญหาการ Jailbreak เมื่อเทียบกับความว่างเปล่าที่โฮสต์ไว้
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 55 tok/s
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
เริ่มจากคอลัมน์ที่โพสต์เปิดตัวคงไม่พูดถึง Intern-Decision-0.8B — โมเดลตัดสินใจขนาด 852,985,920 พารามิเตอร์ของ InternLM ซึ่งผ่านการปรับละเอียดจาก Qwen3.5-0.8B และอัปโหลดขึ้น Hugging Face เมื่อวันที่ 26 กันยายน 2026 โดยไม่มีการประกาศ ไม่มีเปเปอร์ และมีลิงก์ GitHub ที่ยังคง 404 — ถูกวัดได้ที่ 64.48 บน WildJailBreak เทียบกับค่าอ้างอิง 96.29 สำหรับ Jev 1.13 ของ TypeSafe นั่นไม่ใช่ความต่างจากการปัดเศษ มันคือการถดถอยอย่างรุนแรงของความทนทานต่อการปฏิเสธ (refusal robustness) ในโมเดลที่ทั้งหน้าที่ของมันคือการตัดสินอินพุต เผยแพร่บนการ์ดของเจ้าของโมเดลเอง ในตารางที่เกณฑ์วัดเป็นของคู่แข่ง ลองวางสิ่งนั้นเทียบกับ Microsoft-Decision-1 ซึ่งเปิดให้ใช้ทั่วไปบน Microsoft Foundry เมื่อวันที่ 8 ตุลาคม 2026 ในฐานะตัวให้คะแนนแบบข้อความล้วนที่ผ่านการฝึกต่อบน Qwen3.5-9B พร้อมวิธีการประเมินที่มีเอกสารกำกับ และไม่มีผลลัพธ์แม้แต่รายการเดียวพิมพ์อยู่ใต้มัน แล้วคุณจะเห็นรูปร่างที่แท้จริงของการจับคู่นี้ หนึ่งในโมเดลเหล่านี้จะบอกตัวเลขที่ทำให้มันดูแย่ อีกตัวจะบอกคุณว่ามันจะใช้เมตริกใด
การกลับด้านนั้นมีค่ามากกว่าสเปกชีต โมเดลทั้งสองรับสถานะและชุดคำถามที่มีขอบเขต แล้วคืนค่าความน่าจะเป็นเหนือตัวเลือกของคุณ — ไม่มีตัวใดสร้างข้อความ และในแกนนั้น พวกมันเป็นเครื่องมือชนิดเดียวกัน ความแตกต่างที่สำคัญคือ ใครเป็นคนรันมัน มันใหญ่แค่ไหน คุณตรวจสอบได้มากแค่ไหน และคอลัมน์ด้านความปลอดภัยหนึ่งคอลัมน์ที่โมเดลที่เล็กกว่า เงียบกว่า และดาวน์โหลดได้เต็มรูปแบบเลือกจะเผยแพร่ไว้อยู่ดี
แต่ละอันส่งคืนอะไรกลับมาจริง ๆ
Microsoft-Decision-1 เป็น API แบบโฮสต์ และนั่นคือความแตกต่างเชิงโครงสร้างประการแรก น้ำหนักโมเดลไม่ได้ถูกกระจายออกไป — ไม่มีการดาวน์โหลด ไม่มีคลังเก็บ ไม่มีเส้นทางการปรับละเอียด — และการผสานรวมหมายถึงการปรับใช้ Foundry พร้อมด้วยการยืนยันตัวตน การเรียกเก็บเงิน และการกำกับดูแลของ Azure ที่แนบมาด้วย โดยประมวลผลหนึ่งรอบบนข้อมูลสูงสุด 32,768 โทเค็น, รองรับคำถามแบบใช่/ไม่ใช่ แบบปรนัย แบบให้คะแนน แบบจำแนกประเภท และแบบเกณฑ์การให้คะแนน และรับข้อมูลเข้าเป็นข้อความเท่านั้นและส่งออกเป็นตัวเลข รองรับตัวเลือกในการงดตอบอย่างชัดเจน เช่น "บอกไม่ได้" เมื่อหลักฐานไม่เพียงพอ ซึ่งเป็นสิ่งที่ทำให้ค่าเกณฑ์มีความหมาย
Intern-Decision-0.8B เป็นการจัดวางแบบตรงกันข้าม โดยเป็นน้ำหนักแบบ Apache 2.0 พร้อมสัญญาอนุญาต Qwen ต้นทางที่เก็บรักษาไว้ข้าง ๆ ในชื่อ LICENSE-QWEN ประมาณ1.73 GBของคลังโค้ดที่แบ่งเป็นสามชาร์ด — ชาร์ดภาษาขนาด 1.50 GB ชาร์ดวิชันขนาด 176 MB และโปรเจกเตอร์ขนาด 25 MB — ซึ่งพอดีกับ GPU สำหรับผู้ใช้ทั่วไปหนึ่งตัวหรือแล็ปท็อปที่มีสเปกเพียงพอ โดยรับ state, สคีมาของคำถามที่มีชื่อตั้งแต่หนึ่งถึงสิบหกข้อ ซึ่งแต่ละข้อมีตัวเลือกได้ถึง 62 ตัว และอาจมีภาพได้ถึงแปดภาพ และไฟล์ inference.pyที่มาพร้อมกันนั้นได้อธิบายสัญญาไว้อย่างละเอียดมากกว่าที่โมเดลเปิดตัวส่วนใหญ่จะยอมทำเสียอีก: ตัวเลือกถูกแมปเข้ากับสัญลักษณ์โทเคนเดี่ยว A–Z จากนั้น a–z จากนั้น 0–9; ค่า logits ถูกอ่านที่ตำแหน่งก่อนหน้าตัวแทน <decision> ในสเกเลตันที่เรนเดอร์ไว้ล่วงหน้า; ทำ softmax เฉพาะกับตัวเลือกที่ถูกต้องของฟิลด์นั้นเท่านั้น; แล้วจึงนำอุณหภูมิที่ฟิตค่าไว้มาใช้
สัญญาอนุญาตทั้งสองแบบไม่ใช่การซื้อเดียวกัน Microsoft-Decision-1 ให้ปลายทางแบบจัดการแก่คุณ และไม่มีอาร์ติแฟกต์ใดที่คุณเป็นเจ้าของ Intern-Decision-0.8B ให้อาร์ติแฟกต์ที่คุณเป็นเจ้าของ โดยไม่มีปลายทาง ไม่มีสัญญาสนับสนุน และไม่มีเอกสารใดนอกจากตัวรีโพซิทอรีเอง

เพดาน และการสอบเทียบที่คุณตรวจสอบได้
ตัวเลขสองตัวเป็นตัวกำหนดการผสานรวมจริงส่วนใหญ่ และทั้งคู่เป็นของโมเดลขนาดเล็ก
ตัวแรกคือ 8,192 โทเคน อินจิ้นการอนุมานของ Intern-Decision-0.8B จะปฏิเสธอินพุตที่ใหญ่เกินขนาดแทนที่จะตัดทอนมัน ซึ่งเป็นพฤติกรรมที่ถูกต้องสำหรับตัวให้คะแนน และยังเป็นกำแพงแข็งเช่นกัน: ไม่มีกลยุทธ์การแบ่งชิ้นส่วนใดที่จะรักษาสัญญาไว้ได้ เพราะสถานะ สคีมา และโครงกระดูกทั้งหมดต้องอยู่ในรอบเดียว เพดานของ Microsoft-Decision-1 สูงกว่าถึงสี่เท่า คือ 32,768 และมันเป็นขีดจำกัดแบบโฮสต์ที่คุณสามารถเพิ่มได้ด้วยการจัดสรรทรัพยากรให้ต่างออกไป ไม่ใช่ค่าคงที่ในไฟล์ Python
ข้อที่สองคือการปรับเทียบ และตรงนี้ทิศทางจะกลับกัน InternLM เผยแพร่ค่าอุณหภูมิที่ฟิตได้เท่ากับ 2.747760550703 สำหรับรุ่น 0.8B ซึ่งเลือกโดยการลดค่า NLL ให้ต่ำที่สุดจากเคสปรับเทียบที่กำหนดไว้ 1,728 เคส โดยกันไว้ 1,693 เคสสำหรับการตรวจสอบความถูกต้อง และการ์ดระบุชัดเจนว่าไม่ได้ใช้ป้ายกำกับของชุดทดสอบในการเลือกค่านี้ การแปลงที่นำมาใช้คือซอฟต์แมกซ์เหนือโลจิทของตัวเลือกในฟิลด์ ตามด้วยซอฟต์แมกซ์ครั้งที่สองบนค่าลอการิทึมของการแจกแจงนั้นหารด้วยอุณหภูมิ เนื่องจากการแปลงนี้ทำงานหลังซอฟต์แมกซ์ครั้งแรกและรักษาลำดับไว้ จึงไม่สามารถเปลี่ยนค่า argmax ได้เลย — มันเปลี่ยนความมั่นใจ ความน่าจะเป็นของคำตอบ "ใช่" และค่าคาดหวังของคำถามแบบให้คะแนน ส่วนป้ายกำกับยังคงเหมือนเดิม หากไปป์ไลน์ของคุณอ่านเฉพาะป้ายกำกับ อุณหภูมิก็ไม่มีผลใด ๆ แต่ถ้าอ่านค่าความน่าจะเป็น ตั้งเกณฑ์กับมัน หรือป้อนเข้าสู่การคำนวณค่าคาดหวัง อุณหภูมิคือความต่างระหว่างตัวเลขที่มีความหมายกับตัวเลขที่ไม่มีความหมาย การส่ง temperature=1 จะคืนค่าการแจกแจงที่ยังไม่ปรับเทียบ หากคุณอยากฟิตค่าของตัวเองมากกว่า
Microsoft-Decision-1 ไม่มีอาร์ติแฟกต์ที่เทียบเท่า แท็บ Benchmarks ของมันระบุว่า ความแม่นยำ ค่าคลาดเคลื่อนการสอบเทียบ การเรียกคืนด้านความปลอดภัย อัตราผลบวกลวง และความสอดคล้องด้านความเป็นธรรม ถูกวัดบนเกณฑ์มาตรฐานการตัดสินใจสาธารณะและของชุมชน บวกกับชุดทดสอบภายในที่กันไว้ (held-out) ว่า ลำดับตัวเลือกถูกสลับไปมา ว่ามีการใช้การทดสอบทางสถิติแบบจับคู่ และว่าโมเดล "ทำงานได้เทียบเท่ากับโมเดลการตัดสินใจชั้นนำ และนำหน้าโมเดลการตัดสินใจแบบเปิดอื่น ๆ ที่ประเมินด้วยระเบียบวิธีเดียวกัน" ไม่มีค่าคลาดเคลื่อนการสอบเทียบที่พิมพ์ไว้ ไม่มีอุณหภูมิให้ตรวจสอบ และไม่มีคำอธิบายการแบ่งชุดตรวจสอบ คุณสมบัติเพียงอย่างเดียวที่ทำให้ความน่าจะเป็นมีประโยชน์ — ว่า 0.8 หมายถึง 0.8 หรือไม่ — ถูกกล่าวอ้างโดยไม่ได้ระบุเป็นปริมาณ
อ่านสองย่อหน้านั้นเทียบกัน แล้วการเปรียบเทียบก็จะไม่ใช่เรื่องขนาดอีกต่อไป เช็กพอยต์ขนาด 0.8 พันล้านพารามิเตอร์ที่คุณตรวจสอบการปรับเทียบได้และรันซอฟต์แวร์ได้ ถือเป็นวัตถุที่ทีมประเมินผลจัดการได้ง่ายกว่า API แบบโฮสต์ที่การปรับเทียบเป็นเพียงประโยคเดียว โมเดลเล็กยังมีตัวเลขความหน่วงที่บันทึกไว้ด้วย — ค่าเฉลี่ย 33.98 มิลลิวินาที ค่ามัธยฐาน 33.44 มิลลิวินาที และ p95 ที่ 37.50 มิลลิวินาทีต่อคำขอ บน RTX 4090 ตัวเดียวผ่านเส้นทาง Hugging Face ภายในเครื่อง จากการวัดของ InternLM เอง — ขณะที่ของ Microsoft เป็นสิ่งที่คุณวัดผ่านการดีพลอยของคุณเอง ซึ่งการเลือกระหว่างเซิร์ฟเวอร์เลสกับพรอวิชันด์ทรูพุตจะมีผลต่อตัวเลขมากกว่าตัวโมเดลเสียอีก

จุดที่โมเดลขนาดเล็กเป็นรอง
ไม่มีข้อใดข้างต้นทำให้ Intern-Decision-0.8B เป็นตัวเลือกที่ปลอดภัย และตารางที่เผยแพร่เดียวกันก็บอกเหตุผลว่าทำไม WildJailBreak ที่ 64.48เมื่อเทียบกับ 96.29 ของ Jev ถือเป็นช่องว่างด้านความคงทนต่อการปฏิเสธถึงสามสิบจุดในหมวดที่ตัวให้คะแนนต้องเผชิญกับอินพุตที่ไม่น่าเชื่อถือ โมเดลตัดสินใจมักเป็นองค์ประกอบที่ตัดสินว่าการกระทำที่เสนอควรได้รับอนุญาตหรือไม่ ตัวที่ถูกโน้มน้าวให้ปล่อยผ่านได้ง่ายจึงเป็นความเสี่ยงในเรื่องนั้น ไม่ว่าส่วนที่ขาดนี้จะมาจากฐาน Qwen3.5-0.8B จากวัตถุประสงค์การจูนเพื่อการตัดสินใจ หรือจากจำนวนพารามิเตอร์ที่น้อย ก็ไม่ใช่สิ่งที่รีพอซิทอรีบอกคุณ และไม่มีบทความวิจัย สูตรการฝึก หรือการเปิดเผยข้อมูลใดที่จะบอกได้
ส่วนที่เหลือในตารางของ InternLM เองดูสวยหรูกว่าคอลัมน์นั้นและยังคงพอประมาณ ค่าเฉลี่ยจากเจ็ดชุดคือ 79.38 สำหรับรุ่น 0.8B เทียบกับ 84.68 สำหรับรุ่น 2B พี่น้องของตัวเอง และ 90.02 สำหรับรุ่น 4B — ครอบครัวนี้ไต่ขึ้นอย่างชันตามขนาด ซึ่งเป็นสัญญาณอ่อน ๆ ว่าตารางนี้ไม่ได้ถูกวิศวกรรมย้อนกลับมาเพื่อยกย่องเรือธง AG News ได้ 88.61 เทียบกับ 89.57 ของ Jev ซึ่งถือว่าอยู่ในระดับเดียวกันสำหรับการจำแนกหัวข้อสี่ทาง ในด้านการสอบเทียบ รุ่น 0.8B รายงานค่า Brier ที่ 0.530 และค่าความคลาดเคลื่อนการสอบเทียบที่คาดหวัง 0.066 เทียบกับ 0.358 และ 0.095 ของ Jev — ECE ดีกว่า แต่ความแม่นยำแย่ลงอย่างมีนัยสำคัญ นั่นเป็นโปรไฟล์ที่เป็นไปได้สำหรับโมเดลขนาดเล็กที่มีการปรับอุณหภูมิอย่างตั้งใจ และไม่ใช่ชุดค่าผสมที่ทีมการตลาดจะเลือกเผยแพร่โดยบังเอิญ
นอกจากนี้ยังไม่มีวันที่เปิดตัว ไม่มีประกาศ ไม่มีคอลเลกชันที่รวบรวมเช็กพอยต์ทั้งสาม และไม่มีเอนด์พอยต์ที่โฮสต์ไว้ที่ไหนเลย รวมถึงไม่มีการประเมินอิสระใด ๆ ทั้งสิ้น เดโม Space ตอบกลับ 401 คำอธิบายที่ถูกต้องของ Intern-Decision-0.8B คือเช็กพอยต์ที่เปิดให้ใช้แล้วโดยมีข้ออ้างที่ยังไม่ผ่านการตรวจสอบ — ซึ่งเป็นสถานการณ์ที่ดีกว่า API ที่ต้องรอคิว เพราะคุณสามารถวัดผลมันได้ภายในบ่ายเดียว แต่มันหมายความว่าภาระในการตรวจสอบยืนยันเป็นของคุณทั้งหมด
การเลือก และตำแหน่งที่ OrcaRouter อยู่
เลือก Microsoft-Decision-1 หากอุปสรรคคือการจัดซื้อหรือการขยายขนาด: คุณต้องการการรับรองความถูกต้องของ Azure การเรียกเก็บเงินแบบรวม และการประเมิน Responsible AI ก่อนที่สิ่งใดจะเข้าสู่การผลิต; คุณต้องการบริบท 32K; คุณต้องการเอนด์พอยต์ที่คุณไม่ได้ดำเนินการเอง; หรือคุณต้องการเส้นทางการงดตอบที่ออกแบบมาในตัวแทนที่จะเขียนเอง ยอมรับเป็นข้อแลกเปลี่ยนว่าคุณไม่สามารถรันมันได้ ไม่สามารถปรับแต่งละเอียดได้ ไม่สามารถตรวจสอบการสอบเทียบของมันได้ และจะต้องวัดข้ออ้างหลักของมันด้วยตัวคุณเอง
เลือก Intern-Decision-0.8B หากอุปสรรคคือค่าใช้จ่าย หน่วยความจำ หรือการควบคุม: คุณต้องการตัวให้คะแนนแบบ Apache-2.0 ที่พอดีใน 1.73 GB ทำงานบนฮาร์ดแวร์ที่คุณมีอยู่แล้ว ให้ป้ายกำกับเดิมทุกครั้ง และสามารถสลับไปใช้รุ่นพี่น้อง 2B หรือ 4B ได้โดยเปลี่ยนพาธเช็กพอยต์ ยอมรับเป็นข้อแลกเปลี่ยนคือกำแพง 8,192 โทเคน คอลัมน์ WildJailBreak และความจริงที่ว่าไม่มีใครนอก InternLM ทำซ้ำผลลัพธ์ใด ๆ บนการ์ดนี้ได้
คำแนะนำที่ตรงไปตรงมาคือทำทั้งสองอย่าง เพราะมันถูกพอที่การเถียงกันเรื่องนี้แทบไม่คุ้มค่า การเรียกให้คะแนนเองไม่ใช่สิ่งที่เราให้บริการเราเตอร์ — โมเดลที่คืนค่าความน่าจะเป็นแทนข้อความไม่ใช่แชตคอมพลีชัน และทั้งสองอย่างนี้ก็ไม่มีอยู่ในแคตตาล็อกของเรา สิ่งที่ OrcaRouter มีให้คืออีกครึ่งหนึ่งของลูป: โมเดลมากกว่า 200 รายการภายใต้คีย์เดียวที่เข้ากันได้กับ OpenAIซึ่งช่วยร่างเกณฑ์การให้คะแนน สร้างคำตอบที่เป็นตัวเลือก หรือส่ง tool call ที่ตัวให้คะแนนของคุณกำลังจะตรวจ ในราคาตามที่ผู้ให้บริการประกาศไว้ ส่งผ่านด้วยส่วนเพิ่ม 0% ดังนั้นเมื่อผู้ให้บริการลดราคาของโมเดลตัวสร้าง ฝั่งเราก็อัปเดตให้ทันทีในวันเดียวกัน การ failover อัตโนมัติสำคัญกว่าปกติในกรณีนี้ เพราะไปป์ไลน์ที่ให้คะแนนทุกอย่างที่เห็นไม่มีช่องว่างให้ลองเรียกซ้ำเมื่อการเรียกค้าง และ routing DSL ให้คุณส่งพรอมป์ของผู้ตัดสินหนึ่งอันไปยังผู้เขียนหลายตัว แล้วผสานความเห็นที่ตรงกันแทนที่จะเชื่อเพียงตัวเดียว

ประเด็นสำคัญ
Microsoft-Decision-1 เปิดให้ใช้งานทั่วไปบน Microsoft Foundry เมื่อวันที่ 8 ตุลาคม 2026: แบบโฮสต์, ข้อความเท่านั้น, 32,768 โทเคน, สร้างบน Qwen3.5-9B, พร้อมย่อหน้าอธิบายวิธีการแทนตารางเบนช์มาร์ก Intern-Decision-0.8B เป็นเช็กพอยต์ Apache-2.0 ขนาด 1.73 GB ที่อัปโหลดเมื่อวันที่ 26 กันยายน 2026 ซึ่งเผยแพร่ค่า Brier ที่ 0.530, ECE ที่ 0.066, อุณหภูมิที่ปรับพอดีที่ 2.747760550703, 33.98 ms บน 4090 — และคะแนน WildJailBreak 64.48 ที่ไม่มีใครขอให้มันพิมพ์ออกมา หากคุณตรวจสอบได้เพียงสิ่งเดียวก่อนนำตัวใดตัวหนึ่งไปใช้ ให้ตรวจสอบการสอบเทียบกับเคสที่มีป้ายกำกับของคุณเอง; นั่นคือตัวเลขที่ผู้จำหน่ายทั้งสองฝ่ายทิ้งไว้ให้คุณค้นหาเอง
