การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับ Microsoft-Decision-1 กับ Intern-Decision-0.8B พร้อมคำบรรยายย่อยว่า 'ตัวให้คะแนนแบบโฮสต์ที่ไม่มีตัวเลข เทียบกับเช็กพอยต์ขนาด 1.73 GB ที่มีค่าหนึ่งซึ่งไม่น่าชม' โดยมีชิปที่ระบุว่าเป็น endpoint ของ Foundry เทียบกับ 852,985,920 พารามิเตอร์ ย่อหน้าด้านระเบียบวิธีเทียบกับคะแนน WildJailBreak ที่ 64.48 และ 32,768 โทเคนเทียบกับเพดาน 8,192
Guides & Insights

Microsoft-Decision-1 vs Intern-Decision-0.8B: ครึ่งออนซ์แห่งปัญหาการ Jailbreak เมื่อเทียบกับความว่างเปล่าที่โฮสต์ไว้

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เริ่มจากคอลัมน์ที่โพสต์เปิดตัวคงไม่พูดถึง Intern-Decision-0.8B — โมเดลตัดสินใจขนาด 852,985,920 พารามิเตอร์ของ InternLM ซึ่งผ่านการปรับละเอียดจาก Qwen3.5-0.8B และอัปโหลดขึ้น Hugging Face เมื่อวันที่ 26 กันยายน 2026 โดยไม่มีการประกาศ ไม่มีเปเปอร์ และมีลิงก์ GitHub ที่ยังคง 404 — ถูกวัดได้ที่ 64.48 บน WildJailBreak เทียบกับค่าอ้างอิง 96.29 สำหรับ Jev 1.13 ของ TypeSafe นั่นไม่ใช่ความต่างจากการปัดเศษ มันคือการถดถอยอย่างรุนแรงของความทนทานต่อการปฏิเสธ (refusal robustness) ในโมเดลที่ทั้งหน้าที่ของมันคือการตัดสินอินพุต เผยแพร่บนการ์ดของเจ้าของโมเดลเอง ในตารางที่เกณฑ์วัดเป็นของคู่แข่ง ลองวางสิ่งนั้นเทียบกับ Microsoft-Decision-1 ซึ่งเปิดให้ใช้ทั่วไปบน Microsoft Foundry เมื่อวันที่ 8 ตุลาคม 2026 ในฐานะตัวให้คะแนนแบบข้อความล้วนที่ผ่านการฝึกต่อบน Qwen3.5-9B พร้อมวิธีการประเมินที่มีเอกสารกำกับ และไม่มีผลลัพธ์แม้แต่รายการเดียวพิมพ์อยู่ใต้มัน แล้วคุณจะเห็นรูปร่างที่แท้จริงของการจับคู่นี้ หนึ่งในโมเดลเหล่านี้จะบอกตัวเลขที่ทำให้มันดูแย่ อีกตัวจะบอกคุณว่ามันจะใช้เมตริกใด

การกลับด้านนั้นมีค่ามากกว่าสเปกชีต โมเดลทั้งสองรับสถานะและชุดคำถามที่มีขอบเขต แล้วคืนค่าความน่าจะเป็นเหนือตัวเลือกของคุณ — ไม่มีตัวใดสร้างข้อความ และในแกนนั้น พวกมันเป็นเครื่องมือชนิดเดียวกัน ความแตกต่างที่สำคัญคือ ใครเป็นคนรันมัน มันใหญ่แค่ไหน คุณตรวจสอบได้มากแค่ไหน และคอลัมน์ด้านความปลอดภัยหนึ่งคอลัมน์ที่โมเดลที่เล็กกว่า เงียบกว่า และดาวน์โหลดได้เต็มรูปแบบเลือกจะเผยแพร่ไว้อยู่ดี

แต่ละอันส่งคืนอะไรกลับมาจริง ๆ

Microsoft-Decision-1 เป็น API แบบโฮสต์ และนั่นคือความแตกต่างเชิงโครงสร้างประการแรก น้ำหนักโมเดลไม่ได้ถูกกระจายออกไป — ไม่มีการดาวน์โหลด ไม่มีคลังเก็บ ไม่มีเส้นทางการปรับละเอียด — และการผสานรวมหมายถึงการปรับใช้ Foundry พร้อมด้วยการยืนยันตัวตน การเรียกเก็บเงิน และการกำกับดูแลของ Azure ที่แนบมาด้วย โดยประมวลผลหนึ่งรอบบนข้อมูลสูงสุด 32,768 โทเค็น, รองรับคำถามแบบใช่/ไม่ใช่ แบบปรนัย แบบให้คะแนน แบบจำแนกประเภท และแบบเกณฑ์การให้คะแนน และรับข้อมูลเข้าเป็นข้อความเท่านั้นและส่งออกเป็นตัวเลข รองรับตัวเลือกในการงดตอบอย่างชัดเจน เช่น "บอกไม่ได้" เมื่อหลักฐานไม่เพียงพอ ซึ่งเป็นสิ่งที่ทำให้ค่าเกณฑ์มีความหมาย

Intern-Decision-0.8B เป็นการจัดวางแบบตรงกันข้าม โดยเป็นน้ำหนักแบบ Apache 2.0 พร้อมสัญญาอนุญาต Qwen ต้นทางที่เก็บรักษาไว้ข้าง ๆ ในชื่อ LICENSE-QWEN ประมาณ1.73 GBของคลังโค้ดที่แบ่งเป็นสามชาร์ด — ชาร์ดภาษาขนาด 1.50 GB ชาร์ดวิชันขนาด 176 MB และโปรเจกเตอร์ขนาด 25 MB — ซึ่งพอดีกับ GPU สำหรับผู้ใช้ทั่วไปหนึ่งตัวหรือแล็ปท็อปที่มีสเปกเพียงพอ โดยรับ state, สคีมาของคำถามที่มีชื่อตั้งแต่หนึ่งถึงสิบหกข้อ ซึ่งแต่ละข้อมีตัวเลือกได้ถึง 62 ตัว และอาจมีภาพได้ถึงแปดภาพ และไฟล์ inference.pyที่มาพร้อมกันนั้นได้อธิบายสัญญาไว้อย่างละเอียดมากกว่าที่โมเดลเปิดตัวส่วนใหญ่จะยอมทำเสียอีก: ตัวเลือกถูกแมปเข้ากับสัญลักษณ์โทเคนเดี่ยว A–Z จากนั้น a–z จากนั้น 0–9; ค่า logits ถูกอ่านที่ตำแหน่งก่อนหน้าตัวแทน <decision> ในสเกเลตันที่เรนเดอร์ไว้ล่วงหน้า; ทำ softmax เฉพาะกับตัวเลือกที่ถูกต้องของฟิลด์นั้นเท่านั้น; แล้วจึงนำอุณหภูมิที่ฟิตค่าไว้มาใช้

สัญญาอนุญาตทั้งสองแบบไม่ใช่การซื้อเดียวกัน Microsoft-Decision-1 ให้ปลายทางแบบจัดการแก่คุณ และไม่มีอาร์ติแฟกต์ใดที่คุณเป็นเจ้าของ Intern-Decision-0.8B ให้อาร์ติแฟกต์ที่คุณเป็นเจ้าของ โดยไม่มีปลายทาง ไม่มีสัญญาสนับสนุน และไม่มีเอกสารใดนอกจากตัวรีโพซิทอรีเอง

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

เพดาน และการสอบเทียบที่คุณตรวจสอบได้

ตัวเลขสองตัวเป็นตัวกำหนดการผสานรวมจริงส่วนใหญ่ และทั้งคู่เป็นของโมเดลขนาดเล็ก

ตัวแรกคือ 8,192 โทเคน อินจิ้นการอนุมานของ Intern-Decision-0.8B จะปฏิเสธอินพุตที่ใหญ่เกินขนาดแทนที่จะตัดทอนมัน ซึ่งเป็นพฤติกรรมที่ถูกต้องสำหรับตัวให้คะแนน และยังเป็นกำแพงแข็งเช่นกัน: ไม่มีกลยุทธ์การแบ่งชิ้นส่วนใดที่จะรักษาสัญญาไว้ได้ เพราะสถานะ สคีมา และโครงกระดูกทั้งหมดต้องอยู่ในรอบเดียว เพดานของ Microsoft-Decision-1 สูงกว่าถึงสี่เท่า คือ 32,768 และมันเป็นขีดจำกัดแบบโฮสต์ที่คุณสามารถเพิ่มได้ด้วยการจัดสรรทรัพยากรให้ต่างออกไป ไม่ใช่ค่าคงที่ในไฟล์ Python

ข้อที่สองคือการปรับเทียบ และตรงนี้ทิศทางจะกลับกัน InternLM เผยแพร่ค่าอุณหภูมิที่ฟิตได้เท่ากับ 2.747760550703 สำหรับรุ่น 0.8B ซึ่งเลือกโดยการลดค่า NLL ให้ต่ำที่สุดจากเคสปรับเทียบที่กำหนดไว้ 1,728 เคส โดยกันไว้ 1,693 เคสสำหรับการตรวจสอบความถูกต้อง และการ์ดระบุชัดเจนว่าไม่ได้ใช้ป้ายกำกับของชุดทดสอบในการเลือกค่านี้ การแปลงที่นำมาใช้คือซอฟต์แมกซ์เหนือโลจิทของตัวเลือกในฟิลด์ ตามด้วยซอฟต์แมกซ์ครั้งที่สองบนค่าลอการิทึมของการแจกแจงนั้นหารด้วยอุณหภูมิ เนื่องจากการแปลงนี้ทำงานหลังซอฟต์แมกซ์ครั้งแรกและรักษาลำดับไว้ จึงไม่สามารถเปลี่ยนค่า argmax ได้เลย — มันเปลี่ยนความมั่นใจ ความน่าจะเป็นของคำตอบ "ใช่" และค่าคาดหวังของคำถามแบบให้คะแนน ส่วนป้ายกำกับยังคงเหมือนเดิม หากไปป์ไลน์ของคุณอ่านเฉพาะป้ายกำกับ อุณหภูมิก็ไม่มีผลใด ๆ แต่ถ้าอ่านค่าความน่าจะเป็น ตั้งเกณฑ์กับมัน หรือป้อนเข้าสู่การคำนวณค่าคาดหวัง อุณหภูมิคือความต่างระหว่างตัวเลขที่มีความหมายกับตัวเลขที่ไม่มีความหมาย การส่ง temperature=1 จะคืนค่าการแจกแจงที่ยังไม่ปรับเทียบ หากคุณอยากฟิตค่าของตัวเองมากกว่า

Microsoft-Decision-1 ไม่มีอาร์ติแฟกต์ที่เทียบเท่า แท็บ Benchmarks ของมันระบุว่า ความแม่นยำ ค่าคลาดเคลื่อนการสอบเทียบ การเรียกคืนด้านความปลอดภัย อัตราผลบวกลวง และความสอดคล้องด้านความเป็นธรรม ถูกวัดบนเกณฑ์มาตรฐานการตัดสินใจสาธารณะและของชุมชน บวกกับชุดทดสอบภายในที่กันไว้ (held-out) ว่า ลำดับตัวเลือกถูกสลับไปมา ว่ามีการใช้การทดสอบทางสถิติแบบจับคู่ และว่าโมเดล "ทำงานได้เทียบเท่ากับโมเดลการตัดสินใจชั้นนำ และนำหน้าโมเดลการตัดสินใจแบบเปิดอื่น ๆ ที่ประเมินด้วยระเบียบวิธีเดียวกัน" ไม่มีค่าคลาดเคลื่อนการสอบเทียบที่พิมพ์ไว้ ไม่มีอุณหภูมิให้ตรวจสอบ และไม่มีคำอธิบายการแบ่งชุดตรวจสอบ คุณสมบัติเพียงอย่างเดียวที่ทำให้ความน่าจะเป็นมีประโยชน์ — ว่า 0.8 หมายถึง 0.8 หรือไม่ — ถูกกล่าวอ้างโดยไม่ได้ระบุเป็นปริมาณ

อ่านสองย่อหน้านั้นเทียบกัน แล้วการเปรียบเทียบก็จะไม่ใช่เรื่องขนาดอีกต่อไป เช็กพอยต์ขนาด 0.8 พันล้านพารามิเตอร์ที่คุณตรวจสอบการปรับเทียบได้และรันซอฟต์แวร์ได้ ถือเป็นวัตถุที่ทีมประเมินผลจัดการได้ง่ายกว่า API แบบโฮสต์ที่การปรับเทียบเป็นเพียงประโยคเดียว โมเดลเล็กยังมีตัวเลขความหน่วงที่บันทึกไว้ด้วย — ค่าเฉลี่ย 33.98 มิลลิวินาที ค่ามัธยฐาน 33.44 มิลลิวินาที และ p95 ที่ 37.50 มิลลิวินาทีต่อคำขอ บน RTX 4090 ตัวเดียวผ่านเส้นทาง Hugging Face ภายในเครื่อง จากการวัดของ InternLM เอง — ขณะที่ของ Microsoft เป็นสิ่งที่คุณวัดผ่านการดีพลอยของคุณเอง ซึ่งการเลือกระหว่างเซิร์ฟเวอร์เลสกับพรอวิชันด์ทรูพุตจะมีผลต่อตัวเลขมากกว่าตัวโมเดลเสียอีก

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-0.8B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; weights not distributed; calibration error not published; latency not published. Right column Intern-Decision-0.8B rows read: availability uploaded September 26, 2026; parameters 852,985,920 in 1.73 GB; input ceiling 8,192 tokens with oversize input rejected; weights Apache 2.0 and self-serve; Brier 0.530 and ECE 0.066; 33.98 ms mean on a single RTX 4090. A footer line reads that the InternLM figures are vendor-reported on InternLM's own harness with no independent reproduction.

จุดที่โมเดลขนาดเล็กเป็นรอง

ไม่มีข้อใดข้างต้นทำให้ Intern-Decision-0.8B เป็นตัวเลือกที่ปลอดภัย และตารางที่เผยแพร่เดียวกันก็บอกเหตุผลว่าทำไม WildJailBreak ที่ 64.48เมื่อเทียบกับ 96.29 ของ Jev ถือเป็นช่องว่างด้านความคงทนต่อการปฏิเสธถึงสามสิบจุดในหมวดที่ตัวให้คะแนนต้องเผชิญกับอินพุตที่ไม่น่าเชื่อถือ โมเดลตัดสินใจมักเป็นองค์ประกอบที่ตัดสินว่าการกระทำที่เสนอควรได้รับอนุญาตหรือไม่ ตัวที่ถูกโน้มน้าวให้ปล่อยผ่านได้ง่ายจึงเป็นความเสี่ยงในเรื่องนั้น ไม่ว่าส่วนที่ขาดนี้จะมาจากฐาน Qwen3.5-0.8B จากวัตถุประสงค์การจูนเพื่อการตัดสินใจ หรือจากจำนวนพารามิเตอร์ที่น้อย ก็ไม่ใช่สิ่งที่รีพอซิทอรีบอกคุณ และไม่มีบทความวิจัย สูตรการฝึก หรือการเปิดเผยข้อมูลใดที่จะบอกได้

ส่วนที่เหลือในตารางของ InternLM เองดูสวยหรูกว่าคอลัมน์นั้นและยังคงพอประมาณ ค่าเฉลี่ยจากเจ็ดชุดคือ 79.38 สำหรับรุ่น 0.8B เทียบกับ 84.68 สำหรับรุ่น 2B พี่น้องของตัวเอง และ 90.02 สำหรับรุ่น 4B — ครอบครัวนี้ไต่ขึ้นอย่างชันตามขนาด ซึ่งเป็นสัญญาณอ่อน ๆ ว่าตารางนี้ไม่ได้ถูกวิศวกรรมย้อนกลับมาเพื่อยกย่องเรือธง AG News ได้ 88.61 เทียบกับ 89.57 ของ Jev ซึ่งถือว่าอยู่ในระดับเดียวกันสำหรับการจำแนกหัวข้อสี่ทาง ในด้านการสอบเทียบ รุ่น 0.8B รายงานค่า Brier ที่ 0.530 และค่าความคลาดเคลื่อนการสอบเทียบที่คาดหวัง 0.066 เทียบกับ 0.358 และ 0.095 ของ Jev — ECE ดีกว่า แต่ความแม่นยำแย่ลงอย่างมีนัยสำคัญ นั่นเป็นโปรไฟล์ที่เป็นไปได้สำหรับโมเดลขนาดเล็กที่มีการปรับอุณหภูมิอย่างตั้งใจ และไม่ใช่ชุดค่าผสมที่ทีมการตลาดจะเลือกเผยแพร่โดยบังเอิญ

นอกจากนี้ยังไม่มีวันที่เปิดตัว ไม่มีประกาศ ไม่มีคอลเลกชันที่รวบรวมเช็กพอยต์ทั้งสาม และไม่มีเอนด์พอยต์ที่โฮสต์ไว้ที่ไหนเลย รวมถึงไม่มีการประเมินอิสระใด ๆ ทั้งสิ้น เดโม Space ตอบกลับ 401 คำอธิบายที่ถูกต้องของ Intern-Decision-0.8B คือเช็กพอยต์ที่เปิดให้ใช้แล้วโดยมีข้ออ้างที่ยังไม่ผ่านการตรวจสอบ — ซึ่งเป็นสถานการณ์ที่ดีกว่า API ที่ต้องรอคิว เพราะคุณสามารถวัดผลมันได้ภายในบ่ายเดียว แต่มันหมายความว่าภาระในการตรวจสอบยืนยันเป็นของคุณทั้งหมด

การเลือก และตำแหน่งที่ OrcaRouter อยู่

เลือก Microsoft-Decision-1 หากอุปสรรคคือการจัดซื้อหรือการขยายขนาด: คุณต้องการการรับรองความถูกต้องของ Azure การเรียกเก็บเงินแบบรวม และการประเมิน Responsible AI ก่อนที่สิ่งใดจะเข้าสู่การผลิต; คุณต้องการบริบท 32K; คุณต้องการเอนด์พอยต์ที่คุณไม่ได้ดำเนินการเอง; หรือคุณต้องการเส้นทางการงดตอบที่ออกแบบมาในตัวแทนที่จะเขียนเอง ยอมรับเป็นข้อแลกเปลี่ยนว่าคุณไม่สามารถรันมันได้ ไม่สามารถปรับแต่งละเอียดได้ ไม่สามารถตรวจสอบการสอบเทียบของมันได้ และจะต้องวัดข้ออ้างหลักของมันด้วยตัวคุณเอง

เลือก Intern-Decision-0.8B หากอุปสรรคคือค่าใช้จ่าย หน่วยความจำ หรือการควบคุม: คุณต้องการตัวให้คะแนนแบบ Apache-2.0 ที่พอดีใน 1.73 GB ทำงานบนฮาร์ดแวร์ที่คุณมีอยู่แล้ว ให้ป้ายกำกับเดิมทุกครั้ง และสามารถสลับไปใช้รุ่นพี่น้อง 2B หรือ 4B ได้โดยเปลี่ยนพาธเช็กพอยต์ ยอมรับเป็นข้อแลกเปลี่ยนคือกำแพง 8,192 โทเคน คอลัมน์ WildJailBreak และความจริงที่ว่าไม่มีใครนอก InternLM ทำซ้ำผลลัพธ์ใด ๆ บนการ์ดนี้ได้

คำแนะนำที่ตรงไปตรงมาคือทำทั้งสองอย่าง เพราะมันถูกพอที่การเถียงกันเรื่องนี้แทบไม่คุ้มค่า การเรียกให้คะแนนเองไม่ใช่สิ่งที่เราให้บริการเราเตอร์ — โมเดลที่คืนค่าความน่าจะเป็นแทนข้อความไม่ใช่แชตคอมพลีชัน และทั้งสองอย่างนี้ก็ไม่มีอยู่ในแคตตาล็อกของเรา สิ่งที่ OrcaRouter มีให้คืออีกครึ่งหนึ่งของลูป: โมเดลมากกว่า 200 รายการภายใต้คีย์เดียวที่เข้ากันได้กับ OpenAIซึ่งช่วยร่างเกณฑ์การให้คะแนน สร้างคำตอบที่เป็นตัวเลือก หรือส่ง tool call ที่ตัวให้คะแนนของคุณกำลังจะตรวจ ในราคาตามที่ผู้ให้บริการประกาศไว้ ส่งผ่านด้วยส่วนเพิ่ม 0% ดังนั้นเมื่อผู้ให้บริการลดราคาของโมเดลตัวสร้าง ฝั่งเราก็อัปเดตให้ทันทีในวันเดียวกัน การ failover อัตโนมัติสำคัญกว่าปกติในกรณีนี้ เพราะไปป์ไลน์ที่ให้คะแนนทุกอย่างที่เห็นไม่มีช่องว่างให้ลองเรียกซ้ำเมื่อการเรียกค้าง และ routing DSL ให้คุณส่งพรอมป์ของผู้ตัดสินหนึ่งอันไปยังผู้เขียนหลายตัว แล้วผสานความเห็นที่ตรงกันแทนที่จะเชื่อเพียงตัวเดียว

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

ประเด็นสำคัญ

Microsoft-Decision-1 เปิดให้ใช้งานทั่วไปบน Microsoft Foundry เมื่อวันที่ 8 ตุลาคม 2026: แบบโฮสต์, ข้อความเท่านั้น, 32,768 โทเคน, สร้างบน Qwen3.5-9B, พร้อมย่อหน้าอธิบายวิธีการแทนตารางเบนช์มาร์ก Intern-Decision-0.8B เป็นเช็กพอยต์ Apache-2.0 ขนาด 1.73 GB ที่อัปโหลดเมื่อวันที่ 26 กันยายน 2026 ซึ่งเผยแพร่ค่า Brier ที่ 0.530, ECE ที่ 0.066, อุณหภูมิที่ปรับพอดีที่ 2.747760550703, 33.98 ms บน 4090 — และคะแนน WildJailBreak 64.48 ที่ไม่มีใครขอให้มันพิมพ์ออกมา หากคุณตรวจสอบได้เพียงสิ่งเดียวก่อนนำตัวใดตัวหนึ่งไปใช้ ให้ตรวจสอบการสอบเทียบกับเคสที่มีป้ายกำกับของคุณเอง; นั่นคือตัวเลขที่ผู้จำหน่ายทั้งสองฝ่ายทิ้งไว้ให้คุณค้นหาเอง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube