การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับ Microsoft-Decision-1 เทียบกับ Intern-Decision-2B พร้อมคำบรรยายว่า 'จุดตรวจสอบกลางที่ตอบได้เร็วที่สุดและบอกได้แย่ที่สุดว่ามั่นใจแค่ไหน' โดยมีชิปที่แสดงข้อความว่า 2,213,241,664 พารามิเตอร์ อุณหภูมิ 2.100509348278, ECE 0.100, 33.28 มิลลิวินาทีบน 4090 และเพดาน 8,192 โทเคน
Engineering & Research

Microsoft-Decision-1 vs Intern-Decision-2B: เร็วกว่าเก้ามิลลิวินาที และคาลิเบรตได้แย่ลงอย่างที่วัดได้

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

มีตัวเลขหนึ่งในตารางของ InternLM เองที่ไม่ควรมีอยู่ และนั่นคือเหตุผลที่การเปรียบเทียบนี้มีค่ามากกว่าสเปกชีต Intern-Decision-2B — 2,213,241,664 พารามิเตอร์ ผ่านการ fine-tune มาจาก Qwen/Qwen3.5-2B อัปโหลดขึ้น Hugging Face เมื่อวันที่ 26 กันยายน 2026 เวลา 05:36:19 UTC โดยไม่มีการประกาศ — ทำเวลาได้ 33.28 ms เป็นค่า latency เฉลี่ยต่อคำถามบน RTX 4090 ตัวเดียว ซึ่งเร็วกว่ารุ่นพี่น้องที่มี 852 ล้านพารามิเตอร์ของตัวเองที่ 33.98 ms อยู่เล็กน้อย อีกทั้งยังทำได้การคาลิเบรตที่แย่ที่สุดในตระกูลเดียวกัน: ค่าความคลาดเคลื่อนการคาลิเบรตที่คาดหวัง (expected calibration error) อยู่ที่ 0.100 เทียบกับ 0.066 ของรุ่น 0.8B โดยมีค่า temperature ที่ fit ได้เท่ากับ 2.100509348278 เทียบกับ 2.747760550703 ของรุ่น 0.8B ในขณะเดียวกัน Microsoft-Decision-1 ซึ่งพร้อมใช้งานทั่วไปบน Microsoft Foundry ตั้งแต่ 8 ตุลาคม 2026 กลับไม่เปิดเผยทั้งตัวเลข latency และค่าความคลาดเคลื่อนการคาลิเบรตเลย มีเพียงย่อหน้าที่อธิบายระเบียบวิธีว่าทั้งสองค่าวัดกันอย่างไร ดังนั้นคำถามที่การจับคู่นี้ถามจริง ๆ จึงไม่ใช่ว่าในสองตัวนี้ตัวไหนดีกว่า แต่คือสิ่งที่คุณกำลังซื้อเมื่อคุณซื้อขนาดกลางของอะไรก็ตาม

ทั้งสองโมเดลเป็นตัวให้คะแนนการตัดสินใจ: รับสถานะเข้า รับชุดคำถามที่มีขอบเขตจำกัดเข้า และส่งความน่าจะเป็นที่ปรับเทียบแล้วออก ไม่มีข้อความที่สร้างขึ้นและไม่มีโทเคนให้แยกวิเคราะห์ สัญญาร่วมนั้นเองที่ทำให้ความแตกต่างมองเห็นได้ชัดเจน Microsoft-Decision-1 เป็น Foundry API แบบโฮสต์ที่รองรับเฉพาะข้อความ ซึ่งอยู่บนฐาน Qwen3.5-9B มีหน้าต่าง 32,768 โทเคน ไม่มีค่าน้ำหนักแบบกระจาย และไม่มีเส้นทางไฟน์ทูน Intern-Decision-2B เป็นเช็กพอยต์ Apache-2.0 ที่คงสัญญาอนุญาต Qwen ต้นทางไว้เป็น LICENSE-QWEN มีรีโพซิทอรีขนาดประมาณ 4.46 GB มีโค้ดการอนุมานแบบกำหนดเอง และไม่มีปลายทางแบบโฮสต์ที่ใดเลย

ขนาดกลางมีไว้เพื่ออะไรกันแน่

InternLM ปล่อยเช็กพอยต์สามตัวในสี่สิบวินาที: 0.8B เมื่อ 05:35:57, อันนี้เมื่อ 05:36:19, 4B เมื่อ 05:36:37 บนค่าเฉลี่ยจากเจ็ดชุดทดสอบของผู้ขายเอง ตระกูลนี้ไต่ขึ้นตามลำดับที่คุณหวังไว้ — 79.38, 84.68, 90.02 — ซึ่งเป็นจุดเดียวที่ 2B ดูเหมือนเป็นการซื้อที่สมเหตุสมผล ในที่อื่นทั้งหมด มันดูเหมือนขนาดที่ไม่มีใครจะเลือกโดยเจตนา

การประมวลผลพรอมต์ครอบงำการเรียกใช้การตัดสินใจ และนั่นคือคำอธิบายเชิงกลไกสำหรับการผกผันของความหน่วง มากกว่าที่จะเป็นเรื่องลึกลับ ตัวให้คะแนนทำ forward pass เพียงหนึ่งครั้งบนพรอมต์ที่ความยาวถูกกำหนดโดยสถานะ สคีมา และคำอธิบายตัวเลือก — ไม่เคยถูกกำหนดโดยสิ่งที่โมเดลเขียน เพราะมันไม่เขียนอะไรเลย ในสภาวะนั้น จำนวนพารามิเตอร์เป็นต้นทุนอันดับสอง ดังนั้นเหตุผลปกติในการเลือกเช็คพอยต์ที่เล็กที่สุดจึงใช้ไม่ได้: คุณไม่ได้ประหยัดเวลา แต่คุณประหยัดหน่วยความจำ รีโพซิทอรีทั้งหมดของ 0.8B มีขนาดประมาณ 1.73 GB เทียบกับ 4.46 GB ของโมเดลนี้ และนั่นคือเหตุผลที่แท้จริงในการเลือกใช้มัน ข้ออ้างที่แท้จริงเพียงอย่างเดียวของ 2B คือมันบังเอิญเป็นตัวที่เร็วที่สุดในบรรดาตัวที่เร็ว ด้วยส่วนต่างที่เล็กพอจะเป็นสัญญาณรบกวน

เมื่อวางเทียบกับ Microsoft-Decision-1 ข้อกล่าวอ้างนั้นแทบไม่มีความเกี่ยวข้องเลย เพราะโมเดลทั้งสองไม่ได้อยู่ในภาวะความหน่วง (latency regime) เดียวกัน ความเร็วของเอนด์พอยต์แบบโฮสต์เป็นฟังก์ชันของรูปแบบการปรับใช้ของคุณ — serverless เทียบกับ provisioned throughput บน standard SKU เดียวกัน — ก่อนที่จะเป็นฟังก์ชันของตัวโมเดล และ Microsoft ไม่ได้เผยแพร่ตัวเลขต่อการเรียกใช้ให้เปรียบเทียบ สิ่งที่ Microsoft เผยแพร่คือข้อจำกัดด้านการดำเนินงานที่เข้มงวดซึ่งสวนทางกัน: การอนุมานแบบ batch ถูกปิดใช้งาน ไม่มีช่องทางออฟไลน์ให้ใช้เกลี่ยต้นทุนของการรันให้คะแนนแบบจำนวนมาก ดังนั้นไปป์ไลน์ Microsoft-Decision-1 จึงต้องจ่ายต้นทุนแบบอินเทอร์แอกทีฟของทุกการตัดสินใจ ขณะที่เช็กพอยต์ที่โฮสต์เองจ่ายเป็นชั่วโมง GPU ไม่ว่ากำลังให้คะแนนอยู่หรือไม่ก็ตาม

คอลัมน์การปรับเทียบ ที่ซึ่งตรงกลางพ่ายแพ้

อ่านการ์ด Intern-Decision ทั้งสามใบพร้อมกัน แล้วตระกูลนี้จะเลิกมีพฤติกรรมที่คาดเดาได้ ความแม่นยำเป็นแบบโมโนโทนตามขนาด แต่การคาลิเบรชันไม่เป็นเช่นนั้น รุ่น 2B มีค่า ECE เท่ากับ 0.100 — ซึ่งอ่อนที่สุดในบรรดาสามรุ่น — และมีอุณหภูมิที่ฟิตได้ 2.100509348278 ซึ่งต่ำกว่าค่า 2.747760550703 ของ 0.8B อยู่มาก การ์ดระบุให้คุณใช้โมดูลการอนุมานที่มาพร้อมกับขนาดที่คุณดาวน์โหลด เนื่องจากการคาลิเบรชันเริ่มต้นนั้นแยกตามเช็กพอยต์ ใครก็ตามที่คัดลอก wrapper จากรุ่นพี่น้องตัวหนึ่งไปยังอีกตัวหนึ่งจะนำอุณหภูมิที่ผิดไปใช้อย่างเงียบ ๆ

ตัวการแปลงนี้เองน่าทำความเข้าใจก่อนที่คุณจะถือว่า 0.100 นั้นเป็นคำตัดสินเกี่ยวกับ weights มันคือ softmax เหนือ logits ของผู้สมัครในฟิลด์ ตามด้วย softmax ตัวที่สองเหนือ log ของการแจกแจงนั้นหารด้วย temperature เนื่องจากมันทำงานหลัง softmax ตัวแรกและรักษาลำดับไว้ จึงไม่สามารถเปลี่ยน argmax ได้เลย มันเปลี่ยนความมั่นใจ ความน่าจะเป็นของคำตอบ yes และค่าคาดหมายของคำถามเกี่ยวกับคะแนน แต่ปล่อยให้ label เหมือนเดิม ถ้า pipeline ของคุณอ่าน labels แล้ว temperature ก็ไม่มีผลอะไร และ ECE ก็เป็นเพียงเรื่องน่ารู้ ถ้า pipeline ของคุณอ่านค่าความน่าจะเป็น — ตั้ง threshold จากค่าเหล่านั้น จัดอันดับด้วยค่าเหล่านั้น ป้อนค่าเหล่านั้นเข้าสู่การคำนวณค่าคาดหมาย — แล้ว ECE 0.100 ก็คือความแตกต่างระหว่าง threshold ที่มีความหมายอย่างที่คุณเขียนไว้ กับ threshold ที่ไม่เป็นเช่นนั้น วิธีตอบสนองที่ถูกต้องคือ fit temperature ของคุณเองบนเคสที่ติด label ของคุณเอง ไม่ใช่สรุปว่า weights แย่

Microsoft-Decision-1 ต้องการงานแบบเดียวกันทุกประการ โดยมีข้อมูลตั้งต้นน้อยกว่า แท็บ Benchmarks ของมันระบุว่าความแม่นยำ ข้อผิดพลาดในการปรับเทียบ การเรียกคืนเพื่อความปลอดภัย อัตราผลบวกลวง และความสม่ำเสมอด้านความเป็นธรรม ถูกวัดบน benchmark การตัดสินใจสาธารณะและของชุมชน บวกกับชุดทดสอบภายในที่แยกเก็บไว้ ว่าลำดับตัวเลือกถูกสลับเปลี่ยน ว่ามีการทดสอบทางสถิติแบบจับคู่ และว่าโมเดล "มีประสิทธิภาพทัดเทียมกับโมเดลการตัดสินใจชั้นนำ และนำหน้าโมเดลการตัดสินใจแบบเปิดอื่น ๆ ที่ประเมินด้วยระเบียบวิธีเดียวกัน" ไม่มี ECE ไม่มี Brier ไม่มี temperature ไม่มีตารางความแม่นยำ โมเดลที่ข้อเสนอคุณค่าทั้งหมดคือความน่าจะเป็นที่น่าเชื่อถือ กลับเป็นตัวเดียวในการเปรียบเทียบนี้ที่ไม่มีตัวเลขการปรับเทียบเผยแพร่เลยแม้แต่ตัวเดียว

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-2B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; context 32,768 tokens; modalities text only; batch inference disabled; calibration error not published; latency not published. Right column Intern-Decision-2B rows read: availability uploaded September 26, 2026; context 8,192 tokens with oversize input rejected; modalities text plus up to eight images; batch inference not applicable, self-hosted; ECE 0.100, the worst of its three siblings; 33.28 ms mean on a single RTX 4090, the fastest of the three. A footer line reads that the InternLM figures are vendor-reported and the 2B's fitted temperature is 2.100509348278.

ขอบเขตสัญญา: สี่สิ่งที่โมเดลแบบโฮสต์จะไม่ทำ

โมเดลทั้งสองรับสิ่งที่ดูเหมือนจะเป็นคำสั่งเรียกเดียวกัน และความแตกต่างนั้นอยู่ที่ขอบของมัน

• รูปแบบข้อมูล (Modality) — Microsoft-Decision-1 เป็นแบบข้อความล้วนอย่างชัดเจน ไม่รับภาพ เสียง หรือวิดีโอ ส่วน Intern-Decision-2B รับภาพได้สูงสุดแปดภาพควบคู่กับ state ซึ่งทำให้เป็นตัวเลือกสำหรับการคัดแยกภาพหน้าจอและการตรวจสอบเลย์เอาต์ที่ API แบบโฮสต์ไม่สามารถให้บริการได้ไม่ว่าจะด้วยความแม่นยำระดับใดก็ตาม

• เพดานอินพุตและโหมดความล้มเหลว — Microsoft-Decision-1 เรียกใช้เพียงครั้งเดียวบนโทเคนสูงสุด 32,768 โทเคน Intern-Decision-2B ประกาศ DecisionEngine(max_length=8192) และปฏิเสธอินพุตที่เกินขนาดแทนที่จะตัดทอน ซึ่งเป็นพฤติกรรมที่ถูกต้องสำหรับตัวให้คะแนน และยังเป็นกำแพงตายตัวอีกด้วย เนื่องจากสถานะ สคีมา และโครงร่าง ต้องมีอยู่ครบทั้งหมดในการประมวลผลครั้งเดียว ไม่มีกลยุทธ์การแบ่งชิ้นส่วนใดที่รักษาสัญญานี้ไว้ได้

• รูปร่างของคำถาม — InternLM ระบุว่าหนึ่งถึงสิบหกคำถามต่อการเรียกหนึ่งครั้ง โดยแต่ละคำถามมีตัวเลือกได้ถึง 62 ตัวเลือก ครอบคลุมฟิลด์สามประเภท (choice, score, noul) โดยที่ noul เป็นไบนารีใช่/ไม่ใช่ที่คืนค่าความน่าจะเป็น และ score คืนค่าคาดหวังถ่วงน้ำหนักด้วยความน่าจะเป็นบนสเกลที่คุณกำหนดชื่อเอง Microsoft ระบุรูปแบบต่าง ๆ — ใช่/ไม่ใช่, ปรนัย, การให้คะแนน, การจำแนกประเภท, รูบริก — พร้อมตัวเลือกการงดตอบที่รองรับอย่างชัดเจน เช่น "cannot tell" เมื่อหลักฐานไม่เพียงพอ ซึ่งเป็นบรรทัดที่มีประโยชน์ที่สุดในหน้านี้สำหรับใครก็ตามที่เขียนตรรกะการยกระดับ

• ราคา — หน้าโมเดล Microsoft-Decision-1 ไม่แสดงอัตราค่าใช้จ่าย; ราคาจะลิงก์ออกไปยังหน้าราคาของ Microsoft ดังนั้นค่าใช้จ่ายต่อการตัดสินใจเป็นสิ่งที่คุณอ่านได้จาก Azure หรือจากใบเรียกเก็บเงิน โดย 0% ของค่านั้นมาจากโทเค็นเอาต์พุตเนื่องจากไม่มีเลย Intern-Decision-2B ไม่มีค่าใช้จ่ายต่อการเรียกใช้ และมีค่าใช้จ่ายทั้งหมดในรูปของเวลา GPU และไม่มีผู้ให้บริการโฮสต์ พื้นที่จัดเก็บของมันอยู่ที่ประมาณ 4.46 GB โดยแบ่งเป็น language shard ขนาด 3.76 GB, vision tower ขนาด 612.5 MB และ projector ขนาด 50.3 MB

อะไรที่ได้รับการยืนยันแล้ว และอะไรที่เป็นเพียงคำกล่าวอ้างของผู้ขาย

การแยกสองหมวดหมู่นั้นออกจากกันคือวินัยทั้งหมดของตระกูลนี้ ยืนยันได้จากรายการไฟล์หรือการตอบสนอง HTTP: จำนวนพารามิเตอร์, แผนผังชาร์ด, คู่สัญญาอนุญาต, โมเดลฐาน, สถาปัตยกรรมที่อยู่เบื้องหลัง — Qwen3_5ForConditionalGeneration ที่มี 24 เลเยอร์, ขนาดซ่อน 2,048, 8 หัวข้อความค้นหาเทียบกับ 2 หัวข้อความสำคัญ-ค่า, มิติหัว 256, รูปแบบซ้ำของสามเลเยอร์ความสนใจเชิงเส้นต่อหนึ่งเลเยอร์ความสนใจเต็มรูปแบบ, หนึ่งเลเยอร์การทำนายหลายโทเค็นที่เก็บรักษาไว้ และเพดานการฝังตำแหน่ง 262,144 ตำแหน่ง ซึ่งเพดานเอนจิน 8,192 โทเค็นทำให้แทบไม่เกี่ยวข้อง

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

รายงานโดยผู้ขายและยังไม่มีใครทำซ้ำได้: ตัวเลขความแม่นยำทุกตัว ค่าความหน่วงทุกค่า และค่า temperature ไม่มี 'There' ไม่มีรายการบน arXiv ไม่มีโพสต์เปิดตัว ไม่มี changelog และไม่มีการประเมินอิสระ Space สาธิตตอบกลับด้วยรหัส 401 ซึ่งหมายความว่ามันไม่ได้เสีย แต่ไม่เปิดให้สาธารณะ รีโพซิทอรี GitHub ที่ปรากฏขึ้นหลังจากที่โมเดลเปิดตัว — สามคอมมิต โค้ดสำหรับฝึก แบ็กเอนด์สำหรับ inference สองตัว ชุดประเมินที่มี 10,751 แถวทดสอบ เบนช์มาร์กการคาลิเบรต 96 เคส และคู่มือการทำซ้ำ — ถือเป็นเอกสารมากกว่าที่การเปิดตัวแบบเงียบ ๆ ส่วนใหญ่จะได้รับ และมันไม่ได้ให้ทั้งน้ำหนักโมเดล ข้อมูลฝึก และสัญญาอนุญาตโค้ด Microsoft อยู่ในตำแหน่งที่แตกต่างแต่ใกล้เคียง: วิธีการของบริษัทเป็นของจริง และข้ออ้างของบริษัทเป็นเชิงคุณภาพ และในตอนนี้ไม่มีบริษัทใดอยู่ในสถานะที่จะให้ใครนอกจากคุณตรวจสอบตัวเลขหลักของตนได้

OrcaRouter อยู่ตรงจุดใดในไปป์ไลน์แบบนี้

ไม่มีโมเดลใดในสองตัวนี้อยู่ในแคตตาล็อกของเรา และไม่มีสิ่งใดในที่นี้ที่ควรตีความว่าเป็นการยืนยันความพร้อมให้บริการ โมเดลที่คืนค่าความน่าจะเป็นแทนข้อความไม่ใช่สิ่งที่คุณจะส่งคำขอ chat completions ไปให้ และนั่นก็เป็นจริงกับทั้งสองตัวนี้ สิ่งที่เรามีคือครึ่งที่เป็นฝั่งสร้างของลูปที่ตัวให้คะแนนเหล่านี้มีอยู่เพื่อรองรับ นั่นคือโมเดลกว่า 200 ตัวที่อยู่เบื้องหลังคีย์เดียวที่เข้ากันได้กับ OpenAI ซึ่งเป็นตัวเขียนรูบริก ร่างคำตอบที่เป็นตัวเลือก และส่งออก tool call ที่ตัวให้คะแนนจะประเมินก่อนที่มันจะทำงาน ราคาตามรายการของผู้ให้บริการถูกส่งผ่านในอัตรา บวกเพิ่ม 0% ดังนั้นหากผู้ขายฝั่งที่สร้างคำตอบลดราคา ราคาของเราก็ปรับตามในวันเดียวกัน และหากคุณไม่อยากเดิมพันเกณฑ์ตัดสินของคุณกับผู้ตัดสินเพียงตัวเดียว routing DSL จะประกอบโมเดลหลายตัวเข้าเป็นการเรียกครั้งเดียว และ model fusion จะรายงานความสอดคล้องของโมเดลเหล่านั้นเป็นฟิลด์ที่คุณให้คะแนนได้ ระบบ failover อัตโนมัติจะทำให้ฝั่งนั้นยังทำงานอยู่แม้ผู้ให้บริการรายใดรายหนึ่งมีปัญหา ซึ่งสำคัญกว่าในลูปที่ให้คะแนนทุกสิ่งที่เห็น มากกว่าในลูปที่ตอบผู้ใช้เป็นครั้งคราว

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

ประเด็นสำคัญ

Microsoft-Decision-1 เปิดให้บริการทั่วไปบน Microsoft Foundry ตั้งแต่ 8 ตุลาคม 2026: โฮสต์ให้บริการ, ข้อความเท่านั้น, 32,768 โทเค็น, ฐาน Qwen3.5-9B ที่ Microsoft ฝึกเพิ่มเติมภายหลัง, ไม่มีน้ำหนักแบบกระจาย, และส่วนการทดสอบมาตรฐานที่บันทึกวิธีการโดยไม่พิมพ์ตัวเลข — รวมถึงไม่มีความหน่วง โดยปิดการอนุมานแบบเป็นชุด Intern-Decision-2B เป็นเช็กพอยต์ Apache-2.0 ขนาด 2,213,241,664 พารามิเตอร์จาก 26 กันยายน 2026 ซึ่งเร็วที่สุดในสามพี่น้องที่ 33.28 มิลลิวินาทีบน 4090 และปรับคาลิเบรตได้แย่ที่สุดที่ ECE 0.100 โดยมีอุณหภูมิที่ปรับพอดี 2.100509348278 ซึ่งไม่สามารถเปลี่ยนป้ายกำกับได้ แต่จะเปลี่ยนทุกค่าความเชื่อมั่นที่คุณใช้ตั้งเกณฑ์ หากคุณต้องการขนาดกลาง ข้อโต้แย้งที่ตรงไปตรงมาสำหรับมันนั้นมีน้อย: จ่ายเพิ่ม 2.7 GB เพื่อความแม่นยำของ 4B หรือยอมรับพื้นที่การใช้งานของ 0.8B และไม่ว่าในกรณีใด จงปรับคาลิเบรตของคุณเองก่อนที่เกณฑ์จะเข้าใกล้โปรดักชัน

สิ่งที่เรานำมาคือครึ่งส่วนสร้างสรรค์ของลูปที่ตัวให้คะแนนเหล่านั้นมีอยู่เพื่อรองรับ: โมเดลมากกว่า 200 ตัวที่อยู่เบื้องหลัง คีย์เดียวที่เข้ากันได้กับ OpenAI ที่เขียนรูบริก ร่างคำตอบที่เป็นไปได้ และส่งการเรียกเครื่องมือที่ตัวให้คะแนนจะให้คะแนนก่อนที่มันจะถูกดำเนินการ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube