การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับการเปรียบเทียบ Decision 3.0 กับ Microsoft-Decision-1 มีคำบรรยายใต้ชื่อว่า 'โครงหลัก Qwen3.5-9B เดียวกัน แต่มีวิธีซื้อที่ตรงกันข้าม' พร้อมชิปที่ระบุว่า 'weights Apache-2.0 เทียบกับ hosted only', 'images and video เทียบกับ text only', 'published 10 Oct เทียบกับ GA 8 Oct' และส่วนท้ายที่ระบุว่า 'ตัวเลขของ Decision 3.0 เป็นของ vLLM-SR เอง ตัวเลขของ Microsoft-Decision-1 เป็นของ Microsoft เอง ทั้งสองไม่ได้ถูกทำซ้ำอย่างอิสระ' โลโก้ OrcaRouter ถูกประกอบไว้ที่มุมขวาล่าง
Engineering & Research

Decision 3.0 กับ Microsoft-Decision-1: อันหนึ่งคือไฟล์ดาวน์โหลด อีกอันคือ SKU

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ระดับ 9B ของ Decision 3.0 และ Microsoft-Decision-1 บนกระดาษแล้วเป็นผลิตภัณฑ์เดียวกัน ทั้งคู่ทำ post-train Qwen3.5-9B ให้เป็นตัวให้คะแนนที่ตอบคำตอบตัวเลือกชุดหนึ่งซึ่งกำหนดไว้ตายตัว ด้วยความน่าจะเป็นที่ปรับเทียบแล้วสำหรับแต่ละคำตอบ โดยไม่เคยสร้างโทเค็นเลยแม้แต่ตัวเดียว ทั้งคู่มุ่งเป้าไปที่งานเดียวกัน — การจัดเส้นทางคำขอ การให้เกรดผลลัพธ์เทียบกับรูบริก การควบคุมการทำงานของเอเจนต์ การคัดแยกคิว ทั้งสองออกมาห่างกันไม่เกินหนึ่งสัปดาห์: Microsoft-Decision-1 เปิดให้ใช้ทั่วไปบน Microsoft Foundry เมื่อวันที่ 8 ตุลาคม 2026 และประกาศในวันถัดมา และ d3-flash ถูกผลักขึ้น Hugging Face เมื่อเวลา 17:23 UTC วันที่ 10 ตุลาคม 2026

ความแตกต่างไม่ได้อยู่ที่โมเดล แต่อยู่ที่สิ่งที่คุณได้รับอนุญาตให้ทำกับมัน d3-flash เป็นเช็กพอยต์ Apache-2.0 ขนาด 8.39 พันล้านพารามิเตอร์ที่คุณดาวน์โหลดและรันได้ อยู่ในอันดับที่สามในตระกูลที่เริ่มต้นที่ 0.59B และสูงสุดที่ 26.09B Microsoft-Decision-1 เป็นเอนด์พอยต์แบบโฮสต์บน Foundry โดยที่เวตไม่ได้ถูกเผยแพร่เลย ในสายผลิตภัณฑ์ที่ Microsoft กล่าวว่าจะรีเบสไปยังโมเดล MAI ของตัวเองในภายหลัง หนึ่งในสองนี้เป็นอาร์ติแฟกต์ ส่วนอีกสิ่งเป็นบริการ คำถามเชิงปฏิบัติเกือบทุกข้อเกี่ยวกับคู่นี้ล้วนเป็นผลมาจากข้อเท็จจริงข้อเดียวนั้น รวมถึงข้อที่ดูเหมือนจะเกี่ยวกับเบนช์มาร์กด้วย

การตัดสินใจสองเรื่องเกี่ยวกับว่าแบบจำลองการตัดสินใจมีไว้เพื่ออะไร

โพสต์ของ Microsoft มีความชัดเจนเกี่ยวกับขอบเขตในแบบที่การ์ดโมเดลทำได้ไม่บ่อยนัก รูปแบบคำถามที่รองรับได้แก่ ใช่/ไม่ใช่ ปรนัย การให้คะแนน การจำแนกประเภท และการให้เกรดตามเกณฑ์ ข้อยกเว้นก็ถูกระบุไว้อย่างตรงไปตรงมาเช่นกัน: ไม่ได้ออกแบบมาสำหรับการสร้างข้อความ การตอบคำถามปลายเปิด การสนทนา การแปล หรือการสรุปความ และไม่ได้มีไว้สำหรับงานที่ต้องใช้ความรู้ที่ไม่มีอยู่ในข้อมูลนำเข้า มันทำงานหนึ่งรอบบนโทเค็นสูงสุด 32,768 โทเค็น และส่งออกโทเค็นเอาต์พุตเป็นศูนย์เนื่องจากไม่มีลูปการถอดรหัส Microsoft ยังรองรับตัวเลือกการงดตอบ เช่น "บอกไม่ได้" เมื่อหลักฐานที่ให้มาไม่เพียงพอ ซึ่งเป็นรายละเอียดที่ทำให้การตั้งเกณฑ์บนเอาต์พุตมีความหมายได้เลย

d3-flash อยู่ในกรอบแนวคิดเดียวกัน — คำถามแบบ Choice, Noul (ใช่/ไม่ใช่) และ Score, ฟอร์เวิร์ดพาสหนึ่งครั้งต่อคำถาม, ค่าความน่าจะเป็นหนึ่งค่าต่อตัวเลือก, ไม่มีการสร้างคำตอบ — จากนั้นจึงขยายด้านอินพุตให้กว้างขึ้น ในขณะที่ Microsoft-Decision-1 เป็นข้อความเท่านั้นโดยการออกแบบ d3-flash รับข้อความหรือ JSON, รูปภาพหลายรูปต่อคำขอ โดยแต่ละรูปมีความละเอียดสูงสุด 1.6 ล้านพิกเซล และวิดีโอหลายรายการที่อ่านด้วยอัตรา 2 เฟรมต่อวินาที ทุกคำถามในคำขอจะเห็นรูปภาพและวิดีโอทั้งหมดที่แนบมากับคำขอนั้น เป็นโมเดลที่เล็กกว่าแต่ทำได้มากกว่าด้วยอินพุตที่ได้รับ

นั่นคือความแตกแยกจริงครั้งแรก และมันไม่ใช่เรื่องของรสนิยม หากการตัดสินใจที่คุณต้องทำเกี่ยวกับภาพหน้าจอ ใบเสร็จ แผนภูมิ หรือคลิปจากกล้อง Microsoft-Decision-1 ไม่สามารถทำได้ นั่นคือขอบเขตของความสามารถ ไม่ใช่ช่องว่างด้านคุณภาพ และไม่ว่าจะทำงานด้านความแม่นยำมากเพียงใดก็ปิดช่องว่างนั้นไม่ได้

แต่ละรายเผยแพร่อะไร และเผยแพร่อย่างไร

ในที่นี้ รีลีสทั้งสองกำลังทำการพิสูจน์คนละแบบอย่างแท้จริง และเป็นการดีกว่าที่จะแยกทั้งสองออกจากกัน มากกว่าจะนำตัวเลขมาเรียงเทียบกัน

Microsoft ได้ทำการเปรียบเทียบ 36 เบนช์มาร์กที่ครอบคลุมคำถามเกือบ 150,000 ข้อซึ่งถูกกันไว้ไม่ให้เห็นระหว่างการฝึก ครอบคลุมงานด้าน routing การจัดอันดับ คอนเท็กซ์ยาว หลายภาษา และงานแบบ out-of-distribution การให้เหตุผล และความปลอดภัย และระบุว่าโมเดลของตนได้ผลดีที่สุดในทุกชุดการทดสอบเหล่านั้น บริษัทรายงานค่าความหน่วงเป็นอัตราส่วนแทนที่จะเป็นตัวเลข โดย p50 เร็วกว่า GPT-6 Sol ประมาณ 35 เท่า และเร็วกว่า H2O-Lightning-4B v1.1 ราว 2.5 เท่า ซึ่งระบุว่าเป็นผู้ตามอันดับสอง บริษัทบันทึกความทนทานเป็นกระบวนการ คำขอเดียวกันที่ถูกปรับเปลี่ยน 8 รูปแบบ อัตราการพลิกคำตัดสินเฉลี่ย 1.3% และไม่มีการพลิกเลยเมื่อคำอธิบายตัวเลือกถูกเขียนใหม่ด้วยคำอื่น หรือเมื่อตัวเลือกถูกสลับลำดับหรือสุ่ม บริษัททดสอบความปลอดภัยกับคำขอ 5,250 รายการใน 11 เบนช์มาร์กที่ครอบคลุมเนื้อหาเป็นอันตราย การ jailbreaking และ prompt injection บริษัทระบุมาตรฐานการคาลิเบรตที่ตนเองยึดถือ การทำนายที่มีความเชื่อมั่น 90% ควรถูกต้องประมาณเก้าครั้งจากสิบครั้งในกรณีที่เป็นตัวแทน

vLLM-SR เผยแพร่ดัชนี ดัชนี Jev Decision 0.3.1 จัดให้ d3 อยู่ที่ 64.7 โดย d3-flash อยู่ที่ public-suite 57.79 ซึ่งอ้างว่าเพิ่มขึ้น 11.0 จากโมเดล 9B ของ Decision 2.0 ที่ 46.76 นอกจากนี้ยังอ้างว่าคำขอสาธารณะทั้งหมด 140,178 รายการได้รับคำตอบ โดยไม่มีรายการใดที่ไม่รองรับ ซึ่งเป็นคำกล่าวอ้างเรื่องความครอบคลุมมากกว่าเรื่องความแม่นยำ การ์ดเปิดเผยว่าแถวของ d3 เองเป็นการประเมินภายใน ขณะที่แถวเปรียบเทียบข้าง ๆ — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — เป็นข้อมูลบอร์ดสด และในด้านมัลติโมดัล โมเดลตระกูล d3 รายงานคะแนน Perception Test จากคำถามตรวจสอบทั้งหมด 19,140 ข้อ โดย d3-flash อยู่ที่ 73.3 เทียบกับค่าพื้นจากการเดาแบบสามตัวเลือกที่ 33.3

ดังนั้น: Microsoft เผยแพร่คำกล่าวอ้างเรื่องความครอบคลุมพร้อมวิธีการที่มีเอกสารประกอบและตัวเลขความทนทาน โดยไม่มีตัวเลขการปรับเทียบต่อเช็คพอยต์ vLLM-SR เผยแพร่ตำแหน่งบนกระดานผู้นำพร้อมช่องว่างด้านที่มาที่ระบุไว้ระหว่างแถวของตัวเองกับแถวอื่นๆ บวกกับผลลัพธ์จากวิดีโอ และก็ไม่มีตัวเลขการปรับเทียบเช่นกัน การ์ดทั้งสองไม่มีคะแนน Brier หรือตัวเลขข้อผิดพลาดการปรับเทียบที่คาดหมายสำหรับโมเดลที่มันอธิบาย สำหรับผลิตภัณฑ์สองตัวที่ข้อเสนอคุณค่าทั้งหมดคือตัวเลขที่ส่งคืนมีความหมาย นั่นคือช่องโหว่ร่วม และมันเป็นสิ่งที่มีประโยชน์ที่สุดเพียงหนึ่งเดียวที่ผู้ขายรายใดรายหนึ่งจะปล่อยออกมาถัดไปได้

A generated two-column scoreboard headed 'Decision 3.0 d3-flash vs Microsoft-Decision-1 - the scoreboard'. The left column for d3-flash reads: base model Qwen3.5-9B fine-tuned, 8.39B parameters; distribution Apache-2.0 weights on Hugging Face from 10 October 2026; input text, images and video; context budget not stated on the card; reported accuracy Jev Decision Index 0.3 public suite 57.79, an internal evaluation; latency median 19.1 ms text, 149.4 ms image and 407.6 ms video. The right column for Microsoft-Decision-1 reads: base model Qwen3.5-9B post-trained, weights not distributed; distribution hosted on Microsoft Foundry, generally available 8 October 2026; input text only; context budget 32,768 tokens; reported accuracy best of 36 benchmarks covering nearly 150,000 blind questions; latency p50 around 35 times faster than GPT-6 Sol. A footer reads 'd3-flash figures are vLLM-SR's own internal evaluation; Microsoft-Decision-1 figures are Microsoft's own; neither is independently reproduced.'

การจัดจำหน่ายเป็นตัวตัดสินมากกว่าที่เอกสารสเปกจะเป็น

นี่คือจุดที่การเปรียบเทียบไม่ใช่เรื่องของโมเดลอีกต่อไป

ด้วย d3-flashคุณจะได้เวต ไฟล์ decision_config.jsonที่ปักหมุด base revision ไว้, manifest SHA-256 รายไฟล์, โค้ดโมเดลลิ่งที่เขียนขึ้นเอง, readout head และชุด dependency ที่มีเอกสารกำกับ ซึ่งรวมถึง transformers==5.17.0 และแพ็กเกจ CUDA kernel แบบออปชันสำหรับเลเยอร์ linear-attention คุณรันมันบนฮาร์ดแวร์ของคุณเองได้ ไฟน์จูนได้ ควอนไทซ์ได้ แยกออกจากเครือข่ายแบบ air-gap ได้ นอกจากนี้คุณยังต้องรับงานด้านปฏิบัติการมาด้วย: คลาส Python ไม่ใช่เอนด์พอยต์ และการ์ดไม่ได้ระบุ token budget สำหรับ state บวกคำถามบวกคำอธิบายของผู้สมัคร — max_length เป็น null ในคอนฟิกที่จัดส่งมา ดังนั้นเพดานนั้นคุณต้องไปค้นหาเอาเอง

ด้วย Microsoft-Decision-1คุณจะได้เอนด์พอยต์ภายในบัญชีคลาวด์ที่มีอยู่ พร้อมด้วยการรับรองความถูกต้อง ความพร้อมใช้งานในระดับภูมิภาค และการควบคุมการจัดเตรียมที่มาพร้อมกัน และคุณไม่ต้องทำงานด้านปฏิบัติการใดๆ คุณยังไม่ได้รับการควบคุมใดๆ เช่นกัน ไม่มีที่เก็บให้ดาวน์โหลด ไม่มีเส้นทางการปรับละเอียด และไม่มีตัวเลือกการโฮสต์เอง วงจรชีวิตของโมเดลเป็นของ Microsoft ไม่ใช่ของคุณ และประกาศเลิกใช้หรือการเปลี่ยนฐานไปยังแบ็กโบนอื่นเป็นสิ่งที่คุณต้องรับไว้แทนที่จะเป็นสิ่งที่คุณกำหนดเวลา Microsoft กล่าวว่ากำลังจะมีการเปลี่ยนฐานไปยังโมเดล MAI ของตัวเอง ซึ่งเป็นแผนงานที่สมเหตุสมผลสำหรับโมเดลที่มีจุดมุ่งหมายคือการให้คะแนนแบบรอบเดียวที่รวดเร็ว และยังหมายความว่าเช็คพอยต์เฉพาะที่คุณทดสอบประสิทธิภาพนั้นไม่จำเป็นต้องเป็นตัวที่คุณจะเรียกใช้ในอีกหนึ่งปี

เรื่องราวความหน่วงก็ต้องอ่านอย่างระมัดระวังเช่นกัน ตัวเลขพาดหัวของ Microsoft เป็นอัตราส่วนเมื่อเทียบกับโมเดลอเนกประสงค์ที่ใหญ่กว่ามาก ซึ่งเป็นการเปรียบเทียบที่ถูกต้องสำหรับข้อโต้แย้งของมัน — หน้าที่ของโมเดลตัดสินใจคือการแทนที่การเรียกใช้แบบเจเนอเรทีฟที่มีค่าใช้จ่ายสูงด้วยการให้คะแนนที่มีค่าใช้จ่ายต่ำ และ 35x เมื่อเทียบกับ GPT-6 Sol ที่ p50 คือสิ่งที่ข้อโต้แย้งนั้นดูเป็นอย่างไรเมื่อมันได้ผล ตัวเลขของ vLLM-SR เป็นแบบสัมบูรณ์ แบบคำขอเดียวและ GPU เดียว และแสดงให้เห็นภาษี modality อย่างชัดเจน: บน AMD Instinct MI325X หนึ่งตัว คำขอข้อความไปยัง d3-flash ใช้เวลาค่ามัธยฐาน 19.1 ms คำขอเดียวกันกับรูปภาพใช้เวลา 149.4 ms และกับวิดีโอสิบวินาที 407.6 ms ทั้งสองชุดเป็นตัวเลขที่ผู้ขายรายงาน บนฮาร์ดแวร์ที่แตกต่างกัน และไม่มีชุดใดถูกทำซ้ำนอกห้องแล็บที่สร้างมันขึ้นมา

A screenshot of the vllm-sr/d3 model card on Hugging Face, the flagship checkpoint of the Decision 3.0 family that d3-flash belongs to. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The sidebar shows 130 downloads last month, the model tree pinned to Qwen/Qwen3.8-27B, and a collection entry listing 6 items.

วิธีการเลือก

กฎการตัดสินใจนั้นสั้น ซึ่งเป็นสัญญาณที่ดีว่าผลิตภัณฑ์ทั้งสองไม่ได้แข่งขันกันจริง ๆ สำหรับช่องเดียวกัน

เลือก Microsoft-Decision-1 หากการตัดสินใจเป็นแบบข้อความล้วน หากคุณรันบน Foundry อยู่แล้ว และหากสาระสำคัญอยู่ที่การเป็นการเรียกใช้ (call) มากกว่าการดีพลอย (deployment) — ไม่มี GPU ต้องซื้อ ไม่มีคอนเทนเนอร์ต้องดูแล ไม่มีวงจรชีวิตของโมเดลต้องเป็นเจ้าของ เอกสารประกอบของ Microsoft ยังใช้งานได้ง่ายกว่าของอีกฝ่ายสำหรับทีมแพลตฟอร์ม: ค่า perturbation จำนวนการทดสอบความปลอดภัย และข้อความที่ระบุว่ารองรับตัวเลือกการงดตอบ (abstention) คือสิ่งที่คุณต้องใช้ในการเขียนนโยบายเกณฑ์ตัดสิน และเพดาน 32,768 โทเคนก็ระบุไว้ชัดเจนแทนที่จะเว้นว่างไว้

เลือกใช้ Decision 3.0 — ในทางปฏิบัติคือ d3-flash หรือ d3-mini — หากส่วนใดของการตัดสินใจต้องพึ่งพารูปภาพหรือคลิป หากคุณต้องรันมันในที่ที่ API แบบโฮสต์เข้าถึงไม่ได้ หรือหากคุณต้องการปรับละเอียด (fine-tune) ตัวให้คะแนนด้วยเคสที่มีป้ายกำกับของคุณเอง สัญญาอนุญาต Apache-2.0 และ hash manifest ระดับไฟล์ทำให้สิ่งนั้นเป็นตัวเลือกจริง ไม่ใช่แค่ในทางทฤษฎี สิ่งที่คุณต้องยอมรับแลกมาคืองบประมาณอินพุตที่ไม่ได้ระบุไว้ ไม่มีการเผยแพร่ข้อมูลการปรับเทียบ และความจริงที่ว่าตระกูลนี้เพิ่งเปิดตัวได้ไม่กี่วันโดยแทบไม่มีการใช้งานจากภายนอกมารองรับเลย

หากคุณต้องการทั้งสองอย่าง — ตัวให้คะแนนแบบโฮสต์สำหรับเส้นทางข้อความทั่วไป และตัวให้คะแนนแบบโฮสต์เองสำหรับกรณีมัลติโหมดหรือกรณีที่แยกจากเครือข่าย (air-gapped) ซึ่งเรียกผ่านอินเทอร์เฟซเดียวกัน — ตามจริงแล้วไม่มีผู้ขายรายใดให้สิ่งนั้นกับคุณได้ในปัจจุบัน และรูปแบบคำขอทั้งสองแบบก็ใกล้เคียงกันพอที่จะรวมเข้าด้วยกันได้ แต่ก็ไม่เหมือนกันเสียทีเดียว

OrcaRouter อยู่ตรงไหน และไม่อยู่ตรงไหน

typesafe/jev-1.13เป็นโมเดลการตัดสินใจในแคตตาล็อกของเรา ให้บริการผ่าน POST /v1/systemoneด้วยสัญญา state-and-named-questions แบบเดียวกับที่โมเดลทั้งสองข้างต้นใช้: ข้อความเข้า, JSON ที่มีโครงสร้างออก, สูงสุดประมาณ 64K โทเค็นอินพุต, ไม่สตรีมมิ่ง, $0.042 ต่อล้านโทเค็นอินพุต โดยไม่มีค่า completion เพราะมันไม่เคยสร้างออกมา. ที่น่าสังเกตคือ คำถามเรื่องงบประมาณโทเค็นแบบ Android ที่การ์ดทั้งสองข้างต้นไม่ได้ตอบเต็มนั้น ได้รับคำตอบที่นี่

เราไม่ได้ให้บริการโมเดลทั้งสองนี้ใน การเปรียบเทียบนี้ เดซีชัน 3.0 (Decision 3.0) มีเช็กพอยต์ที่เผยแพร่ในรูปแบบเส้นทางการอนุมานแบบโลคัลภายในที่เก็บ Hugging Face มากกว่าที่จะเป็นเอนด์พอยต์ที่กำหนดเส้นทางได้ ส่วน Microsoft-Decision-1 เผยแพร่ผ่านแพลตฟอร์มของ Microsoft เองและแพลตฟอร์มของบุคคลที่สามอีกหลายแห่ง — ไม่ใช่ผ่านเรา ไม่มีข้อความใดในที่นี้ที่ควรตีความว่าเป็นการอ้างอิงถึงความพร้อมใช้งานของทั้งสองโมเดล

สิ่งที่ routing layer มีค่าจริง ๆ ในการตัดสินใจครั้งนี้อยู่ที่อีกครึ่งหนึ่งของลูป ตัว scorer นั้นถูกโดยธรรมชาติ แต่โมเดลที่นำผลลัพธ์ของมันไปลงมือทำกลับไม่ใช่ และการจับคู่โมเดลตัดสินใจกับโมเดลแบบ generative ปกติแล้วหมายถึงการ integrate สองครั้ง ความสัมพันธ์ด้านการเรียกเก็บเงินสองชุด และโหมดความล้มเหลวสองแบบ การเรียกทั้งสองผ่านคีย์เดียวข้ามโมเดลกว่า 200 ตัว — พร้อม automatic failover เมื่อผู้ให้บริการสะดุด และราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยบวกเพิ่ม 0% ทำให้การเปลี่ยนแปลงราคาจากผู้ขายมีผลทันทีในวันเดียวกัน — หมายความว่าคุณสลับ scorer ได้โดยไม่ต้องแตะจุดที่เรียกใช้งาน สิ่งนี้สำคัญกว่าปกติในกรณีนี้ เพราะโมเดลทั้งสองนี้ยังใหม่อยู่มากพอที่การตัดสินใจที่คุณทำในสัปดาห์นี้ควรเป็นสิ่งที่คุณสามารถย้อนกลับได้ในเดือนหน้า

A screenshot of the OrcaRouter models catalogue, headed 'Models - 207 models - 16 providers - one API key, one bill'. Filter tabs read All 207, Text 172, Image 10, Embeddings 5, Video 10 and TTS 10. A panel titled 'How to call any model' lists three steps - copy the model ID from any card, paste it into the model field, POST to our OpenAI-compatible endpoint - beside a code block showing POST https://api.orcarouter.ai/v1/chat/completions. Model cards below include OpenAI: GPT-6.1 Sol and Anthropic: Claude Sonnet 5.5 at $2.00 per million input tokens and $10.00 output, and TypeSafe: Jev 1.13 at 65K context with $0.042 per million input tokens and $0.042 per million output tokens. A credit panel above shows monthly plans from $50 to $1,000.

คำถามที่ตัดสินเรื่องนี้ในอีกหกเดือน

สองทีมทำ post-training ให้เช็คพอยต์ฐานเดียวกันกลายเป็นผลิตภัณฑ์รูปแบบเดียวกันในสัปดาห์เดียวกัน และได้ข้อสรุปตรงกันข้ามเกี่ยวกับวิธีที่มันควรไปถึงมือลูกค้า นั่นไม่ใช่ความบังเอิญของจังหวะเวลาเท่าไรนัก หากแต่เป็นทางแยกในวิธีที่หมวดหมู่นี้ถูกขาย: ในฐานะเวตโมเดลหรือในฐานะบริการ ในฐานะสิ่งที่คุณเป็นเจ้าของหรือสิ่งที่คุณเรียกใช้

จับตาสัญญาณสามประการ ว่าการรีเบสของไมโครซอฟต์ไปยัง MAI หรือโมเดลของตัวเอง จะเปลี่ยนพฤติกรรมด้านความแม่นยำและความหน่วงที่กำลังขายอยู่ในปัจจุบันหรือไม่ — และลูกค้าจะได้รับการแจ้งล่วงหน้ามากน้อยเพียงใด ว่า vLLM-SR จะเผยแพร่งบประมาณอินพุตและค่าการปรับเทียบสำหรับ Decision 3.0 หรือไม่ ซึ่งจะปิดช่องว่างที่ทำให้ดัชนีของตนยังไม่อาจนำไปใช้ได้จริง และว่าใครก็ตามที่อยู่นอกห้องแล็บทั้งสองแห่งจะรันชุดทดสอบสาธารณะบนน้ำหนัก d3 ที่เผยแพร่แล้วหรือไม่ เพราะในตอนนี้ ตัวเลขเดียวที่จะทำให้การเปรียบเทียบนี้ได้ข้อยุติ คือตัวเลขที่ผู้จำหน่ายทั้งสองรายยังไม่ได้ผลิตออกมา

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube