การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับ Microsoft-Decision-1 vs Kev พร้อมคำบรรยายรองว่า 'ตัวให้คะแนนแบบโฮสต์เทียบกับสูตรที่คุณสามารถเทรนใหม่ได้' โดยมีชิปที่ระบุว่า 9B hosted API เทียบกับฐานแบบ frozen บวกอะแดปเตอร์ LoRA แบบ rank-16 ขนาด 33.8M, ไม่มีเบนช์มาร์กที่เผยแพร่ เทียบกับ ECE 0.017 บน transfer-v4, ไม่มีการแจกจ่ายเวต เทียบกับ Apache-2.0 และส่วนท้ายระบุแหล่งที่มาโดยระบุว่าตัวเลขทั้งสองชุดเป็นข้อมูลที่รายงานด้วยตนเอง
Engineering & Research

Microsoft-Decision-1 vs Kev: การซื้อคะแนน หรือการเป็นเจ้าของสูตรที่ผลิตคะแนนนั้น

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Jared Palmer วางใบเสร็จไว้ข้างโมเดลของเขา ครอบครัว Kev — Kev-0.8B, Kev-4B และ Kev-9B ซึ่งสร้างอยู่บน checkpoint ฐานแบบเปิดน้ำหนักที่ถูกแช่แข็ง พร้อมอะแดปเตอร์ LoRA แรงค์ 16 และหัว pointer ขนาดเล็ก — เปิดตัวเมื่อวันที่ 24 กันยายน 2026 โดยเผยแพร่ทั้งสูตรการฝึก จำนวนข้อมูลรายขั้นตอน และตัวเลขการประเมินทั้งหมด และพาดหัวที่ตรงไปตรงมาสำหรับใครก็ตามที่เปรียบเทียบมันกับ Microsoft-Decision-1 ก็คือ Kev บอกคุณได้มากกว่ามหาศาลเกี่ยวกับวิธีทำซ้ำตัวมันเอง ตัวให้คะแนนของ Microsoft เปิดให้ใช้ทั่วไปบน Microsoft Foundry เมื่อวันที่ 8 ตุลาคม 2026: ฐาน Qwen3.5-9B ที่ Microsoft ฝึกต่อหลังการฝึกหลัก บริบท 32,768 โทเคน รองรับเฉพาะข้อความ ไม่แจกจ่ายน้ำหนัก มีระเบียบวิธีการประเมินที่เผยแพร่ แต่ไม่มีผลลัพธ์ที่เผยแพร่ ทั้งสองรับ state และชุดคำถามที่มีการระบุชนิด แล้วคืนค่าการแจกแจงที่ปรับเทียบแล้วแทนข้อความที่สร้างขึ้น ตัวหนึ่งเป็นบริการ อีกตัวเป็นวิธีการที่คุณรันในโน้ตบุ๊กได้คืนนี้

เหตุผลที่ความแตกต่างนี้เป็นตัวตัดสินการจับคู่นี้ แทนที่จะเป็นความสามารถ: Kev-4B รายงาน ECE 0.017 ในการทดสอบแบบ locked ที่อยู่นอกโดเมนของมัน และ Microsoft-Decision-1 ไม่ได้รายงานค่าใด ๆ ดังนั้นข้อโต้แย้งเรื่องการสอบเทียบ (calibration) ซึ่งโดยปกติใช้ตัดสินการเปรียบเทียบแบบ scorer-versus-scorer จึงมีเพียงฝ่ายเดียวที่ระบุจุดยืนของตน

Kev เผยแพร่จริงๆ อะไร

การ์ดของ Kev-4B มีความเฉพาะเจาะจงสูงผิดปกติ และความเฉพาะเจาะจงนั้นเองคือประเด็นสำคัญ แกนหลักคือ Qwen3.5-4B-Base ที่ถูกฟรีซไว้ที่ revision ซึ่งระบุชื่อไว้ โดยมีเลเยอร์ linear attention แบบ Gated DeltaNet จำนวน 24 เลเยอร์ และเลเยอร์ full attention จำนวน 8 เลเยอร์ ที่ hidden size 2,560 บนชั้นบนสุดเป็น LoRA adapter แบบ rank-16 ซึ่งมีพารามิเตอร์ที่เทรนได้ 33.8 ล้านตัว นำไปใช้กับ projection ของ attention, MLP และ DeltaNet พร้อมกับ pointer head ที่ให้คะแนนโทเคนปิดท้ายของแต่ละตัวเลือกเทียบกับโทเคนสุดท้ายของคำถามแล้วทำ softmax มีค่าอุณหภูมิค่าเดียว T = 2.41 ถูกเก็บไว้ในไฟล์ head และนำไปใช้ตอนโหลด โดยการ์ดระบุค่าที่ฟิตได้และแฮชของไฟล์ไว้ด้วย การเทรนทำเป็นระยะ ๆ พร้อมจำนวนเรกคอร์ดที่เผยแพร่ไว้ คือสูตรฐาน 12,576 เรกคอร์ด, 1,425 เรกคอร์ดสำหรับวันที่และหลักฐานที่ขาดหาย, 5,219 เรกคอร์ดเป็นเรื่องร้องเรียนจริงของ CFPB, 6,000 เรกคอร์ดทักษะ และ 5,320 เรกคอร์ดเครื่องมือสำหรับนักพัฒนา โดยระยะหลัง ๆ จะเล่นซ้ำข้อมูลจากระยะก่อนหน้า การ์ดยังระบุด้วยว่าอะไรที่ไม่ได้ใช้: "ไม่มีการใช้เอาต์พุตใด ๆ ของ Jev (โมเดลตัดสินใจแบบโฮสต์ของ TypeSafe)"

ตาราง benchmark ถูกระบุไว้ในหน้าเดียวกัน และแนบกรณีล้มเหลวมาด้วย ซึ่งพบได้ยากกว่ากรณีสำเร็จ การทดสอบ out-of-domain แบบล็อกของ Transfer-v4: ความแม่นยำ 0.838, Brier 0.224, ECE 0.017 Breadth-v1 จากชุดข้อมูลที่กันไว้ 14 ชุดและคำถาม 3,089 ข้อ: ความแม่นยำ 0.690, ECE 0.029 การทดสอบ Hard-v1: 0.803 การทดสอบ Documents-v1: 0.903 MMLU-Pro แบบสิบตัวเลือก: 0.565 การคำนวณวันที่: 0.65 ซึ่งผู้เขียนระบุว่าเป็นจุดอ่อนที่สุด โดยมี preprocessor flag เสนอเป็นวิธีแก้บางส่วน และมีหมายเหตุชัดเจนว่ายังไม่ได้วัดใหม่ ส่วนข้อจำกัดเพิ่มเติมว่า การปรับคาลิเบรตเป็น temperature แบบ in-distribution เพียงค่าเดียว ดังนั้นความครอบคลุมจึงลดลงนอกโดเมน ลำดับตัวเลือกอาจทำให้คำตอบพลิกได้ และความยาวเกิน 8,192 โทเคนนั้นให้บริการได้แต่ยังไม่ได้รับการตรวจสอบความถูกต้อง ตัวเลขการให้บริการก็เผยแพร่ด้วย: 18.1 ms สำหรับหกคำถามบน state สั้น ๆ บน H100, 12.9 ms เมื่อแคชไว้, หน่วยความจำ GPU แบบ resident 14.3 GB

A generated two-column scoreboard for Microsoft-Decision-1 and Kev across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus a frozen Qwen3.5-4B-Base with a 33.8M rank-16 LoRA adapter and pointer head; weights not distributed versus Apache-2.0 download; context 32,768 tokens versus 8,192 validated and 65,536 served; published scores none versus vendor-reported ECE 0.017 on transfer-v4 with Brier 0.224; tuning not available versus the full training recipe published with per-stage record counts; and price a Foundry per-token rate versus free to self-host. A footer reads that both sets of figures are self-reported by their publishers.

สิ่งที่ Microsoft เผยแพร่แทน

Microsoft-Decision-1 ครอบคลุมเนื้อหาเดียวกันเป็นส่วนใหญ่ด้วยท่าทีที่แตกต่างออกไป โดยให้คะแนนคำถามแบบใช่/ไม่ใช่ แบบปรนัย แบบให้คะแนน แบบจำแนกประเภท และแบบรูบริก รองรับตัวเลือกการงดออกเสียงอย่างชัดเจน เช่น "ไม่สามารถบอกได้," ส่งคืนความน่าจะเป็นในรูปแบบ JSON และทำงานในการเรียกใช้ครั้งเดียวด้วยโทเค็นสูงสุด 32K — ซึ่งเป็นสี่เท่าของบริบทที่ Kev ตรวจสอบ ถูกเผยแพร่เป็น API ที่โฮสต์ใน Microsoft Foundry ภายใต้กลุ่มผลิตภัณฑ์ Direct from Azure พร้อมการปรับใช้แบบไร้เซิร์ฟเวอร์และปลายทางแบบรวม, SKU มาตรฐาน, การรับรองความถูกต้องของ Azure และเส้นทางการเรียกเก็บเงินแบบรวม การอนุมานแบบกลุ่มถูกปิดใช้งาน และไม่มีการดาวน์โหลดเวทและไม่มีเส้นทางการปรับแต่งละเอียด

ส่วนการประเมินอธิบายถึงเกณฑ์มาตรฐานการตัดสินใจของสาธารณะและชุมชน รวมถึงชุดข้อมูลภายในที่กันไว้สำหรับทดสอบ ตัวชี้วัดซึ่งรวมถึงความแม่นยำและค่าความคลาดเคลื่อนของการปรับเทียบ ลำดับตัวเลือกที่สลับกัน การทดสอบทางสถิติแบบจับคู่ และข้ออ้างว่าโมเดล "ทำงานได้ทัดเทียมกับโมเดลการตัดสินใจชั้นนำ และนำหน้าโมเดลการตัดสินใจแบบเปิดอื่น ๆ ที่ประเมินด้วยระเบียบวิธีเดียวกัน" ไม่มีตาราง บัตรโมเดลระบุข้อจำกัดของตนเองอย่างตรงไปตรงมา — คะแนนเปลี่ยนไปตามถ้อยคำและลำดับตัวเลือก การปรับเทียบแม่นยำที่สุดกับประเภทงานที่คุ้นเคย ไม่มีการสร้างคำอธิบาย และความครอบคลุมภาษาที่ไม่ใช่ภาษาอังกฤษอ่อนแอที่สุด — แต่รายการข้อจำกัดไม่ใช่การวัดการปรับเทียบ ใครก็ตามที่ตั้งเกณฑ์ยอมรับอัตโนมัติที่ 0.9 บน Microsoft-Decision-1 กำลังตั้งมันด้วยความเชื่อ และปรับมันในการใช้งานจริง

A screenshot of the Kev-4B model card on Hugging Face, read 10 October 2026, showing the jaredpalmer organisation, 114 likes, an apache-2.0 licence label, and the Model card, Files and versions and Community tabs above the Kev-4B heading and a Model summary section.

ส่วนของการเปรียบเทียบที่ต้องเสียเงิน

เศรษฐศาสตร์ของ Kev คือเหตุผลที่การเปรียบเทียบนี้สูสีอย่างแท้จริง สูตรคือ base แบบ frozen บวก adapter ขนาด 33.8M ซึ่งหมายความว่าโมเดลส่วนเพิ่มที่คุณเทรนมีต้นทุนการประมวลผลระดับ adapter ไม่ใช่ระดับ foundation model คุณสามารถเก็บ base ไว้ในหน่วยความจำครั้งเดียวแล้วโหลด adapter หลายตัว — หนึ่งตัวต่อหนึ่งโดเมนการตัดสินใจ — ซึ่งเป็นรูปแบบการดีพลอยที่ hosted API ของ Microsoft ไม่สามารถรองรับได้เลย หากกฎการจัดเส้นทางของคุณต่างจากของผู้ตัดสินทั่วไป Kev ให้คุณเทรนความแตกต่างนั้นได้ ส่วน Microsoft-Decision-1 ให้คุณเขียนพรอมป์ต์ให้ดีขึ้นแล้วได้แต่หวัง

เมื่อเทียบกันแล้ว API แบบโฮสต์ไม่มีภาระด้านการดำเนินงานใด ๆ ไม่มีอะแดปเตอร์ให้ต้องติดตาม ไม่มีสแตกการให้บริการที่ต้องคอยให้พร้อมใช้งาน ไม่มีช่องว่างด้านบริบทระหว่างสิ่งที่ตรวจสอบแล้วกับสิ่งที่ให้บริการจริงให้ต้องพิจารณา และไม่มีความเสี่ยงที่ค่า temperature ซึ่งปรับให้พอดีกับชุดข้อมูลหนึ่งจะให้พฤติกรรมที่ต่างออกไปบนชุดข้อมูลของคุณ สำหรับทีมที่มีปริมาณการตัดสินใจไม่สูงนัก บริการนี้เป็นทางเลือกที่มีต้นทุนชั่วโมงวิศวกรรมต่ำกว่า แม้ว่าโทเคนจะมีค่าใช้จ่ายก็ตาม แต่สำหรับทีมที่ให้คะแนนรายการหลายล้านรายการต่อวัน อะแดปเตอร์แบบโฮสต์เองจะได้เปรียบด้านต้นทุนต่อหน่วยทันทีที่จ่ายค่า GPU ไปแล้ว

ยังมีเส้นทางที่สามที่ไม่ได้ใช้โมเดลทั้งสองในส่วนที่มันอ่อนที่สุด และนั่นคือจุดที่ OrcaRouter ยืนอยู่ เราไม่ได้โฮสต์ Microsoft-Decision-1 หรือ Kev — ตัวให้คะแนนที่ส่งคืนค่าความน่าจะเป็นไม่ใช่เป้าหมายแบบ chat-completions และโมเดลทั้งสองก็ไม่ได้อยู่ในแคตตาล็อกของเรา ครึ่งที่เป็นงานสร้างสรรค์ของไปป์ไลน์การตัดสินใจต่างหากที่เรารองรับ ได้แก่ โมเดลที่ร่างคำตอบที่เป็นตัวเลือก เขียนรูบริก หรือส่ง tool call ที่จะถูกนำไปให้คะแนน ทั้งหมดนั้นอยู่หลังคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียวซึ่งมีโมเดลมากกว่า 200 โมเดลอยู่บนนั้น ในราคาตามรายการของผู้ให้บริการที่ส่งผ่านมาด้วยการบวกเพิ่ม 0%ดังนั้นเมื่อผู้ขายเปลี่ยนราคา ฝั่งเราก็อัปเดตทันทีในวันเดียวกัน ถ้าคุณกำลังสร้างลูปการให้เกรดหรือการคัดแยก การเรียกเพื่อเขียนนั้นจัดเส้นทางได้ แต่การเรียกเพื่อให้คะแนนทำไม่ได้ และการรักษาขอบเขตนั้นให้ชัดเจนคือสิ่งที่หยุดไม่ให้ไปป์ไลน์การให้คะแนนกลายเป็นไปป์ไลน์แชตอย่างเงียบ ๆ

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Kev nor Microsoft-Decision-1 appears, because neither is a chat-completions target.

วิธีตัดสินใจ

เลือก Kevเมื่อคุณต้องการตัวเลขก่อนปล่อยงาน เมื่อคุณต้องการ fine-tune กับเลเบลการตัดสินใจของคุณเอง เมื่อคุณต้องการรันการให้คะแนนภายในขอบเขตของคุณเองด้วยต้นทุนส่วนเพิ่มเป็นศูนย์ หรือเมื่อคุณต้องการให้หลายโดเมนการตัดสินใจใช้โมเดลฐานที่รันอยู่ประจำเครื่องเดียวกันร่วมกัน ตัวเลข ECE ที่เผยแพร่ของมันยังคงเป็นผลการวัดของผู้เขียนเองบนฮาร์เนสของผู้เขียนเอง — ให้มองว่าเป็นการประเมินตนเองที่น่าเชื่อถือ ไม่ใช่ผลลัพธ์จากบุคคลที่สามที่ผ่านการตรวจสอบ — แต่อย่างน้อยมันก็เป็นสเกลที่ระบุไว้ซึ่งคุณสามารถลองทำซ้ำได้ และสูตรก็อยู่ตรงนั้นให้ใช้ทำซ้ำได้เลย

เลือก Microsoft-Decision-1 เมื่อเกณฑ์ตัดสินคือการจัดซื้อจัดจ้างหรือความยาวบริบท: เอนด์พอยต์ Azure แบบ managed ที่มีการคิดค่าบริการแบบรวมและแพ็กเกจ Responsible AI, อินพุต 32K สำหรับเอกสารยาว, และมีผู้ขายที่คุณสามารถยกระดับเรื่องไปถึงได้ การที่มันไม่มีตาราง benchmark ไม่ใช่เรื่องอื้อฉาว — โมเดลแบบโฮสต์จำนวนมากเปิดตัวโดยไม่มีตารางนั้น — แต่มันหมายความว่าเส้นโค้งคาลิเบรชันแรกสำหรับโมเดลนี้จะถูกวาดโดยผู้ใช้ของมัน และคุณควรวางแผนที่จะเป็นหนึ่งในนั้น ด้วยข้อมูลที่มีป้ายกำกับของคุณเอง ก่อนที่คุณจะกำหนดเกณฑ์การผลิตกับมัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube