
Microsoft-Decision-1 vs Kev: การซื้อคะแนน หรือการเป็นเจ้าของสูตรที่ผลิตคะแนนนั้น
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
Jared Palmer วางใบเสร็จไว้ข้างโมเดลของเขา ครอบครัว Kev — Kev-0.8B, Kev-4B และ Kev-9B ซึ่งสร้างอยู่บน checkpoint ฐานแบบเปิดน้ำหนักที่ถูกแช่แข็ง พร้อมอะแดปเตอร์ LoRA แรงค์ 16 และหัว pointer ขนาดเล็ก — เปิดตัวเมื่อวันที่ 24 กันยายน 2026 โดยเผยแพร่ทั้งสูตรการฝึก จำนวนข้อมูลรายขั้นตอน และตัวเลขการประเมินทั้งหมด และพาดหัวที่ตรงไปตรงมาสำหรับใครก็ตามที่เปรียบเทียบมันกับ Microsoft-Decision-1 ก็คือ Kev บอกคุณได้มากกว่ามหาศาลเกี่ยวกับวิธีทำซ้ำตัวมันเอง ตัวให้คะแนนของ Microsoft เปิดให้ใช้ทั่วไปบน Microsoft Foundry เมื่อวันที่ 8 ตุลาคม 2026: ฐาน Qwen3.5-9B ที่ Microsoft ฝึกต่อหลังการฝึกหลัก บริบท 32,768 โทเคน รองรับเฉพาะข้อความ ไม่แจกจ่ายน้ำหนัก มีระเบียบวิธีการประเมินที่เผยแพร่ แต่ไม่มีผลลัพธ์ที่เผยแพร่ ทั้งสองรับ state และชุดคำถามที่มีการระบุชนิด แล้วคืนค่าการแจกแจงที่ปรับเทียบแล้วแทนข้อความที่สร้างขึ้น ตัวหนึ่งเป็นบริการ อีกตัวเป็นวิธีการที่คุณรันในโน้ตบุ๊กได้คืนนี้
เหตุผลที่ความแตกต่างนี้เป็นตัวตัดสินการจับคู่นี้ แทนที่จะเป็นความสามารถ: Kev-4B รายงาน ECE 0.017 ในการทดสอบแบบ locked ที่อยู่นอกโดเมนของมัน และ Microsoft-Decision-1 ไม่ได้รายงานค่าใด ๆ ดังนั้นข้อโต้แย้งเรื่องการสอบเทียบ (calibration) ซึ่งโดยปกติใช้ตัดสินการเปรียบเทียบแบบ scorer-versus-scorer จึงมีเพียงฝ่ายเดียวที่ระบุจุดยืนของตน
Kev เผยแพร่จริงๆ อะไร
การ์ดของ Kev-4B มีความเฉพาะเจาะจงสูงผิดปกติ และความเฉพาะเจาะจงนั้นเองคือประเด็นสำคัญ แกนหลักคือ Qwen3.5-4B-Base ที่ถูกฟรีซไว้ที่ revision ซึ่งระบุชื่อไว้ โดยมีเลเยอร์ linear attention แบบ Gated DeltaNet จำนวน 24 เลเยอร์ และเลเยอร์ full attention จำนวน 8 เลเยอร์ ที่ hidden size 2,560 บนชั้นบนสุดเป็น LoRA adapter แบบ rank-16 ซึ่งมีพารามิเตอร์ที่เทรนได้ 33.8 ล้านตัว นำไปใช้กับ projection ของ attention, MLP และ DeltaNet พร้อมกับ pointer head ที่ให้คะแนนโทเคนปิดท้ายของแต่ละตัวเลือกเทียบกับโทเคนสุดท้ายของคำถามแล้วทำ softmax มีค่าอุณหภูมิค่าเดียว T = 2.41 ถูกเก็บไว้ในไฟล์ head และนำไปใช้ตอนโหลด โดยการ์ดระบุค่าที่ฟิตได้และแฮชของไฟล์ไว้ด้วย การเทรนทำเป็นระยะ ๆ พร้อมจำนวนเรกคอร์ดที่เผยแพร่ไว้ คือสูตรฐาน 12,576 เรกคอร์ด, 1,425 เรกคอร์ดสำหรับวันที่และหลักฐานที่ขาดหาย, 5,219 เรกคอร์ดเป็นเรื่องร้องเรียนจริงของ CFPB, 6,000 เรกคอร์ดทักษะ และ 5,320 เรกคอร์ดเครื่องมือสำหรับนักพัฒนา โดยระยะหลัง ๆ จะเล่นซ้ำข้อมูลจากระยะก่อนหน้า การ์ดยังระบุด้วยว่าอะไรที่ไม่ได้ใช้: "ไม่มีการใช้เอาต์พุตใด ๆ ของ Jev (โมเดลตัดสินใจแบบโฮสต์ของ TypeSafe)"
ตาราง benchmark ถูกระบุไว้ในหน้าเดียวกัน และแนบกรณีล้มเหลวมาด้วย ซึ่งพบได้ยากกว่ากรณีสำเร็จ การทดสอบ out-of-domain แบบล็อกของ Transfer-v4: ความแม่นยำ 0.838, Brier 0.224, ECE 0.017 Breadth-v1 จากชุดข้อมูลที่กันไว้ 14 ชุดและคำถาม 3,089 ข้อ: ความแม่นยำ 0.690, ECE 0.029 การทดสอบ Hard-v1: 0.803 การทดสอบ Documents-v1: 0.903 MMLU-Pro แบบสิบตัวเลือก: 0.565 การคำนวณวันที่: 0.65 ซึ่งผู้เขียนระบุว่าเป็นจุดอ่อนที่สุด โดยมี preprocessor flag เสนอเป็นวิธีแก้บางส่วน และมีหมายเหตุชัดเจนว่ายังไม่ได้วัดใหม่ ส่วนข้อจำกัดเพิ่มเติมว่า การปรับคาลิเบรตเป็น temperature แบบ in-distribution เพียงค่าเดียว ดังนั้นความครอบคลุมจึงลดลงนอกโดเมน ลำดับตัวเลือกอาจทำให้คำตอบพลิกได้ และความยาวเกิน 8,192 โทเคนนั้นให้บริการได้แต่ยังไม่ได้รับการตรวจสอบความถูกต้อง ตัวเลขการให้บริการก็เผยแพร่ด้วย: 18.1 ms สำหรับหกคำถามบน state สั้น ๆ บน H100, 12.9 ms เมื่อแคชไว้, หน่วยความจำ GPU แบบ resident 14.3 GB

สิ่งที่ Microsoft เผยแพร่แทน
Microsoft-Decision-1 ครอบคลุมเนื้อหาเดียวกันเป็นส่วนใหญ่ด้วยท่าทีที่แตกต่างออกไป โดยให้คะแนนคำถามแบบใช่/ไม่ใช่ แบบปรนัย แบบให้คะแนน แบบจำแนกประเภท และแบบรูบริก รองรับตัวเลือกการงดออกเสียงอย่างชัดเจน เช่น "ไม่สามารถบอกได้," ส่งคืนความน่าจะเป็นในรูปแบบ JSON และทำงานในการเรียกใช้ครั้งเดียวด้วยโทเค็นสูงสุด 32K — ซึ่งเป็นสี่เท่าของบริบทที่ Kev ตรวจสอบ ถูกเผยแพร่เป็น API ที่โฮสต์ใน Microsoft Foundry ภายใต้กลุ่มผลิตภัณฑ์ Direct from Azure พร้อมการปรับใช้แบบไร้เซิร์ฟเวอร์และปลายทางแบบรวม, SKU มาตรฐาน, การรับรองความถูกต้องของ Azure และเส้นทางการเรียกเก็บเงินแบบรวม การอนุมานแบบกลุ่มถูกปิดใช้งาน และไม่มีการดาวน์โหลดเวทและไม่มีเส้นทางการปรับแต่งละเอียด
ส่วนการประเมินอธิบายถึงเกณฑ์มาตรฐานการตัดสินใจของสาธารณะและชุมชน รวมถึงชุดข้อมูลภายในที่กันไว้สำหรับทดสอบ ตัวชี้วัดซึ่งรวมถึงความแม่นยำและค่าความคลาดเคลื่อนของการปรับเทียบ ลำดับตัวเลือกที่สลับกัน การทดสอบทางสถิติแบบจับคู่ และข้ออ้างว่าโมเดล "ทำงานได้ทัดเทียมกับโมเดลการตัดสินใจชั้นนำ และนำหน้าโมเดลการตัดสินใจแบบเปิดอื่น ๆ ที่ประเมินด้วยระเบียบวิธีเดียวกัน" ไม่มีตาราง บัตรโมเดลระบุข้อจำกัดของตนเองอย่างตรงไปตรงมา — คะแนนเปลี่ยนไปตามถ้อยคำและลำดับตัวเลือก การปรับเทียบแม่นยำที่สุดกับประเภทงานที่คุ้นเคย ไม่มีการสร้างคำอธิบาย และความครอบคลุมภาษาที่ไม่ใช่ภาษาอังกฤษอ่อนแอที่สุด — แต่รายการข้อจำกัดไม่ใช่การวัดการปรับเทียบ ใครก็ตามที่ตั้งเกณฑ์ยอมรับอัตโนมัติที่ 0.9 บน Microsoft-Decision-1 กำลังตั้งมันด้วยความเชื่อ และปรับมันในการใช้งานจริง

ส่วนของการเปรียบเทียบที่ต้องเสียเงิน
เศรษฐศาสตร์ของ Kev คือเหตุผลที่การเปรียบเทียบนี้สูสีอย่างแท้จริง สูตรคือ base แบบ frozen บวก adapter ขนาด 33.8M ซึ่งหมายความว่าโมเดลส่วนเพิ่มที่คุณเทรนมีต้นทุนการประมวลผลระดับ adapter ไม่ใช่ระดับ foundation model คุณสามารถเก็บ base ไว้ในหน่วยความจำครั้งเดียวแล้วโหลด adapter หลายตัว — หนึ่งตัวต่อหนึ่งโดเมนการตัดสินใจ — ซึ่งเป็นรูปแบบการดีพลอยที่ hosted API ของ Microsoft ไม่สามารถรองรับได้เลย หากกฎการจัดเส้นทางของคุณต่างจากของผู้ตัดสินทั่วไป Kev ให้คุณเทรนความแตกต่างนั้นได้ ส่วน Microsoft-Decision-1 ให้คุณเขียนพรอมป์ต์ให้ดีขึ้นแล้วได้แต่หวัง
เมื่อเทียบกันแล้ว API แบบโฮสต์ไม่มีภาระด้านการดำเนินงานใด ๆ ไม่มีอะแดปเตอร์ให้ต้องติดตาม ไม่มีสแตกการให้บริการที่ต้องคอยให้พร้อมใช้งาน ไม่มีช่องว่างด้านบริบทระหว่างสิ่งที่ตรวจสอบแล้วกับสิ่งที่ให้บริการจริงให้ต้องพิจารณา และไม่มีความเสี่ยงที่ค่า temperature ซึ่งปรับให้พอดีกับชุดข้อมูลหนึ่งจะให้พฤติกรรมที่ต่างออกไปบนชุดข้อมูลของคุณ สำหรับทีมที่มีปริมาณการตัดสินใจไม่สูงนัก บริการนี้เป็นทางเลือกที่มีต้นทุนชั่วโมงวิศวกรรมต่ำกว่า แม้ว่าโทเคนจะมีค่าใช้จ่ายก็ตาม แต่สำหรับทีมที่ให้คะแนนรายการหลายล้านรายการต่อวัน อะแดปเตอร์แบบโฮสต์เองจะได้เปรียบด้านต้นทุนต่อหน่วยทันทีที่จ่ายค่า GPU ไปแล้ว
ยังมีเส้นทางที่สามที่ไม่ได้ใช้โมเดลทั้งสองในส่วนที่มันอ่อนที่สุด และนั่นคือจุดที่ OrcaRouter ยืนอยู่ เราไม่ได้โฮสต์ Microsoft-Decision-1 หรือ Kev — ตัวให้คะแนนที่ส่งคืนค่าความน่าจะเป็นไม่ใช่เป้าหมายแบบ chat-completions และโมเดลทั้งสองก็ไม่ได้อยู่ในแคตตาล็อกของเรา ครึ่งที่เป็นงานสร้างสรรค์ของไปป์ไลน์การตัดสินใจต่างหากที่เรารองรับ ได้แก่ โมเดลที่ร่างคำตอบที่เป็นตัวเลือก เขียนรูบริก หรือส่ง tool call ที่จะถูกนำไปให้คะแนน ทั้งหมดนั้นอยู่หลังคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียวซึ่งมีโมเดลมากกว่า 200 โมเดลอยู่บนนั้น ในราคาตามรายการของผู้ให้บริการที่ส่งผ่านมาด้วยการบวกเพิ่ม 0%ดังนั้นเมื่อผู้ขายเปลี่ยนราคา ฝั่งเราก็อัปเดตทันทีในวันเดียวกัน ถ้าคุณกำลังสร้างลูปการให้เกรดหรือการคัดแยก การเรียกเพื่อเขียนนั้นจัดเส้นทางได้ แต่การเรียกเพื่อให้คะแนนทำไม่ได้ และการรักษาขอบเขตนั้นให้ชัดเจนคือสิ่งที่หยุดไม่ให้ไปป์ไลน์การให้คะแนนกลายเป็นไปป์ไลน์แชตอย่างเงียบ ๆ

วิธีตัดสินใจ
เลือก Kevเมื่อคุณต้องการตัวเลขก่อนปล่อยงาน เมื่อคุณต้องการ fine-tune กับเลเบลการตัดสินใจของคุณเอง เมื่อคุณต้องการรันการให้คะแนนภายในขอบเขตของคุณเองด้วยต้นทุนส่วนเพิ่มเป็นศูนย์ หรือเมื่อคุณต้องการให้หลายโดเมนการตัดสินใจใช้โมเดลฐานที่รันอยู่ประจำเครื่องเดียวกันร่วมกัน ตัวเลข ECE ที่เผยแพร่ของมันยังคงเป็นผลการวัดของผู้เขียนเองบนฮาร์เนสของผู้เขียนเอง — ให้มองว่าเป็นการประเมินตนเองที่น่าเชื่อถือ ไม่ใช่ผลลัพธ์จากบุคคลที่สามที่ผ่านการตรวจสอบ — แต่อย่างน้อยมันก็เป็นสเกลที่ระบุไว้ซึ่งคุณสามารถลองทำซ้ำได้ และสูตรก็อยู่ตรงนั้นให้ใช้ทำซ้ำได้เลย
เลือก Microsoft-Decision-1 เมื่อเกณฑ์ตัดสินคือการจัดซื้อจัดจ้างหรือความยาวบริบท: เอนด์พอยต์ Azure แบบ managed ที่มีการคิดค่าบริการแบบรวมและแพ็กเกจ Responsible AI, อินพุต 32K สำหรับเอกสารยาว, และมีผู้ขายที่คุณสามารถยกระดับเรื่องไปถึงได้ การที่มันไม่มีตาราง benchmark ไม่ใช่เรื่องอื้อฉาว — โมเดลแบบโฮสต์จำนวนมากเปิดตัวโดยไม่มีตารางนั้น — แต่มันหมายความว่าเส้นโค้งคาลิเบรชันแรกสำหรับโมเดลนี้จะถูกวาดโดยผู้ใช้ของมัน และคุณควรวางแผนที่จะเป็นหนึ่งในนั้น ด้วยข้อมูลที่มีป้ายกำกับของคุณเอง ก่อนที่คุณจะกำหนดเกณฑ์การผลิตกับมัน
