
Microsoft-Decision-1 กับ Gemma 4 12B: ตัวหนึ่งเลือกจากรายการของคุณ อีกตัวเขียนรายการใหม่ให้คุณ
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 69 tok/s
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
วาง Microsoft-Decision-1และ Gemma 4 12Bไว้เคียงข้างกัน แล้วความแตกต่างที่ตัดสินทุกสิ่งไม่ใช่ขนาด ความแม่นยำ หรือสัญญาอนุญาต — แต่เป็นสิ่งที่เกิดขึ้นหลังจากโมเดลอ่านอินพุตของคุณ Gemma 4 12B โมเดลมัลติโมดัลแบบไม่มีเอนโคเดอร์ของ DeepMind ที่มีพารามิเตอร์ 11.96 พันล้าน เปิดตัวเมื่อวันที่ 3 มิถุนายน 2026 ภายใต้ Apache 2.0 อ่านข้อความ รูปภาพ เสียง หรือวิดีโอ แล้วเขียนคำตอบให้คุณทีละโทเคน ครอบคลุมหน้าต่าง 256,000 โทเคน และมากกว่า 140 ภาษา Microsoft-Decision-1 เปิดให้ใช้งานทั่วไปบน Microsoft Foundry เมื่อวันที่ 8 ตุลาคม 2026ในฐานะตัวให้คะแนนแบบข้อความล้วนที่ผ่านการฝึกต่อยอดบน Qwen3.5-9B: คุณป้อนสถานะและคำถามที่คุณได้แจกแจงคำตอบไว้แล้ว และมันจะคืนค่าความน่าจะเป็นที่ปรับเทียบแล้วสำหรับแต่ละตัวเลือกในการประมวลผลเพียงครั้งเดียวสูงสุด 32,768 โทเคน โดยไม่สร้างสิ่งใดออกมาเลย โมเดลหนึ่งบอกคุณว่าตัวเลือกใดของคุณถูกต้อง อีกโมเดลบอกคุณว่าตัวเลือกเหล่านั้นควรเป็นอะไร — และคิดเงินคุณทุกคำของสิ่งนั้น
การวางกรอบเรื่องนี้ว่าเป็นการแข่งขันจะเป็นการผิดประเภท และควรพูดเช่นนั้นก่อนถึงบรรทัดสเปก ไม่ใช่หลังจากนั้น สองสิ่งนี้ไม่ใช่สิ่งทดแทนกัน แต่ตั้งอยู่คนละปลายของเวิร์กโฟลว์ คำถามที่มีประโยชน์คือคุณกำลังสร้างปลายทางไหนกันแน่ เพราะคำตอบเป็นตัวกำหนดว่าคุณกำลังซื้อผู้ตัดสินหรือนักเขียน
บิลคือจุดที่ความแตกต่างไม่ใช่เรื่องปรัชญาอีกต่อไป
Gemma 4 12B ถูกคิดค่าบริการแบบเดียวกับโมเดลเจเนอเรทีฟทุกตัว นั่นคือทั้งโทเคนอินพุตและโทเคนเอาต์พุต เมื่อคุณขอให้มันสร้าง JSON แบบมีโครงสร้าง ทุกอักขระของ JSON นั้นล้วนถูกสร้าง ถูกสุ่มตัวอย่าง และถูกคิดค่าบริการ และยิ่งสคีมาของคุณซ้อนกันมากเท่าไร คำตอบก็ยิ่งยาวขึ้น และรายการค่าใช้จ่ายนั้นก็ยิ่งใหญ่ขึ้นเท่านั้น นั่นไม่ใช่ข้อบกพร่องของโมเดล มันคือสิ่งที่เดโคเดอร์ทำ และมันคือรายการค่าใช้จ่ายที่ decision heads มีอยู่ก็เพื่อลบทิ้งนั่นเอง
Microsoft-Decision-1 ไม่มีฝั่งเอาต์พุตให้คิดค่าใช้จ่าย มันรัน forward pass เพียงครั้งเดียวบน state ของคุณ คำถามของคุณ และชุดตัวเลือกของคุณ อ่านคะแนนของแต่ละตัวเลือก แล้วคืนค่า ผลที่ตามมาจะทบต้นตามปริมาณ ไม่ใช่ตามขนาดพรอมป์ต์: ไพป์ไลน์ที่ติดป้ายระเบียนหนึ่งหมื่นรายการด้วย Gemma 4 12B จะสร้างเอกสาร JSON หนึ่งหมื่นฉบับ และไพป์ไลน์เดียวกันบนตัวให้คะแนนการตัดสินใจจะสร้างพรอมป์ต์หนึ่งหมื่นรายการและไม่มีอะไรอย่างอื่น การประหยัดจริงจะมากหรือไม่นั้นขึ้นอยู่กับปริมาณของคุณและความอ้วนของสคีมาโดยสิ้นเชิง และใครก็ตามที่มีงบประมาณต่อโทเคนสามารถหาข้อสรุปได้ในสเปรดชีต ทิศทางไม่เป็นที่โต้แย้ง
ยังมีความไม่สมมาตรที่สองที่เล็กกว่า: Microsoft ไม่ได้ระบุอัตราราคาบนหน้าโมเดล Microsoft-Decision-1 ลิงก์ราคาชี้ไปยังหน้าด้านราคาของ Microsoft เอง ดังนั้นต้นทุนต่อการตัดสินใจจึงเป็นสิ่งที่คุณอ่านจาก Azure ไม่ใช่จากหน้าการ์ด สิ่งที่หน้านั้นยืนยันได้คือ 0% ของการเรียกใช้เป็นโทเค็นเอาต์พุต และการอนุมานแบบแบตช์ถูกปิดใช้งาน — คุณไม่สามารถเฉลี่ยต้นทุนการรันให้คะแนนแบบจำนวนมากผ่านช่องทางแบตช์ได้เหมือนกับที่ทำกับโมเดลแบบเจนเนอเรทีฟ

อินพุตเดียวกัน ได้คำตอบที่แตกต่างกันสองแบบ
ให้ทั้งสองโมเดลได้รับตั๋วสนับสนุนลูกค้าและคำถามหนึ่งข้อ Microsoft-Decision-1 จะคืนค่าประมาณ 0.83 สำหรับ "billing", 0.11 สำหรับ "technical", 0.04 สำหรับ "cancellation", 0.02 สำหรับ "cannot tell" คุณมีป้ายกำกับที่ตั้งชื่อได้ มีตัวเลขที่คุณสามารถตั้งเกณฑ์เปรียบเทียบได้ และมีเส้นทางเลือกที่จะไม่ตอบ — Microsoft ระบุว่าตัวเลือกสไตล์ "cannot tell" ได้รับการสนับสนุนเมื่อหลักฐานที่ให้มาไม่เพียงพอ ซึ่งเป็นสิ่งที่ทำให้ตรรกะการยกระดับทำงานได้ สิ่งที่คุณไม่ได้คือเหตุผล
ส่งตั๋วให้ Gemma 4 12B แล้วคุณจะได้คำตอบเป็นย่อหน้าหนึ่ง มันสามารถใช้เหตุผลกับคำขอด้วยการคิดที่กำหนดค่าได้ เรียกใช้ฟังก์ชัน อ่านใบแจ้งหนี้ที่สแกนซึ่งแนบมากับตั๋ว ถอดเสียงข้อความฝากเสียงที่แนบติดกับตั๋ว และตอบในภาษาของลูกค้าเอง ทุกข้อเหล่านี้ล้วนเป็นสิ่งที่ Decision-1 ทำไม่ได้ไม่ว่าจะด้วยความแม่นยำระดับใด: พื้นผิวอินพุตของมันมีเพียงข้อความและไม่มีสิ่งอื่นใด และมันไม่ได้ถูกออกแบบมาอย่างชัดเจนสำหรับการตอบคำถามแบบปลายเปิด การสนทนา การแปล หรือการสรุปความ
ไม่มีส่วนใดในเอาต์พุตของ Gemma 4 12B ที่เป็นค่าความน่าจะเป็น ถ้าคุณขอให้มันตัดสินใจจัดเส้นทางพร้อมค่าความมั่นใจ คุณจะได้ข้อความร้อยเรียงที่มีตัวเลขอยู่ตัวหนึ่ง และตัวเลขนั้นคืออะไรก็ตามที่ sampler ผลิตออกมา ไม่ใช่ softmax เหนือชุดตัวเลือกที่คุณป้อนให้ ถ้าเกณฑ์ตัดสินในขั้นปลายน้ำต้องพึ่งพาการที่ตัวเลขนั้นมีความหมายอะไรบางอย่าง คุณก็กำลังมีโปรเจกต์สอบเทียบอยู่ในมือ ไม่ใช่ตัวให้คะแนน
การที่คำถามของคุณมีเซตปิดหรือไม่ คือการตัดสินใจทั้งหมด
นี่คือแบบทดสอบที่ต้องนำไปใช้ก่อนสิ่งอื่นใด และใช้เวลาประมาณสิบนาทีโดยใช้ไวท์บอร์ด
• หากคำตอบของคุณมาจากรายการที่คุณสามารถแจกแจงล่วงหน้าได้ — ไม่ว่าจะเป็นป้ายกำกับ คะแนนเรตติ้ง ใช่/ไม่ใช่ คะแนนตามเกณฑ์ หรือเส้นทาง — Microsoft-Decision-1 คือเครื่องมือที่ถูกต้อง และ Gemma 4 12B เป็นวิธีที่สิ้นเปลืองและเชื่อถือได้น้อยกว่าในการเลือกจากรายการนั้น คุณกำลังจ่ายให้ตัวถอดรหัสเดาตัวเลขที่คุณกำหนดขอบเขตไว้แล้ว
• หากคำตอบของคุณไม่ใช่ชุดปิด — สรุปสิ่งนี้ อธิบายสิ่งนั้น เขียนคำตอบ บรรยายแผนภูมิ — Microsoft-Decision-1 ช่วยอะไรไม่ได้เลยไม่ว่าจะจ่ายด้วยราคาใดก็ตาม มันไม่มีเส้นทางไปสู่การเขียนร้อยเรียง ไม่มีฟิลด์เหตุผล และไม่มีกลไกใด ๆ สำหรับสร้างสิ่งใดที่คุณไม่ได้ระบุเป็นตัวเลือกไว้
• หากเป็นทั้งสองอย่าง คุณจะมีไปป์ไลน์สองโมเดลแทนที่จะเป็นการเลือก และคำถามการออกแบบที่น่าสนใจจะกลายเป็นว่าโมเดลใดเป็นเจ้าของเกณฑ์การยกระดับ ตัวให้คะแนนเป็นผู้กำหนดมัน ส่วนผู้เขียนเติมเต็มสิ่งที่จะเกิดขึ้นเหนือและต่ำกว่าเกณฑ์นั้น
ในจุดที่ Gemma 4 12B เป็นเหมือนกีฬาคนละประเภทไปเลย
นอกกรอบการตัดสินใจ Gemma 4 12B ไม่ได้นำอยู่บนเส้นเดียวกัน — มันกำลังเล่นเกมคนละเกม และการแสร้งว่าเป็นอย่างอื่นก็คงไม่ซื่อสัตย์

• โมดัลลิตี้ — Microsoft-Decision-1 รับข้อความเข้าและให้ผลลัพธ์เป็นตัวเลขเท่านั้น Gemma 4 12B รองรับข้อความ รูปภาพ เสียง และวิดีโอโดยกำเนิด ผ่านการออกแบบที่ไม่มีเอนโคเดอร์ ซึ่งฉายแพตช์ดิบและรูปคลื่นเข้าสู่ embedding space โดยตรง พร้อมอินพุตแบบสลับไปมาในลำดับใดก็ได้
• บริบท — 32,768 โทเคนสำหรับ Microsoft-Decision-1 เทียบกับ 256,000 สำหรับ Gemma 4 12B ซึ่งทำคะแนนได้ 43.4% บน MRCR v2 แบบ eight-needle ที่ 128k บนการ์ดของ Google เอง
• ภาษา — รองรับ 25 ภาษาสำหรับ Microsoft-Decision-1 โดย Microsoft เตือนว่าความครอบคลุม คุณภาพ และการปรับเทียบ "อาจแตกต่างกันไปตามภาษา" และระบุว่าภาษาที่ไม่ใช่ภาษาอังกฤษซึ่งมีทรัพยากรต่ำเป็นจุดอ่อน ส่วน Gemma 4 12B รองรับมากกว่า 140 ภาษา โดยมีตัวเลข MMMLU ที่ประเมินได้ที่ 83.4 สำหรับขนาดนี้
• ผลการดำเนินงานที่เผยแพร่ — แท็บ Benchmarks ของ Microsoft-Decision-1 มีระเบียบวิธีวิจัยแต่ไม่มีตัวเลขใด ๆ; Google เผยแพร่ 77.2% MMLU Pro, 77.5% AIME 2026 โดยไม่ใช้เครื่องมือ, 72.0% LiveCodeBench v6, 78.8% GPQA Diamond, 69.1% MMMU Pro และ 79.7% MATH-Vision สำหรับ Gemma 4 12B
• การเผยแพร่ — Microsoft-Decision-1 เป็น API แบบโฮสต์ที่ให้บริการเฉพาะบน Foundry เท่านั้น ไม่มีน้ำหนักโมเดล ไม่มีให้ดาวน์โหลด และไม่มีเส้นทางการปรับแต่ง (fine-tuning) ส่วน Gemma 4 12B เป็นน้ำหนักโมเดลภายใต้สัญญาอนุญาต Apache 2.0 ที่เปิดตัวเข้าสู่ระบบนิเวศตั้งแต่วันแรก ได้แก่ LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang และ Unsloth
• รันไทม์ — การให้คะแนนการตัดสินใจเป็นการประมวลผลรอบเดียวโดยไม่มีลูปถอดรหัส ดังนั้นความหน่วงจึงแปรผันตามพรอมป์ต์มากกว่าความยาวของคำตอบ; Gemma 4 12B สร้างทีละโทเค็น และเอกสารเปิดตัวของ Google ระบุว่าอยู่ที่ 16 GB ของ VRAM หรือหน่วยความจำแบบรวม
แถวผลเบนช์มาร์กคือแถวที่ควรหยุดพิจารณา ในทางที่ทำให้ Microsoft ดูดีน้อยที่สุด ตัวเลขของ Gemma 4 12B ก็เป็นตัวเลขที่ผู้ขายรายงานเช่นกัน — แต่ตัวเลขเหล่านั้นมีหลายเดือนของการใช้งานโดยบุคคลที่สามหนุนหลังอยู่ ในชุดทดสอบสาธารณะ บนฮาร์ดแวร์ที่มีคนอื่นเป็นเจ้าของ รายการของ Microsoft ในหมวดนี้เป็นรายการใหม่ที่สุดและตรวจสอบยืนยันได้ยากที่สุดในสองรายการนี้ แม้ว่าจะมาจากบริษัทที่ใหญ่กว่า
ค่าใช้จ่ายจริงที่คุณต้องจ่ายในการโทรแต่ละครั้ง
Gemma 4 12B ในรูปแบบ 12B ไม่ได้อยู่ในแคตตาล็อกของเรา — ถ้าเป็นขนาดที่คุณต้องการ คุณก็ไปดึงพารามิเตอร์ 11.96 พันล้านตัวแบบ BF16 มาเสิร์ฟเอง สิ่งที่แคตตาล็อกของเรามีคือโมเดลอื่น ๆ ในสาย Gemma 4 และมันราคาไม่แพง: Gemma 4 26B A4B ราคา $0.06 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $0.33 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน และ Gemma 4 31B ราคา $0.13 และ $0.38 โดยทั้งคู่ระบุบริบท 262,144 โทเคน นั่นคือราคาลิสต์ของผู้ขายที่ส่งต่อมาโดยไม่มีการบวกกำไรเพิ่มจากฝั่งเรา อยู่เบื้องหลังคีย์ที่เข้ากันได้กับ OpenAI คีย์เดียว พร้อมกับโมเดลอื่นอีกกว่า 200 ตัว หากปัญหาของคุณกลายเป็นเรื่องการให้เหตุผลทั่วไปมากกว่าการตัดสินใจแบบชุดปิด หนึ่งในสองขนาดนั้นคือตัวเลือกราคาถูกที่ใช้วัดเทียบกับ scorer ที่คุณรันเองได้ — และถ้าคุณไม่อยากผูกกับผู้เขียนเพียงรายเดียว การสลับไปใช้รายอื่นอัตโนมัติ (automatic failover) จะทำให้ขาการสร้างของลูปให้คะแนนยังทำงานต่อไปได้เมื่อผู้ให้บริการรายใดรายหนึ่งมีปัญหา

Microsoft-Decision-1 เป็นการปรับใช้ Foundry ที่คุณจัดเตรียมเอง และไม่มีให้ใช้งานผ่านเรา ไม่มีสิ่งใดในบทความนี้ที่เป็นการกล่าวอ้างถึงความพร้อมใช้งานสำหรับมัน ไม่ว่าจะเป็นฝั่งใดของการเรียกใช้งาน
ประเด็นสำคัญ
Microsoft-Decision-1 เปิดให้ใช้ทั่วไปบน Microsoft Foundry เมื่อวันที่ 8 ตุลาคม 2026 โดยเป็นตัวให้คะแนนแบบข้อความเท่านั้นขนาด 32,768 โทเคน บนฐาน Qwen3.5-9B ที่คืนค่าความน่าจะเป็นซึ่งปรับเทียบแล้วสำหรับตัวเลือกที่คุณระบุ โดยมีโทเคนเอาต์พุตเป็นศูนย์ ไม่มีเวต และไม่มีตัวเลขเบนช์มาร์กที่เผยแพร่ Gemma 4 12B เป็นโมเดลทั่วไปแบบมัลติโมดัลที่ไม่ใช้เอนโคเดอร์ ขนาด 11.96B เปิดตัวเมื่อวันที่ 3 มิถุนายน 2026 ภายใต้ Apache 2.0 ซึ่งให้เหตุผล อ่านภาพและเสียง และเขียนคำตอบได้ยาวถึง 256,000 โทเคน เลือกจากรูปร่างของคำตอบของคุณ ไม่ใช่จากจำนวนพารามิเตอร์ ชุดปิดเป็นของตัวให้คะแนน ชุดเปิดเป็นของตัวเขียน และการจ่ายให้ตัวถอดรหัสเลือกจากรายการที่คุณเขียนไว้แล้ว คือวิธีที่ทีมส่วนใหญ่ใช้จ่ายมากกว่าต้นทุนของการตัดสินใจถึงสิบเท่า
สิ่งที่แค็ตตาล็อกของเรามีให้คือส่วนที่เหลือของตระกูล Gemma 4 และมีราคาไม่แพง: Gemma 4 26B A4B ที่ $0.06 ต่อโทเค็นอินพุต 1 ล้านโทเค็น และ $0.33 ต่อเอาต์พุต 1 ล้านโทเค็น และ Gemma 4 31B ที่ $0.13 และ $0.38
