การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับ Microsoft-Decision-1 ปะทะ Gemma 4 12B พร้อมคำบรรยายว่า 'ผู้ให้คะแนนที่ไม่มีโทเคนเอาต์พุต ปะทะนักเขียนที่ไม่มีเซตปิด' โดยมีชิปที่แสดงความน่าจะเป็น ปะทะร้อยแก้ว, บริบท 32,768 โทเคน ปะทะ 256,000, ข้อความเท่านั้น ปะทะ ข้อความ รูปภาพ เสียง และวิดีโอ และ API ที่โฮสต์ ปะทะเวตแบบเปิด
Guides & Insights

Microsoft-Decision-1 กับ Gemma 4 12B: ตัวหนึ่งเลือกจากรายการของคุณ อีกตัวเขียนรายการใหม่ให้คุณ

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วาง Microsoft-Decision-1และ Gemma 4 12Bไว้เคียงข้างกัน แล้วความแตกต่างที่ตัดสินทุกสิ่งไม่ใช่ขนาด ความแม่นยำ หรือสัญญาอนุญาต — แต่เป็นสิ่งที่เกิดขึ้นหลังจากโมเดลอ่านอินพุตของคุณ Gemma 4 12B โมเดลมัลติโมดัลแบบไม่มีเอนโคเดอร์ของ DeepMind ที่มีพารามิเตอร์ 11.96 พันล้าน เปิดตัวเมื่อวันที่ 3 มิถุนายน 2026 ภายใต้ Apache 2.0 อ่านข้อความ รูปภาพ เสียง หรือวิดีโอ แล้วเขียนคำตอบให้คุณทีละโทเคน ครอบคลุมหน้าต่าง 256,000 โทเคน และมากกว่า 140 ภาษา Microsoft-Decision-1 เปิดให้ใช้งานทั่วไปบน Microsoft Foundry เมื่อวันที่ 8 ตุลาคม 2026ในฐานะตัวให้คะแนนแบบข้อความล้วนที่ผ่านการฝึกต่อยอดบน Qwen3.5-9B: คุณป้อนสถานะและคำถามที่คุณได้แจกแจงคำตอบไว้แล้ว และมันจะคืนค่าความน่าจะเป็นที่ปรับเทียบแล้วสำหรับแต่ละตัวเลือกในการประมวลผลเพียงครั้งเดียวสูงสุด 32,768 โทเคน โดยไม่สร้างสิ่งใดออกมาเลย โมเดลหนึ่งบอกคุณว่าตัวเลือกใดของคุณถูกต้อง อีกโมเดลบอกคุณว่าตัวเลือกเหล่านั้นควรเป็นอะไร — และคิดเงินคุณทุกคำของสิ่งนั้น

การวางกรอบเรื่องนี้ว่าเป็นการแข่งขันจะเป็นการผิดประเภท และควรพูดเช่นนั้นก่อนถึงบรรทัดสเปก ไม่ใช่หลังจากนั้น สองสิ่งนี้ไม่ใช่สิ่งทดแทนกัน แต่ตั้งอยู่คนละปลายของเวิร์กโฟลว์ คำถามที่มีประโยชน์คือคุณกำลังสร้างปลายทางไหนกันแน่ เพราะคำตอบเป็นตัวกำหนดว่าคุณกำลังซื้อผู้ตัดสินหรือนักเขียน

บิลคือจุดที่ความแตกต่างไม่ใช่เรื่องปรัชญาอีกต่อไป

Gemma 4 12B ถูกคิดค่าบริการแบบเดียวกับโมเดลเจเนอเรทีฟทุกตัว นั่นคือทั้งโทเคนอินพุตและโทเคนเอาต์พุต เมื่อคุณขอให้มันสร้าง JSON แบบมีโครงสร้าง ทุกอักขระของ JSON นั้นล้วนถูกสร้าง ถูกสุ่มตัวอย่าง และถูกคิดค่าบริการ และยิ่งสคีมาของคุณซ้อนกันมากเท่าไร คำตอบก็ยิ่งยาวขึ้น และรายการค่าใช้จ่ายนั้นก็ยิ่งใหญ่ขึ้นเท่านั้น นั่นไม่ใช่ข้อบกพร่องของโมเดล มันคือสิ่งที่เดโคเดอร์ทำ และมันคือรายการค่าใช้จ่ายที่ decision heads มีอยู่ก็เพื่อลบทิ้งนั่นเอง

Microsoft-Decision-1 ไม่มีฝั่งเอาต์พุตให้คิดค่าใช้จ่าย มันรัน forward pass เพียงครั้งเดียวบน state ของคุณ คำถามของคุณ และชุดตัวเลือกของคุณ อ่านคะแนนของแต่ละตัวเลือก แล้วคืนค่า ผลที่ตามมาจะทบต้นตามปริมาณ ไม่ใช่ตามขนาดพรอมป์ต์: ไพป์ไลน์ที่ติดป้ายระเบียนหนึ่งหมื่นรายการด้วย Gemma 4 12B จะสร้างเอกสาร JSON หนึ่งหมื่นฉบับ และไพป์ไลน์เดียวกันบนตัวให้คะแนนการตัดสินใจจะสร้างพรอมป์ต์หนึ่งหมื่นรายการและไม่มีอะไรอย่างอื่น การประหยัดจริงจะมากหรือไม่นั้นขึ้นอยู่กับปริมาณของคุณและความอ้วนของสคีมาโดยสิ้นเชิง และใครก็ตามที่มีงบประมาณต่อโทเคนสามารถหาข้อสรุปได้ในสเปรดชีต ทิศทางไม่เป็นที่โต้แย้ง

ยังมีความไม่สมมาตรที่สองที่เล็กกว่า: Microsoft ไม่ได้ระบุอัตราราคาบนหน้าโมเดล Microsoft-Decision-1 ลิงก์ราคาชี้ไปยังหน้าด้านราคาของ Microsoft เอง ดังนั้นต้นทุนต่อการตัดสินใจจึงเป็นสิ่งที่คุณอ่านจาก Azure ไม่ใช่จากหน้าการ์ด สิ่งที่หน้านั้นยืนยันได้คือ 0% ของการเรียกใช้เป็นโทเค็นเอาต์พุต และการอนุมานแบบแบตช์ถูกปิดใช้งาน — คุณไม่สามารถเฉลี่ยต้นทุนการรันให้คะแนนแบบจำนวนมากผ่านช่องทางแบตช์ได้เหมือนกับที่ทำกับโมเดลแบบเจนเนอเรทีฟ

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

อินพุตเดียวกัน ได้คำตอบที่แตกต่างกันสองแบบ

ให้ทั้งสองโมเดลได้รับตั๋วสนับสนุนลูกค้าและคำถามหนึ่งข้อ Microsoft-Decision-1 จะคืนค่าประมาณ 0.83 สำหรับ "billing", 0.11 สำหรับ "technical", 0.04 สำหรับ "cancellation", 0.02 สำหรับ "cannot tell" คุณมีป้ายกำกับที่ตั้งชื่อได้ มีตัวเลขที่คุณสามารถตั้งเกณฑ์เปรียบเทียบได้ และมีเส้นทางเลือกที่จะไม่ตอบ — Microsoft ระบุว่าตัวเลือกสไตล์ "cannot tell" ได้รับการสนับสนุนเมื่อหลักฐานที่ให้มาไม่เพียงพอ ซึ่งเป็นสิ่งที่ทำให้ตรรกะการยกระดับทำงานได้ สิ่งที่คุณไม่ได้คือเหตุผล

ส่งตั๋วให้ Gemma 4 12B แล้วคุณจะได้คำตอบเป็นย่อหน้าหนึ่ง มันสามารถใช้เหตุผลกับคำขอด้วยการคิดที่กำหนดค่าได้ เรียกใช้ฟังก์ชัน อ่านใบแจ้งหนี้ที่สแกนซึ่งแนบมากับตั๋ว ถอดเสียงข้อความฝากเสียงที่แนบติดกับตั๋ว และตอบในภาษาของลูกค้าเอง ทุกข้อเหล่านี้ล้วนเป็นสิ่งที่ Decision-1 ทำไม่ได้ไม่ว่าจะด้วยความแม่นยำระดับใด: พื้นผิวอินพุตของมันมีเพียงข้อความและไม่มีสิ่งอื่นใด และมันไม่ได้ถูกออกแบบมาอย่างชัดเจนสำหรับการตอบคำถามแบบปลายเปิด การสนทนา การแปล หรือการสรุปความ

ไม่มีส่วนใดในเอาต์พุตของ Gemma 4 12B ที่เป็นค่าความน่าจะเป็น ถ้าคุณขอให้มันตัดสินใจจัดเส้นทางพร้อมค่าความมั่นใจ คุณจะได้ข้อความร้อยเรียงที่มีตัวเลขอยู่ตัวหนึ่ง และตัวเลขนั้นคืออะไรก็ตามที่ sampler ผลิตออกมา ไม่ใช่ softmax เหนือชุดตัวเลือกที่คุณป้อนให้ ถ้าเกณฑ์ตัดสินในขั้นปลายน้ำต้องพึ่งพาการที่ตัวเลขนั้นมีความหมายอะไรบางอย่าง คุณก็กำลังมีโปรเจกต์สอบเทียบอยู่ในมือ ไม่ใช่ตัวให้คะแนน

การที่คำถามของคุณมีเซตปิดหรือไม่ คือการตัดสินใจทั้งหมด

นี่คือแบบทดสอบที่ต้องนำไปใช้ก่อนสิ่งอื่นใด และใช้เวลาประมาณสิบนาทีโดยใช้ไวท์บอร์ด

• หากคำตอบของคุณมาจากรายการที่คุณสามารถแจกแจงล่วงหน้าได้ — ไม่ว่าจะเป็นป้ายกำกับ คะแนนเรตติ้ง ใช่/ไม่ใช่ คะแนนตามเกณฑ์ หรือเส้นทาง — Microsoft-Decision-1 คือเครื่องมือที่ถูกต้อง และ Gemma 4 12B เป็นวิธีที่สิ้นเปลืองและเชื่อถือได้น้อยกว่าในการเลือกจากรายการนั้น คุณกำลังจ่ายให้ตัวถอดรหัสเดาตัวเลขที่คุณกำหนดขอบเขตไว้แล้ว

• หากคำตอบของคุณไม่ใช่ชุดปิด — สรุปสิ่งนี้ อธิบายสิ่งนั้น เขียนคำตอบ บรรยายแผนภูมิ — Microsoft-Decision-1 ช่วยอะไรไม่ได้เลยไม่ว่าจะจ่ายด้วยราคาใดก็ตาม มันไม่มีเส้นทางไปสู่การเขียนร้อยเรียง ไม่มีฟิลด์เหตุผล และไม่มีกลไกใด ๆ สำหรับสร้างสิ่งใดที่คุณไม่ได้ระบุเป็นตัวเลือกไว้

• หากเป็นทั้งสองอย่าง คุณจะมีไปป์ไลน์สองโมเดลแทนที่จะเป็นการเลือก และคำถามการออกแบบที่น่าสนใจจะกลายเป็นว่าโมเดลใดเป็นเจ้าของเกณฑ์การยกระดับ ตัวให้คะแนนเป็นผู้กำหนดมัน ส่วนผู้เขียนเติมเต็มสิ่งที่จะเกิดขึ้นเหนือและต่ำกว่าเกณฑ์นั้น

ในจุดที่ Gemma 4 12B เป็นเหมือนกีฬาคนละประเภทไปเลย

นอกกรอบการตัดสินใจ Gemma 4 12B ไม่ได้นำอยู่บนเส้นเดียวกัน — มันกำลังเล่นเกมคนละเกม และการแสร้งว่าเป็นอย่างอื่นก็คงไม่ซื่อสัตย์

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• โมดัลลิตี้ — Microsoft-Decision-1 รับข้อความเข้าและให้ผลลัพธ์เป็นตัวเลขเท่านั้น Gemma 4 12B รองรับข้อความ รูปภาพ เสียง และวิดีโอโดยกำเนิด ผ่านการออกแบบที่ไม่มีเอนโคเดอร์ ซึ่งฉายแพตช์ดิบและรูปคลื่นเข้าสู่ embedding space โดยตรง พร้อมอินพุตแบบสลับไปมาในลำดับใดก็ได้

• บริบท — 32,768 โทเคนสำหรับ Microsoft-Decision-1 เทียบกับ 256,000 สำหรับ Gemma 4 12B ซึ่งทำคะแนนได้ 43.4% บน MRCR v2 แบบ eight-needle ที่ 128k บนการ์ดของ Google เอง

• ภาษา — รองรับ 25 ภาษาสำหรับ Microsoft-Decision-1 โดย Microsoft เตือนว่าความครอบคลุม คุณภาพ และการปรับเทียบ "อาจแตกต่างกันไปตามภาษา" และระบุว่าภาษาที่ไม่ใช่ภาษาอังกฤษซึ่งมีทรัพยากรต่ำเป็นจุดอ่อน ส่วน Gemma 4 12B รองรับมากกว่า 140 ภาษา โดยมีตัวเลข MMMLU ที่ประเมินได้ที่ 83.4 สำหรับขนาดนี้

• ผลการดำเนินงานที่เผยแพร่ — แท็บ Benchmarks ของ Microsoft-Decision-1 มีระเบียบวิธีวิจัยแต่ไม่มีตัวเลขใด ๆ; Google เผยแพร่ 77.2% MMLU Pro, 77.5% AIME 2026 โดยไม่ใช้เครื่องมือ, 72.0% LiveCodeBench v6, 78.8% GPQA Diamond, 69.1% MMMU Pro และ 79.7% MATH-Vision สำหรับ Gemma 4 12B

• การเผยแพร่ — Microsoft-Decision-1 เป็น API แบบโฮสต์ที่ให้บริการเฉพาะบน Foundry เท่านั้น ไม่มีน้ำหนักโมเดล ไม่มีให้ดาวน์โหลด และไม่มีเส้นทางการปรับแต่ง (fine-tuning) ส่วน Gemma 4 12B เป็นน้ำหนักโมเดลภายใต้สัญญาอนุญาต Apache 2.0 ที่เปิดตัวเข้าสู่ระบบนิเวศตั้งแต่วันแรก ได้แก่ LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang และ Unsloth

• รันไทม์ — การให้คะแนนการตัดสินใจเป็นการประมวลผลรอบเดียวโดยไม่มีลูปถอดรหัส ดังนั้นความหน่วงจึงแปรผันตามพรอมป์ต์มากกว่าความยาวของคำตอบ; Gemma 4 12B สร้างทีละโทเค็น และเอกสารเปิดตัวของ Google ระบุว่าอยู่ที่ 16 GB ของ VRAM หรือหน่วยความจำแบบรวม

แถวผลเบนช์มาร์กคือแถวที่ควรหยุดพิจารณา ในทางที่ทำให้ Microsoft ดูดีน้อยที่สุด ตัวเลขของ Gemma 4 12B ก็เป็นตัวเลขที่ผู้ขายรายงานเช่นกัน — แต่ตัวเลขเหล่านั้นมีหลายเดือนของการใช้งานโดยบุคคลที่สามหนุนหลังอยู่ ในชุดทดสอบสาธารณะ บนฮาร์ดแวร์ที่มีคนอื่นเป็นเจ้าของ รายการของ Microsoft ในหมวดนี้เป็นรายการใหม่ที่สุดและตรวจสอบยืนยันได้ยากที่สุดในสองรายการนี้ แม้ว่าจะมาจากบริษัทที่ใหญ่กว่า

ค่าใช้จ่ายจริงที่คุณต้องจ่ายในการโทรแต่ละครั้ง

Gemma 4 12B ในรูปแบบ 12B ไม่ได้อยู่ในแคตตาล็อกของเรา — ถ้าเป็นขนาดที่คุณต้องการ คุณก็ไปดึงพารามิเตอร์ 11.96 พันล้านตัวแบบ BF16 มาเสิร์ฟเอง สิ่งที่แคตตาล็อกของเรามีคือโมเดลอื่น ๆ ในสาย Gemma 4 และมันราคาไม่แพง: Gemma 4 26B A4B ราคา $0.06 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $0.33 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน และ Gemma 4 31B ราคา $0.13 และ $0.38 โดยทั้งคู่ระบุบริบท 262,144 โทเคน นั่นคือราคาลิสต์ของผู้ขายที่ส่งต่อมาโดยไม่มีการบวกกำไรเพิ่มจากฝั่งเรา อยู่เบื้องหลังคีย์ที่เข้ากันได้กับ OpenAI คีย์เดียว พร้อมกับโมเดลอื่นอีกกว่า 200 ตัว หากปัญหาของคุณกลายเป็นเรื่องการให้เหตุผลทั่วไปมากกว่าการตัดสินใจแบบชุดปิด หนึ่งในสองขนาดนั้นคือตัวเลือกราคาถูกที่ใช้วัดเทียบกับ scorer ที่คุณรันเองได้ — และถ้าคุณไม่อยากผูกกับผู้เขียนเพียงรายเดียว การสลับไปใช้รายอื่นอัตโนมัติ (automatic failover) จะทำให้ขาการสร้างของลูปให้คะแนนยังทำงานต่อไปได้เมื่อผู้ให้บริการรายใดรายหนึ่งมีปัญหา

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-1 เป็นการปรับใช้ Foundry ที่คุณจัดเตรียมเอง และไม่มีให้ใช้งานผ่านเรา ไม่มีสิ่งใดในบทความนี้ที่เป็นการกล่าวอ้างถึงความพร้อมใช้งานสำหรับมัน ไม่ว่าจะเป็นฝั่งใดของการเรียกใช้งาน

ประเด็นสำคัญ

Microsoft-Decision-1 เปิดให้ใช้ทั่วไปบน Microsoft Foundry เมื่อวันที่ 8 ตุลาคม 2026 โดยเป็นตัวให้คะแนนแบบข้อความเท่านั้นขนาด 32,768 โทเคน บนฐาน Qwen3.5-9B ที่คืนค่าความน่าจะเป็นซึ่งปรับเทียบแล้วสำหรับตัวเลือกที่คุณระบุ โดยมีโทเคนเอาต์พุตเป็นศูนย์ ไม่มีเวต และไม่มีตัวเลขเบนช์มาร์กที่เผยแพร่ Gemma 4 12B เป็นโมเดลทั่วไปแบบมัลติโมดัลที่ไม่ใช้เอนโคเดอร์ ขนาด 11.96B เปิดตัวเมื่อวันที่ 3 มิถุนายน 2026 ภายใต้ Apache 2.0 ซึ่งให้เหตุผล อ่านภาพและเสียง และเขียนคำตอบได้ยาวถึง 256,000 โทเคน เลือกจากรูปร่างของคำตอบของคุณ ไม่ใช่จากจำนวนพารามิเตอร์ ชุดปิดเป็นของตัวให้คะแนน ชุดเปิดเป็นของตัวเขียน และการจ่ายให้ตัวถอดรหัสเลือกจากรายการที่คุณเขียนไว้แล้ว คือวิธีที่ทีมส่วนใหญ่ใช้จ่ายมากกว่าต้นทุนของการตัดสินใจถึงสิบเท่า

สิ่งที่แค็ตตาล็อกของเรามีให้คือส่วนที่เหลือของตระกูล Gemma 4 และมีราคาไม่แพง: Gemma 4 26B A4B ที่ $0.06 ต่อโทเค็นอินพุต 1 ล้านโทเค็น และ $0.33 ต่อเอาต์พุต 1 ล้านโทเค็น และ Gemma 4 31B ที่ $0.13 และ $0.38

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube