การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความว่า 'Intern-Decision-2B vs Gemma 4 12B' พร้อมคำบรรยายใต้ภาพว่า '8,192 โทเคน เทียบกับ 256,000' และมีป้ายว่า 'ผู้ให้คะแนนที่ปฏิเสธ' กับ 'ผู้รู้รอบด้านที่เขียน' โดยมีโลโก้ OrcaRouter ประกอบอยู่ที่มุม
Guides & Insights

Intern-Decision-2B กับ Gemma 4 12B: เพดาน 8,192 โทเคน เทียบกับหน้าต่าง 256K

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สมมติว่าสิ่งที่คุณต้องให้ตัดสินคือแฟ้มเคลมประกันภัยสี่สิบหน้า internlm/Intern-Decision-2Bจะปฏิเสธมัน ไม่ใช่แค่ตัดทอน ไม่ใช่แค่สรุปย่อ — แต่ปฏิเสธเลย เพราะเอนจินการอนุมานที่มาพร้อมกันประกาศไว้ว่า DecisionEngine(max_length=8192) และโมเดลการ์ดก็ระบุไว้อย่างตรงไปตรงมาว่าอินพุตที่ใหญ่เกินจะ "ถูกปฏิเสธโดยไม่มีการตัดทอน" google/gemma-4-12B-it — Gemma 4 12B Unified — จะรับเอกสารเดียวกันนั้น บวกกับภาพถ่ายสแกนที่เย็บติดมาด้วย บวกกับบันทึกเสียงการสนทนาทางโทรศัพท์ แล้วเขียนคำตอบให้คุณ ความต่างนี้คือการเปรียบเทียบทั้งหมด และแทบไม่เกี่ยวข้องเลยกับจำนวนพารามิเตอร์ — 2,213,241,664 กับ 11,959,730,224 — ซึ่งเป็นสิ่งที่การอ่านสเปกชีตจะให้ความสำคัญเป็นอันดับแรก

Intern-Decision-2 เป็นจุดตรวจการตัดสินใจตรงกลางจากทั้งหมดสามจุดที่ InternLM อัปโหลดขึ้นโดยไม่ประกาศเมื่อวันที่ 26 กันยายน ปรับแต่งละเอียดจาก Qwen/Qwen3.5-2B และมีสัญญาอนุญาต Apache-2.0 โดยคงข้อกำหนดของ Qwen ไว้ Gemma 4 12 Unified เป็นโมเดลไร้เอนโคเดอร์ของ Google DeepMind จากเดือนพฤษภาคม 2026 เป็นระบบ any-to-any ที่รับข้อความ ภาพ เสียง และวิดีโอ และสร้างข้อความภายในหน้าต่าง 256,000 โทเคน ในกว่า 140 ภาษา หนึ่งในสองตัวนี้เป็นตัวให้คะแนน อีกตัวเป็นเจเนอรัลลิสต์ที่บังเอิญสามารถให้คะแนนได้แย่ถ้าคุณพรอมป์ตมันอย่างระมัดระวัง การตัดสินใจเลือกระหว่างสองตัวนี้จึงไม่ใช่เรื่องของ benchmark มากนัก แต่เป็นคำถามว่ารูปร่างของสิ่งที่คุณมีอยู่นั้นเป็นอย่างไร

ในกรณีที่ทั้งสองสิ่งไม่สามารถเทียบเคียงกันได้จริง

คุ้มค่าที่จะพูดกันตรง ๆ เรื่องนี้ก่อนจะดูตัวเลข เพราะการจับคู่นี้ชวนให้เกิดความสมมาตรลวง

Intern-Decision-2B ไม่สร้างโทเค็นใดๆ มันรับสถานะ คำถามที่มีชื่อตั้งแต่หนึ่งถึงสิบหกข้อ โดยแต่ละข้อมีตัวเลือกสูงสุด 62 ตัวเลือก และอาจมีรูปภาพได้สูงสุดแปดรูป; สร้างโครงร่าง JSON ของผู้ช่วยโดยมีตัวแทน <decision> หนึ่งตัวต่อฟิลด์; รันการส่งผ่านไปข้างหน้าแบบเชิงสาเหตุเพียงครั้งเดียว; อ่านค่า logits ณ ตำแหน่งที่อยู่ก่อนหน้าตัวแทนแต่ละตัวทันที; ทำ softmax เฉพาะสัญลักษณ์ที่ถูกต้องของฟิลด์นั้น; และใช้อุณหภูมิที่ปรับค่าแล้วเท่ากับ 2.100509348278 ผลลัพธ์คือการแจกแจงที่ปรับเทียบแล้วและค่า argmax ต่อฟิลด์ การ์ดระบุข้อเสียอย่างตรงไปตรงมาว่า: "API นี้ทำการให้คะแนนผู้สมัครแบบมีโครงสร้าง ไม่ได้เรียกใช้ generate() หรือสุ่มข้อความแบบอิสระ"

Gemma 4 12B สร้างผลลัพธ์ ทุกสิ่งที่มันทำ — การให้เหตุผลด้วยการคิดที่กำหนดค่าได้, การเรียกใช้ฟังก์ชัน, OCR, การทำความเข้าใจแผนภูมิ, การรู้จำเสียงพูด, ความครอบคลุม 140 ภาษา — ทำงานผ่านลูปการถอดรหัสบนคำศัพท์ 262,144 รายการ ถ้าคุณขอให้มันตัดสินใจจัดเส้นทางพร้อมความน่าจะเป็น คุณจะได้ข้อความร้อยแก้วที่มีตัวเลข และตัวเลขนั้นจะเป็นอะไรก็ตามที่ตัวสุ่มตัวอย่างสร้างขึ้น ไม่ใช่ softmax เหนือชุดตัวเลือกของคุณ

ดังนั้น คำถามในทางปฏิบัติไม่ใช่ "อันไหนแม่นยำกว่า" แต่เป็น "คำตอบของคุณเป็นเซตปิดอยู่แล้วหรือไม่?" ถ้าใช่ การใช้ 12B ก็เป็นวิธีที่สิ้นเปลืองในการเลือกจากรายการ ถ้าไม่ใช่ Intern-Decision-2B ก็ช่วยคุณไม่ได้เลยไม่ว่าจะต้องการความแม่นยำระดับใดก็ตาม

เพดานอินพุตคือเส้นแบ่งที่คมชัดที่สุดระหว่างทั้งสอง

นี่คือมิติที่ต้องให้น้ำหนักเหนือสิ่งอื่นใด เพราะมันก่อให้เกิดความล้มเหลวแบบรุนแรง แทนที่จะเป็นเพียงความเสื่อมประสิทธิภาพ

• ความยาวอินพุต — Intern-Decision-2B ยอมรับ 8,192 โทเค็นและปฏิเสธสิ่งใดก็ตามที่ยาวกว่านั้นอย่างเสียงดัง; Gemma 4 12B ยอมรับ 256,000 โทเค็น และบนการ์ดของ Google เอง ได้คะแนน 43.4% ใน MRCR v2 eight-needle ที่ 128k

• รูปภาพ — สูงสุดแปดรูปสำหรับ Intern-Decision-2B และจะนับรวมกับงบ 8,192 โทเค็นเดียวกัน; อัตราส่วนภาพและความละเอียดที่ปรับได้สำหรับ Gemma 4 12B พร้อมอินพุตข้อความและรูปภาพที่สลับกันได้ในลำดับใดก็ได้

• โมดัลลิตี้ขาเข้า — ข้อความและรูปภาพสำหรับตัวหนึ่ง; ข้อความ รูปภาพ เสียง และวิดีโอสำหรับอีกตัวหนึ่ง

• ภาษา — ไม่มีการกล่าวอ้างถึงความสามารถหลายภาษา ณ ที่ใดในเอกสารประกอบของ Intern-Decision; Gemma 4 รองรับภาษาที่ผ่านการฝึกมากกว่า 140 ภาษา โดยมีคะแนนความสามารถหลายภาษาที่ประเมินได้ 83.4 บน MMMLU สำหรับรุ่น 12B

• เอาต์พุต — การแจกแจงคำตอบแบบ JSON ที่มีชนิดข้อมูลสำหรับอันหนึ่ง; ข้อความที่สร้างขึ้นสำหรับอีกอัน

ขีดจำกัด 8,192 ไม่ได้ตั้งขึ้นมาลอย ๆ และนั่นแหละคือสิ่งที่ทำให้การหาทางเลี่ยงเป็นเรื่องยาก วัตถุประสงค์ของการตัดสินใจอ่านค่า logit ณ ตำแหน่งคงที่ต่อฟิลด์ ดังนั้นพรอมป์ต์จึงต้องมีสถานะ สคีมา และโครงร่างเต็มทั้งหมดในครั้งเดียว ไม่มีกลยุทธ์การแบ่งชิ้นส่วนใดที่รักษาข้อกำหนดนี้ไว้ได้ ตั๋ว อีเมล สถานะ JSON สั้น ๆ ภาพหน้าจอหนึ่งหรือสองภาพ — นั่นคือจุดศูนย์กลางของการออกแบบ เอกสารที่ต้องอาศัยการค้นคืนคือเอกสารที่โมเดลนี้ไม่ได้ออกแบบมาเพื่อ

แต่ละอย่างมีค่าใช้จ่ายกับคุณเท่าไร เมื่อนับกันตามจริง

Intern-Decision-2B ไม่มี hosted endpoint และไม่มีผู้ให้บริการ หน้าโมเดลของ OrcaRouter สำหรับมันส่งคืน 404 และไม่มีสิ่งใดในบทความนี้ที่เป็นการอ้างถึงความพร้อมใช้งาน การเรียกใช้งานมันหมายถึงการดาวน์โหลด repository ประมาณ 4.24 GB — language shard 3.76 GB, vision projector 612.5 MB — และรัน inference ควบคู่ไปกับ weights ในสภาพแวดล้อม Python 3.12 ที่มี torch 2.9.1 และ transformers 5.14.1 บน GPU ที่คุณจ่ายเงินอยู่ไม่ว่ามันจะกำลังให้คะแนนการตัดสินใจหรือไม่ก็ตาม

นั่นไม่ใช่ข้อเสียในทุกกรณี และควรลงมือคำนวณจริงแทนที่จะสันนิษฐานเอา ด้วยค่าเฉลี่ย 33.28 ms ต่อคำขอ บน RTX 4090 เพียงตัวเดียว จากการวัดของ InternLM เอง Intern-Decision-2B ที่โฮสต์ในเครื่องไม่คิดค่าใช้จ่ายใด ๆ ต่อการตัดสินใจหนึ่งครั้ง โมเดลทั่วไปแบบโฮสต์คิดค่าบริการตามโทเคน รวมถึงโทเคนที่ใช้คิดก่อนจะตอบ ในปริมาณมาก ตัวให้คะแนนที่คุณมีอยู่แล้วคือเครื่องมือที่ถูกกว่า — ต้นทุนคือ GPU และงานวิศวกรรม ไม่ใช่การเรียกใช้

Gemma 4 12B Unified ก็ไม่มีอยู่ในแคตตาล็อกของเราเช่นกัน หากคุณต้องการใช้ คุณต้องไปดึงพารามิเตอร์ 11.96 พันล้านตัวในรูปแบบ BF16 แล้วให้บริการด้วยตัวเอง จุดที่แคตตาล็อกของเรามีเส้นทาง Gemma 4 จริง ๆ คือสองขนาดที่เหลือ และราคาถูกมาก: Gemma 4 26B A4B ราคา $0.06 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $0.33 ต่อเอาต์พุตหนึ่งล้านโทเคน ส่วน Gemma 4 31B ราคา $0.13 และ $0.38 โดยระบุขนาดคอนเท็กซ์ 262,144 โทเคน และ P50 time-to-first-token ที่แคตตาล็อกแสดงไว้ที่ 1.73 วินาที หากปัญหาของคุณกลายเป็นเรื่องการให้เหตุผลทั่วไปมากกว่าการตัดสินใจแบบชุดปิด นั่นคือสิ่งที่ควรนำไปเปรียบเทียบกับ scorer ที่รันในเครื่องของคุณเอง — โมเดลเพิ่มอีกสองตัวบนคีย์เดียว ราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยไม่บวกเพิ่ม และการสลับไปใช้ระบบสำรองอัตโนมัติ เพื่อให้โมเดลที่คุณยังอยู่ระหว่างการประเมินไม่กลายเป็นจุดล้มเหลวจุดเดียวในเส้นทางการใช้งานจริง

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 input and $0.38 output per million tokens, and a P50 time to first token of 1.73 seconds.

สกอร์บอร์ด พร้อมข้อแม้ที่แนบมาด้วย

• พารามิเตอร์ — Intern-Decision-2B 2,213,241,664 ใน BF16 บวกกับวิชันทาวเวอร์และโปรเจกเตอร์; Gemma 4 12B Unified 11,959,730,224 ใน BF16

• บริบท — 8,192 โทเคน เกินกว่านี้จะถูกปฏิเสธ เทียบกับ 256,000 โทเคน

• เอาต์พุต — ความน่าจะเป็นที่ปรับคาลิเบรตแล้วและค่า argmax โดยไม่มีข้อความ; ข้อความที่สร้างขึ้น ครั้งละหนึ่งโทเคน

• มอดาลิตี้ — ข้อความบวกภาพได้ถึงแปดภาพ เทียบกับอินพุตที่เป็นข้อความ ภาพ เสียง และวิดีโอ โดยให้เอาต์พุตเป็นข้อความ

• หลักฐานที่เผยแพร่ — ตารางผู้ขายแบบเจ็ดชุดการทดสอบ เฉลี่ย 84.68 โดยมีคะแนน Brier 0.437 และ ECE 0.100 ซึ่งยังไม่มีผู้ใดนอกห้องแล็บทำซ้ำได้; การ์ดประเมินของ Google ที่มี MMLU Pro 77.2%, GPQA Diamond 78.8%, AIME 2026 แบบไม่ใช้เครื่องมือ 77.5% และ LiveCodeBench v6 72.0 พร้อมรายการจัดอันดับอิสระที่ Artificial Analysis Intelligence Index 14.2

• การนำไปใช้ — ถูกใจหนึ่งครั้งและดาวน์โหลดศูนย์ครั้งบนเช็กพอยต์ 2B เมื่อเทียบกับตระกูลที่หมุนเวียนมาตั้งแต่เดือนพฤษภาคม พร้อมการควอนไทซ์ ไฟน์จูน และเวอร์ชันต่อยอดที่มีจำนวนนับร้อย

จงอ่านแถวหลักฐานอย่างไม่สมมาตร เพราะมันเป็นเช่นนั้นจริง ตัวเลขของ Google ได้รับการจัดทำดัชนีและทำซ้ำโดยบุคคลที่สามอย่างอิสระ ส่วนตัวเลขของ InternLM ยังไม่ถูกใครนอกห้องแล็บรัน และโดยเฉพาะค่าคาลิเบรชันนั้นควรถือเป็นเจตนาที่มีเอกสารประกอบอย่างดี จนกว่าจะได้เจอชุดทดสอบจากภายนอก สรุปที่ซื่อสัตย์ไม่ใช่ว่าตารางของผู้ขายผิด หากแต่คือว่าสองคอลัมน์นั้นมีน้ำหนักเชิงหลักฐานไม่เท่ากัน และการเปรียบเทียบที่พิมพ์ 84.68 ไว้ข้าง ๆ 77.2 โดยไม่บอกเช่นนั้น กำลังทำให้ผู้อ่านเข้าใจผิด

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Gemma 4 12B'. The left column reads: Parameters 2.21B BF16 plus vision tower; Context 8,192 tokens, refused above; Output probabilities and an argmax, no text; Input text plus up to 8 images; Published evidence vendor table, unreproduced; Licence Apache 2.0 plus LICENSE-QWEN. The right column reads: Parameters 11.96B BF16; Context 256,000 tokens; Output generated text, token by token; Input text, image, audio and video; Published evidence Google card, AA Index 14.2; Licence Apache 2.0, Gemma 4 terms. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Gemma 4 12B figures come from Google's own card plus an independent Artificial Analysis index.

จะทำอะไรกับสิ่งนี้ดี

เลือก Intern-Decision-2B เมื่อการตัดสินใจปิดจริง ๆ สถานะพอดีอยู่ในช่วงแปดพันโทเคนอย่างสบาย ๆ คุณต้องการความน่าจะเป็นที่ตั้งเกณฑ์ได้แทนที่จะเป็นย่อหน้าที่ต้องตีความ และคุณมีฮาร์ดแวร์และความเต็มใจที่จะรันเช็กพอยต์ที่ยังไม่มีใครรองรับ ขนาดกลางนี้มีค่าคาลิเบรชันที่เผยแพร่แล้วอ่อนที่สุดในสามรุ่นที่ InternLM ปล่อยออกมาโดยเฉพาะ — ECE 0.100 เทียบกับ 0.066 สำหรับโมเดลที่มีขนาดครึ่งหนึ่งของมัน และ 0.065 สำหรับรุ่นที่ใหญ่เกือบสองเท่า — ดังนั้นหากคุณกำลังเลือกรุ่นในตระกูลนี้ 2B คือรุ่นที่ควรปรับ temperature ด้วยตัวเอง ไม่ใช่รุ่นที่ควรเชื่อถือได้ทันทีเมื่อแกะกล่อง

เลือก Gemma 4 12B — หรือในทางปฏิบัติมากกว่า คือหนึ่งในสองขนาดของ Gemma 4 ที่เราให้บริการจริง — เมื่ออินพุตยาวกว่าหนึ่งหน้า เมื่อเกี่ยวข้องกับเสียง วิดีโอ หรือภาษาที่ไม่ใช่ภาษาอังกฤษ เมื่อคำตอบต้องมีการอธิบาย ไม่ใช่แค่เลือก หรือเมื่อคุณไม่อยากเป็นเจ้าของสแต็กการอนุมานเอง 12B เป็นรุ่นที่เล็กที่สุดในบรรดาโมเดล Gemma 4 ที่มีเสียงแบบเนทีฟ; 26B A4B เปิดใช้งานพารามิเตอร์ประมาณสี่พันล้านตัวต่อโทเคน และเป็นวิธีที่ถูกที่สุดในการเข้าสู่ตระกูลนี้

และถ้าสิ่งที่คุณมีจริง ๆ คือปัญหาเรื่องการให้คะแนนที่มาพร้อมกับเอกสารยาว ๆ แล้วล่ะก็ ทั้งสองอย่างนี้ก็ไม่ใช่เครื่องมือที่เหมาะสม นั่นคือปัญหาการดึงข้อมูลที่สวมคราบของบทความเปรียบเทียบอยู่

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube