
Intern-Decision-2B กับ Gemma 4 12B: เพดาน 8,192 โทเคน เทียบกับหน้าต่าง 256K
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 584 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 187 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
สมมติว่าสิ่งที่คุณต้องให้ตัดสินคือแฟ้มเคลมประกันภัยสี่สิบหน้า internlm/Intern-Decision-2Bจะปฏิเสธมัน ไม่ใช่แค่ตัดทอน ไม่ใช่แค่สรุปย่อ — แต่ปฏิเสธเลย เพราะเอนจินการอนุมานที่มาพร้อมกันประกาศไว้ว่า DecisionEngine(max_length=8192) และโมเดลการ์ดก็ระบุไว้อย่างตรงไปตรงมาว่าอินพุตที่ใหญ่เกินจะ "ถูกปฏิเสธโดยไม่มีการตัดทอน" google/gemma-4-12B-it — Gemma 4 12B Unified — จะรับเอกสารเดียวกันนั้น บวกกับภาพถ่ายสแกนที่เย็บติดมาด้วย บวกกับบันทึกเสียงการสนทนาทางโทรศัพท์ แล้วเขียนคำตอบให้คุณ ความต่างนี้คือการเปรียบเทียบทั้งหมด และแทบไม่เกี่ยวข้องเลยกับจำนวนพารามิเตอร์ — 2,213,241,664 กับ 11,959,730,224 — ซึ่งเป็นสิ่งที่การอ่านสเปกชีตจะให้ความสำคัญเป็นอันดับแรก
Intern-Decision-2 เป็นจุดตรวจการตัดสินใจตรงกลางจากทั้งหมดสามจุดที่ InternLM อัปโหลดขึ้นโดยไม่ประกาศเมื่อวันที่ 26 กันยายน ปรับแต่งละเอียดจาก Qwen/Qwen3.5-2B และมีสัญญาอนุญาต Apache-2.0 โดยคงข้อกำหนดของ Qwen ไว้ Gemma 4 12 Unified เป็นโมเดลไร้เอนโคเดอร์ของ Google DeepMind จากเดือนพฤษภาคม 2026 เป็นระบบ any-to-any ที่รับข้อความ ภาพ เสียง และวิดีโอ และสร้างข้อความภายในหน้าต่าง 256,000 โทเคน ในกว่า 140 ภาษา หนึ่งในสองตัวนี้เป็นตัวให้คะแนน อีกตัวเป็นเจเนอรัลลิสต์ที่บังเอิญสามารถให้คะแนนได้แย่ถ้าคุณพรอมป์ตมันอย่างระมัดระวัง การตัดสินใจเลือกระหว่างสองตัวนี้จึงไม่ใช่เรื่องของ benchmark มากนัก แต่เป็นคำถามว่ารูปร่างของสิ่งที่คุณมีอยู่นั้นเป็นอย่างไร
ในกรณีที่ทั้งสองสิ่งไม่สามารถเทียบเคียงกันได้จริง
คุ้มค่าที่จะพูดกันตรง ๆ เรื่องนี้ก่อนจะดูตัวเลข เพราะการจับคู่นี้ชวนให้เกิดความสมมาตรลวง
Intern-Decision-2B ไม่สร้างโทเค็นใดๆ มันรับสถานะ คำถามที่มีชื่อตั้งแต่หนึ่งถึงสิบหกข้อ โดยแต่ละข้อมีตัวเลือกสูงสุด 62 ตัวเลือก และอาจมีรูปภาพได้สูงสุดแปดรูป; สร้างโครงร่าง JSON ของผู้ช่วยโดยมีตัวแทน <decision> หนึ่งตัวต่อฟิลด์; รันการส่งผ่านไปข้างหน้าแบบเชิงสาเหตุเพียงครั้งเดียว; อ่านค่า logits ณ ตำแหน่งที่อยู่ก่อนหน้าตัวแทนแต่ละตัวทันที; ทำ softmax เฉพาะสัญลักษณ์ที่ถูกต้องของฟิลด์นั้น; และใช้อุณหภูมิที่ปรับค่าแล้วเท่ากับ 2.100509348278 ผลลัพธ์คือการแจกแจงที่ปรับเทียบแล้วและค่า argmax ต่อฟิลด์ การ์ดระบุข้อเสียอย่างตรงไปตรงมาว่า: "API นี้ทำการให้คะแนนผู้สมัครแบบมีโครงสร้าง ไม่ได้เรียกใช้ generate() หรือสุ่มข้อความแบบอิสระ"
Gemma 4 12B สร้างผลลัพธ์ ทุกสิ่งที่มันทำ — การให้เหตุผลด้วยการคิดที่กำหนดค่าได้, การเรียกใช้ฟังก์ชัน, OCR, การทำความเข้าใจแผนภูมิ, การรู้จำเสียงพูด, ความครอบคลุม 140 ภาษา — ทำงานผ่านลูปการถอดรหัสบนคำศัพท์ 262,144 รายการ ถ้าคุณขอให้มันตัดสินใจจัดเส้นทางพร้อมความน่าจะเป็น คุณจะได้ข้อความร้อยแก้วที่มีตัวเลข และตัวเลขนั้นจะเป็นอะไรก็ตามที่ตัวสุ่มตัวอย่างสร้างขึ้น ไม่ใช่ softmax เหนือชุดตัวเลือกของคุณ
ดังนั้น คำถามในทางปฏิบัติไม่ใช่ "อันไหนแม่นยำกว่า" แต่เป็น "คำตอบของคุณเป็นเซตปิดอยู่แล้วหรือไม่?" ถ้าใช่ การใช้ 12B ก็เป็นวิธีที่สิ้นเปลืองในการเลือกจากรายการ ถ้าไม่ใช่ Intern-Decision-2B ก็ช่วยคุณไม่ได้เลยไม่ว่าจะต้องการความแม่นยำระดับใดก็ตาม
เพดานอินพุตคือเส้นแบ่งที่คมชัดที่สุดระหว่างทั้งสอง
นี่คือมิติที่ต้องให้น้ำหนักเหนือสิ่งอื่นใด เพราะมันก่อให้เกิดความล้มเหลวแบบรุนแรง แทนที่จะเป็นเพียงความเสื่อมประสิทธิภาพ
• ความยาวอินพุต — Intern-Decision-2B ยอมรับ 8,192 โทเค็นและปฏิเสธสิ่งใดก็ตามที่ยาวกว่านั้นอย่างเสียงดัง; Gemma 4 12B ยอมรับ 256,000 โทเค็น และบนการ์ดของ Google เอง ได้คะแนน 43.4% ใน MRCR v2 eight-needle ที่ 128k
• รูปภาพ — สูงสุดแปดรูปสำหรับ Intern-Decision-2B และจะนับรวมกับงบ 8,192 โทเค็นเดียวกัน; อัตราส่วนภาพและความละเอียดที่ปรับได้สำหรับ Gemma 4 12B พร้อมอินพุตข้อความและรูปภาพที่สลับกันได้ในลำดับใดก็ได้
• โมดัลลิตี้ขาเข้า — ข้อความและรูปภาพสำหรับตัวหนึ่ง; ข้อความ รูปภาพ เสียง และวิดีโอสำหรับอีกตัวหนึ่ง
• ภาษา — ไม่มีการกล่าวอ้างถึงความสามารถหลายภาษา ณ ที่ใดในเอกสารประกอบของ Intern-Decision; Gemma 4 รองรับภาษาที่ผ่านการฝึกมากกว่า 140 ภาษา โดยมีคะแนนความสามารถหลายภาษาที่ประเมินได้ 83.4 บน MMMLU สำหรับรุ่น 12B
• เอาต์พุต — การแจกแจงคำตอบแบบ JSON ที่มีชนิดข้อมูลสำหรับอันหนึ่ง; ข้อความที่สร้างขึ้นสำหรับอีกอัน
ขีดจำกัด 8,192 ไม่ได้ตั้งขึ้นมาลอย ๆ และนั่นแหละคือสิ่งที่ทำให้การหาทางเลี่ยงเป็นเรื่องยาก วัตถุประสงค์ของการตัดสินใจอ่านค่า logit ณ ตำแหน่งคงที่ต่อฟิลด์ ดังนั้นพรอมป์ต์จึงต้องมีสถานะ สคีมา และโครงร่างเต็มทั้งหมดในครั้งเดียว ไม่มีกลยุทธ์การแบ่งชิ้นส่วนใดที่รักษาข้อกำหนดนี้ไว้ได้ ตั๋ว อีเมล สถานะ JSON สั้น ๆ ภาพหน้าจอหนึ่งหรือสองภาพ — นั่นคือจุดศูนย์กลางของการออกแบบ เอกสารที่ต้องอาศัยการค้นคืนคือเอกสารที่โมเดลนี้ไม่ได้ออกแบบมาเพื่อ
แต่ละอย่างมีค่าใช้จ่ายกับคุณเท่าไร เมื่อนับกันตามจริง
Intern-Decision-2B ไม่มี hosted endpoint และไม่มีผู้ให้บริการ หน้าโมเดลของ OrcaRouter สำหรับมันส่งคืน 404 และไม่มีสิ่งใดในบทความนี้ที่เป็นการอ้างถึงความพร้อมใช้งาน การเรียกใช้งานมันหมายถึงการดาวน์โหลด repository ประมาณ 4.24 GB — language shard 3.76 GB, vision projector 612.5 MB — และรัน inference ควบคู่ไปกับ weights ในสภาพแวดล้อม Python 3.12 ที่มี torch 2.9.1 และ transformers 5.14.1 บน GPU ที่คุณจ่ายเงินอยู่ไม่ว่ามันจะกำลังให้คะแนนการตัดสินใจหรือไม่ก็ตาม
นั่นไม่ใช่ข้อเสียในทุกกรณี และควรลงมือคำนวณจริงแทนที่จะสันนิษฐานเอา ด้วยค่าเฉลี่ย 33.28 ms ต่อคำขอ บน RTX 4090 เพียงตัวเดียว จากการวัดของ InternLM เอง Intern-Decision-2B ที่โฮสต์ในเครื่องไม่คิดค่าใช้จ่ายใด ๆ ต่อการตัดสินใจหนึ่งครั้ง โมเดลทั่วไปแบบโฮสต์คิดค่าบริการตามโทเคน รวมถึงโทเคนที่ใช้คิดก่อนจะตอบ ในปริมาณมาก ตัวให้คะแนนที่คุณมีอยู่แล้วคือเครื่องมือที่ถูกกว่า — ต้นทุนคือ GPU และงานวิศวกรรม ไม่ใช่การเรียกใช้
Gemma 4 12B Unified ก็ไม่มีอยู่ในแคตตาล็อกของเราเช่นกัน หากคุณต้องการใช้ คุณต้องไปดึงพารามิเตอร์ 11.96 พันล้านตัวในรูปแบบ BF16 แล้วให้บริการด้วยตัวเอง จุดที่แคตตาล็อกของเรามีเส้นทาง Gemma 4 จริง ๆ คือสองขนาดที่เหลือ และราคาถูกมาก: Gemma 4 26B A4B ราคา $0.06 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $0.33 ต่อเอาต์พุตหนึ่งล้านโทเคน ส่วน Gemma 4 31B ราคา $0.13 และ $0.38 โดยระบุขนาดคอนเท็กซ์ 262,144 โทเคน และ P50 time-to-first-token ที่แคตตาล็อกแสดงไว้ที่ 1.73 วินาที หากปัญหาของคุณกลายเป็นเรื่องการให้เหตุผลทั่วไปมากกว่าการตัดสินใจแบบชุดปิด นั่นคือสิ่งที่ควรนำไปเปรียบเทียบกับ scorer ที่รันในเครื่องของคุณเอง — โมเดลเพิ่มอีกสองตัวบนคีย์เดียว ราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยไม่บวกเพิ่ม และการสลับไปใช้ระบบสำรองอัตโนมัติ เพื่อให้โมเดลที่คุณยังอยู่ระหว่างการประเมินไม่กลายเป็นจุดล้มเหลวจุดเดียวในเส้นทางการใช้งานจริง

สกอร์บอร์ด พร้อมข้อแม้ที่แนบมาด้วย
• พารามิเตอร์ — Intern-Decision-2B 2,213,241,664 ใน BF16 บวกกับวิชันทาวเวอร์และโปรเจกเตอร์; Gemma 4 12B Unified 11,959,730,224 ใน BF16
• บริบท — 8,192 โทเคน เกินกว่านี้จะถูกปฏิเสธ เทียบกับ 256,000 โทเคน
• เอาต์พุต — ความน่าจะเป็นที่ปรับคาลิเบรตแล้วและค่า argmax โดยไม่มีข้อความ; ข้อความที่สร้างขึ้น ครั้งละหนึ่งโทเคน
• มอดาลิตี้ — ข้อความบวกภาพได้ถึงแปดภาพ เทียบกับอินพุตที่เป็นข้อความ ภาพ เสียง และวิดีโอ โดยให้เอาต์พุตเป็นข้อความ
• หลักฐานที่เผยแพร่ — ตารางผู้ขายแบบเจ็ดชุดการทดสอบ เฉลี่ย 84.68 โดยมีคะแนน Brier 0.437 และ ECE 0.100 ซึ่งยังไม่มีผู้ใดนอกห้องแล็บทำซ้ำได้; การ์ดประเมินของ Google ที่มี MMLU Pro 77.2%, GPQA Diamond 78.8%, AIME 2026 แบบไม่ใช้เครื่องมือ 77.5% และ LiveCodeBench v6 72.0 พร้อมรายการจัดอันดับอิสระที่ Artificial Analysis Intelligence Index 14.2
• การนำไปใช้ — ถูกใจหนึ่งครั้งและดาวน์โหลดศูนย์ครั้งบนเช็กพอยต์ 2B เมื่อเทียบกับตระกูลที่หมุนเวียนมาตั้งแต่เดือนพฤษภาคม พร้อมการควอนไทซ์ ไฟน์จูน และเวอร์ชันต่อยอดที่มีจำนวนนับร้อย
จงอ่านแถวหลักฐานอย่างไม่สมมาตร เพราะมันเป็นเช่นนั้นจริง ตัวเลขของ Google ได้รับการจัดทำดัชนีและทำซ้ำโดยบุคคลที่สามอย่างอิสระ ส่วนตัวเลขของ InternLM ยังไม่ถูกใครนอกห้องแล็บรัน และโดยเฉพาะค่าคาลิเบรชันนั้นควรถือเป็นเจตนาที่มีเอกสารประกอบอย่างดี จนกว่าจะได้เจอชุดทดสอบจากภายนอก สรุปที่ซื่อสัตย์ไม่ใช่ว่าตารางของผู้ขายผิด หากแต่คือว่าสองคอลัมน์นั้นมีน้ำหนักเชิงหลักฐานไม่เท่ากัน และการเปรียบเทียบที่พิมพ์ 84.68 ไว้ข้าง ๆ 77.2 โดยไม่บอกเช่นนั้น กำลังทำให้ผู้อ่านเข้าใจผิด

จะทำอะไรกับสิ่งนี้ดี
เลือก Intern-Decision-2B เมื่อการตัดสินใจปิดจริง ๆ สถานะพอดีอยู่ในช่วงแปดพันโทเคนอย่างสบาย ๆ คุณต้องการความน่าจะเป็นที่ตั้งเกณฑ์ได้แทนที่จะเป็นย่อหน้าที่ต้องตีความ และคุณมีฮาร์ดแวร์และความเต็มใจที่จะรันเช็กพอยต์ที่ยังไม่มีใครรองรับ ขนาดกลางนี้มีค่าคาลิเบรชันที่เผยแพร่แล้วอ่อนที่สุดในสามรุ่นที่ InternLM ปล่อยออกมาโดยเฉพาะ — ECE 0.100 เทียบกับ 0.066 สำหรับโมเดลที่มีขนาดครึ่งหนึ่งของมัน และ 0.065 สำหรับรุ่นที่ใหญ่เกือบสองเท่า — ดังนั้นหากคุณกำลังเลือกรุ่นในตระกูลนี้ 2B คือรุ่นที่ควรปรับ temperature ด้วยตัวเอง ไม่ใช่รุ่นที่ควรเชื่อถือได้ทันทีเมื่อแกะกล่อง
เลือก Gemma 4 12B — หรือในทางปฏิบัติมากกว่า คือหนึ่งในสองขนาดของ Gemma 4 ที่เราให้บริการจริง — เมื่ออินพุตยาวกว่าหนึ่งหน้า เมื่อเกี่ยวข้องกับเสียง วิดีโอ หรือภาษาที่ไม่ใช่ภาษาอังกฤษ เมื่อคำตอบต้องมีการอธิบาย ไม่ใช่แค่เลือก หรือเมื่อคุณไม่อยากเป็นเจ้าของสแต็กการอนุมานเอง 12B เป็นรุ่นที่เล็กที่สุดในบรรดาโมเดล Gemma 4 ที่มีเสียงแบบเนทีฟ; 26B A4B เปิดใช้งานพารามิเตอร์ประมาณสี่พันล้านตัวต่อโทเคน และเป็นวิธีที่ถูกที่สุดในการเข้าสู่ตระกูลนี้
และถ้าสิ่งที่คุณมีจริง ๆ คือปัญหาเรื่องการให้คะแนนที่มาพร้อมกับเอกสารยาว ๆ แล้วล่ะก็ ทั้งสองอย่างนี้ก็ไม่ใช่เครื่องมือที่เหมาะสม นั่นคือปัญหาการดึงข้อมูลที่สวมคราบของบทความเปรียบเทียบอยู่

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
