
Intern-S2 vs Gemini 3.1 Pro: การประลองมัลติโมดัลที่ InternLM วัดผลจริง
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
การเปรียบเทียบส่วนใหญ่ในซีรีส์นี้ต้องปะติดปะต่อคำกล่าวอ้างของผู้ขายสองรายเข้าด้วยกัน รายการนี้ไม่ต้อง Intern-S2 โมเดลมัลติโมดัล Apache-2.0 ขนาด 397 พันล้านพารามิเตอร์ที่ InternLM เปิดตัววันนี้ และ Gemini 3.1 Pro โมเดลใช้เหตุผลเรือธงของ Google ต่างปรากฏเป็นคอลัมน์ที่วัดค่าแล้วในตาราง benchmark เดียวกัน — ซึ่งทำให้สิ่งนี้เป็นการเทียบแบบตัวต่อตัวที่ยุติธรรมที่สุดในชุดนี้ และไม่ใช่เรื่องบังเอิญที่มันเป็นรายการที่โมเดลเปิดมีเรื่องต้องตอบมากที่สุด Gemini 3.1 Pro อ่านข้อความ รูปภาพ เสียง และวิดีโอ รองรับบริบท 1 ล้านโทเคน และถูกแล็บอิสระกับทราฟฟิกการใช้งานจริงตรวจสอบอย่างหนัก นับตั้งแต่เข้าสู่ช่วงพรีวิวเมื่อวันที่ 19 กุมภาพันธ์ 2026 Intern-S2 อ่านข้อความ รูปภาพ และอนุกรมเวลา ถูกอัปโหลดขึ้น Hugging Face เมื่อเช้านี้ และไม่มีคะแนนจากบุคคลที่สามใด ๆ เลย ในแถวที่ทั้งสองถูกวัด โมเดลของ Google ชนะในแถวเหล่านั้นมากกว่าที่ไม่ชนะ
ทั้งคู่อ่านภาพได้ นั่นคือจุดที่ความคล้ายคลึงกันสิ้นสุดลง
คำว่า "หลายรูปแบบ" ทำให้โมเดลเหล่านี้ดูเหมือนอยู่ในระดับเดียวกัน พวกมันไม่ได้อยู่ในระดับเดียวกัน และความแตกต่างอยู่ที่สิ่งที่แต่ละตัวถูกสร้างขึ้นมาให้มอง
เส้นทางการมองเห็นของ Intern-S2 ได้รับการฝึกให้ประมวลผลหน้าต้นฉบับของวรรณกรรมทางวิทยาศาสตร์ — รูปภาพ สมการ แผนภาพโครงสร้าง เลย์เอาต์ — เป็นตัวแทนที่ใช้ร่วมกันเพียงหนึ่งเดียว แทนที่จะแยกวิเคราะห์ข้อความออกมาก่อน เกณฑ์มาตรฐานแบบหลายรูปแบบของมันเป็นทางวิทยาศาสตร์: VQA ด้านจุลทรรศน์ทางชีววิทยา การรับรู้ระยะไกล การตอบคำถามจากแผนภูมิทางวิทยาศาสตร์ นอกจากนี้ยังรับข้อมูลอนุกรมเวลาและสามารถสร้างการคาดการณ์ ซึ่งเป็นประเภทอินพุตที่แทบไม่มีโมเดลเรือธงทั่วไปใดรองรับเลย
ความสามารถมัลติโมดัลของ Gemini 3.1 Pro นั้นเป็นแบบอเนกประสงค์และกว้างขวางหลากหลายประเภทกว่า นั่นคือ ข้อความ รูปภาพ เสียง และวิดีโอ ในโมเดลเดียว โดยมุ่งเป้าไปที่งานในสายการผลิตทุกรูปแบบที่คุณชี้โมเดลไปที่ไฟล์แล้วถามคำถาม บันทึกการประชุม ภาพหน้าจอ UI แผนภูมิในไฟล์ PDF คลิปวิดีโอ — ล้วนอยู่ในขอบเขตที่ใช้ได้ทั้งหมด และทั้งหมดล้วนผ่านการประเมินแบบสาธารณะมาแล้วหกเดือน
ถ้าอินพุตของคุณเป็นภาพทางวิทยาศาสตร์ Intern-S2 ถูกสร้างขึ้นมาเพื่อสิ่งนี้โดยเฉพาะ และมีตัวเลขจากผู้ขายมาสนับสนุนจุดยืนของตน ถ้าอินพุตของคุณเป็นอย่างอื่น Gemini 3.1 Pro รองรับเสียงและวิดีโอ ส่วน Intern-S2 ไม่รองรับทั้งสองอย่าง สิ่งนี้ช่วยคลี่คลายคำถาม "ควรใช้ตัวไหน" ได้เป็นจำนวนมาก ก่อนที่ราคาหรือเบนช์มาร์กจะเข้ามาเกี่ยวข้อง และใครก็ตามที่บอกคุณว่าทั้งสองใช้แทนกันได้ แสดงว่ายังไม่ได้อ่านรายการอินพุต
สิ่งที่ตารางที่แชร์แสดงให้เห็น เมื่ออ่านอย่างตรงไปตรงมา
เนื่องจาก InternLM ได้ benchmark ทั้งสองตัว นี่จึงเป็นหนึ่งในไม่กี่จุดที่การเปรียบเทียบโดยตรงถือว่าชอบธรรม มากกว่าจะเป็นการนำข้อมูลมาต่อประกอบกัน ข้อแม้ยังคงเดิมและควรกล่าวไว้สักครั้ง: ตัวเลขทุกตัวของ Intern-S2 เป็นข้อมูลที่ผู้ขายรายงานเอง โดย InternLM เป็นผู้รันบนฮาร์เนสของตนเองผ่าน OpenCompass, VLMEvalKit และ AgentCompass โดยไม่มีการทำซ้ำอย่างอิสระ ตัวเลขของ Gemini ในตารางนั้นก็มาจากการรันการเปรียบเทียบของ InternLM เช่นกัน แม้ว่า Gemini จะมีบันทึกอิสระที่กว้างขวางอยู่นอกเหนือจากการรันนั้น
• ความรู้แบบหลายรูปแบบ — Gemini 3.1 Pro 83.99 บน MMMU Pro เทียบกับ Intern-S2 81.68
• การถามตอบแผนภูมิทางวิทยาศาสตร์ — Gemini 3.1 Pro 71.18 บน ChartQAPro เทียบกับ Intern-S2 71.12 เสมอกันจนถึงทศนิยมสองตำแหน่ง
• การรับรู้ระยะไกล — Gemini 3.1 Pro 54.27 บน XLRS-Bench เทียบกับ Intern-S2 51.38
• การตอบคำถามเชิงภาพทางจุลทรรศน์ — Gemini 3.1 Pro ได้ 71.02 บน MicroVQA เทียบกับ Intern-S2 ที่ 69.67
• งานด้านมัลติโมดัลเชิงวิทยาศาสตร์ — Intern-S2 60.74 บน SFE เทียบกับ Gemini 3.1 Pro 59.57 ชัยชนะด้านมัลติโมดัลเพียงหนึ่งเดียวของ Intern-S2
• ความรู้ทั่วไป — Gemini 3.1 Pro 91.00 บน MMLU Pro เทียบกับ Intern-S2 89.77
• คณิตศาสตร์ระดับมัธยมปลาย — Gemini 3.1 Pro 94.70 บน HMMT-2026 เทียบกับ Intern-S2 93.56
• การให้เหตุผลจากวรรณกรรมทางวิทยาศาสตร์ — Intern-S2 ได้ 55.71 บน Biology-Instructions เทียบกับ Gemini 3.1 Pro ที่ 13.87 และ 53.95 เทียบกับ 38.84 บน Mol-Instructions
• โจทย์โอลิมปิกวิทยาศาสตร์ — Intern-S2 87.00 บน FrontierScience-Olympiad เทียบกับ Gemini 3.1 Pro 79.00
• ความเชี่ยวชาญด้านเทอร์มินัล — Gemini 3.1 Pro 73.80 บน TerminalBench 2.1 เทียบกับ Intern-S2 64.04
การอ่านอย่างตรงไปตรงมา: Gemini 3.1 Pro ชนะแถวมัลติโมดัลแบบกว้างด้วยส่วนต่างที่แคบ Intern-S2 ชนะแถววรรณกรรมวิทยาศาสตร์เชิงลึกด้วยส่วนต่างมหาศาล และไม่มีผลลัพธ์ใดน่าประหลาดใจเมื่อพิจารณาจากสิ่งที่แต่ละตัวถูกฝึกมา ความแคบของความพ่ายแพ้ในหมวดมัลติโมดัลอาจกล่าวได้ว่าเป็นสิ่งที่ค้นพบที่น่าสนใจกว่า — เช็กพอยต์เปิดที่ออกวันเดียวกันซึ่งทำคะแนนห่างจากเรือธงแบบปิดอายุหกเดือนเพียงสองจุดบน MMMU Pro และ ChartQAPro ถือเป็นผลลัพธ์ที่แข็งแกร่งสำหรับ InternLM มากกว่าตัวเลขวิทยาศาสตร์ถล่มทลายใด ๆ ของมัน
บริบท ผลลัพธ์ และคำถามตัวอย่าง
เรื่องราวของอินพุตแบบยาวแยกออกจากกันได้อย่างชัดเจน Gemini 3.1 Pro มีหน้าต่างบริบทขนาด 1M โทเคน พร้อมเพดานเอาต์พุตที่ 64K — เพียงพอสำหรับชุดเอกสารยาวและคำตอบที่ครอบคลุม Intern-S2 ถูกประเมินที่สูงสุด 256K โทเคนสำหรับการให้เหตุผลด้านข้อความ และ 64K สำหรับมัลติโมดัล และไม่เปิดเผยเพดานเอาต์พุต ให้ถือว่าหน้าต่างที่ใช้งานได้ของมันเล็กกว่าของ Gemini จนกว่าจะมีใครวัดอย่างอิสระ
มีข้อควรระวังเชิงปฏิบัติการหนึ่งประการทางฝั่ง Google ที่ควรอยู่ในทุกการเปรียบเทียบที่ซื่อตรง Gemini 3.1 Pro ยังคงเป็นโมเดลพรีวิว ไม่ใช่รุ่น GA ที่เปิดใช้งานทั่วไป โมเดลพรีวิวมักมีความคาดหวังด้านความน่าเชื่อถือต่ำกว่า และแผงแสดงอัตราข้อผิดพลาด 7 วันบนหน้าโมเดลก็เป็นเครื่องเตือนอยู่เสมอให้เลือกเส้นทางหลบเลี่ยงความไม่เสถียร แทนที่จะสร้างเส้นทางวิกฤตไว้บนมัน Intern-S2 เป็นการเปิดตัวเต็มรูปแบบภายใต้ Apache-2.0 พร้อมเวตที่คุณปักหมุดได้ ซึ่งทำให้—อย่างขัดกับสัญชาตญาณ—โมเดลเปิดใหม่เอี่ยมนี้มีเสถียรภาพเชิงปฏิบัติการมากกว่าระหว่างสองตัวนี้ ในความหมายที่สำคัญที่สุด: ไม่มีใครสามารถเปลี่ยนมันจากใต้เท้าคุณได้
• บริบท — Intern-S2 ข้อความ 256K / มัลติโมดัล 64K ได้รับการประเมินเทียบกับ Gemini 3.1 Pro 1M โทเค็น
• อินพุต — Intern-S2: ข้อความ รูปภาพ อนุกรมเวลา เทียบกับ Gemini 3.1 Pro: ข้อความ รูปภาพ เสียง วิดีโอ
• น้ำหนักโมเดล — Intern-S2 Apache-2.0 ดาวน์โหลดได้ เทียบกับ Gemini 3.1 Pro ที่ปิด
• ความสมบูรณ์ของโมเดล — Intern-S2 เพิ่งเปิดตัวได้เพียงไม่กี่ชั่วโมง ยังไม่มีคะแนนการทดสอบอิสระเมื่อเทียบกับ Gemini 3.1 Pro preview นับตั้งแต่เดือนกุมภาพันธ์ 2026 แต่ได้รับการทดสอบอย่างหนักหน่วงและเป็นอิสระ
• ราคา — Intern-S2 ไม่มีตารางราคาสาธารณะ; โฮสต์เองหรือใช้ Intern API อย่างเป็นทางการ เทียบกับ Gemini 3.1 Pro $2.00 ต่อล้านโทเคนอินพุต / $12.00 ต่อล้านโทเคนเอาต์พุต, เพิ่มขึ้นเป็น $4.00/$18.00 เมื่อเกิน 200K โทเคนอินพุต

ราคาและแต่ละอันอยู่ที่ไหน
Gemini 3.1 Pro คิดค่าบริการ $2.00 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $12.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคนในระดับมาตรฐาน และจะขยับเป็น $4.00/$18.00 เมื่อคำขอใดคำขอหนึ่งมีโทเคนอินพุตเกิน 200K — เป็นค่าพรีเมียมสำหรับบริบทขนาดยาวที่กัดกินคุณพอดีตอนที่คุณใช้หน้าต่าง 1M ซึ่งเป็นเหตุผลที่ทำให้เลือกมันตั้งแต่แรก สามารถเลือกเส้นทาง (route) ผ่าน OrcaRouter ได้ในราคาตามรายการเดียวกันนี้ โดยส่งผ่านด้วยมาร์กอัป 0% บนคีย์ที่รองรับโมเดลอื่นๆ อีกกว่า 200 โมเดลด้วย การส่งผ่านราคามีความสำคัญตรงนี้ เพราะการปรับราคาของ Google จะตกมาถึงฝั่งเราในวันเดียวกัน แทนที่จะเป็นหลังรอบการปรับราคา ส่วนที่มีประโยชน์สำหรับการจับคู่ครั้งนี้โดยเฉพาะคือ DSL สำหรับการจัดเส้นทาง: คุณสามารถส่งงานภาพและวิดีโอไปที่ Gemini 3.1 Pro และส่งชุดเอกสารวิทยาศาสตร์ไปที่ Intern-S2 ที่โฮสต์เอง แล้วเก็บทั้งสองไว้หลังปลายทางเดียวโดยไม่ต้องมีสัญญาที่สองหรือแก้โค้ดเลย
Intern-S2 ไม่มีราคา API ที่เผยแพร่ การโฮสต์เวต Apache-2.0 ด้วยตนเองคือเส้นทางที่ทีมส่วนใหญ่จะทำจริง และด้วยพารามิเตอร์ 403B มันเป็นการลงทุนด้านฮาร์ดแวร์อย่างแท้จริง Intern API อย่างเป็นทางการมีไว้สำหรับทีมที่ไม่อยากรัน GPU เอง แต่หากไม่มีตารางราคาสาธารณะ การเปรียบเทียบต้นทุนกับ $2/$12 ของ Gemini ก็ไม่ใช่เรื่องที่คุณจะทำได้บนกระดาษ — คุณต้องขอโควตาและคำนวณด้วยตัวเอง

การโทร
เลือก Gemini 3.1 Pro หากคุณต้องการโมเดลมัลติโมดัลเอนกประสงค์ที่รับได้ทั้งเสียงและวิดีโอ รองรับหนึ่งล้านโทเค็น ผ่านการตรวจสอบจากอิสระมาหลายเดือน และสามารถเช่าแบบจ่ายตามโทเค็นได้แล้ววันนี้ มันเป็นโมเดลที่มีหลักฐานหนุนแน่นหนากว่าและมีความสามารถครอบคลุมกว้างกว่า และป้าย preview นั้นเป็นข้อควรระวังด้านความน่าเชื่อถือ ไม่ใช่ด้านความสามารถ
เลือก Intern-S2 หากข้อมูลนำเข้าแบบหลายรูปแบบของคุณเป็นเรื่องทางวิทยาศาสตร์ และข้อมูลของคุณไม่สามารถออกจากโครงสร้างพื้นฐานของคุณได้ มันเป็นเพียงตัวเดียวในสองตัวนี้ที่อ่านหน้าเอกสารวรรณกรรมดิบได้โดยตรง พยากรณ์จากสัญญาณอนุกรมเวลา และสามารถปรับละเอียดด้วยข้อมูลการทดลองที่เป็นกรรมสิทธิ์ภายใต้สัญญาอนุญาตแบบเปิดกว้าง ยอมรับว่าคุณเป็นคนแรกที่รันมัน และตาราง benchmark ที่สนับสนุนมันนั้นถูกเขียนโดยคนที่สร้างมันขึ้นมา

ไม่มีโมเดลใดชนะอย่างเด็ดขาด และตารางพิสูจน์เรื่องนี้ได้ดีกว่าคำชี้ขาดใด ๆ จะทำได้ โมเดลหนึ่งเป็นแบบอเนกประสงค์ที่บังเอิญเก่งด้านวิทยาศาสตร์ ส่วนอีกโมเดลเป็นเครื่องมือทางวิทยาศาสตร์ที่บังเอิญสามารถแข่งขันได้ในงานมัลติโมดัลทั่วไป — และในการเปิดตัวแบบเปิดในวันเดียวกัน คำว่า "แข่งขันได้" คือผลลัพธ์ที่น่าประหลาดใจกว่า
เพื่อให้ได้ทั้งสองด้านของการเปรียบเทียบนี้โดยไม่ต้องมีสัญญาฉบับที่สอง: คีย์ API หนึ่งคีย์ที่ครอบคลุมโมเดลมากกว่า 200 รายการ รวมโมเดลเรือธงมัลติโมดัลแบบปิดและทางเลือกอื่นทุกทางไว้หลังเอนด์พอยต์เดียว คุณจึงกำหนดเส้นทางงานด้านภาพและวิดีโอไปทางหนึ่ง และงานเอกสารแบบเป็นชุดอีกทางหนึ่ง
