การ์ดฮีโร่ที่สร้างขึ้นเพื่อเปรียบเทียบ Intern-S2 กับ Gemini 3.1 Pro โดยแสดงหน้าตัวอย่างทางวิทยาศาสตร์และแผนภูมิที่ป้อนเข้าสู่โมเดลมัลติโมดัลทางด้านซ้าย และไอคอนอินพุตสี่แบบสำหรับรูปภาพ เสียง วิดีโอ และข้อความ ล้อมรอบการ์ด API แบบปิดทางด้านขวา มีป้ายกำกับด้วยความแตกต่างระหว่างมัลติโมดัลลิตี้ทางวิทยาศาสตร์แบบ Apache-2.0 กับเรือธงมัลติโมดัลแบบทั่วไปแบบปิดที่มีบริบท 1M พร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Intern-S2 vs Gemini 3.1 Pro: การประลองมัลติโมดัลที่ InternLM วัดผลจริง

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

การเปรียบเทียบส่วนใหญ่ในซีรีส์นี้ต้องปะติดปะต่อคำกล่าวอ้างของผู้ขายสองรายเข้าด้วยกัน รายการนี้ไม่ต้อง Intern-S2 โมเดลมัลติโมดัล Apache-2.0 ขนาด 397 พันล้านพารามิเตอร์ที่ InternLM เปิดตัววันนี้ และ Gemini 3.1 Pro โมเดลใช้เหตุผลเรือธงของ Google ต่างปรากฏเป็นคอลัมน์ที่วัดค่าแล้วในตาราง benchmark เดียวกัน — ซึ่งทำให้สิ่งนี้เป็นการเทียบแบบตัวต่อตัวที่ยุติธรรมที่สุดในชุดนี้ และไม่ใช่เรื่องบังเอิญที่มันเป็นรายการที่โมเดลเปิดมีเรื่องต้องตอบมากที่สุด Gemini 3.1 Pro อ่านข้อความ รูปภาพ เสียง และวิดีโอ รองรับบริบท 1 ล้านโทเคน และถูกแล็บอิสระกับทราฟฟิกการใช้งานจริงตรวจสอบอย่างหนัก นับตั้งแต่เข้าสู่ช่วงพรีวิวเมื่อวันที่ 19 กุมภาพันธ์ 2026 Intern-S2 อ่านข้อความ รูปภาพ และอนุกรมเวลา ถูกอัปโหลดขึ้น Hugging Face เมื่อเช้านี้ และไม่มีคะแนนจากบุคคลที่สามใด ๆ เลย ในแถวที่ทั้งสองถูกวัด โมเดลของ Google ชนะในแถวเหล่านั้นมากกว่าที่ไม่ชนะ

ทั้งคู่อ่านภาพได้ นั่นคือจุดที่ความคล้ายคลึงกันสิ้นสุดลง

คำว่า "หลายรูปแบบ" ทำให้โมเดลเหล่านี้ดูเหมือนอยู่ในระดับเดียวกัน พวกมันไม่ได้อยู่ในระดับเดียวกัน และความแตกต่างอยู่ที่สิ่งที่แต่ละตัวถูกสร้างขึ้นมาให้มอง

เส้นทางการมองเห็นของ Intern-S2 ได้รับการฝึกให้ประมวลผลหน้าต้นฉบับของวรรณกรรมทางวิทยาศาสตร์ — รูปภาพ สมการ แผนภาพโครงสร้าง เลย์เอาต์ — เป็นตัวแทนที่ใช้ร่วมกันเพียงหนึ่งเดียว แทนที่จะแยกวิเคราะห์ข้อความออกมาก่อน เกณฑ์มาตรฐานแบบหลายรูปแบบของมันเป็นทางวิทยาศาสตร์: VQA ด้านจุลทรรศน์ทางชีววิทยา การรับรู้ระยะไกล การตอบคำถามจากแผนภูมิทางวิทยาศาสตร์ นอกจากนี้ยังรับข้อมูลอนุกรมเวลาและสามารถสร้างการคาดการณ์ ซึ่งเป็นประเภทอินพุตที่แทบไม่มีโมเดลเรือธงทั่วไปใดรองรับเลย

ความสามารถมัลติโมดัลของ Gemini 3.1 Pro นั้นเป็นแบบอเนกประสงค์และกว้างขวางหลากหลายประเภทกว่า นั่นคือ ข้อความ รูปภาพ เสียง และวิดีโอ ในโมเดลเดียว โดยมุ่งเป้าไปที่งานในสายการผลิตทุกรูปแบบที่คุณชี้โมเดลไปที่ไฟล์แล้วถามคำถาม บันทึกการประชุม ภาพหน้าจอ UI แผนภูมิในไฟล์ PDF คลิปวิดีโอ — ล้วนอยู่ในขอบเขตที่ใช้ได้ทั้งหมด และทั้งหมดล้วนผ่านการประเมินแบบสาธารณะมาแล้วหกเดือน

ถ้าอินพุตของคุณเป็นภาพทางวิทยาศาสตร์ Intern-S2 ถูกสร้างขึ้นมาเพื่อสิ่งนี้โดยเฉพาะ และมีตัวเลขจากผู้ขายมาสนับสนุนจุดยืนของตน ถ้าอินพุตของคุณเป็นอย่างอื่น Gemini 3.1 Pro รองรับเสียงและวิดีโอ ส่วน Intern-S2 ไม่รองรับทั้งสองอย่าง สิ่งนี้ช่วยคลี่คลายคำถาม "ควรใช้ตัวไหน" ได้เป็นจำนวนมาก ก่อนที่ราคาหรือเบนช์มาร์กจะเข้ามาเกี่ยวข้อง และใครก็ตามที่บอกคุณว่าทั้งสองใช้แทนกันได้ แสดงว่ายังไม่ได้อ่านรายการอินพุต

สิ่งที่ตารางที่แชร์แสดงให้เห็น เมื่ออ่านอย่างตรงไปตรงมา

เนื่องจาก InternLM ได้ benchmark ทั้งสองตัว นี่จึงเป็นหนึ่งในไม่กี่จุดที่การเปรียบเทียบโดยตรงถือว่าชอบธรรม มากกว่าจะเป็นการนำข้อมูลมาต่อประกอบกัน ข้อแม้ยังคงเดิมและควรกล่าวไว้สักครั้ง: ตัวเลขทุกตัวของ Intern-S2 เป็นข้อมูลที่ผู้ขายรายงานเอง โดย InternLM เป็นผู้รันบนฮาร์เนสของตนเองผ่าน OpenCompass, VLMEvalKit และ AgentCompass โดยไม่มีการทำซ้ำอย่างอิสระ ตัวเลขของ Gemini ในตารางนั้นก็มาจากการรันการเปรียบเทียบของ InternLM เช่นกัน แม้ว่า Gemini จะมีบันทึกอิสระที่กว้างขวางอยู่นอกเหนือจากการรันนั้น

• ความรู้แบบหลายรูปแบบ — Gemini 3.1 Pro 83.99 บน MMMU Pro เทียบกับ Intern-S2 81.68

• การถามตอบแผนภูมิทางวิทยาศาสตร์ — Gemini 3.1 Pro 71.18 บน ChartQAPro เทียบกับ Intern-S2 71.12 เสมอกันจนถึงทศนิยมสองตำแหน่ง

• การรับรู้ระยะไกล — Gemini 3.1 Pro 54.27 บน XLRS-Bench เทียบกับ Intern-S2 51.38

• การตอบคำถามเชิงภาพทางจุลทรรศน์ — Gemini 3.1 Pro ได้ 71.02 บน MicroVQA เทียบกับ Intern-S2 ที่ 69.67

• งานด้านมัลติโมดัลเชิงวิทยาศาสตร์ — Intern-S2 60.74 บน SFE เทียบกับ Gemini 3.1 Pro 59.57 ชัยชนะด้านมัลติโมดัลเพียงหนึ่งเดียวของ Intern-S2

• ความรู้ทั่วไป — Gemini 3.1 Pro 91.00 บน MMLU Pro เทียบกับ Intern-S2 89.77

• คณิตศาสตร์ระดับมัธยมปลาย — Gemini 3.1 Pro 94.70 บน HMMT-2026 เทียบกับ Intern-S2 93.56

• การให้เหตุผลจากวรรณกรรมทางวิทยาศาสตร์ — Intern-S2 ได้ 55.71 บน Biology-Instructions เทียบกับ Gemini 3.1 Pro ที่ 13.87 และ 53.95 เทียบกับ 38.84 บน Mol-Instructions

• โจทย์โอลิมปิกวิทยาศาสตร์ — Intern-S2 87.00 บน FrontierScience-Olympiad เทียบกับ Gemini 3.1 Pro 79.00

• ความเชี่ยวชาญด้านเทอร์มินัล — Gemini 3.1 Pro 73.80 บน TerminalBench 2.1 เทียบกับ Intern-S2 64.04

การอ่านอย่างตรงไปตรงมา: Gemini 3.1 Pro ชนะแถวมัลติโมดัลแบบกว้างด้วยส่วนต่างที่แคบ Intern-S2 ชนะแถววรรณกรรมวิทยาศาสตร์เชิงลึกด้วยส่วนต่างมหาศาล และไม่มีผลลัพธ์ใดน่าประหลาดใจเมื่อพิจารณาจากสิ่งที่แต่ละตัวถูกฝึกมา ความแคบของความพ่ายแพ้ในหมวดมัลติโมดัลอาจกล่าวได้ว่าเป็นสิ่งที่ค้นพบที่น่าสนใจกว่า — เช็กพอยต์เปิดที่ออกวันเดียวกันซึ่งทำคะแนนห่างจากเรือธงแบบปิดอายุหกเดือนเพียงสองจุดบน MMMU Pro และ ChartQAPro ถือเป็นผลลัพธ์ที่แข็งแกร่งสำหรับ InternLM มากกว่าตัวเลขวิทยาศาสตร์ถล่มทลายใด ๆ ของมัน

บริบท ผลลัพธ์ และคำถามตัวอย่าง

เรื่องราวของอินพุตแบบยาวแยกออกจากกันได้อย่างชัดเจน Gemini 3.1 Pro มีหน้าต่างบริบทขนาด 1M โทเคน พร้อมเพดานเอาต์พุตที่ 64K — เพียงพอสำหรับชุดเอกสารยาวและคำตอบที่ครอบคลุม Intern-S2 ถูกประเมินที่สูงสุด 256K โทเคนสำหรับการให้เหตุผลด้านข้อความ และ 64K สำหรับมัลติโมดัล และไม่เปิดเผยเพดานเอาต์พุต ให้ถือว่าหน้าต่างที่ใช้งานได้ของมันเล็กกว่าของ Gemini จนกว่าจะมีใครวัดอย่างอิสระ

มีข้อควรระวังเชิงปฏิบัติการหนึ่งประการทางฝั่ง Goog​le ที่ควรอยู่ในทุกการเปรียบเทียบที่ซื่อตรง Gemini 3.1 Pro ยังคงเป็นโมเดลพรีวิว ไม่ใช่รุ่น GA ที่เปิดใช้งานทั่วไป โมเดลพรีวิวมักมีความคาดหวังด้านความน่าเชื่อถือต่ำกว่า และแผงแสดงอัตราข้อผิดพลาด 7 วันบนหน้าโมเดลก็เป็นเครื่องเตือนอยู่เสมอให้เลือกเส้นทางหลบเลี่ยงความไม่เสถียร แทนที่จะสร้างเส้นทางวิกฤตไว้บนมัน Intern-S2 เป็นการเปิดตัวเต็มรูปแบบภายใต้ Apache-2.0 พร้อมเวตที่คุณปักหมุดได้ ซึ่งทำให้—อย่างขัดกับสัญชาตญาณ—โมเดลเปิดใหม่เอี่ยมนี้มีเสถียรภาพเชิงปฏิบัติการมากกว่าระหว่างสองตัวนี้ ในความหมายที่สำคัญที่สุด: ไม่มีใครสามารถเปลี่ยนมันจากใต้เท้าคุณได้

• บริบท — Intern-S2 ข้อความ 256K / มัลติโมดัล 64K ได้รับการประเมินเทียบกับ Gemini 3.1 Pro 1M โทเค็น

• อินพุต — Intern-S2: ข้อความ รูปภาพ อนุกรมเวลา เทียบกับ Gemini 3.1 Pro: ข้อความ รูปภาพ เสียง วิดีโอ

• น้ำหนักโมเดล — Intern-S2 Apache-2.0 ดาวน์โหลดได้ เทียบกับ Gemini 3.1 Pro ที่ปิด

• ความสมบูรณ์ของโมเดล — Intern-S2 เพิ่งเปิดตัวได้เพียงไม่กี่ชั่วโมง ยังไม่มีคะแนนการทดสอบอิสระเมื่อเทียบกับ Gemini 3.1 Pro preview นับตั้งแต่เดือนกุมภาพันธ์ 2026 แต่ได้รับการทดสอบอย่างหนักหน่วงและเป็นอิสระ

• ราคา — Intern-S2 ไม่มีตารางราคาสาธารณะ; โฮสต์เองหรือใช้ Intern API อย่างเป็นทางการ เทียบกับ Gemini 3.1 Pro $2.00 ต่อล้านโทเคนอินพุต / $12.00 ต่อล้านโทเคนเอาต์พุต, เพิ่มขึ้นเป็น $4.00/$18.00 เมื่อเกิน 200K โทเคนอินพุต

A generated two-column scoreboard titled 'Intern-S2 vs Gemini 3.1 Pro — the scoreboard.' Left column Intern-S2-397B lists Weights Apache-2.0, Context 256K text / 64K multimodal, Inputs text image time series, Independent score none yet, Price self-host or Intern API, MMMU Pro 81.68. Right column Gemini 3.1 Pro lists Weights closed, Context 1M in / 64K out, Inputs text image audio video, Independent score 57 at launch on the then-current scale, Price $2.00 / $12.00 per 1M, MMMU Pro 83.99. Footer reads 'Intern-S2 figures are InternLM's own, unreproduced; both MMMU Pro rows as measured in InternLM's comparison table. Gemini 3.1 Pro figures per Google and independent trackers.'

ราคาและแต่ละอันอยู่ที่ไหน

Gemini 3.1 Pro คิดค่าบริการ $2.00 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $12.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคนในระดับมาตรฐาน และจะขยับเป็น $4.00/$18.00 เมื่อคำขอใดคำขอหนึ่งมีโทเคนอินพุตเกิน 200K — เป็นค่าพรีเมียมสำหรับบริบทขนาดยาวที่กัดกินคุณพอดีตอนที่คุณใช้หน้าต่าง 1M ซึ่งเป็นเหตุผลที่ทำให้เลือกมันตั้งแต่แรก สามารถเลือกเส้นทาง (route) ผ่าน OrcaRouter ได้ในราคาตามรายการเดียวกันนี้ โดยส่งผ่านด้วยมาร์กอัป 0% บนคีย์ที่รองรับโมเดลอื่นๆ อีกกว่า 200 โมเดลด้วย การส่งผ่านราคามีความสำคัญตรงนี้ เพราะการปรับราคาของ Google จะตกมาถึงฝั่งเราในวันเดียวกัน แทนที่จะเป็นหลังรอบการปรับราคา ส่วนที่มีประโยชน์สำหรับการจับคู่ครั้งนี้โดยเฉพาะคือ DSL สำหรับการจัดเส้นทาง: คุณสามารถส่งงานภาพและวิดีโอไปที่ Gemini 3.1 Pro และส่งชุดเอกสารวิทยาศาสตร์ไปที่ Intern-S2 ที่โฮสต์เอง แล้วเก็บทั้งสองไว้หลังปลายทางเดียวโดยไม่ต้องมีสัญญาที่สองหรือแก้โค้ดเลย

Intern-S2 ไม่มีราคา API ที่เผยแพร่ การโฮสต์เวต Apache-2.0 ด้วยตนเองคือเส้นทางที่ทีมส่วนใหญ่จะทำจริง และด้วยพารามิเตอร์ 403B มันเป็นการลงทุนด้านฮาร์ดแวร์อย่างแท้จริง Intern API อย่างเป็นทางการมีไว้สำหรับทีมที่ไม่อยากรัน GPU เอง แต่หากไม่มีตารางราคาสาธารณะ การเปรียบเทียบต้นทุนกับ $2/$12 ของ Gemini ก็ไม่ใช่เรื่องที่คุณจะทำได้บนกระดาษ — คุณต้องขอโควตาและคำนวณด้วยตัวเอง

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence badge, the tags image-text-to-text and qwen3_5_moe, the model size of 403B parameters in BF16/F32, the Intern-S2-397B heading, an inference providers panel reading 'This model isn't deployed by any Inference Provider,' and the collection listing nine items.

การโทร

เลือก Gemini 3.1 Pro หากคุณต้องการโมเดลมัลติโมดัลเอนกประสงค์ที่รับได้ทั้งเสียงและวิดีโอ รองรับหนึ่งล้านโทเค็น ผ่านการตรวจสอบจากอิสระมาหลายเดือน และสามารถเช่าแบบจ่ายตามโทเค็นได้แล้ววันนี้ มันเป็นโมเดลที่มีหลักฐานหนุนแน่นหนากว่าและมีความสามารถครอบคลุมกว้างกว่า และป้าย preview นั้นเป็นข้อควรระวังด้านความน่าเชื่อถือ ไม่ใช่ด้านความสามารถ

เลือก Intern-S2 หากข้อมูลนำเข้าแบบหลายรูปแบบของคุณเป็นเรื่องทางวิทยาศาสตร์ และข้อมูลของคุณไม่สามารถออกจากโครงสร้างพื้นฐานของคุณได้ มันเป็นเพียงตัวเดียวในสองตัวนี้ที่อ่านหน้าเอกสารวรรณกรรมดิบได้โดยตรง พยากรณ์จากสัญญาณอนุกรมเวลา และสามารถปรับละเอียดด้วยข้อมูลการทดลองที่เป็นกรรมสิทธิ์ภายใต้สัญญาอนุญาตแบบเปิดกว้าง ยอมรับว่าคุณเป็นคนแรกที่รันมัน และตาราง benchmark ที่สนับสนุนมันนั้นถูกเขียนโดยคนที่สร้างมันขึ้นมา

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro at orcarouter.ai/models/google/gemini-3.1-pro-preview, captured September 13, 2026, showing the model tagged FLAGSHIP and FEATURED by Google dated 2026-02-19 with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context window and 65K max output, and pricing tiles reading input $2.00 and output $12.00 per 1M tokens.

ไม่มีโมเดลใดชนะอย่างเด็ดขาด และตารางพิสูจน์เรื่องนี้ได้ดีกว่าคำชี้ขาดใด ๆ จะทำได้ โมเดลหนึ่งเป็นแบบอเนกประสงค์ที่บังเอิญเก่งด้านวิทยาศาสตร์ ส่วนอีกโมเดลเป็นเครื่องมือทางวิทยาศาสตร์ที่บังเอิญสามารถแข่งขันได้ในงานมัลติโมดัลทั่วไป — และในการเปิดตัวแบบเปิดในวันเดียวกัน คำว่า "แข่งขันได้" คือผลลัพธ์ที่น่าประหลาดใจกว่า

เพื่อให้ได้ทั้งสองด้านของการเปรียบเทียบนี้โดยไม่ต้องมีสัญญาฉบับที่สอง: คีย์ API หนึ่งคีย์ที่ครอบคลุมโมเดลมากกว่า 200 รายการ รวมโมเดลเรือธงมัลติโมดัลแบบปิดและทางเลือกอื่นทุกทางไว้หลังเอนด์พอยต์เดียว คุณจึงกำหนดเส้นทางงานด้านภาพและวิดีโอไปทางหนึ่ง และงานเอกสารแบบเป็นชุดอีกทางหนึ่ง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube