
Grok 4.7 กับ Gemini 3.1 Pro: ลีดเดอร์บอร์ดขยับ แต่ตัวโมเดลไม่ได้เปลี่ยน
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
เมื่อวันที่ 19 กุมภาพันธ์ 2026 Artificial Analysis ได้เผยแพร่บทความพาดหัวว่า “Gemini 3.1 Pro Preview: ผู้นำคนใหม่แห่งวงการ AI” โดยโมเดลนี้เป็นที่หนึ่งในการประเมิน 6 จาก 10 รายการ และทิ้งห่าง Claude Opus 4.6 อยู่ 4 คะแนน หากเปิดหน้าของโมเดลเดียวกันนั้นในวันนี้ ตัวเลขกลับเป็น 30 อยู่อันดับที่ 69 จาก 200 ผู้ให้บริการไม่ได้เปลี่ยนแปลงอะไรเลย สิ่งที่เปลี่ยนไปคือไม้บรรทัดวัด: Artificial Analysis ได้ปรับ Intelligence Index เป็น v4.3.2 เมื่อวันที่ 19 กันยายน 2026 โดยให้คะแนนโมเดลทุกตัวในแค็ตตาล็อกใหม่เทียบกับชุดการประเมินที่แตกต่างออกไป และผู้นำของเดือนกุมภาพันธ์ก็กลายเป็นผู้อยู่กลางตารางของเดือนกันยายน ในขณะที่ตัวโมเดลเองยังคงอยู่ในพรีวิวโดยไม่ถูกแตะต้อง นั่นคือฉากหลังสำหรับการเปรียบเทียบกับ Grok 4.7 — ซึ่งผู้ให้บริการเปิดตัวเมื่อวันที่ 21 กันยายน 2026 — และเป็นเหตุผลว่าทำไมการจับคู่นี้จึงไม่ค่อยเกี่ยวกับว่าโมเดลไหนฉลาดกว่า แต่เกี่ยวกับว่าสองตัวนี้ ตัวไหนที่คุณยังไว้ใจได้ว่าจะเป็นสิ่งเดียวกันในเดือนหน้า
แต่ละสิ่งเหล่านี้จริง ๆ แล้วคืออะไร
Gemini 3.1 Pro เป็นโมเดลระดับ Pro รุ่นใหม่ล่าสุดของ Google และยังไม่เคยเปิดให้ใช้งานทั่วไปเลย โดยเปิดตัวในชื่อ gemini-3.1-pro-preview เมื่อวันที่ 19 กุมภาพันธ์ 2026 และตารางการเลิกใช้งานของ Google ยังคงระบุว่ามันมี "ยังไม่ประกาศวันปิดให้บริการ" — พรีวิวที่ตอนนี้อยู่ในสถานะพรีวิวมาเจ็ดเดือนแล้ว ในขณะที่ Google ปล่อยโมเดลตระกูล Flash ต่อเนื่องกันลงมาใต้รุ่นนี้: 3.5 Flash ในเดือนพฤษภาคม, 3.6 ในเดือนกรกฎาคม, 3.7 ในเดือนสิงหาคม, 3.8 ในเดือนกันยายน ไม่มีโมเดล Pro ที่พร้อมใช้งานทั่วไปรุ่นใดใหม่กว่า Gemini 3 Pro มันมีความยาวหน้าต่างอินพุต 1,048,576 โทเคน และเพดานเอาต์พุต 65,536 โทเคน รับข้อความ รูปภาพ วิดีโอ เสียง และ PDF เข้า โดยส่งออกเป็นข้อความ และมีตัวควบคุมระดับการคิดที่ต่ำ ปานกลาง และสูง โดยไม่มีพารามิเตอร์ด้านงบประมาณ และไม่มีการตั้งค่า minimal น้ำหนักโมเดลเป็นแบบปิด
Grok 4.7 เปิดตัวมาได้หนึ่งวันและเป็นแบบปิดน้ำหนักเช่นกัน รองรับคอนเท็กซ์ 500k โทเคน — ครึ่งหนึ่งของ Gemini — และรับข้อความกับภาพเข้าได้ จึงไม่สามารถรับวิดีโอหรือเสียงได้เลย ซึ่งเป็นความแตกต่างด้านความสามารถที่ชัดเจนที่สุดในการเปรียบเทียบนี้ ราคาอยู่ที่ 2.00 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ 6.00 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน เมื่อพรอมป์ต่ำกว่า 200k โทเคน และเพิ่มเป็น 4.00 และ 12.00 ดอลลาร์เมื่อเกินเส้นนั้น โดยการอ่านจากแคชอยู่ที่ 0.50 และ 1.00 ดอลลาร์ xAI ยังระบุเวอร์ชันที่เร็วกว่าโดยมีความเร็วเอาต์พุตประมาณสองเท่าและราคาสองเท่า ไม่มีการเผยแพร่ตัวเลขเอาต์พุตสูงสุดสำหรับโมเดลนี้ในเอกสารที่ตรวจสอบในที่นี้
ผู้ปกครองขยับแล้ว นั่นคือเรื่องราว
ปัจจุบันทั้งสองโมเดลได้รับการให้คะแนนบน Artificial Analysis Intelligence Index v4.3.2 ซึ่งแทนที่ Terminal-Bench 2.1 ด้วย Terminal-Bench 4.0 และแทนที่ tau3-Banking ด้วย AutomationBench-AA รวมทั้งปรับจุดยึดใหม่ให้กับสเกล Elo ของ GDPval-AA คะแนนของทุกโมเดลเปลี่ยนแปลงเมื่อดัชนีนี้เปิดตัว คะแนนของ Gemini 3.1 Pro ขยับไปไกลกว่าของโมเดลส่วนใหญ่ เพราะจุดแข็งในเดือนกุมภาพันธ์ของมันกระจุกตัวอยู่ในการประเมินที่ดัชนีใหม่นี้ยกเลิกไปหรือถ่วงน้ำหนักใหม่ เมื่ออ่านสองคอลัมน์วางเทียบกันในวันนี้:
• คอมโพสิต — Grok 4.7 (xhigh): 46 บน Artificial Analysis Intelligence Index v4.3.2. Gemini 3.1 Pro Preview: 30 บนเวอร์ชันเดียวกัน จัดอันดับที่ 69 จาก 200.
• บริบทขนาดยาว — Grok 4.7: หน้าต่าง 500k, AA-LCR v1.1 77% Gemini 3.1 Pro: หน้าต่าง 1M — ใหญ่กว่าเป็นสองเท่า — และเพดานเอาต์พุต 65K ซึ่งคิดเป็นประมาณครึ่งหนึ่งของสิ่งที่เซสชันแบบเอเจนต์ที่ใช้บริบทขนาดยาวมักต้องใช้
• รูปแบบอินพุต — Grok 4.7: ข้อความและรูปภาพ Gemini 3.1 Pro: ข้อความ รูปภาพ วิดีโอ เสียง และ PDF ไม่ใช่เรื่องใกล้เคียง และไม่ใช่ช่องว่างจากเกณฑ์มาตรฐาน — แต่เป็นช่องว่างด้านความสามารถ
• ความเร็ว — Grok 4.7: ยังไม่มีผลการวัดที่เผยแพร่ Gemini 3.1 Pro: 124.4 โทเคนเอาต์พุตต่อวินาที จัดอันดับที่ 39 จาก 200 โดยใช้เวลา 63.62 วินาทีถึงโทเคนแรกผ่าน Google AI Studio
• ราคา ระดับมาตรฐาน — Grok 4.7: $2.00 ขาเข้า / $6.00 ขาออก ต่อ 1M. Gemini 3.1 Pro: $2.00 ขาเข้า / $12.00 ขาออก. อินพุตเท่ากัน แต่เอาต์พุตเป็นสองเท่า
• ราคา, ระดับบริบทแบบยาว — Grok 4.7: เพิ่มเป็นสองเท่าเป็น $4.00 / $12.00 ที่ 200k โทเค็นพรอมป์ต์ Gemini 3.1 Pro: ปรับขึ้นเป็น $4.00 / $18.00 ที่ขอบเขต 200k เดียวกัน อินพุตเดียวกัน เอาต์พุตมากกว่า 50%
• ระดับความสมบูรณ์ — Grok 4.7: เพิ่งเปิดตัวได้หนึ่งวัน ผลทดสอบจากผู้ขายส่วนใหญ่ยังไม่ถูกนำมาทำซ้ำเพื่อยืนยัน Gemini 3.1 Pro: อยู่ในตลาดมาเจ็ดเดือนแล้ว แต่ยังเป็นเวอร์ชันพรีวิว โดยไม่มีการรับปากว่าจะเปิดให้บริการทั่วไป (GA) และไม่มีกำหนดปิดให้บริการ

ตอนนี้ปัญหาพรีวิวกลายเป็นเรื่องจริงจังแล้ว
การพรีวิวเป็นเวลาเจ็ดเดือนถือเป็นเรื่องแปลกประหลาดมากกว่าความเสี่ยง หากไม่มีอะไรผิดพลาดเกิดขึ้น แต่มีบางอย่างเกิดขึ้นแล้ว ตั้งแต่วันที่ 18 กันยายน 2026 ผู้ใช้เริ่มรายงานว่า Gemini 3.1 Pro หายไปจากตัวเลือกโมเดลใน AI Studio และ ณ ขณะที่เขียนนี้ ยังไม่มีการตอบกลับจากพนักงาน Google ไม่มีประกาศเลิกใช้งาน และไม่มีสาเหตุที่ระบุไว้ — เป็นเหตุการณ์ความพร้อมใช้งานที่ยังไม่คลี่คลายมากกว่าการปลดระวางที่ยืนยันแล้ว เมื่อเทียบกับประวัติการประกาศ: Google กล่าวที่งาน I/O ในเดือนพฤษภาคม 2026 ว่า Gemini 3.5 Pro กำลัง "เปิดตัวในเดือนหน้า" และรายงานข่าวในช่วงปลายเดือนสิงหาคมกล่าวว่าโมเดลนั้นถูกยกเลิกไปแล้วเนื่องจากตัวเลือกภายใน "ไม่ได้ดีพอเมื่อเทียบกับซีรีส์ Flash" หน้า Pro ของ Google เองยังคงโฆษณาว่า "3.5 Pro เร็ว ๆ นี้" ซึ่งเป็นความขัดแย้งที่เห็นได้ในหน้าเดียว ไม่ว่าผลลัพธ์จะเป็นอย่างไร การตีความในทางปฏิบัติก็คือ Gemini 3.1 Pro เป็นปลายทางพรีวิวที่ไม่มีวันที่ GA ไม่มีผู้สืบทอดที่ระบุชื่อ และมีเครื่องหมายคำถามเกี่ยวกับความพร้อมใช้งานในปัจจุบัน
ความเสี่ยงของ Grok 4.7 เป็นภาพสะท้อนตรงกันข้าม และเล็กกว่าในเชิงประเภท มันเพิ่งมีอายุได้หนึ่งวัน ตัวเลขของมันจึงยังบาง — Artificial Analysis ยังไม่ได้เผยแพร่การวัดความเร็วหรือความหน่วง และชุดทดสอบ benchmark ของ xAI เองสำหรับโมเดลนี้ก็ยังไม่ได้รับการทำซ้ำอย่างอิสระ สิ่งที่ไม่เป็นข้อกังขาคือ โมเดลนี้พร้อมใช้งานทั่วไป ตั้งราคาไว้ มีเอกสารประกอบ และมีตัวตนที่มั่นคง โมเดลที่ตัวตนมั่นคงแต่ตัวเลขยังไม่ได้รับการพิสูจน์นั้น เป็นสิ่งที่ต่อยอดได้ง่ายกว่ามาก เมื่อเทียบกับโมเดลที่ตัวเลขได้รับการเผยแพร่แล้ว แต่ความพร้อมใช้งานกลับไม่แน่นอน
สิ่งที่การแยกต้องแลกมา ในทางปฏิบัติ
สมมติว่าคุณกำลังเลือกสำหรับไปป์ไลน์เอกสาร ด้วยอินพุต 100k โทเค็นและเอาต์พุต 8k Grok 4.7 มีค่าใช้จ่าย $0.20 สำหรับอินพุต และ $0.048 สำหรับเอาต์พุต — ประมาณหนึ่งในสี่ Gemini 3.1 Pro มีค่าใช้จ่าย $0.20 สำหรับอินพุต และ $0.096 สำหรับเอาต์พุต — ประมาณสามสิบเซนต์ ทั้งสองตัวห่างกันไม่เกินยี่สิบเปอร์เซ็นต์ และถ้าเอกสารของคุณเป็นสแกน PDF เสียง หรือวิดีโอ Gemini เป็นเพียงตัวเดียวในสองตัวนี้ที่อ่านมันได้เลย นั่นไม่ใช่ข้อโต้แย้งเรื่อง benchmark มันยุติการเปรียบเทียบสำหรับภาระงานนั้น
ตอนนี้สมมติว่าคุณกำลังเลือกสำหรับเอเจนต์ที่ใช้บริบทยาว ที่อินพุต 300k และเอาต์พุต 8k Grok 4.7 มีค่าใช้จ่าย $1.20 สำหรับอินพุต และ $0.096 สำหรับเอาต์พุต รวมประมาณ $1.30 ส่วน Gemini 3.1 Pro มีค่าใช้จ่าย $1.20 สำหรับอินพุต และ $0.144 สำหรับเอาต์พุต รวมประมาณ $1.35 แทบจะไม่ต่างกันเลย และในจุดนี้ หน้าต่าง 1M ของ Gemini กับเพดานเอาต์พุต 65K กลายเป็นข้อจำกัดที่ตัดสินผล เพราะเพดาน 65K คือจุดที่การรันเอเจนต์แบบยาว ๆ ไปไม่รอด ทั้งสองโมเดลไม่ใช่ตัวเลือกราคาถูกในการเทียบครั้งนี้ และทั้งคู่ก็ไม่แพงเมื่อเทียบมาตรฐานโมเดลระดับแนวหน้า

การกำหนดเส้นทางอ้อมเป้าหมายที่เคลื่อนที่
OrcaRouter ให้บริการ Gemini 3.1 Pro โดยแสดงไว้ในหน้าของโมเดลนั้นเองในราคาตามที่ผู้ให้บริการกำหนด — ขาเข้า $2.00 และขาออก $12.00 พร้อมหน้าต่างบริบท 1M และเอาต์พุตสูงสุด 65k — เพราะเราส่งต่อราคาตามที่ผู้ให้บริการประกาศไว้โดยไม่บวกเพิ่ม 0% ในกรณีแบบนี้มันไม่ใช่คำโฆษณา: Google มีบิลด์พรีวิวที่ยังไม่กำหนดระยะเวลาให้บริการ ซึ่งความพร้อมใช้งานส่ายไปส่ายมาในเดือนกันยายน และสิ่งที่เราเตอร์ทำได้อย่างมีประโยชน์คือรักษาการเชื่อมต่อให้เสถียรในขณะที่สิ่งที่อยู่เบื้องหลังเปลี่ยนแปลงไป การสลับสำรองอัตโนมัติหมายความว่าปลายทางพรีวิวที่หยุดตอบสนองจะกลายเป็นเพียงเหตุการณ์ด้านการกำหนดเส้นทาง ไม่ใช่การล่มของระบบ และ DSL สำหรับการกำหนดเส้นทางช่วยให้คุณประกอบโมเดลหลายรูปแบบ (multimodal) เข้ากับโมเดลข้อความล้วนในคำสั่งเดียวได้ — ซึ่งเป็นรูปแบบที่คู่นี้บ่งชี้พอดี โดย Gemini อ่านวิดีโอและ Grok คิดวิเคราะห์จากบทถอดความของวิดีโอนั้น ณ ขณะที่เขียนนี้ Grok 4.7 ยังไม่อยู่ในแคตตาล็อกของ OrcaRouter; การเรียกใช้งานในวันนี้หมายถึงต้องผ่าน API ของ xAI เองและแพลตฟอร์มบุคคลที่สามที่ให้บริการโมเดลนี้
รูปแบบที่ควรสร้างคือ: คงใช้ Gemini 3.1 Pro กับงานใดก็ตามที่ต้องนำเข้าวิดีโอ เสียง หรือ PDF และให้ถือว่าสถานะ preview ของมันเป็นความเสี่ยงเชิงปฏิบัติการที่ต้องหาทางเลี่ยง มากกว่าจะเป็นเหตุผลที่จะไม่ใช้มัน ใช้ Grok 4.7 กับงานข้อความและรูปภาพในจุดที่ราคาเอาต์พุตที่ต่ำกว่าและคะแนนรวมที่สูงกว่าของมันมีผล และในจุดที่โมเดลที่คุณผสานรวมวันนี้คือโมเดลที่คุณจะยังคงเรียกใช้ในอีกหกเดือนข้างหน้า สิ่งเดียวที่ห้ามทำคือตีความอันดับที่ 69 ว่าเป็นคำตัดสินต่อตัวโมเดล — มันเป็นคำตัดสินเกี่ยวกับการแก้ไขเกณฑ์วัดมาตรฐาน และการแก้ไขชุดเดียวกับที่ลดอันดับ Gemini 3.1 Pro ก็ยังลดอันดับโมเดลหลายสิบตัวที่ Google ไม่เคยแตะต้องด้วย
การโทร
บนดัชนีปัจจุบัน Grok 4.7 นำ Gemini 3.1 Pro อยู่ 16 คะแนน และในด้านราคาเอาต์พุต มีค่าใช้จ่ายครึ่งหนึ่งในระดับมาตรฐาน และถูกกว่าหนึ่งในสามในระดับบริบทยาว หากงานของคุณเป็นข้อความและรูปภาพ แค่นั้นก็เพียงพอต่อการตัดสินใจแล้ว หากงานของคุณเป็นวิดีโอ เสียง หรือเอกสารสแกน Gemini 3.1 Pro เป็นตัวเลือกเดียวในสองตัวนี้ และการเปรียบเทียบก็จบเพียงเท่านี้ — คุณกำลังซื้อความสามารถ ไม่ใช่คะแนน ข้อควรระวังที่ควรตามมาทั้งสองตัวเป็นเรื่องแหล่งที่มา มากกว่าประสิทธิภาพ: ตัวหนึ่งเป็นพรีวิวอายุเจ็ดเดือนที่ไม่มีกำหนด GA และมีเหตุการณ์ด้านความพร้อมใช้งานเมื่อเดือนกันยายนเป็นเบื้องหลัง อีกตัวเพิ่งเปิดตัวได้หนึ่งวัน มีตัวเลขพาดหัวหนึ่งตัว และยังไม่มีการตรวจสอบซ้ำอย่างอิสระในเรื่องอื่นใดเลย ไม่มีตัวไหนเป็นตัวเลือกที่ตัดสินใจได้เด็ดขาดแล้ว ทั้งคู่คุ้มค่าที่จะใช้แบบจัดเส้นทางตามงาน มากกว่าจะเลือกผูกมัดกับตัวใดตัวหนึ่ง

การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
