
GPT-6 vs Gemini 3.1 Pro: สาย Pro ของ Google ยังไม่เปิดตัวโมเดลใหม่เลยตั้งแต่เดือนกุมภาพันธ์
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Gemini 3.1 Pro อยู่ในรายการราคาของ Google มาเจ็ดเดือนครึ่งและไม่เคยออกจากสถานะพรีวิว มันถูกประกาศเมื่อวันที่ 19 กุมภาพันธ์ 2026 ยังคงให้บริการผ่านเอนด์พอยต์ชื่อ Gemini 3.1 Pro Preview และ ณ วันนี้ยังไม่มีคำมั่นเรื่องความพร้อมใช้งานทั่วไปและไม่มีวันที่ปิดให้บริการ — สองวันที่ที่จะบอกคุณว่าโมเดลนี้อยู่ตรงไหนในแผนของผู้ให้บริการของมันเอง ในทางกลับกัน GPT-6 Sol เปิดตัวเมื่อวันที่ 22 กันยายน 2026 และเมื่อวันที่ 7 ตุลาคม 2026 มันกลายเป็นโมเดลที่อยู่เบื้องหลังแพ็กเกจแบบเสียค่าใช้จ่ายของการเปิดให้ใช้ ChatGPT ทั่วโลกแก่ผู้ใช้มากกว่า 1.2 พันล้านคนต่อสัปดาห์
ดังนั้นการเปรียบเทียบที่พาดหัวจึงไม่ใช่ระหว่างสองระดับเรือธง แต่มันคือการเปรียบเทียบระหว่างผลิตภัณฑ์ที่วางจำหน่ายจริงกับพรีวิวแบบเปิดกว้าง และความแตกต่างนั้นกลับมีน้ำหนักมากกว่าช่องว่างของเบนช์มาร์ก เมื่อวางเทียบกันบน Intelligence Index v4.3.2 ของ Artificial Analysis พรีวิวอายุเจ็ดเดือนของ Google ได้ 29.7 เทียบกับ 47.6 ของ GPT-6 Sol ขณะที่เรียกเก็บแพงกว่าถึง 1.25 เท่าต่องานดัชนีที่เสร็จสมบูรณ์หนึ่งงาน — $1.30 เทียบกับ $1.04 ตัวเลขทั้งสองนั้นเป็นของจริง และทั้งคู่จำเป็นต้องมีข้อควรระวังกำกับก่อนที่คุณจะใช้เงินกับมัน
สิ่งที่ทำให้งานนี้คุ้มค่าที่จะอ่านแทนที่จะมองข้ามก็คือ พรีวิวนี้ชนะได้จริง มันเอาชนะ GPT-6 Sol ได้ใน GPQA Diamond, τ²-Bench ด้านการใช้เครื่องมือแบบเอเจนต์ และการวัดบริบทแบบยาวรายการหนึ่ง — และมันรับเสียงกับวิดีโอเป็นอินพุต ซึ่ง GPT-6 Sol ทำไม่ได้ พรีวิวอายุเจ็ดเดือนที่ยังคว้าชัยได้สองจากสี่ไฟต์ไม่ใช่โมเดลที่ควรตัดทิ้ง มันเป็นโมเดลที่ปัญหาอยู่ที่วงจรชีวิต ไม่ใช่ความสามารถ
ตัวเลขเหล่านั้น และข้อแม้เรื่องการแก้ไขที่ต้องไปด้วยกันกับตัวเลขเหล่านั้นเสมอ
Artificial Analysis จะรันชุดการทดสอบของตนใหม่และเผยแพร่คะแนนอีกครั้งภายใต้การแก้ไขดัชนีเวอร์ชันปัจจุบัน ซึ่งหมายความว่าโมเดลเดียวกันอาจมีตัวเลขที่แตกต่างกันได้สองค่า ขึ้นอยู่กับว่าคุณอ่านเมื่อใด สำหรับ Gemini 3.1 Pro ความแปรปรวนนั้นกว้างผิดปกติ: การรายงานก่อนหน้านี้เกี่ยวกับโมเดลนี้ระบุ 57 บนเวอร์ชันแก้ไขเก่า ขณะที่หน้าปัจจุบัน ณ ตอนนี้ระบุ 29.7 บน v4.3.2 ตัวเลขทั้งสองเป็นของจริง และทั้งคู่ปรากฏอยู่บนเว็บไซต์เดียวกัน
นั่นสำคัญเพราะมีเพียงตัวเลขจากรีวิชันเดียวกันเท่านั้นที่นำมาลบกันได้ 29.7 และ 47.6 คือคู่ที่ควรใช้ตรงนี้ เนื่องจากทั้งคู่มาจาก v4.3.2 — รันเดียวกันกับที่ให้คะแนน Claude Opus 5.5 ที่ 57.6 และ GPT-6 Astra ที่ 52.7 การอ่านค่าจากรันเดียวกัน โดยหนึ่งบรรทัดต่อหนึ่งมิติ:
• ดัชนีความฉลาด v4.3.2 — GPT-6 Sol 47.6 เทียบกับ Gemini 3.1 Pro 29.7
• ต้นทุนต่องานดัชนีที่ทำเสร็จ — Gemini 3.1 Pro $1.30 เทียบกับ GPT-6 Sol $1.04; โมเดลรุ่นเก่าแพงกว่าถึง 25% ต่อคำตอบที่เสร็จสมบูรณ์
• ราคาอินพุต — $2.00 ต่อ 1M เท่ากันทั้งคู่ เสมอกันที่ตัวเลขพาดหัว
• ราคาเอาต์พุต — GPT-6 Sol $10.00 เทียบกับ Gemini 3.1 Pro $12.00; Sol ถูกกว่า 17%
• เงื่อนไขบริบทยาว — GPT-6 Sol คิดราคาทั้งคำขอใหม่เป็น $4.00/$15.00 เมื่อเกิน 272,000 โทเคนอินพุต; Gemini 3.1 Pro ปรับเป็น $4.00/$18.00 เมื่อเกิน 200,000
• หน้าต่างบริบท — GPT-6 Sol 1,050,000 โทเคน เทียบกับ Gemini 3.1 Pro 1,048,576 ถือว่าเสมอกัน
• เอาต์พุตสูงสุด — GPT-6 Sol 128,000 โทเคน เทียบกับ Gemini 3.1 Pro 65,536; Sol เกือบเป็นสองเท่า
• รูปแบบอินพุต — GPT-6 Sol ข้อความ รูปภาพ ไฟล์ เทียบกับ Gemini 3.1 Pro ข้อความ รูปภาพ เสียง วิดีโอ PDF

สองบรรทัดตรงนั้นควรค่าแก่การขยายความ เพราะมันพลิกการอ่านที่ดูเหมือนชัดเจน บรรทัดต้นทุนต่องานบอกว่าตารางราคาที่ดูถูกกว่านั้นเป็นของโมเดลที่แพงกว่าต่องานที่เสร็จหนึ่งงาน — อัตราเอาต์พุต $12 ของ Gemini 3.1 Pro บวกกับปริมาณการใช้เหตุผลของมันทำงานได้มากกว่าที่อัตราอินพุตพาดหัว $2 บ่งชี้ และขั้นบริบทแบบยาวก็ควรค่าอ่านซ้ำทั้งสองฝั่ง: ขั้นของ Gemini 3.1 Pro เริ่มที่ 200,000 โทเคน ต่ำกว่า 272,000 ของ GPT-6 Sol แต่ปรับราคาเอาต์พุตใหม่เป็น $18.00 ในขณะที่ Sol ปรับราคาใหม่เป็น $15.00 ทั้งคู่ไม่ใช่ตารางราคาคงที่ และจุดตัดกันก็ไม่ตรงกัน
จุดที่พรีวิวยังคงชนะ
โมเดลของ Google ไม่ใช่ของโบราณ ดึงผลการประเมินที่การ์ดทั้งสองใบมีอยู่:
• GPQA Diamond — Gemini 3.1 Pro 94.1% เทียบกับ GPT-6 Sol ไม่มีการเผยแพร่ตัวเลขที่เทียบเคียงได้ในรีวิชันนี้
• τ²-Bench การใช้เครื่องมือแบบ agentic — Gemini 3.1 Pro 95.6% เทียบกับ GPT-6 Sol ไม่ได้เผยแพร่บนบอร์ดเดียวกัน
• การเรียกคืนบริบทแบบยาว — Gemini 3.1 Pro 82.0% เทียบกับ GPT-6 Sol 83.7% ห่างกัน 1.7 จุด
• SciCode — Gemini 3.1 Pro 58.7% เทียบกับ GPT-6 Sol 57.6% ถือว่าอยู่ในระดับเดียวกัน
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4.0% เทียบกับ GPT-6 Sol 43.9%; เป็นหมวดหมู่เดียวที่ตัวพรีวิวไม่สามารถแข่งขันได้

คะแนน GPQA Diamond 94.1% และคะแนนการใช้เครื่องมือแบบเอเจนต์ 95.6% เป็นตัวเลขระดับแนวหน้า ไม่ใช่ตัวเลขตกค้างจากอดีต และนั่นคือเหตุผลที่ช่องว่างของดัชนี 17.9 คะแนนนั้นกล่าวเกินจริงเมื่อเทียบกับระยะห่างในทางปฏิบัติ ดัชนีนี้เป็นคะแนนรวมจากการประเมินสิบรายการ และจุดที่ Gemini 3.1 Pro เสียคะแนนนั้นกระจุกตัวอยู่ในส่วนที่ชุดการทดสอบให้น้ำหนักไปทางวิศวกรรมซอฟต์แวร์อย่างมาก — Terminal-Bench 4.0 ที่ 4.0% เป็นค่าผิดปกติที่ย่ำแย่เมื่อเทียบกับ SciCode 58.7% และ Terminal-Bench 2.1 ที่ 73.8% ของมัน โมเดลที่ทำคะแนนได้ใกล้จุดสูงสุดของเบนช์มาร์กแบบเอเจนต์ตัวหนึ่ง แต่กลับอยู่ใกล้จุดต่ำสุดของตัวที่มาสืบทอด กำลังบอกคุณเกี่ยวกับวันที่ฝึกของมัน ไม่ใช่ขีดจำกัดสูงสุดของมัน
การป้อนข้อมูลเสียงและวิดีโอเป็นข้อได้เปรียบที่เป็นรูปธรรมอีกประการหนึ่ง และมันเป็นเงื่อนไขแบบผ่านหรือไม่ผ่าน ไม่ใช่ข้อได้เปรียบแบบค่อยเป็นค่อยไป หากไปป์ไลน์ของคุณรับบันทึกการประชุมหรือภาพแคปหน้าจอเป็นอินพุต Gemini 3.1 Pro ก็เข้าไปได้ แต่ GPT-6 Sol เข้าไปไม่ได้ ความเป็นผู้นำด้านดัชนีไม่ว่าจะมากเพียงใดก็ทดแทนสิ่งนั้นไม่ได้
สิ่งที่ "ยังอยู่ในช่วงพรีวิว" ทำให้คุณต้องเสียต้นทุนอะไรไปบ้าง อย่างเป็นรูปธรรม
สถานะพรีวิวไม่ใช่แค่ป้ายประดับตกแต่ง และต้นทุนนั้นเป็นแบบที่โผล่ขึ้นมาก็ต่อเมื่อคุณได้สร้างต่อยอดบนบางสิ่งบางอย่างแล้วเท่านั้น
ปลายทางพรีวิวไม่มีความมุ่งมั่นด้านความพร้อมใช้งานทั่วไป ซึ่งหมายความว่าผู้ขายไม่ได้สัญญาว่าโมเดลจะยังอยู่ตามกำหนดการที่คุณสามารถวางแผนได้ นอกจากนี้ยังไม่มีวันปิดให้บริการ ซึ่งฟังดูเหมือนเป็นด้านดีของเรื่องนั้น — ไม่มีอะไรถูกปลดระวาง — แต่ก็อ่านได้อีกนัยหนึ่งเช่นกัน: Google ไม่ได้เผยแพร่วงจรชีวิตสำหรับโมเดลที่อยู่ในสถานะนี้ตั้งแต่เดือนกุมภาพันธ์ ขณะที่ปล่อยโมเดลระดับ Flash ตลอดช่วงเวลาเดียวกัน Gemini 3.8 Flash, Gemini 3.5 Flash-Lite, ไลน์ 3.6 และ 3.8 Flash: ระดับ Pro ยังคงอยู่ที่เดิม และผู้สืบทอดมาถึงในรูปแบบ Gemini 4 Argon แทน ซึ่ง Google ประกาศเมื่อวันที่ 30 กันยายน 2026 ในการเปิดตัวเป็นระยะแก่กลุ่มพันธมิตรด้านความปลอดภัยที่ระบุชื่อ โดยไม่มีวันที่พร้อมใช้งานทั่วไปแนบมาด้วยเช่นกัน
นั่นคือรูปแบบที่การเปรียบเทียบนี้ต้องการชี้ให้เห็นจริง ๆ หากคุณสร้างไปป์ไลน์ที่ยั่งยืนบน Gemini 3.1 Pro Preview คุณกำลังสร้างบนโมเดลที่ผู้ขายของมันเองยังไม่บอกว่าจะพ้นสถานะพรีวิว ถูกแทนที่ หรือถูกปลดระวางเมื่อใด จุดยืนของ GPT-6 Sol ตรงกันข้าม: มันเป็นผลิตภัณฑ์ API ที่พร้อมใช้งานทั่วไป มีตารางราคาที่เผยแพร่แล้ว และตั้งแต่ 7 ตุลาคม 2026 มันยังเป็นค่าเริ่มต้นในแอปที่เพื่อนร่วมงานส่วนใหญ่ของคุณใช้ จากข้อมูลที่ผู้ขายรายงานและยังไม่มีการทำซ้ำ OpenAI กล่าวว่าใน ChatGPT นั้น GPT-6 ประกอบคำตอบโดยใช้ข้อความ กราฟิก แผนภูมิ และตัวควบคุมแบบอินเทอร์แอกทีฟ ผ่านความสามารถที่มันเรียกว่า Intelligent UI คำตอบที่ต้องค้นหาเว็บจะเริ่มเร็วขึ้น 44% เมื่อเทียบกับ GPT-5.6 Instant และระดับความพยายาม Extra High จะเริ่มตอบสนองได้เร็วเท่ากับ GPT-5.6 ที่ระดับ Medium ไม่มีสิ่งใดในนั้นเปลี่ยนการผสานรวม API ทั้งหมดนี้คือเหตุผลที่ตอนนี้ GPT-6 เป็นค่าเริ่มต้นที่อยู่รอบตัว และพรีวิวไม่ได้เป็นเช่นนั้น
ยังมีข้อโต้แย้งฉบับเรียบง่ายอีกเวอร์ชันหนึ่งด้วย คุณกำลังจ่ายแพงขึ้น 25% ต่อหนึ่งงานที่ทำเสร็จ โดยได้คะแนนความสามารถต่ำลง สำหรับโมเดลที่ไม่ได้ประกาศวงจรชีวิตไว้ ข้อโต้แย้งฝ่ายตรงข้ามมีอยู่จริง — คุณได้ GPQA Diamond ที่ 94.1% และอินพุตเสียง — แต่มันเป็นข้อโต้แย้งที่เจาะจงสำหรับภาระงานที่เจาะจง ไม่ใช่เหตุผลทั่วไปที่จะทำให้ควรชอบโมเดลรุ่นเก่ากว่า
ทดลองดูตัวอย่างโดยไม่ต้องเดิมพัน
ข้อผิดพลาดที่ต้องหลีกเลี่ยงเมื่อโมเดลหนึ่งอยู่ในตำแหน่งของ Gemini 3.1 Pro คือการมองว่า "เราควรใช้มันไหม" เป็นการตัดสินใจแบบสองทางเพียงครั้งเดียว ซึ่งไม่ใช่เช่นนั้น ทั้ง Gemini 3.1 Pro Preview และ GPT-6 Sol ต่างอยู่ในแคตตาล็อกของ OrcaRouter อยู่เบื้องหลังเอนด์พอยต์ที่เข้ากันได้กับ OpenAI เพียงหนึ่งเดียวและคีย์เดียว โดยบวกเพิ่ม 0% จากราคาที่ผู้ให้บริการประกาศ — ดังนั้นพรีวิวนี้จึงเป็นสิ่งที่คุณสามารถใส่เข้าไปในเส้นทางคำขอจริง วัดผลเทียบกับเวิร์กโหลดของคุณเอง และเก็บไว้หรือตัดทิ้งได้โดยไม่ต้องมีสัญญาผู้ขายรายที่สองหรือแก้โค้ด
การสลับไปใช้ระบบสำรองโดยอัตโนมัติคือสิ่งที่ทำให้เรื่องนั้นปลอดภัยสำหรับโมเดลที่อยู่ในวงจรชีวิตแบบพรีวิว จงกำหนดเส้นทางทราฟฟิกเสียงและวิดีโอไปยัง Gemini 3.1 Pro ซึ่งเป็นตัวเดียวในสองตัวที่รับอินพุตนั้นได้ กำหนดเส้นทางทราฟฟิกงานวิศวกรรมซอฟต์แวร์และงานเอาต์พุตยาวไปยัง GPT-6 Sol และตั้งค่ากลไกสำรองให้เป็นแบบที่ว่า หากปลายทางพรีวิวถูกเลิกใช้ ถูกจำกัดอัตรา หรือถูกปรับราคาแบบเงียบ ๆ คำขอจะไปลงที่โมเดลที่พร้อมใช้งานทั่วไปแทนที่จะล้มเหลว นั่นคือโครงสร้างที่พรีวิวอายุเจ็ดเดือนพึงได้รับ — ไม่ใช่การหลีกเลี่ยง แต่เป็นเส้นทางที่ไม่ต้องพึ่งพามัน
หากคุณต้องการไปไกลกว่านั้น routing DSL จะประกอบโมเดลหลายตัวเข้าเป็นหนึ่งการเรียกเชิงตรรกะ ดังนั้นคำขอหนึ่งรายการจึงลองเทียบกับ Gemini 3.1 Pro และ GPT-6 Sol ได้ แล้วเลือกคำตอบตามเกณฑ์ของคุณเอง แทนที่จะเป็นเกณฑ์ของผู้ขายรายเดียว การหลอมรวมโมเดลทำสิ่งเดียวกันในทิศทางตรงกันข้าม — คณะโมเดลที่ช่วยกันตอบคำถามเดียว — ซึ่งเป็นวิธีที่สมเหตุสมผลในการค้นหาว่าจุดแข็งเฉพาะของพรีวิวตรงไหนที่คุ้มค่าที่จะจ่าย ก่อนจะมุ่งเส้นทางโปรดักชันไปที่มัน

คำตัดสิน และตัวเลขที่ต้องจับตา
สำหรับงานใหม่ GPT-6 Sol เป็นตัวเลือกที่ปลอดภัยกว่าใน 4 จาก 6 มิติที่ใช้ตัดสินการดีพลอย และมีค่าใช้จ่ายต่องานที่เสร็จสมบูรณ์ต่ำกว่า ในขณะที่ทำคะแนนดัชนีได้สูงกว่า 17.1 พอยต์ที่เวอร์ชันเดียวกัน สำหรับเวิร์กโหลดที่ต้องการอินพุตเสียงหรือวิดีโอ หรือที่ซึ่ง 94.1% GPQA Diamond เป็นสิ่งที่คุณกำลังซื้อ Gemini 3.1 Pro Preview ยังคงชนะ และป้าย preview เป็นความเสี่ยงที่ต้องบริหารจัดการ มากกว่าเป็นเหตุผลที่จะถอยหนี
ตัวเลขที่ต้องจับตาดูไม่ใช่ดัชนี แต่มันคือวันที่บนชื่อเอนด์พอยต์ของ Gemini 3.1 Pro เมื่อคำต่อท้าย preview ถูกถอดออก — หรือเมื่อ Argon เปิดให้ใช้งานทั่วไปพร้อมตัวระบุ API จริง — การเปรียบเทียบนี้จะเปลี่ยนรูปไปโดยสิ้นเชิง และช่องว่างเจ็ดเดือนระหว่างการเปิดตัวครั้งล่าสุดของระดับ Pro กับวันนี้จะกลายเป็นสิ่งที่บทความนี้พูดถึง
การเปรียบเทียบในบทความนี้3
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
