การ์ดชื่อเรื่องหลักที่ระบุว่า "Gemini 4 Argon vs GPT-6 Sol — ราคาหนึ่งในห้า แต่ค่าบริการสี่เท่า" พร้อมชิปที่ระบุว่า "Argon $2 / $10", "Sol $2 / $10" และ "ค่าใช้จ่ายต่องานดัชนี $1.99 เทียบกับ $1.05" และบรรทัดส่วนท้ายที่ระบุว่า "ตัวเลขของ Argon เป็นข้อมูลที่ผู้จำหน่ายรายงานเอง; ตัวเลขดัชนีอ้างอิงจาก Artificial Analysis, อ่านเมื่อ 2026-10-01" โลโก้ OrcaRouter ถูกประกอบรวมไว้ที่มุมขวาล่าง
Guides & Insights

Gemini 4 Argon vs GPT-6 Sol: ราคาหนึ่งในห้า แต่บิลสี่เท่า

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

รันชุดดัชนี Artificial Analysis กับ Gemini 4 Argon แล้วมีค่าใช้จ่าย $2,407 รันชุดเดียวกันกับ GPT-6 Sol แล้วมีค่าใช้จ่าย $1,546 ดัชนีเดียวกัน งานเดียวกัน สัปดาห์เดียวกัน โมเดลทั้งสองมีราคาตามรายการเท่ากัน — $2.00 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น และ $10.00 ต่อโทเค็นเอาต์พุตหนึ่งล้านโทเค็น โดย Argon เป็นอัตราเปิดตัวที่ Google ระบุไว้ และ Sol เป็นอัตราปกติของ OpenAI — แต่ต้นทุนสุดท้ายของงานเดียวกันกลับต่างกัน 56% โดยเป็นผลดีต่อโมเดลที่ได้คะแนนต่ำกว่าห้าคะแนน ช่องว่างนี้คือเหตุผลทั้งหมดที่ทำให้การเปรียบเทียบนี้คุ้มค่าที่จะเขียน และมันไม่เกี่ยวอะไรกับเรตการ์ดเลย

Google ประกาศเปิดตัว Gemini 4 Argon เมื่อวันที่ 30 กันยายน 2026 โดยเรียกมันว่ายุคถัดไปของปัญญาประดิษฐ์ระดับแนวหน้า ราคาอยู่ที่ 2 ดอลลาร์สำหรับอินพุต และ 10 ดอลลาร์สำหรับเอาต์พุต โดยมีอินพุตที่แคชไว้ลด 95% และทยอยเปิดให้กับนักป้องกันไซเบอร์ที่เชื่อถือได้ผ่าน Fairwind Program GPT-6 Sol พร้อมใช้งานทั่วไปตั้งแต่ 22 กันยายน 2026 เมื่อ OpenAI เปิดตัวระดับกลางของสาย GPT-6 ในราคา 2 ดอลลาร์สำหรับอินพุต และ 10 ดอลลาร์สำหรับเอาต์พุต พร้อมส่วนลดแคช 90% ตัวหนึ่งซื้อได้แล้ววันนี้บนเอนด์พอยต์ที่เข้ากันได้กับ OpenAI ส่วนอีกตัวไม่มีใครนอกกลุ่มที่ระบุชื่อสามารถซื้อได้ ซึ่งเป็นทางแยกในทางปฏิบัติของบทความนี้ แต่การกลับทิศของต้นทุนข้างต้นยังคงอยู่แม้ว่าคุณจะไม่คำนึงถึงความพร้อมใช้งานโดยสิ้นเชิง และการเข้าใจว่าทำไมจึงเป็นส่วนที่มีประโยชน์

การกลับด้าน กล่าวอย่างตรงไปตรงมา

Artificial Analysis เผยแพร่ทั้ง Intelligence Index และบัญชีค่าใช้จ่ายในการรันดัชนีนั้น เมื่ออ่านรวมกันแล้ว สิ่งเหล่านี้บอกว่า:

• ดัชนี Intelligence Index — Gemini 4 Argon ได้ 52.6 เทียบกับ GPT-6 Sol 47.5 ช่องว่างห้าคะแนน โดย Argon ถูกตั้งค่าไว้ที่ระดับความพยายามสูง ส่วน Sol อยู่ที่ระดับสูงสุด ดังนั้นการเปรียบเทียบนี้จึงเอื้อประโยชน์ต่อ Sol มากกว่าต่อ Argon

• ราคาต่อล้านโทเค็น — เท่ากัน $2.00 ขาเข้า / $10.00 ขาออก ทั้งคู่ การอ่านแคชคือความแตกต่างเพียงอย่างเดียว: $0.10 บน Argon, $0.20 บน Sol

• ต้นทุนต่องานจัดทำดัชนี — Gemini 4 Argon $1.99 เทียบกับ GPT-6 Sol $1.05 โดย Argon มีต้นทุนต่องานสูงกว่าประมาณสองเท่า แม้จะมีต้นทุนต่อโทเคนเท่ากัน

• ค่าใช้จ่ายในการรันชุดทดสอบเต็มรูปแบบ — Gemini 4 Argon $2,407 เทียบกับ GPT-6 Sol $1,546

• ความเร็วเอาต์พุตที่วัดได้ — GPT-6 Sol 77.0 โทเคนต่อวินาที เทียบกับ Gemini 4 Argon 48.9 ซึ่งเป็นความแตกต่าง 1.6 เท่าที่ปรากฏทั้งในรูปของความหน่วงและค่าใช้จ่าย

มีบรรทัดหนึ่งในรายการนั้นที่อธิบายบรรทัดอื่น ๆ ทั้งหมด และมันไม่ใช่ราคา แต่เป็นจำนวนโทเคน บนงานของดัชนีเอง Gemini 4 Argon สร้างโทเคนเอาต์พุตประมาณ 561,000 โทเคนต่องาน ส่วน GPT-6 Sol สร้างประมาณ 282,000 โทเคน Argon ใช้เวลาคิดนานเป็นสองเท่าเพื่อตอบคำถามเดียวกัน และด้วยอัตราต่อโทเคนที่เท่ากัน นั่นก็เท่ากับค่าใช้จ่ายเป็นสองเท่าพอดี

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Sol. The Gemini 4 Argon column reads: AA Intelligence Index 52.6, price $2 in / $10 out per million tokens, cost per index task $1.99, output tokens per task 561K, output speed 48.9 tok/s, max output 1M tokens. The GPT-6 Sol column reads: AA Intelligence Index 47.5, price $2 in / $10 out, cost per index task $1.05, output tokens per task 282K, output speed 77.0 tok/s, max output 128K tokens. A footer line reads that the prices are vendor list prices and the index figures are per Artificial Analysis, read 2026-10-01.

ทำไมโทเคนจึงเป็นราคา

นี่คือข้อแก้ไขที่ควรค่าแก่การซึมซับให้เป็นความเข้าใจก่อนที่ใครจะตั้งงบประมาณสำหรับการโยกย้าย เพราะสัญชาตญาณมักวิ่งไปผิดทาง เมื่อโมเดลหนึ่งมีราคาเท่ากับคู่แข่งและใช้โทเคนเอาต์พุตเป็นสองเท่าเพื่อทำงานให้เสร็จ ราคาต่อโทเคนก็ไม่ใช่ราคาจริง ราคาคือราคาต่อโทเคนคูณด้วยจำนวนโทเคนที่โมเดลเลือกจะใช้ไม่ว่าจะมากเท่าใด และปัจจัยที่สองนั้นเป็นคุณสมบัติของโมเดล ไม่ใช่ของตารางราคา

อัตรากำไรของแต่ละงานแตกต่างกันมากอย่างมหาศาล ซึ่งยิ่งทำให้แย่ลงไปอีก — คุณไม่สามารถใช้ตัวคูณแบบคงที่แล้วเดินหน้าต่อได้:

• Terminal-Bench 4.0 — Argon 165,330 โทเค็นเอาต์พุตต่องาน เทียบกับ 97,372 ของ Sol โดย Argon มีค่าใช้จ่าย $6.78 ต่อหนึ่งงานตรงนี้ เทียบกับ $4.00 ของ Sol แม้ว่า Argon จะทำคะแนนได้ 57.1% เทียบกับ 43.9% ของ Sol

• CritPt — Argon ใช้ 109,533 โทเคน เทียบกับ 31,848 ของ Sol อัตราส่วนโทเคน 3.4 เท่าในงานที่จริง ๆ แล้ว Sol ได้คะแนน สูงกว่า คือ 30.9% ต่อ 27.1%

• GDPval — Argon 74,571 โทเคน เทียบกับ 41,567 ของ Sol โดยคิดเป็น $1.82 ต่อหนึ่งงาน เทียบกับ $1.32

• Omniscience — อัตราส่วนโทเคน 938 ต่อ 2,662 ที่เป็น ผลดีต่อ Argon, ในราคา $0.010 ต่องาน เทียบกับ $0.027 ของ Sol กลุ่มงานเดียวที่ทิศทางกลับกัน.

• การให้เหตุผลแบบบริบทยาว — Argon 2,197 โทเคน เทียบกับ 954 ของ Sol และเป็นเพียงงานเดียวในชุดทดสอบที่ Sol ชนะคะแนนอย่างชัดเจน 83.7% ต่อ 79.7%

CritPt คือตัวที่ให้บทเรียน โมเดลที่เผาผลาญโทเคนมากกว่าสามเท่าครึ่งเพื่อสร้างคำตอบที่แย่กว่าเล็กน้อยสำหรับคำถามเดียวกัน ไม่ใช่เรื่องราวของความสามารถ แต่เป็นเรื่องราวของนิสัยการใช้จ่าย การใช้เหตุผลของ Argon ยาวนาน และในงานบางรูปแบบ ความยาวนั้นแปลงเป็นคะแนน ส่วนในรูปแบบงานอื่นมันก็แค่แปลงเป็นเงินดอลลาร์ ค่า 52.6 ของดัชนีและค่า 47.5 ของ Sol เป็นค่าภาพรวม และค่าภาพรวมก็ซ่อนสิ่งนี้ไว้พอดี

ห้าคะแนนนั้นมาจริง ๆ จากไหน

เนื่องจากช่องว่างของดัชนีและช่องว่างของต้นทุนชี้ไปในทิศทางที่ตรงข้ามกัน จึงเป็นเรื่องที่ควรรู้ว่างานใดเป็นตัวขับเคลื่อนแต่ละอย่าง

• Terminal-Bench 4.0 — Gemini 4 Argon 57.1% เทียบกับ GPT-6 Sol 43.9% นับเป็นชัยชนะครั้งใหญ่ที่สุดเพียงครั้งเดียวของ Argon และเป็นกลุ่มงานที่ใกล้เคียงกับการเขียนโค้ดแบบเอเจนต์ระยะยาวมากที่สุด

• สัพพัญญุตภาพ — Gemini 4 Argon 42.4 เทียบกับ GPT-6 Sol 27.1 ช่องว่าง 15 จุดในด้านความครอบคลุมข้อเท็จจริง ซึ่งเป็นช่องว่างเชิงสัดส่วนที่ใหญ่ที่สุดในชุดการทดสอบ

• AutomationBench-AA — Gemini 4 Argon 77.5% เทียบกับ GPT-6 Sol 61.6%

• SciCode — Gemini 4 Argon 61.8% เทียบกับ GPT-6 Sol 57.6%

• Humanity's Last Exam — Gemini 4 Argon 57.1% เทียบกับ GPT-6 Sol 47.9%

• GDPval — Gemini 4 Argon 1,611 เทียบกับ GPT-6 Sol 1,487

• ApexAgents / AA-Briefcase — GPT-6 Sol 1,482.78 Elo เมื่อเทียบกับ 1,493.84 ของ Argon ซึ่งเป็นช่องว่าง 11 คะแนนที่อยู่ภายในช่วงความเชื่อมั่นที่เผยแพร่ และควรถือว่าเสมอกัน

• การให้เหตุผลเชิงบริบทยาว — GPT-6 Sol 83.7% เทียบกับ Gemini 4 Aron ชัยชนะที่ชัดเจนเพียงหนึ่งเดียวของ Sol

• CritPt — GPT-6 Sol 30.9% เทียบกับ Gemini 4 Argon 27.1% Sol ชนะอีกครั้งอย่างฉิวเฉียด

ดังนั้นภาพรวมจึงไม่ใช่ว่า "Argon ดีกว่า" แต่เป็นว่า Argon ดีกว่าในสองด้านที่สื่อเปิดตัวของมันชูเป็นจุดขายตั้งแต่แรก — การดำเนินงานทางธุรกิจแบบครบวงจร และวิศวกรรมซอฟต์แวร์ระยะยาว — ขณะที่ Sol นั้นอยู่ในระดับเดียวกันหรือนำกว่าในบันไดการให้เหตุผลแนววิชาการ และในการรักษาความสอดคล้องตลอดบริบทที่ยาว สำหรับผู้อ่านที่มีภาระงานเป็นไปป์ไลน์การค้นคืนด้วยพรอมป์ต์ขนาด 400K โทเคน Sol นั้นเป็นทั้งโมเดลที่ดีกว่าและถูกกว่าในเวลาเดียวกัน ซึ่งเป็นสถานะที่พบได้ยากและน่าอยู่ใจ

ความแตกต่างด้านข้อกำหนดที่คงอยู่ยืนนานกว่าการอภิปรายเรื่องเบนช์มาร์ก

• เอาต์พุตสูงสุด — Gemini 4 Argon 1,000,000 โทเค็นในเส้นทางการทำงานเดียว ซึ่ง Google ระบุว่าเป็นขนาดใหญ่ที่สุดในอุตสาหกรรม และเพิ่มขึ้นจากขีดจำกัด 64K ของรุ่นก่อน GPT-6 Sol 128,000 โทเค็น

• หน้าต่างบริบท — การ์ดข้อมูลของผู้จำหน่ายของ GPT-6 Sol ระบุไว้ที่ประมาณ 1,050,000 โทเคน ส่วนของ Argon อยู่ที่ 1,000,000 โทเคน Artificial Analysis วัดค่า Sol ได้ 872,000 โทเคนผ่านฮาร์เนสของตน ซึ่งเป็นการวัดจากฮาร์เนส ไม่ใช่ตัวเลขบนการ์ด — ให้ถือว่าการ์ดคือข้อกำหนด และตัวเลขจากฮาร์เนสคือสิ่งที่ผู้ประเมินได้ทดสอบจริง

• รูปแบบอินพุต — ทั้งสองรับข้อความ รูปภาพ และไฟล์ได้ วัสดุเปิดตัวของ Argon ยังเน้นไปที่ความเข้าใจวิดีโอความยาวมาก โดย Google อ้างว่าทำได้ 91.7% บน LVBench และอธิบายว่าอยู่ในระดับล้ำสมัยที่สุดในวงการ นั่นเป็นตัวเลขที่ผู้ขายรายงานเอง และยังไม่มีคณะกรรมการอิสระรายใดทำซ้ำผลนี้ได้

• อินพุตวิดีโอ — ไม่ชัดเจน Artificial Analysis แสดง Argon ในแผนภูมิโดยปิดอินพุตวิดีโอ และระบุวิดีโออย่างชัดเจนเมื่อเปิดตัว ขณะที่การ์ดของ Sol ไม่ได้ระบุวิดีโอเลย หากวิดีโอเป็นองค์ประกอบสำคัญที่ขาดไม่ได้ในไปป์ไลน์ของคุณ การ์ดทั้งสองใบก็ไม่ได้ให้คำตอบที่ชัดเจน และคุณควรทดสอบก่อนที่จะออกแบบสถาปัตยกรรม

• ความพยายามในการให้เหตุผล — Sol เปิดให้ตั้งค่าความพยายามได้ (ตั้งแต่ none จนถึง max ค่าเริ่มต้นคือ medium) ที่ระดับ API และถูกวัดผลที่ max ส่วน Argon ถูกวัดผลที่ high; ยังไม่มีใครเผยแพร่ชุดการทดสอบเดียวกันที่การตั้งค่าสูงสุดของมัน

เพดานเอาต์พุต 1M โทเคน คือสิ่งเดียวที่อาจเปลี่ยนสถาปัตยกรรมได้จริง ไม่ใช่แค่เปลี่ยนงบประมาณ อะไรก็ตามที่ตอนนี้คุณต้องแยกเป็นการเรียกแบบต่อเนื่องกันสิบสองครั้งเพื่อให้อยู่ใต้เพดาน 128K — ไม่ว่าจะเป็นชุดแพตช์หลายไฟล์ รายงานตรวจสอบฉบับเต็ม หรือเอกสารยาวที่ทำในรอบเดียว — จะกลายเป็นการเรียกเพียงครั้งเดียวที่มีจุดให้ลูปของเอเจนต์สูญเสียสถานะได้น้อยลง การที่มันจะคุ้มค่ากับต้นทุนต่องานที่เพิ่มเป็นสองเท่าหรือไม่นั้น ขึ้นอยู่ทั้งหมดกับว่าคุณมีภาระงานแบบนั้นหรือเปล่า ถ้ามี ก็คงคุ้มค่า ถ้าการเรียกของคุณเป็นแบบ classify-and-return เงินนั้นก็ถูกใช้ไปกับพื้นที่เผื่อที่ไม่มีใครจะใช้

การตั้งค่าความพยายามที่ไม่มีใครเทียบได้ และเหตุใดจึงสำคัญ

ข้อแม้หนึ่งข้อสมควรมีย่อหน้าเป็นของตัวเอง เพราะมันขัดกับการอ่านช่องว่างดัชนี 5 จุดว่าเป็นความแตกต่างด้านความสามารถล้วนๆ โดย Artificial Analysis จัดทำแผนภูมิ Gemini 4 Argon ที่ระดับสูงของความพยายามในการใช้เหตุผล และ GPT-6 Sol ที่ระดับสูงสุด สองระดับนี้ไม่ใช่ขั้นเดียวกันบนบันไดทั้งสองเส้น และทิศทางของความไม่ลงรอยกันนี้น่าสนใจ คือ Sol ถูกทดสอบที่การตั้งค่าแพงที่สุดของมัน ส่วน Argon อยู่ที่ระดับกลางๆ

มีสองการตีความตามมา และข้อมูลไม่สามารถแยกสองสิ่งนี้ออกจากกันได้ อีกทางหนึ่งคือ Argon ที่ max จะได้คะแนนสูงกว่า 52.6 — แต่ก็จะใช้โทเคนมากกว่า 561,000 ต่องาน และมีค่าใช้จ่ายมากกว่า $1.99 — หรือไม่ก็ได้คะแนนพอ ๆ กัน ซึ่งหมายความว่าปุ่มปรับความพยายามไม่ได้ทำอะไรมากนักในชุดทดสอบนี้ ไม่มีการรันที่เผยแพร่แล้วใดที่ชี้ขาดเรื่องนี้ได้ ใครก็ตามที่อ้างว่า 52.6 เป็นเพดานของ Argon กำลังอ้างถึงการตั้งค่า ไม่ใช่ตัวโมเดล และการตั้งค่านั้นคือแบบที่ผู้ขายเลือกจะเผยแพร่เป็นอันดับแรก

ตรรกะเดียวกันนี้ใช้กับ 47.5 ของ Sol เพียงแต่เป็นไปในทิศทางตรงกันข้าม: max อยู่บนสุดของลำดับรุ่น ดังนั้นตัวเลขนี้จึงใกล้เพดานมากกว่าพื้น การแข่งขันที่ยุติธรรมด้วยความพยายามที่เท่ากันอาจทำให้ช่องว่างแคบลง และอาจพลิกการเปรียบเทียบต้นทุนได้ด้วย เนื่องจากโทเคนที่ max ใช้ไปคือโทเคนที่มีราคา 10 ดอลลาร์ต่อล้าน

ทางแยกด้านความพร้อม ซึ่งเป็นตัวตัดสินคำตอบที่แท้จริง

Gemini 4 Argon ยังไม่เปิดให้ใช้ทั่วไป ประกาศของ Google ระบุว่ากำลังทยอยเปิดให้กับกลุ่มผู้ป้องกันไซเบอร์ที่เชื่อถือได้ผ่าน Fairwind Program ว่าบริษัทกำลังมีส่วนร่วมในกระบวนการเข้าถึงโมเดลก่อนเปิดตัวโดยสมัครใจของรัฐบาลสหรัฐฯ และว่าการเข้าถึงทั่วไปสำหรับนักพัฒนา องค์กร และผู้บริโภคจะมาถึง "โดยเร็วที่สุด" โดยเริ่มจากลูกค้า API แบบเสียค่าใช้จ่ายและผู้สมัครสมาชิก Google AI Ultra ยังไม่มีตัวระบุโมเดล ไม่มี endpoint ไม่มีโควตา และไม่มีวันที่ มันไม่มีอยู่ใน API สาธารณะใดๆ รวมถึงของเรา — ลองตรวจสอบแค็ตตาล็อกแล้วจะเจอ 404 เพราะยังไม่มีอยู่ที่นั่น

GPT-6 Sol เป็นผลิตภัณฑ์ที่เรียกใช้งานได้ บน OrcaRouter มันคือ openai/gpt-6-sol ซึ่งให้บริการบนเอนด์พอยต์ที่เข้ากันได้กับ OpenAI แบบเดียวกับโมเดลกว่า 200 ตัวอื่น ๆ ในแค็ตตาล็อก ในราคาตามรายการของ OpenAI ที่ส่งต่อถึงคุณโดยมีมาร์กอัปเป็นศูนย์ ดังนั้นราคา $2/$10 ข้างต้น และขั้นบันไดบริบทยาว 272,000 โทเคนที่ขึ้นเป็น $4/$15 จึงเป็นสิ่งที่คุณจ่ายจริง ไม่ใช่แค่ตัวเลขที่ใบอัตราค่าบริการอ้างไว้ การสลับไปยังผู้ให้บริการรายอื่นอัตโนมัติเมื่อเกิดความล้มเหลวรองรับกรณีที่เส้นทางเริ่มเสื่อมคุณภาพระหว่างการทำงาน และ DSL สำหรับกำหนดเส้นทางช่วยให้แอปพลิเคชันเดียวส่งทราฟฟิกการจำแนกประเภทที่มีต้นทุนต่ำไปยังโมเดลที่เล็กกว่า และส่งทราฟฟิกการให้เหตุผลที่ยากไปยัง Sol ได้โดยไม่ต้องใช้ SDK ตัวที่สอง

A capture of the OrcaRouter model page for openai/gpt-6-sol, listed by OpenAI with a 2026-09-22 date, a 1M-token context window, a 128K-token maximum output, text, image and file input, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

การจัดวางแบบสุดท้ายนั้นคือคำตอบที่ตรงไปตรงมาสำหรับการเปรียบเทียบนี้ในกรณีของทีมส่วนใหญ่ ข้อโต้แย้งเรื่องต้นทุนที่สนับสนุน Argon นั้นเป็นเรื่องจริง แต่มีเงื่อนไขอยู่ที่ภาระงานซึ่งงานของเอเจนต์ในระยะยาวเป็นปัจจัยหลัก ส่วนข้อโต้แย้งเรื่องต้นทุนที่ต่อต้านมันก็เป็นเรื่องจริงในภาระงานอื่น ๆ ทั้งหมด และไม่ว่าอย่างไรคุณก็ซื้อมันไม่ได้ในเดือนนี้ วิธีที่ประหยัดคือการสร้างชุดทดสอบประเมินผลตอนนี้ — พร้อมพรอมป์ของคุณเอง เกณฑ์การให้คะแนนของคุณเอง แล้วรันกับ Sol ที่การตั้งค่าความพยายามหลายระดับ — เพื่อว่าเมื่อ Argon เปิดให้ลูกค้า API แบบจ่ายเงิน คุณจะมีคำตอบที่วัดผลได้สำหรับคำถามที่คนอื่น ๆ จะตอบจากตารางจัดอันดับ

อะไรจะยุติเรื่องนี้ได้

สามสิ่ง เรียงตามลำดับว่าแต่ละอย่างจะเปลี่ยนคำตัดสินได้มากแค่ไหน การเปิดให้ใช้งานทั่วไปของ Argon ในราคาจริงที่ไม่ใช่ราคาเปิดตัว — คำว่า "เปิดตัว" หมายความว่า $2/$10 อาจเปลี่ยนแปลงได้ และลำดับของ Google เองก็ให้ความสำคัญกับลูกค้า API แบบเสียค่าใช้จ่ายก่อน ดังนั้นอัตราที่ประกาศครั้งแรกหลังการเปิดตัวคือสิ่งที่ต้องจับตา การทดสอบ Artificial Analysis ที่เผยแพร่ของ Argon ที่การตั้งค่าระดับความพยายามสูงสุด ซึ่งจะบอกว่า 52.6 เป็นเพดานหรือห่างจากเพดานแค่เส้นยาเดียว และการทำซ้ำโดยอิสระหนึ่งครั้งของตัวเลข DeepSWE v1.1 — Google อ้างว่า 77.9% และเรียกมันว่าสุดยอดใหม่ของวงการ มันเป็นตัวเลขที่ผู้ขายรายงานเองและยังไม่มีการทำซ้ำจากภายนอก Google จนถึงวันนี้

จนถึงตอนนั้น การแบ่งแยกนี้ชัดเจนและชวนให้รู้สึกประชดประชันเล็กน้อย GPT-6 Sol คือโมเดลที่ได้รับการตรวจสอบยืนยันดีกว่า เร็วกว่า ถูกกว่าต่อหนึ่งงานที่ทำเสร็จ และเป็นตัวที่คุณเรียกใช้ได้บ่ายวันนี้ ส่วน Gemini 4 Argon คือโมเดลที่ได้คะแนนสูงกว่าบนกระดานอันดับที่ผู้ขายเลือกเผยแพร่ มีค่าใช้จ่ายในการใช้งานจริงสูงกว่าประมาณสองเท่า และยังไม่วางจำหน่าย การเลือกระหว่างสองตัวนี้ไม่ใช่การตัดสินเรื่องความสามารถ แต่เป็นการตัดสินว่าประโยคใดในสองประโยคนั้นอธิบายเดือนของคุณ

A capture of the Artificial Analysis model page for Gemini 4 Argon (High), dated September 2026 and credited to Google, marked a proprietary model. It reports an Artificial Analysis Intelligence Index score of 53, pricing of $2.00 per million input tokens and $10.00 per million output tokens with a 95% cache discount, an average cost of $1.99 per task on the Intelligence Index, a 1M-token context window, and text and image input.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube