
Gemini 4 Argon vs GPT-6 Sol: ราคาหนึ่งในห้า แต่บิลสี่เท่า
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
รันชุดดัชนี Artificial Analysis กับ Gemini 4 Argon แล้วมีค่าใช้จ่าย $2,407 รันชุดเดียวกันกับ GPT-6 Sol แล้วมีค่าใช้จ่าย $1,546 ดัชนีเดียวกัน งานเดียวกัน สัปดาห์เดียวกัน โมเดลทั้งสองมีราคาตามรายการเท่ากัน — $2.00 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น และ $10.00 ต่อโทเค็นเอาต์พุตหนึ่งล้านโทเค็น โดย Argon เป็นอัตราเปิดตัวที่ Google ระบุไว้ และ Sol เป็นอัตราปกติของ OpenAI — แต่ต้นทุนสุดท้ายของงานเดียวกันกลับต่างกัน 56% โดยเป็นผลดีต่อโมเดลที่ได้คะแนนต่ำกว่าห้าคะแนน ช่องว่างนี้คือเหตุผลทั้งหมดที่ทำให้การเปรียบเทียบนี้คุ้มค่าที่จะเขียน และมันไม่เกี่ยวอะไรกับเรตการ์ดเลย
Google ประกาศเปิดตัว Gemini 4 Argon เมื่อวันที่ 30 กันยายน 2026 โดยเรียกมันว่ายุคถัดไปของปัญญาประดิษฐ์ระดับแนวหน้า ราคาอยู่ที่ 2 ดอลลาร์สำหรับอินพุต และ 10 ดอลลาร์สำหรับเอาต์พุต โดยมีอินพุตที่แคชไว้ลด 95% และทยอยเปิดให้กับนักป้องกันไซเบอร์ที่เชื่อถือได้ผ่าน Fairwind Program GPT-6 Sol พร้อมใช้งานทั่วไปตั้งแต่ 22 กันยายน 2026 เมื่อ OpenAI เปิดตัวระดับกลางของสาย GPT-6 ในราคา 2 ดอลลาร์สำหรับอินพุต และ 10 ดอลลาร์สำหรับเอาต์พุต พร้อมส่วนลดแคช 90% ตัวหนึ่งซื้อได้แล้ววันนี้บนเอนด์พอยต์ที่เข้ากันได้กับ OpenAI ส่วนอีกตัวไม่มีใครนอกกลุ่มที่ระบุชื่อสามารถซื้อได้ ซึ่งเป็นทางแยกในทางปฏิบัติของบทความนี้ แต่การกลับทิศของต้นทุนข้างต้นยังคงอยู่แม้ว่าคุณจะไม่คำนึงถึงความพร้อมใช้งานโดยสิ้นเชิง และการเข้าใจว่าทำไมจึงเป็นส่วนที่มีประโยชน์
การกลับด้าน กล่าวอย่างตรงไปตรงมา
Artificial Analysis เผยแพร่ทั้ง Intelligence Index และบัญชีค่าใช้จ่ายในการรันดัชนีนั้น เมื่ออ่านรวมกันแล้ว สิ่งเหล่านี้บอกว่า:
• ดัชนี Intelligence Index — Gemini 4 Argon ได้ 52.6 เทียบกับ GPT-6 Sol 47.5 ช่องว่างห้าคะแนน โดย Argon ถูกตั้งค่าไว้ที่ระดับความพยายามสูง ส่วน Sol อยู่ที่ระดับสูงสุด ดังนั้นการเปรียบเทียบนี้จึงเอื้อประโยชน์ต่อ Sol มากกว่าต่อ Argon
• ราคาต่อล้านโทเค็น — เท่ากัน $2.00 ขาเข้า / $10.00 ขาออก ทั้งคู่ การอ่านแคชคือความแตกต่างเพียงอย่างเดียว: $0.10 บน Argon, $0.20 บน Sol
• ต้นทุนต่องานจัดทำดัชนี — Gemini 4 Argon $1.99 เทียบกับ GPT-6 Sol $1.05 โดย Argon มีต้นทุนต่องานสูงกว่าประมาณสองเท่า แม้จะมีต้นทุนต่อโทเคนเท่ากัน
• ค่าใช้จ่ายในการรันชุดทดสอบเต็มรูปแบบ — Gemini 4 Argon $2,407 เทียบกับ GPT-6 Sol $1,546
• ความเร็วเอาต์พุตที่วัดได้ — GPT-6 Sol 77.0 โทเคนต่อวินาที เทียบกับ Gemini 4 Argon 48.9 ซึ่งเป็นความแตกต่าง 1.6 เท่าที่ปรากฏทั้งในรูปของความหน่วงและค่าใช้จ่าย
มีบรรทัดหนึ่งในรายการนั้นที่อธิบายบรรทัดอื่น ๆ ทั้งหมด และมันไม่ใช่ราคา แต่เป็นจำนวนโทเคน บนงานของดัชนีเอง Gemini 4 Argon สร้างโทเคนเอาต์พุตประมาณ 561,000 โทเคนต่องาน ส่วน GPT-6 Sol สร้างประมาณ 282,000 โทเคน Argon ใช้เวลาคิดนานเป็นสองเท่าเพื่อตอบคำถามเดียวกัน และด้วยอัตราต่อโทเคนที่เท่ากัน นั่นก็เท่ากับค่าใช้จ่ายเป็นสองเท่าพอดี

ทำไมโทเคนจึงเป็นราคา
นี่คือข้อแก้ไขที่ควรค่าแก่การซึมซับให้เป็นความเข้าใจก่อนที่ใครจะตั้งงบประมาณสำหรับการโยกย้าย เพราะสัญชาตญาณมักวิ่งไปผิดทาง เมื่อโมเดลหนึ่งมีราคาเท่ากับคู่แข่งและใช้โทเคนเอาต์พุตเป็นสองเท่าเพื่อทำงานให้เสร็จ ราคาต่อโทเคนก็ไม่ใช่ราคาจริง ราคาคือราคาต่อโทเคนคูณด้วยจำนวนโทเคนที่โมเดลเลือกจะใช้ไม่ว่าจะมากเท่าใด และปัจจัยที่สองนั้นเป็นคุณสมบัติของโมเดล ไม่ใช่ของตารางราคา
อัตรากำไรของแต่ละงานแตกต่างกันมากอย่างมหาศาล ซึ่งยิ่งทำให้แย่ลงไปอีก — คุณไม่สามารถใช้ตัวคูณแบบคงที่แล้วเดินหน้าต่อได้:
• Terminal-Bench 4.0 — Argon 165,330 โทเค็นเอาต์พุตต่องาน เทียบกับ 97,372 ของ Sol โดย Argon มีค่าใช้จ่าย $6.78 ต่อหนึ่งงานตรงนี้ เทียบกับ $4.00 ของ Sol แม้ว่า Argon จะทำคะแนนได้ 57.1% เทียบกับ 43.9% ของ Sol
• CritPt — Argon ใช้ 109,533 โทเคน เทียบกับ 31,848 ของ Sol อัตราส่วนโทเคน 3.4 เท่าในงานที่จริง ๆ แล้ว Sol ได้คะแนน สูงกว่า คือ 30.9% ต่อ 27.1%
• GDPval — Argon 74,571 โทเคน เทียบกับ 41,567 ของ Sol โดยคิดเป็น $1.82 ต่อหนึ่งงาน เทียบกับ $1.32
• Omniscience — อัตราส่วนโทเคน 938 ต่อ 2,662 ที่เป็น ผลดีต่อ Argon, ในราคา $0.010 ต่องาน เทียบกับ $0.027 ของ Sol กลุ่มงานเดียวที่ทิศทางกลับกัน.
• การให้เหตุผลแบบบริบทยาว — Argon 2,197 โทเคน เทียบกับ 954 ของ Sol และเป็นเพียงงานเดียวในชุดทดสอบที่ Sol ชนะคะแนนอย่างชัดเจน 83.7% ต่อ 79.7%
CritPt คือตัวที่ให้บทเรียน โมเดลที่เผาผลาญโทเคนมากกว่าสามเท่าครึ่งเพื่อสร้างคำตอบที่แย่กว่าเล็กน้อยสำหรับคำถามเดียวกัน ไม่ใช่เรื่องราวของความสามารถ แต่เป็นเรื่องราวของนิสัยการใช้จ่าย การใช้เหตุผลของ Argon ยาวนาน และในงานบางรูปแบบ ความยาวนั้นแปลงเป็นคะแนน ส่วนในรูปแบบงานอื่นมันก็แค่แปลงเป็นเงินดอลลาร์ ค่า 52.6 ของดัชนีและค่า 47.5 ของ Sol เป็นค่าภาพรวม และค่าภาพรวมก็ซ่อนสิ่งนี้ไว้พอดี
ห้าคะแนนนั้นมาจริง ๆ จากไหน
เนื่องจากช่องว่างของดัชนีและช่องว่างของต้นทุนชี้ไปในทิศทางที่ตรงข้ามกัน จึงเป็นเรื่องที่ควรรู้ว่างานใดเป็นตัวขับเคลื่อนแต่ละอย่าง
• Terminal-Bench 4.0 — Gemini 4 Argon 57.1% เทียบกับ GPT-6 Sol 43.9% นับเป็นชัยชนะครั้งใหญ่ที่สุดเพียงครั้งเดียวของ Argon และเป็นกลุ่มงานที่ใกล้เคียงกับการเขียนโค้ดแบบเอเจนต์ระยะยาวมากที่สุด
• สัพพัญญุตภาพ — Gemini 4 Argon 42.4 เทียบกับ GPT-6 Sol 27.1 ช่องว่าง 15 จุดในด้านความครอบคลุมข้อเท็จจริง ซึ่งเป็นช่องว่างเชิงสัดส่วนที่ใหญ่ที่สุดในชุดการทดสอบ
• AutomationBench-AA — Gemini 4 Argon 77.5% เทียบกับ GPT-6 Sol 61.6%
• SciCode — Gemini 4 Argon 61.8% เทียบกับ GPT-6 Sol 57.6%
• Humanity's Last Exam — Gemini 4 Argon 57.1% เทียบกับ GPT-6 Sol 47.9%
• GDPval — Gemini 4 Argon 1,611 เทียบกับ GPT-6 Sol 1,487
• ApexAgents / AA-Briefcase — GPT-6 Sol 1,482.78 Elo เมื่อเทียบกับ 1,493.84 ของ Argon ซึ่งเป็นช่องว่าง 11 คะแนนที่อยู่ภายในช่วงความเชื่อมั่นที่เผยแพร่ และควรถือว่าเสมอกัน
• การให้เหตุผลเชิงบริบทยาว — GPT-6 Sol 83.7% เทียบกับ Gemini 4 Aron ชัยชนะที่ชัดเจนเพียงหนึ่งเดียวของ Sol
• CritPt — GPT-6 Sol 30.9% เทียบกับ Gemini 4 Argon 27.1% Sol ชนะอีกครั้งอย่างฉิวเฉียด
ดังนั้นภาพรวมจึงไม่ใช่ว่า "Argon ดีกว่า" แต่เป็นว่า Argon ดีกว่าในสองด้านที่สื่อเปิดตัวของมันชูเป็นจุดขายตั้งแต่แรก — การดำเนินงานทางธุรกิจแบบครบวงจร และวิศวกรรมซอฟต์แวร์ระยะยาว — ขณะที่ Sol นั้นอยู่ในระดับเดียวกันหรือนำกว่าในบันไดการให้เหตุผลแนววิชาการ และในการรักษาความสอดคล้องตลอดบริบทที่ยาว สำหรับผู้อ่านที่มีภาระงานเป็นไปป์ไลน์การค้นคืนด้วยพรอมป์ต์ขนาด 400K โทเคน Sol นั้นเป็นทั้งโมเดลที่ดีกว่าและถูกกว่าในเวลาเดียวกัน ซึ่งเป็นสถานะที่พบได้ยากและน่าอยู่ใจ
ความแตกต่างด้านข้อกำหนดที่คงอยู่ยืนนานกว่าการอภิปรายเรื่องเบนช์มาร์ก
• เอาต์พุตสูงสุด — Gemini 4 Argon 1,000,000 โทเค็นในเส้นทางการทำงานเดียว ซึ่ง Google ระบุว่าเป็นขนาดใหญ่ที่สุดในอุตสาหกรรม และเพิ่มขึ้นจากขีดจำกัด 64K ของรุ่นก่อน GPT-6 Sol 128,000 โทเค็น
• หน้าต่างบริบท — การ์ดข้อมูลของผู้จำหน่ายของ GPT-6 Sol ระบุไว้ที่ประมาณ 1,050,000 โทเคน ส่วนของ Argon อยู่ที่ 1,000,000 โทเคน Artificial Analysis วัดค่า Sol ได้ 872,000 โทเคนผ่านฮาร์เนสของตน ซึ่งเป็นการวัดจากฮาร์เนส ไม่ใช่ตัวเลขบนการ์ด — ให้ถือว่าการ์ดคือข้อกำหนด และตัวเลขจากฮาร์เนสคือสิ่งที่ผู้ประเมินได้ทดสอบจริง
• รูปแบบอินพุต — ทั้งสองรับข้อความ รูปภาพ และไฟล์ได้ วัสดุเปิดตัวของ Argon ยังเน้นไปที่ความเข้าใจวิดีโอความยาวมาก โดย Google อ้างว่าทำได้ 91.7% บน LVBench และอธิบายว่าอยู่ในระดับล้ำสมัยที่สุดในวงการ นั่นเป็นตัวเลขที่ผู้ขายรายงานเอง และยังไม่มีคณะกรรมการอิสระรายใดทำซ้ำผลนี้ได้
• อินพุตวิดีโอ — ไม่ชัดเจน Artificial Analysis แสดง Argon ในแผนภูมิโดยปิดอินพุตวิดีโอ และระบุวิดีโออย่างชัดเจนเมื่อเปิดตัว ขณะที่การ์ดของ Sol ไม่ได้ระบุวิดีโอเลย หากวิดีโอเป็นองค์ประกอบสำคัญที่ขาดไม่ได้ในไปป์ไลน์ของคุณ การ์ดทั้งสองใบก็ไม่ได้ให้คำตอบที่ชัดเจน และคุณควรทดสอบก่อนที่จะออกแบบสถาปัตยกรรม
• ความพยายามในการให้เหตุผล — Sol เปิดให้ตั้งค่าความพยายามได้ (ตั้งแต่ none จนถึง max ค่าเริ่มต้นคือ medium) ที่ระดับ API และถูกวัดผลที่ max ส่วน Argon ถูกวัดผลที่ high; ยังไม่มีใครเผยแพร่ชุดการทดสอบเดียวกันที่การตั้งค่าสูงสุดของมัน
เพดานเอาต์พุต 1M โทเคน คือสิ่งเดียวที่อาจเปลี่ยนสถาปัตยกรรมได้จริง ไม่ใช่แค่เปลี่ยนงบประมาณ อะไรก็ตามที่ตอนนี้คุณต้องแยกเป็นการเรียกแบบต่อเนื่องกันสิบสองครั้งเพื่อให้อยู่ใต้เพดาน 128K — ไม่ว่าจะเป็นชุดแพตช์หลายไฟล์ รายงานตรวจสอบฉบับเต็ม หรือเอกสารยาวที่ทำในรอบเดียว — จะกลายเป็นการเรียกเพียงครั้งเดียวที่มีจุดให้ลูปของเอเจนต์สูญเสียสถานะได้น้อยลง การที่มันจะคุ้มค่ากับต้นทุนต่องานที่เพิ่มเป็นสองเท่าหรือไม่นั้น ขึ้นอยู่ทั้งหมดกับว่าคุณมีภาระงานแบบนั้นหรือเปล่า ถ้ามี ก็คงคุ้มค่า ถ้าการเรียกของคุณเป็นแบบ classify-and-return เงินนั้นก็ถูกใช้ไปกับพื้นที่เผื่อที่ไม่มีใครจะใช้
การตั้งค่าความพยายามที่ไม่มีใครเทียบได้ และเหตุใดจึงสำคัญ
ข้อแม้หนึ่งข้อสมควรมีย่อหน้าเป็นของตัวเอง เพราะมันขัดกับการอ่านช่องว่างดัชนี 5 จุดว่าเป็นความแตกต่างด้านความสามารถล้วนๆ โดย Artificial Analysis จัดทำแผนภูมิ Gemini 4 Argon ที่ระดับสูงของความพยายามในการใช้เหตุผล และ GPT-6 Sol ที่ระดับสูงสุด สองระดับนี้ไม่ใช่ขั้นเดียวกันบนบันไดทั้งสองเส้น และทิศทางของความไม่ลงรอยกันนี้น่าสนใจ คือ Sol ถูกทดสอบที่การตั้งค่าแพงที่สุดของมัน ส่วน Argon อยู่ที่ระดับกลางๆ
มีสองการตีความตามมา และข้อมูลไม่สามารถแยกสองสิ่งนี้ออกจากกันได้ อีกทางหนึ่งคือ Argon ที่ max จะได้คะแนนสูงกว่า 52.6 — แต่ก็จะใช้โทเคนมากกว่า 561,000 ต่องาน และมีค่าใช้จ่ายมากกว่า $1.99 — หรือไม่ก็ได้คะแนนพอ ๆ กัน ซึ่งหมายความว่าปุ่มปรับความพยายามไม่ได้ทำอะไรมากนักในชุดทดสอบนี้ ไม่มีการรันที่เผยแพร่แล้วใดที่ชี้ขาดเรื่องนี้ได้ ใครก็ตามที่อ้างว่า 52.6 เป็นเพดานของ Argon กำลังอ้างถึงการตั้งค่า ไม่ใช่ตัวโมเดล และการตั้งค่านั้นคือแบบที่ผู้ขายเลือกจะเผยแพร่เป็นอันดับแรก
ตรรกะเดียวกันนี้ใช้กับ 47.5 ของ Sol เพียงแต่เป็นไปในทิศทางตรงกันข้าม: max อยู่บนสุดของลำดับรุ่น ดังนั้นตัวเลขนี้จึงใกล้เพดานมากกว่าพื้น การแข่งขันที่ยุติธรรมด้วยความพยายามที่เท่ากันอาจทำให้ช่องว่างแคบลง และอาจพลิกการเปรียบเทียบต้นทุนได้ด้วย เนื่องจากโทเคนที่ max ใช้ไปคือโทเคนที่มีราคา 10 ดอลลาร์ต่อล้าน
ทางแยกด้านความพร้อม ซึ่งเป็นตัวตัดสินคำตอบที่แท้จริง
Gemini 4 Argon ยังไม่เปิดให้ใช้ทั่วไป ประกาศของ Google ระบุว่ากำลังทยอยเปิดให้กับกลุ่มผู้ป้องกันไซเบอร์ที่เชื่อถือได้ผ่าน Fairwind Program ว่าบริษัทกำลังมีส่วนร่วมในกระบวนการเข้าถึงโมเดลก่อนเปิดตัวโดยสมัครใจของรัฐบาลสหรัฐฯ และว่าการเข้าถึงทั่วไปสำหรับนักพัฒนา องค์กร และผู้บริโภคจะมาถึง "โดยเร็วที่สุด" โดยเริ่มจากลูกค้า API แบบเสียค่าใช้จ่ายและผู้สมัครสมาชิก Google AI Ultra ยังไม่มีตัวระบุโมเดล ไม่มี endpoint ไม่มีโควตา และไม่มีวันที่ มันไม่มีอยู่ใน API สาธารณะใดๆ รวมถึงของเรา — ลองตรวจสอบแค็ตตาล็อกแล้วจะเจอ 404 เพราะยังไม่มีอยู่ที่นั่น
GPT-6 Sol เป็นผลิตภัณฑ์ที่เรียกใช้งานได้ บน OrcaRouter มันคือ openai/gpt-6-sol ซึ่งให้บริการบนเอนด์พอยต์ที่เข้ากันได้กับ OpenAI แบบเดียวกับโมเดลกว่า 200 ตัวอื่น ๆ ในแค็ตตาล็อก ในราคาตามรายการของ OpenAI ที่ส่งต่อถึงคุณโดยมีมาร์กอัปเป็นศูนย์ ดังนั้นราคา $2/$10 ข้างต้น และขั้นบันไดบริบทยาว 272,000 โทเคนที่ขึ้นเป็น $4/$15 จึงเป็นสิ่งที่คุณจ่ายจริง ไม่ใช่แค่ตัวเลขที่ใบอัตราค่าบริการอ้างไว้ การสลับไปยังผู้ให้บริการรายอื่นอัตโนมัติเมื่อเกิดความล้มเหลวรองรับกรณีที่เส้นทางเริ่มเสื่อมคุณภาพระหว่างการทำงาน และ DSL สำหรับกำหนดเส้นทางช่วยให้แอปพลิเคชันเดียวส่งทราฟฟิกการจำแนกประเภทที่มีต้นทุนต่ำไปยังโมเดลที่เล็กกว่า และส่งทราฟฟิกการให้เหตุผลที่ยากไปยัง Sol ได้โดยไม่ต้องใช้ SDK ตัวที่สอง

การจัดวางแบบสุดท้ายนั้นคือคำตอบที่ตรงไปตรงมาสำหรับการเปรียบเทียบนี้ในกรณีของทีมส่วนใหญ่ ข้อโต้แย้งเรื่องต้นทุนที่สนับสนุน Argon นั้นเป็นเรื่องจริง แต่มีเงื่อนไขอยู่ที่ภาระงานซึ่งงานของเอเจนต์ในระยะยาวเป็นปัจจัยหลัก ส่วนข้อโต้แย้งเรื่องต้นทุนที่ต่อต้านมันก็เป็นเรื่องจริงในภาระงานอื่น ๆ ทั้งหมด และไม่ว่าอย่างไรคุณก็ซื้อมันไม่ได้ในเดือนนี้ วิธีที่ประหยัดคือการสร้างชุดทดสอบประเมินผลตอนนี้ — พร้อมพรอมป์ของคุณเอง เกณฑ์การให้คะแนนของคุณเอง แล้วรันกับ Sol ที่การตั้งค่าความพยายามหลายระดับ — เพื่อว่าเมื่อ Argon เปิดให้ลูกค้า API แบบจ่ายเงิน คุณจะมีคำตอบที่วัดผลได้สำหรับคำถามที่คนอื่น ๆ จะตอบจากตารางจัดอันดับ
อะไรจะยุติเรื่องนี้ได้
สามสิ่ง เรียงตามลำดับว่าแต่ละอย่างจะเปลี่ยนคำตัดสินได้มากแค่ไหน การเปิดให้ใช้งานทั่วไปของ Argon ในราคาจริงที่ไม่ใช่ราคาเปิดตัว — คำว่า "เปิดตัว" หมายความว่า $2/$10 อาจเปลี่ยนแปลงได้ และลำดับของ Google เองก็ให้ความสำคัญกับลูกค้า API แบบเสียค่าใช้จ่ายก่อน ดังนั้นอัตราที่ประกาศครั้งแรกหลังการเปิดตัวคือสิ่งที่ต้องจับตา การทดสอบ Artificial Analysis ที่เผยแพร่ของ Argon ที่การตั้งค่าระดับความพยายามสูงสุด ซึ่งจะบอกว่า 52.6 เป็นเพดานหรือห่างจากเพดานแค่เส้นยาเดียว และการทำซ้ำโดยอิสระหนึ่งครั้งของตัวเลข DeepSWE v1.1 — Google อ้างว่า 77.9% และเรียกมันว่าสุดยอดใหม่ของวงการ มันเป็นตัวเลขที่ผู้ขายรายงานเองและยังไม่มีการทำซ้ำจากภายนอก Google จนถึงวันนี้
จนถึงตอนนั้น การแบ่งแยกนี้ชัดเจนและชวนให้รู้สึกประชดประชันเล็กน้อย GPT-6 Sol คือโมเดลที่ได้รับการตรวจสอบยืนยันดีกว่า เร็วกว่า ถูกกว่าต่อหนึ่งงานที่ทำเสร็จ และเป็นตัวที่คุณเรียกใช้ได้บ่ายวันนี้ ส่วน Gemini 4 Argon คือโมเดลที่ได้คะแนนสูงกว่าบนกระดานอันดับที่ผู้ขายเลือกเผยแพร่ มีค่าใช้จ่ายในการใช้งานจริงสูงกว่าประมาณสองเท่า และยังไม่วางจำหน่าย การเลือกระหว่างสองตัวนี้ไม่ใช่การตัดสินเรื่องความสามารถ แต่เป็นการตัดสินว่าประโยคใดในสองประโยคนั้นอธิบายเดือนของคุณ

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
