
Gemini 4 Argon vs GPT-6 Astra: สูสีกันบนดัชนี และราคาปรับลดลงสองในสามของระยะทาง
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 144 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
โมเดลระดับแนวหน้าสองตัวห่างกัน 0.11 คะแนนบนดัชนี Intelligence Index ของ Artificial Analysis โดย Gemini 4 Argon ได้ 52.56 คะแนน และ GPT-6 Astra ได้ 52.67 คะแนน หากคุณต้องเลือกระหว่างสองตัวนี้จากความสามารถทั่วไปที่วัดได้ คุณก็อาจโยนเหรียญตัดสินได้เลย และผลต่างระหว่างสองคะแนนก็ยังเล็กกว่าช่วงความเชื่อมั่นของคะแนนใดคะแนนหนึ่งเสียอีก นี่เป็นสถานการณ์ที่หาได้ยากจริง ๆ ในตลาดที่โมเดลสิบอันดับแรกมีคะแนนต่างกันรวมกันประมาณสิบห้าคะแนน และมันทำให้คู่นี้เป็นคู่ที่วิเคราะห์ง่ายที่สุดในบรรดาคู่เปรียบเทียบของ Gemini 4 Argon เพราะข้อโต้แย้งเรื่องความสามารถจบไปตั้งแต่ก่อนจะเริ่ม และสิ่งที่เหลืออยู่ก็มีเพียงเรื่องเศรษฐศาสตร์กับการเข้าถึง
ทว่านี่ไม่ใช่คู่แฝดกัน Argon ถูกประกาศเมื่อ 2026-09-30 โดย Google DeepMind และกำลังทยอยเปิดตัวเป็นระยะ เริ่มจากนักป้องกันไซเบอร์ที่ได้รับความไว้วางใจใน Fairwind Program ส่วน GPT-6 Astra เปิดตัวในต้นเดือนกันยายน — บัตรแคตตาล็อกของเราลงวันที่ 2026-09-04 ขณะที่ Artificial Analysis ระบุวันที่ 2026-09-03 — และเป็นเส้นทางที่ใช้งานได้จริงซึ่งคุณสามารถเรียกใช้ได้บ่ายนี้ในราคา 10 ดอลลาร์สำหรับอินพุต และ 50 ดอลลาร์สำหรับเอาต์พุตต่อล้านโทเคน พร้อมหน้าต่างบริบทขนาด 1,050,000 โทเคน และเพดานเอาต์พุต 128,000 โทเคน หนึ่งในโมเดลเหล่านี้มีราคาที่คุณสามารถถูกเรียกเก็บเงินได้ในวันนี้
ตรงไหนที่ 0.11 เป็นของจริง และตรงไหนที่เป็นแค่สัญญาณรบกวน
ดัชนีเป็นค่าผสม ดังนั้นโมเดลสองตัวที่ได้คะแนนเท่ากันในค่าผสมอาจแตกต่างกันอย่างมีนัยสำคัญในองค์ประกอบย่อยของมัน ในกรณีนี้ องค์ประกอบย่อยส่วนใหญ่สอดคล้องกัน โดยมีข้อยกเว้นสามประการที่ควรค่าแก่การเอ่ยถึง
• Terminal-Bench 4.0 — GPT-6 Astra 59.1% เทียบกับ Gemini 4 Argon 57.1% Astra นำอยู่เพียงเล็กน้อย
• การให้เหตุผลด้วยบริบทขนาดยาว — GPT-6 Astra 80.7% เทียบกับ Gemini 4 Argon 79.7%
• GPQA Diamond — GPT-6 Astra 96.1% Argon ไม่เผยแพร่ตัวเลขใด ๆ บนบอร์ดนี้
• CritPt — GPT-6 Astra 31.7% เทียบกับ Gemini 4 Argon 27.1%
• SciCode — Gemini 4 Argon 61.8% เทียบกับ GPT-6 Astra 56.5%
• ข้อสอบสุดท้ายของมนุษยชาติ — Gemini 4 Argon 57.1% เทียบกับ GPT-6 Astra 54.7%
• AutomationBench-AA — Gemini 4 Argon 77.5% เทียบกับ GPT-6 Astra 68.5%
• GDPval — Gemini 4 Argon 1,611 เทียบกับ GPT-6 Astra 1,542
• ความรอบรู้ — GPT-6 Astra 43.4 เทียบกับ Gemini 4 Argon 42.4
• ITBench-SRE — GPT-6 Astra 48.6% เทียบกับไม่มีตัวเลขที่เผยแพร่ของ Argon
• ความเร็วเอาต์พุต — GPT-6 Astra 51.2 โทเคนต่อวินาที เทียบกับ Gemini 4 Argon 48.9 ถือว่าอยู่ในระดับเดียวกัน
• ความหน่วงของโทเคนแรกบนชุดทดสอบ index — Gemini 4 Argon 2.8 วินาที เทียบกับ GPT-6 Astra 320.2 วินาที
Astra มีความได้เปรียบในด้านการให้เหตุผลแบบปรนัยเชิงวิทยาศาสตร์ ในโจทย์ฟิสิกส์จุดวิกฤต และในเกณฑ์มาตรฐาน SRE ส่วน Argon มีความได้เปรียบในด้านการเขียนโค้ดเชิงวิทยาศาสตร์ ในชุดงานแบบครบวงจรที่ยากขึ้น และในงานที่วัดมูลค่าด้วย GDP ความได้เปรียบของทั้งสองฝ่ายไม่มากพอที่จะใช้เป็นพื้นฐานของการย้ายระบบด้วยตัวเอง

ส่วนค่าเวลาแฝงนั้นเป็นอีกเรื่องหนึ่ง 320 วินาทีถึงโทเคนแรกคือความเงียบห้านาทีครึ่งก่อนที่จะมีการปล่อยสิ่งใดออกมา เมื่อเทียบกับไม่ถึงสามวินาทีสำหรับ Argon ทั้งสองวัดสิ่งเดียวกัน — เวลาถึงชังก์แรกในการรันดัชนีของ Artificial Analysis — ดังนั้นจึงเปรียบเทียบกันได้ การให้เหตุผลของ Astra เปิดอยู่เสมอ และปรับได้ตั้งแต่ low ไปจนถึง max effort; การรันที่ใช้ max effort กับงานยากจะใช้เวลาคิดหลายนาทีจริง ๆ ก่อนจะพูด การที่ถือว่านั่นเป็นข้อบกพร่องหรือไม่นั้น ขึ้นอยู่กับอินเทอร์เฟซของคุณทั้งหมด สำหรับงานแบบแบตช์ มันไม่กระทบอะไรเลย สำหรับอะไรก็ตามที่มีผู้ใช้คอยจ้องไอคอนหมุนอยู่ มันคือความแตกต่างที่ผู้ใช้มองเห็นได้ชัดเจนที่สุดระหว่างสองโมเดลนี้ มากกว่าช่องว่าง benchmark ใด ๆ บนหน้านั้น
ขั้นราคา ซึ่งเป็นหัวข้อที่แท้จริง
นี่คือจุดที่ความเสมอกันแตกออก และมันแตกในลักษณะที่จำลองผิดได้ง่าย เพราะเรตการ์ดของ Astra มีสามระดับที่ดูคล้ายกัน
• มาตรฐาน สูงสุด 272,000 โทเค็นอินพุต — GPT-6 Astra $10.00 รับ / $50.00 ส่ง, การอ่านแคชที่ $1.00, การเขียนแคชที่ $12.50
• คอนเท็กซ์ยาว เกิน 272,000 โทเคนอินพุต — GPT-6 Astra $20.00 ขาเข้า / $75.00 ขาออก, การอ่านที่แคชไว้ $2.00 ทั้งคำขอจะถูกคิดราคาใหม่ในระดับที่สูงกว่า ไม่ใช่แค่ส่วนที่เกิน: อินพุต 2× และเอาต์พุต 1.5×
• โหมดเร็ว — 2× ของอัตรามาตรฐานที่เกี่ยวข้อง ดังนั้น $20.00 ขาเข้า / $100.00 ขาออก นี่คือตัวเลข $100 ที่มักถูกยกมาอ้างราวกับว่าเป็นอัตราสำหรับบริบทแบบยาว ซึ่งไม่ใช่
• Gemini 4 Argon — ขาเข้า $2.00 / ขาออก $10.00 แบบคงที่ตามเกณฑ์แนะนำเริ่มต้น, อินพุตที่แคชไว้ที่ $0.10 โดยไม่มีขั้นที่ประกาศไว้และไม่มีระดับ fast ที่ประกาศไว้
ดังนั้น Argon จึงถูกกว่าถึงห้าเท่าในด้านอินพุต และถูกกว่าห้าเท่าในด้านเอาต์พุต เมื่อเทียบกับระดับมาตรฐานของ Astra และถูกกว่าถึงสิบเท่าในด้านอินพุตที่สูงกว่า 272K การวัดต้นทุนสองแบบที่เป็นอิสระต่อกันให้ข้อสรุปเดียวกันจากอีกมุมหนึ่ง: Artificial Analysis ระบุว่า Argon อยู่ที่ $1.99 ต่องานดัชนี เทียบกับ $3.26 ของ Astra และ $2,407 สำหรับการรันดัชนีทั้งหมด เทียบกับ $5,324 ของ Astra อัตราส่วนต่องานที่ได้นั้นน้อยกว่าอัตราส่วนต่อโทเคนด้วยเหตุผลเดียวกันกับที่เคยเป็นเมื่อเทียบกับ DeepSeek — Argon ใช้โทเคนน้อยกว่าในการทำงานให้เสร็จ — แต่ก็ยังอยู่ที่ 1.6 เท่า
บอร์ดถ่วงน้ำหนักด้วย GDP ของ Vals บอกเล่าเรื่องเดียวกันในเวอร์ชันที่สาม: Argon อยู่อันดับแรกที่ 68.90% และ $15.68 ต่อการรัน ส่วน Astra อยู่อันดับที่หกที่ 63.13% และ $18.46 Astra มีราคาแพงกว่าและได้คะแนนต่ำกว่าในบอร์ดนั้น เอกสารของ Google ระบุชัดเจนว่าราคานี้เป็นอัตราเริ่มต้น ซึ่งเป็นคำที่หมายความว่ามันสามารถเปลี่ยนแปลงได้ และการตีความอย่างตรงไปตรงมาคือ ข้อได้เปรียบด้านราคาของ Argon นั้นเป็นเรื่องจริง แต่ความถาวรของมันไม่ได้รับประกัน
ข้อเท็จจริงด้านสถาปัตยกรรมสองข้อที่ชี้ขาดมากกว่าผลเบนช์มาร์ก

เริ่มที่เพดานเอาต์พุตก่อน Gemini 4 Argon สร้างได้ถึง 1,000,000 โทเคนในหนึ่งทราเจกทอรีเดียว — ประกาศของ Google ระบุว่านี่เป็นการขยายจาก 64K ในรุ่นก่อนหน้า GPT-6 Astra จำกัดไว้ที่ 128,000 ทั้งคู่มีหน้าต่างบริบทราวหนึ่งล้านโทเคน ดังนั้นนี่จึงเป็นเรื่องของปริมาณที่โมเดลเขียนได้ในครั้งเดียวล้วน ๆ สำหรับการสร้างเนื้อหายาว การแก้โค้ดแบบเต็มแพตช์ หรือการร่างเอกสารในรอบเดียว นั่นคือความแตกต่างแปดเท่าในสิ่งที่การเรียกหนึ่งครั้งสามารถผลิตได้ สำหรับแชต การสกัดข้อมูล และขั้นตอนเอเจนต์สั้น ๆ เพดานทั้งสองถือว่าไม่มีที่สิ้นสุดในทางปฏิบัติ และความแตกต่างนั้นไม่ทำให้คุณเสียอะไรเลย
ด้านรูปแบบข้อมูล (modality) มาเป็นลำดับที่สอง และในจุดนี้ ข้อได้เปรียบกลับไปอีกทางหนึ่งในแง่หนึ่ง GPT-6 Astra รองรับข้อความ รูปภาพ และไฟล์ ส่วน Gemini 4 Argon รองรับข้อความ รูปภาพ วิดีโอ และไฟล์ และสื่อเปิดตัวของ Google เน้นไปที่ความเข้าใจวิดีโอความยาวมากโดยเฉพาะ — โดยอ้างตัวเลข LVBench ที่ 91.7% ซึ่งเป็นข้อมูลที่ผู้ขายรายงานเอง หากไปป์ไลน์ของคุณนำวิดีโอเข้ามาประมวลผล Astra ไม่ใช่ตัวแทนทดแทนได้ ส่วนเสียงก็ไม่ได้ถูกระบุไว้ในรายการรูปแบบข้อมูลที่เผยแพร่ของ Argon เช่นกัน ดังนั้นอย่าสันนิษฐานว่าการอัปเกรดครั้งนี้รองรับเสียงด้วย
สิ่งที่ควรทำจริงๆ
Astra พร้อมใช้งานแล้ว แต่ Argon ยังไม่พร้อม และนั่นก็ปิดจบการตัดสินใจส่วนใหญ่สำหรับเดือนหน้า แนวทางที่เป็นรูปธรรมซึ่งไม่ทำให้งานเสียเปล่า: สร้างบน GPT-6 Astra หากภาระงานของคุณต้องการโมเดลให้เหตุผลที่ทำงานตลอดเวลา มีความแม่นยำทางวิทยาศาสตร์สูง และมีบันทึกผลงานด้านเอเจนต์ที่พิสูจน์แล้ว เก็บชื่อโมเดลไว้ในคอนฟิกูเรชัน และตั้งค่าทามเอาต์ของไคลเอนต์จากพฤติกรรมที่วัดได้จริงของ Astra แทนที่จะตั้งจากความมองโลกในแง่ดี — การรันที่กว่าจะได้โทเคนแรกใช้เวลาห้านาทีจะทำให้ทามเอาต์เริ่มต้นที่ 60 วินาทีสะดุด และสตรีมที่ตายตอน 300 วินาทีก็ดูเหมือนระบบล่ม หากคุณไวต่อต้นทุนเมื่ออินพุตเกิน 272K โทเคน ให้จำลองการปรับราคาอย่างชัดเจนก่อนตัดสินใจ เพราะขั้นบันไดนี้ทำให้อินพุตเป็นสองเท่าและเพิ่มเอาต์พุตขึ้นครึ่งหนึ่งในจุดแบ่งเดียว

ทางสายกลางที่น่าสนใจคือคุณไม่จำเป็นต้องเลือกค่าเริ่มต้นเพียงตัวเดียว Astra และ Argon — เมื่อ Argon เปิดให้บริการ — เป็นโมเดลรูปร่างเดียวกันที่มุ่งเป้าไปยังงานประเภทเดียวกัน ซึ่งทำให้ทั้งสองเป็นพันธมิตรด้านการสลับสำรองตามธรรมชาติ มากกว่าจะเป็นคู่แข่งกันในตำแหน่งเดียวกัน บน OrcaRouter, openai/gpt-6-astra เปิดให้ใช้งานแล้วในราคาตามที่ผู้ให้บริการประกาศ โดยไม่บวกเพิ่มใด ๆ บนปลายทางที่เข้ากันได้กับ OpenAI เดียวกับ โมเดลอื่นอีกกว่า 200 รายการ, พร้อมด้วย การสลับสำรองอัตโนมัติข้ามผู้ให้บริการ และ DSL สำหรับจัดเส้นทางเพื่อกำหนดรูปแบบหลักและสำรองบนคีย์เดียว เมื่อ Argon เข้ามาในแคตตาล็อกด้วย id ใดก็ตามที่ Google ประกาศ การสลับก็เป็นเพียงสตริง — ไม่มีสัญญาที่สอง ไม่มีงานเชื่อมต่อระบบ และไม่ต้องสร้างสิ่งที่คุณสร้างขึ้นรอบ Astra ใหม่ในระหว่างนั้น
อะไรจะตัดสินชี้ขาดได้อย่างถาวร
ราคา Argon ที่เปิดเผยหลังช่วงเปิดตัว และการทำซ้ำอย่างอิสระต่อข้ออ้างด้านเอเจนต์ของ Google — ตัวเลข 77.9% ของ DeepSWE v1.1 และผลลัพธ์ 68% ของ CWE-bench v1 ต่างเป็นข้อมูลที่ผู้ขายรายงานเอง และไม่มีผลการรันจากภายนอกอยู่เบื้องหลังเลย ไม่ว่าจะเรื่องใดก็อาจทำให้ Argon ขยับขึ้นหรือลงอย่างมีนัยสำคัญ เพราะการนำ 0.11 จุดในดัชนีไม่ใช่กันชนต่อความเสียเปรียบด้านต้นทุน 1.6 เท่า หากความได้เปรียบด้านต้นทุนกลายเป็นเพียงชั่วคราว และก็ไม่ใช่การเป็นรอง หาก Google คงราคาเปิดตัวไว้ และระดับ long-context ของ Astra ส่งผลรุนแรงกว่าที่คาดในการใช้งานจริง
สำหรับตอนนี้: เมื่อวัดจากความสามารถทั่วไปที่วัดได้ สองตัวนี้เป็นโมเดลเดียวกันในตัวห่อสองแบบ Astra คือตัวที่มีเส้นทางใช้งานจริง มีขั้นราคาที่รู้อยู่แล้ว และมีช่วงพักคิดห้านาที Argon คือตัวที่มีการ์ดราคาถูกกว่าและไม่มีเอนด์พอยต์ การเสมอกันนี้เป็นเรื่องจริง และฝั่งหนึ่งของมันซื้อได้
