
GPT-5.6 เทียบ Grok 4.6: ระดับเดียวกันบนดัชนี แต่ต่างกันที่บริบทและราคา
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123ความฉลาด49การเขียนโค้ด
บนมาตราวัด Artificial Analysis Intelligence Index ซึ่งใช้เป็นเกณฑ์วัดทั้งคู่จนถึงต้นเดือนกันยายน 2026 GPT-5.6 ของ OpenAI — ซึ่งเทียร์เรือธงอย่าง GPT-5.6 Sol เป็นปลายทางที่ชื่อ API ว่า gpt-5.6 เรียกใช้ — และ Grok 4.6 ของ SpaceXAI ทำคะแนนได้เท่ากันที่ 61 การที่ดัชนีอิสระจัดให้เรือธงคู่แข่งสองรุ่นเสมอกันถือเป็นผลลัพธ์ที่หายากที่สุดชนิดหนึ่งในการเปรียบเทียบระดับแนวหน้า และนี่คือจุดที่การประมือครั้งนี้น่าสนใจขึ้น ไม่ใช่จุดที่จบลง โมเดลทั้งสองที่เสมอกันนี้มีรูปแบบการจำหน่ายที่ต่างกันมาก GPT-5.6 Sol ซึ่งเป็นเรือธงที่ OpenAI เปิดตัวเมื่อวันที่ 9 กรกฎาคม และปรับตำแหน่งเป็นเทียร์คุ้มค่า (value tier) เมื่อ GPT-6 Astra เปิดตัวเมื่อวันที่ 3 กันยายน ตั้งราคาไว้ที่ $4.00 ต่อล้านโทเคนอินพุต และ $20.00 ต่อล้านโทเคนเอาต์พุต หลังปรับลดราคาเมื่อวันที่ 24 สิงหาคม และอ่านบริบทได้สูงสุดประมาณ 1.05 ล้านโทเคน ส่วน Grok 4.6 ที่ xAI เปิดตัวเมื่อวันที่ 12 สิงหาคม ตั้งราคาไว้ที่ $2.00 / $6.00 และรองรับสูงสุด 500,000 โทเคน ทั้งคู่ได้คะแนนเท่ากันบนกระดานอิสระ แต่แล้วโมเดลทั้งสองก็แยกทางกันในแง่ที่ว่าคุณจะดันคำขอเดียวได้ไกลแค่ไหน — และการดันมันไปไกลนั้นต้องแลกมาด้วยค่าใช้จ่ายเท่าไร
หน้านี้เกิดขึ้นมาเพราะเหตุผลที่เป็นรูปธรรม: อัตราค่าบริการสองรายการและเพดานราคาสองรายการขยับตัวภายในช่วงเวลาที่ห่างกันเพียงไม่กี่สัปดาห์ Grok 4.6 เปิดตัวเมื่อวันที่ 12 สิงหาคม และในวันที่ 28 สิงหาคมก็พร้อมใช้งานในแชต Grok ทั่วไปบนเว็บและมือถือ หลังจากที่ถูกจำกัดเฉพาะใน Grok Build และ API ในช่วงสองสัปดาห์แรก โปรโมชันลดราคาของ GPT-5.6 Sol มีผลวันที่ 24 สิงหาคม และสิบวันต่อมา การเปิดตัว GPT-6 Astra ก็ลดสถานะของ Sol จากเรือธง (flagship) ลงเป็นเรือธงระดับคุ้มค่า (value flagship) อย่างเงียบ ๆ โมเดลทั้งสองด้านล่างนี้คือสิ่งที่คุณจะเลือกใช้เมื่อต้องการความสามารถด้านการให้เหตุผลระดับใกล้เคียง frontier โดยไม่ต้องจ่ายในราคาระดับ Astra — ซึ่งเป็นเหตุผลที่ว่าทำไมการเสมอกันที่ 61 ต่อ 61 จึงกลายเป็นจุดตัดสินใจที่มีผลจริง ไม่ใช่เพียงแค่คำถามเชิงความรู้
'เสมอที่ 61' หมายความว่าอย่างไร และไม่หมายความว่าอย่างไร
คะแนนต้องมีวันและไม้บรรทัดกำกับ Artificial Analysis วัด GPT-5.6 Sol ไว้ที่ ~61 และ Grok 4.6 ที่ 61 บนมาตราดัชนีที่ใช้จนถึงต้นเดือนกันยายน — มาตราเดียวกันกับที่บทความในบล็อกนี้อ้างอิงในการจับคู่ GPT-5.6 อื่น ๆ — โดย Grok อยู่อันดับที่ 11 จาก 202 โมเดลที่ AA ติดตาม และ Sol อยู่ห่างจากมันไม่กี่อันดับด้วยคะแนนเท่ากัน ต่อมา AA ได้ปรับเทียบดัชนีใหม่ในวันที่ 7 กันยายน (v4.3) ซึ่งเป็นเวอร์ชันที่บีบอัดคะแนนให้แคบลง: GPT-5.6 Sol วัดได้ 47 ในมาตราดังกล่าว GPT-6 Astra และ Claude Fable 5.1 วัดได้ 53 และยังไม่มีการเผยแพร่คะแนนรวมของ Grok 4.6 บนมาตราอีกเลย ดังนั้นการเสมอกันด้านล่างจึงเป็นข้อความเกี่ยวกับมาตราของเดือนกันยายนก่อนการปรับเทียบใหม่ และควรอ่านเป็นตำแหน่งสัมพัทธ์: บนดัชนีล่าสุดที่ให้คะแนนทั้งคู่ สองรุ่นนี้อยู่ในระดับเดียวกัน และทั้งคู่อยู่รองจากคลาส Claude Opus 5 เพียงเล็กน้อย
ข้อควรระวังอีกข้อเกี่ยวกับผลเสมอ และมันมีผลต่อวิธีที่คุณนำไปใช้ คะแนนทั้งสองถูกสร้างขึ้นที่การตั้งค่าระดับความพยายามที่ต่างกัน — GPT-5.6 Sol ที่ระดับการใช้เหตุผลสูงสุด ซึ่งเป็นระดับสูงสุดของ OpenAI (ที่รันตัวแทนย่อยสี่ตัวแบบขนานสำหรับคำขอที่ยาก) และ Grok 4.6 ที่ระดับ high ซึ่งเป็นค่าเริ่มต้นของ xAI บนสเกล low ถึง xhigh ทั้งคู่เป็นการตั้งค่าแบบ "ทุ่มสุดตัว" แต่ไม่ใช่การตั้งค่าเดียวกัน และผลเสมอคือระหว่างสองการตั้งค่าเฉพาะนี้เท่านั้น ไม่ใช่ระหว่างทุกการตั้งค่าที่โมเดลมีให้ สิ่งที่คะแนนที่เท่ากันยืนยันคือ ไม่มีโมเดลใดมีความได้เปรียบด้านปัญญาทั่วไปที่อีกฝ่ายจะชี้ชัดบนค่าคะแนนรวมจากแหล่งอิสระ — ดังนั้นผู้ซื้อที่ต้องเลือกระหว่างสองโมเดลนี้จึงต้องมองข้ามดัชนีไป พิจารณาที่บริบท ราคา และหลักฐานที่แต่ละฝ่ายสามารถแสดงได้จริง
เรตการ์ดสองใบ หน้าผาสองแห่ง
ผู้ให้บริการทั้งสองรายเรียกเก็บเงินสำหรับพรอมพ์ที่ยาวเป็นเหตุการณ์ระดับพรีเมียม และทั้งคู่เรียกเก็บเงินทั้งคำขอในระดับราคาที่สูงขึ้นเมื่อผ่านเกณฑ์ที่กำหนด — นั่นคือกลไกร่วมที่ทำให้การเปรียบเทียบราคานี้ชัดเจน อัตราของ OpenAI สำหรับ GPT-5.6 Sol คือ $4.00 / $20.00 ต่อล้าน โดยการอ่านจากแคชอยู่ที่ $0.40 และเมื่อคำขอผ่านประมาณ 272K โทเคนอินพุต ทั้งคำขอจะถูกคิดราคาใหม่เป็น $8.00 / $30.00 — โครงสร้างบริบทแบบยาวที่ Epoch AI บันทึกไว้เมื่อวันที่ 8 กันยายน อัตราของ xAI สำหรับ Grok 4.6 คือ $2.00 / $6.00 โดยการอ่านจากแคชอยู่ที่ $0.50 และเมื่อพรอมพ์ผ่าน 200K โทเคน ทั้งคำขอจะเปลี่ยนเป็น $4.00 / $12.00
• เผยแพร่ — GPT-5.6: 9 กรกฎาคม 2026 (API สาธารณะ; alias ของ gpt-5.6 เข้าถึงระดับ Sol) Grok 4.6: 12 สิงหาคม 2026.
• ราคาต่อ 1M (อินพุต / เอาต์พุต) — GPT-5.6 Sol: $4.00 / $20.00, การอ่านแคช $0.40 (โปรโมชันจนถึงอย่างน้อย 21 พ.ย. 2026). Grok 4.6: $2.00 / $6.00, การอ่านแคช $0.50.
• ระดับคำสั่งยาว — GPT-5.6 Sol: คำขอทั้งหมดคิดเป็น $8.00 / $30.00 สำหรับอินพุตเกิน ~272K ส่วน Grok 4.6: คำขอทั้งหมดคิดเป็น $4.00 / $12.00 ที่อินพุต 200K
• บริบท / เพดานเอาต์พุต — GPT-5.6 Sol: อินพุต ~1.05M, เอาต์พุต 128K. Grok 4.6: อินพุต 500K, ไม่มีเพดานเอาต์พุตที่เผยแพร่
• ดัชนี (อิสระ) — GPT-5.6 Sol (สูงสุด) ~61 เทียบกับ Grok 4.6 (สูง) 61 ตามมาตราส่วนเดือนกันยายนก่อนการปรับเทียบใหม่
• โมดาลิตี — ทั้งสองยอมรับข้อความและรูปภาพเป็นอินพุต และให้ผลลัพธ์เป็นข้อความ
ลองคำนวณตัวเลขที่ได้มา แล้วรูปแบบก็ชัดเจนไม่กำกวม: สำหรับความยาวพรอมพ์ทุกระดับที่ Grok 4.6 รองรับได้ มันเป็นตัวเลือกที่ถูกกว่า เพราะเพดานราคาที่ปรับใหม่ของมันยังอยู่ที่หรือต่ำกว่าอัตรามาตรฐานของ GPT-5.6 Sol
• 100K เข้า / 8K ออก — GPT-5.6 Sol: 0.10 × $4 + 0.008 × $20 = $0.56. Grok 4.6: 0.10 × $2 + 0.008 × $6 = $0.25. Grok ถูกกว่าประมาณ 55% สำหรับคำขอนี้
• 400K อินพุต / 30K เอาต์พุต (ปรับราคาใหม่ทั้งคู่) — GPT-5.6 Sol: 0.40 × $8 + 0.03 × $30 = $4.10. Grok 4.6: 0.40 × $4 + 0.03 × $12 = $1.96. Grok ยังมีราคาประมาณครึ่งหนึ่ง แม้หลังคิดหน้าผาราคาของตัวเองแล้วก็ตาม
• 600K in / 30K out — GPT-5.6 Sol: 0.60 × $8 + 0.03 × $30 = $5.70 Grok 4.6: ไม่สามารถ — 600K เกินกว่าหน้าต่างบริบท 500K ของมัน นี่คือช่วงที่ Sol เป็นตัวเลือกเดียว และเป็นจุดที่ราคาของมันไม่ดูพรีเมียมอีกต่อไป

ธรณีวิทยาของหน้าผาราคาแตกต่างกันในด้านหนึ่งที่เอื้อต่อ GPT-5.6 Sol: เกณฑ์ของมัน (272K) อยู่สูงกว่าเกณฑ์ของ Grok (200K) ดังนั้นจึงมีแถบช่วงหนึ่ง — กล่าวคืออินพุตประมาณ 200K ถึง 272K — ที่ Grok ได้ปรับราคาใหม่แล้วแต่ Sol ยังไม่ได้ปรับ แม้ในแถบนั้น Grok ก็ยังมักจะชนะในด้านเงินดอลลาร์ เนื่องจากอัตราการส่งออกที่ปรับราคาแล้วที่ $12 ยังต่ำกว่าราคามาตรฐานของ Sol ที่ $20 อยู่ 40% เศรษฐศาสตร์จะพลิกมาเอื้อต่อ Sol ก็ต่อเมื่อเกิน 500K โทเคน ซึ่งเป็นบริเวณที่หน้าต่างบริบทของ Grok เข้าไม่ถึงพอดี หากความยาวพรอมพ์ของคุณอยู่ต่ำกว่า 200K — ซึ่งเป็นจริงสำหรับการรับส่งข้อมูลแชท RAG และการช่วยเขียนโค้ดส่วนใหญ่ — Grok 4.6 จะประหยัดกว่าเมื่อใช้งานในขนาดใหญ่ เกือบสองเท่าของต้นทุนรวมเฉลี่ย และหน้าผาราคาแบบทั้งคำขอหมายความว่าคุณควรถือว่า 200K เป็นเส้นขอบเขตการวางแผน ไม่ใช่เพียงข้อเสนอแนะแบบอ่อน ๆ
โทเคนพิเศษครึ่งล้านของ Sol จริงๆ แล้วมีไว้เพื่ออะไร
หน้าต่างบริบท 500K ของ Grok 4.6 ครอบคลุมงานจริงมากกว่าที่สเปกชีทแนะนำ — การอ่านโค้ดทั้งฐาน, บันทึกเอเยนต์แบบยาว, บริบทการดึงข้อมูลขนาดใหญ่ — และการที่ไม่มีการเปิดเผยขีดจำกัดเอาต์พุตก็ช่วยในด้านการสร้าง: สำหรับการเรียกครั้งเดียวที่ต้องส่งออกอาร์ติแฟกต์ที่ยาวมาก Grok ไม่มีเพดานที่บันทึกไว้ ขณะที่ GPT-5.6 Sol หยุดที่ 128K โทเคนเอาต์พุต ข้อได้เปรียบของ GPT-5.6 Sol อยู่ในช่วง 500K ถึง 1.05M และงานที่จำเป็นจริงๆ นั้นแคบกว่าที่การตลาดบอกเป็นนัย: เอเยนต์ที่เก็บทั้งรีพอซิทอรีและประวัติงานยาวในบริบท, บันทึกการประชุมหรืองานวิจัยที่ยาวมากซึ่งวิเคราะห์ในรอบเดียว, และงานดึงข้อมูลจากคลังข้อมูลที่ใหญ่เกินกว่าจะแบ่งชิ้นเป็นหน้าต่างขนาดของ Grok ได้ หากไปป์ไลน์ของคุณไม่มีตัวใดแตะช่วงนั้น บริบทพิเศษของ Sol คือพื้นที่สำรองที่คุณจ่ายในอัตราอินพุต $4.00 เพื่อไม่ใช้
โมเดลทั้งสองยังกำหนดทิศทางการให้เหตุผลต่างกันด้วย GPT-5.6 Sol มีแถบปรับระดับความพยายามแบบ low / medium / high / max โดยที่ระดับ max จะเรียกใช้ตัวแทนย่อยสี่ตัวแบบขนานที่ประสานงานกันในงานยาก — กล่าวคือเป็นฝูงตัวแทนขนาดเล็กสำหรับคำขอยากแต่ละอัน ซึ่งทรงพลังแต่ใช้โทเคนเอาต์พุตจำนวนมาก และเป็นค่าตั้งที่อยู่เบื้องหลังคะแนนดัชนี ~61 ส่วน Grok 4.6 ใช้โมเดลเดียวพร้อมแถบปรับระดับจาก low ถึง xhigh (ค่าเริ่มต้นคือ high) และเครื่องมือฝั่งเซิร์ฟเวอร์สำหรับการค้นหาและการรันโค้ด ซึ่งทำให้พฤติกรรมของมันคาดเดาได้ง่ายกว่าในแง่งบประมาณ: หนึ่งคำขอ หนึ่งโมเดล ค่าใช้จ่ายที่คุณสามารถประมาณได้จากเอกสารอัตราค่าบริการ สำหรับนักพัฒนาที่ต้องการค่าใช้จ่ายที่แน่นอน การออกแบบโมเดลเดียวของ Grok นั้นเรียบง่ายกว่าในเชิงปฏิบัติการ ส่วนสำหรับงานระยะยาวที่ยากที่สุด ฝูงตัวแทนระดับ max ของ Sol คือการกำหนดค่าที่มีความสามารถมากกว่า — และนี่คือเหตุผลที่คะแนนดีที่สุดและค่าใช้จ่ายที่แพงที่สุดมาจากค่าตั้งเดียวกัน
หลักฐานที่แต่ละฝ่ายสามารถแสดงได้จริง
ทั้งสองโมเดลไม่มีข้อได้เปรียบด้านชาร์ตคะแนนการเขียนโค้ดแบบวัดจากภายนอก หลักฐานที่อ้างอิงได้จึงแยกกันตามผู้พัฒนา OpenAI รายงานว่า GPT-5.6 Sol ได้ประมาณ 96% บน SWE-bench Verified — ซึ่งเป็นข้อมูลอ้างอิงด้านการเขียนโค้ดที่แข็งแกร่งที่สุดที่โมเดลตัวใดจะแสดงได้ แต่ก็ยังเป็นการประเมินที่เผยแพร่โดยไม่มีผลตรวจสอบอิสระ — และจุดแข็งในโลกจริงของ Sol คือการอยู่ภายในเครื่องมือ Codex และ ChatGPT ส่วน xAI รายงานว่า Grok 4.6 ได้ 94.9% บน GPQA Diamond ซึ่งทางบริษัทระบุว่าเป็นคะแนนสูงสุดที่เคยทดสอบบนเกณฑ์ชี้วัดนั้น และอ้างการประเมินเชิงเอเจนต์ที่มีต้นทุนค่า API เฉลี่ยราว 0.84 ดอลลาร์ต่องานที่ครอบคลุม ตัวเลขทั้งสองเป็นตัวเลขจากผู้พัฒนาทั้งคู่ ในด้านความเร็ว ทั้งสองโมเดลใกล้กันกว่าที่ช่องว่างด้านราคาบ่งชี้: AA วัด Grok 4.6 ได้ 64.9 โทเค็นเอาต์พุตต่อวินาที และ GPT-5.6 Sol อยู่ในช่วงกลาง 60 ในระดับเดียวกันบนบริการมาตรฐาน ขณะที่พรีวิว 'Ultrafast' ที่ใช้ Cerebras แยกต่างหากของ OpenAI (สูงสุดราว 750 โทเค็นต่อวินาที) ยังถูกจำกัดและไม่มีการกำหนดราคา ให้อ่านตารางหลักฐานทั้งหมดได้ว่า: คะแนนดัชนีเสมอกัน หลักฐานการเขียนโค้ดมีทั้งสองฝ่ายแต่ไม่มีการตรวจสอบอิสระในฝ่ายใด และไม่มีส่วนต่างด้านความเร็วที่จะเปลี่ยนการตัดสินใจ
ในเดือนกันยายน 2026 ค่าเริ่มต้นใดที่สมเหตุสมผล?
เลือก Grok 4.6 เมื่อทราฟฟิกของคุณอยู่ในช่วงอินพุตไม่เกิน 200K โทเคน — ราคาใกล้เคียงครึ่งหนึ่งในทุกความยาวที่ให้บริการ ดัชนีอิสระระบุว่าโมเดลอยู่ในระดับเดียวกัน และการปรับตั้งแบบโมเดลเดียวพร้อมเครื่องมือฝั่งเซิร์ฟเวอร์ช่วยให้ค่าใช้จ่ายคาดเดาได้ เลือก GPT-5.6 Sol เมื่อคุณต้องการช่วงคอนเทกซ์ 500K-1.05M จริง ๆ เมื่อสแตกของคุณเป็น Codex หรือ ChatGPT อยู่แล้ว และตัวเลข SWE-bench ~96% ที่รายงานคือหลักฐานด้านการเขียนโค้ดสำหรับฝ่ายจัดซื้อ หรือเมื่อคุณต้องการตัวเลือกการกำหนดค่าแบบซับเอเจนต์สี่ตัวโหมดความพยายามสูงสุดสำหรับงานระยะยาวที่ยากที่สุด และจับตาสองวันที่: โปรโมชัน $4/$20 ของ GPT-5.6 Sol รับประกันถึงอย่างน้อยวันที่ 21 พฤศจิกายน 2026 หลังจากนั้นการเปรียบเทียบนี้จะเปลี่ยนไป และ xAI ได้ทีเซอร์ Grok 4.7 แล้ว — เหตุการณ์ใดเหตุการณ์หนึ่งอาจเปลี่ยนราคาของการจับคู่ที่คุณกำลังจะกำหนดเป็นมาตรฐาน
การรันทั้งสองโดยไม่ต้องปรับสถาปัตยกรรมใหม่
เนื่องจากค่าที่เสมอกันในดัชนีบ่งชี้ว่าการตัดสินใจนี้เป็นเรื่องของเพดานและราคา ไม่ใช่เรื่องคุณภาพ รูปแบบที่ใช้งานได้จริงสำหรับทีมส่วนใหญ่คือการกำหนดเส้นทาง มากกว่าการเลือกใช้. GPT-5.6 Sol และ Grok 4.6 ต่างก็อยู่บน OrcaRouter ในราคาตามรายการของผู้ให้บริการ ส่งผ่านโดยไม่มีมาร์กอัป — ตัวเลข $4/$20 ของ OpenAI และ $2/$6 ของ xAI คือตัวเลขที่แสดงในรายการ และเมื่อผู้ให้บริการรายใดเปลี่ยนอัตรา ราคาใหม่ก็จะแสดงผลบนคีย์เดียวกันในวันเดียวกัน ด้วยปลายทางเดียวที่เข้ากันได้กับ OpenAI คุณสามารถส่งทราฟฟิกแบบ sub-200K ไปยัง Grok 4.6 ยกระดับพรอมพ์ที่ต้องใช้บริบทที่ยาวกว่าหรือการกำหนดค่าแบบ max-effort ของ Sol และใช้การเฟลโอเวอร์อัตโนมัติเพื่อให้การจำกัดอัตราบนเส้นทางของผู้ให้บริการหนึ่งรายเป็นเหตุการณ์การกำหนดเส้นทาง มากกว่าที่จะเป็นการหยุดทำงาน

ส่วนด้านราคาของการเปรียบเทียบนี้คือส่วนที่เปลี่ยนแปลง — โปรโมชัน Sol ของ OpenAI รับประกันเฉพาะจนถึงวันที่ 21 พฤศจิกายน และ xAI มี 4.7 ในโรดแมป — ดังนั้นเอกสารอ้างอิงที่บล็อกนี้ปรับปรุงให้เป็นปัจจุบันอยู่เสมอคือหน้าราคา GPT-5.6 Sol ซึ่งมีการประทับวันที่และตรวจสอบซ้ำทุกครั้งที่ตารางอัตราค่าใช้จ่ายมีการเปลี่ยนแปลง

คำตอบสองบรรทัด
หากพรอมต์ของคุณมีขนาดไม่เกิน 500K โทเคน — ซึ่งส่วนใหญ่ก็เป็นเช่นนั้น — Grok 4.6 ให้คะแนนดัชนีอิสระเท่ากับ GPT-5.6 Sol ในราคาที่ถูกกว่าเกือบครึ่งหนึ่งในทุกความยาวที่ให้บริการได้ โดยไม่มีขีดจำกัดเอาต์พุตที่ประกาศไว้ และมีตัวเลือกโมเดลเดียวที่คาดเดาได้ GPT-5.6 Sol คุ้มค่ากับราคาพรีเมียมในช่วงที่ Grok ไปไม่ถึง นั่นคือบริบทที่เกิน 500K โทเคน และภายในเครื่องมือของ OpenAI ที่คะแนน SWE-bench Verified ที่รายงานไว้ที่ประมาณ 96% และระดับ Terra และ Luna ที่อยู่ถัดลงมาให้คุณได้โมเดลทั้งตระกูล แทนที่จะเป็นโมเดลเพียงตัวเดียว การเสมอกันของคะแนนดัชนีหมายความว่าการตัดสินใจนี้เป็นเรื่องของเพดานและงบประมาณ ไม่ใช่ความสามารถ — ดังนั้นจงวัดพรอมต์จริงที่ยาวที่สุดของคุณก่อนตัดสินใจ เพราะตัวเลขเพียงตัวเดียวนั้นคือตัวตัดสินผู้ชนะ
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
