
GPT-6 Sol Pro vs Grok 4.7: ความเยิ่นเย้อเป็นสองเท่า ราคาเพียงหนึ่งในสาม
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 986 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 196 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
โมเดลระดับใกล้พรมแดนที่ถูกที่สุดสองตัวของเดือนกันยายน 2026 เปิดตัวห่างกันเพียงหนึ่งวัน และสิ่งที่น่าสนใจเกี่ยวกับทั้งสองไม่ได้อยู่ที่ว่าตัวไหนฉลาดกว่า GPT-6 Sol — โมเดลที่ผู้คนเลือกใช้เมื่อพวกเขาค้นหา GPT-6 Sol Pro ซึ่งก็คือโมเดลตัวนั้นที่ตั้งค่า reasoning.mode เป็น pro ไม่ใช่ผลิตภัณฑ์แยกต่างหาก — เปิดตัวเมื่อวันที่ 22 กันยายน 2026 ในราคา $2.00 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น และ $10.00 ต่อโทเค็นเอาต์พุตหนึ่งล้านโทเค็น Grok 4.7 จากผู้จำหน่ายเปิดตัวเมื่อวันที่ 21 กันยายน ในราคาอินพุต $2.00 เท่ากัน และเอาต์พุต $6.00 บนชุดทดสอบที่เป็นกลางของ Artificial Analysis ทั้งสองอยู่ในอันดับห่างกันสองจุดดัชนี และห่างกันประมาณสองดอลลาร์ต่องานที่ทำสำเร็จหนึ่งงาน และสาเหตุของช่องว่างนั้นไม่ใช่ขีดความสามารถ แต่เป็นจำนวนโทเค็นที่แต่ละตัวเผาไปเพื่อไปให้ถึงจุดนั้น
Sol สร้างโทเค็นเอาต์พุต 77 ล้านโทเค็นจากการรัน Intelligence Index ส่วน Grok 4.7 สร้าง 240 ล้าน อัตราส่วนนี้ — มากกว่าสามต่อหนึ่งเล็กน้อย — คือการเปรียบเทียบทั้งหมด และมันพลิกกลับข้อสรุปที่ตารางราคาต่อโทเคนบอกคุณไว้
การ์ดอัตราค่าบริการสองใบ และจุดที่ใบที่ถูกกว่าไม่ได้ถูกอย่างที่คิด
ผู้ขายทั้งสองรายเผยแพร่ตัวเลขเหล่านี้ด้วยตนเอง; ไม่มีรายใดได้รับการกำหนดราคาใหม่โดยอิสระ
• อินพุต — GPT-6 Sol $2.00 ต่อล้านโทเคน เทียบกับ Grok 4.7 $2.00 ต่อล้านโทเคน
• เอาต์พุต — GPT-6 Sol $10.00 ต่อล้านโทเคน เทียบกับ Grok 4.7 $6.00 ต่อล้านโทเคน
• อินพุตที่แคชไว้ — GPT-6 Sol $0.20 ต่อล้านโทเคน เทียบกับ Grok 4.7 $0.50 ต่อล้านโทเคน; การอ่านแคชของ Sol ถูกกว่าถึงสองเท่าครึ่ง ซึ่งตรงกันข้ามกับสิ่งที่อัตราเอาต์พุตที่พาดหัวไว้บ่งชี้
• หน้าต่างบริบท — GPT-6 Sol 1,050,000 โทเคน เทียบกับ Grok 4.7 500,000 โทเคน
• ค่าธรรมเนียมส่วนเพิ่มสำหรับบริบทยาว — GPT-6 Sol คิดราคาคำขอที่สูงกว่า 272,000 โทเค็นอินพุตใหม่เป็น 2× ของอัตราอินพุตและแคช และ 1.5× ของเอาต์พุตสำหรับทั้งคำขอ เทียบกับ Grok 4.7 ที่เพิ่มทุกอัตราเป็นสองเท่าที่ 200,000 โทเค็นอินพุต และสำหรับทั้งคำขอเช่นกัน
• วันตัดข้อมูลความรู้ — GPT-6 Sol 20 เมษายน 2026 เทียบกับ Grok 4.7 ซึ่งมีจุดตัดการฝึกอบรมล่วงหน้าที่รายงานว่าเป็นเดือนมิถุนายน 2026 โดยมีการฝึกอบรมเสริมจนถึงเดือนสิงหาคม
• ระดับความพยายามในการให้เหตุผล — GPT-6 Sol ไม่มี, ต่ำ, ปานกลาง (ค่าเริ่มต้น), สูง, xhigh, สูงสุด เทียบกับ Grok 4.7 ต่ำ, ปานกลาง (ค่าเริ่มต้น), สูง, xhigh
• โมดัลลิตี — ทั้งคู่รับอินพุตทั้งข้อความและรูปภาพ และส่งคืนข้อความ
บรรทัดการอ่านแคชคือสิ่งที่ผู้ซื้อควรพิจารณาให้ดี อัตราเอาต์พุตของ Grok 4.7 ต่ำกว่า 40% แต่ป้อนเข้าที่แคชไว้ของมันสูงกว่า 150% และป้อนเข้าที่แคชไว้คือที่ซึ่งประวัติเอเจนต์ยาว ๆ และพรอมป์ระบบที่ใช้ซ้ำอาศัยอยู่ เวิร์กโหลดที่ส่วนใหญ่เป็นการอ่านบริบทขนาดใหญ่ที่เสถียรซ้ำ ๆ จะพบว่าโมเดลทั้งสองใกล้เคียงกันมากกว่าที่การเทียบ $6 กับ $10 บ่งบอกไว้

บันทึกอิสระ และตัวเลขหนึ่งเดียวที่ตัดสินมัน
Artificial Analysis เป็นเพียงเครื่องมือเดียวที่วัดทั้งสองโมเดล และตัวเลขของมันก็คุ้มค่าที่จะนำมาเปรียบเทียบเคียงกัน เพราะความแตกต่างนั้นให้ข้อคิดที่มีประโยชน์
• Intelligence Index — GPT-6 Sol 48 ที่ max effort เทียบกับ Grok 4.7 46 ที่ xhigh; ทั้งคู่อยู่เหนือค่ามัธยฐาน 25 ของโมเดลที่เทียบเคียงได้อย่างชัดเจน
• ค่าใช้จ่ายต่องานจัดทำดัชนี — GPT-6 Sol $1.06 เทียบกับ Grok 4.7 $3.74
• จำนวนโทเค็นเอาต์พุตสำหรับการรันดัชนี — GPT-6 Sol 77M เทียบกับ Grok 4.7 240M เมื่อเทียบกับค่ามัธยฐานที่ 88M
• ความเร็วเอาต์พุต — Grok 4.7 วัดได้ที่ 39 โทเคนต่อวินาที ซึ่งตัวฮาร์เนสเองระบุว่าช้าอย่างเห็นได้ชัด; ค่าของ Sol บนบอร์ดเดียวกันไม่ถูกเผยแพร่ในบรรทัดสรุปเดียวกัน
• ดัชนี Coding Agent — GPT-6 Sol 57 ที่ $2.99 ต่องาน เทียบกับ Grok 4.7 56 ด้วยฮาร์เนส Grok Build แบบ first-party เพิ่มขึ้น 9 คะแนนจาก Grok 4.6
ต่างกันสองจุดในดัชนี ต้นทุนต่องานสูงกว่าสามเท่าครึ่ง นั่นไม่ใช่ความผิดปกติของราคา — มันคือเลขคณิตของความช่างพูด Grok 4.7 เป็นโมเดลที่คิดออกเสียงยาว ระบบทดสอบติดธงว่ามัน 'ช่างพูดมาก' เมื่อเทียบกับค่ามัธยฐานที่ 88 ล้านโทเคน และค่าใช้จ่ายเป็นไปตามจำนวนโทเคน ไม่ใช่ตามตารางราคา
การเปรียบเทียบ coding-agent มีข้อแม้ที่กระดานคะแนนซ่อนไว้ คะแนน 56 ของ Grok 4.7 ถูกวัดภายใน Grok Build harness ของ xAI เอง ซึ่งเป็นคอนฟิกูเรชันที่ xAI จัดส่งและใช้เป็นเกณฑ์เปรียบเทียบ คะแนน 57 ของ Sol ถูกวัดใน harness ที่เป็นกลาง ข้อได้เปรียบจาก harness ของบริษัทตัวเองเพียงหนึ่งหรือสองคะแนนนั้นอยู่ในช่วงที่การเลือก harness อธิบายได้ ซึ่งหมายความว่าการตีความอย่างตรงไปตรงมาคือทั้งสองอยู่ในระดับเดียวกันในด้านการเขียนโค้ดแบบ agentic — ไม่ใช่ Sol นำอยู่หนึ่งคะแนน

สิ่งที่ผู้จำหน่ายแต่ละรายอ้าง และสิ่งที่ทั้งสองฝ่ายยังไม่ได้แสดงให้เห็น
เอกสารเปิดตัวของ xAI มีความเฉพาะเจาะจง และเป็นเรื่องราวระยะยาว: Grok 4.7 สร้างขึ้นบนโมเดลฐานขนาดใหญ่กว่า Grok 4.6 และได้รับการฝึกการเรียนรู้แบบเสริมกำลัง (reinforcement learning) เป็นเวลานานขึ้น โดยมุ่งเป้าไปที่งานที่ "อาจใช้เวลาหลายชั่วโมงจึงจะเสร็จ" เสริมความสามารถในการตรวจสอบตนเอง การจัดการบริบทแบบยาว และพฤติกรรมภายในสภาพแวดล้อม Grok Bot ตัวเลขที่ผู้ขายรายงาน ได้แก่ Terminal-Bench 4.0 ที่ 38.0% เทียบกับ 20.3% ของ Grok 4.6, CursorBench 4.0 ที่ 46.3% และ DeepSWE v1.1 ที่ 71.0% ตัวเลขทั้งหมดนั้นเป็นการวัดของ xAI เอง และไม่มีตัวใดได้รับการทำซ้ำโดยอิสระ ตัวเลข Terminal-Bench 4.0 ฉบับอิสระที่เผยแพร่กันนั้นต่ำกว่าของผู้ขายอย่างมีนัยสำคัญ ซึ่งเป็นรูปแบบปกติของช่องว่างดังกล่าว
ข้อกล่าวอ้างของ OpenAI สำหรับ GPT-6 Sol เป็นข้อที่ครอบคลุมไปแล้วข้างต้น และมีป้ายกำกับเดียวกัน ตัวเลขที่ผู้ขายรายงานคือ 33.2% บน AutomationBench ที่ความพยายามระดับ xhigh เทียบกับ 26.9% ของ Claude Opus 5 ที่ระดับ max โดยมีต้นทุนต่องานประมาณ 9% และ 68.8% บน DeepSWE v1.1 ที่ความพยายามระดับ max — ห่างจาก Claude Fable 5 ที่ระดับ xhigh ภายใน 1.1 จุด โดยมีต้นทุนต่องานต่ำลงประมาณ 80% โปรดสังเกตเป้าหมายการเปรียบเทียบ: แผนภูมิของ OpenAI เองนำ Sol ไปเปรียบเทียบกับโมเดลของ Anthropic ไม่ใช่กับ Grok 4.7 ทั้งสองผู้ขายยังไม่ได้เผยแพร่การเปรียบเทียบแบบตัวต่อตัวระหว่างกัน

จุดที่เลเยอร์การกำหนดเส้นทางพิสูจน์คุณค่าของตัวเอง
OrcaRouter ไม่มีโมเดลทั้งสองนี้ในคู่เปรียบเทียบนี้ — ทั้ง Grok 4.7 และ GPT-6 Sol ต่างก็ไม่มีอยู่ในแคตตาล็อกของเรา ดังนั้นสิ่งที่กล่าวถึงในที่นี้จึงไม่ใช่การอ้างอิงราคาของทั้งสองผ่านเรา สิ่งที่ชั้นการจัดเส้นทางมีค่าในคู่เฉพาะเจาะจงนี้นั้นอยู่ที่โหมดความล้มเหลว มากกว่าอัตราค่าบริการ เหตุผลที่ควรเลือกใช้ Grok 4.7 คือพฤติกรรมแบบเอเจนต์ในระยะยาว เหตุผลที่ไม่ควรเลือกใช้คือความเร็วเอาต์พุต 39 โทเคนต่อวินาทีทำให้การรันเอเจนต์แบบยาวนานช้าพอที่จะมีนัยสำคัญ และการรันที่ช้าก็คือการรันที่อาจหมดเวลาได้ การสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดความล้มเหลวหมายความว่างานที่ใช้เวลานานสามารถถูกจัดเส้นทางไปยังโมเดลใดก็ตามที่พร้อมใช้งานจริง โดยที่ความเร็วนั้นไม่กลายเป็นจุดล้มเหลวจุดเดียว และ DSL สำหรับการจัดเส้นทางแสดงการเลือกโมเดลเป็นกฎอยู่ภายในคำสั่งเรียก แทนที่จะเป็นการย้ายระบบ — ซึ่งสำคัญในกรณีนี้ เพราะคำตอบที่ถูกต้องสำหรับคู่นี้ขึ้นอยู่กับว่างานนั้นกินโทเคนมากหรือไวต่อความหน่วง และนั่นเป็นคุณสมบัติของคำขอ ไม่ใช่ของคุณสมบัติของไตรมาส
กฎการตัดสินใจ
• การเขียนโค้ดแบบเอเจนต์ภายใต้งบประมาณคงที่ — GPT-6 Sol มีขีดความสามารถระดับเดียวกับผู้นำบนดัชนีการเขียนโค้ดที่เป็นกลาง ด้วยต้นทุนต่อชิ้นงานประมาณหนึ่งในสาม เพราะมันไปถึงจุดนั้นได้ด้วยจำนวนโทเค็นเพียงหนึ่งในสาม
• งานระยะยาวที่ความยาวของการรันคือประเด็นสำคัญ — Grok 4.7 การเปิดตัวครั้งนี้ถูกฝึกมาโดยเฉพาะสำหรับงานที่ใช้เวลาหลายชั่วโมง และตัวเลขจากผู้จำหน่ายบน SWE-Marathon และ CursorBench ก็เคลื่อนไปในทิศทางนั้นเป๊ะ
• ปริมาณงานที่ไวต่อความหน่วง — จากข้อมูลที่มีอยู่ในปัจจุบัน ไม่ใช่ทั้งคู่ ต้นทุนต่องานของ Sol เป็นตัวเลขที่ดีกว่า แต่ค่า 39 โทเคนต่อวินาทีที่วัดได้ของ Grok 4.7 ถือเป็นข้อจำกัดจริงสำหรับงานโต้ตอบใด ๆ
• งานที่ใช้บริบทยาวและพึ่งพาแคชเป็นส่วนใหญ่ — GPT-6 Sol อยู่ในอัตราค่าอ่านแคชมากกว่าอัตราค่าเอาต์พุต ด้วยราคา $0.20 เทียบกับ $0.50 ต่อโทเค็นที่แคชไว้หนึ่งล้านโทเค็น และด้วยขนาดหน้าต่างที่ใหญ่เป็นสองเท่า ยิ่งพรอมป์ของคุณมีส่วนที่คงที่มากเท่าไร ข้อได้เปรียบนี้ก็ยิ่งชัดเจนขึ้นเท่านั้น
• หากการเปรียบเทียบของคุณสร้างขึ้นจากตารางอัตราต่อโทเคน — ให้สร้างใหม่จากต้นทุนต่องาน $6.00 เมื่อเทียบกับ $10.00 สำหรับเอาต์พุตเป็นคู่ตัวเลขที่ให้ข้อมูลน้อยที่สุดในบทความนี้ และเป็นคู่ที่ทุกหน้าที่มีอยู่ในปัจจุบันเปิดด้วย
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
