
GPT-6.1 Sol กับ Grok 4.7: อัตราค่าเอาต์พุตที่ถูกที่สุดในกลุ่ม และบทสนทนาที่แพงที่สุด
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Grok 4.7 ผู้สืบทอดของ Grok 4.6 จาก xAI เปิดตัวเมื่อวันที่ 21 กันยายน 2026 ในราคา 2.00 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเค็น และ 6.00 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเค็น GPT-6.1 Sol การรีเฟรชระดับกลางของ OpenAI เปิดตัวแปดวันถัดมาเมื่อวันที่ 29 กันยายน ในราคาอินพุต 2.00 ดอลลาร์ และเอาต์พุต 10.00 ดอลลาร์ อัตราอินพุตเท่ากัน ส่วนอัตราเอาต์พุตของ Grok 4.7 ถูกกว่า 40% และนั่นคือจุดที่การเปรียบเทียบส่วนใหญ่หยุดลง แต่มันเป็นจุดที่ผิดที่จะหยุด เพราะคณะกรรมการอิสระชุดเดียวกันได้วัดทั้งสองโมเดลแบบครบวงจรแล้ว: Grok 4.7 เผาผลาญโทเค็นเอาต์พุตประมาณ 240 ล้านโทเค็นในการทำ Artificial Analysis Intelligence Index ให้เสร็จ ขณะที่ GPT-6.1 Sol เผาผลาญ 67 ล้านโทเค็น เอาราคาที่ถูกกว่าคูณกับปริมาณที่มากกว่าสามเท่าครึ่ง แล้วโมเดลที่มีราคาต่อโทเค็นต่ำกว่าจะมีต้นทุน 3.74 ดอลลาร์ต่องานที่ทำเสร็จ เทียบกับ 0.72 ดอลลาร์
สองโมเดล ห่างกันแปดวัน และเรตการ์ดที่กลับด้าน
Grok 4.7 เป็นโมเดลการเขียนโค้ดและงานองค์ความรู้ที่แข็งแกร่งที่สุดของ xAI: หน้าต่างบริบท 500,000 โทเคน เอาต์พุตสูงสุด 450,000 โทเคนในการตอบกลับครั้งเดียวตามข้อมูลของผู้ให้บริการเอง รองรับอินพุตข้อความ รูปภาพ และไฟล์ และความพยายามในการให้เหตุผลที่กำหนดค่าได้ในระดับ ต่ำ, ปานกลาง (ค่าเริ่มต้น), สูง และ xhigh. xAI ยังไม่เปิดเผยจำนวนพารามิเตอร์ และมีการรายงานว่าจุดตัดการฝึกอบรมล่วงหน้าคือเดือนมิถุนายน 2026 โดยมีการฝึกเสริมจนถึงเดือนสิงหาคม
GPT-6.1 Sol เป็นการรีเฟรชแบบเพิ่มขึ้นหนึ่งขั้นของ OpenAI สำหรับระดับ GPT-6 Sol โดยวางตำแหน่งต่ำกว่า GPT-6 Astra และสูงกว่า GPT-6 Luna: คอนเท็กซ์ 1,050,000 โทเค็น — ราวสองเท่าของ Grok — พร้อมเพดานเอาต์พุต 128,000 โทเค็น ซึ่งคิดเป็นราวหนึ่งในสามของ Grok, วันตัดองค์ความรู้ 30 เมษายน 2026 และอินพุตข้อความ รูปภาพ และไฟล์แบบเดียวกันlow ถึง max โดยมีค่าเริ่มต้นเป็น medium และไม่รองรับ none อีกต่อไป
หนึ่งบรรทัดต่อมิติ โดยเปิดทั้งสองด้านในแต่ละบรรทัด:
• อินพุต — GPT-6.1 Sol $2.00 ต่อ 1M เทียบกับ Grok 4.7 $2.00 ต่อ 1M; เหมือนกันทุกประการ
• เอาต์พุต — GPT-6.1 Sol $10.00 ต่อ 1M เทียบกับ Grok 4.7 $6.00 ต่อ 1M; Grok ถูกกว่า 40%
• อินพุตที่แคชไว้ — GPT-6.1 Sol $0.10 ต่อ 1M เทียบกับ Grok 4.7 $0.50 ต่อ 1M; Sol ถูกกว่าเป็นห้าเท่า ซึ่งตรงข้ามกับสิ่งที่บรรทัดเอาต์พุตบ่งบอก
• หน้าต่างบริบท — 1,050,000 โทเคน เทียบกับ 500,000
• เอาต์พุตสูงสุดในหนึ่งการตอบกลับ — 128,000 โทเคน เทียบกับ 450,000 ที่อ้างว่าได้
• ขั้นการคิดราคาบริบทยาว — คิดราคาทั้งคำขอใหม่เมื่อมีอินพุตเกิน 272,000 โทเคน โดยอินพุตและแคชเป็น 2× และเอาต์พุตเป็น 1.5× เทียบกับทุกอัตราที่เพิ่มเป็นสองเท่าเมื่อมีอินพุตเกิน 200,000 โทเคน และคิดกับทั้งคำขอเช่นกัน
• ระดับความพยายามในการให้เหตุผล — ต่ำ, ปานกลาง (ค่าเริ่มต้น), สูง, xhigh, สูงสุด เทียบกับ ต่ำ, ปานกลาง (ค่าเริ่มต้น), สูง, xhigh
• น้ำหนักและพารามิเตอร์ — ปิด, ไม่เปิดเผย เทียบกับ ปิด, ไม่เปิดเผย; ทั้งคู่ไม่ได้ให้เช็กพอยต์แก่คุณ
• Intelligence Index ที่ระดับความพยายามสูงสุดที่เผยแพร่ — GPT-6.1 Sol 51.8 ที่ระดับสูงสุด เทียบกับ Grok 4.7 46.4 ที่ระดับ xhigh
• ต้นทุนต่องานในดัชนี แบบอิสระ — $0.72 เทียบกับ $3.74
• โทเคนเอาต์พุตในการรันดัชนี — 67 ล้าน เทียบกับ 240 ล้าน เมื่อเทียบกับค่ามัธยฐานของบอร์ดที่ราว 81 ล้าน
สองบรรทัดในรายการนั้นคือการเปรียบเทียบทั้งหมด อัตราการส่งออกของ Grok 4.7 ต่ำลงจริง ๆ และบรรทัดแคชของมันสูงกว่าจริง ๆ ถึงห้าเท่า และมันสร้างโทเค็นมากกว่า 3.5 เท่าเพื่อให้ถูกวัด ตารางราคาเมื่ออ่านเพียงอย่างเดียวชี้ไปทางหนึ่ง ส่วนการวัดชี้ไปอีกทาง โดยต่างกันถึงห้าเท่า

จุดที่ Grok 4.7 เหนือกว่าจริง ๆ
มันจะไม่ซื่อสัตย์ที่จะนำเสนอบทความนี้ว่าเป็นชัยชนะแบบขาดลอย เพราะ Grok 4.7 ชนะในการประเมินจริง ให้คะแนนเคียงข้างกันที่ระดับความพยายามสูงสุดตามที่เผยแพร่บน Artificial Analysis v4.3.2 — Grok ที่ xhigh, Sol ที่ max, ความแตกต่างของการตั้งค่าที่ควรคำนึงถึงตลอด:
• GDPval-AA v2.1 — Grok 4.7 Elo 1715.4 กับ GPT-6.1 Sol Elo 1575.1 นำอยู่ 140 คะแนน Elo ในงานความรู้ที่มีมูลค่าทางเศรษฐกิจ และเป็นชัยชนะเดี่ยวที่ใหญ่ที่สุดสำหรับโมเดลที่มีอัตราค่าใช้จ่ายถูกกว่า
• AutomationBench-AA — Grok 4.7 0.6556 กับ GPT-6.1 Sol 0.6487 โดยแท้จริงแล้วเสมอกัน แต่ในนามเป็นของ Grok
• SciCode — Grok 4.7 0.5741 กับ GPT-6.1 Sol 0.5417 นำอยู่ 3.2 คะแนนในด้านการเขียนโค้ดทางวิทยาศาสตร์
• Terminal-Bench 4.0 — Grok 4.7 0.2576 กับ GPT-6.1 Sol 0.5606 เป็นรองอยู่ 30 คะแนน และเป็นช่องว่างที่ใหญ่ที่สุดในการจับคู่นี้
• Humanity's Last Exam — Grok 4.7 0.4314 กับ GPT-6.1 Sol 0.5292
• AA-LCR v1.1, การให้เหตุผลแบบบริบทยาว — Grok 4.7 0.7667 กับ GPT-6.1 Sol 0.83
• AA-Omniscience — Grok 4.7 32.0 กับ GPT-6.1 Sol 41.5
• GDP.pdf — Grok 4.7 0.20 กับ GPT-6.1 Sol 0.31
• CritPt — Grok 4.7 0.1771 กับ GPT-6.1 Sol 0.3171
การประเมิน 9 รายการ มี 3 รายการที่ Grok 4.7 ชนะหรือเสมอ รวมถึงรายการที่ยากที่สุดที่จะโต้แย้งด้วย: GDPval-AA ถูกออกแบบมาเพื่อกำหนดมูลค่างานวิชาชีพที่มีคุณค่าทางเศรษฐกิจ และการมีแต้มนำ 140 คะแนน Elo ไม่ใช่สัญญาณรบกวน หากภาระงานของคุณเป็นลักษณะที่ GDPval ถูกสร้างขึ้นมาเพื่อเป็นตัวแทน — การวิเคราะห์ที่เน้นเอกสารเป็นหลัก ผลงานส่งมอบระดับวิชาชีพ การตัดสินใจเชิงดุลพินิจที่มีคำตอบที่ถูกต้อง — โมเดลที่มีเรตการ์ดถูกกว่าก็เป็นโมเดลที่ดีกว่าเช่นกันบนบอร์ดที่เป็นกลาง และต้นทุนต่องานที่เพิ่มขึ้นคือสิ่งที่คุณต้องจ่ายเพื่อแลกกับมัน
ตัวเลขการเปิดตัวของ xAI เองนั้นสูง และเช่นเดียวกับตัวเลขการเปิดตัวของผู้ขายทุกราย ที่ยังไม่ถูกทำซ้ำ CursorBench 4.0 ที่ 46.3% ที่ xhigh เทียบกับ 40.4% ของ Grok 4.6; Terminal-Bench 4.0 ที่ 38.0% เทียบกับ 20.3% ซึ่งเป็นการเพิ่มขึ้นที่อ้างว่าใหญ่ที่สุดเพียงรายการเดียวในการเปิดตัวครั้งนี้; DeepSWE v1.1 ที่ 71.0% ที่ high เทียบกับ 65.2%; EEBench ที่ 64.0% เทียบกับ 53.0% นั่นคือฮาร์เนสของ xAI การตั้งค่าของ xAI การรายงานของ xAI — และสังเกตว่าการอ้าง 38.0% ของ Terminal-Bench 4.0 นั้นอยู่ตรงข้ามกับ 0.2576 ของคณะกรรมการอิสระสำหรับโมเดลเดียวกันบนเบนช์มาร์กเดียวกัน ซึ่งเป็นความคลาดเคลื่อนแบบที่คุณควรคาดหวังระหว่างการกำหนดค่าที่ปรับแต่งโดยผู้ขายและการรันแบบ neutral max-effort
ตัวเลขของ OpenAI สำหรับ GPT-6.1 Sol ควรถูกหักลดความน่าเชื่อถือแบบเดียวกัน และมีจุดอ่อนแบบเดียวกัน ตัวเลขหนึ่งเดียวในการเปรียบเทียบนี้ที่ผู้ขายทั้งสองรายไม่ได้ผลิตออกมา คือต้นทุนต่องานที่ทำสำเร็จ เพราะมันคำนวณจากการใช้โทเคนที่วัดได้ ไม่ใช่จากตารางคะแนน นั่นคือตัวเลขที่ยังคงอยู่
ทำไม 240 ล้านโทเค็นจึงเป็นตัวชี้ขาด
Artificial Analysis อธิบายความเยิ่นเย้อของ Grok 4.7 ในบทสรุปของตัวเอง และจำนวนโทเค็นที่อยู่เบื้องหลังการรันดัชนีคือหลักฐาน: โทเค็นเอาต์พุต 240 ล้าน เทียบกับค่ามัธยฐานของบอร์ดที่ใกล้ 81 ล้าน ซึ่งประมาณสามเท่าของที่โมเดลทั่วไปบนชุดทดสอบเดียวกันผลิต 67 ล้านของ GPT-6.1 Sol อยู่ต่ำกว่าค่ามัธยฐานอย่างมาก นำอัตราส่วนทั้งสองมารวมกัน — ปริมาณ 3.6 เท่าในราคา 0.6 เท่า — และอัตราค่าเอาต์พุตที่ถูกกว่าก็คือการซื้อโทเค็นมากขึ้นแทนที่จะเป็นบิลที่เล็กลง ซึ่งก็คือสิ่งที่ความแตกต่างของต้นทุนต่องานที่ $3.74 เทียบกับ $0.72 ดูเป็นเช่นนั้น
การแคชเปลี่ยนขนาดของผลกระทบ แต่ไม่เปลี่ยนทิศทางของมัน และนี่คือรายละเอียดที่ทำให้ผู้คนเข้าใจผิด อินพุตแบบแคชของ Grok 4.7 อยู่ที่ $0.50 ต่อล้าน เทียบกับ $0.10 ของ Sol — แพงกว่าห้าเท่าในบรรทัดที่ประวัติเอเจนต์ยาว ๆ และ system prompt ที่ใช้ซ้ำอาศัยอยู่ งานที่ถูกครอบงำด้วยการอ่านซ้ำคำนำหน้าขนาดใหญ่ที่คงที่ จึงพบว่าโมเดลทั้งสองใกล้กันกว่าที่ $6 เทียบกับ $10 บ่งชี้ และเมื่อนำความเยิ่นเย้อของ Grok มาทับอีกชั้น ก็ยิ่งห่างกันมากกว่าที่อัตราอินพุตบ่งชี้ บรรทัดแคชกับบรรทัดโทเคนชี้ไปทางเดียวกันในกรณีนี้ ซึ่งเป็นเรื่องผิดปกติ และทำให้การจับคู่นี้ดูสะอาดกว่าที่ตารางอัตราราคาบอกเป็นนัย
ข้อกำหนดบริบทขนาดยาวควรถูกคิดราคาแยกกัน เพราะมันเริ่มมีผลที่จุดต่างกัน GPT-6.1 Sol คิดราคาคำขอทั้งหมดใหม่เมื่อมีโทเค็นอินพุตเกิน 272,000; Grok 4.7 ก็ทำเช่นเดียวกันเมื่อเกิน 200,000 ในการเรียก 250,000 โทเค็น Grok เพิ่มเป็นสองเท่าแล้ว — $4.00 และ $12.00 โดยมีค่าอ่านแคช $1.00 — ในขณะที่ Sol ยังคงใช้ราคามาตรฐาน $2.00 และ $10.00 ระหว่าง 200,000 ถึง 272,000 โทเค็น โมเดลที่มีเรตการ์ดถูกกว่ากลับเป็นโมเดลที่แพงกว่าอย่างมาก และช่วงนี้พบได้บ่อยในงานเอกสาร
จุดที่ Grok ชนะอย่างแท้จริงในด้านโครงสร้างมากกว่าคะแนนคือเพดานเอาต์พุต การตอบกลับสูงสุด 450,000 โทเคน เทียบกับ 128,000 ของ Sol นั้นเป็นผลลัพธ์คนละระดับ: โค้ดเบสที่สร้างขึ้นทั้งหมด บทสนทนายาว การสังเคราะห์ความยาวเท่าหนังสือในการเรียกครั้งเดียว หากคุณกำลังติดเพดานเอาต์พุตในปัจจุบัน ประเด็นนั้นตัดสินการเปรียบเทียบ และไม่มีสิ่งใดในการคำนวณต้นทุนข้างต้นที่ใช้ได้ — คุณไม่สามารถซื้อความสามารถที่โมเดลอื่นไม่มีได้ในราคาใดๆ
ทั้งสองอยู่บนคีย์เดียว ซึ่งเป็นส่วนที่มีประโยชน์
Grok 4.7 อยู่บน OrcaRouter ในราคาตั้งต้นของ xAI เอง — $2.00 และ $6.00 ต่อล้านโทเคน โดยมีค่าอ่านแคช $0.50 และขั้นบันไดที่ 200,000 โทเคนไปเป็น $4.00 และ $12.00 ส่งผ่านมาตรงตามที่ xAI ระบุไว้ — และ GPT-6.1 Sol ก็มาลงบนเส้นทางของเราในวันเปิดตัวในราคาของ OpenAI คือ $2.00 และ $10.00 โดยอินพุตที่แคชไว้ราคา $0.10 และขั้นบันไดที่ 272,000 โทเคนไม่เปลี่ยนแปลง ไม่มีการบวกเพิ่มให้ทั้งสองรายการ: แพลตฟอร์มส่งผ่านราคาตั้งต้นของผู้ให้บริการโดยตรงแทนที่จะบวกกำไร ซึ่งหมายความว่าการลดราคาของผู้ขายไม่ว่าฝ่ายใดจะมีผลที่นี่ในวันเดียวกับที่มีผลที่นั่น โดยไม่มีใบแจ้งหนี้ที่สองและไม่มีตัวแทนจำหน่ายคั่นกลาง

สำหรับคู่นี้โดยเฉพาะ มันคุ้มค่ามากกว่าความสะดวก สองโมเดลนี้ไม่เห็นตรงกันว่าตนเองเก่งเรื่องอะไร — Grok 4.7 นำในด้าน Elo ของงานระดับวิชาชีพและงานเขียนโค้ดเชิงวิทยาศาสตร์ ส่วน GPT-6.1 Sol นำในด้านการรันบนเทอร์มินัล ความน่าเชื่อถือของข้อเท็จจริง และการดึงข้อมูลบริบทยาว — และเส้นแบ่งระหว่างงานเหล่านั้นจะมองเห็นได้จากทราฟฟิกของคุณเองก่อนที่จะมองเห็นได้ในเบนช์มาร์ก การส่งคำขอที่อยู่ในรูปแบบ GDPval ไปทางหนึ่ง และการรันเอเจนต์ระยะยาวไปอีกทาง ภายใต้ endpoint เดียว พร้อม automatic failover ที่ครอบคลุมทั้งสองฝั่ง และมีกฎการจัดเส้นทางที่คุณเปลี่ยนในคอนฟิกแทนที่จะเปลี่ยนตอนดีพลอย เป็นวิธีที่ถูกกว่าในการค้นหาเส้นแบ่งนั้นเมื่อเทียบกับโปรเจกต์ประเมินผล Model fusion ซึ่งเป็นวิธีที่คณะโมเดลช่วยกันตอบ คืออีกทางเลือกที่แพลตฟอร์มมีให้ หากคุณไม่อยากเลือกเป็นรายคำขอเลย

การโทร
• งานเอเจนต์และงานเทอร์มินัลที่ให้ผลลัพธ์ยาว ลูปคำนำหน้าที่แคชไว้ — GPT-6.1 Sol. สามสิบพอยต์บน Terminal-Bench 4.0, แคชไลน์ที่ถูกกว่า 5 เท่า และหนึ่งในห้าของค่าใช้จ่ายต่องานที่ทำเสร็จ
• งานความรู้ระดับมืออาชีพ การวิเคราะห์เอกสาร งานที่ต้องใช้ดุลยพินิจ — Grok 4.7 จากจุดแข็งของคะแนนนำ 140 พอยต์ใน GDPval-AA Elo โดยตั้งงบสำหรับค่าท็อกเกนไว้แทนการสันนิษฐาน
• การเขียนโค้ดเชิงวิทยาศาสตร์ — Grok 4.7 ชนะแบบหวุดหวิดในสปลิต SciCode ของบอร์ด ตรวจสอบกับชุดทดสอบของคุณเอง; 3.2 พอยต์อยู่ในช่วงที่ชุดพรอมป์ต์อื่นสามารถขยับได้
• การตอบกลับครั้งเดียวที่ยาวเกิน 128,000 โทเคนเอาต์พุต — Grok 4.7 และไม่มีเลขคณิตใดทดแทนได้
• คำขอที่มีโทเคนอินพุตระหว่าง 200,000 ถึง 272,000 — GPT-6.1 Sol เพราะ Grok 4.7 เพิ่มคำขอทั้งหมดเป็นสองเท่าไปแล้ว แต่ Sol ยังไม่
• บทสนทนาที่ถูกที่สุดเท่าที่เป็นไปได้ — ไม่ใช่ทั้งสองตัวนี้ ทั้งคู่เป็นโมเดลราคาระดับแนวหน้าและมีความอยากใช้โทเคนระดับแนวหน้า; การเปรียบเทียบนี้เกี่ยวกับว่าโมเดลใดทำงานของคุณให้เสร็จ ไม่ใช่โมเดลใดถูกในเชิงนามธรรม
• หากการเปรียบเทียบลงเอยด้วย "Grok ถูกกว่าต่อโทเคน" — มันจบเร็วเกินไปหนึ่งก้าว ก้าวถัดไปคือจำนวนโทเคน และนั่นคือ 240 ล้าน เทียบกับ 67
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
