การ์ดฮีโร่ที่สร้างขึ้นสำหรับการเปรียบเทียบ GPT-6.1 Sol กับ Grok 4.7 โดยมีหัวข้อว่า 'ถูกกว่าต่อโทเคน 40% แต่บิลสูงกว่า 5.2 เท่า' พร้อมป้ายสามป้ายที่ระบุว่า 'เอาต์พุต Grok 4.7: $6.00 ต่อ 1M' 'เอาต์พุต GPT-6.1 Sol: $10.00 ต่อ 1M' และ 'โทเคนเอาต์พุตในการรันดัชนี: 67M เทียบกับ 240M' และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

GPT-6.1 Sol กับ Grok 4.7: อัตราค่าเอาต์พุตที่ถูกที่สุดในกลุ่ม และบทสนทนาที่แพงที่สุด

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Grok 4.7 ผู้สืบทอดของ Grok 4.6 จาก xAI เปิดตัวเมื่อวันที่ 21 กันยายน 2026 ในราคา 2.00 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเค็น และ 6.00 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเค็น GPT-6.1 Sol การรีเฟรชระดับกลางของ OpenAI เปิดตัวแปดวันถัดมาเมื่อวันที่ 29 กันยายน ในราคาอินพุต 2.00 ดอลลาร์ และเอาต์พุต 10.00 ดอลลาร์ อัตราอินพุตเท่ากัน ส่วนอัตราเอาต์พุตของ Grok 4.7 ถูกกว่า 40% และนั่นคือจุดที่การเปรียบเทียบส่วนใหญ่หยุดลง แต่มันเป็นจุดที่ผิดที่จะหยุด เพราะคณะกรรมการอิสระชุดเดียวกันได้วัดทั้งสองโมเดลแบบครบวงจรแล้ว: Grok 4.7 เผาผลาญโทเค็นเอาต์พุตประมาณ 240 ล้านโทเค็นในการทำ Artificial Analysis Intelligence Index ให้เสร็จ ขณะที่ GPT-6.1 Sol เผาผลาญ 67 ล้านโทเค็น เอาราคาที่ถูกกว่าคูณกับปริมาณที่มากกว่าสามเท่าครึ่ง แล้วโมเดลที่มีราคาต่อโทเค็นต่ำกว่าจะมีต้นทุน 3.74 ดอลลาร์ต่องานที่ทำเสร็จ เทียบกับ 0.72 ดอลลาร์

สองโมเดล ห่างกันแปดวัน และเรตการ์ดที่กลับด้าน

Grok 4.7 เป็นโมเดลการเขียนโค้ดและงานองค์ความรู้ที่แข็งแกร่งที่สุดของ x​AI: หน้าต่างบริบท 500,000 โทเคน เอาต์พุตสูงสุด 450,000 โทเคนในการตอบกลับครั้งเดียวตามข้อมูลของผู้ให้บริการเอง รองรับอินพุตข้อความ รูปภาพ และไฟล์ และความพยายามในการให้เหตุผลที่กำหนดค่าได้ในระดับ ต่ำ, ปานกลาง (ค่าเริ่มต้น), สูง และ xhigh. x​AI ยังไม่เปิดเผยจำนวนพารามิเตอร์ และมีการรายงานว่าจุดตัดการฝึกอบรมล่วงหน้าคือเดือนมิถุนายน 2026 โดยมีการฝึกเสริมจนถึงเดือนสิงหาคม

GPT-6.1 Sol เป็นการรีเฟรชแบบเพิ่มขึ้นหนึ่งขั้นของ OpenAI สำหรับระดับ GPT-6 Sol โดยวางตำแหน่งต่ำกว่า GPT-6 Astra และสูงกว่า GPT-6 Luna: คอนเท็กซ์ 1,050,000 โทเค็น — ราวสองเท่าของ Grok — พร้อมเพดานเอาต์พุต 128,000 โทเค็น ซึ่งคิดเป็นราวหนึ่งในสามของ Grok, วันตัดองค์ความรู้ 30 เมษายน 2026 และอินพุตข้อความ รูปภาพ และไฟล์แบบเดียวกันlow ถึง max โดยมีค่าเริ่มต้นเป็น medium และไม่รองรับ none อีกต่อไป

หนึ่งบรรทัดต่อมิติ โดยเปิดทั้งสองด้านในแต่ละบรรทัด:

• อินพุต — GPT-6.1 Sol $2.00 ต่อ 1M เทียบกับ Grok 4.7 $2.00 ต่อ 1M; เหมือนกันทุกประการ
• เอาต์พุต — GPT-6.1 Sol $10.00 ต่อ 1M เทียบกับ Grok 4.7 $6.00 ต่อ 1M; Grok ถูกกว่า 40%
• อินพุตที่แคชไว้ — GPT-6.1 Sol $0.10 ต่อ 1M เทียบกับ Grok 4.7 $0.50 ต่อ 1M; Sol ถูกกว่าเป็นห้าเท่า ซึ่งตรงข้ามกับสิ่งที่บรรทัดเอาต์พุตบ่งบอก
• หน้าต่างบริบท — 1,050,000 โทเคน เทียบกับ 500,000
• เอาต์พุตสูงสุดในหนึ่งการตอบกลับ — 128,000 โทเคน เทียบกับ 450,000 ที่อ้างว่าได้
• ขั้นการคิดราคาบริบทยาว — คิดราคาทั้งคำขอใหม่เมื่อมีอินพุตเกิน 272,000 โทเคน โดยอินพุตและแคชเป็น 2× และเอาต์พุตเป็น 1.5× เทียบกับทุกอัตราที่เพิ่มเป็นสองเท่าเมื่อมีอินพุตเกิน 200,000 โทเคน และคิดกับทั้งคำขอเช่นกัน
• ระดับความพยายามในการให้เหตุผล — ต่ำ, ปานกลาง (ค่าเริ่มต้น), สูง, xhigh, สูงสุด เทียบกับ ต่ำ, ปานกลาง (ค่าเริ่มต้น), สูง, xhigh
• น้ำหนักและพารามิเตอร์ — ปิด, ไม่เปิดเผย เทียบกับ ปิด, ไม่เปิดเผย; ทั้งคู่ไม่ได้ให้เช็กพอยต์แก่คุณ
• Intelligence Index ที่ระดับความพยายามสูงสุดที่เผยแพร่ — GPT-6.1 Sol 51.8 ที่ระดับสูงสุด เทียบกับ Grok 4.7 46.4 ที่ระดับ xhigh
• ต้นทุนต่องานในดัชนี แบบอิสระ — $0.72 เทียบกับ $3.74
• โทเคนเอาต์พุตในการรันดัชนี — 67 ล้าน เทียบกับ 240 ล้าน เมื่อเทียบกับค่ามัธยฐานของบอร์ดที่ราว 81 ล้าน

สองบรรทัดในรายการนั้นคือการเปรียบเทียบทั้งหมด อัตราการส่งออกของ Grok 4.7 ต่ำลงจริง ๆ และบรรทัดแคชของมันสูงกว่าจริง ๆ ถึงห้าเท่า และมันสร้างโทเค็นมากกว่า 3.5 เท่าเพื่อให้ถูกวัด ตารางราคาเมื่ออ่านเพียงอย่างเดียวชี้ไปทางหนึ่ง ส่วนการวัดชี้ไปอีกทาง โดยต่างกันถึงห้าเท่า

A generated hero card for a GPT-6.1 Sol versus Grok 4.7 comparison, headed '40% cheaper per token, 5.2 times the bill', with two badges reading 'Grok 4.7 output: $6.00 per 1M' and 'GPT-6.1 Sol output: $10.00 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2; Grok at xhigh, Sol at max; AI-generated card', and the OrcaRouter logo in the bottom-right corner.

จุดที่ Grok 4.7 เหนือกว่าจริง ๆ

มันจะไม่ซื่อสัตย์ที่จะนำเสนอบทความนี้ว่าเป็นชัยชนะแบบขาดลอย เพราะ Grok 4.7 ชนะในการประเมินจริง ให้คะแนนเคียงข้างกันที่ระดับความพยายามสูงสุดตามที่เผยแพร่บน Artificial Analysis v4.3.2 — Grok ที่ xhigh, Sol ที่ max, ความแตกต่างของการตั้งค่าที่ควรคำนึงถึงตลอด:

• GDPval-AA v2.1 — Grok 4.7 Elo 1715.4 กับ GPT-6.1 Sol Elo 1575.1 นำอยู่ 140 คะแนน Elo ในงานความรู้ที่มีมูลค่าทางเศรษฐกิจ และเป็นชัยชนะเดี่ยวที่ใหญ่ที่สุดสำหรับโมเดลที่มีอัตราค่าใช้จ่ายถูกกว่า
• AutomationBench-AA — Grok 4.7 0.6556 กับ GPT-6.1 Sol 0.6487 โดยแท้จริงแล้วเสมอกัน แต่ในนามเป็นของ Grok
• SciCode — Grok 4.7 0.5741 กับ GPT-6.1 Sol 0.5417 นำอยู่ 3.2 คะแนนในด้านการเขียนโค้ดทางวิทยาศาสตร์
• Terminal-Bench 4.0 — Grok 4.7 0.2576 กับ GPT-6.1 Sol 0.5606 เป็นรองอยู่ 30 คะแนน และเป็นช่องว่างที่ใหญ่ที่สุดในการจับคู่นี้
• Humanity's Last Exam — Grok 4.7 0.4314 กับ GPT-6.1 Sol 0.5292
• AA-LCR v1.1, การให้เหตุผลแบบบริบทยาว — Grok 4.7 0.7667 กับ GPT-6.1 Sol 0.83
• AA-Omniscience — Grok 4.7 32.0 กับ GPT-6.1 Sol 41.5
• GDP.pdf — Grok 4.7 0.20 กับ GPT-6.1 Sol 0.31
• CritPt — Grok 4.7 0.1771 กับ GPT-6.1 Sol 0.3171

การประเมิน 9 รายการ มี 3 รายการที่ Grok 4.7 ชนะหรือเสมอ รวมถึงรายการที่ยากที่สุดที่จะโต้แย้งด้วย: GDPval-AA ถูกออกแบบมาเพื่อกำหนดมูลค่างานวิชาชีพที่มีคุณค่าทางเศรษฐกิจ และการมีแต้มนำ 140 คะแนน Elo ไม่ใช่สัญญาณรบกวน หากภาระงานของคุณเป็นลักษณะที่ GDPval ถูกสร้างขึ้นมาเพื่อเป็นตัวแทน — การวิเคราะห์ที่เน้นเอกสารเป็นหลัก ผลงานส่งมอบระดับวิชาชีพ การตัดสินใจเชิงดุลพินิจที่มีคำตอบที่ถูกต้อง — โมเดลที่มีเรตการ์ดถูกกว่าก็เป็นโมเดลที่ดีกว่าเช่นกันบนบอร์ดที่เป็นกลาง และต้นทุนต่องานที่เพิ่มขึ้นคือสิ่งที่คุณต้องจ่ายเพื่อแลกกับมัน

ตัวเลขการเปิดตัวของ xAI เองนั้นสูง และเช่นเดียวกับตัวเลขการเปิดตัวของผู้ขายทุกราย ที่ยังไม่ถูกทำซ้ำ CursorBench 4.0 ที่ 46.3% ที่ xhigh เทียบกับ 40.4% ของ Grok 4.6; Terminal-Bench 4.0 ที่ 38.0% เทียบกับ 20.3% ซึ่งเป็นการเพิ่มขึ้นที่อ้างว่าใหญ่ที่สุดเพียงรายการเดียวในการเปิดตัวครั้งนี้; DeepSWE v1.1 ที่ 71.0% ที่ high เทียบกับ 65.2%; EEBench ที่ 64.0% เทียบกับ 53.0% นั่นคือฮาร์เนสของ xAI การตั้งค่าของ xAI การรายงานของ xAI — และสังเกตว่าการอ้าง 38.0% ของ Terminal-Bench 4.0 นั้นอยู่ตรงข้ามกับ 0.2576 ของคณะกรรมการอิสระสำหรับโมเดลเดียวกันบนเบนช์มาร์กเดียวกัน ซึ่งเป็นความคลาดเคลื่อนแบบที่คุณควรคาดหวังระหว่างการกำหนดค่าที่ปรับแต่งโดยผู้ขายและการรันแบบ neutral max-effort

ตัวเลขของ Open​AI สำหรับ GPT-6.1 Sol ควรถูกหักลดความน่าเชื่อถือแบบเดียวกัน และมีจุดอ่อนแบบเดียวกัน ตัวเลขหนึ่งเดียวในการเปรียบเทียบนี้ที่ผู้ขายทั้งสองรายไม่ได้ผลิตออกมา คือต้นทุนต่องานที่ทำสำเร็จ เพราะมันคำนวณจากการใช้โทเคนที่วัดได้ ไม่ใช่จากตารางคะแนน นั่นคือตัวเลขที่ยังคงอยู่

ทำไม 240 ล้านโทเค็นจึงเป็นตัวชี้ขาด

Artificial Analysis อธิบายความเยิ่นเย้อของ Grok 4.7 ในบทสรุปของตัวเอง และจำนวนโทเค็นที่อยู่เบื้องหลังการรันดัชนีคือหลักฐาน: โทเค็นเอาต์พุต 240 ล้าน เทียบกับค่ามัธยฐานของบอร์ดที่ใกล้ 81 ล้าน ซึ่งประมาณสามเท่าของที่โมเดลทั่วไปบนชุดทดสอบเดียวกันผลิต 67 ล้านของ GPT-6.1 Sol อยู่ต่ำกว่าค่ามัธยฐานอย่างมาก นำอัตราส่วนทั้งสองมารวมกัน — ปริมาณ 3.6 เท่าในราคา 0.6 เท่า — และอัตราค่าเอาต์พุตที่ถูกกว่าก็คือการซื้อโทเค็นมากขึ้นแทนที่จะเป็นบิลที่เล็กลง ซึ่งก็คือสิ่งที่ความแตกต่างของต้นทุนต่องานที่ $3.74 เทียบกับ $0.72 ดูเป็นเช่นนั้น

การแคชเปลี่ยนขนาดของผลกระทบ แต่ไม่เปลี่ยนทิศทางของมัน และนี่คือรายละเอียดที่ทำให้ผู้คนเข้าใจผิด อินพุตแบบแคชของ Grok 4.7 อยู่ที่ $0.50 ต่อล้าน เทียบกับ $0.10 ของ Sol — แพงกว่าห้าเท่าในบรรทัดที่ประวัติเอเจนต์ยาว ๆ และ system prompt ที่ใช้ซ้ำอาศัยอยู่ งานที่ถูกครอบงำด้วยการอ่านซ้ำคำนำหน้าขนาดใหญ่ที่คงที่ จึงพบว่าโมเดลทั้งสองใกล้กันกว่าที่ $6 เทียบกับ $10 บ่งชี้ และเมื่อนำความเยิ่นเย้อของ Grok มาทับอีกชั้น ก็ยิ่งห่างกันมากกว่าที่อัตราอินพุตบ่งชี้ บรรทัดแคชกับบรรทัดโทเคนชี้ไปทางเดียวกันในกรณีนี้ ซึ่งเป็นเรื่องผิดปกติ และทำให้การจับคู่นี้ดูสะอาดกว่าที่ตารางอัตราราคาบอกเป็นนัย

ข้อกำหนดบริบทขนาดยาวควรถูกคิดราคาแยกกัน เพราะมันเริ่มมีผลที่จุดต่างกัน GPT-6.1 Sol คิดราคาคำขอทั้งหมดใหม่เมื่อมีโทเค็นอินพุตเกิน 272,000; Grok 4.7 ก็ทำเช่นเดียวกันเมื่อเกิน 200,000 ในการเรียก 250,000 โทเค็น Grok เพิ่มเป็นสองเท่าแล้ว — $4.00 และ $12.00 โดยมีค่าอ่านแคช $1.00 — ในขณะที่ Sol ยังคงใช้ราคามาตรฐาน $2.00 และ $10.00 ระหว่าง 200,000 ถึง 272,000 โทเค็น โมเดลที่มีเรตการ์ดถูกกว่ากลับเป็นโมเดลที่แพงกว่าอย่างมาก และช่วงนี้พบได้บ่อยในงานเอกสาร

จุดที่ Grok ชนะอย่างแท้จริงในด้านโครงสร้างมากกว่าคะแนนคือเพดานเอาต์พุต การตอบกลับสูงสุด 450,000 โทเคน เทียบกับ 128,000 ของ Sol นั้นเป็นผลลัพธ์คนละระดับ: โค้ดเบสที่สร้างขึ้นทั้งหมด บทสนทนายาว การสังเคราะห์ความยาวเท่าหนังสือในการเรียกครั้งเดียว หากคุณกำลังติดเพดานเอาต์พุตในปัจจุบัน ประเด็นนั้นตัดสินการเปรียบเทียบ และไม่มีสิ่งใดในการคำนวณต้นทุนข้างต้นที่ใช้ได้ — คุณไม่สามารถซื้อความสามารถที่โมเดลอื่นไม่มีได้ในราคาใดๆ

ทั้งสองอยู่บนคีย์เดียว ซึ่งเป็นส่วนที่มีประโยชน์

Grok 4.7 อยู่บน OrcaRouter ในราคาตั้งต้นของ x​AI เอง — $2.00 และ $6.00 ต่อล้านโทเคน โดยมีค่าอ่านแคช $0.50 และขั้นบันไดที่ 200,000 โทเคนไปเป็น $4.00 และ $12.00 ส่งผ่านมาตรงตามที่ x​AI ระบุไว้ — และ GPT-6.1 Sol ก็มาลงบนเส้นทางของเราในวันเปิดตัวในราคาของ Open​AI คือ $2.00 และ $10.00 โดยอินพุตที่แคชไว้ราคา $0.10 และขั้นบันไดที่ 272,000 โทเคนไม่เปลี่ยนแปลง ไม่มีการบวกเพิ่มให้ทั้งสองรายการ: แพลตฟอร์มส่งผ่านราคาตั้งต้นของผู้ให้บริการโดยตรงแทนที่จะบวกกำไร ซึ่งหมายความว่าการลดราคาของผู้ขายไม่ว่าฝ่ายใดจะมีผลที่นี่ในวันเดียวกับที่มีผลที่นั่น โดยไม่มีใบแจ้งหนี้ที่สองและไม่มีตัวแทนจำหน่ายคั่นกลาง

A screenshot of the OrcaRouter model page for grok/grok-4.7, showing the listing dated 2026-09-21, the model described as SpaceXAI's flagship for coding, agentic tasks and knowledge work, a 500K-token context with up to 450K output tokens, text, image and file input, and the list price of $2.00 input and $6.00 output per million tokens with a 4.03 s median time to first token.

สำหรับคู่นี้โดยเฉพาะ มันคุ้มค่ามากกว่าความสะดวก สองโมเดลนี้ไม่เห็นตรงกันว่าตนเองเก่งเรื่องอะไร — Grok 4.7 นำในด้าน Elo ของงานระดับวิชาชีพและงานเขียนโค้ดเชิงวิทยาศาสตร์ ส่วน GPT-6.1 Sol นำในด้านการรันบนเทอร์มินัล ความน่าเชื่อถือของข้อเท็จจริง และการดึงข้อมูลบริบทยาว — และเส้นแบ่งระหว่างงานเหล่านั้นจะมองเห็นได้จากทราฟฟิกของคุณเองก่อนที่จะมองเห็นได้ในเบนช์มาร์ก การส่งคำขอที่อยู่ในรูปแบบ GDPval ไปทางหนึ่ง และการรันเอเจนต์ระยะยาวไปอีกทาง ภายใต้ endpoint เดียว พร้อม automatic failover ที่ครอบคลุมทั้งสองฝั่ง และมีกฎการจัดเส้นทางที่คุณเปลี่ยนในคอนฟิกแทนที่จะเปลี่ยนตอนดีพลอย เป็นวิธีที่ถูกกว่าในการค้นหาเส้นแบ่งนั้นเมื่อเทียบกับโปรเจกต์ประเมินผล Model fusion ซึ่งเป็นวิธีที่คณะโมเดลช่วยกันตอบ คืออีกทางเลือกที่แพลตฟอร์มมีให้ หากคุณไม่อยากเลือกเป็นรายคำขอเลย

A screenshot of xAI's Grok 4.7 developer documentation, showing the model ID grok-4.7, the description 'SpaceXAI's frontier model for coding, agentic tasks, and knowledge work', text and image to text modalities, a 500,000-token context window, and pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens.

การโทร

• งานเอเจนต์และงานเทอร์มินัลที่ให้ผลลัพธ์ยาว ลูปคำนำหน้าที่แคชไว้ — GPT-6.1 Sol. สามสิบพอยต์บน Terminal-Bench 4.0, แคชไลน์ที่ถูกกว่า 5 เท่า และหนึ่งในห้าของค่าใช้จ่ายต่องานที่ทำเสร็จ
• งานความรู้ระดับมืออาชีพ การวิเคราะห์เอกสาร งานที่ต้องใช้ดุลยพินิจ — Grok 4.7 จากจุดแข็งของคะแนนนำ 140 พอยต์ใน GDPval-AA Elo โดยตั้งงบสำหรับค่าท็อกเกนไว้แทนการสันนิษฐาน
• การเขียนโค้ดเชิงวิทยาศาสตร์ — Grok 4.7 ชนะแบบหวุดหวิดในสปลิต SciCode ของบอร์ด ตรวจสอบกับชุดทดสอบของคุณเอง; 3.2 พอยต์อยู่ในช่วงที่ชุดพรอมป์ต์อื่นสามารถขยับได้
• การตอบกลับครั้งเดียวที่ยาวเกิน 128,000 โทเคนเอาต์พุต — Grok 4.7 และไม่มีเลขคณิตใดทดแทนได้
• คำขอที่มีโทเคนอินพุตระหว่าง 200,000 ถึง 272,000 — GPT-6.1 Sol เพราะ Grok 4.7 เพิ่มคำขอทั้งหมดเป็นสองเท่าไปแล้ว แต่ Sol ยังไม่
• บทสนทนาที่ถูกที่สุดเท่าที่เป็นไปได้ — ไม่ใช่ทั้งสองตัวนี้ ทั้งคู่เป็นโมเดลราคาระดับแนวหน้าและมีความอยากใช้โทเคนระดับแนวหน้า; การเปรียบเทียบนี้เกี่ยวกับว่าโมเดลใดทำงานของคุณให้เสร็จ ไม่ใช่โมเดลใดถูกในเชิงนามธรรม
• หากการเปรียบเทียบลงเอยด้วย "Grok ถูกกว่าต่อโทเคน" — มันจบเร็วเกินไปหนึ่งก้าว ก้าวถัดไปคือจำนวนโทเคน และนั่นคือ 240 ล้าน เทียบกับ 67

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube