การ์ดหัวเรื่องที่เขียนว่า “Grok 4.7 vs Claude Opus 5” พร้อมคำโปรยรอง “ช่องว่างราคาเป็นเรื่องจริง แต่ความเท่าเทียมไม่ใช่” และการ์ดสามใบ: AA Index v4.3.2 46 vs 51, ราคาต่อ 1M $2/$6 vs $5/$25 และ Terminal-Bench 4.0 26 vs 49
Guides & Insights

Grok 4.7 vs Claude Opus 5: ช่องว่างราคาเป็นของจริง แต่ความเท่าเทียมไม่ใช่

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

คุณสามารถเรียกใช้ Grok 4.7 ในราคา $2.00 ต่อโทเค็นอินพุตหนึ่งล้านโทเค็น และ $6.00 ต่อโทเค็นเอาต์พุตหนึ่งล้านโทเค็น คุณสามารถเรียกใช้ Claude Opus 5 ในราคา $5.00 และ $25.00 นั่นคือความแตกต่าง 4.2 เท่าสำหรับเอาต์พุต — ช่องว่างแบบที่มักตัดสินการเปรียบเทียบก่อนที่เบนช์มาร์กจะถูกเปิดออกด้วยซ้ำ แต่มันไม่ได้ตัดสินกรณีนี้ บนเวอร์ชันของ Artificial Analysis Intelligence Index ที่ทั้งสองโมเดลถูกให้คะแนนอยู่ในปัจจุบัน — v4.3.2 ซึ่งเป็นฉบับปรับปรุงที่เผยแพร่เมื่อวันที่ 19 กันยายน 2026 — Claude Opus 5 อยู่ที่ 51 และ Grok 4.7 ซึ่งผู้ขายเปิดตัวเมื่อวันที่ 21 กันยายน 2026 อยู่ที่ 46 ห้าคะแนนไม่ใช่ชัยชนะแบบถล่มทลาย แต่รูปร่างของห้าคะแนนนั้นคือ Opus 5 ชนะแปดในสิบการประเมินในดัชนีนั้น เหตุผลของโมเดลที่ถูกกว่าคือราคา ส่วนบริบทนั้นเสมอกัน และจุดเดียวที่ข้อได้เปรียบด้านราคาของ Grok 4.7 ควรจะสำคัญที่สุด กลับเป็นจุดที่มันหายไปพอดี

สองเรือธง สองตารางราคาที่ต่างกันคนละขั้ว

Claude Opus 5 วางตลาดมาตั้งแต่วันที่ 24 กรกฎาคม 2026 และเป็นเรือธงระดับ Opus ของ Anthropic โดยอยู่ในตำแหน่งรองจาก Claude Fable 5.1 ในไลน์อัปของบริษัทเอง มันมีหน้าต่างบริบท 1 ล้านโทเคนในราคาแบบคงที่ — Anthropic ระบุตรง ๆ ว่าคำขอ 900k โทเคน คิดราคาต่อโทเคนเท่ากับคำขอ 9k โทเคน โดยไม่มีค่าพรีเมียมสำหรับบริบทยาวเลยแม้แต่น้อย — และมีเอาต์พุตสูงสุด 128K ซึ่งขยายได้ถึง 300K บน Message Batches API การคิดเป็นแบบปรับตัวได้และเปิดไว้เป็นค่าเริ่มต้น โดยมีบันไดระดับความพยายามไล่จาก low, medium, high, xhigh และ max ซึ่งตั้งค่าเริ่มต้นที่ high น้ำหนักโมเดลเป็นแบบปิด

Grok 4.7 เพิ่งเปิดตัวได้หนึ่งวัน โดยรองรับคอนเท็กซ์ 500k โทเคน รับข้อความและรูปภาพเข้า และส่งออกเป็นข้อความ พร้อมมีปุ่มปรับระดับความพยายามในการใช้เหตุผลเป็นของตัวเอง ราคาตามประกาศอยู่ที่ $2.00 สำหรับอินพุต และ $6.00 สำหรับเอาต์พุตต่อล้านโทเคนเมื่อพรอมป์ตต่ำกว่า 200k โทเคน และจะเพิ่มเป็น $4.00 และ $12.00 เมื่อถึงหรือเกินเกณฑ์ดังกล่าว ส่วนการอ่านจากแคชอยู่ที่ $0.50 และ $1.00 ในสองช่วงเดียวกัน xAI ยังระบุถึงเวอร์ชันที่เร็วกว่าซึ่งทำงานด้วยความเร็วเอาต์พุตประมาณสองเท่าในราคาประมาณสองเท่า แม้ว่าการกำหนดค่าดังกล่าวจะเปิดตัวโดยไม่มีผลการวัดความเร็วที่เผยแพร่แนบมาด้วย น้ำหนักโมเดลก็ปิดเช่นกัน ซึ่งตัดทางออกแบบ "รันเอง" ออกจากทั้งสองฝั่งของการเปรียบเทียบนี้

คณะกรรมการอิสระไม่ได้ใกล้ชิด และก็ไม่ประจบสอพลอ

โมเดลทั้งสองนี้ได้รับการให้คะแนนบนดัชนี v4.3.2 ของ Artificial Analysis ซึ่งรวมการประเมินสิบรายการที่ครอบคลุมเอเจนต์ การเขียนโค้ด ความรู้ทั่วไป และการให้เหตุผลเชิงวิทยาศาสตร์ การวางสองคอลัมน์ไว้เคียงกันทำให้ตัวเลขพาดหัวห้าคะแนนดูใจป้ำเกินไปสำหรับโมเดลที่ถูกกว่า — ช่องว่างห้าคะแนนเพียงจุดเดียวในคะแนนรวมอาจซ่อนรายละเอียดได้มาก และในกรณีนี้มันซ่อนการกวาดชัยเกือบทั้งหมด

ความฉลาดเชิงผสมผสาน — Grok 4.7 (xhigh): 46 บน Artificial Analysis Intelligence Index v4.3.2 ส่วน Claude Opus 5 (การใช้เหตุผลแบบปรับตัว ความพยายามสูงสุด): 51 บนฉบับแก้ไขเดียวกัน

การให้เหตุผลที่ยาก — Grok 4.7: Humanity's Last Exam 43, CritPt 18. Claude Opus 5: HLE 55, CritPt 29. ช่องว่าง 12 คะแนนและ 11 คะแนนตามลำดับ โดยทั้งคู่เป็นผลดีต่อ Opus 5

เทอร์มินัลแบบเอเจนติก — Grok 4.7: Terminal-Bench 4.0 ได้ 26 คะแนน ส่วน Claude Opus 5: 49 คะแนน นี่คือช่องว่างเดี่ยวที่กว้างที่สุดบนบอร์ดคะแนน และมันอยู่ในเบนช์มาร์กที่ใกล้เคียงกับงานอัตโนมัติจริงมากที่สุด

ระบบอัตโนมัติในที่ทำงาน — Grok 4.7: AutomationBench-AA 66% Claude Opus 5: 57% นี่คือชัยชนะที่ชัดเจนเพียงหนึ่งเดียวของ Grok 4.7 และเป็นชัยชนะที่แท้จริง — มากถึงเก้าคะแนนในการประเมินที่ให้คะแนนว่าตัวแทนทำงานตามขั้นตอนจนเสร็จได้โดยไม่ชนกับแนวป้องกันหรือไม่

ความรู้และความซื่อสัตย์ — Grok 4.7: AA-Omniscience 32. Claude Opus 5: 37 ทั้งสองโมเดลให้ข้อมูลที่ไม่มีอยู่จริง (hallucinate) โดย Opus 5 ทำเช่นนี้น้อยกว่าเมื่อวัดด้วยตัวชี้วัดนี้

บริบทขนาดยาว — Grok 4.7: AA-LCR v1.1 77% หน้าต่าง 500k โทเค็น Claude Opus 5: 79% หน้าต่าง 1M โทเค็น

ค่าใช้จ่ายในการรันดัชนี — Grok 4.7: 240 ล้านโทเคนเอาต์พุตตลอดการประเมิน ซึ่ง Artificial Analysis ชี้ว่ามีความละเอียดมากเกินปกติ Claude Opus 5: 140 ล้าน Grok 4.7 ใช้โทเคนมากกว่า 1.7 เท่าเพื่อให้ได้คะแนนที่ต่ำกว่า

OrcaRouter model page for Claude Opus 5 showing the anthropic/claude-opus-5 identifier, a 1M-token context window, 128K maximum output, text, image and file input with text output, list rates of $5.00 per 1M input and $25.00 per 1M output, and 69.9M tokens of traffic over seven days.

จุดที่ความได้เปรียบด้านราคาของ Grok 4.7 ไปดับสูญ

นี่คือเลขคณิตที่ตารางราคาซ่อนไว้ ลองดูคำขอแบบ agentic ที่สมจริง: อินพุต 30k โทเคน เอาต์พุต 8k Grok 4.7 เรียกเก็บ $0.06 ขาเข้า และ $0.048 ขาออก — ประมาณสิบเอ็ดเซนต์ Claude Opus 5 เรียกเก็บ $0.15 ขาเข้า และ $0.20 ขาออก — ประมาณสามสิบห้าเซนต์ นั่นคือ 3 เท่าจริง ๆ และที่ขนาดนี้ Grok 4.7 คือตัวเลือกที่ชัดเจนหากพิจารณาแค่ต้นทุนเพียงอย่างเดียว

ตอนนี้ลองมาดูคำขอที่การตลาดของ Grok 4.7 เองถูกสร้างขึ้นมารอบๆ: เซสชันแบบเอเจนต์ที่ใช้บริบทขนาดยาว ดันพรอมป์ให้เกิน 200k โทเคน แล้วอัตราของ Grok 4.7 จะเพิ่มเป็นสองเท่าเป็น $4.00 ขาเข้า และ $12.00 ขาออก Claude Opus 5 ไม่ขยับเลย — หน้าต่าง 1M ของมันคิดราคาแบบคงที่ที่ $5.00 และ $25.00 ที่อินพุต 250k และเอาต์พุต 8k Grok 4.7 มีค่าใช้จ่าย $1.00 ขาเข้า และ $0.096 ขาออก รวมประมาณ $1.10 ส่วน Opus 5 มีค่าใช้จ่าย $1.25 ขาเข้า และ $0.20 ขาออก รวมประมาณ $1.45 ช่องว่างหดลงจาก 3 เท่าเหลือประมาณ 1.3 เท่า ดันต่อไปอีก — 400k, 500k ซึ่งเป็นเพดานสูงสุดของหน้าต่าง Grok 4.7 — และอัตราคงที่ของ Opus 5 ก็ยังคงไล่กระชับเข้ามาเรื่อยๆ ขณะที่หน้าต่างของมันยังคงไปต่อได้ถึงหนึ่งล้านโทเคน Grok 4.7 เป็นโมเดลราคาถูกเมื่อพรอมป์สั้น และเทียบเคียงกันได้เกือบพอๆ กันในด้านราคาเมื่อพรอมป์ยาว ซึ่งพลิกกลับสัญชาตญาณที่หน้าราคาถูกออกแบบมาเพื่อสร้างขึ้น

ข้อแม้สองข้อช่วยให้เรื่องนี้ยังคงตรงไปตรงมา ข้อแรก ระดับบริบทแบบยาวเป็นโครงสร้างราคาตามรายการที่ระบุไว้ในเอกสารโมเดลของ xAI เอง ไม่ใช่ผลจากการวัด — บิลจริงขึ้นอยู่กับแคช และอัตราการอ่านจากแคชที่ 0.50 ดอลลาร์ของ Grok 4.7 นั้นถูกจริง ๆ ข้อสอง Artificial Analysis ยังไม่ได้เผยแพร่ผลการวัดความเร็วของ Grok 4.7 ดังนั้นครึ่งที่เป็น "เร็วกว่า" ของข้อโต้แย้งเรื่องถูกและเร็วจึงยังไม่ได้รับการยืนยันในตอนนี้ สิ่งที่วัดได้คือ Opus 5 ที่ 59 โทเคนต่อวินาที โดยมีเวลาถึงโทเคนแรก 49 วินาที — ช้า แพง และนำหน้าในเกือบทุกมิติด้านคุณภาพ

สิ่งที่คุณจะกำหนดเส้นทางจริง ๆ

นี่คือการเปรียบเทียบที่คำตอบตรงไปตรงมาแตกต่างกันไปตามลักษณะงาน และ เราเตอร์คือวิธีที่คุ้มค่าที่สุดในการลงมือทำตามนั้น Claude Opus 5 ใช้งานได้บน OrcaRouter โดยมีหน้าของโมเดลตัวเองและราคาของผู้ให้บริการถูกส่งต่อมาที่ส่วนเพิ่ม 0% — ดังนั้นราคา $5.00 และ $25.00 ของ Opus 5 ในแคตตาล็อกของเราคือราคาตั้งของ Anthropic ไม่ใช่ราคาที่บวกเพิ่ม และถ้า Anthropic ปรับราคา ตัวเลขก็จะเปลี่ยนในคีย์เดียวกันภายในวันเดียวกัน Grok 4.7 ไม่ได้อยู่ในแคตตาล็อกของ OrcaRouter ณ เวลาที่เขียนนี้ หากจะเรียกใช้ในวันนี้ต้องผ่าน API ของ xAI เองและแพลตฟอร์มของบุคคลที่สามที่มีให้บริการ ความไม่สมมาตรนี้มีคุณค่าที่ควรรู้ก่อนที่คุณจะออกแบบระบบโดยอิงกับมัน

Two-column scoreboard titled “Grok 4.7 vs Claude Opus 5 - the scoreboard”: AA Index 46 vs 51, Terminal-Bench 4.0 26 vs 49, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $5/$25, and open weights “no” on both sides.

รูปแบบการกำหนดเส้นทางที่ได้จากตัวเลขนั้นตรงไปตรงมา ส่งงานที่ใช้บริบทขนาดยาว งานที่ใช้การให้เหตุผลหนัก และงานเอเจนต์เทอร์มินัลไปที่ Opus 5 — มันชนะ Terminal-Bench 4.0 ด้วยคะแนน 23 คะแนน และมีหน้าต่างบริบทเป็นสองเท่าในราคาคงที่ ซึ่งเป็นโปรไฟล์ของงานที่ยากและยาวพอดี ส่งงานระบบอัตโนมัติและงานเวิร์กโฟลว์ปริมาณสูงไปที่ Grok 4.7: มันชนะ AutomationBench-AA ด้วยคะแนนเก้าคะแนน และมีค่าใช้จ่ายเป็นหนึ่งในสามเมื่อพรอมต์สั้น เนื่องจากทั้งสองเข้าถึงได้ผ่านปลายทางเดียวเมื่ออยู่ในแคตตาล็อก การแยกนั้นจึงเป็นกฎการกำหนดเส้นทางมากกว่าสัญญาผู้ขายรายที่สอง และการสลับไปใช้สำรองอัตโนมัติหมายความว่าขีดจำกัดอัตราบนเส้นทางหนึ่งกลายเป็นเหตุการณ์การกำหนดเส้นทางแทนที่จะเป็นการหยุดให้บริการ ในกรณีที่ภาระงานต้องการทั้งสองอย่างจริง ๆ — รอบแรกที่ราคาถูกและรอบตรวจสอบที่ราคาแพง — DSL การกำหนดเส้นทางจะประกอบเข้าด้วยกันเป็นการเรียกครั้งเดียวแทนที่จะเป็นการรวมสองอย่าง

คำตัดสิน

หากคุณเลือกตัดสินจากหลักฐาน Claude Opus 5 ชนะการเปรียบเทียบครั้งนี้ และชนะแบบไม่เฉียดฉิวเลย: แปดในสิบของการประเมิน ช่องว่างที่กว้างที่สุดสองอัน คอนเท็กซ์มากเป็นสองเท่าในราคาเดิม และงบโทเค็นที่ต่ำกว่าสองในสามอย่างมากเพื่อคะแนนที่สูงกว่า คะแนนรวมห้าจุดยังบอกได้น้อยเกินไปว่ามันนำอยู่ห่างแค่ไหน กรณีของ Grok 4.7 นั้นแคบกว่าที่ตารางราคาของมันชวนให้คิด แต่ก็ไม่ได้ว่างเปล่า — มันถูกกว่าจริง ๆ ที่ขนาดพรอมป์ตที่แอปพลิเคชันส่วนใหญ่ใช้กันจริง มันเป็นโมเดลสำหรับงานอัตโนมัติที่ better และมันเพิ่งอายุได้หนึ่งวัน โดยชุดเบนช์มาร์กของผู้ขายยังอยู่ระหว่างการตรวจสอบซ้ำอย่างอิสระ ซื้อมันสำหรับงานอัตโนมัติที่คำนึงถึงต้นทุน คอยดูตัวเลขความเร็วของมันเมื่อ Artificial Analysis เผยแพร่ออกมา และมองว่าระดับราคาสำหรับคอนเท็กซ์ยาวคือสิ่งที่ตัดสินว่าโมเดลราคาถูกจะยังถูกอยู่หรือไม่

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube