สร้างการ์ดชื่อเรื่องหลักสำหรับ Claude Opus 5.5 กับ Grok 4.6 โดยแบ่งด้วยเส้นแบ่งแนวตั้ง: 'Claude Opus 5.5' พร้อม '$4.00 / $20.00' ทางซ้าย, 'Grok 4.6' พร้อม '$2.00 / $6.00' ทางขวา และแท็กไลน์ 'โมเดลหนึ่งอ่าน อีกโมเดลลงมือทำ' ไว้ด้านล่าง พร้อมโลโก้ OrcaRouter ที่มุมล่างขวา
Guides & Insights

Claude Opus 5.5 กับ Grok 4.6: โมเดลหนึ่งอ่าน อีกโมเดลหนึ่งลงมือทำ

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Claude Opus 5.5 และ Grok 4.6 เป็นสองวิธีที่ถูกที่สุดในการซื้อโมเดลระดับแนวหน้าที่รองรับบริบทได้ครึ่งล้านโทเคน — และทั้งสองไม่ใช่ผลิตภัณฑ์เดียวกัน ในการวัดค่าหนึ่ง Grok 4.6 ห่างจากเพดานสูงสุดเพียงสามจุด: 94.9 บน GPQA Diamond ชุดคำถามวิทยาศาสตร์ระดับบัณฑิตศึกษาที่เรือธงของ Anthropic อยู่ในช่วงเดียวกัน ในการวัดถัดไป มันตามหลังอยู่สามสิบแปดจุด บน Terminal-Bench 4.0 ซึ่งเป็นเบนช์มาร์กเทอร์มินัลแบบเอเจนต์ที่ให้โมเดลทำงานจริงในเชลล์ Artificial Analysis ให้คะแนน Grok 4.6 ที่ 21.21% และ Claude Opus 5.5 ที่ 59.60% นั่นไม่ใช่การพิมพ์ผิดในทิศทางใดทิศทางหนึ่ง และรูปทรงทั้งหมดของการจับคู่นี้อยู่ที่การอธิบายว่าทำไมตัวเลขทั้งสองจึงเป็นจริงพร้อมกัน

สองการเปิดตัว ราคาระดับเดียวกัน ห่างกันสี่เดือน

SpaceXAI เปิดตัว Grok 4.6 เมื่อวันที่ 12 สิงหาคม 2026 ในฐานะเรือธงปัจจุบันของสาย Grok ในราคา $2.00 ต่อล้านโทเค็นอินพุตและ $6.00 เอาต์พุต พร้อมหน้าต่างบริบท 500,000 โทเค็น และพื้นผิวอินพุตแบบข้อความ รูปภาพ และไฟล์ Anthropic เปิดตัว Claude Opus 5.5 เมื่อวันที่ 22 กันยายน 2026 ประมาณหกสัปดาห์ต่อมา ในราคา $4.00/$20.00 พร้อมหน้าต่างบริบท 1,000,000 โทเค็นและโทเค็นเอาต์พุต 128,000 ทั้งสองรองรับความพยายามในการให้เหตุผลที่กำหนดค่าได้ การเรียกใช้เครื่องมือ และเอาต์พุตแบบมีโครงสร้าง ทั้งคู่พูดพื้นผิวแชทที่เข้ากันได้กับ OpenAI รวมถึงรูปแบบเฉพาะของผู้จำหน่ายเอง

ดังนั้นการอ่านแบบผิวเผินจึงเป็นการแลกเปลี่ยนที่ชัดเจน: Grok 4.6 มีราคาต่ออินพุตครึ่งหนึ่ง และประมาณหนึ่งในสามสำหรับเอาต์พุต ส่วน Claude Opus 5.5 ตอบด้วยหน้าต่างบริบทเป็นสองเท่า การแลกเปลี่ยนนี้เป็นของจริง และในงานเอกสารยาว มันอาจเป็นสิ่งเดียวที่สำคัญ มันยังไม่ใช่จุดที่ความแตกต่างที่น่าสนใจอยู่ เพราะทั้งสองโมเดลถูกวัดบนชุดทดสอบอิสระเดียวกัน และไม่ได้ลงเอยที่ตำแหน่งเดียวกันบนแกนที่สำคัญสำหรับงานแบบเอเจนต์

สิ่งที่แค็ตตาล็อกระบุไว้บนแกนที่ทั้งคู่ถูกวัด

แค็ตตาล็อกของ OrcaRouter มีที่มาของผลการวัดประสิทธิภาพกำกับในแต่ละแถว — ตัวเลขแต่ละตัวระบุชื่อผู้ประเมินที่มันมาจาก — ดังนั้นคู่ด้านล่างจึงมาจากแหล่งเดียวกันทั้งสองโมเดล คือ Artificial Analysis แทนที่จะเป็นตัวเลขจากผู้ขายในด้านหนึ่งและจากบุคคลที่สามในอีกด้านหนึ่ง:

• GPQA Diamond — Claude Opus 5.5 ไม่ได้ระบุในแกนนี้ในแค็ตตาล็อกของเรา; Grok 4.6 ได้คะแนน 94.9%

• Humanity's Last Exam — Claude Opus 5.5 ทำได้ 61.4% เทียบกับ Grok 4.6 ที่ 42.9%

• SciCode — 66.9% เทียบกับ 56.5%

• การเรียกคืนบริบทแบบยาว — 84.7% เทียบกับ 80.3%

• Terminal-Bench 4.0 — 59.60% เทียบกับ 21.21%

• AA Intelligence Index — 57.6 เทียบกับ 44.3

แถว GPQA ถูกเว้นว่างไว้โดยเจตนาในฝั่งของ Anthropic แทนที่จะเติมจากสไลด์ของผู้ขาย คะแนน 94.9 ของ Grok 4.6 ในแถวนั้นเป็นตัวเลขที่แข็งแรงที่สุดบนการ์ดของมัน และมันเป็นของจริง — เป็นการวัดโดยอิสระ ไม่ใช่คำกล่าวอ้างของ SpaceXAI — และมันบ่งบอกสิ่งที่เป็นจริงเกี่ยวกับโมเดลนี้ว่า เมื่องานเป็นคำถามที่ตั้งไว้อย่างเรียบร้อยและมีคำตอบที่ปกป้องได้เพียงหนึ่งเดียว Grok 4.6 ก็ทำงานได้ในระดับแนวหน้า เมื่ออ่านคู่กับ 21.21% ของ Terminal-Bench 4.0 รูปร่างก็เริ่มชัดเจนขึ้น การสร้างคำตอบที่ถูกต้องเกี่ยวกับวิทยาศาสตร์ กับการลงมือทำงานห้าขั้นตอนในเชลล์กับระบบไฟล์จริง เป็นความสามารถคนละอย่างกัน และ Grok 4.6 ไปได้ไกลกว่ามากในอย่างแรกเมื่อเทียบกับอย่างหลัง

ข้อควรระวังหนึ่งประการเกี่ยวกับการจับคู่นั้นก่อนที่มันจะถูกใช้เป็นคำตัดสิน: ตัวเลขจาก Artificial Analysis ของทั้งสองโมเดลถูกบันทึก ณ วันที่ประเมินที่ต่างกัน โดยของ Grok 4.6 เป็นชุดที่เก่ากว่า การเปรียบเทียบนี้เป็นการเทียบระหว่างโมเดลที่ประเมินในเดือนสิงหาคมกับโมเดลที่ประเมินในเดือนกันยายน บนชุดทดสอบที่ตัวมันเองได้รับการปรับปรุงตลอดช่วงเวลาดังกล่าว ทิศทางของช่องว่างสอดคล้องกันในห้าแกนที่แยกจากกัน ซึ่งเป็นเหตุผลที่เราถือว่ามันเป็นสัญญาณ แต่ค่าคะแนนที่แน่นอนควรอ่านเป็นการเปรียบเทียบสิงหาคมเทียบกับกันยายน ไม่ใช่การเปรียบเทียบในวันเดียวกัน

ดัชนีที่สร้างขึ้นโดยคนที่ไม่ได้ขายอะไรเช่นกัน

มีมาตรวัดอิสระตัวที่สอง และมันสอดคล้องกันในแง่ทิศทาง ขณะเดียวกันก็ยอมแยกแยะความแตกต่างแบบละเอียดน้อยกว่ามาก ดัชนีขีดความสามารถ Epoch (Epoch Capabilities Index) ซึ่งสร้างโดย Epoch AI โดยเป็นองค์ประกอบรวมจากการทดสอบกว่า 50 รายการ และปรับสเกลใหม่ให้ Claude 3.5 Sonnet อยู่ที่ 130 และ GPT-5 อยู่ที่ 150 จัดให้ Claude Opus 5.5 อยู่ที่ 167.35 ในไฟล์ที่เราอ่านเมื่อวันที่ 2 ตุลาคม 2026 ส่วน Grok 4.6 อยู่ที่ 156.61 จากการประเมินเมื่อวันที่ 12 สิงหาคม นั่นคือช่องว่าง 10.74 จุดบนสเกลที่พบว่า ประมาณห้าจุดสอดคล้องกับการเพิ่มขึ้นเป็นสองเท่าของมาตรวัดขอบเขตเวลาของ METR ณ เวลาที่เปิดตัวดัชนี ซึ่งกว้าง และอยู่นอกช่วงที่เผยแพร่ของทั้งสองโมเดลอย่างสบาย ๆ คือ 164.0 ถึง 172.0 และ 154.66 ถึง 158.93 โดยช่วงเหล่านี้ไม่ทับซ้อนกันเลย

น่าสังเกตว่าดัชนีนี้ไม่ได้ตัดสินอะไร ดัชนีนี้จัดให้ Claude Sonnet 5.5 อยู่ที่ 165.2 และ Claude Fable 5.1 อยู่ที่ 164.82 ซึ่งทั้งคู่อยู่เหนือ Grok 4.6 และทั้งสองรุ่นมีราคาต่อโทเคนเอาต์พุตหนึ่งล้านโทเคนถูกกว่าอัตราระดับที่สองของ Grok 4.6 ใครก็ตามที่เลือกโดยดูจากความสามารถต่อราคาเพียงอย่างเดียวก็ยังมีตัวเลือกที่สามและสี่ในตระกูลผู้ขายเดียวกัน ส่วนการจับคู่ในบทความนี้เป็นเรื่องอื่น นั่นคือแต่ละรุ่นในสองรุ่นนี้เก่งเรื่องอะไร

การ์ดราคา และแถวที่ปรากฏเฉพาะบนหนึ่งในนั้น

A two-column scoreboard comparing Claude Opus 5.5 and Grok 4.6 across six rows. Left column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K max output, AA Intelligence Index 57.6, Epoch Capabilities Index 167.35. Right column Grok 4.6: input $2.00 doubling to $4.00 above 200K tokens, output $6.00 doubling to $12.00, cache read $0.50, context 500K tokens, AA Intelligence Index 44.3, Epoch Capabilities Index 156.61. A footer line reads 'Prices and catalogue figures per the OrcaRouter catalogue; Index figures per Artificial Analysis and the Epoch Capabilities Index.'

เรตการ์ดของ Grok 4.6 มีขั้นบันไดที่เรตการ์ดของ Claude Opus 5.5 ไม่มี: คำขอที่มีโทเคนพรอมป์ต์เกิน 200,000 จะคิดค่าบริการเป็นสองเท่าของอัตราฐาน ดังนั้นอินพุตจะเพิ่มจาก $2.00 เป็น $4.00 และเอาต์พุตจาก $6.00 เป็น $12.00 โดยการอ่านแคชขยับจาก $0.50 เป็น $1.00 Claude Opus 5.5 คิด $4.00/$20.00 โดยการอ่านแคชอยู่ที่ $0.20 คงที่ตลอดหน้าต่าง 1,000,000 โทเคนทั้งหมด การกลับทิศนี้เป็นผลในทางปฏิบัติของการซื้อบริบทแบบยาวจากโมเดลใดก็ตาม และมันพลิกการเปรียบเทียบราคาหน้าป้ายเมื่อภาระงานเติบโตขึ้นจริง:

• ราคาที่ 30,000 โทเค็นอินพุต — Claude Opus 5.5 เป็นรุ่นที่แพง โดยอยู่ที่ประมาณ 28 เซนต์สำหรับอินพุต 30,000 และเอาต์พุต 8,000 เทียบกับประมาณ 11 เซนต์สำหรับ Grok 4.6

• ราคาที่ 250,000 โทเคนอินพุต — ลำดับกลับกัน เพราะ Grok 4.6 ได้ขยับไปยังระดับที่เพิ่มเป็นสองเท่าของมันแล้ว ในขณะที่ Claude Opus 5.5 ยังไม่ได้

• การอ่านแคช — $0.20 ต่อล้านสำหรับ Claude Opus 5.5 เทียบกับ $0.50 ซึ่งเพิ่มขึ้นเป็น $1.00 เมื่อเกินขั้น สำหรับ Grok 4.6

• เอาต์พุตสูงสุด — 128,000 โทเคนสำหรับ Claude Opus 5.5; เพดานเอาต์พุตของ Grok 4.6 ไม่ได้เผยแพร่ไว้ในบันทึกแคตตาล็อก

Grok 4.6 ยังมีช่องว่างหนึ่งจุดที่ควรกล่าวอย่างตรงไปตรงมา แทนที่จะปล่อยให้ไปค้นพบในภายหลัง บันทึกของมันไม่ระบุตัวเลขเอาต์พุตสูงสุดเลย — ฟิลด์นี้ยังไม่ได้วัด ไม่ใช่ศูนย์ — ดังนั้นงานที่ต้องอาศัยคำตอบเดียวยาวมากจึงไม่มีตัวเลขที่เผยแพร่ให้ใช้วางแผนเทียบได้ในฝั่งนั้นของการเปรียบเทียบ

คอลัมน์ประสิทธิภาพที่ไม่ควรอ่าน

แค็ตตาล็อกของเรายังมีแผงประสิทธิภาพการให้บริการต่อโมเดล และบน Grok 4.6 มันเป็นสิ่งที่ทำให้เข้าใจผิดมากที่สุดบนหน้านี้ การ์ดระบุค่าแลเทนซี p50 ที่ 10,000 มิลลิวินาที และอัตราข้อผิดพลาด 97.58% ในช่วงเวลาเจ็ดวัน โดยมีโทเค็นที่ให้บริการ 26,184 โทเค็นในช่วงเวลานั้น ฟิลด์เหล่านี้ไม่ได้อธิบายถึงโมเดลที่ช้า แต่พวกมันอธิบายถึงโมเดลที่แทบไม่ถูกเรียกใช้เลย: ที่ระดับทราฟฟิกนั้น ตัวอย่างบางเกินไปจนการกระจายตัวของแลเทนซีไม่มีความหมายอะไร และอัตราข้อผิดพลาดสะท้อนถึงความพยายามเพียงไม่กี่ครั้งมากกว่าที่จะเป็นคุณภาพการให้บริการ การถือเอาบล็อกนั้นเป็นหลักฐานว่า Grok 4.6 ช้า ก็เท่ากับการอ่านอาร์ติแฟกต์จากการวัดเป็นผลการวัด

ในทางกลับกัน แผงของ Claude Opus 5.5 นั้นมีประชากรอยู่เบื้องหลัง — ค่า p50 อยู่ในช่วง 4.4 วินาที ในหน้าต่างเวลาเจ็ดวันโดยมีการสุ่มตัวอย่างรายวัน และมีโทเคนที่ให้บริการไป 156 ล้านโทเคนในช่วงเดียวกัน แม้แต่ตัวเลขนั้นก็ควรถูกอ่านตามที่มันเป็นจริง นั่นคือ ทราฟฟิก playground ของเราเอง ซึ่งเป็นตัวอย่างของผู้ใช้ของเรา ไม่ใช่คุณสมบัติของโมเดล

จะเลือกส่งอันไหน และจะหาคำตอบได้อย่างไรจากงานของคุณเอง

ความแตกต่างที่ตัวเลขเหล่านี้อธิบายนั้นมีเสถียรภาพมากพอที่จะนำไปใช้ตัดสินใจได้ Claude Opus 5.5 เป็นตัวเลือกสำหรับงานแบบเอเจนต์และงานระยะยาว — ช่องว่างใน Terminal-Bench 4.0 ที่ 59.60% เทียบกับ 21.21% เป็นความแตกต่างที่มากที่สุดในแกนใด ๆ ที่ทั้งสองโมเดลถูกวัด และเป็นแกนที่บ่งชี้ว่าโมเดลสามารถรับงานเป็นงานได้หรือรับได้เพียงเป็นคำถาม นอกจากนี้ยังเป็นตัวเลือกเมื่อพรอมป์ต์ยาวจริง ๆ เพราะอัตราค่าใช้จ่ายไม่มีการกระโดดขั้น และหน้าต่างมีขนาดใหญ่เป็นสองเท่า Grok 4.6 เป็นตัวเลือกสำหรับงานที่อยู่ในรูปคำถามในปริมาณมาก: คะแนน GPQA Diamond 94.9% ที่ราคา $2.00/$6.00 ภายใน 200,000 โทเคนแรกถือเป็นข้อเสนอที่ดีมากสำหรับเวิร์กโหลดแบบดึงข้อมูลและตอบคำถามที่ไม่เคยขยายไปถึงระดับราคาที่เพิ่มเป็นสองเท่า

ทั้งสองอยู่บน OrcaRouter ในราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% — Claude Opus 5.5 ที่ $4.00/$20.00 พร้อมการอ่านแคชที่ $0.20, Grok 4.6 ที่ $2.00/$6.00 โดยใช้ระดับที่เกิน 200K ตามที่ SpaceXAI กำหนดไว้อย่างตรงเป๊ะ — อยู่หลังคีย์เดียว ดังนั้นการแบ่งข้างต้นจึงสามารถทดสอบกับชุดพรอมป์ของคุณเองได้ แทนที่จะมาเถียงกัน ในจุดที่มีการเราเททั้งสอง ระบบสำรองอัตโนมัติจะอยู่ข้างใต้ ซึ่งมีประโยชน์เมื่อโมเดลที่ถูกกว่าเป็นตัวที่ถือเส้นทางแบบ agentic อยู่

คำตัดสินที่การจับคู่นี้ได้รับ: Grok 4.6 เป็นนักอ่านที่เก่งกว่า และ Claude Opus 5.5 เป็นผู้ทำงานที่เก่งกว่า คะแนน 94.9 บน GPQA Diamond และ 21.21 บน Terminal-Bench คือโมเดลเดียวกันที่ถูกวัดสองครั้ง และการรู้ว่าตัวเลขสองตัวนั้นตัวไหนที่ภาระงานของคุณดูคล้าย คือทั้งหมดของการตัดสินใจ

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.Screenshot of the OrcaRouter model page for Grok 4.6 (grok/grok-4.6), showing the model header, the context window of 500,000 tokens, the text, image and file input surface, the capability tags, and the input and output price figures per million tokens.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube