
Grok 4.6 เทียบกับ Claude Opus 5: ได้ 61 เหมือนกัน แต่เป็นสองเศรษฐกิจที่แตกต่างกัน
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
Artificial Analysis ใช้การประเมินชุดเดียวกันเก้ารายการกับโมเดลระดับแนวหน้าทุกตัว แล้วเผยแพร่บิล ในดัชนีความฉลาด (Intelligence Index) ของมัน Grok 4.6 และ Claude Opus 5 ต่างก็ได้ตัวเลขเดียวกันที่ 61 ซึ่งถือเป็นการเปรียบเทียบแบบตัวต่อตัวที่หาได้ยาก เพราะคะแนนรวมไม่สามารถบอกคุณได้ว่าควรใช้ตัวไหน สิ่งที่บอกได้คือตัวเลขที่ไม่ค่อยถูกพูดถึงจากแหล่งเดียวกัน: บนชุดทดสอบงานความรู้ AA-Briefcase Grok 4.6 ทำงานหนึ่งงานเสร็จโดยใช้ประมาณ 53 รอบ และโทเคนนำเข้าประมาณห้าร้อยล้านโทเคน ขณะที่ Claude Opus 5 ที่ใช้ความพยายามสูงสุดต้องใช้ประมาณ 103 รอบและสองพันล้านโทเคนสำหรับงานเดียวกัน นั่นคือช่องว่างการบริโภคโทเคนที่ต่างกันสี่ต่อหนึ่งระหว่างสองโมเดลที่มีคะแนนหลักเท่ากัน และความต่างนี้จะเห็นก็ต่อเมื่อคุณหยุดเปรียบเทียบสเปกโมเดลแล้วหันมาเปรียบเทียบบิลแทน
ทั้งสองรุ่นเป็นการเปิดตัวเรือธงล่าสุด ซึ่งทำให้การเปรียบเทียบนี้เป็นไปอย่างสะอาด ไม่ใช่การเทียบรุ่นที่ต่างกัน Grok 4.6 เปิดตัวเมื่อวันที่ 12 สิงหาคม 2026 โดย SpaceXAI ในฐานะการปรับปรุงจากพื้นฐาน Grok 4.5 ซึ่งเป็นฐาน mixture-of-experts ที่มีพารามิเตอร์ 1.5 ล้านล้านเท่าเดิม แต่นำมาฝึกซ้ำด้วยการฝึกแบบมีผู้ดูแลที่ยาวนานขึ้นและการรัน reinforcement-learning ที่มุ่งเป้าไปที่เอเจนต์ที่ทำงานระยะยาว Claude Opus 5 เปิดตัวเมื่อวันที่ 24 กรกฎาคม 2026 โดย Anthropic ในฐานะเรือธงที่ประทับวันที่ตายตัว พร้อม adaptive thinking หน้าต่างบริบท 1 ล้านโทเคน และการรับอินพุตรูปภาพและไฟล์ ทั้งสองอยู่ที่จุดเดียวกันบนกระดานคะแนนอิสระ แต่กลับอยู่คนละฝั่งบนแผ่นราคา: $2 / $6 ต่อล้านโทเคนสำหรับ Grok 4.6 เทียบกับ $5 / $25 สำหรับ Claude Opus 5 งานที่น่าสนใจคือการหาว่าประโยคครึ่งไหนเป็นตัวตัดสินใจเลือกใช้ในโปรดักชันของคุณ
เลข 61 ที่ซ่อนช่องว่างประสิทธิภาพสี่ต่อหนึ่ง
Intelligence Index เป็นองค์ประกอบจากการประเมินเก้าด้าน ซึ่งเป็นทั้งจุดแข็งและจุดบอดของมัน ตัวเลขเพียงค่าเดียวที่เฉลี่ยคะแนนด้านการให้เหตุผล คณิตศาสตร์ การเขียนโค้ด และงานด้านความรู้ ซ่อนวิธีการที่โมเดลไปถึงจุดนั้น — และสองรุ่นนี้ไปถึงจุดนั้นด้วยวิธีที่ตรงข้ามกัน ชุดการทำงานความรู้ระดับมืออาชีพแบบกระเป๋าเอกสารของ Artificial Analysis เองคือหน้าต่างที่ชัดเจนที่สุดในเรื่องนั้น: มันวัดงานระยะยาวจริง และบันทึกว่า Grok 4.6 ใช้ประมาณ 53 เทิร์นและ 0.5 พันล้านโทเค็นอินพุตต่องาน เทียบกับ Claude Opus 5 Max ที่ใช้ประมาณ 103 เทิร์นและ 2 พันล้านโทเค็นอินพุต ในแง่ต้นทุนต่องาน นั่นคือความแตกต่างระหว่างโมเดลที่ทำงานวิจัยและผลิตผลเสร็จโดยใช้โทเค็นเพียงหนึ่งในสี่ กับโมเดลที่เผาผลาญโทเค็นไปหมด
สาเหตุคือการเลือกเชิงออกแบบ ไม่ใช่บั๊ก Grok 4.6 ถูกฝึกมาโดยเฉพาะให้ตรวจสอบงานของตัวเองไปพร้อมกับทำงาน และหยุดเมื่องานย่อยเสร็จสมบูรณ์จริง ๆ — xAI อธิบายว่าเส้นทางงานที่ยาวพร้อมการทดสอบตัวเองคือวัตถุประสงค์ของการฝึก ส่วน Claude Opus 5 ถูกฝึกเพื่อความลึกของการใช้เหตุผลและความกว้างของความรู้ และพฤติกรรมพื้นฐานของมันคือการคิดให้หนักขึ้นและค้นคว้าให้มากเกินกว่าที่จำเป็นอย่างเคร่งครัด ทั้งคู่เป็น "โมเดลใช้เหตุผล" แต่พวกมันจัดสรรความพยายามต่างกัน และการจัดสรรนั้นคือสเปกที่สำคัญต่องานของเอเจนต์

ช่องว่างนี้สำคัญที่สุดสำหรับเอเจนต์ที่เรียกโมเดลในลูป — เอเจนต์วิจัย, โค้ดเอเจนต์ที่รันหลายสิบเทิร์น, ไปป์ไลน์เอกสารที่ประมวลผลแบตช์ข้ามคืน ทุกเทิร์นถูกคิดเงิน และทุกอินพุตโทเคนคือบริบทที่ต้องส่งซ้ำในการเรียกครั้งถัดไป โมเดลที่จบใน 53 เทิร์นที่ 0.5B โทเคนไม่ได้ถูกกว่าต่อโทเคนเท่านั้น; มันถูกกว่าต่องานประมาณหนึ่งลำดับความสำคัญเมื่อเทียบกับโมเดลที่ใช้ 103 เทิร์นที่ 2B โทเคน ก่อนที่คุณจะคูณด้วยราคารายการด้วยซ้ำ
แผ่นข้อมูลจำเพาะทั้งสองด้าน
ในส่วนที่ต่างกันบนกระดาษ ให้เขียนแต่ละส่วนในหนึ่งบรรทัด:
• ดัชนีความฉลาด — Grok 4.6 ได้คะแนน 61 อยู่อันดับที่ 6 จาก 184; Claude Opus 5 ได้คะแนน 61 อยู่อันดับร่วมที่ด้านบนสุด เสมอกันตามการวิเคราะห์ของ Artificial Analysis.
• ราคาตามรายการต่อ 1M โทเคน — Grok 4.6 ที่ $2 ต่อ input / $6 ต่อ output (เพิ่มเป็นสองเท่าเป็น $4 / $12 สำหรับพรอมป์ท์ที่มี input ตั้งแต่ 200K โทเคนขึ้นไป); Claude Opus 5 ที่ $5 ต่อ input / $25 ต่อ output พร้อมส่วนลดแบบ batch 50% เหลือ $2.50 / $12.50.
• หน้าต่างบริบท — 500K โทเคนสำหรับ Grok 4.6 เทียบกับ 1,000,000 สำหรับ Claude Opus 5 ซึ่งเป็นข้อได้เปรียบด้านสเปกที่ชัดเจนที่สุดเพียงข้อเดียวที่โมเดลใดโมเดลหนึ่งมี
• เอาต์พุตสูงสุด — Claude Opus 5 รองรับเอาต์พุตได้สูงสุด 128K โทเคน (300K ผ่าน API แบบแบตช์); เพดานเอาต์พุตของ Grok 4.6 ต่ำกว่า อยู่ในช่วงของคำตอบยาวทั่วไป
• อินพุต — ทั้งคู่รองรับข้อความและรูปภาพ; Claude Opus 5 ยังรองรับไฟล์ และเวอร์ชันอินพุตหลายรูปแบบของ Anthropic เข้าถึงเอกสารได้โดยตรงยิ่งขึ้น
• GDPVal-AA v2 (งานความรู้) — Grok 4.6 ที่ 1,753 Elo เทียบกับ Claude Opus 5 ที่ 1,852 Elo Opus 5 คว้ามงกุฎคุณภาพงานความรู้ในตัวชี้วัดที่ประสิทธิภาพกระเป๋าเอกสารเข้าข้าง Grok [Artificial Analysis]
• CursorBench v3.2 — 69.9% สำหรับ Grok 4.6 เทียบกับ 70.0% สำหรับ Claude Opus 5 ซึ่งถือว่าเสมอกันในทางปฏิบัติ บนเกณฑ์วัดเอเจนต์เขียนโค้ดที่ทั้งคู่ถูกวัด [Artificial Analysis]
• การควบคุมการใช้เหตุผล — Claude Opus 5 มีตัวปรับระดับความพยายามตั้งแต่ต่ำถึงสูงสุด และเปิดใช้การคิดแบบปรับตัวตามค่าเริ่มต้น ส่วน Grok 4.6 แสดงระดับการใช้เหตุผล แต่ถูกปรับให้ค่าเริ่มต้นเอื้อต่อเส้นทางของเอเจนต์ที่ยาว
การวางทั้งสองรุ่นเทียบเคียงกันนั้นก็เพื่อแสดงว่าไม่มีรุ่นใดที่เหนือกว่าอย่างชัดเจน Claude Opus 5 เป็นตัวเลือกทั่วไปที่ดีกว่าในทางทฤษฎี: มีบริบทยาวกว่า, ขีดจำกัดผลลัพธ์สูงกว่า, รองรับไฟล์เข้า, และคุณภาพงานเชิงความรู้สูงกว่า Grok 4.6 ให้ความคุ้มค่าเหนือกว่าและเป็นเอเจนต์ที่มีประสิทธิภาพมากกว่า คำถามเดียวที่เหลืออยู่คือความสามารถแบบไหนที่ตรงกับงานที่คุณทำจริง

จุดที่ Claude Opus 5 คุ้มค่ากับราคาพรีเมียม
{{1}}ตัวเลขเปิดตัวของ Anthropic{{/1}} — {{2}}รายงานโดยผู้พัฒนาระบบเอง ไม่ได้ผ่านการตรวจสอบซ้ำโดยอิสระ{{/2}} — {{3}}ระบุว่า Claude Opus 5 ทำคะแนนได้ 96.0% ในการทดสอบ SWE-bench Verified และ 79.2% ใน SWE-bench Pro{{/3}} {{4}}พร้อมคะแนน OSWorld 70.6% สำหรับการใช้งานคอมพิวเตอร์{{/4}} {{5}}ในการวัดผลแบบองค์รวม คะแนน 61 ของมันเทียบเท่ากับ Grok 4.6{{/5}} {{6}}และบน GDPVal-AA มันนำอยู่อย่างชัดเจน{{/6}} {{7}}สิ่งที่สิ่งนี้แปลผลได้ในทางปฏิบัติ{{/7}} {{8}}คือโมเดลที่รับมือได้ดีตลอดทั้งวันทำงานของพนักงานความรู้{{/8}}: {{9}}การร่างเอกสาร การวิเคราะห์ การให้เหตุผลกับเอกสารยาว งานที่ผสมภาพและข้อความ และการเขียนโค้ด{{/9}} {{10}}ทั้งหมดในที่เดียว{{/10}} {{11}}พร้อมความจุหนึ่งล้านโทเคน{{/11}}
หน้าต่างบริบทคือเหตุผลที่แท้จริงในการเลือกใช้มัน {{1}}ขีดจำกัด 500K โทเคน{{/1}}นั้นใหญ่ แต่มันไม่ใช่{{2}}โค้ดเบสทั้งหมดบวกกับคอร์ปัสงานวิจัยบวกกับผลลัพธ์ขั้นกลางของเซสชันเอเจนต์ที่ยาวนาน{{/2}} ทีมที่ทำ{{3}}การวิเคราะห์เชิงลึกแบบผ่านข้อมูลเพียงครั้งเดียวบนคลังข้อมูลขนาดใหญ่มาก{{/3}} — {{4}}คลังโค้ดทั้งหมด เอกสารทางการเงินหนึ่งปี กองเอกสาร PDF ยาวเหยียด{{/4}} — จะชน{{5}}เพดานของ Grok 4.6{{/5}} และไม่มีทางถึง{{6}}เพดานของ Claude Opus 5{{/6}} สำหรับเวิร์กโหลดเหล่านั้น บริบทที่เพิ่มขึ้นมาไม่ใช่สิ่งฟุ่มเฟือย {{7}}มันคือความแตกต่างระหว่างการที่งานพอดีลงไปได้ กับการต้องวางแผนจัดการรอบ ๆ ขีดจำกัด{{/7}}
จุดที่ Grok 4.6 เป็นตัวเลือกที่คุ้มค่ากว่า
เมื่อพลิกข้อเท็จจริงชุดเดียวกัน Grok 4.6 กลับเป็นตัวเลือกที่ดีกว่าสำหรับไปป์ไลน์เอเจนต์ และไม่ใช่ดีกว่าเพียงเล็กน้อยเลย มันมีต้นทุนถูกกว่า 2.5 เท่าในด้านอินพุต และถูกกว่า 4.2 เท่าในด้านเอาต์พุต เทียบกับราคาป้ายของ Opus 5 และประสิทธิภาพการใช้โทเคนต่องานของมันยิ่งตอกย้ำจุดนั้น ตัวเลขจาก AA-Briefcase บ่งชี้ว่าต้องใช้โทเคนน้อยลงประมาณ 4 เท่า และใช้เทิร์นน้อยลงประมาณ 2 เท่า เพื่อให้ได้ผลลัพธ์ของงานเชิงความรู้ (knowledge-work) แบบเดียวกัน คูณ 4 เท่ากับ 2.5 เท่า และงานที่ต้นทุน 1.00 ดอลลาร์ตามโครงสร้างราคาของ Opus 5 จะกลายเป็นต้นทุนราว 0.10 ดอลลาร์ตามโครงสร้างของ Grok 4.6 — ก่อนที่ส่วนลดแบบแบตช์จากฝั่ง Opus จะเข้ามาปิดช่องว่างบางส่วน
ในส่วนของการเขียนโค้ดแบบ agentic โดยเฉพาะ ผลลัพธ์ DeepSWE 1.1 ของ Grok 4.6 ดีขึ้นจาก 54% เป็น 65.9% ระหว่างเวอร์ชัน 4.5 และ 4.6 ส่วนคะแนน CursorBench ก็ห่างจากของ Opus 5 ไม่ถึงครึ่งจุด พร้อมทั้งตรวจสอบความถูกต้องของงานตัวเองไปด้วยตลอดทาง สำหรับทีมที่เรียกใช้งาน agentic เป็นพันครั้งต่อวัน ซึ่งแต่ละครั้งเป็นลูปแบบหลายเทิร์น ความคุ้มค่าต่องานและเส้นทางที่สั้นลงคือตัวชี้ขาดระหว่างผลิตภัณฑ์ที่ใช้งานได้จริงกับอัตราการเผาผลาญเงินทุน นั่นคือกรณีที่ xAI กำลังนำเสนอ และข้อมูลประสิทธิภาพจากแหล่งอิสระก็หนุนทิศทางดังกล่าว
การตัดสินใจเส้นทาง
นี่คือการแข่งขันที่เราเตอร์พิสูจน์คุณค่า เพราะคำตอบที่ถูกต้องคือ "ทั้งคู่ โดยแบ่งตามลักษณะของปริมาณงาน" Grok 4.6 และ Claude Opus 5 ต่างก็เปิดให้ใช้งานบน OrcaRouter ในราคารายการของแต่ละผู้ให้บริการ — $2 / $6 สำหรับ grok/grok-4.6, $5 / $25 สำหรับ anthropic/claude-opus-5 — โดยมีมาร์กอัป 0% ดังนั้นตัวเลขในโมเดลต้นทุนของคุณคือตัวเลขที่ถูกเรียกเก็บจริง กลไกที่ทำให้การแยกนี้ใช้งานได้จริง: คีย์ API เดียวสำหรับทั้งสองโมเดล, การเฟลโอเวอร์อัตโนมัติหากเอนด์พอยต์ของผู้ให้บริการรายหนึ่งเสื่อมประสิทธิภาพระหว่างการรันเอเจนต์ระยะยาว, และ DSL สำหรับการจัดเส้นทางที่สามารถส่งเทิร์นสั้นๆ ปริมาณมากไปยัง Grok 4.6 และส่งต่องานระยะยาวที่ต้องการบริบทมากไปยัง Claude Opus 5 ภายในคอลเดียว คุณไม่จำเป็นต้องมีสัญญาเพิ่มเติมเพื่อรันสถาปัตยกรรมสองระดับ และคุณสามารถปรับการแยกใหม่ได้เมื่อข้อมูลทราฟฟิกจริงเข้ามา แทนที่จะเดาจากโมเดลการ์ด

การอ่านอย่างตรงไปตรงมา
ความเสมอกันบนดัชนีรวมนั้นมีจริง และมันคือกับดัก โมเดลที่ได้คะแนนเท่ากันไม่ได้ใช้แทนกันได้ พวกมันถูกแยกความแตกต่างตรงจุดที่คะแนนมองไม่เห็นพอดี Claude Opus 5 เป็นตัวเลือกเริ่มต้นที่ปลอดภัยกว่าสำหรับงานความรู้แนวกว้าง เน้นบริบทหนัก และทำงานกับเอกสารและรูปภาพ ซึ่งหน้าต่าง 1M token และการให้เหตุผลเชิงลึกสำคัญกว่าต้นทุน Grok 4.6 เป็นตัวเลือกเริ่มต้นที่ดีกว่าสำหรับลูปเอเจนต์ปริมาณสูง ซึ่งประสิทธิภาพของ token ต่องานและข้อได้เปรียบด้านราคา 2.5 เท่าทบต้นจนกลายเป็นความต่างของบิลระดับสิบเท่า หากปริมาณงานของคุณเป็นแบบแรก จ่ายเงินซื้อ Opus 5 แล้วเลิกกังวลเรื่องราคาได้เลย หากเป็นแบบหลัง ความเท่าเทียมที่คะแนน 61 บนกระดาษคือเหตุผลที่ดีที่สุดที่คุณจะมีในการทดสอบ Grok 4.6 ก่อน — เกณฑ์ชี้วัดบอกว่ามันเท่ากัน แต่ใบแจ้งหนี้บอกว่าไม่เท่ากัน
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
