
GPT-6.1 Sol vs Claude Opus 5.5: ช่องว่างที่มีอยู่จริง ซึ่งกระจายอย่างไม่เท่าเทียม
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 143 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 293 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ช่องว่าง 5.8 จุดระหว่าง Claude Opus 5.5 กับ GPT-6.1 Sol บน Artificial Analysis Intelligence Index นั้นมากที่สุดในบรรดาคู่ใด ๆ ในชุดนี้ และต่างจากคู่ส่วนใหญ่ตรงที่มันจะไม่หายไปด้วยการเปลี่ยนการตั้งค่า Claude Opus 5.5 เปิดตัวเมื่อวันที่ 22 กันยายน 2026 และคิดราคา 4.00 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเคน และ 20.00 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน ได้คะแนน 57.6 GPT-6.1 Sol เปิดตัวเมื่อวันที่ 29 กันยายน 2026 ในราคา 2.00 และ 10.00 ดอลลาร์ ได้คะแนน 51.8 Claude Opus 5.5 เป็นโมเดลที่ได้คะแนนสูงกว่า ด้วยส่วนต่างที่ใหญ่กว่าส่วนต่างที่แยกโมเดลแนวหน้าส่วนใหญ่ออกจากกัน และมีค่าใช้จ่ายต่องานสูงกว่า 8.3 เท่าเพื่อไปให้ถึงจุดนั้น — 5.98 ดอลลาร์ เทียบกับ 0.72 ดอลลาร์ จนถึงตอนนี้ โมเดลที่แพงกว่าก็แค่ชนะ ซึ่งเป็นเวอร์ชันที่น่าสนใจน้อยที่สุดของการเปรียบเทียบนี้ สิ่งที่ทำให้มันน่าอ่านคือ 5.8 จุดนั้นไม่ได้กระจายอย่างสม่ำเสมอทั่วทั้งชุดทดสอบ: บนแกนเดียวที่ตัดสินงานเอกสารยาวและงานเซสชันยาวเป็นส่วนใหญ่ สองโมเดลนี้ห่างกันไม่ถึงสองจุด
ทั้งคู่เป็นโมเดลเรือธงในช่องตลาดเดียวกัน: หน้าต่างบริบทระดับ 1M, เพดานเอาต์พุต 128K, อินพุตข้อความ รูปภาพ และไฟล์, การคิดแบบขยายในฝั่งหนึ่ง และบันไดความพยายามห้าระดับในอีกฝั่งหนึ่ง Claude Opus 5.5 สืบทอดจาก Claude Opus 5 และถูกวางตำแหน่งสำหรับงานให้เหตุผลที่ท้าทาย การเขียนโค้ด และงานเอเจนติกในระยะยาว; GPT-6.1 Sol อยู่ต่ำกว่า GPT-6 Astra หนึ่งระดับ และถูกวางตำแหน่งที่การเขียนโค้ดแบบเอเจนติก การใช้คอมพิวเตอร์ และงานวิชาชีพที่เน้นเอกสาร พวกมันมุ่งเป้าไปที่งานเดียวกัน การวัดผลบอกว่าพวกมันไม่ได้เก่งเท่ากันในทุกงาน
5.8 คะแนนอยู่ตรงไหนจริง ๆ
ดัชนีแบบรวมย่อมซ่อนองค์ประกอบย่อยของตัวเองไว้ ดึงผลการประเมินแต่ละรายการออกมา แล้วช่องว่างนั้นจะไม่ดูเป็นช่องว่างอีกต่อไป แต่จะเริ่มดูเหมือนโปรไฟล์
• Humanity's Last Exam — Claude Opus 5.5 61.4% เทียบกับ GPT-6.1 Sol 52.9% ส่วนต่าง 8.5 จุดในด้านการใช้เหตุผลเชิงนามธรรม
• SciCode — Claude Opus 5.5 66.9% เทียบกับ GPT-6.1 Sol 54.2% ส่วนต่าง 12.7 จุดในโค้ดระดับงานวิจัย
• การเรียกคืนข้อมูลในบริบทขนาดยาว — Claude Opus 5.5 84.7% เทียบกับ GPT-6.1 Sol 83.0% ต่างกัน 1.7 จุดในการดึงข้อเท็จจริงจากอินพุตยาว
• Terminal-Bench 4.0 — Claude Opus 5.5 59.6% เมื่อเทียบกับตัวเลขของ Sol ที่ไม่ได้เผยแพร่ในรีวิชันเดียวกัน
• หน้าต่างบริบท — GPT-6.1 Sol 1,050,000 โทเคน เทียบกับ Claude Opus 5.5 1,000,000 โทเคน โดยทั้งคู่มีเพดานเอาต์พุต 128,000 โทเคน
• ต้นทุนต่องานจัดทำดัชนี — Claude Opus 5.5 $5.98 เทียบกับ GPT-6.1 Sol $0.72
การกระจายคือเรื่องราว ในกรณีที่งานเป็นการให้เหตุผลเชิงนามธรรม — คำถามข้อสอบยาก ปัญหาการเขียนโค้ดระดับงานวิจัยที่ไม่มีคำตอบเดิมให้ลอก — Claude Opus 5.5 นำอย่างเด็ดขาด และช่องว่าง SciCode 12.7 จุดไม่ใช่สัญญาณรบกวน ในกรณีที่งานคือการค้นหาข้อความที่ถูกต้องในอินพุตที่ยาวมากและนำมาใช้ ทั้งสองโมเดลอยู่ในระดับเดียวกันในทางปฏิบัติ และ GPT-6.1 Sol ครองตำแหน่งนั้นด้วยความจุมากกว่า 50,000 โทเค็น งาน LLM ในการผลิตจำนวนมากเป็นประเภทที่สอง: การตอบคำถามแบบเสริมการค้นคืน การตรวจสอบสัญญาและเอกสารยื่น การวิเคราะห์บันทึกและข้อความถอดเสียง การตรวจสอบโค้ดในคลังขนาดใหญ่ งานนั้นวัดด้วยหัวข้อย่อยที่สาม ไม่ใช่สองข้อแรก และในหัวข้อย่อยนั้น การจ่ายเพิ่มซื้อได้ 1.7 จุด
การอ่านแถวดัชนีอย่างตรงไปตรงมา
ข้อควรระวังสองข้อควรอยู่ข้าง ๆ ตัวเลขเหล่านั้น ไม่ใช่ที่ท้ายหน้า
การกำหนดค่าแตกต่างกัน Artificial Analysis จัดทำแผนภูมิให้ Claude Opus 5.5 ในการกำหนดค่า "Max, Default Fallback" และ GPT-6.1 Sol ที่ความพยายามสูงสุด ทั้งสองเป็นการตั้งค่าที่แข็งแกร่งที่สุดที่แต่ละโมเดลเผยแพร่ภายใต้ ซึ่งทำให้การเปรียบเทียบยุติธรรม แต่มันเป็นการเปรียบเทียบเพดานสองค่า มากกว่าค่าเริ่มต้นที่นำออกใช้สองค่า ค่าเริ่มต้นของ Claude Opus 5.5 เองใน hosted API อาจแตกต่างจากการรันที่แสดงในแผนภูมิ และความพยายามเริ่มต้นของ GPT-6.1 Sol อยู่ที่ระดับ medium
แถวของ Terminal-Bench จงใจเว้นว่างไว้ด้านหนึ่ง ตัวเลข 59.6% ของ Claude Opus 5.5 มาจากฉบับปรับปรุงของ Artificial Analysis ฉบับที่เผยแพร่ตัวเลขนั้น ส่วนตัวเลขเทียบเท่าของ GPT-6.1 Sol ไม่มีให้ใช้ในฉบับปรับปรุงที่ตรงกัน การอ้างตัวเลขจากรอบรันอื่นของเบนช์มาร์กเดียวกันจะเป็นการเปรียบเทียบที่ผิด และวิธีที่ซื่อตรงคือปล่อยช่องนั้นให้ว่างไว้ ดีกว่าเติมอะไรบางอย่างที่ใกล้เคียงเพียงประมาณ
ความยาวของคำตอบตัดไปในทิศทางเดียวกันกับที่เกิดขึ้นกับพี่น้องรุ่นที่ถูกกว่า: Claude Opus 5.5 ปล่อยโทเคนเอาต์พุต 260M บนชุด index เทียบกับ 67M ของ GPT-6.1 Sol ซึ่งเป็นความต่าง 3.9× ในอัตราที่สูงเป็นสองเท่าอยู่แล้ว นั่นคือที่มาของอัตราส่วน 8.3× ต่องาน เมื่อเรตการ์ดแสดง 2× ที่อินพุตและ 2× ที่เอาต์พุต ราคาพรีเมียมไม่ใช่ 8.3× เพราะโมเดลมีต้นทุน 8.3× — แต่เป็น 8.3× เพราะมันมีต้นทุน 2× และคิดนานกว่า 3.9×
เหตุผลที่ควรจ่าย
ถ้างานของคุณมีลักษณะใกล้เคียงกับสองหัวข้อแรก การคำนวณก็ตรงไปตรงมา และผลลัพธ์เอนไปทาง Claude Opus 5.5 ช่องว่าง 12.7 คะแนนในงานโค้ดวิทยาศาสตร์ระดับงานวิจัย หรือ 8.5 คะแนนในการให้เหตุผลเชิงนามธรรมที่ยาก คือความแตกต่างระหว่างเอเจนต์ที่ปิดตั๋วได้โดยไม่มีคนคอยดูแล กับเอเจนต์ที่ต้องมีมนุษย์เข้ามาช่วยทุก ๆ สามขั้นตอน การเขียนโค้ดแบบเอเจนต์บนโค้ดเบสขนาดใหญ่คือภาระงานที่ผู้ให้บริการทั้งสองรายเอ่ยถึงเป็นอันดับแรก และเป็นภาระงานที่มีช่องว่างกว้างที่สุด การจ่าย $5.98 แทน $0.72 ต่อหนึ่งงาน เพื่อหลีกเลี่ยงการรันที่ล้มเหลวซึ่งทำให้วิศวกรเสียเวลาไปยี่สิบนาที ไม่ใช่การตัดสินใจที่สูสีเลย
มีข้อโต้แย้งประการที่สองที่ไม่เกี่ยวกับคะแนนเลย Claude Opus 5.5 มีอายุสิบห้าวันและได้สร้างคลังของการประเมิน การรีวิว และประสบการณ์การนำไปใช้งานจากบุคคลที่สาม ซึ่งโมเดลที่มีอายุแปดวันไม่มี สำหรับเส้นทางสู่การใช้งานจริงในโปรดักชัน ความ成熟ของความรู้รอบข้างนั้นมีค่าบางอย่างที่ดัชนีไม่ได้ประเมินราคาไว้
ข้อโต้แย้งที่คัดค้าน และตัวเลขที่ชี้ขาด
ข้อโต้แย้งกลับอยู่ที่แถวบริบทขนาดยาว หากรูปแบบหลักของทราฟฟิกของคุณคือ "อินพุตขนาดใหญ่ คำตอบสั้น" — และสำหรับทีมจำนวนมากก็เป็นเช่นนั้น — แกนที่คุณถูกคิดเงินก็ไม่ใช่แกนที่คุณใช้จริง ในการเรียกคืนข้อมูลบริบทขนาดยาว โมเดลทั้งสองต่างกัน 1.7 คะแนน ที่อัตราส่วนราคา 8.3 เท่า และโมเดลที่ถูกกว่ามีหน้าต่างที่ใหญ่กว่า นั่นคือกรณีที่ส่วนต่างราคานั้นเป็นของจริง วัดได้ และถูกใช้ไปกับความสามารถที่งานของคุณไม่เคยได้ใช้เลย
ตัวเลขที่ชี้ขาดจึงไม่ใช่ดัชนี แต่เป็นสัดส่วนของงานของคุณที่ดูเหมือน SciCode มากกว่าที่จะดูเหมือนการเรียกคืน ทีมที่ตอบคำถามนั้นได้จากบันทึกของตนเองก็ควรตอบคำถามนั้นจากบันทึกของตนเอง ชุดแบบทดสอบมาตรฐานเป็นเพียงตัวแทนของงานหลายชนิดที่ผสมกัน และส่วนผสมนั้นคือตัวแปร
ทั้งคู่อยู่บนคีย์เดียว ซึ่งเป็นสิ่งที่ทำให้คำถามนี้ตอบได้


Claude Opus 5.5 อยู่บน OrcaRouter ในราคาเฉพาะของตัวเองที่ $4.00 / $20.00 โดยการอ่านแคชอยู่ที่ $0.20 GPT-6.1 Sol อยู่บน OrcaRouter ที่ $2.00 / $10.00 และปรับเป็น $4.00 / $15.00 เมื่อเกิน 272,000 โทเคนพรอมต์ โดยการอ่านแคชอยู่ที่ $0.10 ทั้งคู่เป็นราคาตามรายการของผู้ให้บริการ ไม่มีอะไรบวกเพิ่ม ใช้คีย์เดียวและบิลเดียว
เรื่องนี้สำคัญกว่าปกติสำหรับการจับคู่นี้ เพราะโมเดลทั้งสองไม่ใช่สิ่งที่ใช้แทนกันได้ — แต่เป็นการตัดสินใจเรื่องการจัดเส้นทาง ส่งงานเอกสารยาวและงานปริมาณมากไปที่ GPT-6.1 Sol เก็บงานที่ต้องใช้การให้เหตุผลยาก ๆ และงานแก้ไขโค้ดไว้บน Claude Opus 5.5 และทั้งคู่อยู่เบื้องหลัง endpoint เดียวกันด้วยข้อมูลรับรองชุดเดียวกัน หากเส้นทางหนึ่งเสื่อมประสิทธิภาพ การสลับไปใช้ระบบสำรองอัตโนมัติจะย้ายการเรียกแทนที่จะทำให้ล้มเหลว และเนื่องจากรูปแบบการจัดเส้นทางเป็นแบบ Declarative จึงสามารถกำหนดเป็นรายคลาสงานแทนที่จะเป็นรายแอปพลิเคชัน การทดสอบการแยกนี้เป็นการเปลี่ยนแปลงการตั้งค่า ไม่ใช่การย้ายระบบ
สิ่งสุดท้ายที่ควรกล่าวถึงคืออายุการใช้งานของการเปรียบเทียบนี้ ทั้งสองโมเดลมีอายุเพียงไม่กี่วันหรือไม่กี่สัปดาห์ GPT-6.1 Sol มีการเผยแพร่การตั้งค่าแบบอิสระหนึ่งชุด ส่วน Claude Opus 5.5 ก็มีหนึ่งชุด การรันเพียงครั้งเดียวต่อโมเดลเป็นเพียงสแนปช็อต และโหมดความล้มเหลวที่น่าสนใจไม่ใช่ว่าตัวเลขใดตัวเลขหนึ่งผิด — แต่คือการที่การตั้งค่าแบบความพยายามปานกลาง หรือผู้ประเมินรายที่สอง วาดโปรไฟล์ใหม่ จนถึงตอนนั้น การตีความที่สามารถป้องกันได้คือสิ่งที่องค์ประกอบต่างๆ ให้: ช่องว่างที่เด็ดขาดในด้านการให้เหตุผลยากและโค้ดสำหรับงานวิจัย ช่องว่างเล็กน้อยในงานที่ใช้บริบทยาว และค่าใช้จ่าย 8.3 เท่าที่ต้องได้รับการพิสูจน์โดยส่วนของปริมาณงานของคุณที่คล้ายกับแบบแรก

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
