การ์ด hero ที่สร้างขึ้นสำหรับ GPT-6.1 Sol vs Claude Opus 5.5 พร้อมหัวข้อว่า 'ช่องว่างที่แท้จริง ซึ่งกระจายอย่างไม่เท่ากัน' โดยมีการ์ดข้อมูลสองใบที่ระบุว่า 'GPT-6.1 Sol: ดัชนีความฉลาด 51.8, 0.72 ดอลลาร์ต่องานดัชนี, การเรียกคืนบริบทแบบยาว 83.0%' และ 'Claude Opus 5.5: ดัชนีความฉลาด 57.6, 5.98 ดอลลาร์ต่องานดัชนี, การเรียกคืนบริบทแบบยาว 84.7%' ส่วนท้ายระบุว่า 'ตัวเลขต่าง ๆ อ้างอิงจาก Artificial Analysis, Intelligence Index v4.3.2, ทั้งสองโมเดลแสดงบนกราฟที่การตั้งค่าความพยายามสูงสุด' และโลโก้ OrcaRouter ที่มุมล่างขวา
Guides & Insights

GPT-6.1 Sol vs Claude Opus 5.5: ช่องว่างที่มีอยู่จริง ซึ่งกระจายอย่างไม่เท่าเทียม

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ช่องว่าง 5.8 จุดระหว่าง Claude Opus 5.5 กับ GPT-6.1 Sol บน Artificial Analysis Intelligence Index นั้นมากที่สุดในบรรดาคู่ใด ๆ ในชุดนี้ และต่างจากคู่ส่วนใหญ่ตรงที่มันจะไม่หายไปด้วยการเปลี่ยนการตั้งค่า Claude Opus 5.5 เปิดตัวเมื่อวันที่ 22 กันยายน 2026 และคิดราคา 4.00 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเคน และ 20.00 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน ได้คะแนน 57.6 GPT-6.1 Sol เปิดตัวเมื่อวันที่ 29 กันยายน 2026 ในราคา 2.00 และ 10.00 ดอลลาร์ ได้คะแนน 51.8 Claude Opus 5.5 เป็นโมเดลที่ได้คะแนนสูงกว่า ด้วยส่วนต่างที่ใหญ่กว่าส่วนต่างที่แยกโมเดลแนวหน้าส่วนใหญ่ออกจากกัน และมีค่าใช้จ่ายต่องานสูงกว่า 8.3 เท่าเพื่อไปให้ถึงจุดนั้น — 5.98 ดอลลาร์ เทียบกับ 0.72 ดอลลาร์ จนถึงตอนนี้ โมเดลที่แพงกว่าก็แค่ชนะ ซึ่งเป็นเวอร์ชันที่น่าสนใจน้อยที่สุดของการเปรียบเทียบนี้ สิ่งที่ทำให้มันน่าอ่านคือ 5.8 จุดนั้นไม่ได้กระจายอย่างสม่ำเสมอทั่วทั้งชุดทดสอบ: บนแกนเดียวที่ตัดสินงานเอกสารยาวและงานเซสชันยาวเป็นส่วนใหญ่ สองโมเดลนี้ห่างกันไม่ถึงสองจุด

ทั้งคู่เป็นโมเดลเรือธงในช่องตลาดเดียวกัน: หน้าต่างบริบทระดับ 1M, เพดานเอาต์พุต 128K, อินพุตข้อความ รูปภาพ และไฟล์, การคิดแบบขยายในฝั่งหนึ่ง และบันไดความพยายามห้าระดับในอีกฝั่งหนึ่ง Claude Opus 5.5 สืบทอดจาก Claude Opus 5 และถูกวางตำแหน่งสำหรับงานให้เหตุผลที่ท้าทาย การเขียนโค้ด และงานเอเจนติกในระยะยาว; GPT-6.1 Sol อยู่ต่ำกว่า GPT-6 Astra หนึ่งระดับ และถูกวางตำแหน่งที่การเขียนโค้ดแบบเอเจนติก การใช้คอมพิวเตอร์ และงานวิชาชีพที่เน้นเอกสาร พวกมันมุ่งเป้าไปที่งานเดียวกัน การวัดผลบอกว่าพวกมันไม่ได้เก่งเท่ากันในทุกงาน

5.8 คะแนนอยู่ตรงไหนจริง ๆ

ดัชนีแบบรวมย่อมซ่อนองค์ประกอบย่อยของตัวเองไว้ ดึงผลการประเมินแต่ละรายการออกมา แล้วช่องว่างนั้นจะไม่ดูเป็นช่องว่างอีกต่อไป แต่จะเริ่มดูเหมือนโปรไฟล์

• Humanity's Last Exam — Claude Opus 5.5 61.4% เทียบกับ GPT-6.1 Sol 52.9% ส่วนต่าง 8.5 จุดในด้านการใช้เหตุผลเชิงนามธรรม

• SciCode — Claude Opus 5.5 66.9% เทียบกับ GPT-6.1 Sol 54.2% ส่วนต่าง 12.7 จุดในโค้ดระดับงานวิจัย

• การเรียกคืนข้อมูลในบริบทขนาดยาว — Claude Opus 5.5 84.7% เทียบกับ GPT-6.1 Sol 83.0% ต่างกัน 1.7 จุดในการดึงข้อเท็จจริงจากอินพุตยาว

• Terminal-Bench 4.0 — Claude Opus 5.5 59.6% เมื่อเทียบกับตัวเลขของ Sol ที่ไม่ได้เผยแพร่ในรีวิชันเดียวกัน

• หน้าต่างบริบท — GPT-6.1 Sol 1,050,000 โทเคน เทียบกับ Claude Opus 5.5 1,000,000 โทเคน โดยทั้งคู่มีเพดานเอาต์พุต 128,000 โทเคน

• ต้นทุนต่องานจัดทำดัชนี — Claude Opus 5.5 $5.98 เทียบกับ GPT-6.1 Sol $0.72

การกระจายคือเรื่องราว ในกรณีที่งานเป็นการให้เหตุผลเชิงนามธรรม — คำถามข้อสอบยาก ปัญหาการเขียนโค้ดระดับงานวิจัยที่ไม่มีคำตอบเดิมให้ลอก — Claude Opus 5.5 นำอย่างเด็ดขาด และช่องว่าง SciCode 12.7 จุดไม่ใช่สัญญาณรบกวน ในกรณีที่งานคือการค้นหาข้อความที่ถูกต้องในอินพุตที่ยาวมากและนำมาใช้ ทั้งสองโมเดลอยู่ในระดับเดียวกันในทางปฏิบัติ และ GPT-6.1 Sol ครองตำแหน่งนั้นด้วยความจุมากกว่า 50,000 โทเค็น งาน LLM ในการผลิตจำนวนมากเป็นประเภทที่สอง: การตอบคำถามแบบเสริมการค้นคืน การตรวจสอบสัญญาและเอกสารยื่น การวิเคราะห์บันทึกและข้อความถอดเสียง การตรวจสอบโค้ดในคลังขนาดใหญ่ งานนั้นวัดด้วยหัวข้อย่อยที่สาม ไม่ใช่สองข้อแรก และในหัวข้อย่อยนั้น การจ่ายเพิ่มซื้อได้ 1.7 จุด

การอ่านแถวดัชนีอย่างตรงไปตรงมา

ข้อควรระวังสองข้อควรอยู่ข้าง ๆ ตัวเลขเหล่านั้น ไม่ใช่ที่ท้ายหน้า

การกำหนดค่าแตกต่างกัน Artificial Analysis จัดทำแผนภูมิให้ Claude Opus 5.5 ในการกำหนดค่า "Max, Default Fallback" และ GPT-6.1 Sol ที่ความพยายามสูงสุด ทั้งสองเป็นการตั้งค่าที่แข็งแกร่งที่สุดที่แต่ละโมเดลเผยแพร่ภายใต้ ซึ่งทำให้การเปรียบเทียบยุติธรรม แต่มันเป็นการเปรียบเทียบเพดานสองค่า มากกว่าค่าเริ่มต้นที่นำออกใช้สองค่า ค่าเริ่มต้นของ Claude Opus 5.5 เองใน hosted API อาจแตกต่างจากการรันที่แสดงในแผนภูมิ และความพยายามเริ่มต้นของ GPT-6.1 Sol อยู่ที่ระดับ medium

แถวของ Terminal-Bench จงใจเว้นว่างไว้ด้านหนึ่ง ตัวเลข 59.6% ของ Claude Opus 5.5 มาจากฉบับปรับปรุงของ Artificial Analysis ฉบับที่เผยแพร่ตัวเลขนั้น ส่วนตัวเลขเทียบเท่าของ GPT-6.1 Sol ไม่มีให้ใช้ในฉบับปรับปรุงที่ตรงกัน การอ้างตัวเลขจากรอบรันอื่นของเบนช์มาร์กเดียวกันจะเป็นการเปรียบเทียบที่ผิด และวิธีที่ซื่อตรงคือปล่อยช่องนั้นให้ว่างไว้ ดีกว่าเติมอะไรบางอย่างที่ใกล้เคียงเพียงประมาณ

ความยาวของคำตอบตัดไปในทิศทางเดียวกันกับที่เกิดขึ้นกับพี่น้องรุ่นที่ถูกกว่า: Claude Opus 5.5 ปล่อยโทเคนเอาต์พุต 260M บนชุด index เทียบกับ 67M ของ GPT-6.1 Sol ซึ่งเป็นความต่าง 3.9× ในอัตราที่สูงเป็นสองเท่าอยู่แล้ว นั่นคือที่มาของอัตราส่วน 8.3× ต่องาน เมื่อเรตการ์ดแสดง 2× ที่อินพุตและ 2× ที่เอาต์พุต ราคาพรีเมียมไม่ใช่ 8.3× เพราะโมเดลมีต้นทุน 8.3× — แต่เป็น 8.3× เพราะมันมีต้นทุน 2× และคิดนานกว่า 3.9×

เหตุผลที่ควรจ่าย

ถ้างานของคุณมีลักษณะใกล้เคียงกับสองหัวข้อแรก การคำนวณก็ตรงไปตรงมา และผลลัพธ์เอนไปทาง Claude Opus 5.5 ช่องว่าง 12.7 คะแนนในงานโค้ดวิทยาศาสตร์ระดับงานวิจัย หรือ 8.5 คะแนนในการให้เหตุผลเชิงนามธรรมที่ยาก คือความแตกต่างระหว่างเอเจนต์ที่ปิดตั๋วได้โดยไม่มีคนคอยดูแล กับเอเจนต์ที่ต้องมีมนุษย์เข้ามาช่วยทุก ๆ สามขั้นตอน การเขียนโค้ดแบบเอเจนต์บนโค้ดเบสขนาดใหญ่คือภาระงานที่ผู้ให้บริการทั้งสองรายเอ่ยถึงเป็นอันดับแรก และเป็นภาระงานที่มีช่องว่างกว้างที่สุด การจ่าย $5.98 แทน $0.72 ต่อหนึ่งงาน เพื่อหลีกเลี่ยงการรันที่ล้มเหลวซึ่งทำให้วิศวกรเสียเวลาไปยี่สิบนาที ไม่ใช่การตัดสินใจที่สูสีเลย

มีข้อโต้แย้งประการที่สองที่ไม่เกี่ยวกับคะแนนเลย Claude Opus 5.5 มีอายุสิบห้าวันและได้สร้างคลังของการประเมิน การรีวิว และประสบการณ์การนำไปใช้งานจากบุคคลที่สาม ซึ่งโมเดลที่มีอายุแปดวันไม่มี สำหรับเส้นทางสู่การใช้งานจริงในโปรดักชัน ความ成熟ของความรู้รอบข้างนั้นมีค่าบางอย่างที่ดัชนีไม่ได้ประเมินราคาไว้

ข้อโต้แย้งที่คัดค้าน และตัวเลขที่ชี้ขาด

ข้อโต้แย้งกลับอยู่ที่แถวบริบทขนาดยาว หากรูปแบบหลักของทราฟฟิกของคุณคือ "อินพุตขนาดใหญ่ คำตอบสั้น" — และสำหรับทีมจำนวนมากก็เป็นเช่นนั้น — แกนที่คุณถูกคิดเงินก็ไม่ใช่แกนที่คุณใช้จริง ในการเรียกคืนข้อมูลบริบทขนาดยาว โมเดลทั้งสองต่างกัน 1.7 คะแนน ที่อัตราส่วนราคา 8.3 เท่า และโมเดลที่ถูกกว่ามีหน้าต่างที่ใหญ่กว่า นั่นคือกรณีที่ส่วนต่างราคานั้นเป็นของจริง วัดได้ และถูกใช้ไปกับความสามารถที่งานของคุณไม่เคยได้ใช้เลย

ตัวเลขที่ชี้ขาดจึงไม่ใช่ดัชนี แต่เป็นสัดส่วนของงานของคุณที่ดูเหมือน SciCode มากกว่าที่จะดูเหมือนการเรียกคืน ทีมที่ตอบคำถามนั้นได้จากบันทึกของตนเองก็ควรตอบคำถามนั้นจากบันทึกของตนเอง ชุดแบบทดสอบมาตรฐานเป็นเพียงตัวแทนของงานหลายชนิดที่ผสมกัน และส่วนผสมนั้นคือตัวแปร

ทั้งคู่อยู่บนคีย์เดียว ซึ่งเป็นสิ่งที่ทำให้คำถามนี้ตอบได้

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, credited to Anthropic and dated 2026-09-22, showing text, image and file input with text output, a 1,000,000-token context window reading 1M tokens with a 128K maximum output, and a rate row reading $4.00 input and $20.00 output per million tokens alongside a 3.68 s median time to first token and a 36.5M seven-day traffic figure.A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window with 128,000 max output tokens and an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.

Claude Opus 5.5 อยู่บน OrcaRouter ในราคาเฉพาะของตัวเองที่ $4.00 / $20.00 โดยการอ่านแคชอยู่ที่ $0.20 GPT-6.1 Sol อยู่บน OrcaRouter ที่ $2.00 / $10.00 และปรับเป็น $4.00 / $15.00 เมื่อเกิน 272,000 โทเคนพรอมต์ โดยการอ่านแคชอยู่ที่ $0.10 ทั้งคู่เป็นราคาตามรายการของผู้ให้บริการ ไม่มีอะไรบวกเพิ่ม ใช้คีย์เดียวและบิลเดียว

เรื่องนี้สำคัญกว่าปกติสำหรับการจับคู่นี้ เพราะโมเดลทั้งสองไม่ใช่สิ่งที่ใช้แทนกันได้ — แต่เป็นการตัดสินใจเรื่องการจัดเส้นทาง ส่งงานเอกสารยาวและงานปริมาณมากไปที่ GPT-6.1 Sol เก็บงานที่ต้องใช้การให้เหตุผลยาก ๆ และงานแก้ไขโค้ดไว้บน Claude Opus 5.5 และทั้งคู่อยู่เบื้องหลัง endpoint เดียวกันด้วยข้อมูลรับรองชุดเดียวกัน หากเส้นทางหนึ่งเสื่อมประสิทธิภาพ การสลับไปใช้ระบบสำรองอัตโนมัติจะย้ายการเรียกแทนที่จะทำให้ล้มเหลว และเนื่องจากรูปแบบการจัดเส้นทางเป็นแบบ Declarative จึงสามารถกำหนดเป็นรายคลาสงานแทนที่จะเป็นรายแอปพลิเคชัน การทดสอบการแยกนี้เป็นการเปลี่ยนแปลงการตั้งค่า ไม่ใช่การย้ายระบบ

สิ่งสุดท้ายที่ควรกล่าวถึงคืออายุการใช้งานของการเปรียบเทียบนี้ ทั้งสองโมเดลมีอายุเพียงไม่กี่วันหรือไม่กี่สัปดาห์ GPT-6.1 Sol มีการเผยแพร่การตั้งค่าแบบอิสระหนึ่งชุด ส่วน Claude Opus 5.5 ก็มีหนึ่งชุด การรันเพียงครั้งเดียวต่อโมเดลเป็นเพียงสแนปช็อต และโหมดความล้มเหลวที่น่าสนใจไม่ใช่ว่าตัวเลขใดตัวเลขหนึ่งผิด — แต่คือการที่การตั้งค่าแบบความพยายามปานกลาง หรือผู้ประเมินรายที่สอง วาดโปรไฟล์ใหม่ จนถึงตอนนั้น การตีความที่สามารถป้องกันได้คือสิ่งที่องค์ประกอบต่างๆ ให้: ช่องว่างที่เด็ดขาดในด้านการให้เหตุผลยากและโค้ดสำหรับงานวิจัย ช่องว่างเล็กน้อยในงานที่ใช้บริบทยาว และค่าใช้จ่าย 8.3 เท่าที่ต้องได้รับการพิสูจน์โดยส่วนของปริมาณงานของคุณที่คล้ายกับแบบแรก

A generated scoreboard titled 'GPT-6.1 Sol vs Claude Opus 5.5 — the scoreboard' showing two columns on six shared rows: Intelligence Index 51.8 against 57.6; cost per index task $0.72 against $5.98; Humanity's Last Exam 52.9% against 61.4%; SciCode 54.2% against 66.9%; long-context recall 83.0% against 84.7%; context window 1,050,000 against 1,000,000 tokens. A footer reads 'Index, per-task cost and evaluation figures per Artificial Analysis, Intelligence Index v4.3.2.'

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube