
Claude Opus 5.5 กับ GPT-5.6 Sol: สองตารางการเปิดตัวที่แทบไม่ทับซ้อนกัน
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
วาง Claude Opus 5.5 และ GPT-5.6 Sol เคียงข้างกันในสัปดาห์นี้ และสิ่งแรกที่คุณสังเกตเห็นไม่ใช่ผู้ชนะ นั่นคือผู้ขายทั้งสองรายได้เผยแพร่ตารางเปรียบเทียบประสิทธิภาพที่แทบจะไม่มีแถวใดเหมือนกัน เอกสารเปิดตัวของ Claude Opus 5.5 ซึ่งเปิดตัวเมื่อวันที่ 22 กันยายน 2026 ระบุว่ามันนำหน้า GPT-5.6 Sol อยู่ 29 คะแนนใน Terminal-Bench 4.0 เอกสารเปิดตัวของ Sol ซึ่งพร้อมใช้งานทั่วไปตั้งแต่วันที่ 9 กรกฎาคม 2026 กลับนำเสนอด้วย Terminal-Bench 2.1 ซึ่ง Sol Ultra ทำคะแนนได้ 91.9% และ Artificial Analysis Coding Agent Index ซึ่งครองอันดับหนึ่งที่ 80 ตารางทั้งสองเป็นของจริง ทั้งคู่ถูกจัดทำโดยผู้ขายที่ชนะในตารางนั้น คำถามที่มีประโยชน์ไม่ใช่รุ่นไหนดีกว่าในเชิงนามธรรม — แต่เป็นว่า benchmark ใด เมื่อรันภายใต้ฮาร์นเนสของใคร ที่บอกอะไรเกี่ยวกับเวิร์กโหลดของคุณได้ นั่นเป็นคำถามที่ยากกว่าที่โพสต์เปิดตัวทั้งสองอยากให้คุณถาม และเป็นคำถามที่การเปรียบเทียบนี้สร้างขึ้นมาเพื่อตอบ
ทั้งสองรุ่น เคียงข้างกัน

• ผู้ให้บริการ — Anthropic vs OpenAI
• เปิดตัว — Claude Opus 5.5 เมื่อวันที่ 22 กันยายน 2026 เทียบกับ GPT-5.6 Sol เมื่อวันที่ 9 กรกฎาคม 2026
• ราคาต่อหนึ่งล้านโทเคน — อินพุต $4.00 / เอาต์พุต $20.00 เทียบกับอินพุต $5.00 / เอาต์พุต $30.00
• การอ่านแคช — $0.20 ต่อล้านบน Opus 5.5; อัตราแคชของ Sol ถูกกำหนดตามแพลตฟอร์มแต่ละแห่ง และไม่ได้เผยแพร่เป็นตัวเลขเดียวที่เทียบเคียงได้
• หน้าต่างบริบท — 1M โทเค็นทั้งสอง
• เอาต์พุตสูงสุด — 128K โทเค็นบนทั้งสองแบบ โดยได้ถึง 300K บน Batch API ของ Anthropic ที่ต้องเปิดใช้ผ่าน beta header
• ขีดจำกัดข้อมูลความรู้ — มิถุนายน 2026 สำหรับ Opus 5.5 เทียบกับ 16 กุมภาพันธ์ 2026 สำหรับ Sol
• การควบคุมการคิดวิเคราะห์ — โหมดคิดแบบปรับตัวเปิดทำงานตลอดเวลา ค่าเริ่มต้นที่ปานกลาง โดยสเกลจะไล่จากต่ำถึงสูงสุด เทียบกับการตั้งค่าระดับความเข้มข้นในการคิดวิเคราะห์สูงสุด พร้อมโหมด Ultra ที่ประสานงานเอเจนต์ย่อยแบบขนาน
• ไลน์อัป — Opus 5.5 เป็นรุ่นแรกของตระกูล 5.5 โดยมี Sonnet 5.5 และ Haiku 5.5 ที่สัญญาว่าจะมาในอีกไม่กี่สัปดาห์ เทียบกับ Sol ซึ่งเป็นเรือธงของตระกูลสามระดับพร้อมกับ Terra และ Luna
สองในแถวเหล่านั้นทำงานได้มากกว่าแถวอื่น ๆ ช่องว่างของ knowledge cutoff กว้างถึงสี่เดือน ซึ่งสำคัญถ้าพรอมป์ของคุณแตะต้องอะไรก็ตามที่เกิดขึ้นในฤดูใบไม้ผลินี้ และตอนนี้ Opus 5.5 ตัดราคา Sol ทั้งราคาอินพุตและเอาต์พุต — เป็นการพลิกกลับจากเมื่อสามเดือนก่อน เมื่อ Sol เป็นวิธีที่ถูกกว่าในการเข้าถึงเอาต์พุตระดับแนวหน้า และ Claude Opus 5 อยู่ที่ $5/$25
แถวเดียวเท่านั้นที่โมเดลทั้งสองปรากฏอยู่จริง
มีตารางที่เผยแพร่เพียงหนึ่งเดียวเท่านั้นที่มีทั้งสองโมเดล และมันเป็นของ Anthropic ทุกตัวเลขในตารางนั้นเป็นข้อมูลที่ผู้ขายรายงาน ซึ่งจัดทำโดยบริษัทที่ขายหนึ่งในสองโมเดลนี้:
• Terminal-Bench 4.0 — Claude Opus 5.5 66.4% เทียบกับ GPT-5.6 Sol 37.3%
• Terminal-Bench-Science 0.1 — 58.7% เทียบกับ 22.4%
• FrontierCode v1.1 (หลัก) — 54.4% เทียบกับ 47.5%
• CursorBench 4.0 — 57.8% เทียบกับ 41.7%
• AutomationBench — 40.0% เทียบกับ 28.8%
• GDPval-AA v2.1 — 1846 Elo เทียบกับ 1588
นั่นคือชัยชนะแบบกวาดเรียบ และส่วนต่างในสองแถวของ Terminal-Bench ก็มากพอที่ควรค่าแก่การตรวจสอบมากกว่าการยอมรับ เชิงอรรถของ Anthropic เองก็ช่วยทำงานส่วนหนึ่งแทนคุณไว้แล้ว: การรัน Terminal-Bench ของ Opus 5.5 ใช้ความพยายามระดับ xhigh แทนค่าเริ่มต้น และที่ระดับความพยายาม medium ตามค่าเริ่มต้น ข้อได้เปรียบของ FrontierCode ลดลงเหลือ 54.6% เทียบกับ 47.5% — ช่องว่างเจ็ดจุดแทนที่จะเป็นตัวเลขพาดหัว Anthropic ยังแนบคำเตือนทั่วไปไว้กับตารางทั้งหมด โดยกล่าวว่า ณ ระดับความสามารถนี้ ส่วนต่างของ benchmark เป็น “แนวทางที่เชื่อถือได้น้อยกว่าในการบอกความแตกต่างในโลกจริง” และช่องว่างภายในองค์กรของตนกับ Claude Fable 5.1 นั้นแคบกว่าที่คะแนนบ่งชี้ ประโยคที่ผู้ขายลดทอนตารางของตัวเองลง คือประโยคที่น่าเชื่อถือที่สุดในตารางนั้น
ขอให้สังเกตด้วยว่าสิ่งที่หายไปจากตารางนั้นคืออะไร: ไม่มีเบนช์มาร์กใดเลยที่โมเดลของ OpenAI ชนะ ตารางจากผู้ขายที่มีเพียงแถวที่ได้เปรียบไม่ใช่หลักฐานของการกวาดชัยชนะ แต่เป็นหลักฐานของการเลือกแถว
สิ่งที่ตัวเลขของ OpenAI เองบอก
เอกสารเปิดตัวของ Sol เล่าเรื่องที่แตกต่างออกไป บนเบนช์มาร์กที่แตกต่างกัน ในฮาร์เนสที่แตกต่างกัน โดยรายงานไว้เมื่อเปิดตัวในเดือนกรกฎาคม:
• Terminal-Bench 2.1 — 91.9% สำหรับ Sol Ultra และ 88.8% สำหรับ Sol มาตรฐาน เทียบกับ Claude Mythos 5 ที่ 88.0% และ Claude Fable 5 ที่ 84.3%
• Artificial Analysis Coding Agent Index — 80 ซึ่งในขณะนั้นได้รับการอธิบายว่าเป็นสุดยอดแห่งเทคโนโลยี สูงกว่า Claude Fable 5 อยู่ 2.8 คะแนน
• Agents' Last Exam งานเวิร์กโฟลว์ระดับมืออาชีพที่ใช้เวลานาน — 53.6 ซึ่ง OpenAI รายงานว่านำหน้า Claude Fable 5 อยู่ 13.1 คะแนน
• BrowseComp — 92.2%; OSWorld 2.0 — 62.6%; SWE-Bench Pro — 64.6%
ไม่มีแถวใดในนั้นที่รวม Claude Opus 5.5 เพราะมันยังไม่มีอยู่ในเดือนกรกฎาคม ตารางของ Sol ถูกสร้างขึ้นเพื่อเอาชนะ Fable 5 และ Mythos 5 และมันก็ทำได้ ส่วนมันจะเอาชนะ Opus 5.5 ได้หรือไม่นั้น เอกสารของทั้งสองผู้ให้บริการไม่ได้ให้คำตอบ — ตารางทั้งสองถูกจัดทำขึ้นห่างกันสองเดือนและวัดกับคู่แข่งที่แตกต่างกัน
แถว SWE-Bench Pro ควรค่าแก่การกล่าวถึงเป็นพิเศษ เพราะเป็นจุดเดียวในสื่อเปิดตัวของ OpenAI ที่แสดงว่าโมเดลของตนเป็นฝ่ายแพ้: 64.6% สำหรับ Sol เทียบกับ 80% สำหรับ Claude Fable 5 OpenAI ตอบโต้ด้วยการตั้งคำถามถึงความน่าเชื่อถือของเบนช์มาร์กนี้ โดยประเมินว่าประมาณ 30% ของงานในนั้นมีปัญหา นั่นอาจเป็นความจริงก็ได้ และยังเป็นเครื่องเตือนใจที่มีประโยชน์ว่า “เบนช์มาร์กนี้มีข้อบกพร่อง” เป็นข้อกล่าวอ้างที่ทั้งสองแล็บใช้ และมักใช้กับเบนช์มาร์กที่พวกเขาแพ้เสมอ
ปัญหาฮาร์เนส ซึ่งไม่มีตารางของใครแก้ได้

เหตุผลที่ตารางทั้งสองไม่ตรงกันไม่ใช่เพราะผู้ขายรายหนึ่งโกหก แต่เป็นเพราะ benchmark การเขียนโค้ดแบบ agentic วัดโมเดลบวกกับ scaffold และ scaffold แตกต่างกัน Terminal-Bench 4.0 และ Terminal-Bench 2.1 เป็นเวอร์ชันแก้ไขที่แตกต่างกันของแนวคิดเดียวกัน ดำเนินการโดยคนละคน ด้วยงบเครื่องมือที่ต่างกันและกฎการลองใหม่ที่ต่างกัน ตัวเลข Opus 5.5 ของ Anthropic ผลิตขึ้นใน harness ของ Anthropic ส่วนตัวเลข Sol ของ OpenAI ในเครื่องมือแบบ Codex ย้ายโมเดลใดโมเดลหนึ่งไปยัง harness ของอีกฝ่าย แล้วคะแนนจะเปลี่ยน
ข้อมูลอิสระ เท่าที่มีอยู่นั้น ชี้ให้เห็นถึงการแข่งขันที่สูสีกันมากกว่าที่ตารางทั้งสองแสดง เบนช์มาร์กเอเจนต์จากบุคคลที่สามรายการหนึ่งเมื่อเดือนสิงหาคม 2026 ซึ่งรันข้ามหลายโมเดลกับงานแอปพลิเคชันจริง ยกให้ GPT-5.6 Sol เป็นการผสมผสานที่ดีที่สุดของความแม่นยำ ต้นทุน และความเร็ว — ประมาณ $0.52 และห้านาทีต่อการรันหนึ่งครั้ง — ขณะที่ Claude Opus 5 ไม่ใช่ 5.5 เป็นรุ่นที่แม่นยำที่สุดถึง 92% ของการรัน ส่วนกระดานจัดอันดับอีกแห่งที่ครอบคลุมงานเขียนโค้ดระดับองค์กรจัดให้ Claude Opus 5 อยู่อันดับหนึ่งที่ 96.4% โดยมี GPT-5.6 Sol อยู่อันดับสามที่ 86.5% ซึ่งก็ยังเป็นการเปรียบเทียบ Sol กับ Opus รุ่นก่อนเช่นเดิม ไม่ใช่รุ่นใหม่ ทั้งสองรายการไม่ใช่การเปรียบเทียบแบบเผชิญหน้าโดยตรงกับ Opus 5.5 และทั้งคู่ก็ไม่ได้ยุติข้อถกเถียงใด ๆ แต่ทั้งคู่ก็ยืนยันได้ว่า เมื่อมีคนอื่นที่ไม่ใช่ผู้ขายเป็นคนรันการเปรียบเทียบ ช่องว่างความแตกต่างก็จะแคบลง
ข้อสรุปที่นำไปใช้ได้จริงคือ ให้หยุดอ่านตารางเหล่านั้นในฐานะการจัดอันดับ และเริ่มอ่านมันในฐานะรายการสมมติฐาน ถ้างานของคุณคือระบบอัตโนมัติบนเทอร์มินัลแบบระยะยาว ช่องว่าง Terminal-Bench ของ Anthropic ก็เป็นสมมติฐานที่ควรทดสอบกับงานของคุณเอง ถ้าเป็นงานวิจัยระดับมืออาชีพแบบหลายขั้นตอน ผลลัพธ์ Agents' Last Exam ของ Sol ก็เป็นสมมติฐานประเภทเดียวกัน ไม่มีตัวเลขใดถ่ายโอนไปยังปริมาณงานของคุณได้โดยไม่ต้องรัน
ต้นทุนต่องานที่เสร็จสมบูรณ์ ซึ่งเป็นต้นทุนเดียวที่สำคัญ
บนตารางราคา Claude Opus 5.5 ตอนนี้ถูกกว่าทั้งสองทิศทาง: $4.00 เทียบกับ $5.00 สำหรับอินพุต, $20.00 เทียบกับ $30.00 สำหรับเอาต์พุต และอัตราการอ่านแคช $0.20 ซึ่งต่ำกว่าที่ Claude Opus 5 เคยเรียกเก็บ 60% สำหรับเอเจนต์ที่ส่งพรอมต์ระบบยาว ๆ ซ้ำในทุกเทิร์น บรรทัดค่าแคชนั้นเป็นต้นทุนหลัก และเป็นเหตุผลที่เซสชันที่ทำงานยาวนานสามารถถูกลงอย่างมีนัยสำคัญโดยไม่ต้องเปลี่ยนพรอมต์ใด ๆ
แต่ราคาต่อโทเคนไม่เคยเป็นตัวกำหนดบิลของเอเจนต์ ข้อโต้แย้งของ OpenAI สำหรับ Sol ตอนเปิดตัวตั้งอยู่บนประสิทธิภาพการใช้โทเคนมากกว่าราคาหน้าป้าย — โดยรายงานว่าประสิทธิภาพการใช้โทเคนสำหรับการเขียนโค้ดดีขึ้น 54% โดยมีโทเคนเอาต์พุตและเวลาที่ใช้ไม่ถึงครึ่งหนึ่งของ Claude Fable 5 ด้วยต้นทุนที่ต่ำลงประมาณหนึ่งในสาม Anthropic ก็ยกข้อโต้แย้งแบบเงาสะท้อนสำหรับ Opus 5.5: ต้นทุนการรันงานทั่วไปต่ำลงประมาณ 40% เมื่อเทียบกับ Claude Opus 5 ทั้งที่ตารางอัตราค่าบริการลดลงเพียง 20% โดยมีคำรับรองจากลูกค้าอย่าง Box, Kiro, Factory และ GitHub ต่างอ้างถึงการลดลงอย่างมากของจำนวนโทเคนหรือจำนวนขั้นตอน ข้ออ้างทั้งสองชี้ไปในทางเดียวกัน — โมเดลที่ทำงานเสร็จในจำนวนเทิร์นที่น้อยกว่าคือผู้ชนะ — และไม่มีข้ออ้างใดได้รับการตรวจสอบอย่างอิสระ
ในกรณีที่มีการคำนวณต้นทุนต่องานแบบอิสระอยู่จริง ตอนนี้ผลลัพธ์เอียงไปทาง Sol: การวิเคราะห์หนึ่งชิ้นที่เผยแพร่ในเดือนกันยายนระบุว่า GPT-5.6 Sol อยู่ที่ $1.56 ต่อปัญหาที่แก้สำเร็จบน SWE-bench Verified ด้วยอัตราความสำเร็จ 96.2% เทียบกับ Claude Opus 4.8 ที่ 88.6% นั่นคือ Sol ที่วัดเทียบกับโมเดล Anthropic รุ่นเก่า ไม่ใช่เทียบกับ Opus 5.5 ดังนั้นจึงเป็นจุดเริ่มต้นมากกว่าจะเป็นคำตัดสิน — แต่ก็เป็นเครื่องเตือนใจว่าโมเดลที่แก้ปัญหาได้ในการลองครั้งแรกนั้นถูกกว่าโมเดลที่ราคาถูกกว่าซึ่งต้องลองสามรอบ การวัดเดียวที่ชี้ขาดเรื่องนี้สำหรับคุณคืองานของคุณเอง โดยรันทั้งสองวิธี โดยมีจำนวนโทเคนอยู่ตรงหน้าคุณ
นี่เป็นปัญหาด้านการกำหนดเส้นทางมากกว่าปัญหาด้านการจัดซื้อจัดหา และก็คุ้มค่าที่จะระบุให้ชัดเจนว่าด้านใดของปัญหานี้ที่แก้ไขได้แล้วในตอนนี้ วันนี้ GPT-5.6 Sol อยู่บน OrcaRouter แล้ว ในราคาตามรายการของ OpenAI เอง โดยบวกเพิ่ม 0% — ราคาตามรายการของผู้ให้บริการถูกส่งผ่านมาตรง ๆ ดังนั้นเมื่อผู้ให้บริการเปลี่ยนอัตรา ฝั่งเราก็อัปเดตทันทีในวันเดียวกัน แทนที่จะรอหลังการซิงก์ Claude Opus 5.5 ยังไม่ใช่หนึ่งในเส้นทางของเรา แต่ใช้ได้ผ่าน API ของ Anthropic เองและผ่านคลาวด์รายใหญ่ต่าง ๆ เมื่อมันเข้ามาแล้ว คีย์เดียวกันก็ให้บริการได้ทั้งสองตัว ซึ่งนั่นคือสิ่งที่เปลี่ยนการทดลองให้กลายเป็นกฎการกำหนดเส้นทาง แทนที่จะเป็นสัญญาฉบับที่สองและ SDK ตัวที่สอง: ส่งงานไปยังโมเดลใดก็ตามที่ตัวเลขของคุณเองสนับสนุน เก็บ การสลับไปยังระบบสำรองอัตโนมัติให้ชี้ไปที่อีกตัวหนึ่ง และให้บรรทัด routing-DSLตัดสินใจเป็นรายคำขอ แทนที่จะเป็นรายไตรมาส การลดราคาของฝ่ายใดฝ่ายหนึ่งเป็นการเปลี่ยนแปลงการตั้งค่า ไม่ใช่การโยกย้ายระบบ

จุดที่ทั้งสองแตกต่างกันอย่างแท้จริง
ตัดการวัดมาตรฐานออก แล้วความแตกต่างสี่ข้อก็ยังคงอยู่ โดยทั้งหมดตรวจสอบได้:
• จุดตัดข้อมูลความรู้ (knowledge cutoff) มิถุนายน 2026 สำหรับ Opus 5.5 เทียบกับ 16 กุมภาพันธ์ 2026 สำหรับ Sol สี่เดือนถือเป็นช่องว่างที่มีนัยสำคัญจริง ๆ สำหรับสิ่งใดก็ตามที่เกี่ยวข้องกับไลบรารีใหม่ เหตุการณ์ล่าสุด หรือ API ที่เพิ่งเปลี่ยนแปลง และไม่มี benchmark ใดจับความต่างนี้ได้
• การกำหนดเส้นทางของมาตรการป้องกัน Opus 5.5 มาพร้อมมาตรการป้องกันระดับเดียวกับ Fable 5.1: คำขอด้านความมั่นคงปลอดภัยไซเบอร์ส่วนใหญ่จะถูกเปลี่ยนเส้นทางไปยัง Claude Opus 4.8 และงานด้านชีววิทยาจะถูกส่งกลับไปใช้ Claude Opus 5 เว้นแต่บัญชีจะได้รับการยืนยัน หากผลิตภัณฑ์ของคุณอยู่ในโดเมนใดโดเมนหนึ่งในสองด้านนี้ ทราฟฟิกส่วนหนึ่งของคุณกำลังถูกตอบโดยโมเดลที่เล็กกว่า Sol ไม่มีการกำหนดเส้นทางที่เทียบเท่าและได้รับการบันทึกไว้ แม้ว่า OpenAI จะระบุถึงการประเมินความปลอดภัยที่เกี่ยวข้องกับไซเบอร์ของตนเองก็ตาม
• การประสานงาน (Orchestration) Sol มาพร้อมโหมด Ultra ที่ coordinating เอเจนต์ย่อยแบบขนานหลายตัว โดยค่าเริ่มต้นคือสี่ตัว และมีการตั้งค่าระดับความพยายามในการให้เหตุผลสูงสุด Opus 5.5 ไม่มีฟีเจอร์ทั้งสองนี้ในฐานะความสามารถของแพลตฟอร์ม คันโยกของมันคือพารามิเตอร์ effort และการประกอบหลายโมเดลเข้าด้วยกันเป็นสิ่งที่คุณต้องสร้างหรือจัดเส้นทางเอง มากกว่าจะเป็นสิ่งที่ผู้ขายหยิบยื่นให้
• เศรษฐศาสตร์ของตระกูลโมเดล Sol เป็นหนึ่งในสามระดับ โดยมี Terra และ Luna อยู่ต่ำกว่า — และราคาของ Luna ถูกลดลง 80% ส่วนของ Terra ลดลง 20% ในการอัปเดตเมื่อวันที่ 30 กรกฎาคม พี่น้องที่ถูกกว่าของ Anthropic อย่าง Sonnet 5.5 และ Haiku 5.5 ถูกประกาศแล้วแต่ยังไม่เปิดให้ใช้งาน หากภาระงานของคุณเป็นแบบผสมผสาน ปัจจุบัน OpenAI มีระดับที่ถูกกว่าให้เลือกใช้แล้ววันนี้
การเลือกระหว่างพวกมัน
เลือก Claude Opus 5.5 ถ้างานของคุณคือการเขียนโค้ดแบบ agentic ที่ใช้เวลานาน หรืองานด้านความรู้ ถ้าราคาต่อโทเคนสำคัญ ถ้าพรอมต์ของคุณเกี่ยวข้องกับสิ่งใดก็ตามในช่วงสี่เดือนที่ผ่านมา หรือถ้าบริบทขนาด 1M โทเคนที่ราคา $0.20 ต่อล้านโทเคนที่แคชไว้ คือสิ่งที่ทำให้สถาปัตยกรรมของคุณจ่ายไหว เริ่มต้นที่ ความพยายามปานกลาง ไม่ใช่การตั้งค่าสูงที่สืบทอดมา และวัดว่าระดับ ต่ำ ยังคงใช้ได้หรือไม่
เลือก GPT-5.6 Sol หากคุณต้องการโหมดการประสานงานที่มาพร้อมกับผู้จำหน่าย หากคุณต้องการระดับราคาที่ถูกกว่าซึ่งอยู่ใต้รุ่นเรือธงตั้งแต่วันนี้แทนที่จะรออีกไม่กี่สัปดาห์ หรือหากภาระงานของคุณเป็นประเภทที่หลักฐานการเปิดตัวของ Sol เองครอบคลุมได้ดีที่สุด — เวิร์กโฟลว์วิชาชีพระยะยาวและการใช้งานคอมพิวเตอร์ ซึ่งเป็นจุดที่มันรายงานผลลัพธ์ที่แข็งแกร่งที่สุด
หากคุณใช้ Claude Opus 5 อยู่แล้ว โปรดทราบว่า Opus 5.5 ไม่ใช่ตัวแทนที่ใช้แทนกันได้ทันที: ไม่สามารถปิดโหมด thinking ได้อีกต่อไป การบังคับใช้เครื่องมือจะส่งคืนข้อผิดพลาด บล็อก thinking ถูกผูกไว้กับโมเดลและบทสนทนา และเครื่องมือ computer-use computer_20251124 ที่เก่ากว่าไม่เป็นที่ยอมรับบน Claude API หรือ Google Cloud สามข้อแรกยังใช้กับ Claude Fable 5.1 ด้วย การเปลี่ยนไปใช้ Sol เป็นการผสานรวมที่แตกต่างออกไปโดยสิ้นเชิง
สิ่งที่ชี้ขาดการเปรียบเทียบนี้ได้จริง ๆ คือการรันอิสระเพียงครั้งเดียวของทั้งสองโมเดลที่ระดับความพยายามที่เท่ากัน ในฮาร์เนสที่เทียบเคียงกัน บนชุดงานเดียวกัน ณ สัปดาห์นี้ ยังไม่มีใครเผยแพร่สักรายการ จนกว่าจะมีใครสักคนทำ จุดยืนที่ซื่อสัตย์คือจุดยืนที่หลักฐานสนับสนุน: ตารางของ Anthropic สนับสนุน Opus 5.5 และถูกสร้างโดย Anthropic; ตารางของ OpenAI สนับสนุน Sol และถูกสร้างโดย OpenAI; ผลลัพธ์อิสระที่มีอยู่เปรียบเทียบ Sol กับ Opus รุ่นก่อน และบรรยายถึงการแข่งขันที่สูสีกันมาก; และสองแถวที่จะตัดสินค่าใช้จ่ายของคุณ — โทเคนต่องานที่เสร็จสมบูรณ์ และปริมาณการอ่านแคช — เป็นสองแถวที่ทั้งสองผู้ขายไม่เผยแพร่
การเปรียบเทียบในบทความนี้4
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
