
Claude Sonnet 5.5 vs GPT-6 Sol: ตอนนี้ระดับราคา 2 ดอลลาร์มีเรือธงถึงสองรุ่นแล้ว
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 984 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 195 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
Claude Sonnet 5.5 และ GPT-6 Sol มีราคาเท่ากัน — 2 ดอลลาร์ต่อล้านโทเค็นอินพุต, 10 ดอลลาร์ต่อล้านโทเค็นเอาต์พุต — และเปิดตัวห่างกันหกวันในช่วงปลายเดือนกันยายน 2026 ความบังเอิญนั้นไม่ใช่ส่วนที่น่าสนใจ ส่วนที่น่าสนใจคือ เมื่อ Artificial Analysis วัดทั้งสองด้วย Intelligence Index v4.3.2 โมเดลระดับกลางของ Anthropic นำหน้าโมเดลที่ OpenAI ขายเป็นเรือธง: 56 สำหรับ Claude Sonnet 5.5 เทียบกับ 47 สำหรับ GPT-6 Sol ในเวอร์ชันเดียวกัน Claude Sonnet 5 — โมเดลที่ Sonnet 5.5 มาแทนที่ — อยู่ที่ 38
ดังนั้นนี่จึงไม่ใช่การเปรียบเทียบระหว่างระดับราคาถูกกับระดับราคาแพงอีกต่อไป แต่เป็นการเปรียบเทียบสองโมเดลในราคาเดียวกันจากสองแล็บ โดยมีส่วนต่าง 18 จุดระหว่างรุ่นของ Anthropic กับรุ่นก่อนหน้าของตัวเอง และมีส่วนต่าง 9 จุดที่เอื้อประโยชน์ต่อ Anthropic เมื่อเทียบกับรุ่นท็อปสุดของ OpenAI ทุกอย่างด้านล่างนี้เป็นความพยายามที่จะหาว่าช่องว่างใดในเหล่านั้นยังคงอยู่เมื่อเจอกับภาระงานจริง และช่องว่างใดเป็นเพียงอาร์ติแฟกต์ของ benchmark
แต่ละโมเดลจริงๆ แล้วคืออะไร
Claude Sonnet 5.5 เป็นโมเดลที่สองในรุ่น 5.5 ของ Anthropic เปิดตัวเมื่อวันที่ 28 กันยายน 2026 ห้าวันหลังการเปิดตัว Claude Opus 5.5 ที่ให้สัญญาไว้ว่าจะมี โดยใช้รหัส claude-sonnet-5-5 ทั่วทั้ง Claude API, Amazon Bedrock, Google Cloud และ Microsoft Foundry คงหน้าต่างบริบทขนาด 1M โทเคนและเพดานเอาต์พุต 128K ของระดับนี้ไว้ และรักษาราคาของ Claude Sonnet 5 ไว้อย่างเท่าเดิมทุกประการ: $2 ขาเข้า, $10 ขาออก, $0.20 ต่อล้านสำหรับการอ่านแคช, $2.50 สำหรับการเขียนแคชห้านาที โดยให้ใช้งานได้แบบไม่เก็บข้อมูลเลยตั้งแต่วันแรก และคำมั่นเรื่องการยกเลิกให้บริการของ Anthropic มีผลถึงวันที่ 28 กันยายน 2027

GPT-6 Sol เป็นรุ่นสืบทอดของโมเดลที่ถูกเรียกอย่างสับสนว่า GPT-5.6 Sol — ตัวที่ OrcaRouter ยังคงระบุว่าสามารถเข้าถึงได้ในราคา $4 ขาเข้า และ $20 ขาออก และซึ่ง Artificial Analysis ได้ทำเครื่องหมายว่าล้าสมัยไปแล้ว พร้อมชี้ไปยัง GPT-6 Sol โมเดลใหม่เปิดตัวเมื่อวันที่ 22 กันยายน 2026 ในราคา $2 / $10 พร้อมหน้าต่างบริบท 1,050,000 โทเคน เพดานเอาต์พุต 128K และอัตราแบบขั้นบันได: ราคาที่ประกาศ $2 / $10 มีผลสูงสุดถึง 272,000 โทเคนอินพุต และส่วนที่เกินกว่านั้นคิดในราคา $4 / $15
รายละเอียดสุดท้ายนั้นคือจุดแรกที่กรอบความคิดเรื่อง "ราคาที่เหมือนกัน" เริ่มแตกร้าว
ราคาที่เท่ากันจะเป็นจริงเฉพาะกับพรอมป์ต์สั้นเท่านั้น
เรทการ์ดทั้งสองระบุราคา $2 และ $10 และการเปรียบเทียบในวันเปิดตัวเกือบทั้งหมดก็หยุดอยู่แค่นั้น จับทั้งสองมาเทียบกันตามเงื่อนไขที่ชี้ขาดค่าใช้จ่ายในบิล:
• อัตราหลัก — Claude Sonnet 5.5 $2 / $10 เทียบกับ GPT-6 Sol $2 / $10
• อัตราบริบทยาว — Sonnet 5.5 คิดค่าบริการหน้าต่าง 1M ทั้งหมดในอัตรามาตรฐาน; GPT-6 Sol เพิ่มเป็นสองเท่าเป็น $4 / $15 เมื่อมีโทเค็นอินพุตเกิน 272,000
• หน้าต่างบริบท — 1,000,000 โทเค็น vs 1,050,000 โทเค็น
• เอาต์พุตสูงสุด — 128K โทเคนบน API แบบซิงโครนัสสำหรับทั้งสอง; Sonnet 5.5 ทำได้ถึง 300K บน Message Batches API เมื่อใช้output-300k-2026-03-24เฮดเดอร์
• ส่วนลดแบบแบตช์ — ลด 50% สำหรับอินพุตและเอาต์พุตของ Sonnet 5.5; ตรวจสอบเงื่อนไขปัจจุบันของ OpenAI สำหรับ Sol แทนที่จะสันนิษฐานว่ามีความเท่าเทียมกัน
• การอ่านแคช — $0.20 ต่อล้านสำหรับทั้งสอง
การกวาดสแกนรีโพซิทอรีขนาด 800,000 โทเคนมีค่าใช้จ่ายต่อโทเคนบน GPT-6 Sol สูงเป็นสองเท่าของบน Claude Sonnet 5.5 และนั่นก็เป็นภาระงานที่ทั้งสองโมเดลถูกทำการตลาดมุ่งเป้าไว้พอดี หากพรอมป์ของคุณสั้น อัตราค่าบริการก็เสมอกันจริง ๆ และราคาก็ไม่ควรเป็นตัวตัดสินอะไร หากพรอมป์ของคุณยาว ราคาก็ตัดสินไปแล้ว
ตารางคะแนนของ Anthropic เอง อ่านอย่างละเอียด
Anthropic เผยแพร่การเปรียบเทียบแบบสี่คอลัมน์กับ Claude Sonnet 5, Claude Opus 5.5 และ GPT-6 Sol ตัวเลขที่ผู้ขายรายงาน ซึ่งยังไม่มีบุคคลที่สามรายใดทำซ้ำได้:

• Terminal-Bench 4.0 — Sonnet 5.5 70.6% เทียบกับ Sonnet 5 10.3%
• FrontierCode 1.1, Main — Sonnet 5.5 46.2% ที่ Max effort, Sonnet 5 42.4%, Opus 5.5 54.4%, GPT-6 Sol 49.3%
• CursorBench 4.0 — Sonnet 5.5 55.5% เทียบกับ Sonnet 5 34.1% เทียบกับ Opus 5.5 57.8%
GDPval-AA v2.1 — Sonnet 5.5 1844 เทียบกับ Sonnet 5 1449 เทียบกับ Opus 5.5 1846 เทียบกับ GPT-6 Sol 1487
• AA-Briefcase v1.1 — Sonnet 5.5 1811 กับ Sonnet 5 1359 กับ Opus 5.5 1822 กับ GPT-6 Sol 1483
Humanity's Last Exam เมื่อใช้เครื่องมือ — Sonnet 5.5 64.5% เทียบกับ Sonnet 5 54.9% เทียบกับ Opus 5.5 67.7%
• OSWorld 2.1, บางส่วน — Sonnet 5.5 80.1% เทียบกับ Sonnet 5 57.0% เทียบกับ Opus 5 81.8%
• Chartography ไม่ใช้เครื่องมือ — Sonnet 5.5 61.6% เทียบกับ Sonnet 5 15.6% เทียบกับ Opus 5.5 64.4% เทียบกับ GPT-6 Sol 53.6%
สองแถวในนั้นมีเชิงอรรถกำกับ และทั้งคู่ก็สำคัญ ตัวเลข GDPval-AA, AA-Briefcase และ Chartography ของ GPT-6 Sol ถูก Anthropic ระบุว่าเป็นค่าที่วัดหลังการแก้ไขความสามารถในการเข้าใจภาพของฝั่ง OpenAI และตัวเลข FrontierCode ของ Sonnet 5.5 เป็นผลลัพธ์ที่ตั้งค่า Max-effort ซึ่ง Anthropic ระบุว่าต่ำกว่าผลลัพธ์ที่ตั้งค่า Xhigh ของตัวเองในการประเมินเดียวกัน การที่ผู้ขายรายหนึ่งเปรียบเทียบตัวเองกับคู่แข่งบน benchmark ที่ตัวเองเป็นผู้จัดทำ โดยมีเชิงอรรถที่กำกับข้อจำกัดของทั้งสองฝ่าย ไม่ถือเป็นหลักฐานที่เป็นกลาง มันเป็นหลักฐานที่ดีที่สุดที่มีในวันเปิดตัว และไม่ใช่สิ่งเดียวกับการวัด
สิ่งที่ตัวเลขจากแหล่งอิสระบอก และสิ่งที่พวกมันไม่ได้บอก
Artificial Analysis ได้เผยแพร่การรันแบบอิสระครั้งแรก: Index 56 บน v4.3.2 ค่าใช้จ่าย 7.60 ดอลลาร์ต่องาน Index และตัวเลขความเยิ่นเย้อ (verbosity) ที่ 410M โทเคนเอาต์พุต เทียบกับค่ามัธยฐานที่ 88M ตัวเลข verbosity นั้นสมควรได้รับความสนใจมากกว่าที่เป็นอยู่ มันหมายความว่าโมเดลมีแนวโน้มจะใช้โทเคนจำนวนมหาศาลระหว่างทางไปสู่คำตอบ และมันเป็นกลไกเบื้องหลังข้ออ้างด้านประสิทธิภาพเพียงข้อเดียวที่ไม่ได้มาจากตารางของ Anthropic เอง
Anthropic กล่าวว่า Claude Sonnet 5.5 สร้างเอาต์พุตได้เร็วขึ้น 30% เมื่อเทียบกับ Claude Sonnet 5 และมีค่าใช้จ่าย "ต่ำลงถึง 30% ต่องาน" ที่อัตราต่อโทเคนเท่ากัน ข้อกล่าวอ้างทั้งสองนี้รวมกันอธิบายโมเดลที่ทำงานเดียวกันได้ด้วยจำนวนโทเคนน้อยลง ไม่ใช่ตารางราคาที่ถูกกว่า ว่าสิ่งนั้นยังคงเป็นจริงหรือไม่คือสิ่งที่การวัดความเยิ่นเย้อด้วยข้อมูล 410 ล้านโทเคนมีไว้สำหรับ และการรันแบบอิสระเพียงครั้งเดียวไม่พอจะฟันธงเรื่องนี้ — แต่มันพอจะบอกได้ว่าประโยคการตลาดกับจำนวนโทเคนที่วัดได้ชี้ไปในทิศทางตรงกันข้าม และค่าที่วัดได้คือค่าที่จะปรากฏบนใบแจ้งหนี้
โปรดสังเกตด้วยว่าดัชนีอิสระยังไม่มีอะไรบ้าง ยังไม่มีการเผยแพร่การทำซ้ำของ OSWorld, Terminal-Bench หรือ CursorBench จากใครอื่นนอกจาก Anthropic และค่า 56 นั้นเป็นคะแนนรวม: มันไม่ได้บอกอะไรเลยว่าการประเมินใดในสิบรายการที่อยู่ภายในนั้นทำให้เกิดช่องว่างกับค่า 47 ของ Sol ความนำ 9 คะแนนในคะแนนรวมอาจซ่อนการแพ้ 15 คะแนนในการประเมินเพียงรายการเดียวที่เวิร์กโหลดของคุณพึ่งพา
จุดที่พวกเขาแตกต่างกันในแบบที่เรตการ์ดไม่อาจแสดงให้เห็น
ราคาและคะแนนดัชนีเป็นสองแกนที่ง่าย ส่วนแกนที่ตัดสินใจการย้ายระบบคือแกนด้านพฤติกรรม และตรงนี้สองโมเดลไม่ได้สูสีกันเลย

Claude Sonnet 5.5 เปิดใช้ adaptive thinking เป็นค่าเริ่มต้น โดยมีhigh เป็นระดับความพยายามเริ่มต้น และตัดความสามารถสามอย่างที่รุ่นก่อนอนุญาตออก: การส่ง thinking: {"type": "disabled"} ตอนนี้จะคืนค่า 400 และต้องแทนที่ด้วย between_tools; การใช้เครื่องมือแบบบังคับ — tool_choice ที่ตั้งเป็น "any" หรือเครื่องมือที่ระบุชื่อ — จะคืนค่า 400 ทันที; และรุ่นเก่ากว่า computer_20251124 เครื่องมือ computer-use จะถูกปฏิเสธบน Claude API และ Google Cloud โดยให้ใช้ชุดเครื่องมือแทน บล็อก Thinking ในตอนนี้ยังผูกอยู่กับโมเดลที่สร้างมันขึ้นมา ดังนั้นบทสนทนาจึงสามารถย้ายจาก Claude Sonnet 5 ไปยัง Claude Sonnet 5.5 และเก็บเหตุผลของมันไว้ได้ แต่ไม่สามารถย้ายกลับออกไปพร้อมกับมันได้อีก
ถ้า agent loop ของคุณตั้งค่า tool_choice: "any" เพื่อบังคับให้เกิดการเรียกที่ถูกต้องตาม schema Claude Sonnet 5.5 จะปฏิเสธคำขอจนกว่าคุณจะเปลี่ยนไปใช้ auto พร้อมการใช้เครื่องมือแบบ strict หรือ structured outputs นี่คืองาน migration จริง ๆ และเป็นแบบที่ทำให้การสลับ model-ID แค่บรรทัดเดียวกินเวลาทั้งบ่าย
ค่าใช้จ่ายในการสลับมาใช้ GPT-6 Sol นั้นแตกต่างโดยเนื้อแท้ เพราะโมเดลที่มันเข้าแทนที่ยังอยู่ในแค็ตตาล็อกและยังถูกเรียกใช้งานอยู่ GPT-5.6 Sol ไม่ได้ถูกถอนออกไป แต่ถูกกำหนดสถานะเลิกแนะนำ (deprecated) ที่ Artificial Analysis โดยตั้งราคาเป็นสองเท่าของโมเดลใหม่ และยังคงมีทราฟฟิกเข้ามา การวัดของ OrcaRouter เองแสดงว่ามันประมวลผลประมาณ 95 ล้านโทเคนต่อสัปดาห์ ซึ่งเป็นตัวชี้วัดโดยประมาณที่สมเหตุสมผลว่ามีการผสานรวมจำนวนเท่าใดที่ยังไม่ได้ย้ายมา การเปลี่ยนไปใช้ GPT-6 Sol เป็นการตัดสินใจด้านราคาที่คุณค่อยตัดสินใจภายหลังได้ คุณไม่จำเป็นต้องตัดสินใจตอนนี้
กำลังเปรียบเทียบบนคีย์เดียว
ปัญหาในทางปฏิบัติของการเปรียบเทียบผู้ให้บริการสองรายคือ โดยปกติแล้วคุณต้องมีบัญชีสองบัญชี เส้นทาง SDK สองเส้นทาง และชุดขีดจำกัดอัตราการใช้งานสองชุด ก่อนที่คุณจะได้เรียนรู้อะไร OrcaRouter ถูกสร้างขึ้นเพื่อยุบรวมเรื่องนั้นให้เหลือเพียง: ปลายทางที่เข้ากันได้กับ OpenAI หนึ่งปลายทาง, โมเดลมากกว่า 200 รุ่น, ราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยไม่บวกเพิ่ม, และการสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติ
โมเดลทั้งสองตัวที่มีความสำคัญในที่นี้สามารถจัดเส้นทางบนแพลตฟอร์มนี้ได้แล้วตั้งแต่วันนี้ GPT-6 Sol อยู่ในแค็ตตาล็อกที่ราคา $2 / $10 โดยที่ระดับบริบทยาวยังคงอยู่ครบ และ Claude Sonnet 5 — โมเดลที่ทราฟฟิกของ Claude API ส่วนใหญ่ยังใช้งานอยู่ โดยวัดได้ 150 โทเคนเอาต์พุตต่อวินาที และเวลา p50 ของโทเคนแรกอยู่ที่ประมาณห้าวินาที — อยู่บนแพลตฟอร์มนี้ตั้งแต่วันที่ 30 มิถุนายน ในราคา $2 / $10 ของ Anthropic เอง.
Claude Sonnet 5.5 เองยังไม่มีในแคตตาล็อกของเรา แม้จะจริงอย่างนั้น หนทางที่ซื่อตรงไปสู่มันคือ API ของผู้ให้บริการเอง และคลาวด์สามรายที่ Anthropic ระบุไว้ และวิธีประเมินมันอย่างซื่อตรงคือการส่งทราฟฟิกส่วนหนึ่งที่คุณยอมเสียได้ไปให้มัน นั่นคือสิ่งที่ชั้นการกำหนดเส้นทางมีไว้เพื่อ: เพิ่มสัดส่วนเป็นเปอร์เซ็นต์ เฝ้าดูอัตราความล้มเหลว และ เก็บโมเดลก่อนหน้าไว้เป็นตัวสำรองแทนที่จะเป็นแผนการย้อนกลับ.
อันไหนจะขึ้นโปรดักชัน
เลือกจากลักษณะของภาระงาน แทนที่จะเลือกจากคะแนนรวม
Claude Sonnet 5.5 เป็นตัวเลือกที่คุ้มค่ากว่า สำหรับงานที่ต้องใช้บริบทยาว สำหรับอะไรก็ตามที่เขียนไว้แล้วให้ทำงานกับพื้นผิว tool-use และ computer-use ของ Anthropic และสำหรับทีมที่พรอมต์มักยาวเกินสองแสนห้าหมื่นโทเค็น — หน้าต่างราคาเหมาจ่ายให้คุณค่าตรงนั้นมากกว่าผลต่างของดัชนีใด ๆ ทำใจไว้เลยว่าการย้ายครั้งนี้มีเช็กลิสต์แนบมาด้วย: การบังคับใช้เครื่องมือ, สวิตช์เปิดปิดการคิด, การจับคู่เครื่องมือ advisor และการเปลี่ยนแปลงเครื่องมือ computer-use
GPT-6 Sol เป็นตัวเลือกเพื่อความต่อเนื่องที่ปลอดภัยกว่าสำหรับสแตกแบบ OpenAI และเป็นตัวที่ถูกกว่าด้วย หากพรอมต์ของคุณสั้นและการเชื่อมต่อต่างๆ ของคุณสร้างเสร็จแล้ว ข้อได้เปรียบของมันไม่ใช่เรื่องความสามารถ — เพราะในคะแนนรวมมันตามหลังอยู่ — แต่เป็นเพราะรุ่นก่อนของมันยังให้บริการอยู่ และการโยกย้ายไม่มีกำหนดเส้นตาย
จากตัวเลขที่มีอยู่ในปัจจุบัน Claude Sonnet 5.5 ชนะการเปรียบเทียบแบบตัวต่อตัวบนดัชนีอิสระและในด้านเศรษฐศาสตร์ของบริบทแบบยาว และไม่แพ้ในสิ่งใดที่การวัดที่เผยแพร่ใด ๆ ยังสามารถตรวจจับได้ นอกเหนือจากความเชื่อมั่นของตารางของผู้ขายเอง นั่นเป็นข้อกล่าวอ้างที่แคบกว่าที่เอกสารเปิดตัวระบุ และเป็นข้อที่ควรค่าแก่การนำไปปฏิบัติ
สิ่งที่ทำให้คำตอบเปลี่ยนไปได้คือการรันแบบอิสระรอบที่สองบนการประเมินเชิงเอเจนต์ และตัวเลขจำนวนโทเค็นต่องานที่เผยแพร่สำหรับทั้งสองโมเดลบนงานชุดเดียวกัน จนกว่าทั้งสองอย่างนี้จะมีอยู่ ดัชนีคอมโพสิตก็คือความได้เปรียบเก้าจุดสำหรับโมเดลที่มีต้นทุนการรันต่ำกว่า และความได้เปรียบของดัชนีคอมโพสิตเก้าจุดก็ไม่ได้เท่ากับความได้เปรียบเก้าจุดบนภาระงานของคุณ
การเปรียบเทียบในบทความนี้3
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
