
Claude Sonnet 5.5 vs Qwen3.8 Max: หกสัปดาห์ สองระดับ หนึ่งคำตัดสินเรื่องค่าใช้จ่าย
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 984 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 195 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
ลองคิดเลขจากสามพรอมต์ดู แล้วการเปรียบเทียบก็แทบจะได้ข้อสรุปตั้งแต่ยังไม่ถึงขั้นเบนช์มาร์ก การเรียกตอบกลับซัพพอร์ตแบบสั้น ๆ: อินพุต 2,000 โทเคน เอาต์พุต 500 สำหรับ Qwen3.8 Max ที่ราคา 2 ดอลลาร์ต่อล้านโทเคนขาเข้า และ 6 ดอลลาร์ต่อล้านโทเคนขาออก นั่นคิดเป็น 0.4 เซนต์ ส่วน Claude Sonnet 5.5 ที่ราคา 2 และ 10 ดอลลาร์ คิดเป็น 0.9 เซนต์ การรีแฟกเตอร์รีโพซิทอรี: อินพุต 400,000 เอาต์พุต 30,000 — 43 เซนต์ เทียบกับ 83 เซนต์ เซสชันแบบเอเจนต์ยาว ๆ ที่ใช้งบประมาณจริง ๆ: โทเคนขาเข้า 2 ล้าน โทเคนขาออก 200,000 ดังนั้น 5.20 ดอลลาร์ เทียบกับ 6.30 ดอลลาร์ เมื่อตัวเลขใหญ่พอที่ฝั่งอินพุตจะกลายเป็นตัวกำหนดหลัก
ช่องว่างที่เริ่มต้นจากความต่าง 2.25× ในราคาเอาต์พุต จะลดลงเหลือประมาณ 1.2× ที่สเกลเอเจนติก และการสเกลนั้นไม่ใช่เรื่องน่าสงสัย Qwen3.8 Max และ Claude Sonnet 5.5 ต่างเป็นโมเดล 1M โทเคนที่มีเพดานเอาต์พุตสูง ทั้งคู่มีราคา $2 ต่อล้านสำหรับอินพุต และทั้งคู่เปิดตัวห่างกันภายในแปดสัปดาห์ — ของผู้ขายเมื่อวันที่ 3 สิงหาคม 2026 พร้อมการรีเฟรชเมื่อวันที่ 2 กันยายน ของ Anthropic เมื่อวันที่ 28 กันยายน ความแตกต่างระหว่างทั้งสองไม่ใช่ตารางราคา แต่เป็นสิ่งที่แต่ละตัวต้องใช้จ่ายเพื่อให้ทำงานเสร็จ
จัดส่งอะไรไปบ้าง และเมื่อใด
Qwen3.8 Max เป็นระดับความสามารถสูงสุดของ Alibaba จนถึงปัจจุบัน Alibaba วางตำแหน่งให้แข่งขันโดยตรงกับ GPT-5.5, Claude Opus 4.7 และ Gemini 3.1 Pro ในคู่มือการย้ายระบบของตนเอง และแนะนำให้ใช้เมื่อใดก็ตามที่งานนั้นต้องการความสามารถในการให้เหตุผลที่แข็งแกร่งที่สุดที่มีอยู่ โดยมีหน้าต่างบริบท 1M โทเคน รับอินพุตข้อความ รูปภาพ และวิดีโอ และส่งออกข้อความ — การรับอินพุตวิดีโอถือเป็นความสามารถเดียวในที่นี้ที่ Claude Sonnet 5.5 ไม่มี ราคาอยู่ที่ $2 ต่ออินพุตหนึ่งล้านโทเคน และ $6 ต่อเอาต์พุตหนึ่งล้านโทเคน โดยการอ่านแคชอยู่ที่ $0.25 และการเขียนแคชอยู่ที่ $2.50 รายการวันที่ 3 สิงหาคมในแค็ตตาล็อกของเรามีรุ่นรีเฟรชวันที่ 2 กันยายนซึ่งระบุเป็น Qwen3.8 Max (0902) เพิ่มเข้ามา โดยมีอัตราหลักเดียวกันและเพดานเอาต์พุต 131K

Claude Sonnet 5.5 เป็นโมเดลที่สองในรุ่นที่ 5.5 ของ Anthropic เปิดตัวเมื่อวันที่ 28 กันยายน 2026 หกวันหลังจาก Claude Opus 5.5 โดยเปิดให้ใช้งานในชื่อ claude-sonnet-5-5 บน Claude API และผ่าน Amazon Bedrock, Google Cloud และ Microsoft Foundry พร้อมหน้าต่าง 1M โทเคน เพดานเอาต์พุตแบบซิงโครนัส 128K ซึ่งขยายได้ถึง 300K บน Message Batches API เมื่อใส่เฮดเดอร์ output-300k-2026-03-24 และอัตราค่าบริการของ Claude Sonnet 5 คงเดิมทุกประการ: อินพุต $2, เอาต์พุต $10, อ่านแคช $0.20, เขียนแคช $2.50 ไม่เก็บข้อมูลเลยตั้งแต่เปิดตัว และจะไม่ปลดระวางก่อนวันที่ 28 กันยายน 2027
ดังนั้นอัตราอินพุตจึงเท่ากัน หน้าต่างบริบทมีขนาดเท่ากัน และผู้ให้บริการทั้งสองรายรีเฟรชภายในระยะเวลาห่างกันหนึ่งเดือน ทุกอย่างที่ทำให้ทั้งสองแตกต่างกันอยู่ที่ฝั่งเอาต์พุตของบิลหรือในเบนช์มาร์ก
เกณฑ์มาตรฐาน: ตารางของผู้ขายเทียบกับดัชนีอิสระ
ที่นี่มีหลักฐานอยู่สองประเภท และทั้งสองประเภทไม่สามารถใช้แทนกันได้
ตารางการเปิดตัวของ Anthropic เป็นข้อมูลที่ผู้ขายรายงานเอง ไม่มีบุคคลที่สามใดตรวจสอบซ้ำ และครอบคลุมการประเมินแปดรายการ แถวที่สำคัญ
• Terminal-Bench 4.0 — Claude Sonnet 5.5 ทำได้ 70.6% เทียบกับ Claude Sonnet 5 ที่ 10.3%
• CursorBench 4.0 — 55.5% เทียบกับ 34.1% ของ Claude Sonnet 5
• GDPval-AA v2.1 — 1844 เทียบกับ 1449 สำหรับ Claude Sonnet 5, 1846 สำหรับ Claude Opus 5.5 และ 1487 สำหรับ GPT-6 Sol
• Humanity's Last Exam เมื่อใช้เครื่องมือ — 64.5% เทียบกับ 54.9%; Claude Opus 5.5 อยู่ที่ 67.7%
• OSWorld 2.1, บางส่วน — 80.1% เทียบกับ 57.0%
• Chartography โดยไม่ใช้เครื่องมือ — 61.6% เทียบกับ 15.6%
Alibaba ไม่ได้เผยแพร่ตารางสี่คอลัมน์ที่เทียบเท่าโดยตรง ดังนั้นตัวเลขเดียวที่สามารถวางบนแกนเดียวกันได้คือตัวเลขที่เป็นอิสระต่อกัน Artificial Analysis ฉบับแก้ไข v4.3.2
• ดัชนีความฉลาดแบบผสมผสาน — Claude Sonnet 5.5 ได้ 56 อยู่ในอันดับ 3 จาก 216; Qwen3.8 Max ได้ 45 อยู่ในอันดับ 27
• ต้นทุนต่องาน Intelligence Index — $7.60 เทียบกับ $5.41
• ความเร็วเอาต์พุต — โมเดลของ Anthropic ทำงานเทียบกับค่าพื้นฐาน Claude Sonnet 5 ซึ่งวัดได้ 78.7 โทเคนต่อวินาที; Qwen3.8 Max วัดได้ 39.1
• ความฟุ่มเฟือย — 410M โทเคนเอาต์พุตบน Index เทียบกับ 190M
คะแนนรายการประเมินแต่ละรายการของ Qwen3.8 Max เองอยู่ในระดับที่น่านับถือมากกว่าจะเป็นเพียงระดับก้ำกึ่ง: 92.8% บน GPQA Diamond, 88.8% บน Terminal-Bench 2.1, 80.3% ในการเรียกคืนบริบทยาว, 47.8% บน tau-banking มันเสียเปรียบในคะแนนรวมเพราะไม่ชนะอะไรอย่างชัดเจนเลย และรุ่นใหม่กว่าของ Anthropic ชนะหลายอย่างแบบขาดลอย โปรดสังเกตด้วยว่าหน้าเพจอิสระของ Qwen3.8 Max ระบุวันวางจำหน่าย 2 กันยายน 2026 และค่าบริบท 984K — มันกำลังอธิบายเวอร์ชันรีเฟรช (0902) ไม่ใช่บิลด์เดือนสิงหาคม และการนำตัวเลขของทั้งสองมาใช้ปนกันจะเป็นความผิดพลาด

สิ่งที่ขาดหายไปจากทั้งสองคอลัมน์นั้นสำคัญพอ ๆ กับสิ่งที่มีอยู่ในนั้น ไม่มีใครจำลองตัวเลข OSWorld หรือ Terminal-Bench ของ Anthropic ได้อย่างอิสระ ไม่มีใครเผยแพร่ตัวเลข Chartography หรือ CursorBench สำหรับ Qwen3.8 Max ค่าผสม (composite) เป็นตัวเลขเดียวที่วัดด้วยวิธีเดียวกันบนทั้งสองโมเดล ซึ่งเป็นเหตุผลว่าทำไมตัวเลขต้นทุนต่องาน (cost-per-task) ที่อยู่ข้างใต้จึงมีบทบาทมากมายถึงเพียงนั้น
ตัวเลขที่เป็นตัวตัดสิน และมันไม่ได้อยู่ในเรทการ์ดทั้งสองใบ
Artificial Analysis คิดค่าบริการทั้งสองโมเดลในลักษณะเดียวกัน: รันการประเมินทั้งสิบรายการใน Index นับโทเคน คูณด้วยราคาตามรายการ Claude Sonnet 5.5 ออกมาที่ $7.60 ต่องาน และ Qwen3.8 Max ที่ $5.41 ซึ่งเป็นส่วนเพิ่ม 40% สำหรับโมเดลของ Anthropic แม้จะมีคะแนนรวมที่สูงกว่า ค่าความฟุ่มเฟือยของคำอธิบายอธิบายทิศทาง — 410M โทเคน เทียบกับ 190M — และค่าความเร็วอธิบายส่วนที่เหลือ: โมเดลที่ปล่อยโทเคนน้อยกว่าและใช้เวลาต่อโทเคนนานกว่านั้น ไม่ใช่ตัวที่จ่ายสำหรับเอาต์พุตในอัตราสองเท่า
ข้ออ้างเรื่องประสิทธิภาพของ Anthropic เองก็สอดคล้องกับเรื่องราวเดียวกัน มากกว่าที่จะขัดแย้งกับมัน บริษัทกล่าวว่า Claude Sonnet 5.5 สร้างเอาต์พุตได้เร็วกว่า Claude Sonnet 5 มากกว่า 30% และมีค่าใช้จ่าย "ต่ำลงได้ถึง 30% ต่องาน" ที่ราคาเดียวกัน — ซึ่งเป็นข้ออ้างเกี่ยวกับจำนวนโทเคนต่องาน ไม่ใช่อัตรา สิ่งที่ว่าเป็นจริงหรือไม่เมื่อเทียบกับโมเดลที่ใช้โทเคนน้อยกว่าครึ่งหนึ่ง คือสิ่งที่ตัวเลข $7.60 กำลังถาม และการรันแบบอิสระหนึ่งครั้งก็เป็นเพียงจุดข้อมูลหนึ่งจุด
ผลที่ตามมาในทางปฏิบัติ: อัตราค่าเอาต์พุต $6 เทียบกับ $10 คือตัวเลขที่ฝ่ายจัดซื้อจะพิจารณา และมันเป็นตัวเลขที่ทำนายได้น้อยที่สุดในบทความนี้ ตัวที่ทำนายได้จริงคือจำนวนโทเคนต่องานบนพรอมป์ของคุณเอง และไม่มีผู้ขายรายใดจะมอบตัวเลขนั้นให้คุณ
อินพุต, วิดีโอ และกับดักการโยกย้าย
ความแตกต่างด้านความสามารถที่ปรากฏให้เห็นทันทีคือรูปแบบข้อมูล (modality) Qwen3.8 Max รองรับวิดีโอควบคู่ไปกับข้อความและรูปภาพ ส่วน Claude Sonnet 5.5 รองรับข้อความและรูปภาพ สำหรับการวิเคราะห์การบันทึกหน้าจอ ไปป์ไลน์ประมวลผลฟุตเทจการประชุม หรือสิ่งใดก็ตามที่ถือว่าวิดีโอเป็นอินพุตระดับแรก นั่นไม่ใช่ช่องว่างของเกณฑ์มาตรฐาน แต่เป็นคำถามเรื่องคุณสมบัติที่เข้าได้หรือไม่ได้แบบทวิภาค และมีเพียงหนึ่งในโมเดลเหล่านี้เท่านั้นที่ผ่าน

ความแตกต่างที่ปรากฏให้เห็นในอีกหนึ่งสัปดาห์ถัดมาคือพฤติกรรม Claude Sonnet 5.5 ทำให้เกิดการเปลี่ยนแปลงที่ทำให้โค้ดเดิมพัง 5 ประการกับโค้ดที่ทำงานบน Claude Sonnet 5 ค่าที่ไม่ใช่ค่าเริ่มต้น temperature, top_p หรือ top_k ตอนนี้จะส่งคืน 400 การส่ง thinking: {"type": "disabled"} จะส่งคืน 400 โดยชี้ไปที่ between_tools ซึ่งเป็นการตั้งค่า thinking ระดับต่ำสุดใหม่ ที่ยอมรับที่ความพยายามระดับ low, medium และ high และปฏิเสธที่ xhigh หรือ max การใช้เครื่องมือแบบบังคับ — tool_choice เป็น "any" หรือเครื่องมือที่ระบุชื่อ — จะส่งคืน 400 ทันที สำหรับ computer_20251124 ซึ่งเป็นเครื่องมือ computer-use รุ่นเก่า ถูกปฏิเสธบน Claude API และ Google Cloud และบล็อก thinking ผูกติดกับโมเดลและบัญชีที่สร้างมันขึ้นมา ดังนั้นการให้เหตุผลสามารถส่งต่อจาก Claude Sonnet 5 ได้ แต่ไม่สามารถส่งออกไปยังตระกูลอื่นได้ และคำนำหน้าบทสนทนาที่ถูกแก้ไขอาจทำให้การเล่นซ้ำกลายเป็นข้อผิดพลาด
Qwen3.8 Max ไม่ต้องมีสิ่งเหล่านั้นเลย มันเป็นโมเดลรูปแบบ OpenAI ที่มีอินเทอร์เฟซคำขอแบบมาตรฐาน และการย้ายมาใช้จากระดับอื่นของ Qwen ก็เป็นเพียงการเปลี่ยนสตริงโมเดลเท่านั้น
ชั่งน้ำหนักต้นทุนทั้งสองอย่างอย่างตรงไปตรงมา การเลือกโมเดล Qwen ทำให้คุณต้องเสียช่องว่างคะแนนรวม 11 จุด และตัวเลขจากผู้ขาย Anthropic ที่คุณไม่สามารถตรวจสอบได้ด้วยตัวเองอยู่แล้ว การเลือกโมเดล Anthropic ทำให้คุณต้องเสียอินพุตวิดีโอและรายการการเปลี่ยนแปลง API สี่รายการ ซึ่งแต่ละรายการจะล้มเหลวอย่างชัดเจนด้วยข้อผิดพลาด 400 ในครั้งแรกที่ถูกเรียกใช้ — ซึ่งเป็นความล้มเหลวแบบที่ดี แต่ก็ยังต้องทำงานหนึ่งวันอยู่ดี
OrcaRouter อยู่ตรงไหน
เหตุผลที่ต้องใช้การจัดเส้นทางแทนการเลือกก็คือ ตัวเลขชี้ขาด — ต้นทุนต่อหนึ่งงานบนทราฟฟิกของคุณ — ไม่สามารถคำนวณได้จากเอกสารของทั้งสองผู้ให้บริการ
OrcaRouter เป็น endpoint เดียวที่รองรับ OpenAI-compatible ครอบคลุมโมเดลกว่า 200 รายการ โดยส่งต่อราคาตามที่ผู้ให้บริการระบุไว้ (list price) โดยไม่บวกเพิ่ม ดังนั้นไม่ว่าจะมีการลดราคาหรือเปลี่ยน tier จากฝ่ายใด ระบบจะอัปเดตให้มีผลทันทีในวันเดียวกับที่ประกาศ บิลด์ของ Qwen3.8 Max ทั้งสองแบบอยู่ในแคตตาล็อกในราคา $2 / $6 ของ Alibaba เอง — ทั้งเวอร์ชันที่เข้าเดือนสิงหาคมและตัวรีเฟรช (0902) — ควบคู่ไปกับ Claude Sonnet 5 ซึ่งเป็นโมเดลที่ปริมาณทราฟฟิก Claude API ส่วนใหญ่ยังคงใช้งานอยู่ สามารถ rout ได้ตั้งแต่วันที่ 30 มิถุนายน ในราคา $2 / $10 ของ Anthropic ด้วยอัตราที่วัดได้ 150 output tokens ต่อวินาที ส่วน Claude Sonnet 5.5 เองยังไม่มีในแคตตาล็อกของเรา และในเมื่อยังเป็นเช่นนั้น เส้นทางที่ตรงไปตรงมาที่สุดคือ API ของผู้ให้บริการเองและคลาวด์สามแห่งที่ Anthropic ระบุไว้ และวิธีลองใช้โดยไม่ต้องย้าย workload คือการส่งทราฟฟิกเสี้ยวหนึ่งผ่าน automatic failover ไปยัง Claude Sonnet 5 หรือ Qwen3.8 Max
อันไหน สำหรับงานไหน
Qwen3.8 Max ชนะในด้านอินพุตวิดีโอ ด้านอัตราเอาต์พุต ด้านต้นทุนที่วัดได้ต่องานจัดทำดัชนี และด้านความพยายามในการบูรณาการ มันเป็นค่าเริ่มต้นที่เหมาะสมสำหรับงานปริมาณสูงที่มีข้อกำหนดชัดเจน ซึ่งช่องว่างคะแนนรวม 12 จุดจะไม่ปรากฏในคุณภาพผลลัพธ์
Claude Sonnet 5.5 ชนะในคะแนนรวมอิสระ ในการประเมินการเขียนโค้ดแบบเอเจนต์ที่ตัวเลขจากผู้ขายของ Anthropic แสดงการกระโดด 60 คะแนนเมื่อเทียบกับรุ่นก่อนของตัวเองบน Terminal-Bench 4.0 ในเพดานเอาต์พุตแบบแบตช์ 300K และในการตัดสินใจตามลักษณะงานที่ตารางราคาไม่อาจทำได้: มันคือโมเดลที่ควรเลือกเมื่องานยากพอที่ความถูกต้องสำคัญกว่าความประหยัด
สิ่งที่ทำให้คำตอบเปลี่ยนไปไม่ว่าจะเป็นรุ่นไหนก็คือสิ่งเดียวกัน และมันไม่ใช่การเปิดตัว benchmark ใหม่ แต่คือจำนวนโทเคนต่อภารกิจบนพรอมป์ของคุณเอง ภายใต้การตั้งค่าความพยายามของคุณเอง สำหรับทั้งสองโมเดล พารามิเตอร์ effort ของ Anthropic และเพดานเอาต์พุตของ Qwen ต่างเป็นคันโยกที่ควบคุมจำนวนนั้น และทั้งสองอย่างถูกกำหนดโดยคุณ ไม่ใช่โดยรายการราคาของผู้ให้บริการ
สิ่งหนึ่งที่การเปรียบเทียบนี้ทำให้กระจ่างก็คือ ที่ราคา 2 ดอลลาร์ต่อล้านในฝั่งอินพุต ฝั่งอินพุตของบิลไม่ใช่ปัจจัยสร้างความแตกต่างระหว่างเรือธงจากจีนกับรุ่นระดับกลางของ Anthropic อีกต่อไป การแข่งขันนั้นย้ายไปที่เอาต์พุตและจำนวนโทเคนตั้งแต่หลายเดือนก่อนแล้ว
การเปรียบเทียบในบทความนี้3
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
