การ์ด Hero หัวข้อ Claude Sonnet 5.5 vs Qwen3.8 Max คำโปรยย่อย หกสัปดาห์ สองระดับ หนึ่งคำตัดสินเรื่องต้นทุน พร้อมป้ายที่ระบุว่า input $2 ทั้งคู่, output $10 vs $6 และ Index 56 vs 45 และส่วนท้ายอ้างอิง Artificial Analysis v4.3.2 และราคาจากผู้จำหน่าย
Guides & Insights

Claude Sonnet 5.5 vs Qwen3.8 Max: หกสัปดาห์ สองระดับ หนึ่งคำตัดสินเรื่องค่าใช้จ่าย

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ลองคิดเลขจากสามพรอมต์ดู แล้วการเปรียบเทียบก็แทบจะได้ข้อสรุปตั้งแต่ยังไม่ถึงขั้นเบนช์มาร์ก การเรียกตอบกลับซัพพอร์ตแบบสั้น ๆ: อินพุต 2,000 โทเคน เอาต์พุต 500 สำหรับ Qwen3.8 Max ที่ราคา 2 ดอลลาร์ต่อล้านโทเคนขาเข้า และ 6 ดอลลาร์ต่อล้านโทเคนขาออก นั่นคิดเป็น 0.4 เซนต์ ส่วน Claude Sonnet 5.5 ที่ราคา 2 และ 10 ดอลลาร์ คิดเป็น 0.9 เซนต์ การรีแฟกเตอร์รีโพซิทอรี: อินพุต 400,000 เอาต์พุต 30,000 — 43 เซนต์ เทียบกับ 83 เซนต์ เซสชันแบบเอเจนต์ยาว ๆ ที่ใช้งบประมาณจริง ๆ: โทเคนขาเข้า 2 ล้าน โทเคนขาออก 200,000 ดังนั้น 5.20 ดอลลาร์ เทียบกับ 6.30 ดอลลาร์ เมื่อตัวเลขใหญ่พอที่ฝั่งอินพุตจะกลายเป็นตัวกำหนดหลัก

ช่องว่างที่เริ่มต้นจากความต่าง 2.25× ในราคาเอาต์พุต จะลดลงเหลือประมาณ 1.2× ที่สเกลเอเจนติก และการสเกลนั้นไม่ใช่เรื่องน่าสงสัย Qwen3.8 Max และ Claude Sonnet 5.5 ต่างเป็นโมเดล 1M โทเคนที่มีเพดานเอาต์พุตสูง ทั้งคู่มีราคา $2 ต่อล้านสำหรับอินพุต และทั้งคู่เปิดตัวห่างกันภายในแปดสัปดาห์ — ของผู้ขายเมื่อวันที่ 3 สิงหาคม 2026 พร้อมการรีเฟรชเมื่อวันที่ 2 กันยายน ของ Anthro​pic เมื่อวันที่ 28 กันยายน ความแตกต่างระหว่างทั้งสองไม่ใช่ตารางราคา แต่เป็นสิ่งที่แต่ละตัวต้องใช้จ่ายเพื่อให้ทำงานเสร็จ

จัดส่งอะไรไปบ้าง และเมื่อใด

Qwen3.8 Max เป็นระดับความสามารถสูงสุดของ Alibaba จนถึงปัจจุบัน Alibaba วางตำแหน่งให้แข่งขันโดยตรงกับ GPT-5.5, Claude Opus 4.7 และ Gemini 3.1 Pro ในคู่มือการย้ายระบบของตนเอง และแนะนำให้ใช้เมื่อใดก็ตามที่งานนั้นต้องการความสามารถในการให้เหตุผลที่แข็งแกร่งที่สุดที่มีอยู่ โดยมีหน้าต่างบริบท 1M โทเคน รับอินพุตข้อความ รูปภาพ และวิดีโอ และส่งออกข้อความ — การรับอินพุตวิดีโอถือเป็นความสามารถเดียวในที่นี้ที่ Claude Sonnet 5.5 ไม่มี ราคาอยู่ที่ $2 ต่ออินพุตหนึ่งล้านโทเคน และ $6 ต่อเอาต์พุตหนึ่งล้านโทเคน โดยการอ่านแคชอยู่ที่ $0.25 และการเขียนแคชอยู่ที่ $2.50 รายการวันที่ 3 สิงหาคมในแค็ตตาล็อกของเรามีรุ่นรีเฟรชวันที่ 2 กันยายนซึ่งระบุเป็น Qwen3.8 Max (0902) เพิ่มเข้ามา โดยมีอัตราหลักเดียวกันและเพดานเอาต์พุต 131K

Two-column scoreboard for Claude Sonnet 5.5 and Qwen3.8 Max across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, text and image input, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column Qwen3.8 Max: input $2.00 per million, output $6.00 per million, text image and video input, AA Intelligence Index 45, cost per Index task $5.41, September 2 2026 refresh. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 เป็นโมเดลที่สองในรุ่นที่ 5.5 ของ Anthropic เปิดตัวเมื่อวันที่ 28 กันยายน 2026 หกวันหลังจาก Claude Opus 5.5 โดยเปิดให้ใช้งานในชื่อ claude-sonnet-5-5 บน Claude API และผ่าน Amazon Bedrock, Google Cloud และ Microsoft Foundry พร้อมหน้าต่าง 1M โทเคน เพดานเอาต์พุตแบบซิงโครนัส 128K ซึ่งขยายได้ถึง 300K บน Message Batches API เมื่อใส่เฮดเดอร์ output-300k-2026-03-24 และอัตราค่าบริการของ Claude Sonnet 5 คงเดิมทุกประการ: อินพุต $2, เอาต์พุต $10, อ่านแคช $0.20, เขียนแคช $2.50 ไม่เก็บข้อมูลเลยตั้งแต่เปิดตัว และจะไม่ปลดระวางก่อนวันที่ 28 กันยายน 2027

ดังนั้นอัตราอินพุตจึงเท่ากัน หน้าต่างบริบทมีขนาดเท่ากัน และผู้ให้บริการทั้งสองรายรีเฟรชภายในระยะเวลาห่างกันหนึ่งเดือน ทุกอย่างที่ทำให้ทั้งสองแตกต่างกันอยู่ที่ฝั่งเอาต์พุตของบิลหรือในเบนช์มาร์ก

เกณฑ์มาตรฐาน: ตารางของผู้ขายเทียบกับดัชนีอิสระ

ที่นี่มีหลักฐานอยู่สองประเภท และทั้งสองประเภทไม่สามารถใช้แทนกันได้

ตารางการเปิดตัวของ Anthropic เป็นข้อมูลที่ผู้ขายรายงานเอง ไม่มีบุคคลที่สามใดตรวจสอบซ้ำ และครอบคลุมการประเมินแปดรายการ แถวที่สำคัญ

• Terminal-Bench 4.0 — Claude Sonnet 5.5 ทำได้ 70.6% เทียบกับ Claude Sonnet 5 ที่ 10.3%

• CursorBench 4.0 — 55.5% เทียบกับ 34.1% ของ Claude Sonnet 5

• GDPval-AA v2.1 — 1844 เทียบกับ 1449 สำหรับ Claude Sonnet 5, 1846 สำหรับ Claude Opus 5.5 และ 1487 สำหรับ GPT-6 Sol

• Humanity's Last Exam เมื่อใช้เครื่องมือ — 64.5% เทียบกับ 54.9%; Claude Opus 5.5 อยู่ที่ 67.7%

• OSWorld 2.1, บางส่วน — 80.1% เทียบกับ 57.0%

• Chartography โดยไม่ใช้เครื่องมือ — 61.6% เทียบกับ 15.6%

Alibaba ไม่ได้เผยแพร่ตารางสี่คอลัมน์ที่เทียบเท่าโดยตรง ดังนั้นตัวเลขเดียวที่สามารถวางบนแกนเดียวกันได้คือตัวเลขที่เป็นอิสระต่อกัน Artificial Analysis ฉบับแก้ไข v4.3.2

• ดัชนีความฉลาดแบบผสมผสาน — Claude Sonnet 5.5 ได้ 56 อยู่ในอันดับ 3 จาก 216; Qwen3.8 Max ได้ 45 อยู่ในอันดับ 27

• ต้นทุนต่องาน Intelligence Index — $7.60 เทียบกับ $5.41

• ความเร็วเอาต์พุต — โมเดลของ Anthropic ทำงานเทียบกับค่าพื้นฐาน Claude Sonnet 5 ซึ่งวัดได้ 78.7 โทเคนต่อวินาที; Qwen3.8 Max วัดได้ 39.1

• ความฟุ่มเฟือย — 410M โทเคนเอาต์พุตบน Index เทียบกับ 190M

คะแนนรายการประเมินแต่ละรายการของ Qwen3.8 Max เองอยู่ในระดับที่น่านับถือมากกว่าจะเป็นเพียงระดับก้ำกึ่ง: 92.8% บน GPQA Diamond, 88.8% บน Terminal-Bench 2.1, 80.3% ในการเรียกคืนบริบทยาว, 47.8% บน tau-banking มันเสียเปรียบในคะแนนรวมเพราะไม่ชนะอะไรอย่างชัดเจนเลย และรุ่นใหม่กว่าของ Anthropic ชนะหลายอย่างแบบขาดลอย โปรดสังเกตด้วยว่าหน้าเพจอิสระของ Qwen3.8 Max ระบุวันวางจำหน่าย 2 กันยายน 2026 และค่าบริบท 984K — มันกำลังอธิบายเวอร์ชันรีเฟรช (0902) ไม่ใช่บิลด์เดือนสิงหาคม และการนำตัวเลขของทั้งสองมาใช้ปนกันจะเป็นความผิดพลาด

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

สิ่งที่ขาดหายไปจากทั้งสองคอลัมน์นั้นสำคัญพอ ๆ กับสิ่งที่มีอยู่ในนั้น ไม่มีใครจำลองตัวเลข OSWorld หรือ Terminal-Bench ของ Anthropic ได้อย่างอิสระ ไม่มีใครเผยแพร่ตัวเลข Chartography หรือ CursorBench สำหรับ Qwen3.8 Max ค่าผสม (composite) เป็นตัวเลขเดียวที่วัดด้วยวิธีเดียวกันบนทั้งสองโมเดล ซึ่งเป็นเหตุผลว่าทำไมตัวเลขต้นทุนต่องาน (cost-per-task) ที่อยู่ข้างใต้จึงมีบทบาทมากมายถึงเพียงนั้น

ตัวเลขที่เป็นตัวตัดสิน และมันไม่ได้อยู่ในเรทการ์ดทั้งสองใบ

Artificial Analysis คิดค่าบริการทั้งสองโมเดลในลักษณะเดียวกัน: รันการประเมินทั้งสิบรายการใน Index นับโทเคน คูณด้วยราคาตามรายการ Claude Sonnet 5.5 ออกมาที่ $7.60 ต่องาน และ Qwen3.8 Max ที่ $5.41 ซึ่งเป็นส่วนเพิ่ม 40% สำหรับโมเดลของ Anthropic แม้จะมีคะแนนรวมที่สูงกว่า ค่าความฟุ่มเฟือยของคำอธิบายอธิบายทิศทาง — 410M โทเคน เทียบกับ 190M — และค่าความเร็วอธิบายส่วนที่เหลือ: โมเดลที่ปล่อยโทเคนน้อยกว่าและใช้เวลาต่อโทเคนนานกว่านั้น ไม่ใช่ตัวที่จ่ายสำหรับเอาต์พุตในอัตราสองเท่า

ข้ออ้างเรื่องประสิทธิภาพของ Anthropic เองก็สอดคล้องกับเรื่องราวเดียวกัน มากกว่าที่จะขัดแย้งกับมัน บริษัทกล่าวว่า Claude Sonnet 5.5 สร้างเอาต์พุตได้เร็วกว่า Claude Sonnet 5 มากกว่า 30% และมีค่าใช้จ่าย "ต่ำลงได้ถึง 30% ต่องาน" ที่ราคาเดียวกัน — ซึ่งเป็นข้ออ้างเกี่ยวกับจำนวนโทเคนต่องาน ไม่ใช่อัตรา สิ่งที่ว่าเป็นจริงหรือไม่เมื่อเทียบกับโมเดลที่ใช้โทเคนน้อยกว่าครึ่งหนึ่ง คือสิ่งที่ตัวเลข $7.60 กำลังถาม และการรันแบบอิสระหนึ่งครั้งก็เป็นเพียงจุดข้อมูลหนึ่งจุด

ผลที่ตามมาในทางปฏิบัติ: อัตราค่าเอาต์พุต $6 เทียบกับ $10 คือตัวเลขที่ฝ่ายจัดซื้อจะพิจารณา และมันเป็นตัวเลขที่ทำนายได้น้อยที่สุดในบทความนี้ ตัวที่ทำนายได้จริงคือจำนวนโทเคนต่องานบนพรอมป์ของคุณเอง และไม่มีผู้ขายรายใดจะมอบตัวเลขนั้นให้คุณ

อินพุต, วิดีโอ และกับดักการโยกย้าย

ความแตกต่างด้านความสามารถที่ปรากฏให้เห็นทันทีคือรูปแบบข้อมูล (modality) Qwen3.8 Max รองรับวิดีโอควบคู่ไปกับข้อความและรูปภาพ ส่วน Claude Sonnet 5.5 รองรับข้อความและรูปภาพ สำหรับการวิเคราะห์การบันทึกหน้าจอ ไปป์ไลน์ประมวลผลฟุตเทจการประชุม หรือสิ่งใดก็ตามที่ถือว่าวิดีโอเป็นอินพุตระดับแรก นั่นไม่ใช่ช่องว่างของเกณฑ์มาตรฐาน แต่เป็นคำถามเรื่องคุณสมบัติที่เข้าได้หรือไม่ได้แบบทวิภาค และมีเพียงหนึ่งในโมเดลเหล่านี้เท่านั้นที่ผ่าน

OrcaRouter model page for qwen/qwen3.8-max, attributed to Qwen and dated 2026-08-03, showing a 1M-token context window, text, image and video input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 2.25 seconds, and 53.0M tokens of traffic in the last seven days.

ความแตกต่างที่ปรากฏให้เห็นในอีกหนึ่งสัปดาห์ถัดมาคือพฤติกรรม Claude Sonnet 5.5 ทำให้เกิดการเปลี่ยนแปลงที่ทำให้โค้ดเดิมพัง 5 ประการกับโค้ดที่ทำงานบน Claude Sonnet 5 ค่าที่ไม่ใช่ค่าเริ่มต้น temperature, top_p หรือ top_k ตอนนี้จะส่งคืน 400 การส่ง thinking: {"type": "disabled"} จะส่งคืน 400 โดยชี้ไปที่ between_tools ซึ่งเป็นการตั้งค่า thinking ระดับต่ำสุดใหม่ ที่ยอมรับที่ความพยายามระดับ low, medium และ high และปฏิเสธที่ xhigh หรือ max การใช้เครื่องมือแบบบังคับ — tool_choice เป็น "any" หรือเครื่องมือที่ระบุชื่อ — จะส่งคืน 400 ทันที สำหรับ computer_20251124 ซึ่งเป็นเครื่องมือ computer-use รุ่นเก่า ถูกปฏิเสธบน Claude API และ Google Cloud และบล็อก thinking ผูกติดกับโมเดลและบัญชีที่สร้างมันขึ้นมา ดังนั้นการให้เหตุผลสามารถส่งต่อจาก Claude Sonnet 5 ได้ แต่ไม่สามารถส่งออกไปยังตระกูลอื่นได้ และคำนำหน้าบทสนทนาที่ถูกแก้ไขอาจทำให้การเล่นซ้ำกลายเป็นข้อผิดพลาด

Qwen3.8 Max ไม่ต้องมีสิ่งเหล่านั้นเลย มันเป็นโมเดลรูปแบบ OpenAI ที่มีอินเทอร์เฟซคำขอแบบมาตรฐาน และการย้ายมาใช้จากระดับอื่นของ Qwen ก็เป็นเพียงการเปลี่ยนสตริงโมเดลเท่านั้น

ชั่งน้ำหนักต้นทุนทั้งสองอย่างอย่างตรงไปตรงมา การเลือกโมเดล Qwen ทำให้คุณต้องเสียช่องว่างคะแนนรวม 11 จุด และตัวเลขจากผู้ขาย Anthropic ที่คุณไม่สามารถตรวจสอบได้ด้วยตัวเองอยู่แล้ว การเลือกโมเดล Anthropic ทำให้คุณต้องเสียอินพุตวิดีโอและรายการการเปลี่ยนแปลง API สี่รายการ ซึ่งแต่ละรายการจะล้มเหลวอย่างชัดเจนด้วยข้อผิดพลาด 400 ในครั้งแรกที่ถูกเรียกใช้ — ซึ่งเป็นความล้มเหลวแบบที่ดี แต่ก็ยังต้องทำงานหนึ่งวันอยู่ดี

OrcaRouter อยู่ตรงไหน

เหตุผลที่ต้องใช้การจัดเส้นทางแทนการเลือกก็คือ ตัวเลขชี้ขาด — ต้นทุนต่อหนึ่งงานบนทราฟฟิกของคุณ — ไม่สามารถคำนวณได้จากเอกสารของทั้งสองผู้ให้บริการ

OrcaRouter เป็น endpoint เดียวที่รองรับ OpenAI-compatible ครอบคลุมโมเดลกว่า 200 รายการ โดยส่งต่อราคาตามที่ผู้ให้บริการระบุไว้ (list price) โดยไม่บวกเพิ่ม ดังนั้นไม่ว่าจะมีการลดราคาหรือเปลี่ยน tier จากฝ่ายใด ระบบจะอัปเดตให้มีผลทันทีในวันเดียวกับที่ประกาศ บิลด์ของ Qwen3.8 Max ทั้งสองแบบอยู่ในแคตตาล็อกในราคา $2 / $6 ของ Alibaba เอง — ทั้งเวอร์ชันที่เข้าเดือนสิงหาคมและตัวรีเฟรช (0902) — ควบคู่ไปกับ Claude Sonnet 5 ซึ่งเป็นโมเดลที่ปริมาณทราฟฟิก Claude API ส่วนใหญ่ยังคงใช้งานอยู่ สามารถ rout ได้ตั้งแต่วันที่ 30 มิถุนายน ในราคา $2 / $10 ของ Anthropic ด้วยอัตราที่วัดได้ 150 output tokens ต่อวินาที ส่วน Claude Sonnet 5.5 เองยังไม่มีในแคตตาล็อกของเรา และในเมื่อยังเป็นเช่นนั้น เส้นทางที่ตรงไปตรงมาที่สุดคือ API ของผู้ให้บริการเองและคลาวด์สามแห่งที่ Anthropic ระบุไว้ และวิธีลองใช้โดยไม่ต้องย้าย workload คือการส่งทราฟฟิกเสี้ยวหนึ่งผ่าน automatic failover ไปยัง Claude Sonnet 5 หรือ Qwen3.8 Max

อันไหน สำหรับงานไหน

Qwen3.8 Max ชนะในด้านอินพุตวิดีโอ ด้านอัตราเอาต์พุต ด้านต้นทุนที่วัดได้ต่องานจัดทำดัชนี และด้านความพยายามในการบูรณาการ มันเป็นค่าเริ่มต้นที่เหมาะสมสำหรับงานปริมาณสูงที่มีข้อกำหนดชัดเจน ซึ่งช่องว่างคะแนนรวม 12 จุดจะไม่ปรากฏในคุณภาพผลลัพธ์

Claude Sonnet 5.5 ชนะในคะแนนรวมอิสระ ในการประเมินการเขียนโค้ดแบบเอเจนต์ที่ตัวเลขจากผู้ขายของ Anthropic แสดงการกระโดด 60 คะแนนเมื่อเทียบกับรุ่นก่อนของตัวเองบน Terminal-Bench 4.0 ในเพดานเอาต์พุตแบบแบตช์ 300K และในการตัดสินใจตามลักษณะงานที่ตารางราคาไม่อาจทำได้: มันคือโมเดลที่ควรเลือกเมื่องานยากพอที่ความถูกต้องสำคัญกว่าความประหยัด

สิ่งที่ทำให้คำตอบเปลี่ยนไปไม่ว่าจะเป็นรุ่นไหนก็คือสิ่งเดียวกัน และมันไม่ใช่การเปิดตัว benchmark ใหม่ แต่คือจำนวนโทเคนต่อภารกิจบนพรอมป์ของคุณเอง ภายใต้การตั้งค่าความพยายามของคุณเอง สำหรับทั้งสองโมเดล พารามิเตอร์ effort ของ Anthropic และเพดานเอาต์พุตของ Qwen ต่างเป็นคันโยกที่ควบคุมจำนวนนั้น และทั้งสองอย่างถูกกำหนดโดยคุณ ไม่ใช่โดยรายการราคาของผู้ให้บริการ

สิ่งหนึ่งที่การเปรียบเทียบนี้ทำให้กระจ่างก็คือ ที่ราคา 2 ดอลลาร์ต่อล้านในฝั่งอินพุต ฝั่งอินพุตของบิลไม่ใช่ปัจจัยสร้างความแตกต่างระหว่างเรือธงจากจีนกับรุ่นระดับกลางของ Anthropic อีกต่อไป การแข่งขันนั้นย้ายไปที่เอาต์พุตและจำนวนโทเคนตั้งแต่หลายเดือนก่อนแล้ว

การเปรียบเทียบในบทความนี้3

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube