
Claude Opus 5.5 vs GPT-6 Astra: ช่องว่าง $6 และราคาที่สองที่ Astra เรียกเก็บเมื่อเกิน 272K
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 177 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1323 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
เดือนนี้ผู้ขายสองรายได้เผยแพร่ตารางเปรียบเทียบประสิทธิภาพสำหรับรุ่นเรือธงของตน โดยแต่ละตารางแสดงให้เห็นว่ารุ่นของตัวเองเป็นผู้ชนะ และไม่มีตารางใดเลยที่มีแม้แต่แถวเดียวที่นำสองรุ่นนี้มาแข่งกัน Claude Opus 5.5 ซึ่งเปิดตัวเมื่อวันที่ 22 กันยายน 2026 ในราคา 4 ดอลลาร์ต่ออินพุต 1 ล้านโทเคน และ GPT-6 Astra ซึ่งเปิดตัวเมื่อวันที่ 3 กันยายน 2026 ในราคา 10 ดอลลาร์ต่ออินพุต 1 ล้านโทเคน ทั้งสองรุ่นมีเกณฑ์วัดที่ทับซ้อนกันเพียงสองรายการเท่านั้น และทั้งคู่ก็แบ่งกันไป โดย Opus 5.5 ชนะงานที่ใกล้เคียงกับ AutomationBench ในตารางของ Anthropic ส่วน Astra ชนะงานนั้นในตารางของ OpenAI และ Astra นำหน้าอย่างชัดเจนในด้านการให้เหตุผลเชิงวิทยาศาสตร์ในทั้งสองตาราง นั่นคือสิ่งที่เอกสารจากผู้ขายบอกคุณได้ ส่วนภาพจากแหล่งอิสระนั้นคลุมเครือน้อยกว่าและชี้ไปในทางตรงกันข้าม และภาพด้านราคานั้นได้เปรียบเสียเปรียบกันมากยิ่งกว่าทั้งสองเรื่อง
สิ่งที่แต่ละฝ่ายเผยแพร่
ตารางของ Anthropic สำหรับ Opus 5.5 ใช้ฮาร์เนสของตัวเองและการตั้งค่าระดับความพยายามของตัวเอง และในจุดที่ระบุ Astra ตัวเลขเหล่านั้นเป็นของ Anthropic ไม่ใช่การรันซ้ำ ให้ถือว่าทั้งชุดเป็นข้อมูลที่ผู้จำหน่ายรายงานเอง:
• Terminal-Bench 4.0 — Claude Opus 5.5 66.4% เทียบกับ GPT-6 Astra 57.9% (Anthropic ระบุว่าการรันของ Opus ใช้ความพยายามระดับ xhigh)
• FrontierCode v1.1 — Claude Opus 5.5 54.4% เทียบกับ GPT-6 Astra 53.3%
• GDPval-AA v2.1 งานความรู้ — Claude Opus 5.5 1,846 Elo เทียบกับ GPT-6 Astra 1,542
• AutomationBench — Claude Opus 5.5 40.0% กับ GPT-6 Astra 41.4% (Astra นำอยู่)
• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58.7% เทียบกับ GPT-6 Astra 64.6% (Astra นำอยู่)
• Humanity's Last Exam เมื่อใช้เครื่องมือ — Claude Opus 5.5 67.7% เทียบกับ GPT-6 Astra 57.2%
ฝั่งของ OpenAI นั้นจับคู่ให้ตรงกันได้ยากกว่า เพราะ OpenAI เปิดตัว Astra โดยเทียบกับรุ่นก่อนของตัวเอง แทนที่จะเทียบกับเรือธงของ Anthropic และเกณฑ์มาตรฐานที่เลือก — การใช้คอมพิวเตอร์ วิศวกรรมฟรอนต์เอนด์ ความรู้ทั่วไป — ส่วนใหญ่ไม่ปรากฏในตารางของ Anthropic เลยด้วยซ้ำ นั่นไม่ใช่ความไม่ซื่อสัตย์ แต่เป็นพฤติกรรมการเปิดตัวตามปกติ และนั่นคือเหตุผลที่ว่าทำไมการเปรียบเทียบที่สร้างจากตารางของผู้ขายสองรายจึงเป็นการเปรียบเทียบของสองชุดที่เลือกมา ไม่ใช่ของสองโมเดล สิ่งหนึ่งที่ทั้งสองตารางเห็นตรงกันคือ Astra เก่งด้านวิทยาศาสตร์แบบเอเจนต์และการใช้คอมพิวเตอร์ และสองโมเดลนี้ใกล้เคียงกันพอด้านการเขียนโค้ดจนการเลือกฮาร์เนสอาจเปลี่ยนผลลัพธ์ได้
การอ่านที่เป็นอิสระ ซึ่งไม่มีผู้ขายรายใดเลือก

Artificial Analysis รันโมเดลทุกรุ่นด้วยการตั้งค่าเดียวที่เปิดเผยต่อสาธารณะ ดังนั้นตัวเลขของบริษัทจึงเป็นตัวเลขชุดเดียวในที่นี้ที่ได้มาจากผู้ประเมินรายเดียวกันภายใต้เงื่อนไขเดียวกัน:
• ดัชนีความฉลาด — Claude Opus 5.5 58 อยู่อันดับที่ 1 จาก 210 เทียบกับ GPT-6 Astra 53 อยู่อันดับที่ 6
• ป้ายกำกับคอนฟิกูเรชัน — Claude Opus 5.5 "การให้เหตุผลแบบปรับตัว, ความพยายามสูงสุด, การถอยกลับค่าเริ่มต้น", GPT-6 Astra "max"
• ความเร็วในการสร้างเอาต์พุต — GPT-6 Astra 52.5 โทเคน/วินาที อยู่ในระดับค่อนไปทางต่ำของช่วงราคาเดียวกัน เมื่อเทียบกับ Claude Opus 5.5 ที่ยังไม่เปิดเผย
• เวลาถึงโทเคนแรก — GPT-6 Astra 352.15 วินาที เทียบกับค่ามัธยฐานของบอร์ดที่ 3.83 วินาที; Claude Opus 5.5 ยังไม่เผยแพร่
• ราคา — Claude Opus 5.5 $4.00 ขาเข้า / $20.00 ขาออก ต่อล้าน เทียบกับ GPT-6 Astra $10.00 / $50.00
• บริบทและเอาต์พุต — GPT-6 Astra บริบท 1M และเอาต์พุตสูงสุด 128K เทียบกับ Claude Opus 5.5 1M และ 128K
ช่องว่างดัชนี 5 จุดไม่ถือเป็นข้อชี้ขาดโดยตัวมันเอง และไม่ควรตีความว่าเป็นเช่นนั้น — ทั้งสองโมเดลจัดอยู่ในระดับขีดความสามารถเดียวกัน ซึ่งนั่นคือสิ่งที่ "frontier" หมายถึงในไตรมาสนี้ สิ่งที่แถวข้อมูลของ Astra ยืนยันได้จริง ๆ ก็คือ การจ่ายราคาพรีเมียมไม่ได้ซื้อความได้เปรียบด้านขีดความสามารถบนบอร์ดเดียวที่ทั้งสองโมเดลปรากฏอยู่ แถวความหน่วงคือประเด็นยุ่งยากที่ตรงไปตรงมา: 352 วินาทีถึงโทเคนแรกนั้นสูงที่สุดในกลุ่มนี้อย่างมาก แม้ว่าจะวัดที่ความพยายามสูงสุด และโมเดลให้เหตุผลที่คิดก่อนจะปล่อยผลลัพธ์ย่อมดูช้าเสมอเมื่อวัดด้วยเมตริกนี้ ตัวเลข 52.5 โทเคน/วินาทีเป็นค่าที่พกพาไปเทียบได้มากกว่า และถือว่าค่อนไปทางต่ำสำหรับโมเดลที่ราคา $10/$50
ราคาที่สองของ Astra สูงกว่า 272,000 โทเค็น

ตารางราคาคือจุดที่สองรุ่นนี้เทียบกันไม่ได้เลย เพราะการคิดราคาของ Astra มีขั้นบันไดอยู่ในตัว อัตรามาตรฐานคืออินพุต $10.00, อินพุตแคช $1.00, การเขียนแคช $12.50 และเอาต์พุต $50.00 ต่อล้านโทเคน อย่างไรก็ตาม เมื่อเกิน 272,000 อินพุตโทเคน ทั้งคำขอจะถูกคิดราคาใหม่ — ไม่ใช่เฉพาะส่วนที่เกิน แต่ทั้งการเรียก — ที่อัตราอินพุตและแคช 2 เท่า และเอาต์พุต 1.5 เท่า ซึ่งทำให้งานบริบทขนาดยาวตกอยู่ที่ประมาณอินพุต $20 และเอาต์พุต $75 ต่อล้านโทเคน
Claude Opus 5.5 ไม่ทำเช่นนี้ Anthropic คิดค่าบริการ $4.00 และ $20.00 พร้อมหน้าต่าง 1M โทเคนเต็มในราคามาตรฐาน และระบุชัดเจนว่าคำขอ 900K โทเคนถูกคิดในอัตราต่อโทเคนเท่ากับคำขอ 9K โทเคน ดังนั้นอัตราส่วนที่พาดหัวระหว่างสองตัวนี้ — Astra มีต้นทุน 2.5x ของ Opus 5.5 ในทั้งสองทิศทาง — ไม่ใช่อัตราส่วนที่ใช้กับภาระงานที่ทั้งสองโมเดลถูกขายไปจริง บนเอเจนต์ระยะยาวที่แบกบริบทการทำงานขนาดใหญ่ การเปรียบเทียบคือ $20/$75 เทียบกับ $4/$20 ซึ่งคิดเป็น 5 เท่าสำหรับอินพุต และเกือบ 4 เท่าสำหรับเอาต์พุต ราคาแบบแบตช์ยิ่งทำให้ทบขึ้นแทนที่จะแก้ไข: Opus 5.5 ลดลงครึ่งหนึ่งเหลือ $2.00/$10.00 ขณะที่ระดับ flex ของ Astra ลดลงครึ่งหนึ่งเหลือ $5.00/$25.00 บนฐานที่สูงกว่าอยู่แล้วห้าเท่าในกรณีบริบทยาว
นี่คือความไม่สมมาตรที่มีผลต่อการตัดสินใจมากที่สุดเพียงหนึ่งเดียวในการเปรียบเทียบครั้งนี้ และมันมองไม่เห็นในตารางการเปิดตัวทุกตารางของทั้งสองบริษัท เพราะผู้ขายทั้งสองรายอ้างอิงอัตราแบบพาดหัว หากพรอมป์ต์ของคุณอยู่ต่ำกว่า 272K โทเคน ให้ข้ามไปเลย หากคุณกำลังสร้างเอเจนต์ที่อ่านรีโพซิทอรีหรือชุดเอกสาร ให้คิดราคาไว้ที่ $20/$75 ก่อนที่คุณจะเปรียบเทียบสิ่งใด
การเข้าถึงเป็นส่วนหนึ่งของข้อกำหนด
Astra เป็นโมเดลแรกของ OpenAI ที่ก้าวข้ามเกณฑ์ขีดความสามารถด้านความมั่นคงปลอดภัยไซเบอร์ระดับ Critical ภายใต้กรอบ Preparedness Framework ของบริษัทเอง และการเปิดตัวก็สะท้อนการจัดประเภทนั้นมากกว่าขีดความสามารถ การเข้าถึงเปิดให้องค์กรจำนวนจำกัดก่อน การเข้าถึงระดับองค์กรต้องให้ผู้ดูแลระบบเปิดใช้งานก่อนที่ผู้ใช้จะเห็นมัน และโมเดลที่จัดส่งนั้นปฏิเสธงานบางประเภทไปเลย Claude Opus 5.5 มาพร้อมกับปัญหาเดียวกันในอีกรูปแบบหนึ่งจากทิศทางตรงกันข้าม: มันถูกจัดส่งพร้อมชั้น safeguard tier ที่ Anthropic เคยสงวนไว้สำหรับ Claude Fable 5.1 ซึ่งหมายความว่าคำขอด้านความมั่นคงปลอดภัยไซเบอร์ส่วนใหญ่จะถูกเปลี่ยนเส้นทางไปยัง Claude Opus 4.8 และงานด้านชีววิทยาจะ fallback ไปใช้ Claude Opus 5 เว้นแต่บัญชีจะได้รับการยืนยัน
พฤติกรรมทั้งสองแบบปรากฏขึ้นในที่เดียวกัน ซึ่งก็คือการประเมินของคุณ Artificial Analysis ติดป้ายการตั้งค่าของ Opus 5.5 ว่า {{1}}การสำรองเริ่มต้น{{/1}} ก็เพราะคำขออาจไปลงที่โมเดลอื่นที่ไม่ใช่โมเดลที่คุณระบุ และบนพรอมต์ด้านความปลอดภัยหรือวิทยาศาสตร์ชีวภาพ สิ่งนี้เกิดขึ้นเป็นประจำ หากเวิร์กโหลดของคุณอยู่ในโดเมนเหล่านั้น สตริงโมเดลในคำขอของคุณไม่ได้เป็นการรับประกันเกี่ยวกับโมเดลที่ตอบ และตัวเลขคุณภาพของคุณจะรวมโมเดลที่เล็กกว่าไว้ในสัดส่วนการเรียกที่ไม่ทราบแน่ชัด ไม่มีผู้ให้บริการรายใดปิดบังเรื่องนี้ — ทั้งคู่จัดทำเอกสารไว้ — แต่ก็ไม่มีพาดหัวข่าวใดกล่าวถึงเรื่องนี้เช่นกัน
การเลือกระหว่างพวกมัน
การตัดสินใจที่การเปรียบเทียบนี้ก่อให้เกิดขึ้นจริงคือว่างานที่มีบริบทยาวสมควรที่จะจ่ายตามการคิดราคาแบบขั้นของ Astra หรือไม่ และสำหรับทีมส่วนใหญ่ คำตอบคือไม่: Opus 5.5 ถูกกว่าทุกบรรทัดที่ต่ำกว่า 272K ถูกกว่าอย่างมากเมื่อสูงกว่านั้น ทำคะแนนได้สูงกว่าในบอร์ดอิสระเพียงหนึ่งเดียว และรองรับบริบท 1M โทเค็นโดยไม่มีค่าธรรมเนียมเพิ่ม ส่วนกรณีของ Astra นั้นแคบกว่าแต่ก็เป็นเรื่องจริง — การใช้เหตุผลทางวิทยาศาสตร์ การใช้คอมพิวเตอร์ และเครื่องมือในระบบนิเวศของ OpenAI — และหากการประเมินผลของคุณจัดให้มันนำหน้าในด้านเหล่านั้น ค่าใช้จ่ายส่วนเพิ่มก็เป็นเพียงรายการหนึ่ง ไม่ใช่ข้อผิดพลาด
สิ่งที่ทำให้เรื่องนี้ใช้ได้จริงคือวิธีที่คุณนำทั้งสองมาเปรียบเทียบกัน เพราะการเปรียบเทียบที่เป็นธรรมต้องใช้โมเดลทั้งสองบนคีย์เดียวกันและบิลเดียวกัน ทั้งสองสามารถกำหนดเส้นทางผ่าน OrcaRouter ในราคาตามที่ผู้ให้บริการประกาศ โดยบวกเพิ่ม 0% — Claude Opus 5.5 ในราคา $4.00/$20.00 ของ Anthropic และ GPT-6 Astra ในราคา $10.00/$50.00 — ซึ่งหมายความว่าการตัดสินใจเรื่อง 272K สามารถทดสอบกับทราฟฟิกของคุณเองได้ แทนที่จะเถียงกันจากข่าวประชาสัมพันธ์สองฉบับ การปักหมุด Astra ไว้กับคลาสงานที่มันชนะ และปล่อยให้การสลับไปใช้ระบบสำรองอัตโนมัติ ดูแลส่วนที่เหลือนั้นเป็นกฎการกำหนดเส้นทาง และคำขอที่ข้ามเส้น 272K สามารถส่งไปตามเส้นทางที่ถูกกว่าได้โดยไม่ต้องแก้โค้ด เพราะกฎนั้นอยู่ในเราเตอร์ ไม่ใช่ในแอปพลิเคชันของคุณ

อะไรจะเปลี่ยนคำตอบ
สิ่งหนึ่งที่จะช่วยได้คือ การเปรียบเทียบแบบควบคุมโดยตรงที่ความพยายามเท่ากันบนชุดเกณฑ์มาตรฐานที่ใช้ร่วมกัน ทั้งสองผู้ขายยังไม่เคยเผยแพร่การเปรียบเทียบเช่นนั้น และทั้งคู่ก็ไม่มีแรงจูงใจที่จะทำ ซึ่งทำให้ดัชนีอิสระเป็นเพียงการเปรียบเทียบภายใต้เงื่อนไขเดียวกันเท่านั้นที่หาได้ — และดัชนีนั้นจัดให้ Opus 5.5 อยู่สูงกว่า Astra ห้าคะแนนและห้าอันดับ ด้วยราคาต่อโทเคนต่ำกว่าครึ่งหนึ่ง ข้อโต้แย้งที่ควรจับตามองคือ ทั้งสองโมเดลถูกให้คะแนนที่ความพยายามสูงสุด ขณะที่ Opus 5.5 เปิดตัวโดยมีค่าเริ่มต้นเป็นระดับกลาง หากความได้เปรียบของ Astra ในงานวิทยาศาสตร์ระยะยาวยังคงอยู่เมื่อรันที่ความพยายามเท่ากัน ข้อสนับสนุนสำหรับการจ่ายในราคาพรีเมียมก็จะแข็งแกร่งขึ้นแทนที่จะอ่อนลง จนกว่าจะมีใครรันการทดสอบนั้น จุดยืนที่ป้องกันได้คือ Astra เป็นผู้เชี่ยวชาญที่ตั้งราคาแบบทั่วไป และ Opus 5.5 คือแบบทั่วไปที่บังเอิญได้คะแนนสูงกว่า
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
