
{{1}}Claude Opus 5.5{{/1}} ปะทะ {{2}}GPT-6 Astra{{/2}}: การทดสอบแบบชิมดูที่แซงหน้าผลการวัดมาตรฐานไปไกล
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
มีคนถาม Claude Opus 5.5ให้ทำวิดีโอสั้นเกี่ยวกับห้องแล็บคู่แข่งที่แก้ปัญหา Navier-Stokes ได้ แล้วโพสต์ผลลัพธ์ออกไป จากนั้นก็เขียนประโยคที่ทำให้การเปรียบเทียบนี้คุ้มค่าที่จะทำ นั่นคือ โมเดลนี้ "ดีมาก" มี "รสนิยมเยี่ยม" และเป็น Claude ตัวแรกนับตั้งแต่ Opus 4.7 ที่พวกเขาอยากใช้งานอย่างหนักจริง ๆ แต่พวกเขาก็ยังคงใช้ GPT-6 Astraและ GPT-5.6 Sol เป็นตัวหลัก เพราะงานของพวกเขาเน้นการวิจัยหนัก นั่นคือสามข้ออ้างในโพสต์เดียว และมันดึงไปคนละทิศคนละทาง โมเดลหนึ่งอาจเป็นสิ่งที่ทำงานด้วยแล้วเพลิดเพลินที่สุด แต่ก็ยังไม่ใช่ตัวที่คุณจะส่งทราฟฟิกโปรดักชันไปให้ คำถามที่น่าสนใจไม่ใช่ว่าโมเดลไหนดีกว่า แต่คือคำตัดสินสองข้อนั้น ข้อไหนที่ยังยืนได้เมื่อเจอกับตัวเลข และข้อไหนกลายเป็นแค่คำกล่าวเกี่ยวกับรสนิยม
โพสต์นี้เป็นรายงานของผู้ปฏิบัติงานคนหนึ่ง ไม่ใช่การรัน benchmark — ให้มองเป็นสัญญาณว่าโมเดลให้ความรู้สึกอย่างไรในงานสร้างสรรค์และงานปลายเปิด ไม่ใช่หลักฐานเกี่ยวกับขีดความสามารถ ข้อมูลตัวเลขทั้งหมดด้านล่างมีกำกับว่าใครเป็นผู้จัดทำ
การทดสอบชิมบอกอะไรคุณได้บ้าง และบอกอะไรไม่ได้
ชิ้นงานมีความสำคัญตรงนี้ การทำวิดีโอเกี่ยวกับผลลัพธ์ทางคณิตศาสตร์ไม่ใช่งานเขียนโค้ดที่มีเกตผ่าน/ไม่ผ่าน ไม่มีขั้นตอนคอมไพล์ ไม่มีชุดทดสอบ ไม่มีฮาร์เนส Terminal-Bench ที่ให้คะแนนว่าสิ่งนั้นดีแค่ไหน โมเดลต้องเลือกมุมมอง ตัดสินใจว่าจะแสดงอะไร ทำให้มันเชื่อมโยงกัน และหยุด เมื่อผู้ปฏิบัติงานบอกว่าโมเดลมี "รสนิยมดีเยี่ยม" นั่นคือสิ่งที่พวกเขากำลังบรรยาย: การตัดสินใจเกี่ยวกับขอบเขตและจุดเน้นที่ปรากฏในงานซึ่งข้อกำหนดจงใจคลุมเครือ
นั่นคือความสามารถจริง และเป็นความสามารถที่ชุดแบบทดสอบวัดได้แย่ที่สุด นอกจากนี้ยังเป็นเหตุผลว่าทำไมคนคนเดียวกันจึงชื่นชมโมเดลได้แต่ไม่เปลี่ยนไปใช้โมเดลนั้น รสนิยมคือสิ่งที่คุณต้องการเมื่อคุณกำลังสำรวจ มันไม่ใช่สิ่งที่คุณต้องการเมื่อคุณมีโค้ด 200,000 บรรทัดให้ตรวจสอบและมีบิลที่ต้องชี้แจงเหตุผล
การวางกรอบการเปิดตัวของ Anthropic เองชี้ไปที่ความสามารถเดียวกัน ในรูปแบบข้อเขียนมากกว่าวิดีโอ: Claude Opus 5.5 ถูกนำเสนอว่ามีการเขียนที่ "Claudish" น้อยลง — มีการเกริ่นนำน้อยลง มีการหลีกเลี่ยงการฟันธงน้อยลง มีความเต็มใจมากขึ้นที่จะวางประเด็นสำคัญไว้ก่อน การให้คะแนนความอ่านง่ายโดยอิสระสนับสนุนทิศทางของข้อกล่าวอ้างนั้น แม้จะเห็นไม่ตรงกันในเรื่องขนาด ผู้ให้บริการยังรายงานอีกว่าการทดสอบตรวจสอบข้อเท็จจริงภายในผ่าน 16 จาก 18 ครั้ง เทียบกับ 0 จาก 18 สำหรับทั้ง Claude Fable 5.1 และ Claude Opus 5; ตัวเลขนั้นเป็นของ Anthropic เอง ยังไม่มีการทำซ้ำ และควรอ่านเป็นข้อกล่าวอ้างมากกว่าผลลัพธ์
สองกระดานคะแนน หนึ่งข้อขัดแย้งที่สำคัญ

บนเกณฑ์มาตรฐานที่เผยแพร่แบบดิบ Claude Opus 5.5 มักนำ GPT-6 Astra ปัญหาคือแหล่งอ้างอิงสองแหล่งที่ถูกอ้างถึงมากที่สุดไม่เห็นตรงกันว่านำมากแค่ไหน
ตารางเปิดตัวของ Anthropic วางให้ Claude Opus 5.5 อยู่ที่ 66.4% บน Terminal-Bench 4.0 โดย GPT-6 Astra อยู่ที่ 57.9% และ Claude Fable 5.1 อยู่ที่ 55.8% นั่นคือการนำอยู่ 8.5 คะแนนตามที่ผู้ขายรายงาน ในการเขียนโค้ดแบบเอเจนต์ — ส่วนต่างแบบที่ยุติการโต้แย้งได้ในสไลด์การตลาด Artificial Analysis ซึ่งรันฮาร์เนสของตัวเอง วัด Claude Opus 5.5 ได้ 59.6% บนแบบทดสอบเดียวกัน: อยู่ในระดับเดียวกับ GPT-6 Astra ที่ความพยายามระดับ xhigh และสูงกว่า Claude Opus 5 ราว 11 คะแนน การนำอยู่เป็นของจริงในการอ่านค่าทั้งสองแบบ แต่ขนาดของมันไม่ใช่
จุดที่โมเดลทั้งสองสลับตำแหน่งกันมีประโยชน์มากกว่าจุดที่โมเดลทั้งสองไม่สลับตำแหน่งกัน:
• Terminal-Bench 4.0 (การเขียนโค้ดแบบเอเจนต์) — Claude Opus 5.5 66.4% ตามตารางของ Anthropic เอง, 59.6% ตาม Artificial Analysis; GPT-6 Astra 57.9%
• Humanity's Last Exam แบบใช้เครื่องมือ — Claude Opus 5.5 ผู้พัฒนาเปิดเผย 67.7% วัดผลอิสระได้ 61.4%; GPT-6 Astra 57.2%
• GDPval-AA v2.1 (งานความรู้ในโลกจริงครอบคลุม 44 อาชีพ) — Claude Opus 5.5 1,846 Elo; GPT-6 Astra 1,542 Elo ตัวเลขทั้งสองมาจากคณะกรรมการอิสระของ Artificial Analysis ไม่ใช่จากผู้จำหน่าย
• Terminal-Bench-Science 0.1 — GPT-6 Astra 64.6% เทียบกับ Claude Opus 5.5 58.7% นี่คือชัยชนะที่ชัดเจนของ Astra และมันเป็นเบนช์มาร์กเชิงเอเจนต์ที่มีกลิ่นอายของวิทยาศาสตร์
• AutomationBench — GPT-6 Astra 41.4% เทียบกับ Claude Opus 5.5 40.0% ห่างกันนิดเดียว แต่ก็เป็น Astra อีกครั้ง
• FrontierCode v1.1 — Claude Opus 5.5 54.4% กับ GPT-6 Astra 53.3% ห่างกันแค่จุดเดียว
อ่านรายการนั้นในแบบที่ผู้ปฏิบัติจริงจะอ่าน งานที่มีภาระหนักด้านการวิจัย — งานที่มีองค์ประกอบด้านวิทยาศาสตร์หรือวรรณกรรม งานที่รันลูปการใช้เครื่องมือยาวนานและต้องการให้โมเดลยังยืนหยัดได้ — คือจุดที่ GPT-6 Astra ยืนหยัดได้พอดี ส่วนบอร์ดงานความรู้และการเขียนโค้ดที่ Claude Opus 5.5 วิ่งนำห่างไปไกล คือสิ่งที่คุณจะชี้ไปถ้างานของคุณคือการส่งมอบซอฟต์แวร์ คนทั้งสองในบทสนทนานี้อ่านเบนช์มาร์กของตัวเองได้ถูกต้อง พวกเขาแค่อ่านเบนช์มาร์กคนละตัวเท่านั้น
การตั้งค่าระดับความพยายามทำงานมากกว่าตัวโมเดลเสียอีก
ยังมีเหตุผลประการที่สองที่ไม่ค่อยน่าชื่นชมว่าทำไมอัตรากำไรในพาดหัวจึงดูอ่อน การเปรียบเทียบผู้ขายไม่ได้ทำภายใต้การตั้งค่าเดียวกัน
ตัวเลขที่เผยแพร่ของ Claude Opus 5.5 มาจากการตั้งค่าความพยายามในการให้เหตุผลแบบสูงมาก (xhigh) เทียบกับ GPT-6 Astra ที่ระดับ high การรันอิสระของ Artificial Analysis ตั้งค่าทั้งสองโมเดลไว้ที่ xhigh และช่องว่างด้านการเขียนโค้ดก็หายไป — ความได้เปรียบ 8.5 จุดของผู้จำหน่ายกลายเป็นคะแนนเท่ากัน นั่นไม่ใช่ข้อกล่าวหาว่ามีการกระทำผิด แต่เป็นสิ่งที่เกิดขึ้นเมื่อผู้จำหน่ายเลือกการตั้งค่าที่แสดงให้โมเดลของตนดูดีที่สุด และห้องปฏิบัติการอิสระเลือกการตั้งค่าที่เทียบเท่ากับคู่แข่ง ก่อนที่คุณจะย้ายเวิร์กโหลดโดยอาศัยตารางเบนช์มาร์ก ให้ตรวจสอบว่ามันถูกรันที่การตั้งค่าความพยายามระดับใด เพราะคำตอบบ่อยครั้งคือ "ระดับที่เข้าข้างตัวเอง"
บิลค่าโทเคนก็เล่าเรื่องเดียวกันจากอีกมุมหนึ่ง เอกสารเปิดตัวของ Anthropic เองระบุว่า Claude Opus 5.5 ใช้โทเคนราว 119,000 โทเคนต่อหนึ่งปัญหา โดยประมาณ 84,000 โทเคนในนั้นใช้ไปกับการคิด ขณะที่ GPT-6 Astra แก้ปัญหาที่เทียบเคียงกันได้ด้วยโทเคนราว 27,000 โทเคน โทเคนที่ใช้คิดถูกคิดค่าใช้จ่ายเป็นโทเคนเอาต์พุต โมเดลที่ใช้โทเคนมากกว่าสี่เท่าในราคาเอาต์พุตหนึ่งในห้านั้นแทบจะเสมอตัว — และนั่นยังไม่นับข้อเท็จจริงที่ว่าโมเดลที่ถูกกว่ามักเป็นโมเดลที่คุณยอมรันด้วยการตั้งค่าความพยายามสูงกว่าอยู่แล้ว
ยังมีข้อควรระวังเพิ่มเติมอีกประการหนึ่งที่อยู่ฝั่ง Claude Opus 5.5 โดยเฉพาะ: การจัดเส้นทางเพื่อความปลอดภัยของ Anthropic อาจส่งคำขอที่เกี่ยวข้องกับไซเบอร์และชีวภาพบางส่วนไปยังเส้นทางที่เข้มงวดกว่า ซึ่งฉุดคะแนนที่เผยแพร่ในการประเมินเหล่านั้นให้ต่ำลงเมื่อเทียบกับสิ่งที่โมเดลที่อยู่เบื้องหลังจะให้ผลออกมา หากงานของคุณเกี่ยวข้องกับโดเมนเหล่านี้ ช่องว่างระหว่างเบนช์มาร์กกับประสบการณ์จริงของคุณจะเกิดขึ้นจริง และช่องว่างนั้นจะเป็นไปในทิศทางที่เบนช์มาร์กมองโลกในแง่ดีเกินไป
งานจริงมีค่าใช้จ่ายเท่าใดในแต่ละครั้ง

Claude Opus 5.5 เป็นโมเดลที่ราคาถูกกว่าบนตารางราคา และไม่ได้ใกล้เคียงกันเลย:
• Claude Opus 5.5 — $4.00 ต่ออินพุต 1 ล้านโทเคน, $20.00 ต่อเอาต์พุต 1 ล้านโทเคน, $0.20 ต่อแคชอินพุต 1 ล้านโทเคน, $5.00 ต่อการเขียนแคช 1 ล้านโทเคน บริบท 1M โทเคน เอาต์พุตสูงสุด 128k
• GPT-6 Astra — $10.00 ต่อล้านอินพุต, $50.00 ต่อล้านเอาต์พุต, $1.00 ต่อล้านแคชอินพุต, $12.50 ต่อล้านการเขียนแคช เมื่อเกิน 272,000 โทเค็นอินพุตในคำขอเดียว ทั้งคำขอจะถูกคิดราคาใหม่ที่ $20.00 อินพุตและ $100.00 เอาต์พุต; ระดับแบตช์คือ $5.00/$25.00
ดังนั้น Claude Opus 5.5 จึงถูกกว่าสำหรับอินพุต 2.5 เท่า และถูกกว่าสำหรับเอาต์พุต 2.5 เท่า โดยอินพุตที่แคชไว้ถูกกว่า 5 เท่า หากงานของคุณใช้โทเคนใกล้เคียงกัน นั่นก็คือการตัดสินใจทั้งหมด และคำถามเรื่องรสนิยมก็เป็นเพียงของประดับ
ข้อแม้เกี่ยวกับการใช้โทเคนข้างต้นคือสิ่งที่ทำให้มันไม่ง่ายเพียงนั้น และการกำหนดราคาใหม่สำหรับบริบทขนาดยาวของ GPT-6 Astra ก็เป็นกับดักอีกอย่างหนึ่ง หากส่งโทเคนอินพุตเกิน 272,000 โทเคนในหนึ่งคำขอ ทั้งคำขอ — ไม่ใช่เฉพาะส่วนที่เกิน — จะเปลี่ยนไปใช้อัตราบริบทขนาดยาว งานวิจัยที่ยัดคลังข้อมูลขนาดใหญ่ลงในคำขอเดียวคือรูปแบบที่กระตุ้นมันพอดี การประมวลผลแบบกลุ่มที่ราคาครึ่งเดียวคือทางออกที่ถูกต้อง และมันอยู่ในคิวที่ช้ากว่า
บทสรุปที่ตรงไปตรงมาคือ ภาพรวมต้นทุนจะพลิกกลับไปมา ขึ้นอยู่กับว่าคุณกำลังทำอะไรอยู่ สำหรับงานที่ทั้งสองโมเดลใช้โทเค็นในปริมาณใกล้เคียงกัน Claude Opus 5.5 ชนะเรื่องราคาอย่างขาดลอย สำหรับลูปการวิจัยแบบเอเจนต์ที่ยาวนาน ซึ่งจำนวนโทเค็นแตกต่างกันไปตามที่เอกสารเปิดตัวของ Anthropic เองแสดงไว้ ทั้งสองกลับมาบรรจบกัน — ซึ่งเป็นพาดหัวข่าวที่ตื่นเต้นน้อยกว่าการลดต้นทุน 40% มาก และใกล้เคียงกับสิ่งที่ผู้ปฏิบัติงานรายงานมากกว่า
ทำไมผู้ใช้ที่เน้นการค้นคว้าจึงไม่สลับ
เมื่อนำชิ้นส่วนทั้งหมดมาประกอบเข้าด้วยกัน ประโยค “ยังคงชอบ Astra มากกว่า” ก็ไม่ใช่สิ่งที่ขัดแย้งกับประโยค “รสชาติดีเยี่ยม” อีกต่อไป มันคือข้อสังเกตเดียวกันที่มองจากอีกมุมหนึ่ง
งานที่ผู้ใช้ระบุชื่อไว้นั้นใช้เวลานาน ปลายเปิด ต้องใช้เครื่องมือ และมีค่าใช้จ่ายสูงต่อการรันหนึ่งครั้ง สำหรับงานเหล่านั้น GPT-6 Astra ครองกระดานวิทยาศาสตร์และงานอัตโนมัติ ใช้โทเคนการคิดเพียงเศษเสี้ยว และ — จากการวัดโดยอิสระ — อยู่ในระดับเดียวกันด้านการเขียนโค้ดเมื่อทั้งสองโมเดลทำงานด้วยความพยายามเท่ากัน ข้อได้เปรียบของ Claude Opus 5.5 กระจุกตัวอยู่ในงานที่คุณมองเห็นผลลัพธ์และตัดสินมันได้: งานเขียนร้อยแก้ว การตัดสินใจด้านดีไซน์ การกำหนดขอบเขตของโจทย์ที่คลุมเครือ การตัดสินใจว่าวิดีโอเกี่ยวกับ Navier-Stokes ควรนำเสนออะไรจริง ๆ นั่นคือรสนิยม และรสนิยมก็คือส่วนที่ไม่มีปรากฏอยู่บนแกนของเบนช์มาร์กเลย
หากคุณหวังว่าจะมีคำตัดสินว่าโมเดลหนึ่งชนะ หลักฐานก็ไม่สนับสนุนสิ่งนั้น เวอร์ชันที่ปกป้องได้นั้นแคบกว่า: Claude Opus 5.5 เป็นโมเดลที่ดีกว่าสำหรับงานที่วิจารณญาณเป็นคอขวด GPT-6 Astra เป็นโมเดลที่ดีกว่าสำหรับงานที่ความพยายามอย่างต่อเนื่องในบริบทขนาดยาวเป็นคอขวด และช่องว่างด้านราคาระหว่างทั้งสองนั้นแคบลงจนเกือบไม่มีเลยสำหรับงานประเภทที่สอง นั่นคือการตัดสินใจเลือกเส้นทาง ไม่ใช่การเปลี่ยนผ่าน
การรันทั้งสองโดยไม่มีการย้ายข้อมูล

นี่คือจุดที่โมเดลทั้งสองไม่ต้องเลือกอย่างใดอย่างหนึ่งอีกต่อไป GPT-6 Astra พร้อมใช้งานบน OrcaRouter วันนี้ในราคาตามที่ OpenAI กำหนดเอง — อินพุต $10.00 เอาต์พุต $50.00 อ่านแคช $1.00 เขียนแคช $12.50 — โดยมี ส่วนเพิ่ม 0% ราคาตามที่ผู้ให้บริการกำหนดส่งผ่านตรง ๆ นั่นหมายความว่าการเปลี่ยนแปลงอัตราของผู้ขายจะมาถึงฝั่งเราภายในวันเดียวกัน แทนที่จะเป็นเมื่อใดก็ตามที่ผู้ขายต่อซิงก์
Claude Opus 5.5 นั้นเข้าถึงได้ผ่าน API ของ Anthropic เองและแพลตฟอร์มของบุคคลที่สามหลายแห่ง เราไม่ได้ระบุว่ามันเป็นสิ่งที่เราให้บริการ และคุณควรตั้งข้อกังขากับใครก็ตามที่อ้างเป็นอย่างอื่นก่อนที่โมเดลจะเผยแพร่ไปทั่ว สิ่งที่คุณทำได้ในวันนี้คือวางทั้งสองโมเดลไว้เบื้องหลังคีย์เดียวและรูปแบบ endpoint เดียว แล้วกำหนดเส้นทางตามภาระงานแทนที่จะตามความชอบ ส่งคำขอแบบปลายเปิดที่ต้องใช้วิจารณญาณอย่างมากไปยัง Claude Opus 5.5 และส่งวงจรการวิจัยยาวไปยัง GPT-6 Astra โดยไม่ต้องดูแลสัญญาสองฉบับหรือการเชื่อมต่อไคลเอนต์สองแบบ
การสลับไปใช้ระบบสำรองอัตโนมัติคือสิ่งที่ทำให้การทดสอบนั้นปลอดภัย โมเดลใหม่ยังไม่ใช่เส้นทางสำหรับโปรดักชัน และการกำหนดเส้นทางผ่านปลายทางเดียวหมายความว่าเหตุการณ์ขัดข้องของผู้ให้บริการหรือการจำกัดอัตราจะย้ายคำขอไปแทนที่จะทำให้ล้มเหลว หากคุณต้องการค้นหาว่าช่องว่างด้านรสนิยมนั้นเป็นจริงกับงานของคุณเองหรือไม่ นั่นคือวิธีค้นหาที่ประหยัด — ลองรันมันเคียงข้างสิ่งที่คุณมีอยู่แล้วแทนที่จะแทนที่มัน และให้ชุดทดสอบของคุณเองเป็นตัวตัดสินแทนตารางการเปิดตัว
คำถามที่เบนช์มาร์กไม่อาจตอบได้
มีสองสิ่งที่น่าจับตามอง และทั้งคู่ไม่ใช่คะแนน benchmark อีกจุดหนึ่ง
ประการแรกคือว่าความไม่สมมาตรของการตั้งค่า effort จะถูกคลี่คลายหรือไม่ ตอนนี้ ตารางของผู้ขายที่ตั้งค่า xhigh เมื่อเทียบกับคู่แข่งที่ตั้งค่า high ให้ผลนำ 8.5 จุด ซึ่งการทดสอบอิสระที่ตั้งค่าให้ตรงกันกลับกลายเป็นผลเสมอ เมื่อห้องแล็บอิสระเผยแพร่ผลการรันที่ตั้งค่าให้ตรงกันบนบอร์ดวิทยาศาสตร์และระบบอัตโนมัติที่ GPT-6 Astra กำลังนำอยู่ในขณะนี้ ภาพนั้นอาจเคลื่อนไปในทางใดทางหนึ่ง — และมันจะเคลื่อนไปตามหลักฐาน ไม่ใช่ตามการวางกรอบของใคร
ข้อที่สองคือคำถามเรื่องประสิทธิภาพของโทเคน หากค่าใช้จ่ายส่วนเกินจากการคิดของ Claude Opus 5.5 ลดลงในรีลีสจุดย่อย ข้อได้เปรียบด้านอัตราค่าบริการ 2.5 เท่าของมันก็จะไม่ถูกหักลบอีกต่อไป และข้อโต้แย้งเรื่องราคาก็ชนะไปเลย หากไม่เป็นเช่นนั้น ผู้ปฏิบัติงานที่ยังใช้ GPT-6 Astra เป็นตัวขับเคลื่อนหลักก็ไม่ได้ตามวงจรข่าวไม่ทัน พวกเขาอ่านภาระงานของตัวเองได้อย่างถูกต้อง และตารางเปิดตัวก็แค่ไม่ได้วัดสิ่งนั้น
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
