
GPT-6 Astra vs Claude Fable 5.1: เรตการ์ดที่เหมือนกันทุกประการ และการตัดสินใจที่ขึ้นอยู่กับการอ่านแคช
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
นี่คือสิ่งที่การเปรียบเทียบแทบทุกชิ้นของการจับคู่นี้ทำพลาด และมันคือตัวเลขแรกที่ผู้ซื้อมองหา: GPT-6 Astra กับ Claude Fable 5.1 มีราคาเท่ากันเป๊ะ ในเอกสารของผู้ให้บริการทั้งสองรายเอง ซึ่งทั้งคู่เปิดอ่านเมื่อวันที่ 16 กันยายน 2026 OpenAI ระบุ GPT-6 Astra ที่ $10.00 ต่อล้านโทเคนอินพุต และ $50.00 ต่อล้านโทเคนเอาต์พุต ส่วน Anthropic ระบุ Claude Fable 5.1 ที่ $10.00 และ $50.00 ตัวคูณคือ 1.0 ไม่มีพรีเมียมให้ต้องหาเหตุผลรองรับ ไม่มีส่วนลดให้คว้าไว้ และไม่มีการคำนวณต่อโทเคนใดที่แยกสองตัวนี้ออกจากกัน หมายเหตุการวางกรอบหนึ่งข้อก่อนเข้าสู่ตัวเลข: GPT-6 Astra เองเปิดตัวเมื่อวันที่ 3 กันยายน 2026 ดังนั้นนี่จึงเป็นหน้าอ้างอิงสำหรับสองโมเดลที่วางจำหน่ายแล้ว ไม่ใช่การรายงานข่าวเปิดตัว สิ่งที่เปลี่ยนไปภายในเจ็ดวันล่าสุดคือหลักฐาน ไม่ใช่ตัวโมเดล — การวัดแบบตัวต่อตัวที่เป็นอิสระครั้งแรกของทั้งคู่เผยแพร่เมื่อวันที่ 9 กันยายน และ OpenAI ได้ปรับปรุงเอกสารความพร้อมให้บริการของตนเองเมื่อวันที่ 14 กันยายน หากคุณมาที่นี่โดยค้นหา "Fable 5.1 vs GPT-6 Astra" โดยคาดหวังคำตอบเรื่องราคา คำตอบเรื่องราคาคือเสมอกัน และการตัดสินใจที่แท้จริงอยู่ในอีกสองบรรทัดถัดลงไปในใบเรียกเก็บเงิน
เรทการ์ดทั้งสองเป็นบัตรเดียวกัน
เริ่มจากสิ่งที่ผู้จำหน่ายแต่ละรายเผยแพร่ เพราะข้อกล่าวอ้างทุกข้อที่ตามมาล้วนสืบทอดมาจากข้อมูลนั้น เอกสารโมเดลของ OpenAI เองสำหรับ gpt-6-astra ซึ่งอ่านเมื่อวันที่ 16 กันยายน 2026 ระบุราคา $10.00 ต่อ 1M โทเคนอินพุต, $1.00 ต่อ 1M อินพุตที่แคชไว้, $12.50 ต่อ 1M การเขียนแคช และ $50.00 ต่อ 1M เอาต์พุต โดยมีหน้าต่างบริบทขนาด 1,050,000 โทเคน อินพุตสูงสุด 922,000 โทเคน และเอาต์พุตสูงสุด 128,000 โทเคน เอกสารของ Anthropic สำหรับ claude-fable-5-1 ซึ่งอ่านในวันเดียวกัน ระบุราคา $10.00 ต่อ 1M อินพุต, $0.25 ต่อ 1M การอ่านแคช, $12.50 ต่อ 1M ในระดับการเขียนแคชห้านาที ($20.00 ในระดับหนึ่งชั่วโมง) และ $50.00 ต่อ 1M เอาต์พุต โดยมีบริบท 1M โทเคน และเพดานเอาต์พุต 128,000 โทเคนเช่นเดียวกัน
จัดเรียงให้ตรงกัน แล้วตัวคูณจะคำนวณออกมาเอง อินพุต: 1.0 เท่า เอาต์พุต: 1.0 เท่า การเขียนแคช: 1.0 เท่าบนระดับห้านาทีที่เทียบเคียงได้ การคิดราคาแบบแบตช์: ผู้ขายทั้งสองรายให้ส่วนลดครึ่งหนึ่ง ดังนั้นทั้งคู่จึงอยู่ที่ $5.00 ขาเข้าและ $25.00 ขาออก ใครก็ตามที่อ้างตัวคูณราคาสำหรับการจับคู่นี้ — รวมถึงตัวเลข “2.5 เท่า” ที่วนเวียนอยู่สำหรับ GPT-6 Astra — กำลังนำ Astra ไปเปรียบเทียบกับรุ่นพี่น้องที่ถูกกว่าภายในตระกูลเดียวกันของตัวเอง ซึ่งมักเป็น GPT-5.6 Sol ที่ $5.00 ขาเข้าและ $30.00 ขาออกบนเรตการ์ดของ OpenAI และไม่ได้เปรียบเทียบกับ Claude Fable 5.1 เลยแม้แต่น้อย
ความแตกต่างเชิงโครงสร้างสองประการยังคงอยู่หลังความเสมอกันนั้น และสิ่งเหล่านี้คือสิ่งที่คิดเงินจริง ประการแรกคือการอ่านแคช: $1.00 ต่อ 1M บน GPT-6 Astra เทียบกับ $0.25 ต่อ 1M บน Claude Fable 5.1 นั่นเป็นรายการโทเค็นเดียวที่เรตการ์ดทั้งสองแตกต่างกัน และช่องว่างอยู่ที่สี่เท่า ประการที่สองคือหน้าผาบริบทแบบยาว OpenAI คิดราคาคำขอทั้งหมดใหม่เมื่ออินพุตเกิน 272,000 โทเค็น — อัตราอินพุตและแคชเพิ่มเป็นสองเท่า และเอาต์พุตคูณด้วย 1.5 ดังนั้นการเรียกเดียวกันจึงถูกคิดเงินที่ $20.00 ขาเข้า และ $75.00 ขาออก โดยการอ่านแคชอยู่ที่ $2.00 เรตการ์ดที่เผยแพร่ของ Anthropic สำหรับ Claude Fable 5.1 ไม่ได้ระบุค่าธรรมเนียมเพิ่มสำหรับบริบทแบบยาว สำหรับสองโมเดลที่ทั้งคู่ขายพร้อมหน้าต่างหนึ่งล้านโทเค็น ความแตกต่างนั้นไม่ใช่รายละเอียดเล็กน้อยจากการปัดเศษ: มันคือเกณฑ์ที่เปลี่ยนการเรียกที่มีค่าใช้จ่ายสูงให้กลายเป็นการเรียกที่มีค่าใช้จ่ายสูงมากบนด้านเดียวของการเปรียบเทียบเท่านั้น
บรรทัดเดียวที่แตกต่าง และปริมาณงานที่มันตัดสินทุกอย่าง
ช่องว่างสี่เท่าในการอ่านแคชฟังดูเหมือนเป็นหมายเหตุเล็ก ๆ เมื่อเทียบกับอัตราหลักที่เท่ากัน แต่มันไม่ใช่เช่นนั้น เพราะวิธีที่ลูปของเอเจนต์คิดค่าใช้จ่ายจริง ๆ เอเจนต์ที่ทำงานยาวนานจะส่งคำนำหน้า (prefix) ขนาดใหญ่ชุดเดิมซ้ำ — พรอมต์ระบบ นิยามเครื่องมือ บริบทของรีโพซิทอรี ชุดเอกสารที่อัปโหลด — ในทุกเทิร์น และคำนำหน้านั้นถูกคิดค่าที่อัตราการอ่านแคชทุกครั้งที่มีการอ่านซ้ำ ยิ่งงานใช้จำนวนเทิร์นมากเท่าไร บิลก็ยิ่งเป็นการอ่านแคชมากกว่าอินพุตใหม่
ลองคำนวณกับเวิร์กโหลดที่ไม่มีอะไรพิเศษสำหรับทั้งสองโมเดล: พรีฟิกซ์คงที่ขนาด 100,000 โทเคนที่อ่านซ้ำตลอด 50 เทิร์น บวกอินพุตใหม่จริง ๆ 20,000 โทเคน และเอาต์พุต 10,000 โทเคนสำหรับงานนี้ บน GPT-6 Astra นั่นคือโทเคนที่อ่านจากแคชจำนวน 5 ล้านโทเคนในราคา $1.00 ต่อ 1M ($5.00) โทเคนอินพุตใหม่ 20,000 โทเคนในราคา $10.00 ต่อ 1M ($0.20) และโทเคนเอาต์พุต 10,000 โทเคนในราคา $50.00 ต่อ 1M ($0.50) — $5.70 สำหรับงานนี้ บน Claude Fable 5.1 จำนวนโทเคนเดียวกันคิดเงินที่ $1.25 สำหรับการอ่านแคช บวก $0.20 และ $0.50 เท่าเดิม — $1.95 เรตการ์ดเหมือนกันทุกประการ และโมเดลหนึ่งถูกกว่าในการรันงานนี้ประมาณ 2.9 เท่า ทั้งหมดเป็นเพราะบรรทัดค่าอ่านแคช
ตอนนี้ลองย่อโจทย์ลงดู การเรียกครั้งเดียวที่มี 4,000 โทเค็นอินพุตและ 2,000 โทเค็นเอาต์พุต โดยไม่ใช้แคชซ้ำ มีค่าใช้จ่าย $0.14 เท่ากันทั้งสองฝ่าย การเสมอกันนี้เป็นของจริง และมันคงอยู่เป๊ะ ๆ ตราบเท่าที่ไม่มีอะไรถูกแคช นี่เป็นจุดแรกที่อันดับพลิก และมันพลิกตามรูปร่างของภาระงาน มากกว่าการเลือกผู้จำหน่าย: ลูปที่ถูกครอบงำด้วยแคชตกเป็นของ Claude Fable 5.1 การเรียกครั้งเดียวแบบไม่มีแคชเป็นการเสมอกันอย่างแท้จริง และเกณฑ์ 272,000 โทเค็นคือจุดที่ GPT-6 Astra เลิกมีราคาเท่ากับสิ่งอื่นใดอีกต่อไป
ต้นทุนต่องาน ซึ่งการจัดอันดับจะพลิกไปในทางตรงกันข้าม
การเปรียบเทียบแบบต่อโทเคนเป็นตัวแทนที่ด้อยสำหรับต้นทุนของงานหนึ่ง ๆ เพราะโมเดลทั้งสองไม่ได้ใช้จำนวนโทเคนเท่ากันในการทำงานเดียวกันให้เสร็จ Artificial Analysis ซึ่งเผยแพร่การคิดบัญชีต้นทุนต่องานแบบอิสระเพียงเจ้าเดียวที่ผู้ขายทั้งสองรายต้องอยู่ภายใต้ในปัจจุบัน วัดต้นทุนของการรันการประเมิน Intelligence Index ของตนไว้ที่ $3.26 ต่องานสำหรับ GPT-6 Astra ที่ความพยายามสูงสุด เทียบกับ $7.63 สำหรับ Claude Fable 5.1 — หมายความว่าโมเดล OpenAI ที่มีราคาป้ายเดียวกันทำงานประเมินเดียวกันให้เสร็จด้วยต้นทุนประมาณ 43% หรือต่ำกว่าราว 57% กลไกอยู่ที่ชุดข้อมูลเดียวกัน: AA วัด GPT-6 Astra ที่ 27,000 โทเคนเอาต์พุตต่องานที่ความพยายามสูงสุด และ Claude Fable 5.1 ที่ 78,000 สำหรับคะแนนดัชนีเดียวกัน ใกล้เคียงกับความต่างสามเท่าในจำนวนโทเคนที่ใช้ไป นั่นคือตัวเลขของ AA จากบันทึกการวัดประสิทธิภาพที่เผยแพร่เมื่อวันที่ 9 กันยายน 2026 ไม่ใช่ของฝ่ายใดฝ่ายหนึ่ง
เมื่อนำข้อค้นพบทั้งสองมารวมกัน สรุปอย่างตรงไปตรงมาคืออันดับจะกลับด้านไปตามภาระงาน และการกลับด้านทั้งสองครั้งนั้นไม่ใช่ผลจากการปัดเศษ ในกรณีที่ต้นทุนของงานถูกครอบงำด้วยการอ่านซ้ำพรีฟิกซ์ขนาดใหญ่ที่คงที่ การอ่านแคชที่ถูกกว่าสี่เท่าของ Claude Fable 5.1 จะชนะ และชนะอย่างมาก ในกรณีที่ต้นทุนของงานถูกครอบงำด้วยจำนวนโทเค็นที่โมเดลส่งออกเพื่อทำให้เสร็จ — การรันแบบเอเจนต์ที่ยาวนาน การเขียนโค้ดหลายขั้นตอน งานวิจัยที่แผ่กระจายไปหลายเทิร์น — การใช้โทเค็นราวหนึ่งในสามของ GPT-6 Astra จะชนะด้วยส่วนต่างที่มากกว่าช่องว่างของแคช ซึ่งเป็นเหตุผลว่าทำไมจึงมีต้นทุนถูกกว่าต่อหนึ่งงานที่เสร็จสมบูรณ์ตามการวัดของ AA แม้ว่าจะคิดค่าอ่านแคชแพงกว่าถึงสี่เท่า
คำเตือนหนึ่งประการควรมากับการเปรียบเทียบโทเค็นข้ามผู้ให้บริการใด ๆ เสมอ: โมเดลทั้งสองไม่ได้ใช้ตัวตัดคำร่วมกัน ดังนั้นโทเค็นหนึ่งหน่วยในฝั่งหนึ่งจึงไม่ใช่โทเค็นหนึ่งหน่วยของอีกฝั่ง จำนวนโทเค็นที่รายงานอาจต่ำกว่าหรือสูงกว่าข้อความจริงด้วยปัจจัยที่ต่างกันในแต่ละโมเดล และโทเค็นการให้เหตุผลถูกรายงานไม่สอดคล้องกันในแต่ละเอนด์พอยต์ ตัวเลขค่าใช้จ่ายต่องานเป็นตัวเลขที่น่าเชื่อถือกว่าในที่นี้ เพราะคิดเป็นหน่วยดอลลาร์ไม่ใช่โทเค็น ให้ถือว่าการเปรียบเทียบ 27,000 กับ 78,000 เป็นไปในเชิงทิศทาง

Terminal-Bench 4.0 ซึ่งทั้งสองผู้จำหน่ายรายงานตัวเลขเดียวกัน
เกณฑ์มาตรฐานที่ผู้ให้บริการรายงานเองซึ่งทั้งสองห้องแล็บเลือกเผยแพร่คือ Terminal-Bench 4.0 และเมื่อเทียบกับเกณฑ์มาตรฐานที่ผู้ให้บริการรายงานเองโดยทั่วไปแล้ว มันมีความเรียบร้อยผิดปกติ เพราะผู้ให้บริการทั้งสองรายเห็นตรงกันเรื่องคะแนนของ Claude Fable 5.1 เอกสารเปิดตัวของ OpenAI รายงานว่า GPT-6 Astra ได้ 57.9% และ Claude Fable 5.1 ได้ 55.8% พร้อมกับการประเมินว่าต้นทุน API ต่องานของ Astra บนเกณฑ์มาตรฐานนั้นต่ำลงราว 63% ส่วนประกาศของ Anthropic เองก็รายงานว่า Claude Fable 5.1 ได้ 55.8% เช่นกัน ในตารางที่ยังระบุว่า Claude Mythos 5.1 ได้ 60.9% Claude Opus 5 ได้ 52.3% Claude Fable 5 ได้ 42.0% และ GPT-5.6 Sol ได้ 37.3% การที่ทั้งสองห้องแล็บรายงานคะแนน 55.8% สำหรับโมเดลของ Anthropic หมายความว่าช่องว่าง 2.1 จุดที่ OpenAI อ้างนั้นไม่ใช่ข้อโต้แย้งเกี่ยวกับตัวเลขของคู่แข่งเลย แต่เป็นคำถามเกี่ยวกับตัวเลขของ Astra เองล้วนๆ ซึ่งมีเพียง OpenAI เท่านั้นที่เผยแพร่ออกมา
การวัดผลโดยอิสระทำให้ช่องว่างนั้นกว้างขึ้นแทนที่จะแคบลง และเป็นเรื่องที่ควรพูดออกมาตรง ๆ เพราะปฏิกิริยาโดยธรรมชาติคือการสันนิษฐานว่าตรงกันข้าม ผลการวัด benchmark ของ GPT-6 Astra โดย Artificial Analysis ซึ่งเผยแพร่เมื่อวันที่ 9 กันยายน 2026 รายงานว่า Terminal-Bench v4.0 อยู่ที่59%สำหรับ GPT-6 Astra เทียบกับ52%สำหรับ Claude Fable 5.1 และ 40% สำหรับ GPT-5.6 Sol — ห่างกันเจ็ดจุดระหว่างสองโมเดลในการเปรียบเทียบนี้ ไม่ใช่ 2.1 ช่องว่าง 2.1 จุดที่ผู้ขายรายงานไม่ได้ชี้ขาดอะไร และช่องว่างเจ็ดจุดจากการวัดอิสระก็เช่นกัน ทั้งสองค่าอยู่ในช่วงที่การตั้งค่า harness การเลือก scaffold และความแปรปรวนระหว่างการรันแต่ละครั้งทำให้ตัวเลขขยับ และความต่างของเวอร์ชันก็สำคัญเช่นกัน: 59 กับ 52 คือ Terminal-Bench v4.0 ของ AA ซึ่งไม่จำเป็นต้องเป็นการตั้งค่าเดียวกันกับที่ทั้งสองแล็บใช้รัน สิ่งที่พูดได้โดยไม่ต้องกำกวมคือ บน benchmark นี้โดยเฉพาะ เมื่อวัดอย่างเป็นอิสระ GPT-6 Astra นำอยู่ — และนั่นก็คือ benchmark เพียงหนึ่งเดียว
จุดที่ Claude Fable 5.1 ล้ำหน้าอย่างแท้จริง
การเปรียบเทียบที่โมเดลหนึ่งชนะทุกแถวไม่ใช่การเปรียบเทียบ และการเปรียบเทียบนี้ไม่ได้มีหน้าตาเช่นนั้นเมื่ออ่านหลักฐานอิสระทั้งหมด บน Artificial Analysis Intelligence Index — ซึ่งเป็นดัชนีรวม ไม่ใช่แบบทดสอบเดี่ยวเพียงตัวเดียว — ทั้งสองรุ่นเสมอกันที่ 53 โดย Claude Fable 5.1 ถูกป้อนที่ค่าสูงสุดพร้อม fallback และ GPT-6 Astra ที่ความพยายามสูงสุด บทความของ AA เองก็บรรยายว่า Claude Fable 5.1 เสมอในอันดับหนึ่งกับ GPT-6 Astra ไม่ได้ตามหลัง บน Coding Agent Index ของ AA ทั้งสองก็อยู่ในระดับเดียวกันที่ 62 โดย GPT-6 Astra วัดในฮาร์เนส Codex และ Claude Fable 5.1 ใน Claude Code บนตัวชี้วัดแบบรวมสองตัวที่ครอบคลุมขอบเขตงานกว้างที่สุด ไม่มีอะไรที่ต่างกันระหว่างสองรุ่นนี้
ตัวเลขที่ Anthropic รายงานทำให้ Claude Fable 5.1 มีเหตุผลสนับสนุนของตัวเองอย่างแท้จริง และตัวเลขเหล่านี้เป็นตัวเลขที่ผู้ขายรายงานเอง ไม่ได้ถูกทำซ้ำโดยอิสระ: 65.0% บน Humanity's Last Exam เมื่อใช้เครื่องมือ (เทียบกับ 63.8% สำหรับ Claude Fable 5 และ 63.6% สำหรับ Claude Opus 5), 1,853 บน GDPval-AA v2, 73.4% บน CursorBench 3.2.0 และ 52.6% บน Terminal-Bench-Science 0.1 เทียบกับ 24.7% ของ Claude Fable 5 — รายการหลังสุดนี้เป็นการก้าวกระโดดข้ามรุ่นที่ใหญ่ที่สุดในตารางของ Anthropic และเป็นเบนช์มาร์กที่ OpenAI ไม่ได้เผยแพร่ตัวเลขที่เทียบเคียงได้ Anthropic ยังรายงาน OSWorld 2.0 ที่ 77.9% สำหรับ partial และ 41.7% สำหรับ strict ขณะที่ OpenAI รายงาน GPT-6 Astra ที่ 72.6% บน OSWorld 2.0 โดยไม่ได้ระบุว่าใช้รูปแบบใด ดังนั้นตัวเลขสองตัวนั้นจึงไม่อาจถือเป็นการเปรียบเทียบที่เทียบกันได้โดยตรง แม้ว่าจะระบุชื่อเบนช์มาร์กเดียวกัน
หลักฐานเชิงปฏิบัติการก็สนับสนุน Claude Fable 5.1 บนแพลตฟอร์มของเราเองเช่นกัน ในช่วงเจ็ดวันจนถึงวันที่ 16 กันยายน 2026 เอนด์พอยต์ OrcaRouter anthropic/claude-fable-5.1 วัดค่าได้ 90.0 โทเคนเอาต์พุตต่อวินาที ที่ p50 ของเวลาถึงโทเคนแรก 4.43 วินาที เทียบกับ 46.1 โทเคนต่อวินาที ที่ 6.71 วินาทีของ openai/gpt-6-astra — คิดเป็นอัตราการประมวลผลราวสองเท่า และโทเคนแรกก็เร็วกว่าอย่างเห็นได้ชัด ตัวเลขทั้งสองเป็นค่ามัธยฐานที่วัดโดยเราเตอร์ของเราเองในช่วงเจ็ดวัน และนักรายงานอิสระในช่วงสัปดาห์เปิดตัวมีความเห็นไม่ตรงกันเรื่องความหน่วงเชิงเปรียบเทียบ จึงควรมองว่านี่เป็นการวัดของแพลตฟอร์มเดียว ไม่ใช่ข้อเท็จจริงที่ยุติแล้ว ใบอัตราค่าบริการที่เผยแพร่ของ Anthropic ยังมีสิ่งที่ของ OpenAI ไม่มี นั่นคือคำมั่นเรื่องการเลิกให้บริการ โดยระบุว่า Claude Fable 5.1 ยังใช้งานอยู่และจะได้รับการสนับสนุนอย่างน้อยจนถึงวันที่ 1 กันยายน 2027 สำหรับใครก็ตามที่กำลังจัดทำแผนจัดซื้อจัดจ้างสองปี คำมั่นเรื่องวงจรชีวิตที่มีวันที่ชัดเจนมีค่ามากกว่าคะแนนเบนช์มาร์กหนึ่งจุด
ความปลอดภัยและพฤติกรรมการปฏิเสธ: ความแตกต่างที่แท้จริงและชัดเจนที่สุด
จุดที่โมเดลสองตัวนี้แตกต่างกันอย่างแท้จริงมากที่สุดไม่ใช่เบนช์มาร์ก และยังเป็นจุดที่มีหลักฐานอิสระน้อยที่สุดอีกด้วย OpenAI รายงานจากการประเมินภายในว่า GPT-6 Astra สร้างผลลัพธ์ที่ไม่ได้ตั้งใจ บ่อยน้อยกว่า 74.7%เมื่อเทียบกับ Claude Fable 5.1 และบ่อยน้อยกว่า GPT-5.6 Sol ของตัวเอง 89% ในการประเมินที่จำลองตามเหตุการณ์ Hugging Face OpenAI รายงานว่า GPT-5.6 Sol ที่ไม่มีมาตรการป้องกันสำหรับการใช้งานจริง เกินเป้าหมายที่ได้รับอนุญาตใน 48% ของกรณี ขณะที่ Astra ทำเช่นนั้นใน 0% ของกรณี นั่นคือตัวเลขของ OpenAI ที่ผลิตโดย OpenAI จากการประเมินที่ OpenAI ออกแบบ และยังไม่มีบุคคลที่สามรายใดทำซ้ำได้ มันเป็นข้อกล่าวอ้างที่หนักแน่นที่สุดในบทความนี้ และได้รับการตรวจสอบยืนยันน้อยที่สุด ซึ่งเป็นเหตุผลว่าทำไมการระบุที่มาจึงสำคัญ
ข้ออ้างเชิงโครงสร้างของ OpenAI อย่างน้อยก็ตรวจสอบเทียบกับตัวผลิตภัณฑ์ได้: GPT-6 Astra เป็นโมเดลแรกที่ไปถึงเกณฑ์ความสามารถด้านความมั่นคงไซเบอร์ระดับ Critical ภายใต้ Preparedness Framework ของ OpenAI และเมื่อเปิดให้ใช้งานจริง มันปฏิเสธงานไซเบอร์ขั้นสูง เช่น การเขียน exploit แบบ proof-of-concept OpenAI กล่าวว่ามีความตั้งใจจะขยายการเข้าถึงภายใต้มาตรการป้องกันที่ผ่อนปรนกว่า ผ่านโครงการ Daybreak ซึ่งหมายความว่าพฤติกรรมการปฏิเสธของโมเดลไม่ใช่คุณสมบัติตายตัว — แต่เป็นการตั้งค่านโยบายที่จะเปลี่ยนแปลงไป Anthropic รายงานการปรับปรุงในทิศทางตรงกันข้ามสำหรับ Claude Fable 5.1: ผลบวกลวงในงานไซเบอร์ลดลงประมาณ 60% และลดลงประมาณ 85% ในคำถามชีววิทยาพื้นฐานและการแพทย์ ทั้งสองตัวเลขเป็นข้อมูลที่ผู้ขายรายงานเอง ซึ่งเป็นข้ออ้างเรื่องการปฏิเสธน้อยลง ไม่ใช่ปฏิเสธมากขึ้น
Anthropic ยังเผยแพร่ต้นทุนของมาตรการป้องกันของตัวเองด้วย และนี่เป็นการเปิดเผยที่ผิดปกติอย่างแท้จริง เอกสารเปิดตัวระบุว่า Claude Fable 5.1 ถูกประเมินโดยเปิดมาตรการป้องกันแบบโปรดักชันไว้ และในจุดที่มาตรการป้องกันเข้าแทรกแซง Claude Fable 5.1 และ Claude Fable 5 ได้คะแนนศูนย์ใน OSWorld 2.0 กล่าวอีกนัยหนึ่ง ส่วนหนึ่งของช่องว่างที่วัดได้บนเบนช์มาร์กแบบเอเจนต์เกิดจากมาตรการป้องกันที่ทำงาน ไม่ใช่จากตัวโมเดลที่ล้มเหลว และผู้ขายก็บอกเช่นนั้น อ่านสองจุดยืนนี้คู่กันแล้วการแลกเปลี่ยนก็เป็นรูปธรรมชัดเจน: GPT-6 Astra ปฏิเสธโดยค่าเริ่มต้นมากกว่า และถูกจำกัดการเข้าถึงไว้หลังการควบคุมระดับองค์กร ขณะที่ Claude Fable 5.1 ถูกออกแบบมาให้ปฏิเสธเกินความจำเป็นน้อยลง และผู้ขายก็เผยแพร่ว่าการปฏิเสธที่เหลืออยู่นั้นทำให้คะแนนที่วัดได้ลดลงตรงไหนบ้าง ว่าอันไหนดีกว่านั้นขึ้นอยู่ทั้งหมดกับว่าคุณคือคนที่ถูกปฏิเสธหรือไม่

กระดานคะแนนที่ระบุว่า
• ราคาตามรายการ ระดับมาตรฐาน — GPT-6 Astra $10.00 อินพุต / $50.00 เอาต์พุต / $1.00 การอ่านจากแคช / $12.50 การเขียนแคช ต่อ 1M (เอกสาร OpenAI, อ่านเมื่อ 16 กันยายน 2026) Claude Fable 5.1 $10.00 / $50.00 / $0.25 การอ่านจากแคช / $12.50 การเขียนแคช ต่อ 1M (เอกสาร Anthropic, อ่านเมื่อ 16 กันยายน 2026) ตัวคูณสำหรับอินพุตและเอาต์พุต: 1.0 เท่า จุดที่ต่างกันเพียงอย่างเดียวคือการอ่านจากแคช ซึ่ง Claude Fable 5.1 ถูกกว่าถึงสี่เท่า
• บริบทขนาดยาว — GPT-6 Astra คิดราคาคำขอทั้งหมดใหม่เมื่อเกิน 272,000 โทเคนอินพุต: อินพุตและแคชเป็น 2 เท่า เอาต์พุตเป็น 1.5 เท่า ดังนั้น $20.00 / $75.00 โดยการอ่านแคชอยู่ที่ $2.00 ส่วน Claude Fable 5.1 ระบุว่าไม่มีค่าธรรมเนียมเพิ่มเติมสำหรับบริบทขนาดยาวบนหน้าต่าง 1M โทเคน
• ค่าใช้จ่ายต่องานที่ทำสำเร็จ (อิสระ) — GPT-6 Astra 3.26 ดอลลาร์ต่องาน Intelligence Index ที่ความพยายามสูงสุด และ 0.82 ดอลลาร์ที่ระดับต่ำ Claude Fable 5.1 อยู่ที่ 7.63 ดอลลาร์ที่ระดับสูงสุดเมื่อใช้ fallback GPT-6 Astra ต่ำกว่าประมาณ 57% ต่องานในการตั้งค่าที่เทียบเคียงกัน Artificial Analysis เผยแพร่เมื่อวันที่ 9 กันยายน 2026
• โทเคนต่องาน (อิสระ) — GPT-6 Astra ใช้โทเคนเอาต์พุต 27,000 โทเคนต่องานดัชนีที่ความพยายามสูงสุด ส่วน Claude Fable 5.1 ใช้ 78,000 โทเคนเพื่อให้ได้คะแนนเท่ากัน จาก Artificial Analysis บทความเดียวกัน เป็นเพียงข้อมูลเชิงทิศทางเท่านั้น เนื่องจากทั้งสองโมเดลไม่ได้ใช้โทเคไนเซอร์ตัวเดียวกัน
• Terminal-Bench 4.0 — ตามที่ผู้ขายรายงาน: GPT-6 Astra 57.9% และ Claude Fable 5.1 55.8% (OpenAI) โดย Anthropic ซึ่งเป็นอิสระจาก OpenAI ก็รายงานว่าโมเดลของตนเองได้ 55.8% เช่นกัน ผลทดสอบอิสระ: GPT-6 Astra 59% เทียบกับ Claude Fable 5.1 52% (Artificial Analysis, 9 กันยายน 2026)
• ปัญญาประกอบ (อิสระ) — เสมอกันที่ 53 บน Artificial Analysis Intelligence Index v4.3 ข้อมูล ณ วันที่ 16 กันยายน 2026 โดย Claude Fable 5.1 ตั้งค่าไว้ที่ระดับสูงสุดพร้อม fallback และ GPT-6 Astra ที่ความพยายามสูงสุด Coding Agent Index ก็อยู่ที่ระดับ 62 เช่นกัน
• กรณีที่ได้รับการยืนยันที่แข็งแกร่งที่สุดของ Claude Fable 5.1 (ตามที่ผู้จำหน่ายรายงาน) — Humanity's Last Exam 65.0% เมื่อใช้เครื่องมือ, GDPval-AA v2 1,853, CursorBench 3.2.0 73.4%, Terminal-Bench-Science 0.1 52.6% เทียบกับ 24.7% ของ Claude Fable 5, OSWorld 2.0 77.9% แบบบางส่วน / 41.7% แบบเข้มงวด Anthropic กันยายน 2026 OpenAI ไม่ได้เผยแพร่ตัวเลข Humanity's Last Exam หรือ Terminal-Bench-Science ที่เทียบเคียงได้สำหรับ GPT-6 Astra
• ความปลอดภัย (ตามที่ผู้ขายรายงาน ไม่ได้ทำซ้ำโดยอิสระ) — OpenAI รายงานว่า GPT-6 Astra สร้างผลลัพธ์ที่ไม่พึงประสงค์น้อยลง 74.7% เมื่อเทียบกับ Claude Fable 5.1 และน้อยลง 89% เมื่อเทียบกับ GPT-5.6 Sol Anthropic รายงานว่า Claude Fable 5.1 ลดผลบวกลวงด้านไซเบอร์ลงประมาณ 60% และลดผลบวกลวงด้านชีววิทยาพื้นฐานและการแพทย์ลงประมาณ 85% และระบุว่าในจุดที่มาตรการป้องกันของตนเข้าแทรกแซง โมเดลได้คะแนนเป็นศูนย์บน OSWorld 2.0
• ปริมาณงานที่วัดได้ (ตามที่เราเตอร์ระบุ) — Claude Fable 5.1 ทำได้ 90.0 โทเคนเอาต์พุตต่อวินาที โดยมีเวลาถึงโทเคนแรกที่ p50 เท่ากับ 4.43 วินาที; GPT-6 Astra ทำได้ 46.1 โทเคนต่อวินาที ที่ 6.71 วินาที ค่ามัธยฐานเจ็ดวันของ OrcaRouter ถึงวันที่ 16 กันยายน 2026 ส่วน Artificial Analysis วัดเวลา GPT-6 Astra แยกต่างหากได้ 52.9 โทเคนเอาต์พุตต่อวินาทีบนชุดทดสอบของตนเอง ดังนั้นทั้งความเร็วสัมบูรณ์และขนาดของช่องว่างจึงขึ้นอยู่กับว่าใครเป็นผู้วัด — ทิศทางสอดคล้องกัน แต่ขนาดไม่
ความพร้อมใช้งาน และกฎการเข้าถึงที่อาจเป็นตัวตัดสินก่อนที่การทดสอบประสิทธิภาพจะตัดสิน
ช่องทางการให้บริการทับซ้อนกันอย่างมาก แต่กฎการเข้าถึงกลับไม่ทับซ้อนกัน OpenAI เปิดตัว GPT-6 Astra ใน ChatGPT Work, Codex และ API ของตัวเอง โดย Microsoft Azure และ Foundry พร้อมใช้งานทั่วไปตั้งแต่วันที่ 3 กันยายน 2026 และ Amazon Bedrock พร้อมใช้งานทั่วไปตั้งแต่วันที่ 8 กันยายน 2026 บน ChatGPT Business และ Enterprise นั้น ปิดเป็นค่าเริ่มต้น — ผู้ดูแล workspace ต้องเปิดใช้งานภายใต้อัตราค่าบริการที่เกี่ยวข้องก่อนที่สมาชิกคนใดจะใช้งานได้ และการเข้าถึงจะให้ตามแต่ละช่องทาง ไม่ใช่แบบเหมารวม ดังนั้นแพ็กเกจที่มีโมเดลใน Codex อาจไม่มีโมเดลนั้นในตัวเลือกแชทมาตรฐาน OpenAI ระบุว่า Zero Data Retention พร้อมใช้งานสำหรับลูกค้า API ที่มีคุณสมบัติเหมาะสมบนเอนด์พอยต์ที่รองรับ โดยขึ้นอยู่กับการอนุมัติ และเอกสารช่วยเหลือของ OpenAI ได้รับการอัปเดตเมื่อวันที่ 14 กันยายน 2026 ด้วยเวอร์ชัน Codex CLI ขั้นต่ำที่จำเป็นเพื่อให้โมเดลปรากฏขึ้นได้
Anthropic เปิดตัว Claude Fable 5.1 บน Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry และ Claude Platform on AWS โดยโมเดลเดียวกันพร้อมให้ใช้ในแพ็กเกจ Pro, Max, Team และ Enterprise โมเดลนี้ถูกระบุว่าอยู่ในสถานะ active โดยมีวันปลดระวางไม่เร็วกว่า 1 กันยายน 2027 และไม่มีขั้นตอนการเลือกรับ (opt-in) ที่เทียบเท่าซึ่งมีการบันทึกไว้ — โมเดลนี้พร้อมใช้งานแทนที่จะถูกกั้นไว้ Claude Mythos 5.1 ซึ่งเป็นโมเดลพี่น้องกัน เป็นโมเดลพื้นฐานตัวเดียวกันแต่มีมาตรการป้องกันที่ต่างกัน โดยจำกัดเฉพาะผู้ได้รับเชิญสำหรับโปรแกรม Cyber Verification และ Life Sciences ของ Anthropic
• ความครอบคลุมของ Cloud — Claude Fable 5.1 อยู่บน Amazon Bedrock, Google Cloud, Microsoft Foundry และ Claude Platform บน AWS ส่วน GPT-6 Astra อยู่บน Microsoft Azure และ Foundry รวมถึง Amazon Bedrock Google Cloud คือช่องว่างตรงนั้น: หากการ inference ของคุณต้องรันบน Google Cloud หนึ่งในสองตัวนี้มีคำตอบ แต่อีกตัวไม่มี
• ค่าเริ่มต้นการเข้าถึง — โดยค่าเริ่มต้น GPT-6 Astra จะปิดอยู่สำหรับ Business และ Enterprise และต้องให้ผู้ดูแลระบบเป็นผู้เปิดใช้งานภายใต้อัตราค่าบริการที่กำหนด ส่วน Claude Fable 5.1 ไม่มีข้อกำหนดการเลือกเข้าร่วมที่ระบุไว้ในเอกสาร
• การจัดการข้อมูล — OpenAI ระบุว่ามี Zero Data Retention สำหรับลูกค้า API ที่มีคุณสมบัติเหมาะสมบนปลายทางที่รองรับ โดยขึ้นอยู่กับการอนุมัติ Anthropic ระบุถึงมาตรการป้องกันสำหรับองค์กรซึ่งมาพร้อมกับการไม่เก็บรักษาข้อมูล โดยจะเปิดให้ใช้ในฤดูใบไม้ร่วงปี 2026 ซึ่งหมายความว่ายังไม่พร้อมใช้งานในปัจจุบัน
• วงจรชีวิต — Claude Fable 5.1 มีคำมั่นเรื่องการเลิกให้บริการที่เผยแพร่ไว้แล้ว โดยจะไม่เร็วกว่า 1 กันยายน 2027 OpenAI ยังไม่ได้เผยแพร่คำมั่นที่มีกำหนดเวลาเทียบเท่าสำหรับ GPT-6 Astra

รันทั้งคู่ภายใต้คีย์เดียว
เนื่องจากบัตรราคาทั้งสองเหมือนกันที่ตัวเลขพาดหัว คำถามที่ทำให้ทีมต้องเสียเงินจริง ๆ จึงไม่ใช่รุ่นไหนถูกกว่า แต่คือการเปลี่ยนใจมีค่าใช้จ่ายแพงแค่ไหน ทั้งสองให้บริการบน OrcaRouter ในราคาตามที่ผู้ขายกำหนดเอง — openai/gpt-6-astra ที่ $10.00 ขาเข้าและ $50.00 ขาออก โดยใช้ระดับ long-context 272K ตามที่ OpenAI กำหนดไว้อย่างเคร่งครัด และ anthropic/claude-fable-5.1 ที่ $10.00 และ $50.00 โดยการอ่านแคชอยู่ที่ $0.25 — โดยทุกอัตรา ส่งต่อโดยไม่บวกเพิ่ม 0% ดังนั้นเมื่อผู้ขายเปลี่ยนราคา จะมีผลกับคีย์เดิมในวันเดียวกัน แทนที่จะต้องรอการย้ายระบบเรียกเก็บเงิน
เรื่องนี้สำคัญกับคู่นี้มากกว่าคู่อื่นๆ เพราะหลักฐานบ่งชี้ว่าคำตอบที่ถูกต้องคือการแยกกันมากกว่าการเลือกอย่างใดอย่างหนึ่ง ปริมาณการใช้งานแชทนั้นมีจริงบนปลายทางทั้งสองแห่ง — 180.7 ล้านโทเค็นถูกส่งไปยัง GPT-6 Astra ในช่วงเจ็ดวันจนถึงวันที่ 16 กันยายน 2026 และ 19.9 ล้านโทเค็นไปยัง Claude Fable 5.1 — และลักษณะของปริมาณงานที่เหมาะกับแต่ละตัวนั้นแตกต่างกันมากพอที่การกำหนดเส้นทางระหว่างทั้งสองจะเป็นการเปลี่ยนแปลงการตั้งค่ามากกว่าการตัดสินใจเชิงสถาปัตยกรรม DSL สำหรับกำหนดเส้นทางสามารถส่งลูปที่ทำงานยาวนานและใช้แคชหนักไปยัง Claude Fable 5.1 เพื่อการอ่านแคชที่ถูกกว่า 4 เท่า ในขณะที่งานสั้น ปริมาณสูง และมีประสิทธิภาพในการส่งออกไปยัง GPT-6 Astra และการรวมโมเดลสามารถนำทั้งสองมาช่วยกันแก้ปัญหาเดียวกันที่ยากได้ เมื่อคำตอบเดียวไม่ดีพอที่จะนำไปใช้งาน การสลับระบบโดยอัตโนมัติ (automatic failover) หมายความว่าการจำกัดอัตราบนเส้นทางใดเส้นทางหนึ่งเป็นเหตุการณ์การกำหนดเส้นทางมากกว่าการหยุดให้บริการ ซึ่งเป็นสิ่งที่ทำให้สมเหตุสมผลที่จะลองใช้ด้านที่ยังไม่พิสูจน์ของโมเดลแนวหน้าสุดใหม่บนเส้นทางโปรดักชัน
ใครควรเลือกอันไหน
เลือก GPT-6 Astra หากงานของคุณเป็นงานระยะยาวแบบครบวงจร — การเขียนโค้ดแบบเอเจนต์ การทำงานอัตโนมัติในเทอร์มินัล งานวิจัย หรืองานที่ใช้คอมพิวเตอร์ซึ่งดำเนินไปหลายขั้นตอน และมีค่าใช้จ่ายจากโทเคนที่ส่งออกมากกว่าโทเคนบริบท จากหลักฐานอิสระพบว่ามันทำงานประเมินเดียวกันจนสำเร็จโดยใช้โทเคนเอาต์พุตเพียงประมาณหนึ่งในสาม และมีต้นทุนถูกกว่าประมาณ 57% ต่องานที่ทำสำเร็จ อีกทั้งยังเป็นผู้นำใน Terminal-Bench 4.0 ทั้งจากการวัดของผู้จำหน่ายและการวัดอิสระ ให้จัดงบประมาณแบบต่องานแทนแบบต่อโทเคน และถือว่า 272,000 โทเคนอินพุตเป็นขอบเขตแข็ง: หากเกินกว่านั้น คำขอของโมเดลนี้จะถูกคิดราคาใหม่ตามกฎของผู้จำหน่ายเองสำหรับคำขอทั้งหมด
เลือก Claude Fable 5.1 หากเวิร์กโหลดของคุณอ่านคำนำหน้าที่คงที่ขนาดใหญ่ซ้ำ — system prompt ยาว ๆ, ที่เก็บโค้ด, ชุดเอกสาร — ในหลายรอบ เพราะการอ่านแคชที่ถูกกว่า 4 เท่าจะทบต้นในทุก ๆ ครั้ง และเลขคณิตข้างต้นแสดงให้เห็นว่ามันเปลี่ยนงานที่ราคา $5.70 ให้เป็น $1.95 มันยังเป็นตัวเลือกหากคุณต้องการปริมาณงานที่วัดได้สูงกว่าและโทเคนแรกที่เร็วกว่า หากการอนุมานของคุณต้องรันบน Google Cloud หรือหากคำมั่นเรื่องการเลิกใช้ที่มีกำหนดเวลามีความสำคัญต่อการจัดซื้อ มันอยู่ในระดับเดียวกับ GPT-6 Astra ในดัชนีรวมและในดัชนีเอเจนต์เขียนโค้ด และมันมีหลักฐานจากผู้ขายที่หนักแน่นกว่าใน Humanity's Last Exam, GDPval และ CursorBench — ซึ่งเป็นเบนช์มาร์กที่ OpenAI ไม่ได้เผยแพร่ตัวเลขที่เทียบเคียงได้ ดังนั้นให้ถือว่านั่นเป็นช่องว่างในหลักฐานมากกว่าจะเป็นชัยชนะที่พิสูจน์แล้ว
และคำตอบที่หน้าเปรียบเทียบต้องให้คุณเมื่อมันเป็นความจริง: สำหรับหลายทีม คำแนะนำที่ตรงไปตรงมาคือไม่ใช่ทั้งสองรุ่น เอกสารของ Anthropic เองสำหรับ Claude Fable 5.1 ระบุว่าสำหรับเวิร์กโหลดส่วนใหญ่ คุณควรเริ่มด้วย Claude Opus 5 และหันไปใช้ Fable 5.1 เฉพาะเมื่อการประเมินของคุณบน Opus 5 ที่ใช้ความพยายามสูงขึ้นยังคงไม่เพียงพอ Claude Opus 5 ราคาเข้า $5.00 และออก $25.00 — เป็นครึ่งหนึ่งของทั้งสองโมเดลนี้ในทั้งสองบรรทัด หากข้อได้เปรียบด้านการอ่านแคชสี่เท่า หรือประสิทธิภาพโทเค็นสามเท่าไม่ได้อธิบายเวิร์กโหลดของคุณ ส่วนเพิ่มราคาของรุ่นเรือธงกำลังซื้อความสามารถที่คุณยังไม่ได้พิสูจน์ว่าจำเป็น และวิธีที่ถูกที่สุดในการหาคำตอบคือส่งงานจริงผ่านทั้งสองรุ่นนี้และอีกรุ่นที่ต่ำลงหนึ่งระดับ ด้วยคีย์เดียว ก่อนตัดสินใจเลือกรุ่นใดรุ่นหนึ่ง
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
