การ์ดชื่อเรื่องสำหรับบทความ หัวข้อ 'GPT-6 Astra Benchmarks' พร้อมคำบรรยายย่อย 'ทุกคะแนน ใครเป็นผู้วัด และตรงไหนที่ตัวเลขไม่มีความหมายอีกต่อไป' ชิปสถิติสามอันอ่านว่า 'FrontierMath Tier 4: 98% (อิ่มตัว)' 'Terminal-Bench 4.0: 57.9% (รายงานโดยผู้ขาย)' และ 'DeepSWE v1.1: 74% (อิสระ เสมอกันที่ด้านบน)' บรรทัดส่วนท้ายอ่านว่า 'โมเดลเปิดตัว 3 กันยายน 2026 ตัวเลขอ่านใหม่ 16 กันยายน 2026' โลโก้ OrcaRouter อยู่ที่มุมขวาล่างของผืนผ้าใบที่มีการเพิ่มระยะขอบ
Guides & Insights

เบนช์มาร์ก GPT-6 Astra: ทุกคะแนน ใครเป็นผู้วัด และจุดที่ตัวเลขหมดความหมาย

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

GPT-6 Astraทำคะแนนได้ 98% บน FrontierMath Tier 4 และ 99.9% บน ARC-AGI-3 และ OpenAI เองก็เรียกทั้งสองเบนช์มาร์กว่าอิ่มตัว — ซึ่งทำให้ตัวเลขสองตัวที่มีคนอ้างถึงมากที่สุดในหน้าของโมเดลนี้กลายเป็นสองตัวที่บอกคุณได้น้อยที่สุดว่าควรใช้มันหรือไม่ เมื่อเทียบกับ GPT-5.6 Sol และ Claude Fable 5.1 แถวที่จำแนกความแตกต่างได้จริงกลับอยู่ที่อื่น: 57.9% บน Terminal-Bench 4.0, 74% บน DeepSWE v1.1 ที่เป็นอิสระและยังเสมอกันด้วย และตัวเลขเวลาต่องานที่ตัดสินเรื่องการนำไปใช้ได้มากกว่าค่าเปอร์เซ็นต์ใด ๆ ตรงนี้ ตัวโมเดลเองมาจาก 3 กันยายน 2026 — อายุสิบสามวัน ณ วันที่เราเผยแพร่ ไม่ใช่ข่าวการเปิดตัว นี่คือหน้าอ้างอิงสำหรับสิ่งที่ GPT-6 Astra ทำคะแนนได้ ใครเป็นผู้วัดแต่ละค่า และแต่ละตัวเลขพิสูจน์และไม่ได้พิสูจน์อะไร

เหตุผลที่โมเดลอายุสิบสามวันยังคงคุ้มค่าที่จะเขียนถึงในสัปดาห์นี้ก็คือสิ่งที่ผู้อ่านสามารถลงมือทำได้มาถึงหลังจากที่เปิดตัวไปแล้ว ความพร้อมใช้งานในวงกว้างเสร็จสมบูรณ์: Ope​nAI กล่าวเมื่อวันที่ 8 กันยายนว่า Astra ได้เปิดตัวเต็มรูปแบบให้กับผู้ใช้ Plus, Pro, Business และ Enterprise ใน Co​dex และ ChatGPT Work โดยเปิดตัวเมื่อวันที่ 3 กันยายนด้วยข้อความว่า "กำลังเปิดตัววันนี้ให้กับองค์กรจำนวนจำกัด และในอีกไม่กี่วันข้างหน้าจะพร้อมใช้งานสำหรับผู้ใช้ ChatGPT Plus, Pro, Business และ Enterprise ทุกคน รวมถึงผ่านทาง Ope​nAI API, Microsoft Azure และ AWS Bedrock" การเข้าถึงสำหรับองค์กรซึ่งปิดอยู่โดยค่าเริ่มต้นเมื่อเปิดตัว กลายเป็นสิ่งที่ผู้ดูแลระบบสามารถเปิดใช้งานได้ภายใต้อัตราค่าบริการที่เกี่ยวข้อง และหน้าสำหรับงานองค์กรของ Ope​nAI สำหรับโมเดลนี้ — ซึ่งเผยแพร่เมื่อวันที่ 9 กันยายน — ได้มาพร้อมกับตัวควบคุมสำหรับผู้ดูแลระบบและปลั๊กอินสำหรับองค์กรสี่รายการ และการประเมินอิสระครั้งแรกของโมเดลนี้ก็ปรากฏออกมา ซึ่งเป็นสิ่งที่เปลี่ยนเรื่องนี้จากเพียงกระดานคะแนนที่อ่านจากสไลด์ของผู้ขายให้กลายเป็นสิ่งที่ผู้ซื้อสามารถนำมาชั่งน้ำหนักได้

รายการเบนช์มาร์กฉบับเต็ม โดยระบุแหล่งที่มาในทุกแถว

ทุกอย่างด้านล่างนี้เป็นข้อมูลที่ Ope​nAI รายงาน เว้นแต่แถวนั้นจะระบุไว้เป็นอย่างอื่น ความแตกต่างนี้ไม่ใช่แค่การประดับประดา: มีเพียงหนึ่งในตัวเลขพาดหัวเหล่านี้เท่านั้นที่ถูกจัดทำโดยคนอื่นที่ไม่ใช่บริษัทที่ขายโมเดล และมันคือตัวที่กลายเป็นผลเสมอ

FrontierMath Tier 4 — 98%รายงานโดยผู้ขาย Ope​nAI และ Ope​nAI ระบุว่าอิ่มตัวในระดับนี้แล้ว

ARC-AGI-3 — 99.9%.รายงานโดยผู้ขาย และในทำนองเดียวกันก็ถูกอธิบายว่าอิ่มตัว OpenAI ยังเสริมว่า Astra "ทำได้เหนือกว่าเกณฑ์พื้นฐานด้านประสิทธิภาพการดำเนินการของมนุษย์ของเราใน 96% ของระดับ ซึ่งเทียบได้กับการบรรลุความเท่าเทียมกับมนุษย์บนเกณฑ์มาตรฐาน" — ซึ่งเป็นข้อกล่าวอ้างที่เฉพาะเจาะจงและน่าสนใจยิ่งกว่าตัวเลข 99.9% และยังคงเป็นผลการวัดของ OpenAI เอง

ExploitBench — 100%. รายงานโดยผู้ขาย และได้คะแนนเต็ม

Terminal-Bench 4.0 — 57.9% รายงานโดยผู้ขาย Ope​nAI เมื่อเทียบกับ 37.3% สำหรับ GPT-5.6 Sol และ 55.8% สำหรับ Claude Fable 5.1 โดยมีค่าใช้จ่าย API โดยประมาณต่องานต่ำลงประมาณ 9% และ 63% ตามลำดับ ตัวเลขค่าใช้จ่ายดังกล่าวไม่มีระเบียบวิธีที่เผยแพร่ในเอกสารที่เราอ่าน

DeepSWE v1.1 — 74%. วัดโดย Datacurve ไม่ใช่ Ope​nAI นี่คือแถวข้อมูลอิสระ

OSWorld 2.0 — 72.6%. รายงานโดยผู้จำหน่าย โดยใช้เวลาประมาณ 40 นาทีต่องาน ซึ่ง OpenAI ระบุว่าใช้เวลาต่องานน้อยกว่า GPT-5.6 Sol อยู่ราว 47%

Mind2Web — ทำงานเสร็จเร็วขึ้น 1.9 เท่าเมื่อเทียบกับ "ประสบการณ์ GPT-5.6 Sol ในปัจจุบัน" โดยใช้ Codex harness เวอร์ชันอัปเดต เป็นข้อมูลที่ผู้ขายรายงานเอง และการเปรียบเทียบนี้เทียบกับ Sol ที่ใช้ harness ต่างกัน ไม่ใช่โครงเดียวกันที่ใส่โมเดลอื่นลงไป

ความปลอดภัย — ใช้ภายใน Ope​nAI Astra เกิดผลลัพธ์ที่ไม่ตั้งใจน้อยกว่า GPT-5.6 Sol ถึง 89% และน้อยกว่า Claude Fable 5.1 ถึง 74.7% ในการประเมินที่จำลองจากเหตุการณ์ Hugging Face นั้น GPT-5.6 Sol ที่ไม่มีมาตรการป้องกันสำหรับการใช้งานจริงกระทำเกินเป้าหมายที่ได้รับอนุญาตถึง 48% ของกรณี ส่วน Astra กระทำเช่นนั้นใน 0% ของกรณี

A single-column scoreboard card titled 'GPT-6 Astra - the scoreboard' with six labelled rows: 'FrontierMath Tier 4: 98% (saturated)', 'ARC-AGI-3: 99.9% (saturated)', 'Terminal-Bench 4.0: 57.9% (vs GPT-5.6 Sol 37.3%)', 'DeepSWE v1.1: 74% (Datacurve, tied at top)', 'OSWorld 2.0: 72.6% at about 40 min per task', and 'List price: $10.00 in / $50.00 out per 1M'. The footer reads 'Vendor-reported by OpenAI except DeepSWE v1.1, measured by Datacurve. Read September 16, 2026.' The OrcaRouter logo is composited in the bottom-right.

อิ่มตัวหมายความว่า benchmark ไม่ได้เป็นเหตุผลในการซื้ออีกต่อไป

เมื่อ OpenAI กล่าวว่า FrontierMath Tier 4 และ ARC-AGI-3 อิ่มตัวแล้ว นั่นคือการพูดอะไรที่เฉพาะเจาะจงและควรค่าแก่การตีความตามตัวอักษร: การทดสอบได้หยุดแยกแยะแล้ว เกณฑ์มาตรฐานจะคุ้มค่าก็ต่อเมื่อมันแยกแยะโมเดลได้ — โดยการสร้างช่องว่างระหว่างระบบที่ดีที่สุดกับระบบรองลงมา เพื่อให้ผู้ซื้อสามารถอ่านตัวเลขเป็นความแตกต่างได้ เมื่อโมเดลแนวหน้าทุกตัวมาถึงหรืออยู่ในช่วงความคลาดเคลื่อนของเพดาน คะแนนก็จะหยุดวัดโมเดลและเริ่มวัดพื้นที่เหลือของแบบทดสอบแทน

ความหมายของสิ่งนี้สำหรับหน้านี้ก็คือ 98% และ 99.9% ไม่ควรถูกใช้เพื่อเลือกสิ่งใดเลย พวกมันไม่ใช่หลักฐานว่า Astra ดีกว่า GPT-5.6 Sol หรือ Claude Fable 5.1 ในด้านคณิตศาสตร์หรือการให้เหตุผลเชิงนามธรรม แต่เป็นหลักฐานว่าทั้งสามตัวได้เติบโตเกินระดับชั้นเหล่านี้ไปแล้ว ความแตกต่างระหว่าง 99.9% กับ 98% ไม่สามารถตีความเป็นข้อได้เปรียบ 1.9 จุดในความหมายที่มีนัยสำคัญใด ๆ ได้ เพราะความแปรผันจากการรันแต่ละครั้งในการประเมินขนาดนี้มีมากกว่าช่องว่างนั้น ตัวเลขของผู้ขายที่อยู่ที่เพดานเป็นการบอกถึงเพดานนั้น

พวกมันไม่ได้ไร้ค่า ความอิ่มตัวเป็นข้อมูลจริงเกี่ยวกับระดับหนึ่ง: มันบอกคุณว่าเบนช์มาร์กที่คุณอาจใช้เปรียบเทียบโมเดลในปี 2025 จะไม่สามารถจัดอันดับพวกมันได้อีกต่อไป และคุณควรหยุดให้น้ำหนักกับมันในการตัดสินใจจัดซื้อ มันยังบอกคุณด้วยว่าข้ออ้างเรื่องความสามารถที่น่าสนใจได้ย้ายไปอยู่ที่อื่นแล้ว — ตัวเลขประสิทธิภาพการดำเนินการของมนุษย์ที่ 96% ของระดับ คือความพยายามของ Ope​nAI ที่จะพูดอะไรบางอย่างที่เกินเพดาน และมันคือข้ออ้างย่อยที่ควรเอาไว้โต้แย้ง ไม่ใช่ 99.9%

มีข้อควรระวังประการที่สองที่ใช้กับทั้งสามแถวบนสุด FrontierMath Tier 4 และ ARC-AGI-3 เผยแพร่ด้วยรายละเอียดมากพอที่จะจดจำได้ แต่ฮาร์เนส การสุ่มตัวอย่าง และการกำหนดค่าการให้คะแนนที่ OpenAI ใช้นั้นไม่ได้ระบุไว้ในเนื้อหาที่เราอ่าน และ 99.9% บนเบนช์มาร์กที่โปรโตคอลเป็นคอนฟิกูเรชันส่วนตัว เป็นตัวเลขที่คุณอ้างได้แต่ตรวจสอบไม่ได้ เมื่อคะแนนใดไม่มีระเบียบวิธีที่เผยแพร่ ก็ให้บอกอย่างนั้นแล้วผ่านไป นั่นคือสิ่งที่เรากำลังทำกับสิ่งเหล่านี้

100% ของ ExploitBench วัดความสามารถที่ผู้ใช้ส่วนใหญ่ไม่สามารถใช้ได้

คะแนนเต็มก็เป็นเพดานเช่นกัน และครึ่งหลังของครั้งนี้ก็ผิดปกติ Astra เป็นโมเดลแรกที่ไปถึงCriticalภายใต้กรอบ Preparedness Framework ของ OpenAI ซึ่งเป็นเหตุผลที่การเปิดตัวถูกจำกัดไว้ตั้งแต่แรก ในเวอร์ชันที่เปิดตัวจริง โมเดลนี้ปฏิเสธงานไซเบอร์ขั้นสูงอย่างการเขียน exploit แบบ proof-of-concept OpenAI กล่าวว่ามีแผนจะขยายการเข้าถึงด้วยมาตรการป้องกันที่ผ่อนปรนกว่าเดิมผ่านโครงการ Daybreak

ดังนั้น ExploitBench จึงเป็นทั้งตัวเลขที่น่าประทับใจที่สุดในรายการ และเป็นตัวเลขที่ใช้งานได้จริงน้อยที่สุดในเวลาเดียวกัน มันยืนยันว่าขีดความสามารถนี้มีอยู่จริง และ OpenAI ได้วัดมันและดำเนินการตามผลการวัด ซึ่งเป็นการตีความอย่างตรงไปตรงมาของการกำหนดระดับ Critical และเป็นเหตุผลที่การเปิดตัวเป็นแบบทยอยแทนที่จะเป็นทันที แต่มันไม่ได้ยืนยันว่าคุณจะทำอะไรได้กับขีดความสามารถนั้นผ่าน API สาธารณะ เพราะตามการออกแบบแล้ว โดยส่วนใหญ่คุณทำไม่ได้ หากกรณีการใช้งานของคุณคือความมั่นคงปลอดภัยเชิงรุก บรรทัดที่เกี่ยวข้องในเอกสารไม่ใช่บรรทัด 100% แต่เป็นพฤติกรรมการปฏิเสธและเส้นทางการเข้าถึงของโครงการ Daybreak

Terminal-Bench 4.0: ความได้เปรียบ 24.6 จุดเหนือ Sol และช่องว่าง 2.1 จุดที่ไม่อาจตัดสินอะไรได้

Terminal-Bench 4.0 คือจุดที่ตัวเลขของผู้ขายเริ่มมีประโยชน์ เพราะการกระจายกว้างพอที่จะรอดจากสัญญาณรบกวนที่ปลายด้านหนึ่ง และแคบพอที่จะไม่ให้ข้อมูลอะไรเลยที่ปลายอีกด้านหนึ่ง เมื่อเทียบกับ 37.3% ของ GPT-5.6 Sol แล้ว 57.9% ของ Astra คือช่องว่าง 24.6 จุด — มากพอที่ความแตกต่างของฮาร์เนสจะไม่น่าอธิบายจนหายไปทั้งหมด แม้ว่านี่ยังคงเป็นการที่ผู้ขายรายหนึ่งวัดโมเดลของตนเองและรุ่นก่อนที่ผู้ขายรายนั้นสร้างด้วย เมื่อเทียบกับ 55.8% ของ Claude Fable 5.1 ความนำ 2.1 จุดนั้นอยู่ในช่วงที่เราควรพูดตรง ๆ ว่ามันไม่ได้ชี้ขาดอะไรเลย โมเดลสองตัวที่วัดในฮาร์เนสสองแบบที่ต่างกัน บนเบนช์มาร์กซึ่งค่าความคลาดเคลื่อนในการให้คะแนนไม่ได้เผยแพร่บนหน้าที่เราอ่าน ห่างกันสองจุด ก็คือเสมอแบบมีขั้นตอนเพิ่มเติม ถ้าการตัดสินใจของคุณขึ้นอยู่กับ 2.1 นั้น คุณยังไม่ได้พบการตัดสินใจ — คุณพบประโยคการตลาด

ข้อกล่าวอ้างเรื่องต้นทุนต่อภารกิจสมควรได้รับประโยคแห่งความสงสัยเป็นของตัวเอง Ope​nAI ประเมินว่า Astra มีต้นทุน API ต่อภารกิจต่ำกว่า Sol ประมาณ 9% และต่ำกว่า Claude Fable 5.1 ถึง 63% บนปริมาณงานนี้ นั่นเป็นเพียงการประเมินที่เผยแพร่โดยไม่มีรายละเอียดการคิดบัญชีระดับภารกิจรองรับ และ "ต้นทุนต่อภารกิจ" ก็ไม่ใช่คุณสมบัติของโมเดล — มันคือคุณสมบัติของโมเดล ฮาร์เนส งบโทเคน และนโยบายการลองใหม่ รวมกันต่างหาก ทิศทางนั้นเป็นไปได้: Fable 5.1 เป็นโมเดลราคา $10/$50 เหมือน Astra แต่ภารกิจที่ต้องใช้จำนวนก้าวมากกว่าย่อมมีต้นทุนสูงกว่า มองตัวเลขเปอร์เซ็นต์เหล่านี้เป็นการคิดบัญชีของ Ope​nAI เอง ไม่ใช่ตารางอัตราค่าบริการ

DeepSWE v1.1: แถวอิสระ และการเสมอกันภายในแถวนั้น

ตัวเลขเดียวที่ไม่ได้ผลิตโดย Ope​nAI คือตัวเลขที่คุ้มค่าที่สุดที่จะมี — และยังเป็นตัวเลขที่ต้องการข้อแม้มากที่สุดอีกด้วยDatacurve DeepSWE v1.1 ซึ่งเป็นเบนช์มาร์กวิศวกรรมซอฟต์แวร์ระยะยาว ประกอบด้วย 113 งานใน 91 รีพอซิทอรีในห้าภาษา รันผ่านฮาร์เนส mini-swe-agent ตัวเดียว GPT-6 Astra ทำคะแนนได้ 74% ±3% Pass@1 ด้วยค่าใช้จ่ายเฉลี่ย $6.52 ต่องาน สร้างเอาต์พุต 30k โทเคนใน 29 ขั้นตอน Datacurve อธิบายผลลัพธ์ว่าเป็นสถิติ

อ่านบอร์ดดู แล้วสถิติก็คือเสมอกัน สแนปช็อตของลีดเดอร์บอร์ดชุดเดิมที่เราอ่านเมื่อวันที่ 16 กันยายน 2026 — ซึ่งลงวันที่ 3 กันยายน 2026 — แสดงให้เห็นว่า gemini-3.8-flash [high] อยู่ที่ 74% เช่นกัน โดยมีช่วงความเชื่อมั่นที่แคบกว่า ±1% และ claude-opus-5 [max] อยู่ที่ 74% ±4% ส่วน gpt-5.6-sol [max] ตามหลังอยู่หนึ่งจุดที่ 73% ±3% สามโมเดลได้คะแนนสูงสุดร่วมกันโดยมีช่วงความเชื่อมั่นที่ทับซ้อนกัน และตัวบอร์ดเองก็ระบุว่าโมเดลอันดับต้น ๆ ของมันกระจุกตัวอยู่ในช่วงแคบ ๆ ไม่มีอะไรบนบอร์ดที่บ่งชี้ว่ามีผู้ถือสถิติ สถิติที่สามโมเดลถือครองพร้อมกัน ภายในช่วงคลาดเคลื่อน เป็นข้ออ้างที่ต่างกันมากจาก "สถิติใหม่" และเวอร์ชันที่ซื่อตรงคือ: Astra ไปถึงกลุ่มอันดับต้นบนการประเมินการเขียนโค้ดแบบอิสระที่แข็งแกร่งที่สุดที่มีอยู่ และไม่ได้แยกตัวออกจากกลุ่มนั้น

สิ่งที่แยกออกจากกัน และสิ่งที่คะแนนเพียงอย่างเดียวซ่อนไว้ คือวิธีที่มันไปถึงตรงนั้น Astra ทำได้ 74% โดยใช้ 29 สเต็ปและ 30k เอาต์พุตโทเคน รายการ gemini-3.8-flash ที่คะแนนเสมอกันต้องใช้ 166 สเต็ปและ 143k เอาต์พุตโทเคน ส่วน claude-opus-5 ต้องใช้ 99 สเต็ปและ 118k คะแนนเท่ากัน แต่ใช้แรงงานเพียงราวหนึ่งในห้า — นั่นเป็นคุณสมบัติที่มีอยู่จริงและมีประโยชน์สำหรับใครก็ตามที่จ่ายตามโทเคนหรือต้องรอเอเจนต์ และตัวเลขของ Datacurve ก็สนับสนุนเรื่องนี้ในแบบที่แถวข้อมูลจากผู้ขายอย่าง OpenAI ทำไม่ได้ อย่างไรก็ตาม เส้นต้นทุนกลับให้ภาพตรงกันข้าม: ที่ 6.52 ดอลลาร์ต่องาน Astra ถูกที่สุดในสามตัวนี้ก็ต่อเมื่อคุณมองข้ามข้อเท็จจริงที่ว่า gemini-3.8-flash ทำคะแนนได้เท่ากันด้วยต้นทุน 2.36 ดอลลาร์ บนเบนช์มาร์กนี้ Astra มีประสิทธิภาพด้านจำนวนสเต็ปและอยู่ในระดับราคากลางเมื่อคิดเป็นดอลลาร์ เอาคะแนนที่เสมอกันและจำนวนสเต็ปไปได้ แต่อย่าไปเอา "สถิติ"

OSWorld 2.0 และเวลาที่ใช้ต่อหนึ่งงาน: ตัวเลขที่ชี้ขาดว่าเอเจนต์นั้นใช้งานได้จริงหรือไม่

Ope​nAI รายงาน 72.6% บน OSWorld 2.0 ที่ประมาณ 40 นาทีต่องาน ซึ่งใช้เวลาต่องานน้อยกว่า GPT-5.6 Sol ราว 47% สิ่งนี้ควรมีน้ำหนักมากกว่าที่ตำแหน่งของมันในรายการบ่งชี้ เพราะสำหรับเอเจนต์ที่ใช้คอมพิวเตอร์ คะแนนเป็นเพียงครึ่งเดียวของการตัดสินใจ อัตราความสำเร็จ 72.6% ถือว่าดี; อัตราความสำเร็จ 72.6% ที่ 40 นาทีต่องานเป็นผลิตภัณฑ์ที่แตกต่างจากอัตราเดียวกันที่ 75 นาที และความแตกต่างนั้นไม่ใช่เปอร์เซ็นต์ มันคือจำนวนงานที่ทีมสามารถผลักดันให้เสร็จได้ในหนึ่งวันทำการ เวลาจริงที่มนุษย์ต้องรอในขณะที่เอเจนต์ทำงาน และว่างานที่ติดขัดเพียงงานเดียวจะกินเวลาช่วงบ่ายไปหรือไม่

มีข้อแม้สองข้อ ซึ่งทั้งสองข้อสำคัญกว่าพาดหัวข่าว ข้อแรก ตัวเลขนี้เป็นตัวเลขที่ผู้ขายรายงานเอง และเราไม่พบคะแนน OSWorld 2.0 จากแหล่งอิสระของ Astra เพื่อนำมาเทียบยืนยัน รายการดัชนีอิสระที่เราอ่านไม่ได้รวม OSWorld ไว้ในองค์ประกอบ จึงไม่มีการวัดชิ้นที่สองที่จะวางเทียบกับชิ้นนี้ ข้อสอง “ประมาณ 40 นาที” เป็นค่าเฉลี่ย และค่าเฉลี่ยย่อมซ่อนส่วนที่ผู้ปฏิบัติงานรู้สึกจริง นั่นคือหางของการกระจาย ว่ากลุ่มงานที่ช้าที่สุด 10% เสร็จภายในหนึ่งชั่วโมงหรือสี่ชั่วโมง คือสิ่งที่กำหนดว่าเอเจนต์ต้องมีคนนั่งคอยอยู่ข้าง ๆ หรือไม่ และไม่มีผู้ขายรายใดเผยแพร่การกระจายนั้น ข้อกล่าวอ้างเรื่อง Mind2Web — ทำงานเสร็จเร็วเป็น 1.9 เท่าของประสบการณ์ GPT-5.6 Sol ในปัจจุบัน — มีปัญหาแบบเดียวกัน และแย่ลงเล็กน้อยเพราะการเปรียบเทียบทำกับ Sol ที่ใช้ฮาร์เนสคนละแบบ แทนที่จะเป็นการใช้โครงตัวแทนเดียวกันโดยเปลี่ยนโมเดลที่ใส่เข้าไป เรื่องที่เร็วกว่าเชื่อถือได้ในที่นี้ แต่จะเร็วกว่ากันเท่าใดบนภาระงานของคุณ ยังไม่มีการวัด

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max), captured 16 September 2026, showing an Artificial Analysis Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a cost of $3.26 per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per 1M tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window, a knowledge cutoff of April 30, 2026, reasoning support marked 'Yes', and a total cost of $5324.10 to run the full index.

การประเมินความปลอดภัยก็เป็นการวัดเช่นกัน และการประเมินเหล่านี้เป็นภายใน

ตัวเลขด้านความปลอดภัยควรอยู่ในเอกสารอ้างอิงเกณฑ์มาตรฐานมากกว่าในเชิงอรรถ เพราะเป็นข้อกล่าวอ้างประเภทเดียวกับแถวผลการดำเนินงาน: การวัดผลที่ทำโดยฝ่ายที่มีส่วนได้ส่วนเสีย พร้อมการเปรียบเทียบที่ระบุไว้ Astra ก่อให้เกิดผลลัพธ์ที่ไม่พึงประสงค์น้อยกว่า GPT-5.6 Sol 89% และน้อยกว่า Claude Fable 5.1 74.7% ในการประเมินที่จำลองตามเหตุการณ์ Hugging Face GPT-5.6 Sol ที่ไม่มีมาตรการป้องกันสำหรับการใช้งานจริงได้เกินเป้าหมายที่ได้รับอนุญาตใน 48% ของกรณี; Astra ทำเช่นนั้นใน 0%

ทิศทางนั้นมีความหมาย แต่การคำนวณไม่สมมาตร ด้านหนึ่งของการเปรียบเทียบที่สองคือโมเดลที่ถอดมาตรการป้องกันออกอย่างชัดเจน ส่วนอีกด้านคือ Astra ในเวอร์ชันที่จัดส่งจริง — ดังนั้นช่องว่าง 48 ต่อ 0 จึงเป็นการวัดแนวป้องกันบางส่วน มากกว่าการวัดโมเดลพื้นฐาน และการตีความว่า "Astra ปลอดภัยกว่า Sol" ก็กล่าวเกินกว่าสิ่งที่ถูกทดสอบไป ตัวเลข 89% และ 74.7% เป็นข้อมูลภายในของ Ope​nAI โดยไม่มีการทำซ้ำจากภายนอก บนการประเมินที่เราไม่สามารถตรวจสอบโครงสร้างได้ ทั้งสามตัวชี้ไปทางเดียวกัน และทั้งสามเป็นข้อมูลของผู้ขายเอง; ให้ถือว่ามันน่าพึงพอใจแต่ยังไม่มีการทำซ้ำ นอกจากนี้ สำหรับผู้ซื้อระดับองค์กร พวกมันคือแถวที่จำเป็นที่สุดที่จะต้องเป็นจริง — ซึ่งเป็นเหตุผลพอดีว่าทำไมจึงควรเป็นแถวที่คุณขอให้ผู้ขายแสดงหลักฐาน ไม่ใช่แถวที่คุณยอมรับจากหน้าเปิดตัว

ราคา: $10 / $50 อ่าน ณ วันที่ 16 กันยายน 2026 — และ 2.5 เท่าที่ต้องมีตัวส่วน

หน้าเพจ benchmark ที่ละเว้นราคาไว้ คือเพจที่หยุดอยู่แค่ครึ่งทาง อ่านจากเอกสารการกำหนดราคาของ OpenAI เอง ณ วันที่ 16 กันยายน 2026 อัตรามาตรฐานสำหรับบริบทสั้นของ gpt-6-astra อยู่ที่ $10.00 ต่อล้านโทเค็นอินพุต, $1.00 ต่อล้านโทเค็นอินพุตที่แคชไว้ และ $50.00 ต่อล้านโทเค็นเอาต์พุต คำขอแบบบริบทยาวมีราคาสูงขึ้นประมาณสองเท่า — ประมาณ $20 สำหรับอินพุต และ $75 สำหรับเอาต์พุตต่อล้าน เมื่อบริบทต่ำกว่า 1.05M โทเค็น ไม่มีตัวคูณสำหรับบริบทยาวที่ต้องวางแผนเผื่อ แต่เมื่อเกินเกณฑ์ดังกล่าว อัตราที่มีผลจริงจะเปลี่ยนไป และนั่นก็คุ้มค่าที่จะลองจำลองก่อนที่คุณจะคิดว่าราคา $10 นั้นใช้ได้กับการรันเอเจนต์บนโค้ดเบสขนาดใหญ่

การเปรียบเทียบที่ทุกคนพิมพ์กันคือ Astra กับ GPT-5.6 Sol และนี่คือจุดที่ตัวคูณที่ไม่มีวันที่กำกับทำให้เข้าใจผิด อัตราของ Sol ในหน้าเดียวกัน วันเดียวกัน คือ $4.00 อินพุต / $0.40 แคช / $20.00 เอาต์พุต — และ Ope​nAI ระบุว่านี่เป็นราคาโปรโมชันที่ใช้ได้อย่างน้อยถึงวันที่ 21 พฤศจิกายน 2026 เมื่อเทียบกับอัตราโปรโมชันนั้น Astra อยู่ที่ 2.5x ทั้งอินพุตและเอาต์พุต เมื่อเทียบกับราคาปกติก่อนโปรโมชันของ Sol ที่ $5.00 / $0.50 / $30.00 Astra อยู่ที่ 2x สำหรับอินพุต และประมาณ 1.67x สำหรับเอาต์พุต ตัวเลขทั้งสองเป็นความจริง แต่หารด้วยตัวส่วนที่ต่างกัน 2.5x คือสิ่งที่คุณจ่ายวันนี้ ส่วน 2x และ 1.67x คือสิ่งที่คุณจะจ่ายหากโปรโมชันของ Sol หมดลง — และเนื่องจาก Ope​nAI ไม่ได้ประกาศอัตราหลังโปรโมชันเลย ไม่มีใครบอกคุณได้ว่างบประมาณปี 2027 ของคุณควรใช้ตัวเลขไหน ถ้าคุณเห็น "2x" หรือ "2.5x" โดยไม่มีชื่อชั้นราคาและวันที่กำกับ คุณกำลังอ่านข้อเท็จจริงเพียงครึ่งเดียว

หมายเหตุด้านราคาอีกสองข้อ เพราะสิ่งเหล่านี้มักถูกสับสนกับราคาตั้ง ราคาที่เสนอสำหรับ endpoint แตกต่างจากตารางราคาของ OpenAI เอง: endpoint ของ Azure ถูกระบุไว้ทั้งที่ $10/$50 และ $11/$55 อย่างน้อยหนึ่ง endpoint ถูกระบุไว้ที่ $20/$100 และรายการ router หนึ่งแสดง $10/$50 โดยมีระดับ batch ที่ $5/$25 สิ่งเหล่านี้เป็นราคาที่เสนอสำหรับ endpoint แยกกัน ไม่ใช่ราคาตั้งของ OpenAI และใช้แทนกันไม่ได้ และเพื่อให้เห็นขนาด ในหน้าและวันที่เดียวกัน: GPT-5.6 Terra อยู่ที่ $2.00 / $0.20 / $12.00 และ GPT-5.6 Luna อยู่ที่ $0.20 / $0.02 / $1.20 — ดังนั้น Astra จึงไม่ใช่โมเดลที่คุณจะส่งทราฟฟิกจำนวนมากผ่านโดยอัตโนมัติ มันถูกตั้งราคาสำหรับงานที่แถว benchmark ด้านบนอธิบายไว้: งานระยะยาวแบบ end-to-end ซึ่งเวลาตามนาฬิกาที่น้อยลง 47% และขั้นตอนของเอเจนต์ที่น้อยลงสามารถคุ้มกับอัตราค่าโทเคนที่สูงขึ้น 2.5 เท่า และไม่ใช่สำหรับแชต

นั่นคือเลขคณิตที่ทำให้เลเยอร์จัดเส้นทาง earn ตำแหน่งของมัน และก็คุ้มค่าที่จะพูดให้ชัดเจนว่าเพราะเหตุใด GPT-6 Astra อยู่ในแค็ตตาล็อกของ OrcaRouter ในชื่อ openai/gpt-6-astra และแพลตฟอร์มส่งต่อราคาตามรายการของ OpeAI ด้วยมาร์กอัป 0% — ดังนั้นการเปลี่ยนแปลงราคาจากผู้ขาย รวมถึงอัตราโปรโมชันที่ส่วนนี้พึ่งพาอยู่ จะมีผลฝั่งเราภายในวันเดียวกัน แทนที่จะรอตามรอบการปรับราคา นอกจากนี้ยังหมายความว่าคำถามเรื่องระดับชั้นข้างต้นไม่ใช่เรื่องสมมติอีกต่อไป คุณสามารถวาง Astra ไว้กับงานระยะยาว และปล่อยให้ Sol, Terra หรือ Luna รับงานปริมาณมาก ภายใต้คีย์เดียว โดยไม่ต้องมีสัญญาที่สองหรือแก้โค้ด และสลับไปมาระหว่างกันได้เมื่อตัวใดตัวหนึ่งมีประสิทธิภาพลดลง

Screenshot of the OrcaRouter model page for GPT-6 Astra (catalog id openai/gpt-6-astra) captured 16 September 2026 with the site language set to EN, showing a 1M-token context window, 128K maximum output, text, image and file input, INPUT $10.00 and OUTPUT $50.00 per 1M tokens, p50 TTFT 6.70 s, p95 TTFT 10.00 s, 181.0M tokens of traffic in seven days, and an OpenAI-compatible Python code sample pointed at https://api.orcarouter.ai/v1 using the model id openai/gpt-6-astra.

สเปก, การเปลี่ยนแปลงของ Codex และสิ่งที่ OpenAI ยังไม่ได้เผยแพร่

รหัสโมเดล — gpt-6-astra ในเอกสารของ Ope​nAI เอง

บริบทและเอาต์พุต — หน้าต่างบริบท 1,050,000 โทเคน, เอาต์พุตสูงสุด 128,000 โทเคน

วันตัดข้อมูลความรู้ — 30 เมษายน 2026 รองรับโทเค็นการให้เหตุผล: ใช่

โมดัลลิตี — อินพุตที่ระบุเป็นไฟล์ รูปภาพ และข้อความ การระบุเช่นนี้มาจากเราเตอร์ ไม่ใช่จาก OpenAI และเราได้ติดป้ายกำกับว่าเป็นข้อมูลที่เราเตอร์รายงาน มิใช่ข้อมูลที่ผู้จำหน่ายยืนยัน

มีให้ใช้งานใน — ChatGPT Work, Co​dex และ API รวมถึง Microsoft Azure และ AWS Bedrock เวิร์กสเปซสำหรับองค์กรปิดไว้เป็นค่าเริ่มต้น ผู้ดูแลระบบเปิดใช้งานการเข้าถึงภายใต้อัตราค่าบริการที่เกี่ยวข้อง และได้รับตัวควบคุมเพื่อจำกัดเว็บไซต์และแอปพลิเคชันเดสก์ท็อปที่ได้รับอนุมัติ จัดการการอัปโหลดและการดาวน์โหลด และควบคุมประวัติการท่องเว็บ ChatGPT Work และ Co​dex เพิ่มนโยบายการยืนยันก่อนการดำเนินการที่มีผลสำคัญ และการตรวจสอบอัตโนมัติสำหรับการเรียกใช้เครื่องมือที่ไม่ปลอดภัยหรือไม่ได้รับอนุญาต ปลั๊กอินสำหรับองค์กรสี่รายการมาพร้อมกันใน ChatGPT Desktop: Oracle Analytics, Power BI (บริการ Microsoft Fabric), Navan และ Avalara Zero Data Retention พร้อมใช้งานสำหรับลูกค้า API ที่มีคุณสมบัติเหมาะสมบนปลายทางที่รองรับ โดยขึ้นอยู่กับการอนุมัติ

มีกลไกหนึ่งที่ควรค่าแก่การกล่าวถึง เพราะมันเปลี่ยนวิธีที่โมเดลทำงานกับงานระยะยาว มากกว่าจะเปลี่ยนคะแนนของมัน Co​dex ได้แนวทางคอนเท็กซ์แบบใหม่กับ Astra: บันทึกต่างๆ คงอยู่ข้ามหน้าต่างคอนเท็กซ์ แทนที่จะถูกบีบอัดซ้ำแล้วซ้ำเล่าให้เป็นสรุปเดียว และหน้าต่างคอนเท็กซ์ก่อนหน้ายังคงค้นหาได้ ดังนั้นข้อกำหนดและผลการทดสอบจากข้อความก่อนหน้าและเอาต์พุตของเครื่องมือจึงยังคงค้นหาเจอ Ope​nAI เรียกสิ่งนี้ว่าการทดลอง เปิดใช้งานใน config.toml ของ Co​dex และกล่าวว่าจะกลายเป็นค่าเริ่มต้นสำหรับ Astra บนเบนช์มาร์กที่วัดเป็น 29 ขั้นตอน นั่นคือกลไกที่น่าจะอธิบายจำนวนขั้นตอนได้มากที่สุด

สิ่งที่ไม่ได้เผยแพร่ก็สำคัญไม่แพ้สิ่งที่เผยแพร่แล้ว Ope​nAI ไม่ได้ระบุจำนวนพารามิเตอร์หรือคอมพิวต์ที่ใช้ฝึกสำหรับโมเดลนี้ และเราไม่ได้พิมพ์ตัวเลขดังกล่าว ตัวเลข "มากกว่า 100,000 GPUs ที่ Stargate" ถูกส่งต่อกันจากแหล่งมือสอง และไม่ปรากฏอยู่ในหน้าที่เราอ่าน อีกทั้งเอกสารของ Ope​nAI ก็ไม่ได้ระบุ "Astra Pro" ที่มีราคาแยกต่างหากหรือมีเอกสารแยกต่างหาก หรือระดับชั้นอื่นใด — มีรายงานข่าวกล่าวถึงระดับหนึ่ง แต่การปรากฏในรายการของเราเตอร์ไม่ใช่เอกสารจากผู้ขาย และเราไม่นำเสนอระดับชั้นที่เราหาไม่พบในเอกสารของ Ope​nAI เอง

สิ่งที่ผู้อ่านควรได้รับจริงๆ จากสิ่งนี้

จัดเรียงแถวตามว่าแต่ละแถวควรมีน้ำหนักผลักดันการตัดสินใจมากน้อยเพียงใด คู่ที่อิ่มตัวแล้ว — 98% บน FrontierMath Tier 4 และ 99.9% บน ARC-AGI-3 — ไม่ควรมีผลต่อการตัดสินใจนั้นเลย สิ่งเหล่านี้บอกว่าเกณฑ์วัดจบแล้ว ไม่ได้บอกว่า Astra ชนะเกณฑ์เหล่านั้น 100% ของ ExploitBench เป็นของจริง และโดยการออกแบบแล้วแทบใช้ประโยชน์ไม่ได้ผ่านโมเดลสาธารณะ ซึ่งเป็นทางเลือกด้านความปลอดภัยโดยเจตนา ไม่ใช่ข้อจำกัดที่ต้องหาทางหลีกเลี่ยง Terminal-Bench 4.0 เป็นคำกล่าวอ้างด้านประสิทธิภาพจากผู้ขายที่แข็งแกร่งที่สุด โดยมีช่องว่างที่แท้จริงเหนือ Sol และช่องว่าง 2.1 จุดเหนือ Claude Fable 5.1 ซึ่งใกล้เคียงเกินกว่าจะฟันธง DeepSWE v1.1 เป็นแถวเดียวที่วัดโดยอิสระ โดยจัดให้ Astra อยู่ในการเสมอสามทางที่ด้านบนแทนที่จะนำโดดเดี่ยว และจำนวนสเต็ปกับโทเคนของมันคือส่วนของผลลัพธ์นั้นที่ควรค่าแก่การยกมาอ้าง OSWorld 2.0 ที่ 40 นาทีต่องานเป็นตัวเลขที่มีความหมายเชิงปฏิบัติการมากที่สุดบนหน้านี้ และเป็นตัวเลขที่ถูกตรวจสอบโดยอิสระน้อยที่สุด แถวด้านความปลอดภัยเป็นข้อมูลภายใน ยังไม่มีการทำซ้ำ และชี้ไปในทิศทางที่ถูกต้อง

ซึ่งทำให้เหลือการแบ่งแยกที่ตรงไปตรงมา หากคุณกำลังเลือกโมเดลในสัปดาห์นี้สำหรับงานแบบเอเจนต์ที่ต้องใช้เวลายาวนาน — การเขียนโค้ดหลายชั่วโมง การใช้คอมพิวเตอร์ งานแบบต้นจนจบที่มิฉะนั้นมนุษย์ต้องคอยเฝ้าดูแล — Astra คือโมเดลที่มีหลักฐานล่าสุดรองรับมากที่สุด และเหตุผลด้านค่าใช้จ่ายขึ้นอยู่กับเวลาที่ประหยัดได้ต่องาน มากกว่าจำนวนโทเค็นที่ประหยัดได้ต่อการเรียกใช้ หากคุณกำลังเลือกสำหรับงานปริมาณสูงที่มีปฏิสัมพันธ์สั้น ตัวเลข 2.5 เท่าเมื่อเทียบกับอัตราโปรโมชันของ Sol คือตัวเลขที่ชี้ขาด และคำตอบน่าจะคือไม่ และหากคุณกำลังเลือกโดยอาศัยความแข็งแกร่งของ 98% หรือ 99.9% คุณกำลังเลือกบนสองแถวที่เลิกให้ข้อมูลแล้ว

คำถามที่ควรค่าแก่การถามซึ่งหน้านี้ยังไม่ได้ตอบ

การนำ 2.1 คะแนนใน Terminal-Bench เหนือ Claude Fable 5.1 นั้นเป็นเรื่องจริงหรือไม่? ไม่ใช่จากหลักฐานนี้ ตัวเลขทั้งสองมาจาก OpenAI ที่วัดโมเดลของตัวเองกับคู่แข่ง ในฮาร์เนสที่เราไม่สามารถเปรียบเทียบได้ โดยไม่มีค่าความคลาดเคลื่อนในการให้คะแนนที่เผยแพร่ มันเป็นการนำในการนับคะแนนของ OpenAI เอง และอยู่ในช่วงที่การรันซ้ำอาจพลิกผลได้ วิธีที่จะตัดสินได้คือรันทั้งคู่บนงานของคุณเอง ซึ่งใช้เวลาสองสามชั่วโมงและคุ้มค่ามากกว่า 2.1 คะแนน

ทำไมกระดานของ Datacurve จึงไม่ยก Astra ขึ้นเป็นที่หนึ่ง ในเมื่อเอกสารเปิดตัวของ OpenAI อ้างสถิติ? เพราะกระดานนั้นกำลังวัดผล ส่วนหน้าเปิดตัวนั้นกำลังขาย ภาพรวมของ Datacurve เองแสดงโมเดลสามตัวที่ 74% โดยมีช่วงความเชื่อมั่นที่ทับซ้อนกัน และไม่ระบุผู้นำ การอ้างสถิติกับกระดานที่คะแนนเสมอกันไม่ใช่คำโกหกเสียทีเดียว แต่เป็นการเลือกตัวส่วน — รูปแบบความล้มเหลวแบบเดียวกับตัวคูณ 2.5 เท่า และเป็นเหตุผลที่เราลงวันที่กำกับทุกตัวเลขตรงนี้

หากเกณฑ์มาตรฐานระดับสูงสุดอิ่มตัวแล้ว ผู้ซื้อควรใช้อะไรแทน เวลาต่อหนึ่งงาน ต้นทุนต่อหนึ่งงานที่ทำสำเร็จ และจำนวนขั้นตอนในงานระยะยาว — มิติที่ตัวเลขยังกระจายตัวอยู่และยังสัมพันธ์กับสิ่งที่ทีมต้องจ่าย นั่นคือการวัดที่หา Published ได้ยากกว่า ซึ่งเป็นเหตุผลที่หน้าเปิดตัวผลิตภัณฑ์ของผู้ขายยังคงนำเสนอเกณฑ์ที่อิ่มตัวแล้วเป็นหลัก

คำถามที่เปิดอยู่

ตัวเลขที่จะทำให้หน้านี้ล้าสมัยเร็วที่สุดก็คือราคา อัตราโปรโมชันของ Sol มีผลอย่างน้อยจนถึงวันที่ 21 พฤศจิกายน 2026 และ OpenAI ยังไม่ได้ประกาศอัตราหลังโปรโมชัน เมื่อตรงนั้นเปลี่ยน ตัวคูณ 2.5 เท่าในบทความนี้ก็จะเปลี่ยนตาม ไปในทิศทางของ 2 เท่า อย่างที่สองคือว่าจะมีใครรันการประเมินเหล่านี้ซ้ำอย่างอิสระบนชุดทดสอบเดียวกันหรือไม่ — DeepSWE คือแบบอย่างว่าสิ่งนั้นควรมีหน้าตาอย่างไร และ OSWorld 2.0 กับ Terminal-Bench 4.0 คือสองแถวที่ต้องการการดูแลแบบนี้มากที่สุด จนกว่าจะถึงตอนนั้น สรุปอย่างซื่อตรงของเบนช์มาร์ก GPT-6 Astra ก็คือ ตัวเลขที่น่าประทับใจนั้นอิ่มตัวแล้ว ตัวเลขที่ใช้แยกแยะความแตกต่างนั้นมาจากผู้ขายรายงานเองและใกล้เคียงกันมาก และตัวเลขอิสระเพียงตัวเดียวคือผลเสมอที่เอกสารเปิดตัวของผู้ขายเองเรียกว่าสถิติ

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube