
OpenAI Astra: ทุกสิ่งที่เรารู้เกี่ยวกับโมเดลที่ไม่ใช่ GPT-6
- qwenใหม่Qwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 ต่อ 1 ล้านโทเค็น · 56 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4 Flash 07312026-07-3150ความฉลาด69การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 200 tok/s
- orcaใหม่OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicใหม่Anthropic: Claude Opus 52026-07-2461ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2150ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1651ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1557ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0951ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0955ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0959ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0854ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0641ความฉลาด59การเขียนโค้ด
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232ความฉลาด42การเขียนโค้ด
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226ความฉลาด39การเขียนโค้ด
- anthropicAnthropic: Claude Sonnet 52026-06-3053ความฉลาด72การเขียนโค้ด
- klingKling: Kling 3.0 Turbo2026-06-1757ความฉลาด52การเขียนโค้ด57คณิตศาสตร์
- z-aiZ.ai: GLM 5.22026-06-1651ความฉลาด69การเขียนโค้ด60คณิตศาสตร์
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242ความฉลาด61การเขียนโค้ด61คณิตศาสตร์
สิ่งที่คุณดาวน์โหลดได้ในวันนี้ไม่ใช่โมเดล แต่เป็นไฟล์โค้ด Lean สิบไฟล์ เมื่อวันที่ 1 สิงหาคม 2026 OpenAI ได้เผยแพร่บทความวิจัยเกี่ยวกับคณิตศาสตร์ และซ่อนอยู่ในนั้นคือการยืนยันครั้งแรกของชื่อระบบ frontier รุ่นถัดไป: Astra ไม่มีการ์ดโมเดล ไม่มีหน้าป้ายราคา ไม่มี API endpoint และไม่มีวันที่ แฟล็กชิปรุ่นปัจจุบันที่คุณสามารถเรียกใช้ได้จริงยังคงเป็น GPT-5.6 Sol ที่ราคา $5 ต่อล้านอินพุตโทเคน และ $30 ต่อล้านเอาต์พุตโทเคน เหมือนกับที่เป็นมาตั้งแต่วันที่ 9 กรกฎาคม
หากคุณค้นหา GPT-6 นี่คือคำตอบสั้น ๆ: OpenAI ไม่เคยประกาศโมเดลในชื่อนั้น และ ณ วันนี้ก็ยังไม่ได้ตัดสินใจว่า Astra จะเปิดตัวในชื่อ GPT-6 หรือเป็นเวอร์ชันย่อยของ GPT-5 อย่าง GPT-5.7 หรือเป็นระดับที่สี่ที่อยู่เคียงข้าง Sol, Terra และ Luna ความคลุมเครือในการตั้งชื่อนี้ไม่ใช่การหลบเลี่ยงสื่อ แต่เป็นคำถามภายในที่ยังเป็นประเด็นอยู่ ซึ่งรายงานโดย The Information เมื่อวันที่ 31 กรกฎาคม และยังไม่มีข้อยุติตั้งแต่นั้น
สิ่งที่ตามมานี้แยกแยะสามสิ่งซึ่งการรายงานข่าวส่วนใหญ่เกี่ยวกับเรื่องนี้มักจะรวมเข้าด้วยกัน นั่นคือ สิ่งที่ OpenAI กล่าวด้วยตนเอง สิ่งที่รายงานข่าวที่น่าเชื่อถือเพิ่มเติม และสิ่งที่เผยแพร่โดยไม่มีแหล่งที่มา หลักฐานเหล่านี้เป็นสิ่งประดิษฐ์จริงที่คุณสามารถคอมไพล์ได้ ตัวเลข 10 ล้านล้านพารามิเตอร์เป็นเพียงตัวเลขที่ใครบางคนพิมพ์บนอินเทอร์เน็ต สิ่งเหล่านี้สมควรได้รับน้ำหนักที่แตกต่างกันอย่างมาก
สิ่งที่ OpenAI พูดจริง — และรายการอีกยาวเหยียดที่มันไม่ได้พูด
การประกาศไม่ได้มาในรูปแบบการเปิดตัวผลิตภัณฑ์ แต่มาอยู่ในรูปแบบเอกสารวิจัย โพสต์ของ OpenAI อธิบายผลลัพธ์ที่เกิดจาก "Astra เวอร์ชันภายใน ซึ่งเป็นโมเดลหลักรุ่นถัดไปของเรา" ครอบคลุมปัญหาที่ในกรอบการนำเสนอของพวกเขา ไม่มีความคืบหน้าในผลลัพธ์หลักมานานอย่างน้อยหนึ่งทศวรรษ Astra ถูกนำเสนอในฐานะระบบที่สร้างขึ้นสำหรับงานที่ดำเนินต่อเนื่องยาวนาน: เอเจนต์หลายตัวประสานงานกันในส่วนต่างๆ ของปัญหาใหญ่หนึ่งปัญหาในช่วงเวลาที่ยาวนาน แทนที่จะตอบในรอบเดียว
นั่นใกล้เคียงกับคำอธิบายทางเทคนิคอย่างเป็นทางการทั้งหมด เมื่อเทียบกับมันแล้ว รายการสิ่งที่ขาดหายไปก็โดดเด่นอย่างยิ่ง:
• ยืนยันโดย OpenAI — ชื่อ Astra; ว่ามันคือ "โมเดลหลักรุ่นถัดไป"; ว่าเวอร์ชันภายในให้ผลลัพธ์ 10 รายการ; ความตั้งใจในการออกแบบแบบหลายเอเจนต์และระยะยาว; ต้นฉบับ 249 หน้า; ใบรับรอง Lean 4 บนคลังเก็บสาธารณะ; การประมาณต้นทุนโทเค็นตามอัตรา GPT-5.6 Sol.
• OpenAI ไม่ได้ระบุวันที่วางจำหน่าย; ราคา; หน้าต่างบริบท; จำนวนพารามิเตอร์; คะแนน benchmark ใดๆ; การ์ดโมเดล; ว่ามีให้ใช้บน ChatGPT หรือเฉพาะบน API เท่านั้น; มีเอเจนต์กี่ตัวที่รัน รันนานเท่าใด บนฮาร์ดแวร์อะไร; พรอมต์; อัตราความสำเร็จ; ชื่อผลิตภัณฑ์สุดท้าย.
รายงานที่น่าเชื่อถือช่วยเพิ่มเติมรายละเอียดได้บ้าง The Information รายงานว่า แซม ออลต์แมนได้สาธิต Astra แก่ผู้กำหนดนโยบายในกรุงวอชิงตันเมื่อปลายเดือนกรกฎาคม — การบรรยายสรุปที่ตามรายงานดังกล่าว มีวุฒิสมาชิกราฟาเอล วาร์น็อก, เบอร์นี โมรีโน และมาร์ก วอร์เนอร์เข้าร่วม โดยมีสก็อตต์ เบสเซนต์ รัฐมนตรีว่าการกระทรวงการคลัง และโฮเวิร์ด ลุตนิก รัฐมนตรีว่าการกระทรวงพาณิชย์อยู่ด้วยเช่นกัน โมเดลตระกูลนี้ถูกอธิบายว่าอยู่ในระหว่างการทดสอบแล้ว โดยที่ "Astra" ยังคงเป็นชื่อชั่วคราว
ไม่มีใครนอก OpenAI เคยรันโมเดลนี้กับสิ่งใดเลย ทุกคำกล่าวอ้างด้านความสามารถที่ถูกพูดถึงนั้น ล้วนสืบย้อนกลับไปได้แค่หลักฐานที่ตีพิมพ์ทั้งสิบชิ้น หรือไม่ก็เดโมที่สาธารณชนไม่เคยเห็น
บทพิสูจน์ทั้งสิบ: ตรวจสอบได้อย่างไม่ธรรมดา และยังไม่ยุติ

นี่คือจุดที่ประกาศนี้แข็งแกร่งกว่าการปล่อย benchmark ทั่วไปจริง ๆ และควรพูดให้ชัดเจนว่าทำไม OpenAI ไม่ได้เผยแพร่คะแนนแล้วขอให้เชื่อถือ แต่เผยแพร่สิ่งตรวจสอบได้ด้วยเครื่องจักรภายใต้ Apache 2.0 ในคลัง openai/ten-proofs — ไฟล์ Lean หนึ่งไฟล์ต่อผลลัพธ์หนึ่งรายการ ตรึงไว้ที่ Lean 4.32.0 พร้อม dependency ที่เป็น mathlib ประกอบกับไดเรกทอรี ComparatorChallenges สำหรับการตรวจสอบอิสระ คลังนี้ถูกส่งเป็น commit เดียวเมื่อวันที่ 1 สิงหาคม และตั้งแต่นั้นก็ได้รับ stars หลายร้อยดวงและ forks หลายสิบครั้ง
ผลลัพธ์ทั้งสิบ ตามที่คลังข้อมูลเรียกชื่อนั้น ครอบคลุมสาขาต่างๆ อย่างกว้างขวางผิดปกติ:
• ทฤษฎีกรุป — การสร้างกรุปที่ไม่เป็นซอฟิก ซึ่งให้คำตอบเชิงปฏิเสธต่อคำถามที่เปิดค้างมาตั้งแต่ปี 1999 ความเป็นซอฟิกเป็นสมบัติที่กรุปเกือบทุกกรุปที่นักคณิตศาสตร์ทำงานด้วยมี ประเด็นที่ว่าทุกกรุปเชิงวิยุตนับได้ต้องมีสมบัตินี้หรือไม่นั้นยังคงค้างอยู่เป็นเวลา 27 ปี
• พีชคณิตตัวดำเนินการ — ตัวอย่างค้านที่เกี่ยวข้องกับข้อความคาดเดาเรื่องความแข็งเกร็งของคอนส์ (Connes rigidity conjecture) ซึ่งถูกเสนอโดยแอแล็ง คอนส์ ผู้ได้รับเหรียญฟิลด์ส ในปี 1980.
• เรขาคณิตมิติสูง — การปรับปรุงวิธีการบรรจุทรงกลม ซึ่งรายงานว่าเป็นครั้งแรกในประเภทนี้ตั้งแต่ปี 1978 — รวมถึงรูปแบบที่คมของอสมการปริมาตรของเออร์ฮาร์ต
• ทฤษฎีการเข้ารหัส — ขอบเขตใหม่สำหรับรหัสไบนารีและรหัสทรงกลม
• ความซับซ้อน — ขอบเขตล่างของวงจรเลขคณิตสำหรับเพอร์มาเนนต์ และผลลัพธ์การทำซ้ำแบบขนานแบบเอ็กซ์โพเนนเชียลสำหรับเกมที่พัวพัน
• การเข้ารหัสแบบแลตทิซ — ความยากแบบพหุนามคงที่สำหรับปัญหาการหาเวกเตอร์ที่ใกล้ที่สุด.
• คอมบินาทอริกเชิงสุดขีด — มาตราส่วนการเติบโตของจำนวนแรมซีย์หลายสีของสามเหลี่ยม และตัวอย่างค้านในทฤษฎีกราฟเชิงสุดขีด รวมถึงงานเกี่ยวกับปัญหาของ Erdős หลายข้อที่ได้รับการรวบรวม
ปฏิกิริยาจากนักคณิตศาสตร์เป็นไปในทางสนใจมากกว่าจะเมินเฉย โทมัส บลูม ผู้ดูแลฐานข้อมูลปัญหาแอร์ดิช เรียกผลงานนี้ว่าข่าวใหญ่ และให้คะแนนว่าสำคัญกว่าตัวอย่างค้านข้อสันนิษฐานระยะหนึ่งหน่วยจากเดือนพฤษภาคม โนอาม บราวน์ จาก OpenAI ให้ข้อคิดที่ช่วยลดความคาดหวังจากภายในว่า "น่าเสียดายที่ยังไม่มีรางวัลปัญหามิลเลนเนียม (ในตอนนี้)"
สิ่งที่ใบรับรอง Lean ชี้ขาด และสิ่งที่มันปล่อยค้างไว้
การพิสูจน์แบบ Lean ที่ผ่านการตรวจสอบชนิด (type-check) นั้นถูกต้องโดยโครงสร้าง คุณไม่จำเป็นต้องเชื่อถือวิธีการประเมินของ OpenAI การเลือกเกณฑ์เปรียบเทียบ หรือการตีความผลลัพธ์ของพวกเขาเอง — คุณสามารถคอมไพล์ไฟล์ได้ สำหรับอุตสาหกรรมที่ "เราได้คะแนน 94.1%" เป็นหน่วยมาตรฐานของหลักฐาน นั่นคือการยกระดับความสามารถในการหักล้างที่มีความหมาย
มันยังแคบกว่าที่พาดหัวข่าวบอกเป็นนัย ในสี่ประเด็นเฉพาะ Lean ตรวจสอบว่าการพิสูจน์ข้อความเชิงรูปนัยนั้นสมเหตุสมผล มันไม่ได้ตรวจสอบว่าข้อความเชิงรูปนัยนั้นเป็นทฤษฎีบทที่เนื้อความกล่าวอ้าง มันไม่ได้ตรวจสอบว่านิยามที่เข้ารหัสไว้ตรงกับความหมายที่วงการวิชาการใช้กับคำเหล่านั้น มันไม่ได้ตรวจสอบการลดรูปอย่างไม่เป็นทางการที่เชื่อมปลายทางเชิงรูปนัยเข้ากับผลลัพธ์ในพาดหัว และมันไม่ได้พูดถึงความใหม่เลย — ว่าผลลัพธ์นั้นใหม่ หรือเป็นที่รู้จักอยู่แล้วภายใต้ชื่ออื่น
ทั้งสี่ข้อนั้นล้วนเป็นคำถามที่ต้องใช้วิจารณญาณของมนุษย์ และ ณ ขณะที่ประกาศ ยังไม่มีข้อใดผ่านการทบทวนโดยผู้ทรงคุณวุฒิ ต้นฉบับกล่าวถึงการปรึกษาผู้เชี่ยวชาญ แต่การกล่าวขอบคุณไม่ใช่การรับรองทุกข้ออ้าง การคอมไพล์บางส่วนที่เผยแพร่ของคลังข้อมูลนี้คอมไพล์งานได้ 8,820 จาก 9,007 งาน ซึ่งเป็นลักษณะของงาน formalization ขนาดใหญ่จริงที่อยู่ระหว่างการตรวจสอบ มากกว่าจะเป็นการตรวจสอบที่เสร็จสมบูรณ์ สถานะที่ซื่อสัตย์ในวันนี้คือ ข้ออ้างการวิจัยที่ถูกเข้ารหัสอย่างเป็นทางการและสำคัญจำนวนสิบข้อ — ไม่ใช่สิบบทความที่ได้รับการยอมรับในหลักคณิตศาสตร์
มีข้อจำกัดประการที่สองที่เงียบกว่านั้น: กระบวนการค้นพบไม่สามารถทำซ้ำได้โดยบุคคลภายนอก OpenAI หลักฐานเป็นสาธารณะ แต่ระบบค้นหา โพรอมต์ เช็คพอยต์ และสภาพแวดล้อมการดำเนินการไม่เป็นสาธารณะ คุณสามารถตรวจสอบปลายทางได้ แต่คุณไม่สามารถรันการเดินทางนั้นซ้ำได้
ตัวเลข $2,000 และเหตุใดมันจึงซื้อได้น้อยกว่าที่ฟังดู

ตัวเลขที่แพร่กระจายไปไกลที่สุดคือต้นทุน OpenAI ระบุค่าใช้จ่ายด้านโทเค็นสำหรับสิบโซลูชันไว้ที่ประมาณ 2,000 ดอลลาร์ คิดตามอัตรา GPT-5.6 Sol — ประมาณ 200 ดอลลาร์ต่อปัญหาที่เปิดค้างมานานสิบปี ตามการตีความถ้อยคำที่พบบ่อยที่สุด สื่อบางสำนักอ่านประโยคเดียวกันว่าต่ำกว่า 2,000 ดอลลาร์ ต่อ ปัญหา ซึ่งต่างกันถึงสิบเท่า; โพสต์ของ OpenAI สั้นพอที่การตีความทั้งสองแบบยังคงถูกตีพิมพ์ และเรายังไม่เห็นบริษัทออกมาชี้แจงให้ชัดเจน
{{1}}นำยอดรวมทั้งหมดมาคิดคำนวณดู โซลคิดค่าบริการ 5 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ 30 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน{{/1}} {{2}}โดยโทเคนสำหรับการให้เหตุผลถูกคิดเงินในอัตราเอาต์พุต{{/2}} {{3}}หากการใช้จ่ายทั้งหมดเป็นเอาต์พุต 2,000 ดอลลาร์จะซื้อโทเคนเอาต์พุตได้มากที่สุดประมาณ 67 ล้านโทเคน{{/3}} {{4}}หรือประมาณ 6.7 ล้านโทเคนต่อหนึ่งปัญหา{{/4}} {{5}}นั่นคือปริมาณการคิดที่มากพอสมควร{{/5}} {{6}}และไม่ใช่จำนวนการคิดที่เกินเหตุหรือไร้สาระ{{/6}} {{7}}มันคืองบประมาณในระดับที่กลุ่มวิจัยที่มีเงินทุนหนาแน่นสามารถทุ่มให้กับคำถามยากๆ เพียงข้อเดียวได้อยู่แล้ว{{/7}}
ข้อควรระวังสามประการสำคัญกว่าพาดหัวข่าว:
• มันเป็นราคาเชิงสมมุติ ไม่ใช่ราคาจริง Astra ยังไม่เปิดตัวและยังไม่กำหนดราคา. $2,000 อธิบายว่าโทเค็นเหล่านั้น จะมีราคาเท่าใดตามอัตราของโมเดลอื่น. ระบบที่ล้ำสมัยซึ่งสร้างขึ้นสำหรับการทำงานแบบมัลติเอเจนต์ที่กินเวลาหลายชั่วโมง ไม่มีเหตุผลชัดเจนที่จะตั้งราคาเท่ากับ Sol และมีเหตุผลทุกประการที่จะตั้งราคาสูงกว่า
• มันนับเฉพาะผลสำเร็จเท่านั้น ไม่มีการเผยแพร่อัตราความสำเร็จ เราไม่ทราบว่า Astra ถูกมอบหมายให้แก้ปัญหากี่ข้อและแก้ไม่สำเร็จ หรือความพยายามเหล่านั้นมีค่าใช้จ่ายเท่าใด ต้นทุนต่อความสำเร็จที่เผยแพร่โดยไม่มีอัตราความสำเร็จไม่ใช่ต้นทุนต่อผลลัพธ์ และความแตกต่างอาจมีขนาดเป็นสิบเท่าไม่ทางใดก็ทางหนึ่ง
• โทเค็นคือส่วนที่ถูก มนุษย์เป็นผู้กำหนดกรอบปัญหา เตรียมต้นฉบับ และขับเคลื่อนการทำให้เป็นทางการ แรงงานนั้นไม่ได้อยู่ใน 2,000 ดอลลาร์
ส่วนเดียวที่คุณสามารถกำหนดราคาได้ในวันนี้คือตัวเลขฐาน (baseline) เนื่องจาก OrcaRouter ส่งผ่านราคารายการของผู้ให้บริการตรงๆ โดยไม่บวกกำไร (0% markup) GPT-5.6 Sol จึงมีราคาเท่ากันที่ $5/$30 บน API ของเราเหมือนกับบน API ของ OpenAI — ดังนั้นถ้าคุณต้องการตรวจสอบความถูกต้องของตัวเลขกับปริมาณงานของคุณเอง อัตราที่ในประกาศคืออัตราที่คุณจะจ่ายจริง สิ่งที่ยังไม่มีใครสามารถกำหนดราคาได้คือ Astra เอง และผู้ขายคนไหนที่บอกคุณเป็นอย่างอื่นกำลังเดาสุ่มอยู่
วันวางจำหน่ายถูกกำหนดโดยกรอบเวลา 30 วัน ไม่ใช่โดยการรั่วไหล

การรายงานข่าวส่วนใหญ่เกี่ยวกับ "เมื่อไหร่ GPT-6 จะมา" เป็นเพียงการคิดเลขจากข่าวลือ มีข้อจำกัดที่เป็นรูปธรรมมากกว่านั้นอยู่ตรงหน้าเรา และแทบไม่ถูกเชื่อมโยงเข้ากับคำถามนี้เลย
คำสั่งฝ่ายบริหารที่ลงนามเมื่อวันที่ 2 มิถุนายน 2026 สั่งให้หน่วยงานของรัฐบาลกลางจัดตั้งกระบวนการทบทวนโดยสมัครใจ ซึ่งนักพัฒนาระดับแนวหน้าจะส่งโมเดลให้รัฐบาลตรวจสอบล่วงหน้าสูงสุด 30 วันก่อนการเผยแพร่สู่สาธารณะ กรอบการดำเนินงานดังกล่าวมีกำหนดมีผลบังคับใช้อย่างเป็นทางการในวันที่ 1 สิงหาคม ซึ่งเป็นวันเดียวกับที่โพสต์เกี่ยวกับ Astra ถูกเผยแพร่ขึ้น รายงานระบุว่า Astra คาดว่าจะเป็นโมเดลแรกที่ผ่านกระบวนการนี้
คำว่า "Voluntary" กำลังมีบทบาทในประโยคนั้น ในทางปฏิบัติ ฝ่ายบริหารเคยใช้อิทธิพลกับจังหวะการเปิดตัวมาก่อน และพฤติกรรมล่าสุดของ OpenAI เองก็ดูเหมือนการซ้อมใหญ่: GPT-5.6 ถูกจำกัดให้เฉพาะองค์กรที่ผ่านการตรวจสอบประมาณยี่สิบแห่งตั้งแต่วันที่ 26 มิถุนายน ก่อนที่จะเปิดให้เข้าถึงอย่างกว้างขวางในวันที่ 9 กรกฎาคม — ซึ่งเป็นการเปิดตัวแบบเป็นขั้นตอนประมาณสองสัปดาห์
รวมสองข้อเท็จจริงนั้นเข้าด้วยกัน คุณจะได้ประมาณการคร่าวๆ แทนที่จะเป็นการคาดการณ์ หาก Astra ผ่านการตรวจสอบก่อนเปิดตัว 30 วัน แล้วทำซ้ำรูปแบบ GPT-5.6 การเปิดตัวในวงกว้างจะเกิดขึ้นประมาณหกสัปดาห์หลังจากการส่ง และวันที่ส่งคือสิ่งที่เราไม่รู้แน่ชัด นี่คือเหตุผลที่วันที่ในเดือนสิงหาคมที่มั่นใจควรถูกลดความสำคัญ: ขั้นตอนการคัดกรองเป็นกระบวนการที่มีระยะเวลาที่ประกาศไว้ และนาฬิกายังไม่เริ่มเดินอย่างชัดเจน
ตลาดการคาดการณ์ได้เคลื่อนไปในทิศทางนั้นพอดี เมื่ออ่านในวันที่ 5 สิงหาคม 2026 บันได 'GPT-6 ปล่อยภายใน' ของ Polymarket อยู่ที่ 1% สำหรับวันที่ 7 สิงหาคม, 3% สำหรับวันที่ 14 สิงหาคม, 13% สำหรับวันที่ 21 สิงหาคม, 25% สำหรับวันที่ 31 สิงหาคม, 68% สำหรับวันที่ 30 กันยายน และ 89% สำหรับวันที่ 31 ธันวาคม โดยมีปริมาณซื้อขายเกือบหนึ่งล้านดอลลาร์ จงถือว่านั่นคือการคาดการณ์รวมของฝูงชน ไม่ใช่แหล่งข้อมูล — แต่โปรดสังเกตว่าฝูงชนได้ย้ายน้ำหนักไปยังไตรมาสที่ 4 แล้ว
การจดจำสถิติที่ผ่านมาก็ช่วยได้เช่นกัน คำกล่าวอ้างทุกครั้งที่ว่า "GPT-6 จะเปิดตัวสัปดาห์หน้า" ในช่วงสิบสองเดือนที่ผ่านมาล้วนผิดพลาด ข่าวรั่วที่ไม่ได้รับการยืนยันระบุว่าวันที่ 14 เมษายน 2026 เป็นวันเปิดตัว แต่สิ่งที่เปิดตัวจริงในอีกเก้าวันต่อมาคือ GPT-5.5
ข่าวลือที่ถูกจัดระดับ
จัดเรียงตามน้ำหนักที่แต่ละอย่างแบกรับจริง:
• ยังไม่ได้ตั้งชื่อ (GPT-6 / GPT-5.7 / คลาสแยกต่างหาก) โดยอ้างอิงจาก The Information ข้อกล่าวอ้างที่น่าเชื่อถือที่สุดที่ไม่ใช่ของ OpenAI ในเรื่องนี้ และเป็นสิ่งที่ควรปรับความคาดหวัง — ระบบที่ประกาศผ่านบทความคณิตศาสตร์อาจไม่ถูกติดฉลากว่าเป็นการก้าวกระโดดข้ามรุ่นเลยก็ได้
• โค้ดเนม "Zinc" และ "Magnesium" ถูกพบใน Design Arena.การพบเห็นจากชุมชน รายงานว่าการส่งผลงานถูกปิดใช้งาน ยังไม่ได้รับการยืนยันจาก OpenAI ตีความได้ว่า: การออกรุ่นย่อย GPT-5.x อาจมา ก่อน Astra ซึ่งจะไม่ตอบสนองความคาดหวัง GPT-6 ของใครเลย ขณะเดียวกันก็กลืนกินวงจรข่าว
• มีขนาดประมาณ 2 เท่าของ GPT-5.6 Sol โดยราคาอยู่ในช่วงใกล้เคียงกับ GPT-5.6ข่าวลือที่แพร่สะพัด ผู้ปล่อยข่าวยอมรับว่าไม่ได้ทดสอบโมเดลดังกล่าว ฟังดูน่าเชื่อถือแต่ไร้หลักฐานยืนยันโดยสิ้นเชิง
• หน้าต่างบริบทขนาด 1.5 ล้านโทเคน. ปรากฏในรายงานรวบรวมข่าวหลุดโดยไม่มีการเอ่ยชื่อแหล่งข่าว. น่าสังเกตว่า Sol มี 1,050,000 โทเคนอยู่แล้ว ดังนั้นนี่จึงเป็นการเพิ่มขึ้นเพียงเล็กน้อย ไม่ใช่การก้าวกระโดด — ซึ่งเป็นเหตุผลให้สงสัยว่ามันเป็น "ข่าวหลุด" ที่เป็นพาดหัว
• พารามิเตอร์ประมาณ 10 ล้านล้าน ไม่มีการระบุแหล่งที่มาใด ๆ ที่เราสืบหาได้ เป็นตัวเลขที่ถูกกล่าวถึงซ้ำมากที่สุดและมีหลักฐานสนับสนุนน้อยที่สุดในเรื่องทั้งหมด
• ความจำและการปรับแต่งเฉพาะบุคคลเป็นทิศทางที่กำหนดชัดเจน อ้างอิงจากคำกล่าวสาธารณะของ Altman ในการสัมภาษณ์เดือนสิงหาคม 2025 — จริงอยู่ แต่เก่าไปหนึ่งปีแล้ว และเป็นเรื่องทิศทางหลังยุค GPT-5 โดยทั่วไป ไม่เกี่ยวกับ Astra โดยเฉพาะ
สิ่งที่ควรทำจริงๆ ระหว่างตอนนี้กับเวลาที่มันจัดส่ง
การเดินหมากที่ผิดคือการปรับสถาปัตยกรรมใหม่เพื่อรองรับโมเดลที่ยังไม่มี model card การเดินหมากที่ถูกคือการสังเกตว่าปัญหาใดของคุณที่ระบบ multi-agent แบบ long-horizon จะเปลี่ยนไป เพราะนั่นคือส่วนของ stack ที่คุณยังสร้างไว้ไม่เพียงพอในวันนี้ ไม่ว่า OpenAI จะปล่อยอะไรออกมาก็ตาม
สามอย่างในจำนวนนี้คุ้มค่าที่จะสร้างขึ้นเพื่อแข่งขันกับ GPT-5.6 Sol ในตอนนี้:
• Cost ceilings per task, not per call. If a single job can run for hours and spend six or seven million output tokens, per-request limits stop protecting you. You need a budget that a whole task inherits, and a hard stop.
• การตั้งจุดบันทึกและการดำเนินการต่อได้. การเรียกใช้แบบครั้งเดียวจะส่งคืนผลลัพธ์หรือล้มเหลว การรันเอเจนต์ที่กินเวลาหลายชั่วโมงตายลงในนาทีที่ 90 โดยไม่มีการเขียนข้อมูลถาวรไว้เลย ถือเป็นความล้มเหลวที่มีค่าใช้จ่ายสูงประเภทหนึ่ง ซึ่งโค้ดเบสส่วนใหญ่ไม่เคยต้องเผชิญ
• การประเมินผลที่คุณเชื่อถือได้สำหรับปัญหาที่ไม่มีคำตอบอ้างอิงข้อพิสูจน์ทั้งสิบข้อน่าสนใจ ส่วนหนึ่งเพราะ Lean ทำหน้าที่เป็นออราเคิล แทบไม่มีอะไรในระบบการผลิตจริงที่ทำได้แบบนั้น หากคุณไม่สามารถแยกแยะการรันหกชั่วโมงที่ดีจากการรันที่ดูเหมือนดีแต่ผิดพลาดได้ การเพิ่มพลังประมวลผลก็ไม่ช่วยคุณ
สำหรับคำถามเรื่องการสลับ: Astra ไม่มีให้บริการบน OrcaRouter เพราะมันไม่มีให้บริการที่ใดเลย สิ่งที่เราพอจะพูดได้คือ ปัญหาการเปลี่ยนเวอร์ชันบ่อยครั้งได้รับการแก้ไขไปเป็นส่วนใหญ่ในฝ่ายของเรา คีย์เดียวเข้าถึงโมเดลได้มากกว่า 200 รุ่น ดังนั้นไม่ว่ามันจะถูกส่งออกมาในชื่อ GPT-6, GPT-5.7 หรือเป็นระดับที่สี่ของ GPT-5.6 การนำมาใช้ก็เป็นเพียงการเปลี่ยนสตริงโมเดล ไม่ใช่การย้ายระบบ — ไม่ต้องมีสัญญาฉบับที่สอง ไม่ต้องมี SDK ใหม่ และสำหรับโมเดล frontier ที่ยังไม่ผ่านการพิสูจน์โดยเฉพาะ การสลับสำรองอัตโนมัติคือสิ่งที่ทำให้คุณประเมินมันในโหลดงานจริงได้ แทนที่จะเดิมพันเส้นทางการผลิตบนระบบที่ไม่มีใครนอกห้องแล็บเคยทดสอบภายใต้ความเครียด คุณส่งทราฟิกบางส่วนไปให้มัน โดยมี Sol เป็นตัวสำรองรองรับอยู่ข้างใต้ แล้วคุณจะรู้ผล
คำถามที่ควรค่าแก่การตอบ
Astra เหมือนกับ GPT-6 หรือไม่?
ไม่จำเป็น และนั่นคือความไม่แน่นอนที่ส่งผลกระทบมากที่สุดในเรื่องนี้ OpenAI ยืนยันว่า Astra คือโมเดลหลักรุ่นถัดไป แต่ยังไม่ได้ตัดสินใจเรื่องชื่อสำหรับการเปิดตัว รายงานข่าวระบุว่า GPT-6, GPT-5.7 และโมเดลอีกคลาสหนึ่งที่แยกต่างหาก ต่างก็อยู่ในตัวเลือกพร้อมกับ Sol, Terra และ Luna เป็นไปได้โดยสิ้นเชิงที่โมเดลชื่อ GPT-6 จะไม่เกิดขึ้นจริง และการก้าวกระโดดด้านความสามารถที่ผู้คนรอคอยอาจมาในชื่อที่ไม่มีใครเคยจับตามอง
วันนี้ฉันสามารถเข้าถึง Astra ในรูปแบบใดก็ได้หรือไม่
ไม่ — ไม่ใช่ใน ChatGPT ไม่ผ่าน API ไม่ผ่านตัวกลางหรือผู้ค้าต่อรายใด สิ่งที่เปิดเผยต่อสาธารณะในตอนนี้คือ เอกสารวิชาการ บทวิเคราะห์แนวคิดเชิงเหตุผล และคลังเก็บ Lean หากบริการใดอ้างว่าสามารถให้สิทธิ์เข้าใช้งาน Astra ได้ บริการนั้นก็อาจจะขายต่อบริการอื่นหรือไม่ก็โกหก สิ่งเดียวที่คุณสามารถทำได้อย่างเป็นประโยชน์จริง ๆ กับการเปิดตัวครั้งนี้ในตอนนี้คือ การคอมไพล์บทพิสูจน์ด้วยตัวคุณเอง
แอสตร้าแก้ปัญหาที่นักคณิตศาสตร์มนุษย์แก้ไม่ได้จริงหรือ?
มันได้สร้างบทพิสูจน์ที่ผ่านการตรวจสอบอย่างเป็นทางการสำหรับข้อความที่ยังไม่มีคำตอบมานานอย่างน้อยหนึ่งทศวรรษ ซึ่งเป็นผลลัพธ์ที่แท้จริงและไม่ธรรมดา — และการตรวจสอบนี้ถือว่าเหนือกว่ามาตรฐานปกติของอุตสาหกรรมหนึ่งขั้น แต่ "การผ่านการตรวจสอบด้วย Lean" ไม่ใช่ "การผ่านการตรวจสอบโดยผู้เชี่ยวชาญ" และคำถามเชิงกรอบที่ว่าข้อความเชิงรูปแบบแต่ละข้อความครอบคลุมปัญหาหลักที่เป็นประเด็นสำคัญหรือไม่ คือส่วนที่ Lean ไม่สามารถตอบได้ ผู้เชี่ยวชาญที่อ่านต้นฉบับต่างให้ความเห็นเชิงบวก แต่ยังไม่มีฉบับใดที่ผ่านการตรวจสอบโดยผู้ทรงคุณวุฒิ คาดว่าข้อสรุปนี้จะชัดเจนมากขึ้นในอีกหลายเดือนข้างหน้า ไม่ว่าผลจะออกมาในทิศทางใด
ตัวเลข 2,000 ดอลลาร์หมายความว่างานวิจัยระดับแนวหน้าตอนนี้มีราคาถูกแล้วหรือไม่
นั่นหมายความว่าการรันโทเคนที่ชนะนั้นมีต้นทุนถูก ด้วยราคาของโมเดลอื่น โดยไม่นับรวมความล้มเหลวและไม่นับรวมมนุษย์ ข้อยกเว้นทั้งสามข้อนี้แต่ละข้ออาจมีผลกระทบใหญ่ การอ่านอย่างตรงไปตรงมาคือ ต้นทุนส่วนเพิ่มของการค้นหาบทพิสูจน์อัตโนมัติที่ประสบความสำเร็จได้ลดลงต่ำพอที่จะน่าสนใจ ไม่ใช่ว่าปัญหาที่เปิดอยู่สิบข้อตอนนี้มีราคาเท่ากับแล็ปท็อปเครื่องหนึ่ง
อะไรที่จะยุติเรื่องนี้ได้จริงๆ
สามสิ่งเฉพาะ ซึ่งไม่มีสิ่งใดที่เป็นข่าวลือ และทั้งหมดสามารถตรวจสอบได้เมื่อมันเกิดขึ้น
การ์ดโมเดลและหน้าข้อมูลราคา นั่นคือช่วงเวลาที่ Astra หยุดเป็นเพียงผลงานวิจัยและกลายเป็นสิ่งที่คุณสามารถนำมาวางแผนได้ — และเป็นช่วงเวลาที่คำถามเรื่องชื่อคลี่คลายตัวเอง
การสร้างที่เก็บ Lean ขึ้นมาใหม่โดยอิสระ โดยผู้เชี่ยวชาญที่ตรวจสอบนิยามและการลดรูปอย่างไม่เป็นทางการ ไม่ใช่แค่การตรวจสอบชนิดข้อมูลเท่านั้น ไดเรกทอรี ComparatorChallenges ชี้ให้เห็นว่า OpenAI คาดหวังสิ่งนี้ หากข้อความเชิงรูปนัยยังคงผ่านการตรวจสอบอย่างเข้มงวดนั้น ผลลัพธ์ก็จะถูกมองข้ามได้ยากขึ้นมาก แต่ถ้าความไม่ตรงกันปรากฏขึ้นแม้เพียงหนึ่งในสิบ ข้อกล่าวอ้างทุกข้อในชุดก็จะถูกอ่านทบทวนใหม่
หลักฐานว่าการนับเวลาการทบทวนของรัฐบาลกลางได้เริ่มต้นขึ้นแล้ว ภายใต้ช่วงเวลา 30 วันก่อนการวางจำหน่าย การส่งครั้งนั้นเป็นสัญญาณที่เชื่อถือได้เร็วที่สุดของวันวางจำหน่าย ซึ่งให้ข้อมูลมากกว่าภาพหน้าจอถัดไปของรายการที่ถูกปิดใช้งานในลีดเดอร์บอร์ดสนามประลองอย่างมาก
จนกว่าจะถึงตอนนั้น ข้อความที่แม่นยำนั้นแคบและควรยึดถือไว้: เรือธงตัวถัดไปของ OpenAI มีชื่อ หลักฐานที่ตรวจสอบได้ด้วยเครื่องสิบชิ้น การสาธิตที่วอชิงตัน และไม่มีอะไรอื่นอีก ใครก็ตามที่เสนอวันที่ให้คุณกำลังเดา และใครก็ตามที่เสนอจำนวนพารามิเตอร์ให้คุณกำลังแต่งเรื่องขึ้นมา
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
