OpenAI Astra-1
Guides & Insights

OpenAI Astra: ทุกสิ่งที่เรารู้เกี่ยวกับโมเดลที่ไม่ใช่ GPT-6

ผู้เขียน

Jim Song

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สิ่งที่คุณดาวน์โหลดได้ในวันนี้ไม่ใช่โมเดล แต่เป็นไฟล์โค้ด Lean สิบไฟล์ เมื่อวันที่ 1 สิงหาคม 2026 OpenAI ได้เผยแพร่บทความวิจัยเกี่ยวกับคณิตศาสตร์ และซ่อนอยู่ในนั้นคือการยืนยันครั้งแรกของชื่อระบบ frontier รุ่นถัดไป: Astra ไม่มีการ์ดโมเดล ไม่มีหน้าป้ายราคา ไม่มี API endpoint และไม่มีวันที่ แฟล็กชิปรุ่นปัจจุบันที่คุณสามารถเรียกใช้ได้จริงยังคงเป็น GPT-5.6 Sol ที่ราคา $5 ต่อล้านอินพุตโทเคน และ $30 ต่อล้านเอาต์พุตโทเคน เหมือนกับที่เป็นมาตั้งแต่วันที่ 9 กรกฎาคม

หากคุณค้นหา GPT-6 นี่คือคำตอบสั้น ๆ: OpenAI ไม่เคยประกาศโมเดลในชื่อนั้น และ ณ วันนี้ก็ยังไม่ได้ตัดสินใจว่า Astra จะเปิดตัวในชื่อ GPT-6 หรือเป็นเวอร์ชันย่อยของ GPT-5 อย่าง GPT-5.7 หรือเป็นระดับที่สี่ที่อยู่เคียงข้าง Sol, Terra และ Luna ความคลุมเครือในการตั้งชื่อนี้ไม่ใช่การหลบเลี่ยงสื่อ แต่เป็นคำถามภายในที่ยังเป็นประเด็นอยู่ ซึ่งรายงานโดย The Information เมื่อวันที่ 31 กรกฎาคม และยังไม่มีข้อยุติตั้งแต่นั้น

สิ่งที่ตามมานี้แยกแยะสามสิ่งซึ่งการรายงานข่าวส่วนใหญ่เกี่ยวกับเรื่องนี้มักจะรวมเข้าด้วยกัน นั่นคือ สิ่งที่ OpenAI กล่าวด้วยตนเอง สิ่งที่รายงานข่าวที่น่าเชื่อถือเพิ่มเติม และสิ่งที่เผยแพร่โดยไม่มีแหล่งที่มา หลักฐานเหล่านี้เป็นสิ่งประดิษฐ์จริงที่คุณสามารถคอมไพล์ได้ ตัวเลข 10 ล้านล้านพารามิเตอร์เป็นเพียงตัวเลขที่ใครบางคนพิมพ์บนอินเทอร์เน็ต สิ่งเหล่านี้สมควรได้รับน้ำหนักที่แตกต่างกันอย่างมาก

สิ่งที่ OpenAI พูดจริง — และรายการอีกยาวเหยียดที่มันไม่ได้พูด

การประกาศไม่ได้มาในรูปแบบการเปิดตัวผลิตภัณฑ์ แต่มาอยู่ในรูปแบบเอกสารวิจัย โพสต์ของ OpenAI อธิบายผลลัพธ์ที่เกิดจาก "Astra เวอร์ชันภายใน ซึ่งเป็นโมเดลหลักรุ่นถัดไปของเรา" ครอบคลุมปัญหาที่ในกรอบการนำเสนอของพวกเขา ไม่มีความคืบหน้าในผลลัพธ์หลักมานานอย่างน้อยหนึ่งทศวรรษ Astra ถูกนำเสนอในฐานะระบบที่สร้างขึ้นสำหรับงานที่ดำเนินต่อเนื่องยาวนาน: เอเจนต์หลายตัวประสานงานกันในส่วนต่างๆ ของปัญหาใหญ่หนึ่งปัญหาในช่วงเวลาที่ยาวนาน แทนที่จะตอบในรอบเดียว

นั่นใกล้เคียงกับคำอธิบายทางเทคนิคอย่างเป็นทางการทั้งหมด เมื่อเทียบกับมันแล้ว รายการสิ่งที่ขาดหายไปก็โดดเด่นอย่างยิ่ง:

ยืนยันโดย OpenAI — ชื่อ Astra; ว่ามันคือ "โมเดลหลักรุ่นถัดไป"; ว่าเวอร์ชันภายในให้ผลลัพธ์ 10 รายการ; ความตั้งใจในการออกแบบแบบหลายเอเจนต์และระยะยาว; ต้นฉบับ 249 หน้า; ใบรับรอง Lean 4 บนคลังเก็บสาธารณะ; การประมาณต้นทุนโทเค็นตามอัตรา GPT-5.6 Sol.

OpenAI ไม่ได้ระบุวันที่วางจำหน่าย; ราคา; หน้าต่างบริบท; จำนวนพารามิเตอร์; คะแนน benchmark ใดๆ; การ์ดโมเดล; ว่ามีให้ใช้บน ChatGPT หรือเฉพาะบน API เท่านั้น; มีเอเจนต์กี่ตัวที่รัน รันนานเท่าใด บนฮาร์ดแวร์อะไร; พรอมต์; อัตราความสำเร็จ; ชื่อผลิตภัณฑ์สุดท้าย.

รายงานที่น่าเชื่อถือช่วยเพิ่มเติมรายละเอียดได้บ้าง The Information รายงานว่า แซม ออลต์แมนได้สาธิต Astra แก่ผู้กำหนดนโยบายในกรุงวอชิงตันเมื่อปลายเดือนกรกฎาคม — การบรรยายสรุปที่ตามรายงานดังกล่าว มีวุฒิสมาชิกราฟาเอล วาร์น็อก, เบอร์นี โมรีโน และมาร์ก วอร์เนอร์เข้าร่วม โดยมีสก็อตต์ เบสเซนต์ รัฐมนตรีว่าการกระทรวงการคลัง และโฮเวิร์ด ลุตนิก รัฐมนตรีว่าการกระทรวงพาณิชย์อยู่ด้วยเช่นกัน โมเดลตระกูลนี้ถูกอธิบายว่าอยู่ในระหว่างการทดสอบแล้ว โดยที่ "Astra" ยังคงเป็นชื่อชั่วคราว

ไม่มีใครนอก OpenAI เคยรันโมเดลนี้กับสิ่งใดเลย ทุกคำกล่าวอ้างด้านความสามารถที่ถูกพูดถึงนั้น ล้วนสืบย้อนกลับไปได้แค่หลักฐานที่ตีพิมพ์ทั้งสิบชิ้น หรือไม่ก็เดโมที่สาธารณชนไม่เคยเห็น

บทพิสูจน์ทั้งสิบ: ตรวจสอบได้อย่างไม่ธรรมดา และยังไม่ยุติ

OpenAI Astra-2

นี่คือจุดที่ประกาศนี้แข็งแกร่งกว่าการปล่อย benchmark ทั่วไปจริง ๆ และควรพูดให้ชัดเจนว่าทำไม OpenAI ไม่ได้เผยแพร่คะแนนแล้วขอให้เชื่อถือ แต่เผยแพร่สิ่งตรวจสอบได้ด้วยเครื่องจักรภายใต้ Apache 2.0 ในคลัง openai/ten-proofs — ไฟล์ Lean หนึ่งไฟล์ต่อผลลัพธ์หนึ่งรายการ ตรึงไว้ที่ Lean 4.32.0 พร้อม dependency ที่เป็น mathlib ประกอบกับไดเรกทอรี ComparatorChallenges สำหรับการตรวจสอบอิสระ คลังนี้ถูกส่งเป็น commit เดียวเมื่อวันที่ 1 สิงหาคม และตั้งแต่นั้นก็ได้รับ stars หลายร้อยดวงและ forks หลายสิบครั้ง

ผลลัพธ์ทั้งสิบ ตามที่คลังข้อมูลเรียกชื่อนั้น ครอบคลุมสาขาต่างๆ อย่างกว้างขวางผิดปกติ:

ทฤษฎีกรุป — การสร้างกรุปที่ไม่เป็นซอฟิก ซึ่งให้คำตอบเชิงปฏิเสธต่อคำถามที่เปิดค้างมาตั้งแต่ปี 1999 ความเป็นซอฟิกเป็นสมบัติที่กรุปเกือบทุกกรุปที่นักคณิตศาสตร์ทำงานด้วยมี ประเด็นที่ว่าทุกกรุปเชิงวิยุตนับได้ต้องมีสมบัตินี้หรือไม่นั้นยังคงค้างอยู่เป็นเวลา 27 ปี

พีชคณิตตัวดำเนินการ — ตัวอย่างค้านที่เกี่ยวข้องกับข้อความคาดเดาเรื่องความแข็งเกร็งของคอนส์ (Connes rigidity conjecture) ซึ่งถูกเสนอโดยแอแล็ง คอนส์ ผู้ได้รับเหรียญฟิลด์ส ในปี 1980.

เรขาคณิตมิติสูง — การปรับปรุงวิธีการบรรจุทรงกลม ซึ่งรายงานว่าเป็นครั้งแรกในประเภทนี้ตั้งแต่ปี 1978 — รวมถึงรูปแบบที่คมของอสมการปริมาตรของเออร์ฮาร์ต

ทฤษฎีการเข้ารหัส — ขอบเขตใหม่สำหรับรหัสไบนารีและรหัสทรงกลม

ความซับซ้อน — ขอบเขตล่างของวงจรเลขคณิตสำหรับเพอร์มาเนนต์ และผลลัพธ์การทำซ้ำแบบขนานแบบเอ็กซ์โพเนนเชียลสำหรับเกมที่พัวพัน

การเข้ารหัสแบบแลตทิซ — ความยากแบบพหุนามคงที่สำหรับปัญหาการหาเวกเตอร์ที่ใกล้ที่สุด.

คอมบินาทอริกเชิงสุดขีด — มาตราส่วนการเติบโตของจำนวนแรมซีย์หลายสีของสามเหลี่ยม และตัวอย่างค้านในทฤษฎีกราฟเชิงสุดขีด รวมถึงงานเกี่ยวกับปัญหาของ Erdős หลายข้อที่ได้รับการรวบรวม

ปฏิกิริยาจากนักคณิตศาสตร์เป็นไปในทางสนใจมากกว่าจะเมินเฉย โทมัส บลูม ผู้ดูแลฐานข้อมูลปัญหาแอร์ดิช เรียกผลงานนี้ว่าข่าวใหญ่ และให้คะแนนว่าสำคัญกว่าตัวอย่างค้านข้อสันนิษฐานระยะหนึ่งหน่วยจากเดือนพฤษภาคม โนอาม บราวน์ จาก OpenAI ให้ข้อคิดที่ช่วยลดความคาดหวังจากภายในว่า "น่าเสียดายที่ยังไม่มีรางวัลปัญหามิลเลนเนียม (ในตอนนี้)"

สิ่งที่ใบรับรอง Lean ชี้ขาด และสิ่งที่มันปล่อยค้างไว้

การพิสูจน์แบบ Lean ที่ผ่านการตรวจสอบชนิด (type-check) นั้นถูกต้องโดยโครงสร้าง คุณไม่จำเป็นต้องเชื่อถือวิธีการประเมินของ OpenAI การเลือกเกณฑ์เปรียบเทียบ หรือการตีความผลลัพธ์ของพวกเขาเอง — คุณสามารถคอมไพล์ไฟล์ได้ สำหรับอุตสาหกรรมที่ "เราได้คะแนน 94.1%" เป็นหน่วยมาตรฐานของหลักฐาน นั่นคือการยกระดับความสามารถในการหักล้างที่มีความหมาย

มันยังแคบกว่าที่พาดหัวข่าวบอกเป็นนัย ในสี่ประเด็นเฉพาะ Lean ตรวจสอบว่าการพิสูจน์ข้อความเชิงรูปนัยนั้นสมเหตุสมผล มันไม่ได้ตรวจสอบว่าข้อความเชิงรูปนัยนั้นเป็นทฤษฎีบทที่เนื้อความกล่าวอ้าง มันไม่ได้ตรวจสอบว่านิยามที่เข้ารหัสไว้ตรงกับความหมายที่วงการวิชาการใช้กับคำเหล่านั้น มันไม่ได้ตรวจสอบการลดรูปอย่างไม่เป็นทางการที่เชื่อมปลายทางเชิงรูปนัยเข้ากับผลลัพธ์ในพาดหัว และมันไม่ได้พูดถึงความใหม่เลย — ว่าผลลัพธ์นั้นใหม่ หรือเป็นที่รู้จักอยู่แล้วภายใต้ชื่ออื่น

ทั้งสี่ข้อนั้นล้วนเป็นคำถามที่ต้องใช้วิจารณญาณของมนุษย์ และ ณ ขณะที่ประกาศ ยังไม่มีข้อใดผ่านการทบทวนโดยผู้ทรงคุณวุฒิ ต้นฉบับกล่าวถึงการปรึกษาผู้เชี่ยวชาญ แต่การกล่าวขอบคุณไม่ใช่การรับรองทุกข้ออ้าง การคอมไพล์บางส่วนที่เผยแพร่ของคลังข้อมูลนี้คอมไพล์งานได้ 8,820 จาก 9,007 งาน ซึ่งเป็นลักษณะของงาน formalization ขนาดใหญ่จริงที่อยู่ระหว่างการตรวจสอบ มากกว่าจะเป็นการตรวจสอบที่เสร็จสมบูรณ์ สถานะที่ซื่อสัตย์ในวันนี้คือ ข้ออ้างการวิจัยที่ถูกเข้ารหัสอย่างเป็นทางการและสำคัญจำนวนสิบข้อ — ไม่ใช่สิบบทความที่ได้รับการยอมรับในหลักคณิตศาสตร์

มีข้อจำกัดประการที่สองที่เงียบกว่านั้น: กระบวนการค้นพบไม่สามารถทำซ้ำได้โดยบุคคลภายนอก OpenAI หลักฐานเป็นสาธารณะ แต่ระบบค้นหา โพรอมต์ เช็คพอยต์ และสภาพแวดล้อมการดำเนินการไม่เป็นสาธารณะ คุณสามารถตรวจสอบปลายทางได้ แต่คุณไม่สามารถรันการเดินทางนั้นซ้ำได้

ตัวเลข $2,000 และเหตุใดมันจึงซื้อได้น้อยกว่าที่ฟังดู

OpenAI Astra-3

ตัวเลขที่แพร่กระจายไปไกลที่สุดคือต้นทุน OpenAI ระบุค่าใช้จ่ายด้านโทเค็นสำหรับสิบโซลูชันไว้ที่ประมาณ 2,000 ดอลลาร์ คิดตามอัตรา GPT-5.6 Sol — ประมาณ 200 ดอลลาร์ต่อปัญหาที่เปิดค้างมานานสิบปี ตามการตีความถ้อยคำที่พบบ่อยที่สุด สื่อบางสำนักอ่านประโยคเดียวกันว่าต่ำกว่า 2,000 ดอลลาร์ ต่อ ปัญหา ซึ่งต่างกันถึงสิบเท่า; โพสต์ของ OpenAI สั้นพอที่การตีความทั้งสองแบบยังคงถูกตีพิมพ์ และเรายังไม่เห็นบริษัทออกมาชี้แจงให้ชัดเจน

{{1}}นำยอดรวมทั้งหมดมาคิดคำนวณดู โซลคิดค่าบริการ 5 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ 30 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน{{/1}} {{2}}โดยโทเคนสำหรับการให้เหตุผลถูกคิดเงินในอัตราเอาต์พุต{{/2}} {{3}}หากการใช้จ่ายทั้งหมดเป็นเอาต์พุต 2,000 ดอลลาร์จะซื้อโทเคนเอาต์พุตได้มากที่สุดประมาณ 67 ล้านโทเคน{{/3}} {{4}}หรือประมาณ 6.7 ล้านโทเคนต่อหนึ่งปัญหา{{/4}} {{5}}นั่นคือปริมาณการคิดที่มากพอสมควร{{/5}} {{6}}และไม่ใช่จำนวนการคิดที่เกินเหตุหรือไร้สาระ{{/6}} {{7}}มันคืองบประมาณในระดับที่กลุ่มวิจัยที่มีเงินทุนหนาแน่นสามารถทุ่มให้กับคำถามยากๆ เพียงข้อเดียวได้อยู่แล้ว{{/7}}

ข้อควรระวังสามประการสำคัญกว่าพาดหัวข่าว:

มันเป็นราคาเชิงสมมุติ ไม่ใช่ราคาจริง Astra ยังไม่เปิดตัวและยังไม่กำหนดราคา. $2,000 อธิบายว่าโทเค็นเหล่านั้น จะมีราคาเท่าใดตามอัตราของโมเดลอื่น. ระบบที่ล้ำสมัยซึ่งสร้างขึ้นสำหรับการทำงานแบบมัลติเอเจนต์ที่กินเวลาหลายชั่วโมง ไม่มีเหตุผลชัดเจนที่จะตั้งราคาเท่ากับ Sol และมีเหตุผลทุกประการที่จะตั้งราคาสูงกว่า

มันนับเฉพาะผลสำเร็จเท่านั้น ไม่มีการเผยแพร่อัตราความสำเร็จ เราไม่ทราบว่า Astra ถูกมอบหมายให้แก้ปัญหากี่ข้อและแก้ไม่สำเร็จ หรือความพยายามเหล่านั้นมีค่าใช้จ่ายเท่าใด ต้นทุนต่อความสำเร็จที่เผยแพร่โดยไม่มีอัตราความสำเร็จไม่ใช่ต้นทุนต่อผลลัพธ์ และความแตกต่างอาจมีขนาดเป็นสิบเท่าไม่ทางใดก็ทางหนึ่ง

โทเค็นคือส่วนที่ถูก มนุษย์เป็นผู้กำหนดกรอบปัญหา เตรียมต้นฉบับ และขับเคลื่อนการทำให้เป็นทางการ แรงงานนั้นไม่ได้อยู่ใน 2,000 ดอลลาร์

ส่วนเดียวที่คุณสามารถกำหนดราคาได้ในวันนี้คือตัวเลขฐาน (baseline) เนื่องจาก OrcaRouter ส่งผ่านราคารายการของผู้ให้บริการตรงๆ โดยไม่บวกกำไร (0% markup) GPT-5.6 Sol จึงมีราคาเท่ากันที่ $5/$30 บน API ของเราเหมือนกับบน API ของ OpenAI — ดังนั้นถ้าคุณต้องการตรวจสอบความถูกต้องของตัวเลขกับปริมาณงานของคุณเอง อัตราที่ในประกาศคืออัตราที่คุณจะจ่ายจริง สิ่งที่ยังไม่มีใครสามารถกำหนดราคาได้คือ Astra เอง และผู้ขายคนไหนที่บอกคุณเป็นอย่างอื่นกำลังเดาสุ่มอยู่

วันวางจำหน่ายถูกกำหนดโดยกรอบเวลา 30 วัน ไม่ใช่โดยการรั่วไหล

OpenAI Astra-4

การรายงานข่าวส่วนใหญ่เกี่ยวกับ "เมื่อไหร่ GPT-6 จะมา" เป็นเพียงการคิดเลขจากข่าวลือ มีข้อจำกัดที่เป็นรูปธรรมมากกว่านั้นอยู่ตรงหน้าเรา และแทบไม่ถูกเชื่อมโยงเข้ากับคำถามนี้เลย

คำสั่งฝ่ายบริหารที่ลงนามเมื่อวันที่ 2 มิถุนายน 2026 สั่งให้หน่วยงานของรัฐบาลกลางจัดตั้งกระบวนการทบทวนโดยสมัครใจ ซึ่งนักพัฒนาระดับแนวหน้าจะส่งโมเดลให้รัฐบาลตรวจสอบล่วงหน้าสูงสุด 30 วันก่อนการเผยแพร่สู่สาธารณะ กรอบการดำเนินงานดังกล่าวมีกำหนดมีผลบังคับใช้อย่างเป็นทางการในวันที่ 1 สิงหาคม ซึ่งเป็นวันเดียวกับที่โพสต์เกี่ยวกับ Astra ถูกเผยแพร่ขึ้น รายงานระบุว่า Astra คาดว่าจะเป็นโมเดลแรกที่ผ่านกระบวนการนี้

คำว่า "Voluntary" กำลังมีบทบาทในประโยคนั้น ในทางปฏิบัติ ฝ่ายบริหารเคยใช้อิทธิพลกับจังหวะการเปิดตัวมาก่อน และพฤติกรรมล่าสุดของ OpenAI เองก็ดูเหมือนการซ้อมใหญ่: GPT-5.6 ถูกจำกัดให้เฉพาะองค์กรที่ผ่านการตรวจสอบประมาณยี่สิบแห่งตั้งแต่วันที่ 26 มิถุนายน ก่อนที่จะเปิดให้เข้าถึงอย่างกว้างขวางในวันที่ 9 กรกฎาคม — ซึ่งเป็นการเปิดตัวแบบเป็นขั้นตอนประมาณสองสัปดาห์

รวมสองข้อเท็จจริงนั้นเข้าด้วยกัน คุณจะได้ประมาณการคร่าวๆ แทนที่จะเป็นการคาดการณ์ หาก Astra ผ่านการตรวจสอบก่อนเปิดตัว 30 วัน แล้วทำซ้ำรูปแบบ GPT-5.6 การเปิดตัวในวงกว้างจะเกิดขึ้นประมาณหกสัปดาห์หลังจากการส่ง และวันที่ส่งคือสิ่งที่เราไม่รู้แน่ชัด นี่คือเหตุผลที่วันที่ในเดือนสิงหาคมที่มั่นใจควรถูกลดความสำคัญ: ขั้นตอนการคัดกรองเป็นกระบวนการที่มีระยะเวลาที่ประกาศไว้ และนาฬิกายังไม่เริ่มเดินอย่างชัดเจน

ตลาดการคาดการณ์ได้เคลื่อนไปในทิศทางนั้นพอดี เมื่ออ่านในวันที่ 5 สิงหาคม 2026 บันได 'GPT-6 ปล่อยภายใน' ของ Polymarket อยู่ที่ 1% สำหรับวันที่ 7 สิงหาคม, 3% สำหรับวันที่ 14 สิงหาคม, 13% สำหรับวันที่ 21 สิงหาคม, 25% สำหรับวันที่ 31 สิงหาคม, 68% สำหรับวันที่ 30 กันยายน และ 89% สำหรับวันที่ 31 ธันวาคม โดยมีปริมาณซื้อขายเกือบหนึ่งล้านดอลลาร์ จงถือว่านั่นคือการคาดการณ์รวมของฝูงชน ไม่ใช่แหล่งข้อมูล — แต่โปรดสังเกตว่าฝูงชนได้ย้ายน้ำหนักไปยังไตรมาสที่ 4 แล้ว

การจดจำสถิติที่ผ่านมาก็ช่วยได้เช่นกัน คำกล่าวอ้างทุกครั้งที่ว่า "GPT-6 จะเปิดตัวสัปดาห์หน้า" ในช่วงสิบสองเดือนที่ผ่านมาล้วนผิดพลาด ข่าวรั่วที่ไม่ได้รับการยืนยันระบุว่าวันที่ 14 เมษายน 2026 เป็นวันเปิดตัว แต่สิ่งที่เปิดตัวจริงในอีกเก้าวันต่อมาคือ GPT-5.5

ข่าวลือที่ถูกจัดระดับ

จัดเรียงตามน้ำหนักที่แต่ละอย่างแบกรับจริง:

ยังไม่ได้ตั้งชื่อ (GPT-6 / GPT-5.7 / คลาสแยกต่างหาก) โดยอ้างอิงจาก The Information ข้อกล่าวอ้างที่น่าเชื่อถือที่สุดที่ไม่ใช่ของ OpenAI ในเรื่องนี้ และเป็นสิ่งที่ควรปรับความคาดหวัง — ระบบที่ประกาศผ่านบทความคณิตศาสตร์อาจไม่ถูกติดฉลากว่าเป็นการก้าวกระโดดข้ามรุ่นเลยก็ได้

โค้ดเนม "Zinc" และ "Magnesium" ถูกพบใน Design Arena.การพบเห็นจากชุมชน รายงานว่าการส่งผลงานถูกปิดใช้งาน ยังไม่ได้รับการยืนยันจาก OpenAI ตีความได้ว่า: การออกรุ่นย่อย GPT-5.x อาจมา ก่อน Astra ซึ่งจะไม่ตอบสนองความคาดหวัง GPT-6 ของใครเลย ขณะเดียวกันก็กลืนกินวงจรข่าว

มีขนาดประมาณ 2 เท่าของ GPT-5.6 Sol โดยราคาอยู่ในช่วงใกล้เคียงกับ GPT-5.6ข่าวลือที่แพร่สะพัด ผู้ปล่อยข่าวยอมรับว่าไม่ได้ทดสอบโมเดลดังกล่าว ฟังดูน่าเชื่อถือแต่ไร้หลักฐานยืนยันโดยสิ้นเชิง

หน้าต่างบริบทขนาด 1.5 ล้านโทเคน. ปรากฏในรายงานรวบรวมข่าวหลุดโดยไม่มีการเอ่ยชื่อแหล่งข่าว. น่าสังเกตว่า Sol มี 1,050,000 โทเคนอยู่แล้ว ดังนั้นนี่จึงเป็นการเพิ่มขึ้นเพียงเล็กน้อย ไม่ใช่การก้าวกระโดด — ซึ่งเป็นเหตุผลให้สงสัยว่ามันเป็น "ข่าวหลุด" ที่เป็นพาดหัว

พารามิเตอร์ประมาณ 10 ล้านล้าน ไม่มีการระบุแหล่งที่มาใด ๆ ที่เราสืบหาได้ เป็นตัวเลขที่ถูกกล่าวถึงซ้ำมากที่สุดและมีหลักฐานสนับสนุนน้อยที่สุดในเรื่องทั้งหมด

ความจำและการปรับแต่งเฉพาะบุคคลเป็นทิศทางที่กำหนดชัดเจน อ้างอิงจากคำกล่าวสาธารณะของ Altman ในการสัมภาษณ์เดือนสิงหาคม 2025 — จริงอยู่ แต่เก่าไปหนึ่งปีแล้ว และเป็นเรื่องทิศทางหลังยุค GPT-5 โดยทั่วไป ไม่เกี่ยวกับ Astra โดยเฉพาะ

สิ่งที่ควรทำจริงๆ ระหว่างตอนนี้กับเวลาที่มันจัดส่ง

การเดินหมากที่ผิดคือการปรับสถาปัตยกรรมใหม่เพื่อรองรับโมเดลที่ยังไม่มี model card การเดินหมากที่ถูกคือการสังเกตว่าปัญหาใดของคุณที่ระบบ multi-agent แบบ long-horizon จะเปลี่ยนไป เพราะนั่นคือส่วนของ stack ที่คุณยังสร้างไว้ไม่เพียงพอในวันนี้ ไม่ว่า OpenAI จะปล่อยอะไรออกมาก็ตาม

สามอย่างในจำนวนนี้คุ้มค่าที่จะสร้างขึ้นเพื่อแข่งขันกับ GPT-5.6 Sol ในตอนนี้:

Cost ceilings per task, not per call. If a single job can run for hours and spend six or seven million output tokens, per-request limits stop protecting you. You need a budget that a whole task inherits, and a hard stop.

การตั้งจุดบันทึกและการดำเนินการต่อได้. การเรียกใช้แบบครั้งเดียวจะส่งคืนผลลัพธ์หรือล้มเหลว การรันเอเจนต์ที่กินเวลาหลายชั่วโมงตายลงในนาทีที่ 90 โดยไม่มีการเขียนข้อมูลถาวรไว้เลย ถือเป็นความล้มเหลวที่มีค่าใช้จ่ายสูงประเภทหนึ่ง ซึ่งโค้ดเบสส่วนใหญ่ไม่เคยต้องเผชิญ

การประเมินผลที่คุณเชื่อถือได้สำหรับปัญหาที่ไม่มีคำตอบอ้างอิงข้อพิสูจน์ทั้งสิบข้อน่าสนใจ ส่วนหนึ่งเพราะ Lean ทำหน้าที่เป็นออราเคิล แทบไม่มีอะไรในระบบการผลิตจริงที่ทำได้แบบนั้น หากคุณไม่สามารถแยกแยะการรันหกชั่วโมงที่ดีจากการรันที่ดูเหมือนดีแต่ผิดพลาดได้ การเพิ่มพลังประมวลผลก็ไม่ช่วยคุณ

สำหรับคำถามเรื่องการสลับ: Astra ไม่มีให้บริการบน OrcaRouter เพราะมันไม่มีให้บริการที่ใดเลย สิ่งที่เราพอจะพูดได้คือ ปัญหาการเปลี่ยนเวอร์ชันบ่อยครั้งได้รับการแก้ไขไปเป็นส่วนใหญ่ในฝ่ายของเรา คีย์เดียวเข้าถึงโมเดลได้มากกว่า 200 รุ่น ดังนั้นไม่ว่ามันจะถูกส่งออกมาในชื่อ GPT-6, GPT-5.7 หรือเป็นระดับที่สี่ของ GPT-5.6 การนำมาใช้ก็เป็นเพียงการเปลี่ยนสตริงโมเดล ไม่ใช่การย้ายระบบ — ไม่ต้องมีสัญญาฉบับที่สอง ไม่ต้องมี SDK ใหม่ และสำหรับโมเดล frontier ที่ยังไม่ผ่านการพิสูจน์โดยเฉพาะ การสลับสำรองอัตโนมัติคือสิ่งที่ทำให้คุณประเมินมันในโหลดงานจริงได้ แทนที่จะเดิมพันเส้นทางการผลิตบนระบบที่ไม่มีใครนอกห้องแล็บเคยทดสอบภายใต้ความเครียด คุณส่งทราฟิกบางส่วนไปให้มัน โดยมี Sol เป็นตัวสำรองรองรับอยู่ข้างใต้ แล้วคุณจะรู้ผล

คำถามที่ควรค่าแก่การตอบ

Astra เหมือนกับ GPT-6 หรือไม่?

ไม่จำเป็น และนั่นคือความไม่แน่นอนที่ส่งผลกระทบมากที่สุดในเรื่องนี้ OpenAI ยืนยันว่า Astra คือโมเดลหลักรุ่นถัดไป แต่ยังไม่ได้ตัดสินใจเรื่องชื่อสำหรับการเปิดตัว รายงานข่าวระบุว่า GPT-6, GPT-5.7 และโมเดลอีกคลาสหนึ่งที่แยกต่างหาก ต่างก็อยู่ในตัวเลือกพร้อมกับ Sol, Terra และ Luna เป็นไปได้โดยสิ้นเชิงที่โมเดลชื่อ GPT-6 จะไม่เกิดขึ้นจริง และการก้าวกระโดดด้านความสามารถที่ผู้คนรอคอยอาจมาในชื่อที่ไม่มีใครเคยจับตามอง

วันนี้ฉันสามารถเข้าถึง Astra ในรูปแบบใดก็ได้หรือไม่

ไม่ — ไม่ใช่ใน ChatGPT ไม่ผ่าน API ไม่ผ่านตัวกลางหรือผู้ค้าต่อรายใด สิ่งที่เปิดเผยต่อสาธารณะในตอนนี้คือ เอกสารวิชาการ บทวิเคราะห์แนวคิดเชิงเหตุผล และคลังเก็บ Lean หากบริการใดอ้างว่าสามารถให้สิทธิ์เข้าใช้งาน Astra ได้ บริการนั้นก็อาจจะขายต่อบริการอื่นหรือไม่ก็โกหก สิ่งเดียวที่คุณสามารถทำได้อย่างเป็นประโยชน์จริง ๆ กับการเปิดตัวครั้งนี้ในตอนนี้คือ การคอมไพล์บทพิสูจน์ด้วยตัวคุณเอง

แอสตร้าแก้ปัญหาที่นักคณิตศาสตร์มนุษย์แก้ไม่ได้จริงหรือ?

มันได้สร้างบทพิสูจน์ที่ผ่านการตรวจสอบอย่างเป็นทางการสำหรับข้อความที่ยังไม่มีคำตอบมานานอย่างน้อยหนึ่งทศวรรษ ซึ่งเป็นผลลัพธ์ที่แท้จริงและไม่ธรรมดา — และการตรวจสอบนี้ถือว่าเหนือกว่ามาตรฐานปกติของอุตสาหกรรมหนึ่งขั้น แต่ "การผ่านการตรวจสอบด้วย Lean" ไม่ใช่ "การผ่านการตรวจสอบโดยผู้เชี่ยวชาญ" และคำถามเชิงกรอบที่ว่าข้อความเชิงรูปแบบแต่ละข้อความครอบคลุมปัญหาหลักที่เป็นประเด็นสำคัญหรือไม่ คือส่วนที่ Lean ไม่สามารถตอบได้ ผู้เชี่ยวชาญที่อ่านต้นฉบับต่างให้ความเห็นเชิงบวก แต่ยังไม่มีฉบับใดที่ผ่านการตรวจสอบโดยผู้ทรงคุณวุฒิ คาดว่าข้อสรุปนี้จะชัดเจนมากขึ้นในอีกหลายเดือนข้างหน้า ไม่ว่าผลจะออกมาในทิศทางใด

ตัวเลข 2,000 ดอลลาร์หมายความว่างานวิจัยระดับแนวหน้าตอนนี้มีราคาถูกแล้วหรือไม่

นั่นหมายความว่าการรันโทเคนที่ชนะนั้นมีต้นทุนถูก ด้วยราคาของโมเดลอื่น โดยไม่นับรวมความล้มเหลวและไม่นับรวมมนุษย์ ข้อยกเว้นทั้งสามข้อนี้แต่ละข้ออาจมีผลกระทบใหญ่ การอ่านอย่างตรงไปตรงมาคือ ต้นทุนส่วนเพิ่มของการค้นหาบทพิสูจน์อัตโนมัติที่ประสบความสำเร็จได้ลดลงต่ำพอที่จะน่าสนใจ ไม่ใช่ว่าปัญหาที่เปิดอยู่สิบข้อตอนนี้มีราคาเท่ากับแล็ปท็อปเครื่องหนึ่ง

อะไรที่จะยุติเรื่องนี้ได้จริงๆ

สามสิ่งเฉพาะ ซึ่งไม่มีสิ่งใดที่เป็นข่าวลือ และทั้งหมดสามารถตรวจสอบได้เมื่อมันเกิดขึ้น

การ์ดโมเดลและหน้าข้อมูลราคา นั่นคือช่วงเวลาที่ Astra หยุดเป็นเพียงผลงานวิจัยและกลายเป็นสิ่งที่คุณสามารถนำมาวางแผนได้ — และเป็นช่วงเวลาที่คำถามเรื่องชื่อคลี่คลายตัวเอง

การสร้างที่เก็บ Lean ขึ้นมาใหม่โดยอิสระ โดยผู้เชี่ยวชาญที่ตรวจสอบนิยามและการลดรูปอย่างไม่เป็นทางการ ไม่ใช่แค่การตรวจสอบชนิดข้อมูลเท่านั้น ไดเรกทอรี ComparatorChallenges ชี้ให้เห็นว่า OpenAI คาดหวังสิ่งนี้ หากข้อความเชิงรูปนัยยังคงผ่านการตรวจสอบอย่างเข้มงวดนั้น ผลลัพธ์ก็จะถูกมองข้ามได้ยากขึ้นมาก แต่ถ้าความไม่ตรงกันปรากฏขึ้นแม้เพียงหนึ่งในสิบ ข้อกล่าวอ้างทุกข้อในชุดก็จะถูกอ่านทบทวนใหม่

หลักฐานว่าการนับเวลาการทบทวนของรัฐบาลกลางได้เริ่มต้นขึ้นแล้ว ภายใต้ช่วงเวลา 30 วันก่อนการวางจำหน่าย การส่งครั้งนั้นเป็นสัญญาณที่เชื่อถือได้เร็วที่สุดของวันวางจำหน่าย ซึ่งให้ข้อมูลมากกว่าภาพหน้าจอถัดไปของรายการที่ถูกปิดใช้งานในลีดเดอร์บอร์ดสนามประลองอย่างมาก

จนกว่าจะถึงตอนนั้น ข้อความที่แม่นยำนั้นแคบและควรยึดถือไว้: เรือธงตัวถัดไปของ OpenAI มีชื่อ หลักฐานที่ตรวจสอบได้ด้วยเครื่องสิบชิ้น การสาธิตที่วอชิงตัน และไม่มีอะไรอื่นอีก ใครก็ตามที่เสนอวันที่ให้คุณกำลังเดา และใครก็ตามที่เสนอจำนวนพารามิเตอร์ให้คุณกำลังแต่งเรื่องขึ้นมา

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube