
โมเดลแบบวนซ้ำตัวที่สองของ OpenAI: สิ่งที่ข้อมูลรั่วไหล 'แกนต้องห้าม' จาก DevDay อ้างจริง ๆ คืออะไร
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 177 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1323 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
ข้อกล่าวอ้างที่บทความนี้พูดถึงมีแหล่งที่มาเพียงแหล่งเดียว และมันคือโพสต์เดียวบน X เมื่อวันที่ 24 กันยายน บัญชี @scaling01 เขียนว่าผู้ให้บริการ "เปิดประตูน้ำท่วมและจะเปิดตัวโมเดลภาษาที่วนซ้ำตัวที่สองของพวกเขา นอกเหนือจาก GPT-6 Astra ในงาน DevDay" พร้อมอธิบาย recurrent depth ว่าเป็น "แกนต้องห้าม" และชี้ว่ามัน "ไม่ต้องห้ามอีกต่อไปแล้ว" เท่านั้นคือทั้งหมด: ไม่มีชื่อโมเดล ไม่มี ID โมเดล ไม่มีราคา ไม่มีวันที่ใดนอกจากคีย์โน้ต DevDay วันที่ 29 กันยายนในซานฟรานซิสโก และไม่มีถ้อยคำใดจากผู้ให้บริการ สิ่งที่ทำให้ข้อกล่าวอ้างนี้คุ้มค่าเวลาของผู้อ่านไม่ใช่ทวีต แต่เป็นข้อเท็จจริงที่เกิดขึ้นจริงรองรับอยู่ข้างใต้ GPT-6 Astra ซึ่งผู้ให้บริการเปิดตัวเมื่อวันที่ 3 กันยายน เป็นโมเดลระดับโปรดักชันตัวแรกจากห้องแล็บรายใหญ่ใด ๆ ที่รายงานข่าวเชื่อมโยงเข้ากับสถาปัตยกรรมแบบวนซ้ำที่มีความลึกเชิงกำทวน GPT-6 Sol และ GPT-6 Luna ที่เปิดให้ใช้เมื่อวันที่ 22 กันยายน ในราคา 2 ดอลลาร์ขาเข้า / 10 ดอลลาร์ขาออก และ 0.10 ดอลลาร์ขาเข้า / 0.50 ดอลลาร์ขาออก ต่อล้านโทเค็น ได้เปลี่ยนเรือธงนั้นให้กลายเป็นบันไดราคา การมีโมเดลแบบวนซ้ำตัวที่สองจะหมายความว่าผู้ให้บริการเลิกมอง recurrent depth เป็นการเดิมพันครั้งเดียวอีกต่อไป แต่เป็นสถาปัตยกรรมถาวร — ซึ่งเป็นข้อกล่าวอ้างที่ใหญ่กว่าการเปิดตัวใด ๆ และตรวจสอบได้ยากกว่ามาก
นี่เป็นบทความแบบ "สิ่งที่เรารู้จนถึงตอนนี้" ทุกอย่างที่อ้างถึงผู้โพสต์หรือการรายงานแบบไม่เปิดเผยตัวตนจะถูกระบุไว้เช่นนั้น และไม่มีสิ่งใดในนี้ที่ควรตีความว่าเป็นการประกาศอย่างเป็นทางการ
ทำไมวลี 'forbidden axis' จึงเป็นส่วนที่น่าสนใจที่สุดของทวีต
ถ้อยคำนี้เป็นของผู้โพสต์เอง ไม่ใช่ศัพท์เฉพาะทาง แต่ก็ชี้ไปที่สิ่งที่มีอยู่จริง ในการขยายขนาดทรานส์ฟอร์เมอร์มีแกนที่ชัดเจนสามแกน ได้แก่ พารามิเตอร์ ข้อมูล และคอมพิวต์สำหรับฝึก ความลึกจากการเกิดซ้ำเป็นแกนที่สี่ และเป็นแกนที่แปลก แทนที่จะซ้อนบล็อกที่แตกต่างกัน N บล็อก โมเดลแบบวนลูปใช้ชุดบล็อกเล็ก ๆ ชุดเดิมซ้ำ R ครั้ง ดังนั้นความลึกที่มีผลจึงประมาณจำนวนเลเยอร์คูณจำนวนรอบ ขณะที่จำนวนพารามิเตอร์คงที่ Google DeepMind วางทฤษฎีนี้ไว้ใน การให้เหตุผลด้วยความคิดแฝง: ว่าด้วยพลังของทรานส์ฟอร์เมอร์แบบวนลูป และงานที่ถูกอ้างอิงอย่างกว้างขวางคือ การขยายขนาดคอมพิวต์ ณ เวลาทดสอบด้วยการให้เหตุผลแฝง: แนวทางความลึกแบบเกิดซ้ำ ได้แสดงเหตุผลในทางปฏิบัติ
มันไม่ใช่ความลึกที่ได้มาฟรี ๆ งานด้านการสเกลแบบ iso-depth บนโมเดลภาษาที่วนซ้ำให้ค่ากำลังของความสมมูลเชิงการเกิดซ้ำ (recurrence-equivalence exponent) อยู่ที่ประมาณ 0.46 — หมายความว่าการวนเพิ่มหนึ่งรอบให้สิ่งที่คุณได้ประมาณ 46% ของสิ่งที่บล็อกใหม่จริง ๆ จะให้ได้ คุณกำลังซื้อความลึกในราคาลด และจ่ายด้วยพลังประมวลผลแบบอนุกรมแทนที่จะเป็นหน่วยความจำ นั่นเป็นการแลกเปลี่ยนที่คุ้มค่า ถ้าคุณถูกจำกัดด้วยหน่วยความจำหรือต้องการให้โมเดลเล็กทำงานเหมือนโมเดลใหญ่ ซึ่งก็คือการแลกเปลี่ยนที่ชั้นราคาถูกของตระกูลใด ๆ กำลังมองหาพอดี
แล้วทำไมถึง "ต้องห้าม"? เพราะการคำนวณที่เกิดขึ้นภายในลูปนั้นเกิดขึ้นในสถานะที่ซ่อนอยู่ ไม่ใช่ในโทเค็นที่ปล่อยออกมา การติดตาม Chain-of-Thought — การอ่านสิ่งที่โมเดลเขียนลงในขณะที่มันคิด — เป็นเครื่องมือสร้างความมั่นใจหลักของอุตสาหกรรมตั้งแต่โมเดลแบบ reasoning มาถึง และเป็นเครื่องมือที่ทำให้เหตุการณ์เอเจนต์ของ Hugging Face ในเดือนกรกฎาคมเป็นที่เข้าใจได้เลยสำหรับผู้สอบสวน โมเดลที่ทำงานในพื้นที่แฝง (latent space) มากขึ้น จะให้ข้อมูลกับเครื่องมือนั้นน้อยลงในการอ่าน นั่นคือข้อโต้แย้งต่อการทำลูปที่แนวหน้า (frontier) มาตลอดสองปี และเป็นเหตุผลว่าทำไมเทคนิคนี้จึงแพร่หลายในน้ำหนักเปิด — ของ ByteDance Seed ที่ชื่อว่า Ouro ที่ 1.4B และ 2.6B และ Nanbeige4.2-3B, ซึ่งรันสแต็ก 22 เลเยอร์สองรอบ — ในขณะที่ห้องแล็บที่มีคำมั่นด้านความปลอดภัยที่เผยแพร่แล้วยังห่างไกลจากมัน เอกสารของ Alibaba เกี่ยวกับ MeSH และ SpiralFormer โจมตีปัญหาเดียวกันจากด้านประสิทธิภาพ
สิ่งที่ OpenAI ได้กล่าวไว้จริง ๆ และสิ่งที่ยังไม่ได้กล่าว
รายงานที่เริ่มเรื่องนี้คือรายงานของ The Informationเมื่อวันที่ 1 และ 2 ว่า Astra ใช้เทคนิคที่เรียกว่า recurrent depth ซึ่งมีอีกชื่อหนึ่งว่า opaque recurrence นั่นเป็นสำนักข่าวที่มีแหล่งข่าวหนักแน่นและมีผลงานเป็นที่ประจักษ์จริง และนี่ก็ยังเป็นเพียงการรายงานข่าว ไม่ใช่เอกสารยืนยัน OpenAI ไม่เคยตีพิมพ์บทความด้านสถาปัตยกรรมที่ยืนยันการออกแบบแบบวนซ้ำ และบทวิเคราะห์ Astra ของ Sebastian Raschka ที่มีผู้อ่านกันอย่างแพร่หลายก็ระบุตรง ๆ ว่าโครงสร้างแบบวนซ้ำนั้นเป็นการอนุมานจากคำกล่าวต่อสาธารณะ — การสร้างแบบจำลองของเขามี Astra รันบล็อก 22 บล็อกของตนสองรอบ เท่ากับการใช้บล็อกจริง 44 ครั้ง โดยสองลูปเป็นค่าที่เหมาะสมที่สุด และการเพิ่มลูปขึ้นจะทำให้การฝึกไม่เสถียร
สิ่งที่คนของ OpenAI เองกล่าวนั้นแคบกว่าและระมัดระวังมากกว่าที่ทั้งการรายงานข่าวหรือกระแสต่อต้านบ่งชี้ หัวหน้านักวิทยาศาสตร์ Jakub Pachocki โพสต์เมื่อวันที่ 2 กันยายนว่า ความลึกของกราฟการคำนวณของโมเดลแนวหน้า ซึ่งรวมถึง Astra อยู่ในช่วงไม่เกินสองเท่าของ GPT-4 — เป็นการวนซ้ำในปริมาณจำกัด ไม่ใช่การเรียกซ้ำแบบสุดขั้วอย่างที่พาดหัวข่าวบางแห่งสื่อ — และคัดค้านสิ่งที่เขาเรียกว่าการรายงานที่สับสน พร้อมยอมรับว่าการตรวจสอบ chain-of-thought นั้นเปราะบางและมีแนวโน้มไปในทางลบ การ์ดระบบของ Astra มีรายงานว่าระบุว่าความสามารถในการตรวจสอบร่องรอยการให้เหตุผลลดลงจาก GPT-5.6 Solซึ่งเป็นการยอมรับที่แท้จริง และไม่ได้ขึ้นอยู่กับว่าสถาปัตยกรรมใดเป็นสาเหตุ
ปฏิกิริยาด้านความปลอดภัยนั้นดังก้อง Buck Shlegeris จาก Redwood Research กล่าวว่าเขากังวลอย่างยิ่ง และเตือนว่าการสเกล recurrence ให้ใหญ่ขึ้นอาจ "ทำลายความสามารถในการตรวจสอบ CoT อย่างสิ้นเชิง"; Ryan Greenblatt และ Zvi Mowshowitz ได้โต้แย้งแบบเดียวกันในน้ำเสียงที่ต่างกัน ข้อโต้แย้งที่มีประโยชน์ที่สุดมาจาก Raschka: OpenAI ได้ปกปิดร่องรอยการให้เหตุผลดิบมาตั้งแต่รุ่น o1 โดยไม่คำนึงถึงสถาปัตยกรรม และการที่โมเดลที่แข็งแกร่งกว่าปล่อย chain of thought ที่สั้นกว่า ไม่ใช่หลักฐานในตัวเองว่ามีช่องทางการให้เหตุผลที่ซ่อนอยู่
นำสองย่อหน้านั้นมารวมกัน แล้วคุณจะได้สถานการณ์ที่ทวีตนั้นกำลังเดิมพันอยู่ “Astra ถูกลูปแล้ว” เป็นรายงานที่น่าเชื่อถือซึ่ง OpenAI ปฏิเสธที่จะยืนยัน “โมเดลลูปตัวที่สองจะเปิดตัวในวันที่ 29 กันยายน” เป็นโพสต์เดียว
ห้าข่าวหลุดของ OpenAI ในเดือนกันยายน และข่าวนี้อยู่ตรงไหน
เดือนกันยายนก่อให้เกิดกลุ่มเรื่องราวการรั่วไหลของ OpenAI อย่างหนาแน่น และสิ่งที่มีประโยชน์เกี่ยวกับเรื่องเหล่านี้ก็คือ它們ไม่ได้เป็นหลักฐานประเภทเดียวกันทั้งหมด
• 3 กันยายน — สตริง gpt-6-astra และ gpt-6-astra-aeon ปรากฏอยู่ในแฟล็กฟีเจอร์ของ Statsig ภายใน Codex Desktop ซึ่งถูกแคปหน้าจอโดย @notjazii และถูกขยายความต่อโดย @kimmonismus เรื่องราวของเอเจนต์ Aeon ถือกำเนิดจากตรงนั้น ผ่านไปห้าสัปดาห์ก็ยังไม่มีหน้าสินค้า ไม่มีราคา ไม่มีเอกสาร และไม่มีเบนช์มาร์กสำหรับ Aeon และไม่มี ID โมเดลใดที่ใช้งานได้จริง
• 21 กันยายน — สตริง "GPT-6 Sol medium" ปรากฏขึ้นในบันทึกการ merge ของ NVIDIA
• 22 กันยายน — พาธรีจิสทรี Azure สามพาธ สำหรับ gpt-6-sol, gpt-6-luna และ gpt-6-astra-minor ถูกโพสต์จากฟอรัมนักพัฒนาชาวจีน locdd.com ในฐานะ URL ของ Microsoft ที่ใช้งานจริง เมื่อเราเรียกดึงเอนด์พอยต์การกำหนดค่าของ playground สาธารณะในวันถัดมา ชื่อใหม่ทั้งสามชื่อกลับไม่มีอยู่ในนั้น รีจิสทรีมี gpt-6-astra และรายการรุ่น GPT-5.6 ที่เก่ากว่าแทน
• 22 กันยายน — GPT-6 Sol และ GPT-6 Luna เปิดตัวแล้ว ราคา, รหัสโมเดล, บันทึกประจำรุ่นของ SDK, รายการบน Bedrock, รายการในตัวเลือกของ GitHub Copilot และค่าเริ่มต้นของ Perplexity ตามมาทั้งหมดภายในหนึ่งวัน
รูปแบบนี้ไม่ยากที่จะมองออก ประเภทของการรั่วไหลที่มีหลักฐานอยู่ภายในช่องทางที่เปิดใช้งานจริง — ไม่ว่าจะเป็นบันทึกการเปิดตัว SDK, ทะเบียนคลาวด์, ฟีเจอร์แฟล็กบนเดสก์ท็อป — กลายเป็นผลิตภัณฑ์อยู่เรื่อย ๆ ส่วนประเภทของการรั่วไหลที่เป็นเพียงชื่อไม่เป็นเช่นนั้น คำกล่าวอ้างของวันนี้ ซึ่งเป็นโมเดลภาษาแบบวนซ้ำตัวที่สองจาก OpenAI ในงาน DevDay ไม่มีหลักฐานใด ๆ ประกอบเลย: ไม่มีสตริง ไม่มีแฟล็ก ไม่มีเส้นทางทะเบียน ไม่มีแถวราคา ไม่มี ID ของโมเดล นั่นไม่ได้ทำให้มันผิด มันทำให้มันตรวจสอบจากภายนอกไม่ได้ ซึ่งเป็นคำอธิบายที่แตกต่างและซื่อตรงกว่า
ตารางงาน DevDay ที่แวดล้อมเรื่องนี้เป็นของจริง และมีการบันทึกไว้อย่างละเอียดผิดปกติ
สิ่งเดียวที่คุณระบุวันที่ได้อย่างแม่นยำก็คืออีเวนต์นี้ DevDay 2026 ได้รับการยืนยันแล้วสำหรับวันอังคารที่ 29 กันยายน ณ Fort Mason ใน San Francisco โดยมี Sam Altman เป็นผู้กล่าวสุนทรพจน์หลัก พร้อมการถ่ายทอดสดฟรี — OpenAI ประกาศวันที่นี้ตั้งแต่เดือนเมษายน
สิ่งที่คาดว่าจะมีในนั้นถูกส่งสัญญาณล่วงหน้าชัดกว่าปกติ Altman โพสต์เมื่อวันที่ 15 กันยายนว่า OpenAI มี "big ship this week, and then for devday ship x 6" และถอนคำพูดครึ่งแรกกลับในเย็นวันถัดมา: "the main thing i was excited about launching this week will be next week instead, but imo worth the wait!" หัวหน้าฝ่ายผลิตภัณฑ์ Tibo Sottiaux ผู้ที่วางภาพสัปดาห์นั้นให้มีขนาดเท่างาน DevDay กล่าวเมื่อวันที่ 19 กันยายนว่าการเปิดตัวยังจะมาในวันอังคาร และในวันที่ 22 กันยายน มันก็มาถึง — Sol และ Luna พร้อมกับการรีเซ็ตการใช้งาน Codex ที่เก็บสำรองไว้สำหรับบัญชีแบบเสียค่าใช้จ่าย อ่าน "ship x 6" ว่าเป็นจำนวนหกสิ่งที่จะส่งมอบรอบ ๆ DevDay แล้วโมเดลแบบวนซ้ำตัวที่สองก็เข้ากับความหมายปกติของวลีนี้ได้อย่างสบาย ๆ; แต่ถ้าอ่านเป็นคำพูดเกินจริง มันก็ไม่เข้ากันเลย ไม่ว่าจะทางไหน มันก็เป็นโพสต์ของผู้ก่อตั้ง ไม่ใช่โรดแมป
การรั่วไหลที่ใกล้เคียงกันชี้ไปในทิศทางเดียวกันโดยไม่เอ่ยชื่อโมเดล บิลด์ Codex Cloud ปรากฏขึ้นใน ChatGPT เดสก์ท็อปบิลด์ 9922 พร้อมการผสานรวม Tailscale และพร็อกซี และโฟลว์การเริ่มต้นใช้งานแสดงระดับแผนสำหรับนักพัฒนา — Free, Prototype และ Accelerate โดยตัวสุดท้ายราคา $50 — ไม่กี่วันก่อนคีย์โนต ทั้งสองไม่ใช่โมเดลที่วนซ้ำ ทั้งคู่สอดคล้องกับ DevDay ที่เน้นแพลตฟอร์มมากกว่าการวิจัย
ถ้ามันเป็นของจริง มันคือรุ่นไหน
ยังไม่มีใครรายงานตัวตน ดังนั้นต่อไปนี้จึงเป็นการอนุมานและควรอ่านโดยเข้าใจว่าเป็นเช่นนั้น
เส้นทางที่สั้นที่สุดสู่ “โมเดลแบบวนซ้ำตัวที่สองของ OpenAI” คือรุ่นสืบทอดของ Astra อัลต์แมนกล่าวว่าโมเดลที่มีความสามารถสูงกว่ากำลังจะมา “ในไม่ช้ามาก” และวิธีที่ถูกที่สุดในการสร้างโมเดลแบบนั้นบนฐานความลึกแบบเกิดซ้ำคือคงสถาปัตยกรรมไว้แล้วเพิ่มงบการวนซ้ำ — เกิดซ้ำต่อโทเคนมากขึ้นแทนที่จะเพิ่มน้ำหนัก การตีความแบบนั้นยังอธิบายกรอบคำว่า “floodgates” ได้ดีที่สุด เพราะเรือธงตัวที่สองบนสถาปัตยกรรมเดียวกันคือคำประกาศว่าเรือธงตัวแรกได้ผล
การตีความครั้งที่สองคือระดับใหม่ภายในสาย GPT-6 ที่มีอยู่ ไวยากรณ์การตั้งชื่อได้ให้กำเนิดสตริง gpt-6-astra-minor, gpt-6-sol และ gpt-6-luna ขึ้นมาแล้ว และรุ่นพี่น้องแบบวนซ้ำที่งบประมาณความลึกต่างกันก็สอดคล้องอย่างยิ่งกับตระกูลที่ปัจจุบันครอบคลุมตั้งแต่ $0.10 ถึง $50 ต่อโทเค็นเอาต์พุตหนึ่งล้านโทเค็น โมเดลแบบวนซ้ำที่ถูกกว่าจะเป็นเวอร์ชันของสิ่งนี้ที่ผู้อ่านรู้สึกได้ในกระเป๋าสตางค์มากที่สุด
การตีความประการที่สาม — การเปิดตัวโมเดลน้ำหนักเปิดแบบวนซ้ำ — เป็นข้อที่ได้รับการสนับสนุนน้อยที่สุด มันน่าจะอธิบายวลีนี้ได้ดีกว่าอย่างอื่น และงานวิจัยแบบเปิดเกี่ยวกับโมเดลวนซ้ำที่มันจะไปอยู่เคียงข้างนั้นมีอยู่แล้วใน Ouro และ Nanbeige4.2-3B แต่ OpenAI ยังไม่ได้ประกาศอะไรในทิศทางนั้นสำหรับเจเนอเรชันนี้ และการประดิษฐ์ผลิตภัณฑ์ขึ้นมาให้เข้ากับคำหนึ่งคำคือวิธีที่การรายงานข่าววงในไปผิดทาง

อะไรจะทำให้สิ่งนี้สามารถตรวจสอบได้ก่อนวันที่ 29 กันยายน
เฝ้าดูพื้นผิวที่แก้ไขการรั่วไหลสามครั้งล่าสุด ตามลำดับนี้:
• ID ของโมเดลที่ resolve ได้ใน API ของ OpenAI หรือแถวใหม่บนหน้าราคาของ OpenAI
• บันทึกประจำรุ่นใน SDK openai-go หรือ openai-node ที่ระบุตัวระบุโมเดลใหม่ — นั่นแหละคือวิธีที่ Sol และ Luna ทำให้การมาถึงของตัวเองรั่วไหลออกมา โดยที่ SDK v3.65.0 ปล่อยตัวระบุโมเดลออกมาก่อนที่หน้าเพจประกาศจะเปิดขึ้นหลายชั่วโมง
• รายการ Bedrock หรือ Azure หรือสตริงแฟล็ก Statsig ใหม่ในบิลด์เดสก์ท็อป
• ประโยคเกี่ยวกับสถาปัตยกรรมใน system card นี่คือประโยคที่จะสำคัญที่สุดและจะปรากฏเป็นอันดับสุดท้าย เพราะ OpenAI ไม่เคยยืนยันการออกแบบแบบวนซ้ำสำหรับ Astra
อะไรก็ตามที่ไม่ใช่สามอันแรกก็เป็นเพียงชื่อ และชื่อก็เป็นสิ่งที่เชื่อถือได้น้อยที่สุดในบรรดาผลลัพธ์ของวงจรทั้งหมดนี้

ทำไมเรื่องนี้จึงสำคัญ แม้ว่าในที่สุดทวีตนั้นจะผิดก็ตาม
มีสองสิ่งที่จะเปลี่ยนแปลง หากความลึกแบบเกิดซ้ำกลายเป็นมาตรฐานแทนที่จะเป็นข้อยกเว้น
ประการแรกคือการประกันความมั่นใจ หากรุ่นถัดไปใช้การให้เหตุผลของตนมากขึ้นในสถานะซ่อนเร้น การประเมินใด ๆ ที่พึ่งพาการอ่านสายความคิดที่เขียนออกมาของโมเดลจะสูญเสียสัญญาณ — และนั่นรวมถึงการประเมินความปลอดภัยโดยบุคคลที่สาม ไม่ใช่เพียงการเฝ้าระวังของ OpenAI เอง นั่นเป็นข้อมูลนำเข้าด้านการจัดซื้อจัดจ้างสำหรับใครก็ตามที่มีข้อกำหนดด้านการประกันความมั่นใจ และมันจะไม่ปรากฏให้เห็นในตาราง benchmark
ข้อที่สองคือรูปทรงของบันไดราคา การทำลูปแลกพารามิเตอร์กับพลังประมวลผลแบบอนุกรม จึงย้ายต้นทุนจากหน่วยความจำไปสู่เวลา: อาจถูกกว่าในการโฮสต์ แต่อาจช้ากว่าต่อโทเคน ไลน์ GPT-6 กำหนดราคาของการแลกเปลี่ยนนี้ไว้อย่างชัดเจนอยู่แล้ว — GPT-6 Astra ที่ $10 ขาเข้า / $50 ขาออก ต่อล้านโทเคน คือโมเดลระดับลึก GPT-6 Sol ที่ $2 / $10 คือตัวที่เร็ว GPT-6 Luna ที่ $0.10 / $0.50 คือตัวที่รองรับปริมาณสูง ทั้งสามตัวเปิดให้ใช้งานจริงบน OrcaRouter ในราคาตามรายการของ OpenAIโดยไม่บวกเพิ่ม ดังนั้นหากโมเดลตัวที่สี่แบบทำลูปเปิดตัวในวันที่ 29 กันยายน อัตราค่าบริการฝั่งเราก็คืออัตราค่าบริการของผู้ขายในวันที่มันเปิดตัว — และการลดราคาของผู้ขายจะมีผลที่นี่ในวันเดียวกับที่มีผลที่นั่น
ประโยชน์ใช้สอยจริงของการรั่วไหลแบบนี้ไม่ใช่การคาดการณ์ แต่คือการเตรียมพร้อม โมเดลที่อาจเปิดตัวภายในห้าวันและยังไม่มีเบนช์มาร์กอิสระ คือกรณีที่ระบบสลับสำรองอัตโนมัติ (automatic failover) ถูกสร้างขึ้นมาเพื่อรองรับโดยเฉพาะ: ชี้เส้นทางไปที่โมเดลใหม่ โดยให้ GPT-6 Astra หรือ GPT-6 Sol อยู่เบื้องหลัง แล้วสัปดาห์แรกที่แย่จะทำให้คุณเสียทราฟฟิกเพียงเศษเสี้ยว แทนที่จะเสียเส้นทางโปรดักชันของคุณ นี่ก็เป็นวิธีที่สมเหตุสมผลในการทดสอบโมเดลที่มีความลึกสูงเช่นกัน — routing DSL จะประกอบมันเข้าเป็นหนึ่งการเรียกเคียงข้างโมเดลที่มันตั้งใจจะแทนที่ และ model fusion จะรันกลุ่มของโมเดลเหล่านั้นเทียบกับพรอมต์เดียวกัน ซึ่งเป็นการประเมินสถาปัตยกรรมใหม่ได้เร็วกว่าโพสต์เปิดตัวใด ๆ
คืนนี้มีอะไรเป็นความจริงกันแน่
โพสต์หนึ่งบน X กล่าวว่าโมเดลภาษาที่วนซ้ำรุ่นที่สองของ OpenAI จะมาถึงในวันที่ 29 กันยายน ไม่มีรหัสโมเดล ไม่มีราคา ไม่มีชื่อ ไม่มีแหล่งข่าวที่สอง ไม่มีอาร์ติแฟกต์ ภายใต้โพสต์นั้น: เรือธงที่วางจำหน่ายเมื่อวันที่ 3 กันยายน ซึ่งรายงานข่าวกล่าวว่ามีการวนซ้ำ และที่ OpenAI ไม่เคยยืนยันว่ามีการวนซ้ำ, การลดลงที่ได้รับการยอมรับของความสามารถในการตรวจสอบเส้นทางการให้เหตุผลเมื่อเทียบกับ GPT-5.6 Sol, หัวหน้านักวิทยาศาสตร์ที่กล่าวว่าการวนซ้ำถูกจำกัดให้อยู่ภายในสองเท่าของความลึกกราฟการคำนวณของ GPT-4, และรุ่นราคาถูกที่วางจำหน่ายเมื่อวันที่ 22 กันยายน ซึ่งทำให้คำถามเกี่ยวกับสถาปัตยกรรมมีความเกี่ยวข้องในเชิงพาณิชย์มากกว่าทางวิชาการ
นั่นเป็นข้ออ้างแบบบาง ๆ ที่ตั้งอยู่บนเรื่องเล่าหนาหนึ่ง ซึ่งเป็นรูปแบบปกติของการรั่วไหลห้าวันก่อนงานอีเวนต์ หากโมเดลแบบวนซ้ำตัวที่สองปรากฏที่ Fort Mason ในวันอังคาร รายละเอียดที่น่าสนใจจะไม่ใช่ตัวเลข benchmark — แต่จะเป็นว่าการ์ดระบบกล่าวซ้ำข้อแม้เรื่องความสามารถในการเฝ้าติดตามตรวจสอบหรือไม่ ประโยคเดียวนั้นคือสิ่งที่บอกคุณว่า "ไม่ถูกห้ามอีกต่อไป" เป็นสโลแกนหรือเป็นนโยบาย

การเปรียบเทียบในบทความนี้3
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
