
722 ต้นฉบับคณิตศาสตร์ของ OpenAI: โมเดลที่อยู่เบื้องหลังไม่มีชื่อ ไม่มีราคา และไม่มี API
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
เมื่อเวลา 21:47 UTC ของวันที่ 6 ตุลาคม 2026 ที่เก็บข้อมูลชื่อ openai/math ปรากฏขึ้นบน GitHub โดยไม่มีคำอธิบายและมีคอมมิตเริ่มต้น สิบสี่นาทีต่อมา OpenAI ได้โพสต์มันไปที่ X และเปิดหน้าเพจคู่หูชื่อ "การแบ่งปันความก้าวหน้าของ AI ในสาขาคณิตศาสตร์" สองสิ่งนี้รวมกันบรรยายถึงเหตุการณ์ที่ไม่มีแบบอย่างมาก่อน: ต้นฉบับทางคณิตศาสตร์ 722 ฉบับ จัดกลุ่มเป็น 372 ตระกูล สร้างโดยโมเดลระดับแนวหน้าภายในที่ OpenAI ยังไม่ได้ตั้งชื่อ ยังไม่ได้กำหนดราคา และไม่สามารถเรียกใช้จาก API ใดๆ ได้ โมเดลที่มันอยู่เหนือกว่าคือโมเดลที่คุณสามารถเข้าถึงได้จริงในทุกวันนี้ — GPT-6 Astra ในราคา $10 / $50 ต่อล้านโทเค็น และ GPT-6.1 Sol ในราคา $2 / $10 — และไม่มีโมเดลใดในสองตัวนี้เขียนบทความเหล่านี้ OpenAI กล่าวว่าโมเดลที่เขียนมันยังอยู่ระหว่างการฝึกฝน และกำลังดำเนินการ "ปล่อยอย่างมีความรับผิดชอบ" นี่คือสิ่งที่ได้รับการยืนยันจนถึงขณะนี้ สิ่งที่ยังไม่ได้รับการยืนยัน และคำถามหนึ่งข้อที่ผู้อ่านควรได้จากเรื่องนี้
เริ่มจากสิ่งที่การเปิดตัวนี้ไม่ใช่ มันไม่ใช่การเปิดตัวโมเดล: ไม่มีการ์ดโมเดล ไม่มีตัวระบุ ไม่มีหน้าต่างบริบท ไม่มีตารางเกณฑ์มาตรฐาน ไม่มีวันที่ มันไม่ใช่งานวิจัย: ไม่มีสิ่งใดที่นี่ผ่านการตรวจสอบโดยผู้ทรงคุณวุฒิ และ OpenAI กล่าวอย่างตรงไปตรงมาว่าผลลัพธ์ที่ไม่มีการทำให้เป็นทางการด้วย Lean "อาจมีปัญหา" และมันไม่ใช่การรั่วไหล — เหตุผลที่ชิ้นนี้เขียนในกรอบแบบ "สิ่งที่เรารู้จนถึงตอนนี้" ไม่ใช่เพราะเนื้อหาเป็นความลับ แต่เพราะตัวหัวข้อเอง ซึ่งก็คือโมเดล ยังไม่เปิดตัว ทุกสิ่งอื่นด้านล่างสามารถตรวจสอบเทียบกับรีพอซิทอรี โพสต์ของ OpenAI เอง และกลุ่มที่ปรึกษาที่ OpenAI บอกว่าได้ปรึกษา
อะไรกันแน่ที่เกิดขึ้นเมื่อวันที่ 6 ตุลาคม
ที่เก็บโค้ดนี้เป็นสาธารณะ ได้รับสัญญาอนุญาต Apache-2.0 และเขียนด้วย Lean README ของมันระบุว่าแค็ตตาล็อก “มีต้นฉบับ 722 ชิ้น จัดเป็น 372 กลุ่ม” โดยที่หนึ่งกลุ่มจะรวมผลลัพธ์หลักเข้ากับการให้เหตุผลประกอบ ผลสืบเนื่อง หรือการพิสูจน์ทางเลือก แผนที่ต้นฉบับมีรายละเอียดเพียงพอต่อการตรวจสอบ: 372 กลุ่ม โดยแต่ละกลุ่มมีผลลัพธ์หลักหนึ่งรายการ ระบุพร้อมบทความที่เป็นองค์ประกอบ และในกรณีที่มี ลิงก์การทำให้เป็นทางการใน Lean
โพสต์ของ OpenAI เพิ่มตัวเลขเกี่ยวกับแหล่งที่มา ซึ่งเป็นข้อมูลของทาง OpenAI เองและไม่ได้ผ่านการตรวจสอบอย่างเป็นอิสระ:
• โจทย์ที่ตั้งขึ้น — ประมาณ 4,000 ข้อ ซึ่งกลุ่มโจทย์ที่เผยแพร่ได้รับการคัดเลือกจากจำนวนนี้
• การประมวลผลต่อผลลัพธ์ — โดยเฉลี่ยเทียบเท่ากับการใช้ความคิดของ ChatGPT Pro ประมาณสามชั่วโมง
• สรุปการให้เหตุผล — เผยแพร่แล้ว 10 รายการ ครอบคลุมกลุ่มต่าง ๆ รวมถึงเลขชี้กำลังความอตรรกยะของ π ข้อความคาดการณ์ของมาห์เลอร์แบบสมมาตรและแบบทั่วไป ข้อความคาดการณ์เรื่องความจำกัดโดยตรงของคาปลันสกีในลักษณะเฉพาะสอง สูตรเมซาร์–ปารีซีสำหรับแก้วสปินเจือจาง และระบบวลาซอฟ–แมกซ์เวลล์เชิงสัมพัทธภาพสามมิติ
• นโยบายการปรับปรุงแก้ไข — เวอร์ชันใหม่จะถูกเผยแพร่เมื่อมีการแก้ไข โดยเวอร์ชันก่อนหน้ายังคงสามารถเข้าถึงได้
สาขาต่างๆ ครอบคลุมทั้งแผนที่: ทฤษฎีจำนวน, เรขาคณิตเชิงพีชคณิตและเรขาคณิตเชิงซ้อน, คอมบินาทอริกส์, วิทยาการคอมพิวเตอร์เชิงทฤษฎี, พีชคณิตตัวดำเนินการ, ความน่าจะเป็นและฟิสิกส์คณิตศาสตร์ ชื่อเรื่องบางชื่อในกลุ่มนี้เมื่อมองเผินๆ แล้วเป็นข้อกล่าวอ้างที่ยิ่งใหญ่มาก — ตัวอย่างค้านต่อข้อคาดการณ์การปกคลุมของไรเซอร์, การคูณจำนวนเต็มที่ต่ำกว่า n log n, การคูณเมทริกซ์ที่มีเลขชี้กำลังไม่เกิน 9/4, ข้อคาดการณ์มาเลอร์, ตัวอย่างค้านต่อ Baum–Connes และ Kadison–Kaplansky การที่ข้อใดข้อหนึ่งจะเป็นจริงหรือไม่นั้นเป็นคำถามที่การเผยแพร่นี้ไม่ได้ให้คำตอบแก่คุณ

โมเดลนี้ยังไม่มีชื่อ ยังไม่เปิดตัว และ OpenAI บอกว่ากำลังจะมา
README ชัดเจนไม่มีข้อกังขาเกี่ยวกับผู้เขียนว่า "ต้นฉบับทางคณิตศาสตร์และชิ้นงานประกอบการพิสูจน์ที่ผลิตโดยโมเดล OpenAI ภายใน" โดยส่วนใหญ่ได้มาจาก "การใช้โมเดล OpenAI ภายในที่ยังไม่ได้เปิดตัว" ไม่มีชื่อ ไม่มีขนาด ชื่อที่แพร่หลายในรายงานข่าวอื่น ๆ ยังไม่ได้รับการยืนยันจาก OpenAI และเราจะไม่ให้ชื่อใด ๆ
สิ่งที่ระบุวันที่ได้ก็คือไทม์ไลน์ที่อยู่รอบ ๆ เรื่องนี้ เมื่อวันที่ 28 สิงหาคม 2026 ตามเพจของ OpenAI เกี่ยวกับกลุ่มที่ปรึกษาด้านคณิตศาสตร์ของบริษัท บริษัท "เริ่มฝึกโมเดลภายในตัวใหม่" ซึ่งตั้งแต่นั้นมาได้แก้ปัญหา Navier–Stokes Millennium Prize และปัญหาเปิดที่ค้างมานานกว่า 100 ปัญหา ตามการนับของ OpenAI เอง ผลลัพธ์ของ Navier–Stokes ถูกประกาศแยกต่างหากเมื่อวันที่ 8 กันยายน 2026 โดย OpenAI อธิบายว่าโมเดลที่อยู่เบื้องหลังนั้น "มีความสามารถสูงกว่าอย่างมีนัยสำคัญเมื่อเทียบกับ GPT-6 Astra" และกล่าวว่าการฝึกยังคงดำเนินอยู่ ต้นฉบับสองชิ้นในคอลเลกชันของสัปดาห์นี้ไม่เป็นไปตามขั้นตอนมาตรฐาน ซึ่งน่าสังเกตเพราะหมายความว่าการเผยแพร่นี้ไม่ใช่ไปป์ไลน์แบบเดียวกันทั้งหมด: งานเกี่ยวกับเขตปลอดศูนย์ของฟังก์ชันซีตาของรีมันน์ และบทพิสูจน์ข้อคาดการณ์ฮอดจ์สำหรับพันธุ์อาเบเลียนแบบ CM ถูกจัดการแตกต่างออกไป และ OpenAI กล่าวว่าบทความเกี่ยวกับซีตานั้นได้รับการแก้ไขโดยมนุษย์เพื่อให้อ่านง่ายขึ้น
จากนั้นประโยคที่สำคัญสำหรับใครก็ตามที่วางแผนโดยอิงจากสิ่งนี้: OpenAI เขียนว่ากำลัง "ทำงานเพื่อเปิดตัวโมเดลที่ให้ผลลัพธ์เหล่านี้อย่างมีความรับผิดชอบ" นั่นคือการแสดงเจตนา ไม่ใช่วันที่ จนกว่าจะเปิดตัว โมเดล OpenAI ที่นักพัฒนาสามารถเรียกใช้ได้มีเพียงโมเดลที่อยู่ในรายการราคาแล้วเท่านั้น
"การยืนยัน" ในที่นี้หมายถึงอะไร — และมันสิ้นสุดตรงไหน
นี่คือส่วนที่การรายงานข่าวเกี่ยวกับการเปิดตัวครั้งนี้ส่วนใหญ่ย่อให้เหลือเพียงวลีเดียว และเป็นส่วนที่กำหนดว่าจะให้น้ำหนักกับบทความชิ้นใดชิ้นหนึ่งมากน้อยเพียงใด
OpenAI ระบุชัดเจนว่า "คอลเลกชันนี้รวมผลลัพธ์ที่อยู่ในขั้นตอนการตรวจสอบที่แตกต่างกัน" หลักฐานรูปแบบที่แข็งแกร่งที่สุดในชุดนี้คือการทำให้เป็นรูปแบบทางการด้วย Lean ซึ่งช่วยให้คอมพิวเตอร์ตรวจสอบการพิสูจน์ได้แทนที่จะเป็นมนุษย์ แมนนิเฟสต์การทำให้เป็นทางการของที่เก็บเอง — แค็ตตาล็อกของบทความที่มีผลลัพธ์หลักซึ่งทำให้เป็นทางการแล้ว — มีรายการ 162 รายการ ดังนั้นประมาณหนึ่งในห้าของต้นฉบับ 722 ชิ้นได้รับการสนับสนุนโดยการพิสูจน์ที่เครื่องตรวจสอบได้ในทรีสาธารณะ OpenAI กล่าวว่าจะมีการเพิ่มเติมอีก "เมื่อเราได้รับมา"
ผลลัพธ์ส่วนใหญ่ที่เหลือยังไม่ได้รับการตรวจสอบยืนยันในแง่นั้น และ OpenAI ไม่ได้แสร้งทำเป็นอย่างอื่นกับทั้งคอลเลกชัน: "ผลลัพธ์ที่ยังไม่ได้ทำให้เป็นทางการบางส่วนอาจมีปัญหา เราจะพยายามแก้ไขปัญหาดังกล่าวอย่างรวดเร็ว" รายละเอียดเชิงโครงสร้างสองประการตอกย้ำว่านี่คือการเผยแพร่แบบมีการจัดการ มากกว่าจะเป็นการเผยแพร่แบบเปิด — issues ถูกปิดใช้งานบนรีโพซิทอรี และ pull requests ถูกจำกัดให้เฉพาะผู้ร่วมงาน ไม่มีช่องทางสาธารณะใดในการท้าทายข้อพิสูจน์ที่มีอยู่
ดังนั้น การตีความอย่างตรงไปตรงมาจึงแคบกว่าที่จำนวนในพาดหัวชี้ให้เห็น:
• ตรวจสอบด้วยเครื่อง — ต้นฉบับ 162 ฉบับที่มีผลลัพธ์หลักซึ่งทำให้เป็นทางการแล้วใน Lean tree สาธารณะ
• ไม่ได้ตรวจสอบด้วยเครื่อง — ส่วนที่เหลือ ซึ่ง OpenAI เองระบุว่าอาจมีข้อผิดพลาด
• ความรับผิดชอบของมนุษย์ — ไม่มีการระบุชื่อผู้ใด; กรอบของ OpenAI เองก็คือว่าไม่มีบุคคลใดเข้าใจข้อโต้แย้งที่อยู่เบื้องหลังเนื้อหาส่วนใหญ่ที่ถูกผลิตขึ้น
• การประเมินอิสระ — ไม่มีเผยแพร่เลย การคัดเลือกว่าผลลัพธ์ใด "มีนัยสำคัญ" พอที่จะรวมไว้ทำโดย OpenAI
ทั้งหมดนั้นไม่ได้หมายความว่างานนี้ผิด มันหมายความว่าในตอนนี้ "OpenAI เผยแพร่ข้อพิสูจน์ 722 ข้อ" กับ "ข้อพิสูจน์ 722 ข้อได้รับการตรวจสอบแล้ว" เป็นคนละข้อความ และมีเพียงข้อความแรกเท่านั้นที่เป็นจริงในวันนี้

คณะที่ปรึกษาได้แนบเงื่อนไขมาด้วย และมันถูกบันทึกไว้เป็นหลักฐาน
โพสต์ของ OpenAI ระบุว่าได้ปรึกษากับคณะที่ปรึกษาอิสระด้านคณิตศาสตร์และปัญญาประดิษฐ์ (Advisory Group on Mathematics and Artificial Intelligence) แห่ง Institute for Advanced Study และได้อ้างอิง "คำแนะนำและข้อเสนอแนะสาธารณะ" ของพวกเขา คำแนะนำเหล่านั้นเผยแพร่เมื่อวันที่ 29 กันยายน 2026 หลังจากที่คณะได้รับคำตอบมากกว่า 600 รายการจากชุมชนนักคณิตศาสตร์ และควรค่าแก่การอ่านโดยตรง เพราะคณะนี้ไม่ใช่เพียงตรายางประทับ
เอกสารเดียวกันเปิดด้วยการระบุว่ากลุ่มนี้ไม่สนับสนุนการปฏิบัตินี้เลยแม้แต่น้อย: "ห้องปฏิบัติการ AI ชั้นแนวหน้าบางแห่งกำลังทดสอบปัญหาคณิตศาสตร์ขั้นสูงบนโมเดลที่เป็นกรรมสิทธิ์ซึ่งยังไม่สามารถเข้าถึงได้โดยชุมชนวิทยาศาสตร์ในวงกว้าง... เราไม่สนับสนุนการปฏิบัตินี้ และเราขอให้พวกเขาหยุด" กลุ่มนี้ยังอธิบายว่าตนดำเนินงานอย่างเป็นอิสระ โดยที่สมาชิกไม่ได้รับค่าตอบแทนและไม่มีอำนาจในการตัดสินใจเหนือ OpenAI — คำอธิบายของความสัมพันธ์ที่โพสต์ของ OpenAI เองก็กล่าวในทำนองเดียวกัน
จุดที่ข้อเสนอแนะของกลุ่มและรุ่นที่เผยแพร่นี้สอดคล้องกันคือเรื่องกระบวนการ: การทบทวนวรรณกรรมอย่างละเอียดถี่ถ้วนพร้อมการอ้างอิงถึงงานที่เสนอแนวคิดเหล่านั้น, การเขียนบทพิสูจน์ในรูปแบบมาตรฐานแทนที่จะเป็นผลลัพธ์ดิบจากโมเดล, และการทำเวอร์ชันที่รักษารุ่นก่อนหน้าไว้ จุดที่ทั้งสองไม่สอดคล้องกันคือส่วนที่กลุ่มเรียกว่าหัวใจหลัก — ที่ว่าห้องแล็บซึ่งเผยแพร่ผลลัพธ์ที่ไม่มีใครเข้าใจควรสนับสนุนทุนสำหรับความเข้าใจของมนุษย์ที่ต้องตามมา ผ่านเวิร์กช็อป การประชุม และโครงการต่าง ๆ และว่างานนี้ควรนำโดยชุมชนมากกว่าจะกำกับโดยห้องแล็บ OpenAI ได้ให้คำมั่นว่าจะสนับสนุนทุนสำหรับ "ชุดเวิร์กช็อป การประชุม และโครงการพิเศษว่าด้วยความเข้าใจผลลัพธ์สำคัญที่สร้างโดย AI" และระบุว่าจะมีรายละเอียดตามมา นั่นคือประเด็นที่ยังค้างอยู่ และเป็นประเด็นที่ต้องยึดเป็นเงื่อนไขให้พวกเขาทำตาม
สิ่งที่คุณเรียกใช้ได้ในวันนี้ และ routing มีไว้เพื่ออะไรจริง ๆ ในที่นี้
ไม่มีวิธีใดที่จะส่งคำขอไปยังโมเดลที่ผลิตต้นฉบับเหล่านี้ และไม่มีบุคคลที่สามรายใดสามารถจัดเส้นทางให้ได้ — รายการใดก็ตามที่อ้างเป็นอย่างอื่นกำลังอธิบายถึงโมเดลที่ไม่มีอยู่ในแคตตาล็อกของใครเลย โมเดล OpenAI ที่ใช้งานจริงคือสาย GPT-6 ที่ให้บริการอยู่ และตัวเลขของโมเดลเหล่านี้อยู่ในรายการราคา ไม่ใช่จากการอนุมาน:
• GPT-6 Astra — $10 / $50 ต่อล้านโทเคน, อ่านแคช $1; ระดับบริบทแบบยาวที่เกิน 272K โทเคนพรอมป์ในราคา $20 / $75; บริบท 1.05M โทเคน, เอาต์พุตสูงสุด 128K
• GPT-6.1 Sol — $2 / $10 ต่อล้านโทเค็น, อ่านแคช $0.10; การแบ่งระดับบริบทแบบยาวแบบเดียวกันที่ $4 / $15; บริบท 1.05M โทเค็น, เอาต์พุตสูงสุด 128K
ทั้งสองอยู่ในแค็ตตาล็อกของ OrcaRouter ซึ่งเป็นประเด็นเชิงปฏิบัติสำหรับใครก็ตามที่อ่านการเปิดตัวนี้ในฐานะสัญญาณเกี่ยวกับขีดความสามารถ: โมเดลที่คุณได้รับอนุญาตให้ใช้ในวันนี้ก็คือโมเดลที่พรอมป์ของคุณถูกปรับให้สอดคล้องอยู่แล้ว และช่องว่างระหว่างโมเดลเหล่านั้นกับโมเดลภายในก็คือช่องว่างที่ OpenAI กำลังขอให้นักคณิตศาสตร์ช่วยปิดนั่นเอง
ช่องว่างตรงนั้นก็เป็นเหตุผลหนึ่งที่ควรแยกค่าใช้จ่ายในการทดลองออกจากเส้นทางการใช้งานจริง เมื่อ OpenAI ตั้งชื่อและติดราคาให้โมเดลนี้จริง สัปดาห์แรกจะมีคำกล่าวอ้างเรื่อง benchmark ที่ยังไม่ได้ตรวจสอบถาโถมเข้ามา และมีงานรีอินทิเกรตที่ตื่นตระหนกอีกเพียบ — ข้อโต้แย้งด้าน routing สำหรับแพลตฟอร์มอย่างของเราก็คือ การลองโมเดลที่ยังไม่ผ่านการพิสูจน์จะเสียแค่สตริงชื่อโมเดล ไม่ใช่การย้ายระบบทั้งชุด GPT-6 Astra อยู่ที่ $10 / $50 และ GPT-6.1 Sol อยู่ที่ $2 / $10 ต่อล้านโทเคน ส่งต่อในราคาตามลิสต์โดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ขายเปลี่ยนราคา ราคาใหม่จะมีผลทันทีในวันที่ประกาศ Automatic failover หมายความว่าโมเดลใหม่สามารถรับทราฟฟิกเพียงเสี้ยวหนึ่งและถูกถอดออกได้โดยไม่ทำให้เส้นทางของคำขอหยุดชะงักไปด้วย และ routing DSL ให้คุณประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียว หากคุณอยากได้ความเห็นที่สองเกี่ยวกับการอนุมานที่ยาว แทนที่จะเป็นคำตอบเดียว ทั้งหมดนั้นใช้ไม่ได้กับโมเดลที่ยังไม่เปิดตัว — แต่มันคือโครงสร้างพื้นฐานที่คุณอยากให้พร้อมไว้ก่อนที่โมเดลตัวถัดไปจะมาถึง

สิ่งที่ควรดูต่อไป
สี่สิ่ง เรียงตามลำดับที่สิ่งเหล่านี้น่าจะสำคัญ จำนวนการทำให้เป็นทางการ เพราะมันเป็นตัวเลขเดียวในการเปิดตัวครั้งนี้ที่สามารถเปลี่ยนจาก “OpenAI บอกว่า” ไปเป็น “เครื่องตรวจสอบแล้ว” และมันเปิดเผยต่อสาธารณะ การประเมินผลลัพธ์ที่มีชื่อระบุอย่างเป็นอิสระอย่างแท้จริงเป็นครั้งแรก — นักคณิตศาสตร์นอก OpenAI ที่ตรวจไล่บทความเฉพาะเรื่องอย่างเปิดเผย ไม่ใช่การสรุปชุดผลงานทั้งหมด คลังที่โฮสต์โดยชุมชนซึ่ง OpenAI บอกว่ายังอยู่ระหว่างสำรวจ ซึ่งจะย้ายชิ้นงานออกจากบัญชีของ OpenAI เองและไปอยู่ในมือของวงการ และการเปิดตัวโมเดลเอง ซึ่ง OpenAI ให้คำมั่นแล้วแต่ยังไม่ได้กำหนดเวลา
ต้นฉบับ 722 ชิ้นหมายความว่า AI แก้ปัญหาเหล่านี้ได้แล้วหรือ
สำหรับส่วนย่อยหนึ่ง หากคณิตศาสตร์นั้นถูกต้อง: คอลเลกชันนี้อ้างว่ามีตัวอย่างค้านและบทพิสูจน์ครอบคลุมปัญหาที่เปิดอยู่ซึ่งเป็นที่รู้จักกันดี และ 162 บทความมีการทำให้เป็นทางการที่เครื่องตรวจสอบได้รองรับผลลัพธ์หลักของบทความเหล่านั้น สำหรับบทความที่เหลือ ข้ออ้างคือโมเดลได้สร้างต้นฉบับเกี่ยวกับปัญหานั้น ซึ่งเป็นข้อกล่าวอ้างที่อ่อนกว่าการแก้ปัญหาที่ได้รับการตรวจสอบแล้ว และ OpenAI เองก็เตือนว่าผลลัพธ์ที่ไม่ได้ทำให้เป็นทางการอาจมีข้อผิดพลาด ความแตกต่างระหว่าง "สร้างบทพิสูจน์" กับ "มีบทพิสูจน์" คือเรื่องราวทั้งหมดของการเปิดตัวครั้งนี้
มีสิ่งใดในนี้ที่นำไปใช้ในผลิตภัณฑ์ได้จริงในปัจจุบันหรือไม่
ไม่ ต้นฉบับเป็น PDF, ซอร์สโค้ด Lean และบทสรุปการให้เหตุผล — เป็นสิ่งประดิษฐ์จากงานวิจัย ไม่ใช่บริการ ไม่มี ID โมเดล ไม่มี endpoint ไม่มีราคา และไม่มีแบบฟอร์มขอสิทธิ์เข้าถึง ส่วนที่มีประโยชน์จริงของการเปิดตัวนี้สำหรับนักพัฒนาคือการยืนยันว่า OpenAI มีโมเดลที่เหนือกว่า GPT-6 Astra อย่างมีนัยสำคัญอยู่ระหว่างการฝึก ซึ่งเป็นสัญญาณสำหรับการวางแผนในสิบสองเดือนข้างหน้า มากกว่าจะเป็นสิ่งที่คุณเรียกใช้ได้ในสัปดาห์นี้
ทำไม OpenAI จึงเปิดเผยผลลัพธ์แทนที่จะเป็นตัวโมเดล?
เพราะทั้งสองมีความเสี่ยงที่ไม่เหมือนกัน การเผยแพร่งานวิจัยนั้นย้อนกลับได้ OpenAI เก็บเวอร์ชันก่อนหน้าไว้และระบุว่าจะแก้ไขปัญหาให้ ส่วนการปล่อยโมเดลนั้นย้อนกลับไม่ได้ OpenAI ระบุว่ากำลังดำเนินการเพื่อเปิดตัวโมเดลนี้อย่างมีความรับผิดชอบ และข้อเสนอแนะของคณะที่ปรึกษา ซึ่งบริษัทบอกว่าได้นำมาใช้ประกอบการตัดสินใจนั้น ถูกสร้างขึ้นโดยยึดลำดับขั้นตอนนี้เป็นแกนหลักพอดี นั่นคือ ทำให้ผลลัพธ์ไปถึงมือคนในวงการพร้อมการอ้างอิงและการทำเวอร์ชัน จากนั้นจึงสนับสนุนความเข้าใจของมนุษย์ที่ต้องตามมา
ฉบับหนึ่งบรรทัดสำหรับคนที่อ่านผ่าน ๆ: คลังคณิตศาสตร์ที่ผลิตโดย AI ซึ่งไม่เคยมีมาก่อนอย่างแท้จริงได้เปิดเผยต่อสาธารณะเมื่อวันที่ 6 ตุลาคม โดยประมาณหนึ่งในห้าถูกตรวจสอบโดยเครื่อง ไม่มีส่วนใดผ่านการตรวจสอบโดยผู้ทรงคุณวุฒิเลย และทั้งหมดผูกอยู่กับโมเดลที่คุณใช้ไม่ได้ คำถามที่น่าสนใจไม่ใช่ว่าโมเดลมีความสามารถหรือไม่ — การประมวลผลแบบคิดระดับแนวหน้าเป็นเวลาสามชั่วโมงต่อผลลัพธ์ จากปัญหา 4,000 ข้อ ตอบคำถามนั้นแล้ว และ OpenAI กล่าวว่าโมเดลนี้มีความสามารถมากกว่า GPT-6 Astra อย่างมีนัยสำคัญ — แต่เป็นว่าการตรวจสอบและความเข้าใจของมนุษย์จะตามทันก่อนที่การเปิดตัวครั้งถัดไปจะทำให้โมเดลนี้ล้าสมัยหรือไม่
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
