
OpenAI's 722 wiskundemanuscripten: Het model erachter heeft geen naam, geen prijs en geen API
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Op 6 oktober 2026 om 21:47 UTC verscheen een repository genaamd openai/math op GitHub zonder beschrijving en met een initiële commit. Veertien minuten later plaatste OpenAI het op X en zette een begeleidende pagina online, "AI-voortgang delen in de wiskunde." Samen beschrijven die twee dingen een gebeurtenis zonder precedent: 722 wiskundige manuscripten, gegroepeerd in 372 families, geproduceerd door een intern frontier-model dat OpenAI niet heeft genoemd, niet heeft geprijsd, en niet via een API kan worden aangeroepen. De modellen waar het boven staat, zijn de modellen die je vandaag daadwerkelijk kunt bereiken — GPT-6 Astra tegen $10 / $50 per miljoen tokens en GPT-6.1 Sol tegen $2 / $10 — en geen van beide heeft deze papers geschreven. OpenAI zegt dat het model dat dit wel deed nog steeds wordt getraind, en dat het werkt aan het "verantwoord vrijgeven" ervan. Dit is wat tot nu toe geverifieerd is, wat niet, en de ene vraag die een lezer hieruit zou moeten meenemen.
Begin met wat deze release niet is. Het is geen modelintroductie: er is geen modelkaart, geen identifier, geen contextvenster, geen benchmarktabel, geen datum. Het is geen paper: niets hier is peer-reviewed, en OpenAI zegt ronduit dat resultaten zonder een Lean-formalisering "problemen kunnen hebben". En het is geen lek — de reden dat dit stuk in een wat-we-tot-nu-toe-weten-kader is geschreven, is niet dat het materiaal geheim is, maar dat het onderwerp zelf, het model, nog niet is uitgebracht. Al het overige hieronder is te verifiëren aan de hand van de repository, OpenAI's eigen bericht en de adviesgroep die OpenAI zegt te hebben geraadpleegd.
Wat landde er eigenlijk op 6 oktober?
De repository is openbaar, heeft de Apache-2.0-licentie en is geschreven in Lean. De README ervan vermeldt dat de catalogus "722 manuscripten bevat, georganiseerd in 372 families," waarbij een familie een hoofdresultaat groepeert met begeleidende argumenten, consequenties of alternatieve bewijzen. De kaart van manuscripten is gedetailleerd genoeg om te controleren: 372 families met elk een hoofdresultaat, vermeld met hun samenstellende papers en, waar beschikbaar, een link naar een Lean-formalisering.
Het bericht van OpenAI voegt de herkomstcijfers toe, die van henzelf zijn en niet onafhankelijk gecontroleerd:
• Gestelde opgaven — ongeveer 4.000, waaruit de vrijgegeven families werden geselecteerd
• Rekenkracht per resultaat — gemiddeld het equivalent van ongeveer drie uur denkwerk van ChatGPT Pro
• Redeneersamenvattingen — 10 vrijgegeven, over families waaronder de irrationaliteitsexponent van π, de symmetrische en algemene Mahler-vermoedens, het direct-eindigheidsvermoeden van Kaplansky in karakteristiek twee, de Mézard–Parisi-formule voor verdunde spinglazen en het driedimensionale relativistische Vlasov–Maxwell-systeem
• Revisiebeleid — nieuwe versies worden geplaatst voor correcties, waarbij eerdere versies toegankelijk blijven
De onderwerpen bestrijken het hele spectrum: getaltheorie, algebraïsche en complexe meetkunde, combinatoriek, theoretische informatica, operatoralgebra's, kansrekening en wiskundige fysica. Sommige titels in de familie zijn op het eerste gezicht zeer grote beweringen — een tegenvoorbeeld voor het dekkingsvermoeden van Ryser, geheeltallige vermenigvuldiging onder n log n, matrixvermenigvuldiging met exponent ten hoogste 9/4, de vermoedens van Mahler, tegenvoorbeelden voor Baum–Connes en Kadison–Kaplansky. Of een gegeven bewering waar is, is precies de vraag die deze release niet voor u beslecht.

Het model is naamloos, niet uitgebracht en OpenAI zegt dat het eraan komt
De README is ondubbelzinnig over de auteur: "wiskundige manuscripten en ondersteunende bewijsartefacten geproduceerd door een intern OpenAI-model", waarbij de overgrote meerderheid is verkregen "met behulp van een niet-uitgebracht intern OpenAI-model". Geen naam, geen codenaam, geen grootte. Namen die in andere berichtgeving circuleren, zijn niet door OpenAI bevestigd, en wij zijn niet van plan er een te verstrekken.
Wat te dateren valt, is de tijdlijn eromheen. Op 28 augustus 2026 begon het bedrijf, volgens de pagina van OpenAI over zijn adviesgroep voor wiskunde, “met het trainen van een nieuw intern model” dat sindsdien het Navier–Stokes Millennium Prize-probleem heeft opgelost en, volgens OpenAI's eigen telling, meer dan 100 al lang openstaande problemen. Het Navier–Stokes-resultaat werd apart aangekondigd op 8 september 2026, waar OpenAI het onderliggende model omschreef als “aanzienlijk capabeler dan GPT-6 Astra” en zei dat de training nog gaande was. Twee van de manuscripten in de collectie van deze week doorbreken de standaardprocedure, wat het vermelden waard is omdat het betekent dat de release geen uniforme pijplijn is: het werk aan een nulvrij gebied voor de Riemann-zètafunctie en een bewijs van het Hodge-vermoeden voor CM-abelse variëteiten werden anders behandeld, en OpenAI zegt dat de zèta-tekst door mensen is geredigeerd voor leesbaarheid.
Dan de zin die ertoe doet voor iedereen die hiermee rekening moet houden: OpenAI schrijft dat het "werkt aan een verantwoorde vrijgave van het model dat deze resultaten heeft geproduceerd." Dat is een verklaring van intentie, geen datum. Totdat het wordt uitgebracht, zijn de enige OpenAI-modellen die een ontwikkelaar kan aanroepen, de modellen die al op de prijslijst staan.
Wat "verificatie" hier betekent — en waar het stopt
Dit is het deel dat de meeste berichtgeving over de release tot één frase samenvat, en het is het deel dat bepaalt hoeveel gewicht je aan een enkele paper moet toekennen.
OpenAI stelt expliciet dat "deze collectie resultaten in verschillende stadia van verificatie bevat." De sterkste vorm van bewijs in de bundel is een Lean-formalisering, waarmee een computer het bewijs kan controleren in plaats van een mens. Het eigen formalisatiemanifest van de repository — de catalogus van papers met een geformaliseerd hoofdresultaat — telt 162 vermeldingen, dus ongeveer één op de vijf van de 722 manuscripten wordt ondersteund door een machinecontroleerbaar bewijs in de openbare tree. OpenAI zegt dat er meer zullen worden toegevoegd "zodra we ze verkrijgen."
De resterende grote meerderheid is in die zin niet geverifieerd, en OpenAI doet niet alsof dat anders is voor de hele verzameling: "Sommige van de niet-geformaliseerde resultaten zouden problemen kunnen hebben. We zullen ons inspannen om dergelijke problemen snel op te lossen." Twee structurele details versterken dat dit een beheerde release is en niet een open release — issues zijn uitgeschakeld op de repository, en pull requests zijn beperkt tot medewerkers. Er is geen publieke manier om een eenmaal geplaatst bewijs aan te vechten.
Dus de eerlijke lezing is beperkter dan het getal in de kop suggereert:
• Machinaal gecontroleerd — 162 manuscripten met een geformaliseerd hoofdresultaat in de openbare Lean-boom
• Niet machinaal gecontroleerd — de rest, waarvan OpenAI zelf aangeeft dat er mogelijk fouten in kunnen zitten
• Menselijke verantwoordelijkheid — niemand bij naam genoemd; OpenAI's eigen framing is dat geen enkel persoon de argumenten begrijpt achter het grootste deel van wat werd geproduceerd
• Onafhankelijke beoordeling — geen enkele gepubliceerd; de selectie van welke resultaten "significant" genoeg waren om op te nemen, werd door OpenAI gemaakt
Niets daarvan betekent dat het werk verkeerd is. Het betekent dat voorlopig "OpenAI heeft 722 bewijzen vrijgegeven" en "722 bewijzen zijn gecontroleerd" verschillende uitspraken zijn, en alleen de eerste is vandaag waar.

De adviesgroep heeft een voorwaarde toegevoegd, en het staat officieel vast
In het bericht van OpenAI staat dat het de onafhankelijke Advisory Group on Mathematics and Artificial Intelligence bij het Institute for Advanced Study heeft geraadpleegd en gebruik heeft gemaakt van "hun advies en publieke aanbevelingen". Die aanbevelingen werden gepubliceerd op 29 september 2026, nadat de groep meer dan 600 reacties uit de wiskundige gemeenschap had ontvangen, en ze zijn het waard om rechtstreeks te lezen, omdat de groep geen rubberen stempel is.
Hetzelfde document opent met de verklaring dat de groep deze praktijk helemaal niet onderschrijft: "sommige frontier AI-labs testen geavanceerde wiskundige problemen op propriëtaire modellen die ontoegankelijk blijven voor de bredere wetenschappelijke gemeenschap... wij onderschrijven deze praktijk niet, en we vragen hen ermee te stoppen." De groep beschrijft zichzelf ook als onafhankelijk opererend, met onbetaalde leden en geen beslissingsbevoegdheid over OpenAI — een beschrijving van de relatie die ook doorklinkt in OpenAI's eigen bericht.
Waar de aanbevelingen van de groep en deze release overeenkomen, is het op het proces: een grondige literatuurstudie met verwijzingen naar werk dat de ideeën introduceerde, uitwerkingen van bewijzen in een standaardstijl in plaats van ruwe modeloutput, en versiebeheer dat eerdere releases bewaart. Waar ze niet overeenkomen, is het op het deel dat de groep centraal noemt — dat een lab dat resultaten publiceert die niemand begrijpt, het menselijk begrip dat moet volgen zou moeten financieren, via workshops, conferenties en programma's, en dat dit werk door de gemeenschap geleid moet blijven in plaats van door het lab gestuurd. OpenAI heeft toegezegd financiering te bieden voor "een reeks workshops, conferenties en speciale programma's rond het begrip van belangrijke resultaten die door AI zijn geproduceerd" en zegt dat details later volgen. Dat is het openstaande punt, en dat is het punt waaraan we hen moeten houden.
Wat je vandaag kunt aanroepen, en waar routing hier eigenlijk voor dient
Er is geen manier om een verzoek te sturen naar het model dat deze manuscripten heeft geproduceerd, en geen enkel platform van derden kan het routeren — elke vermelding die het tegendeel beweert, beschrijft een model dat in niemands catalogus bestaat. De OpenAI-modellen in productie zijn de live GPT-6-lijn, en hun cijfers staan op de prijslijst in plaats van dat ze worden afgeleid:
• GPT-6 Astra — $10 / $50 per miljoen tokens, $1 voor cache-lezen; niveau voor lange context boven 272K prompttokens tegen $20 / $75; 1,05M-token context, 128K maximale uitvoer
• GPT-6.1 Sol — $2 / $10 per miljoen tokens, $0,10 cache-lezing; dezelfde staffeling voor lange context bij $4 / $15; context van 1,05M tokens, maximale uitvoer van 128K
Beide staan in de OrcaRouter-catalogus, wat het praktische punt is voor iedereen die deze release leest als een signaal over capaciteit: de modellen die je vandaag mag gebruiken, zijn ook de modellen waarop je prompts al zijn afgestemd, en de kloof tussen hen en het interne model is precies de kloof die OpenAI aan wiskundigen vraagt om te helpen dichten.
Dat gat is ook een reden om de experimenteerrekening gescheiden te houden van het productiepad. Wanneer OpenAI dit model daadwerkelijk een naam en een prijs geeft, zal de eerste week een vloedgolf van niet-geverifieerde benchmarkclaims en een hoop paniekerig herintegratiewerk zijn — het routingargument voor een platform zoals het onze is dat het uitproberen van een onbewezen model je dan een modelstring kost, niet een migratie. GPT-6 Astra zit op $10 / $50 en GPT-6.1 Sol kost $2 / $10 per miljoen tokens, doorgegeven tegen lijstprijs met 0% opslag, dus een prijswijziging van een leverancier is live op dezelfde dag dat die ingaat. Automatische failover betekent dat een nieuw model een deel van het verkeer kan dragen en kan worden geschrapt zonder dat het aanvraagpad daardoor uitvalt, en de routing-DSL laat je meerdere modellen samenstellen tot één aanroep als je een second opinion wilt op een lange afleiding in plaats van één antwoord. Niets daarvan geldt voor een model dat nog niet is uitgebracht — maar het is precies de infrastructuur die je op orde wilt hebben voordat het volgende model dat doet.

Wat nu te kijken
Vier dingen, in de volgorde waarin ze waarschijnlijk van belang worden. Het aantal formalisaties, omdat het het enige getal in deze release is dat kan opschuiven van "OpenAI zegt het" naar "een machine heeft het gecontroleerd", en het is openbaar. De eerste echt onafhankelijke evaluatie van een genoemd resultaat — een wiskundige buiten OpenAI die in het openbaar een specifieke paper doorwerkt, niet een samenvatting van de verzameling. De door de community gehoste repository die OpenAI naar eigen zeggen nog steeds verkent, wat het artefact uit OpenAI's eigen verhaal zou halen en in handen van het vakgebied zou leggen. En de release van het model zelf, waartoe OpenAI zich heeft verplicht maar die nog niet is gepland.
Betekenen de 722 manuscripten dat AI deze problemen heeft opgelost?
Voor een deelverzameling, als de wiskunde klopt: de verzameling claimt tegenvoorbeelden en bewijzen voor bekende open problemen, en 162 van de papers hebben een machinegecontroleerde formalisatie achter hun hoofdresultaat. Voor de rest is de bewering dat een model een manuscript over het probleem heeft geproduceerd, wat een zwakkere bewering is dan een geverifieerde oplossing, en OpenAI waarschuwt zelf dat ongeformaliseerde resultaten fouten kunnen bevatten. Het onderscheid tussen 'een bewijs geproduceerd hebben' en 'een bewijs hebben' is het hele verhaal van deze release.
Is iets hiervan vandaag bruikbaar in een product?
Nee. De manuscripten zijn pdf's, Lean-bronnen en redeneersamenvattingen — onderzoeksartefacten, geen dienst. Er is geen model-ID, geen endpoint, geen prijs en geen aanvraagformulier voor toegang. Het praktisch nuttige deel van de release voor een ontwikkelaar is de bevestiging dat OpenAI een model in training heeft dat wezenlijk verder gaat dan GPT-6 Astra, wat een planningssignaal is voor de komende twaalf maanden in plaats van iets dat je deze week kunt aanroepen.
Waarom heeft OpenAI resultaten vrijgegeven in plaats van het model?
Omdat de twee verschillende risicoprofielen hebben. Het publiceren van manuscripten is omkeerbaar — OpenAI bewaart eerdere versies en zegt problemen te zullen oplossen — terwijl het uitbrengen van het model dat niet is. OpenAI verklaart dat het werkt aan een verantwoorde release, en de aanbevelingen van de adviesgroep, waarop het bedrijf naar eigen zeggen heeft voortgebouwd, zijn precies rond deze volgorde opgebouwd: krijg de resultaten met citaties en versiebeheer in handen van het vakgebied, en financier vervolgens het menselijke begrip dat daarop moet volgen.
De versie in één regel voor wie er snel doorheen wil: een werkelijk ongekende verzameling door AI geproduceerde wiskunde werd op 6 oktober openbaar gemaakt, ongeveer een vijfde ervan machinaal gecontroleerd, niets ervan peer-reviewed, en het geheel is verbonden aan een model dat je niet kunt gebruiken. De interessante vraag is niet of het model capabel is — drie uur aan rekenkracht voor frontier-denken per resultaat over 4.000 problemen beantwoordt dat, en OpenAI zegt dat het model aanzienlijk capabeler is dan GPT-6 Astra — maar of de verificatie en het menselijke begrip kunnen bijbenen voordat de volgende release deze achterhaald maakt.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
