Hero-Titelkarte mit der Aufschrift „OpenAIs 722 Mathematik-Manuskripte“ und dem Untertitel „Das Modell dahinter hat keinen Namen, keinen Preis und keine API“, einem bernsteinfarbenen Badge mit der Aufschrift „UNVERÖFFENTLICHTES MODELL – NUR ERGEBNISSE“ und drei Karten: „Was veröffentlicht wurde: 722 Manuskripte, 372 Familien“, „Was nicht veröffentlicht wurde: keine Modellkarte, kein Identifikator, kein Datum“ und „Was OpenAI sagt: arbeitet daran, das Modell zu veröffentlichen“.
Guides & Insights

OpenAIs 722 mathematische Manuskripte: Das Modell dahinter hat keinen Namen, keinen Preis und keine API

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 6. Oktober 2026 um 21:47 UTC erschien ein Repository namens openai/math auf GitHub ohne Beschreibung und mit einem ersten Commit. Vierzehn Minuten später postete OpenAI es auf X und stellte eine Begleitseite online, „KI-Fortschritte in der Mathematik teilen“. Zusammen beschreiben diese beiden Dinge ein Ereignis ohne Präzedenzfall: 722 mathematische Manuskripte, gruppiert in 372 Familien, erzeugt von einem internen Frontier-Modell, das OpenAI weder benannt noch bepreist hat und das über keine API aufgerufen werden kann. Die Modelle, über denen es steht, sind die, die man heute tatsächlich erreichen kann — GPT-6 Astra zu 10 $ / 50 $ pro Million Tokens und GPT-6.1 Sol zu 2 $ / 10 $ — und keines von ihnen hat diese Arbeiten geschrieben. OpenAI sagt, das Modell, das dies getan hat, werde noch trainiert, und man arbeite an einer „verantwortungsvollen Veröffentlichung“. Das ist, was bislang verifiziert ist, was nicht, und die eine Frage, die ein Leser daraus mitnehmen sollte.

Zunächst einmal, was dieses Release nicht ist. Es ist kein Modell-Launch: Es gibt keine Model Card, keine Kennung, kein Kontextfenster, keine Benchmark-Tabelle, kein Datum. Es ist kein Paper: Nichts hier wurde einem Peer-Review unterzogen, und OpenAI sagt unumwunden, dass Ergebnisse ohne eine Lean-Formalisierung „Probleme haben könnten“. Und es ist kein Leak – der Grund, warum dieser Beitrag im Rahmen von „Was wir bisher wissen“ geschrieben ist, ist nicht, dass das Material geheim wäre, sondern dass das Thema selbst, das Modell, unveröffentlicht ist. Alles Weitere unten lässt sich anhand des Repositorys, von OpenAIs eigenem Beitrag und der Beratergruppe, die OpenAI nach eigenen Angaben konsultiert hat, überprüfen.

Was ist am 6. Oktober tatsächlich gelandet?

Das Repository ist öffentlich, unter Apache-2.0 lizenziert und in Lean geschrieben. Seine README gibt an, dass der Katalog „722 Manuskripte enthält, die in 372 Familien organisiert sind“, wobei eine Familie ein Hauptergebnis mit begleitenden Argumenten, Konsequenzen oder alternativen Beweisen gruppiert. Die Manuskriptkarte ist detailliert genug, um eine Prüfung zu ermöglichen: 372 Familien mit jeweils einem Hauptergebnis, aufgeführt mit ihren jeweiligen Arbeiten und, sofern verfügbar, einem Link zu einer Lean-Formalisierung.

Der Beitrag von OpenAI ergänzt die Herkunftszahlen, die von OpenAI selbst stammen und nicht unabhängig geprüft wurden:

• Gestellte Aufgaben — etwa 4.000, aus denen die freigegebenen Familien ausgewählt wurden

• Rechenaufwand pro Ergebnis – im Durchschnitt das Äquivalent von etwa drei Stunden Denkzeit von ChatGPT Pro

• Reasoning-Zusammenfassungen — 10 veröffentlicht, mit Familien wie dem Irrationalitätsexponenten von π, den symmetrischen und allgemeinen Mahler-Vermutungen, Kaplanskys Vermutung der direkten Endlichkeit in Charakteristik zwei, der Mézard–Parisi-Formel für verdünnte Spingläser und dem dreidimensionalen relativistischen Vlasov–Maxwell-System

• Überarbeitungsrichtlinie — neue Versionen werden für Korrekturen veröffentlicht, während frühere Versionen zugänglich bleiben

Die Themen decken die gesamte Bandbreite ab: Zahlentheorie, algebraische und komplexe Geometrie, Kombinatorik, theoretische Informatik, Operatoralgebren, Wahrscheinlichkeitstheorie und mathematische Physik. Einige der Titel dieser Familie sind auf den ersten Blick sehr weitreichende Behauptungen — ein Gegenbeispiel zu Rysers Überdeckungsvermutung, Ganzzahlmultiplikation unter n log n, Matrixmultiplikation mit einem Exponenten von höchstens 9/4, die Mahler-Vermutungen, Gegenbeispiele zu Baum–Connes und Kadison–Kaplansky. Ob eine gegebene zutrifft, ist genau die Frage, die diese Veröffentlichung für Sie nicht beantwortet.

Screenshot of the GitHub repository page for openai/math, created October 6, 2026, showing the README statement that the repository contains mathematical manuscripts and supporting proof artifacts produced by an internal OpenAI model, the description of 722 manuscripts organized into 372 families, and the list of ten released reasoning summaries.

Das Modell ist namenlos, unveröffentlicht, und OpenAI sagt, es kommt.

Das README ist eindeutig bezüglich des Verfassers: „mathematische Manuskripte und unterstützende Beweisartefakte, erstellt von einem internen OpenAI-Modell“, wobei die überwiegende Mehrheit „unter Verwendung eines nicht veröffentlichten internen OpenAI-Modells“ erlangt wurde. Kein Name, kein Codename, keine Größe. Namen, die in anderen Berichten kursieren, wurden von OpenAI nicht bestätigt, und wir werden keinen nennen.

Datierbar ist die Zeitachse darum herum. Am 28. August 2026 begann das Unternehmen – laut OpenAIs Seite über seine Mathematik-Beratungsgruppe – „mit dem Training eines neuen internen Modells“, das seitdem das Navier–Stokes-Millenniumsproblem und, nach OpenAIs eigener Zählung, mehr als 100 seit Langem offene Probleme gelöst hat. Das Navier–Stokes-Ergebnis wurde separat am 8. September 2026 angekündigt, wobei OpenAI das dahinterstehende Modell als „deutlich leistungsfähiger als GPT-6 Astra“ beschrieb und sagte, das Training sei noch im Gange. Zwei der Manuskripte in der Sammlung dieser Woche durchbrechen das Standardverfahren, was erwähnenswert ist, weil es bedeutet, dass die Veröffentlichung keine einheitliche Pipeline ist: Die Arbeit an einem nullstellenfreien Bereich für die Riemannsche Zeta-Funktion und ein Beweis der Hodge-Vermutung für CM-abelsche Varietäten wurden anders behandelt, und OpenAI sagt, die Zeta-Ausarbeitung sei von Menschen für die Lesbarkeit überarbeitet worden.

Dann der Satz, der für alle wichtig ist, die damit planen: OpenAI schreibt, dass es „daran arbeitet, das Modell, das diese Ergebnisse erzeugt hat, verantwortungsvoll zu veröffentlichen“. Das ist eine Absichtserklärung, kein Datum. Bis es verfügbar ist, sind die einzigen OpenAI-Modelle, die ein Entwickler aufrufen kann, diejenigen, die bereits auf der Preisliste stehen.

Was „Verifikation“ hier bedeutet – und wo sie endet

Dies ist der Teil, den der Großteil der Berichterstattung über die Veröffentlichung zu einer Phrase verdichtet, und es ist der Teil, der entscheidet, wie viel Gewicht man einem einzelnen Paper beimessen sollte.

OpenAI sagt ausdrücklich: „Diese Sammlung enthält Ergebnisse aus unterschiedlichen Verifikationsstadien.“ Die stärkste Form des Belegs in dem Bündel ist eine Lean-Formalisierung, mit der ein Computer den Beweis prüfen kann statt ein Mensch. Das eigene Formalisierungsmanifest des Repositorys – der Katalog der Papers mit einem formalisierten Hauptergebnis – listet 162 Einträge auf, sodass ungefähr jedes fünfte der 722 Manuskripte durch einen maschinell prüfbaren Beweis im öffentlichen Baum gestützt wird. OpenAI sagt, weitere würden „hinzugefügt, sobald wir sie erhalten“.

Die verbleibende große Mehrheit ist in diesem Sinne nicht verifiziert, und OpenAI gibt über die gesamte Sammlung hinweg nicht vor, dass es anders wäre: "Einige der nicht formalisierten Ergebnisse könnten Probleme haben. Wir werden uns bemühen, solche Probleme schnell zu beheben." Zwei strukturelle Details untermauern, dass dies ein verwaltetes Release und kein offenes ist – Issues sind im Repository deaktiviert, und Pull Requests sind auf Mitarbeiter beschränkt. Es gibt keinen öffentlichen Weg, einen vorliegenden Beweis anzufechten.

Die ehrliche Lesart ist also enger, als die Zahl in der Überschrift vermuten lässt:

• Maschinell geprüft — 162 Manuskripte mit einem formalisierten Hauptergebnis im öffentlichen Lean-Baum

• Nicht maschinell geprüft — der Rest, den OpenAI selbst als potenziell fehlerhaft kennzeichnet

• Menschliche Verantwortung — niemand namentlich genannt; OpenAIs eigene Darstellung ist, dass keine Person die Argumente hinter dem Großteil dessen versteht, was erzeugt wurde

• Unabhängige Bewertung – keine veröffentlicht; die Auswahl, welche Ergebnisse „signifikant“ genug waren, um aufgenommen zu werden, wurde von OpenAI getroffen

Nichts davon bedeutet, dass die Arbeit falsch ist. Es bedeutet, dass „OpenAI hat 722 Beweise veröffentlicht“ und „722 Beweise wurden überprüft“ vorerst unterschiedliche Aussagen sind, und nur die erste ist heute wahr.

Three-column infographic titled "How much of the 722 is actually checked", contrasting "Machine-checked: 162 manuscripts, formalized main result, in the public Lean tree", "Not machine-checked: the remaining majority, no Lean formalization, OpenAI says could contain issues", and "Human or independent review: none named, none published, selection made by OpenAI", with a footer reading "Figures per OpenAI's repository and post, October 6 2026".

Die Beratungsgruppe hat eine Bedingung geknüpft, und sie ist aktenkundig.

In einem Beitrag von OpenAI heißt es, das Unternehmen habe die unabhängige Advisory Group on Mathematics and Artificial Intelligence am Institute for Advanced Study konsultiert und sich auf „ihren Rat und öffentliche Empfehlungen“ gestützt. Diese Empfehlungen wurden am 29. September 2026 veröffentlicht, nachdem die Gruppe mehr als 600 Rückmeldungen aus der mathematischen Gemeinschaft erhalten hatte, und es lohnt sich, sie direkt zu lesen, denn die Gruppe ist kein reines Absegnungsgremium.

Dasselbe Dokument beginnt mit der Feststellung, dass die Gruppe diese Praxis überhaupt nicht befürwortet: „Einige Frontier-KI-Labore testen fortgeschrittene mathematische Probleme an proprietären Modellen, die der breiteren wissenschaftlichen Gemeinschaft weiterhin unzugänglich bleiben … wir befürworten diese Praxis nicht und bitten sie, damit aufzuhören.“ Die Gruppe beschreibt sich außerdem als unabhängig arbeitend, wobei die Mitglieder unbezahlt sind und keine Entscheidungsbefugnis über OpenAI haben – eine Beschreibung der Beziehung, die auch OpenAIs eigener Beitrag aufgreift.

Wo die Empfehlungen der Gruppe und diese Veröffentlichung übereinstimmen, ist beim Prozess: eine akribische Literaturdurchsicht mit Zitaten auf Arbeiten, die die Ideen eingeführt haben, in einem Standardstil verfasste Beweisausarbeitungen statt roher Modellausgaben und eine Versionierung, die frühere Releases bewahrt. Wo sie nicht übereinstimmen, ist bei dem Teil, den die Gruppe als zentral bezeichnet — dass ein Labor, das Ergebnisse veröffentlicht, die niemand versteht, das menschliche Verständnis finanzieren sollte, das folgen muss, durch Workshops, Konferenzen und Programme, und dass diese Arbeit von der Community geleitet statt vom Labor gesteuert bleibt. OpenAI hat zugesagt, „eine Reihe von Workshops, Konferenzen und speziellen Programmen rund um das Verständnis wichtiger von KI erzeugter Ergebnisse“ zu finanzieren, und sagt, Details würden folgen. Das ist der offene Punkt, und an ihm muss man sie festhalten.

Was du heute aufrufen kannst, und wofür Routing hier eigentlich gedacht ist

Es gibt keine Möglichkeit, eine Anfrage an das Modell zu senden, das diese Manuskripte erstellt hat, und keine Drittplattform kann sie weiterleiten – jede Auflistung, die etwas anderes behauptet, beschreibt ein Modell, das in niemandes Katalog existiert. Die OpenAI-Modelle in Produktion sind die aktuelle GPT-6-Reihe, und ihre Zahlen stehen auf der Preisliste, statt abgeleitet zu werden:

• GPT-6 Astra — 10 $ / 50 $ pro Million Token, 1 $ Cache-Lesevorgang; Long-Context-Stufe oberhalb von 272K Prompt-Token bei 20 $ / 75 $; 1,05M-Token-Kontext, max. 128K Ausgabe

• GPT-6.1 Sol — 2 $ / 10 $ pro Million Tokens, 0,10 $ pro Cache-Lesevorgang; gleiche Langkontext-Staffelung bei 4 $ / 15 $; Kontext von 1,05 Mio. Token, maximale Ausgabe von 128K

Beide sind im OrcaRouter-Katalog, was für alle, die diese Veröffentlichung als Signal zur Leistungsfähigkeit lesen, der praktische Punkt ist: Die Modelle, die du heute verwenden darfst, sind auch die Modelle, an denen deine Prompts bereits ausgerichtet sind, und die Lücke zwischen ihnen und dem internen Modell ist genau die Lücke, zu deren Schließung OpenAI Mathematiker um Hilfe bittet.

Diese Lücke ist auch ein Grund, den Experimentierposten getrennt vom Produktionspfad zu halten. Wenn OpenAI diesem Modell dann einen Namen und einen Preis gibt, wird die erste Woche eine Flut ungeprüfter Benchmark-Behauptungen und jede Menge panische Re-Integrationsarbeit bringen — das Routing-Argument für eine Plattform wie unsere ist, dass der Versuch mit einem unerprobten Modell dann nur einen Model-String kostet, keine Migration. GPT-6 Astra liegt bei 10 $ / 50 $ und GPT-6.1 Sol bei 2 $ / 10 $ pro Million Tokens, zum Listenpreis mit 0 % Aufschlag durchgereicht, sodass eine Preisänderung des Anbieters noch am selben Tag live ist, an dem sie kommt. Automatisches Failover bedeutet, dass ein neues Modell einen Bruchteil des Traffics tragen und wieder herausgenommen werden kann, ohne den Request-Pfad mitzureißen, und mit der Routing-DSL lassen sich mehrere Modelle zu einem einzigen Aufruf kombinieren, wenn Sie bei einer langen Herleitung lieber eine zweite Meinung als eine einzelne Antwort möchten. Nichts davon gilt für ein Modell, das noch nicht erschienen ist — aber es ist genau die Infrastruktur, die Sie eingerichtet haben wollen, bevor das nächste erscheint.

Screenshot of the OrcaRouter model page for OpenAI GPT-6.1 Sol, showing a 1.05M-token context window, 128K max output, a base pricing tier of $2.00 per million input tokens and $10.00 per million output tokens with a $0.100 cache read and $2.50 cache write, a long-context tier above 272K prompt tokens at $4.00 / $15.00 with $0.200 cache read and $5.00 cache write, plus live performance and benchmark panels.

Was als Nächstes ansehen

Vier Dinge, in der Reihenfolge, in der sie wahrscheinlich von Bedeutung sein werden. Die Formalisierungszahl, weil sie die einzige Zahl in dieser Veröffentlichung ist, die von „OpenAI sagt“ zu „eine Maschine hat es überprüft“ wechseln kann, und sie ist öffentlich. Die erste wirklich unabhängige Evaluierung eines namentlich genannten Ergebnisses – ein Mathematiker außerhalb von OpenAI, der öffentlich eine bestimmte Arbeit durcharbeitet, keine Zusammenfassung der Sammlung. Das von der Community gehostete Repository, von dem OpenAI sagt, es werde noch erkundet, und das das Artefakt aus OpenAIs eigener Darstellung heraus und in die Hände der Fachwelt bewegen würde. Und die Veröffentlichung des Modells selbst, zu der sich OpenAI verpflichtet hat, für die es aber noch keinen Termin gibt.

Bedeuten die 722 Manuskripte, dass die KI diese Probleme gelöst hat?

Für eine Teilmenge – wenn die Mathematik stimmt – gilt: Die Sammlung behauptet Gegenbeispiele und Beweise zu bekannten offenen Problemen, und bei 162 der Arbeiten steht hinter ihrem Hauptergebnis eine maschinell überprüfbare Formalisierung. Für den Rest lautet die Behauptung, dass ein Modell ein Manuskript zu dem Problem erstellt hat, was eine schwächere Aussage ist als eine verifizierte Lösung, und OpenAI selbst warnt, dass unformalisierte Ergebnisse Fehler enthalten können. Der Unterschied zwischen „einen Beweis erstellt“ und „einen Beweis hat“ ist die ganze Geschichte dieser Veröffentlichung.

Lässt sich davon heute irgendetwas in einem Produkt einsetzen?

Nein. Die Manuskripte sind PDFs, Lean-Quellen und Reasoning-Zusammenfassungen – Forschungsartefakte, kein Dienst. Es gibt keine Modell-ID, keinen Endpunkt, keinen Preis und kein Formular für Zugriffsanfragen. Der praktisch nützliche Teil der Veröffentlichung für Entwickler ist die Bestätigung, dass OpenAI ein Modell trainiert, das deutlich über GPT-6 Astra hinausgeht – ein Planungssignal für die nächsten zwölf Monate, nicht etwas, das man diese Woche aufrufen kann.

Warum hat OpenAI Ergebnisse statt des Modells veröffentlicht?

Weil die beiden unterschiedliche Risikoprofile haben. Das Veröffentlichen von Manuskripten ist umkehrbar – OpenAI behält frühere Versionen und sagt, dass es Probleme beheben wird –, während das Ausliefern des Modells nicht umkehrbar ist. OpenAI erklärt, dass es an einer verantwortungsvollen Veröffentlichung arbeitet, und die Empfehlungen der Beratergruppe, auf die sich das Unternehmen nach eigenen Angaben gestützt hat, sind genau um diese Abfolge herum aufgebaut: die Ergebnisse mit Zitaten und Versionierung in die Hände der Fachwelt zu geben und dann das menschliche Verständnis zu finanzieren, das darauf folgen muss.

Die Ein-Zeilen-Version für alle, die nur überfliegen: Ein wahrhaft beispielloser Korpus von KI-generierter Mathematik wurde am 6. Oktober veröffentlicht, etwa ein Fünftel davon maschinell überprüft, nichts davon peer-reviewt, alles davon an ein Modell geknüpft, das man nicht nutzen kann. Die interessante Frage ist nicht, ob das Modell leistungsfähig ist – das beantworten drei Stunden Denk-Compute an der Frontier pro Ergebnis über 4.000 Probleme hinweg, und Open​AI sagt, das Modell sei deutlich leistungsfähiger als GPT-6 Astra –, sondern ob die Verifikation und das menschliche Verständnis aufholen, bevor die nächste Veröffentlichung diese hier obsolet macht.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert