GPT-5.6 Preise nach dem Preisschnitt: Luna vs Terra vs Sol und welche Stufe man wählen sollte
Guides & Insights

GPT-5.6 Preise nach dem Preisschnitt: Luna vs Terra vs Sol und welche Stufe man wählen sollte

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Nach der Preissenkung von O​penAI am 30. Juli 2026 war die GP​T-5.6-Familie — GPT-5.6 Luna, GPT-5.6 Terra und GPT-5.6 Sol — noch nie so günstig im großen Maßstab zu betreiben. Eine Woche später, am 6. August, hat O​penAI dieselben Stufen direkt in ChatGPT integriert: GPT-5.6 Luna wird zum Standardmodell für Free- und Go-Konten mit unbegrenzten Text-Chats, während GPT-5.6 Sol für Plus und Pro aktualisiert wurde. Am 19. August gaben O​penAI und Replit bekannt, dass Replits neuer Free Mode für Core- und Pro-Abonnenten auf GPT-5.6 Luna läuft — die bisher größte Drittanbieter-Wette auf die Volumenstufe. Und Ende August begann O​penAI, einen Fallback für intensive Verbraucher einzuführen: ein „Luna Reserve“-Kontingent, das ausgewählten ChatGPT-Plus- und Pro-Konten begrenzte GPT-5.6-Luna-Nutzung in Codex und ChatGPT Work gewährt, sobald ihre regulären Nutzungslimits erschöpft sind. Doch die drei Stufen sind sehr unterschiedlich bepreist, und die richtige Wahl (plus der geschickte Einsatz von Caching, Batch und Routing) ist der mit Abstand größte Hebel für deine API-Rechnung. Dieser Leitfaden erläutert die vollständigen Preise nach der Senkung, durchgerechnete Kostenbeispiele, wie jede Stufe im Vergleich zu Konkurrenten abschneidet und wie du über einen einzigen Endpoint zwischen ihnen routen kannst.

Die Preise gelten pro Million Tokens (Eingabe / Ausgabe) und entsprechen der nach den Kürzungen aktualisierten Preisliste, wie berichtet und auf den Pass-through-Modellseiten von OrcaRouter; gestaffelte Preise und Cache-Preise stammen von den Modellseiten von OrcaRouter, und Wettbewerbszahlen sind entsprechend ausgewiesen. Die Details zum ChatGPT-Rollout in diesem Artikel entsprechen den Angaben von O​penAI vom 6. August 2026, und die Details zum Replit Free Mode entsprechen den Angaben von O​penAI und Replit vom 19. August 2026 – vom Anbieter gemeldet, nicht unabhängig gemessen. Die Details zu Luna Reserve entsprechen den Angaben, die O​penAI in seinem Hilfezentrum dokumentiert, sowie den Berichten von O​penAI-Mitarbeitern und frühen Nutzern Ende August 2026 – vom Anbieter und aus der Community stammend, nicht unabhängig verifiziert. Preise ändern sich – vor dem Entwickeln prüfen.

TL;DR

GPT-5.6 Luna (0,20 $ / 1,20 $) ist das Arbeitspferd für hohe Volumina; Terra (2 $ / 12 $) ist die ausgewogene Mitte; Sol (5 $ / 30 $) ist das Flaggschiff für die anspruchsvollsten Denkaufgaben und agentisches Codieren. Alle drei teilen sich einen Kontext von etwa 1,05 Millionen Token und ein maximales Output von 128K. Prompt-Caching und die Batch-Option senken die Kosten weiter, während sehr lange Eingaben Sie in eine höhere Stufe versetzen. Auf der Verbraucherseite kündigte O​penAI am 6. August an, dass GPT-5.6 Luna zum Standard für kostenlose und Go-ChatGPT-Konten mit unbegrenzten Text-Chats wird und dass ein aktualisiertes GPT-5.6 Sol für Plus und Pro ausgerollt wird. Am 19. August führte Replit den Free Mode auf GPT-5.6 Luna für Core- und Pro-Abonnenten ein und leitet schwierigere Aufgaben bei Bedarf an GPT-5.6 Sol weiter. Ende August begann O​penAI außerdem mit dem Ausrollen eines „Luna Reserve“-Fallbacks, das ausgewählten ChatGPT-Plus- und Pro-Konten eine begrenzte GPT-5.6-Luna-Nutzung in Codex und ChatGPT Work gewährt, nachdem ihre regulären Limits ausgeschöpft sind – von O​penAI dokumentiert, wobei Nutzer über das Ausrollen auf ausgewählte Konten berichteten. Nutzen Sie Luna für die einfache Mehrheit, Terra, wenn Sie mehr brauchen, und Sol nur dort, wo es seine Kosten rechtfertigt – und leiten Sie nach Schwierigkeitsgrad über einen einzigen O​penAI-kompatiblen Endpunkt, um die Ausgaben zu minimieren.

Wichtige Erkenntnisse

• Luna: 0,20 $ / 1,20 $ pro 1 Mio. Tokens — schnell, günstig, für hohe Volumina und latenzempfindliche Anwendungen.

• Terra: $2 / $12 — die ausgewogene Mittelklasse für anspruchsvollere Aufgaben, die kein Flaggschiff benötigen.

• Sol: $5 / $30 — das Flaggschiff für tiefgehendes Denken, großangelegtes Codieren und langfristige Agenten.

• Caching und Batch senken die Kosten weiter; lange Eingaben bringen Sie in eine teurere Long-Context-Stufe.

• ChatGPT (laut O​penAI, 6. Aug.): Luna wird zum Standard für free/Go mit unbegrenzten Text-Chats; Sol erhält ein Zuverlässigkeitsupdate für Plus/Pro.

• Replit (angekündigt am 19. Aug.): Free Mode für Core/Pro läuft auf GPT-5.6 Luna — bis zu 30x mehr Nutzung pro Replit, wobei schwierigere Aufgaben an GPT-5.6 Sol weitergeleitet werden. Von Replit angegeben, nicht unabhängig verifiziert.

• Luna Reserve (Ende August, OpenAI-dokumentiert): ein begrenztes Fallback-Kontingent, das ausgewählten ChatGPT-Plus- und Pro-Konten ermöglicht, GPT-5.6 Luna in Codex und ChatGPT Work weiterhin zu nutzen, nachdem die regulären Limits ausgeschöpft sind — nicht unbegrenzt und nicht in Business- oder Enterprise-Workspaces verfügbar.

• Größter Sparhebel: nach Schwierigkeit routen — zahle keine Sol-Preise für Arbeit, die Luna erledigen kann.

Die neue Basispreisgestaltung für GP​T-5.​6

Hier ist die Basispreisgestaltung nach der Senkung pro Million Input-/Output-Tokens: Luna 0,20 $ / 1,20 $ (gesenkt von 1 $ / 6 $), Terra 2 $ / 12 $ (gesenkt von 2,50 $ / 15 $) und Sol 5 $ / 30 $ (unverändert). Die beiden günstigeren Stufen wurden am 30. Juli 2026 gesenkt; die Flaggschiff-Stufe blieb unverändert. Einfach ausgedrückt: Die niedrigen Stufen sind jetzt auf Skalierung ausgelegt, während das Flaggschiff Premium bleibt.

Gestaffelte, zwischengespeicherte und Stapelpreise

Der Grundpreis ist nur der Ausgangspunkt. Die Preisgestaltung von GP​T-5.​6 hat drei Modifikatoren, die Ihre effektiven Kosten wesentlich verändern:

• Stufen für lange Kontexte. Die Preise steigen für sehr lange Eingaben. Auf den Pass-through-Seiten von OrcaRouter kostet Luna $0.20 / $1.20 bis zu einer großen Kontextstufe und $0.40 / $1.80 darüber hinaus; Sol kostet auf seiner Basisstufe $5 / $30 und auf der größten Stufe $10 / $45. Die Stufe wird anhand der Anzahl der Eingabe-Tokens jeder Anfrage gewählt, sodass ein paar sehr große Prompts Ihren Durchschnittspreis unbemerkt erhöhen können.

• Prompt-Caching. Wiederverwendeter Kontext wird zu einem stark reduzierten Preis abgerechnet — Lunas Cache-Read kostet etwa 0,02 $ pro Million Tokens (gegenüber 0,20 $ frisch), mit Cache-Writes um 0,25 $; Sols Cache-Read liegt bei etwa 0,50 $ (gegenüber 5 $ frisch). Für Agenten und Chat mit einem stabilen System-Prompt ist Caching oft die größte Einsparung.

• Batch. Nicht dringende Jobs werden asynchron zu einem reduzierten Preis ausgeführt — ideal für Massenklassifizierung, Evaluierungen und Offline-Generierung, bei denen Latenz keine Rolle spielt.

Rechenbeispiele: Was es tatsächlich kostet

Konkrete Zahlen machen die Stufen greifbar. Nehmen wir 10 Millionen Tokens pro Monat mit einer Aufteilung von 70 % Input / 30 % Output (eine typische Chat/Agent-Mischung):

• Luna: etwa 5 $ pro Monat (ungefähr 4,37 $ mit Prompt-Caching).

• Terra: etwa 50 $ pro Monat.

Sol: etwa 125 $ pro Monat (ungefähr 109 $ mit Caching).

Das ist eine 25-fache Spreizung zwischen Luna und Sol für dasselbe Volumen — und genau deshalb ist es wichtiger, jede Anfrage der günstigsten geeigneten Stufe zuzuordnen, als sich auf einen einzelnen Tarif zu verlassen. (Diese Werte entsprechen dem On-Page-Kostenrechner von OrcaRouter, der auf Basis des Listenpreises schätzt; Ihre tatsächlichen Zahlen hängen vom Caching und Ihrer Eingabe-/Ausgabe-Mischung ab.)

Wofür jede Stufe eigentlich gedacht ist

GPT-5.6 Luna — das Volumen-Arbeitstier

Luna ist die schnelle, kosteneffiziente Stufe, optimiert für hochvolumige, latenzempfindliche Workloads: Chat, Klassifizierung, Extraktion, Routing und leichte agentische Aufgaben, mit einer p50-Zeit bis zum ersten Token von etwa 1,65 Sekunden. Nach der Preissenkung ist sie mit $0.20 / $1.20 so bepreist, dass sie direkt mit günstigen offenen Modellen konkurriert – die Standardoption für die große Mehrheit einfacher Aufrufe. Sie ist auch die Stufe, auf die O​penAI den Verbraucher-ChatGPT ausrichtet: Laut seiner Ankündigung vom 6. August wird GPT-5.6 Luna zum Standardmodell für Free- und Go-Konten, wobei reine Text-Chats unbegrenzt werden und in der folgenden Woche ein neuer Think-Button erscheint, der bei schwierigeren Fragen für tiefergehendes Denken sorgt (Datei-, Bild- und Sprachlimits bleiben bestehen). O​penAI gibt an, dass Luna 62 % weniger Faktenfehler macht als das GPT-5.5 Instant, das es ersetzt – eine vom Anbieter gemeldete Zahl, aber ein klares Signal, dass die Volumenstufe der Bereich ist, in den das Unternehmen den Großteil seines Datenverkehrs lenkt.

Am 19. August 2026 machte Replit GPT-5.6 Luna zum Motor seines neuen Free Mode – dem Standarderlebnis für Core- und Pro-Abonnenten. Alltäglicher Chat, Ideenfindung und einfache Codierungsaufgaben laufen auf Luna, ohne das bezahlte KI-Guthaben des Nutzers zu verbrauchen; Replit gibt an, dass Core-Nutzer nun bis zu 30-mal mehr pro Monat erstellen können, einschließlich bis zu 30 Stunden Chat. Wenn eine Aufgabe mehr Denkvermögen erfordert, leitet Replits Agent diese Anfrage für diesen Teil an ein größeres Modell weiter – die Power-/Max-Modi oder GPT-5.6 Sol – und fällt dann auf Luna zurück. Dies sind von Replit und O​penAI angegebene Details, nicht unabhängig verifiziert – aber die Richtung passt zur Preissenkung: Ein um 80 % günstigeres Luna ist es, das einen immer verfügbaren, standardmäßig enthaltenen Tarif tragfähig macht.

Eine weitere Nuance auf Verbraucherseite kam Ende August 2026 hinzu: Luna Reserve. Wie O​penAI in seinem Hilfezentrum dokumentiert, können ausgewählte ChatGPT-Plus- und Pro-Konten ein begrenztes Kontingent an GPT-5.6-Luna-Nutzung in Codex und ChatGPT Work als Fallback erhalten, sobald ihr reguläres Nutzungskontingent erschöpft ist – ein Hinweis oder Mondindikator erscheint an der Obergrenze, und man kann auf Luna weiterarbeiten, solange die Reserve reicht. Es ist keine unbegrenzte Erweiterung: Die Reserve ist getrennt vom regulären Kontingent und selbst begrenzt, sie bedient ausschließlich GPT-5.6 Luna (niemals Terra oder Sol), sie ist nicht in Business- oder Enterprise-Workspaces verfügbar, und das Erreichen eines regulären Limits garantiert keinen Zugriff. Mitarbeiter von O​penAI bestätigten die Existenz der Reserve am 27. August, und frühe Nutzerberichte beschreiben eine schrittweise Einführung für ausgewählte Konten – Angaben von Anbieter und Community, nicht unabhängig verifiziert. Einige frühe Community-Berichte weisen außerdem darauf hin, dass die Reserve die browserleichte Seite von GPT-5.6 Luna nutzt, sodass Live-Web-Inspektionsaufgaben während der Reserve möglicherweise nicht funktionieren.

GPT-5.6 Terra — die ausgewogene Mitte

Terra liegt zwischen Volume und Flaggschiff: leistungsfähiger als Luna für anspruchsvolleres Reasoning und Coding, aber deutlich günstiger als Sol. Bei $2 / $12 ist es eine sinnvolle Standardwahl, wenn Luna nicht ganz ausreicht, man aber nicht das Flaggschiff braucht — Extraktion mittlerer Komplexität, Entwurfserstellung und mehrstufige Aufgaben, die weiterhin in großem Maßstab laufen.

GPT-5.6 Sol — das Flaggschiff

Sol ist für die härtesten Aufgaben gebaut: tiefes mehrstufiges Denken, Softwareentwicklung in großem Maßstab und agentische Workflows mit langem Zeithorizont, wobei es über einen Kontext von ~1,05 Mio. Tokens und bis zu 128K Ausgabe hinweg kohärent bleibt. Bei $5 / $30 (Basis) ist es eine Premium-Wahl – heben Sie es für Aufgaben auf, die es wirklich brauchen, wie komplexe Multi-Datei-Programmierung oder lange Agentenläufe. Am 6. August hat O​penAI außerdem GPT-5.6 Sol in ChatGPT für Plus- und Pro-Nutzer aktualisiert: Das Unternehmen sagt, die Chat-Version sei bei Fakten zuverlässiger – 68 % weniger Faktenfehler, so O​penAI – und gebe fokussiertere Antworten, mit einem neuen Schieberegler, um zu steuern, wie viel Denkaufwand sie anwendet. Das Update betrifft nur den Chat (das Sol hinter Work und Codex ist unverändert), und die API-Stufe bleibt bei $5 / $30.

Der Reasoning-Token-Vorbehalt

GP​T-5.​6 sind Reasoning-Modelle, daher können die effektiven Ausgabekosten eine naive Schätzung übersteigen: Wenn Reasoning aktiviert ist, werden interne Reasoning-Token als Ausgabe abgerechnet. Bei anspruchsvollen Prompts mit hohem Reasoning-Aufwand kann das Ihre Rechnung dominieren. Passen Sie den Reasoning-Aufwand an die Aufgabe an (niedrig oder aus für einfache Aufrufe), begrenzen Sie die Ausgabetoken, wo Sie können, und messen Sie den tatsächlichen Verbrauch. Günstigere Preise pro Token helfen; das Erzeugen weniger Token hilft mehr.

Wie jede Stufe im Vergleich zur Konkurrenz abschneidet

Die Preissenkung positionierte GP​T-5.​6 neu im Wettbewerbsumfeld. Laut Berichten unterbietet Luna mit $0.20 / $1.20 nun Claude Haiku 4.5 um etwa das 5-Fache beim Input und das 4-Fache beim Output, und Terra liegt mit $2 / $12 unter der Standardpreisgestaltung von Claude Sonnet 5 (berichtet bei $3 / $15). Bei offenen Gewichten liegt Luna nahe der Untergrenze, die durch die V4-Linie von Deep​Seek und GLM-5.2 von Zhi​pu (etwa $1.20 / $4.10) gesetzt wird, wobei Qw​en- und Gem​ini-Flash-Stufen in der Nähe liegen. Das Fazit: Für kostenbewusste Aufgaben ist Luna nun konkurrenzfähig mit den günstigsten leistungsfähigen Modellen und nicht mehr eine Premium-Alternative zu ihnen – während Sol weiterhin eine echte Premium-Stufe für Leistungsfähigkeit darstellt, die man nicht günstig bekommt.

Der eigentliche Sparhebel: nach Schwierigkeit routen

Die günstigste Rechnung ist keine einzelne Preisstufe – es geht darum, jede Anfrage dem günstigsten Modell zuzuordnen, das sie bewältigen kann. In der Praxis: Senden Sie einfache, hochvolumige Anfragen an Luna (oder ein günstiges offenes Modell), steigen Sie für schwierigere Aufgaben auf Terra um und nutzen Sie Sol nur für die wirklich schwierige Minderheit. In Kombination mit Caching und Batch-Betrieb senkt dies die Kosten regelmäßig weit stärker als jede einzelne Preisänderung. Der Haken ist operativer Natur: Man möchte nicht drei OpenAI-Stufen plus Alternativen offener Modelle separat wieder integrieren.

Greifen Sie über einen einzigen Endpunkt auf alle drei (und günstigere Alternativen) zu.

Genau hier hilft ein herstellerneutraler Router. OrcaRouter stellt GPT-5.6 Luna, Terra und Sol — zu denselben reduzierten Preisen, 0 % Aufschlag — über einen einzigen O​penAI-kompatiblen Endpunkt bereit, neben günstigeren offenen Modellen wie DeepSeek V4 Pro, GLM-5.2 und Qw​en. Der Wechsel zwischen den Stufen (oder A/B-Tests von Luna gegen ein offenes Modell) ist eine Konfigurationsänderung, keine Neuintegration, und du kannst jede Anfrage an das jeweils günstigste Modell weiterleiten. Luna Reserve ist die Verbraucherversion derselben Idee — ein integrierter Fallback, der ausgewählte Nutzer auf GPT-5.6 Luna lässt, nachdem ihr reguläres Kontingent aufgebraucht ist — und das API-seitige Pendant ist automatisches Failover, das OrcaRouter übernimmt, wenn ein Anbieter eine Anfrage drosselt oder mit einem Fehler beantwortet.

Die nach der Preissenkung gültige Luna-Preisliste ist auf OrcaRouters eigener Modellseite zum Listenpreis sichtbar – 0,20 $ / 1,20 $ pro Million Token –, da der Router die Preise der Anbieter mit 0 % Aufschlag weitergibt, mit einem Kostenrechner direkt auf der Seite für eine typische monatliche Rechnung. Es gibt außerdem einen kostenlosen Tarif und eine Angebotsseite für zusätzliche Ersparnisse.

FAQ

Wie hoch sind die GPT-5.6-Preise nach der Preissenkung?

Luna $0.20 / $1.20, Terra $2 / $12, und Sol $5 / $30 pro Million Eingabe-/Ausgabetokens. Luna und Terra wurden am 30. Juli 2026 gesenkt; Sol ist unverändert.

Welche GP​T-5.​6-Stufe sollte ich verwenden?

Luna für umfangreiche, latenzempfindliche Arbeit; Terra für anspruchsvollere Aufgaben, die nicht das Flaggschiff benötigen; Sol für das anspruchsvollste Denken und agentisches Codieren. Nach Schwierigkeit routen, um Kosten zu minimieren.

Ist GPT-5.6 Luna in ChatGPT kostenlos?

O​penAI gab am 6. August bekannt, dass GPT-5.6 Luna zum Standardmodell für kostenlose und Go-ChatGPT-Konten wird, mit unbegrenzten Text-Chats; Einschränkungen bleiben bei Datei-Uploads, Bildern und Sprach-Tools bestehen, und ein Think-Button für höheres Denkvermögen wird separat eingeführt. Dies sind von O​penAI angekündigte Pläne, nicht unabhängig verifiziert.

Warum verwendet Replit GPT-5.6 Luna für den Free-Modus?

Replits Free Mode, angekündigt am 19. August 2026, führt alltägliche Chats, Ideenfindung und einfaches Programmieren standardmäßig für Core- und Pro-Abonnenten auf GPT-5.6 Luna aus und leitet schwierigere Aufgaben bei Bedarf an ein größeres Modell weiter – seine Power/Max-Modi oder GPT-5.6 Sol. Replit führt die Wirtschaftlichkeit auf die Preissenkung der Luna-API vom 30. Juli zurück, die etwa 80 % beträgt. Dies sind vom Anbieter angekündigte Pläne, die nicht unabhängig verifiziert wurden.

Was ist Luna Reserve?

Ein Fallback-Kontingent, das O​penAI für Codex und ChatGPT Work dokumentiert: Ausgewählte ChatGPT-Plus- und Pro-Konten erhalten ein begrenztes Kontingent für die Nutzung von GPT-5.6 Luna, sobald ihr reguläres Nutzungslimit erschöpft ist, damit sie weiterarbeiten können, anstatt abgeschnitten zu werden. Es liefert ausschließlich GPT-5.6 Luna – niemals Terra oder Sol –, hat ein eigenes Limit, ist vom regulären Verbrauch getrennt und in Business- oder Enterprise-Workspaces nicht verfügbar. Die Existenz ist von O​penAI bestätigt (Mitarbeiter bestätigten es am 27. August); die Einführung bei ausgewählten Konten wird von der Community berichtet, ist jedoch nicht unabhängig verifiziert.

Wie viel kostet GP​T-5.​6 pro Monat?

Bei 10M Token pro Monat (70 % Input): grob 5 $ auf Luna, 50 $ auf Terra und 125 $ auf Sol – ein 25-facher Unterschied, vor Caching. Ihre tatsächlichen Kosten hängen vom Caching und Ihrer Input-/Output-Mischung ab.

Verfügen alle drei Stufen über dasselbe Kontextfenster?

Ja — ungefähr ein Kontext von 1,05M Token und bis zu 128K Ausgabe-Token, mit Unterstützung für Vision, Tools, JSON und Reasoning.

Wie wirkt sich Prompt-Caching auf die Kosten aus?

Caching reduziert die Kosten für wiederholten Kontext drastisch — Lunas Cache-Read liegt bei etwa $0.02 pro Million Tokens gegenüber $0.20 für frische Kontexte — verwenden Sie also wann immer möglich gecachte Prompts. Lange Eingaben hingegen können Sie in eine teurere Long-Context-Stufe versetzen.

Wie schneiden die Stufen im Vergleich zu Anthropic oder offenen Modellen ab?

Laut Berichten unterbietet Luna Claude Haiku 4.5 (ca. 5x Input / 4x Output) und Terra liegt unter Claude Sonnet 5 (3 $ / 15 $). Luna liegt außerdem nahe der günstigen Open-Model-Untergrenze (Deep​Seek, GLM-5.2 ~1,20 $ / 4,10 $).

Wo kann ich alle drei Ebenen zusammen verwenden?

Über OrcaRouters einzelnen OpenAI-kompatiblen Endpunkt mit 0% Aufschlag, zusammen mit günstigeren offenen Modellen für ein schwierigkeitsbasiertes Routing.

Fazit

Nach der Preissenkung sind GPT-5.6 Luna ($0.20 / $1.20) und Terra ($2 / $12) attraktiv für Arbeiten mit hohem Volumen und das mittlere Segment, während Sol ($5 / $30) das Premium-Flaggschiff bleibt – eine 25-fache Kostenspanne, die intelligentes Routing belohnt. Der Verbraucher-Rollout untermauert die Aufteilung: OpenAI macht Luna zum kostenlosen Standard, reserviert Sols Zuverlässigkeitsupdate aber für kostenpflichtige Tarife. Replits Free Mode vom 19. August – auf GPT-5.6 Luna basierend, wobei schwierigere Aufgaben an GPT-5.6 Sol weitergereicht werden – zeigt, dass stark frequentierte Produkte auf derselben Stufe landen, und der Luna-Reserve-Fallback Ende August setzt das Muster fort, indem er ausgewählte Plus- und Pro-Nutzer auch nach dem Aufbrauchen ihrer regulären Limits auf GPT-5.6 Luna belässt. Für API-Entwickler ist das ein weiterer Grund, einfachen Traffic an Luna zu leiten. Die größten Einsparungen erzielt man, indem man nach Schwierigkeit routet, auf Caching und Batch setzt und Reasoning-Token kontrolliert, statt standardmäßig eine Stufe zu nutzen. Am einfachsten geht das über einen einzigen Endpunkt mit 0 % Aufschlag wie OrcaRouter, wo alle drei Stufen (zu den neuen Preisen) neben den günstigeren offenen Modellen liegen, mit denen man sie vergleichen möchte.