
OpenAI obniża ceny API GPT-5.6: Co się zmieniło, dlaczego i jak to uzyskać
- qwenNOWOŚĆQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 za 1 mln tokenów · 55 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligencja69Kod
- qwenNOWOŚĆQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 206 tok/s
- orcaNOWOŚĆOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOWOŚĆAnthropic: Claude Opus 52026-07-2461Inteligencja78Kod
- googleNOWOŚĆGoogle: Gemini 3.6 Flash2026-07-2150Inteligencja69Kod
- googleNOWOŚĆGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1651Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1557Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0854Inteligencja72Kod
- tencentTencent: Hy32026-07-0641Inteligencja59Kod
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencja42Kod
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencja39Kod
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencja72Kod
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencja52Kod57Matematyka
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencja69Kod60Matematyka
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligencja61Kod61Matematyka
30 lipca 2026 roku OpenAI obniżyło ceny API dwóch tańszych modeli GPT-5.6 — zdecydowanie obniżając cenę najtańszego wariantu i lekko redukując średni, podczas gdy flagowy model pozostał nietknięty. To znaczący ruch w nasilającej się wojnie cenowej, który natychmiast trafił do opublikowanego cennika. W tym artykule wyjaśniamy dokładnie, co się zmieniło, jaka inżynieria za tym stoi, jak nowe ceny wypadają na tle konkurencji, na jakie ukryte koszty uważać, jak jeszcze bardziej obniżyć rachunek — oraz że niższe ceny są już dostępne na OrcaRouter z 0% narzutem.
Każda wartość poniżej ma podane źródło. Ceny podawane są za milion tokenów (wejście / wyjście) i odzwierciedlają cennik OpenAI z 30 lipca 2026 r., o którym donosiły media, w tym Unite.AI, a także strony modeli passthrough OrcaRouter; dane konkurencji mają przypisane źródła. Ceny się zmieniają — sprawdź, zanim zbudujesz.
TL;DR. OpenAI obniżyło ceny GPT-5.6 Luna do 0,20 USD / 1,20 USD (z 1 USD / 6 USD, czyli o ~80%) oraz GPT-5.6 Terra do 2 USD / 12 USD (z 2,50 USD / 15 USD, czyli o ~20%), podczas gdy GPT-5.6 Sol pozostaje na poziomie 5 USD / 30 USD. Na tę obniżkę zapracowały dwa usprawnienia wydajnościowe: przepisane jądra GPU (ok. 20% niższy koszt serwowania) i przeprojektowany model szkicowy do dekodowania spekulatywnego (ponad 15% szybsze generowanie tokenów). Cięcie przesuwa Lunę poniżej Haiku 4.5 od Anthropic i w kierunku niskiego progu cenowego otwartych modeli wyznaczonego przez DeepSeek i GLM. Jeśli kierujesz ruch przez niezależny od dostawców punkt końcowy z 0% marżą, taki jak OrcaRouter, nowe stawki są już aktywne — ta sama cena, jedno API kompatybilne z OpenAI, a obok każdy konkurencyjny model do porównywania i przełączania się między nimi.
Najważniejsze wnioski
• GPT-5.6 Luna: teraz $0.20 / $1.20 za 1 mln tokenów, spadek z $1 / $6 — czyli około 80% obniżki.
• GPT-5.6 Terra: teraz $2 / $12 zamiast $2.50 / $15 — około 20% taniej.
• GPT-5.6 Sol (flagowy): bez zmian — 5 $ / 30 $.
• Dlaczego: przepisane produkcyjne kernele GPU (~20% niższy koszt serwowania) plus przeprojektowanie modelu szkicowego do dekodowania spekulacyjnego (ponad 15% wydajności generowania tokenów), według wpisu technicznego OpenAI z 29 lipca.
• Jak to zdobyć: obniżka jest już uwzględniona na OrcaRouter (0% narzutu) — Luna po $0.20 / $1.20 — przez jeden endpoint zgodny z OpenAI.
Co dokładnie się zmieniło?
Rodzina modeli OpenAI GPT-5.6 działa jak drabinka poziomów: Luna (szybki, najtańszy), Terra (średni) i Sol (sztandarowy). Obniżka z 30 lipca objęła dwa tańsze poziomy. Według opublikowanego cennika GPT-5.6 Luna spadła z $1 / $6 do $0,20 / $1,20 za milion tokenów wejściowych/wyjściowych — czyli o około 80% zarówno w przypadku wejścia, jak i wyjścia — a GPT-5.6 Terra spadła z $2,50 / $15 do $2 / $12, czyli o około 20%. GPT-5.6 Sol, sztandarowy model stworzony do najtrudniejszych zadań wnioskowania i agentowego kodowania, pozostał na poziomie $5 / $30. Poziomy o dużym wolumenie znacznie potaniały; najwyższy poziom nie drgnął.
Stawka bazowa za token to nie cała historia. Cennik GPT-5.6 obejmuje również progi długości wejścia (bardzo długie konteksty przechodzą na wyższą stawkę), zniżkę za cachowanie promptów (odczyt z pamięci podręcznej jest znacznie tańszy niż świeże wejście) oraz opcję wsadową (zadania asynchroniczne ze zniżką). Wszystkie trzy przekładają się na obniżkę, więc efektywna cena dla obciążenia opartego na cache lub wsadach może być jeszcze niższa. Uważaj na próg długiego kontekstu w drugą stronę: podawanie ogromnych promptów może przenieść cię na wyższy próg.

Dwie optymalizacje stojące za cięciem.
To nie był gest w stylu loss-leadera — OpenAI przedstawiło to jako dywidendę z efektywności. W poście technicznym z 29 lipca 2026 roku członkowie zespołu technicznego OpenAI opisali optymalizacje w zakresie inferencji oraz środowiska agentowego (agent harness) stojącego za Codex i ChatGPT Work. Wyróżniają się dwie z nich. Po pierwsze, przepisanie jąder GPU w całej infrastrukturze produkcyjnej — z wykorzystaniem Sol, działającego wewnątrz Codex, do przepisania własnych jąder firmy — co według OpenAI obniżyło kompleksowe koszty serwowania o około 20%. Po drugie, przeprojektowany model wstępny do dekodowania spekulatywnego, który według doniesień poprawił wydajność generowania tokenów o ponad 15%. Niższy koszt serwowania, przeniesiony na klientów jako niższe ceny w planach o wysokim wolumenie, to sedno tej historii — i przedsmak pętli sprzężenia zwrotnego, za którą goni cała branża: wykorzystywanie modeli granicznych do optymalizacji tej samej infrastruktury, która je obsługuje.
Jak wypadają nowe ceny
Obniżka jest wymierzona bezpośrednio w konkurencję. Według doniesień Unite.AI, nowe ceny Luny wynoszące 0,20 / 1,20 USD są niższe od cen Anthropic Haiku 4.5 o około 5x na wejściu i 4x na wyjściu, a nowe ceny Terry wynoszące 2 / 12 USD kształtują się poniżej standardowych cen Claude Sonnet 5 (według doniesień 3 / 15 USD, obowiązujących po 31 sierpnia 2026 r.). Na tle modeli o otwartych wagach Luna znajduje się teraz blisko dolnego progu taniej inferencji wyznaczonego przez linię DeepSeek V4 oraz GLM-5.2 od Zhipu (około 1,20 / 4,10 USD), a poziomy cenowe Alibaba Qwen i Google Gemini Flash utrzymują się w podobnym zakresie. Innymi słowy, OpenAI obniżyło swoje poziomy cenowe dla dużych wolumenów do poziomu, na którym już działają najtańsze wydajne modele — zmniejszając karę cenową za wybór modelu zastrzeżonego zamiast otwartego.
Inferencja staje się coraz tańsza.
Patrząc z szerszej perspektywy, ta obniżka wpisuje się w wieloletni trend: koszt danego poziomu możliwości gwałtownie spadał z pokolenia na pokolenie, w miarę jak laboratoria wyciskają coraz większą przepustowość z tego samego sprzętu. Własne starsze pakiety OpenAI ilustrują tę tendencję spadkową w czasie, a każdy przełom w wydajności — lepsze jądra, spekulatywne dekodowanie, tańsza attention — zwykle objawia się obniżką cen w ciągu kilku miesięcy. Dla kupujących praktyczny wniosek jest taki, by projektować architekturę dla świata, w którym wnioskowanie tanieje zgodnie z harmonogramem: nie wiązać się na stałe z cenami jednego modelu i utrzymywać niskie koszty przełączania.
Ukryty koszt, na który warto uważać: tokeny rozumowania
Modele GPT-5.6 to modele rozumujące, co wpływa na rzeczywiste koszty. Gdy rozumowanie jest włączone, model generuje wewnętrzne tokeny rozumowania, które są rozliczane jako wyjście — więc efektywny koszt wyjścia może być wyższy, niż sugerowałoby naiwne oszacowanie „słów w odpowiedzi”, zwłaszcza w przypadku trudnych promptów z wysokim poziomem rozumowania. Rozwiązaniem jest dostrojenie poziomu rozumowania do zadania (niski lub wyłączony w przypadku prostych wywołań), ograniczenie wyjścia tam, gdzie to możliwe, oraz mierzenie rzeczywistego użycia tokenów zamiast zakładania. Niższa stawka za token pomaga, ale kontrolowanie liczby generowanych tokenów pomaga bardziej.
Co to oznacza dla programistów
Jeśli używasz GPT-5.6 Luna lub Terra do pracy o dużej skali — klasyfikacji, ekstrakcji, routingu, lekkich agentów, czatu — Twój rachunek właśnie spadł, w niektórych przypadkach o większość swojej wartości, bez potrzeby zmiany kodu. To sprawia, że progi wolumenowe są jeszcze atrakcyjniejsze dla obciążeń wrażliwych na koszty i zawęża różnicę w cenie względem tanich otwartych modeli. Kalkulacja flagowca pozostaje bez zmian: Sol w cenie $5 / $30 nadal jest premium wyborem do najtrudniejszych zadań. Zwycięski wzorzec to routing według trudności — tanie progi (lub tanie otwarte modele) dla łatwych 80%, a flagowiec tylko tam, gdzie zwraca swój koszt.
Jak obniżyć swój rachunek jeszcze bardziej
Obniżka ceny to fundament do budowania, a nie meta. Największe dodatkowe dźwignie: cache'owanie promptów (użyj stabilnego promptu systemowego lub długiego kontekstu i zapłać znacznie niższą stawkę za wejście z cache'u); opcja wsadowa (uruchamiaj niepilne zadania asynchronicznie ze zniżką); routing warstw i modeli (wysyłaj każde żądanie do najtańszego modelu, który sobie z nim poradzi, w tym modele otwarte); oraz kontrola rozumowania (nie płać za głębokie rozumowanie przy trywialnych wywołaniach). Zastosowane łącznie, te dźwignie regularnie obniżają realne rachunki znacznie bardziej niż jakakolwiek pojedyncza zmiana stawek. Jako konkretny punkt odniesienia: przy 10 milionach tokenów miesięcznie z 70% udziałem wejścia, nowe stawki Luny wynoszą około $5 miesięcznie (około $4.37 z cache'owaniem); ta sama ilość na Sol to około $125 miesięcznie — najmocniejszy argument za routingiem według trudności.
Jak natychmiast skorzystać z niższych cen
Oto część, która spaja to wszystko. a href="https://www.orcarouter.ai/">OrcaRouter/a> pobiera 0% marży i przekazuje ceny dostawcy bezpośrednio, więc stawka OpenAI jest już dostępna na OrcaRouter: GPT-5.6 Luna pokazuje teraz $0.20 / $1.20, a Terra $2 / $12 na stronach modeli — te same stawki, co w cenniku samego OpenAI, dostępne przez jeden endpoint kompatybilny z OpenAI, obok 185+ innych modeli. Otrzymujesz tę stawkę bez migracji i możesz porównać ceny Luny i Terry z DeepSeek, GLM, Qwen, Gemini i Claude w jednym miejscu, a następnie kierować każde żądanie do opcji, która jest najtańsza dla danego zadania. Jest też darmowy poziom oraz strona Offers z dodatkowymi oszczędnościami.

Obniżka jest już aktywna na OrcaRouter: GPT-5.6 Luna za 0,20 $ / 1,20 $ za 1M tokenów, z zerowym narzutem.
Wyznacz trasę według trudności, aby zaoszczędzić jeszcze więcej
Najtańszy rachunek to nie jeden model — to właściwy model do każdego zapytania. Ponieważ OrcaRouter udostępnia całą gamę modeli przez jeden endpoint, proste, wysokowolumenowe zapytania możesz kierować do Luny lub taniego otwartego modelu, a Sol lub inny flagowy model zostawić dla trudnych — przełączenie to zmiana konfiguracji, a nie ponowna integracja. Obniżka ceny Luny czyni tę strategię routowania według trudności jeszcze tańszą, bez przepinania czegokolwiek.

Często zadawane pytania
O ile OpenAI obniżyło ceny GPT-5.6?
GPT-5.6 Luna spadł z $1 / $6 do $0,20 / $1,20 za milion tokenów (około 80%), a GPT-5.6 Terra z $2,50 / $15 do $2 / $12 (około 20%). GPT-5.6 Sol pozostał na poziomie $5 / $30.
Kiedy weszła w życie obniżka cen?
30 lipca 2026 r., odnotowane w dzienniku zmian API OpenAI i aktywne na opublikowanej karcie stawek.
Dlaczego OpenAI obniżyło ceny?
OpenAI przypisuje to optymalizacjom wnioskowania — przepisanym produkcyjnym jądrom GPU (około 20% niższy koszt serwowania) i przeprojektowanemu modelowi draftowemu do spekulatywnego dekodowania (ponad 15% wydajności generowania tokenów) — według wpisu inżynierskiego z 29 lipca 2026 r.
Czy flagowiec (Sol) staniał?
Nie. GPT-5.6 Sol pozostaje po 5 / 30 dolarów za milion tokenów. Obniżono tylko dwa tańsze poziomy, Lunę i Terę.
Jak nowe ceny wypadają w porównaniu z Anthropic i otwartymi modelami?
Według raportów Luna jest teraz tańsza od Haiku 4.5 firmy Anthropic o około 5x w przypadku wejścia / 4x w przypadku wyjścia, a Terra jest poniżej standardowej ceny Claude Sonnet 5 (3 $ / 15 $). Luna znajduje się również blisko niskiego progu cenowego otwartych modeli wyznaczonego przez DeepSeek i GLM-5.2.
Jaki jest haczyk z tokenami rozumowania?
GPT-5.6 to modele rozumujące; wewnętrzne tokeny rozumowania są rozliczane jako wyjście, więc efektywny koszt wyjścia może przekroczyć naiwne szacunki. Dostosuj wysiłek rozumowania i ogranicz wyjście, aby to kontrolować.
Jak uzyskać nowe niższe ceny?
Są już dostępne w API OpenAI i, przy 0% marży, na OrcaRouter — gdzie GPT-5.6 Luna pokazuje $0.20 / $1.20 — przez jeden endpoint zgodny z OpenAI, bez konieczności zmian w kodzie.
Sedno sprawy
Obniżka cen OpenAI z 30 lipca sprawia, że GPT-5.6 Luna i Terra są znacznie tańsze przy pracy o dużej skali — to dywidenda wydajności wynikająca z przepisania jądra i zysków z dekodowania spekulacyjnego, a także wyraźna odpowiedź na realną wojnę cenową, która obecnie podcina tańsze poziomy Anthropica i zbliża się do podłogi cenowej otwartych modeli. Flagowy Sol pozostaje bez zmian, więc kieruj się trudnością zadań, polegaj na cache'owaniu i grupowaniu oraz kontroluj tokeny rozumowania, aby zaoszczędzić najwięcej. A ponieważ OrcaRouter przekazuje ceny dostawców z 0% narzutu, niższe stawki są już tam aktywne — ta sama cena, jeden endpoint zgodny z OpenAI i cały wachlarz modeli w jednym miejscu. Skorzystaj z obniżki bez zmiany ani jednej linijki kodu i pozwól, aby każde żądanie wybierało najtańszy model, który poradzi sobie z zadaniem.
