Karta tytułowa z napisem „GPT-6 Astra w Codex” i podtytułem „Notatki między oknami, poziomy wysiłku i rzeczywisty rachunek”, wiersz „Model wydany 3 września 2026 – strona referencyjna zweryfikowana 16 września 2026” oraz trzy oznaczone karty: config.toml, Notatki plus przeszukiwalna historia i Koszt na sesję.
Guides & Insights

GPT-6 Astra w Codex: notatki między oknami, poziomy wysiłku i prawdziwy rachunek

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

GPT-6 Astra to model z 2026-09-03, a ta strona nie jest relacją z premiery — to materiał referencyjny do skierowania na niego swojego agenta kodującego teraz, gdy jest powszechnie dostępny. Powód, dla którego deweloper miałby się przełączyć, to jeden konkretny mechanizm i warto go zrozumieć, zanim wydasz na niego jakiekolwiek pieniądze: zamiast kompresować długą sesję w jedno stratne podsumowanie za każdym razem, gdy okno się zapełnia, Co​dex z GPT-6 Astra prowadzi notatki między oknami kontekstu i pozostawia wcześniejsze okna kontekstu przeszukiwalne, dzięki czemu wymaganie, które podałeś czterdzieści tur temu, oraz dane wyjściowe testu, który nie powiódł się dziesięć tur temu, wciąż można odzyskać, a nie zostały zamiecione podsumowaniem. Ope​nAI nazywa tę funkcję eksperymentalną, włącza ją jedną linią w twoim pliku Co​dex config.toml i twierdzi, że stanie się domyślnym ustawieniem dla Astra. Wszystko poniżej — dokładna konfiguracja, poziomy wysiłku, zmierzone wyniki oraz przykładowy rachunek za sesję, w którym wymieniono wiersz buforowanego wejścia — odczytano ze stron samego Ope​nAI w dniu 2026-09-16, a każda liczba od stron trzecich jest oznaczona jako taka.

W tym tygodniu wydarzyły się dwie rzeczy, które zmieniają arytmetykę związaną z jego wdrożeniem. W dniu 2026-09-12 lider OpenAI ds. Codex opublikował postmortem potwierdzający, że sam eksperyment z zarządzaniem kontekstem miał błąd — powodował przedwczesne zatrzymania i odpowiedzi na nieaktualne wiadomości, i został wyłączony dla około 4000–5000 użytkowników, którzy z niego korzystali — a OpenAI przeprowadziło pełny reset limitów użycia dla użytkowników Codex i Astra o północy z 09-12 na 09-13. W tym samym tygodniu korporacyjne przestrzenie robocze, w których Astra była domyślnie wyłączona przy uruchomieniu, stały się możliwe do administrowania według własnego cennika. Uczciwe stanowisko jest więc takie: mechanizm jest wart wdrożenia, build wciąż się zmienia pod twoimi stopami, a ty powinieneś wypróbować go na gałęzi, a nie pod presją terminu.

Co tak naprawdę jest nowego w Co​dex z GPT-6 Astra?

Poproś dowolnego agenta kodującego, żeby pracował przez sześć godzin, a napotkasz ten sam mur. Okno kontekstu się zapełnia, środowisko streszcza zapis rozmowy do jednego gęstego bloku, żeby zrobić miejsce, a streszczenie jest stratne dokładnie w ten sposób, który boli — powód, dla którego wcześniejsza poprawka nie zadziałała, dokładny kształt nieprzechodzącego testu, ograniczenie, o którym użytkownik mimochodem wspomniał w trzeciej turze. Przywołane szczegóły, a nie streszczone, są tym, czego tak naprawdę chciałeś.

Integracja Astra z Co​dex zmienia kształt tego. Dokumentacja Co​dex od Ope​nAI mówi to wprost: „Astra przechowuje notatki między oknami kontekstu i może przeszukiwać wcześniejsze wiadomości oraz wyniki narzędzi z tego samego zadania”. Notatki są trwałe i można je zapisywać; historia za nimi pozostaje czytelna, więc wcześniejsze okno można nadal przeszukiwać w poszukiwaniu pierwotnych dowodów, nawet po zapisaniu notatki na ich temat. Wymagania i wyniki testów z wcześniejszych wiadomości oraz dane wyjściowe narzędzi wciąż można znaleźć.

OpenAI jednoznacznie stwierdza, że nie są to ukończone prace. W dokumentacji konfiguracji flaga ta jest opisana jako „Włącz eksperymentalne zarządzanie kontekstem (domyślnie wyłączone)” i stwierdza się, że funkcja „wykorzystuje notatki i przeszukiwalną historię do zachowywania zgromadzonych szczegółów”. Dokumentacja podaje również, że „nie jest dostępna w przypadku logowania przez Business, Enterprise lub za pomocą klucza API w momencie premiery”. To również nie jest nieskończony kontekst — model nadal rozumuje w skończonym oknie, a każde ponowne odczytanie wcześniejszej notatki zużywa budżet wejściowy tej tury. Okno ma 1 050 000 tokenów, a maksymalna liczba tokenów wejściowych wynosi 922 000, zgodnie z dokumentacją modeli OpenAI; mechanizm notatek opiera się na tym rozwiązaniu, a nie zastępuje go.

Konfiguracja, dokładnie tak, jak dokumentuje ją Ope​nAI

To ustawienie jest elementem podrzędnym tabeli [features] w Twoim pliku Codex config.toml — plik znajduje się w ~/.codex/, chyba że nadpisano CODEX_HOME. Udokumentowana ścieżka klucza to features.context_management.experimental_mode, wartość logiczna, a wartością jest true:

[features.context_management]
experimental_mode = true

Jeśli w pliku masz już tabelę [features], dodaj odpowiedni klucz wewnątrz niej, zamiast deklarować tę tabelę dwukrotnie:

[features]
context_management.experimental_mode = true

Użyj jednej albo drugiej formy. Społecznościowe omówienia tej flagi podają, że zadeklarowanie kropkowanej ścieżki w korzeniu, a następnie otwarcie tabeli [features] w dalszej części tego samego pliku może nie zostać sparsowane, ponieważ zostanie uznane za ponownie zadeklarowaną tabelę, co jest regułą TOML, a nie OpenAI — ale ludzie się na tym potykają, więc wybierz jedną formę i się jej trzymaj. Po edycji rozpocznij nowe zadanie: to ustawienie nie dopasowuje się wstecznie do już działającej sesji.

Połowa tego samego pliku dotycząca modelu nie wyróżnia się niczym szczególnym, a dokumentacja referencyjna Ope​nAI opisuje te klucze bezpośrednio — model to „Model do użycia”, a model_provider domyślnie przyjmuje wartość openai:

model = "gpt-6-astra"
model_provider = "openai"
model_reasoning_effort = "high"

Jedna uwaga dotycząca czytania wersji dokumentacji. Dokumentacja referencyjna konfiguracji Codex podaje, że model_reasoning_effort akceptuje wartości minimal, low, medium, high i xhigh, zaznaczając, że xhigh zależy od modelu — podczas gdy strona modelu API OpenAI dla gpt-6-astra dokumentuje reasoning.effort jako low, medium, high, xhigh i max. Suwak klienta i API nie opisują tego samego zestawu, więc ustaw effort jawnie i potwierdź, co zaakceptował Twój klient, zamiast zakładać.

Wybór modelu — i reguła dostępu, która zaskakuje ludzi

Dokumentacja modelu Codex OpenAI podaje bezpośrednio formę CLI: codex -m gpt-6-astra. W sesji interaktywnej /model przełącza model i dostosowuje poziom wysiłku rozumowania; w uruchomieniu jednorazowym codex exec -m gpt-6-astra "Review the current changes" działa tak samo. W aplikacji desktopowej i rozszerzeniu IDE kontrolka modelu znajduje się pod polem wprowadzania.

Reguła dostępu to miejsce, w którym ludzie popełniają błędy, i warto przeczytać ją dwukrotnie, ponieważ te dwie funkcje mają różne bramki:

• Model — dostępny w ChatGPT Work, Codex i API, a także oferowany na Microsoft Azure i AWS Bedrock. Strona startowa OpenAI podaje, że Astra „jest udostępniana dziś ograniczonemu zestawowi organizacji, a w nadchodzących dniach stanie się dostępna dla wszystkich użytkowników ChatGPT Plus, Pro, Business i Enterprise”.

• Eksperymentalne zarządzanie kontekstem — węższe. Dokumentacja OpenAI stwierdza, że „wymaga zalogowania się do ChatGPT w planach Plus, Pro lub Pro Lite” oraz że „nie jest dostępne w przypadku logowania się w planach Business, Enterprise lub za pomocą klucza API w momencie premiery”.

Ta druga linijka jest tą, którą warto sobie przyswoić. Możesz wywoływać gpt-6-astra za pomocą klucza API i możesz za to płacić w planie Business — ale funkcji notatek między oknami tam nie będzie. Jeśli mechanizm notatek jest powodem, dla którego przechodzisz, potrzebujesz logowania ChatGPT Plus, Pro lub Pro Lite w kliencie Codex, a nie klucza API. OpenAI przedstawia to jako dostępność zależną od „wdrożenia, metody logowania i klienta”, co jest uprzejmą wersją tego samego.

A screenshot of OpenAI's official Codex models documentation showing the model and reasoning control beneath the composer set to '5.6 Sol Extra High', a note that Ultra mode uses subagents, and a Recommended models row of three cards - Astra described as the most capable model for complex work across code, apps and research with advanced reasoning and computer use, 5.6 Sol for complex coding and cybersecurity, and 5.6 Terra as the balanced lower-cost model. A GPT-5.5 retirement notice dated October 14, 2026 appears above.

Dwa kolejne zastrzeżenia, oznaczone jako zgłoszone, a nie udokumentowane przez dostawcę. Relacje z wdrożenia podają, że dla Astra wymagany jest Co​dex CLI w wersji 0.153.0 lub nowszej; nie udało się potwierdzić tej minimalnej wersji na własnych stronach Ope​nAI. Dokumentacja Co​dex opisuje też presety selektora modeli — Astra Light, Astra Medium, Astra Extra High — oferowane uprawnionym kontom Pro, Business ($100) i Enterprise obok suwaka rozumowania. To pozycje selektora, a nie osobne produkty: Ope​nAI dokumentuje jeden identyfikator modelu, gpt-6-astra, z jednym zestawem specyfikacji i jedną ceną, i nie publikuje odrębnej specyfikacji ani stawki dla żadnej konfiguracji „Astra Pro” lub „Astra Medium”. Wszelkie liczby podawane dla nazwanego poziomu Astra należy traktować jako niezweryfikowane.

Jeśli chcesz wypróbować model, zanim zdecydujesz się oprzeć na nim ścieżkę produkcyjną, kierowanie go przez jeden endpoint obok obecnego modelu to tani sposób, by się przekonać — GPT-6 Astra jest w katalogu OrcaRouter, więc test porównawczy kosztuje cię tylko ciąg modelu, a nie drugą umowę i drugie SDK.

Wysiłek rozumowania: pięć poziomów i ile kosztuje każdy z nich

Dokumentacja API Ope​nAI dla gpt-6-astra wymienia pięć poziomów wysiłku — low, medium, high, xhigh i max — a wskazówki Co​dex mówią bez ogródek, jak ich używać: „Używaj najniższego wysiłku rozumowania, który daje rezultat, jakiego potrzebujesz”, i zacznij od domyślnego, zwiększając go, gdy zadanie wymaga głębszego planowania.

Powód, dla którego ignorowanie tej rady jest kosztowne konkretnie w tym modelu, tkwi w tym, gdzie tokeny rozumowania trafiają na rachunek. Tokeny rozumowania to tokeny wyjściowe, a wyjście w modelu Astra kosztuje 50,00 USD za milion — dziesięć razy więcej niż stawka za wejście i pięćdziesiąt razy więcej niż stawka za wejście z pamięci podręcznej. Zatem ten kompromis nie jest abstrakcyjny:

• Każde dodatkowe 1000 tokenów rozumowania na turę kosztuje 0,05 USD według stawki za dane wyjściowe.

• W sesji liczącej 150 tur utrzymywanie dodatkowych 1 000 tokenów rozumowania na turę kosztuje około 7,50 USD; utrzymywanie dodatkowych 5 000 kosztuje około 37,50 USD.

• W poniższej przeanalizowanej sesji dane wyjściowe stanowią już największą pojedynczą pozycję — 0,200 USD na turę wobec 0,090 USD z odczytów pamięci podręcznej — to wzrost rozumowania jest składnikiem, który najszybciej zwiększa sumę.

To, czego Ope​nAI nie publikuje, to tabela dla poszczególnych poziomów wysiłku: nie ma żadnej wartości podanej przez dostawcę określającej, ile tokenów rozumowania generują xhigh lub max w zadaniu programistycznym w stosunku do medium, ani benchmarku dostawcy z rozbiciem na poziomy wysiłku. Każdy, kto podaje ci precyzyjny współczynnik „max kosztuje 2x”, cytuje własny pomiar, a nie pomiar Ope​nAI. Uczciwa metoda polega na uruchomieniu jednego reprezentatywnego zadania na dwóch poziomach wysiłku i odczytaniu bloku usage w odpowiedzi — ta liczba pomnożona przez $50 za milion to twoja rzeczywista premia za wyższy wysiłek.

Zmierzone wyniki, każdy z własnym źródłem

Praca z kodem i terminalem — wszystkie dane raportowane przez OpenAI, o ile nie zaznaczono inaczej. Terminal-Bench 4.0: GPT-6 Astra z wynikiem 57,9%, wobec 37,3% dla GPT-5.6 Sol i 55,8% dla Claude Fable 5.1 — przy czym OpenAI szacuje około 9% niższy koszt API na zadanie względem GPT-5.6 Sol i 63% niższy względem Claude Fable 5.1. DeepSWE v1.1 od Datacurve umieszcza Astrę na poziomie 74,1% w benchmarku własnym Datacurve, co Datacurve opisuje jako nowy rekord, a niektóre relacje zaokrąglają do 74%. W szerszym zestawie agentowym OpenAI raportuje OSWorld 2.0 na poziomie 72,6% przy około 40 minutach na zadanie — około 47% mniej czasu na zadanie niż GPT-5.6 Sol — obok FrontierMath Tier 4 na poziomie 98%, ARC-AGI-3 na poziomie 99,9% i ExploitBench na poziomie 100%, które OpenAI opisuje jako nasycone lub praktycznie nasycone poziomy. Są to liczby dostawcy; nie odtworzyliśmy ich, a niezależna analiza wyniku ARC-AGI-3 przeprowadzona przez ARC Prize wykazała, że został on zmierzony w specjalnym środowisku adaptera dostawcy i spada w standardowych warunkach.

Element, który nie jest numerem dostawcy, jest tym, co dla przepływu pracy przeglądu kodu powinno mieć największe znaczenie. CodeRabbit opublikował własną ocenę Astry w dniu 2026-09-04, a wynik jest węższy niż nagłówek. W przypadku pull requestów obejmujących wiele plików — trudnych przeglądów, które wymagają powiązania zmiany ze skutkami w innych częściach bazy kodu — Astra wychwyciła około 20% więcej błędów niż GPT-5.6 Sol, przy użytecznym pokryciu błędów wynoszącym 57,1% w porównaniu z 47,6%. W przypadku ogólnych przeglądów zysk w dużej mierze znika: 61,3% w porównaniu z 59,0%, czyli około 4% więcej. CodeRabbit określa oba jako „wczesne, kierunkowe wyniki”, które nie ustalają rankingu, i zauważa, że jego metoda nie izoluje przyczyny poprawy. Strona premiery OpenAI określa tę samą pracę jako „ponad dwukrotnie w przypadku pull requestów obejmujących wiele plików”; własny opis CodeRabbit podaje 20% i powyższe wartości procentowe pokrycia. Czytaj wartości procentowe, a nie podsumowanie.

A single-column scoreboard titled 'GPT-6 Astra in Codex - the scoreboard' with six rows: Terminal-Bench 4.0 at 57.9%, DeepSWE v1.1 at 74.1%, Mind2Web at 1.9x faster, context window of 1,050,000 tokens, cached input at $1.00 per 1M, and output at $50.00 per 1M. A footer reads 'OpenAI-reported except DeepSWE v1.1 (Datacurve); pricing per OpenAI, read September 16, 2026.'

Ta asymetria to najbardziej użyteczna liczba na tej stronie przy podejmowaniu decyzji, jak wdrożyć model, i wskazuje ten sam kierunek co cena: zysk koncentruje się w rozumowaniu między plikami, więc tam właśnie należy wykorzystać model.

Co zmienia korzystanie z komputera w Co​dex dla Twojego przepływu pracy?

OpenAI twierdzi, że zaktualizowane środowisko uruchomieniowe Codex sprawia, że GPT-6 Astra ukończa zadania na Mind2Web 1,9 razy szybciej niż obecne doświadczenie z GPT-5.6 Sol. Mind2Web to automatyzacja zadań internetowych, więc rozumiej to tak: praca agenta, która musi mieć styczność z przeglądarką lub GUI, kończy się znacząco szybciej, a to samo zaktualizowane środowisko uruchomieniowe jest tym, na czym działasz, gdy w ogóle korzystasz z Codex. Towarzysząca liczba to powyższy wynik OSWorld 2.0 — 72,6% przy około 40 minutach na zadanie, czyli o około 47% mniej czasu na zadanie niż Sol.

Dla dewelopera praktyczną konsekwencją jest zmiana w tym, co warto delegować. Przepływy pracy, które wcześniej były zbyt wolne, by automatyzować je end-to-end — obsługa konsoli stagingowej bez API, odtwarzanie błędu przez interfejs użytkownika, przechodzenie przez wieloetapowy formularz w celu wygenerowania fixture'a — mieszczą się teraz w zakresie, w którym uruchomienie agenta jest tańsze niż zrobienie tego ręcznie. Podnosi to również wartość kontroli po stronie przedsiębiorstwa, które OpenAI dostarczyło wraz z nimi: ChatGPT Work i Codex dodają zasady potwierdzania, co oznacza zatwierdzanie przed istotnymi działaniami, oraz automatyczny przegląd niebezpiecznych lub nieautoryzowanych wywołań narzędzi. Jeśli pozwalasz agentowi klikać w prawdziwym interfejsie, ta warstwa przeglądu jest tym, co stoi między złym przebiegiem a złym popołudniem — i to dlatego dostęp dla przedsiębiorstw domyślnie wyłączony, z administratorem włączającym go zgodnie z obowiązującym cennikiem, jest funkcją zarządzania, a nie przeszkodą.

Wycena przepływu pracy, a nie tokenu

Oto cena, z nazwą i datą. Ze strony cennika OpenAI (odczyt: 2026-09-16): standard gpt-6-astra to $10.00 za milion tokenów wejściowych, $1.00 za milion tokenów wejściowych z pamięci podręcznej, $12.50 za milion zapisów do pamięci podręcznej i $50.00 za milion tokenów wyjściowych. Batch i Flex działają po połowie tych stawek; tryb Fast podwaja je. To właśnie ta pozycja dotycząca wejścia z pamięci podręcznej decyduje o rachunku w pętli agentowej, ponieważ agent kodujący ponownie wysyła duży, w większości niezmieniony kontekst w każdej pojedynczej turze, a wejście z pamięci podręcznej kosztuje jedną dziesiątą świeżego wejścia.

Przed arytmetyką liczą się dwa progi. Dokumentacja modelu OpenAI podaje, że prompty powyżej 272 000 tokenów wejściowych są wyceniane według 2x stawek za dane wejściowe i pamięć podręczną oraz 1,5x stawki wyjściowej za całe żądanie — nie tylko za nadwyżkę — a strona cennika zawiera wiersz dla długiego kontekstu: 20,00 USD za dane wejściowe, 2,00 USD za dane wejściowe z pamięci podręcznej i 75,00 USD za dane wyjściowe. A każdy token rozumowania jest rozliczany według stawki wyjściowej, jak omówiono powyżej.

Weź realistyczny całonocny refaktoring: 150 tur modelu, średnio 100 000 tokenów wejściowych na turę, z czego 90 000 to odczyt z pamięci podręcznej, a 10 000 to nowe tokeny, oraz 4 000 tokenów wyjściowych na turę, w tym rozumowanie. Poniżej progu 272 tys. przy standardowych stawkach:

• Wejście z pamięci podręcznej — 90 000 tokenów × 1,00 USD za milion = 0,090 USD na turę

• Świeże dane wejściowe — 10 000 tokenów × 10,00 USD za milion = 0,100 USD na turę

• Wyjście — 4 000 tokenów × 50,00 USD za milion = 0,200 USD na turę

• Łącznie — 0,390 USD za turę, więc 150 tur to około 58,50 USD za sesję

Teraz przesuń tę samą sesję powyżej progu. Przy 300 000 tokenów wejściowych na turę — 270 000 z pamięci podręcznej, 30 000 nowych — całe żądanie zostaje wycenione od nowa, więc wejście z pamięci podręcznej podwaja się do 2,00 USD, nowe wejście podwaja się do 20,00 USD, a wyjście wzrasta do 75,00 USD:

• Buforowane dane wejściowe — 270 000 × 2,00 USD za milion = 0,540 USD za turę

• Nowe dane wejściowe — 30 000 × 20,00 USD za milion = 0,600 USD na turę

• Wyjście — 4 000 × 75,00 USD za milion = 0,300 USD za turę

• Razem — 1,44 USD za turę, czyli około 216,00 USD za 150 tur

Ten sam kształt zadania, rachunek około 3,7 razy wyższy, a cała różnica sprowadza się do tego, po której stronie 272 000 tokenów znajduje się Twój transkrypt. To w jednym zdaniu argument za mechanizmem notatek: jeśli trwałe notatki i przeszukiwalna historia pozwalają utrzymać kontekst roboczy szczuplejszy, zamiast ciągnąć dalej cały transkrypt, funkcja zwraca się w tokenach wejściowych, zanim w ogóle zacznie pomagać w jakości. To także argument przeciw temu, by uruchomienie bez nadzoru rozrastało transkrypt bez górnego limitu.

A screenshot of the OrcaRouter model page for GPT-6 Astra showing the catalog id openai/gpt-6-astra, 1M tokens of context and 128K max output, text, image and file input with text output, reasoning, coding and agentic use cases, $10.00 per 1M input and $50.00 per 1M output, the /v1/chat/completions and /v1/responses endpoints, and an OpenAI-compatible code sample pointed at api.orcarouter.ai/v1.

Dla porównania, ta sama sesja o 150 turach przy tym samym profilu tokenów na tańszych poziomach: GPT-5.6 Terra przy publikowanych stawkach 2,00 USD za wejście / 0,20 USD za pamięć podręczną / 12,00 USD za wyjście daje około 12,90 USD, a GPT-5.6 Luna przy 0,20 / 0,02 / 1,20 USD daje około 1,29 USD. To arytmetyka na publikowanych stawkach Ope​nAI, a nie twierdzenie, że wykonałyby to samo zadanie — co jest sednem dwóch kolejnych sekcji.

Jeśli porównujesz to wszystko u różnych dostawców, warto wiedzieć, że OrcaRouter przekazuje cenę katalogową dostawcy bez narzutu (0%), więc zmiana ceny u dostawcy jest widoczna w trasowanym punkcie końcowym tego samego dnia, a nie dopiero na następnej fakturze.

Tryby awarii, które należy uwzględnić w projekcie

Astra to model długiego horyzontu oparty na konstrukcji długiego kontekstu, a obie połowy tego opisu to miejsca, w których tkwią problemy. To ustalenia społeczności i postmortemy dostawców, a nie nasze pomiary.

• W tym tygodniu w eksperymencie dotyczącym zarządzania kontekstem pojawił się błąd. Opublikowany przez OpenAI raport powłamaniowy z 2026-09-12 potwierdza, że eksperyment oparty na dobrowolnym udziale „powodował przedwczesne zatrzymania oraz odpowiedzi na nieaktualne wiadomości”, dotykając około 4000–5000 użytkowników, i został wyłączony. Ten sam raport wymienia dwie inne przyczyny skarg na jakość z tygodnia premiery: umiejętności (skills) napisane pod wcześniejsze modele, które wyzwalały się nieprawidłowo i uniemożliwiały Astrze sprawdzanie własnej pracy, oraz błędnie skonfigurowane silniki obsługujące, pogarszające jakość obsługi dla ogona ruchu. Następnie o północy z 09-12 na 09-13 nastąpił reset limitów użycia.

• Nadmierne analizowanie i rozrost testów. Szeroko udostępniany wątek na r/codex opisuje, jak Astra w odpowiedzi na niewielkie zgłoszenie funkcji najpierw zbudowała warstwy weryfikacji, testy dymne i sprawdzanie haszy, uruchamiała je w kilku kolejnościach i zgłosiła licznik użycia blisko wyczerpania na długo przed tym, zanim funkcja w ogóle powstała. Te relacje to pojedyncze relacje, a nie kontrolowane pomiary, a podobne skargi krążyły o innych modelach frontier miesiąc wcześniej — więc traktuj to jako realny wzorzec, względem którego można określić zakres, a nie tempo, na którym można opierać planowanie.

• Przebiegi, które się nie kończą. Armin Ronacher, twórca Flaska, opisał, jak zostawił Astrę działającą bez nadzoru przez 35 godzin, po których wygenerowała ona około 75 000 linii netto w 79 commitach, około 1400 wiadomości między agentami i około 1200 USD opłat za API — około 15,50 USD na commit — przy czym, według jego oceny, nie dostarczono nic wartościowego. Doniesienia o liczbie tokenów są rozbieżne, więc tę liczbę należy traktować orientacyjnie. Brakujący warunek zatrzymania przedstawił jako problem w równym stopniu związany z otoczeniem wykonawczym, co z modelem, i to jest praktyczny wniosek: zdefiniuj ukończenie, zanim zaczniesz.

• Istnieje również odwrotny problem. Raporty społeczności opisują, że Astra zatrzymuje się tuż przed ukończeniem zadania i czeka na podpowiedź, aby kontynuować — to ta sama przyczyna źródłowa widziana z drugiej strony: niedostatecznie doprecyzowane pojęcie „gotowe”. Jasne określenie, co znaczy „gotowe”, to najcenniejsza pojedyncza linia w twoim prompcie zadania.

• Długie sesje mogą stać się niemożliwe do odzyskania. Otwarte zgłoszenia Co​dex opisują sytuację typu paragraf 22, w której okno kontekstu się zapełnia, uruchamia się automatyczna kompakcja, samemu zadaniu kompakcji kończy się kontekst, a wątku nie da się odzyskać — a osobno, że natywne trasy notatek i historii zwracają 404 w Pro z Astrą w niektórych konfiguracjach, podczas gdy przełączanie okien może powodować utratę stanu zadania. Jedno i drugie to otwarte zgłoszenia, a nie oświadczenia dostawcy, ale przemawiają za tym, by utrzymywać punkty kontrolne przebiegów w git, zamiast ufać, że sesja przetrwa.

• Nieaktualne notatki to cecha projektu, a nie błąd. Nic nie gwarantuje, że notatka odzwierciedla aktualny stan opisywanego pliku, a wyszukiwanie polega na dosłownym dopasowywaniu podciągów, a nie na dopasowywaniu semantycznym. Przechowuj ścieżkę źródłową razem z notatką, weryfikuj ponownie przy zmianie i traktuj notatki z przebiegu bez nadzoru jako dowody do sprawdzenia, a nie prawdę, na której można polegać.

• Limity użycia to obecnie główny przedmiot skarg. Raporty z tygodnia 14 września 2026 r. obejmują limity nawet czterokrotnie bardziej restrykcyjne niż w tygodniu premiery oraz nierozwiązany zarzut, że wysiłek xhigh zużywa mniej przydziału niż średni — co, jeśli się potwierdzi, oznacza, że wysiłek i kwota nie idą w parze. Ope​nAI nie opublikowało liczbowych limitów dla poszczególnych planów Astra.

Kiedy tańszy model to właściwy wybór

Powyższe zmierzone wyniki podejmują decyzję o routingu za Ciebie. Przewaga Astry koncentruje się na pracy obejmującej wiele plików lub wiele godzin: przeglądzie międzyplikowym, długoterminowych zadaniach agentowych, przepływach computer-use. Przy zwykłych edycjach pojedynczych plików, mechanicznych refaktoryzacjach, tworzeniu szkieletów testów i formatowaniu ~4-procentowa ogólna różnica w przeglądzie względem GPT-5.6 Sol nie uzasadnia około 2,5-krotności obecnej ceny za token — a własny wniosek CodeRabbit wskazuje to samo, zalecając inteligentne kierowanie zadaniami zamiast całkowitego zastąpienia. Zarezerwuj drogi model do zadań, w których ujawnia się jego przewaga, a resztę kieruj niżej.

Konkretnie, działający podział: GPT-6 Astra do zmian obejmujących wiele plików, nieznanych baz kodu, wielogodzinnych przebiegów agentów i wszystkiego, co dotyczy przeglądarki; GPT-5.6 Terra do edycji o ograniczonym zakresie, generowania kodu szablonowego i testów; GPT-5.6 Luna do klasyfikacji, ekstrakcji i masowych mechanicznych przebiegów. Zgodnie z powyższymi obliczeniami sesji różnica między uruchamianiem wszystkiego na Astra a uruchamianiem jednej trzeciej tego na Astra to różnica między około 58,50 USD a około 28 USD w przypadku tych samych 150 tur.

Właściwe przeprowadzenie tego podziału to dokładnie zadanie warstwy routingu. OrcaRouter umieszcza ponad 200 modeli za jednym API, więc powyższy podział to zmiana konfiguracji, a nie trzy integracje — a automatyczne przełączanie awaryjne sprawia, że eksperymentalna funkcja mająca zły tydzień, tak jak ta, pogarsza jakość Twojego przebiegu, zamiast go kończyć. W przypadku modelu, którego mechanizm kontekstu sam Ope​nAI wciąż określa jako eksperymentalny i który na krótko wyłączył, skonfigurowanie drugiej ścieżki nie jest paranoją; to właściwa doza ostrożności.

Co obserwować dalej

Cztery rzeczy zmieniłyby tę stronę, a wszystkie cztery są otwarte. Czy eksperyment z zarządzaniem kontekstem zostanie ponownie włączony i w jakiej formie — Ope​nAI twierdzi, że stanie się domyślny dla Astry, co oznacza, że linia konfiguracji powyżej w końcu przestanie być czymś, co się ustawia. Czy raporty o błędach 404 dotyczące notatek i historii w Pro zostaną zamknięte, ponieważ to właśnie różnica między tym, czy mechanizm działa zgodnie z dokumentacją, a tym, czy działa tylko na niektórych ścieżkach. Czy Ope​nAI publikuje jakiekolwiek dane o tokenach lub kosztach dla poszczególnych poziomów wysiłku, co jest brakującą liczbą w każdej dzisiejszej decyzji dotyczącej wysiłku. I czy limity użycia, które zaostrzono w tygodniu premiery, zostaną poluzowane, gdy popyt, który wstrzymał nowe subskrypcje Pro za $200 w dniu 2026-09-10, zostanie zaspokojony.

Do tego czasu plan działania jest krótki. Przypnij model za pomocą codex -m gpt-6-astra, włącz eksperyment tylko wtedy, gdy w kliencie masz zalogowane konto Plus, Pro lub Pro Lite, ustaw poziom wysiłku jawnie, zamiast ufać etykiecie suwaka, trzymaj kontekst roboczy poniżej 272 000 tokenów, bo właśnie tam rachunek się podwaja, zdefiniuj, co oznacza ukończenie, zanim odejdziesz, i kieruj łatwą pracę tam, gdzie jest taniej. Model pochodzi z 2026-09-03 i nigdzie się nie wybiera; to narzędzia wokół niego wciąż się stabilizują.

Pytania, które się pojawiają

Czy warto włączać funkcję notatek międzyokienkowych do zadań o zwykłym rozmiarze?Ogólnie rzecz biorąc, nie. Istnieje po to, by rozwiązać problem utraty informacji na granicach okien kontekstowych, więc w zadaniu, które mieści się w jednym oknie, dodaje ruchome części — w tym eksperymentalną ścieżkę kodu, którą wyłączono z powodu błędu w dniu 2026-09-12 — nie usuwając przy tym żadnej uciążliwości. Włącz ją do pracy długofalowej, a pozostaw wyłączoną przy edycji o ograniczonym zakresie.

Czy okno o rozmiarze 1,050,000 tokenów może zastąpić wyszukiwanie w mojej konfiguracji? Nie ze względu na koszty. Wczytywanie dużego kontekstu z powrotem przy każdej turze jest rozliczane przy każdej turze, a powyżej 272,000 tokenów wejściowych całe żądanie jest wyceniane na nowo: $20.00 za wejście i $75.00 za wyjście. Krok wyszukiwania, który utrzymuje mniejszy kontekst roboczy, jest zwykle tańszym rozwiązaniem — dlatego mechanizm notatek jest interesujący: to wyszukiwanie wbudowane w harness.

Co dzieje się z notatkami, gdy zadanie się kończy? Dokumentacja Ope​nAI ogranicza ten mechanizm do tego samego zadania, a opisy społeczności wskazują, że notatki są przechowywane przy tym zadaniu, a nie przenoszone dalej automatycznie. Nie zakładaj, że nowe zadanie dziedziczy notatki poprzedniego; wszystko, co musi przetrwać, powinno znaleźć się w twoim repozytorium, a nie w pamięci agenta.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie