
Claude Opus 5.5 i Test Arbuza: Anthropic poprawił prozę, ale sedno wciąż pozostaje ukryte
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Jedna z próbek, które najdalej wyszły poza tydzień premiery, była krótkim opowiadaniem o arbuzie. Kilkaset słów, bez dołączonego benchmarku, bez wykresu — po prostu model poproszony o napisanie czegoś krótkiego, któremu w większości się to udało. To dziwny artefakt, by znajdować się blisko centrum flagowego wydania, ale wskazuje na to, co dostawca postanowił wysunąć na pierwszy plan, gdy wypuścił Claude Opus 5.5 22 września 2026 r.: nie kolejny punkt na Terminal-Bench, lecz proza. Firma przedstawia to tak, że ten model pisze mniej „Claudish” — jej określenie na rejestr formułkowy, przesadnie asekuracyjny, pełen odchrząkiwania, za który Claude Opus 5 zbierał skargi, i że Claude Fable 5.1, GPT-6 Astra i GPT-5.6 Sol — od tamtej pory każdy z nich jest mierzony względem niego. Tak więc pytanie, na które warto odpowiedzieć, nie brzmi, czy demo było czarujące. Chodzi o to, czy proza poprawiła się w sposób mierzalny, o ile i gdzie wciąż zawodzi.
Co według Anthropic zostało naprawione

Twierdzenie Anthropic jest wystarczająco konkretne, by je przetestować. Opus 5.5, jak twierdzi Anthropic, stawia najważniejsze informacje na pierwszym miejscu, używa mniej żargonu i ściślej przestrzega podanych przez użytkownika zasad pisania niż poprzednie modele Opus. Materiały potwierdzające pochodzą od dostawcy i nie zostały niezależnie odtworzone: wewnętrzne testy sprawdzania faktów, które według Anthropic przeszły 16 z 18 prób, w porównaniu z zerem na 18 dla obu Claude Fable 5.1 i Claude Opus 5. Cytaty klientów w materiałach premierowych wskazują w tym samym kierunku — John Ruelas z Ramp opisuje treści, które „piszą jak dobry kolega”, a Box raportuje około 40% mniejszą rozwlekłość w przypadku własnych obciążeń.
Warto tu rozdzielić dwie rzeczy. Po pierwsze, „mniej w stylu Claude'a” to prawdziwy, dający się nazwać tryb awarii, a nie wymysł marketingowy. Praktycy narzekają na skondensowaną, źle ustrukturyzowaną prozę Claude'a od generacji Opus wydanych po wersji 4.6, a zarzut jest konkretny: zbyt dużo wstępów, zbyt wiele powtórzeń promptu, nawyk dochodzenia do sedna dwa akapity po tym, jak czytelnik go potrzebował. Po drugie, własne liczby Anthropic dotyczące tego, że to naprawiono, są dokładnie tym — własnymi liczbami Anthropic. Wynik 16 na 18 nie ma niezależnej replikacji, a „o 40% mniejsza rozwlekłość” to wewnętrzny pomiar klienta, a nie opublikowana metodologia.
Wydanie to niesie także wartą poznania zmianę niezwiązaną z pisaniem: Opus 5.5 to pierwszy model Opus dostarczany z zabezpieczeniami w zakresie cyberbezpieczeństwa, biologii i rozwoju frontier-LLM, odpowiadającymi tym w Claude Fable 5.1. Gdy żądanie uruchomi jedno z nich, Anthropic twierdzi, że w przejrzysty sposób kieruje żądanie do innego modelu, zamiast od razu odmawiać.
Liczby, które nie należą do Anthropic

Najbardziej użyteczna niezależna analiza twierdzenia o pisaniu pochodzi z Every's Vibe Check, który przeprowadził te same prompty na pięciu modelach frontier i ocenił wyniki za pomocą dwóch standardowych narzędzi do pomiaru czytelności. W tym zestawie promptów Claude Opus 5.5 wypadł jako najbardziej czytelny w grupie — a różnica w stosunku do modelu, który zastąpił, jest tu najważniejsza:
• Poziom klasy Flesch-Kincaid — Claude Opus 5.5 na poziomie 6,95 w porównaniu z Claude Opus 5 na poziomie 7,97
• Flesch Reading Ease — 68,4 dla Opus 5.5 wobec 61,35 dla Opus 5
• Claude Fable 5.1 — poziom klasy 7,43, łatwość czytania 66,09
• GPT-6 Astra — poziom klasy 7,52, łatwość czytania 64,55
• GPT-5.6 Sol — poziom klasy 8,74, łatwość czytania 56,62
Oba mierniki należy czytać łącznie, ponieważ zmieniają się w przeciwnych kierunkach i właśnie o to chodzi: niższy poziom czytelności i wyższy wynik łatwości oznaczają prostszą prozę. Opus 5.5 wypada około pełnego poziomu poniżej Opus 5, mniej więcej pół poziomu poniżej zarówno Claude Fable 5.1, jak i GPT-6 Astra, oraz prawie dwa poziomy poniżej GPT-5.6 Sol. Mówiąc wprost: poziom czytania siódmej klasy zamiast ósmej.
To rzeczywista poprawa, ale także wąska. To zestaw promptów jednego medium, a nie benchmark z ustaloną listą zadań i stojącą za nim tabelą wyników. Mówi, w jakim kierunku zmierzamy, i w przybliżeniu, jak duży to krok. Nie mówi jednak, że Opus 5.5 dobrze pisze na twoim materiale, a własne uwagi jakościowe Every'ego jasno pokazują, że recenzent również tak nie uważał.
Gdzie wciąż grzebie sedno
Ta sama recenzja, która dała liczby czytelności, jest bez ogródek o porażce, która przetrwała poprawkę. Poproszony o napisanie początku eseju, Opus 5.5 potrzebował od 37 do 39 zdań, by omówić to, co recenzent omówił w 21, i poświęcił cały akapit na kwestię, którą recenzent ujął w ośmiu słowach. Podsumowanie recenzenta brzmi, że model „wciąż zakopuje sedno” — a ostrzejsza wersja zarzutu jest taka, że potrafi poprawnie zdiagnozować, czego potrzebuje akapit, a następnie stworzyć wersję, która ignoruje jego własną diagnozę.
Jako redaktor wypadł gorzej niż jako pisarz. W rankingu z pozostałymi modelami w zadaniach redakcyjnych Opus 5.5 znalazł się zaClaude Opus 5, GPT-5.6 Sol i GPT-6 Astra — model lepiej radzi sobie z tworzeniem czytelnych zdań niż z rozpoznawaniem, które zdanie powinno było pojawić się pierwsze. Werdykt recenzenta zawiera się w zdaniu wartym zacytowania, bo jest najużyteczniejszą rzeczą w całej recenzji: „Jestem z niego bardziej zadowolony jako ze współpracownika niż z prozy, którą produkuje”.
Praktyczny wniosek wynika z tego wprost. Pisz z jego pomocą, ustawiając wysiłek na wysoki lub wyższy — to przy niższych ustawieniach wysiłku wypełniacz bywa najgorszy. Dostarczaj własne przykłady, zamiast prosić go, żeby je wymyślał. Potem sam przenieś sedno na początek albo przekaż szkic czemuś, co to zrobi. Opus 5.5 daje ci szybszą drogę do czystego pierwszego szkicu i naprawdę lepszego współpracownika do kolejnych poprawek. Nie daje ci redaktora.
Ile kosztują dodatkowe słowa

Istnieje wymiar kosztowy problemu gadatliwości, który recenzje tekstów w większości pomijają, a który kłóci się z narracją premiery. Artificial Analysis, które przeprowadza własną ocenę, zamiast opierać się na danych dostawców, umieszcza Claude Opus 5.5 na pierwszym miejscu spośród 212 modeli w swoim Intelligence Index z wynikiem 58 — ale na 95. miejscu spośród 212 pod względem gadatliwości, wygenerowawszy 260 milionów tokenów wyjściowych podczas tego przebiegu Index wobec mediany 88 milionów. Ocena kosztowała 5,98 USD za zadanie Intelligence Index i 8708,20 USD łącznie.
Zderz to z własnym twierdzeniem Anthropic o wydajności, a te dwa wyraźnie się nie zgadzają. Deklarowane przez dostawcę stanowisko głosi, że Opus 5.5 zużywa mniej tokenów i generuje wyniki ponad 30% szybciej niż Opus 5. Niezależny test przeprowadzony przez Artificial Analysis wykazał, że model jest bardzo gadatliwy w porównaniu z konkurencyjnymi modelami. Oba mogą być prawdziwe jednocześnie — inne zestawy zadań, inne ustawienia wysiłku, inne definicje „mniejszej liczby tokenów” — ale nikt nie powinien odczytywać narracji premierowej jako ustalonego faktu dotyczącego ekonomii tokenów. Jeśli chodzi o cenę, obraz jest jaśniejszy: 4 USD za milion tokenów wejściowych i 20 USD za milion tokenów wyjściowych, wobec 5 USD/25 USD, przy 95-procentowej zniżce na pamięć podręczną w danych Artificial Analysis.
Jeśli płacisz za token wyjściowy, rozwlekła proza nie jest preferencją stylistyczną. To pozycja w rachunku.
Uruchamianie tego względem tego, co już masz
Jedna szczera uwaga przed częścią praktyczną: Claude Opus 5.5 nie jest jedną z naszych ścieżek. Nie hostujemy go i nic poniżej nie powinno być odczytywane jako twierdzenie, że to robimy. Dostęp do niego uzyskasz przez własne API Anthropic oraz kilka platform innych firm.
To, co jest dziś w OrcaRouter, to model, który został zastąpiony, oraz poziom wyżej od niego. Claude Opus 5 jest dziś w OrcaRouter, podobnie jak Claude Fable 5.1 — oba w cenie katalogowej dostawcy z 0% marży przekazanej dalej, co oznacza, że zmiana ceny u dostawcy trafia na naszą stronę tego samego dnia, a nie dopiero wtedy, gdy sprzedawca pośredni znajdzie na to czas. Jeśli zastanawiasz się, czy proza Opus 5.5 jest warta przesiadki, to przydatne zestawienie: możesz przeprowadzić porównanie na jednym kluczu, bez drugiej umowy i bez zmian w kodzie, ponieważ oba modele są w jednym API dla ponad 200 modeli, na tym samym endpoincie.
Innym powodem, dla którego warto trzymać drugi model w pętli, jest tryb awarii, którego dotyczy ten artykuł. Model, który zakopuje sedno, to model, który chcesz móc obejść w trakcie zadania, a automatyczne przełączanie awaryjne istnieje dokładnie po to, aby zła generacja nie zamieniła się w zatrzymany potok. Jeśli wolisz w ogóle nie wybierać jednego modelu, DSL routingu łączy kilka z nich w jedno wywołanie, a fuzja modeli uruchamia panel modeli odpowiadających wspólnie — co jest rozsądnym kształtem pracy redakcyjnej, w której zawodzi osąd, a nie zdolności.
Kto powinien działać, a kto powinien czekać?
Jeśli twoim zarzutem wobec Claude Opus 5 było to, że musiałeś przepisywać jego wstępy, Opus 5.5 to prawdziwe rozwiązanie tego problemu w przybliżeniu na poziomie jednej klasy czytelności, a dane dotyczące czytelności mówią, że poprawa jest mierzalna, a nie oparta na wrażeniach. Jeśli twoim zarzutem było to, że potrzeba trzech akapitów, by przejść do rzeczy, nic w niezależnych dowodach nie wskazuje, że to się zmieniło. To różne zarzuty, a materiały o premierze traktowały je jako jeden.
Konkretnie w przypadku pracy twórczej historia o arbuzie nie jest dowodem na nic poza tym, że ludzie sięgają po małe, ciepłe, niezobowiązujące prompty, gdy chcą wyczuć nowy model. To rozsądne posunięcie. Jest to także dokładnie ten kontekst, w którym skłonność do zakopywania sedna jest najmniej widoczna, bo nikt nie czyta historii o arbuzie dla tezy. Postaw model przed dokumentem, w którym czytelnik potrzebuje wniosku już w pierwszych dwóch zdaniach, a dowiesz się, który z tych dwóch problemów naprawdę miałeś.
Następną rzeczą, na którą warto zwrócić uwagę, jest to, czy kolejny model z rodziny — oczekuje się, że zarówno Sonnet 5.5, jak i Haiku 5.5 pojawią się w nadchodzących tygodniach — odziedziczy poprawę czytelności, oraz czy ktokolwiek opublikuje wynik czytelności dla redagowania, a nie szkicowania. Wynik dla szkicowania jest tym łatwym. Wynik dla redagowania to obszar, w którym Opus 5.5 wciąż plasuje się za trzema konkurentami.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
