
Claude Haiku 5.5 vs GPT-6 Luna: Ta sama cena katalogowa, trzykrotnie wyższy rachunek
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Claude Haiku 5.5 i GPT-6 Luna mają identyczną cenę na papierze: 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych — te same dwie liczby co do centa, od dwóch dostawców, którzy rzadko się ze sobą w czymkolwiek zgadzają. W poście zapowiadającym premierę Anthropic umieszcza nawet wyniki Luny w kolumnie obok własnych, czego dostawcy nie robią w przypadku modeli, które uważają za niegroźne.
Te dwie karty różnią się we wszystkim, co ukrywa naklejka. Luna utrzymuje tę stawkę do 272 000 tokenów, zanim wzrośnie; Claude Haiku 5.5 podnosi stawkę przy 100 000. Claude Haiku 5.5 uzyskuje 43,40 w Artificial Analysis Intelligence Index v4.3.2 w porównaniu z 38,12 Luny — i kosztuje 0,21 USD za ukończone zadanie Index w porównaniu z 0,07 USD Luny. Ta sama cena, trzykrotnie wyższy rachunek, pięć punktów więcej inteligencji. To cały kompromis, i jest on czystszy niż większość bezpośrednich porównań w tym przedziale.
Dwie karty, obok siebie
Za milion tokenów w dolarach amerykańskich, na podstawie opublikowanych stawek Anthropic i OpenAI odzwierciedlonych w naszym własnym katalogu, wraz z niezależnymi pomiarami przypisywanymi Artificial Analysis. Zapisane w pamięci podręcznej 2026-10-08.

• Wejście — Claude Haiku 5.5 0,10 USD do 100 000 tokenów, 0,50 USD powyżej. GPT-6 Luna 0,10 USD do 272 000 tokenów, 0,20 USD powyżej.
• Dane wyjściowe — Claude Haiku 5.5: 0,50 USD do 100 000 tokenów, 2,50 USD powyżej. GPT-6 Luna: 0,50 USD do 272 000 tokenów, 0,75 USD powyżej.
• Buforowane dane wejściowe i zapisy — odpowiednio 0,01 USD i 0,125 USD poniżej pierwszego progu, przy czym Claude Haiku 5.5 po przekroczeniu 100 000 tokenów przechodzi na 0,05 USD i 0,625 USD, a GPT-6 Luna po przekroczeniu 272 000 tokenów na 0,02 USD i 0,25 USD.
• Kontekst i dane wyjściowe — po 1 mln tokenów dla obu; po 128 000 maksymalnych danych wyjściowych dla obu. Te dwa naprawdę mają ten sam kształt.
• Myślenie — adaptacyjne w obu przypadkach, oba z parametrem wysiłku. Domyślny poziom wysiłku dla Claude Haiku 5.5 to średni; nie wszystkie opublikowane wyniki są przy tym ustawieniu.
• Niezależny wynik — Claude Haiku 5.5 (Max) 43,40, drugi wśród 182 modeli. GPT-6 Luna (Max) 38,12, ósmy wśród 182.
• Niezależny koszt na zadanie — 0,21 USD wobec 0,07 USD.
• Szybkość — 241,9 tokenów wyjściowych na sekundę wobec 129,4, zmierzone przez ten sam ewaluator.
Próg to miejsce, w którym tkwi różnica
Obaj dostawcy stworzyli dwupoziomowy cennik stawek. Zrobili to w bardzo różnych miejscach, a umiejscowienie ma znacznie większe znaczenie niż liczba na górze.
Próg Anthropic wynosi 100 000 tokenów. Poniżej niego płacisz 0,10 USD i 0,50 USD; powyżej — pięć razy tyle i pięć razy tyle — 0,50 USD i 2,50 USD. Anthropic twierdzi, że prompty poniżej tego progu stanowiły około 90% żądań do swojego poprzedniego modelu Haiku, co jest własną strukturą ruchu dostawcy i ogólnie rzecz biorąc rozsądnym opisem obciążeń związanych z krótkimi wywołaniami.
Próg OpenAI wynosi 272 000 tokenów. Poniżej niego: 0,10 USD i 0,50 USD — identyczne jak u Anthropic. Powyżej niego: 0,20 USD i 0,75 USD, czyli podwojenie i wzrost o 50%. To znacznie łagodniejszy próg i zaczyna się prawie trzy razy dalej.
Weź prompt o rozmiarze 200 000 tokenów, co jest prawdopodobnym rozmiarem dla potoku przetwarzania długich dokumentów i całkowicie rozsądnym dla okna 1 mln tokenów. W Claude Haiku 5.5 to żądanie jest rozliczane według drugiego progu: $0.50 za wejście, $2.50 za wyjście. W GPT-6 Luna to nadal pierwszy próg: $0.10 za wejście, $0.50 za wyjście. Pięć razy większa stawka za wejście i pięć razy większa stawka za wyjście, przy tym samym żądaniu, między dwoma modelami o tej samej cenie bazowej. To nie jest niuans — w przypadku obciążenia z długimi promptami to całe porównanie.
Dlaczego ta sama stawka daje trzykrotnie wyższy rachunek
Koszt na zadanie to liczba, która powinna decydować o potoku o dużym wolumenie, a tutaj oba modele rozchodzą się w sposób, którego cennik nie potrafi wyjaśnić.
Artificial Analysis wycenia GPT-6 Luna (Max) na 0,07 USD za zadanie Intelligence Index, a Claude Haiku 5.5 (Max) na 0,21 USD — trzykrotność, przy identycznych stawkach cennikowych, przy różnicy 5,28 punktu w wyniku. Przyczyna jest na tej samej stronie i nie jest subtelna. Claude Haiku 5.5 wygenerował 440 milionów tokenów wyjściowych podczas przeprowadzania Intelligence Index wobec mediany 100 milionów, a ewaluator nazywa go bardzo rozwlekłym. GPT-6 Luna wygenerował 140 milionów wobec tej samej mediany 100 milionów i został opisany jako dość rozwlekły. Trzykrotna liczba tokenów wyjściowych to trzykrotny rachunek, gdy dominującym miernikiem jest wyjście.
Własne dane Anthropic wskazują ten sam kierunek. Wykresy kosztu względem dokładności dostawcy przedstawiają Haiku 5.5 w całym zakresie wysiłku, a wyróżniony cytat z premiery mówi, że Sonnet 5.5 i Opus 5.5 pozostają lepszym wyborem do złożonej pracy programistycznej z agentami, natomiast Haiku 5.5 jest pozycjonowany do kompakcji, streszczania i podagentów. Im mniejsze zadanie, tym mniej tego problemu rozwlekłości dostajesz — a to dokładnie takie obciążenie, do jakiego model został stworzony, i dokładnie takie, przy którym trzykrotną różnicę kosztów warto sprawdzić na podstawie własnych logów, a nie tablicy wyników.
Jeszcze jeden wpis w rejestrze, tym razem z dokumentacji Anthropic, a nie z dokumentacji ewaluatora: Claude Haiku 5.5 używa nowszego tokenizera współdzielonego z Claude 4.7 i późniejszymi, więc ten sam tekst odpowiada o około 30% większej liczbie tokenów niż w poprzednim Haiku. Stawka jest taka sama jak u Luny; tokenizer już nie.

What Anthropic's own table says about Luna
Strona premiery Anthropic umieszcza GPT-6 Luna jako kolumnę w swojej tabeli testów porównawczych, a uczciwym sposobem raportowania tego jest dołączenie informacji o źródle: to ewaluacje Anthropic, przeprowadzone na środowisku testowym Anthropic, przeciwko modelowi konkurenta. Są raportowane przez dostawcę, a nie niezależnie odtworzone, a gdy dostawca uruchamia własny zestaw testów przeciwko wynikom rywala, jest to porównanie, które należy rozważyć, a nie przyjmować bezkrytycznie.
• Praca umysłowa — GDPval-AA v2.1 na poziomie 1620 dla Claude Haiku 5.5 wobec 1437 dla GPT-6 Luna. AA-Briefcase v1.1 na poziomie 1578 wobec 1336.
• Obsługa komputera — podzbiór offline OSWorld 2.1: 72,4% wobec 48,9%.
• Kodowanie agentowe — Terminal-Bench 4.0: 39,2% wobec 16,4%; FrontierCode 1.1 (Main): 46,4% wobec 42,4%.
• Rozumowanie wizualne — Chartography na poziomie 46,4% bez narzędzi wobec 29,1%.
Na własnym zestawie testowym dostawcy Claude Haiku 5.5 prowadzi w każdym wierszu. Na niezależnej tablicy wyników prowadzi mniejszą przewagą — 43,40 wobec 38,12 — co jest zwykłą relacją między tabelą dostawcy a tabelą strony trzeciej i powodem, dla którego obie są tu podane. Oba zgadzają się co do kierunku, ale różnią się co do wielkości.
Ustawa jest decydującym głosem
Zestaw cztery fakty, które tak naprawdę mają znaczenie, obok siebie, a wybór przestaje być bliski w przypadku większości obciążeń.
GPT-6 Luna jest trzykrotnie tańszy w przeliczeniu na ukończone zadanie według niezależnego pomiaru, jego pierwszy próg cenowy sięga osiemnaście razy dalej w oknie kontekstu, jego wskaźniki przekroczenia progu są niższe na obu miernikach, i jako jedyny z tych dwóch ma karę za długi kontekst będącą podwojeniem, a nie pięciokrotnym skokiem. Claude Haiku 5.5 przoduje w zmierzonej inteligencji o margines, który jest realny i umiarkowany, jest szybszy niemal dwukrotnie na wyjściu oraz — we własnym środowisku testowym dostawcy, gdzie różnica jest największa — przoduje w każdym opublikowanym wierszu benchmarku.
Jeśli twoje wywołania są krótkie, jeśli ograniczeniem jest przepustowość albo jeśli różnica w jakości ujawnia się w twojej własnej ewaluacji, zapłać trzy razy więcej. Jeśli twoje wywołania są długie, jeśli są generowane maszynowo i nigdy nie czyta ich człowiek, albo jeśli uruchamiasz warstwę klasyfikacji, która odpala się milion razy dziennie, te same 0,10 i 0,50 dolara kupią ci rachunek trzy razy mniejszy po drugiej stronie, a możliwość, z której rezygnujesz, to pięć punktów na liście rankingowej, na której oba modele znajdują się blisko czoła.
Wywołanie któregokolwiek z nich z jednego miejsca
Pożyteczną rzeczą w tak wyrównanym porównaniu jest to, że nie powinieneś musieć wierzyć nikomu na słowo, w tym nam. GPT-6 Luna jest już dziś dostępna w katalogu OrcaRouter w cenie dostawcy z 0% narzutu — ta sama struktura cen wydrukowana powyżej, przekazywana bezpośrednio, a nie uśredniana — podobnie jak Claude Sonnet 5.5 i Claude Opus 5.5, dzięki czemu test eskalacji z taniej odnogi do średniego poziomu to konfiguracja, a nie projekt. Jeden klucz, jeden SDK, automatyczne przełączanie awaryjne pod spodem oraz DSL routingu, jeśli eskalacja należy do trasy, a nie do twojej aplikacji.
Claude Haiku 5.5 nie znajduje się jeszcze w katalogu. Mówienie tego wprost jest bardziej użyteczne niż sugerowanie czegoś przeciwnego: strona Luna tego porównania jest dla nas osiągalna telefonicznie już dziś rano, a strona Anthropic musi być osiągalna w Anthropic, dopóki nie będzie inaczej.

Co zmieniłoby odpowiedź
Dwie rzeczy, i obie warto obserwować, a nie szacować.
Pierwsza kwestia to, czy rozwlekłość się zmienia. Koszt na zadanie w Claude Haiku 5.5 jest funkcją tego, ile tokenów zużywa na odpowiedź przy maksymalnym wysiłku, a parametr wysiłku jest dźwignią, która na to wpływa. Zespół, który ustawi wysiłek na niższym poziomie — domyślne ustawienie modelu to średni, a nie maksymalny — zobaczy wartość kosztu na zadanie bliższą wartości Luny i wynik również bliższy wynikowi Luny. Ten kompromis jest dostępny; ile jest wart, to pytanie o twoją ewaluację, a nie o model.
Drugą kwestią jest to, czy niezależne liczby kosztu na zadanie utrzymają się, gdy oba modele zgromadzą więcej zmierzonych przebiegów. Pojedyncze miejsce na tablicy wyników to tylko migawka, a trzykrotna różnica pojawiająca się w jednej migawce jest warta potwierdzenia na podstawie własnej faktury, zanim proces zostanie przebudowany wokół niej. Do tego służy wspólny punkt końcowy.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
