Wygenerowana karta hero dla „Identyczne stawki, trzykrotnie wyższy rachunek”, z plakietką „TA SAMA NAKLEJKA”, z hasłem „DWA MODELE, 0,10 USD I 0,50 USD, JEDNO PYTANIE” i podtytułem „Claude Haiku 5.5 kontra GPT-6 Luna: te same dwie liczby i bardzo różne progi”. Na czterech chipach widnieją: „0,10 USD / 0,50 USD w obu”, „100K vs 272K”, „0,21 USD vs 0,07 USD” i „43,40 vs 38,12”. Dwie karty poniżej są oznaczone jako „TO SAMO” („0,10 USD na wejściu i 0,50 USD na wyjściu w ramach pierwszego progu oraz okno 1 mln tokenów w obu”) i „NIE TO SAMO” („próg wynosi 100 000 tokenów w porównaniu z 272 000, a koszt na zadanie różni się trzykrotnie”). W stopce widnieje: „Opublikowane stawki z cenników dostawców; niezależne pomiary od Artificial Analysis, odczyt z 8 października 2026 r.”. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Claude Haiku 5.5 vs GPT-6 Luna: Ta sama cena katalogowa, trzykrotnie wyższy rachunek

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Claude Haiku 5.5 i GPT-6 Luna mają identyczną cenę na papierze: 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych — te same dwie liczby co do centa, od dwóch dostawców, którzy rzadko się ze sobą w czymkolwiek zgadzają. W poście zapowiadającym premierę Ant​hropic umieszcza nawet wyniki Luny w kolumnie obok własnych, czego dostawcy nie robią w przypadku modeli, które uważają za niegroźne.

Te dwie karty różnią się we wszystkim, co ukrywa naklejka. Luna utrzymuje tę stawkę do 272 000 tokenów, zanim wzrośnie; Claude Haiku 5.5 podnosi stawkę przy 100 000. Claude Haiku 5.5 uzyskuje 43,40 w Artificial Analysis Intelligence Index v4.3.2 w porównaniu z 38,12 Luny — i kosztuje 0,21 USD za ukończone zadanie Index w porównaniu z 0,07 USD Luny. Ta sama cena, trzykrotnie wyższy rachunek, pięć punktów więcej inteligencji. To cały kompromis, i jest on czystszy niż większość bezpośrednich porównań w tym przedziale.

Dwie karty, obok siebie

Za milion tokenów w dolarach amerykańskich, na podstawie opublikowanych stawek Anthropic i OpenAI odzwierciedlonych w naszym własnym katalogu, wraz z niezależnymi pomiarami przypisywanymi Artificial Analysis. Zapisane w pamięci podręcznej 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs GPT-6 Luna - two cards, side by side'. Claude Haiku 5.5 reads input $0.10 under the first tier and $0.50 past 100,000, output $0.50 and $2.50 past 100,000, maximum output 128,000 tokens, Intelligence Index v4.3.2 43.40, cost per task $0.21, output speed 241.9 tokens per second. GPT-6 Luna reads input $0.10 under the first tier and $0.20 past 272,000, output $0.50 and $0.75, maximum output 128,000 tokens, Intelligence Index v4.3.2 38.12, cost per task $0.07, output speed 129.4 tokens per second. A footer reads 'Vendors' published list rates; independent measurements from Artificial Analysis.'

• Wejście — Claude Haiku 5.5 0,10 USD do 100 000 tokenów, 0,50 USD powyżej. GPT-6 Luna 0,10 USD do 272 000 tokenów, 0,20 USD powyżej.

• Dane wyjściowe — Claude Haiku 5.5: 0,50 USD do 100 000 tokenów, 2,50 USD powyżej. GPT-6 Luna: 0,50 USD do 272 000 tokenów, 0,75 USD powyżej.

• Buforowane dane wejściowe i zapisy — odpowiednio 0,01 USD i 0,125 USD poniżej pierwszego progu, przy czym Claude Haiku 5.5 po przekroczeniu 100 000 tokenów przechodzi na 0,05 USD i 0,625 USD, a GPT-6 Luna po przekroczeniu 272 000 tokenów na 0,02 USD i 0,25 USD.

• Kontekst i dane wyjściowe — po 1 mln tokenów dla obu; po 128 000 maksymalnych danych wyjściowych dla obu. Te dwa naprawdę mają ten sam kształt.

• Myślenie — adaptacyjne w obu przypadkach, oba z parametrem wysiłku. Domyślny poziom wysiłku dla Claude Haiku 5.5 to średni; nie wszystkie opublikowane wyniki są przy tym ustawieniu.

• Niezależny wynik — Claude Haiku 5.5 (Max) 43,40, drugi wśród 182 modeli. GPT-6 Luna (Max) 38,12, ósmy wśród 182.

• Niezależny koszt na zadanie — 0,21 USD wobec 0,07 USD.

• Szybkość — 241,9 tokenów wyjściowych na sekundę wobec 129,4, zmierzone przez ten sam ewaluator.

Próg to miejsce, w którym tkwi różnica

Obaj dostawcy stworzyli dwupoziomowy cennik stawek. Zrobili to w bardzo różnych miejscach, a umiejscowienie ma znacznie większe znaczenie niż liczba na górze.

Próg Anthropic wynosi 100 000 tokenów. Poniżej niego płacisz 0,10 USD i 0,50 USD; powyżej — pięć razy tyle i pięć razy tyle — 0,50 USD i 2,50 USD. Anthropic twierdzi, że prompty poniżej tego progu stanowiły około 90% żądań do swojego poprzedniego modelu Haiku, co jest własną strukturą ruchu dostawcy i ogólnie rzecz biorąc rozsądnym opisem obciążeń związanych z krótkimi wywołaniami.

Próg OpenAI wynosi 272 000 tokenów. Poniżej niego: 0,10 USD i 0,50 USD — identyczne jak u Anthropic. Powyżej niego: 0,20 USD i 0,75 USD, czyli podwojenie i wzrost o 50%. To znacznie łagodniejszy próg i zaczyna się prawie trzy razy dalej.

Weź prompt o rozmiarze 200 000 tokenów, co jest prawdopodobnym rozmiarem dla potoku przetwarzania długich dokumentów i całkowicie rozsądnym dla okna 1 mln tokenów. W Claude Haiku 5.5 to żądanie jest rozliczane według drugiego progu: $0.50 za wejście, $2.50 za wyjście. W GPT-6 Luna to nadal pierwszy próg: $0.10 za wejście, $0.50 za wyjście. Pięć razy większa stawka za wejście i pięć razy większa stawka za wyjście, przy tym samym żądaniu, między dwoma modelami o tej samej cenie bazowej. To nie jest niuans — w przypadku obciążenia z długimi promptami to całe porównanie.

Dlaczego ta sama stawka daje trzykrotnie wyższy rachunek

Koszt na zadanie to liczba, która powinna decydować o potoku o dużym wolumenie, a tutaj oba modele rozchodzą się w sposób, którego cennik nie potrafi wyjaśnić.

Artificial Analysis wycenia GPT-6 Luna (Max) na 0,07 USD za zadanie Intelligence Index, a Claude Haiku 5.5 (Max) na 0,21 USD — trzykrotność, przy identycznych stawkach cennikowych, przy różnicy 5,28 punktu w wyniku. Przyczyna jest na tej samej stronie i nie jest subtelna. Claude Haiku 5.5 wygenerował 440 milionów tokenów wyjściowych podczas przeprowadzania Intelligence Index wobec mediany 100 milionów, a ewaluator nazywa go bardzo rozwlekłym. GPT-6 Luna wygenerował 140 milionów wobec tej samej mediany 100 milionów i został opisany jako dość rozwlekły. Trzykrotna liczba tokenów wyjściowych to trzykrotny rachunek, gdy dominującym miernikiem jest wyjście.

Własne dane Anthropic wskazują ten sam kierunek. Wykresy kosztu względem dokładności dostawcy przedstawiają Haiku 5.5 w całym zakresie wysiłku, a wyróżniony cytat z premiery mówi, że Sonnet 5.5 i Opus 5.5 pozostają lepszym wyborem do złożonej pracy programistycznej z agentami, natomiast Haiku 5.5 jest pozycjonowany do kompakcji, streszczania i podagentów. Im mniejsze zadanie, tym mniej tego problemu rozwlekłości dostajesz — a to dokładnie takie obciążenie, do jakiego model został stworzony, i dokładnie takie, przy którym trzykrotną różnicę kosztów warto sprawdzić na podstawie własnych logów, a nie tablicy wyników.

Jeszcze jeden wpis w rejestrze, tym razem z dokumentacji Ant​hropic, a nie z dokumentacji ewaluatora: Claude Haiku 5.5 używa nowszego tokenizera współdzielonego z Claude 4.7 i późniejszymi, więc ten sam tekst odpowiada o około 30% większej liczbie tokenów niż w poprzednim Haiku. Stawka jest taka sama jak u Luny; tokenizer już nie.

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 specifications row and the published pricing table, with the per-million-token input, output and cache rates and the 100,000-token threshold at which the second tier begins.

What Ant​hropic's own table says about Luna

Strona premiery Ant​hropic umieszcza GPT-6 Luna jako kolumnę w swojej tabeli testów porównawczych, a uczciwym sposobem raportowania tego jest dołączenie informacji o źródle: to ewaluacje Ant​hropic, przeprowadzone na środowisku testowym Ant​hropic, przeciwko modelowi konkurenta. Są raportowane przez dostawcę, a nie niezależnie odtworzone, a gdy dostawca uruchamia własny zestaw testów przeciwko wynikom rywala, jest to porównanie, które należy rozważyć, a nie przyjmować bezkrytycznie.

• Praca umysłowa — GDPval-AA v2.1 na poziomie 1620 dla Claude Haiku 5.5 wobec 1437 dla GPT-6 Luna. AA-Briefcase v1.1 na poziomie 1578 wobec 1336.

• Obsługa komputera — podzbiór offline OSWorld 2.1: 72,4% wobec 48,9%.

• Kodowanie agentowe — Terminal-Bench 4.0: 39,2% wobec 16,4%; FrontierCode 1.1 (Main): 46,4% wobec 42,4%.

• Rozumowanie wizualne — Chartography na poziomie 46,4% bez narzędzi wobec 29,1%.

Na własnym zestawie testowym dostawcy Claude Haiku 5.5 prowadzi w każdym wierszu. Na niezależnej tablicy wyników prowadzi mniejszą przewagą — 43,40 wobec 38,12 — co jest zwykłą relacją między tabelą dostawcy a tabelą strony trzeciej i powodem, dla którego obie są tu podane. Oba zgadzają się co do kierunku, ale różnią się co do wielkości.

Ustawa jest decydującym głosem

Zestaw cztery fakty, które tak naprawdę mają znaczenie, obok siebie, a wybór przestaje być bliski w przypadku większości obciążeń.

GPT-6 Luna jest trzykrotnie tańszy w przeliczeniu na ukończone zadanie według niezależnego pomiaru, jego pierwszy próg cenowy sięga osiemnaście razy dalej w oknie kontekstu, jego wskaźniki przekroczenia progu są niższe na obu miernikach, i jako jedyny z tych dwóch ma karę za długi kontekst będącą podwojeniem, a nie pięciokrotnym skokiem. Claude Haiku 5.5 przoduje w zmierzonej inteligencji o margines, który jest realny i umiarkowany, jest szybszy niemal dwukrotnie na wyjściu oraz — we własnym środowisku testowym dostawcy, gdzie różnica jest największa — przoduje w każdym opublikowanym wierszu benchmarku.

Jeśli twoje wywołania są krótkie, jeśli ograniczeniem jest przepustowość albo jeśli różnica w jakości ujawnia się w twojej własnej ewaluacji, zapłać trzy razy więcej. Jeśli twoje wywołania są długie, jeśli są generowane maszynowo i nigdy nie czyta ich człowiek, albo jeśli uruchamiasz warstwę klasyfikacji, która odpala się milion razy dziennie, te same 0,10 i 0,50 dolara kupią ci rachunek trzy razy mniejszy po drugiej stronie, a możliwość, z której rezygnujesz, to pięć punktów na liście rankingowej, na której oba modele znajdują się blisko czoła.

Wywołanie któregokolwiek z nich z jednego miejsca

Pożyteczną rzeczą w tak wyrównanym porównaniu jest to, że nie powinieneś musieć wierzyć nikomu na słowo, w tym nam. GPT-6 Luna jest już dziś dostępna w katalogu OrcaRouter w cenie dostawcy z 0% narzutu — ta sama struktura cen wydrukowana powyżej, przekazywana bezpośrednio, a nie uśredniana — podobnie jak Claude Sonnet 5.5 i Claude Opus 5.5, dzięki czemu test eskalacji z taniej odnogi do średniego poziomu to konfiguracja, a nie projekt. Jeden klucz, jeden SDK, automatyczne przełączanie awaryjne pod spodem oraz DSL routingu, jeśli eskalacja należy do trasy, a nie do twojej aplikacji.

Claude Haiku 5.5 nie znajduje się jeszcze w katalogu. Mówienie tego wprost jest bardziej użyteczne niż sugerowanie czegoś przeciwnego: strona Luna tego porównania jest dla nas osiągalna telefonicznie już dziś rano, a strona Anthropic musi być osiągalna w Anthropic, dopóki nie będzie inaczej.

A screenshot of the OrcaRouter catalogue page for GPT-6 Luna, showing the model identifier openai/gpt-6-Luna, the provider OpenAI, a 1M-token context window, 128,000 maximum output, the release date September 22 2026, the $0.10 per million input and $0.50 per million output rates and a p50 time to first token of 1.49 seconds.

Co zmieniłoby odpowiedź

Dwie rzeczy, i obie warto obserwować, a nie szacować.

Pierwsza kwestia to, czy rozwlekłość się zmienia. Koszt na zadanie w Claude Haiku 5.5 jest funkcją tego, ile tokenów zużywa na odpowiedź przy maksymalnym wysiłku, a parametr wysiłku jest dźwignią, która na to wpływa. Zespół, który ustawi wysiłek na niższym poziomie — domyślne ustawienie modelu to średni, a nie maksymalny — zobaczy wartość kosztu na zadanie bliższą wartości Luny i wynik również bliższy wynikowi Luny. Ten kompromis jest dostępny; ile jest wart, to pytanie o twoją ewaluację, a nie o model.

Drugą kwestią jest to, czy niezależne liczby kosztu na zadanie utrzymają się, gdy oba modele zgromadzą więcej zmierzonych przebiegów. Pojedyncze miejsce na tablicy wyników to tylko migawka, a trzykrotna różnica pojawiająca się w jednej migawce jest warta potwierdzenia na podstawie własnej faktury, zanim proces zostanie przebudowany wokół niej. Do tego służy wspólny punkt końcowy.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie