Wygenerowana karta hero zatytułowana „GPT-6.1 Sol vs Qwen3.8-Max" z dwoma zaokrąglonymi panelami: po lewej „GPT-6.1 Sol" z listą „OpenAI – wydany 29 września 2026", „2,00 USD za wejście / 10,00 USD za wyjście za 1 mln", „0,72 USD za zadanie" i „AA Index 51,8"; po prawej „Qwen3.8-Max" z listą „Alibaba – wydany 3 sierpnia 2026", „2,00 USD za wejście / 6,00 USD za wyjście za 1 mln", „5,41 USD za zadanie" i „AA Index 45,4"; poniżej pasek „Ta sama cena wejściowa. Rachunek 7,5× większy."; w stopce „Dane: Artificial Analysis v4.3.2." oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

GPT-6.1 Sol vs Qwen3.8-Max: Faktura, a nie cennik

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Weź jedno nocne zadanie konserwacji repozytorium, uruchamiaj je raz na noc przez miesiąc i postaw GPT-6.1 Sol i Qwen3.8-Max na nim po kolei. Według danych Artificial Analysis v4.3.2 dla poszczególnych zadań GPT-6.1 Sol kosztuje 21,72 USD za te trzydzieści nocy, a Qwen3.8-Max kosztuje 162,27 USD — różnica 140,55 USD miesięcznie, około 1690 USD rocznie, za zadanie, którego cennik za token wynosi 2,00 USD na wejściu i 10,00 USD na wyjściu w porównaniu z 2,00 USD na wejściu i 6,00 USD na wyjściu. Stawki za milion tokenów na wejściu różnią się między sobą w granicach błędu zaokrąglenia, a chiński model jest o 40% tańszy na wyjściu, a jednak faktura różni się 7,5-krotnie. Dostawca wydał GPT-6.1 Sol 29 września 2026 r.; Qwen3.8-Max jest dostępny od 3 sierpnia 2026 r.

Ta różnica nie jest sztuczką cenową ani artefaktem benchmarku — to całość tego, co to porównanie ma do powiedzenia, i pochodzi z jednej liczby, której nie pokazuje ci żaden cennik.

Czym jest każdy model

GPT-6.1 Sol to obecny flagowy model OpenAI do rozumowania i kodowania, wydany tydzień po GPT-6 Sol, którego zastępuje, w tej samej cenie katalogowej 2,00 USD / 10,00 USD, ze stawką 0,10 USD za wejście z pamięci podręcznej i oknem kontekstu wynoszącym 1 050 000 tokenów. Jest sprzedawany do pracy agentowej: jego tagi best-for na naszej własnej karcie modelu to rozumowanie, kodowanie i agentowość, a ma najwyższy wynik jakości.

Qwen3.8-Max to flagowy model agentowy firmy Alibaba — zamknięty model dostępny wyłącznie przez API, który przyjmuje dane wejściowe w postaci tekstu, obrazu i wideo oraz obsługuje kontekst 1 000 000 tokenów. W przeciwieństwie do mniejszych wydań Qwen, ten nie ma opublikowanych wag. W Artificial Analysis ma 45,42 punktu w Intelligence Index i zajmuje 17. miejsce na 147 modeli, a jego indeks kodowania na poziomie 76,2 daje mu 9. miejsce w tej dziedzinie. To nie jest słaby model. Jest po prostu drogi, jeśli pozwoli mu się myśleć.

Numer, którego nie ma na karcie stawek

A generated two-column scoreboard titled 'GPT-6.1 Sol vs Qwen3.8-Max - the scoreboard'. Left column 'GPT-6.1 Sol': Output tokens 38,128, Reasoning tokens 25,190, Cost per task $0.72, AA Index 51.8, Time per task 640 s, Context 1.05M. Right column 'Qwen3.8-Max': Output tokens 107,730, Reasoning tokens 70,830, Cost per task $5.41, AA Index 45.4, Time per task 2,152 s, Context 1M. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Artificial Analysis odnotowuje 107 730 tokenów wyjściowych na zadanie dla Qwen3.8-Max, z czego 70 830 to tokeny rozumowania. GPT-6.1 Sol generuje 38 128 tokenów wyjściowych, z czego 25 190 to tokeny rozumowania. Chiński model zapisuje 2,8 razy więcej tokenów, aby odpowiedzieć na to samo pytanie, a zapisuje je po cenie o 40% niższej za token.

• Tokeny wyjściowe na zadanie — 38,128 vs 107,730; Qwen generuje 2,8× więcej

• W tym rozumowanie — 25 190 vs 70 830

• Koszt na zadanie — 0,724 USD vs 5,409 USD; Qwen kosztuje 7,5× więcej

• Czas na zadanie — 640 s vs 2 152 s; około 11 minut vs około 36

• Czas do pierwszego tokenu odpowiedzi — 332,0 s vs 55,1 s

• Indeks Inteligencji — 51,83 vs 45,42

• Okno kontekstowe — 1 050 000 vs 1 000 000 tokenów

• Dane wejściowe — tekst, obraz i plik vs tekst, obraz i wideo

Wykonaj mnożenie, a rabat znika. Model, który emituje blisko trzy razy więcej tokenów przy stawce niższej o 40%, nie kosztuje mniej — kosztuje około 1,7 razy więcej tylko na wyjściu, a zmierzona wartość na zadanie wskazuje, że rzeczywisty mnożnik wynosi 7,5, gdy uwzględni się dane wejściowe, odczyty z pamięci podręcznej i długość produktywnej odpowiedzi.

Zwróć uwagę na czwartą i piątą linię, ponieważ wskazują przeciwne kierunki, a razem wyjaśniają, czym jest Qwen3.8-Max. Zwraca pierwszy token w 55 sekund, podczas gdy GPT-6.1 Sol potrzebuje pięciu i pół minuty, a następnie spędza trzydzieści sześć minut na ukończeniu zadania, podczas gdy model OpenAI kończy je w jedenaście minut. To model, który zaczyna mówić natychmiast i myśli bardzo długo. W interfejsie czatu z odpowiedzią strumieniową odbiera się to jako responsywność. W przypadku nienadzorowanego zadania nocnego to czas zegarowy, za który również płacisz.

Trzy obszary, w których Qwen3.8-Max naprawdę przoduje

Luka indeksowa wynosi 6,4 punktu w całym zestawie; to liczba, którą cytuje się tak, jakby była jednolita. Nie jest jednolita, a ta rozbieżność jest pouczająca:

• GPQA Diamond — Qwen3.8-Max 0,9283 vs GPT-6.1 Sol – nieopublikowane w tym przebiegu

• GDPval — 1,671.4 vs 1,575.09

• Terminal-Bench 2.1 — 0.8876 vs nie opublikowano w tym uruchomieniu

• AutomationBench — 0,5619 vs 0,648

• SciCode — nie opublikowano w tym przebiegu w porównaniu z 0,5417 dla GPT-6.1 Sol

• CritPT — 0,1771 vs 0,3171

Qwen3.8-Max wygrywa w pytaniach naukowych na poziomie absolwenta oraz w próbce zadań zawodowych, co jest realnym wynikiem jak na model swojego pokolenia i powodem, dla którego jego indeks kodowania zajmuje 9. miejsce na 138. Przegrywa trudniejsze, bliskie badaniom ewaluacje — CritPT o 14 punktów — i przegrywa z AutomationBench o 8,7, a to ten, który najbardziej przypomina pracę komputerową bez nadzoru. To, które z tych dwóch uznasz za ważniejsze dla swojego obciążenia pracą, jest rzeczywistą decyzją; nagłówek o 6,4 punktu to średnia z niezgody, a nie werdykt.

Co dają dodatkowe tokeny, a czego nie

Długie ślady rozumowania nie są z definicji marnotrawstwem. Model, który zużywa 70 830 tokenów namysłu na trudnym zadaniu, robi coś, co krótszy model może pomijać, a w ewaluacjach, w których Qwen3.8-Max jest z przodu, ten namysł jest prawdopodobnie tego przyczyną. Problem polega na tym, że płacisz za to przy każdym zadaniu, nie tylko przy trudnych. Liczby tokenów rozumowania są cechą kalibracji modelu, a nie trudności pytania, a model, który nadmiernie się zastanawia nad jednolinijkową ekstrakcją, obciąża cię za to.

Sposobem na ustalenie, które z twoich zadań jest którym, jest zaprzestanie traktowania wyboru modelu jako globalnego. Co prowadzi nas do części, która jest zmianą konfiguracji.

Nasza własna karta modelu dla GPT-6.1 Sol zawiera udostępniane liczby podmiotu: stawkę $2.00 / $10.00, okno kontekstu 1 050 000 tokenów, p50 czasu do pierwszego tokenu wynoszące 4,54 sekundy oraz przechowywany blok indeksu Artificial Analysis na tej samej stronie co cennik, względem którego aplikacja faktycznie kierowałaby ruch.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

Jeden klucz, jeden miernik, dwa modele

Oba modele są dostępne przez jeden punkt końcowy OrcaRouter — jedno API dla ponad 200 modeli, a cena katalogowa dostawcy jest przekazywana z 0% narzutu. Karta OrcaRouter dla Qwen3.8-Max zawiera stawkę rozliczeniową obok okna kontekstu 1 000 000 tokenów, modalności wejściowych tekst/obraz/wideo i siedmiodniowego wolumenu 101,4 mln tokenów — liczby, na podstawie których aplikacja wybiera trasę, obok tych, o których dyskutuje artykuł. To przekazywanie cen ma szczególne znaczenie właśnie dla Qwen3.8-Max, ponieważ model, którego ekonomia jest zdominowana przez wolumen tokenów wyjściowych, to taki, którego dostawca może w każdej chwili zmienić cenę, a licznik przekazywania oznacza, że zmiana trafia na Twoją fakturę w dniu, w którym opublikuje ją Alibaba, a nie zgodnie z harmonogramem odsprzedawcy.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the $2.00 input and $6.00 output per-million prices, a 5.66 s p50 time to first token, 101.4M tokens over seven days, a 1,000,000-token context window and text/image/video input, above the OpenAI- and Anthropic-compatible code samples.

Ciekawsze zastosowanie warstwy routingu to tutaj DSL routingu, który pozwala łączyć modele w ramach jednego wywołania, zamiast wybierać jeden dla całej aplikacji. Podziel nocne zadanie: tani model klasyfikuje i ekstrahuje dane, GPT-6.1 Sol obsługuje kroki rozumowania i weryfikacji, a Qwen3.8-Max jest zarezerwowany dla zadań, w których jego długie rozważania i siła naukowa klasy GPQA faktycznie zmieniają odpowiedź. Automatyczne przełączanie awaryjne obsługuje resztę — jeśli dostawca ulegnie degradacji w trakcie działania, żądanie zostaje przeniesione, zamiast doprowadzić do niepowodzenia całej partii.

Żadna z tych rzeczy nie jest powodem, by wybierać model. To one sprawiają, że nie musisz dokonywać tego wyboru raz na zawsze i żyć z nim.

Decyzja i to, na co warto zwrócić uwagę

Płać 7,5 razy więcej tylko tam, gdzie namysł na to zasługuje. W przypadku ogólnego zadania nocnego GPT-6.1 Sol za 0,724 USD za zadanie jest możliwym do obrony domyślnym wyborem, a 1690 USD rocznie to realny koszt. Gdy zadanie dotyczy nauk ścisłych lub rozumowania zawodowego z weryfikowalną odpowiedzią, wynik 0,9283 Qwen3.8-Max na GPQA Diamond jest wart tych tokenów — to jest właśnie to, co robi lepiej.

Na co trzeba uważać, to czy Alibaba zmieni ceny. Model o 2,8× większym zużyciu tokenów w cenie $2.00/$6.00 jest wyceniony tak, jakby to tokeny były rzadkim zasobem; samo zachowanie modelu sprawia, że tokeny stają się obfite. Jeśli stawka za tokeny wyjściowe zmieni się istotnie, arytmetyka z tego artykułu zmieni się wraz z nią, a miernik przenoszenia pokaże ci to tego samego dnia, w którym to nastąpi.

Porównane w tym artykule3

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie