
GPT-6.1 Sol vs Qwen3.8-Max: Faktura, a nie cennik
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Weź jedno nocne zadanie konserwacji repozytorium, uruchamiaj je raz na noc przez miesiąc i postaw GPT-6.1 Sol i Qwen3.8-Max na nim po kolei. Według danych Artificial Analysis v4.3.2 dla poszczególnych zadań GPT-6.1 Sol kosztuje 21,72 USD za te trzydzieści nocy, a Qwen3.8-Max kosztuje 162,27 USD — różnica 140,55 USD miesięcznie, około 1690 USD rocznie, za zadanie, którego cennik za token wynosi 2,00 USD na wejściu i 10,00 USD na wyjściu w porównaniu z 2,00 USD na wejściu i 6,00 USD na wyjściu. Stawki za milion tokenów na wejściu różnią się między sobą w granicach błędu zaokrąglenia, a chiński model jest o 40% tańszy na wyjściu, a jednak faktura różni się 7,5-krotnie. Dostawca wydał GPT-6.1 Sol 29 września 2026 r.; Qwen3.8-Max jest dostępny od 3 sierpnia 2026 r.
Ta różnica nie jest sztuczką cenową ani artefaktem benchmarku — to całość tego, co to porównanie ma do powiedzenia, i pochodzi z jednej liczby, której nie pokazuje ci żaden cennik.
Czym jest każdy model
GPT-6.1 Sol to obecny flagowy model OpenAI do rozumowania i kodowania, wydany tydzień po GPT-6 Sol, którego zastępuje, w tej samej cenie katalogowej 2,00 USD / 10,00 USD, ze stawką 0,10 USD za wejście z pamięci podręcznej i oknem kontekstu wynoszącym 1 050 000 tokenów. Jest sprzedawany do pracy agentowej: jego tagi best-for na naszej własnej karcie modelu to rozumowanie, kodowanie i agentowość, a ma najwyższy wynik jakości.
Qwen3.8-Max to flagowy model agentowy firmy Alibaba — zamknięty model dostępny wyłącznie przez API, który przyjmuje dane wejściowe w postaci tekstu, obrazu i wideo oraz obsługuje kontekst 1 000 000 tokenów. W przeciwieństwie do mniejszych wydań Qwen, ten nie ma opublikowanych wag. W Artificial Analysis ma 45,42 punktu w Intelligence Index i zajmuje 17. miejsce na 147 modeli, a jego indeks kodowania na poziomie 76,2 daje mu 9. miejsce w tej dziedzinie. To nie jest słaby model. Jest po prostu drogi, jeśli pozwoli mu się myśleć.
Numer, którego nie ma na karcie stawek

Artificial Analysis odnotowuje 107 730 tokenów wyjściowych na zadanie dla Qwen3.8-Max, z czego 70 830 to tokeny rozumowania. GPT-6.1 Sol generuje 38 128 tokenów wyjściowych, z czego 25 190 to tokeny rozumowania. Chiński model zapisuje 2,8 razy więcej tokenów, aby odpowiedzieć na to samo pytanie, a zapisuje je po cenie o 40% niższej za token.
• Tokeny wyjściowe na zadanie — 38,128 vs 107,730; Qwen generuje 2,8× więcej
• W tym rozumowanie — 25 190 vs 70 830
• Koszt na zadanie — 0,724 USD vs 5,409 USD; Qwen kosztuje 7,5× więcej
• Czas na zadanie — 640 s vs 2 152 s; około 11 minut vs około 36
• Czas do pierwszego tokenu odpowiedzi — 332,0 s vs 55,1 s
• Indeks Inteligencji — 51,83 vs 45,42
• Okno kontekstowe — 1 050 000 vs 1 000 000 tokenów
• Dane wejściowe — tekst, obraz i plik vs tekst, obraz i wideo
Wykonaj mnożenie, a rabat znika. Model, który emituje blisko trzy razy więcej tokenów przy stawce niższej o 40%, nie kosztuje mniej — kosztuje około 1,7 razy więcej tylko na wyjściu, a zmierzona wartość na zadanie wskazuje, że rzeczywisty mnożnik wynosi 7,5, gdy uwzględni się dane wejściowe, odczyty z pamięci podręcznej i długość produktywnej odpowiedzi.
Zwróć uwagę na czwartą i piątą linię, ponieważ wskazują przeciwne kierunki, a razem wyjaśniają, czym jest Qwen3.8-Max. Zwraca pierwszy token w 55 sekund, podczas gdy GPT-6.1 Sol potrzebuje pięciu i pół minuty, a następnie spędza trzydzieści sześć minut na ukończeniu zadania, podczas gdy model OpenAI kończy je w jedenaście minut. To model, który zaczyna mówić natychmiast i myśli bardzo długo. W interfejsie czatu z odpowiedzią strumieniową odbiera się to jako responsywność. W przypadku nienadzorowanego zadania nocnego to czas zegarowy, za który również płacisz.
Trzy obszary, w których Qwen3.8-Max naprawdę przoduje
Luka indeksowa wynosi 6,4 punktu w całym zestawie; to liczba, którą cytuje się tak, jakby była jednolita. Nie jest jednolita, a ta rozbieżność jest pouczająca:
• GPQA Diamond — Qwen3.8-Max 0,9283 vs GPT-6.1 Sol – nieopublikowane w tym przebiegu
• GDPval — 1,671.4 vs 1,575.09
• Terminal-Bench 2.1 — 0.8876 vs nie opublikowano w tym uruchomieniu
• AutomationBench — 0,5619 vs 0,648
• SciCode — nie opublikowano w tym przebiegu w porównaniu z 0,5417 dla GPT-6.1 Sol
• CritPT — 0,1771 vs 0,3171
Qwen3.8-Max wygrywa w pytaniach naukowych na poziomie absolwenta oraz w próbce zadań zawodowych, co jest realnym wynikiem jak na model swojego pokolenia i powodem, dla którego jego indeks kodowania zajmuje 9. miejsce na 138. Przegrywa trudniejsze, bliskie badaniom ewaluacje — CritPT o 14 punktów — i przegrywa z AutomationBench o 8,7, a to ten, który najbardziej przypomina pracę komputerową bez nadzoru. To, które z tych dwóch uznasz za ważniejsze dla swojego obciążenia pracą, jest rzeczywistą decyzją; nagłówek o 6,4 punktu to średnia z niezgody, a nie werdykt.
Co dają dodatkowe tokeny, a czego nie
Długie ślady rozumowania nie są z definicji marnotrawstwem. Model, który zużywa 70 830 tokenów namysłu na trudnym zadaniu, robi coś, co krótszy model może pomijać, a w ewaluacjach, w których Qwen3.8-Max jest z przodu, ten namysł jest prawdopodobnie tego przyczyną. Problem polega na tym, że płacisz za to przy każdym zadaniu, nie tylko przy trudnych. Liczby tokenów rozumowania są cechą kalibracji modelu, a nie trudności pytania, a model, który nadmiernie się zastanawia nad jednolinijkową ekstrakcją, obciąża cię za to.
Sposobem na ustalenie, które z twoich zadań jest którym, jest zaprzestanie traktowania wyboru modelu jako globalnego. Co prowadzi nas do części, która jest zmianą konfiguracji.
Nasza własna karta modelu dla GPT-6.1 Sol zawiera udostępniane liczby podmiotu: stawkę $2.00 / $10.00, okno kontekstu 1 050 000 tokenów, p50 czasu do pierwszego tokenu wynoszące 4,54 sekundy oraz przechowywany blok indeksu Artificial Analysis na tej samej stronie co cennik, względem którego aplikacja faktycznie kierowałaby ruch.

Jeden klucz, jeden miernik, dwa modele
Oba modele są dostępne przez jeden punkt końcowy OrcaRouter — jedno API dla ponad 200 modeli, a cena katalogowa dostawcy jest przekazywana z 0% narzutu. Karta OrcaRouter dla Qwen3.8-Max zawiera stawkę rozliczeniową obok okna kontekstu 1 000 000 tokenów, modalności wejściowych tekst/obraz/wideo i siedmiodniowego wolumenu 101,4 mln tokenów — liczby, na podstawie których aplikacja wybiera trasę, obok tych, o których dyskutuje artykuł. To przekazywanie cen ma szczególne znaczenie właśnie dla Qwen3.8-Max, ponieważ model, którego ekonomia jest zdominowana przez wolumen tokenów wyjściowych, to taki, którego dostawca może w każdej chwili zmienić cenę, a licznik przekazywania oznacza, że zmiana trafia na Twoją fakturę w dniu, w którym opublikuje ją Alibaba, a nie zgodnie z harmonogramem odsprzedawcy.

Ciekawsze zastosowanie warstwy routingu to tutaj DSL routingu, który pozwala łączyć modele w ramach jednego wywołania, zamiast wybierać jeden dla całej aplikacji. Podziel nocne zadanie: tani model klasyfikuje i ekstrahuje dane, GPT-6.1 Sol obsługuje kroki rozumowania i weryfikacji, a Qwen3.8-Max jest zarezerwowany dla zadań, w których jego długie rozważania i siła naukowa klasy GPQA faktycznie zmieniają odpowiedź. Automatyczne przełączanie awaryjne obsługuje resztę — jeśli dostawca ulegnie degradacji w trakcie działania, żądanie zostaje przeniesione, zamiast doprowadzić do niepowodzenia całej partii.
Żadna z tych rzeczy nie jest powodem, by wybierać model. To one sprawiają, że nie musisz dokonywać tego wyboru raz na zawsze i żyć z nim.
Decyzja i to, na co warto zwrócić uwagę
Płać 7,5 razy więcej tylko tam, gdzie namysł na to zasługuje. W przypadku ogólnego zadania nocnego GPT-6.1 Sol za 0,724 USD za zadanie jest możliwym do obrony domyślnym wyborem, a 1690 USD rocznie to realny koszt. Gdy zadanie dotyczy nauk ścisłych lub rozumowania zawodowego z weryfikowalną odpowiedzią, wynik 0,9283 Qwen3.8-Max na GPQA Diamond jest wart tych tokenów — to jest właśnie to, co robi lepiej.
Na co trzeba uważać, to czy Alibaba zmieni ceny. Model o 2,8× większym zużyciu tokenów w cenie $2.00/$6.00 jest wyceniony tak, jakby to tokeny były rzadkim zasobem; samo zachowanie modelu sprawia, że tokeny stają się obfite. Jeśli stawka za tokeny wyjściowe zmieni się istotnie, arytmetyka z tego artykułu zmieni się wraz z nią, a miernik przenoszenia pokaże ci to tego samego dnia, w którym to nastąpi.
Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
