Wygenerowana karta tytułowa hero z napisem 'Gemini 3.1 Pro vs Qwen3.8-27B' i podtytułem 'Siedmiomiesięczna wersja zapoznawcza vs checkpoint, który możesz pobrać', z dwiema kartami: Gemini 3.1 Pro, w wersji zapoznawczej od 19 lutego 2026 r., w cenie 2,00 USD za 1 mln tokenów wejściowych i 12,00 USD za 1 mln tokenów wyjściowych oraz ze wskaźnikiem Artificial Analysis Intelligence Index na poziomie 29,7, w porównaniu z Qwen3.8-27B, z otwartymi wagami od 14 sierpnia 2026 r., w cenie 0,50 USD za 1 mln tokenów wejściowych i 3,00 USD za 1 mln tokenów wyjściowych i wskaźnikiem na poziomie 33,7, z medalionem VS pomiędzy nimi i logo OrcaRouter w prawym dolnym rogu. Stopka: 'Artificial Analysis Intelligence Index v4.3.2, stan na 2026-09-23; ceny są stawkami katalogowymi dostawców.'
Guides & Insights

Gemini 3.1 Pro kontra Qwen3.8-27B: siedmiomiesięczna zapowiedź kontra checkpoint, który możesz pobrać

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

18 września 2026 r. użytkownicy na forum dla deweloperów AI należącym do samego dostawcy zaczęli zgłaszać, że Gemini 3.1 Pro zniknął z selektora modeli AI Studio — także na kontach płatnych, nie pomogło czyszczenie pamięci podręcznej ani okna incognito. Wątek z prośbą do dostawcy o wyjaśnienie, czy to „błąd, czy działanie zamierzone”, był wciąż aktywny 21 września. Nie ma komunikatu o wycofaniu, ścieżki migracji ani odpowiedzi personelu. Tymczasem Qwen3.8-27B, który laboratorium udostępniło jako open source 14 sierpnia na licencji Apache 2.0, nie może zostać odebrany nikomu, kto go pobrał. To właśnie ta asymetria — a nie różnica w wynikach benchmarków, która jest realna, choć umiarkowana — jest tym, co tak naprawdę rozstrzyga w tym starciu, i dlatego oba modele w rzeczywistości nie konkurują o to samo miejsce, mimo że tabele porównawcze stawiają je obok siebie.

Poniżej znajduje się bezpośrednie zestawienie istniejących liczb, każda z etykietą: dane Artificial Analysis z zapisów wykonanych 23 września 2026 r., własna karta modelu Alibaby, wpis Google ogłaszający premierę oraz nasza własna telemetria routingu — przez cały czas utrzymywane osobno. Tam, gdzie nic nie zostało zmierzone, ta strona mówi o tym wprost, zamiast zgadywać.

Co się stało w tym tygodniu i co to oznacza, a czego nie oznacza

Raporty są konkretne i pochodzą z forum samego Google, a nie z bloga konkurencji. Wątek zatytułowany „Gemini 3.1 Pro zniknął z AI Studio od 2026-09-18 — błąd czy celowe działanie?” opisuje płacących użytkowników tracących model bez żadnego ogłoszenia, pomoc techniczną Google One oferującą niepowiązane kroki rozwiązywania problemów oraz stronę statusu Google, która nie pokazuje żadnych problemów. Drugi wątek, „Model Gemini 3.1 Pro Preview niedostępny w AI Studio do tworzenia aplikacji”, zbiera tę samą skargę, w tym od użytkownika, którego asystent kodowania był budowany na wersji preview przez wiele miesięcy i który mówi, że Flash „tworzy byle jaki kod” w jego bazie kodu.

Trzy uczciwe zastrzeżenia. To zniknięcie z konsoli deweloperskiej, a nie potwierdzona awaria API: Gemini 3.1 Pro nadal widnieje w naszym własnym katalogu i można go trasować, gdzie w ciągu ostatnich siedmiu dni przetworzył 94,7 mln tokenów. Jest to zgłoszone przez użytkowników — Google nic nie powiedziało, więc nikt spoza Google nie może oddzielić „cichej deprecjacji” od „problemu z przepustowością” od „błędu konsoli”. A czas nie stawia tego w dobrym świetle, biorąc pod uwagę, że ten model znajduje się w wersji zapoznawczej od 19 lutego 2026 r. — siedem miesięcy, bez opublikowanej daty GA, podczas gdy Google wypuściło drabinkę modeli Flash poniżej niego. Osobno, GitHub Copilot wycofał Gemini 3.1 Pro 1 września 2026 r. z 30-dniowym wyprzedzeniem, co jest osobnym i niepowiązanym wydarzeniem, ale wskazuje w tym samym kierunku: punkt końcowy w wersji zapoznawczej bez zobowiązania do GA to zależność, o którą masz prawo się denerwować.

Jedna liczba z naszej strony jest warta umieszczenia obok tego kontekstu, ponieważ nie potrafimy jej wyjaśnić i wolimy to powiedzieć. Nasza siedmiodniowa telemetria dla wpisu katalogowego Gemini 3.1 Pro pokazuje 80,5% wskaźnika błędów; sąsiednie modele, które sprawdziliśmy tego samego ranka — Qwen3.8-Max, Claude Fable 5.1 — mają 5,9% i 6,9%. Nie wiemy, czy to ten sam problem, który zgłasza forum, zły tydzień dla jednego dostawcy upstream, czy artefakt instrumentacji. Potraktuj to jako powód, aby uruchomić test kanarkowy przed podjęciem decyzji, a nie jako werdykt o modelu.

Ta sama linijka, dwa różne wyniki

To jest ta część, w której większość stron porównawczych się myli, więc warto podejść do niej starannie. Artificial Analysis ocenia oba te modele w Intelligence Index v4.3.2. Zapisaliśmy obie strony 23 września 2026 i obie mają tę samą wersję — więc w przeciwieństwie do większości twierdzeń o indeksie porównujących modele ten pochodzi z tego samego zrzutu, a różnica jest prawdziwa.

• Qwen3.8-27B (xhigh) — Indeks Inteligencji 33,7

• Gemini 3.1 Pro Preview — Indeks Inteligencji 29,7

Qwen prowadzi o cztery punkty według obecnej miary. Trudniejsze pytanie brzmi, co to oznacza, ponieważ sama miara przesunęła się w tym roku co najmniej trzy razy. W lutym Artificial Analysis opublikowało artykuł nazywający Gemini 3.1 Pro Preview „nowym liderem w AI”, o cztery punkty przed Claude Opus 4.6, a ówczesne relacje prasowe podawały wynik 57 w ówczesnym Index v4.0. W v4.3.2 wynosi on 29,7. Artificial Analysis ogłosiło v4.3 7 września 2026 r., cztery dni po v4.2, a w ramach tej wersji zastąpiono Terminal-Bench 2.1 znacznie trudniejszym, 66-zadaniowym Terminal-Bench 4.0 i wymieniono τ³-Banking na AutomationBench-AA. Lutowe mocne strony Gemini 3.1 Pro leżały w ewaluacjach, które nowy indeks wycofał lub zmienił ich wagi. A więc: to nie model się pogorszył, tylko egzamin. Ale jeśli wybierasz model dzisiaj, liczba z dzisiaj jest tym, na czym naprawdę możesz się opierać, a dzisiejsza liczba sprzyja Qwen.

Tam, gdzie te dwa naprawdę się rozchodzą

Zbiorcze wyniki ukrywają kształt różnicy, a właśnie kształt jest tym, co użyteczne. Każda z poniższych liczb pochodzi z tego samego zrzutu z 23 września stron v4.3.2 Artificial Analysis dla obu modeli, na tej samej rewizji.

• Rozumowanie i wiedza — Gemini zdecydowanie prowadzi. GPQA Diamond 94,1 vs 90,5; Humanity's Last Exam 47,0 vs 33,9; SciCode 58,7 vs 46,6; CritPt 17,7 vs 5,4.

• Rzeczywiste zadania zawodowe — Qwen prowadzi, i to z dużą przewagą. GDPval po normalizacji: 45,4% vs 13,8%.

• Bankowość agentowa i transakcje — Qwen na czele. τ-Banking 48,0 vs 21,4 Gemini.

• Agentowe użycie narzędzi w ogólnym benchmarku — Gemini prowadzi tam, gdzie Qwen nie był mierzony. τ²-Bench 95,6 dla Gemini; brak wyniku dla Qwen3.8-27B.

• Praca w terminalu — blisko siebie, a oba wypadają słabo w nowym benchmarku. Terminal-Bench 2.1: Qwen 79,8, Gemini 73,8. Terminal-Bench 4.0: Qwen 5,6%, Gemini 4,0% — oba wyniki jednocyfrowe.

• Kalibracja — najostrzejsza rozbieżność na obu stronach. W AA-Omniscience Gemini uzyskuje 31,9 przy dokładności 54,9% i wskaźniku halucynacji 50,9%; Qwen uzyskuje −10,0 przy dokładności 15,6% i wskaźniku halucynacji 30,3%. Gemini wie więcej i zmyśla w ponad połowie przypadków; Qwen często odmawia odpowiedzi i halucynuje w około jednej trzeciej przypadków, w których odpowiada.

• Długi kontekst — dokładnie równo w przywoływaniu długiego kontekstu, po 82,0 każdy. W multimodalnym przywoływaniu długiego kontekstu Qwen 21,7% vs Gemini 15,6%.

Czytaj wpisy „nie mierzone” jako to, czym są. Gemini nie ma opublikowanego znormalizowanego wyniku GDPval-AA w zestawieniu z 45,4% Qwena, a Qwen nie ma wyniku dla τ²-Bench, IFBench, Terminal-Bench Hard ani ITBench-SRE w porównaniu z wynikami Gemini: 77,1, 53,8 i 30,3. Każda z tych luk to miejsce, w którym tabela podsumowująca po cichu wykreowałaby zwycięzcę.

A generated two-column scoreboard headed 'Gemini 3.1 Pro vs Qwen3.8-27B — the scoreboard', with the same six dimension labels in both columns. Gemini 3.1 Pro: AA Index 29.7, price per 1M $2.00 input and $12.00 output, context 1M tokens, output speed 116.5 tokens per second, open weights no (preview API), cost to run the index $1,310. Qwen3.8-27B: AA Index 33.7, price per 1M $0.50 input and $3.00 output, context 262K native, output speed 41.3 tokens per second, open weights yes (Apache 2.0), cost to run the index $1,336. Footer: 'Artificial Analysis Intelligence Index v4.3.2, captured 2026-09-23; prices are provider list rates.'

Rozbieżność, która decyduje o budżetach: ten sam koszt utrzymania indeksu

Qwen3.8-27B jest dramatycznie tańszy za token. Według danych rynkowych publikowanych przez Artificial Analysis kosztuje 0,50 USD za milion tokenów wejściowych i 3,00 USD za milion tokenów wyjściowych, z 80% zniżką na cache i mieszaną stawką 7:2:1 wynoszącą 0,47 USD. Gemini 3.1 Pro Preview to 2,00 USD i 12,00 USD — czterokrotnie wyższa cena wejściowa i czterokrotnie wyższa cena wyjściowa — z 90% zniżką na cache i mieszaną stawką 1,74 USD.

A oto liczba, której nikt nie publikuje: własna księgowość Artificial Analysis wycenia koszt uruchomienia całego Intelligence Index na 1 310,21 USD dla Gemini 3.1 Pro Preview i 1 335,92 USD dla Qwen3.8-27B. Uruchamianie Qwena nie jest tańsze. Jest bardzo nieznacznie droższe, ponieważ potrzebuje na to więcej czasu. Z rachunku Qwena za tokeny wyjściowe 512,36 USD przypadło na tokeny rozumowania, a 82,51 USD na rzeczywistą odpowiedź; w przypadku Geminiego 691,82 USD przypadło na rozumowanie, a 113,08 USD na odpowiedź. Cena za token to stawka, a nie rachunek.

Jeszcze dwa fakty cenowe, które pomijają tabele porównawcze. Po pierwsze, cena Gemini 3.1 Pro jest stopniowana według rozmiaru danych wejściowych każdego żądania: 2,00 USD/12,00 USD do 200 tys. tokenów wejściowych, a potem 4,00 USD/18,00 USD powyżej tego progu, przy czym odczyty z pamięci podręcznej rosną dwukrotnie z 0,20 USD do 0,40 USD. Okno kontekstowe o wielkości miliona tokenów jest prawdziwe, ale jego ostatnie 800 000 tokenów kosztuje podwójnie. Po drugie, nasz własny wpis katalogowy dla Qwen3.8-27B — serwowanego w block-FP8, z wieżą wizyjną w pełnej precyzji — podaje 0,40 USD za wejście i 4,21 USD za wyjście, co jest tańsze na wejściu, a droższe na wyjściu niż powyższa wartość rynkowa, i nie podaje żadnej stawki za tokeny z pamięci podręcznej. Różni dostawcy, różny podział. Sprawdź stawkę, według której faktycznie zostaniesz rozliczony.

Oba modele są dostępne przez jeden klucz OrcaRouter po cenie katalogowej dostawcy z 0% narzutu, więc zmiana ceny u dostawcy trafia na naszą stronę tego samego dnia, a nie po cyklu aktualizacji cen — co ma większe znaczenie niż zwykle, gdy jeden z dwóch ma granicę poziomu ustaloną na 200 tys. tokenów.

Opóźnienie: najszybszy pierwszy token należy do wolniejszego modelu

To najbardziej myląca para liczb w całym porównaniu i to właśnie ona najprawdopodobniej skłoni czytelnika do błędnego działania.

• Czas do pierwszego fragmentu — Qwen 4,04 s vs Gemini 28,37 s. Qwen wydaje się siedem razy szybszy.

• Czas do uzyskania rzeczywistej odpowiedzi — Gemini 28,37 s vs Qwen 52,52 s. Gemini wygrywa około 1,8-krotnie, ponieważ Qwen spędza 48,48 sekundy na myśleniu między pierwszym fragmentem a pierwszym tokenem odpowiedzi.

• Szybkość generowania — Gemini 116,5 tokena na sekundę vs Qwen 41,3. Gemini jest 2,8 razy szybszy, gdy już zacznie pisać, wobec mediany porównawczej, którą Artificial Analysis określa na 95,4 tokena na sekundę. Własna strona Qwena nazywa go „wyraźnie wolnym”.

Jeśli Twój produkt strumieniuje pierwszy token do użytkownika, główna latencja Qwen to kłamstwo, które powiesz sobie raz. Jeśli Twój produkt czeka na pełną odpowiedź, Gemini jest szybszym modelem. Obie liczby to pomiary Artificial Analysis; obie zostały wykonane przy ustawieniu wysiłku xhigh u Qwen, które jest domyślnym ustawieniem karty modelu.

To domyślne ustawienie jest żywą skargą wśród praktyków, a karta modelu po części to przyznaje. Qwen3.8-27B udostępnia parametr reasoning_effort z trzema poziomami — xhigh (domyślnym, „dla złożonych zadań wymagających wnikliwej analizy”), medium oraz low. Opracowania społecznościowe aż po wrzesień donoszą, że xhigh powoduje bardzo długie fazy rozumowania, i zalecają zejście do medium lub low oraz ograniczenie budżetu rozumowania. Sama karta Alibaby ostrzega, że w wieloturowej pracy agentowej obniżenie wysiłku „nie zawsze skraca całkowitego czasu wykonania zadania” — co jest szczerym stwierdzeniem jak na kartę modelu i ostrzeżeniem, że oczywiste rozwiązanie nie zawsze jest rozwiązaniem.

Kontekst: 1M vs 262K i co tak naprawdę się mieści

Gemini 3.1 Pro ma okno kontekstowe o rozmiarze 1 000 000 tokenów i maksymalne wyjście 65 536 tokenów. Qwen3.8-27B natywnie obsługuje 262 144 tokeny, z możliwością rozszerzenia do 1 000 000 dzięki skalowaniu YaRN, przy czym zaleca się w nim osobne budżety: treść rozumowania do 262 144, a końcowa odpowiedź do 131 072.

Dwa uczciwe przypisy. Tabela specyfikacji Artificial Analysis podaje okno Qwen jako 256 000, podczas gdy własny tekst FAQ Artificial Analysis mówi 260 tys., a karta modelu podaje 262 144 — to różnice wynikające z zaokrągleń tej samej liczby, ale podawaj 262 144, ponieważ tak mówi karta. A rozszerzenie do 1 mln to technika skalowania, a nie to samo co natywne okno o długości miliona tokenów: przywoływanie informacji z długiego kontekstu przy 1 mln w modelu rozszerzonym o YaRN nie jest tym, co mierzy wynik 82,0 AA-LCR. Nikt nie opublikował wyniku przywoływania w kontekście 1 mln dla Qwen3.8-27B. Traktuj okno Gemini jako to, którego zachowanie zmierzono przy pełnej długości, a okno Qwen jako to, które powinieneś sam przetestować, zanim zaczniesz projektować w oparciu o nie — i pamiętaj, że powyżej 200 tys. tokenów wejściowych cena Gemini się podwaja.

Praca agentowa i wywoływanie narzędzi

To jest miejsce, w którym zestawienie jest naprawdę nierozstrzygnięte i w którym wykreowanie zwycięzcy byłoby łatwe i błędne. Qwen3.8-27B ma zmierzone wyniki agentowe, których brakuje Gemini, i odwrotnie.

Argumentacja Qwen opiera się na mocnym niezależnym wyniku i mocnym wyniku dostawcy. Tym niezależnym wynikiem jest τ-Banking na poziomie 48,0 wobec 21,4 Gemini — ponad dwukrotnie wyższy, na tej samej wersji, w benchmarku dotyczącym wieloetapowego korzystania z narzędzi w środowisku bankowym. Wynikiem dostawcy jest własna karta Alibaby, w której podano OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9, CoWorkBench 70,7, JobBench 33,4 oraz Agents' Last Exam 20,4 Pass@1. To ewaluacje Alibaby, niepowtórzone przez nikogo innego, i sytuują się dokładnie w tych kategoriach, w których niezależnie zmierzony wynik GDPval (45,4% po normalizacji wobec 13,8%) wskazuje ten sam kierunek.

Argument Gemini jest taki, że ma jedyny wysoki bezwzględny wynik agentowy w tym porównaniu — τ²-Bench 95,6 — a Qwen nie ma żadnego wyniku τ²-Bench. Ma także IFBench 77,1 za podążanie za instrukcjami, kolejny brak po stronie Qwen. Ma też siedmiomiesięczny dorobek produkcyjny, którego nie ma pięciotygodniowe wydanie open-weights.

Tym, co przechyla szalę, nie jest wynik, lecz twoja topologia. Przewaga Qwen w zadaniach agentowych jest mierzona na benchmarkach, w których model działa wewnątrz dużego, istniejącego wcześniej systemu oprogramowania, którego nie zaprojektował. Przewaga Gemini jest mierzona na benchmarkach, w których model musi przez długi czas precyzyjnie przestrzegać instrukcji. To różne umiejętności i obie są prawdziwe.

A screenshot of the Artificial Analysis comparison page for Gemini 3.1 Pro Preview against Qwen3.8-27B, showing an Intelligence Index of 29.7 for Gemini 3.1 Pro Preview and 33.7 for Qwen3.8-27B on revision v4.3.2, with blended price rows of $1.74 and $0.47 per 1M tokens, cost per task of $1.01 and $0.67, cost to run the full Intelligence Index of $1,310 and $1,336, and the output-token breakdown beneath.

Programowanie

Kodowanie rozkłada się tak samo, dlatego pytanie „który jest lepszy w kodowaniu” nie ma tu jednoznacznej odpowiedzi. Gemini prowadzi na polu obliczeń naukowych — SciCode 58,7 vs 46,6 — a jego AA Coding Index wynoszący 68,8 na naszej stronie katalogowej mieści się w granicach błędu zaokrąglenia względem 68,1 Qwena, a przy tym z zapasem w każdym przedziale ufności wartym przytoczenia. W agentowej pracy z terminalem oba modele są blisko siebie w starszym benchmarku — Qwen 79,8 vs Gemini 73,8 na Terminal-Bench 2.1 — a w nowszym nie do odróżnienia, gdzie oba spadają do jednocyfrowych wyników.

Karta Alibaby podaje znacznie więcej — SWE-bench Pro 61,7, LiveCodeBench v6 90,3, QwenSWEBench 79,0 — ale to dane raportowane przez dostawcę, a w przypisie karty zaznaczono, że SWE-bench Pro i QwenSWEBench zostały uruchomione w środowisku Claude Code, które nie jest środowiskiem, jakiego użyłby konkurent. Bezpiecznie można stwierdzić, że na jednym benchmarku kodowania, na którym modele obu laboratoriów zostały zmierzone przez stronę trzecią, te dwa dzieli różnica czterech punktów w Terminal-Bench 2.1 i 1,6 punktu w Terminal-Bench 4.0, a oba są słabe w tym trudniejszym.

Otwarte wagi kontra podglądowy endpoint

To jest oś, na której te dwa elementy w ogóle nie są porównywalne, i to ta o największych praktycznych konsekwencjach.

Qwen3.8-27B jest na licencji Apache 2.0, ma 27B gęstych parametrów i 64 warstwy, z hybrydą liniowej uwagi Gated DeltaNet oraz pełnej uwagi w proporcji około 3:1 — to konstrukcja, dzięki której serwowanie okna 262K jest przystępne kosztowo. Działa. Po kwantyzacji do 4 bitów mieści się w około 17 GB, co wystarcza na jeden konsumencki GPU; w ciągu pięciu tygodni wyrósł wokół niego cały ekosystem kompresji, od kwantów Dynamic V3 od Unsloth, w tym wersji 1-bitowej, która według Unsloth działa w 8 GB przy około 77% oryginalnej dokładności, po Ternary Bonsai 2 27B od PrismML w połowie września. Możesz go dostrajać, możesz go audytować i możesz go uruchomić na laptopie z odłączoną siecią.

Gemini 3.1 Pro to zamknięty endpoint w wersji zapoznawczej, siedmiomiesięczny, bez daty GA, z kartą modelu, która wyraźnie ostrzega, że wersje zapoznawcze mogą nie mieć stabilności, dostępności i wsparcia stabilnego wydania, oraz — od tego tygodnia — z konsolą deweloperską, którą najwyraźniej po cichu opuścił. Nie możesz go pobrać, nie możesz przypiąć wersji i nie możesz przełączyć się awaryjnie na samego siebie.

Jeśli chcesz szczerą odpowiedź dotyczącą routingu, a nie werdykt: istnienie otwartego checkpointu jest tym, co pozwala przetrwać zależność od Gemini. Umieść Qwen3.8-27B za lokalną lub samodzielnie hostowaną ścieżką jako rozwiązanie zapasowe, pozostaw Gemini 3.1 Pro na głównej ścieżce do zadań wymagających intensywnego rozumowania, w których jest mierzalnie lepszy, i umieść oba za jednym endpointem z automatycznym przełączaniem awaryjnym, tak aby ciche zniknięcie z czyjejś konsoli było incydentem, który pochłania twoja warstwa routingu, a nie awarią, którą widzą twoi użytkownicy. To nie jest reklama produktu — to jedyna konfiguracja, w której wiadomości z tego tygodnia nie kosztują cię weekendu.

Wybierz Gemini 3.1 Pro, jeśli

• Twoja najtrudniejsza praca to rozumowanie wymagające dużej wiedzy, a nie korzystanie z narzędzi w długim horyzoncie — daje ono wyniki: GPQA Diamond 94,1 wobec 90,5, Humanity's Last Exam 47,0 wobec 33,9, SciCode 58,7 wobec 46,6 i CritPt 17,7 wobec 5,4.

• Potrzebujesz naprawdę długich danych wejściowych. Zmierzone okno o rozmiarze miliona tokenów, którego zdolność do przywoływania informacji przetestowano na długich dystansach, przewyższa okno 262K rozszerzone techniką — pod warunkiem, że możesz pogodzić się z podwojeniem ceny po przekroczeniu 200K tokenów wejściowych.

• Czas do uzyskania pełnej odpowiedzi ma większe znaczenie niż czas do pierwszego tokenu, a chcesz 116,5 tokena na sekundę, a nie 41,3.

• Potrzebujesz dziś szerokiej multimodalności: wejścia audio, plików, obrazów, tekstu i wideo w zestawieniu z tekstem, obrazem i wideo Qwen.

• Jesteś gotów zaakceptować ryzyko związane z wersją zapoznawczą i masz plan awaryjny, który kontrolujesz.

Wybierz Qwen3.8-27B, jeśli

• Twoje agenty działają wewnątrz dużych, istniejących systemów — τ-Banking 48,0 do 21,4 i GDPval 45,4% do 13,8% po normalizacji to dwie największe przewagi pojedynczego modelu w całym tym porównaniu.

• Potrzebujesz odpowiedzi, która będzie uczciwa, a nie pewna siebie. Wskaźnik halucynacji na poziomie 30,3% w porównaniu z 50,9% w przypadku Gemini to inny rodzaj produktu.

• Licencjonowanie lub zasady dotyczące lokalizacji danych wykluczają zamknięte API albo musisz dostroić model na własnych danych.

• Chcesz, by koszt za token stanowił jedną czwartą kosztu Gemini, i akceptujesz, że różnicę wydasz na tokeny myślenia — uruchomienie indeksu kosztuje tyle samo w obu przypadkach.

• Jesteś gotowy obniżyć reasoning_effort z jego domyślnego ustawienia xhigh, zamiast wysyłać go takim, jaki jest.

Czego nie mogliśmy zweryfikować

Dla porządku, a ponieważ strona porównawcza jest tylko tak dobra, jak jej luki: dla Qwen3.8-27B przy obniżonym wysiłku rozumowania nie opublikowano żadnej niezależnej oceny, więc jego kompromis między szybkością a jakością przy średnim i niskim poziomie wysiłku pozostaje niezmierzony. Nie istnieje żaden wynik odtwarzania długiego kontekstu dla konfiguracji 1M rozszerzonej o YaRN. Gemini 3.1 Pro nie ma opublikowanego znormalizowanego wyniku GDPval-AA, a Qwen3.8-27B nie ma go dla τ²-Bench, IFBench ani ITBench-SRE. I nikt — nawet Google — nie wyjaśnił, dlaczego Gemini 3.1 Pro zniknął z selektora AI Studio 18 września. Zaktualizujemy tę stronę, gdy którakolwiek z tych rzeczy się zmieni.

A screenshot of the OrcaRouter model page for Qwen3.8 27B (obsidian/qwen3.8-27b), showing Vision, Tools, JSON and Reasoning badges, a 2026-08-15 catalogue date, a 262K-token context window, list pricing of $0.40 input and $4.21 output per 1M tokens with no cached-token rate published, a p50 time to first token of 3.92s and a p95 of 10.00s over seven days, 1023.1M tokens of traffic in the same window, and a description noting the model is served in block-FP8 with the vision tower kept at full precision.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie