
Gemini 3.5 Flash-Lite vs Qwen 3.8: Tani koń roboczy vs 2.4T flagowiec
- qwenNOWOŚĆQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 za 1 mln tokenów · 56 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligencja69Kod
- qwenNOWOŚĆQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 200 tok/s
- orcaNOWOŚĆOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOWOŚĆAnthropic: Claude Opus 52026-07-2461Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2150Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1651Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1557Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0854Inteligencja72Kod
- tencentTencent: Hy32026-07-0641Inteligencja59Kod
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencja42Kod
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencja39Kod
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencja72Kod
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencja52Kod57Matematyka
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencja69Kod60Matematyka
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligencja61Kod61Matematyka
Gdy po raz pierwszy pisano to porównanie, było ono niezwykle jednostronne: Gemini 3.5 Flash-Lite był realnym, dostępnym produktem, a Qwen 3.8 był zamkniętym podglądem bez ceny, bez benchmarków i bez wag. Niewiele było można porównać.
To już nie jest aktualna sytuacja. Qwen3.8-Max osiągnął ogólną dostępność 3 sierpnia 2026 roku z opublikowaną taryfą w wysokości $2 / $6 za milion tokenów, punktem końcowym zgodnym z OpenAI i DashScope oraz pełną tabelą benchmarków. Jest samoobsługowy, o przewidywalnych kosztach i dostępny na żywo — w tym na OrcaRouter. Dlatego ten artykuł został napisany od nowa, bo uczciwe porównanie nie jest dziś „realnym modelem a mrzonką”. To jest prawdziwe klasowe porównanie: najtańszy wysokoprzepustowy koń roboczy Google z największym flagowcem Alibaba.
Uwaga dla twórców — te dwa rozwiązania znajdują się na przeciwnych końcach krzywej kosztów, więc właściwe pytanie brzmi: do której klasy należy Twoje obciążenie. OrcaRouter udostępnia ponad 200 modeli za jednym punktem końcowym zgodnym z OpenAI, dzięki czemu możesz przetestować oba w tym samym zadaniu bez podłączania dwóch SDK.
Werdykt w skrócie. Te modele tak naprawdę nie konkurują ze sobą — odpowiadają na różne pytania. Flash-Lite to model wydajnościowy: Artificial Analysis Index 36, $0.30 / $2.50 za 1M, mniej więcej 490 tokens/sec, ogólnie dostępny. Zaprojektowano go tak, aby obsługiwał każde żądanie przy znikomym koszcie. Qwen3.8-Max to model flagowy: ~2,4T parametrów, kontekst 1M tokenów ze stałą stawką, natywne wejście obrazu i wideo oraz deklarowane przez producenta wyniki na poziomie modeli granicznych (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) — przy $2 / $6, co stanowi 6,7× stawkę wejściową Flash-Lite. Flash-Lite to właściwy domyślny wybór do klasyfikacji, routingu i ekstrakcji na dużą skalę. Qwen3.8-Max to model, do którego przechodzisz, gdy zadanie naprawdę wymaga rozumowania na poziomie granicznym, miliona tokenów kontekstu lub wejścia nietekstowego. Jedno zastrzeżenie pozostało bez zmian: Qwen wciąż nie ma niezależnego wyniku benchmarkowego.
Najważniejsze wnioski
• Qwen 3.8 jest teraz ogólnie dostępny — od 3 sierpnia 2026 roku opublikowano cennik, dostęp samoobsługowy oraz tabelę benchmarków. Wcześniejsze ujęcie tego jako zamkniętego, nieprzewidywalnego kosztowo podglądu jest nieaktualne.
• Flash-Lite jest dramatycznie tańszy: $0.30 / $2.50 za 1M w porównaniu z Qwen's $2 / $6 — około 6,7× na wejściu i 2,4× na wyjściu.
• Flash-Lite jest znacznie szybszy: mniej więcej 490 tokenów na sekundę, zaprojektowany do pracy o wysokiej przepustowości. Model Qwen3.8-Max wykazuje p50 czasu do pierwszego tokena na poziomie 1,64 s w 7-dniowej telemetrii OrcaRouter, ale jest to duży i dokładny model.
• Flash-Lite ma jedyny zweryfikowany wynik: Artificial Analysis Index 36. Qwen3.8-Max pozostaje nieoceniony przez każdego niezależnego ewaluatora, chociaż Alibaba publikuje teraz własne liczby.
• Qwen zdecydowanie wygrywa pod względem możliwości: to kontekst 1M tokenów w stałej cenie bez dodatkowych opłat za długie prompty, a także obsługa tekstu/obrazu/wideo i OmniDocBench 1.5 92.1 do parsowania dokumentów. Flash-Lite to mały model wydajnościowy.
• Otwarte wagi: Obiecują, że modele Qwen pojawią się w tym tygodniu (jeszcze bez licencji), a także Qwen3.8-27B podobno działa w ~17GB pamięci VRAM. Flash-Lite jest zamknięty na stałe.
Nota o dokładności: wszystkie dane dotyczące jakości Qwen3.8-Max pochodzą od firmy Alibaba i nie zostały zweryfikowane przez podmioty trzecie. Dane Gemini 3.5 Flash-Lite pochodzą z Artificial Analysis. Cennik Qwen to ogólnie dostępna taryfa z Alibaba Model Studio i zastępuje dostęp z okresu zapowiedzi opisany we wcześniejszych wersjach tego artykułu.
Specyfikacje i cena, obok siebie
• Producent / status — Flash-Lite: Google; ogólnie dostępny; Qwen3.8-Max: Alibaba; GA (3 sierpnia 2026)
• Pozycjonowanie — Flash-Lite: tani, wysokoprzepustowy poziom wydajności; Qwen3.8-Max: okręt flagowy / ambicja przodowania
• AA Intelligence Index — Flash-Lite: 36 (Artificial Analysis); Qwen3.8-Max: Nadal bez wyniku
• Wyniki raportowane przez dostawcę — Flash-Lite: wynik jest mierzony przez stronę trzecią; Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (wszystkie raportowane przez Alibaba)
• Cena (za 1M, wejście / wyjście) — Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00, stała dla kontekstu 1M; wejście z pamięci podręcznej $0.25
• Prędkość — Flash-Lite: ~490 tok/s (Artificial Analysis); Qwen3.8-Max: p50 TTFT 1,64 s (7-dniowa telemetria OrcaRouter)
• Kontekst — Flash-Lite: kontekst klasy wydajnościowej; Qwen3.8-Max: 1M tokenów (983 616 z myśleniem; maks. wyjście 131 072)
• Modalność — Flash-Lite: model wydajności skoncentrowany na tekście; Qwen3.8-Max: tekst, obraz, wideo na wejściu → tekst na wyjściu
• Wagi — Flash-Lite: zamknięte, tylko API; Qwen3.8-Max: obiecane w ciągu tygodnia, brak jeszcze licencji
• Dostęp już dziś — Flash-Lite: standardowe API, samoobsługa; Qwen3.8-Max: standardowe API, samoobsługa (Model Studio, DashScope, OrcaRouter)
Ułożone w ten sposób wyniki wyglądają zupełnie inaczej niż dawniej. Kolumna Qwena nie jest już pusta — jest pełna, a w kilku wierszach to on jest silniejszym wpisem. To, co zastępuje stare ujęcie „znany towar kontra obietnica”, to prosta różnica poziomów: Flash-Lite jest mniej więcej 6.7× tańszy na wejściu i około 13× szybszy pod względem przepustowości, podczas gdy Qwen oferuje kontekst multimodalny o wielkości miliona tokenów i deklarowane rozumowanie na poziomie czołowych modeli. To oba pełnoprawne produkty; po prostu służą do różnych zadań.
Jedynym wierszem, w którym wciąż obowiązuje stare zastrzeżenie, jest wiersz benchmarków. Indeks 36 Flash-Lite został zmierzony przez Artificial Analysis na publicznej tablicy wyników. Każdy wynik Qwena — GPQA Diamond 92,6, Terminal-Bench 86,6 i reszta — został uzyskany przez Alibaba na własnym środowisku testowym. To rzeczywista poprawa w porównaniu z niepublikowaniem niczego, ale to nie jest weryfikacja przez stronę trzecią, a laboratoria publikują benchmarki, w których wygrywają.

Index 36 vs niepunktowany flagowiec: czytając to szczerze
Kuszące jest zestawić Index 36 Flash-Lite z GPQA Diamond 92.6 Qwena i ogłosić pogrom. To byłby błąd kategorialny podwójnie.
Po pierwsze, Artificial Analysis Intelligence Index to złożony wskaźnik obejmujący wiele zadań; GPQA Diamond to pojedynczy test z nauk ścisłych na poziomie zaawansowanym. Nie są one na tej samej skali i nie można ich od siebie odejmować.
Po drugie, co ważniejsze, Flash-Lite nigdy nie został zaprojektowany do uzyskiwania wysokich wyników. Indeks 36 to wynik typowego modelu efektywnego. Celem inżynierów Google było stworzenie modelu na tyle taniego i szybkiego, aby można go było umieścić przed każdym przychodzącym żądaniem — routing zgłoszeń, klasyfikacja, ekstrakcja, streszczanie na dużą skalę — gdzie model graniczny byłby ekonomicznym absurdem. Ocena go względem flagowego modelu 2,4T pod kątem pułapu rozumowania nie oddaje jego przeznaczenia.
To, co możemy powiedzieć, jest węższe i bardziej użyteczne. Qwen3.8-Max jest najprawdopodobniej modelem o znacznie większych możliwościach — jego deklarowane wyniki są znacznie wyższe, niż osiągnąłby model Index-36, a skok wyniku FrontierSWE z 40,7 u poprzednika do 73,5 sugeruje realny postęp. Jednak „najprawdopodobniej” pozostaje wnioskiem, ponieważ żaden niezależny ewaluator nie ocenił tego modelu. Dla kontekstu: poprzednik Qwen3.7-Max uzyskał 46 w indeksie AA — więcej niż 36 Flash-Lite, ale daleko od czołówki — więc sugerowany przez Alibabę skok pokoleniowy jest duży i niezweryfikowany.
Praktyczna konsekwencja: jeśli Twoje zadanie należy do tych, które Flash-Lite już poprawnie wykonuje, wyższy pułap Qwena jest dla Ciebie bezwartościowy — płaciłbyś za niego 6,7× więcej. Pułap ma znaczenie tylko wtedy, gdy Flash-Lite faktycznie zawodzi.
Koszt w praktyce: przepaść między poziomami w liczbach
Weźmy zadanie klasyfikacji o dużej objętości: 2000 tokenów wejściowych, 200 tokenów wyjściowych, uruchamiane 500 000 razy dziennie — realistyczny przykład triażu wsparcia lub routowania treści.
• Flash-Lite: za wywołanie, 0,002M × $0,30 = $0,0006, plus 0,0002M × $2,50 = $0,0005. ≈ $0,0011 za wywołanie → ~$550/dzień.
• Qwen3.8-Max: za wywołanie, 0.002M × $2 = $0.004, plus 0.0002M × $6 = $0.0012. ≈ $0.0052 za wywołanie → ~$2,600/dzień.
• Miesięcznie: Flash-Lite ≈ $16,500; Qwen ≈ $78,000 — różnica $61,500 przy tej samej liczbie zadań.
Przy takiej skali wybór poziomu to największa pojedyncza pozycja w systemie i bardzo trudno uzasadnić flagowy model do pracy, z którą radzi sobie model wydajnościowy. To jest dokładnie scenariusz, dla którego istnieje Flash-Lite.
Teraz odwróć to. Weźmy zadanie z długim dokumentem: 600 000 tokenów kontekstu, 5 000 tokenów wyjściowych, 200 razy dziennie.
• Qwen3.8-Max: 0,6M × 2 $ = 1,20 $, plus 0,005M × 6 $ = 0,03 $. ≈ 1,23 $ za wywołanie, bez dopłaty za długi prompt — i mniej więcej 0,18 $, jeśli kontekst jest serwowany z pamięci podręcznej po 0,25 $/1M.
• Flash-Lite nie może być w ogóle wyceniony dla tego kształtu, ponieważ kontekst pojedynczego wywołania o długości 600 000 tokenów nie jest czymś, co model klasy efektywnościowej ma pomieścić.
Więc odpowiedź zmienia się całkowicie wraz z profilem obciążenia, co jest prawdziwą lekcją. Flash-Lite wygrywa z ogromną przewagą w zadaniach o dużej objętości i krótkim kontekście. Qwen wygrywa we wszystkim, co wymaga miliona tokenów lub wejścia nietekstowego, gdzie Flash-Lite nie jest tańszą opcją, ale po prostu nie jest opcją.

Scenariusze: który poziom pasuje
Triage i routing zgłoszeń wsparcia na dużą skalę.Flash-Lite, zdecydowanie. Indeks 36 w zupełności wystarcza do klasyfikacji, a przy koszcie około 0,0011 USD za wywołanie można go uruchomić na każdym zgłoszeniu. Do większego modelu eskaluj tylko niejednoznaczną mniejszość.
Analiza całego dokumentu: umowy lub wniosku. Qwen3.8-Max. Kontekst 1M w stałej cenie oznacza, że 400-stronicowy dokument jest przetwarzany w jednym wywołaniu bez dodatkowych opłat i bez dzielenia na fragmenty, a jego deklarowany wynik 92.1 w OmniDocBench 1.5 celuje dokładnie w tego typu pracę.
Potoki zrzutów ekranu, wykresów lub wideo. Domyślnie Qwen3.8-Max — akceptuje obrazy i wideo jako dane wejściowe i raportuje OSWorld-Verified 86.1 w sterowaniu prawdziwym GUI. Flash-Lite nie jest kandydatem do danych nietekstowych.
Programowanie agentowe.Qwen3.8-Max przy deklarowanych wynikach (Terminal-Bench 2.1 86.6, FrontierSWE 73.5), z zastrzeżeniem, że żadne z nich nie zostały niezależnie zweryfikowane, a jego najsłabszy samodzielnie raportowany wynik to IFBench 82.8 w podążaniu za instrukcjami — realne ryzyko dla potoków, które parsują wyniki każdego kroku.
Architektura dwupoziomowa.Często właściwa odpowiedź brzmi: jedno i drugie — Flash-Lite jako tanie pierwsze przejście przy każdym żądaniu, Qwen3.8-Max jako ścieżka eskalacji dla niewielkiej części, która potrzebuje miliona tokenów, obrazu lub prawdziwego rozumowania. Taki wzorzec obejmuje większość przewagi kosztowej Flash-Lite, zachowując jednocześnie dostępną opcję z najwyższej półki.
Samodzielne hostowanie i otwartość
Flash-Lite jest zamknięty i dostępny wyłącznie przez API, na stałe — nie ma możliwości samodzielnego hostowania.
Wagi Qwen3.8-Max są obiecane w ciągu tygodnia, ale model flagowy nie jest realistycznym celem: mniej więcej 1,2 TB w 4-bitach wobec około 141 GB na H200 oznacza osiem lub więcej akceleratorów z najwyższej półki, a Alibaba nadal nie ujawniło liczby aktywnych parametrów, więc przepustowość, jaką zapewniłby ten wydatek, jest niemożliwa do wymodelowania. Nie ma też jeszcze tekstu licencji, co oznacza, że użyteczność komercyjna jest formalnie nieokreślona.
Równocześnie ogłoszony Qwen3.8-27B to wydanie, które naprawdę ma znaczenie dla planów on-premise. Również z otwartymi wagami i podobno działający w około 17 GB VRAM, jest to prawdziwa opcja do samodzielnego hostingu — i co istotne, znacznie bliższy konkurent niszy wydajnościowej Flash-Lite niż flagowy model 2,4 T.
Często zadawane pytania
Czy mogę dzisiaj używać Qwen 3.8?
Tak. Qwen3.8-Max jest ogólnie dostępny od 3 sierpnia 2026 r., z opublikowanymi cenami 2 USD / 6 USD za 1 mln tokenów oraz punktem końcowym zgodnym z OpenAI i DashScope. Jest dostępny samoobsługowo przez Alibaba Model Studio, DashScope i OrcaRouter. Wcześniejsze wersje tego artykułu opisywały podgląd z ograniczonym dostępem; to już nieaktualne.
Które jest tańsze?
Gemini 3.5 Flash-Lite zdecydowanie wygrywa: 0,30 USD / 2,50 USD za 1M w porównaniu z 2 USD / 6 USD w przypadku Qwen3.8-Max — czyli mniej więcej 6,7× taniej na wejściu i 2,4× na wyjściu. Przy pracy o dużej objętości i krótkim kontekście ta różnica dominuje nad wszystkimi innymi względami.
Co jest lepsze?
To różne poziomy. Flash-Lite ma jedyny audytowany wynik (AA Index 36), ale został zaprojektowany pod tanią przepustowość, a nie pod rozumowanie. Qwen3.8-Max jest najprawdopodobniej znacznie bardziej zdolny — jego deklarowane przez producenta wyniki GPQA Diamond 92.6 i Terminal-Bench 2.1 86.6 są na poziomie czołowych modeli — ale nie ma niezależnego benchmarku, więc pozostaje to wnioskiem, a nie zmierzonym wynikiem.
Który jest szybszy?
Flash-Lite, zdecydowanie. Artificial Analysis mierzy około 490 tokenów na sekundę, do czego służy jego konstrukcja klasy wydajnościowej. Qwen3.8-Max wykazuje p50 czas do pierwszego tokenu wynoszący 1,64 sekundy w 7-dniowej telemetrii OrcaRouter, ale to duży, dokładny model, a recenzenci z ery podglądu uznali go za wolny w przypadku długich procesów agentowych.
I don't have verified information about the release of "Qwen 3.8" as of my knowledge cutoff (June 2024). Qwen models up to Qwen 2.5 were released with open weights under permissive licenses, but I can't confirm whether a "3.8" version exists or its openness status. I'd recommend checking the official Qwen (Alibaba) repository or announcements for the most current information.
Jeszcze nie. Alibaba twierdzi, że wagi flagowego modelu dotrą w tym tygodniu, ale nadal nie ma licencji, karty modelu ani repozytorium. Nawet po wydaniu model 2,4T wymaga ośmiu lub więcej GPU klasy H200. Równolegle ogłoszony Qwen3.8-27B, podobno ~17 GB VRAM, jest praktyczną opcją do samodzielnego hostowania.
Czy użyć obu?
Często tak. Dwupoziomowa konfiguracja — Flash-Lite jako tani pierwszy etap dla każdego żądania, Qwen3.8-Max jako ścieżka eskalacji dla zadań z długim kontekstem, multimodalnych lub naprawdę trudnych — zachowuje większość przewagi kosztowej Flash-Lite, jednocześnie dając opcję z najwyższej półki tam, gdzie uzasadnia ona swoją cenę.
Który powinienem wybrać do produkcji dzisiaj?
Flash-Lite do prac o dużej skali, krótkim kontekście i wyłącznie tekstowych, gdzie wystarcza Index 36 — jest tani, szybki, poddany audytowi i sprawdzony. Qwen3.8-Max, gdy zadanie wymaga kontekstu obejmującego milion tokenów, danych wejściowych w postaci obrazu lub wideo albo rozumowania, którego Flash-Lite w oczywisty sposób nie potrafi wykonać. Obie opcje są obecnie w pełni wdrożalne, co nie było prawdą, gdy pierwotnie pisano to porównanie.
Sedno sprawy
Gemini 3.5 Flash-Lite vs Qwen 3.8To kiedyś było porównaniem produktu z ogłoszeniem. Już nim nie jest. Od 3 sierpnia 2026 r. Qwen3.8-Max jest ogólnie dostępny, ma cenę, jest samoobsługowy i udokumentowany — więc uczciwe ujęcie to decyzja o poziomie, a nie o gotowości.
Flash-Lite{{1}} pozostaje właściwym domyślnym wyborem do zadań, do których został stworzony:{{/1}} przy cenie 0,30 / 2,50 USD{{2}} i ~490 tokenach na sekundę{{/2}} działa na każdym żądaniu za ułamek kosztów,{{3}} a jego audytowany indeks 36 jest w pełni wystarczający do klasyfikacji, routingu i ekstrakcji.{{/3}} Qwen3.8-Max{{4}} to wyższy poziom eskalacji{{/4}} — kontekst ryczałtowy na milion tokenów, natywne wejście obrazu i wideo oraz deklarowane zaawansowane rozumowanie{{5}} — przy mniej więcej 6,7× wyższym koszcie wejścia.{{/5}} Jego jedyną nierozwiązaną słabością{{6}} pozostaje to samo, co wcześniej:{{/6}} żaden niezależny ewaluator nie wystawił mu oceny,{{7}} więc jego jakość opiera się wyłącznie na tabeli samego Alibaby.{{/7}} Należy wypatrywać pierwszej niezależnej oceny Intelligence Index{{8}} oraz wag Qwen3.8-27B,{{/8}} które będą konkurować znacznie bezpośredniej z niszą Flash-Lite.{{9}} W międzyczasie wybór powinien zależeć od charakteru obciążenia —{{/9}} i warto rozważyć uruchomienie obu modeli.{{10}}

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
