
Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite: Darmowe nie znaczy tanie, a dotychczasowy lider wciąż pozostaje bezpiecznym wyborem
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- qwenNOWOŚĆQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 586 tok/s
- orcaNOWOŚĆOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
- tencentTencent: Hy32026-07-0642Inteligencja59Kod
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencja42Kod
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencja39Kod
- anthropicAnthropic: Claude Sonnet 52026-06-3055Inteligencja72Kod
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencja52Kod57Matematyka
- z-aiZ.ai: GLM 5.22026-06-1653Inteligencja69Kod60Matematyka
„Free" to najdroższe słowo w słownictwie rynku modeli, bo zwykle oznacza, że ktoś zamierza obciążyć cię opłatą za coś innego niż cena z metki. To jest pułapka ukryta w zestawieniu pomiędzy Ling 3.0 Tiny, nowym modelem rozumowania MoE o 7,9 mld parametrów od Ant Group InclusionAI, a Gemini 3.5 Flash-Lite, najtańszym i najszybszym obecnym poziomem Gemini od Google. Ling 3.0 Tiny jest teraz darmowy w wywołaniach i po promocji z 14 sierpnia kosztuje 0,06 / 0,18 USD za milion tokenów — ale Artificial Analysis zmierzyło, że spaliło 210 mln tokenów wyjściowych tylko po to, by zdobyć wynik w swojej klasie 56 modeli, wobec mediany 63 mln, i oznaczyło go jako „bardzo gadatliwego". Gemini 3.5 Flash-Lite kosztuje pięć razy więcej za token — 0,30 / 2,50 USD — a jednak ma niezależny Intelligence Index równy 36 — o 13 punktów wyższy od Ling 3.0 Tiny — oraz prędkość generowania około 490 tokenów na sekundę. Tańsza metka, szybszy mówca i niższy wynik to ten sam model. To jest cała historia tego porównania i cały powód, by dwa razy się zastanowić, zanim automatycznie wybierzesz nowicjusza tylko ze względu na cenę.
Oba modele mieszczą się w segmencie budżetowym, ale znajdują się na różnych etapach jego cyklu życia. Gemini 3.5 Flash-Lite to dojrzały lider: wydany 21 lipca 2026 roku, na bieżąco mierzony przez niezależną stronę trzecią i powszechnie wdrażany jako domyślny poziom dla pracy agentowej o dużej skali i wrażliwej na opóźnienia. Ling 3.0 Tiny ma tydzień, jest wyceniony tak, aby pozyskać użytkowników, i został oceniony dokładnie raz. Ten artykuł oddziela to, czym każdy model faktycznie jest, co mówią niezależne liczby i dlaczego cena „free" jest najmniej użyteczną liczbą w tym porównaniu.
Ling 3.0 Tiny, nowość z miernikiem
Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.
The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Gemini 3.5 Flash-Lite, obecny lider
Gemini 3.5 Flash-Lite to odpowiedź Google na to samo pytanie, wydany o jeden poziom niżej w linii Gemini 3.5. Jest natywnie multimodalny na wejściu — tekst, obrazy, wideo, audio i pliki — z wyjściem tekstowym, oknem kontekstowym o pojemności 1M tokenów, do 64K tokenów wyjściowych i konfigurowalnym poziomem rozumowania (minimalnym, niskim, wyższym), dzięki czemu potok może regulować głębokość i rachunek dla każdego żądania. Jego niezależny wynik to prawdziwy skok pokoleniowy: indeks inteligencji Artificial Analysis 36, miejsce #12 spośród 151 śledzonych modeli, wzrost z 25 dla Gemini 3.1 Flash-Lite. Pod względem szybkości jest to najszybszy model w serii 3.5 — Google podawał 350 tokenów wyjściowych na sekundę w momencie premiery, a strona AA na żywo zmierzyła około 490 tokenów na sekundę, plasując go na #2 wśród śledzonych modeli. Deklarowane przez producenta wyniki agentowe — 74,0% w OSWorld-Verified, 54% w Terminal-Bench 2.1, 72,2% w teście wieloigłowego wyszukiwania z kontekstem 128K — to własne dane Google o charakterze orientacyjnym, a nie wyrocznia, a jedna otwarta kwestia (computer-use wymienione jako wbudowane na blogu Google, ale nieobsługiwane w dokumentacji API) jest warta sprawdzenia, zanim zaczniesz na niej polegać.
Jest to również, w przeliczeniu na token, nietanie jak na swoją półkę cenową. Nazwa „Lite” opisuje miejsce modelu w ofercie, a nie spadającą cenę katalogową: Gemini 2.5 Flash-Lite kosztował $0.10 / $0.40, 3.1 Flash-Lite kosztował $0.25 / $1.50, a 3.5 Flash-Lite kosztuje $0.30 / $2.50 za milion tokenów, przy cenie odczytu z pamięci podręcznej wynoszącej $0.03. Przewaga w wydajności wynika z szybkości i ekonomii tokenów, a własne pomiary Artificial Analysis pokazują, że rzeczywisty koszt na zadanie mniej więcej podwajał się z generacji na generację, podczas gdy czas na zadanie zmniejszył się o połowę.
Niezależna tablica wyników, czytana w kontekście
Umieść oba modele na tym samym indeksie, a różnica jest uderzająca: Gemini 3.5 Flash-Lite ma 36, Ling 3.0 Tiny 23. Ale to porównanie z nagłówka to tylko połowa obrazu, ponieważ oba modele nie są oceniane w tym samym polu. AA plasuje Ling 3.0 Tiny na 6. miejscu z 56 w swojej klasie modeli tiny, przy medianie klasy wynoszącej 8 — znacznie powyżej średniej dla modelu tej wielkości. Gemini 3.5 Flash-Lite zajmuje 12. miejsce z 151 w szerszym monitorowanym polu. Jeden to wyjątkowy model tiny; drugi to solidny model budżetowy w otwartej puli. Oba stwierdzenia są prawdziwe i oznaczają różne rzeczy. Ling 3.0 Tiny oferuje lepszy stosunek jakości do ceny w swojej klasie wielkości niż Gemini 3.5 Flash-Lite w swojej kategorii — a Gemini 3.5 Flash-Lite wciąż pozostaje modelem o znacznie większych możliwościach w tej samej niezależnej skali.

Wymiary, każdy w osobnej linii:
• Wynik niezależny — Ling 3.0 Tiny AA Index 23 (#6/56, mediana klasy 8) vs Gemini 3.5 Flash-Lite AA Index 36 (#12/151).
• Cena — Ling 3.0 Tiny $0.06 / $0.18 za 1M po darmowej promocji vs Gemini 3.5 Flash-Lite $0.30 / $2.50 za 1M (cached input $0.03).
• Rozwlekłość — Ling 3.0 Tiny: 210M tokenów wyjściowych w przebiegu indeksowania, natomiast Gemini 3.5 Flash-Lite: zmierzona, ale nie rozwlekła według tego wskaźnika.
• Modalność — Ling 3.0 Tiny: tylko tekst vs Gemini 3.5 Flash-Lite: tekst, obraz, wideo, audio i pliki.
• Kontekst — 256K w Ling 3.0 Tiny vs 1M w Gemini 3.5 Flash-Lite, z maksymalnym wyjściem 64K w obu.
• Prędkość — Ling 3.0 Tiny ~90–264 tokenów/s w punktach końcowych, które opublikowały liczby, vs Gemini 3.5 Flash-Lite ~490 tokenów/s w pomiarze na żywo AA.
Wiersz szybkości to ten, który najprawdopodobniej ulegnie zmianie. Szybkość generowania modelu Ling 3.0 Tiny jest faktycznie nierozstrzygnięta: Artificial Analysis podaje N/A, a Vercel deklaruje 264 tokeny na sekundę. Wynik ~490 tokenów na sekundę dla Gemini 3.5 Flash-Lite to pomiar AA na żywo, wykonany na długo po tym, jak opadły wahania po jego premierze. Dla warstwy wrażliwej na opóźnienia to różnica między znaną wartością a otwartym pytaniem.
Ekonomia gadatliwości: dlaczego darmowe nie jest tanie
Oto arytmetyka, która zwykle rozstrzyga to porównanie. Uruchom to samo zadanie wymagające intensywnego rozumowania — powiedzmy 4000 tokenów wejściowych i 2000 tokenów wyjściowych — na obu modelach po zakończeniu promocji Ling 3.0 Tiny. Ling 3.0 Tiny nalicza (4000 × $0,06 + 2000 × $0,18) / 1 000 000, czyli około $0,0006. Gemini 3.5 Flash-Lite nalicza (4000 × $0,30 + 2000 × $2,50) / 1 000 000, czyli około $0,0062. Przy identycznej liczbie tokenów Ling 3.0 Tiny jest 10 razy tańszy. Potem dochodzi rozwlekłość: model rozumujący, który generuje tokeny myślenia na wyjściu, nie produkuje identycznej liczby tokenów. Jeśli stosunek rozwlekłości Ling 3.0 Tiny 210M do 63M utrzyma się przy Twoim obciążeniu, efektywny koszt na zadanie mniej więcej się potraja po stronie wyjściowej, a przewaga 10× kurczy się do około 3–4×. Wciąż taniej — ale już nie za darmo i nie w tej samej lidze, na jaką wskazuje liczba 210M.
Uczciwe ujęcie jest takie, że te dwa modele nie są substytutami na tym samym poziomie jakości. Wynik 23 modelu Ling 3.0 Tiny to wyjątkowy rezultat jak na model z 1,3 mld aktywnych parametrów; wynik 36 modelu Gemini 3.5 Flash-Lite to zupełnie inna liga możliwości, do tego wizja, kontekst 1M i sprawdzona szybkość. Za tę różnicę płacisz — pięciokrotnie wyższą cenę za token i więcej za zadanie, gdy uwzględnisz różnice w szybkości — ale to realna różnica możliwości, a nie marketingowa. Jeśli Twoje obciążenie może się zadowolić jakością tańszego modelu, Ling 3.0 Tiny jest lepszą wartością. Jeśli Twoje obciążenie wymaga tych możliwości, żadna przewaga cenowa nie zniweluje tej luki.
Gdzie router udowadnia swoją rację bytu
To jest dokładnie taki typ obciążenia, w którym warstwa routingu bije postawienie na jeden model, a realia hostingowe mają znaczenie dla tego, jak to zbudujesz. Gemini 3.5 Flash-Lite jest już dostępny na OrcaRouter w cenie listowej swojego dostawcy — 0,30 USD za 1M tokenów wejściowych / 2,50 USD za 1M tokenów wyjściowych, przekazywane dalej z 0% marżą, więc stawka z cennika Google jest taka sama jak u nas, a każda przyszła obniżka cen wejdzie w życie tego samego dnia. Jest dostępny za pośrednictwem tego samego zgodnego z OpenAI punktu końcowego, co ponad 200 innych modeli, z automatycznym przełączaniem awaryjnym między dostawcami na wypadek, gdyby dostawca bazowy zaczął zawodzić w trakcie działania, a DSL routingu może wysłać prompt do kilku modeli i zachować najlepszą odpowiedź.
Ling 3.0 Tiny nie jest w OrcaRouter; jest obsługiwany przez własne punkty końcowe, dziś za darmo. To połączenie sprawia, że argument za routingiem jest silniejszy, a nie słabszy. Wykorzystaj darmowe okno, aby porównać Ling 3.0 Tiny z własnym ruchem, zanim zacznie kosztować. Następnie zbuduj ścieżkę produkcyjną na warstwie hostingowej — Gemini 3.5 Flash-Lite do wywołań wymagających widzenia, długiego kontekstu lub ustalonego profilu prędkości, a warstwa routingu może swobodnie eskalować do droższego modelu dla trudnej mniejszości. Darmowa warstwa to świetny eksperyment i krucha zależność; warstwa hostingowa to coś, na czym można zbudować produkt. W OrcaRouter możesz uruchomić oba w tym samym grafie — Ling 3.0 Tiny przez bezpośredni punkt końcowy, Gemini 3.5 Flash-Lite przez klucz — i pozwolić routerowi decydować na każde żądanie.

Werdykt
Jeśli wybierasz między tymi dwoma i nie używasz ich razem, decyzja jest łatwa do sformułowania, ale trudna do zaakceptowania. Ling 3.0 Tiny to lepsza oferta i słabszy model: tygodniowy, tekstowy model rozumowania z doskonałym wynikiem jak na swój rozmiar, agresywną ceną i nierozstrzygniętą kwestią szybkości i rozwlekłości — wart natychmiastowego przetestowania w bezpłatnym okresie próbnym i warto wiedzieć, że od 14 sierpnia będzie rozliczany. Gemini 3.5 Flash-Lite to bezpieczniejsza domyślna opcja produkcyjna: w niezależnych testach uzyskał o 13 punktów wyższą ocenę, jest multimodalny, ma kontekst 1M, jest pięciokrotnie szybszy według ugruntowanych pomiarów i odpowiednio wyceniony. Bezpłatne nie znaczy tanie, gdy model mówi trzy razy więcej, aby myśleć, przy niższym pułapie możliwości — a dotychczasowy lider jest bezpiecznym wyborem nie bez powodu.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
