Karta tytułowa hero dla 'Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite' z podtytułem 'Darmowe nie znaczy tanie — dotychczasowy lider to wciąż bezpieczny wybór' oraz dwiema kartami statystyk: Ling 3.0 Tiny (AA Index 23, bardzo gadatliwy, darmowy do 14 sierpnia) i Gemini 3.5 Flash-Lite (AA Index 36, ~490 tok/s, $0.30 / $2.50). Logo OrcaRouter umieszczone w prawym dolnym rogu.
Guides & Insights

Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite: Darmowe nie znaczy tanie, a dotychczasowy lider wciąż pozostaje bezpiecznym wyborem

Autor

Jim Song

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

„Free" to najdroższe słowo w słownictwie rynku modeli, bo zwykle oznacza, że ktoś zamierza obciążyć cię opłatą za coś innego niż cena z metki. To jest pułapka ukryta w zestawieniu pomiędzy Ling 3.0 Tiny, nowym modelem rozumowania MoE o 7,9 mld parametrów od Ant Group InclusionAI, a Gemini 3.5 Flash-Lite, najtańszym i najszybszym obecnym poziomem Gemini od Google. Ling 3.0 Tiny jest teraz darmowy w wywołaniach i po promocji z 14 sierpnia kosztuje 0,06 / 0,18 USD za milion tokenów — ale Artificial Analysis zmierzyło, że spaliło 210 mln tokenów wyjściowych tylko po to, by zdobyć wynik w swojej klasie 56 modeli, wobec mediany 63 mln, i oznaczyło go jako „bardzo gadatliwego". Gemini 3.5 Flash-Lite kosztuje pięć razy więcej za token — 0,30 / 2,50 USD — a jednak ma niezależny Intelligence Index równy 36 — o 13 punktów wyższy od Ling 3.0 Tiny — oraz prędkość generowania około 490 tokenów na sekundę. Tańsza metka, szybszy mówca i niższy wynik to ten sam model. To jest cała historia tego porównania i cały powód, by dwa razy się zastanowić, zanim automatycznie wybierzesz nowicjusza tylko ze względu na cenę.

Oba modele mieszczą się w segmencie budżetowym, ale znajdują się na różnych etapach jego cyklu życia. Gemini 3.5 Flash-Lite to dojrzały lider: wydany 21 lipca 2026 roku, na bieżąco mierzony przez niezależną stronę trzecią i powszechnie wdrażany jako domyślny poziom dla pracy agentowej o dużej skali i wrażliwej na opóźnienia. Ling 3.0 Tiny ma tydzień, jest wyceniony tak, aby pozyskać użytkowników, i został oceniony dokładnie raz. Ten artykuł oddziela to, czym każdy model faktycznie jest, co mówią niezależne liczby i dlaczego cena „free" jest najmniej użyteczną liczbą w tym porównaniu.

Ling 3.0 Tiny, nowość z miernikiem

Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.

The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Screenshot of the Artificial Analysis page for Ling 3.0 Tiny, showing an Intelligence Index of 23, price $0.00 / $0.00 on the free tier, a 210M-token verbosity read versus a 63M median, and output speed listed as N/A. REUSED from the what-is-ling-3-0-tiny explainer (audited).

Gemini 3.5 Flash-Lite, obecny lider

Gemini 3.5 Flash-Lite to odpowiedź Go​ogle na to samo pytanie, wydany o jeden poziom niżej w linii Gemini 3.5. Jest natywnie multimodalny na wejściu — tekst, obrazy, wideo, audio i pliki — z wyjściem tekstowym, oknem kontekstowym o pojemności 1M tokenów, do 64K tokenów wyjściowych i konfigurowalnym poziomem rozumowania (minimalnym, niskim, wyższym), dzięki czemu potok może regulować głębokość i rachunek dla każdego żądania. Jego niezależny wynik to prawdziwy skok pokoleniowy: indeks inteligencji Artificial Analysis 36, miejsce #12 spośród 151 śledzonych modeli, wzrost z 25 dla Gemini 3.1 Flash-Lite. Pod względem szybkości jest to najszybszy model w serii 3.5 — Go​ogle podawał 350 tokenów wyjściowych na sekundę w momencie premiery, a strona AA na żywo zmierzyła około 490 tokenów na sekundę, plasując go na #2 wśród śledzonych modeli. Deklarowane przez producenta wyniki agentowe — 74,0% w OSWorld-Verified, 54% w Terminal-Bench 2.1, 72,2% w teście wieloigłowego wyszukiwania z kontekstem 128K — to własne dane Go​ogle o charakterze orientacyjnym, a nie wyrocznia, a jedna otwarta kwestia (computer-use wymienione jako wbudowane na blogu Go​ogle, ale nieobsługiwane w dokumentacji API) jest warta sprawdzenia, zanim zaczniesz na niej polegać.

Jest to również, w przeliczeniu na token, nietanie jak na swoją półkę cenową. Nazwa „Lite” opisuje miejsce modelu w ofercie, a nie spadającą cenę katalogową: Gemini 2.5 Flash-Lite kosztował $0.10 / $0.40, 3.1 Flash-Lite kosztował $0.25 / $1.50, a 3.5 Flash-Lite kosztuje $0.30 / $2.50 za milion tokenów, przy cenie odczytu z pamięci podręcznej wynoszącej $0.03. Przewaga w wydajności wynika z szybkości i ekonomii tokenów, a własne pomiary Artificial Analysis pokazują, że rzeczywisty koszt na zadanie mniej więcej podwajał się z generacji na generację, podczas gdy czas na zadanie zmniejszył się o połowę.

Niezależna tablica wyników, czytana w kontekście

Umieść oba modele na tym samym indeksie, a różnica jest uderzająca: Gemini 3.5 Flash-Lite ma 36, Ling 3.0 Tiny 23. Ale to porównanie z nagłówka to tylko połowa obrazu, ponieważ oba modele nie są oceniane w tym samym polu. AA plasuje Ling 3.0 Tiny na 6. miejscu z 56 w swojej klasie modeli tiny, przy medianie klasy wynoszącej 8 — znacznie powyżej średniej dla modelu tej wielkości. Gemini 3.5 Flash-Lite zajmuje 12. miejsce z 151 w szerszym monitorowanym polu. Jeden to wyjątkowy model tiny; drugi to solidny model budżetowy w otwartej puli. Oba stwierdzenia są prawdziwe i oznaczają różne rzeczy. Ling 3.0 Tiny oferuje lepszy stosunek jakości do ceny w swojej klasie wielkości niż Gemini 3.5 Flash-Lite w swojej kategorii — a Gemini 3.5 Flash-Lite wciąż pozostaje modelem o znacznie większych możliwościach w tej samej niezależnej skali.

Comparison scoreboard for Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite. Left column Ling 3.0 Tiny: AA 23, $0.06 / $0.18 after promo, 210M output tokens, text-only, 256K context, speed N/A (Vercel 264 tok/s). Right column Gemini 3.5 Flash-Lite: AA 36, $0.30 / $2.50, 43M output tokens, text + image + video + audio, 1M context, ~490 tok/s (AA). Footer: 'Both models per Artificial Analysis.' OrcaRouter logo composited bottom-right.

Wymiary, każdy w osobnej linii:

• Wynik niezależny — Ling 3.0 Tiny AA Index 23 (#6/56, mediana klasy 8) vs Gemini 3.5 Flash-Lite AA Index 36 (#12/151).

• Cena — Ling 3.0 Tiny $0.06 / $0.18 za 1M po darmowej promocji vs Gemini 3.5 Flash-Lite $0.30 / $2.50 za 1M (cached input $0.03).

• Rozwlekłość — Ling 3.0 Tiny: 210M tokenów wyjściowych w przebiegu indeksowania, natomiast Gemini 3.5 Flash-Lite: zmierzona, ale nie rozwlekła według tego wskaźnika.

• Modalność — Ling 3.0 Tiny: tylko tekst vs Gemini 3.5 Flash-Lite: tekst, obraz, wideo, audio i pliki.

• Kontekst — 256K w Ling 3.0 Tiny vs 1M w Gemini 3.5 Flash-Lite, z maksymalnym wyjściem 64K w obu.

• Prędkość — Ling 3.0 Tiny ~90–264 tokenów/s w punktach końcowych, które opublikowały liczby, vs Gemini 3.5 Flash-Lite ~490 tokenów/s w pomiarze na żywo AA.

Wiersz szybkości to ten, który najprawdopodobniej ulegnie zmianie. Szybkość generowania modelu Ling 3.0 Tiny jest faktycznie nierozstrzygnięta: Artificial Analysis podaje N/A, a Vercel deklaruje 264 tokeny na sekundę. Wynik ~490 tokenów na sekundę dla Gemini 3.5 Flash-Lite to pomiar AA na żywo, wykonany na długo po tym, jak opadły wahania po jego premierze. Dla warstwy wrażliwej na opóźnienia to różnica między znaną wartością a otwartym pytaniem.

Ekonomia gadatliwości: dlaczego darmowe nie jest tanie

Oto arytmetyka, która zwykle rozstrzyga to porównanie. Uruchom to samo zadanie wymagające intensywnego rozumowania — powiedzmy 4000 tokenów wejściowych i 2000 tokenów wyjściowych — na obu modelach po zakończeniu promocji Ling 3.0 Tiny. Ling 3.0 Tiny nalicza (4000 × $0,06 + 2000 × $0,18) / 1 000 000, czyli około $0,0006. Gemini 3.5 Flash-Lite nalicza (4000 × $0,30 + 2000 × $2,50) / 1 000 000, czyli około $0,0062. Przy identycznej liczbie tokenów Ling 3.0 Tiny jest 10 razy tańszy. Potem dochodzi rozwlekłość: model rozumujący, który generuje tokeny myślenia na wyjściu, nie produkuje identycznej liczby tokenów. Jeśli stosunek rozwlekłości Ling 3.0 Tiny 210M do 63M utrzyma się przy Twoim obciążeniu, efektywny koszt na zadanie mniej więcej się potraja po stronie wyjściowej, a przewaga 10× kurczy się do około 3–4×. Wciąż taniej — ale już nie za darmo i nie w tej samej lidze, na jaką wskazuje liczba 210M.

Uczciwe ujęcie jest takie, że te dwa modele nie są substytutami na tym samym poziomie jakości. Wynik 23 modelu Ling 3.0 Tiny to wyjątkowy rezultat jak na model z 1,3 mld aktywnych parametrów; wynik 36 modelu Gemini 3.5 Flash-Lite to zupełnie inna liga możliwości, do tego wizja, kontekst 1M i sprawdzona szybkość. Za tę różnicę płacisz — pięciokrotnie wyższą cenę za token i więcej za zadanie, gdy uwzględnisz różnice w szybkości — ale to realna różnica możliwości, a nie marketingowa. Jeśli Twoje obciążenie może się zadowolić jakością tańszego modelu, Ling 3.0 Tiny jest lepszą wartością. Jeśli Twoje obciążenie wymaga tych możliwości, żadna przewaga cenowa nie zniweluje tej luki.

Gdzie router udowadnia swoją rację bytu

To jest dokładnie taki typ obciążenia, w którym warstwa routingu bije postawienie na jeden model, a realia hostingowe mają znaczenie dla tego, jak to zbudujesz. Gemini 3.5 Flash-Lite jest już dostępny na OrcaRouter w cenie listowej swojego dostawcy — 0,30 USD za 1M tokenów wejściowych / 2,50 USD za 1M tokenów wyjściowych, przekazywane dalej z 0% marżą, więc stawka z cennika Go​ogle jest taka sama jak u nas, a każda przyszła obniżka cen wejdzie w życie tego samego dnia. Jest dostępny za pośrednictwem tego samego zgodnego z OpenAI punktu końcowego, co ponad 200 innych modeli, z automatycznym przełączaniem awaryjnym między dostawcami na wypadek, gdyby dostawca bazowy zaczął zawodzić w trakcie działania, a DSL routingu może wysłać prompt do kilku modeli i zachować najlepszą odpowiedź.

Ling 3.0 Tiny nie jest w OrcaRouter; jest obsługiwany przez własne punkty końcowe, dziś za darmo. To połączenie sprawia, że argument za routingiem jest silniejszy, a nie słabszy. Wykorzystaj darmowe okno, aby porównać Ling 3.0 Tiny z własnym ruchem, zanim zacznie kosztować. Następnie zbuduj ścieżkę produkcyjną na warstwie hostingowej — Gemini 3.5 Flash-Lite do wywołań wymagających widzenia, długiego kontekstu lub ustalonego profilu prędkości, a warstwa routingu może swobodnie eskalować do droższego modelu dla trudnej mniejszości. Darmowa warstwa to świetny eksperyment i krucha zależność; warstwa hostingowa to coś, na czym można zbudować produkt. W OrcaRouter możesz uruchomić oba w tym samym grafie — Ling 3.0 Tiny przez bezpośredni punkt końcowy, Gemini 3.5 Flash-Lite przez klucz — i pozwolić routerowi decydować na każde żądanie.

Screenshot of the OrcaRouter model page for Gemini 3.5 Flash-Lite (google/gemini-3.5-flash-lite) showing $0.30 input / $2.50 output per 1M tokens, a 1M-token context, up to 64K max output, multimodal text + image + video + file + audio input, and a p50 time-to-first-token of 819ms over the last 7 days. Fresh Edge-headless capture, audited.

Werdykt

Jeśli wybierasz między tymi dwoma i nie używasz ich razem, decyzja jest łatwa do sformułowania, ale trudna do zaakceptowania. Ling 3.0 Tiny to lepsza oferta i słabszy model: tygodniowy, tekstowy model rozumowania z doskonałym wynikiem jak na swój rozmiar, agresywną ceną i nierozstrzygniętą kwestią szybkości i rozwlekłości — wart natychmiastowego przetestowania w bezpłatnym okresie próbnym i warto wiedzieć, że od 14 sierpnia będzie rozliczany. Gemini 3.5 Flash-Lite to bezpieczniejsza domyślna opcja produkcyjna: w niezależnych testach uzyskał o 13 punktów wyższą ocenę, jest multimodalny, ma kontekst 1M, jest pięciokrotnie szybszy według ugruntowanych pomiarów i odpowiednio wyceniony. Bezpłatne nie znaczy tanie, gdy model mówi trzy razy więcej, aby myśleć, przy niższym pułapie możliwości — a dotychczasowy lider jest bezpiecznym wyborem nie bez powodu.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube