Wygenerowana redakcyjna karta hero zatytułowana „Ling-3.1-flash vs Gemini 3.8 Flash” z podtytułem „Darmowy okres próbny 256K kontra produkcyjne API o 1 mln tokenów”. Dwa wiersze porównania brzmią: „Ling-3.1-flash: darmowy dwutygodniowy okres próbny, kontekst 262 144 tokenów, nie opublikowano wag” oraz „Gemini 3.8 Flash: $0.75 / $3.75 za 1 mln tokenów, kontekst 1 048 576 tokenów, wejście multimodalne”, nad stopką o treści: „Dane Ling podane przez dostawcę; dane Gemini według OrcaRouter i Artificial Analysis.”
Guides & Insights

Ling-3.1-flash vs Gemini 3.8 Flash: model próbny 256K kontra działający model 1M-tokenowy

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Postaw Ling-3.1-flash i Gemini 3.8 Flash obok siebie, a ta rozbieżność nie dotyczy inteligencji — dotyczy stanu. Ling-3.1-flash, ogłoszony 29–30 września 2026 r. przez Ant Group model typu mixture-of-experts o ok. 560 mld parametrów, to bezpłatny dwutygodniowy test z obsługiwanym kontekstem 256K, limitem wyjścia 32 768 tokenów, wejściem tylko tekstowym oraz bez publikowanych wag, licencji ani ceny. Gemini 3.8 Flash, wydany 2 września 2026 r. model rozumujący klasy Flash od Google, to ogólnodostępne API z pełnym oknem 1 048 576 tokenów, wyjściem 65 536 tokenów, wejściem multimodalnym i publicznym cennikiem. Na papierze to porównanie dwóch modeli; w praktyce to porównanie modelu, na którym możesz budować już dziś, z takim, który możesz tylko testować w tym miesiącu.

To nie jest powód, by odrzucać Ling-3.1-flash. Darmowy MoE 560B z zacięciem agentowym jest wart dwóch tygodni, które każdy poświęciłby na jego ocenę. Ale zmienia to, czemu służy bezpośrednie porównanie: nie „co powinienem przyjąć jako standard”, lecz „czy model próbny jest wystarczająco dobry, żebym już teraz zabezpieczył się na wypadek tego, jaka będzie odpowiedź za piętnaście dni”. To są różne pytania i mają różne odpowiedzi na każdej z poniższych osi.

Trzy rzeczy, które przesądzają o tym, zanim zrobi to jakikolwiek benchmark

Większość porównań zaczyna się od wyników. To powinno zacząć się od dostępności, ponieważ różnica w tym zakresie nie jest kwestią stopnia.

• Cennik — Ling-3.1-flash jest bezpłatny przez czas trwania okresu próbnego i nie ma w ogóle opublikowanego cennika po okresie próbnym. Gemini 3.8 Flash ma cenę katalogową $0,75 za milion tokenów wejściowych i $3,75 za milion tokenów wyjściowych w okresie promocyjnym, a od 1 stycznia 2027 r. cena wraca do $1,50 / $7,50. Ceny katalogowe podane przez dostawcę; obie mogą ulec zmianie.

• Kontekst — Ling-3.1-flash oferuje 262 144 tokeny w wersji próbnej, a 1 000 000 podano jako docelową wartość. Gemini 3.8 Flash oferuje obecnie pełne 1 048 576 tokenów. Jeśli Twoje obciążenie zależy od okna miliona tokenów, tylko jeden z tych dwóch ma je teraz.

Wagi — Ling-3.1-flash nie ma żadnych opublikowanych: brak repozytorium, brak licencji, brak checkpointu, tylko deklarowana intencja udostępnienia jako open source po okresie próbnym. Gemini 3.8 Flash jest zamknięty i zawsze taki pozostanie, ale to zarządzane API, które możesz dziś wywołać bez niejasności.

Czytane razem, te trzy tworzą jedną tezę: sztandarowe zalety modelu Ling są albo promocyjne (bezpłatny), albo perspektywiczne (kontekst 1M, otwarte wagi), podczas gdy zalety modelu Gemini są kontraktowe. Ta asymetria przenika wszystko, co następuje.

Gdzie model Ling naprawdę wygrywa

Dwa miejsca, i oba są prawdziwe.

Pierwszym jest koszt podczas oceny. Dwutygodniowy bezpłatny okres próbny dla modelu tej wielkości to nie chwyt marketingowy, który można zbyć machnięciem ręki — to najtańszy sposób, aby sprawdzić, czy 560B mixture-of-experts radzi sobie z twoimi promptami. Gemini 3.8 Flash, niezależnie od ceny, nie jest darmowy, a poważna ocena obejmująca kilka tysięcy wywołań kosztuje realne pieniądze.

Drugi to trajektoria otwartości. Ling-3.1-flash jest następcą modelu, który rzeczywiście udostępnił wagi na licencji MIT, a Ant publicznie zapowiedział, że ten również zamierza udostępnić jako open source. Jeśli to zostanie wydane na permisywnej licencji, zyskujesz coś, czego Gemini 3.8 Flash nigdy nie zaoferuje: możliwość self-hostingu, dostrajania lub destylacji bazowego modelu 560B. Haczyk jest ten, który ma największe znaczenie — stawiasz na obietnicę, a obietnica poprzedniej generacji została dotrzymana z dwutygodniowym opóźnieniem, nie zaś jako gwarancja.

Gdzie Gemini 3.8 Flash nie jest blisko porażki

Pomijając proces i kwestię otwartości, porównanie operacyjne jest jednostronne na korzyść Google.

• Dane wejściowe — Gemini 3.8 Flash przyjmuje tekst, obraz, wideo, plik i dźwięk. Ling-3.1-flash przyjmuje tekst i zwraca tekst. W przypadku przepływów pracy z dokumentami, zrzutami ekranu lub wideo nie jest to preferencja, to granica możliwości.

• Limit wyjściowy — 65,536 tokenów w porównaniu z 32,768. Istotne w momencie, gdy generujesz raporty, pliki kodu lub długie ustrukturyzowane dane wyjściowe w jednym przebiegu.

Przepustowość — niezależne testy wskazują, że mediana prędkości wyjściowej Gemini 3.8 Flash wynosi blisko 249 tokenów na sekundę, a własna siedmiodniowa telemetria OrcaRouter mierzy 552 tokeny na sekundę przy p50 wynoszącym 4,95 sekundy do pierwszego tokena. Testowy hosting Ling-3.1-flash został podany jako osiągający około 63 tokenów na sekundę. Model Gemini należy do innej klasy szybkości.

• Głębokość referencyjna — Gemini 3.8 Flash ma za sobą szereg niezależnych pomiarów; liczby Ling-3.1-flash są w całości first-party, na zupełnie nowym endpoincie, a żadna strona trzecia jeszcze ich nie powtórzyła.

• Agenci multimodalni — wszystko, co musi odczytać zrzut ekranu, plik PDF lub nagrane połączenie, jest zadaniem dla Gemini z samego założenia, a nie ze względu na jakość.

Headless capture of the OrcaRouter model page for Gemini 3.8 Flash, model ID google/gemini-3.8-flash. It is marked FEATURED and credited to Google with a 2026-09-02 date, carries Vision, Audio, Tools, JSON and Reasoning capability chips, and describes the model as Google's most intelligent Flash model with significant gains over 3.7 Flash on software engineering, agentic tasks and multi-step reasoning. A stat strip reads input $0.75 and output $3.75 per 1M tokens, p50 time to first token 4.95 s, p95 10.00 s and 149.9M tokens of traffic over seven days; the pricing table lists $0.750 input, $3.75 output and $0.075 cache read per 1M tokens.

Benchmarki i dlaczego te dwa zestawy tak naprawdę nie są porównywalne

Podawany przez dostawcę wynik dla Ling-3.1-flash to łączny wynik 81,0 w pięciu benchmarkach agentowych: 40,4% w Terminal-Bench 4.0, 55,9% w SWE-Atlas i 65,35% w HealthBench Professional; własne dane Ant obejmują dodatkowo 1673 Elo w GDPVal-AA v2.1 i 75,16 w FrontierSWE. Każdy z tych wyników pochodzi z pomiaru samego Ant. Nie opublikowano żadnego harnessu, a co ważniejsze, żadnych wag, na których ktokolwiek mógłby ponownie uruchomić ten zestaw.

Przypadek Gemini 3.8 Flash jest jakościowo odmienny. W obecnej wersji Indeksu Inteligencji Artificial Analysis (v4.3.2) uzyskuje 40,9 przy wysokim wysiłku rozumowania, 39,8 przy średnim i 33,5 przy niskim — warto też zaznaczyć, że indeks został niedawno zrewidowany, więc liczby publikowane na temat tego modelu wcześniej jesienią obliczono na innej wersji i nie są bezpośrednio porównywalne z tymi. Same deklaracje Google dotyczące tego modelu obejmują 54,9 w HLE-Verified oraz mocne wyniki w Terminal-Bench 2.1 na poziomie górnych 80 punktów. Liczby niezależne i producenta, zestawione obok siebie, jedne i drugie wiarygodne, ale nie są wzajemnie wymienne.

Warto przeprowadzić jedno czyste porównanie krzyżowe, ponieważ oba należą do tej samej rodziny benchmarków. W Terminal-Bench 4.0 wartość podana przez dostawcę dla Ling-3.1-flash wynosi 40,4%. Claude Sonnet 5.5 — model średniej klasy, nie flagowy — uzyskuje 70,6% w tej samej wersji. Ten pojedynczy wiersz to najsilniejszy argument przeciwko odczytywaniu karty Ant jako „bliskiej czołówce”: model jest konkurencyjny w miarach agentowych, które Ant postanowił wyróżnić, i wyraźnie w tyle w mierze kodowania terminalowego, dla której istnieje zewnętrzna liczba.

Generated two-column scoreboard titled "Ling-3.1-flash vs Gemini 3.8 Flash - the scoreboard". The Ling-3.1-flash column reads Context 262,144, Output 32,768, Input text only, Price free trial, Weights none, Speed ~63 tok/s. The Gemini 3.8 Flash column reads Context 1,048,576, Output 65,536, Input text, image, audio, Price $0.75 / $3.75, Weights closed, Speed 552 tok/s. A footer reads "Ling figures vendor-reported; Gemini figures per OrcaRouter and Artificial Analysis."

Praktyczny kształt wyboru

Jeśli w ciągu najbliższych dwóch tygodni musisz coś zbudować, odpowiedź nie jest nawet bliska i nie jest to przytyk do Ling-3.1-flash. Gemini 3.8 Flash jest jedynym z tych dwóch, który daje ci stabilny endpoint, opublikowaną cenę, pełne okno miliona tokenów, wejście multimodalne i licencję, którą możesz przeczytać. To produkcyjny model klasy Flash.

Ling-3.1-flash jest obiektem ewaluacji. Jego wartość obecnie polega na tym, że ewaluacja jest darmowa, a model interesujący: MoE 560B z tylko ~25B aktywnymi na token to zakład na rzadkość, a Ant pozycjonuje go dokładnie pod obciążenia związane z agentami, wyszukiwaniem i automatyzacją biurową, o które konkurują modele klasy Flash. Przepuszczanie przez niego własnych promptów w oknie próbnym jest warte zachodu właśnie dlatego, że nikt poza Ant jeszcze tego nie zrobił — byłbyś wśród pierwszych z opinią niezależną od dostawcy.

Drzewo decyzyjne, które ma sens w tym miesiącu: skieruj produkcję do Gemini 3.8 Flash, poświęć darmowy okres próbny na uruchamianie Ling-3.1-flash na najtrudniejszych promptach, a kwestię otwartych wag potraktuj jako prawdziwe rozwidlenie. Jeśli wagi pojawią się na permisywnych warunkach, a cena wyląduje blisko poziomu Flash, Ling-3.1-flash stanie się prawdziwą drugą opcją — taką, którą możesz hostować samodzielnie, a którą Gemini nigdy nie będzie. Jeśli pojawią się z haczykami, okres próbny się kończy, a wraz z nim porównanie.

Uruchamianie obu z jednego klucza i mówienie wprost o tym, czego brakuje

Gemini 3.8 Flash jest od dziś dostępny w katalogu OrcaRouter pod identyfikatorem modelu google/gemini-3.8-flash, w cenie katalogowej samego Google, bez żadnej marży — więc gdy w styczniu promocyjna stawka wróci do poprzedniego poziomu, cena, którą tu płacisz, podąży za nią automatycznie, bez konieczności zawierania nowej umowy. DeepSeek-V4.1-Flash, drugi tani model klasy Flash, wart zmierzenia w tym samym eksperymencie, znajduje się w tym samym katalogu w cenie katalogowej swojego dostawcy, więc test trzech modeli porównujący model próbny ze sprawdzonymi opcjami klasy Flash działa za pomocą jednego klucza API z automatycznym przełączaniem awaryjnym między nimi.

Ling-3.1-flash nie znajduje się w naszym katalogu, a sprawdzenie w naszym publicznym API modeli zwraca wynik „not found” zarówno dla niego, jak i dla poprzedniej generacji — więc uczciwym ujęciem jest to, że okres próbny działa tam, gdzie działa: przez własny interfejs dostawcy i zewnętrzne platformy inferencyjne, a my nie twierdzimy, że go hostujemy. To właśnie ta część tego porównania może zmienić się najszybciej: model w darmowym okresie próbnym z nieogłoszoną ceną to dokładnie ten rodzaj rzeczy, który trafia do warstwy routingu w momencie, gdy Ant i jego hosty opublikują cennik, a przekazywanie bez marży oznacza, że w dniu, w którym to nastąpi, cena tutaj jest ceną tam.

A więc werdykt jest węższy, niż sugerują liczby parametrów. Ling-3.1-flash to model bardziej ambitny i ciekawszy wynik badawczy; Gemini 3.8 Flash to ten, na którym można oprzeć wdrożenie. Dopóki nie istnieje licencja i cena, na tym polega cała różnica — a nie jest to różnica, którą rozstrzygnie jeden wiersz benchmarku.

Headless capture of the Artificial Analysis page for Gemini 3.8 Flash (High), marked "Released September 2026". Summary tiles read Intelligence 41 (rank 50 of 224), Speed 248.5 output tokens per second (rank 4 of 224), Cost $1.24 per Intelligence Index task at $0.75 input and $3.75 output per 1M tokens with a 90% cache discount (rank 62 of 224), and Verbosity 170M output tokens (rank 96 of 224). The comparison summary states the model is notably fast but very verbose, takes text, image, speech and video input, outputs text, and has a 1M-token context window, and the page names the current Artificial Analysis Intelligence Index build as v4.3.2.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie