
Ling-3.1-flash vs Gemini 3.8 Flash: model próbny 256K kontra działający model 1M-tokenowy
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 219 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Postaw Ling-3.1-flash i Gemini 3.8 Flash obok siebie, a ta rozbieżność nie dotyczy inteligencji — dotyczy stanu. Ling-3.1-flash, ogłoszony 29–30 września 2026 r. przez Ant Group model typu mixture-of-experts o ok. 560 mld parametrów, to bezpłatny dwutygodniowy test z obsługiwanym kontekstem 256K, limitem wyjścia 32 768 tokenów, wejściem tylko tekstowym oraz bez publikowanych wag, licencji ani ceny. Gemini 3.8 Flash, wydany 2 września 2026 r. model rozumujący klasy Flash od Google, to ogólnodostępne API z pełnym oknem 1 048 576 tokenów, wyjściem 65 536 tokenów, wejściem multimodalnym i publicznym cennikiem. Na papierze to porównanie dwóch modeli; w praktyce to porównanie modelu, na którym możesz budować już dziś, z takim, który możesz tylko testować w tym miesiącu.
To nie jest powód, by odrzucać Ling-3.1-flash. Darmowy MoE 560B z zacięciem agentowym jest wart dwóch tygodni, które każdy poświęciłby na jego ocenę. Ale zmienia to, czemu służy bezpośrednie porównanie: nie „co powinienem przyjąć jako standard”, lecz „czy model próbny jest wystarczająco dobry, żebym już teraz zabezpieczył się na wypadek tego, jaka będzie odpowiedź za piętnaście dni”. To są różne pytania i mają różne odpowiedzi na każdej z poniższych osi.
Trzy rzeczy, które przesądzają o tym, zanim zrobi to jakikolwiek benchmark
Większość porównań zaczyna się od wyników. To powinno zacząć się od dostępności, ponieważ różnica w tym zakresie nie jest kwestią stopnia.
• Cennik — Ling-3.1-flash jest bezpłatny przez czas trwania okresu próbnego i nie ma w ogóle opublikowanego cennika po okresie próbnym. Gemini 3.8 Flash ma cenę katalogową $0,75 za milion tokenów wejściowych i $3,75 za milion tokenów wyjściowych w okresie promocyjnym, a od 1 stycznia 2027 r. cena wraca do $1,50 / $7,50. Ceny katalogowe podane przez dostawcę; obie mogą ulec zmianie.
• Kontekst — Ling-3.1-flash oferuje 262 144 tokeny w wersji próbnej, a 1 000 000 podano jako docelową wartość. Gemini 3.8 Flash oferuje obecnie pełne 1 048 576 tokenów. Jeśli Twoje obciążenie zależy od okna miliona tokenów, tylko jeden z tych dwóch ma je teraz.
Wagi — Ling-3.1-flash nie ma żadnych opublikowanych: brak repozytorium, brak licencji, brak checkpointu, tylko deklarowana intencja udostępnienia jako open source po okresie próbnym. Gemini 3.8 Flash jest zamknięty i zawsze taki pozostanie, ale to zarządzane API, które możesz dziś wywołać bez niejasności.
Czytane razem, te trzy tworzą jedną tezę: sztandarowe zalety modelu Ling są albo promocyjne (bezpłatny), albo perspektywiczne (kontekst 1M, otwarte wagi), podczas gdy zalety modelu Gemini są kontraktowe. Ta asymetria przenika wszystko, co następuje.
Gdzie model Ling naprawdę wygrywa
Dwa miejsca, i oba są prawdziwe.
Pierwszym jest koszt podczas oceny. Dwutygodniowy bezpłatny okres próbny dla modelu tej wielkości to nie chwyt marketingowy, który można zbyć machnięciem ręki — to najtańszy sposób, aby sprawdzić, czy 560B mixture-of-experts radzi sobie z twoimi promptami. Gemini 3.8 Flash, niezależnie od ceny, nie jest darmowy, a poważna ocena obejmująca kilka tysięcy wywołań kosztuje realne pieniądze.
Drugi to trajektoria otwartości. Ling-3.1-flash jest następcą modelu, który rzeczywiście udostępnił wagi na licencji MIT, a Ant publicznie zapowiedział, że ten również zamierza udostępnić jako open source. Jeśli to zostanie wydane na permisywnej licencji, zyskujesz coś, czego Gemini 3.8 Flash nigdy nie zaoferuje: możliwość self-hostingu, dostrajania lub destylacji bazowego modelu 560B. Haczyk jest ten, który ma największe znaczenie — stawiasz na obietnicę, a obietnica poprzedniej generacji została dotrzymana z dwutygodniowym opóźnieniem, nie zaś jako gwarancja.
Gdzie Gemini 3.8 Flash nie jest blisko porażki
Pomijając proces i kwestię otwartości, porównanie operacyjne jest jednostronne na korzyść Google.
• Dane wejściowe — Gemini 3.8 Flash przyjmuje tekst, obraz, wideo, plik i dźwięk. Ling-3.1-flash przyjmuje tekst i zwraca tekst. W przypadku przepływów pracy z dokumentami, zrzutami ekranu lub wideo nie jest to preferencja, to granica możliwości.
• Limit wyjściowy — 65,536 tokenów w porównaniu z 32,768. Istotne w momencie, gdy generujesz raporty, pliki kodu lub długie ustrukturyzowane dane wyjściowe w jednym przebiegu.
Przepustowość — niezależne testy wskazują, że mediana prędkości wyjściowej Gemini 3.8 Flash wynosi blisko 249 tokenów na sekundę, a własna siedmiodniowa telemetria OrcaRouter mierzy 552 tokeny na sekundę przy p50 wynoszącym 4,95 sekundy do pierwszego tokena. Testowy hosting Ling-3.1-flash został podany jako osiągający około 63 tokenów na sekundę. Model Gemini należy do innej klasy szybkości.
• Głębokość referencyjna — Gemini 3.8 Flash ma za sobą szereg niezależnych pomiarów; liczby Ling-3.1-flash są w całości first-party, na zupełnie nowym endpoincie, a żadna strona trzecia jeszcze ich nie powtórzyła.
• Agenci multimodalni — wszystko, co musi odczytać zrzut ekranu, plik PDF lub nagrane połączenie, jest zadaniem dla Gemini z samego założenia, a nie ze względu na jakość.

Benchmarki i dlaczego te dwa zestawy tak naprawdę nie są porównywalne
Podawany przez dostawcę wynik dla Ling-3.1-flash to łączny wynik 81,0 w pięciu benchmarkach agentowych: 40,4% w Terminal-Bench 4.0, 55,9% w SWE-Atlas i 65,35% w HealthBench Professional; własne dane Ant obejmują dodatkowo 1673 Elo w GDPVal-AA v2.1 i 75,16 w FrontierSWE. Każdy z tych wyników pochodzi z pomiaru samego Ant. Nie opublikowano żadnego harnessu, a co ważniejsze, żadnych wag, na których ktokolwiek mógłby ponownie uruchomić ten zestaw.
Przypadek Gemini 3.8 Flash jest jakościowo odmienny. W obecnej wersji Indeksu Inteligencji Artificial Analysis (v4.3.2) uzyskuje 40,9 przy wysokim wysiłku rozumowania, 39,8 przy średnim i 33,5 przy niskim — warto też zaznaczyć, że indeks został niedawno zrewidowany, więc liczby publikowane na temat tego modelu wcześniej jesienią obliczono na innej wersji i nie są bezpośrednio porównywalne z tymi. Same deklaracje Google dotyczące tego modelu obejmują 54,9 w HLE-Verified oraz mocne wyniki w Terminal-Bench 2.1 na poziomie górnych 80 punktów. Liczby niezależne i producenta, zestawione obok siebie, jedne i drugie wiarygodne, ale nie są wzajemnie wymienne.
Warto przeprowadzić jedno czyste porównanie krzyżowe, ponieważ oba należą do tej samej rodziny benchmarków. W Terminal-Bench 4.0 wartość podana przez dostawcę dla Ling-3.1-flash wynosi 40,4%. Claude Sonnet 5.5 — model średniej klasy, nie flagowy — uzyskuje 70,6% w tej samej wersji. Ten pojedynczy wiersz to najsilniejszy argument przeciwko odczytywaniu karty Ant jako „bliskiej czołówce”: model jest konkurencyjny w miarach agentowych, które Ant postanowił wyróżnić, i wyraźnie w tyle w mierze kodowania terminalowego, dla której istnieje zewnętrzna liczba.

Praktyczny kształt wyboru
Jeśli w ciągu najbliższych dwóch tygodni musisz coś zbudować, odpowiedź nie jest nawet bliska i nie jest to przytyk do Ling-3.1-flash. Gemini 3.8 Flash jest jedynym z tych dwóch, który daje ci stabilny endpoint, opublikowaną cenę, pełne okno miliona tokenów, wejście multimodalne i licencję, którą możesz przeczytać. To produkcyjny model klasy Flash.
Ling-3.1-flash jest obiektem ewaluacji. Jego wartość obecnie polega na tym, że ewaluacja jest darmowa, a model interesujący: MoE 560B z tylko ~25B aktywnymi na token to zakład na rzadkość, a Ant pozycjonuje go dokładnie pod obciążenia związane z agentami, wyszukiwaniem i automatyzacją biurową, o które konkurują modele klasy Flash. Przepuszczanie przez niego własnych promptów w oknie próbnym jest warte zachodu właśnie dlatego, że nikt poza Ant jeszcze tego nie zrobił — byłbyś wśród pierwszych z opinią niezależną od dostawcy.
Drzewo decyzyjne, które ma sens w tym miesiącu: skieruj produkcję do Gemini 3.8 Flash, poświęć darmowy okres próbny na uruchamianie Ling-3.1-flash na najtrudniejszych promptach, a kwestię otwartych wag potraktuj jako prawdziwe rozwidlenie. Jeśli wagi pojawią się na permisywnych warunkach, a cena wyląduje blisko poziomu Flash, Ling-3.1-flash stanie się prawdziwą drugą opcją — taką, którą możesz hostować samodzielnie, a którą Gemini nigdy nie będzie. Jeśli pojawią się z haczykami, okres próbny się kończy, a wraz z nim porównanie.
Uruchamianie obu z jednego klucza i mówienie wprost o tym, czego brakuje
Gemini 3.8 Flash jest od dziś dostępny w katalogu OrcaRouter pod identyfikatorem modelu google/gemini-3.8-flash, w cenie katalogowej samego Google, bez żadnej marży — więc gdy w styczniu promocyjna stawka wróci do poprzedniego poziomu, cena, którą tu płacisz, podąży za nią automatycznie, bez konieczności zawierania nowej umowy. DeepSeek-V4.1-Flash, drugi tani model klasy Flash, wart zmierzenia w tym samym eksperymencie, znajduje się w tym samym katalogu w cenie katalogowej swojego dostawcy, więc test trzech modeli porównujący model próbny ze sprawdzonymi opcjami klasy Flash działa za pomocą jednego klucza API z automatycznym przełączaniem awaryjnym między nimi.
Ling-3.1-flash nie znajduje się w naszym katalogu, a sprawdzenie w naszym publicznym API modeli zwraca wynik „not found” zarówno dla niego, jak i dla poprzedniej generacji — więc uczciwym ujęciem jest to, że okres próbny działa tam, gdzie działa: przez własny interfejs dostawcy i zewnętrzne platformy inferencyjne, a my nie twierdzimy, że go hostujemy. To właśnie ta część tego porównania może zmienić się najszybciej: model w darmowym okresie próbnym z nieogłoszoną ceną to dokładnie ten rodzaj rzeczy, który trafia do warstwy routingu w momencie, gdy Ant i jego hosty opublikują cennik, a przekazywanie bez marży oznacza, że w dniu, w którym to nastąpi, cena tutaj jest ceną tam.
A więc werdykt jest węższy, niż sugerują liczby parametrów. Ling-3.1-flash to model bardziej ambitny i ciekawszy wynik badawczy; Gemini 3.8 Flash to ten, na którym można oprzeć wdrożenie. Dopóki nie istnieje licencja i cena, na tym polega cała różnica — a nie jest to różnica, którą rozstrzygnie jeden wiersz benchmarku.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
