Wygenerowana redakcyjna karta hero zatytułowana „Ling-3.1-flash jest już dostępny i darmowy przez dwa tygodnie” z podtytułem „Co tak naprawdę oferuje dziś 560B MoE”. Cztery zaokrąglone karty zawierają: „Parametry: łącznie 560B / ~25B aktywnych”, „Kontekst: 262 144 tokeny”, „Limit wyjściowy: 32 768 tokenów” i „Wagi: nieopublikowane”, nad wierszem stopki o treści „Dane techniczne podane przez dostawcę; brak opublikowanej ceny po okresie próbnym”.
Guides & Insights

Ling-3.1-flash jest już dostępny i bezpłatny przez dwa tygodnie: co tak naprawdę oferuje 560B MoE

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Ling-3.1-flash, model typu mieszanka ekspertów o około 560 miliardach parametrów, który laboratorium inclusionAI należące do Ant Group ogłosiło 29–30 września 2026 r., w tym tygodniu przestał być tylko komunikatem prasowym: teraz odpowiada na żądania w działającym komercyjnym API. Model działa w ramach dwutygodniowego bezpłatnego okresu próbnego na bramie wnioskowania innej firmy, a pojawia się także we własnym produkcie Ant, Ling Studio — co przenosi pytanie z „czy istnieje” na „co właściwie obsługuje”. Odpowiedź jest węższa, niż sugerują liczby z nagłówków. Ling-3.1-flash przyjmuje tekst na wejściu i zwraca tekst na wyjściu; obsługuje kontekst 262 144 tokenów (256K), choć w ogłoszeniu jako docelową wartość podano 1 mln; jego wyjście jest ograniczone do 32 768 tokenów; i nikt nie opublikował ceny, którą zapłacisz piętnastego dnia, gdy zamknie się bezpłatne okno, a wagi mają się wtedy pojawić.

Ta luka między kartą zapowiedzi a działającym endpointem jest tym, czego warto się trzymać, ponieważ większość materiałów o tym wydaniu czyta specyfikacje tak, jakby model miał je udostępniać już dziś. Tak jednak nie jest. Ling-3.1-flash to drugi model z tego laboratorium w ciągu trzech miesięcy, który pojawia się jako coś, co niezależny tracker LLM Releases bez ogródek klasyfikuje jako „weights not released”, a różnica między tym, czym według Ant jest ten model, a tym, co deweloper może wywołać już teraz, jest miejscem, w którym budżet lub pilotaż może po cichu pójść nie tak.

Co się zmieniło między ogłoszeniem a dniem dzisiejszym?

Samo ogłoszenie było wpisem specyfikacyjnym: łącznie ~560 mld parametrów, ~25 mld aktywnych na token, do 1 mln tokenów kontekstu, trzy najważniejsze liczby z ewaluacji i obietnica — „planujemy wkrótce udostępnić model jako open source”. Nic z tego się nie zmieniło. Zmieniła się dostępność. W ciągu jednego dnia od ogłoszenia model był osiągalny na komercyjnym edge, a bezpłatny okres próbny udostępnia ten sam rzeczywisty endpoint, jaki udostępniałby płatny: ten sam interfejs API, ta sama modalność wyłącznie tekstowa, ten sam przełącznik trybu myślenia do pracy agentów w długim horyzoncie.

Dla każdego, kto zastanawia się, czy poświęcić na to czas inżynierów, w tym tygodniu okres próbny to cała historia — a to nóż obosieczny. Darmowe wnioskowanie przez dwa tygodnie to naprawdę tani sposób, by sprawdzić, jak model zachowuje się na własnych promptach — rzadkość w przypadku modelu tej wielkości. Ale darmowe to stan promocyjny, a nie cena. Nigdzie nie opublikowano jeszcze cennika po okresie próbnym dla Ling-3.1-flash, więc każdy model kosztów oparty na darmowym planie jest wartością zastępczą, dopóki Ant i jego hostingodawcy nie podadzą liczb.

Specyfikacja i trzy liczby, które wciąż są obietnicami

• Parametry — łącznie 560B, ~25B aktywnych na token. Według danych dostawcy, a jednocześnie około czterokrotnie więcej niż w poprzedniej generacji: łącznie 124B / 5,1B aktywnych. Współczynnik rzadkości utrzymuje się blisko 1 na 22, więc aktywacja nie jest drastycznie szczuplejsza — model jest po prostu znacznie większy niż ten, którego jest następcą.

• Kontekst — dziś obsługiwane jest 262 144 tokenów. „Do 1 mln” to cel po włączeniu okna; nie jest to to, co daje punkt końcowy wersji próbnej, i jest to najczęstsze błędne odczytanie tego wydania.

• Wyjście — maksymalnie 32 768 tokenów. Rozsądne dla pętli agenta, ale ciasne, jeśli zamierzasz generować długie dokumenty w jednym przebiegu.

• Modalność — tekst na wejściu, tekst na wyjściu. To model tekstowy. Wizja, audio i wprowadzanie plików nie są częścią premiery i nie podano dla nich daty.

• Rozumowanie — hybrydowy stos z jawnym przełącznikiem trybu myślenia, ten sam wzorzec, którego używała poprzednia generacja, ukierunkowany na wieloetapową pracę z agentami i wywoływaniem narzędzi, a nie na czat w pojedynczej turze.

• Wagi i licencja — nieopublikowane. To dana, która ma największe znaczenie, a zarazem ta, która nie ma jeszcze żadnej wartości: na dzień dzisiejszy nie istnieje żadne repozytorium Hugging Face, tekst licencji ani checkpoint do pobrania.

Ant Group's own Ling-3.1-flash benchmark chart, published 30 September 2026. Twelve bar-chart panels cover GDPval-AA v2.1 (1,673 for Ling-3.1-flash), tau-squared Banking (47.60), SkillsBench (69.70), Automationbench public (52.50), Terminal-Bench 4.0 (40.40), CyberGym (87.90), FrontierSWE (75.16), SWE Atlas Codebase QnA (55.92), Finance Agent v2 (57.87), HealthBench Professional (65.35), DRACO (85.49) and MultiChallenge (69.78), with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment and that Ling-3.1-flash's healthcare capabilities can currently be experienced only in AQ.

Karta wzorcowa, czytana z uwzględnieniem rabatu, którego potrzebuje

Własne raporty firmy Ant plasują Ling-3.1-flash na 81,0 łącznie w pięciu benchmarkach agentowych, z 40,4% w Terminal-Bench 4.0, 55,9% w SWE-Atlas i 65,35% w HealthBench Professional; a we własnym ujęciu firmy dochodzi 1673 Elo w GDPVal-AA v2.1 i 75,16 w FrontierSWE. Każda z tych liczb pochodzi z pierwszej ręki. Nie ma harnessu, zestawu promptów ani wag, które pozwoliłyby komukolwiek innemu ponownie uruchomić ten zestaw testów, co jest standardowym zastrzeżeniem dla modelu na tym etapie — i tutaj warto powiedzieć wprost: nieodtworzony wynik dostawcy to twierdzenie o modelu, a nie jego pomiar.

Karta jest też wymowna w sposób, którego jej autorzy mogli nie zamierzać. Wynik 40,4% w Terminal-Bench 4.0 plasuje się znacznie poniżej poziomu frontier; Claude Sonnet 5.5, model średniej wielkości, a nie flagowy, uzyskuje 70,6% w tej samej wersji tego benchmarku. Uczciwa interpretacja nie polega na tym, że Ling-3.1-flash jest słaby — 40,4% to przyzwoity wynik agentowo-terminalowy dla modelu pozycjonowanego pod kątem kosztów — lecz na tym, że narracja „blisko frontieru w kluczowych benchmarkach”, która krążyła w mediach społecznościowych w dniu ogłoszenia, nie wytrzymuje konfrontacji z konkretnymi wierszami. Benchmark, w którym model wypada najlepiej, HealthBench Professional z wynikiem 65,35, jest także tym, który niesie niezręczny przypis: Ant podaje, że oceniano go w środowisku, które nazywa AQ, oraz że możliwości modelu w zakresie opieki zdrowotnej „można obecnie doświadczyć wyłącznie w AQ”, nie definiując nigdzie publicznie, czym AQ jest. Wynik z nagłówka z dołączonym nienazwanym środowiskiem to demo, a nie odtwarzalny wynik.

Dlaczego duży model pojawiający się w wersji próbnej to prawdziwa wiadomość

Ciekawszym posunięciem jest tu sekwencja, a nie parametry. Ling-3.0-flash od razu trafił do otwartych wag. Ten startuje najpierw w wersji próbnej, z wstrzymanymi wagami, licencją i oficjalną ceną oraz publicznym zobowiązaniem do open source dopiero po zakończeniu darmowego okresu. To scenariusz komercyjnego wydania przebrany za ogłoszenie otwartego modelu i prawdziwa zmiana warta śledzenia: jeśli wagi pojawią się na permisywnej licencji, społeczność otrzyma bazowy model 560B do dostrajania i destylacji; jeśli pojawią się z komercyjnymi obwarowaniami, dwutygodniowy okres próbny był produktem, a hasło „open source” było marketingiem. Tak czy inaczej, wybór zapadnie w trakcie okresu próbnego i to jest rzecz, na którą warto patrzeć, a nie pojedynczy wiersz benchmarku.

Gdzie jest uruchamiane, i uczciwy obraz routingu

Na razie Ling-3.1-flash jest dostępny za pośrednictwem własnego interfejsu produktowego dostawcy oraz przez zewnętrzne platformy inferencyjne prowadzące testy — i to wszystko. Nie ma go dziś w katalogu OrcaRouter; wyszukanie w naszym publicznym API modeli dla Ling-3.1-flash, Ling-3.0-flash i wariantu Ling-3.0 vision w każdym przypadku zwraca nie znaleziono, i nie będziemy udawać inaczej. Gdy endpoint Ant rzeczywiście osiągnie ogólną dostępność z opublikowaną ceną katalogową, model pass-through, na którym działa OrcaRouter — cena katalogowa dostawcy przekazywana bez marży, dzięki czemu obniżka ceny dostawcy obowiązuje u nas tego samego dnia — to dokładnie takie rozwiązanie, jakie pasuje do modelu, którego cennik wciąż nie został ustalony.

To, co możesz zrobić już dziś, nie czekając na decyzję w sprawie licencji, to przeprowadzić porównanie, które naprawdę ma znaczenie w przypadku nieprzetestowanego modelu: zmierzyć go na tle modeli klasy Flash, które możesz wywołać już teraz. Gemini 3.8 Flash i DeepSeek-V4.1-Flash są dostępne w naszym katalogu w cenach katalogowych ich dostawców, za jednym kluczem API, z automatycznym przełączaniem awaryjnym między nimi. W przypadku modelu w bezpłatnym okresie próbnym, którego wagi i cennik są nieznane, to rozsądny sposób, by go utrzymywać — jeszcze jeden kandydat, do którego możesz kierować ruch, dopóki trwa okres próbny, oraz ścieżka produkcyjna, która nie zależy od tego, co wydarzy się piętnastego dnia.

Headless capture of Ant's Ling Studio interface with Ling-3.1-flash selected in the model picker. The centre panel shows the model-experience card headed "Ling-3.1-flash Model Experience", describing the model as strong at general-purpose agents, search, routine office work and software/code development, above three starter tasks (Hot Spot Scout, Interaction Design Master, Product Assistant). The Model Settings panel on the right shows Max Length 262144, temperature 0.6, top_k 20, top_p 0.95 and Thinking enabled.

Co robić w tym tygodniu

Jeśli model ma znaczenie dla Twojej pracy, okres próbny jest powodem, by działać teraz, zamiast czekać na rozstrzygnięcie kwestii otwartych wag — dwa tygodnie darmowego wnioskowania na 560B MoE to najtańsza ewaluacja, jaką otrzymasz, a odpowiedź na pytanie „czy sprawdza się na moich promptach” jest dostępna już dziś, nawet jeśli odpowiedzi na pytanie „czy mogę hostować go samodzielnie” wciąż nie ma. Trzy rzeczy do sprawdzenia, dopóki okno jest otwarte, w kolejności:

• Uruchamiaj własne obciążenie, a nie kartę benchmarku. Opublikowane liczby to wybór zadań dokonany przez Ant; to Twoje prompty decydują o Twoim stacku.

• Testuj kontekst, którego faktycznie będziesz używać. Endpoint obsługuje 262 144 tokeny, a nie 1 mln. Jeśli twój projekt zależy od większego okna, projektujesz, licząc na obietnicę.

• Nie buduj modelu kosztów na „darmowości”. Darmowość to stan trwający dwa tygodnie. Dopóki nie zostanie opublikowany cennik stawek, planuj powrót do płatnego modelu klasy Flash jako domyślnego i traktuj Ling-3.1-flash jako dodatkową przepustowość.

Ogłoszenie jest prawdziwe, a model działa — to więcej, niż można było powiedzieć jeszcze tydzień temu. Ale „wydany i otwarty” oraz „uruchomiony w trybie testowym” to różne stany, a ten należy zdecydowanie do drugiej kategorii — specyfikacja 560B, endpoint 256K, karta wyników benchmarków dostępna wyłącznie od dostawcy i dwutygodniowe odliczanie, które jest jedynym twardym terminem w całym wydaniu.

Generated editorial card titled "Ling-3.1-flash on trial - what to verify this week" listing six rounded rows: "Your workload: run it, not the card"; "Context: 262,144 served, not 1M"; "Cost model: free is a two-week state"; "Weights: none published, promise only"; "Fallback: keep a priced Flash-tier route"; "Deadline: the trial window is the only firm date", above a footer reading "Vendor-stated specs; no published post-trial rate card."

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie