Karta hero dla Ling-3.0-flash-base, karta tytułowa z płaską ilustracją trzech ułożonych jeden na drugim punktów kontrolnych łączących się w jedną końcową wagę bazową, oznaczonych jako wstępnie wytrenowany, średnio wytrenowany i scalony, pod nagłówkiem Ling-3.0-flash-base i podtytułem Otwarte punkty kontrolne Ant Group do kontynuacji wstępnego trenowania.
Engineering & Research

Ling-3.0-flash-base: Ciche wydanie checkpointu Ant Group, teraz oficjalne

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Laboratorium inclusionAI firmy Ant Group wgrało Ling-3.0-flash-base oraz pięć pokrewnych checkpointów na Hugging Face 11 sierpnia 2026 r. bez żadnego ogłoszenia, a przez cały tydzień wszystkie sześć repozytoriów miało zero pobrań — wyglądało na to, że nikt poza laboratorium ich nie zauważył. Następnie 19 sierpnia oficjalne konto laboratorium publicznie przedstawiło kolekcję, a każda karta modelu w niej została zaktualizowana w ciągu kilku minut. To tekst o tym, co do tej pory wiadomo o tym wydaniu. W skrócie: Ling-3.0-flash-base nie jest modelem czatowym i nie ma nim być. To surowy, bazowy checkpoint sprzed alignmentu modelu Ling-3.0-flash, czyli modelu Mixture-of-Experts o 124 miliardach parametrów, w tym 5,1 miliarda aktywnych parametrów, wydany na licencji MIT dla osób, które chcą kontynuować jego trenowanie, a nie wywoływać go.

Oś czasu: tydzień ciszy, a potem ogłoszenie.

Kolejność ma znaczenie, ponieważ mówi ci, jak czytać wszystko inne w tym tekście. Sześć repozytoriów utworzono 11 sierpnia, a wagi dla Ling-3.0-flash-base — scalonego checkpointu, tego, od którego wzięła się nazwa tego artykułu — pojawiły się 12 sierpnia wraz z commitem „initial model release”. Nie towarzyszył temu żaden wpis na blogu, żaden wątek w mediach społecznościowych ani żadne ogłoszenie. W chwili badania, tydzień później, każde z sześciu repozytoriów nadal miało zero pobrań.

Ta cisza skończyła się 19 sierpnia. Oficjalne konto Ant Ling publicznie ogłosiło kolekcję checkpointów, a karty Hugging Face wszystkich sześciu repozytoriów zostały zaktualizowane w odstępie kilku minut od siebie — znaczniki czasu pokrywają się niemal dokładnie. Uczciwe ujęcie sprawy jest więc takie: wagi zostały wysłane po cichu, ogłoszenie pojawiło się z tygodniowym opóźnieniem, a wszystko, co obecnie wiadomo o wydaniu, pochodzi z samych kart modeli oraz krótkiego repozytorium z przepisami treningowymi. Nic innego nie zostało jeszcze niezależnie zweryfikowane.

Co faktycznie zostało wydane: sześć punktów kontrolnych, trzy etapy treningu

InclusionAI opisuje wydanie jako „zbiór punktów kontrolnych podczas procesu trenowania” dla serii Ling-3.0, jej najbardziej wydajnej rodziny modeli językowych do tej pory. Dla każdego z dwóch najmniejszych rozmiarów — Ling-3.0-tiny i Ling-3.0-flash — laboratorium opublikowało trzy punkty kontrolne, po jednym na każdy etap trenowania:

Wstępnie wytrenowaneLing-3.0-flash-base-30T i Ling-3.0-tiny-base-30T: ukończono zakrojone na szeroką skalę pre-trenowanie; bez mid-trenowania, bez łączenia, bez post-trenowania.

Po treningu pośrednimLing-3.0-flash-base-midtrain i Ling-3.0-tiny-base-midtrain: ukończono fazę treningu pośredniego; bez scalania punktów kontrolnych i bez treningu końcowego.

ScaloneLing-3.0-flash-base i Ling-3.0-tiny-base: bazowe punkty kontrolne po scaleniu WSM, uzyskane z wag po treningu pośrednim i reprezentujące końcowy stan bazowy przed treningiem końcowym.

Wszystkie sześć to bazowe punkty kontrolne. Żaden nie przeszedł etapu dopasowania — nadzorowanego dostrajania, optymalizacji preferencji, uczenia ze wzmocnieniem — który przekształca model bazowy w coś, co można udostępnić użytkownikom. Karta modelu mówi to wprost: niezalecany do bezpośredniego wdrożenia w czacie z użytkownikiem końcowym, aplikacji krytycznych dla bezpieczeństwa bez dodatkowego dopasowania i ewaluacji, ani do użytku produkcyjnego bez dalszego treningu i walidacji pod kątem konkretnego zadania.

Czym jest bazowy punkt kontrolny — i dlaczego zwrot WSM ma znaczenie

Jeśli kiedykolwiek korzystałeś z modeli wyłącznie przez API, „bazowy checkpoint” może brzmieć jak mniejsza lub starsza wersja modelu, który już znasz. Nie jest to ani jedno, ani drugie. Bazowy checkpoint to niealignowany plik wag sieci neuronowej, który powstaje w wyniku pre-treningu; zachowanie, które faktycznie wykorzystujesz — podążanie za instrukcjami i wywoływanie narzędzi — jest nakładane na niego później. Publikowanie bazowych checkpointów to sposób, w jaki laboratorium przekazuje społeczności badawczej surowy materiał do własnego dalszego pre-treningu, dostrajania, destylacji i RL.

To, co czyni tę wersję bardziej interesującą niż typowy zrzut bazowych wag, to przepis treningowy, który za nią stoi. InclusionAI stosuje technikę o nazwie Warmup-Stable and Merge (WSM), która zastępuje konwencjonalne wygaszanie współczynnika uczenia się na końcu treningu ważonym łączeniem punktów kontrolnych. Mówiąc wprost: zamiast pozwolić współczynnikowi uczenia się stopniowo maleć do końca przebiegu, laboratorium trenuje ze stałym współczynnikiem, zapisuje punkty kontrolne na ostatnim odcinku i scala je z wyuczonymi wagami. Deklarowane motywacje dostawcy, z karty modelu:

• Ponieważ nie ma fazy zanikania, która "utrwalałaby" końcową mieszankę danych, wynikowy model bazowy lepiej nadaje się do dalszego pre-trenowania i dynamicznego rozszerzania danych.

• Ponieważ przepis na scalanie można przetestować offline, zespół może porównać różne profile zanikania bez ponownego uruchamiania kosztownego treningu dla każdego z nich.

Ten drugi punkt sprawia, że wydanie jest artefaktem badawczym, a nie ciekawostką: cały sens tych punktów kontrolnych polega na tym, że mają być dalej trenowane, a przepis jest zaprojektowany tak, aby to tolerować.

Co jest w środku Ling-3.0-flash-base

Architektura jest identyczna z architekturą Ling-3.0-flash po treningu, która powinna być już znana z szerszego omówienia tego modelu. Z karty modelu i config.json:

Rozmiar — 124B parametrów łącznie według dostawcy (pełny checkpoint na dysku, włączając embeddingi, liczy około 127B na Hugging Face), z 5.1B aktywowanych na token.

Rzadkość — rzadki MoE 1/64: 512 trasowanych ekspertów, przy czym dla każdego tokena aktywowanych jest 8 trasowanych ekspertów i 1 wspólny ekspert.

Attention — a native hybrid-linear design: 35 Kimi Delta Attention (KDA) layers and 7 Gated MLA layers in a 5:1 repeating pattern across 42 transformer layers.

Kontekst — konfiguracja zawiera embedding pozycyjny o długości 256 tys. tokenów (262 144), ten sam natywny kontekst co w przypadku modelu siostrzanego po dotrenowaniu.

Wagi — BF16, dostarczane jako 28 fragmentów safetensors (~255 GB na dysku), z niestandardowym bailing_hybrid kodem modelu dołączonym do repozytorium.

Licencja — MIT, bez klauzuli ograniczającej dozwolone użytkowanie.

Single-model scoreboard for Ling-3.0-flash-base listing six figures: total params 124B (5.1B active), stage base pre-alignment WSM-merged, context 256K native, architecture hybrid-linear MoE 1/64 sparse, experts 512 routed with 8 plus 1 active, and independent scores none yet, with the footer noting all figures are from the vendor model card

Jedno uczciwe zastrzeżenie co do podawanego rozmiaru: karta modelu producenta podaje {{1}}„Łącznie 124B"{{/1}}, i to ta liczba krąży wszędzie — ale całkowita liczba parametrów safetensors w repozytorium wynosi około 127,5B, gdy uwzględnimy warstwę osadzeń. Liczba 124B to suma bez warstwy osadzeń; te dwie liczby nie są ze sobą sprzeczne — warto wiedzieć, na którą z nich patrzysz, gdy widzisz {{2}}„127B"{{/2}} na pasku bocznym lub w programie do pobierania.

Do czego to służy, a do czego nie

Zalecane przypadki użycia karty modelu są jednoznaczne:

• Kontynuacja pre-treningu

• Szkolenie średniozaawansowane

* Nadzorowane dostrajanie do adaptacji domenowej

• Optymalizacja preferencji i post-trening RL

• Badania nad destylacją

• Badania nad systemami długiego kontekstu i MoE

A jej lista „niezalecane w obecnej formie” jest równie jednoznaczna: bezpośrednie wdrożenie czatu dla użytkowników końcowych, aplikacje krytyczne dla bezpieczeństwa bez alignmentu, użycie produkcyjne bez post-treningu. Innymi słowy, to surowiec dla ludzi trenujących modele, a nie model, który ludzie wdrażają. Jeśli nie planujesz niczego dostrajać ani pre-trenować, nie ma tu dla ciebie nic do pobrania — i nie ma w tym nic złego.

Druga połowa historii to projekt płynnego skalowania. InclusionAI twierdzi, że Ling-3.0-tiny-base i Ling-3.0-flash-base korzystają z tego samego przepisu treningowego, dzięki czemu społeczność może najpierw zweryfikować strategię dalszego pretreningu lub dostrajania na małym punkcie kontrolnym — który zajmuje znacznie mniej pamięci GPU — a następnie przeskalować ten sam zweryfikowany przepis na większy punkt kontrolny flash. To celowy wybór dotyczący przepływu pracy, a nie przypadek logistyki wydań, i jest to najbardziej użyteczna cecha tej kolekcji dla każdego, kto naprawdę chce eksperymentować.

Rzeczywistość sprzętowa i droga, którą większość ludzi faktycznie chce

Nie da się obejść rozmiaru bazowych wag flash. BF16 zajmujący ~255 GB oznacza, że zanim w ogóle zaczniesz, potrzebujesz poważnego węzła multi-GPU (lub zoptymalizowanej pod kątem pamięci konfiguracji treningu); nie ma oficjalnej kwantyzacji FP8 ani FP4 bazowego checkpointu — warianty skwantyzowane istniejące w katalogu organizacji dotyczą modelu po treningu. Przykłady dostrajania znajdują się w repozytorium GitHub inclusionAI/ling-cookbook, które jest wprost określone jako praca w toku. Jeśli kontynuacja pre-treningu nie jest celem twojego zespołu, bazowe checkpointy nie są punktem wejścia.

Większość osób czytających o rodzinie Ling-3.0 w ogóle nie chce bazowego checkpointu — chcą modelu, który rozmawia. To jest wytrenowany Ling-3.0-flash, dostępny przez własne API producenta oraz kilka platform zewnętrznych. Gdy pojawia się taki szybki, nowo wydany model o otwartych wagach, najtańszym sposobem oceny go względem obecnego stacku jest uruchomienie go obok tego, czego już używasz — i właśnie do tego służy router: jedno API, jeden klucz i automatyczne przełączanie awaryjne, aby chwilowa awaria dostawcy nie przerwała testów. OrcaRouter łączy się w ten sposób z ponad 200 modelami i przekazuje cennik dostawców bezpośrednio, z 0% narzutu, więc cena, którą widzisz, jest ceną dostawcy, a prowizja od dostawcy trafia na naszą stronę tego samego dnia.

Screenshot of the inclusionAI/Ling-3.0-flash-base model card on Hugging Face showing the six-checkpoint collection table for Ling-3.0-tiny and Ling-3.0-flash and the training-stage descriptions

Co nie zostało jeszcze potwierdzone

Ponieważ ogłoszenie tego wydania ma dopiero jeden dzień, lista niepotwierdzonych elementów jest długa i należy ją traktować jako listę zadań do wykonania, a nie krytykę:

Brak niezależnych benchmarków dla bazowego checkpointu.Karta modelu zawiera wykres benchmarków producenta porównujący Ling-3.0-flash-base ze wstępnie wytrenowanymi odpowiednikami w testach z matematyki, kodowania, rozumowania, wielojęzyczności i długiego kontekstu — ale jest to własna ewaluacja producenta, umieszczona na wewnętrznym serwerze obrazów, bez sekcji metodologii i bez niezależnej reprodukcji.

Brak jeszcze reprodukcji społecznościowych. Na moment badania, wszystkie sześć repozytoriów wykazywało zero pobrań i praktycznie żadnego zaangażowania. Wydanie jest zbyt świeże, aby ktokolwiek opublikował niezależne dostrojenie lub kontynuację pretrenowania na bazie tych wag.

Narzędzia są na wczesnym etapie. Ta bailing_hybrid architektura zawiera niestandardowy kod modelowania, więc polegasz na trust_remote_code lub na frameworku, który dodał wsparcie. Cookbook do fine-tuningu jest wyraźnie w trakcie prac.

Samo ogłoszenie jest skąpe. Publiczna prezentacja miała formę wątku na X oraz kart modeli; nie ma osobnego dokumentu premiery opisującego dane treningowe, moc obliczeniową ani dokładną recepturę scalenia poza tym, co podają karty.

Natomiast odpowiednik po treningu ma niezależnie udokumentowane wyniki: Ling-3.0-flash jest notowany przez Artificial Analysis ze wskaźnikiem inteligencji 38 — liczba pochodząca z rankingu, a nie od dostawcy. Nic takiego nie istnieje jeszcze dla Ling-3.0-flash-base; bazowy checkpoint nie jest nigdzie udostępniany, więc nie ma go na żadnym rankingu. Te dwa artefakty znajdują się na zupełnie różnych etapach weryfikacji i lepiej ich nie mylić.

Screenshot of the Artificial Analysis model page for Ling-3.0-flash, the post-trained sibling of Ling-3.0-flash-base, showing its Intelligence Index of 38 and pricing of $0.075 per 1M input and $0.22 per 1M output tokens

Kto powinien działać teraz

Trzy grupy powinny przeczytać to inaczej:

Naukowcy prowadzący dalsze pre-trenowanie, domenowe SFT lub destylację — to wydanie jest dla Ciebie. Bazowy punkt kontrolny WSM-merged został specjalnie zbudowany do dalszego trenowania, a przepis tiny-then-flash daje tani sposób na walidację podejścia przed skalowaniem. Zacznij od Ling-3.0-tiny-base, potwierdź przepis, a następnie przejdź do Ling-3.0-flash-base.

Inżynierowie, którzy chcą działającego modelu — potrzebujecie Ling-3.0-flash po treningu, a nie tej wersji. Bazowe punkty kontrolne nie będą wykonywać instrukcji i nie są nigdzie udostępniane; nie kierujcie na nie klienta API.

Wszyscy inni — pożytecznym posunięciem jest obserwowanie. Interesującymi sygnałami w nadchodzących tygodniach są pierwsze niezależne dostrojenie zbudowane na tych wagach, społecznościowa reprodukcja wykresu benchmarku dostawcy oraz to, czy zewnętrzny stack treningowy doda pełnoprawne wsparcie dlabailing_hybrid. architektury

Często zadawane pytania

Jaka jest różnica między Ling-3.0-flash-base a Ling-3.0-flash?

Ling-3.0-flash jest modelem po treningu — dopasowanym przy użyciu nadzorowanego dostrajania i uczenia przez wzmacnianie (RL), postępuje zgodnie z instrukcjami, obsługuje wywoływanie narzędzi i jest udostępniany przez API. Ling-3.0-flash-base jest tą samą architekturą na wcześniejszym etapie: to końcowy scalony bazowy checkpoint przed jakimkolwiek post-treningiem i nie będzie zachowywał się jak model czatu. Model bazowy istnieje po to, aby badacze mogli prowadzić własny dalszy pre-trening, dostrajanie lub destylację, zamiast zaczynać od zera.

Dlaczego laboratorium miałoby udostępniać punkty kontrolne, które nie zostały poddane dalszemu treningowi?

Ponieważ post-training to dokładnie to, co większość badaczy chce robić samodzielnie, a bazowy checkpoint jest właściwym punktem wyjścia do tego. Osobne publikowanie checkpointów pre-trained, mid-trained i merged oznacza, że zespół może wybrać etap pasujący do swojej pracy: kontynuację pre-treningu od wag pre-trained lub fine-tuning i RL od merged base — a dzięki WSM, bez ograniczeń związanych z zanikiem współczynnika uczenia się, które sprawiają, że bazowy model jest niestabilny przy dalszym trenowaniu.

Czy mogę uruchomić Ling-3.0-flash-base na sprzęcie konsumenckim?

W praktyce nie. Wagi BF16 to około 255 GB rozłożone na 28 shardów, bez oficjalnego skwantowanego wariantu bazowego checkpointu. Mniejszy odpowiednik, Ling-3.0-tiny-base, jest przeznaczony do eksperymentów na skromniejszym sprzęcie — i dzieli przepis treningowy flash checkpointu, więc sprawdzone eksperymenty skalują się.

Czy Ling-3.0-flash-base jest darmowy do użytku komercyjnego?

Tak — jest wydany na licencji MIT bez klauzuli dotyczącej dozwolonego użytku. Obejmuje to zarówno użycie badawcze, jak i, co do zasady, komercyjne wykorzystanie wag oraz wszelkich modeli dostrojonych na ich podstawie. Jest to bazowy punkt kontrolny, więc „użycie” oznacza tutaj trenowanie na nim; licencja nie wspomina o hostowanym API, ponieważ dla modelu bazowego żadne nie istnieje.

Sedno sprawy

Dla większości czytelników, Ling-3.0-flash-base to wskaźnik, a nie produkt: pokazuje, dokąd zmierza rodzina Ling-3.0 i w jaki sposób laboratorium chce, aby społeczność na niej budowała, ale nie ma tu niczego, co można by wywołać przez API. Dla mniejszej grupy faktycznie zajmującej się dalszym pretrenowaniem, dostrajaniem lub destylacją jest to naprawdę przydatne wydanie — sześć punktów kontrolnych, na licencji MIT, celowo zaprojektowanych do dalszego trenowania, ze ścieżką „najpierw małe”, która sprawia, że eksperymenty są niedrogie. To, co zmieniłoby je z „przydatnego wydania” w „sprawdzony przepis”, to dokładnie to, czego dziś brakuje: niezależna reprodukcja, dokonana przez kogoś spoza laboratorium, tego, co potrafią punkty kontrolne WSM, gdy ktoś je dalej trenuje.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube