Inkling-Small-1
Guides & Insights

Inkling-Small: Model o ćwierć rozmiaru, który przewyższa własny flagowy model, ale wciąż plasuje się za Indexem.

Autor

Jim Song

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Thinking Machines Lab spędziło dwa tygodnie po wydaniu swojego pierwszego modelu o otwartych wagach na budowaniu modelu około jednej czwartej mniejszego, a według własnej punktacji laboratorium to mniejszy wygrywa. Inkling-Smallosiąga 80,2% na SWE-bench Verified w porównaniu z modelem Inkling, który uzyskał 77,6% na SWE-bench Verified, oraz 89,5% na GPQA Diamond wobec 87,2%, 64,7% na Terminal-Bench 2.1 wobec 63,8% oraz 31,6% na Humanity’s Last Exam wobec 29,7% — z 276B całkowitych parametrów, w tym 12B aktywnych, zamiast 975B z 41B. Z głównych liczb, które są wspólne dla obu kart modeli, flagowy model 975B osiąga lepszy wynik dokładnie w jednej: AIME 2026, o 1,6 punktu.

Następnie Artificial Analysis przetestował oba niezależnie i ocenił Inkling-Small na 40 w swoim Indeksie Inteligencji wobec 41 Inklinga — mniejszy model o punkt za. Oba te wyniki są prawdziwe, a różnica między nimi jest najbardziej użyteczną rzeczą w tej premierze. Wszystko poniżej oddziela to, co Thinking Machines raportuje o własnym modelu, od tego, co zmierzył ktoś inny: dane producenta pochodzą z ogłoszenia i dwóch kart modeli na Hugging Face, dane niezależne z własnych testów Artificial Analysis, a ceny i długości kontekstu z danych na żywo z punktów końcowych OpenRouter, sprawdzonych w dniu pisania tego tekstu. Tam, gdzie te trzy źródła się różnią — a w kwestii długości kontekstu się różnią — mówimy o tym wprost, zamiast wybierać tę bardziej pochlebną.

Co tak naprawdę wydano 30 lipca

Inkling-Small to rzadki transformator typu mixture-of-experts: łącznie 276B parametrów, 12B aktywnych na token, 42 warstwy, przy czym każdy token jest kierowany do 6 z 256 ekspertów plus 2 wspólnych ekspertów, którzy działają na wszystkim. Uwaga przeplata warstwy lokalne i globalne. Wagi znajdują się na Hugging Face na licencji Apache 2.0 bez ograniczeń komercyjnych, model można dostrajać za pomocą API Tinker od Thinking Machines, a rozmawiać z nim można tekstowo, obrazowo i audio w Tinker Playground. Według laboratorium model był trenowany na systemach NVIDIA GB300 NVL72.

Inkling-Small-2

Multimodalność jest natywna, a nie doczepiona na siłę, a karta jest niezwykle konkretna co do tego, jak to działa. Nie ma osobnego enkodera wizji ani audio: dźwięk trafia jako spektrogramy dMel, obrazy jako łatki 40×40 pikseli przepuszczane przez czterowarstwowy hMLP, a oba typy są osadzane bezpośrednio w tym samym strumieniu tokenów co tekst. Wejściem są tekst, obrazy i dźwięk; wyjściem jest wyłącznie tekst, co warto powiedzieć wprost, bo „multimodalny" bywa odczytywany jako „potrafi mówić" wystarczająco często, by zepsuć komuś dzień. Wysiłek myślowy to pokrętło z pięcioma ustawieniami — minimalny, niski, średni, wysoki, ekstra wysoki — więc te same wagi można uruchamiać tanio albo z pełną mocą.

Najciekawszą częścią przepisu jest trening końcowy. Inkling-Small została poddana destylacji on-policy, z pełnym Inkingiem jako nauczycielem, a następnie otrzymała około dwóch dodatkowych tygodni uczenia przez wzmacnianie, skalowanego na agentowym kodowaniu. Ta kolejność wyjaśnia kształt wyników: uczeń odziedziczył ogólną kompetencję swojego nauczyciela, a potem otrzymał dodatkowy trening dokładnie na tej osi, na której obecnie pokonuje nauczyciela.

Tablica wyników opublikowana przez Thinking Machines

Benchmarki producentów to marketing, dopóki ktoś ich nie odtworzy, więc czytaj tę sekcję jako to, co twierdzi laboratorium, a nie jako to, co zostało zweryfikowane. To wciąż szeroki zestaw, i to szeroki w kierunku niepochlebnym dla flagowca.

Inkling-Small-3

Oprócz czterech wspólnych liczb, karta uzupełnia resztę obrazu — wszystkie własne uruchomienia Thinking Machines:

Praca agentowa — 1269 Elo na GDPval-AA v2, benchmark realistycznych zadań ekonomicznych, a nie łamigłówek.

Wykresy i dokumenty — 77,4% na CharXiv RQ, rosnąc do 81,3%, gdy model może pisać i uruchamiać Pythona. Ten skok o 3,9 punktu to użyteczna wskazówka, że dostęp do narzędzi daje więcej w pracy nad rozumowaniem wizualnym niż inżynieria promptów.

Vision — 74,0% w MMMU Pro, nieznacznie powyżej 73,5% uzyskanego przez Inklinga.

Audio — 90,1% w VoiceBench i 77,0% w MMAU, oba wyniki nieznacznie niższe od flagowca: 91,4% i 77,2%. Audio to jedno z dwóch miejsc, w których zmniejszenie wyraźnie kosztowało.

Bezpieczeństwo — 98,4% w StrongREJECT i 96,9% w benignnych promptach FORTRESS, ale 71,6% w adwersarialnych promptach FORTRESS wobec 78,0% flagowego modelu. To kolejny koszt: regresja o 6,4 punktu w odporności adwersarialnej, która liczy się bardziej niż jakiekolwiek zyski w kodowaniu, jeśli model ma działać za publicznym polem tekstowym.

Forecasting — 61,3 ± 0,46 wskaźnik Briera na ForecastBench bez dostępu do wyszukiwania oraz 0,1238 ± 0,0086 wynik Briera na Prophet Arena. W ogóle podawanie przedziałów ufności to większa dyscyplina, niż większość postów o premierach.

Jedna luka: karta flagowca podaje 54,3% na SWE-bench Pro, trudniejszym odpowiedniku SWE-bench Verified. Karta Inkling-Small nie raportuje SWE-bench Pro. Zważywszy na to, jak mocno eksponowana jest liczba Verified, to właśnie brak tego wyniku jest liczbą, którą najbardziej chcielibyśmy zobaczyć uzupełnioną.

Co mówi natomiast niezależny indeks

Artificial Analysis ocenia Inkling-Small na 40 punktów w wersji 4.1 swojego Indeksu Inteligencji, czyli o jeden punkt mniej niż Inkling, który uzyskał 41. Indeks składa się z dziewięciu ewaluacji — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience i AA-LCR — i ta lista wyjaśnia większość pozornej sprzeczności. Tylko dwie z dziewięciu pokrywają się z prezentacją rozumowania na karcie Thinking Machines. Pozostałe są ukierunkowane na korzystanie z narzędzi agentowych, wyszukiwanie w długich kontekstach i odporność na halucynacje, a model może wygrywać w benchmarkach, które laboratorium decyduje się opublikować, przegrywając jednocześnie te, które wybiera strona trzecia. Żadna ze stron nie kłamie — mierzą po prostu różne rzeczy.

Inkling-Small-4

Jest też szczegół w drobnym druku wart więcej niż jednopunktowy nagłówek: Artificial Analysis wymienia wpis flagowca jako Inkling (xhigh) — jego najwyższe ustawienie poziomu myślenia — podczas gdy wiersz Inkling-Small nie ma sufiksu effort. Tak więc jednopunktowa przewaga flagowca została zarejestrowana z pokrętłem rozumowania ustawionym na maksimum. Gdyby wyrównanie poziomów myślenia choćby nieznacznie przesunęło to porównanie, wraz z nim zniknąłby ostatni argument przemawiający za większym modelem wyłącznie pod względem możliwości.

Tam, gdzie niezależne dane wcale nie są zbliżone, to szybkość i koszt, i tutaj przemawia to na korzyść małego modelu z przewagami, których nie oddaje żadna tabela benchmarków:

Szybkość generowania — 133 tokenów na sekundę w porównaniu z 80 dla Inkling (xhigh). Artificial Analysis plasuje Inkling-Small na 7. miejscu spośród 101 modeli w swojej klasie pod względem szybkości, przy medianie w klasie wynoszącej 66.

Czas do pierwszego tokena — 1.63s w porównaniu z 1.84s. Realna, ale niewielka przewaga.

Uśredniona cena za 1 mln tokenów — $0.22 w porównaniu z $0.72 przy ich ważeniu. Mniej więcej jedna trzecia kosztu, o jeden punkt indeksowy mniej.

Ranga inteligencji — #15 z 101, przy medianie wyników w klasie wynoszącej 25. Wyraźnie powyżej średniej, ale daleko od czołówki.

Rozwlekłość — i tu jest haczyk. Spalił 130 mln tokenów wyjściowych na przejście przez indeks, przy medianie wynoszącej 100 mln. Podsumowanie Artificial Analysis określa to jako „zauważalnie szybkie, jednak nieco rozwlekłe”. Generuje około 30% więcej niż typowo, co po cichu pochłania część zniżki za token.

Krótka uwaga porządkowa, bo każdy, kto porównuje źródła, na nią trafi: Artificial Analysis podaje całkowitą liczbę parametrów jako 266B, podczas gdy ogłoszenie, obie karty modelu i OpenRouter podają 276B. Wszędzie użyliśmy 276B. Nie zmienia to żadnych wniosków, ale to rozbieżność, o której warto wiedzieć, zanim zacytujesz tę liczbę w dokumencie projektowym.

To, co faktycznie możesz dziś wynająć, a nie to, co mówi karta specyfikacji.

Luka między ogłoszeniem o otwartych wagach a działającym endpointem to moment, w którym większość relacji z premiery przestaje zwracać uwagę. Thinking Machines deklaruje okno kontekstu do 1M tokenów, a Artificial Analysis również podaje 1M. Na OpenRouterze obaj dostawcy, którzy obecnie udostępniają Inkling-Small, ograniczają je do 524 288 tokenów — połowa reklamowanej liczby. To nie tyle sprzeczność, ile różnica między tym, co umożliwia architektura, a tym, co ktokolwiek wdrożył w produkcji. Dla kontrastu, flagowy Inkling ma jednak jeden endpoint obsługujący pełne 1 048 576 tokenów, choć ten sam endpoint ogranicza odpowiedzi do 32 768 tokenów.

Reszta bieżącego obrazu, odczytana z danych punktu końcowego OpenRouter:

Dwóch dostawców, dwie ceny — 0,45 USD za 1 mln tokenów wejściowych i 1,20 USD za 1 mln tokenów wyjściowych od jednego, 0,50 USD i 1,20 USD od drugiego. Artificial Analysis podaje, że stawka first-party samego Thinking Machines jest jeszcze niższa: 0,30 USD i 1,20 USD, a wejście z pamięci podręcznej – 0,06 USD. Hosting stron trzecich pobiera 50–67% wyższą opłatę za wejście dla tych samych wag.

Buforowanie promptów — 0,10 USD za 1 mln zbuforowanych tokenów wejściowych przez OpenRouter, w porównaniu z 0,17 USD za flagowy model.

Wartości liczbowe, które wynajmujesz, nie są wartościami, które poddano benchmarkom — karta modelu wymienia BF16 i NVFP4. Tańszy endpoint serwuje fp8; drugi w ogóle nie deklaruje kwantyzacji. Wyniki benchmarków producenta nie zostały zmierzone na serwowaniu fp8 tych wag, a efekty kwantyzacji w długich przebiegach agentowych są dokładnie tym, czego margines 0,9 punktu w Terminal-Bench nie przetrwa. Jeśli odtwarzasz wynik liczbowy, zaznacz, którego endpointu użyłeś.

Pokrycie funkcji jest nierówne w zależności od dostawcy — oba endpointy udostępniają reasoning oraz reasoning_effort, więc pięciopoziomowy przełącznik myślenia działa. Ale tylko jeden reklamuje wywoływanie narzędzi i logprobs, a żaden obecnie nie reklamuje response_format, czyli parametr trybu strukturalnego wyjścia/JSON. Flagowy Inkling ma taki endpoint. Jeśli Twój potok zależy od wymuszonego przez schemat JSON, to ten szczegół da się we znaki pierwszego dnia, a jest to ograniczenie dostawcy, a nie modelu.

Pułap generowania — 262 144 tokeny na punkcie końcowym fp8; drugi nie deklaruje górnego limitu.

Przypadek kosztów, na podstawie zmierzonych liczb tokenów

Ceny za milion tokenów to zły sposób porównywania modeli rozumujących, bo cała zmienna to ile tokenów spalają na myślenie. Artificial Analysis publikuje rzeczywiste wydatki, co jest znacznie lepszym narzędziem: przeprowadzenie Inkling-Small przez pełny Indeks Inteligencji zużyło około 130M tokenów wyjściowych i kosztowało $192.37, co daje około $0.07 za zadanie przy ich średniej ważonej.

Porównaj to z tym samym pomiarem dla modeli, które ludzie faktycznie wdrażają: DeepSeek V4 Flash po $0.03 za zadanie, gpt-oss-120b po $0.08, Gemini 3.6 Flash po $0.56, GLM-5.2 po $0.57, Kimi K3 po $0.86, GPT-5.6 Sol po $1.23, Claude Opus 5 po $2.34, Claude Fable 5 po $3.15. Inkling-Small jest drugim najtańszym modelem w tej grupie i kosztuje około 18× mniej za zadanie niż GPT-5.6 Sol, który uzyskuje 59 punktów wobec 40.

Istnieje też bardziej przejrzysty sposób, aby zobaczyć, dlaczego cena spadła właśnie do tego poziomu. Liczba aktywnych parametrów spadła z 41B do 12B, czyli 3,4 razy. Cena wyjściowa spadła z 4,05 USD do 1,20 USD za milion, czyli 3,375 razy. Cena wynajmu rzadkiego MoE to w zasadzie tylko koszt obliczeń na token, a Thinking Machines wyceniło to odpowiednio, zamiast ustalać cenę na podstawie benchmarku.

Jedna praktyczna uwaga na temat przeprowadzenia tego porównania samodzielnie: Inkling-Small nie znajduje się dziś w katalogu OrcaRouter, więc wynajmowałbyś go za pośrednictwem jego własnych endpointów. Zamknięte modele, z którymi byś go porównywał — GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash i reszta tej listy — są w OrcaRouter dostępne pod jednym kluczem z 0% narzutem, co oznacza, że płacisz cenę katalogową każdego dostawcy bez żadnych doliczeń. To ma znaczenie szczególnie dla modelu kosztów: liczba, którą wpisujesz do arkusza, to liczba, która trafia na fakturę, a gdy dostawca obniża ceny, po naszej stronie pojawia się to tego samego dnia, a nie po renegocjacji. Automatyczne przełączanie awaryjne między dostawcami obejmuje drugą połowę ewaluacji, czyli ramię bazowe padające w trakcie działania i po cichu psujące twoje wyniki.

Gdzie tak naprawdę plasuje się wśród modeli open-weight

W zestawieniu z flagowcem Inkling-Small wypada jak triumf. W zestawieniu z resztą stawki to solidny model open-weights ze środka tabeli, a relacje z premiery w większości pominęły drugie odczytanie.

W indeksie Artificial Analysis Intelligence modele wyprzedzające oba Inklings to Claude Opus 5 (61), Claude Fable 5 (60), GPT-5.6 Sol (59), Kimi K3 (57), Grok 4.5 (54), GLM-5.2 i Muse Spark 1.1 (51) oraz Gemini 3.6 Flash (50). To oczekiwane — to systemy graniczne, większość z nich zamknięta, a kilka ogromnych.

To, co naprawdę powinno zmienić decyzję, to DeepSeek V4 Flash, który uzyskuje 50 punktów wobec 40 dla Inkling-Small przy 284B całkowitych i 13B aktywnych parametrów — praktycznie ta sama klasa rozmiaru i ta sama okazja w otwartych wagach, przy mniej niż połowie kosztu za zadanie. Jeśli szukasz najtańszego wydajnego modelu o otwartych wagach, niezależne liczby wskazują tam, a nie tutaj. Dodatkowo, w przeciwieństwie do Inkling-Small, jest dostępny przez OrcaRouter, więc przetestowanie tego wariantu na własnym obciążeniu to zmiana ciągu modelu, a nie procedura zakupowa.

To, co Inkling-Small ma, a czego nie ma DeepSeek V4 Flash, to natywne wejście audio i obrazu w tych samych wagach, pięciopoziomowe pokrętło myślenia oraz dostrajanie Tinker z laboratorium, które go wytrenowało. To realne wyróżniki dla agenta multimodalnego i uczciwy powód, aby go wybrać — a nie wynik indeksu.

Kto powinien się przeprowadzić, a kto zostać na miejscu?

Decyzja dzieli się wyraźnie, co jest na tyle niezwykłe, że warto to stwierdzić wprost.

Przejdź z Inkling na Inkling-Small, jeśli uruchamiasz agentów kodujących. Dane dostawcy faworyzują mały model na SWE-bench Verified i Terminal-Bench, udokumentowanym powodem jest dodatkowe agentowe uczenie ze wzmocnieniem (RL), a kosztuje on około jednej trzeciej i zwraca tokeny 1.66× szybciej. Płacenie 3.3× za jeden punkt indeksu mierzony przy maksymalnym wysiłku myślowym to trudna sprawa do uzasadnienia.

Przejdź na to, jeśli koszt zadania rozumowania jest ograniczeniem wiążącym i możesz pogodzić się z 40 na indeksie. $0.07 za zadanie przy wskaźniku trafień w pamięci podręcznej wynoszącym $0.06 za milion w endpointzie pierwszej strony to agresywna cena za model z natywnym dźwiękiem i wizją.

Przejdź, jeśli dostrajasz. Model 276B/12B jest znacznie tańszy w adaptacji i serwowaniu niż 975B/41B, a Tinker obsługuje oba.

Zostań przy Inklingu, jeśli potrzebujesz długiego audio. To najbardziej dotkliwa regresja w tej wersji i jest ukryta w kartach modeli: model flagowy zaleca wejścia audio poniżej 20 minut, podczas gdy karta Inkling-Small zaleca poniżej 2 minut. Dziesięciokrotne zmniejszenie. Jeśli transkrybowałeś lub analizowałeś spotkania, mały model nie jest zamiennikiem typu drop-in w żadnej cenie.

Zostań, jeśli potrzebujesz kontekstu przekraczającego 512K z hostowanego endpointu lub uzupełnień dłuższych niż 262K tokenów. Obecnie tylko flagowy model ma endpoint obsługujący pełny milion.

Zostań, jeśli potrzebujesz JSON-a z wymuszonym schematem bez pisania własnej pętli walidacji i ponawiania prób, dopóki dostawca nie udostępni response_format dla małego modelu.

Zostań, jeśli odporność na ataki adversarial jest kluczowa. 71,6% w porównaniu z 78,0% w FORTRESS adversarial to zły kierunek dla czegokolwiek, co jest skierowane do użytkownika, i jest to własny wynik laboratorium.

Trzy pytania, które relacja z premiery pozostawiła bez odpowiedzi

Czy Inkling-Small to po prostu zdestylowany Inkling?

Częściowo, a część, która nie jest — właśnie ta się liczy. Destylacja on-policy z Inklingiem jako nauczycielem była jednym z etapów post-treningu, więc spora część ogólnych możliwości jest rzeczywiście dziedziczona. To jednak model o osobnej architekturze — 42 warstwy wobec 66 w flagowcu, z tą samą topologią routingu: 6 aktywnych ekspertów spośród 256 plus 2 współdzielone, co oznacza, że eksperci są wężsi, a nie że jest ich mniej. Dostał też około dwóch tygodni agentowego RL do kodowania, którego nauczyciel nigdy nie otrzymał. To właśnie ten ostatni etap sprawia, że uczeń po destylacji przewyższa nauczyciela w benchmarkach kodowania, co w innym przypadku nie powinno mieć miejsca.

Czy realnie mogę to samodzielnie hostować?

Tylko na poważnym sprzęcie. 276B parametrów to mniej więcej 276 GB wag przy 8-bitach i około 552 GB w BF16, zanim uwzględni się jakąkolwiek pamięć podręczną KV — w obu przypadkach to węzeł z wieloma GPU, a nie stacja robocza. Zaletą rzadkiego MoE jest koszt wnioskowania, a nie zajętość pamięci; przechowujesz wszystkie 276B, a obliczenia wykonujesz na 12B. Karta wymienia SGLang, vLLM, TokenSpeed, Unsloth i Hugging Face Transformers jako obsługiwane ścieżki serwowania oraz podaje formaty BF16 i NVFP4. Zwróć też uwagę, że oba hostowane endpointy udostępniają obecnie wersję skwantowaną, więc „ten sam model” hostowany samodzielnie w BF16 nie będzie działał identycznie jak API, względem którego przeprowadziłeś testy.

Czy 975B Inkling nadal ma rację bytu?

Trzy, i wszystkie są wąskie: pełny kontekst 1M tokenów, wejścia audio dłuższe niż dwie minuty oraz lepsze zachowanie bezpieczeństwa wobec ataków. Co istotne, „jest mądrzejszy” nie znajduje się pewnie na tej liście — jeden punkt indeksu przy maksymalnym wysiłku myślowym, wobec zestawu benchmarków producenta, które mniejszy model w większości wygrywa, nie jest argumentem za możliwościami. Dwa tygodnie po premierze flagowego modelu 975B, Thinking Machines wypuściło model, który trudno polecić. To albo niezwykła szczerość, albo niezwykłe tempo, i w każdym razie to dobry znak dla laboratorium.

Co obejrzeć dalej

Trzy rzeczy przesądzą o tym, jak ta premiera się zestarzeje. Czy pojawi się endpoint obsługujący reklamowany kontekst 1M, co usunęłoby najwyraźniejszą pozostałą przewagę flagowca. Czy ktokolwiek opublikuje niezależne porównanie obu modeli przy wyrównanym nakładzie pracy, co jest jedynym sposobem, by sprawdzić, czy ten jeden punkt indeksu jest prawdziwy. Oraz czy rekomendacja 2-minutowego audio jest ograniczeniem treningowym, czy domyślnym ustawieniem serwowania — bo jeśli to drugie, znika największy powód, aby pozostać przy większym modelu. Do tego czasu uczciwe podsumowanie jest takie, że Thinking Machines wypuściło model, który kosztuje jedną trzecią ceny, jest o dwie trzecie szybszy, lepszy w kodowaniu według własnych danych, nieznacznie ustępuje w niezależnych zagregowanych wynikach i jest wyraźnie w tyle za rywalem tej samej wielkości, o którym większość relacji nie wspomniała.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube