Recenzja modelu Inkling AI: pierwszy model o otwartych wagach od Thinking Machines, przetestowany i wyjaśniony
Guides & Insights

Recenzja modelu Inkling AI: pierwszy model o otwartych wagach od Thinking Machines, przetestowany i wyjaśniony

Autor

Jim Song

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Ta recenzja modelu AI Inkling szczegółowo analizuje debiutanckie wydanie Thinking Machines Lab, startupu prowadzonego przez byłą CTO OpenAI, Mirę Murati. Inkling to model typu Mixture-of-Experts (MoE) z otwartymi wagami, multimodalny, z oknem kontekstowym o pojemności 1 miliona tokenów i regulowanym pokrętłem „wysiłku myślowego”. Jest szybki, tani w samodzielnym hostingu i zaprojektowany z myślą o dostosowywaniu, a nie dominacji na listach rankingowych. Poniżej oddzielamy deklarowane przez dostawcę benchmarki od niezależnych pomiarów, omawiamy architekturę, pokazujemy, jak go uruchomić, i wyjaśniamy, kto dokładnie powinien (a kto nie powinien) go wdrożyć.

Stan na: 2026-07-16 — jeden dzień po premierze. Jest to recenzja oparta na badaniach; nie istnieją jeszcze żadne długoterminowe testy praktyczne dla żadnego tak nowego modelu, a poniżej oznaczamy wszystkie niezweryfikowane dane.

Uwaga dla twórców: jeśli chcesz wypróbować Inkling wraz z innymi modelami, OrcaRouter udostępnia modele dostępne przez API za pomocą jednego punktu końcowego zgodnego z OpenAI, dzięki czemu możesz porównywać i przełączać się bez nowych integracji.

- TL;DR werdykt: Inkling to naprawdę zdolny i efektywny otwarty model, który doskonale sprawdza się w dostrajaniu i wdrożeniach wrażliwych na koszty, ale nie jest liderem na granicy możliwości, a jego twórca otwarcie to przyznaje. Jeśli szukasz dostosowywalnej, wolnej od opłat licencyjnych bazy z ogromnym oknem kontekstu, jest to jedna z najciekawszych premier 2026 roku. Jeśli chcesz mieć najsilniejszy dostępny model, poszukaj gdzie indziej.

- Co to jest: Model rozumowania MoE o otwartych wagach (Apache 2.0). Dla kogo: Praktycy, którzy chcą dostroić i samodzielnie hostować, zamiast płacić za zamknięte frontier API.

Najważniejsze wnioski

Twórca i data: Thinking Machines Lab; wydany 15 lipca 2026 roku jako pierwszy model laboratorium.

Architektura: Sparse MoE, 975B całkowitych / 41B aktywnych parametrów, 66 warstw, do 1M-tokenowego kontekstu w wagach (256K poprzez hostowane API).

Licencja: Apache 2.0 — pełne wagi na Hugging Face, darmowe do użytku komercyjnego i samodzielnego hostowania.

Uczciwe pozycjonowanie: Firma otwarcie stwierdza, że „nie jest to najmocniejszy model dostępny dzisiaj, zamknięty czy otwarty.”

Niezależny wynik: 41/100 na indeksie Artificial Analysis Intelligence — #10 z 97 modeli, i wyprzedza kilka otwartych modeli (patrz uzgodnienie poniżej).

Koszt: Wagi są wolne od opłat licencyjnych do samodzielnego hostowania; dostęp hostowany zaczyna się od około $1.87 / 1M tokenów wejściowych.

Zastrzeżenie: Prawie wszystkie główne benchmarki są samodzielnie raportowane przez dostawcę i nie są niezależnie audytowane.

Kto stoi za Inkling?

- Pudełko założyciela. Inkling to pierwszy model od Thinking Machines Lab (thinkingmachines.ai), założone przez Mira Murati, dawniej Chief Technology Officer w OpenAI. Laboratorium działało w względnej tajemnicy przed tą premierą i przyjęło stanowisko otwartych wag, które kontrastuje z podejściem zamkniętych flagowych modeli byłego pracodawcy Murati. Thinking Machines nie monetyzuje sam model – przychody płyną przez jego Tinker platformę do dostrajania i partnerów hostingowych zewnętrznych. Ten model biznesowy jest kluczowy dla zrozumienia Inkling: wagi są darmowym wejściem, a firma zarabia, gdy dostosowujesz lub skalowujesz.

Czym jest Inkling?

Inkling to model o otwartych wagach, multimodalny, Mixture-of-Experts, duży model językowy i rozumowania, ogłoszony przez Thinking Machines Lab 15 lipca 2026 roku i udostępniony na permisywnej Apache 2.0 licencji z pełnymi wagami na Hugging Face.

Tym, co wyróżnia tę premierę, jest sposób jej przedstawienia. Zamiast ubiegać się o koronę pioniera, Thinking Machines opisuje Inkling jako wszechstronny, wydajny i konfigurowalny otwarty model. W niezwykle szczerym jak na dzień premiery wyznaniu, firma stwierdza, że Inkling “nie jest najsilniejszym modelem dostępnym obecnie, ani zamkniętym, ani otwartym.” Ta szczerość nadaje ton całej tej recenzji: Inkling to narzędzie zaprojektowane do adaptacji, samodzielnego hostowania i dostrajania, a nie trofeum benchmarkowe.

Relacje z Fortune i TechCrunch potwierdziły tę ocenę. TechCrunch argumentował, że Inkling nie zagraża OpenAI, Anthropic ani Google na poziomie granicznym, ale wywiera presję na środkową warstwę dostawców hostingu otwartych wag i platform do dostrajania. Forbes określił strategię otwartych wag Muratiego jako bliższą chińskim otwartym modelom (DeepSeek, Qwen, Kimi) niż zamkniętym amerykańskim flagowym — narracja o otwartych wagach Stany Zjednoczone kontra Chiny, która przewija się przez większość komentarzy towarzyszących premierze.

Architektura i specyfikacje

Pod maską, Inkling jest rzadkim transformatorem mieszanki ekspertów. Tylko ułamek jego parametrów aktywuje się na token, co zapewnia efektywność wnioskowania pomimo dużej całkowitej liczby parametrów. Szczegóły są udokumentowane w oficjalnej karcie modelu i na blogu Hugging Face.

Łączna liczba parametrów: 975B

Aktywne parametry: 41B (rzadkie MoE)

Warstwy: 66-warstwowy transformator tylko z dekoderem

Eksperci: 256 routowanych + 2 współdzielone; 6 z 256 routowanych na token (2 współdzielone zawsze aktywne)

Kierowanie: Sigmoid / aux-loss-free

Uwaga: Hybrydowy, 5:1 przesuwne okno (lokalny) do globalnego; 8 głowic KV

Kodowanie pozycji: Uczone względne osadzenia pozycji (nie RoPE)

Multimodalność: bez enkodera — audio jako spektrogramy dMel, obrazy jako łatki 40×40, podawane bezpośrednio

Dodatki: Krótkie sploty (SConv); warstwy MTP do spekulacyjnego dekodowania

Numeryczne: BF16, MXFP8, NVFP4 (NVFP4 checkpoint for NVIDIA Blackwell)

Okno kontekstu: Do 1 000 000 tokenów w wagach (256K na hostowanych API)

Mniejszy wariant: Inkling-Small, 276B całkowite / 12B aktywne (podgląd, wagi jeszcze nie wydane)

Kilka wyborów projektowych odróżnia Inkling od zwykłego MoE:

Układ ekspertów. Z 256 routowanymi ekspertami plus 2 współdzielonymi ekspertami, i 6 routowanymi ekspertami aktywowanymi na token, współdzielona para działa jako zawsze włączony „zlew ekspertów”, który przechwytuje wspólne obliczenia, podczas gdy routowani eksperci się specjalizują. Routing sigmoidalny bez straty pomocniczej unika terminu kary za równoważenie obciążenia stosowanego w wielu projektach MoE.

Względne osadzenia pozycyjne, nie RoPE. Większość nowoczesnych modeli długiego kontekstu opiera się na osadzeniach wirowych; Inkling zamiast tego używa wyuczonych względnych osadzeń pozycyjnych, co jest nietypowym wyborem w tej skali.

Wielomodalność bez enkodera. Zamiast dołączać osobne enkodery wizji/dźwięku, Inkling wchłania 40×40 fragmenty obrazu oraz spektrogramy audio dMel bezpośrednio do stosu transformatorów. Upraszcza to potok i jest częścią powodu, dla którego model jest opisywany jako rodzimie multimodalny.

MTP dla spekulacyjnego dekodowania. Warstwy przewidywania wielu tokenów (MTP) działają jako wbudowany szkicownik, przyspieszając generowanie bez osobnego modelu szkicowego.

Uwaga redakcji — dodaj grafikę: Oznaczony schemat blokowy jednej warstwy Inkling — uwaga przesuwnego okna a uwaga globalna (5:1), router ekspertowy 256+2 z 6 aktywnymi ekspertami podświetlonymi, SConv oraz głowica draftująca MTP.

Trening i suwak „wysiłku myślowego”

Inkling został wstępnie wytrenowany na 45 bilionach multimodalnych tokenów obejmujących tekst, obrazy, audio i wideo, przy użyciu hybrydowego optymalizatora (Muon dla dużych wag macierzowych, Adam dla reszty) na systemach NVIDIA GB300 NVL72. Po treningu zastosowano zakrojone na szeroką skalę asynchroniczne uczenie przez wzmacnianie, które przekroczyło ponad 30 milionów rolloutów w ramach dwóch długich, ciągłych przebiegów, uruchomionych od początkowego nadzorowanego dostrajania na syntetycznych danych.

Charakterystyczną cechą jest sterowalny parametr wysiłku rozumowania, zademonstrowany w zakresie od około 0,2 do 0,99, gdzie wyższe wartości oznaczają więcej rozumowania i większy koszt. Pozwala to operatorom na wymianę opóźnienia i wydatków na głębokość myślenia. Wszystkie poniższe dane porównawcze zostały uruchomione przy Effort = 0.99.

Kontrolowalny wysiłek myślenia: przewodnik operacyjny

We wdrożeniu kontrola wysiłku jest udostępniana jako enum reasoning_effort z poziomami brak / minimalny / niski / średni / wysoki / bardzo wysoki / maksymalny. Nie ma jednego „właściwego” ustawienia — to aktywna dźwignia do kompromisu między opóźnieniem, kosztem a jakością. Skorzystaj z poniższej tabeli jako mapy początkowej (wskazówki względne; jakość na poziomie benchmarku została zmierzona na górze zakresu):

brak / minimalny. Względne opóźnienie & koszt tokenów: Najniższy; Najlepsze dla: Klasyfikacja, ekstrakcja, formatowanie, routing, klej do wyszukiwania

niski. Opóźnienie względne i koszt tokenów: Niski; Najlepsze do: Krótkie Q&A, proste streszczanie, zadania wsadowe o dużej objętości

średni. Względne opóźnienie i koszt tokenów: Umiarkowany; Najlepsze do: Ogólny czat, szkicowanie, większość wywołań narzędzi agenta

wysoki. Względne opóźnienie i koszt tokenów: Wyższy; Najlepsze dla: rozumowanie wieloetapowe, generowanie kodu, analiza

xhigh / maks. Względne opóźnienie i koszt tokenów: Najwyższe; Najlepsze dla: Trudna matematyka, rozumowanie w stylu konkursowym, parytet benchmarku (Effort=0.99)

Czy możesz uruchomić to lokalnie? Sprzęt i pamięć VRAM

Ponieważ Inkling to model o parametrach 975B, “lokalnie” oznacza w praktyce serwer z wieloma procesorami graficznymi, a nie laptop. Przybliżone wymagania (według relacji z premiery i narzędzi społecznościowych):

BF16 (pełna). Przybliżona łączna VRAM: ~2 TB; Przykładowe konfiguracje: 8× NVIDIA B300 lub 16× H200

NVFP4 (skwantowany). Ok. zagregowana pamięć VRAM: ~600 GB; Przykładowe konfiguracje: 4× NVIDIA B300 lub 8× H200

GGUF (społeczność). Przybliżona zagregowana pamięć VRAM: Zależy od kwantyzacji; Przykładowe konfiguracje: Istnieją wersje Unsloth GGUF dla mniejszych/kwantyzowanych wariantów

Punkt kontrolny NVFP4 — dostarczany specjalnie dla NVIDIA Blackwell — obniża koszty pamięci o około dwie trzecie w porównaniu z BF16, co stanowi różnicę między węzłem B300 z 8 procesorami GPU a węzłem z 4 procesorami GPU. Dla większości zespołów wciąż oznacza to skorzystanie z usług dostawcy hostingu lub wynajętego węzła GPU zamiast własnego sprzętu. Kwantyzacje Unsloth GGUF jeszcze bardziej obniżają próg wejścia w zakresie sprzętu do eksperymentów, kosztem pewnej jakości.

Szybki start wdrożenia

Inkling udostępnia API zgodne z OpenAI, więc większość istniejącego kodu klienckiego działa jako zamiennik po zmianie podstawowego adresu URL i nazwy modelu. Trzy popularne ścieżki serwowania:

vLLM — serwer jednokomendowy (domyślnie port 8000):

vllm serve thinkingmachines/Inkling --port 8000
# następnie wywołaj punkt końcowy kompatybilny z OpenAI pod adresem http://localhost:8000/v1

SGLang — podziel na 8 GPU (domyślnie port 30000):

python -m sglang.launch_server \
  --model-path thinkingmachines/Inkling \
  --tp 8 --port 30000

Hugging Face transformers – załadować przez multimodalną klasę auto:

z transformers importuj AutoModelForMultimodalLM, AutoProcessor

model = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
processor = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# podaj reasoning_effort w {none, minimal, low, medium, high, xhigh, max}

Ponieważ punkt końcowy jest zgodny z OpenAI, migracja istniejącej aplikacji zwykle sprowadza się do wskazania nowego podstawowego adresu URL w SDK i ustawienia reasoning_effort według uznania. Dodatkowe środowiska uruchomieniowe przy starcie to TokenSpeed i Unsloth.

Gdzie to uruchomić: dostępność dostawcy wnioskowania

Jeśli wolisz nie zarządzać GPU, kilku partnerów hostuje Inkling. Opcje „Uruchom Inkling na X” przy uruchomieniu:

Tinker (Thinking Machines). Rola: Dostrajanie; Notatki: Opcje kontekstu 64K i 256K; 50% ograniczona czasowo zniżka premierowa (płatna)

Together AI. Rola: Hostowane wnioskowanie; Uwagi: punkty końcowe zgodne z OpenAI

Fireworks. Rola: Hostowane wnioskowanie; Uwagi:

Modal. Rola: Wnioskowanie hostowane / GPU bezserwerowe; Uwagi:

Databricks. Rola: Hostowana inferencja; Uwagi: przez Unity AI Gateway

Baseten. Rola: Hostowane wnioskowanie; Uwagi:

Benchmarki: deklaracje producenta vs. niezależne pomiary

To jest najważniejsza część każdej uczciwej recenzji Inkling 2026, ponieważ liczby pochodzą z dwóch bardzo różnych miejsc.

Ujawnienie: Z wyjątkiem Artificial Analysis Index, każdy benchmark Inkling poniżej jest zgłoszony przez dostawcę przy premierze (Effort = 0.99, temperature 1.0) i ma nie został niezależnie audytowany. Liczby konkurencji pochodzą od stron trzecich (MarkTechPost, Artificial Analysis) lub zostały przeprowadzone ponownie przez Thinking Machines, i są podobnie nie niezależnie audytowane tutaj. Niektóre liczby posiadają kwalifikatory harness lub podzbioru. Traktuj je wszystkie jako kierunkowe, a nie jako ewangelię.

Wyniki samooceny dostawcy

Według własnych materiałów premierowych Thinking Machines:

AIME 2026 (matematyka): 97.1%

GPQA Diamond (rozumowanie naukowe): 87.2%

SWE-bench Verified (kodowanie, tylko bash): 77.6%

SWE-bench Pro (Public): 54.3%

MMMU Pro (multimodalny): 73,3%

VoiceBench (audio): 91.4%

MMAU (audio): 77.2%

IFBench (podążanie za instrukcjami): 79.8%

Terminal Bench 2.1 (agentowy terminal): 63.8

FORTRESS Adversarial: 78.0%

SimpleQA Zweryfikowano: 43.9%

Na papierze wyglądają solidnie, zwłaszcza wyniki w zakresie rozumowania matematycznego i naukowego. Ale firma porównała Inkling z nadchodzącymi wersjami konkurencji (GPT 5.6 Sol, Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Kimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra) korzystając z wyników, które sama wygenerowała. Te liczby konkurencji mogą nie odpowiadać danym podawanym przez rywali, dlatego bezpośrednie porównania należy traktować z ostrożnością.

Bezpośrednie porównanie wielu modeli (rywale z otwartymi wagami)

Najbardziej przejrzyste zestawienie porównawcze modelu Inkling z innymi modelami open-weight pochodzi z tabeli porównawczej MarkTechPost (odtworzone poniżej, z przypisaniem do MarkTechPost). Jest użyteczne właśnie dlatego, że umieszcza rywali w jednej ramce:

HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%

AIME 2026. Inkling: 97.1%; Nemotron 3 Ultra: 94.2%; Kimi K2.6: 96.4%; GLM 5.2: 99.2%; DeepSeek V4 Pro: 96.7%

SWE-bench Verified. Inkling: 77.6%; Nemotron 3 Ultra: 70.7%; Kimi K2.6: 80.2%; GLM 5.2: 80.0%; DeepSeek V4 Pro: 80.6%

Terminal Bench 2.1. Inkling: 63.8%; Nemotron 3 Ultra: 56.4%; Kimi K2.6: 71.3%; GLM 5.2: 82.7%; DeepSeek V4 Pro: 64%

FORTRESS (adversarial). Inkling: 78.0%; Nemotron 3 Ultra: 77.6%; Kimi K2.6: 65.6%; GLM 5.2: 71.3%; DeepSeek V4 Pro: 36.0%

Źródło: MarkTechPost. Nie audytowane niezależnie.

Wzorzec jest jasny i zgodny ze skromnością Thinking Machines. Inkling prowadzi w FORTRESS (bezpieczeństwo adwersarialne) i pokonuje Nemotron 3 Ultra we wszystkich dziedzinach, ale ustępuje GLM 5.2, Kimi K2.6 i DeepSeek V4 Pro w HLE, SWE-bench Verified, a zwłaszcza Terminal Bench 2.1 (63,8% wobec 82,7% GLM 5.2). Jeśli priorytetem są agentowe kodowanie i zadania terminalowe, to wiodące chińskie modele open source są dziś na czele.

Niezależny pomiar (Artificial Analysis)

Aby uzyskać bardziej neutralny odczyt, Artificial Analysis ocenił Inklinga w dniu 2026-07-15 i umieścił go na 41/100 w swoim Intelligence Index, zajmując #10 spośród 97 modeli. Dwa punkty dotyczące tego, jak sprawiedliwie odczytywać tę rangę:

To silne pokazanie otwartego modelu, a nie ogólne #1. Według Artificial Analysis, indeks Inklinga wynoszący 41 plasuje się przed Nemotron 3 Ultra (38), Gemma 4 31B (29) i gpt-oss-120b (24) — więc wśród modeli z otwartymi wagami jest konkurencyjny lub wiodący. Ale #10 z 97 oznacza, że dziewięć modeli plasuje się wyżej ogólnie, zgodnie z ramami „kompetentny, nie pionierski”.

Efektywność jest tym, w czym się wyróżnia. Artificial Analysis odnotowuje silną efektywność tokenów — około 25K tokenów do ukończenia swojego zestawu ewaluacyjnego wobec 37–43K dla modeli porównawczych — oraz GDPval-AA v2 Elo na poziomie 1238, przed Kimi (1190) i DeepSeek V4 Flash (1189), plus niewielką przewagę (+2) w AA-Omniscience.

Zmierzona prędkość wyjściowa wynosi 72,7 tokenów na sekundę z czasem do pierwszego tokenu 1,75 s. Krótko mówiąc: szacowne miejsce w pierwszej dziesiątce i naprawdę wydajne rozwiązanie — ale celowo nie przedstawiamy tego jako zwycięstwo w rankingu.

Możliwości multimodalne i długiego kontekstu

Inkling akceptuje tekst (UTF-8), obrazy (od 40px do 4096px za pomocą hierarchicznego enkodera kafelków) oraz dźwięk (16kHz WAV, do około 20 minut, z użyciem dyskretnego kodowania tokenów). Wynik to tylko tekst — nie ma generowania obrazów ani dźwięku, więc zaplanuj model rozumienia, a nie generowania. Wideo było używane podczas wstępnego uczenia, ale nie jest obsługiwanym ani ocenianym wejściem w momencie uruchomienia, więc jeszcze nie planuj na jego podstawie.

Główną wyróżniającą cechą jest okno kontekstowe o pojemności 1 miliona tokenów w opublikowanych wagach, które otwiera drzwi do analizy kodu w skali całego repozytorium, syntezy długich dokumentów i rozszerzonych sesji wieloetapowych agentów bez agresywnego dzielenia na fragmenty. Warto zwrócić uwagę na praktyczny niuans: hostowane API udostępniają do 256 tys. tokenów, więc pełny 1 milion to na ten moment funkcja dostępna w przypadku samodzielnego hostowania. W połączeniu z konstrukcją przesuwnego okna uwagi (sliding-window attention) i dekodowaniem spekulatywnym (speculative decoding) historia długiego kontekstu pozostaje jednym z najbardziej praktycznych atutów Inkling.

Ceny, poziomy i całkowity koszt posiadania

Inkling jest prawdziwie otwarty. Pełne wagi (punkt kontrolny BF16 plus punkt kontrolny NVFP4) są na Hugging Face na licencji Apache 2.0, więc samodzielne hostowanie jest wolne od opłat licencyjnych — płacisz tylko za moc obliczeniową. Thinking Machines nie monetyzuje samego modelu; przychody płyną przez Tinker i hosty zewnętrzne.

Hostowane ceny za token (według Artificial Analysis), według poziomu kontekstu:

64K. Wejście / 1M: $1.87; Wejście z pamięci podręcznej / 1M: $0.374; Wyjście / 1M: $4.68

256K. Wejście / 1M: $3.74; Wejście w cache / 1M: $0.748; Wyjście / 1M: $9.36

Odzwierciedla ograniczony czasowo 50% rabat launchowy; dokładne liczby Tinker dotyczące tokenów znajdują się w dokumentacji i ulegną zmianie.

Self-host vs API — jak myśleć o TCO. Ekonomia opiera się na wolumenie i wykorzystaniu:

API (Tinker / partnerzy): zero stałych kosztów, płać za token, prawie natychmiastowy start. Najlepsze przy niskim lub skokowym wolumenie, lub podczas prototypowania.

Samodzielne hostowanie (wynajęte lub własne GPU): płacisz za węzeł z 4–8 GPU, niezależnie od tego, czy jest zajęty, ale marginalny koszt tokena zbliża się do surowego kosztu energii elektrycznej. Ponieważ Inkling aktywuje tylko 41B parametrów i jest wydajny tokenowo (~25K vs 37–43K według zestawu Artificial Analysis), przepustowość na godzinę GPU jest korzystna, a ciężkie, stałe obciążenia mogą być znacznie tańsze niż ceny API za token, gdy węzeł jest dobrze wykorzystany. Komentarze wokół premiery określały samodzielne hostowanie otwartych wag jako około 40–60% tańsze niż porównywalne użycie zamkniętego API na dużą skalę — to stwierdzenie kierunkowe, a nie zweryfikowana liczba.

Uwaga redaktora — dodaj wizualizację: Wykres progu rentowności — miesięczna liczba tokenów (x) a całkowity koszt (y) z trzema liniami: closed frontier API, Inkling hosted API oraz Inkling self-hosted na wynajętym węźle GPU — pokazujący punkt przecięcia, przy którym samodzielne hostowanie wygrywa.

Bezpieczeństwo, dostosowanie i cenzura

Bezpieczeństwo to jedna z mocniejszych i bardziej wyróżniających się historii Inklinga. Na FORTRESS adversarialbenchmarku uzyskuje wynik78.0%najlepszy wśród modeli open-weight w porównaniu MarkTechPosta, przed GLM 5.2 (71.3%), Kimi K2.6 (65.6%) i daleko przed DeepSeek V4 Pro (36.0%). Thinking Machines również podkreśla skalibrowaną niepewność w wynikach modelu.

Relacja VentureBeat podkreśliła powiązaną właściwość: odporność na cenzurę. W połączeniu z permisywną licencją Apache 2.0, pozycjonuje to Inkling jako otwarty model, który zespoły mogą dostosować do własnych zasad, zamiast dziedziczyć nieprzejrzysty, narzucony przez dostawcę reżim treści — istotne rozważenie dla regulowanych lub regionalnych wdrożeń. Jak zawsze w przypadku modelu w dniu premiery, żaden niezależny red-team ani audyt bezpieczeństwa od stron trzecich nie pojawił się w momencie pisania, więc traktuj oznaczenie FORTRESS jako pochodzące od dostawcy/strony trzeciej, a nie certyfikowane zewnętrznie.

Czy powinieneś dostroić Inkling?

Dostrajanie to prawdopodobnie powód istnienia Inkling. Szybki framework decyzyjny:

Dostrój (przez Tinker lub własny potok) jeśli: masz zastrzeżone dane, wąską dziedzinę lub zadanie, w którym mniejszy wyspecjalizowany model pokonuje ogólny; musisz posiadać wagi; lub chcesz wbudować konkretny ton, format lub politykę. Opcje kontekstu 64K/256K Tinker i zniżka startowa obniżają barierę.

Używaj po prostu modelu podstawowego (self-host lub API), jeśli: twoje zadanie jest ogólnego przeznaczenia, masz małą objętość danych lub nie potwierdziłeś jeszcze, że dostrajanie poprawia twój wskaźnik. Inżynieria promptów wraz z pokrętłem reasoning_effort często wystarcza.

Poszukaj gdzie indziej, jeśli: potrzebujesz najnowocześniejszego kodowania agentowego już dziś (GLM 5.2 i Kimi K2.6 prowadzą w tych benchmarkach) lub wymagasz niezależnie audytowanych gwarancji jakości.

Zalety i wady

Zalety

W pełni otwarte wagi na podstawie Apache 2.0, bez opłat licencyjnych do samodzielnego hostowania i bezpłatne do użytku komercyjnego.

Wydajny rzadki MoE (tylko 41B aktywnych) plus silna efektywność tokenów utrzymuje koszt i szybkość wnioskowania na konkurencyjnym poziomie.

Ogromny 1M-token kontekst w wagach (256K przez API).

Prawdziwa multimodalność (tekst, obraz, dźwięk wejście).

Regulowany suwak nakładu rozumowania (brak → maksimum) dla bieżących kompromisów między kosztem a jakością.

Najlepsze w swojej klasie bezpieczeństwo adversarialne o otwartych wagach (FORTRESS 78,0%, według MarkTechPost) oraz „odporność na cenzurę”.

Silna samodzielna pozycja — w pierwszej dziesiątce z 97 w Indeksie Artificial Analysis, przed Nemotron 3 Ultra, Gemma 4 31B i gpt-oss-120b.

Wady

Wyraźnie nie model graniczny, według własnego przyznania twórcy.

Trails wyprzedza otwartych rywali (GLM 5.2, Kimi K2.6, DeepSeek V4 Pro) w benchmarkach agentowych i kodowania (Terminal Bench 2.1, SWE-bench Verified, HLE).

Większość benchmarków jest zgłaszana przez dostawców i nie jest niezależnie audytowana.

Tylko tekst na wyjściu; brak generowania obrazów/dźwięku; brak wejścia wideo na starcie; Inkling-Small wciąż w wersji preview.

Prawdziwe „lokalne” użycie wymaga węzła z wieloma GPU (~600 GB VRAM nawet po kwantyzacji).

W momencie premiery nie pojawiła się żadna merytoryczna, niezależna krytyczna recenzja ani ocena bezpieczeństwa/zespołu red-team.

Kto powinien używać Inkling?

Inkling jest dobrym wyborem, jeśli jesteś praktykiem lub zespołem, który chce posiadać i dostosowywać swój model zamiast wynajmować zamknięte API. Idealne przypadki użycia obejmują:

Zespoły dostrajające budujące modele specyficzne dla domeny za pomocą Tinker lub własnego potoku.

Wdrożenia wrażliwe na koszty i o dużej skali gdzie samodzielne hostowanie bez opłat licencyjnych przewyższa ceny graniczne za token.

Obciążenia długiego kontekstu takie jak pomoc w kodzie na poziomie repozytorium, analiza dokumentów i długie sesje agentów.

Aplikacje multimodalne wymagające połączonego zrozumienia tekstu, obrazu i dźwięku.

Wdrożenia wrażliwe na politykę chcące dostosować się do otwartej bazy o silnym bezpieczeństwie i odpornej na cenzurę.

To słabe dopasowanie, jeśli potrzebujesz absolutnie najsilniejszego rozumowania lub wydajności kodowania agentowego, potrzebujesz wejścia wideo lub wyjścia generatywnego, albo wymagasz niezależnie audytowanych benchmarków przed wdrożeniem.

Werdykt i ocena końcowa

Zajmijmy się bezpośrednio słoniem w pokoju: Inkling nie jest najsilniejszym modelem dostępnym obecnie, a Thinking Machines mówi dokładnie to. Czytając cynicznie, jest to niska poprzeczka. Czytając uczciwie, to jest cały sens — Inkling jest zoptymalizowany do innego celu niż bycie na szczycie tabeli. Jest wydajny (41B aktywnych, budżety zadań ~25K tokenów), otwarcie licencjonowany (Apache 2.0), bezpieczny według standardów wag otwartych (FORTRESS 78%) i zaprojektowany do dostrajania i samoobsługi. To połączenie czyni go jednym z bardziej przemyślanych uruchomień otwartych modeli w 2026 roku, nawet jeśli pozostaje w tyle za GLM 5.2 i Kimi K2.6 w najtrudniejszych benchmarkach agentowych i kodowania.

Pozostałe gwiazdki to w dużej mierze samodzielnie raportowane benchmarki i brak jakiejkolwiek niezależnej krytycznej recenzji tak wcześnie. Ale dla zamierzonej publiczności – budowniczych, którzy cenią sobie własność, dostosowanie, kontrolę kosztów i ogromne okno kontekstu ponad graniczne przechwałki – Inkling dostarcza.

Ocena: 4 na 5 dla swojej docelowej grupy odbiorców, czyli budowniczych i dostrajaczy; niższa, jeśli szukasz wyłącznie najwyższych możliwości.

Często zadawane pytania

Czym jest Inkling i kto go stworzył? Inkling to pierwszy model Thinking Machines Lab, startupu AI kierowanego przez Mirę Murati (byłą CTO OpenAI). Został uruchomiony 15 lipca 2026 roku jako otwarty, multimodalny model rozumowania typu Mixture-of-Experts.

Czy Inkling jest najlepszym modelem AI?Nie, a firma nie twierdzi, że tak jest — podaje, że Inkling „nie jest najsilniejszym modelem dostępnym dziś, zamkniętym ani otwartym.” Niezależny pomiar (Artificial Analysis) klasyfikuje go na 10. miejscu spośród 97 ogólnie, choć wyprzedza kilka otwartych modeli.

Ile parametrów ma Inkling i jaki jest rozmiar okna kontekstowego? Łącznie 975B z 41B aktywnymi (rzadki MoE), w 66 warstwach. Okno kontekstowe wynosi do 1 000 000 tokenów w wydanych wagach i do 256K w hostowanych API.

Czy Inkling jest open source i jaka jest licencja? Wagi są udostępnione na licencji Apache 2.0, która zezwala na użycie komercyjne i samodzielne hostowanie. Są to „otwarte wagi” — pełne wagi modelu znajdują się na Hugging Face.

Czy Inkling jest darmowy w użyciu? Wagi są bezpłatne i wolne od opłat licencyjnych do samodzielnego hostowania. Dostrajanie na Tinker oraz hostowane wnioskowanie przez dostawców takich jak Together AI, Fireworks, Modal, Databricks czy Baseten to płatne usługi. Dostęp hostowany zaczyna się od około $1.87 / 1M tokenów wejściowych (promocja limitowana czasowo z okazji premiery).

Jak uruchomić lub pobrać Inkling oraz jakiego sprzętu potrzebuję?Pobierz wagi z Hugging Face i serwuj je za pomocą vLLM, SGLang lub Hugging Face transformers przez API zgodne z OpenAI. Spodziewaj się około ~2 TB łącznej pamięci VRAM dla BF16 (8× B300 / 16× H200) lub ~600 GB dla skwantyzowanego punktu kontrolnego NVFP4 (4× B300 / 8× H200). Społecznościowe wersje Unsloth GGUF obniżają próg eksperymentowania.

Jak dostroić Inkling? Użyj Thinking Machines’ Tinker platformy, która oferuje opcje kontekstu 64K i 256K oraz limitowaną promocję startową 50%, lub dostrój otwarte wagi we własnym potoku.

Co to jest kontrolowany wysiłek myślowy? Ustawienie reasoning_effort (none / minimal / low / medium / high / xhigh / max), które wymienia opóźnienie i koszt tokenów na głębokość rozumowania. Niski wysiłek nadaje się do klasyfikacji i ekstrakcji; maksymalny wysiłek nadaje się do trudnych zadań matematycznych i odpowiada konfiguracji benchmarku (Effort=0.99).

Jak Inkling wypada w porównaniu z Kimi, GLM, DeepSeek i Nemotron?Według porównania MarkTechPost, Inkling prowadzi w FORTRESS (bezpieczeństwo) i ogólnie pokonuje Nemotron 3 Ultra, ale ustępuje GLM 5.2, Kimi K2.6 i DeepSeek V4 Pro w Terminal Bench 2.1, SWE-bench Verified i HLE. Jest konkurencyjny, ale nie jest najsilniejszym otwartym modelem w zakresie kodowania agentowego.

Czy Inkling może przetwarzać obrazy, dźwięk i wideo? Przyjmuje tekst, obrazy (40px–4096px) i dźwięk (16 kHz WAV, do ~20 minut) jako wejście. Wynik to tylko tekst — brak generowania obrazów lub dźwięku. Wideo było używane podczas wstępnego trenowania, ale nie jest obsługiwanym wejściem przy uruchomieniu.

Czy wyniki testów porównawczych Inkling są wiarygodne? Traktuj je ostrożnie. Oprócz niezależnego Artificial Analysis Intelligence Index, główne liczby są samodzielnie raportowane przez sprzedawców przy premierze i nie są niezależnie audytowane. Dane konkurencji pochodzą od stron trzecich (MarkTechPost) lub zostały ponownie przetworzone przez Thinking Machines i mogą nie odpowiadać liczbom podawanym przez rywali.

Czym jest Inkling-Small i co znajduje się na roadmapie? Inkling-Small to mniejszy wariant (276B całkowitych / 12B aktywnych). W momencie premiery był jeszcze w wersji preview, a wagi nie zostały jeszcze wydane. Główny model już posiada warstwy MTP do spekulatywnego dekodowania.



Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube