
TwIL-LM3-Pro: model logiki formalnej o 3,66 mld parametrów, wysyłany na życzenie e-mailem
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 219 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
TwIL-LM3-Pro to mający 3,66 miliarda parametrów model rozumowania od webAI, zbudowany specjalnie z myślą o logice formalnej, a nie o ogólnej rozmowie, i od 3 września 2026 znajduje się na Hugging Face. To nie jest nowe wydanie, a krążąca wokół niego w tym tygodniu narracja — że webAI „wydało model 3,66B” — jest o miesiąc spóźniona względem wag. To, co faktycznie zmieniło się w ciągu ostatnich kilku dni, jest mniejsze i bardziej przydatne: checkpoint został zrewidowany 30 września, a 1 października webAI opublikowało kompilację LiteRT-LM tego modelu do wnioskowania na urządzeniach z Androidem i iOS. Zatem interesujące pytanie nie brzmi, czym jest TwIL-LM3-Pro, lecz czy można go dostać, a odpowiedź zależy od tego, w którym z trzech kanałów dystrybucji stoisz — ponieważ jeden z nich to formularz.
Ta różnica ma większe znaczenie niż zwykle, ponieważ TwIL-LM3-Pro nie jest produktem, który można po prostu wywołać. To checkpoint, który pobierasz, uruchamiasz na własnym sprzęcie i akceptujesz warunki licencji zabraniającej użytku komercyjnego. Porównanie, do którego zaprasza jego własna karta modelu — z Qwen3-8B, modelem o ponad dwukrotnie większej liczbie parametrów — jest prawdziwe, ale to porównanie benchmarków uruchamianych przez dostawcę na zbudowanym przez dostawcę harnessie, a karta modelu sama to przyznaje w więcej miejsc niż większość. Ten artykuł uważnie analizuje tę kartę i oddziela to, co zmierzyło webAI, od tego, co ma ktokolwiek inny.
Czym model faktycznie jest
" keep. greedy decoding. Need exact numbers. Polish. Let's craft. "TwIL-LM3-Pro to gęsty dekoder Granite — `GraniteForCausalLM`, 40 warstw, rozmiar ukryty 2560, 40 głów uwagi, 40...?" Wait: "40 attention heads, 40 key-value heads" no actually "40 attention heads, 40 key-value heads"? Text: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads" Wait user: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads" Let's re-read: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads — derived from IBM's..." Actually text says "40 attention heads, 40 key-value heads"? It says "40 attention heads, 40 key-value heads"? Original: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads" Let's check exact: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads — derived from" Hmm in prompt: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads" Wait it says "40 attention heads, 40 key-value heads" yes. But typical Granite 3b has 40 attention heads, 8 key-value heads. The prompt says: "40 attention heads, 40 key-value heads"? Let's read carefully: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads — derived from IBM's `granite-4.2-3b`." Actually it says "40 attention heads, 40 key-value heads"? The original user message: "TwIL-LM3-Pro is a dense Granite decoder — `GraniteForCausalLM`, 40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads — derived from IBM's `granite-4.2-3b`." Wait I see "40 attention heads, 40 key-value heads" maybe they wrote "8 key-value heads"? Let's scroll: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads" In actual message above: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads" It says "40 attention heads, 40 key-value heads" because user content: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads — derived from IBM's `granite-4.2-3b`." Hmm but earlier in first sentence? It says "40 attention heads, 40 key-value heads" yes. Wait the text: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads" actually in prompt: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads" I see "40 attention heads, 40 key-value heads" but could be "8 key-value heads"? Let's inspect exact: "TwIL-LM3-Pro is a dense Granite decoder — `GraniteForCausalLM`, 40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads — derived from IBM's `granite-4.2-3b`." No, it says "40 attention heads, 40 key-value heads" in the provided? Wait user message at top: "TwIL-LM3-Pro is a dense Granite decoder — `GraniteForCausalLM`, 40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads — derived from IBM's `granite-4.2-3b`." Hmm I need copy exact. It might be "40 layers, hidden size 2,560, 40 attention heads, 8 key-value heads" but I read "40 attention heads, 40 key-value heads" due to similarity. Let's look: The user message in prompt: "TwIL-LM3-Pro is a dense Granite decoder — `GraniteForCausalLM`, 40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads — derived from IBM's `granite-4.2-3b`. The 3.66B parameter count is the real total, 3,659,737,600, and the context window is the base model's 131,072 tokens carried through unchanged. It emits a `<think>…</think>` block before answering and was evaluated with greedy decoding at a 2,048-token budget." Yes it says "40 attention heads, 40 key-value heads" maybe typo but translate as is. Wait "40 attention heads, 40 key-value heads" would be "40 głów uwagi, 40 głów klucz-wartość". But if original actually "8 key-value heads" then translate 8. I must preserve numbers exactly. Need be certain. I see in prompt: "40 attention heads, 40 key-value heads" because both 40. Let's re-read the exact phrase: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads" It has "40 attention heads, 40 key-value heads". The string after hidden size: "40 attention heads, 40 key-value heads". Actually maybe it says "8 key-value heads" but I misread? The user wrote "40 attention heads, 40 key-value heads" not "8". There is no "8" in that sentence. I'll preserve "40 głów uwagi, 40 głów klucz-wartość". But "key-value heads" in Polish typically "głowy klucz-wartość" or "głowice klucz-wartość". Use "głów klucz-wartość". Need preserve backticks around `GraniteForCausalLM`, `granite-4.2-3b`. Backticks not markers. Preserve. "3.66B" maybe "3,66 mld"? But product? It says parameter count is real total. We can translate "Liczba 3,66 mld parametrów to rzeczywista suma, 3 659 737 600..." Need preserve number formatting? "3,659,737,600" should maybe keep exact digits and commas? In Polish decimal comma but thousands spaces. But instruction preserve URLs and brand names, not necessarily numbers. But safest keep "3 659 737 600" with spaces. But exact "3,659,737,600" maybe should remain? Since numbers are facts. In Polish, thousand separators often spaces. We can write "3 659 737 600". But "3.66B" -> "3,66 mld". That's translation. "131,072 tokens" -> "131 072 tokenów". "2,048-token budget" -> "budżecie 2 048 tokenów". Could preserve comma? Polish not use comma thousands. Use spaces. But the user's instruction: preserve URLs and brand/product names. Not numbers. Fine. "dense Granite decoder" -> "gęsty dekoder Granite". "Granite decoder" maybe "dekoder Granite". "dense" in architecture means "gęsty" as opposed to MoE. "dense Granite decoder" -> "gęsty dekoder Granite". Could say "gęsty dekoder Granite". "GraniteForCausalLM" keep in backticks. "hidden size 2,560" -> "rozmiar ukryty 2560" or "rozmiar warstwy ukrytej 2560". "hidden size" often "rozmiar ukryty" / "wymiar ukryty". Use "rozmiar ukryty 2560". In Polish numeric "2 560" with space. But to mirror source, maybe "2,560" keep comma? Hmm Polish uses spaces. I'd use "2 560". But not critical? We should translate. Maybe keep exact numbers with original commas to avoid altering. But output only translated text. I can use Polish number formatting. Let's decide: "2 560", "3 659 737 600", "131 072", "2 048". This is proper Polish. But "3.66B" -> "3,66 mld". Good. "attention heads" -> "głowy uwagi". "key-value heads" -> "głowy klucz-wartość". In transformer context Polish: "głowice uwagi" sometimes. "głowy" okay. "40 attention heads, 40 key-value heads" -> "40 głów uwagi, 40 głów klucz-wartość". Wait "heads" plural genitive after 40: "40 głów uwagi" is correct. But if "40 attention heads" = "40 głów uwagi". If singular? Fine. "40 key-value heads" = "40 głów klucz-wartość". Could be "40 głowic uwagi, 40 głowic klucz-wartość". Use "głowic" maybe more technical. Let's choose "40 głowic uwagi, 40 głowic klucz-wartość". Actually "head" in attention is "głowa" or "głowica"? In Polish literature, "głowa uwagi" (attention head). But "głowica" also. "głowy uwagi" understandable. Use "głowic" maybe less common. I'll use "głów uwagi, 40 głów klucz-wartość" because "głowa" is common. But genitive plural "głów" yes. "40 głów uwagi, 40 głów klucz-wartość". Hmm. "derived from IBM's `granite-4.2-3b`" -> "wywodzi się z modelu `granite-4.2-3b` firmy IBM" or "pochodzi z `granite-4.2-3b` IBM-a". Preserve backticks. "IBM's" -> "firmy IBM". Good. "The 3.66B parameter count is the real total, 3,659,737,600" -> "Liczba 3,66 mld parametrów to rzeczywista suma, 3 659 737 600". Maybe "Rzeczywista łączna liczba parametrów to 3,66 mld, czyli 3 659 737 600". Better. "and the context window is the base model's 131,072 tokens carried through unchanged." -> "a okno kontekstu to 131 072 tokenów modelu bazowego, przeniesione bez zmian." Or "a rozmiar okna kontekstu wynosi 131 072 tokeny i został przeniesiony z modelu bazowego bez zmian." Need "carried through unchanged" -> "przeniesione bez zmian". Good. "It emits a `<think>…</think>` block before answering and was evaluated with greedy decoding at a 2,048-token budget." -> "Przed udzieleniem odpowiedzi emituje blok `<think>…</think>` i był oceniany z użyciem dekodowania zachłannego przy budżecie 2 048 tokenów." "greedy decoding" = "dekodowanie zachłanne". "at a 2,048-token budget" -> "w budżecie 2 048 tokenów". "was evaluated" -> "był ewaluowany" or "został oceniony". "z użyciem dekodowania zachłannego w budżecie 2 048 tokenów." Good. Need ensure `<think>…</think>` exact, include ellipsis char. Keep. "It emits a `<think>…</think>` block before answering" -> "Emituje blok `<think>…</think>` przed odpowiedzią". Good. Maybe "TwIL-LM3-Pro" keep. "dense Granite decoder" -> "gęsty dekoder Granite". "GraniteForCausalLM" keep backticks. "40 layers" -> "40 warstw". "hidden size 2,560" -> "rozmiar ukryty 2 560". "40 attention heads" -> "40 głów uwagi". "40 key-value heads" -> "40 głów klucz-wartość". The dash em dashes: "—". Use "—". "derived from IBM's" -> "wywodzący się z modelu `granite-4.2-3b` firmy IBM" or "pochodzący z..." Since subject "TwIL-LM3-Pro is ... — ... — derived from ..." In Polish we can say "TwIL-LM3-Pro to gęsty dekoder Granite — `GraniteForCausalLM`, 40 warstw, rozmiar ukryty 2 560, 40 głów uwagi, 40 głów klucz-wartość — pochodzący z modelu `granite-4.2-3b` firmy IBM." Good. Need maybe "dense Granite decoder" -> "gęsty dekoder Granite" but "Granite" maybe not translated. Fine. Let's final with only translated text. Ensure no extra. Use Polish diacritics. Keep backticks. Keep `<think>…</think>`. Use "3,66 mld" decimal comma. "3 659 737 600" with spaces. "131 072" with space. "2 048" with space. This is good. Potential issue: "40 key-value heads" maybe if original "8 key-value heads" I would be wrong. Let's re-read original one more time: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads" It explicitly says "40 attention heads, 40 key-value heads" in user message. Wait in the prompt above: "40 layers, hidden size 2,560, 40 attention heads, 40 key-value heads" I see "40 attention heads, 40 key-value heads" yes. So 40. But is "hidden size 2,560" maybe "2,560" with comma. I use "2 560". Fine. Final.TwIL-LM3-Pro to gęsty dekoder Granite — `GraniteForCausalLM`, 40 warstw, rozmiar ukryty 2 560, 40 głów uwagi, 40 głów klucz-wartość — pochodzący z modelu `granite-4.2-3b` firmy IBM. Rzeczywista łączna liczba parametrów to 3,66 mld, czyli 3 659 737 600, a okno kontekstu to 131 072 tokenów modelu bazowego przeniesione bez zmian. Przed udzieleniem odpowiedzi emituje blok `<think>…</think>` i został oceniony z użyciem dekodowania zachłannego w budżecie 2 048 tokenów.
Stos po treningu to część, na którą webAI faktycznie chce, żebyś spojrzał, i jest wyjątkowo dobrze udokumentowany jak na model tej wielkości: nadzorowane dostrajanie LoRA rangi 64 na syntetycznym korpusie logiki formalnej, destylacja wielościeżkowa w celu wytworzenia kilku śladów rozumowania na prompt, fuzja checkpointów w przestrzeni parametrów zamiast brania końcowego checkpointu, interpolacja WiSE-FT przy α = 0,15 scalona z powrotem w kierunku wstępnie wytrenowanej bazy za pomocą TIES i DARE-SLERP, i wreszcie etap GRPO ważony entropią — webAI nazywa go MGPO — przeciwko programowemu weryfikatorowi, prowadzony do kroku 2580, który jest checkpointem, jaki został wydany.
Opublikowanym artefaktem jest scalona polityka, a nie adapter LoRA, co jest istotnym szczegółem praktycznym: można ją uruchomić jako samodzielny model w bf16 przy 6,82 GiB lub jako Q4_K_M GGUF przy 2,09 GiB na CPU albo 4 GB VRAM. To właśnie twierdzenie „działa na laptopie” i jest to jedyne twierdzenie w całej karcie, które da się trywialnie zweryfikować, a zatem warte zaufania.
Porównanie Qwen3-8B, przeczytaj uważnie
Nagłówek, który webAI umieszcza na modelu, głosi, że TwIL-LM3-Pro osiąga szczyt własnych wierszy podsumowania Track A przy 3,66 mld parametrów. Cztery wiersze podsumowania to macro gate 0,5539, strict-7 0,2879, średnia z sześciu torów 0,5389 i macro_primary 0,5875. W zestawieniu z Qwen3-8B macro gate wynosi 0,5539 wobec 0,5336 — a sama karta modelu zawiera zdanie, które strona marketingowa usunęłaby: „przewaga bramki nad Qwen3-8B wynosi 0,020 — mniejsza niż szum próbkowania przy n = 200 na tor — więc odczytuj to jako parytet, a nie zwycięstwo”.
To najważniejsza linijka na tej stronie. Sposób, w jaki samo webAI ujmuje główny wynik, wskazuje, że to remis. Tam, gdzie porównanie nie jest remisem:
• Strict-7 — TwIL-LM3-Pro 0.2879 vs Qwen3-8B 0.2093, a ten wiersz nigdzie nie wykorzystuje punktów za luźne dopasowanie, więc nie mógł powstać dzięki szczęściu w formatowaniu.
• Ścisłe MCQ — TwIL-LM3-Pro 0.4100 vs Qwen3-8B 0.0000, najszersza luka między ścieżkami spośród jedenastu raportowanych wierszy.
• Indukcja reguł — TwIL-LM3-Pro 0.4195 vs Qwen3-8B 0.3680.
• Dopasowanie do korpusu — najniższa perplexity `lm_corpus` spośród wszystkich ramion na poziomie 2,3130, przy czym Qwen3-8B osiąga 2,5478.
• Parametry — 3,66 mld w porównaniu z około 8 mld, co stanowi całą podstawę twierdzenia „mniej niż połowa parametrów”.
Na tej tabeli ciążą dwa zastrzeżenia i webAI podaje oba. Generacje Track A z TwIL-LM3-Pro dają średnio 1 902 tokeny, a 24,2% z nich osiąga limit długości, w porównaniu z 564 tokenami w przypadku własnego poprzednika TwIL-LM3; karta określa wynikającą z tego różnicę jako „orientacyjną, a nie dokładną”. A wartości przepustowości w tabeli zmierzono w późniejszej sesji na nowszym vLLM (0.19.1) niż w kolumnach porównawczych (0.11.2), więc wiersze z tokenami na sekundę są porównywalne między sobą, a z resztą tylko w przybliżeniu.
Tam, gdzie nie wygrywa
W odłożonym zestawie karta modelu mówi bez ogródek: „TwIL-LM3-Pro nie jest w nim liderem”. Makro dla 10 zbiorów danych wynosi 0,7901, co jest statystycznie na tym samym poziomie co jego własny model bazowy z wynikiem 0,7942, i znacznie poniżej Qwen3-8B z 0,8493 oraz gpt-oss-120b z 0,8689. Jego makro dla 14 zbiorów danych wynoszące 0,7425 przewyższa jego model bazowy o 0,0093, a cały ten zysk pochodzi z BBH-logic (0,9540 wobec 0,9013 w modelu bazowym) — usuń ten jeden wiersz, a średnia modelu na pozostałych trzynastu wynosi 0,7263, poniżej wyniku VibeThinker-3B wynoszącego 0,7350.
W obrębie specjalizacji istnieją trzy autentycznie słabe punkty, wszystkie ujawnione: dokładne dopasowanie tłumaczenia FOL na poziomie 0,0100, `procedural` na poziomie 0,1200 w trybie ścisłym oraz dokładne dopasowanie parsowania semantycznego na poziomie 0,0000. Indukcja reguł parsuje tylko 56,5% swoich wyników. A model jest rozwlekły z założenia — około 792 tokenów na odpowiedź w Track B wobec 482 u jego poprzednika — co jest kosztem, a nie możliwością.
Nic z tego nie jest krytyką wydania. Tak wygląda dobrze napisana karta modelu i dlatego podane tu liczby można w ogóle cytować.
Trzy sposoby, aby to zdobyć, a jeden z nich to formularz
Sytuacja dystrybucyjna to właściwa wiadomość tego tygodnia i warto ją dokładnie przedstawić.
Wagi znajdują się na Hugging Face, bez ograniczeń dostępu, na licencji webAI Non-Commercial License ver. 1.0 — która pozwala na badania i użytek osobisty oraz wymaga odrębnej umowy z webAI w przypadku wdrożeń generujących przychody. Ta licencja jest wiążącym ograniczeniem dla całego wydania i dlatego TwIL-LM3-Pro nie jest modelem, który większość zespołów produktowych może po prostu przyjąć.
webAI twierdzi, że rodzina przekroczyła pół miliona pobrań w ciągu miesiąca; to liczba, którą firma opublikowała we własnym ogłoszeniu i która nie została niezależnie zweryfikowana. Pobrania darmowego niekomercyjnego checkpointu nie są miarą zastępczą użycia produkcyjnego, a webAI nie przedstawia ich jako takiej.
Platforma samego dostawcy nie jest publicznym punktem końcowym. webAI opisuje się jako platforma dla przedsiębiorstw, która wnosi AI do twoich danych, z aplikacją modelu działającą w podejściu local-first, a jej droga komercyjna to rozwiązanie dla przedsiębiorstw, a nie opublikowany cennik stawek za token. TwIL-LM3-Pro nie występuje również na dużych zewnętrznych platformach inferencyjnych, które indeksują otwarte checkpointy — sprawdziliśmy i nie ma go też w katalogu OrcaRouter — więc praktyczna odpowiedź na pytanie „skąd mam to wywołać przez API” jest taka, że obecnie w większości przypadków wcale nie; pobierasz go.
Trzeci kanał jest nowy. Repozytorium `TwIL-LM3-Pro-LiteRT-LM` pojawiło się 1 października 2026 r., zawierające artefakty `.litertlm` i oznaczone dla Androida i iOS — własne opakowanie tych samych wag w środowisko uruchomieniowe LiteRT-LM firmy webAI. Czy ta kompilacja dziedziczy licencję niekomercyjną, to pytanie, na które trzeba odpowiedzieć przed planowaniem wokół niej, ponieważ repozytorium nadrzędne ją dziedziczy.
Dlaczego specjalista od logiki formalnej przy tej skali jest wart uwagi
Powód, dla którego to wydanie wciąż wypływa, nie tkwi w tabeli wyników. Tkwi w tym, że webAI opublikowało cały pipeline, uruchomiło identyczny przepis na pięciu różnych modelach bazowych i zaraportowało, co się stało. Tabela porównawcza rodziny odnotowuje zmianę makro-bramki Track A o +0,012 do +0,145 w zależności od modelu bazowego, a zbiór odłożony pozostaje w granicach ±0,013 — udokumentowana wersja stwierdzenia „to się generalizuje”. Jedynym współczynnikiem dobieranym dla każdego modelu jest waga scalania, przeszukiwana na podstawie wyników na zbiorze odłożonym: 0,15 dla SmolLM3, 0,20 dla Granite i bazy TwIL, 0,50 dla VibeThinker-3B.
To wielokrotnego użytku przepis na przekształcenie małego modelu ogólnego w wąskiego specjalistę bez niszczenia tego, co już wiedział, opublikowany wraz z załączonymi wynikami negatywnymi. Dla każdego, kto potrzebuje etykiet wynikania, formalizacji twierdzeń w Lean albo parsowania semantycznego, a nie płynnej prozy, model GGUF o rozmiarze 2,09 GiB, który działa offline, bez opłaty za wywołanie i bez zależności sieciowej, jest czymś innym niż jakikolwiek model hostowany, niezależnie od tego, co mówi tabela Elo.
Otwartym pytaniem jest, czy wagi kiedykolwiek pojawią się na licencji zezwalającej na użytek komercyjny i czy port LiteRT-LM jest dostarczany z tym samym ograniczeniem. Do tego czasu TwIL-LM3-Pro pozostaje artefaktem badawczym z niezwykle uczciwą kartą modelu — co nie jest bez znaczenia.

Jeśli potrzebujesz tej funkcji na produkcji już dziś
W przypadku wdrożenia komercyjnego to nie benchmarki, lecz licencja jest przeszkodą, a praktycznym zamiennikiem jest model hostowany, do którego można kierować ruch. To właśnie ta warstwa, na której działa OrcaRouter: jeden punkt końcowy zgodny z OpenAI obsługujący ponad 200 modeli w cenie katalogowej dostawcy, bez doliczania marży, więc obniżka ceny u dostawcy obowiązuje tego samego dnia, a nie dopiero po zakończeniu cyklu umownego. W tych nielicznych miejscach, gdzie mały checkpoint logiki formalnej naprawdę się sprawdza — wsadowe etykietowanie w trybie offline, przebieg wnioskowania w środowisku odizolowanym od sieci, krok przetwarzania wstępnego, którego wynikiem jest etykieta, a nie proza — uczciwy podział polega na uruchomieniu lokalnego modelu tam, gdzie zadanie sprowadza się do przekształcenia tekstu w etykietę, i skierowaniu otaczającego rozumowania, rozszerzania promptów oraz QA do modeli hostowanych przy użyciu tego samego klucza.
Jedno zastrzeżenie, które warto powtórzyć szczególnie w tej sekcji: dzięki automatycznemu przełączaniu awaryjnemu możesz też wskazać model, zanim zaufasz mu na ścieżce produkcyjnej, i wycofać zmiany, edytując regułę routingu, a nie wdrażając ponownie. To wzorzec, który pasuje do takiego modelu, gdy jego status komercyjny jest nierozstrzygnięty.

Co obejrzeć
Trzy rzeczy zmieniłyby tę historię. Zmiana licencji albo port LiteRT-LM z jasną licencją przeniosłyby TwIL-LM3-Pro z artefaktu badawczego do komponentu gotowego do wdrożenia. Pojawienie się na dużej hostowanej platformie inferencyjnej dałoby mu prawdziwe API. A niezależna ewaluacja — przeprowadzona przez kogoś innego niż webAI, kto uruchomiłby harness Track A — powiedziałaby nam, czy przewaga strict-7 nad Qwen3-8B przetrwa, gdy zmierzy ją ktoś, kto nie zbudował tego harnessu. Żadna z tych trzech rzeczy jeszcze nie nastąpiła, a karta modelu jest na tyle uczciwa, że widać dokładnie, co musiałoby zachodzić, żeby miały one znaczenie.

