
Pierwszy dzień Kolibri: Aleph Alpha udostępniła 78 mld wag niemiecko-angielskich, a reakcja wyprzedza dowody
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 217 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Dwadzieścia cztery godziny po tym, jak Aleph Alpha opublikowała Kolibri, reakcja skrzepła w jedno zdanie — i warto to zdanie rozłożyć na części. Laboratorium z Heidelbergu umieściło 3 października 2026 roku na Hugging Face model typu mixture-of-experts o 78,1 miliarda parametrów, na licencji Apache 2.0, ogłosiło to tego samego ranka we własnej sekcji informacyjnej i z własnego konta, a nazajutrz krążące w kanałach o AI podsumowanie brzmiało: 78 mld parametrów łącznie, 3,46 mld aktywnych na token, otwarte wagi na licencji Apache 2.0, stworzony dla języka niemieckiego i angielskiego. Każdy człon tego zdania można zweryfikować na podstawie repozytorium. To, co w dużej mierze przemilczano, to które części wydania są zmierzonymi faktami, a które są twierdzeniami autorów o ich własnym modelu, których nikt poza Heidelbergiem nie uruchomił. Ta luka to historia pierwszego dnia i ma większe znaczenie niż liczba z nagłówka.
Zacznijmy od osi czasu, ponieważ zaskakująco duża część reakcji potraktowała to jako tajemnicze ciche wydanie, a nie było nim. Repozytorium Hugging Face Aleph-Alpha/Kolibri-1 zostało utworzone 2 października 2026 o 05:54:02 UTC, karta modelu podaje deklarowaną datę wydania 3 października, a wpis w newsroomie dostawcy ukazał się tego samego ranka o 08:43:53 GMT — w Dniu Zjednoczenia Niemiec, dacie, którą laboratorium wyraźnie wybrało. Własne konto Aleph Alpha opublikowało o tym wpis w ciągu kilku minut. Nie było embarga prasowego ani wydarzenia premierowego, co prawdopodobnie stało się źródłem narracji o „cichym wydaniu”, ale wpis w newsroomie dostawcy, raport techniczny i oficjalne ogłoszenie nie są cichym wydaniem. To normalne wydanie, którego prasa AI głównego nurtu po prostu nie opisała tego dnia.
Liczba, którą powtarza reakcja
Powód, dla którego wszyscy cytują liczbę 3,46 mld aktywnych parametrów, jest taki, że jest to jedyna liczba w ogłoszeniu, która zmienia to, co musi mieć nabywca. Kolibri to 50-warstwowy transformer, w którym każda warstwa jest mieszaniną ekspertów (mixture-of-experts), z 384 ekspertami na warstwę: jednym współdzielonym i sześcioma routowanymi, przy łącznej liczbie 78 103 074 560 parametrów. Na każdy token aktywuje 3 457 573 120 z nich — współczynnik rzadkości wynoszący około 22,6 do 1. To właśnie sprawia, że model o 78 miliardach parametrów można serwować na parze H100s zamiast na szafie serwerowej, i jest to najdonioślejsze twierdzenie w tym ogłoszeniu.
Wokół niego znajdują się pozostałe kluczowe liczby, wszystkie pochodzące z karty modelu, a nie z niezależnego przebiegu:
• Kontekst — trenowany na 16 384 tokenach, poddany treningowi pośredniemu na 65 536, natywnie przy 262 144 i walidowany do 1 048 576. Karta zaleca pozostanie na poziomie 262 144 lub poniżej w przypadku zadań wrażliwych na opóźnienia. Uwaga: samo „1M context”, które zobaczysz w podsumowaniach, to zwalidowany pułap, a nie natywne okno.
• Precyzja — wagi FP8 w blokach 128x128 z dynamicznie kwantyzowanymi aktywacjami, ewaluowane z pamięcią podręczną KV w FP8; embeddingi, głowica LM, normalizacje i router MoE pozostają w bfloat16.
• Rozumowanie — cztery poziomy wysiłku — brak, niski, średni, wysoki — ustawiane przez szablon czatu, z wywoływaniem narzędzi w stylu Hermes i parserem vLLM dostarczanym w tym samym repozytorium co wagi.
• Języki — niemiecki i angielski, i nic więcej.
• Trening — 20 bilionów tokenów wstępnego trenowania na filtrowanym korpusie dwujęzycznym, który w około 62,5 procent składa się z angielskiego, 23,9 procent z niemieckiego i 13,6 procent z kodu, plus 3,44 biliona tokenów trenowania pośredniego i 201 miliardów tokenów na rozszerzenie długiego kontekstu.
• Moc obliczeniowa i energia — 768 układów NVIDIA B200 w 96 węzłach HGX, 21 dni wstępnego trenowania przez 511 godzin i 392 000 godzin GPU przy raportowanym 6,4×10^23 FLOPs oraz szacunkowo 9,5×10^2 MWh, z uwzględnieniem narzutu centrum danych, z wyłączeniem nadzorowanego dostrajania i uczenia ze wzmocnieniem.
• Licencja — Apache 2.0. Bez aneksu dotyczącego dopuszczalnego użytkowania, bez progu miesięcznej liczby aktywnych użytkowników, bez odrębnych warunków komercyjnych.
Dwa twierdzenia, których nikt nie sprawdził
To jest ta część pierwszego dnia, którą pominęła reakcja, i to jest ta część, która decyduje o tym, czy Kolibri jest ważny, czy tylko interesujący.
Pierwsza to teza o ekonomice serwowania. Sposób, w jaki Aleph Alpha to przedstawia, nie polega na tym, że Kolibri jest najsilniejszym dostępnym modelem — na własnej tabeli porównawczej laboratorium nim nie jest, i laboratorium to przyznaje. Chodzi raczej o to, że żaden porównywany model nie zapewnia większej jakości przy tym samym koszcie serwowania ani tej samej jakości przy niższym koszcie, wzdłuż granicy Pareto jakości względem dekodowanych tokenów na sekundę na GPU. To twierdzenie o przepustowości na konkretnym sprzęcie i dokładnie takiego rodzaju twierdzenie, które może rozstrzygnąć wyłącznie strona trzecia ze stoperem i dwoma H100. Nikt tego nie zrobił. Na dzień 4 października 2026 r. nie ma wpisu dotyczącego Kolibri w Artificial Analysis ani replikacji harnessu ewaluacyjnego przez stronę trzecią.
Drugie to twierdzenie dotyczące tokenizatora. Aleph Alpha wytrenowała dwujęzyczny niemiecko-angielski tokenizator ze słownikiem 128 000 tokenów, używając metody, którą nazywa UniBPE, i podaje 4,90 średniej liczby bajtów na token w niemieckim tekście internetowym wobec GPT-5 na poziomie 4,35, Gemini — 4,13, Qwen 3.5-3.8 — 4,17, GLM 5.3 — 3,93, DeepSeek V4 — 3,72 i Kimi K3 — 3,28. Każda z tych liczb jest własną liczbą dostawcy, zmierzoną na własnym korpusie dostawcy, wobec konkurentów wybranych przez dostawcę. Większa ilość tekstu na token to realny efekt kosztu wnioskowania, a nie twierdzenie o jakości, i jeśli się utrzymuje, kumuluje się w każdym obciążeniu związanym z przetwarzaniem dokumentów — ale to pomiar jednego laboratorium, a nie wynik benchmarku.
O niemiecki tu chodzi, a to jest najciekawsza inżynieria w tym wydaniu
Większość „wielojęzycznych” kart modeli opisuje mieszankę treningową, która przypadkiem obejmowała niemiecki. Ta została zbudowana odwrotnie, a karta jest nietypowo szczegółowa, jeśli chodzi o mechanikę.
Niewielkie eksperymenty z modelami zastępczymi doprowadziły Aleph Alpha do celu około 20 procent danych niemieckojęzycznych w mieszance, co przy treningu na 20 bilionów tokenów oznaczało znalezienie 4 bilionów niemieckich tokenów. Zdeduplikowane i odfiltrowane otwarte niemieckojęzyczne zbiory danych dostarczyły 390 miliardów — o rząd wielkości za mało. Laboratorium wypełniło lukę na trzy sposoby: dostrojenie filtra Common Crawl specjalnie pod język niemiecki, co dało 1,3 biliona unikalnych organicznych tokenów; przeformułowanie istniejących niemieckojęzycznych dokumentów na hasła encyklopedyczne, dialogi pytanie-odpowiedź i fragmenty tekstu, co dało około kolejnego biliona i stało się największym pojedynczym niemieckojęzycznym źródłem; oraz tłumaczenie, które wykorzystano w modelu poprzedzającym, a przy Kolibri celowo z niego zrezygnowano. Ostatecznie język niemiecki stał się unikalną pulą 2,4 biliona tokenów, w 80 procentach opracowaną lub wygenerowaną wewnętrznie, stanowiącą 21,3 procent tokenów przedtreningowych po nadpróbkowaniu.
Szczegół dotyczący filtra to coś, co wychodzi na jaw tylko w laboratorium, które rzeczywiście trenowało na niemieckim. Standardowy potok przetwarzania danych językowych odrzuca dokumenty zbyt wieloma długimi słowami — ale niemiecka proza administracyjna rutynowo przekracza angielski limit średniej długości słowa, więc domyślne ustawienia po cichu usuwają rejestr, w którym pisze administracja publiczna. Model wytrenowany na gotowym angielskim filtrze nie ma właściwie żadnego słownictwa prawno-administracyjnego, a żaden benchmark ci o tym nie powie.
Co tak naprawdę pokazuje tabela porównawcza
Aleph Alpha opublikował porównanie po treningu obejmujące czternaście modeli i jest ono użyteczniejsze niż większość tabel premierowych, bo nie schlebia obiektowi porównania. W tym samym zestawie testowym co Kolibri, przy wysokim wysiłku rozumowania, Qwen3.8 27B uzyskuje 80,2 w średniej angielskiej wobec 75,5 Kolibri i 79,9 w średniej niemieckiej wobec 70,8, a także przewodzi w GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified oraz obu benchmarkach długiego kontekstu. Nemotron 3 Super 120B-A12B uzyskuje 73,0 w języku angielskim wobec 75,5 Kolibri. Gemma 4 26B-A4B IT uzyskuje 71,9 i 66,3 w tych dwóch średnich.
Zatem uczciwe podsumowanie tego wydania nie brzmi „state of the art”. Brzmi ono następująco: Kolibri plasuje się pośrodku grupy modeli aktywujących od trzech do dwunastu miliardów parametrów na token, wyraźnie wygrywa ze znacznie mniejszymi, a przegrywa z gęstym modelem Alibaba o 27 miliardach parametrów w większości wierszy własnej tabeli, aktywując przy tym około jednej ósmej parametrów. To, czy ekonomika ratuje tę lukę, jest tezą Pareto, a teza Pareto nie została przetestowana.

Jak byś to właściwie nazwał, dzisiaj
Nie ma hostowanego endpointu od dostawcy — wydanie to wagi plus raport techniczny, a w opublikowanych materiałach nie ma żadnego SKU API Aleph Alpha dla Kolibri. Nie ma też dla niego żadnej trasy w OrcaRouter: sprawdziliśmy katalog pod każdą pisownią prefiksu dostawcy i nazwy modelu, a Kolibri tam nie ma, więc wywołanie go dziś oznacza pobranie około 78 GB wag FP8 i samodzielne uruchomienie endpointu vLLM z aleph-alpha-inference pakietu lub opublikowanego obrazu kontenera.
To realna decyzja zakupowa, a nie przypis, i właśnie tu warstwa routingu zarabia na swoje miejsce — nawet dla modelu, którego sama nie obsługuje. Uczciwe porównanie dla każdego, kto rozważa samodzielnie hostowane, suwerenne wdrożenie modelu 78B, to nie wiersze benchmarków — to 78 GB VRAM i rozmowa zakupowa przeciwko pozycji rozliczeniowej za token na sprzęcie należącym do kogoś innego. Jeśli tym, czego naprawdę potrzebujesz w tym miesiącu, jest mały model mieszanki ekspertów, do którego możesz się zwracać bez kupowania dwóch GPU, poziom Gemma 4 26B-A4B jest najbliższą rzeczą już dostępną na trasowanym endpoincie, w cenie 0,06 USD za milion tokenów wejściowych i 0,33 USD za milion tokenów wyjściowych przy oknie 262 144 tokenów, a OrcaRouter trasuje ten poziom na jednym kluczu zgodnym z OpenAI w cenie katalogowej dostawcy bez żadnych dodatków. To tani sposób, by sprawdzić, czy obciążenie uzasadnia posiadanie sprzętu, zanim sprzęt dotrze.

Na co zwrócić uwagę i co zmieniłoby werdykt
Trzy rzeczy, w kolejności od tego, jak bardzo zmieniłyby obraz sytuacji.
Niezależny pomiar przepustowości w zalecanej dla karty konfiguracji z dwoma H100 potwierdziłby tezę Pareto albo ją obalił — a to jedyne twierdzenie w tym wydaniu, które jest naprawdę nowatorskie, a nie powtórzeniem karty specyfikacji. Niezależne odtworzenie średnich z zestawów zadań w języku niemieckim i angielskim pozwoliłoby ustalić, czy dystans do Qwen3.8 27B jest tak wąski, jak sugeruje własna tabela dostawcy, czy jeszcze węższy. A ewaluacja w języku niemieckim na prawdziwym tekście administracyjnym — nie na przetłumaczonym ogólnym benchmarku — sprawdziłaby to, do czego to wydanie zostało faktycznie stworzone, czego obecnie nie mierzy żaden ranking.
Dopóki jedno z nich się nie pojawi, właściwe ujęcie to takie, które wspiera samo repozytorium. Kolibri to prawdziwe wydanie modelu z otwartymi wagami z europejskiego laboratorium, w skali, w jakiej europejskie laboratoria nie wypuszczały wcześniej modeli, na warunkach Apache 2.0, którym nie dorównał żaden z dotychczasowych graczy, z potokiem danych opublikowanym razem z wagami i historią iteracji dwóch modeli, która jest ciekawsza niż liczba z nagłówka. Jest też, na razie, modelem, którego najczęściej cytowane wyniki pochodzą od jego własnych autorów. Oba te zdania są prawdziwe już pierwszego dnia, a to drugie jest tym, które pominęła reakcja.

