Karta tytułowa hero z napisem „Kolibri: model o otwartych wagach 78B z Niemiec” dużą pogrubioną czcionką, a poniżej pojedyncza mniejsza linia o treści „78B łącznie / 3.46B aktywnych / kontekst 1M tokenów / Apache 2.0”, oraz trzy małe płaskie ikony liniowe w rzędzie, na białym tle z delikatnymi niebiesko-cyjanowymi akcentami gradientowymi i logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Pierwszy dzień Kolibri: Aleph Alpha udostępniła 78 mld wag niemiecko-angielskich, a reakcja wyprzedza dowody

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwadzieścia cztery godziny po tym, jak Aleph Alpha opublikowała Kolibri, reakcja skrzepła w jedno zdanie — i warto to zdanie rozłożyć na części. Laboratorium z Heidelbergu umieściło 3 października 2026 roku na Hugging Face model typu mixture-of-experts o 78,1 miliarda parametrów, na licencji Apache 2.0, ogłosiło to tego samego ranka we własnej sekcji informacyjnej i z własnego konta, a nazajutrz krążące w kanałach o AI podsumowanie brzmiało: 78 mld parametrów łącznie, 3,46 mld aktywnych na token, otwarte wagi na licencji Apache 2.0, stworzony dla języka niemieckiego i angielskiego. Każdy człon tego zdania można zweryfikować na podstawie repozytorium. To, co w dużej mierze przemilczano, to które części wydania są zmierzonymi faktami, a które są twierdzeniami autorów o ich własnym modelu, których nikt poza Heidelbergiem nie uruchomił. Ta luka to historia pierwszego dnia i ma większe znaczenie niż liczba z nagłówka.

Zacznijmy od osi czasu, ponieważ zaskakująco duża część reakcji potraktowała to jako tajemnicze ciche wydanie, a nie było nim. Repozytorium Hugging Face Aleph-Alpha/Kolibri-1 zostało utworzone 2 października 2026 o 05:54:02 UTC, karta modelu podaje deklarowaną datę wydania 3 października, a wpis w newsroomie dostawcy ukazał się tego samego ranka o 08:43:53 GMT — w Dniu Zjednoczenia Niemiec, dacie, którą laboratorium wyraźnie wybrało. Własne konto Aleph Alpha opublikowało o tym wpis w ciągu kilku minut. Nie było embarga prasowego ani wydarzenia premierowego, co prawdopodobnie stało się źródłem narracji o „cichym wydaniu”, ale wpis w newsroomie dostawcy, raport techniczny i oficjalne ogłoszenie nie są cichym wydaniem. To normalne wydanie, którego prasa AI głównego nurtu po prostu nie opisała tego dnia.

Liczba, którą powtarza reakcja

Powód, dla którego wszyscy cytują liczbę 3,46 mld aktywnych parametrów, jest taki, że jest to jedyna liczba w ogłoszeniu, która zmienia to, co musi mieć nabywca. Kolibri to 50-warstwowy transformer, w którym każda warstwa jest mieszaniną ekspertów (mixture-of-experts), z 384 ekspertami na warstwę: jednym współdzielonym i sześcioma routowanymi, przy łącznej liczbie 78 103 074 560 parametrów. Na każdy token aktywuje 3 457 573 120 z nich — współczynnik rzadkości wynoszący około 22,6 do 1. To właśnie sprawia, że model o 78 miliardach parametrów można serwować na parze H100s zamiast na szafie serwerowej, i jest to najdonioślejsze twierdzenie w tym ogłoszeniu.

Wokół niego znajdują się pozostałe kluczowe liczby, wszystkie pochodzące z karty modelu, a nie z niezależnego przebiegu:

• Kontekst — trenowany na 16 384 tokenach, poddany treningowi pośredniemu na 65 536, natywnie przy 262 144 i walidowany do 1 048 576. Karta zaleca pozostanie na poziomie 262 144 lub poniżej w przypadku zadań wrażliwych na opóźnienia. Uwaga: samo „1M context”, które zobaczysz w podsumowaniach, to zwalidowany pułap, a nie natywne okno.

• Precyzja — wagi FP8 w blokach 128x128 z dynamicznie kwantyzowanymi aktywacjami, ewaluowane z pamięcią podręczną KV w FP8; embeddingi, głowica LM, normalizacje i router MoE pozostają w bfloat16.

• Rozumowanie — cztery poziomy wysiłku — brak, niski, średni, wysoki — ustawiane przez szablon czatu, z wywoływaniem narzędzi w stylu Hermes i parserem vLLM dostarczanym w tym samym repozytorium co wagi.

• Języki — niemiecki i angielski, i nic więcej.

• Trening — 20 bilionów tokenów wstępnego trenowania na filtrowanym korpusie dwujęzycznym, który w około 62,5 procent składa się z angielskiego, 23,9 procent z niemieckiego i 13,6 procent z kodu, plus 3,44 biliona tokenów trenowania pośredniego i 201 miliardów tokenów na rozszerzenie długiego kontekstu.

• Moc obliczeniowa i energia — 768 układów NVIDIA B200 w 96 węzłach HGX, 21 dni wstępnego trenowania przez 511 godzin i 392 000 godzin GPU przy raportowanym 6,4×10^23 FLOPs oraz szacunkowo 9,5×10^2 MWh, z uwzględnieniem narzutu centrum danych, z wyłączeniem nadzorowanego dostrajania i uczenia ze wzmocnieniem.

• Licencja — Apache 2.0. Bez aneksu dotyczącego dopuszczalnego użytkowania, bez progu miesięcznej liczby aktywnych użytkowników, bez odrębnych warunków komercyjnych.

Dwa twierdzenia, których nikt nie sprawdził

To jest ta część pierwszego dnia, którą pominęła reakcja, i to jest ta część, która decyduje o tym, czy Kolibri jest ważny, czy tylko interesujący.

Pierwsza to teza o ekonomice serwowania. Sposób, w jaki Aleph Alpha to przedstawia, nie polega na tym, że Kolibri jest najsilniejszym dostępnym modelem — na własnej tabeli porównawczej laboratorium nim nie jest, i laboratorium to przyznaje. Chodzi raczej o to, że żaden porównywany model nie zapewnia większej jakości przy tym samym koszcie serwowania ani tej samej jakości przy niższym koszcie, wzdłuż granicy Pareto jakości względem dekodowanych tokenów na sekundę na GPU. To twierdzenie o przepustowości na konkretnym sprzęcie i dokładnie takiego rodzaju twierdzenie, które może rozstrzygnąć wyłącznie strona trzecia ze stoperem i dwoma H100. Nikt tego nie zrobił. Na dzień 4 października 2026 r. nie ma wpisu dotyczącego Kolibri w Artificial Analysis ani replikacji harnessu ewaluacyjnego przez stronę trzecią.

Drugie to twierdzenie dotyczące tokenizatora. Aleph Alpha wytrenowała dwujęzyczny niemiecko-angielski tokenizator ze słownikiem 128 000 tokenów, używając metody, którą nazywa UniBPE, i podaje 4,90 średniej liczby bajtów na token w niemieckim tekście internetowym wobec GPT-5 na poziomie 4,35, Gemini — 4,13, Qwen 3.5-3.8 — 4,17, GLM 5.3 — 3,93, DeepSeek V4 — 3,72 i Kimi K3 — 3,28. Każda z tych liczb jest własną liczbą dostawcy, zmierzoną na własnym korpusie dostawcy, wobec konkurentów wybranych przez dostawcę. Większa ilość tekstu na token to realny efekt kosztu wnioskowania, a nie twierdzenie o jakości, i jeśli się utrzymuje, kumuluje się w każdym obciążeniu związanym z przetwarzaniem dokumentów — ale to pomiar jednego laboratorium, a nie wynik benchmarku.

O niemiecki tu chodzi, a to jest najciekawsza inżynieria w tym wydaniu

Większość „wielojęzycznych” kart modeli opisuje mieszankę treningową, która przypadkiem obejmowała niemiecki. Ta została zbudowana odwrotnie, a karta jest nietypowo szczegółowa, jeśli chodzi o mechanikę.

Niewielkie eksperymenty z modelami zastępczymi doprowadziły Aleph Alpha do celu około 20 procent danych niemieckojęzycznych w mieszance, co przy treningu na 20 bilionów tokenów oznaczało znalezienie 4 bilionów niemieckich tokenów. Zdeduplikowane i odfiltrowane otwarte niemieckojęzyczne zbiory danych dostarczyły 390 miliardów — o rząd wielkości za mało. Laboratorium wypełniło lukę na trzy sposoby: dostrojenie filtra Common Crawl specjalnie pod język niemiecki, co dało 1,3 biliona unikalnych organicznych tokenów; przeformułowanie istniejących niemieckojęzycznych dokumentów na hasła encyklopedyczne, dialogi pytanie-odpowiedź i fragmenty tekstu, co dało około kolejnego biliona i stało się największym pojedynczym niemieckojęzycznym źródłem; oraz tłumaczenie, które wykorzystano w modelu poprzedzającym, a przy Kolibri celowo z niego zrezygnowano. Ostatecznie język niemiecki stał się unikalną pulą 2,4 biliona tokenów, w 80 procentach opracowaną lub wygenerowaną wewnętrznie, stanowiącą 21,3 procent tokenów przedtreningowych po nadpróbkowaniu.

Szczegół dotyczący filtra to coś, co wychodzi na jaw tylko w laboratorium, które rzeczywiście trenowało na niemieckim. Standardowy potok przetwarzania danych językowych odrzuca dokumenty zbyt wieloma długimi słowami — ale niemiecka proza administracyjna rutynowo przekracza angielski limit średniej długości słowa, więc domyślne ustawienia po cichu usuwają rejestr, w którym pisze administracja publiczna. Model wytrenowany na gotowym angielskim filtrze nie ma właściwie żadnego słownictwa prawno-administracyjnego, a żaden benchmark ci o tym nie powie.

Co tak naprawdę pokazuje tabela porównawcza

Aleph Alpha opublikował porównanie po treningu obejmujące czternaście modeli i jest ono użyteczniejsze niż większość tabel premierowych, bo nie schlebia obiektowi porównania. W tym samym zestawie testowym co Kolibri, przy wysokim wysiłku rozumowania, Qwen3.8 27B uzyskuje 80,2 w średniej angielskiej wobec 75,5 Kolibri i 79,9 w średniej niemieckiej wobec 70,8, a także przewodzi w GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified oraz obu benchmarkach długiego kontekstu. Nemotron 3 Super 120B-A12B uzyskuje 73,0 w języku angielskim wobec 75,5 Kolibri. Gemma 4 26B-A4B IT uzyskuje 71,9 i 66,3 w tych dwóch średnich.

Zatem uczciwe podsumowanie tego wydania nie brzmi „state of the art”. Brzmi ono następująco: Kolibri plasuje się pośrodku grupy modeli aktywujących od trzech do dwunastu miliardów parametrów na token, wyraźnie wygrywa ze znacznie mniejszymi, a przegrywa z gęstym modelem Alibaba o 27 miliardach parametrów w większości wierszy własnej tabeli, aktywując przy tym około jednej ósmej parametrów. To, czy ekonomika ratuje tę lukę, jest tezą Pareto, a teza Pareto nie została przetestowana.

A single-column specification scoreboard titled 'Kolibri — the scoreboard', with six rows reading 'Total parameters: 78.1B', 'Active per token: 3.46B', 'Context: 262,144 native, 1M validated', 'Licence: Apache 2.0', 'Independent score: none published' and 'Deployment floor: 2x H100 80GB', and a footer line reading 'All figures vendor-reported from the model card; no independent evaluation yet.' OrcaRouter logo in the bottom-right corner.

Jak byś to właściwie nazwał, dzisiaj

Nie ma hostowanego endpointu od dostawcy — wydanie to wagi plus raport techniczny, a w opublikowanych materiałach nie ma żadnego SKU API Aleph Alpha dla Kolibri. Nie ma też dla niego żadnej trasy w OrcaRouter: sprawdziliśmy katalog pod każdą pisownią prefiksu dostawcy i nazwy modelu, a Kolibri tam nie ma, więc wywołanie go dziś oznacza pobranie około 78 GB wag FP8 i samodzielne uruchomienie endpointu vLLM z aleph-alpha-inference pakietu lub opublikowanego obrazu kontenera.

To realna decyzja zakupowa, a nie przypis, i właśnie tu warstwa routingu zarabia na swoje miejsce — nawet dla modelu, którego sama nie obsługuje. Uczciwe porównanie dla każdego, kto rozważa samodzielnie hostowane, suwerenne wdrożenie modelu 78B, to nie wiersze benchmarków — to 78 GB VRAM i rozmowa zakupowa przeciwko pozycji rozliczeniowej za token na sprzęcie należącym do kogoś innego. Jeśli tym, czego naprawdę potrzebujesz w tym miesiącu, jest mały model mieszanki ekspertów, do którego możesz się zwracać bez kupowania dwóch GPU, poziom Gemma 4 26B-A4B jest najbliższą rzeczą już dostępną na trasowanym endpoincie, w cenie 0,06 USD za milion tokenów wejściowych i 0,33 USD za milion tokenów wyjściowych przy oknie 262 144 tokenów, a OrcaRouter trasuje ten poziom na jednym kluczu zgodnym z OpenAI w cenie katalogowej dostawcy bez żadnych dodatków. To tani sposób, by sprawdzić, czy obciążenie uzasadnia posiadanie sprzętu, zanim sprzęt dotrze.

A screenshot of Aleph Alpha's newsroom post for Kolibri, showing the vendor headline about a sovereign open-weight model, the 78B parameter figure and the one-million-token context line, and the architecture comparison between Kolibri and Kolibri Origin.

Na co zwrócić uwagę i co zmieniłoby werdykt

Trzy rzeczy, w kolejności od tego, jak bardzo zmieniłyby obraz sytuacji.

Niezależny pomiar przepustowości w zalecanej dla karty konfiguracji z dwoma H100 potwierdziłby tezę Pareto albo ją obalił — a to jedyne twierdzenie w tym wydaniu, które jest naprawdę nowatorskie, a nie powtórzeniem karty specyfikacji. Niezależne odtworzenie średnich z zestawów zadań w języku niemieckim i angielskim pozwoliłoby ustalić, czy dystans do Qwen3.8 27B jest tak wąski, jak sugeruje własna tabela dostawcy, czy jeszcze węższy. A ewaluacja w języku niemieckim na prawdziwym tekście administracyjnym — nie na przetłumaczonym ogólnym benchmarku — sprawdziłaby to, do czego to wydanie zostało faktycznie stworzone, czego obecnie nie mierzy żaden ranking.

Dopóki jedno z nich się nie pojawi, właściwe ujęcie to takie, które wspiera samo repozytorium. Kolibri to prawdziwe wydanie modelu z otwartymi wagami z europejskiego laboratorium, w skali, w jakiej europejskie laboratoria nie wypuszczały wcześniej modeli, na warunkach Apache 2.0, którym nie dorównał żaden z dotychczasowych graczy, z potokiem danych opublikowanym razem z wagami i historią iteracji dwóch modeli, która jest ciekawsza niż liczba z nagłówka. Jest też, na razie, modelem, którego najczęściej cytowane wyniki pochodzą od jego własnych autorów. Oba te zdania są prawdziwe już pierwszego dnia, a to drugie jest tym, które pominęła reakcja.

A screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the repository header, the Apache 2.0 licence tag, the stated release date of 3 October 2026, and the parameter, context and FP8 precision lines in the card body.