Wygenerowano kartę hero dla materiału objaśniającego Kolibri z nagłówkiem „Kolibri: model 78B z otwartymi wagami z Niemiec” i podtytułem „78B łącznie / 3,46B aktywnych / kontekst 1M tokenów / Apache 2.0” oraz trzema płaskimi ikonami liniowymi: koliber, stos warstw i kłódka nad dokumentem. Logo OrcaRouter znajduje się w pasku pod grafiką.
Guides & Insights

Kolibri, wyjaśnione: Aleph Alpha udostępnia model niemiecko-angielski 78B na licencji Apache 2.0

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Aleph Alpha wydała Kolibri 3 października 2026 r., model oparty na mieszance ekspertów o 78,1 miliarda parametrów, który aktywuje 3,46 miliarda parametrów na token, ma zweryfikowane okno kontekstowe o rozmiarze 1 048 576 tokenów i jest udostępniany z pełnymi wagami na Hugging Face na licencji Apache 2.0. Laboratorium w Heidelbergu opublikowało go w Dniu Zjednoczenia Niemiec wraz z raportem technicznym, kartą modelu w języku niemieckim i angielskim oraz niezwykle szczegółowym opisem tego, jak go wytrenowano. Modelem, z którym jest porównywany w całej dokumentacji samego Aleph Alpha, jest Kolibri Origin — poprzednik o 30,6 miliarda parametrów i 3,27 miliarda aktywnych parametrów, który zakończył wstępne trenowanie 11 czerwca 2026 r. i nigdy nie został publicznie udostępniony. Dwa modele, trzy miesiące różnicy, a dzielący je dystans to najciekawsza rzecz w tym wydaniu.

To, co czyni Kolibri wartym uważnej lektury, to nie fakt, że jest to najsilniejszy dostępny model. W tabelach porównawczych samego Aleph Alpha nie jest i do tego jeszcze wrócimy. Godne uwagi jest to, że europejskie laboratorium w ogóle wypuściło model z otwartymi wagami w tej skali, publikując wraz z nim potok treningowy, pochodzenie danych i dane dotyczące zużycia energii, a licencję ustawiło na Apache 2.0, a nie na dedykowaną licencję badawczą. Dla zespołów, których zasady zakupowe zaczynają się od pytania „gdzie trafiają dane”, właśnie ta kombinacja jest produktem.

Specyfikacja i dwie liczby, które się liczą

Wszystko poniżej pochodzi z karty modelu, którą Aleph Alpha opublikowała wraz z wagami; nic z tego nie zostało jeszcze niezależnie odtworzone, a w chwili pisania nie ma wiersza Artificial Analysis dla Kolibri.

• Łączna liczba parametrów — 78 103 074 560, z 3 457 573 120 aktywnymi na token, co daje stosunek około 22,6 do 1.

• Architektura — transformer o 50 warstwach, wszystkie warstwy typu mixture-of-experts, 384 ekspertów na warstwę, w tym 1 współdzielony i 6 routowanych, oraz mieszanka w proporcji 4:1 uwagi z przesuwnym oknem do uwagi z grupowanymi zapytaniami w całym stosie.

• Kontekst — trenowany na 16,384 tokenach, poddany treningowi pośredniemu na 65,536 i rozszerzony do natywnych 262,144. Ponieważ kodowanie pozycyjne jest stosowane wyłącznie w warstwach okna przesuwnego, Aleph Alpha twierdzi, że okno można rozszerzyć bez skalowania pozycji, oraz zweryfikowała jakość i wydajność obsługi do 1,048,576 tokenów. Karta zaleca pozostanie na poziomie 262,144 lub poniżej w przypadku prac wrażliwych na opóźnienia oraz złożonych zadań.

• Precyzja — wagi FP8 w blokach 128×128 z dynamicznie kwantyzowanymi aktywacjami, ewaluowane z pamięcią podręczną KV FP8; embeddingi, głowica LM, normalizacje i router MoE pozostają w bfloat16.

• Rozumowanie — cztery poziomy wysiłku: brak, niski, średni i wysoki, ustawiane przez szablon czatu.

• Wywoływanie narzędzi — tak, w stylu Hermes, z parserem vLLM dostarczanym w tym samym repozytorium co wagi.

• Języki — niemiecki i angielski, i nic więcej. Zostało to przedstawione jako wybór projektowy, a nie przeoczenie.

• Trening — 20 bilionów tokenów pretrenowania na filtrowanym dwujęzycznym korpusie, w przybliżeniu 62,5 procent angielskiego, 23,9 procent niemieckiego i 13,6 procent kodu, plus 3,44 biliona tokenów treningu pośredniego i 201 miliardów na rozszerzenie długiego kontekstu.

• Obliczenia — 768 układów NVIDIA B200 w 96 węzłach HGX, 21 dni wstępnego trenowania przez 511 godzin i 392 000 godzin GPU, przy raportowanych 6,4×10²³ FLOPs. Trening pośredni dodał pięć dni i 90 000 godzin GPU; rozszerzenie długiego kontekstu dodało 13 godzin i 10 000 godzin GPU.

• Energia — szacunkowo 9,5×10² MWh z uwzględnieniem narzutu centrum danych, obejmująca wstępne szkolenie, szkolenie w średnim etapie i szkolenie z długim kontekstem, ale z wyłączeniem nadzorowanego dostrajania i uczenia ze wzmocnieniem.

• Licencja — Apache 2.0. Bez aneksu dotyczącego dopuszczalnego użytkowania, bez progu miesięcznej liczby aktywnych użytkowników, bez odrębnych warunków komercyjnych.

Dwie z tych linijek to te, które kupujący powinien przeczytać dwa razy. Liczba aktywnych parametrów to to, za co płacisz podczas inferencji, a 3,46 miliarda aktywnych z 78 miliardów ogółem to agresywny współczynnik rzadkości — to właśnie cały powód, dla którego model tej wielkości może być w ogóle serwowany na dwóch GPU. A wartość kontekstu podano jako 262 144 natywnie i 1 048 576 po walidacji, co jest ostrożniejszym twierdzeniem niż płaskie „1M kontekstu”, które zobaczysz w większości materiałów o tym wydaniu.

Generated single-column scoreboard for Kolibri with six rows: total parameters 78.1B, active per token 3.46B, context 262,144 native and 1M validated, licence Apache 2.0, independent score 'none published', and deployment floor 2x H100 80GB. The footer reads 'All figures vendor-reported from the model card; no independent evaluation yet.'

Dwa modele, trzy miesiące różnicy

Kolibri to drugi model z tego, co Aleph Alpha nazywa swoją Model Factory, a opublikowany przez nią harmonogram to część premiery, którą większość relacji pomija.

Prace nad pipeline’em treningowym rozpoczęły się w styczniu 2026 r. Kolibri Origin zakończył wstępne trenowanie w docelowej skali 11 czerwca 2026 r. — 30,6 mld parametrów łącznie, 3,27 mld aktywnych, okno kontekstu 65 536 tokenów, 7,51 bln tokenów treningowych, 50 warstw, z których dwie były gęste, a 48 to MoE, oraz pojedynczy tryb rozumowania. Został poddany wewnętrznej walidacji i nigdy nie został publicznie udostępniony. Kolibri zakończył wstępne trenowanie 11 września 2026 r.

• Parametry — 30,6 mld łącznie i 3,27 mld aktywnych, wobec 78,1 mld łącznie i 3,46 mld aktywnych.

• Kontekst — 8 192 tokeny kontekstu wstępnego trenowania w Origin, w porównaniu z 16 384 w Kolibri, kończąc na natywnych 262 144.

• Dane — 7,51 biliona tokenów przedtreningowych na Origin, w porównaniu z 20 bilionami, pochodzących z surowej puli ponad 200 bilionów, którą potok filtrował, deduplikował i opracowywał.

• Architektura — dwie gęste warstwy plus 48 warstw MoE na Origin, w porównaniu z 50 warstwami MoE, ze zmienionym projektem mechanizmu uwagi, potrojoną liczbą ekspertów, większą rzadkością i zastąpionym algorytmem routingu.

• Rozumowanie — jeden tryb w Origin, w przeciwieństwie do braku, niskiego, średniego i wysokiego w Kolibri.

• Wydanie — brak publicznego wydania dla Origin, 3 października 2026 dla Kolibri.

Najbardziej zmieniają się liczby w zestawach zadań, w których oba modele oceniał ten sam system ewaluacyjny. W niemieckiej średniej zestawu po treningu Origin uzyskał 46,4, a Kolibri 70,8; w angielskiej średniej – 54,1 wobec 75,5. Na AIME 2025 w języku niemieckim – 73,5 wobec 87,5. W wewnętrznych benchmarkach proxy klientów, które dostawca publikuje jako zestaw branżowy, zestaw dla dostawców motoryzacyjnych wzrósł z 0,72 do 0,99, półprzewodniki z 0,35 do 0,80, niemiecki sektor publiczny z 0,54 do 0,75, przemysłowa technika napędowa z 0,31 do 0,60, a lotnictwo i kosmonautyka z 0,14 do 0,59.

Te wewnętrzne liczby dla poszczególnych branż są prowadzone przez dostawcę na zbudowanych przez samego dostawcę zestawach ewaluacyjnych zaprojektowanych z myślą o klientach dostawcy, więc traktuj je jako opis intencji, a nie wynik. Sens ich publikacji polega na tym, że wyjaśniają, pod co model był optymalizowany: nie ranking, lecz zestaw dokumentów z branż regulowanych.

Screenshot of Aleph Alpha's newsroom post 'Kolibri Has Landed: A Sovereign Open-Weight Model', showing the opening lines dating the release to the Day of German Reunification, describing Kolibri as an English-German mixture-of-experts transformer with 78B total and 3B active parameters, context lengths up to 1M tokens, full weights on Hugging Face under Apache 2.0, and the paragraph on Kolibri Origin as the 30B total, 3B active predecessor with a 65k context window.

Niemiecki jest tu decyzją projektową, a nie znacznikiem języka.

Większość „wielojęzycznych” kart modeli oznacza mieszankę treningową, w której przypadkiem znalazło się trochę niemieckiego. Ten został zbudowany na odwrót, a karta dokładnie opisuje mechanikę.

Aleph Alpha ustaliła na podstawie eksperymentów z małymi modelami proxy, że około 20 procent danych niemieckojęzycznych w mieszance dawało najlepsze wyniki, co przy treningu na 20 bilionów tokenów oznaczało znalezienie 4 bilionów niemieckich tokenów. Zdeduplikowane i przefiltrowane otwarte niemieckojęzyczne zbiory danych dały jej 390 miliardów — o rząd wielkości mniej niż cel. Lukę zamknęła na trzy sposoby: dostrojenie filtra Common Crawl specjalnie pod kątem języka niemieckiego, co dało 1,3 biliona unikalnych organicznych tokenów; przeformułowanie istniejących niemieckich dokumentów na wpisy encyklopedyczne, dialogi typu pytanie-odpowiedź i fragmenty tekstu, co dało około 1 biliona więcej i stało się największym pojedynczym niemieckojęzycznym źródłem; oraz tłumaczenie, stosowane tylko w Kolibri Origin i zarzucone w Kolibri. Niemiecki ostatecznie stał się unikalną pulą 2,4 biliona tokenów, w 80 procentach opracowaną lub wygenerowaną wewnętrznie, stanowiącą 21,3 procent tokenów przedtreningowych po upsamplingu.

Szczegół dotyczący filtra warto przytoczyć, ponieważ jest to coś, co ujawnia się tylko w laboratorium, które faktycznie trenowało na niemieckim. Standardowy potok danych językowych odrzuca dokumenty ze zbyt dużą liczbą długich słów — ale niemiecka proza administracyjna rutynowo przekracza angielskie ograniczenie średniej długości słowa, więc domyślne ustawienia po cichu usuwają rejestr, w którym pisze administracja publiczna. Oczywistą konsekwencją komercyjną jest to, że model wytrenowany na standardowym angielskim filtrze nie ma praktycznie żadnego niemieckiego słownictwa prawno-administracyjnego, a żaden benchmark tego nie powie.

Tokenizator otrzymuje takie samo traktowanie. Aleph Alpha wytrenowała dwujęzyczny niemiecko-angielski tokenizator ze słownikiem 128 000 tokenów, używając nowej metody, którą nazywa UniBPE, która zachowuje oddolne scalanie kodowania par bajtów, ale wybiera scalenia z celem unigramowym. Na niemieckim tekście internetowym raportuje średnio 4,90 bajta na token, wyprzedzając GPT-5 z 4,35, Gemini z 4,13, Qwen3.5–3.8 z 4,17, GLM 5.3 z 3,93, DeepSeek V4 z 3,72 i Kimi K3 z 3,28 — wszystkie dane raportowane przez dostawców w ich własnym porównaniu. Więcej tekstu na token oznacza mniej tokenów na zadanie, co jest bezpośrednim efektem kosztu wnioskowania, a nie twierdzeniem o jakości, i jest to rodzaj wygranej w wydajności, która kumuluje się w obciążeniu związanym z przetwarzaniem dokumentów.

Czego nie rozstrzyga tabela dostawcy

Aleph Alpha opublikowała porównanie z zakresu post-trainingu obejmujące czternaście modeli; jest ono użyteczniejsze niż większość tabel publikowanych przy premierze, ponieważ nie schlebia obiektowi.

W tym samym środowisku testowym, przy Kolibri na wysokim poziomie wysiłku rozumowania, Qwen3.8 27B uzyskuje 80,2 w średniej dla języka angielskiego wobec 75,5 Kolibri i 79,9 w średniej dla języka niemieckiego wobec 70,8. Prowadzi również w GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified i dwóch benchmarkach długiego kontekstu. Nemotron 3 Super 120B-A12B uzyskuje 73,0 w języku angielskim wobec 75,5 Kolibri — bliżej i wyprzedza w AIME 2025. Gemma 4 26B-A4B IT uzyskuje 71,9 i 66,3 w obu średnich.

Zatem uczciwe podsumowanie tego wydania nie brzmi „state of the art”. Brzmi ono tak: Kolibri plasuje się pośrodku stawki modeli, które aktywują od trzech do dwunastu miliardów parametrów na token, wyraźnie wygrywa ze znacznie mniejszymi, a przegrywa z gęstym modelem o 27 miliardach parametrów od Alibaba w większości wierszy własnej tabeli, aktywując przy tym około jednej ósmej parametrów. Aleph Alpha ujmuje to jako granicę Pareto jakości względem dekodowanych tokenów na sekundę na GPU — żaden z porównywanych modeli nie zapewnia większej jakości przy tym samym koszcie obsługi ani tej samej jakości przy niższym koszcie. To właśnie to twierdzenie należy poddać weryfikacji i jest to twierdzenie z zakresu ekonomiki obsługi, a nie twierdzenie o możliwościach.

Żadna z tych liczb nie została niezależnie zweryfikowana. Nie ma wpisu Artificial Analysis dla Kolibri, brak replikacji frameworku ewaluacyjnego przez strony trzecie, a benchmarki branżowe są tworzone przez dostawcę. Porównanie jest także strukturalnie korzystne dla Kolibri w jednym kierunku, a niekorzystne w innym: wszystkie czternaście modeli przepuszczono przez własny harness Aleph Alpha z identycznymi promptami i ustawieniami few-shot, co jest właściwym sposobem postępowania, ale to wciąż harness jednego laboratorium. Każdą liczbę w tej sekcji należy traktować jako raportowaną przez dostawcę, dopóki ktoś inny jej nie uruchomi.

Screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the licence badge apache-2.0 and the Model overview block: architecture Mixture-of-Experts, 78B total parameters given as 78,103,074,560, active parameters per token 3,457,573,120, languages German and English, context length 1,048,576 tokens with a recommendation to stay at or below 262,144 for serving efficiency and complex tasks, float8_e4m3 weights in 128x128 blocks with an FP8 KV cache and embeddings, LM head, norms and MoE router in bfloat16, reasoning mode yes, tool calling yes, and the June 18 2026 knowledge cutoff.

Czego potrzebujesz, aby to uruchomić

Kolibri to nie model, którego można spróbować na laptopie. Wagi FP8 oznaczają zajętość pamięci modelu na poziomie około 78 GB, a minimalna konfiguracja kart to dwa A100 80 GB, dwa H100 SXM5, jeden H200, jeden B200 lub jeden B300; zalecana konfiguracja to dwa H100 SXM5, dwa H200, jeden B200 lub jeden B300.

Serwowanie go oznacza zainstalowanie pakietu aleph-alpha-inference, który zapewnia wtyczkę Kolibri vLLM i przypina obsługiwaną wersję vLLM, albo pobranie obrazu kontenera ghcr.io/aleph-alpha/aleph-alpha-inference. Następnie jest to standardowe wywołanie vLLM z pamięcią podręczną KV FP8, parserem rozumowania Kolibri i parserem wywołań narzędzi Kolibri. Konteksty powyżej 262 144 tokenów wymagają jawnej flagi maksymalnej długości modelu oraz przesłonięcia osadzania pozycji. Zalecane parametry próbkowania to temperature 1.0, top-p 0.97 i top-k 128.

Interfejs API jest zgodny z OpenAI, co ma większe znaczenie, niż się wydaje: poziom wysiłku rozumowania jest przekazywany przez szablon czatu jako wartość reasoning_effort, a wywołania narzędzi są emitowane w standardowym polu tools. Zespół, który już posługuje się formatem chat-completions, może wskazać istniejący kod na endpoint Kolibri na maszynie we własnym budynku, bez warstwy opakowującej.

Czego Kolibri jeszcze nie ma

Cztery nieobecności warto jasno przedstawić, ponieważ relacje z premiery zwykle je pomijają.

• Brak niezależnej oceny. Artificial Analysis nie ma strony modelu dla Kolibri, a żadna strona trzecia nie opublikowała reprodukcji tabeli benchmarków dostawcy.

• Brak hostowanego endpointu od dostawcy. Wydanie to wagi oraz raport techniczny; w materiale opublikowanym wraz z modelem nie ma SKU API Aleph Alpha dla Kolibri.

• Brak trasy na OrcaRouter i żadnej na jakimkolwiek agregatorze, który wymienilibyśmy z nazwy. Przeszukaliśmy katalog pod każdą pisownią prefiksu dostawcy i nazwy modelu, a Kolibri tam nie ma — więc jeśli chcesz go wywołać, sam pobierasz 78 GB i uruchamiasz endpoint vLLM. Wolimy to powiedzieć, niż sugerować, że go serwujemy.

• Brak danych wejściowych multimodalnych. Tekst na wejściu, tekst na wyjściu, dwa języki. To kompromis, na który laboratorium zdecydowało się, wybierając głębię zamiast wszechstronności, i w przypadku wdrożenia do przetwarzania dokumentów jest to prawdopodobnie właściwy wybór, ale to realna granica.

Jeśli tym, czego naprawdę potrzebujesz dzisiaj, jest mały model mieszaniny ekspertów, który możesz wywołać bez kupowania dwóch GPU, poziom Gemma 4 MoE jest najbliższym rozwiązaniem już dostępnym na routowanym punkcie końcowym, w cenie 0,06 USD za milion tokenów wejściowych i 0,33 USD za milion tokenów wyjściowych w wariancie 26B-A4B, z oknem 262 144 tokenów. Dla każdego, kto rozważa samodzielnie hostowane, suwerenne wdrożenie 78B w porównaniu z tym, użyteczne porównanie to nie wiersze benchmarków — to 78 GB VRAM i rozmowa o zakupie w zestawieniu z pozycją kosztową za token. OrcaRouter kieruje ten poziom na jednym kluczu zgodnym z OpenAI, z ceną katalogową dostawcy przekazywaną w całości i bez doliczania niczego, co jest tanim sposobem, aby przekonać się, czy obciążenie uzasadnia posiadanie sprzętu.

Kolibri to ciekawszy artefakt. Model niemiecko-angielski o 78 miliardach parametrów na licencji Apache 2.0, z potokiem danych, metodą tokenizacji, wskaźnikiem energii i trzyletnią iteracją obok wag, to inny rodzaj wydania niż same wagi — ujawnienie jest częścią produktu, a nie wpisem na blogu o nim. Czy twierdzenie o Pareto się obroni, to teraz pytanie do ludzi z dwoma H100 i stoperem, a odpowiedź nie nadejdzie od nikogo, kto napisał kartę modelu.