Carton-titre indiquant « Kolibri vs Solar Mini 4 », avec le sous-titre « Le même budget actif de 3B, deux paris très différents », et deux lignes en petits caractères indiquant « Kolibri — 78,1B au total, poids Apache 2.0, auto-hébergé » et « Solar Mini 4 — 35B au total, fermé, API hébergée », sur fond blanc avec de discrets accents en dégradé bleu et cyan et le logo OrcaRouter en bas à droite.
Guides & Insights

Kolibri vs Solar Mini 4 : le même budget actif de 3B, deux paris très différents

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux modèles ont été livrés à dix-sept jours d'intervalle, tous deux réglés pour mobiliser environ trois milliards de paramètres actifs par token, et pourtant, pour ce qui est de les adopter réellement, ils pourraient difficilement être plus différents. Kolibri d'Aleph Alpha, ce sont 78,1 milliards de paramètres de poids Apache-2.0 que vous téléchargez et servez vous-même : aucun point de terminaison hébergé n'existe, et, à ce jour, il n'existe nulle part le moindre score indépendant le concernant. Solar Mini 4 d'Upstage, ce sont 35 milliards de paramètres que vous ne pouvez pas télécharger du tout — il n'existe que sous la forme d'un point de terminaison facturé à l'usage, et il affiche déjà un Artificial Analysis Intelligence Index de 24,05. Le nombre de paramètres actifs vous indique ce que chacun coûte à exécuter. Rien d'autre dans ce nombre ne vous dit ce qu'il vous en coûte pour démarrer.

Si les totaux divergent autant — 78,1 B contre 35 B avec une part active presque identique —, c’est parce que les deux sont des architectures à mélange d’experts clairsemé, et que les deux laboratoires ont fait des choix opposés quant à la quantité de capacité d’experts à garder en réserve. Kolibri embarque 384 experts et achemine chaque token vers 1 expert partagé plus 6 d’entre eux. Solar Mini 4 divulgue une répartition 35B/3B et rien sur son nombre d’experts. Lorsque deux modèles sont présentés avec le même chiffre de paramètres actifs, c’est le total des paramètres, et non ce chiffre, qui détermine votre facture matérielle — et ici, la différence est de 2,2× pour le même budget de calcul annoncé.

Ce que chacun est réellement

• Paramètres totaux — Kolibri 78.10B vs Solar Mini 4 35B

• Paramètres actifs par token — Kolibri 3.46B vs Solar Mini 4 3B

• Poids — Kolibri Apache 2.0, poids complets sur Hugging Face vs Solar Mini 4 fermé ; API uniquement

• Contexte — Kolibri 1 048 576 tokens validés vs Solar Mini 4 512K selon la documentation d'Upstage, 1 048 576 selon la fiche modèle d'Artificial Analysis

• Sortie maximale — Kolibri non plafonné par le fournisseur vs Solar Mini 4 128 000 tokens

• Langues — Kolibri allemand et anglais vs Solar Mini 4 anglais, coréen et japonais

• Date limite des connaissances — Kolibri 18 juin 2026 vs Solar Mini 4 février 2026

• Mise à disposition — Kolibri auto-hébergé (vLLM) vs Solar Mini 4 hébergé sur la Console et le Playground d'Upstage, ainsi que sur site

• Évaluation indépendante — Kolibri : aucune publication vs Solar Mini 4 AA Intelligence Index 24.05

Kolibri : 78 milliards de paramètres, et personne en dehors du laboratoire ne l'a évalué

Aleph Alpha a publié Kolibri le 3 octobre 2026, délibérément le jour de l'unité allemande, comme le premier d'une nouvelle famille et le successeur de Kolibri Origin. La fiche du modèle est inhabituellement franche sur ce qui y est entré : 20 billions de tokens de pré-entraînement, 3,44 billions d'entraînement intermédiaire et 201 milliards d'entraînement à long contexte, exécutés sur 768 GPU B200 en 21 jours pour environ 6,4×10²³ FLOPs et environ 950 MWh. Le fournisseur indique aussi volontairement le nombre de défaillances — 38 interruptions imprévues, soit environ une pour 10 000 heures-GPU —, un chiffre que les laboratoires omettent généralement.

Screenshot of Aleph Alpha's newsroom post “Kolibri Has Landed”, showing the 03/10/2026 release date, the line about releasing on the Day of German Reunification, and the architecture comparison table between Kolibri and Kolibri Origin.

L'architecture se résume à un récit de MoE épars bien propre. Cinquante couches avec un ratio de 4:1 entre l'attention à fenêtre glissante (fenêtres de 512 tokens) et l'attention globale, cette dernière ne s'activant qu'une couche sur cinq. Des poids FP8 avec une mise à l'échelle par blocs de 128×128 et un cache KV en FP8. Kolibri Origin, pour comparaison, utilisait 128 experts routés sur 8, une dimension cachée d'expert de 768 et une attention complète sur chaque couche, sur des données en anglais coupées en septembre 2024. Kolibri passe à 384 experts routés sur 6 avec une dimension cachée de 512, et repousse les deux coupures linguistiques au 18 juin 2026.

Le pipeline allemand est la partie qu’il est véritablement difficile d’acheter ailleurs. Aleph Alpha a entraîné son propre tokenizer UniBPE et rapporte un texte allemand à 4,90 octets par token, contre 4,35 pour GPT-5, 4,17 pour Qwen3.5 et 4,13 pour Gemini. C’est un tokenizer qui revendique une meilleure compression de l’allemand que n’importe lequel des modèles multilingues de pointe, et c’est le mécanisme concret derrière l’argument de déploiement souverain : moins de tokens par document allemand signifie moins de tokens facturés et une fenêtre effective plus longue sur le même matériel.

Chaque chiffre de performance qui existe pour Kolibri provient de la fiche de modèle d’Aleph Alpha elle-même, et il faut le lire comme tel. Le tableau rapporté par le fournisseur place Kolibri à 75,5 global sur les évaluations en anglais et à 70,8 en allemand, 84,3 sur GPQA Diamond en anglais contre 81,3 en allemand, 21,5 sur Humanity's Last Exam en anglais contre 15,9 en allemand, 66,4 sur SWE-Bench Verified, 85,9 sur LiveCodeBench v6 et 68,3 sur AA-LCR. Ce sont des chiffres non audités. Il n’existe aucune page Artificial Analysis pour Kolibri — l’URL du modèle dans le tracker renvoie une 404 — donc rien dans ce tableau n’a été reproduit de manière indépendante, et l’article que vous lisez ne peut pas le rendre plus solide qu’il ne l’est.

Ce que la carte établit solidement, c'est l'histoire du service. Le socle matériel, ce sont deux A100 80GB, ou deux H100 SXM5, ou un seul H200, B200 ou B300. Une recette vLLM publiée l'exécute avec --kv-cache-dtype fp8 et des parseurs dédiés pour le raisonnement et les appels d'outils, à une température de 1,0, top-p 0,97 et top-k 128, avec un réglage reasoning_effort allant de none à low, medium et high. Un seul B300 servant un modèle 78B avec un contexte validé de 1M de tokens, c'est la forme concrète de l'offre : vous achetez la machine, puis vous assumez le coût marginal de chaque token.

Solar Mini 4 : vous louez la tranche active 3B au lieu de l’acheter

Solar Mini 4 est arrivé le 22 septembre 2026 — instantané solar-mini4-260922, alias solar-mini4 — en tant que petit modèle orienté agents d'Upstage : 35B au total, 3B actifs, une date de coupure de février 2026, anglais, coréen et japonais, avec des modes conversation, raisonnement, sortie structurée et appel d'outils. Il est disponible via la Console et le Playground d'Upstage, ainsi que pour un déploiement sur site, mais il n'y a aucun téléchargement de poids ni aucune licence à consulter. La documentation d'Upstage indique également « Data not collected » à son sujet, ce qui est la mention de conformité qui compte si vous le placez devant du trafic réel.

Screenshot of Upstage's Console documentation page for Solar Mini 4, showing the snapshot identifier solar-mini4-260922, the release date 2026-09-22, 35B total and 3B active parameters, a 512K context window with 128K maximum output, the list price of $0.10 per million input, $0.40 per million output and $0.01 per million cached, and the note “Data not collected”.

Contrairement à Kolibri, Solar Mini 4 a été soumis à un harnais d'évaluation indépendant. Artificial Analysis le place à 24,05 sur l'Intelligence Index, avec 1,01 % mesuré sur Terminal-Bench 4.0, 47,6 % sur SciCode, 83,3 % sur AA-LCR et 25,8 % sur Humanity's Last Exam. L'article de lancement d'Upstage présente le 24,1 comme l'Index le plus élevé parmi les modèles à 3B de paramètres actifs, devant Qwen3.6 35B A3B à 18 et Nemotron 3.5 Lightning à 13 — un cadrage qui est juste dans les limites de ce qu'il avance, et il faut noter qu'il est exactement aussi restreint que cela en a l'air, puisqu'il s'agit d'une affirmation sur la classe des 3B actifs plutôt que sur les petits modèles en général.

La mesure qui devrait guider votre budget n'est pas l'Index. La répartition des coûts par tâche d'Artificial Analysis place Solar Mini 4 à environ 0,36 $ par tâche de l'Intelligence-Index, et environ 0,30 $ de ce montant — quelque 82 % — correspond à des écritures de cache de prompt. Les lectures de cache coûtent 0,03 $ et la sortie générée seulement 0,035 $. Le modèle émet environ 88 300 tokens de sortie par tâche, dont environ 71 600 sont des tokens de raisonnement. En d'autres termes : c'est un modèle bon marché dont la facture est dominée par la réécriture d'un long contexte, et non par les tokens qu'il renvoie. Les coûts par évaluation vont de 1,63 $ pour Terminal-Bench 4.0 à 0,95 $ pour AA-Briefcase. La vitesse de sortie médiane est de 198 tokens par seconde avec un délai de 1,58 seconde jusqu'au premier chunk.

Le prix de chaque chemin

Solar Mini 4 n'est pas facturé au tarif catalogue aujourd'hui. La page de tarification d'Upstage présente pour ce modèle un échelonnement daté : 0,03 $ par million de jetons d'entrée, 0,003 $ pour les jetons en cache et 0,12 $ en sortie — une remise de lancement de 70 % — jusqu'au 10 octobre 2026 UTC, puis 0,05 $ / 0,005 $ / 0,20 $ à partir du 11 octobre, et enfin le tarif catalogue de 0,10 $ / 0,01 $ / 0,40 $ à partir du 23 octobre. Le billet de lancement d'Upstage décrit la remise de façon plus vague que ne le fait le calendrier de la page de tarification elle-même ; l'échelonnement ci-dessus est la version qui comporte des dates, et c'est celle sur laquelle il faut planifier. Remarquez où se situe la remise la plus forte : l'entrée mise en cache tombe à un dixième du tarif d'entrée, ce qui récompense précisément la charge de travail à contexte long et stable que le profil de coût d'écriture en cache ci-dessus facture.

Le prix de Kolibri est un bon de commande. Il n’y a pas de tarif par million de tokens à comparer, car il n’y a pas de compteur hébergé : vous payez les GPU et l’électricité, et le seul signal de coût public du fournisseur est l’entraînement lui-même, soit environ 950 MWh pour produire le modèle. Si vous disposez déjà d’une capacité d’inférence, le coût marginal par token de Kolibri s’approche du coût de l’électricité ; sinon, le ticket d’entrée est une machine à deux A100 ou mieux. C’est une forme d’engagement fondamentalement différente de celle d’un modèle que vous pouvez appeler au million de tokens et cesser d’appeler demain, et c’est la décision réelle que présentent les deux options.

Là où ils se recoupent, et où la comparaison échoue

• Calcul actif — quasi identique : 3,46 B contre 3 B par token

• Tout ce qui en découle — non comparable, car un seul des deux dispose de preuves vérifiées

• Meilleur score mesuré — Solar Mini 4 a un indice audité de 24,05 ; Kolibri dispose d’un tableau fournisseur et n’a aucun score audité.

• Allemand — Kolibri est le seul des deux à être entraîné pour cela, à 4,90 octets par token ; Solar Mini 4 ne le répertorie pas

• Coréen et japonais — Solar Mini 4 liste les deux ; Kolibri n’en liste aucun

• Contexte long — Kolibri valide un total de 1 048 576 jetons ; la documentation de Solar Mini 4 elle-même indique 512 K, tandis que sa fiche Artificial Analysis indique 1 M, donc considérez le plafond comme dépendant du fournisseur.

• Délai avant le premier token — Solar Mini 4, c’est quelques minutes, parce qu’il suffit de s’inscrire ; Kolibri, c’est des jours, parce qu’il faut monter une machine en rack

• Modèle de coûts — par jeton, décroissant selon le barème de remises, face au capital plus la puissance

Le résumé honnête, c’est qu’il ne s’agit pas d’un duel qui se tranche dans un classement. Le tableau du fournisseur Kolibri inclut même son propre jeu de comparaison — GLM-4.7 Flash 30B-A3B à 64,7 de score global en anglais, Nemotron 3 Nano 30B-A3B à 65,6, Qwen3.5 35B-A3B à 74,7, Qwen3.6 35B-A3B à 71,4, Gemma 4 26B-A4B IT à 71,9, tous face aux 75,5 de Kolibri lui-même — et chacune de ces lignes est le propre chiffre d’Aleph Alpha, obtenu par le même laboratoire sur son propre harnais. C’est une carte utile du voisinage des 3B actifs. Ce n’est pas un classement indépendant.

Si ce que vous voulez, c’est un MoE à 3B actifs sur une clé aujourd’hui

Aucun des deux modèles de cette comparaison ne figure sur OrcaRouter, et il convient d’être précis sur la raison. Kolibri ne dispose encore d’aucune inférence hébergée, quelle qu’elle soit — ce sont des poids et une recette vLLM, donc il n’y a rien vers quoi un routeur puisse pointer. Solar Mini 4 est servi par Upstage et par le canal sur site propre d’Upstage ; nous ne l’acheminons pas, et nous n’acheminons aucun modèle Upstage. Si vous voulez l’un ou l’autre, vous l’obtenez auprès des fournisseurs eux-mêmes.

Notre route est la classe englobante — le segment sparse small-MoE dans lequel ces deux modèles se livrent concurrence. Gemma 4 26B-A4B IT est au catalogue à 0,06 $ en entrée et 0,33 $ en sortie par million de tokens avec une fenêtre de 262 144 tokens. Qwen3.5 35B-A3B est à 0,057 $ / 0,459 $ et Qwen3.6 35B-A3B à 0,248 $ / 1,485 $ avec une fenêtre de 262 144 tokens et 65 536 tokens de sortie maximale. C'est le même compromis que font les deux modèles ci-dessus — une tranche active de 3B à 4B achetée au prix d'un petit modèle — disponible sur une clé API avec le prix catalogue du fournisseur répercuté à 0 % de marge, de sorte qu'un changement de prix du fournisseur arrive sur votre facture le jour même où il est annoncé plutôt qu'au prochain renouvellement de contrat. Basculement automatique compte ici plus que d'habitude : lorsque vous évaluez un modèle sparse non éprouvé, une deuxième route derrière la même clé est ce qui empêche un mauvais après-midi de devenir une panne.

A two-column comparison scoreboard titled “Kolibri vs Solar Mini 4 — the scoreboard”. The Kolibri column lists total parameters 78.1B, 3.46B active per token, Apache 2.0 downloadable weights, 1,048,576-token context, German and English, and no independent score published. The Solar Mini 4 column lists total parameters 35B, 3B active per token, closed API-only weights, a 512K-per-docs / 1M-per-Artificial-Analysis context, English, Korean and Japanese, and an Artificial Analysis Intelligence Index of 24.05. A footer line reads “Kolibri figures are Aleph Alpha's own, unaudited; Solar Mini 4 figures per Artificial Analysis and Upstage.”

Que faire, et quoi regarder

Choisissez Kolibri si votre charge de travail est en allemand ou en anglais, si les données ne peuvent pas quitter votre propre rack, et si vous disposez — ou êtes prêt à acheter — des GPU pour servir 78B en FP8. Dans cette configuration, c’est le seul de ces deux modèles qui soit ne serait-ce qu’une option, et le contexte validé de 1M tokens avec un tokenizer allemand à 4,90 octets par token est un avantage réel, bien que mesuré par le fournisseur. Choisissez Solar Mini 4 si vous voulez être en production cette semaine, si le coréen ou le japonais figure sur la feuille de route, et si votre charge de travail est un contexte long et stable que la remise sur cache récompense ; prévoyez un budget pour les écritures de cache, pas pour les tokens de sortie.

La question qui reste ouverte est la même pour les deux, et c'est une question de preuves plutôt que de capacités. Les 75,5 et 84,3 de Kolibri sont les chiffres d'Aleph Alpha sur le propre banc d'essai d'Aleph Alpha, et tant qu'un organisme de suivi indépendant ne l'aura pas exécuté, quiconque les cite ne fait que citer le laboratoire. Le 24,05 de Solar Mini 4 est réel et reproduit, mais l'Index est un instantané d'un modèle qui se trouve encore au milieu de l'échelle des remises, le prix catalogue n'arrivant pas avant le 23 octobre. Surveillez la première évaluation indépendante de Kolibri, et surveillez ce que Solar Mini 4 coûtera réellement une fois l'échelle arrivée à son terme — car à 0,10 $ / 0,40 $, l'économie de la location de la tranche 3B paraît différente des 0,03 $ / 0,12 $ qu'on vous propose aujourd'hui.