
Ember-1 vs LFM2.5 2.6B Base : un comportement abouti face à un substrat brut
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 177 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Ni Ember-1 ni LFM2.5 2.6B Base ne sont des modèles que l’on peut prendre et utiliser, et ils sont inutilisables pour des raisons opposées. Ember-1, publié par Fireworks Research le 23 septembre 2026, est un dérivé spécialisé de Kimi K3 de Moonshot AI que le laboratoire a réentraîné pour atteindre la précision de K3 avec environ 40 % de tokens en moins — un comportement abouti, disponible uniquement sous forme d’aperçu de recherche sur la plateforme serverless de l’éditeur, sans poids ni prix publié. LFM2.5 2.6B Base, publié par Liquid AI le 4 août 2026, est un checkpoint préentraîné de 2,69 milliards de paramètres sous LFM Open License v1.0 qui n’a pas du tout été ajusté aux instructions et qui continuera votre texte plutôt que de répondre à votre question — un substrat brut, téléchargeable dès aujourd’hui, délibérément inachevé. Les lire côte à côte est une bonne façon de voir les deux arguments avancés sur la question de savoir d’où viennent désormais les gains d’efficacité.
La question à laquelle les deux modèles répondent
Les deux sorties partent du même postulat : les gains faciles obtenus en agrandissant un modèle ont largement été captés, et le travail intéressant s’est déplacé vers la manière dont un modèle dépense ce qu’il possède déjà. Les deux laboratoires y répondent différemment. Fireworks Research a pris un modèle de pointe existant et en a modifié le comportement. Liquid AI a construit un petit modèle à partir de zéro et a changé l’échelle. Ni l’une ni l’autre n’est une histoire de nouvelle architecture, et ni l’une ni l’autre ne cherche à se hisser en tête d’un classement.
Réponse d'Ember-1 : garder le modèle, réentraîner le comportement
Ember-1 laisse l'architecture de Kimi K3 intacte et s'attaque à une inefficacité spécifique. Les modèles de raisonnement peuvent consommer plus de 90 % de leurs tokens générés en délibération interne, et dans une boucle d'agent multi-tours, ces traces sont rejouées et refacturées à chaque tour suivant — Fireworks Research décrit la croissance du contexte résultante comme approximativement quadratique en fonction du nombre de tours. L'affirmation du laboratoire est que le raisonnement de K3 est plus long que nécessaire pour la tâche et que l'excédent peut être supprimé sans modifier les réponses. Il rapporte avoir mené plus de 50 expériences d'entraînement et plus de 200 évaluations sur sa propre pile d'entraînement serverless, et affirme que la longueur du raisonnement a chuté de 35 à 50 % sans perte de précision sur sept benchmarks et deux ensembles de trafic de production clients. Tout cela est rapporté par le fournisseur et non reproduit.
Les résultats sont hétérogènes d’une manière que le chiffre phare dissimule. Les réductions de tokens d’Ember-1 vont de 51,9 % sur Terminal Bench 2.1 à 5,9 % sur τ-2 Bench Airline. Dans un test A/B de codage en production chez un client, les tokens de sortie sont passés de 49,3 K à 29,9 K, tandis que le score s’est maintenu à 0,753 contre 0,751 — soit une réduction de 71,3 % des tokens de raisonnement. C’est un effet important sur un profil de charge de travail et presque invisible sur un autre, ce à quoi on peut s’attendre d’un modèle entraîné à cesser de trop réfléchir plutôt qu’à réfléchir moins.

Réponse de LFM2.5 2.6B Base : changez l'échelle, gardez la recette
LFM2.5 2.6B Base est un pari d'un autre genre. C'est l'architecture hybride de Liquid AI à petite échelle : 30 couches, dont 22 blocs de convolution courte à double portail et 8 couches d'attention à requêtes groupées, entraînée sur environ 34 000 milliards de tokens dans 16 langues, avec une fenêtre de contexte de 131 072 tokens. Le checkpoint complet compte 2,69 milliards de paramètres denses — assez petit pour que la conversation sur le coût cesse de porter sur les tokens et commence à porter sur le seul GPU que vous avez en rab.
Ce qui le rend inhabituel, c’est ce qu’il ne fait délibérément pas. Il n’y a pas de réglage par instructions (instruction tuning), et c’est tout l’intérêt du suffixe « Base » : donnez-lui une question et il poursuivra le texte dans le style de la question plutôt que d’y répondre. La fiche modèle de Liquid AI elle-même le recommande pour les tâches nécessitant un fine-tuning intensif. Il n’existe pas non plus d’évaluation publiée de celui-ci, et ce n’est pas un oubli — évaluer un checkpoint de base sur des benchmarks de suivi d’instructions ne mesurerait rien, car le comportement mesuré n’a pas encore été appris lors de l’entraînement.
Le contraste, une ligne par dimension
• Ce dont il s'agit — Ember-1 : un dérivé réentraîné de Kimi K3 avec un raisonnement raccourci. LFM2.5 2.6B Base : un point de contrôle préentraîné à partir de zéro, sans affinage par instructions.
• Paramètres — Ember-1 : non divulgués ; hérités de Kimi K3. LFM2.5 2.6B Base : 2,69B dense.
• Poids — Ember-1 : aucun publié. LFM2.5 2.6B Base : disponible sous la LFM Open License v1.0.
• Prix — Ember-1 : aucun prix publié ; les dollars des benchmarks reposent sur la grille tarifaire de Kimi K3. LFM2.5 2.6B Base : téléchargement gratuit ; vous fournissez le matériel.
• Contexte — Ember-1 : non publié pour l’aperçu. LFM2.5 2.6B Base : 131 072 tokens.
• Évaluation publiée — Ember-1 : sept benchmarks et deux tests A/B, tous réalisés par le fournisseur. LFM2.5 2.6B Base : aucune, par choix.
• Ce que vous obtenez à la fin — Ember-1 : un point de terminaison qui produit un raisonnement plus court avec une précision de niveau K3. LFM2.5 2.6B Base : un point de départ dont le comportement dépend entièrement de ce que vous y entraînez.
Deux sortes différentes de manque
Les lacunes dans ces deux versions semblent symétriques et ne le sont pas. L’évaluation manquante de LFM2.5 2.6B Base est une propriété de l’artefact : un checkpoint de base n’a pas de comportement à évaluer, et l’instruction tuning manquant est une caractéristique documentée plutôt qu’une insuffisance. L’absence ne crée pas d’incertitude commerciale, car ce que vous achetez est un fichier auquel une licence est attachée, et le livrable est complet dès que le téléchargement se termine.
Les éléments manquants d’Ember-1 restent véritablement en suspens. Aucun prix n’est publié, donc l’affirmation sur le coût relève d’un calcul sur la grille tarifaire de Kimi K3, plutôt que d’un tarif sur lequel fonder un budget. Aucune diffusion des poids n’a eu lieu, donc le modèle ne peut pas perdurer au-delà de la décision du fournisseur de continuer à le servir. Et la fenêtre d’accès est décrite comme temporaire : Fireworks Research présente ses publications de recherche comme des fenêtres serverless de deux semaines, dont la pérennité dépend de la demande de la communauté. Un aperçu qui pourrait ne plus exister le mois prochain est une proposition différente d’un aperçu qui n’est simplement pas encore prouvé, et le deuxième test A/B client dans l’annonce — environ 35 % de tokens en moins par tâche — vous indique ce que le laboratoire attend, et non ce qui sera encore accessible en novembre.
Cette asymétrie est la réponse honnête à « lequel de ces deux est le plus prêt ». Ni l’un ni l’autre n’est prêt au sens d’être une dépendance de production directement intégrable. LFM2.5 2.6B Base est achevé en tant que matière première et inachevé en tant que modèle. Ember-1 est achevé en tant que modèle et inachevé en tant que service.

Que faire avec chacun ce trimestre
Si vous disposez d'un pipeline de fine-tuning et d'une tâche étroite avec des étiquettes propres, LFM2.5 2.6B Base est le plus prévisible des deux. Le checkpoint est petit, la licence est permissive, l'architecture est conçue pour être efficace à l'inférence, et le travail consistant à en faire quelque chose d'utile — fine-tuning supervisé, jeu d'évaluation, pile de service — est un travail que vous maîtrisez déjà de bout en bout. Vous exécuterez de toute façon vos propres évaluations, car Liquid AI n'en a publié aucune.
Si vous avez une charge de travail d’agent hébergé dont la facture est dominée par les jetons de raisonnement, Ember-1 s’attaque à un poste réel de votre équation de coûts, et cela vaut les deux semaines. Le bon test consiste en du trafic fantôme par rapport à votre solution en place : envoyez une part des requêtes réelles aux deux, comparez les sorties, ne touchez pas aux résultats en production. C’est aussi le conseil qu’a donné une couverture critique indépendante de la sortie, assorti d’un avertissement juste — compresser la délibération risque de faire perdre une étape dont le modèle avait besoin, et dans un agent, cela se manifeste plus tard par un mauvais appel d’outil plutôt que par une phrase erronée.
Aucun des deux modèles n’est sur OrcaRouter. Si vous voulez tester le schéma plutôt que ces deux artefacts — un petit modèle affinable et un grand raisonneur hébergé dans un même pipeline — c’est exactement à cela que sert le DSL de routage : composer plusieurs modèles en un seul appel et laisser chacun gérer la partie dans laquelle il excelle, derrière une seule clé et une seule facture. La comparaison vaut ici la peine d’être faite au niveau de l’architecture, même si les deux points de terminaison spécifiques restent hors de portée.
Le trade, énoncé une fois
Ember-1 vend la certitude de comportement et l’incertitude d’approvisionnement : un modèle dont la qualité est soigneusement argumentée et dont la disponibilité est explicitement conditionnelle. LFM2.5 2.6B Base vend la certitude d’approvisionnement et l’incertitude de comportement : un fichier que vous aurez toujours et dont la compétence dépend entièrement de l’entraînement que vous y investissez. Les équipes confrontées à un problème de serving et sans capacité d’entraînement devraient suivre la preview et espérer qu’elle devienne permanente. Les équipes disposant de capacité d’entraînement et ayant une tâche étroite devraient télécharger la base et cesser d’attendre la feuille de route de quiconque.

Ce que ce rapprochement montre vraiment, c’est que « l’efficacité » ne signifie plus une seule chose. Pour Ember-1, cela signifie moins de tokens à qualité égale sur le matériel de quelqu’un d’autre. Pour LFM2.5 2.6B Base, cela signifie un modèle suffisamment petit pour que le matériel cesse complètement d’être celui de quelqu’un d’autre. Ce sont toutes deux de bonnes réponses, et elles ne sont pas interchangeables.
