
FrogNano-4B-2609 vs LFM2.5 2.6B Base : un spécialiste abouti et un sac de poids pré-entraînés
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 219 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Saisissez une question dans LFM2.5 2.6B Base et il continuera votre phrase au lieu d'y répondre. Ce n'est pas un défaut — Liquid AI l'a publié comme le point de contrôle pré-entraîné sous-jacent à la famille LFM2.5, l'ajustement aux instructions étant délibérément laissé à son homologue non-Base, et la fiche indique clairement qu'il est destiné à un ajustement fin intensif. FrogNano-4B-2609 de Microsoft correspond à ce à quoi ressemble l'autre bout de ce pipeline : le même type de petit modèle de langage, soumis à cinq itérations d'apprentissage par renforcement sur des tâches sur des dépôts synthétiques jusqu'à ce qu'il émette des appels d'outils structurés et des correctifs candidats via un harnais à cinq outils. Aucun des deux ne dispose d'un benchmark indépendant publié. La différence est que l'un d'eux a vu son post-entraînement achevé, et savoir lequel est toute la décision.
Les chiffres FrogNano ci-dessous proviennent de la fiche de modèle et du rapport technique de Microsoft. Les chiffres LFM proviennent de la fiche de Liquid AI, de son fichier de configuration d'architecture et de son fichier de licence. Chaque nombre attribué à l'un ou l'autre fournisseur est signalé comme déclaré par le fournisseur, et aucun de ces deux modèles n'a fait l'objet d'une évaluation par un tiers — pour LFM2.5 2.6B Base, c'est en grande partie délibéré, car un point de contrôle sans ajustement par instructions ne constitue pas une cible équitable pour un benchmark de conversation.
La comparaison ne fonctionne que si vous savez ce que vous comparez
Mettez les deux fiches techniques côte à côte et la première chose qui cloche, c'est le nombre de paramètres. LFM2.5 2.6B Base, c'est 2,69 milliards de paramètres denses répartis sur 30 couches — 22 blocs de convolution courte à double porte et 8 couches d'attention à requêtes groupées — entraîné sur environ 34 000 milliards de tokens dans 16 langues, avec un vocabulaire de 128 000 tokens et un contexte de 131 072 tokens. Sa version quantifiée avoisine les 1,67 Go en Q4_K_M.
La fiche de FrogNano-4B-2609 indique que son champ de paramètres correspond à la plage « 500M-5B », et le résumé du modèle le décrit comme environ 4,66 milliards. Le téléchargement tranche le débat : deux shards safetensors totalisant 9,32 Go de poids BF16, 738 tenseurs, sur une pile héritée, dense, de 32 couches, hybride Gated DeltaNet et gated-attention. Une tour de vision de 24 couches se trouve dans le checkpoint et n’a jamais été post-entraînée.
Ainsi, le rapport de taille est d'environ 1,7 pour 1, et le rapport de mémoire est plus proche de 5,6 pour 1 une fois la quantification prise en compte. Cet écart compte davantage que la ligne de paramètres, car ces deux modèles sont des candidats à l'auto-hébergement plutôt que des points de terminaison — ce qui est la seule raison pour laquelle ils figurent dans le même article.
• Usage prévu — LFM2.5 2.6B Base est une matière première pour une exécution de fine-tuning. FrogNano-4B-2609 est une politique finalisée pour l’ingénierie logicielle au niveau du dépôt au sein du harnais Leaf.
• Suivi d'instructions — LFM2.5 2.6B Base n'en a aucun de base ; la fiche de Liquid AI le recommande pour des tâches nécessitant un fine-tuning intensif. FrogNano-4B-2609 suit une description de tâche et émet des appels d'outils structurés, car c'est exactement ce pour quoi son objectif RL l'a entraîné.
• Contexte — 131 072 tokens pour LFM2.5 2.6B Base, contre environ 131 K tokens combinés pour la configuration évaluée de FrogNano. Nominalement identiques, mais la fenêtre de FrogNano doit contenir les résultats d’outils, la sortie shell et les journaux de test, pas seulement un prompt.
• Plafond de sortie — la configuration validée de FrogNano autorise 8 192 jetons générés par tour d’assistant. LFM2.5 2.6B Base ne publie aucun équivalent, puisqu’il n’est pas conçu pour terminer une réponse.
• Modalité — les deux sont uniquement textuels. Les composants de vision de FrogNano sont hérités et explicitement non pris en charge ; LFM2.5 2.6B Base est de type texte en entrée, texte en sortie par construction.
• Licence — LFM2.5 2.6B Base relève de la LFM Open License v1.0, gratuite en dessous de $10M de chiffre d’affaires annuel et nécessitant une licence distincte à ce seuil ou au-delà, les œuvres dérivées héritant du plafond. La fiche de FrogNano indique MIT dans ses liminaires et Apache 2.0 dans son corps.
La chose que Microsoft a payée, et celle que vous devriez payer vous-même.
C'est la section porteuse, car c'est celle où une comparaison de spécifications induit en erreur.
Toute la valeur ajoutée de FrogNano-4B-2609 réside dans le post-entraînement, et Microsoft a publié la méthode. Partez de Qwen3.5-4B, qui a obtenu 39,4 % sur SWE-bench Verified via le harnais Leaf en tant que modèle général. Générez des tâches candidates de dépôt à partir d’instantanés réels, lancez des rollouts depuis le point de contrôle actuel pour trouver les tâches qu’il résout parfois, conservez celles-ci, entraînez, puis répétez — cinq itérations, environ 1 500 environnements synthétiques validés au total, et aucune distillation à partir d’un modèle plus grand à aucun moment. Le résultat sur la fiche de Microsoft elle-même est de 61,5 % sur SWE-bench Verified, 37,6 % sur SWE-bench Pro, 31,1 % sur Terminal-Bench 2.0 et 47,3 % sur PatchEval-Verified. L’annexe sur l’efficacité de l’article rapporte la même progression sous la forme de 48,2 %, 53,4 %, 58,3 %, 58,6 % et 61,6 % au fil des itérations, ce qui est un rappel utile : même les deux tableaux du laboratoire lui-même pour la même expérience ne s’accordent pas sur les échelons.
Maintenant, confrontez cela à LFM2.5 2.6B Base. C’est le checkpoint précédant le début de ce travail. La recommandation de sa propre fiche — le fine-tuner — correspond précisément au travail que documente FrogNano : un environnement de tâche, une récompense exécutable, un harnais de plus longue durée, et plusieurs itérations d’entraînement face à une politique changeante. L’article ne prétend pas que cela soit facile. Il rapporte que les checkpoints intermédiaires sont devenus progressivement plus coûteux à entraîner à mesure que les traces de raisonnement s’allongeaient, qu’une pénalité de longueur de log a dû être ajoutée pour arrêter la dérive, et que les itérations ultérieures ont perdu la capacité d’appel d’outils en parallèle que possédait le modèle de base, pour finir à un taux d’appels simultanés de 1,71 %. Quiconque envisage d’exécuter la recette FrogNano sur une autre base 2.6B devrait prévoir un budget pour ces trois problèmes en particulier.
Ce que LFM2.5 2.6B Base vous apporte, c'est une autre forme d'avance : un budget de pré-entraînement de 34 000 milliards de tokens, une architecture hybride documentée, une version quantifiée existante, et un contexte documenté de 131 072 tokens, le tout à une taille qui s'exécute sur du matériel sur lequel un checkpoint BF16 de 9,32 Go ne tiendrait pas. Si votre tâche est suffisamment étroite pour qu'un petit fine-tuning batte un modèle généraliste, c'est une véritable position — et sinon, vous avez fait l'économie d'un entraînement.

Ce que vous devez construire de toute façon
Aucun de ces deux n’est un appel réseau, et cela façonne la comparaison pratique davantage que n’importe quelle ligne de spécifications.
LFM2.5 2.6B Base réclame un runtime d’inférence et un entraînement. La fiche de Liquid AI liste des builds au format natif, GGUF, ONNX et MLX, donc la partie serving est bien couverte — llama.cpp sur un ordinateur portable est une option réaliste pour le checkpoint quantisé. La partie entraînement vous revient : les données, l’objectif, l’évaluation, et un moyen de déterminer si le résultat s’est amélioré ou s’il est simplement différent.
FrogNano-4B-2609 veut un point de terminaison compatible OpenAI avec les bons parseurs et un cluster Kubernetes avec l'autorisation de gérer les pods et les politiques réseau. Le README de Microsoft est d'une franchise inhabituelle : le harnais est une dépendance plutôt qu'une commodité, et la fiche indique que des scores identiques nécessitent un checkpoint, un tokenizer, une configuration de service, des images de tâches et un protocole d'évaluation correspondants. La configuration n'est pas un détail ici — servez-le sans parseur de raisonnement Qwen3 ni parseur d'appel d'outils Qwen3 coder, et le modèle écrit de la prose là où le harnais attend un appel d'outil.
Voilà la physionomie de cette confrontation : d'un côté, un projet d'entraînement avec un petit problème de serving ; de l'autre, un projet de serving avec un gros problème d'évaluation et plus rien à entraîner. Dans les deux cas, c'est une soirée de travail. Un seul est une soirée de travail qui peut se terminer par « le modèle n'est pas assez bon », sans que ce soit de votre faute.

Où un routeur mérite sa place dans une configuration comme celle-ci
Ces deux modèles finissent dans un pipeline qui appelle aussi quelque chose d’hébergé. Le banc d’évaluation propre à FrogNano en est la preuve : le harnais Leaf communique avec un point de terminaison compatible OpenAI, ce qui signifie que le modèle testé et tout modèle auquel vous le comparez sont atteints via la même interface. C’est un schéma qui vaut la peine d’être copié, même lorsque la raison n’est qu’hygiénique, et c’est là qu’un seul point de terminaison fait quelque chose de concret.
OrcaRouter regroupe plus de 200 modèles derrière une seule clé compatible OpenAI avec 0 % de marge, de sorte que les prix catalogue des fournisseurs sont répercutés sans modification et qu'un changement de prix d'un fournisseur est effectif de notre côté le jour même — c'est le chiffre qui bouge réellement lorsque vous décidez si un spécialiste auto-hébergé bat un modèle général hébergé en coût par tâche. Basculement automatique couvre la moitié hébergée de cette comparaison, pas le checkpoint que vous servez vous-même. Nous n'hébergeons pas FrogNano-4B-2609 ni LFM2.5 2.6B Base ; les deux sont des téléchargements. Ce qu'une couche de routage élimine, c'est la seconde intégration à chaque fois que le côté hébergé de votre benchmark change.
En choisir un, franchement
Choisissez LFM2.5 2.6B Base si votre tâche est étroite, votre matériel est modeste et que vous êtes prêt à prendre en charge vous-même l'entraînement — la licence est gratuite en dessous de 10 M$ de chiffre d'affaires, la version quantifiée pèse 1,67 Go, et la fiche de Liquid AI elle-même le recommande exactement pour cela. La contrepartie, c'est que vous obtenez un point de départ, pas une capacité : rien dans la publication ne vous dit quel score obtiendrait un entraînement RL à la FrogNano construit par-dessus, et personne n'en a publié.
Choisissez FrogNano-4B-2609 si la tâche relève de l’ingénierie logicielle au niveau du dépôt et que vous voulez que le post-entraînement soit déjà effectué. Les 61,5 %, 37,6 %, 31,1 % et 47,3 % sont de véritables résultats publiés par un laboratoire qui a décrit sa méthode en détail — et ils constituent aussi, pour l’instant, une boucle fermée : même laboratoire, même harnais, même référence de modèle de base. Le téléchargement de 9,32 Go, la dépendance au harnais et le cumul de licences sont le prix à payer pour éviter un projet d’entraînement que vous auriez sinon à mener.

Le recadrage utile consiste à dire que ce ne sont pas des concurrents. LFM2.5 2.6B Base se situe en amont d’un processus qui a produit quelque chose comme FrogNano-4B-2609. Si vous vous retrouvez à devoir choisir entre eux, la vraie question est de savoir si votre problème justifie que vous preniez en charge un entraînement — et si la réponse est non, le checkpoint 4B avec le harnais, la méthode publiée et le classement SWE-bench rapporté par le fournisseur est celui qui arrive déjà terminé.
