
Ling 3.0 Tiny contre Gemini 3.5 Flash-Lite : Gratuit ne veut pas dire médiocre, et le produit établi reste le pari sûr.
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- qwenNOUVEAUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 586 tok/s
- orcaNOUVEAUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
- tencentTencent: Hy32026-07-0642Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
- z-aiZ.ai: GLM 5.22026-06-1653Intelligence69Code60Maths
« Gratuit » est le mot le plus cher du vocabulaire du marché des modèles, car il signifie généralement que quelqu’un s’apprête à vous facturer autre chose que le prix affiché. C’est le piège caché dans l’affrontement entre Ling 3.0 Tiny, le nouveau modèle de raisonnement MoE de 7,9 milliards de paramètres d’Ant Group InclusionAI, et Gemini 3.5 Flash-Lite, le niveau Gemini actuel le moins cher et le plus rapide de Google. Ling 3.0 Tiny est gratuit à appeler pour le moment et coûte 0,06 $ / 0,18 $ par million de jetons après sa promotion du 14 août — mais Artificial Analysis a mesuré qu’il brûlait 210 millions de jetons de sortie rien que pour obtenir son score dans une classe de 56 modèles, contre une médiane de 63 millions, et l’a qualifié de « très verbeux ». Gemini 3.5 Flash-Lite coûte cinq fois plus cher par jeton, soit 0,30 $ / 2,50 $, pourtant il affiche un indice d’intelligence indépendant de 36 — 13 points au-dessus de Ling 3.0 Tiny — et une vitesse de sortie d’environ 490 jetons par seconde. Le prix le plus bas, le débit le plus rapide et le score le plus faible appartiennent tous au même modèle. C’est toute l’histoire de cette comparaison, et toute la raison de réfléchir à deux fois avant de choisir par défaut le nouveau venu sur le seul critère du prix.
Les deux modèles appartiennent à la catégorie économique, mais ils se trouvent à des étapes différentes de son cycle de vie. Gemini 3.5 Flash-Lite est l'acteur mature en place : lancé le 21 juillet 2026, remesuré en continu par un tiers, et largement déployé comme niveau par défaut pour les travaux agentiques à haut volume et sensibles à la latence. Ling 3.0 Tiny a une semaine, est tarifé pour attirer des utilisateurs, et n'a été évalué qu'une seule fois. Cet article distingue ce qu'est réellement chaque modèle, ce que disent les chiffres indépendants, et pourquoi le prix « gratuit » est le chiffre le moins utile de la comparaison.
Ling 3.0 Tiny, le nouveau venu avec un compteur
Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.
The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Gemini 3.5 Flash-Lite, le titulaire
Gemini 3.5 Flash-Lite est la réponse de Google à la même question, placé un cran plus bas dans la gamme Gemini 3.5. Il est nativement multimodal en entrée — texte, images, vidéo, audio et fichiers — avec une sortie textuelle, une fenêtre de contexte de 1 M de tokens, jusqu'à 64 K tokens en sortie, et un effort de raisonnement configurable (minimal, low, higher) afin qu'un pipeline puisse ajuster la profondeur, et la facture, à chaque requête. Son score indépendant est un véritable saut générationnel : indice Artificial Analysis Intelligence de 36, classé n° 12 sur 151 modèles suivis, contre 25 pour Gemini 3.1 Flash-Lite. Côté vitesse, c'est le modèle le plus rapide de la série 3.5 — Google annonçait 350 tokens/seconde en sortie au lancement, et la page en direct d'AA mesure environ 490 tokens/seconde, classé n° 2 parmi les modèles suivis. Ses chiffres agentiques déclarés par le fournisseur — 74,0 % sur OSWorld-Verified, 54 % sur Terminal-Bench 2.1, 72,2 % sur un test de récupération multi-aiguilles de 128 K — sont ceux de Google et ont une valeur plus indicative que normative, et une question ouverte (computer-use listé comme intégré sur le blog de Google mais non pris en charge dans la documentation de l'API) mérite vérification avant de s'y fier.
Ce n'est pas non plus, par jeton, bon marché pour sa catégorie. Le nom « Lite » décrit la place du modèle dans la gamme, et non un prix en baisse : Gemini 2.5 Flash-Lite était à 0,10 $ / 0,40 $, 3.1 Flash-Lite à 0,25 $ / 1,50 $, et 3.5 Flash-Lite est à 0,30 $ / 2,50 $ par million de jetons, avec une entrée en cache à 0,03 $. Le gain d'efficacité vient de la vitesse et de l'économie de jetons, et les mesures d'Artificial Analysis montrent que le coût réel par tâche a environ doublé de génération en génération, alors que le temps par tâche a été divisé par deux.
Le tableau de bord indépendant, lu dans son contexte.
Mettons les deux modèles sur le même index et l'écart est saisissant : Gemini 3.5 Flash-Lite à 36, Ling 3.0 Tiny à 23. Mais cette comparaison en une n'est que la moitié du tableau, car les deux modèles ne sont pas évalués dans le même champ. AA place Ling 3.0 Tiny 6e sur 56 dans sa catégorie de modèles minuscules, contre une médiane de catégorie de 8 — bien au-dessus de la moyenne pour un modèle de cette taille. Gemini 3.5 Flash-Lite se classe 12e sur 151 dans l'ensemble plus large des modèles suivis. L'un est un modèle minuscule exceptionnel ; l'autre est un modèle économique solide dans le pool ouvert. Les deux affirmations sont vraies, et elles signifient des choses différentes. Ling 3.0 Tiny offre un meilleur rapport qualité-prix pour sa catégorie de taille que Gemini 3.5 Flash-Lite pour la sienne — et Gemini 3.5 Flash-Lite reste le modèle le plus performant, et de loin, sur la même échelle indépendante.

Les dimensions, une ligne chacune :
• Score indépendant — Ling 3.0 Tiny AA Index 23 (#6/56, médiane de classe 8) vs Gemini 3.5 Flash-Lite AA Index 36 (#12/151).
• Prix — Ling 3.0 Tiny $0.06 / $0.18 par 1M après une promotion gratuite vs Gemini 3.5 Flash-Lite $0.30 / $2.50 par 1M (entrée en cache $0.03).
• Verbosité — Ling 3.0 Tiny 210M a généré des tokens de sortie lors de l'exécution de l'index, tandis que Gemini 3.5 Flash-Lite a été mesuré sans être considéré comme verbeux selon cet indicateur.
• {{1}}Modalité{{/1}} — {{2}}Ling 3.0 Tiny : texte uniquement, vs Gemini 3.5 Flash-Lite : texte, image, vidéo, audio et fichiers en entrée.{{/2}}
• Contexte — 256K sur Ling 3.0 Tiny contre 1M sur Gemini 3.5 Flash-Lite, avec une sortie maximale de 64K sur les deux.
• Vitesse — Ling 3.0 Tiny ~90–264 tokens/s sur les endpoints qui ont publié un chiffre, contre Gemini 3.5 Flash-Lite ~490 tokens/s sur la mesure en direct d'AA.
La ligne de vitesse est celle qui a le plus de chances de bouger. La vitesse de sortie de Ling 3.0 Tiny est réellement non résolue : Artificial Analysis l'indique comme N/A, tandis que Vercel annonce 264 tokens/seconde. Les ~490 tokens/seconde de Gemini 3.5 Flash-Lite sont une mesure en direct d'AA prise bien après que la volatilité de son propre lancement se soit calmée. Pour un niveau sensible à la latence, c'est la différence entre une quantité connue et une question ouverte.
L'économie de la verbosité : pourquoi le gratuit n'est pas bon marché
Voici l'arithmétique qui décide généralement de cette comparaison. Exécutez la même tâche à forte exigence de raisonnement — disons 4 000 jetons d'entrée et 2 000 jetons de sortie — sur les deux modèles après la fin de la promotion de Ling 3.0 Tiny. Ling 3.0 Tiny facture (4 000 × 0,06 $ + 2 000 × 0,18 $) / 1 000 000, soit environ 0,0006 $. Gemini 3.5 Flash-Lite facture (4 000 × 0,30 $ + 2 000 × 2,50 $) / 1 000 000, soit environ 0,0062 $. À nombre de jetons identique, Ling 3.0 Tiny est 10 fois moins cher. Ajoutez ensuite la verbosité : un modèle de raisonnement qui émet des jetons de pensée en sortie ne produit pas des nombres de jetons identiques. Si le ratio de verbosité de 210M contre 63M de Ling 3.0 Tiny se vérifie sur votre charge de travail, le coût effectif par tâche triple environ côté sortie, et l'avantage de 10 fois se réduit à environ 3 à 4 fois. Toujours moins cher — mais plus gratuit, et pas du même ordre que ce que laisse entendre le chiffre de 210M.
Le cadrage honnête est que les deux modèles ne sont pas des substituts de même qualité. Le 23 de Ling 3.0 Tiny est un score exceptionnel pour un modèle à 1,3 milliard de paramètres actifs ; le 36 de Gemini 3.5 Flash-Lite relève d'une autre catégorie de capacités, auxquelles s'ajoutent la vision, un contexte d'un million de tokens et une rapidité établie. Vous payez cet écart — cinq fois le prix au token, et davantage par tâche une fois les différences de vitesse prises en compte — mais c'est un écart de capacités bien réel, pas un simple écart marketing. Si votre charge de travail peut se satisfaire de la qualité du modèle moins cher, Ling 3.0 Tiny est le meilleur rapport qualité-prix. Si votre charge de travail exige ces capacités, aucun avantage de prix ne comble l'écart.
Là où un routeur gagne sa place
C'est précisément le type de charge de travail où une couche de routage surpasse un engagement envers un modèle unique, et les réalités de l'hébergement comptent pour la façon dont vous la construisez. Gemini 3.5 Flash-Lite est disponible sur OrcaRouter au prix catalogue de son fournisseur — 0,30 $ en entrée / 2,50 $ en sortie par million de jetons, transmis avec 0 % de marge, de sorte que le chiffre de la grille tarifaire de Google est celui que nous appliquons, et toute future baisse de prix est répercutée le jour même. Il se trouve derrière le même point de terminaison compatible OpenAI que 200+ autres modèles, avec un basculement automatique entre fournisseurs en cas de dégradation d'un fournisseur de base en cours d'exécution, et le DSL de routage peut envoyer une requête à plusieurs modèles et conserver la meilleure réponse.
Ling 3.0 Tiny n'est pas sur OrcaRouter ; il est servi par ses propres endpoints, gratuit aujourd'hui. Cette combinaison renforce en réalité l'argument du routage plutôt qu'elle ne l'affaiblit. Profitez de la période gratuite pour benchmarker Ling 3.0 Tiny sur votre propre trafic avant que cela ne devienne payant. Construisez ensuite le chemin de production sur le niveau hébergé — Gemini 3.5 Flash-Lite pour les appels qui nécessitent la vision, un contexte long ou un profil de vitesse stable, la couche de routage étant libre d'escalader vers un modèle plus cher pour la minorité difficile. Un niveau gratuit est une excellente expérience mais une dépendance fragile ; le niveau hébergé est ce sur quoi vous pouvez bâtir un produit. Sur OrcaRouter, vous pouvez exécuter les deux dans le même graphe — Ling 3.0 Tiny par endpoint direct, Gemini 3.5 Flash-Lite par clé — et laisser le routeur décider requête par requête.

Verdict
Si vous choisissez entre ces deux modèles sans les router ensemble, la décision est simple à énoncer mais difficile à accepter. Ling 3.0 Tiny est la meilleure affaire mais le modèle le plus faible : un niveau de raisonnement textuel vieux d'une semaine, avec un excellent score pour sa taille, un prix agressif et un bilan non résolu en matière de vitesse et de verbosité. Il mérite une évaluation immédiate en essai gratuit, mais sachez qu'il sera facturé à l'usage à partir du 14 août. Gemini 3.5 Flash-Lite est l'option par défaut la plus sûre en production : noté indépendamment 13 points plus haut, multimodal, contexte 1M, cinq fois plus rapide selon une mesure établie, et tarifé en conséquence. Gratuit ne veut pas dire économique quand le modèle parle trois fois plus pour réfléchir avec un plafond de capacités inférieur — et le modèle en place est le pari sûr pour une raison.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
