
Qwen 3.7 Flash : le modèle de vision Cent-Cheap d'Alibaba pour des agents qui regardent réellement les écrans
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
L'équipe Qwen d'Alibaba a passé les deux dernières années à lancer une gamme dense de modèles couvrant presque tous les niveaux de prix et de capacités imaginables, et le 27 juillet 2026, un autre est arrivé discrètement comme référence d'API commerciale : qwen/qwen3.7-flash. Il n'est pas arrivé avec le faste d'un lancement de produit phare, et Alibaba n'a publié ni rapport technique, ni suite de benchmarks, ni schéma d'architecture pour ce modèle. Ce avec quoi il est arrivé, c'est une description qui compte bien plus pour les développeurs qu'un score de plus au classement : un modèle de raisonnement vision-langage, une fenêtre de contexte d'un million de jetons, et un prix si bas qu'il apparaît à peine comme une ligne sur la facture.
Cette combinaison — bon marché, vaste contexte, et « voit » les images nativement — place Qwen 3.7 Flash résolument dans une catégorie devenue l'une des plus compétitives et des plus utiles de tout le marché des modèles : le cheval de travail multimodal à faible coût. Ce ne sont pas les modèles qui gagnent les classements de référence. Ce sont les modèles qui sont sollicités dix millions de fois par jour dans les boucles d'agents, les pipelines d'automatisation de navigateur et les outils de support, car à 0,03 $ en entrée et 0,13 $ en sortie par million de jetons, le coût cesse pratiquement d'être une contrainte de conception.
Cet article est un premier aperçu explicatif : ce qu'est réellement Qwen 3.7 Flash, ce qu'Alibaba a divulgué (et, surtout, ce qu'il n'a pas divulgué), comment les aspects économiques se jouent avec de vrais calculs de tokens, et où il se situe à côté du reste de la famille Qwen — y compris les modèles bien plus grands Qwen 3.8 et Qwen 3.7 Max — et face à des rivaux multimodaux bon marché comme Gemini 3.5 Flash-Lite. Nous verrons également comment une couche de routage comme OrcaRouter traite un tel modèle : non pas comme un modèle vedette, mais comme un niveau par défaut qui absorbe silencieusement l'essentiel du trafic multimodal.
TL;DR
Qwen 3.7 Flash est un modèle vision-langage de l'équipe Qwen d'Alibaba, répertorié sous l'identifiant de modèle qwen/qwen3.7-flash depuis le 27 juillet 2026. Il est conçu pour les agents multimodaux, le codage visuel, la recherche et l'interaction avec ordinateur/interface utilisateur, avec des atouts annoncés en reconnaissance d'objets et en compréhension spatiale. Il prend en charge une fenêtre contextuelle de 1 000 000 de jetons et est proposé au prix de 0,03 $ pour 1 million de jetons en entrée et 0,13 $ pour 1 million de jetons en sortie — parmi les modèles de vision les moins chers disponibles. La longueur maximale de sortie, le nombre exact de paramètres et l'architecture sont non officiellement divulgués ; les spéculations de la communauté évoquent une petite conception de mélange d'experts et un possible précurseur d'une version Qwen 3.7 à poids ouverts, mais cela n'est pas confirmé. Il s'agit d'un modèle distinct, plus petit et moins cher que Qwen 3.8 (le fleuron à poids ouverts de 2,4 T de paramètres annoncé séparément par Alibaba) et Qwen 3.7 Max (le plus grand fleuron de cette même génération). Aucune suite de benchmarks indépendante — y compris Artificial Analysis — ne l'a encore évalué, alors considérez les affirmations sur la qualité comme prématurées et non prouvées tant que des chiffres tiers n'existent pas.

Points clés
• Qwen 3.7 Flash est un modèle vision-langage, pas texte uniquement — il est conçu pour les agents multimodaux, le codage visuel, la recherche et les tâches d'utilisation d'ordinateur, pas pour le chat général.
• Le prix est de 0,03 $ pour 1M tokens d'entrée et 0,13 $ pour 1M tokens de sortie, ce qui est à peu près conforme au niveau le moins cher des modèles multimodaux proches de la pointe disponibles sur le marché aujourd'hui.
• La fenêtre de contexte est de 1M tokens, ce qui compte plus pour les sessions d'agent riches en images et à plusieurs tours que cela ne le paraît, car les images et captures d'écran consomment rapidement des tokens.
Les notes de tarification de l'annonce indiquent qu'avec la mise en cache des prompts sur un contexte répété, le coût effectif peut être inférieur de 60 à 80 % au prix catalogue — un levier non négligeable pour les boucles d'agents qui rejouent le même prompt système ou l'historique de captures d'écran.
• Alibaba n'a pas publié le nombre maximal de tokens de sortie, le nombre de paramètres, ni les détails de l'architecture ; tout ce que vous lisez de plus spécifique ailleurs est une inférence de la communauté, pas une divulgation du fournisseur.
• Il ne s’agit pas de Qwen 3.8 (le modèle phare de 2,4T à poids ouverts) ni de Qwen 3.7 Max (le plus gros modèle fermé de la même vague de lancement) — la similitude des noms mise à part, ce sont trois modèles différents avec trois rôles différents.
• Aucune organisation de référence indépendante, y compris Artificial Analysis, n'a publié de scores pour Qwen 3.7 Flash au moment de la rédaction — la qualité est véritablement non prouvée en dehors de la description du fournisseur.
Ce qu'est réellement Qwen 3.7 Flash
Débarrassez-vous de la convention de nommage et Qwen 3.7 Flash est la réponse d'Alibaba à une question que tous les grands labs se sont désormais posée : à quoi ressemble un modèle quand son unique cahier des charges est « gérer le trafic visuel, agentique et à fort volume aussi économiquement que possible sans être inutile » ? Google y a répondu avec les gammes Gemini Flash et Flash-Lite. OpenAI y a répondu avec ses lignes mini et nano. La réponse d'Alibaba, dans cette génération, est Qwen 3.7 Flash.
La description officielle se concentre sur quatre cas d'utilisation : les agents multimodaux, le codage visuel, la recherche, et l'interaction avec un ordinateur ou une interface utilisateur. C'est une liste très délibérée. Il ne s'agit pas de « grande capacité d'écriture créative » ou de « raisonnement poussé sur des problèmes d'olympiades de maths » — c'est une liste de tâches où un modèle doit regarder une capture d'écran, une page web, un élément d'interface utilisateur, ou un diff de code rendu visuellement, puis agir en conséquence. Alibaba souligne également la reconnaissance d'objets et la compréhension spatiale comme des atouts particuliers, ce qui correspond au cadre d'utilisation informatique et d'interaction avec l'interface utilisateur : un agent qui va cliquer sur des boutons, lire des mises en page, ou naviguer sur un écran doit savoir où se trouvent les choses, pas seulement ce qu'elles disent.
Il vaut la peine d'être explicite sur ce que « raisonnement » signifie dans ce contexte. Qwen 3.7 Flash est décrit comme un modèle de raisonnement vision-langage, ce qui signifie qu'il est censé travailler sur des tâches visuelles en plusieurs étapes plutôt que de simplement légender une image ou répondre à une question unique de recherche. C'est la différence entre « décris cette capture d'écran » et « voici une capture d'écran d'un formulaire avec trois erreurs de validation — trouve ce qui ne va pas et dis-moi quel champ corriger en premier. »
Spécifications et l'orientation multimodale-agentique
Voici la liste complète de ce qui est effectivement confirmé, par rapport à ce qui ne l'est pas.
Confirmé : Le fabricant est l'équipe Qwen d'Alibaba. Il est répertorié sous l'identifiant de modèle qwen/qwen3.7-flash, disponible depuis le 27 juillet 2026. Il accepte des entrées multimodales (vision et langage). La fenêtre de contexte est de 1 000 000 de jetons. Le prix est de 0,03 $ pour 1 M de jetons d'entrée et de 0,13 $ pour 1 M de jetons de sortie. Les notes de prix de la fiche signalent que la mise en cache des invites sur un contexte répété peut réduire le coût effectif de 60 à 80 % par rapport au prix affiché pour les charges de travail qui réutilisent les mêmes instructions système ou images de référence entre les appels — un détail qui compte beaucoup pour les boucles d'agents qui renvoient le même historique de captures d'écran ou le même schéma d'outils à chaque tour.
Non divulgué :Limite maximale de jetons de sortie. Nombre exact de paramètres. Architecture (dense vs. mélange d'experts). Composition des données d'entraînement. Tous les scores de référence propriétaires.
Spéculation de la communauté (étiquetez-la comme telle, car c'est tout ce que c'est) : Compte tenu de la dénomination « Flash », de la tarification agressive et du modèle qu'Alibaba a suivi avec les générations précédentes de Qwen, certains observateurs soupçonnent que Qwen 3.7 Flash utilise une petite architecture de mixture-of-experts optimisée pour un faible coût de calcul par jeton, et qu'il pourrait s'agir d'un aperçu ou d'une étape de distillation avant une éventuelle version open-weight de Qwen 3.7, reflétant la manière dont les variantes « flash » ou « turbo » antérieures de Qwen précédaient parfois des versions open plus larges. Rien de tout cela n'est confirmé par Alibaba. Traitez cela comme une supposition éclairée, pas un fait, jusqu'à ce qu'un rapport technique officiel ou une fiche modèle dise le contraire.
L'absence d'un chiffre de sortie maximale publié mérite d'être signalée pour quiconque construit sur ce modèle : si votre cas d'utilisation produit des sorties structurées longues (gros payloads JSON, génération de code multi-fichiers, longs transcriptions), testez empiriquement le plafond de sortie réel avant de vous y engager en production, car vous ne pouvez pas vérifier la documentation pour un nombre qui n'y figure pas.
Exemple concret de tarification : Ce que cela coûte réellement
Des nombres aussi petits sont faciles à ignorer, alors faisons correctement le calcul.
À 0,03 $ pour 1 million de tokens d’entrée et 0,13 $ pour 1 million de tokens de sortie, un seul appel avec 2 000 tokens d’entrée (une capture d’écran de taille correcte plus une courte instruction) et 300 tokens de sortie (une réponse structurée) coûte : 2 000 / 1 000 000 × 0,03 $ = 0,00006 $ pour l’entrée, plus 300 / 1 000 000 × 0,13 $ = 0,000039 $ pour la sortie. Total : environ 0,0001 $ par appel — un centième de centime.
Passons à l’échelle. Exécutons 1 million de ces appels — une charge quotidienne plausible pour un produit agentique de taille moyenne effectuant des analyses de captures d’écran ou des vérifications de l’état de l’interface — et on arrive à : 1,000,000 × 2,000 = 2 milliards de jetons d’entrée × $0.03/1M = $60, plus 1,000,000 × 300 = 300 millions de jetons de sortie × $0.13/1M = $39. Total : environ 99 $ pour un million d’appels d’agent de vision. Même avant d’ajouter la mise en cache des prompts (ce que les notes de la liste suggèrent pourrait réduire ce coût de 60 à 80 % pour les charges de travail à contexte répété), c’est un montant que la plupart des équipes peuvent approuver sans réunion budgétaire.
Maintenant, comparez un scénario plus lourd : un agent d'utilisation d'ordinateur qui maintient un contexte de 50 000 jetons (captures d'écran, historique des actions, résultats d'outils) et génère 500 jetons d'action par étape, exécuté 100 000 fois par jour. Coût d'entrée : 100 000 × 50 000 = 5 milliards de jetons × 0,03 $/1M = 150 $/jour. Coût de sortie : 100 000 × 500 = 50 millions de jetons × 0,13 $/1M = 6,50 $/jour. Cela représente environ 156 $/jour, soit environ 4 700 $/mois, pour une charge de travail agentique à contexte long assez agressive — et ce avant toute remise de mise en cache sur les parties répétées de ce contexte de 50K, qui dans une boucle d'utilisation d'ordinateur (même prompt système, mêmes définitions d'outils, état d'écran qui se chevauche) est exactement le type de charge de travail pour lequel le cache de prompt a été conçu.

Procédures pas à pas de scénarios réels
Tâches de vision à haut volume
Imaginez un pipeline de catalogage de produits qui doit classifier, étiqueter et extraire des attributs à partir de quelques centaines de milliers d’images de produits par jour — c’est exactement le genre de charge de travail où le coût par jeton se multiplie assez vite pour faire exploser un budget sur un modèle de vision de milieu de gamme, mais reste confortablement abordable avec la tarification de Qwen 3.7 Flash. La reconnaissance d’objets et la compréhension spatiale, les deux capacités qu’Alibaba mentionne explicitement, correspondent directement à « qu’y a-t-il dans cette image, où se trouve-t-il et dans quel état est-il ».
Codage visuel
Le "codage visuel" en tant que cas d'utilisation nommé suggère des workflows tels que : donner au modèle une capture d'écran d'une interface utilisateur rendue ainsi que le code du composant sous-jacent, et lui demander de repérer les incohérences, ou prendre une exportation Figma et obtenir une première implémentation. Il s'agit d'une catégorie de tâches qui pénalise spécifiquement les modèles de code textuels uniquement — vous pouvez décrire un bug de mise en page avec des mots, mais un modèle qui peut réellement voir le padding cassé ou le bouton mal aligné le diagnostiquera plus rapidement et de manière plus fiable.
Agentique / Utilisation d'ordinateur
Voici le cas d'utilisation principal. Un agent d'utilisation d'ordinateur doit regarder un écran, comprendre ce qui est cliquable, décider d'une action, et répéter — souvent sur des dizaines d'étapes par tâche. L'économie ici est impitoyable pour les modèles coûteux : une tâche d'automatisation de navigateur ou de bureau en 30 étapes, chaque étape transportant une nouvelle capture d'écran, peut accumuler des centaines de milliers de jetons avant que la tâche soit terminée. Au tarif des modèles de pointe, c'est de l'argent réel par tâche ; au tarif de Qwen 3.7 Flash, exécuter des milliers de telles sessions par jour reste à la portée du budget d'une petite équipe.
Rechercher
La recherche visuelle — faire correspondre une image à un corpus, vérifier qu'un résultat récupéré correspond effectivement à une photo de référence, ou ancrer une requête de recherche dans une capture d'écran de ce que l'utilisateur regarde — bénéficie de la même combinaison d'un grand contexte (pour contenir plusieurs images candidates ou un long ensemble de documents récupérés) et d'un faible coût par appel (car les boucles de recherche et de vérification impliquent souvent de nombreux appels de modèle par requête utilisateur, et non un seul).
Comment accéder et utiliser Qwen 3.7 Flash
Qwen 3.7 Flash est appelé avec l’identifiant de modèle qwen/qwen3.7-flash, et il fonctionne avec n’importe quel outil compatible OpenAI — ce qui signifie que les intégrations existantes de type chat-completions ou responses peuvent le cibler avec un simple changement de nom de modèle, sans réécrire le code client. C’est aussi là qu’une couche de routage comme OrcaRouter devient pratique plutôt que théorique : au lieu de coder en dur un seul modèle dans chaque service, un point de terminaison unifié compatible OpenAI vous permet de définir un modèle multimodal économique et performant comme palier par défaut pour le trafic vision et agentique, et de réserver les modèles de raisonnement plus chers au sous-ensemble de requêtes qui en ont réellement besoin. Pour un modèle dont toute la proposition de valeur est « très bon marché, assez performant, non prouvé à la frontière », ce type de routage par paliers — économique par défaut, escalade si nécessaire — est sans doute la bonne façon de le déployer en production plutôt que de miser toute une pipeline sur un seul modèle non vérifié.
Le formatage standard des requêtes multimodales s'applique : entrées d'images accompagnées de texte dans le même message, grandes fenêtres de contexte pour les sessions multi-images ou multi-tours, et facturation par token qui s'affiche clairement dans les tableaux de bord d'utilisation. Testez le plafond pratique de longueur de sortie pour votre charge de travail avant de vous y fier, car le maximum n'est pas publié.
Limitations honnêtes et ce qui n'est pas confirmé
Pour être direct sur ce qui est véritablement inconnu ici : il n'existe aucune donnée de référence indépendante sur Qwen 3.7 Flash provenant d'Artificial Analysis ou de tout autre évaluateur comparable à ce jour. Tout ce qui concerne sa qualité — ses performances réelles en raisonnement visuel, sa fiabilité pour les tâches multi-étapes agentiques, sa capacité à résister aux distracteurs dans des scénarios à long contexte — n'est actuellement étayé que par le langage de positionnement d'Alibaba lui-même, et non par un tiers l'ayant exécuté via une suite de tests standardisée. La description du fournisseur et la vérification indépendante ne sont pas la même chose, et les lecteurs devraient pondérer les capacités de ce modèle en conséquence jusqu'à ce que cette vérification existe.
Au-delà des benchmarks, Alibaba n'a pas divulgué l'architecture, le nombre de paramètres ni la longueur maximale de sortie. La théorie circulant dans la communauté — « petit MoE, possible précurseur d'un Qwen 3.7 open-weight » — est une supposition raisonnable fondée sur les schémas de dénomination et la tarification, mais il s'agit d'une spéculation, non d'un élément confirmé par Alibaba. Si la transparence du modèle (architecture publiée, poids ouverts, rapport technique) est un critère pour votre cas d'usage, Qwen 3.7 Flash ne répond actuellement pas à cette exigence — c'est un modèle fermé, exclusivement accessible via API, avec une documentation publique minimale au-delà de sa fiche API.
Comment il se compare : Qwen 3.8, Qwen 3.7 Max et les rivaux bon marché
La nomenclature ici induit en erreur, donc il vaut la peine d'être précis. Qwen 3.8 est le fleuron open-weight annoncé séparément par Alibaba, construit selon les rapports autour d'une conception de 2,4 billions de paramètres — un modèle fondamentalement différent avec un objectif différent : un grand modèle ouvert polyvalent destiné à concurrencer à la frontière, et non un niveau utilitaire multimodal bon marché. Qwen 3.7 Max est le plus grand fleuron fermé, présumément plus capable, au sein de cette même vague de sortie «3.7» — le modèle auquel vous recourriez lorsqu'une tâche nécessite une qualité maximale quel que soit le coût. Qwen 3.7 Flash, le sujet de cet article, est le troisième et le moins cher point de cette constellation : plus petit, plus rapide, considérablement moins coûteux, et spécifiquement conçu pour les charges de travail multimodales-agentiques plutôt que pour l'excellence polyvalente. Ne supposez pas que les capacités ou le comportement se transmettent entre ces trois modèles simplement parce que deux d'entre eux partagent un numéro de version — ce sont des modèles différents avec des fonctions différentes.
Face à la concurrence extérieure, la comparaison la plus proche est celle de Google Gemini 3.5 Flash-Lite, qui occupe un créneau similaire : un niveau low-cost, multimodal et à haut débit conçu exactement pour le type de charges de travail volumineuses décrites ci-dessus. Les deux modèles se font principalement concurrence sur les mêmes axes — prix par token, longueur de contexte et gestion multimodale — plutôt que sur des benchmarks de raisonnement purs, car aucun des deux n'est positionné comme un modèle de raisonnement de pointe. Sans données de benchmark indépendantes pour Qwen 3.7 Flash, une affirmation comparative de qualité contre Gemini 3.5 Flash-Lite n'est pas quelque chose que cet article peut faire de manière responsable ; ce que l'on peut dire, c'est que le prix de Qwen 3.7 Flash est compétitif par rapport à ce niveau ou en dessous, et sa fenêtre de contexte de 1M est généreuse pour un modèle dans cette tranche de coût, ce qui est exactement le type d'écart qui rend les niveaux multimodaux bon marché dignes d'être testés empiriquement sur votre propre charge de travail plutôt que de choisir uniquement sur le prix.
FAQ
Qu'est-ce que Qwen 3.7 Flash ?
C'est un modèle de raisonnement vision-langage de l'équipe Qwen d'Alibaba, conçu pour les agents multimodaux, le codage visuel, la recherche et l'interaction avec l'ordinateur et l'interface utilisateur, répertorié sous l'ID de modèle qwen/qwen3.7-flash depuis le 27 juillet 2026.
Combien coûte Qwen 3.7 Flash ?
0,03 $ par million de jetons d'entrée et 0,13 $ par million de jetons de sortie — parmi les modèles de vision les moins chers actuellement disponibles, la fiche signalant des réductions supplémentaires de 60 à 80 % possibles grâce à la mise en cache des prompts sur contexte répété.
Qu'est-ce que la fenêtre de contexte ?
1 000 000 jetons.
Est-ce que Qwen 3.7 Flash est le même que Qwen 3.8 ?
Non. Qwen 3.8 est le modèle phare open-weight de 2,4 billions de paramètres annoncé séparément par Alibaba. Qwen 3.7 Flash est un modèle multimodal fermé, beaucoup plus petit et moins cher, avec un objectif différent. Ils ne doivent pas être confondus, même s'ils proviennent tous deux de la gamme Qwen d'Alibaba.
Est-ce que Qwen 3.7 Flash est identique à Qwen 3.7 Max ?
Non. Qwen 3.7 Max est le plus grand modèle phare de la même vague de lancement « 3.7 ». Qwen 3.7 Flash est le niveau plus petit, plus rapide et bien moins cher, destiné aux tâches multimodales et agentiques à volume élevé plutôt qu'à une sortie de qualité maximale.
Est-ce que Qwen 3.7 Flash prend en charge les images ?
Oui, c'est un modèle vision-langage — il accepte des entrées multimodales (image et texte) et est spécifiquement positionné autour de tâches visuelles comme la reconnaissance d'objets, la compréhension spatiale, le codage visuel et l'interaction ordinateur/interface utilisateur.
Quelle est la longueur maximale de sortie ?
Non officiellement divulgué par Alibaba. Quiconque construisant une charge de travail en production devrait tester directement le plafond de sortie pratique plutôt que de supposer un nombre.
Est-ce que Qwen 3.7 Flash est un modèle de mélange d'experts ?
Non confirmé. Certains dans la communauté spéculent qu'il utilise une petite architecture MoE basée sur son prix et son modèle de dénomination, mais Alibaba n'a pas publié les détails de l'architecture, donc cela reste une spéculation plutôt qu'un fait.
Comment se compare-t-il à Gemini 3.5 Flash-Lite?
Les deux occupent un niveau multimodal similaire, à faible coût et à haut débit, et rivalisent principalement sur le prix et la longueur de contexte plutôt que sur des critères bruts de raisonnement. Il n'existe pas encore de données de référence indépendantes pour établir une comparaison de qualité définitive concernant Qwen 3.7 Flash.
Où puis-je accéder à Qwen 3.7 Flash ?
En utilisant l'ID de modèle qwen/qwen3.7-flash via n'importe quel client compatible OpenAI, ou via une couche de routage comme OrcaRouter qui peut le définir comme niveau multimodal économique par défaut aux côtés d'autres modèles.
Qwen 3.7 Flash est-il bon ?
Non prouvé de manière indépendante à ce jour — aucune organisation de test tierce, y compris Artificial Analysis, n'a publié de scores pour celui-ci. Sa proposition de valeur repose sur le prix et la taille du contexte, non sur un avantage de qualité démontré, il vaut donc la peine de le tester empiriquement sur votre charge de travail spécifique avant de s'engager.

En résumé
Qwen 3.7 Flash n'essaie pas de gagner un classement, et Alibaba n'a donné à personne la documentation pour vérifier, même si elle le voulait. Ce qu'elle essaie de faire, c'est rendre les charges de travail vision-et-agent — analyse de captures d'écran, vérifications visuelles de code, boucles d'utilisation informatique, recherche visuelle — suffisamment bon marché pour que le coût cesse d'être la raison pour laquelle vous ne construisez pas la fonctionnalité. À 0,03 $/0,13 $ par million de tokens avec un contexte d'un million de tokens, l'économie soutient véritablement un trafic d'agents multimodaux à volume élevé et toujours actif d'une manière que peu de modèles, quel que soit leur niveau de qualité, peuvent égaler. L'inconvénient est l'honnêteté sur les lacunes : aucun benchmark indépendant, aucune architecture divulguée ni longueur de sortie maximale, et une réelle incertitude sur la façon dont il se comporte face à des concurrents bon marché établis comme Gemini 3.5 Flash-Lite. Traitez-le comme un défaut prometteur et extrêmement abordable pour les charges de travail multimodales-agentiques qui méritent d'être testées dès maintenant — et gardez-le clairement séparé dans votre esprit à la fois de Qwen 3.8 et de Qwen 3.7 Max, qui sont des modèles différents résolvant des problèmes complètement différents.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
