Qwen3.5 Flash — chat multimodal (texte/image/vidéo) optimisé pour le coût, contexte 1M
Qwen3.5 Flash est un modèle de langage multimodal de la famille Qwen, conçu pour une inférence rapide et un faible coût. Il accepte des entrées de texte, d'image et de vidéo et génère des réponses…
Qwen3.5 Flash accepte du texte, des images (y compris plusieurs images par requête) et des entrées vidéo. Pour la vidéo, le modèle peut ingérer des images clés ou des fichiers vidéo entiers jusqu'à la limite de contexte. Il traite ces modalités ensemble dans un seul appel API, permettant des tâches comme décrire une scène vidéo, répondre à des questions sur une image, ou combiner des instructions textuelles avec du contenu visuel. La durée exacte de vidéo prise en charge dépend de l'extraction d'images et de la budgétisation des tokens dans la fenêtre de contexte de 1M.
Le modèle excelle dans les tâches qui nécessitent un grand contexte et une entrée multimodale. Les exemples incluent le résumé de longues transcriptions vidéo, l'extraction de données structurées à partir de documents scannés avec images, et la construction d'agents conversationnels qui référencent un contexte visuel. Il est également efficace pour le traitement par lots à haut débit, où le faible coût par token (surtout en entrée) le rend économique pour des millions de requêtes. Pour les tâches simples de texte uniquement, un modèle textuel moins coûteux peut être encore plus rentable.
Pour les tâches purement textuelles qui ne nécessitent pas la capacité multimodale, un modèle plus petit ou uniquement textuel avec un prix plus bas peut être plus rentable. La force de Qwen3.5 Flash réside dans ses capacités multimodales et de long contexte ; si votre application n'a besoin que de complétions de texte court, des modèles comme text-davinci ou des variantes plus petites de Qwen peuvent faire économiser de l'argent. De même, si vous n'avez pas besoin du contexte complet de 1M, un modèle avec une fenêtre plus petite pourrait réduire la latence et le coût.
La désignation « Flash » indique que ce modèle sacrifie une certaine précision au profit d'une inférence plus rapide et d'un coût de calcul réduit. Comparé aux modèles plus grands de Qwen (par exemple, Qwen3.5-72B), il utilise une architecture plus efficace avec moins de paramètres. Les scores de référence sont publiés par Qwen mais ne figurent pas dans cette fiche catalogue. En pratique, il offre des performances compétitives dans les tâches de compréhension multimodale tout en maintenant une latence inférieure par requête, ce qui le rend adapté aux applications en temps réel.
La latence dépend de la taille d'entrée, de la longueur de sortie et de la charge du serveur. Étant donné que Qwen3.5 Flash est conçu pour la vitesse, il renvoie généralement des réponses plus rapidement que des modèles plus grands comme Qwen3.5-72B pour des nombres de jetons équivalents. Les chiffres exacts de jetons par seconde ne sont pas fournis dans le catalogue. Les utilisateurs peuvent tester les performances via le point de terminaison d'OrcaRouter pour mesurer la latence réelle pour leur cas d'utilisation spécifique. La fenêtre de contexte de 1M peut introduire des frais généraux de traitement pour les entrées très longues.
Les points forts incluent l'entrée multimodale, un contexte très large, 65K tokens de sortie et un faible coût par token. Le modèle gère bien les longs documents et les vidéos. Limitations : il n'est pas le plus précis pour les tâches complexes de raisonnement ou de mathématiques comparé aux modèles frontières plus grands. Il peut également avoir du mal avec des instructions nuancées en plusieurs étapes. Pour les tâches où une qualité de sortie de pointe est cruciale, envisagez un modèle plus grand de la classe Qwen ou GPT-4o. L'architecture 'Flash' privilégie le débit et le coût plutôt que la précision maximale.
Le prix est de 0,10 $ pour 1 million de tokens d’entrée (tokens de texte, d’image ou de vidéo) et de 0,40 $ pour 1 million de tokens de sortie. Ces tarifs sont facturés au taux du fournisseur, sans marge de la part d’OrcaRouter. Il n’y a pas de frais supplémentaires pour la passerelle API. Ce prix est directement répercuté, ce qui signifie que l’utilisateur final paie le même montant que s’il appelait l’API du fournisseur lui-même, sans aucun supplément d’OrcaRouter. Le comptage des tokens suit la tokenisation standard pour chaque modalité.
Le prix des tokens d’entrée ($0.10/1M) est très compétitif parmi les modèles multimodaux. Par exemple, de nombreux grands modèles multimodaux facturent $2-10 par million de tokens d’entrée. Le prix de sortie ($0.40/1M) est également bas. Cependant, étant donné que le modèle dispose d’une fenêtre de contexte de 1M, le traitement d’entrées très longues peut entraîner un coût total élevé malgré le faible taux par token. Les utilisateurs doivent équilibrer la longueur du contexte par rapport au nombre de requêtes. Pour les entrées courtes, des modèles plus petits peuvent offrir un coût absolu encore plus bas.
L'entrée du catalogue ne précise pas si la mise en cache est disponible pour Qwen3.5 Flash sur OrcaRouter. Les utilisateurs doivent consulter la documentation d'OrcaRouter pour obtenir des détails sur les fonctionnalités de mise en cache des prompts ou de mise en cache des réponses. Si la mise en cache n'est pas prise en charge, des entrées identiques répétées entraîneront des coûts de jetons complets à chaque fois. Pour le traitement par lots, envisagez de dédupliquer les entrées ou d'utiliser un cache local pour réduire les appels API. Le tarif reste celui du fournisseur, sans majoration, quel que soit l'état de la mise en cache.
Utilisez le endpoint compatible OpenAI à l'adresse https://api.orcarouter.ai/v1. Définissez le paramètre model sur "qwen/qwen3.5-flash" dans votre requête. Fournissez une clé API d'OrcaRouter. Le format de la requête correspond à l'API de complétion de chat d'OpenAI, prenant en charge les rôles (system, user, assistant) et le contenu multimodal utilisant le tableau "content" avec "type": "image_url" ou "type": "text". Pour la vidéo, vous devrez peut-être extraire des images et les transmettre en tant qu'images. Consultez la documentation d'OrcaRouter pour connaître les directives exactes de gestion des vidéos.
Paramètres standard compatibles OpenAI : temperature, top_p, max_tokens (jusqu'à 65536), séquences d'arrêt, presence_penalty, frequency_penalty et seed. Le paramètre max_tokens est plafonné à 65536 pour correspondre à la sortie maximale du modèle. Le modèle prend en charge le streaming via stream: true. Vous pouvez également définir des identifiants utilisateur pour le suivi. Pour les requêtes multimodales, incluez le contenu de l'image ou de la vidéo dans le message utilisateur. Le modèle accepte jusqu'à la fenêtre de contexte de 1 048 576 jetons au total sur tous les tours.
Si vous utilisez déjà le SDK Python d'OpenAI, remplacez `base_url` par `https://api.orcarouter.ai/v1` et mettez à jour le nom du modèle avec `"qwen/qwen3.5-flash"`. L'authentification utilise une clé API OrcaRouter au lieu d'une clé OpenAI. Les structures des requêtes et des réponses sont identiques. Pour une migration depuis d'autres fournisseurs, utilisez le format des complétions de chat. Assurez-vous que vos prompts système et votre contenu multimodal sont formatés selon les conventions d'OpenAI. Aucune modification de code au-delà du point de terminaison et du nom du modèle n'est nécessaire.
Oui, l'API OrcaRouter prend en charge les messages système, les messages utilisateur et les messages assistant dans une conversation à plusieurs tours. L'historique complet de la conversation compte dans la fenêtre de contexte de 1 048 576 tokens. Le modèle traite le contenu multimodal dans les messages utilisateur. Pour la vidéo, vous pouvez envoyer plusieurs images sous forme d'images dans un seul message utilisateur. Le modèle maintient le contexte entre les tours, vous pouvez donc avoir des interactions prolongées avec des historiques longs, à condition que le nombre total de tokens reste en dessous de la limite.
Qwen3.5 Flash est une alternative plus petite, plus rapide et moins chère aux modèles Qwen plus grands comme Qwen3.5-72B ou Qwen3.5-32B. Il sacrifie une certaine précision des benchmarks pour une latence et un coût réduits. Il partage la même prise en charge des entrées multimodales et la même grande fenêtre de contexte (1M) que ses grands frères. Pour les tâches nécessitant un raisonnement de pointe, les modèles plus grands sont préférés. Pour les applications à volume élevé ou en temps réel où la vitesse et le coût sont plus importants, Flash est le meilleur choix.
GPT-4o offre une précision plus élevée sur de nombreux benchmarks de raisonnement et multimodaux, mais à un prix nettement plus élevé (généralement 2,50 $ par million de tokens d’entrée pour GPT-4o et 0,15 $ pour GPT-4o mini). Qwen3.5 Flash est moins cher (0,10 $ en entrée) et dispose d’une fenêtre de contexte plus large (1M contre 128K pour GPT-4o). Sa limite de tokens de sortie (65K) dépasse également celle de GPT-4o mini (16K). Pour les applications sensibles aux coûts avec de très longues entrées, Qwen3.5 Flash peut être plus économique tout en offrant une bonne compréhension multimodale.
Claude 3 Haiku et Gemini 1.5 Flash sont des modèles « flash » similaires. Claude 3 Haiku est uniquement textuel et coûte 0,25 $ par million de tokens d'entrée. Gemini 1.5 Flash prend en charge les entrées multimodales et dispose d'une fenêtre de contexte de 1M, au prix de 0,075 $ par million de tokens d'entrée. Le support multimodal et le contexte de 1M de Qwen3.5 Flash le placent dans une catégorie similaire, avec un prix de sortie (0,40 $/1M) plus élevé que Gemini Flash (0,30 $/1M) mais inférieur à celui de Haiku (1,25 $/1M). Les performances de benchmark varient selon la tâche.
OrcaRouter héberge des modèles open-source comme Llama 3.1 8B et Mistral 7B. Qwen3.5 Flash est un modèle propriétaire, mais il rivalise en termes de coût et de capacité. Les modèles open-source ont souvent un coût par jeton faible ou nul (vous ne payez que pour le calcul), mais ils peuvent nécessiter davantage d'ingénierie pour être configurés. Qwen3.5 Flash propose une API gérée sans marge, une fenêtre de contexte de 1M et une prise en charge multimodale que la plupart des modèles open-source n'ont pas. C'est un bon compromis entre la flexibilité de l'open-source et la qualité du propriétaire.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.5-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Entrée / 1M tokens | $0.100 |
| Sortie / 1M tokens | $0.400 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
Ce dont parlent les développeurs cette semaine
GET /api/public/models/qwen/qwen3.5-flashOuvrir @misc{orcarouter_qwen3_5_flash,
title = {qwen/qwen3.5-flash API},
author = {qwen},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-flash}
}qwen. (n.d.). qwen/qwen3.5-flash API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-flash