Qwen3.6 Plus snapshot 2026-04-02 — version figée de qwen3.6-plus, mêmes capacités.
qwen/qwen3.6-plus-2026-04-02 est un point de contrôle spécifique de la série Qwen3.6 Plus, hébergé par Qwen et accessible via l'API compatible OpenAI d'OrcaRouter. Il accepte les entrées de texte,…
qwen/qwen3.6-plus-2026-04-02 peut accepter des fichiers vidéo ou des séquences d'images en entrée avec des invites textuelles. Il comprend le contexte temporel à travers les images vidéo, permettant des tâches telles que le résumé vidéo, la détection d'événements et la réponse à des questions sur le contenu visuel au fil du temps. Grâce au contexte de 1 million de tokens, le modèle peut traiter plusieurs minutes de vidéo (selon la fréquence d'images et la résolution) en une seule fois. Le modèle ne génère pas de vidéo de manière native ; il analyse et raisonne sur l'entrée vidéo. Pour de meilleurs résultats, les développeurs doivent fournir une vidéo à une fréquence d'images raisonnable (par exemple, 1 image par seconde) et une taille appropriée, car des fréquences d'images élevées peuvent rapidement consommer la fenêtre de contexte. L'API d'OrcaRouter prend en charge les codecs et formats vidéo courants ; consultez la documentation pour les contraintes spécifiques.
Bien que ce modèle excelle dans les tâches agentiques multimodales à long contexte, il peut être excessif pour des cas d’usage plus simples. Pour une discussion textuelle directe, de la classification ou de la génération de forme courte, les modèles plus petits et plus rapides disponibles sur OrcaRouter (par exemple, Qwen3.6 Base, Llama 3 ou les équivalents de GPT-4o-mini) offrent généralement une latence plus faible et un coût par token réduit. Si votre application n’a pas besoin de la fenêtre de contexte complète de 1 million de tokens ni du traitement d’images ou de vidéos, une alternative moins chère répondra probablement à vos besoins pour une fraction du prix. De plus, pour les tâches où le score τ²-Bench n’est pas une priorité (par exemple, le résumé simple), d’autres modèles peuvent être tout aussi performants. Évaluez toujours la longueur de contexte et les exigences de modalité réelles par rapport au coût et à la latence lors du choix d’un modèle.
Le modèle obtient un score de 97,7 sur τ²-Bench, un benchmark qui mesure la capacité d’une IA à agir comme un agent dans des environnements simulés. τ²-Bench teste la planification, l’utilisation d’outils, la gestion de la mémoire et le raisonnement multi-tours à travers des tâches comme les achats en ligne, l’analyse de données et le développement logiciel. Un score élevé indique que le modèle peut efficacement décomposer des instructions complexes, utiliser des outils externes (par exemple, calculatrices, recherche, exécuteurs de code) et maintenir un état cohérent sur plusieurs étapes. Cela rend le modèle bien adapté à la création d’agents autonomes qui interagissent avec des API, naviguent sur le Web ou manipulent des fichiers. Cependant, les scores du benchmark ne garantissent pas un comportement parfait dans tous les environnements réels ; le modèle peut encore échouer sur des tâches nouvelles ou ambiguës. Les développeurs doivent tester minutieusement les configurations des agents.
τ²-Bench est un benchmark pour évaluer les agents IA sur des tâches réalistes en plusieurs étapes dans des environnements contrôlés. Un score de 97,7 indique que le modèle accomplit correctement presque toutes les tâches de la suite de benchmark. Cela inclut des tâches comme la réservation de voyages, l'édition de documents, l'écriture de code et la recherche dans des bases de données—toutes nécessitant que le modèle planifie des sous-actions, utilise des outils et se remette des erreurs. Ce score suggère que le modèle possède de solides capacités de raisonnement, de suivi d'instructions et d'utilisation d'outils. Cependant, les benchmarks sont limités : ils ne couvrent pas tous les scénarios réels possibles, et les performances peuvent se dégrader dans des environnements ouverts sans retour structuré. Le score doit être considéré comme un indicateur comparatif au sein de la famille de modèles Qwen et par rapport à d'autres modèles orientés agents disponibles sur OrcaRouter.
Seul le score τ²-Bench (97.7) est explicitement fourni pour ce modèle. Aucun autre résultat de benchmark (par exemple, MMLU, HumanEval, GSM8K) n'est disponible dans les faits donnés. En tant que grand modèle multimodal avec un contexte de 1M, on s'attend à ce qu'il soit compétitif sur les tâches de raisonnement général, mais les chiffres spécifiques ne sont pas divulgués ici. Les développeurs devraient effectuer leurs propres évaluations sur des ensembles de données spécifiques à leur domaine pour mesurer les performances. OrcaRouter prend en charge des outils de journalisation et d'évaluation qui peuvent aider à comparer les sorties entre modèles. Pour une vue d'ensemble, envisagez de tester sur des tâches qui reflètent votre charge de travail de production, en particulier celles impliquant la compréhension de longs contextes et le raisonnement multimodal.
Bien que le modèle obtienne un score élevé sur τ²-Bench, il présente des limitations communes aux grands modèles de langage : il peut halluciner des faits, générer du contenu biaisé ou nuisible, et avoir du mal avec des tâches nécessitant un calcul mathématique précis sans outils externes. Le contexte de 1 million de tokens, bien que vaste, reste fini — des contextes extrêmement longs peuvent amener le modèle à perdre le focus sur les premières parties ou à manquer des détails subtils. La compréhension multimodale, en particulier de la vidéo, dépend de la sélection d'images ; le modèle ne comprend pas intrinsèquement la vidéo en temps réel. De plus, le score de 97,7 sur τ²-Bench ne garantit pas une performance parfaite sur chaque tâche agentique, surtout celles nécessitant une interaction avec des réponses API imprévues ou des instructions ambiguës. La latence et le coût sont plus élevés que ceux des modèles plus petits en raison du grand contexte et du traitement multimodal.
Les détails de tarification pour qwen/qwen3.6-plus-2026-04-02 sont déterminés par OrcaRouter et ne sont pas inclus dans les faits fournis. En général, la tarification pour de tels modèles est basée sur le nombre de jetons en entrée et en sortie, avec des frais supplémentaires pour le traitement d'images et de vidéos (par image ou par trame). La fenêtre de contexte étendue signifie que l'utilisation de la totalité des 1 million de jetons dans une seule requête entraînera des coûts plus élevés que l'utilisation de contextes plus courts. OrcaRouter propose un modèle de paiement à l'utilisation, et des limites de débit peuvent s'appliquer en fonction du niveau du compte. Pour les tarifs exacts par jeton et toute remise applicable (par exemple, pour le traitement par lots ou l'utilisation engagée), reportez-vous à la page de tarification officielle d'OrcaRouter ou contactez leur équipe commerciale. La mise en cache des invites fréquentes n'est pas confirmée pour ce modèle spécifique ; consultez la documentation d'OrcaRouter sur la mise en cache des invites.
Compte tenu de la grande fenêtre contextuelle du modèle et de ses entrées multimodales, le coût peut varier considérablement selon les schémas d'utilisation. Si vos prompts dépassent rarement 10 000 jetons et n'incluent aucune image, un modèle moins cher réduirait les dépenses. En revanche, si vous traitez régulièrement de longs documents ou des images haute résolution, le coût par requête peut être justifié par les performances élevées du modèle sur τ²-Bench. Le traitement vidéo est particulièrement coûteux car chaque image consomme des jetons. OrcaRouter peut offrir des réductions via le cache ou des tarifs par lot pour réduire les coûts effectifs. Pour optimiser les dépenses, envisagez de tronquer les entrées à la longueur de contexte minimale nécessaire, de réduire la résolution des images et d'utiliser l'échantillonnage d'images. Surveillez également votre utilisation de jetons via le tableau de bord d'utilisation d'OrcaRouter pour éviter les surprises. Aucun niveau gratuit ni crédit d'essai n'est mentionné pour ce modèle.
Pour utiliser le modèle, envoyez des requêtes HTTP à l'URL de base d'OrcaRouter : https://api.orcarouter.ai/v1. Utilisez l'identifiant du modèle exactement comme indiqué : "qwen/qwen3.6-plus-2026-04-02". L'API est compatible avec OpenAI, vous pouvez donc utiliser n'importe quel SDK OpenAI avec un point de terminaison personnalisé. Par exemple, en Python avec la bibliothèque openai, définissez `base_url` sur le point de terminaison d'OrcaRouter et `api_key` sur votre clé OrcaRouter. Le corps de la requête prend en charge les paramètres standard : `model`, `messages`, `max_tokens`, `temperature`, `top_p`, etc. Pour les entrées multimodales, incluez des URL d'images ou des données encodées en base64 dans le tableau de contenu en utilisant les types `image_url` ou `video_url`. Consultez la documentation de l'API d'OrcaRouter pour le formatage exact des entrées vidéo.
L'API accepte les paramètres standard d'OpenAI Chat Completions : `model` (obligatoire), `messages` (tableau d'objets message), `max_tokens` (max 65,536), `temperature` (0.0–2.0 ; plage typique 0.0–1.0), `top_p` (0.0–1.0), `frequency_penalty`, `presence_penalty`, les séquences `stop` et `stream` (booléen). Pour les tâches agentiques, il est souvent recommandé de régler `temperature` sur 0.0 ou une valeur faible pour encourager un comportement déterministe. Pour les tâches créatives, une température plus élevée peut être appropriée. Le paramètre `max_tokens` contrôle la longueur de la sortie ; le modèle peut générer jusqu'à 65,536 tokens par tour. Notez que définir `max_tokens` trop haut peut augmenter la latence et le coût. Si vous devez limiter la longueur de la sortie pour maîtriser les coûts, définissez une valeur adaptée à votre cas d'utilisation. Le streaming est pris en charge et peut réduire la latence perçue.
Si vous utilisez déjà l'API d'OrcaRouter avec un autre modèle, la migration vers qwen/qwen3.6-plus-2026-04-02 nécessite généralement uniquement de modifier le paramètre `model` dans vos requêtes, en passant de l'ancien identifiant à "qwen/qwen3.6-plus-2026-04-02". Aucune autre modification du point de terminaison de l'API ou de la méthode d'authentification n'est nécessaire, car tous les modèles partagent la même URL de base et la même méthode d'authentification. Si vous utilisiez des entrées multimodales (images, vidéo), le format est compatible. Cependant, notez que le comportement du modèle et le format de sortie peuvent différer des modèles précédents ; vous devez tester vos prompts et ajuster les messages système ou la température si nécessaire. De plus, sachez que la fenêtre de contexte et les limites de tokens diffèrent — vos requêtes peuvent nécessiter d'être révisées pour tirer pleinement parti du contexte de 1M ou pour éviter de dépasser la sortie maximale. OrcaRouter fournit un guide de migration dans sa documentation.
Qwen propose plusieurs modèles sur OrcaRouter, y compris des versions antérieures comme Qwen3.5 et Qwen3.6 Base. Par rapport à la version de base, cette variante Plus offre une fenêtre de contexte plus large (1M contre généralement 128K ou 256K), une prise en charge multimodale (image et vidéo) et un score τ²-Bench plus élevé (97,7 contre probablement inférieur). Le cachet de date (2026-04-02) indique un point de contrôle plus récent, avec possiblement un meilleur raisonnement ou suivi d'instructions. Cependant, la variante Plus peut être plus coûteuse par token et avoir une latence plus élevée en raison du contexte plus large et du traitement multimodal. Pour les tâches purement textuelles avec un contexte court, la version de base peut être plus économique. Pour les charges de travail agentiques ou multimodales, cette variante Plus est le choix recommandé parmi les modèles Qwen.
Les deux modèles sont disponibles sur OrcaRouter, mais qwen/qwen3.6-plus-2026-04-02 offre une fenêtre de contexte plus large (1M contre 128K pour GPT-4o) et prend en charge l'entrée vidéo (GPT-4o prend en charge les images et l'audio). Le score τ²-Bench de 97.7 est une métrique spécifique non communiquée publiquement pour GPT-4o, donc une comparaison directe sur ce benchmark n'est pas possible. En termes de tarification, GPT-4o peut avoir des taux de tokens différents ; consultez la page de tarification d'OrcaRouter. GPT-4o offre généralement de solides performances multilingues et une vaste connaissance, tandis que ce modèle Qwen pourrait être optimisé pour la prise en charge des langues asiatiques (bien que cela ne soit pas explicitement indiqué). Les développeurs devraient tester les deux sur leurs tâches spécifiques pour déterminer lequel offre un meilleur équilibre entre qualité et coût. OrcaRouter permet de basculer entre les modèles avec des modifications de code minimales.
Claude 3.5 Sonnet est un autre modèle populaire sur OrcaRouter, reconnu pour son raisonnement solide et sa sécurité. Il dispose d'une fenêtre de contexte de 200K tokens et prend en charge les entrées d'images, mais pas la vidéo. qwen/qwen3.6-plus-2026-04-02 offre cinq fois plus de contexte (1M) et un support natif de la vidéo, ainsi qu'un score élevé au τ²-Bench. Les modèles Claude sont souvent loués pour leur suivi nuancé des instructions et leurs comportements de refus ; ce modèle Qwen, avec ses performances agentiques (97,7 τ²-Bench), suggère une capacité comparable ou supérieure dans les tâches d'utilisation d'outils. Des différences de prix existent ; consultez les grilles tarifaires d'OrcaRouter. Pour les tâches de long contexte ou vidéo, le modèle Qwen peut être préférable. Pour les applications critiques en matière de sécurité, la conformité de Claude aux garde-fous de sécurité pourrait être un avantage. Encore une fois, des tests utilisateurs sont recommandés.
Gemini 2.0 Pro, disponible sur OrcaRouter, offre une fenêtre de contexte de 1 million de tokens et prend en charge les entrées textuelles, images, audio et vidéo. Il obtient également des scores élevés dans les benchmarks. Les deux modèles ont des longueurs de contexte et des capacités multimodales similaires. La différence clé pourrait résider dans les performances agentiques : qwen/qwen3.6-plus-2026-04-02 obtient un score de 97,7 sur τ²-Bench, un benchmark axé sur les tâches agentiques ; les scores de Gemini sur ce benchmark ne sont pas disponibles publiquement. De plus, chaque modèle peut avoir des forces différentes en matière de codage, de support multilingue ou de précision factuelle. Les développeurs devraient évaluer les deux dans leur domaine spécifique. OrcaRouter facilite le passage de l'un à l'autre via la même interface API. Les prix peuvent différer ; consultez OrcaRouter pour les tarifs actuels.
Choisissez qwen/qwen3.6-plus-2026-04-02 lorsque vous avez besoin de : une fenêtre de contexte de 1 million de jetons (plus grande que de nombreuses alternatives), la prise en charge d’entrées vidéo (pas seulement des images et du texte), et de solides performances agentiques mesurées par τ²‑Bench (97,7). Si votre cas d’usage implique le traitement de très longs documents ou vidéos, ou la création d’agents autonomes nécessitant une mémoire étendue, ce modèle est un candidat solide. Si vous dépassez rarement 128 000 jetons, n’avez pas besoin de vidéo, et préférez une inférence plus rapide, envisagez des modèles comme GPT‑4o mini ou Qwen3.6 Base. Pour les tâches exigeant la plus haute exactitude factuelle ou sécurité, évaluez des alternatives dotées de garde‑fous plus robustes. En fin de compte, le meilleur modèle dépend de vos arbitrages spécifiques entre coût, latence, longueur de contexte, prise en charge des modalités et performances sur les benchmarks.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.6-plus-2026-04-02",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Palier | Entrée / 1M tokens | Sortie / 1M tokens |
|---|---|---|
| ≤ 256K | $0.500 | $3.00 |
| ≤ 1.0M | $2.00 | $6.00 |
| Palier sélectionné selon le nombre de tokens d'entrée de chaque requête | ||
Estimation basée sur le tarif public
Tarification par paliers — cette estimation utilise les tarifs du palier de base.
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/qwen/qwen3.6-plus-2026-04-02Ouvrir @misc{orcarouter_qwen3_6_plus_2026_04_02,
title = {qwen/qwen3.6-plus-2026-04-02 API},
author = {qwen},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.6-plus-2026-04-02}
}qwen. (n.d.). qwen/qwen3.6-plus-2026-04-02 API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.6-plus-2026-04-02