Une version non censurée et sans perte de Qwen3.6 35B A3B qui conserve les capacités du modèle original tout en supprimant le comportement de refus. Conçue pour les développeurs, les chercheurs en IA et les workflows d'agents avancés nécessitant des sorties de modèle sans restriction, sans compromettre le raisonnement, le codage, les performances multilingues ou l'utilisation d'outils. La variante Aggressive est totalement déverrouillée et conçue pour fournir des réponses directes et complètes sur un large éventail de prompts. Bien que le modèle puisse occasionnellement ajouter de brèves remarques informatives héritées de l'entraînement du modèle de base, il ne s'agit pas de refus et le contenu demandé est toujours généré intégralement. Idéal pour la recherche en IA, les tests de sécurité, le red teaming, le développement d'agents, les assistants de codage et d'autres applications avancées d'IA qui bénéficient d'une flexibilité maximale des sorties. L'accès à ce modèle est restreint et destiné aux chercheurs en sécurité, aux red teams, aux chercheurs en sécurité IA et autres professionnels qualifiés menant des recherches, évaluations et tests légitimes.
Ce modèle est une variante de type Mixture-of-Experts de la série Qwen3.6, développé à l'origine par Alibaba Cloud et hébergé par le fournisseur Obsidian sur OrcaRouter. Il comprend 35 milliards de…
Ce modèle excelle dans les tâches qui bénéficient d'une large fenêtre de contexte et d'une compréhension multimodale. Pour le texte, il peut résumer ou répondre à des questions sur des documents d'une longueur allant jusqu'à 262 144 tokens, comme des livres entiers ou de longs rapports. Pour les images et les vidéos, il peut extraire des informations détaillées et les combiner avec le contexte textuel. Sa nature non censurée lui permet de générer du contenu créatif sans les contraintes de sécurité habituelles, utile pour la génération d'histoires, le jeu de rôle ou d'autres scénarios où des filtres restrictifs sont indésirables. Sa conception MoE offre une inférence rapide par rapport aux modèles denses de taille totale similaire, ce qui le rend pratique pour les applications en temps réel lorsqu'il est déployé efficacement. Les capacités multilingues sont héritées de la famille Qwen3.6, prenant en charge de nombreuses langues.
Le tag « uncensored » signifie que le modèle a subi un entraînement d'alignement réduit par rapport aux checkpoints standard de Qwen3.6. Cela peut entraîner des sorties moins filtrées pour les contenus nuisibles, offensants ou controversés. Les utilisateurs doivent tester le modèle de manière approfondie dans leur cas d'utilisation spécifique pour s'assurer que les sorties répondent à leurs normes. L'absence de censure peut être bénéfique pour des tâches comme l'écriture créative, le jeu de rôle non censuré ou la recherche sur des sujets sensibles où une génération neutre est souhaitée. Cependant, cela signifie aussi que le modèle peut produire du contenu qui enfreint les politiques de contenu typiques. OrcaRouter ne revendique aucun filtrage de sécurité supplémentaire ; le comportement de base du modèle est ce que vous obtenez.
Si votre tâche implique des entrées courtes (par exemple, quelques centaines de tokens), une classification simple, ou ne nécessite qu'une compréhension de base du langage, des modèles plus petits et moins chers comme Qwen2.5-7B ou GPT-4o-mini peuvent être plus rentables. Les forces de ce modèle sont les plus évidentes lors du traitement de contextes très longs (plus de 10K tokens) ou d'entrées multimodales. Pour des tâches purement textuelles de moins de 8K tokens sans besoin de capacité image/vidéo, vous pouvez économiser de l'argent en utilisant un petit modèle dédié. De plus, si votre application nécessite un filtrage strict du contenu, la nature non censurée pourrait vous obliger à ajouter une couche de modération externe, ce qui augmente le coût.
Le modèle accepte les entrées image et vidéo en plus du texte. Pour les images, vous pouvez fournir des données image encodées en base64 ou des URL (via le tableau content de l'API avec le type "image_url"). Pour les vidéos, l'API accepte probablement des trames vidéo sous forme de séquences d'images ou des URL de fichiers vidéo ; le format exact doit être vérifié dans la documentation d'OrcaRouter. Le modèle traite ces entrées visuelles avec le texte pour générer des réponses. La fenêtre de contexte de 262,144 tokens s'applique au nombre total de tokens de toutes les modalités d'entrée. Notez que le traitement des images et des vidéos consomme des tokens proportionnellement à la résolution visuelle et à la longueur, donc des entrées plus grandes réduiront la capacité de texte disponible.
Aucun score de benchmark spécifique n'a été fourni pour ce modèle par le fournisseur. La série Qwen3.6 obtient généralement des résultats compétitifs sur les benchmarks de long contexte tels que L-Eval et RULER, et sur des tâches multimodales comme MMMU et MathVista, mais les chiffres exacts pour cette variante non censurée 35B A3B ne sont pas publiés. Les utilisateurs intéressés par les performances empiriques devraient effectuer leurs propres évaluations sur des ensembles de données représentatifs. L'architecture MoE avec 3B paramètres activés donne souvent des résultats comparables aux modèles denses de taille active similaire, tandis que les coûts de stockage et de mémoire totaux sont plus élevés en raison des 35B paramètres complets.
La vitesse et la latence dépendent de plusieurs facteurs : la longueur de l'entrée, la longueur de la sortie, la charge du serveur et la configuration matérielle. Étant donné que le modèle n'active que 3B paramètres par jeton, il devrait être plus rapide qu'un modèle dense de 35B paramètres, avec des taux de génération comparables à ceux de modèles comme GPT-3.5 (bien qu'aucun chiffre exact ne soit fourni). L'infrastructure d'OrcaRouter via Obsidian peut offrir une latence variable ; les utilisateurs peuvent tester avec leurs propres charges de travail. Pour les scénarios à contexte long (par exemple, 100K+ jetons), le temps de pré-remplissage augmente linéairement avec la longueur de l'entrée. La génération de jetons de sortie est généralement le principal contributeur à la latence. Aucun accord de niveau de service (SLA) pour la vitesse n'est stipulé.
Les atouts du modèle incluent sa grande fenêtre de contexte de 262K, ce qui permet de traiter des livres entiers ou des transcriptions vidéo de plusieurs heures en une seule fois. La conception MoE offre un bon compromis entre capacité et vitesse d'inférence. L'entrée multimodale permet d'effectuer des tâches combinant texte et données visuelles. Le caractère non censuré permet de générer du contenu que d'autres modèles pourraient refuser. La prise en charge multilingue couvre des dizaines de langues. Le prix est compétitif pour un modèle de cette capacité : 0,31 $/M en entrée et 4,21 $/M en sortie, sans marge bénéficiaire.
Les limitations incluent l'absence de chiffres de référence publiés, ce qui rend plus difficile l'évaluation des performances relatives. La nature non censurée peut produire des résultats indésirables sans modération supplémentaire. Le nombre de paramètres activés de 3B signifie qu'il pourrait ne pas égaler la puissance de raisonnement brute des modèles denses plus grands (ex. GPT-4) sur des tâches logiques complexes. Les capacités multimodales peuvent être moins affinées que celles des modèles dédiés vision-langage. Les modalités d'entrée comme la tokenisation vidéo pourraient réduire le contexte effectif pour le texte. Aucune capacité de streaming ou d'utilisation d'outils n'est garantie. Enfin, la dépendance envers le fournisseur tiers Obsidian signifie que la disponibilité et le temps de fonctionnement ne sont pas sous le contrôle d'OrcaRouter.
La tarification est transparente : 0,31 $ par million de tokens d’entrée et 4,21 $ par million de tokens de sortie. Ce sont les tarifs exacts des fournisseurs d’Obsidian, sans aucune majoration ajoutée par OrcaRouter. Les tokens d’entrée incluent tout le texte et les tokens visuels (pour les images et vidéos). Les tokens de sortie sont le texte généré. Il n’y a pas de frais par requête ni d’abonnement requis. Vous ne payez que pour les tokens consommés. La tarification est par million de tokens, donc les petites requêtes coûtent des fractions de centime. Aucun niveau gratuit ou essai n’est annoncé.
Aucune remise, avantage de mise en cache ou tarification en volume n'a été divulgué pour ce modèle. Les tarifs indiqués sont fixes par jeton. Contrairement à certains fournisseurs qui proposent des prix réduits pour les jetons d'entrée mis en cache, OrcaRouter applique le même tarif d'entrée quelle que soit la répétition. Pour une utilisation très élevée, vous pouvez contacter OrcaRouter pour d'éventuels arrangements personnalisés, mais aucune remise standard n'est documentée. La politique de marge zéro garantit que vous payez exactement ce que Obsidian facture, sans frais cachés.
Les modèles multimodaux à long contexte comparables d'autres fournisseurs coûtent souvent plus cher : par exemple, OpenAI's GPT-4 Turbo est à $10/1M d'entrée et $30/1M de sortie, tandis que Claude 3.5 Sonnet est à $3/1M d'entrée et $15/1M de sortie. Ce modèle est nettement moins cher à $0.31/$4.21. Cependant, ces modèles offrent des capacités différentes (par exemple, l'utilisation d'outils, des benchmarks de raisonnement plus élevés). Le prix plus bas reflète l'architecture MoE et le fait qu'il s'agit d'un modèle hébergé par un tiers non censuré. Si vous avez besoin d'une fiabilité garantie, d'une sécurité plus élevée ou de fonctionnalités avancées comme l'appel de fonctions, le coût supplémentaire peut être justifié.
Pour utiliser le modèle, envoyez une requête POST à https://api.orcarouter.ai/v1/chat/completions (ou le point de terminaison approprié selon l'API compatible OpenAI d'OrcaRouter). Incluez l'en-tête "Authorization: Bearer YOUR_API_KEY". Dans le corps de la requête, définissez "model": "obsidian/Qwen3.6-35B-A3B". Transmettez les messages au format standard d'OpenAI : un tableau d'objets avec "role" et "content". Pour le contenu multimodal, utilisez un tableau de contenu avec les types "text" et "image_url" (ou équivalent vidéo). Exemple avec cURL : curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'
Vous pouvez utiliser les paramètres typiques compatibles avec OpenAI : temperature (valeur par défaut 1.0), top_p (0.9), max_tokens (la valeur par défaut varie, il est recommandé de la définir explicitement), stop sequences, frequency_penalty, presence_penalty et seed pour la reproductibilité. Le modèle prend en charge le streaming via "stream": true pour recevoir des réponses token par token. Pour les entrées multimodales, l'API attend des tableaux de contenu avec le type "image_url" et éventuellement "video_url" (consultez la documentation d'OrcaRouter pour le format vidéo exact). La limite de la fenêtre de contexte de 262 144 tokens s'applique au nombre total de tokens dans les messages plus la réponse. Si vous dépassez la limite, vous obtiendrez une erreur de longueur de contexte ; vous pouvez ajuster "max_tokens" ou tronquer les messages.
Pour tirer parti du contexte de 262K, structurez vos invites de manière à inclure l'intégralité du document ou de l'historique de conversation. Gardez à l'esprit que chaque jeton dans l'entrée compte pour le coût et les limites. Pour des entrées très longues, envisagez de segmenter ou de résumer avant d'envoyer, bien que le modèle soit conçu pour gérer le contexte complet. Utilisez le paramètre "max_tokens" pour contrôler la longueur de la sortie. Si vous rencontrez des erreurs de délai d'attente, activez le streaming pour obtenir des résultats partiels plus rapidement. OrcaRouter peut avoir ses propres paramètres de délai d'attente ; contactez le support si nécessaire. Le modèle ne prend pas en charge les messages système de manière spéciale ; traitez-les comme un message d'utilisateur ou d'assistant avec le rôle "system" (format OpenAI standard).
Migrer depuis des fournisseurs comme OpenAI ou Anthropic implique de changer l'URL de base vers https://api.orcarouter.ai/v1 et de mettre à jour l'ID du modèle. Si votre code utilise le client Python d'OpenAI, définissez client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1") puis utilisez client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...). Le format des messages et les noms des paramètres sont identiques. Aucune modification de la logique des prompts n'est nécessaire. Notez que la structure des objets de réponse est également compatible, donc le code d'analyse existant devrait fonctionner. Testez d'abord avec une petite requête pour vous assurer de l'authentification et de la facturation correctes.
Par rapport à Qwen3.6-72B (dense), ce modèle utilise MoE et a donc un coût d'inférence par token plus faible, mais peut avoir une capacité brute légèrement inférieure. Le contexte de 262K est plus grand que celui de 128K de Qwen2.5. Par rapport à Qwen3.6-32B (peut-être dense), ce modèle offre une entrée multimodale que ces versions antérieures peuvent ne pas avoir. La variante « uncensored » est unique ; les versions standard de Qwen ont un alignement. Si vous avez besoin d'une sécurité stricte, choisissez le Qwen3.6 classique. En termes de prix, ce modèle est moins cher que de nombreux modèles denses Qwen sur d'autres plateformes.
GPT-4o et Claude 3.5 Sonnet sont des modèles propriétaires avec une formation approfondie à la sécurité, des scores de benchmark plus élevés en raisonnement et en codage, et prennent en charge l'utilisation d'outils, la vision et un contexte large (200K pour Claude). Ce modèle offre un contexte plus large (262K) et une entrée multimodale à un prix nettement inférieur. Cependant, il lui manque les fonctionnalités avancées, la fiabilité et la cohérence des performances de ces modèles. Pour les applications où le coût est une préoccupation principale et où vous pouvez accepter un certain compromis sur la qualité, ce modèle est une bonne alternative. Si vous avez besoin d'un raisonnement de premier ordre ou d'appels de fonctions, les modèles premium valent le coût supplémentaire.
Ce modèle est optimal lorsque vous avez besoin : (1) d’un contexte très long (262 000 tokens) à faible coût ; (2) d’une entrée multimodale (images/vidéo) sans payer de prix premium ; (3) d’une génération de texte non censurée là où les filtres de contenu interféreraient ; (4) d’une inférence rapide par rapport au nombre total de paramètres grâce à l’activation MoE. C’est un excellent candidat pour la recherche, l’extraction de données, l’écriture créative et toute tâche bénéficiant d’un contexte élevé et d’un faible coût par token. Si vous avez besoin de fonctionnalités avancées comme les appels d’outils, les sorties structurées ou une haute fiabilité, envisagez d’autres modèles.
| Entrée / 1M tokens | $0.310 |
| Sortie / 1M tokens | $4.21 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/obsidian/Qwen3.6-35B-A3BOuvrir @misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B