
Qwen3.8-27B-Uncensored-MLX sur Apple Silicon : comment choisir votre build, le charger dans LM Studio ou mlx-vlm, et maîtriser le contexte de 262K
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
La chose la plus utile à savoir sur orcarouter/Qwen3.8-27B-Uncensored-MLX est que vous n'avez pas à choisir un sous-dossier pour l'exécuter. La version abliterated Apple-Silicon de Qwen/Qwen3.8-27B d'OrcaRouter — publiée sur Hugging Face le 17 août 2026, donc pas nouvelle, juste sous-documentée — conserve une copie de la version 4 bits à la racine du dépôt, précisément pour que les outils qui traitent un dépôt comme un seul modèle, au premier rang desquels LM Studio, la chargent sans aucune configuration. Cette seule décision explique pourquoi cette carte a attiré environ 83 000 téléchargements au cours du dernier mois, alors que les conversions MLX comparables n'en obtiennent qu'une petite fraction. Tout le reste est un vrai choix : laquelle des quatre précisions convient à la mémoire unifiée de votre Mac, quel runner vous utilisez, si la vision et l'appel d'outils survivent à votre largeur de bits, et si la fenêtre de contexte de 262 144 jetons vaut ce qu'elle coûte sur votre matériel. Ce runbook passe en revue ces décisions dans l'ordre. Il s'agit d'une documentation de première main — les tailles, précisions et chiffres de fidélité ci-dessous sont ceux d'OrcaRouter, mesurés sur cette version exacte, et chaque chiffre de la communauté est identifié comme tel.

Que contient exactement ce dépôt ?
Ceci est une version ablitérée de Qwen/Qwen3.8-27B — un modèle dense de 27B à attention hybride (attention linéaire Gated DeltaNet plus attention complète), natif vision-langage, avec contrôle de la pensée, appel d'outils, une tête de prédiction multi-tokens (MTP) et une fenêtre de contexte de 262 144 tokens. L'ablitération supprime le comportement de refus du modèle en orthogonalisant la direction de refus hors du flux résiduel ; si cela vous est nouveau, notre introduction à la technique est le meilleur point de départ que cette page, qui concerne l'exécution de la version, pas la méthode. Les poids sont sous licence Apache-2.0, hérités du modèle de base.
Ne confondez pas ce dépôt avec qwen-3-8-27b-mlx, qui est le même modèle de base au format MLX sans l'abliteration. Les lecteurs téléchargent régulièrement l'un alors qu'ils voulaient l'autre : celui-ci est la version de recherche sans refus ; celui-là est le Qwen/Qwen3.8-27B standard sur Apple Silicon. Vérifiez le nom du dépôt avant de passer du temps à télécharger.
Un détail structurel a plus d’importance qu’il n’y paraît : la tour de vision, toutes les normes et le conv1d d’attention linéaire restent en BF16, et seules les couches linéaires du modèle de langage — y compris embed_tokens et lm_head — sont quantifiées. C’est pourquoi la compréhension d’images survit à la quantification, et c’est aussi pourquoi les tailles sur disque ci-dessous sont un peu plus grandes qu’une estimation naïve « 27B à N bits » : une partie du modèle n’est jamais compressée.
La décision : quelle version correspond à quel Mac.

Quatre précisions sont fournies en sous-dossiers — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — toutes en quantification affine MLX avec une taille de groupe de 64. La version 4-bit est également répliquée à la racine du dépôt. Choisissez d'abord selon la mémoire unifiée de votre Mac, puis selon la qualité :
• 8-bit — environ 27,5 Go sur disque, nécessite un Mac de 64 Go (une machine de 32 Go peut le charger, mais laisse peu de place pour autre chose). Fidélité cosinus mesurée par rapport à la source BF16 : 0,9997, effectivement quasi sans perte. Choisissez-le quand la qualité est primordiale et que la mémoire est abondante.
• 6-bit — ~22 Go, convient aux Macs de 24 à 32 Go. Fidélité 0,9996, excellent. Le meilleur rapport qualité/gigaoctet pour la plupart des possesseurs d'une machine de 48 Go.
• 4-bit — ~15 Go, confortable sur un Mac de 24 Go. Fidélité 0,996, très bonne. C'est notre valeur par défaut recommandée, et c'est la copie à la racine du dépôt pour cette raison.
• 2 bits — ~8,7 Go, tient sur un Mac de 16 Go. Fidélité 0,92 et, à 27B, sérieusement dégradé : boucles de répétition, texte brouillé, code et chinois, vision partielle. La fiche le dit clairement — uniquement pour archivage, pas pour du vrai travail. Un Mac de 16 Go peut techniquement le charger ; cela ne le rend pas utilisable.
La taille sur disque n'est pas la quantité de mémoire. Les poids doivent tenir dans la mémoire unifiée aux côtés de macOS, du cache KV et des tampons temporaires de Metal, alors laissez de la marge. Un test communautaire de la version 4 bits sur un Mac M1 Pro 32 Go a mesuré environ 16 Go de poids sur disque, mais un pic d'inférence de 18,5 à 21,7 Go ; les tests communautaires des versions MLX 8 bits rapportent des pics d'environ 34 à 36 Go, même lorsque les poids font environ 29,5 Go. La recommandation pratique issue de ce même test communautaire est : 16 Go n'est pas une vraie option pour un modèle 27B, 24 Go peut essayer la version 4 bits avec un contexte court, et 32 Go est le point de départ confortable. Notre article sur la planification de la VRAM reprend les mêmes calculs pour toute la famille.
Comme l'ensemble du dépôt totalise environ 94 Go toutes précisions confondues, ne téléchargez que le sous-dossier dont vous avez besoin avec hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — en substituant la précision de votre choix. La copie 4-bit à la racine est un doublon du sous-dossier 4-bit, vous n'avez donc jamais besoin de télécharger les deux.
Chemin un — LM Studio, zéro configuration
La copie racine en 4 bits existe précisément pour que LM Studio puisse traiter tout le dépôt comme un seul modèle. Recherchez l’ID du modèle, sélectionnez la précision souhaitée (la copie racine est en 4 bits), et l’application gère le reste. Trois pièges, tous issus de notre carte, et ils constituent toute la différence entre un fonctionnement réussi et un échec :

• Le dépôt est restreint. Les téléchargements anonymes renvoient une erreur HTTP 401. Acceptez les conditions sur la page du modèle, puis collez un jeton de lecture Hugging Face dans LM Studio : Settings → Integrations → Hugging Face. Sinon, le chargement échoue tout simplement.
• Désactivez la quantification du cache KV. Les modèles de vision MLX ne la prennent pas en charge sur cette architecture et le chargement échoue lors de l'initialisation si elle est activée (suivi sous mlx-engine#286). C'est l'inverse de la recommandation pour les builds GGUF, où la quantification du cache K/V est une économie de VRAM légitime — les deux formats ne sont pas interchangeables ici.
• Mettez à jour le runtime. qwen3_5Le support de l’architecture qwen3_5 a été ajouté dans mlx-vlm 0.6.x ; un ancien runtime intégré ne peut pas charger ces poids du tout. Le badge « Likely too large » de LM Studio, en revanche, n’est qu’un avertissement de RAM, pas une erreur — ignorez-le si votre mémoire unifiée respecte les recommandations ci-dessus.
Quelle précision dans LM Studio : la 8 bits fait ~29,5 Go sur disque et nécessite un Mac de 64 Go ; la 6 bits ~22 Go convient à une machine de 48 Go ; la 4 bits à ~16 Go est le bon choix sur un Mac de 32 Go. Si vous préférez la voie llama.cpp / Ollama sur d'autre matériel, notre guide d'exécution locale pour le modèle non censuré couvre ce chemin séparément.
Deuxième chemin — mlx-vlm et mlx-lm depuis un sous-dossier
La voie de la ligne de commande vous offre la précision directement et un serveur compatible OpenAI pour les outils d’agent. Prérequis : pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 et mlx ≥ 0.32 ; le backend Metal est sélectionné automatiquement sur Apple Silicon). Après le téléchargement du sous-dossier ci-dessus :
python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "Explique l'intrication quantique en une phrase." --max-tokens 256
Ajoutez --image path/to/image.png pour l'entrée visuelle, ou servez-la :
python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080
For agent frameworks that speak OpenAI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.
La vision survit à la quantification.
Parce que la tour de vision et le conv1d restent en BF16, la compréhension de l'image est préservée en 4/6/8 bits. Sur notre image de test — formes, couleurs, position, arrière-plan et texte dans l'image — les versions 4/6/8 bits ont tout décrit correctement ; la version 2 bits n'était que partielle. Si vous choisissez une version et que la vision compte, le 4 bits est le minimum auquel vous devriez descendre. Nous n'avons pas publié de débit de vision spécifique à Apple Silicon pour cette version, ne faites donc pas confiance à un chiffre de tok/s pour celle-ci à moins qu'il ne provienne d'un run nommé sur votre propre classe de puce.
La tour de vision préservée fait également partie de la surface de risque, et il vaut la peine de le dire clairement : un modèle abliteré qui peut aussi lire des images n'est pas un problème de sécurité purement textuel.
Appel d'outils et utilisation d'agents
L'appel d'outils est une capacité du modèle de base qui survit à l'abliteration, ce qui rend cette version véritablement utile pour le red-teaming de systèmes agentiques — et véritablement dangereuse si elle est dirigée vers de vrais services. La configuration standard est le point de terminaison mlx_lm.server ci-dessus, que tout agent compatible OpenAI peut appeler. Si vous l'exécutez comme agent, comprenez ce que vous avez activé : un modèle sans refus avec appel de fonctions et un contexte de 262K constitue une posture de sécurité différente de celle d'un modèle de chat, et le cadrage « recherche uniquement » de la fiche existe pour cette raison.
Le contexte 262K et ce qu'il coûte vraiment
L'architecture confère à ce modèle un contexte long exceptionnellement peu coûteux. L'attention hybride signifie ici 48 couches d'attention linéaire (Gated DeltaNet) entrelacées avec 16 couches d'attention complète, et seules les 16 couches d'attention complète portent un cache KV classique — les couches linéaires conservent plutôt un état récurrent compact. Ainsi, 262 144 jetons coûtent nettement moins que sur un 27B à attention complète. C'est un fait structurel du modèle de base, pas une promesse au sujet de votre Mac.
En pratique, la fenêtre est une capacité, pas une option gratuite. Un test communautaire de contexte long sur un M4 Max a mesuré environ 63 tok/s en contexte court, tombant à environ 11 tok/s à 31K jetons — le décodage se dégrade fortement à mesure que le cache se remplit, et la latence du premier jeton sur des invites très longues est généralement un obstacle plus grand que le débit brut. Le pré-remplissage spéculatif et basé sur ANE améliore l'ingestion, pas le décodage. Nos propres chiffres de coût du cache KV sur Apple Silicon pour cette version ne sont pas publiés ; si vous avez besoin de chiffres précis pour votre matériel, les exécutions communautaires sont la source honnête, et le consensus communautaire est de considérer les 262K complets comme une ressource à laquelle on recourt délibérément, et non comme un réglage par défaut laissé actif.
Vitesse — ce qui est réellement mesuré
Nous publions exactement un chiffre de vitesse pour cette version et ce n'est pas Apple Silicon : ~32–37 tok/s en régime stable sur un seul H200 via le backend MLX CUDA, ce qui confirme que les poids fonctionnent également hors de macOS. Sur Mac, notre fiche ne publie délibérément aucun tok/s, car cela dépend de la puce, de la précision et de l'exécuteur. Des chiffres utiles aux praticiens, tous étiquetés comme tels :
Cette configuration exacte, en 4-bit, M1 Pro 32 Go : ~8,7 tok/s en génération et ~41,7 tok/s en préremplissage sur un court essai (test communautaire, août 2026). Une puce plus ancienne, mais un plancher réaliste.
• oMLX avec MTP natif sur un M4 Max, checkpoint standard non-abliterated : 53,3 tok/s en prose et 72,1 tok/s en code, avec ~273,7 tok/s de préremplissage à 4K ; décodage brut sans MTP ~24,6 tok/s. Mesuré par un praticien sur un checkpoint et un runtime différents, donc à considérer comme une borne supérieure que les poids abliterated pourraient approcher plutôt qu'une promesse.
• oMLX double-ANE prefill sur un M3 Ultra, abliterated oQ4e-MTP : préremplissage en hausse d'environ 17,7 % à 16K et ~18,9 % à 32K, et décodage via Lightning MTP jusqu'à ~75 tok/s à 16K. Les mises en garde sont réelles : cela utilise des interfaces privées du runtime Apple et des poids approximatifs INT8, ajoute environ 4 Go de mémoire de pointe, et fait passer le temps de chargement du modèle de ~3,4 s à ~28 s. Il s'agit d'une optimisation d'ingestion de prompt, pas d'un accélérateur de génération.
La tête MTP — une accélération gratuite si votre runner la prend en charge
Cette version inclut le drafter de prédiction multi-tokens du modèle de base dans le sous-dossier mtp/ (architecture qwen3_5_mtp), et il fonctionne avec n'importe quelle précision principale. L'acceptation est sans perte — avec un décodage glouton, la sortie est identique à une exécution sans le drafter — c'est donc une véritable accélération sans coût de qualité lorsqu'il s'active. Deux notes de configuration de notre fiche : il nécessite une version de mlx-vlm qui inclut le drafter qwen3_5_mtp (la branche main), et vous devez passer à la fois --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp et --draft-kind mtp. Définir mtp_enabled seul ne fait rien. Si votre exécuteur ne prend pas en charge le drafter, il est ignoré et le modèle fonctionne normalement — rien ne casse.
Sécurité — lisez ceci avant de l'exécuter, pas après.
Le propre avertissement de la fiche du modèle est inhabituellement direct, et cette page ne va pas l'adoucir. L'alignement sécurité de cette version a été en grande partie supprimé. Il se conformera à des demandes nuisibles, contraires à l'éthique, offensantes ou illégales que le modèle de base Qwen/Qwen3.8-27B refuserait, et il ne dispose d'aucun garde-fou intégré digne de ce nom. Il est publié strictement pour la recherche légitime — interprétabilité, étude de la sécurité de l'IA et des mécanismes de refus, red-teaming, évaluation de la robustesse et expériences contrôlées. Si ce n'est pas ce que vous faites, ce n'est pas le bon modèle.
Deux avertissements de la carte méritent d'être soulignés. Premièrement, les sondes de jailbreak et de sécurité « réussissent » trivialement sur un modèle abliteré, et ce n'est pas une évaluation de sécurité réussie — c'est le comportement attendu d'un modèle dont la direction de refus a été supprimée. L'absence de refus n'est pas une preuve de sécurité. Deuxièmement, la préservation de la vision, de l'appel d'outils et du contexte de 262K élargit la surface d'attaque vers la compréhension d'images et l'utilisation agentique : un modèle non censuré capable de lire des captures d'écran et d'appeler des outils présente un risque plus large qu'une version sans refus limitée au chat. La quantification en faible précision ajoute une troisième couche d'instabilité par-dessus — à 2 bits, une sortie brouillée peut même être confondue avec un refus, ce qui est un type d'échec déroutant en soi.
Vous assumez la pleine et entière responsabilité de l'utilisation et des résultats générés. La licence Apache-2.0 est héritée du modèle de base et n'y change rien : elle autorise l'utilisation ; elle ne rend pas votre déploiement sûr. Toute personne qui déploie ce modèle auprès d'utilisateurs finaux, de mineurs ou dans tout environnement de production doit d'abord ajouter ses propres couches de modération, de sécurité et de prévention des abus, et se conformer à la législation applicable. Pour les chercheurs qui l'exécutent réellement, les garde-fous pratiques sont les suivants : un environnement isolé, idéalement hors ligne ; des outils d'agent ne pointant pas vers des services réels ; aucune exposition aux utilisateurs finaux ; et un examen des résultats avant toute diffusion.
Quand le local n'est pas la réponse
Le local est tout l'intérêt de cette version — les poids sont sur votre disque, aucun coût par token, et rien ne sort de la machine. Mais le local est aussi un plafond : elle est réservée aux puces Apple Silicon, il faut vivre avec la qualité de la quantification, et il n'y a aucune redondance si la machine est occupée. Si vous avez besoin d'un modèle de classe 27B non-abliterated via une API pour une charge de travail réelle, ou si vous voulez tester cette version locale en A/B contre un modèle hébergé avec les mêmes prompts, c'est pour combler cette lacune qu'une couche de routage existe. OrcaRouter met plus de 200 modèles derrière une seule clé API au tarif catalogue des fournisseurs, avec bascule automatique et un DSL de routage — une baisse de prix d'un fournisseur prend effet chez nous le jour même de son annonce, car nous répercutons le tarif catalogue. Une seule API, une seule intégration, et vous pouvez comparer une configuration locale non éprouvée à un modèle hébergé sans créer de second compte. Nous n'hébergeons pas cette version MLX — ce sont des poids locaux par conception — l'API est donc la voie complémentaire, pas un substitut.
Le guide de décision rapide
• {{1}}Mac 16 Go{{/1}} — honnêtement, pas ce modèle. Le {{2}}2-bit{{/2}} tient et ne sert qu'à l'{{3}}archivage{{/3}} ; vous aurez des problèmes de {{4}}mémoire{{/4}} de toute façon. Cherchez un {{5}}modèle non censuré plus petit{{/5}}, ou la {{6}}conversion mixte communautaire 3/6-bit{{/6}} conçue pour les {{7}}machines 18–24 Go{{/7}}.
• Mac 24 Go — 4 bits, et gardez le contexte court ; ne lancez pas la vision et le contexte long en même temps.
• Mac 32 Go — 4-bit est le point idéal ; 6-bit si vous gardez le contexte serré.
• Mac 48 Go — 6 bits avec marge ; 8 bits si vous ne poussez pas la fenêtre.
• 64 Go et plus — 8-bit, quasi sans perte, et contexte 262K à portée avec les réserves ci-dessus.
Voilà tout le runbook. Le modèle date du 17 août 2026, ce n'est pas une nouvelle de lancement, et ça n'a pas besoin de l'être : 83 000 téléchargements ont eu lieu parce que les gens voulaient un guide pratique, et cette page est ce guide. Commencez à la racine du dépôt, chargez la version 4-bit dans LM Studio, et ne vous écartez de la version par défaut que lorsque vous savez ce que vous échangez contre la qualité. Si vous venez du côté de la famille GGUF ou FP8, les guides associés couvrent ces parcours — le cadre de décision est le même, les calculs de quantification ne le sont pas.
Pas un autre build de ce modèle — Qwen3.8-Flash-Next-Uncensored est une version distincte : abliteré à partir de Qwen3.8-Flash-Next, un aperçu de l'architecture Qwen4 en mélange d'experts avec 176B paramètres stockés / 6B actifs. Même technique d'abliteration, poids différents, sa propre collection.
Les six builds 27B — BF16, GGUF, MLX, FP8, INT8 et NVFP4 — sont réunis dans la collection Qwen3.8-27B-Uncensored sur Hugging Face.
Ces poids sont locaux uniquement par conception. Pour une base de référence hébergée contre laquelle mesurer la version abliterée, Qwen3.8-27B est servi sur OrcaRouter au prix catalogue du fournisseur avec 0 % de marge — le modèle standard, alignement de sécurité intact.
