Un sablier sur un piédestal de modèle vide — les poids Qwen3.8-27B n'ont pas été publiés, donc aucune API gratuite ne peut exister.
Guides & Insights

API gratuite Qwen 3.8 27B : Pas encore — Que lancer à la place

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Non — en date du 12 août 2026, il n'existe pas d'API gratuite pour Qwen3.8-27B, et il n'y en a pas non plus de payante. Le modèle a été annoncé le 3 août avec des poids ouverts promis sur Hugging Face et ModelScope « la semaine du 10 août », mais l'organisation officielle Qwe​n ne possède toujours pas de dépôt Qwen3.8. Tant que les poids ne sont pas publiés, personne ne peut héberger Qwen3.8-27B, donc « gratuit » est sans objet. Voici les trois voies pour accéder gratuitement une fois les poids disponibles (et ce que chacune coûte réellement), ainsi que les modèles que vous pouvez exécuter gratuitement en local dès aujourd'hui.

Pas encore d'API gratuite — les poids sont la porte d'entrée.

Alibaba a annoncé la famille Qwen3.8 le 3 août 2026 : le Qwen3.8-Max à 2,4 billions de paramètres (environ 95 milliards de paramètres actifs, un contexte de 1 million de jetons, proposé à 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie sur Alibaba Cloud Model Studio) et le Qwen3.8-27B dense, sur une seule machine. Les deux ont été promis en poids ouverts sur Hugging Face et ModelScope la même semaine.

Cette promesse est maintenant en retard de deux jours. J'ai vérifié directement sur Hugging Face le 12 août : l'organisation officielle Qwe​n ne possède aucun dépôt Qwen3.8, quel qu'il soit. Les dépôts Qwen3.8-27B-GGUF, -FP8, -NVFP4A16 et -NInfer qui apparaissent dans la recherche de modèles sont des cartes d'espace réservé — zéro fichier de poids, des compteurs de téléchargement à un chiffre, des cartes modèle qui disent littéralement « réservé avant la sortie de Qwe​n/Qwen3.8-27B ». Ne considérez pas cela comme une preuve que le modèle existe ; considérez plutôt qu'il s'agit de gens qui réservent des places de stationnement.

Deux choses que vous ne pouvez pas supposer. Premièrement, la licence : aucune n'a été nommée pour Qwen3.8-27B. Les poids ouverts récents de Qwe​n ont été distribués sous la licence Tongyi Qianwen, dont la clause de 100 millions d'utilisateurs actifs mensuels déclenche des discussions sur la licence commerciale à grande échelle — Apache 2.0 n'est pas un choix par défaut sûr. Deuxièmement, les spécifications : Alibaba n'a publié ni tableau de référence, ni fenêtre de contexte, ni exigence matérielle confirmée pour le 27B. Tout ce qui est répété à son sujet aujourd'hui n'est que projection.

Nous avons couvert la liste de contrôle précédant la sortie — ce qui est confirmé, ce qui relève de la rumeur, ce qu'il faut vérifier avant de télécharger — dans Qwen3.8-27B Open Weights: What We Know Before the Drop. Cet article traite de la partie que ce document n'a pas couverte : comment « gratuit » fonctionnera concrètement une fois le modèle publié.

Une fois les poids tombés : trois routes vers la liberté, et ce que chacune coûte vraiment.

« Gratuit » n'est jamais gratuit. Les trois voies vers un Qwen3.8-27B gratuit déplacent le coût quelque part ; la différence est là où il atterrit. Le 27B est un modèle dense — chacun de ses ~27 milliards de paramètres est actif sur chaque jeton — donc les coûts ci-dessous concernent du matériel réel, pas du marketing.

Three routes to a free Qwen3.8-27B API after the weights drop: run it yourself, a hosted free tier, or OrcaRouter's planned free tier — and the real cost of each.

Option 1 : Faites-le vous-même — gratuit en argent, payant en matériel

La seule voie où « gratuit » devient littéralement vrai après l'achat du matériel. Le cofondateur d'Unsloth, Daniel Han, s'attend à ce que le modèle 27B fonctionne dans environ 17 Go de VRAM à sa sortie — un objectif, pas une spécification livrée. En utilisant l'échelle de quantification mesurée de Qwen3.6-27B comme approximation : Q4_K_M se situe autour de 16 Go, Q6_K autour de 21 Go, FP8 autour de 27 Go, et BF16 complet autour de 54–56 Go. Le minimum réaliste aujourd'hui est une carte de 24 Go — RTX 3090, RTX 4090, ou classe A6000 — en Q4.

Le timing compte : les poids officiels avec vLLM ou SGLang fonctionnent généralement dans les jours qui suivent une sortie, mais les quantifications communautaires GGUF et AWQ accusent un retard d'une à deux semaines, donc un « pull and run » à la Ollama n'existera pas le jour de la sortie. Les coûts cachés sont l'électricité, une machine silencieuse et votre temps. L'avantage, c'est la confidentialité — rien ne sort de votre machine — et un coût marginal de zéro qui se cumule si vous utilisez aussi le GPU pour d'autres modèles.

Route 2 : Niveaux gratuits hébergés — gratuits en argent, tarifés en limites

Une fois les poids publiés, attendez-vous à un quota d'évaluation de la part d'Alibaba Cloud et à des offres gratuites de la part des hébergeurs serverless habituels. Le schéma à prévoir est celui qu'Alibaba applique déjà pour Qwen3.8-Max : un quota de 1 million de jetons pour les nouveaux utilisateurs, région Singapour uniquement, valable 90 jours, sans report — et les jetons de raisonnement sont facturés comme des jetons de sortie, de sorte qu'un modèle qui raisonne par défaut peut épuiser tout le crédit en un week-end de prototypage. Ce que vous payez en réalité, ce sont des limites de débit, un verrouillage régional, une date d'expiration et le fait que vos requêtes soient envoyées à un tiers. Une offre gratuite est une porte d'entrée pour évaluer le modèle, pas un endroit pour le déployer.

Itinéraire 3 : le niveau gratuit d'OrcaRouter — prévu, pas encore en ligne

Parce que la requête de recherche est littéralement « gratuit », nous allons être explicites : OrcaRouter prévoit un niveau gratuit pour Qwen3.8-27B une fois que les poids seront publiés. Ce n'est pas encore en ligne. Il n'y a aucun endpoint à appeler, et je ne vais pas coller d'exemple factice. Nous l'annoncerons quand il y aura quelque chose à annoncer. Ce que nous hébergeons aujourd'hui, c'est Qwen3.8-Max à 2 $ / 6 $ pour 1 million de jetons, sans marge — et le 27B n'est pas sur la plateforme, parce que personne ne peut encore le servir.

Ce que vous pouvez utiliser gratuitement dès maintenant

Si votre besoin est « un modèle ouvert de classe 27B que je peux exécuter sans payer », vous n'avez pas à attendre. La réponse honnête de même niveau est Qwen3.6-27B, le prédécesseur direct du modèle que vous attendez.

Comparison of Qwen3.6-27B and Nemotron 3.5 Lightning 30B A3B, which you can run free today, against Qwen3.8-27B, which is not yet released.

Qwen3.6-27B est sous licence Apache 2.0, un modèle dense de 27,8B avec un contexte de 262K et une entrée native en texte, image et vidéo. Un GGUF Q4_K_M pèse environ 16,5 Go et fonctionne à environ 25 tokens par seconde sur un GPU grand public de 24 Go (16 à 18 tokens par seconde sur un M4 Max). Les chiffres rapportés par le fournisseur sur sa fiche modèle : SWE-Bench Verified 77,2, MMLU-Pro 86,2, AIME 2026 94,1, GPQA Diamond 87,8 et MMMU 82,9. Si Qwen3.8-27B est « un 27B », c'est le 27B que vous pouvez réellement utiliser aujourd'hui — même famille, même conception dense, déjà ouvert.

Nemotron 3.5 Lightning 30B A3B est un modèle de forme différente, également gratuit : publié le 11 août 2026 sous la licence OpenMDW 1.1 de NVIDIA. C'est un modèle Mixture-of-Experts de 30B au total, ~3B actifs, avec une architecture hybride Mamba-2 et jusqu'à 1M de contexte — les checkpoints NVFP4 font environ 21,6 Go et un GGUF Q4 environ 25 Go. Il nécessite une carte de 24 Go ou plus, car les 30 milliards de paramètres résident en mémoire même si seulement environ 3 milliards s'activent par jeton. Les premiers retours le placent autour de 45 jetons par seconde sur un seul GPU. Il est conçu pour la couche d'exécution des agents — appels d'outils, validation, formatage — pas pour le raisonnement de pointe. Si votre charge de travail est du travail de routine d'agents à haut volume, il peut battre un modèle dense de 27B sur votre tâche réelle.

Et si ce que vous voulez précisément, c’est une API hébergée gratuite dès aujourd’hui plutôt qu’une installation locale, le seul « gratuit » honnête est le quota Qwen3.8-Max d’Alibaba : 1M de tokens, région de Singapour, 90 jours. Ce n’est pas le 27B, et c’est une allocation d’évaluation, pas un service — utilisez-la pour tester le comportement de Qwen3.8 maintenant, puis passez à la suite.

Quand ce conseil est erroné

Si vous possédez déjà un GPU de 24 Go ou plus, le cadrage « attendre les niveaux gratuits » est erroné pour vous. Le jour où les poids sont publiés, vLLM sur les poids officiels est votre niveau gratuit ; vous attendriez une commodité dont vous n'avez pas besoin. Tenez bon environ deux semaines uniquement si vous voulez spécifiquement l'échelle de quantification GGUF peaufinée.

Si vous prototypez selon un contrat d'API, les quotas gratuits hébergés (une fois que le 27B les aura) peuvent coûter moins cher que votre temps — même avec l'expiration à 90 jours et le verrouillage régional, louer une machine GPU pour une semaine de prototypage est généralement l'option la plus coûteuse.

Si la licence s’avère être Tongyi Qianwen plutôt qu’Apache,« free weights » ne signifiera pas libre de commercialiser au-delà du seuil de 100 millions d’utilisateurs actifs mensuels. Lisez le fichier LICENSE dans le dépôt réel avant de construire quoi que ce soit dessus — c’est la manière la plus courante par laquelle des « free open-weights » se transforment en facture.

Et si Alibaba repousse encore la date — cela fait déjà deux jours de retard sur la fenêtre promise — chaque semaine qui passe fait de Qwen3.6-27B le bon choix plutôt que la solution de secours.

A timeline from announcement to free local run of Qwen3.8-27B.

En résumé

Il n'existe pas d'API gratuite Qwen3.8-27B pour la simple raison que Qwen3.8-27B n'existe nulle part. Lorsque les poids seront publiés, les trois voies gratuites seront l'auto-hébergement (payé en matériel), les niveaux gratuits hébergés (payés en limites), et le niveau gratuit prévu par OrcaRouter — qui n'est pas encore actif, et nous le dirons clairement quand il le sera. Aujourd'hui, l'option gratuite la plus proche est Qwen3.6-27B sur votre propre matériel. Attendre ne vous coûte rien, sauf le 27B ; faire tourner le prédécesseur ne vous coûte rien, sauf un GPU que vous pouvez mettre à profit pour tout le reste entre-temps.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement