Un carton-titre généré portant « Boreal vs Qwen3.8 Max », avec le sous-titre « La ligne que chaque fournisseur espère que vous ignorerez », des icônes linéaires plates représentant un cadre de lecture vidéo, une carte de scores dont une ligne est mise en évidence, et une loupe, avec le logo OrcaRouter incrusté en bas à droite.
Guides & Insights

Boreal vs Qwen3.8 Max : La ligne que chaque fournisseur espère que vous sauterez

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Chaque lancement de modèle s'accompagne de la publication d'une fiche de chiffres, et chaque fiche comporte une ligne sur laquelle le fournisseur préférerait que vous ne vous attardiez pas. Pour Qwen3.8 Max, sorti le 3 août 2026, les lignes flatteuses sont faciles à repérer : il a pris la première place du classement front-end de CodeArena avec 1 691 points, il a atteint un indice agentique Artificial Analysis de 58, à égalité avec Claude Opus 5 en mode effort élevé — ce qui rapprochait le plus un laboratoire chinois du sommet de ce classement — et il a obtenu un score GDPval-AA de 1 739 Elo, devant GPT-5.6 Sol. La ligne juste en dessous est plus difficile à lire. Sur la même suite d'évaluation de cet évaluateur, le taux d'hallucination mesuré est passé de 23 % sur la génération précédente à 40 %, et le score de récupération en contexte long du modèle a chuté de deux points. Boreal, le modèle de vidéo publicitaire de Creatify, lancé le 15 septembre 2026 à un centime par seconde, présente une ligne du même genre sur sa propre fiche — et elle est plus précise, parce que le fournisseur l'a publiée.

Aucune des deux lignes n’est disqualifiante. Toutes deux sont plus instructives que les scores affichés en tête, c’est pourquoi il vaut la peine de les mettre côte à côte plutôt que de comparer les bannières.

Ce en quoi Qwen3.8 Max excelle véritablement

Les victoires sont réelles et elles ne sont pas négligeables.

Qwen3.8 Max est un modèle mixture-of-experts de 2 400 milliards de paramètres, dont environ 95 milliards de paramètres sont actifs par token, et c'est le premier Qwen de classe Max qu'Alibaba a annoncé vouloir publier en poids ouverts — annoncé pour la semaine du 10 août 2026, sans licence ni date ferme, un détail à noter, car l'annonce n'est pas la sortie. Il dispose d'une fenêtre de contexte de 1 M de tokens avec un plafond de sortie de 131 072 tokens, et il accepte en entrée du texte, des images et de la vidéo. Ce dernier point mérite d'être souligné dans cette comparaison particulière : parmi les quatre modèles de texte de pointe que cette série oppose à Boreal, Qwen3.8 Max est l'un des deux seuls à qui l'on peut remettre un clip vidéo finalisé et poser une question à son sujet.

La tarification est agressive, au point de redéfinir le segment. À 2,00 $ le million de tokens en entrée et 6,00 $ le million de tokens en sortie, avec les lectures de cache à 0,25 $, elle est environ 20 % moins chère que la génération précédente tout en doublant la longueur maximale de sortie. Sur notre tableau de bord, cela donne 2,00 $ et 6,00 $, un contexte de 1 M de tokens, un temps jusqu’au premier token (p50) de 10,00 secondes — le plafond que rapporte notre instrumentation, donc à interpréter comme « lent » plutôt que comme précis — et 183,0 millions de tokens de trafic au cours des sept derniers jours.

Et la rangée en dessous

Voici la partie qui ne fait pas la une du post de lancement.

L’évaluation indépendante d’Artificial Analysis a enregistré deux régressions entre Qwen3.7-Max et Qwen3.8 Max. Sa mesure de récupération en contexte long a chuté de deux points. Sa mesure d’omniscience a chuté de dix, et le taux d’hallucination mesuré par l’évaluateur est passé de 23 % à 40 %. En même temps, le coût par tâche du modèle sur l’indice d’intelligence est passé de 0,53 $ à 1,14 $ — il a fallu environ 64 tours par tâche au modèle, contre 14 pour son prédécesseur.

Lisez ces éléments ensemble et une image cohérente apparaît. Qwen3.8 Max est un modèle qui s’est amélioré dans les domaines que les benchmarks à réponse unique peuvent mesurer — le code, l’achèvement de tâches agentiques, la résolution structurée de problèmes — et qui a régressé sur ce qu’il est le plus difficile d’évaluer : savoir quand il ne sait pas. Un modèle qui délibère davantage et hallucine davantage ne se contredit pas. Des traces de raisonnement plus longues créent davantage d’occasions d’adopter avec assurance une réponse erronée, et un benchmark qui récompense l’achèvement de la tâche ne pénalise pas cela tant que la tâche ne comporte pas d’invariant caché à violer.

Pour un acheteur, la conséquence pratique est étroite et précise. Si votre usage du modèle relève de la génération de code ou d'un flux de travail agentique où une mauvaise réponse échoue bruyamment — un test échoue, une compilation casse — les régressions sont en grande partie invisibles et les gains constituent toute l'histoire. Si votre usage est la recherche documentaire, le résumé, ou tout ce où une réponse fausse mais fluide parvient à un humain sans vérification, le passage de 23 à 40 est le chiffre qui devrait décider de votre évaluation, et non le classement CodeArena.

La pire gamme de Boreal, publiée par le fournisseur

Le contraste qui rend ce rapprochement utile, c'est que Creatify a fait quelque chose que la plupart des fournisseurs ne font pas : il a placé son résultat le plus faible dans le même post que son plus fort.

Boreal a été testé en aveugle face à son propre modèle de base non modifié, avec le prompt, la résolution, le nombre d'images et la graine maintenus constants, sur 40 cas de production. Creatify rapporte une préférence de 81 % pour Boreal — 25 contre 6 avec 9 égalités, test du signe p<0,001 — puis décompose cette moyenne. Publicités de produits : 83 %. Scènes de créateurs et UGC : 85 %. Clips d'une personne qui parle : 60 %.

Ce dernier chiffre est la ligne. Les talking heads figurent parmi les formats les plus courants de la publicité à réponse directe, et c’est le format où l’avantage du modèle sur sa propre base est le plus mince — à peine mieux qu’un pile ou face contre un modèle que personne n’allait déployer. Le rendu est annoncé à 1:1 avec le temps réel en classe 720p, et la rétention des détails fins s’est améliorée de 11,3 % à p = 0,004, donc le bilan global est véritablement positif. La ventilation vous indique simplement pour quelle moitié de la catégorie ce modèle a été optimisé, et ce n’est pas la moitié avec une personne qui parle face caméra.

Notez aussi quel type de preuve constitue chacune de ces lignes. La régression de Qwen3.8 Max a été découverte par un évaluateur indépendant exécutant son propre harnais. La ligne faible de Boreal a été divulguée par le fournisseur, dans un test que le fournisseur a conçu et exécuté. La seconde est plus fiable en tant qu’affirmation de fait et moins informative en tant que comparaison, car on ne trouve aucun chiffre indépendant dans le fichier de Boreal.

A generated two-column scoreboard for Boreal vs Qwen3.8 Max sharing six dimension labels. Boreal reads output rendered video, input text or one image, meter $0.01 per second, context not published, latency 1:1 realtime, independent score none yet. Qwen3.8 Max reads output text 131K max, input text image video, meter $2 / $6 per 1M, context 1M tokens, latency p50 10.00s TTFT, independent score AA Index 58 with 2 regressions. Footer reads "Boreal figures vendor-run and unreproduced; Qwen3.8 Max per our catalogue and Artificial Analysis."

Le contraste de spécification

• Sortie — Boreal : vidéo rendue, classe 720p, texte-vers-vidéo et image-vers-vidéo. Qwen3.8 Max : texte uniquement, jusqu'à 131 072 jetons.

• Entrée — Boreal : une invite textuelle ou une image fixe. Qwen3.8 Max : texte, images et vidéo.

• Prix — Boreal : 0,01 $ par seconde de vidéo terminée. Qwen3.8 Max : 2,00 $ par 1M d'entrée / 6,00 $ par 1M de sortie, lectures du cache à 0,25 $.

• Contexte — Boreal : non publié. Qwen3.8 Max : 1 M de tokens en entrée, 131 K en sortie.

• Latence — Boreal : annoncée à 1:1 avec le temps réel. Qwen3.8 Max : temps médian (p50) jusqu'au premier token de 10,00 secondes sur notre tableau de bord.

• Poids — Boreal : propriétaires, détenus et servis par Creatify. Qwen3.8 Max : propriétaire au lancement ; Alibaba a annoncé une publication de poids ouverts pour le premier Qwen de classe Max, sans licence ni date confirmée.

• Preuves — Boreal : test à l'aveugle de 40 cas réalisé par le fournisseur, aucune évaluation indépendante. Qwen3.8 Max : couverture de benchmarks indépendants incluant deux régressions mesurées, aux côtés des lignes du fournisseur affichant 86,1 sur OSWorld-Verified et 86,6 sur Terminal-Bench 2.1.

Ce que vaut une régression pour quelqu’un qui achète

Les régressions dans les classements sont généralement considérées comme des anecdotes. Elles se rapprochent pourtant davantage de l’élément le plus déterminant pour la décision qu’un benchmark publie, car ce sont les seules lignes qui vous indiquent ce qu’un fournisseur a cédé.

Le geste utile n’est pas de lire l’une ou l’autre des fiches, mais de faire tourner les deux modèles sur votre propre trafic — et l’obstacle pratique, c’est que cela suppose normalement deux contrats, deux SDK et deux relations de facturation, ce qui crée assez de friction pour que la plupart des équipes sautent le test et achètent plutôt sur la base du score affiché.

Cette friction est précisément ce qu'une couche de routage élimine. Qwen3.8 Max figure dans notre catalogue aux côtés de la génération précédente, donc les comparer sur votre propre ensemble d'évaluation est une modification d'une seule ligne de la chaîne du modèle plutôt qu'un cycle d'approvisionnement, et la même clé donne accès au reste du catalogue lorsque la comparaison indique que vous voulez un modèle différent pour une étape différente du pipeline. Il se situe à au tarif catalogue du fournisseur, avec 0 % de marge, ce qui compte ici pour une raison précise : Qwen3.8 Max est arrivé environ 20 % moins cher que la génération qu'il a remplacée, et une révision tarifaire du fournisseur de ce type est le genre de chose qui devrait apparaître sur votre facture quand elle se produit, plutôt qu'au prochain renouvellement.

Boreal ne fait pas partie de notre catalogue. OrcaRouter ne propose pas de modèles de génération vidéo, et rien ici ne doit être interprété comme affirmant le contraire. Ce que nous proposons, c'est la couche au-dessus — les textes, les variantes, la validation de conformité, l'analyse de ce qui a performé — et deux des modèles de cette série, dont Qwen3.8 Max, peuvent se voir confier le clip finalisé pour examen.

A screenshot of Creatify's own launch post for Boreal, dated September 15 2026 and headed "Introducing Boreal: frontier-quality AI video at a cent a second", showing the Boreal by Creatify Labs logo card and the opening paragraph stating that Boreal generates text-to-video and image-to-video at one cent per second, about $0.05 for a five-second clip, and renders in realtime.

Comment lire l’une ou l’autre carte

Qwen3.8 Max est le meilleur achat si votre travail relève du code, des agents ou du raisonnement structuré, à un prix inférieur à celui de son propre prédécesseur ; et les deux régressions indépendantes justifient de le tester sur votre trafic de retrieval et de summarisation avant d'y router votre production. Le chiffre de 40 % d'hallucinations n'est pas une raison d'éviter le modèle ; c'est une raison de savoir lesquelles de vos charges de travail peuvent le tolérer.

Boreal est le seul des deux à produire l’artefact sur lequel cette comparaison est censée porter, et c’est l’option crédible la moins chère sur les tarifs publiés pour la vidéo publicitaire au format court. Sa contrainte est propre au format et annoncée par son propre fournisseur : 60 % de préférence sur les clips de personne seule en train de parler. Testez ce format avant les publicités de produit, car c’est là que la marge de progression est la plus faible.

Deux choses feraient bouger les choses. Si Alibaba publie les poids ouverts qu’il a annoncés pour Qwen3.8 Max, le prix et la pérennité du modèle changeront tous les deux, et la licence sous laquelle il sera proposé comptera plus que la date. Et pour Boreal, la première évaluation indépendante — quelle qu’elle soit, par qui que ce soit — remplacerait un test fournisseur de 40 cas qui, à l’heure actuelle, porte toute la charge de preuve pour un modèle commercialisé dans un format où les marques sont exceptionnellement sensibles à l’apparence de leur produit.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing Qwen3.8 Max by Qwen dated 2026-08-03 marked Featured, a 1M-token context, text + image + video input with text output, a p50 time to first token of 10.00 seconds, input $2.00 and output $6.00 per 1M tokens, and 183.0M tokens of traffic in the last 7 days.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement