
LongCat-2.5-Preview vs Grok 4.6 : l'un a une fiche de benchmark, l'autre a un successeur
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 610 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 189 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Comparer LongCat-2.5-Preview à Grok 4.6 est délicat pour une raison qui n'a rien à voir avec la qualité de l'un ou l'autre modèle : la question a une date de péremption. Grok 4.6 est sorti le 12 août 2026 et Grok 4.7 est sorti le 21 septembre 2026 — six jours avant la rédaction de ces lignes — aux mêmes tarifs de 2,00 $ / 6,00 $ par million de tokens et avec la même fenêtre de contexte de 500 000 tokens. LongCat-2.5-Preview, quant à lui, est arrivé sur la LongCat API Platform de Meituan le 25 septembre 2026, sans aucun successeur annoncé à l'horizon et sans le moindre benchmark publié. Le vrai choix n'est donc pas « quel modèle est le meilleur ». Il est de savoir si vous voulez une capacité mesurée, avec un successeur mesuré déjà prêt derrière elle, ou une capacité non mesurée qui est au moins la chose actuelle.
Cette formulation est moins palpitante qu’un tableau d’affichage, et nettement plus utile.
Commencez par ce que Grok 4.6 a réellement dans ses dossiers.
Grok 4.6 est un modèle bien documenté. Dans notre catalogue, il dispose d'une fenêtre de contexte de 500 000 tokens, d'une entrée texte, image et fichier, et d'une grille tarifaire de 2,00 $ par million de tokens d'entrée, 6,00 $ par million de tokens de sortie et 0,50 $ par million de tokens d'entrée mis en cache, passant à 4,00 $ et 12,00 $ au-delà de 200 000 tokens d'entrée. Son profil indépendant d'Artificial Analysis comprend un Coding Index de 76,8 — cinquième parmi les modèles suivis par cet indice — un Intelligence Index de 44,3 au dix-huitième rang, GPQA Diamond à 94,9 %, Humanity's Last Exam à 42,9 %, SciCode à 56,5 %, Terminal-Bench v2.1 à 88,4 et τ²-Bench pour la banque à 50,7. Son Long-Context Recall est de 80,3.

LongCat-2.5-Preview n'a rien de tout cela. L'entrée du journal des modifications de Meituan pour le 25 septembre 2026 est un avis de disponibilité daté qui énumère trois capacités revendiquées — compréhension d'images, codage et compatibilité avec « Claude Code et d'autres environnements de développement courants », notamment Hermes, OpenClaw, OpenCode et Kilo Code — et rien qui ressemble à un résultat. La page de tarification du fournisseur indique 0,30 $ par million de jetons d'entrée non mis en cache, 0,006 $ par million de jetons d'entrée mis en cache et 1,20 $ par million de jetons de sortie, avec la mention explicite qu'il s'agit d'une remise à durée limitée. La fenêtre de contexte est de 1 000 000 de jetons ; la sortie maximale est de 131 072. Le nombre de paramètres d'environ 1,6 billion au total / 48 milliards actifs provient des métadonnées du site de Meituan et de la couverture médiatique spécialisée chinoise plutôt que de la documentation. Il n'existe aucun dépôt pour ce modèle sur HuggingFace ni dans l'organisation GitHub de Meituan, et les métadonnées de catalogue qu'OpenCode fournit indiquent que les poids ouverts sont faux.
La dimension qu’un tableau d’affichage manquerait totalement
Ces deux modèles diffèrent sur un point qu'aucun benchmark ne mesure, et pour beaucoup d'équipes, cela tranche la question à lui seul : ce qu'il advient des prompts que vous envoyez.
La propre documentation d'OpenCode indique que LongCat 2.5 Preview Free est servi par un fournisseur qui applique une politique de rétention zéro et n'utilise pas vos données pour l'entraînement ; le tableau de confidentialité de Zen met des chiffres sur ces affirmations — entraînement du modèle « Non utilisé », conservation des données « 0 jour ». Le même tableau de confidentialité indique trente jours de conservation pour Grok 4.6 et Grok 4.7. Ces deux affirmations sont celles d'OpenCode, publiées sur les pages d'OpenCode, et elles décrivent spécifiquement l'entrée gratuite et l'entrée comparative. Mais si vous pointez un agent vers un dépôt privé, c'est la différence entre une conversation que vous n'avez pas à avoir avec le service juridique et une que vous devez avoir — et cela n'a rien à voir avec le modèle qui obtient le meilleur score sur SciCode.

Ce que « mesuré » vous apporte et ne vous apporte pas
Les chiffres de Grok 4.6 sont meilleurs que ceux de LongCat-2.5-Preview dans le seul sens qui compte ici : ils existent. Cela ne signifie pas pour autant que Grok 4.6 est le meilleur modèle. Son indice de codage de 76,8 est inférieur à celui de la génération Grok 4.7, et le modèle auquel il a été comparé n'est plus à la frontière de sa propre famille. Son successeur publié a un indice d'intelligence de 46,4 contre 44,3 pour Grok 4.6, et un rappel en contexte long de 76,67 contre 80,33 pour Grok 4.6 — donc le successeur n'est pas meilleur sur tous les axes, ce qui est exactement le genre de détail qu'un numéro de génération masque.
Il y a aussi une mise en garde liée au serving en conditions réelles qu'il vaut la peine d'énoncer sans détour, car elle va à l'encontre de l'interprétation flatteuse pour les deux modèles. Sur notre propre échantillon playground de sept jours, Grok 4.6 n'a enregistré aucun débit mesuré et aucun trafic de tokens, ce qui correspond à ce qu'une absence de données donne dans cette colonne, plutôt qu'à un verdict de performance. LongCat-2.5-Preview n'a aucun échantillon de serving provenant de chez nous, tout simplement parce que nous ne le routons pas. Ainsi, toute comparaison de latence entre ces deux modèles est unilatérale d'une manière que la prose masque habituellement : on ne peut pas évaluer un modèle auquel on n'envoie pas de trafic.
Là où la couche de routage est réellement utile ici
Trois des faits ci-dessus sont de ceux pour lesquels un routeur est conçu, plutôt que simplement compatible. La grille tarifaire de Grok 4.6 passe à un palier supérieur au-delà de 200 000 jetons d'entrée, de sorte qu'une même tâche logique peut être facturée à deux tarifs différents selon un nombre que votre application connaît déjà avant d'envoyer quoi que ce soit. Grok 4.6 a un successeur publié à des tarifs identiques, ce qui signifie que le passage de l'un à l'autre devrait être une modification d'une seule ligne, et jamais une réintégration. Et la propriété la plus attrayante de LongCat-2.5-Preview — son prix — est explicitement qualifiée de temporaire par le fournisseur.
Sur OrcaRouter nous servons Grok 4.6 au tarif catalogue de xAI avec zéro marge, de sorte qu'un changement de tarif d'un fournisseur se répercute sur votre facture le jour même plutôt qu'au prochain renouvellement, et le basculement automatique déplace une requête dégradée vers un fournisseur sain sans que votre code sache lequel a répondu. Un DSL de routage couvre directement le cas de la tarification par paliers, et la fusion de modèles couvre le cas où le modèle que vous voulez pour la lecture longue n'est pas celui que vous voulez pour la synthèse finale. LongCat-2.5-Preview ne fait pas partie de nos routes — nous ne le servons pas, et rien ici n'affirme le contraire. Le but de le nommer n'est pas de vous rediriger ailleurs ; c'est qu'un modèle que vous évaluez plutôt que vous exécutez a sa place derrière la même clé que les modèles que vous exécutez, afin que son évaluation coûte une entrée de configuration au lieu d'un projet.

Comment décider
• Choisissez Grok 4.6 si vous avez besoin d'une réponse que vous pouvez défendre. Il dispose d'une fiche indépendante, d'un profil d'entrée documenté et d'un prix qui n'expire pas. Son principal risque n'est pas la qualité, mais la pertinence : Grok 4.7 existe aux mêmes tarifs, et le coût de rester sur 4.6 par inertie correspond à la différence entre un indice d'intelligence de 44,3 et de 46,4 que vous n'auriez pas eu à payer.
• Choisissez LongCat-2.5-Preview si le facteur décisif est la rétention ou la portée. Un accès sans rétention via OpenCode, une fenêtre d’un million de tokens, un plafond de sortie de 131 072 tokens et une grille tarifaire d’environ un septième de celle de Grok 4.6 sont de réels avantages — le premier vérifié par la politique de confidentialité d’un tiers, les autres affirmés par le fournisseur seul.
• Ne choisissez pas entre eux sur la foi d'un tableau de benchmarks, car un seul existe. Le score de codage de 76,8 et le rappel de contexte long de 80,3 de Grok 4.6 décrivent Grok 4.6. Rien ne décrit encore LongCat-2.5-Preview. Quiconque publie cette semaine un score de LongCat-2.5-Preview à côté d'un score de Grok 4.6 cite soit un autre modèle LongCat, soit invente le chiffre.
• Vérifiez le côté entrée avant de vous appuyer dessus. Le changelog de Meituan met en avant la compréhension d'images, mais la réponse d'exemple dans sa propre documentation « Retrieve Model » indique encore input_modalities comme ["text"] avec une chaîne de modalité text->text — une affirmation du fournisseur face à un contrat publié qui dit le contraire. Grok 4.6 accepte du texte, des images et des fichiers sans une telle ambiguïté. Et vérifiez que votre harnais expose un champ entrelacé reasoning_content avant de tirer la moindre conclusion sur la qualité de raisonnement de LongCat-2.5-Preview ; un client qui laisse tomber ce champ échouera silencieusement.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
