La qualité multi-modèles à petit prix.
N'attendez plus le prochain modèle — le prochain bond de capacité vient d'un panel, pas d'un point de contrôle. Fusion envoie vos requêtes les plus difficiles à plusieurs modèles de pointe à la fois, puis un juge pèse leurs accords, repère leurs contradictions et renvoie la réponse la plus solide — vérifiée par recoupement avec les autres. Utilisez-le pour le travail qui compte vraiment — raisonnement approfondi, code difficile, recherche, critique d'expert — partout où se tromper coûte plus que quelques générations supplémentaires.
Une conversation informelle va directement vers un modèle par défaut moins coûteux. Les requêtes de code, d'agent et utilisant des outils se déploient vers le panel — là où un deuxième avis paie vraiment.
Votre prompt atteint plusieurs modèles de pointe à la fois — des tentatives indépendantes qui rattrapent chacune ce que les autres manquent.
Un juge lit chaque candidat et renvoie le plus solide d'entre eux — vérifié par recoupement avec les autres, pas le premier jet d'un seul modèle.
Uniquement là où c'est utile. Fusion sollicite le panel pour les prompts de code, agentiques, utilisant des outils ou complexes — les conversations légères sont dirigées directement vers un modèle par défaut moins coûteux, vous ne payez le panel que pour les requêtes où un second avis vaut vraiment la peine.
Un seul modèle vous donne une unique tentative sur votre prompt — sans aucun moyen de détecter une erreur. Fusion exécute plusieurs modèles de pointe sur le même prompt simultanément, puis un juge indépendant lit chaque réponse et retourne la plus solide, vérifiée par recoupement avec les autres. Le désaccord entre des modèles performants est un signal : il fait remonter les cas difficiles où un seul modèle se serait silencieusement trompé.
Un modèle, une réponse. Aucun second avis — si c'est faux, vous livrez quelque chose de faux.
Choisit un modèle par prompt pour réduire les coûts. Sélection plus intelligente — mais toujours une seule réponse.
Un panel répond en parallèle ; un juge retourne la réponse la plus solide, vérifiée par recoupement avec les autres.
| Modèle | Rôle | Contexte |
|---|---|---|
| Gemini 3.5 Flash | Panel | 1M |
| MiniMax M2.7 | Panel | 204K |
| GLM 5.1 | Panel | 200K |
| Claude Opus 4.8 | Juge | 1M |
Vous voulez une autre combinaison ? Créez votre propre panel dans l'éditeur Routing DSL.
Fusion n'est pas un cas particulier — c'est une configuration intégrée de notre DSL de routage, un petit langage isolé permettant de définir précisément comment chaque requête est acheminée. Clonez le modèle «Fable 5 Level» et modifiez le panel, le juge, la règle de déclenchement ou le mode de sélection du gagnant.
Un modèle juge classe chaque candidat et retourne le plus solide tel quel — jamais une fusion diluée.
Le panel vote sur une réponse structurée — sans appel supplémentaire au juge.
Un modèle agrégateur fusionne les candidats en une réponse améliorée (Mixture-of-Agents).
Pour le code : le candidat dont le correctif passe effectivement votre suite de tests l'emporte.
Une course — le tronçon le plus rapide l'emporte, pour les cas où la vitesse prime.
Aucune boîte noire. Construisez votre propre routeur avec le DSL et chaque diffusion parallèle est enregistrée — quels modèles ont concouru, la latence et le statut de chaque segment, et quelle réponse le juge a retenue — afin de voir dans la console exactement pourquoi une réponse a été sélectionnée.
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="orcarouter/fusion-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)Parce que fusion exécute chaque membre du panel plus un juge, une requête déployée est facturée comme la somme de ces complétions sous-jacentes plutôt que comme un seul modèle — et uniquement sur les requêtes qui se déploient réellement. Zéro majoration.