Privé par l’architecture · Protégé à chaque appel

Une passerelle. Tous les modèles. Vos données restent les vôtres.

Une inférence privée sur 200+ modèles, protégée à chaque appel. Zéro marge sur le paiement à l’usage et les abonnements. Ou apportez vos propres clés.

Sans carte bancaire · en ligne en 60 secondes · aucun prompt journalisé sans votre accord

200+
modèles, un seul endpoint
0%
de marge sur les tokens, jamais
0 B
prompt conservé par défaut
la journalisation reste désactivée tant que vous ne l’activez pas
40+%
d’économies sur le coût d’inférence
grâce au routage adaptatif sensible au cache
99%
de précision de routage
avec escalade vers les modèles de pointe
<10ms
de latence de routage, avec bascule automatique
Toutes les intégrations
from openai import OpenAI
 
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=ORCAROUTER_API_KEY,
)
resp = client.chat.completions.create(
model="orcarouter/auto", # we grade + route
messages=[{"role": "user", "content": "..."}],
)

Une ligne. On note chaque prompt, on route vers un modèle de pointe ou OSS, et on ajoute 0 $.

Confidentialité et sécurité

Privé par l’architecture. Protégé à chaque appel.

Ce que vous demandez à une IA vous appartient. Ce que font vos agents, c’est à vous de l’approuver.

Vos données

Ce que le modèle et nos serveurs peuvent voir.

  • Data Cloaking

    Masqué.

    Les noms, e-mails et numéros de carte sont remplacés par des substituts avant d’atteindre le modèle que vous appelez, puis restitués dans la réponse.

    En un clic
  • ZDR

    Rien n’est conservé.

    Les prompts ne sont pas journalisés tant que vous n’activez pas la journalisation. Signez un accord de rétention zéro pour la verrouiller.

    Par défaut
  • PQC

    Résistant aux ordinateurs quantiques.

    Les journaux que vous choisissez de conserver sont scellés avec un ML-KEM hybride. La cryptographie est open source : SCUTTLE.

    Par défaut
  • Data Residency

    Votre région.

    Déclarez États-Unis, UE, Royaume-Uni, Asie-Pacifique ou Chine, et vos rapports de conformité portent cette région.

    Sur demande
  • TEE

    Protégé même à l’exécution.

    Des enclaves attestées, avec une preuve pour chaque réponse.

    Sur demande

Vos agents

Ce qui passe, et ce qui s’exécute.

  • Guardrails

    Bloqué avant d’être facturé.

    PII, secrets, jailbreaks et injections de prompt sont arrêtés avant que le modèle ne les voie. Les règles par motifs sont gratuites ; une règle jugée par IA ne facture que sa propre vérification.

    En un clic
  • Agent Firewall

    Chaque appel d’outil, évalué.

    Chaque appel d’outil ou MCP est autorisé, soumis à une personne pour validation, ou bloqué avant de s’exécuter.

    Surveillance par défaut
  • Compliance Packs

    Aligné sur 32 référentiels.

    Une politique par réglementation. Observez-la d’abord sur du trafic réel, puis activez le blocage.

    Offres payantes

Et aussi :File d’approbation humaineMenaces classées selon l’OWASP LLM Top 10 et MITRE ATLASL’archive publique des incidents d’agents

La passerelle

Routez mieux. Dépensez moins.

Router

Chaque prompt est évalué, puis confié au modèle qui y répond le mieux.

Parcourir les modèles

Observer

Des journaux quand vous le voulez, la dépense en direct et un reçu par prompt.

Voir un reçu

Gérer

Versionnez vos prompts et réutilisez les appels en cache sans toucher au code.

Versionner un prompt
Modèles

Tous les modèles. Une seule grille tarifaire.

Les plus récents de 200+ modèles, en direct, au prix du fournisseur lui-même.

Voir les 200+ →
ModèleRouté versEntrée /MSortie /MContexteRoute privée
openai/gpt-6.1-solTexteNOUVEAUOpenAI Direct$2.00$10.001MPas de route privée
anthropic/claude-sonnet-5.5TexteNOUVEAUAnthropic Direct$2.00$10.001MPas de route privée
typesafe/jev-1.13TexteNOUVEAU—$0.042$0.04266KPas de route privée
openai/gpt-6-lunaTexteNOUVEAUOpenAI Direct$0.100$0.5001MPas de route privée
openai/gpt-6-solTexteNOUVEAUOpenAI Direct$2.00$10.001MPas de route privée
anthropic/claude-opus-5.5TexteNOUVEAUAnthropic Direct$4.00$20.001MPas de route privée
grok/grok-4.7TexteNOUVEAU—$2.00$6.00500KPas de route privée
orca/orcaverify-text1.0TexteNOUVEAU—$2.00$2.00—Pas de route privée
+ 194 modèles supplémentaires · prix mis à jour toutes les 60 s
Installation

En ligne en 60 secondes.

Étape 1

Pointez votre SDK vers nous

Pointez base_url sur api.orcarouter.ai/v1 et remplacez votre clé API. Aucun autre changement de code.

→
Étape 2

Nous routons, protégeons et observons

Évalué en moins d'1 ms, avec bascule, cache et journaux complets intégrés.

→
Étape 3

Vous livrez, sur un seul endpoint

En direct chez chaque fournisseur, à son tarif public — nous ajoutons 0 $ par token.

Tarifs

Nous ne prenons jamais de marge sur les tokens que vous achetez.

Nos revenus viennent des fonctionnalités d'équipe optionnelles.

Hacker

Gratuit
À vie. Aucune majoration sur tous les tokens.
Router — 200+ modèles, bascule auto
Observer — tableau de bord de base
Gérer — versionnage des prompts
10 clés API · 0% de marge sur les tokens
Commencer gratuitement

Entreprise

Sur mesure
Engagements SLA et capacité dédiée.
Tout du forfait Team
Sièges d’équipe illimités
Accès prioritaire aux nouveaux modèles
Toutes les fonctionnalités masquées et bêta
Infrastructure dédiée
SLA de disponibilité 99.99%
Support dédié & tarif sur mesure
Confiance & conformité
Ne nous croyez pas sur parole. Les rapports d’audit sont disponibles sous NDA, et notre cryptographie post-quantique est open source.
Payer les tokens

Trois façons de payer vos tokens.

Recharges et abonnements au prix du fournisseur. Nous ajoutons 0 $.

Les forfaits ci-dessus concernent les fonctionnalités d’équipe. Ils ne changent pas le prix des tokens.

Depuis le blog

Tout frais de la salle des machines.

Ce que nous construisons et pourquoi — nos derniers articles.

Tous les articles →
FAQ

Confidentialité, sécurité et routage : nos réponses.

Stockez-vous mes prompts ou entraînez-vous des modèles avec ?

Nous n’entraînons jamais de modèles sur vos prompts. Le contenu des prompts et des réponses n’est journalisé que si la journalisation est active pour votre espace de travail ; nous conservons les métadonnées (heure, modèle, tokens, coût, IP) pour la facturation et la sécurité. Un accord de rétention zéro verrouille cette journalisation.

Où mes données sont-elles traitées ?

Par le fournisseur qui sert le modèle choisi, dans ses propres régions. Le paramètre de région de votre espace de travail (États-Unis, UE, Royaume-Uni, Asie-Pacifique ou Chine) marque vos rapports de conformité avec cette région ; il ne fixe pas encore le lieu de stockage de vos données ni celui de l’inférence.

Que signifie « résistant au quantique » ici ?

Les journaux de requêtes que vous choisissez de conserver peuvent être scellés par un chiffrement post-quantique hybride (ML-KEM-768 + X25519) : une copie dérobée aujourd’hui ne pourra pas être ouverte par un futur ordinateur quantique. Le code est open source : SCUTTLE. C’est activé par défaut sur notre service hébergé.

Qu'est-ce qu'un routeur IA ?

Un routeur IA se place entre votre application et de nombreux modèles et choisit le meilleur modèle pour chaque requête. OrcaRouter évalue chaque prompt en moins de 1 ms et le route — frontier pour le raisonnement difficile, open source pour le courant — sur plus de 200 modèles, sans majoration de tokens.

Qu'est-ce qu'un routeur LLM et comment fonctionne-t-il ?

Un routeur LLM classifie chaque prompt et le dirige vers le modèle le plus susceptible de bien répondre au moindre coût. OrcaRouter route via des embeddings contextuels avec apprentissage en ligne sur le trafic réel — 75,5 % de précision au classement public RouterArena.

OrcaRouter est-il une passerelle IA (AI gateway) ?

Oui. OrcaRouter est une passerelle IA de production : un point d'accès compatible OpenAI avec routage adaptatif, répartition de charge, bascule automatique, garde-fous, pare-feu d'agents, cache de prompts et observabilité par requête.

Qu'est-ce qu'un AI CDN ?

Comme un CDN sert le contenu depuis la meilleure périphérie, un AI CDN sert l'inférence depuis le meilleur fournisseur : capacité saine, rapide et bon marché, prompts répétés mis en cache, bascule en cas de panne. OrcaRouter joue ce rôle sur plus de 200 modèles.

Qu'est-ce que le routage adaptatif ?

Le routage adaptatif apprend l'arbitrage qualité/coût à partir de votre propre trafic. Orientez chaque espace de travail vers « le moins cher qui passe la barre », la meilleure qualité ou l'équilibre — ou laissez orcarouter/auto affiner le choix requête par requête.

Faut-il à la fois une passerelle IA et un routeur LLM ?

Ils résolvent des problèmes différents — gouvernance vs choix du modèle — mais inutile d'avoir deux systèmes : OrcaRouter route requête par requête et applique budgets, garde-fous et observabilité sur le même saut.

Le routage ajoute-t-il de la latence ?

L'évaluation du prompt prend moins de 1 ms et la latence ajoutée totale reste sous 50 ms — largement récupérée par des fournisseurs plus rapides et les tokens de prompt en cache.

OrcaRouter majore-t-il le prix des tokens ?

Non. Vous payez le tarif publié de chaque fournisseur ; OrcaRouter ajoute 0 $ par token et se rémunère via les offres optionnelles Team et Enterprise.

Puis-je garder mon code OpenAI SDK existant ?

Oui — basculez base_url vers https://api.orcarouter.ai/v1 et votre code SDK OpenAI, Anthropic ou Google continue de fonctionner : Chat Completions, Responses, Embeddings, Images, Audio et streaming.

Que se passe-t-il quand un fournisseur tombe ?

OrcaRouter réessaie sur une capacité de secours saine pour le même modèle ou un équivalent avant le début de la réponse : les pannes amont n'atteignent jamais vos utilisateurs.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube