Bezpieczna inferencja bez marży — w modelu pay-as-you-go lub w subskrypcji. Albo użyj własnych kluczy. Routing adaptacyjny obniża Twój rachunek.
Bez karty kredytowej · działa w 60 sekund
from openai import OpenAIclient = OpenAI(base_url="https://api.orcarouter.ai/v1",api_key=ORCAROUTER_API_KEY,)resp = client.chat.completions.create(model="orcarouter/auto", # we grade + routemessages=[{"role": "user", "content": "..."}],)
Jedna linia. Oceniamy każdy prompt, kierujemy go do modelu frontier lub OSS i doliczamy $0.
Każdy prompt jest oceniany i trafia do modelu, który odpowie na niego najlepiej.
Przeglądaj modelePełne logi, wydatki na żywo i paragon do każdego promptu. Żadnych czarnych skrzynek.
Zobacz paragonWersjonuj prompty i korzystaj ponownie z zapytań z cache — bez zmian w kodzie.
Wersjonuj promptUstaw base_url na api.orcarouter.ai/v1 i podmień klucz API. Żadnych innych zmian w kodzie.
Ocena poniżej 1 ms, z wbudowanym failoverem, cache i pełnymi logami.
Bezpośrednio do każdego dostawcy po jego cenniku — doliczamy $0 za token.
Ceny na żywo, obok siebie — dokładnie tyle, ile zapłaciłbyś dostawcy bezpośrednio.
| Model | Przekierowane do | Wejście /M | Wyjście /M | Kontekst | Jakość |
|---|---|---|---|---|---|
| z-ai/glm-5.3NOWY | Zhipu AI | $1.26 | $3.96 | 1M | 9.0 |
| qwen/qwen3.8-27bNOWY | Alibaba Cloud | $0.330 | $2.40 | 262K | 4.0 |
| qwen/qwen3.8-27b-freeNOWY | Alibaba Cloud | — | — | 66K | 4.0 |
| deepseek/deepseek-v4-pro-0813NOWY | DeepSeek | $0.442 | $0.884 | 1M | 7.0 |
| grok/grok-4.6NOWY | — | $2.00 | $6.00 | 500K | 9.0 |
| meta/muse-spark-1.2NOWY | — | $1.25 | $4.25 | 1M | 8.0 |
| qwen/qwen3.8-maxNOWY | Alibaba Cloud | $2.00 | $6.00 | 1M | 9.0 |
| deepseek/deepseek-v4-flash-0731NOWY | DeepSeek | $0.147 | $0.295 | 1M | 6.0 |
| + Kolejne 194 modele · ceny aktualizowane co 60 sekund | |||||
Doładowania i subskrypcje po cenie dostawcy. Nie doliczamy nic.
Doładuj, kiedy chcesz. Cena dostawcy, rozliczenie każdego wywołania.
Zasila Twój portfel w każdym okresie. Pełna kwota, dowolny model, z bonusowymi środkami w większych planach.
Korzystaj z własnych kluczy dostawcy, limitów zapytań i kredytów.
Plany poniżej to funkcje zespołowe, nie cena tokena.
Zarabiamy na opcjonalnych funkcjach zespołowych.
Router AI stoi między Twoją aplikacją a wieloma modelami i wybiera najlepszy model dla każdego żądania. OrcaRouter ocenia każdy prompt w czasie poniżej 1 ms i kieruje go — frontier do trudnego rozumowania, open source do rutyny — po ponad 200 modelach bez marży za tokeny.
Router LLM klasyfikuje każdy prompt i dopasowuje go do modelu, który najprawdopodobniej odpowie dobrze przy najniższym koszcie. OrcaRouter kieruje na podstawie osadzeń kontekstowych z uczeniem online na żywym ruchu — 75,5% trafności w publicznym rankingu RouterArena.
Tak. OrcaRouter to produkcyjna bramka AI: jeden endpoint zgodny z OpenAI z routingiem adaptacyjnym, równoważeniem obciążenia, automatycznym failoverem, barierami ochronnymi, zaporą agentów, cache promptów i obserwowalnością per żądanie.
Tak jak CDN serwuje treści z najlepszego węzła brzegowego, AI CDN serwuje inferencję od najlepszego dostawcy: zdrowa, szybka i tania moc, cache powtarzających się promptów, failover przy awariach. OrcaRouter pełni tę rolę dla ponad 200 modeli.
Routing adaptacyjny uczy się kompromisu jakość/koszt z Twojego własnego ruchu. Ustaw każdy workspace na „najtańsze, co przechodzi poprzeczkę", najwyższą jakość albo balans — lub pozwól orcarouter/auto dostrajać wybór przy każdym żądaniu.
Rozwiązują różne problemy — nadzór vs wybór modelu — ale nie potrzebujesz dwóch systemów: OrcaRouter kieruje per żądanie i egzekwuje budżety, bariery i obserwowalność w tym samym skoku.
Ocena promptu trwa poniżej 1 ms, a łączne dodatkowe opóźnienie pozostaje poniżej 50 ms — zwykle odzyskiwane wielokrotnie dzięki szybszym dostawcom i cache tokenów promptu.
Nie. Płacisz opublikowaną stawkę każdego dostawcy; OrcaRouter dodaje 0 $ za token, a zarabia na opcjonalnych planach Team i Enterprise.
Tak — przełącz base_url na https://api.orcarouter.ai/v1, a Twój kod SDK OpenAI, Anthropic czy Google dalej działa: Chat Completions, Responses, Embeddings, Images, Audio i streaming.
OrcaRouter ponawia żądanie na zdrowej rezerwowej mocy tego samego lub równoważnego modelu, zanim zacznie się odpowiedź — awarie upstream nie docierają do Twoich użytkowników.
Podmień jedną linię. To cała migracja.
Wyprzedza GPT-5 i Azure na RouterArenaPoparte opublikowanymi badaniami
OrcaRouterProwadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.
providers@orcarouter.ai