DeepSeek-V4.1-Flash ist das kleinste Modell der neuen Architekturfamilie von DeepSeek, veröffentlicht am 10. September 2026, mit nativem multimodalen visuellen Verständnis – der Produktionsnachfolger sowohl von V4 Flash als auch vom V4 Flash Vision-Experiment. Die neue Architektur zielt auf eine höhere Leistungsobergrenze, schnellere Inferenz und höheren Durchsatz ab, und DeepSeek berichtet, dass V4.1 Flash V4 Pro in Bezug auf Leistung, Kosten, Geschwindigkeit und Gesamtaufgabenzeit umfassend übertrifft. Es akzeptiert Text und Bilder als Eingabe mit Textausgabe, bietet ein Kontextfenster von 1M Token mit bis zu 384K Ausgabe-Tokens und unterstützt Denkmodus (Standard, mit wählbarem Aufwand niedrig / hoch / maximal) sowie Nicht-Denkmodi über die Chat-Completions-, Responses- und Anthropic-kompatiblen APIs, zusammen mit JSON-Ausgabe, Tool-Aufrufen und Chat-Präfix-Vervollständigung; FIM funktioniert nur im Nicht-Denkmodus. Die Modellgewichte sind auf Hugging Face offen verfügbar (deepseek-ai/DeepSeek-V4.1-Flash). Offizielle Benchmarks bei der Veröffentlichung: 90,6 auf Terminal-Bench 2.1, 74,2 auf DeepSWE v1.1, 65,4 auf NL2Repo-Bench, 90,9 auf GPQA Diamond, 63,9 auf HLE mit Tools, und starke Ergebnisse für native Vision-Agenten (89,6 BabyVision, 78,9 Chartography mit Tools). Die Preise wurden im Zuge der Veröffentlichung gesenkt: 0,15 $/M Input (Cache-Miss), 0,60 $/M Output und 0,003 $/M bei Cache-Hits zu Off-Peak-Preisen, mit Verdopplung während der Spitzenzeiten an Wochentagen (01:00-04:00 und 06:00-10:00 UTC); alle anderen Stunden einschließlich Wochenenden sind Off-Peak.
DeepSeek V4.1 Flash ist ein DeepSeek-Modell, das über OrcaRouter, das OpenAI-kompatible API-Gateway, verfügbar ist. Es akzeptiert Text- und Bildeingaben, verfügt über ein Kontextfenster von 1.048.576…
DeepSeek V4.1 Flash akzeptiert Text und Bilder als Eingabe und gibt Text zurück. In der Praxis deckt das drei allgemeine Muster ab. Das erste ist Dokumentenverständnis: das Einfügen von Screenshots von Tabellen, gescannten Seiten oder Diagrammen zusammen mit schriftlichen Anweisungen. Das zweite ist visuelle Verankerung, wobei ein Screenshot einer Schnittstelle, eines Diagramms oder eines Fehlerzustands im Kontext einer längeren Konversation oder Spezifikation analysiert wird. Das dritte ist gemischtmodales Schlussfolgern, wobei ein langer Textkorpus mit einigen Bildern kombiniert wird, die die Frage verankern. Die Ausgabe ist nur Text, daher beschreibt, extrahiert oder erklärt das Modell, was es sieht, anstatt Bilder zu generieren. Bild-Token zählen als Eingabe und werden mit 0,15 $ pro 1 Mio. Eingabe-Token abgerechnet, demselben Satz wie für Texteingabe auf OrcaRouter. Für Workloads, bei denen Text allein ausreicht, kann ein reines Textmodell günstiger sein, aber V4.1 Flash vermeidet den Betrieb einer separaten Vision-Pipeline für leichte visuelle Aufgaben.
Zu den stärksten Einsatzfeldern gehören Langkontext-Analysen mit einer langen Antwort, Codeverständnis über große Repositories hinweg, multimodale Dokumentenprüfung und agentische Schleifen, die sehr viel Zustand mitführen müssen. Da die maximale Ausgabe 384.000 Token erreicht, kann das Modell vollständige Berichte, Migrationshinweise oder ausgedehnten Code statt kurzer Zusammenfassungen zurückgeben. Weitere sinnvolle Einsatzmöglichkeiten sind Pipelines zur Umwandlung von Transkripten in strukturierte Notizen, Vertragsvergleiche und Support-Workflows, bei denen der vollständige Verlauf im Kontext erhalten bleibt. Das Ergebnis von 90,9 bei GPQA Diamond deutet auf Stärke bei wissenschaftlichen Fragen auf Graduiertenniveau hin, was eher auf technische und forschungsorientierte Fragebeantwortung als allein auf Prosa hindeutet. Weniger offensichtlich geeignet ist es für hochfrequenten Traffic mit winzigen Anfragen, da ein kurzer Klassifizierungsaufruf kein Fenster mit einer Million Token benötigt, sowie für Aufgaben, die Bildgenerierung erfordern, da die Ausgabe nur Text ist.
Viele Modelle begrenzen die Ausgabe auf einige tausend Tokens, was bei allem, was länger ist, ein Zusammensetzen über mehrere Turns erzwingt. Eine Obergrenze von 384.000 Tokens erlaubt es DeepSeek V4.1 Flash, ein vollständiges Artefakt in einem Durchgang auszugeben: eine komplette technische Spezifikation, einen langen Migrationsplan, einen ausführlichen annotierten Diff oder eine vollständige Transkript-Überarbeitung. Eine Generierung in einem Durchgang bewahrt die interne Konsistenz meist besser, als eine Antwort aus vielen kurzen Aufrufen zusammenzusetzen, weil das Modell zwischen den Turns nie den Faden verliert. Der Kompromiss sind die Kosten. Die Ausgabe wird auf OrcaRouter mit $0.60 pro 1M Ausgabe-Tokens abgerechnet, dem Vierfachen des Eingabe-Tarifs, weshalb eine sehr lange Generierung der teure Teil einer Anfrage ist. Nutze die Obergrenze dort, wo eine kohärente lange Antwort echten Mehrwert bietet, setze max_tokens passend zur Aufgabe und vermeide es, das Modell abschweifen zu lassen, wenn eine Antwort aus zwei Absätzen genügen würde.
Ein großer Kontext und eine hohe Ausgabegrenze sind Fähigkeiten, für die Sie bezahlen. Wenn eine Aufgabe nur einen kurzen Prompt und eine kurze Antwort benötigt – etwa Intent-Klassifikation, Entity-Extraktion, Routing oder einfaches Umschreiben –, bringt das zusätzliche Fenster nichts, und ein kleineres Modell an anderer Stelle auf OrcaRouter kostet pro Aufruf in der Regel weniger. Dasselbe gilt für Batch-Jobs mit hohem Volumen, bei denen die Eingaben bereits konstruktionsbedingt in Chunks aufgeteilt sind. Wählen Sie DeepSeek V4.1 Flash, wenn die Aufgabe das Fenster wirklich benötigt: ganze Dokumente, langer Code-Kontext, die Prüfung mehrerer Bilder oder eine lange Antwort in einem einzigen Durchgang. Eine nützliche Regel ist, zuerst die Prompt-Größe und die erwartete Ausgabe zu schätzen. Wenn beide moderat sind, vergleichen Sie die gesamten Token-Kosten mit einer kleineren Option. Wenn der Prompt Hunderttausende von Tokens erreicht, ist die Alternative normalerweise eine Retrieval-Pipeline, die eigene Engineering-Kosten und Informationsverluste mit sich bringt.
GPQA Diamond ist eine Sammlung von Wissenschaftsfragen auf Graduierten-Niveau, die so formuliert sind, dass sie sich nicht einfach nachschlagen lassen; die Ergebnisse spiegeln daher eher das Reasoning über schwieriges technisches Material wider als die Erinnerung an gängige Fakten. DeepSeek V4.1 Flash erzielt in diesem Benchmark 90,9. Ein hohes Ergebnis hier zeigt, dass das Modell mehrstufiges wissenschaftliches Reasoning und präzise Fachfragen kompetent bewältigt. Das bedeutet nicht, dass das Modell bei jeder Aufgabe gleich stark ist. GPQA Diamond ist eng gefasst: Es sagt wenig über Long-Context-Retrieval, Tonalität, Instruction-Following bei unordentlichen Prompts oder Codequalität im großen Maßstab aus. Betrachten Sie 90,9 als einen Datenpunkt, der die technische Reasoning-Fähigkeit bestätigt, und validieren Sie diese an Ihrem eigenen Workload. Erstellen Sie ein kleines Evaluationsset aus Ihren realen Eingaben, einschließlich langer Dokumente und Bild-plus-Text-Prompts, und vergleichen Sie die Ausgaben auf diesem Set, bevor Sie eine Produktionsroute auf OrcaRouter festlegen.
Die Latenz bei DeepSeek V4.1 Flash hängt größtenteils davon ab, wie viel Sie es generieren lassen. Die Zeit bis zum ersten Token wird von der Prompt-Größe und der Anbieterlast beeinflusst, während die Gesamtantwortzeit mit der Ausgabelänge wächst. Bei einer Obergrenze von 384.000 Token ist eine Generierung mit maximaler Länge von Natur aus eine lang laufende Anfrage. Für dieses Modell auf OrcaRouter sind keine veröffentlichten Latenzwerte verfügbar, messen Sie also mit Ihren eigenen Prompts, statt eine Zahl anzunehmen. Praktische Schritte: Begrenzen Sie max_tokens für interaktive Pfade, damit Antworten begrenzt bleiben, streamen Sie Token, damit Benutzer Fortschritt sehen, und reservieren Sie sehr lange Generierungen für Hintergrundjobs. Bei hoher Parallelität sollten Sie erwarten, dass Durchsatzgrenzen des Anbieters Ihre effektive Rate bestimmen; reihen Sie entsprechend in eine Warteschlange ein oder wiederholen Sie Anfragen. Vergleichen Sie mit Ihrem aktuellen Modell unter Verwendung derselben Prompts und erfassen Sie die Zeit bis zum ersten Token getrennt von der Gesamtdauer.
Benchmarks sind nützlich, um ein Feld einzugrenzen, nicht für das Ranking von Modellen im Produktivbetrieb. Jeder Test misst eine spezifische, eingeschränkte Fähigkeit unter einem festen Prompt-Format. GPQA Diamond belohnt wissenschaftliches Schlussfolgern auf Graduiertenniveau, während ein Coding-Benchmark ein völlig anderes Verhalten belohnt. Ein starkes Ergebnis in einem Bereich überträgt sich nicht automatisch, und kleine Unterschiede zwischen Modellen liegen oft innerhalb der Schwankung zwischen den Durchläufen. Zwei Vorgehensweisen helfen. Erstens: Prüfen Sie, ob die Aufgabe des Benchmarks der Ihren ähnelt. Ein Wert von 90,9 bei GPQA Diamond ist aussagekräftig für Forschung und technische Fragebeantwortung, weniger für Chat-Ton oder Extraktion. Zweitens: Testen Sie mit Ihren eigenen Daten: Stellen Sie eine repräsentative Stichprobe zusammen, definieren Sie eine Bewertungsregel und messen Sie. Auf OrcaRouter können Sie dieselbe Anfrage über eine einzige OpenAI-kompatible API an verschiedene Modell-IDs weiterleiten und Ausgaben direkt vergleichen, was aussagekräftiger ist als eine Leaderboard-Position allein.
Drei Grenzen sollten Sie einplanen. Erstens: Die Ausgabe besteht nur aus Text: Das Modell nimmt Bildeingaben an, erzeugt aber keine Bilder. Zweitens: Lange Ausgaben kosten mehr, und bei $0.60 pro 1M Ausgabe-Tokens, dem Vierfachen des Eingabetarifs, sind ausführliche Generierungen das größte Kostenrisiko. Drittens: Ein großes Kontextfenster garantiert nicht, dass jedes Detail genutzt wird. Attention über eine Million Tokens hinweg ist eine Fähigkeit, die Sie an Ihren eigenen Dokumenten überprüfen und nicht einfach voraussetzen sollten. Es gibt auch betriebliche Einschränkungen. Sehr große Prompts brauchen länger zur Verarbeitung und verbrauchen das Rate-Budget schneller. Das Modell wird von DeepSeek über OrcaRouter bereitgestellt, daher richtet sich die Verfügbarkeit nach der Infrastruktur des Anbieters und etwaigen von ihm angewendeten Limits. Die multimodale Genauigkeit bei dichten Diagrammen, Handschrift oder Scans mit niedriger Auflösung variiert; validieren Sie an repräsentativen Stichproben, bevor Sie kritische Extraktionsarbeit dorthin leiten.
DeepSeek V4.1 Flash wird mit $0,15 pro 1 Mio. Input-Tokens und $0,60 pro 1 Mio. Output-Tokens abgerechnet. OrcaRouter gibt diese zum Tarif des Anbieters ohne Aufschlag weiter, die angezeigte Zahl ist also der Preis des Anbieters und nicht ein Wiederverkaufspreis. Input umfasst alles, was Sie senden: Text-Tokens, Bild-Tokens und die angesammelte Historie einer Konversation. Output umfasst alles, was das Modell generiert, einschließlich Tool-Call-Argumenten und jeglichem Reasoning-Text, den es ausgibt. Die Abrechnung erfolgt tokenbasiert, daher verwendet eine günstigere Anfrage einfach weniger Tokens. Für das Kontextfenster selbst wird keine separate Gebühr beschrieben: Ein Fenster mit 1.048.576 Tokens ist ein Limit, keine Gebühr. Ein großer Prompt kostet natürlich mehr, weil er mehr Input-Tokens enthält. Verfolgen Sie die Nutzung pro Route, damit Sie Ausgaben den Funktionen zuordnen können, die sie tatsächlich verursachen.
Zwei Multiplikatoren bestimmen deine Ausgaben: wie viele Tokens hineingehen und wie viele herauskommen. Die Ausgabeseite ist die teurere: $0.60 pro 1M Tokens gegenüber $0.15 pro 1M Eingabe-Tokens – ein vierfacher Unterschied. Eine Anfrage, die 200,000 Tokens liest und 500 Tokens schreibt, wird von der Eingabe dominiert. Eine Anfrage, die 2,000 Tokens liest und 20,000 schreibt, wird von der Ausgabe dominiert. Wenn du weißt, welches Muster dein Produkt hat, weißt du, wo optimiert werden muss. Es folgen drei Hebel. Kontext kürzen: Nimm nur die Dokumente und den Verlauf auf, die eine Aufgabe benötigt, obwohl 1,048,576 Tokens verfügbar sind. Ausgabe begrenzen: Setze max_tokens auf den tatsächlichen Bedarf statt auf die Obergrenze. Und bündeln: Weniger, größere Aufrufe vermeiden es, denselben Kontext wiederholt zu senden, was oft die unauffälligste Quelle von Verschwendung in Long-Context-Anwendungen ist.
DeepSeek V4.1 Flash wird von OrcaRouter zum Anbietertarif ohne Aufschlag abgerechnet, sodass etwaige anbieterseitige Rabatte oder Tarife für zwischengespeicherte Eingaben durchgereicht werden, statt absorbiert oder mit einem Aufschlag versehen zu werden. Ob ein reduzierter Tarif für zwischengespeicherte Eingaben für dieses Modell verfügbar ist und unter welchen Bedingungen, legt DeepSeek fest; bestätige dies daher in der aktuellen Dokumentation des Anbieters, bevor du Ersparnisse in ein Budget einplanst. Was du direkt kontrollierst, ist das Prompt-Design. Halte einen stabilen Präfix bei, etwa Systemanweisungen, Schema und abgerufenen Kontext, und hänge variablen Inhalt am Ende an, damit jede vom Anbieter unterstützte Präfix-Wiederverwendung greifen kann. Verwende identischen Kontext über Aufrufe in einem Batch hinweg wieder, statt ihn für jedes Element erneut zu senden. Kürze den Verlauf aggressiv und fasse frühere Turns zusammen, sobald sie nicht mehr benötigt werden. Diese Gewohnheiten reduzieren die Eingabe-Tokens, die bei Long-Context-Workloads üblicherweise den Großteil der Kosten ausmachen.
Richten Sie einen OpenAI-kompatiblen Client auf https://api.orcarouter.ai/v1 aus und setzen Sie das Modell auf deepseek/deepseek-v4.1-flash. Da OrcaRouter die OpenAI-Chat-Completions-Schnittstelle bereitstellt, funktionieren vorhandene SDKs für Python, JavaScript und andere Sprachen mit einer Änderung von Base-URL und Modell-ID plus Ihrem OrcaRouter-API-Schlüssel. Eine minimale Anfrage sendet ein messages-Array mit Ihren System- und User-Turns sowie optionalen Parametern wie max_tokens, temperature und stream. Bildeingaben folgen dem standardmäßigen multimodalen Inhaltsformat, wobei Bildteile neben Textteilen in derselben User-Nachricht stehen. Antworten kommen in der üblichen Form zurück, sodass Parsing-, Streaming- und Tool-Call-Handling-Code unverändert weiterverwendet werden kann. Prüfen Sie die OrcaRouter-Modellseite auf Hinweise zu Parametern je Modell, und protokollieren Sie die Rohantworten für die ersten paar Aufrufe, während Sie Prompt-Größe und Ausgabelimits abstimmen.
Vier Parameter prägen die meisten DeepSeek V4.1 Flash-Anfragen. max_tokens legt die Obergrenze für die Ausgabe fest und ist angesichts eines Maximums von 384.000 Tokens die wichtigste Kostenkontrolle; setzen Sie es auf das, was die Aufgabe erfordert, nicht auf das Maximum. temperature steuert die Variabilität, halten Sie es also niedrig für Extraktion, strukturierte Ausgabe und Code und höher für das Verfassen von Entwürfen. stream ermöglicht es Ihnen, den Fortschritt bei langen Generierungen anzuzeigen, was wichtig ist, wenn eine Antwort bis zu Zehntausende von Tokens umfassen kann. Systemanweisungen sollten Format- und Sicherheitsanforderungen enthalten. Für Bilder ist das standardmäßige multimodale Content-Array der zu verwendende Mechanismus. Überlegen Sie bei langen Prompts, ob jedes enthaltene Dokument notwendig ist, da Eingabe-Tokens mit $0,15 pro 1M abgerechnet werden. Wenn das Modell Tool-Aufrufe über das OpenAI-kompatible Schema unterstützt, definieren Sie schmale, gut dokumentierte Tools statt breiter. Legen Sie einen clientseitigen Timeout fest, der Ihrer längsten erwarteten Generierung entspricht.
Die Migration ist bewusst klein gehalten. Ändern Sie die Basis-URL in https://api.orcarouter.ai/v1, ersetzen Sie den Modell-String durch deepseek/deepseek-v4.1-flash und geben Sie einen OrcaRouter-API-Schlüssel an. Anfrage- und Antwortschemata bleiben OpenAI-kompatibel, sodass Nachrichten-Arrays, Streaming-Ereignisse und Tool-Call-Payloads keine strukturelle Überarbeitung benötigen. Die Arbeit liegt im Verhalten, nicht in der Verkabelung. Ein Modell mit einem 1.048.576-Token-Fenster und einer Obergrenze für die Ausgabe von 384.000 Token lädt zu Prompts ein, die Ihr vorheriges Modell nicht akzeptieren konnte. Nutzen Sie die Gelegenheit, die Kontextqualität zu erhöhen, anstatt die Prompt-Größe blind aufzublähen, da Eingabe-Token 0,15 $ pro 1 Mio. Token kosten. Stimmen Sie max_tokens, temperature und die Wiederholungslogik neu ab und führen Sie dann Ihr Evaluationsset erneut aus. Überprüfen Sie ebenfalls Annahmen zu Tokenizer und Prompt-Aufteilung: Chunking-Logik, die für ein kleines Fenster entwickelt wurde, ist jetzt möglicherweise unnötig, und wenn sie beibehalten wird, kann sie den Kontext fragmentieren.
Bilder werden als Inhaltsteile in der Benutzernachricht bereitgestellt, entsprechend dem multimodalen Format von OpenAI: Der Nachrichteninhalt wird zu einem Array, das Textteile und Bildteile enthält, wobei jedem Bild entweder eine URL oder base64-Daten zugewiesen werden. Ein typischer Aufruf mischt einen langen Textkörper, wie eine Spezifikation, ein Transkript oder eine vorherige Konversation, mit einem oder mehreren Screenshots oder gescannten Seiten und stellt eine Frage, die von beiden abhängt. Größe vor dem Hochladen anpassen. Sehr große Bilder fügen Eingabe-Token hinzu, und Eingaben werden mit 0,15 $ pro 1 Mio. Token abgerechnet, daher verschwendet das Senden von Bildschirmaufnahmen in voller Auflösung einfacher Diagramme Budget, ohne die Genauigkeit zu verbessern. Schneiden Sie auf den relevanten Bereich zu und verwenden Sie eine lesbare Auflösung für textlastiges Material. Wenn eine Aufgabe viele Bilder erfordert, gruppieren Sie sie logisch in einer Anfrage, anstatt einen separaten Aufruf pro Bild zu tätigen, der jedes Mal Ihren Textkontext erneut sendet.
Modelle der Frontier-Klasse liegen oft bei den schwierigsten Reasoning- und Coding-Benchmarks vorn, verlangen aber in der Regel deutlich mehr pro Token und können die Ausgabe weit unter dem begrenzen, was DeepSeek V4.1 Flash zulässt. Der Wert von 90,9, den dieses Modell bei GPQA Diamond erzielt, bringt es in einen glaubwürdigen Bereich für wissenschaftliches Reasoning auf Graduiertenniveau, während die Preisgestaltung von $0,15 pro 1 Mio. Input-Token und $0,60 pro 1 Mio. Output-Token Arbeit mit langem Kontext erschwinglich hält. Die Entscheidung läuft meist auf drei Fragen hinaus. Wie schwierig ist die Reasoning-Aufgabe, und spielt die Genauigkeitslücke dabei eine Rolle? Wie lang ist die Eingabe, und wie viel Pipeline-Komplexität spart ein Fenster mit 1.048.576 Token? Wie lang ist die Ausgabe, angesichts der Obergrenze von 384.000 Token? Für dokumentenlastige Analysen, lange Single-Pass-Generierung und multimodale Prüfung in großem Umfang ist V4.1 Flash oft die praktische Wahl. Für die schwierigsten Reasoning-Schritte sollten Sie erwägen, diese Aufrufe an ein kostenintensiveres Modell auf OrcaRouter weiterzuleiten.
OrcaRouter stellt viele Modelle hinter einer einzigen OpenAI-kompatiblen API bereit, sodass ein Vergleich eine Frage des Wechselns der Modell-ID ist statt der Integration eines zweiten Anbieters. Innerhalb der DeepSeek-Familie sind die entscheidenden Dimensionen Preis, Kontextfenster und Ausgabeobergrenze. V4.1 Flash kombiniert ein 1.048.576-Token-Fenster mit einem 384.000-Token-Ausgabelimit bei 0,15 $ pro 1 Mio. Eingabe- und 0,60 $ pro 1 Mio. Ausgabe-Token. Kleinere oder günstigere Modelle sind sinnvoll, wenn Prompts und Antworten kurz sind und das zusätzliche Kontextfenster keinen Mehrwert bietet. Vision-fähige Alternativen sind wichtig, wenn Sie Bildausgabe statt Bildeingabe benötigen. Spezialisierte Code- oder Reasoning-Modelle können bei eng gefassten Aufgaben gewinnen. Da OrcaRouter zum Anbieterpreis ohne Aufschlag abrechnet, ist der Vergleich bei Tokens direkt vergleichbar: Lassen Sie identische Prompts über beide IDs laufen, messen Sie Kosten und Qualität und routen Sie je nach Aufgabe.
Wählen Sie etwas anderes, wenn die Aufgabenform nicht zu den Stärken des Modells passt. Kurze, hochfrequente Klassifizierungs-, Routing- oder Extraktionsaufgaben profitieren nicht von einem 1.048.576-Token-Fenster und sind auf einem kleineren Modell günstiger. Aufgaben, die die Generierung von Bildern erfordern, benötigen eine völlig andere Modellklasse. Wenn ein einzelner schwieriger Denkschritt die Qualität dominiert, wie etwa theoremartige Mathematik oder subtiler Algorithmusentwurf, kann ein Frontier-Modell, das nur für diesen Schritt verwendet wird, den höheren Preis wert sein. Es ist auch sinnvoll, Modelle zu kombinieren. Verwenden Sie DeepSeek V4.1 Flash, um lange Eingaben zu lesen, Belege zu sammeln und erweiterte Ausgaben zu entwerfen – zu 0,15 $ pro 1 Mio. Eingabe-Tokens und 0,60 $ pro 1 Mio. Ausgabe-Tokens – und eskalieren Sie dann bestimmte Entscheidungen zur Überprüfung an ein teureres Modell. Die OpenAI-kompatible API von OrcaRouter macht dieses Routing zu einer Konfigurationsänderung statt zu einer neuen Integration.
OpenAI-kompatibel — behalte dein bisheriges SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4.1-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoninglogprobsmax_tokensreasoningreasoning_effortresponse_formatstopstreamstream_optionstemperaturethinkingtool_choicetoolstop_logprobstop_puser_id| Eingabe / 1M Tokens · Nebenzeiten | $0.150 |
|---|---|
| Ausgabe / 1M Tokens · Nebenzeiten | $0.600 |
| Cache-Lesen / 1M · Nebenzeiten | $0.0030 |
| Spitzenzeiten | 01:00–04:00, 06:00–10:00 ×2 (UTC) |
| Eingabe / 1M Tokens · ×2 | $0.300 |
| Ausgabe / 1M Tokens · ×2 | $1.20 |
| Cache-Lesen / 1M · ×2 | $0.0060 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
Worüber Entwickler diese Woche sprechen
GET /api/public/models/deepseek/deepseek-v4.1-flashÖffnen @misc{orcarouter_deepseek_v4_1_flash,
title = {DeepSeek V4.1 Flash API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash}
}DeepSeek. (2026). DeepSeek V4.1 Flash API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash