DeepSeek V4 Flash 0731 ist die erneut nachtrainierte offizielle Version von DeepSeeks effizientem V4-Flash-Mixture-of-Experts-Modell – 284B Gesamt- / 13B aktive Parameter, architektonisch und in der Größe identisch mit dem V4-Flash-Release von April, wobei das Post-Training von Grund auf neu durchgeführt wurde. Es bietet ein 1M-Token-Kontextfenster mit bis zu 384K Ausgabe-Tokens, unterstützt sowohl Denk- als auch Nicht-Denk-Modi (Denken standardmäßig aktiviert) sowie JSON-Ausgabe und Tool-Aufrufe und spricht nativ die Responses API mit einer gezielten Anpassung für Codex-artige Coding-Agenten. Die Revision 0731 ist ein großer Schritt nach vorn bei der Agent-Fähigkeit und übertrifft in DeepSeeks veröffentlichten Agent-Benchmarks sogar DeepSeek V4 Pro Preview – 82,7 auf Terminal Bench 2.1, 76,7 auf Cybergym, 70,3 auf Toolathlon Verified, 54,4 auf DeepSWE und 54,2 auf NL2Repo. In der DeepSeek-Erstanbieter-API bedient diese Revision nun die Modell-ID deepseek-v4-flash; die datierte Kennung verweist für Aufrufer, die sie nach Datum referenzieren, auf dieselbe Revision. Sie ist eine starke Wahl für Coding-Agenten, Workloads für Terminal- und Tool-Nutzung sowie hochvolumige agentische Pipelines zu Flash-Tier-Kosten.
DeepSeek V4 Flash 0731 ist ein rein textbasiertes Sprachmodell des Anbieters DeepSeek, das über OrcaRouter unter der Modell-ID deepseek/deepseek-v4-flash-0731 verfügbar ist. Die wichtigsten…
Die Eingabe ist auf Text beschränkt. Das Kontextfenster umfasst 1.048.576 Token, und die maximale Ausgabe beträgt 384.000 Token pro Antwort. Das ist ein großer Arbeitsbereich: Sie können vor der Generierung etwa eine Million Token an Inhalt lesen und in einem einzigen Aufruf bis zu 384.000 Token Ausgabe anfordern. Die Modellkarte führt diese als zwei getrennte Obergrenzen auf; sie gibt kein kombiniertes Limit für eine Anfrage an, die beide Werte nahezu ausschöpft. In der Praxis sollten Sie, um innerhalb der Grenzen zu bleiben, Ihre Token vor dem Senden zählen und max_tokens unterhalb der Ausgabeobergrenze festlegen. Die Beschränkung auf Text bedeutet außerdem, dass Sie PDFs, Tabellenkalkulationen und andere Dokumente zunächst in einfachen Text konvertieren müssen. Die Tokenisierung ist in den verfügbaren Angaben nicht spezifiziert. Testen Sie daher repräsentative Inhalte, um zu sehen, wie groß Ihre Prompts werden. Wenn Ihre Anfrage 1.048.576 Eingabe-Token überschreitet, schlägt der API-Aufruf fehl; dasselbe gilt für Ausgaben über 384.000 Token.
Angesichts der aufgeführten Spezifikationen eignet sich das Modell am besten für Aufgaben, die lange Texteingaben, lange Textausgaben und terminalorientiertes agentisches Denken kombinieren. Der Score von 82,7 im Terminal Bench 2.1 belegt die Stärke bei der Bewältigung von Befehlszeilenaufgaben, bei denen ein Modell die Shell-Ausgabe liest und den nächsten Befehl festlegt. Der Kontextumfang von 1.048.576 Token unterstützt die Analyse ganzer Repositorys, Code-Überprüfungen über mehrere Dateien hinweg, lange juristische oder technische Dokumente sowie umfangreiche Chatverläufe. Der Ausgabeumfang von 384.000 Token ermöglicht die Erzeugung langer strukturierter Dokumente, synthetischer Datensätze oder schrittweiser Analysen in einem einzigen Durchlauf. Die Token-Preise von 0,15 $ für Eingabe und 0,29 $ für Ausgabe pro Million Token machen die Verarbeitung großer Textmengen finanziell planbar. Das Modell ist weniger geeignet, wenn Sie Bildverständnis, Audiotranskription oder sehr geringe Latenz benötigen – keiner dieser Punkte wird durch die bereitgestellten Fakten abgedeckt. Wenn Ihre Aufgabe zu dem reinen Textprofil mit großem Kontext und großem Ausgabeumfang passt, ist dies ein vernünftiger Kandidat, den Sie über OrcaRouter bewerten sollten.
Das Modell kann keine Nicht-Text-Eingaben akzeptieren; in seinem Katalogeintrag gibt es keine Bild-, Audio- oder Videomodallität. Es gibt auch keine veröffentlichten Latenz- oder Streaming-Garantien in den verfügbaren Fakten. Sie sollten ein günstigeres Modell wählen, wenn Ihre Arbeitslast nicht den großen Kontext oder die Ausgabelimits benötigt. Ein kurzer Chatbot-Austausch, der ein paar tausend Tokens verwendet, würde beispielsweise weiterhin zum gleichen Preis pro Token abgerechnet, könnte aber besser von einem Modell mit kleinerem Kontext und einem niedrigeren Preis pro Million Tokens bedient werden. Die verfügbaren Fakten listen keine Preise für Alternativen auf, vergleichen Sie also die Preise pro 1M Tokens im OrcaRouter-Katalog. Wenn Ihre Aufgabe eine einfache Klassifizierung oder Zusammenfassung kurzer Passagen ist, kann ein günstigeres Modell ausreichend sein. Wenn Ihre Aufgabe den vollen 1M-Kontext oder die 384K-Ausgabe benötigt oder von der Terminal Bench 2.1-Stärke bei der Befehlszeilenarbeit profitiert, dann ist der Preis dieses Modells die relevante Bewertungsgrundlage.
Jede Eingabe muss Text sein. PDFs, Bilder, Tabellenkalkulationen und Audiodateien müssen in Klartext konvertiert oder transkribiert werden, bevor sie gesendet werden können. Das ist ein notwendiger Vorverarbeitungsschritt, der aber auch das Anfrageformat vereinfacht: Standard-Inhaltsfelder im OpenAI-Stil, die Strings enthalten, sind alles, was du brauchst. Der Kontext von 1.048.576 Token bedeutet, dass du lange konvertierte Texte in einer einzigen Anfrage übergeben kannst; die Ausgabe von 384.000 Token bedeutet, dass du sehr lange Texte zurückerhalten kannst. Die Token-Anzahl ist der Hauptaspekt im Betrieb, da die Gesamtrechnung von Eingabe- und Ausgabe-Token abhängt. OrcaRouter meldet die Nutzung in der OpenAI-kompatiblen Antwort, sodass du beide Zahlen überwachen kannst. Wenn du mit Sprachen oder Code arbeitest, die ineffizient tokenisiert werden, schrumpft dein effektiver Kontext, da die Token-Anzahl und nicht die Zeichenanzahl die Begrenzung darstellt. Es werden keine Tokenizer-Details bereitgestellt, also führe einen schnellen Test mit deinem eigenen Inhalt durch, um typische Token-Längen zu ermitteln.
Terminal Bench 2.1 bewertet die Fähigkeit eines Modells, in einer Terminalumgebung zu arbeiten: Befehlsausgaben zu verstehen, Verzeichnisse zu navigieren, Befehle auszuführen und realistische Systemadministrations- oder Softwareentwicklungsaufgaben über eine Shell abzuschließen. Der Hauptwert für DeepSeek V4 Flash 0731 liegt bei 82,7 auf einer Skala, auf der höhere Werte besser sind. Dies ist das einzige Benchmark-Ergebnis, das in den verfügbaren Fakten angegeben ist. Der Wert ist ein nützliches Signal, wenn Sie planen, Agentenschleifen zu entwickeln, die Shell-Befehle absetzen, da der Benchmark genau diese Art von Fähigkeit testen soll. Er ist kein Maß für Allgemeinwissen, kreatives Schreiben, Mathematik oder mehrsprachige Kompetenz. Es werden keine Vergleichs-Baselines oder andere Benchmark-Zahlen bereitgestellt, daher sollte die 82,7 im Kontext interpretiert werden: starke Evidenz für terminalbezogene Aufgaben und keinerlei Evidenz in die eine oder andere Richtung für andere Bereiche. Benchmark-Ergebnisse hängen von der genauen Aufgabenverteilung ab, daher können Ihre eigenen Terminal-Aufgaben anders abschneiden; validieren Sie dies mit Ihrer eigenen Auswertung, bevor Sie es in der Produktion einsetzen.
Die verfügbaren Fakten für DeepSeek V4 Flash 0731 enthalten keine Angaben zu Tokens pro Sekunde, Zeit bis zum ersten Token, p95-Latenz oder Durchsatz. Der Name Flash deutet auf eine leichtere Variante hin, aber die bereitgestellten Fakten quantifizieren die Geschwindigkeit nicht. Was die Fakten hingegen enthalten, ist ein großes Kontextfenster von 1.048.576 Tokens und eine große Ausgabegrenze von 384.000 Tokens. Längere Eingaben und Ausgaben verbrauchen naturgemäß mehr Rechenleistung, daher wird die Latenz bei Anfragen mit vollem Kontext wahrscheinlich höher sein als bei kurzen Prompts, selbst bei einem schnellen Modell. Die Preise von 0,15 $/0,29 $ pro Million Tokens beschreiben Kosten, nicht Geschwindigkeit. Um eine fundierte Entscheidung zu treffen, führen Sie Ihren eigenen Lasttest gegen die OrcaRouter-API mit repräsentativen Prompts in der von Ihnen beabsichtigten Größe durch und vergleichen Sie die Zeit bis zum ersten Token und die Gesamtdauer mit anderen Modellen im Katalog. Extrapolieren Sie die Latenz nicht aus dem Benchmark-Ergebnis, da dieses nicht die Antwortzeit misst.
Die wichtigsten Einschränkungen sind aus den aufgeführten Fakten ersichtlich. Es ist rein textbasiert, daher ist jede multimodale Eingabe ausgeschlossen. Die Benchmark-Belege beschränken sich auf eine einzige Punktzahl, 82,7 auf Terminal Bench 2.1, der die Bearbeitung terminalbasierter Aufgaben abdeckt, nicht allgemeines Denken oder Wissen. Es werden keine Latenz-, Verfügbarkeits- oder Fehlerraten-Metriken veröffentlicht, daher ist die Leistung unter Last unbekannt. Die Kontext- und Ausgabelimits sind groß, aber endlich: 1.048.576 Token Eingabe und 384.000 Token Ausgabe pro Anfrage. Anfragen, die diese Grenzen überschreiten, sind nicht erfolgreich. Es gibt keinen dokumentierten Prompt-Caching-Rabatt in den bereitgestellten Fakten, daher werden wiederholte Präfixe als gewöhnliche Eingabe-Token abgerechnet. Die Preise sind auf Pro-Token-Basis niedrig, aber die absoluten Kosten wachsen linear mit der Kontextgröße. Wenn Ihre Anwendung Bildverarbeitung, geringe Latenz oder einen sehr hohen Durchsatz benötigt, ist dieses Modell möglicherweise nicht die richtige Wahl; überprüfen Sie diese Anforderungen separat, bevor Sie sich festlegen.
Die Kosten werden pro Token berechnet, mit einem Tarif für die Eingabe und einem für die Ausgabe. Eingabe-Token kosten 0,15 $ pro 1.000.000 Token; Ausgabe-Token kosten 0,29 $ pro 1.000.000 Token. OrcaRouter stellt diese zum Anbieter-Tarif ohne Aufschlag in Rechnung, d. h. es wird kein zusätzlicher Plattform-Prozentsatz auf den Tarif von deepseek aufgeschlagen. Die Kosten einer einzelnen Anfrage betragen ungefähr Eingabe-Token mal 0,15 $ geteilt durch 1.000.000 plus Ausgabe-Token mal 0,29 $ geteilt durch 1.000.000. Zum Beispiel kostet eine vollständige Eingabe mit 1.048.576 Token etwa 0,1573 $ und eine Ausgabe mit maximaler Länge von 384.000 Token etwa 0,1114 $, wenn beide Grenzen in separaten Transaktionen genutzt würden. Die verfügbaren Fakten erwähnen keine ermäßigten Preise für gecachte Eingaben; gehen Sie daher davon aus, dass jedes Eingabe-Token zum Standardtarif abgerechnet wird. Da die Preisgestaltung linear ist, ist die Kostenschätzung für Stapelverarbeitung unkompliziert, sobald Sie Ihre durchschnittliche Eingabegröße und Ausgabelänge kennen.
Der Hauptzielkonflikt besteht zwischen Kontextgröße und Preis. Bei 0,15 $ pro 1 Million Eingabe-Tokens kostet ein Prompt, der den vollständigen Kontext von 1.048.576 Tokens nutzt, allein etwa 0,157 $ an Eingabegebühren. Wenn Ihre Aufgabe nur ein paar tausend Tokens Kontext benötigt, zahlen Sie für ungenutzte Kapazität – ein Modell mit kleinerem Kontext und niedrigerem Preis pro Token könnte je nach dessen Tarifen günstiger sein. Der Satz von 0,29 $ pro 1 Million Ausgabe-Tokens bedeutet, dass lange Ausgaben einzeln nicht besonders teuer sind, aber bei einer Workload, die Gigabytes an Text erzeugt, summieren sich die Kosten. In den bereitgestellten Fakten sind weder Batch-Rabatte noch Reservierungs- oder Cache-Rabatte aufgeführt. Die Abrechnung ohne Aufschlag von OrcaRouter bedeutet, dass der angezeigte Preis dem Preis des Anbieters entspricht; Ihre endgültige Rechnung ist einfach eine Funktion der gesendeten und empfangenen Tokens. Schätzen Sie für groß angelegte Batch-Jobs die gesamten Eingabe- und Ausgabe-Tokens, multiplizieren Sie diese mit den beiden Sätzen und vergleichen Sie das Ergebnis mit Alternativen im Katalog.
OrcaRouter fakturiert DeepSeek V4 Flash 0731 ausdrücklich zum Anbieterpreis ohne Aufschlag. Die 0,15 $ pro 1 Million Eingabetokens und 0,29 $ pro 1 Million Ausgabetokens sind die Preise des Anbieters, keine aufgeschlagene Version. Die bereitgestellten Fakten beschreiben kein Prompt-Caching für dieses Modell. Es ist keine Preisebene für zwischengespeicherte Eingaben aufgeführt, und es gibt keine Aussage darüber, dass OrcaRouter automatisch Prompts in Ihrem Namen zwischenspeichert. Wenn der zugrunde liegende Anbieter Caching anbietet, sind die Bedingungen nicht Teil dessen, was für diesen Katalogeintrag bereitgestellt wurde. Sie sollten daher die aktuelle Dokumentation von OrcaRouter prüfen, bevor Sie einen Rabatt annehmen. Die API-Antwort enthält – da sie dem Chat-Completions-Format von OpenAI folgt – Nutzungsinformationen, mit denen Sie die in Rechnung gestellten Eingabe- und Ausgabetokens überprüfen können. Loggen Sie zu Prüfzwecken das Usage-Objekt jeder Antwort und vergleichen Sie es mit Ihren erwarteten Token-Anzahlen. Jegliche Kostenkontrolle muss von Ihren eigenen Prompt- und Parameterwahlen ausgehen.
Senden Sie standardmäßige Chat-Completion-Anfragen an die OpenAI-kompatible API von OrcaRouter. Die Basis-URL ist https://api.orcarouter.ai/v1, und die Modell-ID lautet deepseek/deepseek-v4-flash-0731. Setzen Sie das Modellfeld auf exakt diese Zeichenfolge und fügen Sie Ihren OrcaRouter-API-Schlüssel als Bearer-Token in den Authorization-Header ein. Erstellen Sie ein Messages-Array mit Textinhalt; das Modell akzeptiert keine Bild- oder Audioinhalte. Die Antwort ist wie eine OpenAI-Chat-Completion formatiert und enthält die generierte Nachricht sowie ein Usage-Objekt. Da die Modell-ID ein Provider-Präfix enthält, behalten Sie sie exakt so bei, wie angegeben. Die verfügbaren Fakten erfordern keine nicht standardmäßigen Header oder speziellen Transporteinstellungen. Sie können die OpenAI-SDKs, curl oder einen beliebigen HTTP-Client verwenden, der JSON versteht. Beginnen Sie mit einer kleinen Anfrage, überprüfen Sie, ob die zurückgegebene Nutzung den erwarteten Eingabe- und Ausgabe-Token-Anzahlen entspricht, und skalieren Sie dann hoch.
Da der Endpoint OpenAI-kompatibel ist, stehen die üblichen Chat-Completion-Parameter zur Verfügung: model, messages, temperature, top_p, max_tokens oder max_completion_tokens, stop, stream und ähnliche Optionen, die vom verwendeten SDK unterstützt werden. Die verfügbaren Fakten listen nicht auf, welche Parameter OrcaRouter für dieses spezifische Modell berücksichtigt. Daher solltest du alles testen, was über model und messages hinausgeht. Die entscheidenden Grenzen sind die des Modells selbst: 1.048.576 Eingabe-Token und 384.000 Ausgabe-Token. Halte max_tokens unterhalb der Ausgabe-Obergrenze, um fehlgeschlagene Anfragen zu vermeiden. Für Tool- oder Function-Calling geben die Fakten keine Unterstützung an; teste eine minimale Tool-Definition, bevor du einen Agenten aufbaust. Für die Steuerung des Ausgabeformats gibt es keine Erwähnung von JSON-Modus oder Garantien für strukturierte Ausgaben; validiere den generierten Text selbst, wenn du zuverlässige Strukturen benötigst. Streaming wird bei OpenAI-kompatiblen Endpoints üblicherweise unterstützt, aber die Fakten bestätigen dies für dieses Modell nicht. Konsultiere daher die API-Referenz von OrcaRouter.
Migration ist größtenteils Konfiguration: Ändern Sie die Basis-URL auf https://api.orcarouter.ai/v1, stellen Sie den API-Schlüssel auf Ihren OrcaRouter-Schlüssel um und ersetzen Sie den Modellnamen durch deepseek/deepseek-v4-flash-0731. Code, der bereits Nachrichten erstellt, Chat-Completion-Antworten verarbeitet und Nutzungsdaten liest, funktioniert weiterhin, solange er der OpenAI-Konvention folgt. Zwei Unterschiede erfordern Aufmerksamkeit. Erstens ist dieses Modell rein textbasiert, entfernen Sie also alle image_url- oder audio-Felder aus Ihren Anfragen. Zweitens sind die Kontext- und Ausgabegrenzen sehr groß; passen Sie Ihre max_tokens-Einstellung an, um die Ausgabegrenze von 384.000 Token einzuhalten, und rechnen Sie mit gelegentlich langen Antworten. Wenn Ihr Code Wiederholungsversuche bei 429- oder 5xx-Fehlern enthält, behalten Sie diese bei; die Fakten ändern nichts an den Erwartungen an die Fehlerbehandlung. Führen Sie einen Smoke-Test mit einem kleinen Prompt durch, bestätigen Sie, dass die Abrechnung bei 0,15 $/0,29 $ pro Million Token erscheint, und verlagern Sie dann den Datenverkehr schrittweise.
Die Basis-URL für die OrcaRouter-API lautet https://api.orcarouter.ai/v1. Alle Anfragen an diesen Endpunkt sollten HTTPS verwenden. Die Authentifizierung erfolgt über einen API-Schlüssel, der als standardmäßiges Bearer-Token im Authorization-Header gesendet wird. Die verfügbaren Fakten führen keine alternativen Authentifizierungsmethoden auf. Die Modell-ID lautet deepseek/deepseek-v4-flash-0731, die den Anbieternamen und das 0731-Snapshot-Suffix enthält; übergeben Sie sie genau wie angegeben. In den meisten OpenAI-kompatiblen SDKs konfigurieren Sie einen Client mit base_url und api_key und legen dann den Modellnamen bei jedem Aufruf fest. Die Antwort enthält abrechnungsrelevante Token-Anzahlen im usage-Objekt. Die Fakten enthalten keine Angaben zu Raten-Limits, Wiederholungsverhalten oder Timeout-Empfehlungen. Schlagen Sie daher in der OrcaRouter-Dokumentation nach, um diese betrieblichen Details zu erfahren. Bewahren Sie Ihren API-Schlüssel sicher auf; der Schlüssel bestimmt den Zugriff auf jedes Modellkonto in Ihrem OrcaRouter-Projekt. Wenn Sie einen Proxy oder ein Gateway verwenden, richten Sie es auf die OrcaRouter-Basis-URL aus und bewahren Sie die vollständige Modell-ID.
Die bereitgestellten Fakten decken nur diese spezifische Momentaufnahme ab, daher ist ein zeilenweiser numerischer Vergleich mit anderen DeepSeek-Einträgen anhand der vorliegenden Daten nicht möglich. Was wir über DeepSeek V4 Flash 0731 wissen: ein Kontext von 1.048.576 Token, ein Ausgabelimit von 384.000 Token, reine Texteingabe, Preise von 0,15 $/0,29 $ pro 1 Million Token und ein Terminal-Bench-2.1-Wert von 82,7. Andere DeepSeek-Modelle im OrcaRouter-Katalog können sich in jeder dieser Dimensionen unterscheiden. Beim Entscheiden sollten Sie die Spezifikationen vergleichen, die wirklich zählen: wie viele Token Ihre Prompts tatsächlich verwenden, wie viele Token Ihre Ausgaben benötigen, ob Sie eine multimodale Eingabe brauchen, und den Preis pro 1 Million Token des Kandidaten. Das Flash-Label deutet auf eine schlankere Variante im Vergleich zu anderen DeepSeek-Veröffentlichungen hin, aber der einzige objektive Leistungsindikator in den Fakten ist der Terminal-Bench-Wert. Nutzen Sie die Katalogseiten von OrcaRouter für einen direkten Vergleich der Spezifikationen und der aktuellen Preise, bevor Sie eine Auswahl treffen.
Bei einem Kontext von 1.048.576 Token befindet sich dieses Modell in der Long-Context-Kategorie. Ein Modell mit kleinerem Kontext könnte bei einigen hunderttausend Token oder weniger seine Grenze erreichen, sodass Sie Dokumente aufteilen, Chunks einbetten oder Retrieval verwenden müssen. Der Vorteil dieses Modells besteht darin, dass Sie ein sehr großes Korpus in einem einzigen Prompt unterbringen können und das Modell in einem einzigen Durchlauf das gesamte Korpus berücksichtigen kann. Der Nachteil sind die Kosten pro Anfrage: Jedes Eingabe-Token wird abgerechnet, sodass ein riesiger Kontext die Ausgaben für Eingaben vervielfacht. Die Fakten führen kein Modell mit einem noch größeren Kontextfenster auf, daher sind die einzigen sicheren Aussagen die über die eigenen Grenzen dieses Modells. Bei der Auswahl sollten Sie Ihre tatsächlichen Prompt-Größen abschätzen. Wenn Ihre Aufgaben typischerweise weniger als 100.000 Token verwenden, ist der volle Kontext möglicherweise irrelevant und ein günstigeres, kleineres Modell könnte vorzuziehen sein. Wenn Sie regelmäßig die üblichen Kontextgrenzen überschreiten, ist das 1-Millionen-Token-Fenster dieses Modells das entscheidende Merkmal.
Wählen Sie DeepSeek V4 Flash 0731, wenn die Aufgabe nur Text umfasst und Sie seine Spezifikationen nutzen können. Der 1,048,576-Token-Kontext rechtfertigt die Auswahl, wenn Sie ein gesamtes Repository, einen Dokumentensatz oder ein langes Transkript in einem Durchgang lesen müssen. Das 384,000-Token-Ausgabelimit rechtfertigt die Auswahl, wenn Sie sehr lange generierte Antworten ohne mehrere Roundtrips benötigen. Die 82.7-Punkt-Bewertung im Terminal Bench 2.1 rechtfertigt die Auswahl für Terminalautomatisierung und agentische CLI-Workflows. Der Preis von $0.15/$0.29 pro 1M Token rechtfertigt die Auswahl für die Batch-Textverarbeitung mit hohem Volumen, bei der die Kosten pro Token dominieren. Wählen Sie es nicht, wenn Sie Bilder oder Audio benötigen, wenn Ihre Kontextanforderungen minimal sind und ein günstigeres Modell existiert, oder wenn Sie keine unbekannten Latenzeigenschaften akzeptieren können. Die verfügbaren Fakten geben keine Latenzgarantien, daher sollten leistungssensitive Teams zuerst mit echten Prompts benchmarken. Bestätigen Sie in jedem Fall die Modell-ID und Abrechnung auf OrcaRouter, bevor Sie skalieren.
OpenAI-kompatibel — behalte dein bisheriges SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| Eingabe / 1M Tokens | $0.147 |
| Ausgabe / 1M Tokens | $0.295 |
| Cache-Lesen / 1M | $0.020 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
Worüber Entwickler diese Woche sprechen
GET /api/public/models/deepseek/deepseek-v4-flash-0731Öffnen @misc{orcarouter_deepseek_v4_flash_0731,
title = {DeepSeek V4 Flash 0731 API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731}
}DeepSeek. (2026). DeepSeek V4 Flash 0731 API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731