
DeepSeek V4.1 Flash in OpenCode: Konfiguration, Kosten und der Aufwandsregler, den niemand erwähnt
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 151 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 251 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
DeepSeek V4.1 Flash sitzt seit dem 10. September in OpenCode Go, und der Multiplikator, den OpenCode ihm zugeordnet hat, hat ein veröffentlichtes Enddatum: den 20. September. Das ist in vier Tagen. Das Interessante ist nicht die Frist – es ist, dass die Einstellung, die entscheidet, ob das Programmieren mit diesem Modell angenehm ist, in jedem Einrichtungsleitfaden auf der ersten Ergebnisseite fehlt und in mindestens zwei Harnesses stillschweigend fallengelassen wird. Dies ist ein Playbook, um einen Coding-Agenten auf DeepSeek V4.1 Flash auszurichten: die exakten Modell-IDs, die drei heute verifizierten Integrationen, die von der Community gemeldete Steuerung des Reasoning-Aufwands und der Überdenken-Fehlermodus mit den Gegenmaßnahmen, die tatsächlich funktionieren.
Worauf Sie Ihren Agenten tatsächlich ausrichten
DeepSeek V4.1 Flash wurde am 10.09.2026 veröffentlicht – der Versionshinweis in DeepSeeks eigener API-Dokumentation ist auf diesen Tag datiert, und es ist das kleinste Modell in der neuen Architekturfamilie des Anbieters. DeepSeek gibt ein Mixture-of-Experts-Backbone mit 552B Parametern an, das auf einem Design basiert, das DeepSeek als Causal Encoder–Decoder bezeichnet; während der Prefill-Phase werden etwa 8B Parameter pro Token und während der Decode-Phase 16B Parameter aktiviert. Es nimmt Text und Bilder als Eingabe entgegen und gibt Text zurück, unterstützt ein Kontextfenster von bis zu einer Million Tokens und generiert bis zu 384.000 Tokens in einer einzigen Antwort – die Kontext- und Ausgabegrenzen stammen beide von OrcaRouters eigener Modellseite für das Modell, auf der 1.048.576 bzw. 384.000 angegeben sind.
Die Anbieter-Benchmarks, aus dem Diagramm auf DeepSeeks Release-Seite und damit vom Anbieter gemeldet und ungeprüft: 30,0 bei Terminal-Bench 3.0, 74,2 bei DeepSWE v1.1, 88,1 bei CyberGym, 54,8 bei Automation-Bench und 90,9 bei GPQA Diamond. Unabhängige Bewertungen sind dünner gesät, aber es gibt sie – Artificial Analysis, heute direkt nachgelesen, setzt DeepSeek V4.1 Flash auf 40 in seinem Intelligence Index, Rang 6 von 113 in seiner Vergleichsklasse. Eine Zeile von derselben Seite ist für eine Leserschaft, die mit Coding-Agenten arbeitet, wichtiger als der Rang: Artificial Analysis bezeichnet das Modell als sehr wortreich, da es 250 Mio. Ausgabe-Tokens verbraucht habe, um seinen Intelligence-Index-Durchlauf abzuschließen, gegenüber einem Median von 140 Mio. Darauf kommen wir zurück.
Zwei Fakten zur Namensgebung sparen echte Debugging-Zeit. Die kanonische API-Modell-ID von DeepSeek lautet jetzt code>deepseek-flash/code>. Die älteren Strings code>deepseek-v4-flash/code> und code>deepseek-v4-flash-vision-exp/code> werden weiterhin akzeptiert, aber die dahinterliegenden Modelle wurden eingestellt und Anfragen werden von V4.1 Flash zum Flash-Preis bedient. Davon abgesehen ist DeepSeek V4 Pro nicht verschwunden: DeepSeeks Dokumentation besagt, dass der V4 Pro API-Dienst über den 2026-09-14 hinaus mit unveränderter Abrechnung weiterläuft. Wenn Ihnen gesagt wurde, das Flaggschiff sei abgeschaltet worden, entspricht das nicht dem, was die eigenen Dokumente des Anbieters sagen.

OpenCode: zwei Wege hinein und die ID, die man tatsächlich eingeben muss
Es gibt zwei Wege, DeepSeek V4.1 Flash hinter OpenCode zu bringen, und sie funktionieren wirtschaftlich unterschiedlich.
Die Abonnement-Route ist OpenCode Go, ein 10 $/Monat-Plan, den OpenCode als eine kuratierte Auswahl offener Coding-Modelle beschreibt, die getestet und bewertet wurden. Die Einrichtung umfasst vier Schritte und es gibt keine Konfigurationsdatei, die man von Hand bearbeiten muss: Melden Sie sich bei OpenCode Zen an, abonnieren Sie Go, kopieren Sie den API-Schlüssel und starten Sie dann code>/connect/code> in der TUI, wählen Sie OpenCode Go und fügen Sie den Schlüssel ein. Danach code>/models/code> listet auf, was verfügbar ist. Modellreferenzen in der Konfiguration haben die Form code>opencode-go/<model-id>/code>.
Welche Modell-ID? Beide. Die eigene Modellliste des Go-Gateways, heute abgerufen von code>https://opencode.ai/zen/go/v1/models/code>, führt code>deepseek-flash/code> und code>deepseek-v4.1-flash/code> als zwei verschiedene Einträge auf, neben den alten code>deepseek-v4-flash/code> und code>deepseek-v4-pro/code>. Jede der ersten beiden wird zu dem gewünschten Modell aufgelöst; code>deepseek-flash/code> ist der kanonische Name und die sicherere Wahl für alles, was Sie weiterlaufen lassen möchten.
Der direkte Weg überspringt das Abonnement vollständig: Führen Sie code>/connect aus, suchen Sie nach DeepSeek und fügen Sie einen DeepSeek-Plattformschlüssel ein. Sie werden dann von DeepSeek zum Listenpreis abgerechnet, statt ein Go-Kontingent zu beanspruchen. DeepSeek gibt den Listenpreis mit 0,15 $ pro 1 Mio. Input-Tokens und 0,60 $ pro 1 Mio. Output-Tokens außerhalb der Spitzenzeiten an, wobei gecachte Lesevorgänge 0,003 $ pro 1 Mio. kosten – und während der Spitzenzeiten genau das Doppelte. Sowohl die OpenCode-Go-Dokumentation als auch OrcaRouters Modellseite, heute gelesen, stimmen in diesen Zahlen überein.
Was OpenCode Go hinzufügt, ist die Kontingentstruktur, und hier lohnt es sich, die Zahlen sorgfältig zu lesen, denn sie sind der Grund, warum die Frist wichtig ist. Die eigene Dokumentation von OpenCode führt DeepSeek V4.1 Flash mit einem monatlichen Limit von 15 $ auf, derzeit vervierfacht auf 60 $ im Rahmen einer Aktion, die OpenCode als „Endet am 20. Sep.“ kennzeichnet. Geschätzte Anfragezahlen werden in zwei Spalten veröffentlicht: 6.500 pro 5 Stunden / 16.250 pro Woche / 32.500 pro Monat zum Standardtarif oder 26.000 / 65.000 / 130.000 mit angewendetem 4×-Multiplikator. Die Form des Kontingents ist über alle Modelle hinweg einheitlich – das 5-Stunden-Limit beträgt 20 % des Monatswerts, das Wochenlimit 50 %, und das Monatslimit ist die Gesamtmenge.
Das sind die von OpenCode veröffentlichten Zahlen, heute aus seiner Go-Dokumentation entnommen. Es liegt an ihnen, die Aktion zu beenden, und sie ist datiert.

Command Code: immer noch live, und ein wissenswerter Bugreport
Command Codes eigener Katalog führt das Modell mit heutigem Stand noch immer unter der ID code>deepseek-v4-1-flash/code>, mit einem 1-Mio.-Token-Kontextfenster und derselben durchgereichten Preisstruktur: 0,15 $ / 0,60 $ außerhalb der Spitzenzeiten, 0,30 $ / 1,20 $ zu Spitzenzeiten, 0,003 $ pro gecachtem Lesevorgang. Die übereinstimmenden Preise über zwei unabhängige Harnesse hinweg sind kein Zufall – beide geben DeepSeeks Listenpreis weiter, statt eigene Preise festzulegen.
Die Handhabung ist unkompliziert. Installieren Sie mit code>npm i -g command-code/code>, führen Sie es in Ihrem Projektverzeichnis aus, authentifizieren Sie sich mit code>/login/code>, und verwenden Sie code>/connect/code>, wenn Sie Ihren eigenen Provider-Schlüssel verwenden möchten. code>/model <id>/code> ändert das Modell direkt, während ein bloßes code>/model/code> ein Auswahlmenü öffnet, und code>/effort/code> legt den Reasoning-Aufwand für das aktuelle Modell fest — das Flag, das hier am wichtigsten ist.
Es lohnt sich, einen Community-Bugreport im Hinterkopf zu behalten, bevor du die falsche Ebene debuggst. Ein offenes Issue gegen eine Routing-Schicht eines Drittanbieters beschreibt einen Reasoning-Replay-Cache, der bei der code>command-code/deepseek-v4.1-flash/code>-ID nie greift, weil das Muster, auf das die Routing-Schicht matcht, ein code>v4./code>- oder code>v4-/code>Segment erwartet und die Zeichenkette code>v4.1/code> ist. Das gemeldete Symptom sind Upstream-400-Fehler, die bemängeln, dass im Thinking-Modus erzeugter Reasoning-Inhalt zurück an die API übergeben werden muss. Das ist ein Community-Bugreport über einen clientseitigen Matcher, keine Anbieter-Anleitung und kein Problem mit dem Modell — aber es ist genau die Art von Sache, die um 2 Uhr nachts wie ein Modellfehler aussieht.
Claude Code, Codex und die Clients, die OpenCode selbst validiert hat
OpenCode Go ist nicht nur für OpenCode gedacht, und ihre Dokumentation sagt das ausdrücklich: Es ist für OpenCode und andere Coding-Agents konzipiert, die ähnliche Anfragemuster erzeugen, mit einer veröffentlichten Liste von Clients, die als funktionierend validiert wurden. Diese Liste nennt derzeit Hermes, Claude Code, Codex, ZCode und Pi — und für Claude Code lautet der Hinweis, dass es „seinen nativen Session-Header erkennt. Ein Wrapper für benutzerdefinierte Header ist nicht erforderlich.“ Damit einher gehen zwei Anforderungen: Identifizieren Sie Ihren Client mit seinem eigenen User-Agent statt mit einem generischen SDK-Namen, und senden Sie bei jeder Konversation eine stabile Sitzungskennung im code>x-opencode-session/code>-Header, der dafür sorgt, dass ihr Routing und Prompt-Caching funktionieren. Bei Hermes ist der validierte Build entscheidend — der Header-Fix wurde nach v0.21.0 zusammengeführt, sodass dieser Release ihn allein nicht enthält.
Es gibt außerdem eine Route, an die überhaupt kein Abonnement gebunden ist, die den Anthropic-kompatiblen Endpunkt von DeepSeek direkt verwendet. Setzen Sie code>ANTHROPIC_BASE_URL/code> auf code>https://api.deepseek.com/anthropic/code>, code>ANTHROPIC_AUTH_TOKEN/code> auf Ihren DeepSeek-Schlüssel und richten Sie die Modellvariablen auf das Modell. Claude-Modellnamen werden bei der Eingabe neu zugeordnet: Alles, was mit code>claude-opus/code> beginnt, geht an DeepSeek V4 Pro und wird zum V4-Pro-Preis abgerechnet, während code>claude-sonnet/code> und code>claude-haiku/code>-Namen an das Flash-Modell gehen. Das code>[1m]/code>-Suffix in der Modellzeichenfolge fordert die Kontextvariante mit einer Million Token an. Die eigene Anleitung von DeepSeek für dieses Setup setzt außerdem code>CLAUDE_CODE_EFFORT_LEVEL=max/code> und legt das Auto-Compact-Fenster auf 786432 Token fest.
In dieser letzten Variable steckt ein Community-Fix. Ein Workaround-Proxy existiert, weil aktuelle Claude-Code-Builds code>thinking: {"type": "disabled"}/code> bei Subagent-Anfragen senden, während code>CLAUDE_CODE_EFFORT_LEVEL=max/code> einen Reasoning-Effort-Parameter hinzufügt und DeepSeeks Anthropic-Format-Endpunkt diese Kombination mit einer Meldung ablehnt, dass Thinking-Optionen nicht deaktivierbar seien, wenn Reasoning-Effort gesetzt ist. Der gemeldete Workaround ist eng gefasst — den Effort-Parameter nur bei Subagent-Anfragen entfernen und den Hauptagenten unangetastet lassen. Betrachten Sie ihn als Community-Befund zu einer Vertragsinkongruenz zwischen Client und Server und rechnen Sie damit, dass sich die genaue Versionsgrenze verschieben wird.
Der Aufwandsregler: 1–100, und warum „niedrig“ 50 bedeutet
Alles in diesem Abschnitt ist ein Community-Befund und keine Herstellerempfehlung. DeepSeek veröffentlicht keine Preset-zu-Zahl-Zuordnung, die wir verifizieren könnten, und die folgenden Zahlen stammen aus Praxisberichten und Dokumentation von Drittanbieter-Harnessen. Sie sind über die Quellen hinweg konsistent genug, um nützlich zu sein, und unbestätigt genug, dass Sie sie an Ihrer eigenen Arbeit testen sollten.
DeepSeek V4.1 Flash wird mit einem kontinuierlichen Skalar für den Reasoning-Aufwand von 1 bis 100 trainiert. Er ist keine Token-Obergrenze – er verschiebt, wo das Modell auf einer Kurve liegt, die der Trainingsprozess gelernt hat, wobei geringerer Aufwand mehr Druck ausübt, prägnant zu sein, und höherer Aufwand zusätzliches Reasoning günstiger macht. Drei öffentliche Presets bilden diese Skala ab:
• Niedrig — 50, der kürzeste Weg und die Voreinstellung, die dem Regler seinen Ruf der Billigkeit verleiht.
• Hoch — 75, und die Stufe, die die meisten Community-Quellen als vernünftige Obergrenze für Agentenarbeit beschreiben.
• Max — 100, wobei die Strafe für die Länge der Argumentation vollständig entfällt.
Was der Regler einbringt, ist real, aber stark abnehmend. Ein Community-Benchmark-Durchlauf berichtete, dass eine Erhöhung des Aufwands von 25 auf 100 Terminal-Bench 2.1 von 82,4 auf 90,6 verschob, während sich die Ausgabe-Tokens insgesamt ungefähr um das 2,5-Fache erhöhten. Berichte konvergieren darauf, dass ein Aufwand irgendwo zwischen 60 und 80 den größten Teil der verfügbaren Genauigkeit für weniger als die Hälfte des Token-Budgets erfasst, wobei max die Agent-Trajektorien um weitere 1,6–1,8× verlängert – für einen marginalen Gewinn.
Der Standardwert ist der Teil, bei dem sich niemand einig ist. Einige Harness-Dokumentationen und Praxisberichte besagen, dass ein nicht gesetzter Effort zu high aufgelöst wird; andere beschreiben den Server-Standardwert schlicht als unbekannt. Was dokumentiert statt debattiert wird, ist, dass zwei Harness-Integrationen gefunden wurden, die den Parameter überhaupt nicht senden — das Anbieterprofil von OpenCode Go und ein natives DeepSeek-Profil ließen beide die Ausgabe von code>reasoning_effort/code> für den code>deepseek-flash/code>-Slug weg, weil ihr Match-Guard einen code>deepseek-v…/code>-Präfix erwartete, den die kanonische ID nicht hat. In beiden Fällen wurde die vom Benutzer gewählte Einstellung stillschweigend durch den Anbieter-Standardwert ersetzt. Wenn Ihr Client ein Effort-Steuerelement anzeigt, ist das kein Beweis dafür, dass es tatsächlich übertragen wird. Protokollieren Sie einen Request-Body und sehen Sie nach.
Noch eine Eigenheit aus denselben Berichten: Der Endpunkt OpenCode Go akzeptiert code>low/code>, code>medium/code>, code>high/code> und code>max/code>, aber lehnt einen ganzzahligen Effort-Wert ab – ein Wert von 80 soll HTTP 400 zurückgeben. Der 1–100-Regler existiert im Modell, wird aber nicht überall als reine Zahl offengelegt, daher lässt sich „set effort to 65“ in Ihrem Client möglicherweise nicht ausdrücken.
Der Fehlermodus des Überdenkens und was ihn tatsächlich behebt
Dies ist der Fehlermodus, der darüber entscheidet, ob Sie das Modell in Ihrem Arbeitsablauf behalten. Berichte aus der Community beschreiben, dass DeepSeek V4.1 Flash weiterdenkt, nachdem die Arbeit erledigt ist: Es erörtert einen Punkt erneut, den es bereits korrekt beantwortet hat, schildert die Korrektur seiner eigenen falschen Annahmen und erzeugt lange Argumentationsketten mit geringer Informationsdichte. Ein Praktiker berichtete, dass die Reasoning-Ausgabe in einer Coding-CLI-Sitzung über eine Stunde lang weiterlief. Ein anderer berichtete, er habe es überhaupt nicht dazu bringen können, einen langen Benchmark-Lauf zu beenden.
Eine Quellennotiz zu diesem zweiten Bericht, denn es ist die Sorte Behauptung, die gern saubergewaschen wird. Sie stammt aus einem Community-Thread darüber, wie man das Modell zuverlässig laufen lässt, und Reddit blockiert unseren Fetcher, wir konnten den Thread also nicht direkt lesen – wir geben den Bericht weiter, statt eine Seite zu zitieren, die wir geöffnet haben. Was wir unabhängig überprüfen konnten, ist die Gestalt des Problems, und dort ist die externe Evidenz ungewöhnlich sauber: Artificial Analysis kennzeichnet das Modell auf der eigenen Seite als sehr wortreich – es verbraucht 250 Mio. Ausgabe-Tokens für einen Durchlauf, den sein Median-Vergleichsmodell in 140 Mio. abschließt. Das sind rund 1,8×, gemessen von einem Dritten, auf einem festen Aufgabensatz. Die Forumsberichte und die unabhängige Kennzahl beschreiben dasselbe Verhalten.
Die Abhilfemaßnahmen, die aus diesen Berichten hervorgehen, alle aus der Community stammend:
• Setze den Aufwand auf hoch oder darunter fest und lass nicht zu, dass er sich hochschraubt. Die expliziteste Korrektur, die in freier Wildbahn zu sehen ist, ist ein Routing-Plugin, das speziell geschrieben wurde, um die Aufwandssteigerung zu stoppen: Die Turn-Tiefe trägt nichts zum Eskalationswert bei, nur ein fehlgeschlagenes Tool-Ergebnis oder ein identischer Wiederholungsversuch zählt, die Eskalation ist gedeckelt, und max ist Opt-in und standardmäßig herabgestuft. Wenn dein Harness es einem Agenten erlaubt, seinen eigenen Aufwand zu erhöhen, während ein Lauf länger wird, ist das der Mechanismus, den man abschalten sollte.
• Führe max nicht standardmäßig aus. Mehrere Anwender berichten, dass max bei Routinearbeit eher im Kreis läuft, statt zu konvergieren, und dass ein Zurückschalten auf high das Problem behebt.
• Begrenze code>max_tokens/code> auf interaktiven Pfaden. Ein Ausgabelimit von 384.000 Tokens ist eine Obergrenze, kein Ziel, und eine Schleife, die nicht endet, ist bei diesem Limit teuer.
• Verifiziere, dass der Parameter gesendet wird. Angesichts der Tatsache, dass zwei Harnesse gefunden wurden, die ihn stillschweigend verwerfen, sind „Ich habe ihn auf high gesetzt" und „high hat die API erreicht" unterschiedliche Aussagen.
• Das Harness ist wichtiger, als man erwarten würde. Praktiker, die dieselben Gewichte laufen lassen, berichten von deutlich unterschiedlichem Verhalten je nach Shell – dasselbe Modell, das in einem Harness mit sich selbst streitet und das Signal verschüttet, zieht in einem anderen keinen dieser Vorwürfe auf sich. Das ist eine Beobachtung aus der Community über das Verhalten von Harnesses, keine Herstelleraussage über das Modell, aber es ist der am häufigsten wiederholte Ratschlag in den Berichten.
Was ein Coding-Loop bei diesen Sätzen tatsächlich kostet
DeepSeeks Listenpreis liegt bei 0,15 $ pro 1 Mio. Input-Tokens und 0,60 $ pro 1 Mio. Output-Tokens außerhalb der Spitzenzeiten — Output ist viermal so teuer wie Input, was das Erste ist, das man sich bei einem Agenten einprägen sollte, der sowohl Reasoning als auch Code generiert.
Nehmen wir einen realistischen Agenten-Turn: 60.000 Tokens Kontext (System-Prompt, Tool-Schemas, ein Repo-Ausschnitt, Gesprächsverlauf) als Eingabe und 3.000 Tokens Reasoning plus einen Patch als Ausgabe. Das ergibt 60.000 × $0,15/1 Mio. = $0,009 für die Eingabe plus 3.000 × $0,60/1 Mio. = $0,0018 für die Ausgabe, also etwa 1,1 Cent pro Turn. Zweihundert solcher Turns an einem Arbeitstag sind ungefähr $2,16, oder etwa $47 über einen Monat mit Werktagen zum Off-Peak-Tarif. Das ist die Rechnung, die ein monatliches Guthaben von $15 mit einer obendrauf kommenden 4×-Promo großzügig erscheinen lässt — und die Rechnung, die Ausführlichkeit zu dem macht, worauf man achten sollte.
Denn hier steckt die Hebelwirkung, die in dieser Artificial Analysis-Zahl verborgen ist. Dass das Modell bei einem festen Aufgabensatz 1,8-mal so viele Output-Tokens wie der Median verbraucht, bedeutet, dass eine output-gebundene Schleife 1,8-mal so viel kostet, wie der Tokenpreis allein vermuten lässt. Und der Effort-Regler ist genau dafür die Stellschraube. Berichte aus der Community deuten darauf hin, dass der Wechsel von Max herunter auf High die Output-Tokens ungefähr halbiert – eine weit größere Schwankung, als der Peak-/Off-Peak-Zeitplan Ihnen antun wird. Die Effort-Einstellung ist der große Hebel; der Zeitplan ist der kostenlose Hebel.
Was man wissen sollte, bevor man irgendetwas einplant: Die Stoßzeiten sind 01:00–04:00 und 06:00–10:00 UTC, Montag bis Freitag, und alles andere, einschließlich Wochenenden, gilt als Nebenzeit. Ein europäisches Team, das von 09:00–18:00 CET arbeitet, berührt die Stoßzeit nie. Ein Team in Peking, das zu denselben lokalen Zeiten arbeitet, trifft von 09:00–12:00 und 14:00–18:00 auf Stoßzeiten – sieben von neun Arbeitsstunden zum doppelten Preis. Dasselbe Modell, derselbe Code, die doppelte Rechnung, allein durch die Zeitzone entschieden.
Die andere kostenlose Einsparung ist der Cache-Lesetarif, 0,003 $ pro 1 Mio. gegenüber 0,15 $ für frischen Input – ein Fünfzigstel. Der Prompt eines Coding-Agenten ist größtenteils ein stabiler Präfix: Systemanweisungen, Tool-Definitionen, die Teile des Repos, die sich nicht ändern. Halte das stabile Material am Anfang und lass den variablen Inhalt dahinter folgen, und der anbieterseitige Cache erledigt den Rest. Ob rabattierter gecachter Input gilt und unter welchen Bedingungen, wird von DeepSeek und nicht vom Client festgelegt; bestätige es daher in der aktuellen Dokumentation, bevor du ein Budget darauf aufbaust – unsere eigene Modellseite für code>deepseek/deepseek-v4.1-flash/code> sagt dasselbe, nämlich dass der Tarif für gecachten Input den Bedingungen des Anbieters folgt.
Wenn Sie lieber kein zweites Abonnement hinzufügen möchten, um das Modell zu bewerten, erhalten Sie dieselbe ID über einen einzigen OpenAI-kompatiblen Endpunkt vor unserem gesamten Katalog, zum Tarif des Anbieters mit 0 % Aufschlag — sodass eine Preisänderung auf Seiten von DeepSeek hier am selben Tag live ist und nicht erst bei der nächsten Preisanpassung. Das ist besonders wichtig für genau die Situation, die dieser Artikel beschreibt: ein Modell mit einer dokumentierten Neigung weiterzumachen, auf einem Pfad, den Sie noch nicht abschließend bewertet haben. Eine Fallback-Kette bedeutet, dass ein Turn, der schiefgeht, auf einem anderen Modell landet, bevor die Antwort beginnt, statt die Anfrage fehlschlagen zu lassen.
552B, 748B oder 763B — die Größenfrage ist wirklich offen
Gib die Parameteranzahl für dieses Modell nicht als gesichert wieder, denn es sind drei verschiedene Zahlen im Umlauf, und keine davon ist schlicht falsch.
DeepSeeks eigene Modellkarte beschreibt ein Modell mit „552B Backbone-Parametern“, und das ist die vom Anbieter gemeldete Zahl – sie ist zugleich die Zahl, die im Spezifikationspanel auf unserer eigenen Modellseite angegeben wird. Dieselbe Karte führt separat ein „Engram conditional memory“-Modul mit 196B Parametern auf, auf das „spärlich über tokenbasiertes Lookup zugegriffen“ wird. Addiert man die beiden, erhält man 748B, und genau auf diese Arithmetik ist die Community-Analyse innerhalb von Stunden nach der Veröffentlichung gekommen. Und die Dateimetadaten im selben Modell-Repository geben eine Modellgröße von 763B Parametern an, was wiederum eine dritte Zahl ist.
Der scheinbare Streit ist eher ein Definitionsproblem als ein Widerspruch. Nachgeschlagene Engram-Parameter kosten Speicher, aber pro Token fast keinen Rechenaufwand, während berechnete Backbone-Parameter bei jedem Token Zeit kosten – genau deshalb weist der Anbieter sie getrennt aus und deshalb sagt ein Vergleich der Headline-Zahlen zweier Modelle mit unterschiedlichen Architekturen sehr wenig aus.
Was nicht ernsthaft bestritten wird, ist die Anzahl der aktiven Parameter: ungefähr 8B pro Token während des Prefill und 16B während des Decode, und das ist die Zahl, die tatsächlich die Inferenzkosten bestimmt. Die Gewichte sind unter einer MIT-Lizenz offen, wenn Sie das selbst überprüfen möchten. Betrachten Sie 552B als vom Anbieter angegeben, 748B als glaubwürdige Gesamtzahl der Community und jede Behauptung, die Größenfrage sei geklärt, als verfrüht.

Was vor dem 20. zu tun ist
Wenn Sie DeepSeek V4.1 Flash in einem Coding-Agenten ausprobieren möchten, ist die Reihenfolge, die am wenigsten Zeit verschwendet: zuerst das Harness auswählen, dann den Effort festlegen, dann messen.
Zum Harness: Die ehrliche Zusammenfassung der heutigen Verifikation lautet, dass alle drei Routen funktionieren und sich darin unterscheiden, was sie von dir verlangen. OpenCode Go ist ein Abonnement für 10 $ pro Monat mit einem Aktions-Multiplikator, der am 20. September ausläuft, und die Einrichtung besteht aus code>/connect/code> plus code>/models/code> ohne eine Datei, die bearbeitet werden muss. Command Code listet das Modell live in seinem eigenen Katalog auf, wechselt mit code>/model <id>/code> und stellt Effort als erstklassigen Befehl bereit. Claude Code erreicht es entweder über den Pfad der validierten Clients von OpenCode Go — wo es keinen benutzerdefinierten Header-Wrapper benötigt — oder direkt gegen DeepSeeks Endpoint im Anthropic-Format, wo der Konflikt beim Subagenten-Effort die bekannte raue Kante ist.
Was den Effort angeht: Legen Sie ihn explizit fest, und zwar eher niedrig: hoch oder den Modellstandard, falls hoch das ist, was dabei herauskommt – aber nicht maximal. Bestätigen Sie dann, dass er Ihren Rechner verlassen hat, denn es wurde festgestellt, dass zwei Harnesse ihn verwerfen.
Beim Messen sollten Sie auf Ausgabe-Tokens achten, nicht auf die Wanduhrzeit. Die Ausführlichkeit ist der Kostenfaktor, der Aufwandsregler ist die Steuerung, und der Spitzenzeitplan ist ein Zeitzonen-Zufall, den Sie kostenlos vermeiden können.
Und zu den Größenangaben, die Ihnen diese Woche zitiert werden — 552B, 748B, 763B — ist die nützliche Antwort, dass der Anbieter sein Backbone meldet, die Community das Speichermodul hinzufügt und die Repository-Metadaten wieder etwas anderes sagen. Wer eine davon als die endgültige Antwort präsentiert, hat eine Zahl ausgewählt, statt eine zu überprüfen.
