
DeepSeek V4.1 Flash in OpenCode: configurazione, costo e il selettore dell'impegno che nessuno menziona
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 151 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 251 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
DeepSeek V4.1 Flash è presente in OpenCode Go dal 10 settembre, e il moltiplicatore che OpenCode gli ha associato ha una data di fine pubblicata: il 20 settembre. Mancano quattro giorni. La parte interessante non è la scadenza — è che l'impostazione che stabilisce se sia piacevole programmare con questo modello manca da ogni guida di configurazione nella prima pagina dei risultati, e in almeno due harness viene eliminata silenziosamente. Questo è un playbook per indirizzare un agente di coding verso DeepSeek V4.1 Flash: gli id esatti dei modelli, le tre integrazioni verificate oggi, il controllo del reasoning effort segnalato dalla community e la modalità di errore dell'overthinking con le mitigazioni che funzionano davvero.
A cosa stai effettivamente puntando il tuo agente
DeepSeek V4.1 Flash è stato rilasciato il 2026-09-10 — la nota di rilascio sulla documentazione API di DeepSeek è datata quel giorno, ed è il modello più piccolo della nuova famiglia di architetture del fornitore. DeepSeek riporta un backbone mixture-of-experts da 552 miliardi di parametri costruito su quello che definisce un design Causal Encoder–Decoder, attivando circa 8 miliardi di parametri per token durante il prefill e 16 miliardi durante il decode. Accetta testo e immagini come input e restituisce testo, offre una finestra di contesto fino a un milione di token e genererà fino a 384.000 token in una singola risposta — i limiti di contesto e di output provengono entrambi dalla pagina modello di OrcaRouter per questo modello, che elenca rispettivamente 1.048.576 e 384.000.
I benchmark del fornitore, dal grafico sulla pagina di rilascio di DeepSeek e quindi dichiarati dal fornitore e non verificati: 30,0 su Terminal-Bench 3.0, 74,2 su DeepSWE v1.1, 88,1 su CyberGym, 54,8 su Automation-Bench e 90,9 su GPQA Diamond. Le valutazioni indipendenti sono più rade ma esistono — Artificial Analysis, consultato direttamente oggi, colloca DeepSeek V4.1 Flash a 40 sul suo Intelligence Index, al 6° posto su 113 nella sua classe di confronto. Una riga di quella stessa pagina conta, per chi legge nell'ottica degli agenti di programmazione, più del posizionamento: Artificial Analysis etichetta il modello come molto verboso, avendo consumato 250 milioni di token in output per completare la sua esecuzione dell'Intelligence Index contro una mediana di 140 milioni. Ci torneremo.
Due dettagli sui nomi fanno risparmiare tempo concreto nel debug. L'id canonico del modello dell'API di DeepSeek ora è code>deepseek-flash/code>. Le stringhe più vecchie code>deepseek-v4-flash/code> e code>deepseek-v4-flash-vision-exp/code> sono ancora accettate, ma i modelli che stanno dietro di esse sono stati dismessi e le richieste vengono servite da V4.1 Flash al prezzo di Flash. Separatamente, DeepSeek V4 Pro non è sparito: la documentazione di DeepSeek afferma che il servizio API V4 Pro continua oltre il 2026-09-14 con fatturazione invariata. Se ti è stato detto che il modello di punta è stato disattivato, non è ciò che dicono i documenti stessi del fornitore.

OpenCode: due percorsi per entrare, e l'id da digitare davvero
Ci sono due modi per mettere DeepSeek V4.1 Flash dietro OpenCode, e hanno economie diverse.
La via dell'abbonamento è OpenCode Go, un piano da 10 $ al mese che OpenCode descrive come un insieme curato di modelli di coding aperti che ha testato e valutato con benchmark. La configurazione richiede quattro passaggi e non c'è alcun file di configurazione da modificare a mano: accedi a OpenCode Zen, sottoscrivi Go, copia la chiave API, poi esegui code>/connect/code> nella TUI, scegli OpenCode Go e incolla la chiave. Dopodiché code>/models/code> elenca ciò che è disponibile. I riferimenti ai modelli nella configurazione hanno la forma code>opencode-go/<model-id>/code>.
Quale ID del modello? Entrambi. L'elenco dei modelli del gateway Go stesso, recuperato oggi da code>https://opencode.ai/zen/go/v1/models/code>, restituisce code>deepseek-flash/code> e code>deepseek-v4.1-flash/code> come due voci distinte, insieme ai legacy code>deepseek-v4-flash/code> e code>deepseek-v4-pro/code>. Una qualsiasi delle prime due corrisponde al modello che vuoi; code>deepseek-flash/code> è il nome canonico e la scelta più sicura per qualsiasi cosa tu intenda mantenere in esecuzione.
La rotta diretta salta del tutto l'abbonamento: esegui code>/connect/code>, cerca DeepSeek e incolla una chiave della piattaforma DeepSeek. Vieni poi fatturato da DeepSeek al prezzo di listino invece di attingere a una quota Go. DeepSeek pubblica come prezzo di listino $0,15 per 1M di token in input e $0,60 per 1M di token in output nelle ore non di punta, con le letture in cache a $0,003 per 1M — ed esattamente il doppio di tali cifre durante le ore di punta. Sia la documentazione di OpenCode Go sia la pagina del modello di OrcaRouter, consultate oggi, concordano su questi valori.
Ciò che OpenCode Go aggiunge è la struttura delle quote, e qui i numeri meritano un'attenta lettura, perché sono il motivo per cui la scadenza è importante. La documentazione di OpenCode elenca DeepSeek V4.1 Flash con un limite mensile di 15 $, attualmente moltiplicato per 4 fino a 60 $ nell'ambito di una promozione che OpenCode contrassegna come "Termina il 20 set". Le stime del numero di richieste sono pubblicate in due colonne: 6.500 ogni 5 ore / 16.250 a settimana / 32.500 al mese alla tariffa standard, oppure 26.000 / 65.000 / 130.000 con il moltiplicatore 4× applicato. La forma della quota è coerente tra i modelli — il limite di 5 ore è il 20% della cifra mensile, il limite settimanale è il 50%, e il limite mensile è l'intero importo.
Quelli sono i numeri pubblicati da OpenCode, letti oggi dalla sua documentazione Go. La promozione sta a loro concluderla, ed è datata.

Command Code: ancora attivo, e una segnalazione di bug che vale la pena conoscere
Il catalogo di Command Code elenca ancora il modello a partire da oggi, con l'id code>deepseek-v4-1-flash/code>, con una finestra di contesto da 1M token e la stessa economia di pass-through: $0,15 / $0,60 fuori punta, $0,30 / $1,20 in punta, $0,003 per lettura in cache. Il fatto che i prezzi coincidano su due harness indipendenti non è una coincidenza: entrambi stanno applicando il prezzo di listino di DeepSeek anziché stabilirne uno proprio.
Il funzionamento è semplice. Installa con code>npm i -g command-code/code>, eseguilo dalla directory del tuo progetto, autenticati con code>/login/code>, e usa code>/connect/code> se vuoi usare la tua chiave del provider. code>/model <id>/code> applica direttamente un cambio di modello, mentre un semplice code>/model/code> apre un selettore, e code>/effort/code> imposta lo sforzo di ragionamento per il modello corrente — il flag che conta di più qui.
Vale la pena tenere a mente un bug report della community prima di eseguire il debug del livello sbagliato. Una issue aperta contro un livello di routing di terze parti descrive una cache di replay del reasoning che non si attiva mai per l'code>command-code/deepseek-v4.1-flash/code> id, perché il pattern su cui il livello di routing esegue il match si aspetta un code>v4./code> o code>v4-/code> come segmento e la stringa è code>v4.1/code>. Il sintomo segnalato è costituito da errori 400 upstream che lamentano che il contenuto di reasoning prodotto in modalità thinking deve essere rimandato all'API. Si tratta di un bug report della community su un matcher lato client, non di una linea guida del fornitore e non di un problema del modello — ma è esattamente il tipo di cosa che alle 2 di notte sembra un guasto del modello.
Claude Code, Codex e i client validati da OpenCode stesso
OpenCode Go non è pensato solo per OpenCode, e la loro documentazione lo dice esplicitamente: è progettato per OpenCode e per altri agenti di coding che generano schemi di richiesta simili, con un elenco pubblicato di client validati come funzionanti. Attualmente quell'elenco comprende Hermes, Claude Code, Codex, ZCode e Pi — e per Claude Code la nota è che "riconosce il proprio header di sessione nativo. Non serve alcun wrapper con header personalizzati." Due requisiti lo accompagnano: identificare il proprio client con il suo user agent anziché con un nome SDK generico, e inviare un identificatore di sessione stabile nell'header code>x-opencode-session/code> a ogni conversazione, ed è questo che permette al loro routing e alla cache dei prompt di funzionare. Per Hermes conta la build validata — la correzione dell'header è stata integrata dopo la v0.21.0, quindi quella release da sola non la include.
Esiste anche una route senza alcun abbonamento associato, che utilizza direttamente l'endpoint di DeepSeek compatibile con Anthropic. Imposta code>ANTHROPIC_BASE_URL/code> su code>https://api.deepseek.com/anthropic/code>, code>ANTHROPIC_AUTH_TOKEN/code> sulla tua chiave DeepSeek, e punta le variabili del modello sul modello desiderato. I nomi dei modelli Claude vengono rimappati in ingresso: qualsiasi nome che inizi con code>claude-opus/code> viene indirizzato a DeepSeek V4 Pro e fatturato al prezzo di V4 Pro, mentre i nomi code>claude-sonnet/code> e code>claude-haiku/code> vengono indirizzati al modello Flash. Il suffisso code>[1m]/code> sulla stringa del modello richiede la variante di contesto da un milione di token. Anche la guida di DeepSeek per questa configurazione imposta code>CLAUDE_CODE_EFFORT_LEVEL=max/code> e fissa la finestra di auto-compact a 786432 token.
Quell'ultima variabile è dove risiede una correzione della comunità. Esiste un proxy di workaround perché le recenti build di Claude Code inviano code>thinking: {"type": "disabled"}/code> sulle richieste dei subagent mentre code>CLAUDE_CODE_EFFORT_LEVEL=max/code> aggiunge un parametro reasoning-effort, e l'endpoint di DeepSeek in formato Anthropic rifiuta questa combinazione con un messaggio che indica che le opzioni di thinking non possono essere disabilitate quando è impostato il reasoning effort. Il workaround segnalato è limitato — rimuovere il parametro effort solo dalle richieste dei subagent, lasciando intatto l'agente principale. Consideralo un riscontro della comunità su un disallineamento del contratto client/server, e aspettati che il confine esatto della versione cambi.
La manopola dello sforzo: 1–100, e perché "basso" significa 50
Tutto ciò che trovi in questa sezione è il risultato di osservazioni della comunità, non indicazioni ufficiali del fornitore. DeepSeek non pubblica una mappatura da preset a numero che possiamo verificare, e i numeri riportati di seguito provengono da resoconti di professionisti e documentazione di harness di terze parti. Sono abbastanza coerenti tra le fonti da essere utili, ma anche abbastanza non confermati da richiedere che tu li verifichi sul tuo lavoro.
DeepSeek V4.1 Flash è addestrato con uno scalare continuo di sforzo di ragionamento da 1 a 100. Non è un limite di token — sposta il punto in cui il modello si colloca su una curva appresa dal processo di addestramento, dove uno sforzo inferiore applica maggiore pressione verso la concisione e uno sforzo superiore rende il ragionamento aggiuntivo più economico. Tre preset pubblici corrispondono a quella scala:
• Basso — 50, il percorso più breve, e il preset che conferisce al controllo la sua reputazione di economicità.
• Alto — 75, e il livello che la maggior parte delle fonti della community descrive come il tetto sensato per il lavoro degli agenti.
• Max — 100, dove la penalità sulla lunghezza del ragionamento viene rimossa del tutto.
Ciò che la manopola garantisce è reale, ma con rendimenti nettamente decrescenti. Una serie di benchmark della community ha riportato che aumentare l'effort da 25 a 100 ha spostato Terminal-Bench 2.1 da 82,4 a 90,6, moltiplicando al contempo i token di output complessivi di circa 2,5×. I resoconti convergono su un effort compreso tra 60 e 80, che cattura la maggior parte della precisione disponibile con meno della metà del budget di token, mentre il massimo aggiunge un ulteriore 1,6–1,8× alle traiettorie dell'agente per un guadagno marginale.
Il valore predefinito è la parte su cui nessuno concorda. Parte della documentazione dell'harness e alcuni resoconti di professionisti affermano che un effort non impostato viene risolto in high; altri descrivono il default del server come semplicemente sconosciuto. Ciò che è documentato anziché dibattuto è che si è scoperto che due integrazioni harness non inviavano affatto il parametro — il profilo provider OpenCode Go e un profilo DeepSeek nativo omettevano entrambi l'emissione di code>reasoning_effort/code> per lo code>deepseek-flash/code> slug, perché la loro guardia di corrispondenza si aspettava un code>deepseek-v…/code> come prefisso che l'id canonico non ha. In entrambi i casi l'impostazione scelta dall'utente è stata silenziosamente sostituita dal default del provider. Se il tuo client mostra un controllo effort, non è prova che sia sulla rete. Registra un corpo di richiesta e controlla.
Un'altra anomalia dalle stesse segnalazioni: l'endpoint OpenCode Go accetta code>low/code>, code>medium/code>, code>high/code> e code>max/code>, ma rifiuta un valore intero per effort — è stato segnalato che un valore di 80 restituisce HTTP 400. La scala 1–100 esiste nel modello, ma non è esposta come numero grezzo ovunque, quindi "imposta effort a 65" potrebbe non essere esprimibile nel tuo client.
La modalità di fallimento del pensare troppo, e ciò che in realtà la corregge
Questa è la modalità di fallimento che determina se mantenere il modello nel tuo ciclo di lavoro. Le segnalazioni della community descrivono DeepSeek V4.1 Flash che continua a ragionare dopo che il lavoro è terminato: discute di nuovo un punto a cui ha già risposto correttamente, racconta la correzione dei propri presupposti errati e produce lunghe catene di ragionamento con bassa densità informativa. Un professionista ha segnalato che l'output di ragionamento è continuato per oltre un'ora all'interno di una sessione CLI di programmazione. Un altro ha riferito di non essere riuscito in alcun modo a fargli completare una lunga esecuzione di benchmark.
Una nota sulle fonti su quel secondo rapporto, perché è il tipo di affermazione che viene riciclata. Proviene da un thread della community sull'esecuzione affidabile del modello, e Reddit blocca il nostro fetcher, quindi non abbiamo potuto leggere il thread direttamente — stiamo riportando il rapporto anziché citare una pagina che abbiamo aperto. Ciò che abbiamo potuto verificare in modo indipendente è la forma del problema, e su questo le prove esterne sono insolitamente chiare: Artificial Analysis, sulla propria pagina, segnala il modello come molto verboso, con un consumo di 250M token di output per completare un'esecuzione che il suo modello di confronto mediano conclude in 140M. Si tratta di circa 1,8×, misurato da una terza parte, su un insieme di attività fisso. I resoconti del forum e la metrica indipendente descrivono lo stesso comportamento.
Le mitigazioni che derivano da quei rapporti, tutte provenienti dalla comunità:
• Fissa l'effort su high o inferiore e rifiutati di lasciarlo salire progressivamente. La correzione più esplicita osservata sul campo è un plugin di routing scritto appositamente per fermare l'escalation dell'effort: la profondità del turno non contribuisce in alcun modo al punteggio di escalation, contano solo un risultato di tool fallito o un retry identico, l'escalation è limitata da un tetto massimo, e max è opt-in e declassato per impostazione predefinita. Se il tuo harness consente a un agente di aumentare da solo il proprio effort man mano che una run si allunga, quello è il meccanismo da disattivare.
• Non usare max come impostazione predefinita. Diversi professionisti riferiscono che max gira a vuoto invece di convergere su attività di routine, e che tornare a high lo risolve.
• Limita code>max_tokens/code> sui percorsi interattivi. Un tetto di output di 384.000 token è un limite, non un obiettivo, e un ciclo che non termina è costoso a quel tetto.
• Verifica che il parametro venga inviato. Dato che due harness sono stati scoperti mentre lo omettevano silenziosamente, "l'ho impostato su high" e "high è arrivato all'API" sono affermazioni diverse.
• L'harness conta più di quanto ci si aspetterebbe. Chi lo esegue con gli stessi pesi segnala comportamenti nettamente diversi a seconda della shell — lo stesso modello che litiga con se stesso e seppellisce il segnale in un harness non attira nessuna di quelle lamentele in un altro. Si tratta di un'osservazione della comunità sul comportamento dell'harness, non di un'affermazione di un fornitore sul modello, ma è il consiglio più ripetuto nei report.
Quanto costa davvero un ciclo di coding a queste tariffe
Il prezzo di listino di DeepSeek è $0,15 per 1 milione di token di input e $0,60 per 1 milione di token di output nelle ore non di punta — l'output costa quattro volte l'input, ed è la prima cosa da interiorizzare riguardo a un agente che genera sia ragionamento sia codice.
Considera un turno realistico di un agente: 60.000 token di contesto (prompt di sistema, schemi degli strumenti, una porzione di repo, cronologia della conversazione) in input, e 3.000 token di ragionamento più una patch in output. Sono 60.000 × $0,15/1M = $0,009 in input, più 3.000 × $0,60/1M = $0,0018 in output, quindi circa 1,1 centesimi per turno. Duecento turni di questo tipo in una giornata lavorativa sono circa $2,16, ovvero circa $47 nell'arco di un mese di giorni feriali alla tariffa non di punta. Questa è l'aritmetica che fa sembrare generosa un'indennità mensile di $15 con in più una promo 4× — e l'aritmetica che rende la verbosità la cosa da tenere d'occhio.
Perché ecco la leva che si nasconde in quel dato di Artificial Analysis. Il fatto che il modello usi 1,8× i token di output mediani su un set di attività fisso significa che un loop vincolato dall'output costa 1,8× rispetto a quanto suggerirebbe il solo prezzo dei token. E la manopola dell'effort è il controllo proprio per questo. Le segnalazioni della community indicano che il passaggio da max a high dimezza all'incirca i token di output — una variazione molto più ampia di qualsiasi effetto possa avere su di te la pianificazione peak/off-peak. L'impostazione dell'effort è la leva che conta di più; la pianificazione è quella che non costa nulla.
Cosa vale la pena sapere prima di pianificare qualsiasi cosa: le ore di punta sono 01:00–04:00 e 06:00–10:00 UTC, dal lunedì al venerdì, e tutto il resto, compresi i fine settimana, è fuori punta. Un team europeo che lavora dalle 09:00 alle 18:00 CET non tocca mai le ore di punta. Un team a Pechino che lavora le stesse ore locali si trova nelle ore di punta dalle 09:00 alle 12:00 e dalle 14:00 alle 18:00 — sette delle nove ore lavorative a doppio prezzo. Stesso modello, stesso codice, bolletta doppia, deciso interamente dal fuso orario.
L'altro risparmio gratuito è la tariffa di lettura dalla cache, 0,003 $ per 1M contro 0,15 $ per l'input nuovo — un cinquantesimo. Il prompt di un agente di programmazione è per lo più un prefisso stabile: istruzioni di sistema, definizioni degli strumenti, le parti del repository che non cambiano. Tieni il materiale stabile all'inizio e lascia che il contenuto variabile lo segua, e la cache lato provider fa il resto. Se l'input in cache scontato si applichi, e a quali condizioni, è stabilito da DeepSeek e non dal client, quindi verificalo nella documentazione aggiornata prima di basarci un budget — la nostra pagina del modello per code>deepseek/deepseek-v4.1-flash/code> dice la stessa cosa, ovvero che la tariffa per l'input in cache segue i termini del provider.
Se preferisci non aggiungere un secondo abbonamento per valutare il modello, lo stesso id è disponibile tramite un endpoint compatibile con OpenAI davanti al nostro intero catalogo, alla tariffa del provider con 0% di ricarico — così una variazione di prezzo da parte di DeepSeek è attiva qui lo stesso giorno, anziché al successivo aggiornamento dei prezzi. Questo conta soprattutto proprio per la situazione descritta in questo articolo: un modello con una tendenza documentata a proseguire, su un percorso che non hai ancora finito di valutare. Una catena di fallback fa sì che un turno che va storto approdi su un altro modello prima che la risposta inizi, invece di far fallire la richiesta.
552B, 748B o 763B — la questione della dimensione è davvero aperta
Non dare per assodato il numero di parametri di questo modello, perché circolano tre numeri diversi e nessuno di essi è semplicemente sbagliato.
La model card di DeepSeek descrive un modello con «552B parametri backbone», e questa è la cifra riportata dal fornitore — è anche il numero presente nel pannello delle specifiche sulla nostra pagina del modello. La stessa card elenca separatamente un modulo «memoria condizionale Engram» da 196B parametri, «accesso sparso tramite ricerca basata su token». Sommando i due si ottiene 748B, che è l'aritmetica a cui è approdata l'analisi della community nel giro di poche ore dal rilascio. E i metadati del file sullo stesso repository del modello indicano una dimensione del modello di 763B parametri, che è ancora una terza cifra.
L'apparente disputa è di natura definitoria, non una contraddizione. I parametri Engram consultati costano memoria ma quasi nessuna aritmetica per token, mentre i parametri backbone calcolati costano tempo su ogni token — ed è esattamente per questo che il fornitore li riporta separatamente e che confrontare i numeri principali di due modelli con architetture diverse dice molto poco.
Ciò che non è seriamente contestato è il numero di parametri attivi: circa 8B per token durante il prefill e 16B durante il decode, ed è questo il numero che governa effettivamente il costo di inferenza. I pesi sono aperti con licenza MIT se vuoi verificare tutto questo da solo. Considera 552B come dichiarato dal fornitore, 748B come un totale credibile della comunità, e qualsiasi affermazione secondo cui la questione della dimensione sia chiusa come prematura.

Cosa fare prima del 20
Se hai intenzione di provare DeepSeek V4.1 Flash in un agente di programmazione, l'ordine che fa perdere meno tempo è: scegli prima l'harness, poi fissa l'effort, quindi misura.
Sul sistema di prova, il riassunto onesto della verifica di oggi è che tutte e tre le route funzionano e differiscono in ciò che ti richiedono. OpenCode Go è un abbonamento da 10 $ al mese con un moltiplicatore promozionale che scade il 20 settembre, e la configurazione è code>/connect/code> più code>/models/code> senza alcun file da modificare. Command Code elenca il modello in tempo reale nel proprio catalogo, si passa con code>/model <id>/code>, ed espone l'effort come comando di prima classe. Claude Code vi arriva o tramite il percorso dei client validati di OpenCode Go — dove non serve alcun wrapper di header personalizzato — oppure direttamente contro l'endpoint in formato Anthropic di DeepSeek, dove il conflitto sull'effort dei subagent è il noto punto spinoso.
Per quanto riguarda l'effort, impostalo esplicitamente e impostalo piuttosto basso: high, o il default del modello se high è quello che risulta essere, e non max. Poi conferma che abbia lasciato la tua macchina, perché è stato riscontrato che due harness lo omettono.
Sulla misurazione, tieni d'occhio i token di output anziché il tempo reale. La verbosità è il costo, la manopola dell'impegno è il controllo, e l'orario di punta è un incidente di fuso orario che puoi evitare gratis.
E sulle dichiarazioni di dimensione che ti verranno citate questa settimana — 552B, 748B, 763B — la risposta utile è che il fornitore dichiara il suo backbone, la comunità aggiunge il modulo di memoria, e i metadati del repository dicono ancora qualcos'altro. Chiunque presenti uno di questi come la risposta definitiva ha scelto un numero invece di verificarlo.
