Gemini 3.6 Flash

google/gemini-3.6-flash
NuovoIn evidenza
VisioneAudioStrumentiJSONRagionamento
di Google · 2026-07-21

Gemini 3.6 Flash è l'ultimo modello veloce ed economicamente efficiente di Google nella famiglia Gemini 3 — un modello nativamente multimodale che legge testo, immagini, video, audio e file e risponde in testo, con una finestra di contesto da 1M token e fino a 64K token di output. È progettato per team che necessitano di qualità quasi frontier alla velocità e al prezzo della fascia Flash e rappresenta un'ottima scelta predefinita per agenti di coding, comprensione di documenti e media, retrieval-augmented generation e automazione ad alta produttività. Rispetto al precedente 3.5 Flash, è decisamente più efficiente in termini di token e meno verboso — raggiunge la stessa qualità o migliore emettendo meno token di output, riducendo direttamente costi e latenza in esecuzioni agentiche lunghe. Supporta sforzo di ragionamento configurabile (così i chiamanti possono bilanciare profondità e velocità per richiesta), tool calling nativo e output strutturati, e si comporta molto bene nelle valutazioni a contesto lungo e coding agentico per la sua fascia, incluso 91,8% su multi-needle retrieval con media 128k e punteggi competitivi su SWE-Bench Pro, Terminal-Bench e OSWorld. Gemini 3.6 Flash parla sia il formato chat-completions di OpenAI sia l'API nativa generateContent di Gemini, rendendolo un upgrade plug-and-play per integrazioni esistenti compatibili con Gemini e OpenAI. Usalo come cavallo di battaglia quotidiano quando desideri gran parte dell'intelligenza di un modello frontier senza pagare i prezzi frontier.

ctx1.05M token
Output max65.5K
Inputtext + image + video + file + audio
Outputtext
p50 TTFT1.67 s
INGRESSO$1.50/ 1M token
USCITA$7.50/ 1M token
p50 TTFT1.67 s7 g
p95 TTFT5.38 s7 g
TRAFFICO7.6Ktoken / 7 g

Google Gemini 3.6 Flash è un modello multimodale di grandi dimensioni sviluppato da Google, offerto tramite l'API di OrcaRouter con prezzi trasparenti (nessun ricarico). Accetta input di testo,…

Cos'è Google Gemini 3.6 Flash e a chi è rivolto?

Come si differenzia la variante Flash dagli altri modelli Gemini?

Quali modalità di input supporta Gemini 3.6 Flash?

Esempi di codice

Chiama da qualsiasi SDK

Compatibile con OpenAI: mantieni il tuo SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.6-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parametri supportati

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Prezzi

Input / 1M token$1.50
Output / 1M token$7.50
Lettura cache / 1M$0.150
ValutaUSD

Calcolatore dei costi

Token / mese10MM
Quota di input70%%
Stimato / mese $33.00 · Con cache dei prompt $28.28

Stima basata sul prezzo di listino

Stima di token e costo

Token di input: 17Costo per richiesta: $0.003775

Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.

Prestazioni

p50 TTFT
1.67 s
Velocità di output
712 tok/s
p95 TTFT
5.38 s
Tasso di errore
25.0%

Benchmark pubblici

69.2
AA Coding
Migliore del 87% dei modelli confrontati
n. 16 su 122
50.1
AA Intelligence
Migliore del 82% dei modelli confrontati
n. 22 su 124
CharXiv Reasoning (no tools)
85.2
CharXiv Reasoning (with tools)
89.4
DeepSWE v1.1
49.0
GDM-MRCR v2 8-needle (128k avg)
91.8
GDM-MRCR v2 8-needle (1M pointwise)
54.0
GPQA Diamond
92.8
Humanity's Last Exam
38.3
Long-Context Recall
69.7
MLE-Bench
63.9
OSWorld-Verified
83.0
SciCode
52.7
SWE-Bench Pro (Public)
58.7
tau_banking
24.5
Terminal-bench 2.1 (Terminus-2)
78.0
terminalbench_v2_1
77.5
Fonte: artificialanalysis.ai, deepmind.google

A confronto

Gemini 3.6 FlashGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Input $/M$1.50$2.00$4.00$0.50
Output $/M$7.50$12.00$18.00$3.00
Contesto1.0M1.0M1.0M1.0M
Qualità8/1010/1010/109/10
Confronta affiancatiConfronta affiancatiConfronta affiancatiConfronta affiancati

FAQ

Qual è il costo dell'utilizzo di Gemini 3.6 Flash tramite OrcaRouter?
Il prezzo è di $1,50 per 1 milione di token di input e $7,50 per 1 milione di token di output. OrcaRouter fattura alla tariffa del fornitore con margine zero. Non ci sono commissioni aggiuntive.
Qual è la finestra di contesto di Gemini 3.6 Flash?
La finestra di contesto è di 1.048.576 token (circa 1 milione di token). L'uscita massima è di 65.536 token. Il contesto include tutte le modalità di input (testo, immagine, video, file, audio).
Quali sono i punti di forza principali di questo modello?
Gemini 3.6 Flash offre una finestra di contesto molto ampia, supporta cinque modalità di input (testo, immagine, video, file, audio) e raggiunge un forte punteggio di benchmark di recupero di 91.8 su GDM-MRCR v2 8-needle (128k avg). È anche conveniente in quanto variante Flash.
Come si confronta Gemini 3.6 Flash con GPT-4o o Claude 3.5 Sonnet?
Ha una finestra di contesto più ampia (1M vs 128K/200K) e un prezzo per token più basso ($1.50/$7.50 vs ~$2.50/$10 o $3/$15). I punteggi dei benchmark non sono direttamente comparabili, ma Gemini Flash è ottimizzato per il recupero in contesti lunghi. GPT-4o e Claude possono offrire una maggiore accuratezza nel ragionamento in alcuni compiti.
Come gestisce OrcaRouter i miei dati quando uso questo modello?
OrcaRouter inoltra le tue richieste ai server di inferenza di Google. OrcaRouter non si addestra sui tuoi dati né memorizza i prompt oltre quanto necessario per l'elaborazione e la fatturazione. Si applicano le politiche sulla privacy dei dati di Google. Puoi trovare i dettagli nell'informativa sulla privacy di OrcaRouter.
Posso chiamare Gemini 3.6 Flash usando l'OpenAI Python SDK?
Sì. Imposta l'URL di base su https://api.orcarouter.ai/v1 e l'ID del modello su "google/gemini-3.6-flash". Usa la libreria OpenAI Python con la tua chiave API OrcaRouter. Esempio: client = OpenAI(api_key="your_key", base_url="https://api.orcarouter.ai/v1") poi client.chat.completions.create(model="google/gemini-3.6-flash", messages=[...]).
Il modello supporta lo streaming e le chiamate di funzione?
Tramite OrcaRouter, sì. Puoi impostare stream=true e includere tools nella richiesta. L'API traduce il formato OpenAI nell'API di Google. Testa con il tuo caso d'uso per confermare la piena compatibilità.
Qual è il significato del punteggio benchmark 91.8 su GDM-MRCR v2 8-needle?
Misura l'accuratezza del modello nel recuperare più informazioni specifiche da un contesto lungo (in media 128K token). Un punteggio del 91.8% significa che il modello ha risposto correttamente nel 91.8% degli scenari di recupero testati. Ciò indica una buona prestazione nei compiti con contesto lungo.

Incorpora questo badge

Google: Gemini 3.6 Flash$1.50/M in1666ms p50tramite OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.6-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.6-flash.svg" alt="Google: Gemini 3.6 Flash su OrcaRouter" /> </a>
Markdown [![Google: Gemini 3.6 Flash](https://www.orcarouter.ai/embed/google/gemini-3.6-flash.svg)](https://www.orcarouter.ai/models/google/gemini-3.6-flash)

Scheda del modello come dati

GET /api/public/models/google/gemini-3.6-flashApri
Leggibile dalle macchine:/llms.txt/llms-full.txt