Gemini 3.6 Flash

google/gemini-3.6-flash
NovoDestaque
VisãoÁudioFerramentasJSONRaciocínio
por Google · 2026-07-21

O Gemini 3.6 Flash é o modelo mais recente, rápido e econômico da Google na família Gemini 3 — um modelo nativamente multimodal que lê texto, imagens, vídeo, áudio e arquivos e responde em texto, com uma janela de contexto de 1M tokens e até 64K tokens de saída. Ele foi desenvolvido para equipes que precisam de qualidade próxima à fronteira com velocidade e preço de nível Flash, e é uma escolha padrão robusta para agentes de codificação, compreensão de documentos e mídia, geração aumentada por recuperação e automação de alto rendimento. Em comparação com o Flash 3.5 anterior, ele é significativamente mais eficiente em termos de tokens e menos verboso — atingindo a mesma ou melhor qualidade enquanto emite menos tokens de saída, o que reduz diretamente o custo e a latência em execuções agentivas longas. Ele suporta esforço de raciocínio configurável (para que os chamadores possam ajustar a profundidade em relação à velocidade por solicitação), chamada de ferramentas nativa e saídas estruturadas, e se sai muito bem em avaliações de contexto longo e codificação agentiva para sua categoria, incluindo 91,8% na recuperação de múltiplas agulhas com média de 128k e pontuações competitivas em SWE-Bench Pro, Terminal-Bench e OSWorld. O Gemini 3.6 Flash fala tanto o formato chat-completions do OpenAI quanto a API generateContent nativa do Gemini, tornando-se uma atualização plugável para integrações existentes compatíveis com Gemini e OpenAI. Use-o como o cavalo de batalha do dia a dia quando quiser a maior parte da inteligência de um modelo de fronteira sem pagar preços de fronteira.

ctx1.05M tokens
Saída máx.65.5K
Entradatext + image + video + file + audio
Saídatext
p50 TTFT1.67 s
ENTRADA$1.50/ 1M tokens
SAÍDA$7.50/ 1M tokens
p50 TTFT1.67 s7 d
p95 TTFT5.38 s7 d
TRÁFEGO7.6Ktokens / 7 d

Google Gemini 3.6 Flash é um grande modelo multimodal desenvolvido pelo Google, oferecido através da API da OrcaRouter com preços transparentes (sem margem de lucro). Aceita entradas de texto,…

O que é Google Gemini 3.6 Flash e para quem é?

Como a variante Flash difere dos outros modelos Gemini?

Quais modalidades de entrada o Gemini 3.6 Flash suporta?

Exemplos de código

Chame de qualquer SDK

Compatível com OpenAI — mantenha seu SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.6-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parâmetros suportados

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Preços

Entrada / 1M tokens$1.50
Saída / 1M tokens$7.50
Leitura de cache / 1M$0.150
MoedaUSD

Calculadora de custos

Tokens / mês10MM
Proporção de entrada70%%
Estimado / mês $33.00 · Com cache de prompt $28.28

Estimativa com base no preço de tabela

Estimador de tokens e custo

Tokens de entrada: 15Custo por solicitação: $0.003772

Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.

Desempenho

p50 TTFT
1.67 s
Velocidade de saída
712 tok/s
p95 TTFT
5.38 s
Taxa de erro
25.0%

Benchmarks públicos

69.2
AA Coding
Melhor que 87% dos modelos comparados
nº 16 de 122
50.1
AA Intelligence
Melhor que 82% dos modelos comparados
nº 22 de 124
CharXiv Reasoning (no tools)
85.2
CharXiv Reasoning (with tools)
89.4
DeepSWE v1.1
49.0
GDM-MRCR v2 8-needle (128k avg)
91.8
GDM-MRCR v2 8-needle (1M pointwise)
54.0
GPQA Diamond
92.8
Humanity's Last Exam
38.3
Long-Context Recall
69.7
MLE-Bench
63.9
OSWorld-Verified
83.0
SciCode
52.7
SWE-Bench Pro (Public)
58.7
tau_banking
24.5
Terminal-bench 2.1 (Terminus-2)
78.0
terminalbench_v2_1
77.5
Fonte: artificialanalysis.ai, deepmind.google

Comparativo

Gemini 3.6 FlashGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Entrada $/M$1.50$2.00$4.00$0.50
Saída $/M$7.50$12.00$18.00$3.00
Contexto1.0M1.0M1.0M1.0M
Qualidade8/1010/1010/109/10
Comparar lado a ladoComparar lado a ladoComparar lado a ladoComparar lado a lado

FAQ

Qual é o custo de usar o Gemini 3.6 Flash através do OrcaRouter?
O preço é de $1.50 por 1 milhão de tokens de entrada e $7.50 por 1 milhão de tokens de saída. A OrcaRouter cobra pela taxa do provedor com margem zero. Não há taxas adicionais.
Qual é a janela de contexto do Gemini 3.6 Flash?
A janela de contexto é de 1.048.576 tokens (aproximadamente 1 milhão de tokens). A saída máxima é de 65.536 tokens. O contexto inclui todas as modalidades de entrada (texto, imagem, vídeo, arquivo, áudio).
Quais são os principais pontos fortes deste modelo?
O Gemini 3.6 Flash oferece uma janela de contexto muito grande, suporta cinco modalidades de entrada (texto, imagem, vídeo, arquivo, áudio) e atinge uma forte pontuação de benchmark de recuperação de 91,8 no GDM-MRCR v2 8-needle (média de 128k). Também é econômico como uma variante Flash.
Como o Gemini 3.6 Flash se compara ao GPT-4o ou ao Claude 3.5 Sonnet?
Tem um contexto maior (1M vs 128K/200K) e preço por token mais baixo ($1.50/$7.50 vs ~$2.50/$10 ou $3/$15). As pontuações de benchmark não são diretamente comparáveis, mas o Gemini Flash é otimizado para recuperação de contexto longo. GPT-4o e Claude podem oferecer maior precisão de raciocínio em algumas tarefas.
Como o OrcaRouter lida com meus dados quando uso este modelo?
O OrcaRouter encaminha suas solicitações para os servidores de inferência do Google. O OrcaRouter não treina com seus dados nem armazena prompts além do necessário para processamento e faturamento. As políticas de privacidade de dados do Google se aplicam. Você pode encontrar detalhes na política de privacidade do OrcaRouter.
Posso chamar o Gemini 3.6 Flash usando o SDK Python da OpenAI?
Sim. Defina a URL base para https://api.orcarouter.ai/v1 e o ID do modelo para "google/gemini-3.6-flash". Use a biblioteca OpenAI Python com sua chave de API OrcaRouter. Exemplo: client = OpenAI(api_key="your_key", base_url="https://api.orcarouter.ai/v1") então client.chat.completions.create(model="google/gemini-3.6-flash", messages=[...]).
O modelo suporta streaming e chamada de funções?
Através do OrcaRouter, sim. Você pode definir stream=true e incluir ferramentas na requisição. A API traduz o formato OpenAI para a API do Google. Teste com seu caso de uso para confirmar a compatibilidade total.
Qual é o significado da pontuação de benchmark 91.8 no GDM-MRCR v2 8-needle?
Ele mede a precisão do modelo em recuperar várias informações específicas de um contexto longo (média de 128 mil tokens). Uma pontuação de 91,8% significa que o modelo respondeu corretamente em 91,8% dos cenários de recuperação testados. Isso indica um bom desempenho em tarefas de contexto longo.

Incorporar este selo

Google: Gemini 3.6 Flash$1.50/M in1666ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.6-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.6-flash.svg" alt="Google: Gemini 3.6 Flash no OrcaRouter" /> </a>
Markdown [![Google: Gemini 3.6 Flash](https://www.orcarouter.ai/embed/google/gemini-3.6-flash.svg)](https://www.orcarouter.ai/models/google/gemini-3.6-flash)

Ficha do modelo como dados

GET /api/public/models/google/gemini-3.6-flashAbrir
Legível por máquina:/llms.txt/llms-full.txt