Gemma 4 26B A4B

google/gemma-4-26b-a4b-it
VisãoFerramentasJSONRaciocínio
por Google · 2026-04-03

Gemma 4 26B A4B IT é um modelo de Mistura de Especialistas (MoE) ajustado por instruções do Google DeepMind. Apesar de 25.2B parâmetros totais, apenas 3.8B são ativados por token durante a inferência — entregando qualidade próxima de 31B a...

ctx262K tokens
Entradatext + image + video
Saídatext
p50 TTFT2.38 s
ENTRADA$0.06/ 1M tokens
SAÍDA$0.33/ 1M tokens
p50 TTFT2.38 s7 d
p95 TTFT10.00 s7 d
TRÁFEGO7.3Mtokens / 7 d

Gemma 4 26B A4B é um modelo Mixture-of-Experts desenvolvido pelo Google. Ele tem 26 bilhões de parâmetros no total, mas apenas 4 bilhões estão ativos por token—esse design reduz o custo computacional…

O que é Gemma 4 26B A4B?

Quem deve usar este modelo?

Como faço para acessar o Gemma 4 26B A4B através do OrcaRouter?

Exemplos de código

Chame de qualquer SDK

Compatível com OpenAI — mantenha seu SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="google/gemma-4-26b-a4b-it",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parâmetros suportados

  • frequency_penalty
  • include_reasoning
  • logit_bias
  • logprobs
  • max_tokens
  • min_p
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Preços

Preços
Entrada / 1M tokens$0.060
Saída / 1M tokens$0.330
Leitura de cache / 1M$0.0075
MoedaUSD

Calculadora de custos

Tokens / mês10MM
Proporção de entrada70%%
Estimado / mês $1.41 · Com cache de prompt $1.23

Estimativa com base no preço de tabela

Estimador de tokens e custo

Tokens de entrada: 15Custo por solicitação: $0.000166

Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.

Desempenho

p50 TTFT
2.38 s
Velocidade de saída
66.8 tok/s
p95 TTFT
10.00 s
Taxa de erro
17.7%

Benchmarks públicos

39.3
AA Coding
Melhor que 39% dos modelos comparados
nº 83 de 138
16.7
AA Intelligence
Melhor que 25% dos modelos comparados
nº 109 de 147
70.5
AA Math
Melhor que 62% dos modelos comparados
nº 31 de 82
GPQA Diamond
79.2
Humanity's Last Exam
19.3
IFBench
72.4
Long-Context Recall
65.7
MMLU-Pro
73.5 index
SciCode
40.0
tau_banking
12.0
TerminalBench Hard
13.6
terminalbench_v2_1
39.0
τ²-Bench
43.6
Fonte: artificialanalysis.ai

Atividade da comunidade

Do que os desenvolvedores estão falando esta semana

Hacker News0 menções · 7 d

Comparativo

Gemma 4 26B A4BGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Entrada $/M$0.06$2.00$4.00$0.50
Saída $/M$0.33$12.00$18.00$3.00
Contexto262K1.0M1.0M1.0M
Qualidade5/1010/1010/109/10
Comparar lado a ladoComparar lado a ladoComparar lado a ladoComparar lado a lado

FAQ

Quanto custa o Gemma 4 26B A4B por token?
Tokens de entrada custam $0.06 por 1M tokens, tokens de saída custam $0.33 por 1M tokens. Essas taxas são cobradas à taxa do provedor com zero markup da OrcaRouter.
Qual é o tamanho da janela de contexto?
A janela de contexto é de 262.144 tokens. Isso inclui tokens de texto, imagem e vídeo. O comprimento efetivo que você pode usar depende do total de tokens na sua solicitação.
Quais são os principais pontos fortes do modelo?
Os pontos fortes incluem compreensão multimodal (texto, imagem, vídeo), uma grande janela de contexto, eficiência MoE (26B total, 4B ativo) e uma forte pontuação GPQA Diamond de 79.2 para raciocínio científico.
Como ele se compara ao Gemma 3 8B?
Gemma 4 tem um contexto maior (262k vs 128k), suporta vídeo e tem uma pontuação mais alta no GPQA. É mais capaz para tarefas multimodais complexas, mas mais caro por token.
O modelo suporta entrada de vídeo?
Sim, ele aceita vídeo via URL ou sequências de imagens. Você pode fornecer uma URL de vídeo no array de conteúdo. O modelo processará os frames e responderá perguntas sobre o vídeo.
Como faço para chamar este modelo via API do OrcaRouter?
Use a URL base https://api.orcarouter.ai/v1, o ID do modelo google/gemma-4-26b-a4b-it, e envie um POST para /chat/completions com os parâmetros padrão da OpenAI para entradas de texto ou multimodais.
O OrcaRouter adiciona alguma margem ao preço do provedor?
Não, a OrcaRouter cobra exatamente a taxa do provedor, sem margem de lucro. Você paga $0.06/$0.33 por milhão de tokens, o mesmo que se estivesse usando o Google diretamente.
Quais considerações de tratamento de dados ou privacidade se aplicam?
O tratamento de dados segue os termos de serviço da OrcaRouter e a política de privacidade específica do modelo do Google. A OrcaRouter não utiliza seus dados para treinar seus modelos. Consulte a página de privacidade da OrcaRouter para mais detalhes.
Posso usar este modelo para aplicações em tempo real?
Sim, a API suporta streaming (stream=true). No entanto, a latência depende do tamanho da entrada, hardware e concorrência. Teste com seu caso de uso específico para avaliar a adequação para necessidades em tempo real.
Quais são as limitações deste modelo?
As limitações incluem: apenas 4B parâmetros ativos por token, portanto tarefas que exigem profundidade de raciocínio extrema podem ter um desempenho pior do que modelos densos muito maiores. Não suporta entrada de áudio. O custo pode ser alto para entradas de vídeo muito longas devido ao uso de tokens.

Incorporar este selo

Google: Gemma 4 26B A4B•$0.06/M in•2384ms p50•via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemma-4-26b-a4b-it" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemma-4-26b-a4b-it.svg" alt="Google: Gemma 4 26B A4B no OrcaRouter" /> </a>
Markdown [![Google: Gemma 4 26B A4B](https://www.orcarouter.ai/embed/google/gemma-4-26b-a4b-it.svg)](https://www.orcarouter.ai/models/google/gemma-4-26b-a4b-it)

Ficha do modelo como dados

GET /api/public/models/google/gemma-4-26b-a4b-itAbrir
Legível por máquina:/llms.txt/llms-full.txt