Uma versão sem perdas e sem censura do Gemma 4 26B A4B projetada para preservar as capacidades do modelo original enquanto minimiza o comportamento de recusa. Otimizada para desenvolvedores, pesquisadores de IA e aplicações avançadas que exigem respostas de alta qualidade com restrições mínimas. A variante Balanced é recomendada para a maioria das cargas de trabalho, fornecendo respostas completas enquanto mantém raciocínio estável e comportamento conversacional natural. Em alguns cenários sensíveis, o modelo pode enquadrar brevemente seu raciocínio antes de fornecer a resposta completa, mas é projetado para evitar reter conteúdo. Comparada a variantes sem censura mais agressivas, a Balanced oferece amostragem mais consistente, maior estabilidade em contextos longos e menor desvio de tópico em conversas extensas. Bem adequada para escrita criativa, roleplay, assistentes multilíngues, raciocínio em contextos longos e aplicações de IA de uso geral onde qualidade, coerência e confiabilidade são as principais prioridades. O acesso a este modelo é restrito e destinado a pesquisadores de segurança, red teams, pesquisadores de segurança de IA e outros profissionais qualificados que realizam pesquisa, avaliação e testes legítimos.
Gemma 4 26B A4B Uncensored é um modelo de linguagem de mistura de especialistas (MoE) da série Gemma 4 do Google, hospedado pelo provedor Obsidian e acessível através do OrcaRouter. Possui 26 bilhões…
Gemma 4 26B A4B Uncensored se destaca em tarefas que exigem raciocínio de longo alcance sobre grandes contextos, como sumarização de livros, conversas de múltiplas interações com histórico extenso e análise de bases de código. Sua arquitetura MoE o torna eficiente para processamento em lote, onde muitos prompts são tratados simultaneamente. Capacidades multimodais permitem que ele raciocine sobre imagens — por exemplo, interpretando gráficos, memes ou fotos de produtos. O comportamento sem censura é ideal para escrita criativa que explora temas adultos, roleplay adulto ou geração de ficção sem restrições de conteúdo. Ele também tem bom desempenho em benchmarks padrão de NLP para raciocínio, matemática e codificação, semelhante a outras variantes do Gemma 4.
Se a sua tarefa não exigir contexto longo (por exemplo, abaixo de 8K tokens) ou entrada multimodal, você pode ser melhor atendido por um modelo denso menor, como Gemma 2 9B ou Llama 3 8B, que são mais rápidos e mais baratos por token. Para tarefas que precisam de filtros de segurança, o modelo sem censura pode produzir saídas inadequadas — escolha em vez disso um modelo ajustado para segurança. Além disso, se você precisar de latência extremamente baixa para chat em tempo real, este modelo MoE pode ser mais lento que um modelo denso pequeno devido à sobrecarga de roteamento de especialistas. Considere suas necessidades de throughput: para solicitações de alto volume e contexto curto, um modelo mais barato como Gemma 2 27B (denso) pode ser mais econômico.
O design de mistura de especialistas ativa apenas um subconjunto de parâmetros por token (4 bilhões de um total de 26 bilhões). Isso reduz o custo computacional por passagem direta em comparação com um modelo denso de 26B, permitindo maior throughput no mesmo hardware. No entanto, o roteamento introduz uma pequena sobrecarga de latência por token e pode levar a desequilíbrio de carga entre especialistas se os prompts forem altamente especializados. Na prática, modelos MoE como este oferecem um bom equilíbrio: qualidade competitiva por uma fração dos FLOPs. Os 4B de parâmetros ativos são comparáveis a um modelo denso de 4B em termos de computação por token, mas o modelo se beneficia do conhecimento armazenado em 26B de parâmetros totais.
Sim, o modelo aceita tanto entrada de texto quanto de imagens. Você pode enviar uma única imagem ou várias imagens em uma requisição, juntamente com instruções de texto. As imagens são codificadas e processadas junto com o texto dentro da janela de contexto de 262.144 tokens. Isso possibilita respostas a perguntas visuais, compreensão de documentos e tarefas que exigem a análise de gráficos, diagramas ou fotografias. O modelo utiliza um codificador visual (tipicamente um componente semelhante ao ViT) para converter imagens em tokens. Embora os detalhes exatos da arquitetura não sejam publicamente documentados, ele suporta formatos de imagem padrão. Observe que as imagens consomem tokens proporcionais à sua resolução, portanto imagens de alta resolução reduzirão o contexto de texto disponível.
Como uma variante do Gemma 4, o modelo base (com ajuste de segurança) mostrou forte desempenho em benchmarks de raciocínio como MMLU, GSM8K, e tarefas de codificação como HumanEval e MBPP. A versão não censurada provavelmente mantém essas capacidades, já que os pesos principais do modelo permanecem inalterados. No entanto, pontuações específicas de benchmark para esta variante não censurada não foram divulgadas. Os usuários podem esperar resultados competitivos em raciocínio aritmético, geração de código e tarefas multilíngues. A janela de contexto de 262K também permite desempenho superior em recuperação de documentos longos e sumarização em comparação com modelos de contexto mais curto. Para benchmarks multimodais, o modelo deve lidar adequadamente com conjuntos de dados de resposta a perguntas visuais.
A latência do modelo Gemma 4 26B A4B é geralmente menor do que a de um modelo denso de 26B parâmetros, porque apenas 4B parâmetros estão ativos por token. No entanto, o mecanismo de roteamento MoE adiciona uma pequena sobrecarga a cada token gerado, portanto, a latência total por token pode ser ligeiramente maior do que a de um modelo denso puro de 4B. Para inferência em lote com sequências longas, a taxa de transferência pode ser maior devido à redução das demandas de largura de banda de memória. No OrcaRouter, a latência também dependerá do hardware subjacente provisionado pelo provedor Obsidian. O desempenho no mundo real deve ser testado com cargas de trabalho representativas para determinar se atende aos seus requisitos de velocidade.
Apesar de seus pontos fortes, este modelo tem limitações. Os 4B parâmetros ativos significam que, para raciocínio muito complexo ou conhecimento específico de domínio, ele pode ter desempenho inferior a modelos maiores como o Gemma 4 47B (denso) ou modelos de fronteira. A natureza não censurada significa que as saídas podem ser tóxicas, tendenciosas ou desalinhadas com valores humanos se usadas sem moderação. Ele também pode gerar conteúdo prejudicial que viola as políticas de uso da OpenAI quando acessado por meio do OrcaRouter — os usuários são responsáveis pela conformidade. Além disso, a arquitetura MoE pode levar a qualidade inconsistente entre tokens se o roteamento de especialistas for subótimo. Por fim, a compreensão multimodal, embora presente, pode não corresponder a modelos dedicados de visão-linguagem.
O preço para este modelo é determinado pelo provedor Obsidian e repassado pela OrcaRouter sem margem de lucro. Você paga US$ 0,25 por milhão de tokens de entrada e US$ 2,90 por milhão de tokens de saída. Os tokens de entrada incluem tokens de texto e imagem (as imagens são tokenizadas antes do processamento). Os tokens de saída cobrem a resposta gerada. Não há taxas adicionais para chamadas de API ou uso da janela de contexto além do custo por token. Este preço é competitivo para um modelo MoE de 26B, especialmente dada a grande janela de contexto. Os encargos são calculados por solicitação e aparecem no seu extrato de faturamento da OrcaRouter.
Tokens de saída são significativamente mais caros que tokens de entrada ($2,90 vs $0,25 por milhão). Isso é típico para modelos de linguagem porque gerar tokens requer mais computação do que processar entrada. Para minimizar custos, você pode estruturar prompts para reduzir o número de tokens de saída—por exemplo, pedindo respostas mais curtas ou usando instruções do sistema para limitar a verbosidade. Além disso, como os custos de entrada são baixos, você pode incluir grandes janelas de contexto (até 262 mil tokens) sem gastar muito. Se seu caso de uso envolve muitos prompts curtos, mas respostas longas, o custo dos tokens de saída dominará.
OrcaRouter não oferece caching embutido para este modelo. O preço é por token e por requisição. No entanto, você pode implementar caching no lado do cliente para sequências de entrada comuns, a fim de evitar reenviar prompts idênticos. Além disso, se você repetir a mesma mensagem de sistema em várias conversas, pode considerar incluí-la em um contexto longo e reutilizar a mesma sessão através da API de chat completions para evitar tokens de entrada redundantes. Alguns provedores podem oferecer caching de prompt por conta própria, mas o preço da Obsidian conforme listado não inclui uma opção de caching. Verifique a documentação do provedor para possíveis descontos em prompts repetidos.
Para usar este modelo, envie solicitações para o endpoint compatível com OpenAI https://api.orcarouter.ai/v1. Defina o parâmetro model como "obsidian/gemma-4-26B-A4B". Sua chave de API da OrcaRouter deve ser incluída no cabeçalho Authorization como token Bearer. A API suporta endpoints de conclusão de texto e conclusão de chat. Para chat, use o endpoint /v1/chat/completions com um array de mensagens que inclui papéis de usuário, assistente e sistema. Para solicitações multimodais, inclua URLs de imagem ou dados em base64 no campo content. Um exemplo de corpo de requisição em Python usaria a biblioteca openai com base_url definido para o endpoint da OrcaRouter e o ID do modelo como acima.
A API suporta parâmetros padrão do OpenAI: temperature (0-2, padrão 1), top_p (0-1), max_tokens (até a janela de contexto), presence_penalty, frequency_penalty, stop sequences e n (número de conclusões). Para multimodal, o campo content aceita uma matriz com tipo "text" e tipo "image_url". Você também pode definir stream=true para respostas em streaming. O modelo suporta mensagens do sistema. A janela de contexto é de 262,144 tokens, incluindo entrada e saída. Nem todos os parâmetros podem ser suportados exatamente como documentados; verifique a documentação do OrcaRouter para quaisquer limitações específicas do provedor. Para melhores resultados, defina temperature entre 0.7 e 1.0 para tarefas criativas e mais baixo para saídas determinísticas.
A migração é direta devido à API compatível com a OpenAI. Se você estiver usando atualmente o cliente Python da OpenAI, altere o base_url para https://api.orcarouter.ai/v1 e defina sua chave de API como sua chave OrcaRouter. Atualize o parâmetro model do nome do modelo anterior para "obsidian/gemma-4-26B-A4B". Nenhuma outra alteração de código é necessária para a maioria dos casos de uso. Para solicitações multimodais, o formato da imagem pode diferir; use a mesma estrutura da API de visão da OpenAI. Teste algumas solicitações para garantir a compatibilidade. Observe que os limites de taxa e o tratamento de erros podem ser diferentes; consulte a documentação da OrcaRouter para práticas recomendadas.
A URL base para todas as chamadas de API é https://api.orcarouter.ai/v1. O identificador exato do modelo a ser usado nas requisições é "obsidian/gemma-4-26B-A4B". Esse ID deve ser passado como parâmetro model em chamadas de chat completions ou completions. Não há um ID de modelo alternativo para essa variante. Certifique-se de incluir o prefixo completo 'obsidian/' para rotear corretamente ao provedor Obsidian. Se você tentar usar um ID genérico 'gemma-4-26B-A4B' sem o prefixo do provedor, ele pode não ser resolvido. O prefixo do provedor é necessário porque o OrcaRouter oferece suporte a vários provedores que oferecem o mesmo modelo base.
Na família Gemma 4, a Google oferece variantes densas e MoE. A versão densa (ex.: Gemma 4 47B) possui todos os parâmetros ativos, proporcionando maior qualidade por token, mas com maior custo computacional. A versão MoE com 26B totais e 4B ativos oferece um ponto ideal de custo-benefício. Comparado ao Gemma 4 2B ou 9B denso, este modelo possui conhecimento mais amplo devido ao maior número total de parâmetros. Entre os modelos MoE, o Gemma 4 26B A4B é menor que modelos MoE maiores, como o Mixtral 8x22B (141B totais, 39B ativos). O aspecto não censurado é exclusivo desta variante Obsidian; outros modelos Gemma 4 incluem ajustes de segurança.
Modelos não censurados como os da série Llama 3-Uncensored ou Wizard geralmente removem os filtros de segurança de um modelo base. Esta variante do Gemma 4 é uma das poucas opções não censuradas MoE, oferecendo uma contagem de parâmetros total maior (26B) com parâmetros ativos menores (4B). Comparado ao Llama 3 70B Uncensored, é muito menor e mais barato, mas pode ter um teto inferior em tarefas complexas. Sua janela de contexto de 262K é significativamente maior do que a maioria dos modelos não censurados, que geralmente têm limite de 8K a 32K. O suporte multimodal também é um diferencial: a maioria dos modelos não censurados são somente texto.
GPT-4o e Claude 3.5 Sonnet são modelos maiores e proprietários, com ajuste extensivo de segurança e capacidades multimodais. Eles geralmente superam o Gemma 4 26B A4B em benchmarks e tarefas do mundo real, especialmente em raciocínio, criatividade e consistência. No entanto, são muito mais caros por token (GPT-4o: $5/M input, $15/M output; Claude: $3/M input, $15/M output). O modelo Gemma é ideal para aplicações sensíveis a custo que precisam de contexto grande, mas sem restrições de segurança. Ele não igualará os modelos de fronteira em seguir instruções sutis ou precisão factual, mas pode ser suficiente para muitas tarefas generativas.
Escolha este modelo em vez de um modelo maior (como GPT-4o ou Claud Opus) quando: (1) você precisar de um contexto muito grande (262K) sem pagar preços premium; (2) exigir saídas não censuradas para casos de uso permitidos; (3) sua carga de trabalho for de alto rendimento e a eficiência de custo do MoE for relevante; (4) suas tarefas estiverem dentro da capacidade de um modelo com 4B de parâmetros ativos. Evite este modelo se precisar da mais alta qualidade para decisões críticas, alinhamento rigoroso de segurança ou raciocínio extremamente complexo. Para muitas tarefas comuns, como resumo, tradução ou perguntas e respostas sobre documentos longos, este modelo oferece uma forte relação custo-benefício.
| Entrada / 1M tokens | $0.250 |
| Saída / 1M tokens | $2.90 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
GET /api/public/models/obsidian/gemma-4-26B-A4BAbrir @misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B