Una versione lossless e senza censure di Gemma 4 26B A4B progettata per preservare le capacità del modello originale riducendo al minimo i comportamenti di rifiuto. Ottimizzata per sviluppatori, ricercatori di IA e applicazioni avanzate che richiedono risposte di alta qualità con restrizioni minime. La variante Balanced è consigliata per la maggior parte dei carichi di lavoro, fornendo risposte complete mantenendo un ragionamento stabile e un comportamento conversazionale naturale. In alcuni scenari sensibili, il modello può inquadrare brevemente il proprio ragionamento prima di fornire la risposta completa, ma è progettato per evitare di trattenere contenuti. Rispetto a varianti senza censure più aggressive, Balanced offre un campionamento più consistente, una maggiore stabilità su contesti lunghi e una ridotta deriva tematica nelle conversazioni estese. Adatta per scrittura creativa, giochi di ruolo, assistenti multilingue, ragionamento su contesti lunghi e applicazioni IA generiche dove qualità, coerenza e affidabilità sono le priorità principali. L'accesso a questo modello è limitato e destinato a ricercatori di sicurezza, red team, ricercatori di sicurezza IA e altri professionisti qualificati che conducono ricerche, valutazioni e test legittimi.
Gemma 4 26B A4B Uncensored è un modello linguistico mixture-of-experts (MoE) della serie Gemma 4 di Google, ospitato dal fornitore Obsidian e accessibile tramite OrcaRouter. Ha 26 miliardi di…
Gemma 4 26B A4B Uncensored eccelle in compiti che richiedono ragionamento a lungo raggio su grandi contesti, come il riassunto di libri, conversazioni multi-turn con storia estesa e analisi di codebase. La sua architettura MoE la rende efficiente per l'elaborazione batch in cui molti prompt vengono gestiti contemporaneamente. Le capacità multimodali le consentono di ragionare sulle immagini, ad esempio interpretando grafici, meme o foto di prodotti. Il comportamento senza censura è ideale per la scrittura creativa che esplora temi maturi, giochi di ruolo per adulti o la generazione di narrativa senza restrizioni di contenuto. Si comporta anche bene nei benchmark NLP standard per ragionamento, matematica e codifica, simile ad altre varianti di Gemma 4.
Se il tuo task non richiede contesto lungo (ad esempio, sotto 8K token) o input multimodale, potresti essere meglio servito da un modello denso più piccolo come Gemma 2 9B o Llama 3 8B, che sono più veloci ed economici per token. Per attività che necessitano di filtri di sicurezza, il modello non censurato potrebbe produrre output inappropriati: scegli invece un modello ottimizzato per la sicurezza. Inoltre, se hai bisogno di latenza estremamente bassa per chat in tempo reale, questo modello MoE potrebbe essere più lento di un piccolo modello denso a causa del sovraccarico del routing degli esperti. Considera le tue esigenze di throughput: per richieste ad alto volume e contesto breve, un modello più economico come Gemma 2 27B (denso) potrebbe essere più conveniente.
Il design mixture-of-experts attiva solo un sottoinsieme di parametri per token (4 miliardi su un totale di 26 miliardi). Ciò riduce il costo computazionale per forward pass rispetto a un modello denso da 26B, consentendo una maggiore produttività sullo stesso hardware. Tuttavia, il routing introduce un leggero overhead di latenza per token e può portare a uno squilibrio del carico degli esperti se i prompt sono altamente specializzati. In pratica, modelli MoE come questo offrono un buon compromesso: qualità competitiva per una frazione dei FLOPs. I 4B parametri attivi sono paragonabili a un modello denso da 4B in termini di calcolo per token, ma il modello beneficia della conoscenza memorizzata in 26B parametri totali.
Sì, il modello accetta input sia di testo che di immagini. Puoi inviare una singola immagine o più immagini in una richiesta, insieme a istruzioni testuali. Le immagini vengono codificate ed elaborate insieme al testo nella finestra di contesto di 262.144 token. Ciò consente il question answering visivo, la comprensione dei documenti e attività che richiedono l'analisi di grafici, diagrammi o fotografie. Il modello utilizza un encoder visivo (tipicamente un componente simile a ViT) per convertire le immagini in token. Sebbene i dettagli esatti dell'architettura non siano documentati pubblicamente, supporta formati immagine standard. Si noti che le immagini consumano token proporzionali alla loro risoluzione, quindi le immagini ad alta risoluzione ridurranno il contesto testuale disponibile.
Come variante di Gemma 4, il modello base (con ottimizzazione della sicurezza) ha mostrato buone prestazioni nei benchmark di ragionamento come MMLU, GSM8K, e nei compiti di codifica come HumanEval e MBPP. La versione non censurata probabilmente mantiene queste capacità poiché i pesi del modello principale sono invariati. Tuttavia, punteggi specifici dei benchmark per questa variante non censurata non sono stati rilasciati. Gli utenti possono aspettarsi risultati competitivi nel ragionamento aritmetico, nella generazione di codice e nei compiti multilingue. La finestra di contesto di 262K consente anche prestazioni superiori nel recupero e nella sintesi di documenti lunghi rispetto a modelli con contesto più breve. Per i benchmark multimodali, il modello dovrebbe gestire adeguatamente i dataset di risposta a domande visive.
La latenza per il modello Gemma 4 26B A4B è generalmente inferiore a quella di un modello denso con 26B parametri, poiché solo 4B parametri sono attivi per token. Tuttavia, il meccanismo di routing MoE aggiunge un piccolo overhead a ogni token generato, quindi la latenza totale per token potrebbe essere leggermente superiore rispetto a un modello denso puro da 4B. Per l'inferenza in batch con sequenze lunghe, il throughput può essere più elevato grazie alla ridotta domanda di larghezza di banda di memoria. Su OrcaRouter, la latenza dipenderà anche dall'hardware sottostante fornito dal provider Obsidian. Le prestazioni reali dovrebbero essere testate con carichi di lavoro rappresentativi per determinare se soddisfano i requisiti di velocità.
Nonostante i suoi punti di forza, questo modello presenta dei limiti. I 4 miliardi di parametri attivi fanno sì che, per ragionamenti molto complessi o conoscenze specifiche di dominio, possa essere inferiore a modelli più grandi come Gemma 4 47B (denso) o modelli all'avanguardia. La natura non censurata implica che gli output possano essere tossici, distorti o non allineati con i valori umani se usati senza moderazione. Potrebbe inoltre generare contenuti dannosi che violano le policy di utilizzo di OpenAI quando vi si accede tramite OrcaRouter: gli utenti sono responsabili della conformità. Inoltre, l'architettura MoE può portare a una qualità incoerente tra i token se il routing degli esperti è subottimale. Infine, la comprensione multimodale, sebbene presente, potrebbe non eguagliare quella di modelli dedicati alla visione e al linguaggio.
Il prezzo per questo modello è determinato dal provider Obsidian e trasmesso da OrcaRouter senza alcun margine. Si pagano $0.25 per milione di token di input e $2.90 per milione di token di output. I token di input includono sia token di testo che di immagine (le immagini vengono tokenizzate prima dell'elaborazione). I token di output coprono la risposta generata. Non ci sono costi aggiuntivi per le chiamate API o l'uso della finestra di contesto oltre al costo per token. Questo prezzo è competitivo per un modello MoE da 26B, specialmente considerando la grande finestra di contesto. Gli addebiti vengono calcolati per richiesta e appaiono sul tuo estratto conto di OrcaRouter.
I token di output sono significativamente più costosi dei token di input ($2,90 vs $0,25 per milione). Questo è tipico per i modelli linguistici perché generare token richiede più calcoli che processare input. Per minimizzare i costi, puoi strutturare i prompt per ridurre il numero di token di output—ad esempio, chiedendo risposte più brevi o utilizzando istruzioni di sistema per limitare la verbosità. Inoltre, poiché i costi di input sono bassi, puoi permetterti di includere grandi finestre di contesto (fino a 262K token) senza spendere una fortuna. Se il tuo caso d'uso prevede molti prompt brevi ma risposte lunghe, il costo dei token di output dominerà.
OrcaRouter non fornisce un caching integrato per questo modello. Il prezzo è per token e per richiesta. Tuttavia, puoi implementare un caching lato client delle sequenze di input comuni per evitare di reinviare prompt identici. Inoltre, se ripeti lo stesso messaggio di sistema in molte conversazioni, potresti considerare di includerlo in un contesto lungo e riutilizzare la stessa sessione tramite l'API di completamento chat per evitare token di input ridondanti. Alcuni provider potrebbero offrire il caching dei prompt in modo autonomo, ma il prezzo di Obsidian come elencato non include un'opzione di caching. Controlla la documentazione del provider per eventuali sconti su prompt ripetuti.
Per utilizzare questo modello, invia richieste all'endpoint compatibile con OpenAI https://api.orcarouter.ai/v1. Imposta il parametro model su "obsidian/gemma-4-26B-A4B". La tua chiave API di OrcaRouter deve essere inclusa nell'header Authorization come token Bearer. L'API supporta sia gli endpoint per il completamento di testo che per i completamenti chat. Per la chat, utilizza l'endpoint /v1/chat/completions con un array messages che include i ruoli user, assistant e system. Per richieste multimodali, includi URL di immagini o dati in base64 nel campo content. Un esempio di corpo di richiesta in Python utilizzerebbe la libreria openai con base_url impostato sull'endpoint di OrcaRouter e l'ID del modello come sopra.
L'API supporta i parametri standard di OpenAI: temperatura (0-2, predefinito 1), top_p (0-1), max_tokens (fino alla finestra di contesto), penalità di presenza, penalità di frequenza, sequenze di stop e n (numero di completamenti). Per il multimodale, il campo content accetta un array con type "text" e type "image_url". Puoi anche impostare stream=true per risposte in streaming. Il modello supporta i messaggi di sistema. La finestra di contesto è di 262.144 token inclusi input e output. Non tutti i parametri potrebbero essere supportati esattamente come documentato; controlla la documentazione di OrcaRouter per eventuali limitazioni specifiche del provider. Per ottenere i migliori risultati, imposta la temperatura tra 0.7 e 1.0 per attività creative, e più bassa per output deterministici.
La migrazione è semplice grazie all'API compatibile con OpenAI. Se stai attualmente utilizzando il client Python di OpenAI, modifica il base_url in https://api.orcarouter.ai/v1 e imposta la tua chiave API sulla chiave OrcaRouter. Aggiorna il parametro model dal nome del modello precedente a "obsidian/gemma-4-26B-A4B". Non sono necessarie altre modifiche al codice per la maggior parte dei casi d'uso. Per le richieste multimodali, il formato dell'immagine potrebbe differire; utilizza la stessa struttura dell'API vision di OpenAI. Testa alcune richieste per garantire la compatibilità. Nota che i limiti di velocità e la gestione degli errori potrebbero differire; consulta la documentazione di OrcaRouter per le migliori pratiche.
L'URL base per tutte le chiamate API è https://api.orcarouter.ai/v1. L'identificatore esatto del modello da utilizzare nelle richieste è "obsidian/gemma-4-26B-A4B". Questo ID deve essere passato come parametro model nelle chiamate di completamento chat o completamenti. Non esiste un ID modello alternativo per questa variante. Assicurati di includere il prefisso completo 'obsidian/' per instradare correttamente al provider Obsidian. Se tenti di utilizzare un ID generico 'gemma-4-26B-A4B' senza il prefisso del provider, potrebbe non risolversi. Il prefisso del provider è necessario perché OrcaRouter supporta più provider che offrono lo stesso modello base.
Nella famiglia Gemma 4, Google offre varianti dense e MoE. La versione dense (ad esempio Gemma 4 47B) ha tutti i parametri attivi, offrendo una qualità superiore per token ma a un costo computazionale più elevato. La versione MoE con 26B totali e 4B attivi rappresenta un punto di equilibrio ideale per l'efficienza dei costi. Rispetto ai modelli dense Gemma 4 2B o 9B, questo modello ha una conoscenza più ampia grazie al numero totale di parametri maggiore. Tra i modelli MoE, Gemma 4 26B A4B è più piccolo di modelli MoE più grandi come Mixtral 8x22B (141B totali, 39B attivi). L'aspetto uncensored è esclusivo di questa variante Obsidian; gli altri modelli Gemma 4 includono un tuning di sicurezza.
I modelli non censurati come quelli della serie Llama 3-Uncensored o Wizard di solito rimuovono i filtri di sicurezza da un modello base. Questa variante di Gemma 4 è una delle poche opzioni MoE non censurate, con un numero totale di parametri maggiore (26B) ma parametri attivi inferiori (4B). Rispetto a Llama 3 70B Uncensored, è molto più piccolo ed economico, ma potrebbe avere un tetto massimo inferiore per compiti complessi. La sua finestra di contesto di 262K è significativamente più ampia rispetto alla maggior parte dei modelli non censurati, che spesso si fermano a 8K-32K. Anche il supporto multimodale è un elemento di differenziazione: la maggior parte dei modelli non censurati è solo testo.
GPT-4o e Claude 3.5 Sonnet sono modelli proprietari più grandi, con un ampio tuning di sicurezza e capacità multimodali. Generalmente superano Gemma 4 26B A4B nei benchmark e nei compiti del mondo reale, specialmente in ragionamento, creatività e coerenza. Tuttavia, sono molto più costosi per token (GPT-4o: $5/M input, $15/M output; Claude: $3/M input, $15/M output). Il modello Gemma è ideale per applicazioni sensibili ai costi che necessitano di grandi contesti ma senza restrizioni di sicurezza. Non sarà all'altezza dei modelli all'avanguardia nel seguire istruzioni sottili o nell'accuratezza fattuale, ma può essere sufficiente per molti compiti generativi.
Scegli questo modello invece di un modello più grande (come GPT-4o o Claude Opus) quando: (1) hai bisogno di un contesto molto ampio (262K) senza pagare prezzi premium; (2) richiedi output senza censure per casi d'uso consentiti; (3) il tuo carico di lavoro è ad alto throughput e l'efficienza dei costi del MoE è importante; (4) le tue attività rientrano nelle capacità di un modello con 4B parametri attivi. Evita questo modello se hai bisogno della massima qualità per decisioni critiche, un allineamento di sicurezza rigoroso o un ragionamento estremamente complesso. Per molte attività comuni come riassunti, traduzioni o Q&A su documenti lunghi, questo modello offre un ottimo rapporto qualità-prezzo.
| Input / 1M token | $0.250 |
| Output / 1M token | $2.90 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
GET /api/public/models/obsidian/gemma-4-26B-A4BApri @misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B