Une version sans perte et non censurée de Gemma 4 26B A4B conçue pour préserver les capacités du modèle original tout en minimisant le comportement de refus. Optimisée pour les développeurs, les chercheurs en IA et les applications avancées nécessitant des réponses de haute qualité avec un minimum de restrictions. La variante Balanced est recommandée pour la plupart des charges de travail, offrant des réponses complètes tout en maintenant un raisonnement stable et un comportement conversationnel naturel. Dans certains scénarios sensibles, le modèle peut brièvement encadrer son raisonnement avant de fournir la réponse complète, mais il est conçu pour éviter de retenir le contenu. Comparée à des variantes non censurées plus agressives, Balanced offre un échantillonnage plus cohérent, une meilleure stabilité sur des contextes longs et une dérive thématique réduite lors de conversations prolongées. Bien adapté à l'écriture créative, au jeu de rôle, aux assistants multilingues, au raisonnement sur contexte long et aux applications d'IA généralistes où la qualité, la cohérence et la fiabilité sont les priorités principales. L'accès à ce modèle est restreint et destiné aux chercheurs en sécurité, aux équipes rouges, aux chercheurs en sécurité de l'IA et à d'autres professionnels qualifiés menant des recherches, évaluations et tests légitimes.
Gemma 4 26B A4B Uncensored est un modèle de langage à mélange d'experts (MoE) de la série Gemma 4 de Google, hébergé par le fournisseur Obsidian et accessible via OrcaRouter. Il possède 26 milliards…
Gemma 4 26B A4B Uncensored excelle dans les tâches qui nécessitent un raisonnement à longue portée sur de grands contextes, comme le résumé de livres, les conversations à plusieurs tours avec un historique étendu, et l'analyse de code. Son architecture MoE le rend efficace pour le traitement par lots où de nombreux prompts sont traités simultanément. Les capacités multimodales lui permettent de raisonner sur des images—par exemple, interpréter des graphiques, des mèmes ou des photos de produits. Le comportement non censuré est idéal pour l'écriture créative qui explore des thèmes adultes, le jeu de rôle pour adultes, ou la génération de fiction sans restrictions de contenu. Il performe également bien sur les benchmarks NLP standard pour le raisonnement, les mathématiques et le codage, similaire aux autres variantes de Gemma 4.
Si votre tâche ne nécessite pas un long contexte (par exemple, moins de 8K tokens) ou une entrée multimodale, vous pourriez être mieux servi par un modèle dense plus petit comme Gemma 2 9B ou Llama 3 8B, qui sont plus rapides et moins chers par token. Pour les tâches qui nécessitent des filtres de sécurité, le modèle non censuré pourrait produire des sorties inappropriées — choisissez plutôt un modèle ajusté pour la sécurité. De plus, si vous avez besoin d'une latence extrêmement faible pour un chat en temps réel, ce modèle MoE peut être plus lent qu'un petit modèle dense en raison de la surcharge de routage des experts. Tenez compte de vos besoins en débit : pour les requêtes à volume élevé et contexte court, un modèle moins cher comme Gemma 2 27B (dense) pourrait être plus rentable.
La conception par mélange d'experts n'active qu'un sous-ensemble de paramètres par jeton (4 milliards sur un total de 26 milliards). Cela réduit le coût de calcul par passage avant par rapport à un modèle dense de 26B, permettant un débit plus élevé sur le même matériel. Cependant, le routage introduit un léger surcoût de latence par jeton et peut entraîner un déséquilibre de charge des experts si les prompts sont hautement spécialisés. En pratique, les modèles MoE comme celui-ci offrent un bon compromis : une qualité compétitive pour une fraction des FLOPs. Les 4B de paramètres actifs sont comparables à un modèle dense de 4B en termes de calcul par jeton, mais le modèle bénéficie des connaissances stockées dans les 26B de paramètres totaux.
Oui, le modèle accepte à la fois des entrées textuelles et des images. Vous pouvez envoyer une seule image ou plusieurs images dans une requête, accompagnées d’instructions textuelles. Les images sont encodées et traitées avec le texte dans la fenêtre de contexte de 262 144 tokens. Cela permet de répondre à des questions visuelles, de comprendre des documents, et d’effectuer des tâches nécessitant l’analyse de graphiques, de diagrammes ou de photographies. Le modèle utilise un encodeur visuel (généralement un composant de type ViT) pour convertir les images en tokens. Bien que les détails précis de l’architecture ne soient pas documentés publiquement, il prend en charge les formats d’image standard. Notez que les images consomment des tokens proportionnellement à leur résolution, donc les images haute résolution réduiront le contexte texte disponible.
En tant que variante de Gemma 4, le modèle de base (avec réglage de sécurité) a montré de solides performances sur des benchmarks de raisonnement comme MMLU, GSM8K, et des tâches de codage telles que HumanEval et MBPP. La version non censurée conserve probablement ces capacités puisque les poids du modèle principal restent inchangés. Cependant, les scores spécifiques de cette variante non censurée n'ont pas été publiés. Les utilisateurs peuvent s'attendre à des résultats compétitifs en raisonnement arithmétique, génération de code et tâches multilingues. La fenêtre de contexte de 262K permet également une performance supérieure pour la récupération et le résumé de longs documents par rapport aux modèles avec un contexte plus court. Pour les benchmarks multimodaux, le modèle devrait traiter correctement les ensembles de données de questions-réponses visuelles.
La latence du modèle Gemma 4 26B A4B est généralement inférieure à celle d’un modèle dense de 26B paramètres, car seuls 4B paramètres sont actifs par jeton. Cependant, le mécanisme de routage MoE ajoute une légère surcharge à chaque jeton généré, donc la latence totale par jeton peut être légèrement supérieure à celle d’un modèle dense pur de 4B. Pour l’inférence par lots avec de longues séquences, le débit peut être plus élevé grâce à une demande réduite en bande passante mémoire. Sur OrcaRouter, la latence dépendra également du matériel sous-jacent fourni par le fournisseur Obsidian. Les performances réelles doivent être testées avec des charges de travail représentatives pour déterminer si elles répondent à vos exigences de vitesse.
Malgré ses points forts, ce modèle présente des limites. Les 4B de paramètres actifs signifient que pour un raisonnement très complexe ou des connaissances spécifiques à un domaine, il peut être moins performant que des modèles plus grands comme Gemma 4 47B (dense) ou les modèles de pointe. La nature non censurée signifie que les sorties peuvent être toxiques, biaisées ou désalignées avec les valeurs humaines si utilisées sans modération. Il peut également générer du contenu nuisible qui enfreint les politiques d'utilisation d'OpenAI lorsqu'il est accédé via OrcaRouter—les utilisateurs sont responsables de la conformité. De plus, l'architecture MoE peut entraîner une qualité incohérente entre les tokens si le routage des experts est sous-optimal. Enfin, la compréhension multimodale, bien que présente, peut ne pas égaler celle de modèles dédiés vision-langage.
Le prix de ce modèle est déterminé par le fournisseur Obsidian et transmis par OrcaRouter sans aucune marge. Vous payez 0,25 $ par million de tokens d'entrée et 2,90 $ par million de tokens de sortie. Les tokens d'entrée incluent à la fois les tokens de texte et les tokens d'image (les images sont tokenisées avant traitement). Les tokens de sortie couvrent la réponse générée. Il n'y a pas de frais supplémentaires pour les appels API ou l'utilisation de la fenêtre de contexte au-delà du coût par token. Ce prix est compétitif pour un modèle MoE de 26B, surtout compte tenu de la grande fenêtre de contexte. Les frais sont calculés par requête et apparaissent sur votre relevé de facturation OrcaRouter.
Les jetons de sortie sont nettement plus chers que les jetons d'entrée (2,90 $ contre 0,25 $ par million). C'est typique pour les modèles de langage, car générer des jetons nécessite plus de calculs que traiter les entrées. Pour minimiser les coûts, vous pouvez structurer les invites afin de réduire le nombre de jetons de sortie, par exemple en demandant des réponses plus courtes ou en utilisant des instructions système pour limiter la verbosité. De plus, comme les coûts d'entrée sont faibles, vous pouvez vous permettre d'inclure de grandes fenêtres de contexte (jusqu'à 262 000 jetons) sans vous ruiner. Si votre cas d'utilisation implique de nombreuses invites courtes mais des réponses longues, le coût des jetons de sortie dominera.
OrcaRouter ne fournit pas de mise en cache intégrée pour ce modèle. La tarification est par jeton et par requête. Cependant, vous pouvez implémenter une mise en cache côté client des séquences d'entrée courantes pour éviter de renvoyer des invites identiques. De plus, si vous répétez le même message système dans de nombreuses conversations, vous pourriez envisager de l'inclure dans un contexte long et de réutiliser la même session via l'API de complétion de chat pour éviter les jetons d'entrée redondants. Certains fournisseurs peuvent offrir leur propre mise en cache des invites, mais la tarification d'Obsidian telle qu'indiquée n'inclut pas d'option de mise en cache. Consultez la documentation du fournisseur pour tout rabais potentiel sur les invites répétées.
Pour utiliser ce modèle, envoyez des requêtes au point de terminaison compatible OpenAI https://api.orcarouter.ai/v1. Définissez le paramètre model sur "obsidian/gemma-4-26B-A4B". Votre clé API d'OrcaRouter doit être incluse dans l'en-tête Authorization sous forme de jeton Bearer. L'API prend en charge à la fois les points de terminaison de complétion de texte et de complétion de chat. Pour le chat, utilisez le point de terminaison /v1/chat/completions avec un tableau messages incluant les rôles user, assistant et system. Pour les requêtes multimodales, incluez des URL d'images ou des données base64 dans le champ content. Un exemple de corps de requête en Python utiliserait la bibliothèque openai avec base_url défini sur le point de terminaison d'OrcaRouter et l'ID du modèle comme ci-dessus.
L'API prend en charge les paramètres standards d'OpenAI : temperature (0-2, défaut 1), top_p (0-1), max_tokens (jusqu'à la fenêtre de contexte), presence_penalty, frequency_penalty, séquences d'arrêt, et n (nombre de complétions). Pour le multimodal, le champ content accepte un tableau avec le type "text" et le type "image_url". Vous pouvez également définir stream=true pour les réponses en streaming. Le modèle prend en charge les messages système. La fenêtre de contexte est de 262 144 tokens, entrée et sortie comprises. Certains paramètres peuvent ne pas être pris en charge exactement comme documenté ; consultez la documentation d'OrcaRouter pour les limitations propres à chaque fournisseur. Pour de meilleurs résultats, définissez temperature entre 0.7 et 1.0 pour les tâches créatives, et plus bas pour des résultats déterministes.
La migration est simple grâce à l'API compatible avec OpenAI. Si vous utilisez actuellement le client Python d'OpenAI, modifiez le base_url en https://api.orcarouter.ai/v1 et définissez votre clé API sur votre clé OrcaRouter. Mettez à jour le paramètre model en remplaçant l'ancien nom de modèle par "obsidian/gemma-4-26B-A4B". Aucune autre modification de code n'est requise pour la plupart des cas d'utilisation. Pour les requêtes multimodales, le format de l'image peut différer ; utilisez la même structure que l'API vision d'OpenAI. Testez quelques requêtes pour vérifier la compatibilité. Notez que les limites de débit et la gestion des erreurs peuvent différer ; consultez la documentation d'OrcaRouter pour les bonnes pratiques.
L'URL de base pour tous les appels API est https://api.orcarouter.ai/v1. L'identifiant exact du modèle à utiliser dans les requêtes est "obsidian/gemma-4-26B-A4B". Cet identifiant doit être passé comme paramètre model dans les appels de complétion de chat ou de complétion. Il n'existe pas d'identifiant de modèle alternatif pour cette variante. Assurez-vous d'inclure le préfixe complet 'obsidian/' pour router correctement vers le fournisseur Obsidian. Si vous tentez d'utiliser un identifiant générique 'gemma-4-26B-A4B' sans le préfixe du fournisseur, il pourrait ne pas être résolu. Le préfixe du fournisseur est nécessaire car OrcaRouter prend en charge plusieurs fournisseurs offrant le même modèle de base.
Dans la famille Gemma 4, Google propose des variantes denses et MoE. La version dense (par exemple, Gemma 4 47B) a tous ses paramètres actifs, offrant une qualité supérieure par token mais à un coût de calcul plus élevé. La version MoE avec 26B au total et 4B actifs représente un point idéal pour un bon rapport coût-efficacité. Comparé aux modèles denses Gemma 4 2B ou 9B, ce modèle dispose de connaissances plus vastes grâce à un nombre total de paramètres plus important. Parmi les modèles MoE, Gemma 4 26B A4B est plus petit que des modèles MoE plus grands comme Mixtral 8x22B (141B au total, 39B actifs). L'aspect non censuré est unique à cette variante Obsidian ; les autres modèles Gemma 4 incluent des réglages de sécurité.
Les modèles non censurés comme ceux de la série Llama 3-Uncensored ou Wizard suppriment généralement les filtres de sécurité d'un modèle de base. Cette variante Gemma 4 est l'une des rares options MoE non censurées, offrant un nombre total de paramètres plus élevé (26B) avec des paramètres actifs plus faibles (4B). Comparé à Llama 3 70B Uncensored, il est beaucoup plus petit et moins cher, mais peut avoir un plafond plus bas pour les tâches complexes. Sa fenêtre de contexte de 262K est nettement plus grande que celle de la plupart des modèles non censurés, qui plafonnent souvent à 8K-32K. Le support multimodal constitue également un élément différenciateur : la plupart des modèles non censurés sont limités au texte.
GPT-4o et Claude 3.5 Sonnet sont des modèles propriétaires plus volumineux, dotés d'un réglage de sécurité approfondi et de capacités multimodales. Ils surpassent généralement Gemma 4 26B A4B dans les benchmarks et les tâches du monde réel, notamment en matière de raisonnement, de créativité et de cohérence. Cependant, ils sont beaucoup plus chers par token (GPT-4o : 5 $/M d'entrée, 15 $/M de sortie ; Claude : 3 $/M d'entrée, 15 $/M de sortie). Le modèle Gemma est idéal pour les applications sensibles aux coûts nécessitant un grand contexte mais sans restrictions de sécurité. Il n'égalera pas les modèles de pointe en matière de suivi d'instructions subtiles ou de précision factuelle, mais peut être suffisant pour de nombreuses tâches génératives.
Choisissez ce modèle plutôt qu’un modèle plus grand (comme GPT-4o ou Claud Opus) lorsque : (1) vous avez besoin d’une très grande fenêtre de contexte (262K) sans payer des prix premium ; (2) vous exigez des résultats non censurés pour des cas d’utilisation autorisés ; (3) votre charge de travail est à haut débit et l’efficacité du coût MoE est importante ; (4) vos tâches sont à la portée d’un modèle à 4B paramètres actifs. Évitez ce modèle si vous avez besoin de la plus haute qualité pour des décisions critiques, un alignement de sécurité strict, ou un raisonnement extrêmement complexe. Pour de nombreuses tâches courantes comme le résumé, la traduction ou les questions-réponses sur de longs documents, ce modèle offre un excellent rapport qualité-prix.
| Entrée / 1M tokens | $0.250 |
| Sortie / 1M tokens | $2.90 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/obsidian/gemma-4-26B-A4BOuvrir @misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B