Una versión sin pérdidas y sin censura de Gemma 4 26B A4B diseñada para preservar las capacidades del modelo original mientras minimiza el comportamiento de rechazo. Optimizada para desarrolladores, investigadores de IA y aplicaciones avanzadas que requieren respuestas de alta calidad con restricciones mínimas. La variante Balanced se recomienda para la mayoría de las cargas de trabajo, ofreciendo respuestas completas mientras mantiene un razonamiento estable y un comportamiento conversacional natural. En algunos escenarios sensibles, el modelo puede enmarcar brevemente su razonamiento antes de proporcionar la respuesta completa, pero está diseñado para evitar retener contenido. En comparación con variantes sin censura más agresivas, Balanced ofrece un muestreo más consistente, mayor estabilidad en contextos largos y menor desviación temática en conversaciones extendidas. Ideal para escritura creativa, juegos de rol, asistentes multilingües, razonamiento en contextos largos y aplicaciones de IA de uso general donde la calidad, la coherencia y la fiabilidad sean las prioridades principales. El acceso a este modelo está restringido y destinado a investigadores de seguridad, equipos rojos, investigadores de seguridad de IA y otros profesionales calificados que realicen investigaciones, evaluaciones y pruebas legítimas.
Gemma 4 26B A4B Uncensored es un modelo de lenguaje de mezcla de expertos (MoE) de la serie Gemma 4 de Google, alojado por el proveedor Obsidian y accesible a través de OrcaRouter. Tiene 26 mil…
Gemma 4 26B A4B Uncensored se destaca en tareas que requieren razonamiento de largo alcance sobre grandes contextos, como resumen de libros, conversaciones de múltiples turnos con historial extenso y análisis de código fuente. Su arquitectura MoE la hace eficiente para el procesamiento por lotes donde se manejan muchas solicitudes de forma concurrente. Las capacidades multimodales le permiten razonar sobre imágenes, por ejemplo, interpretando gráficos, memes o fotos de productos. El comportamiento sin censura es ideal para escritura creativa que explora temas maduros, juegos de rol para adultos o generación de ficción sin restricciones de contenido. También funciona bien en evaluaciones estándar de PLN para razonamiento, matemáticas y programación, similar a otras variantes de Gemma 4.
Si tu tarea no requiere un contexto largo (por ejemplo, menos de 8K tokens) o entrada multimodal, podría ser más adecuado usar un modelo denso más pequeño como Gemma 2 9B o Llama 3 8B, que son más rápidos y baratos por token. Para tareas que necesiten filtros de seguridad, el modelo sin censura podría generar resultados inapropiados: elige en su lugar un modelo ajustado para seguridad. Además, si necesitas una latencia extremadamente baja para chat en tiempo real, este modelo MoE puede ser más lento que un modelo denso pequeño debido a la sobrecarga del enrutamiento de expertos. Considera tus necesidades de rendimiento: para solicitudes de gran volumen y contexto corto, un modelo más barato como Gemma 2 27B (denso) podría ser más rentable.
El diseño de mezcla de expertos activa solo un subconjunto de parámetros por token (4 mil millones de un total de 26 mil millones). Esto reduce el costo computacional por paso forward en comparación con un modelo denso de 26B, lo que permite un mayor rendimiento en el mismo hardware. Sin embargo, el enrutamiento introduce una ligera sobrecarga de latencia por token y puede provocar un desequilibrio de carga entre los expertos si las instrucciones están muy especializadas. En la práctica, los modelos MoE como este ofrecen un buen equilibrio: calidad competitiva por una fracción de los FLOPs. Los 4B parámetros activos son comparables a un modelo denso de 4B en términos de cómputo por token, pero el modelo se beneficia del conocimiento almacenado en los 26B parámetros totales.
Sí, el modelo acepta tanto entradas de texto como de imagen. Puede enviar una sola imagen o varias imágenes en una solicitud, junto con instrucciones de texto. Las imágenes se codifican y procesan junto con el texto dentro de la ventana de contexto de 262.144 tokens. Esto permite responder preguntas visuales, comprender documentos y realizar tareas que requieren analizar gráficos, diagramas o fotografías. El modelo utiliza un codificador visual (generalmente un componente similar a ViT) para convertir las imágenes en tokens. Si bien los detalles exactos de la arquitectura no están documentados públicamente, admite formatos de imagen estándar. Tenga en cuenta que las imágenes consumen tokens proporcionales a su resolución, por lo que las imágenes de alta resolución reducirán el contexto de texto disponible.
Como variante de Gemma 4, el modelo base (con ajuste de seguridad) ha demostrado un rendimiento sólido en puntos de referencia de razonamiento como MMLU, GSM8K y tareas de codificación como HumanEval y MBPP. Es probable que la versión sin censura conserve estas capacidades, ya que los pesos principales del modelo no cambian. Sin embargo, no se han publicado puntuaciones específicas de referencia para esta variante sin censura. Los usuarios pueden esperar resultados competitivos en razonamiento aritmético, generación de código y tareas multilingües. La ventana de contexto de 262K también permite un rendimiento superior en la recuperación y resumen de documentos largos en comparación con modelos de contexto más corto. Para puntos de referencia multimodales, el modelo debería manejar adecuadamente conjuntos de datos de preguntas y respuestas visuales.
La latencia del modelo Gemma 4 26B A4B es generalmente menor que la de un modelo denso de 26B parámetros porque solo 4B parámetros están activos por token. Sin embargo, el mecanismo de enrutamiento MoE agrega una pequeña sobrecarga a cada token generado, por lo que la latencia total por token puede ser ligeramente mayor que la de un modelo denso puro de 4B. Para inferencia por lotes con secuencias largas, el rendimiento puede ser mayor debido a la reducción de demandas de ancho de banda de memoria. En OrcaRouter, la latencia también dependerá del hardware subyacente aprovisionado por el proveedor Obsidian. El rendimiento real debe probarse con cargas de trabajo representativas para determinar si cumple con sus requisitos de velocidad.
A pesar de sus fortalezas, este modelo tiene limitaciones. Los 4B parámetros activos significan que, para razonamientos muy complejos o conocimientos específicos de un dominio, puede rendir por debajo de modelos más grandes como Gemma 4 47B (dense) o modelos de frontera. La naturaleza sin censura implica que los resultados pueden ser tóxicos, sesgados o desalineados con los valores humanos si no se usan con moderación. También puede generar contenido dañino que viole las políticas de uso de OpenAI cuando se accede a través de OrcaRouter; los usuarios son responsables de cumplirlas. Además, la arquitectura MoE puede generar una calidad inconsistente entre tokens si el enrutamiento de expertos es subóptimo. Por último, la comprensión multimodal, aunque presente, puede no igualar a la de los modelos dedicados de visión-lenguaje.
El precio de este modelo está determinado por el proveedor Obsidian y se pasa a través de OrcaRouter con cero margen de beneficio. Usted paga $0.25 por millón de tokens de entrada y $2.90 por millón de tokens de salida. Los tokens de entrada incluyen tanto tokens de texto como de imagen (las imágenes se tokenizan antes del procesamiento). Los tokens de salida cubren la respuesta generada. No hay tarifas adicionales por llamadas API o uso de la ventana de contexto más allá del costo por token. Este precio es competitivo para un modelo MoE de 26B, especialmente dado el gran contexto de ventana. Los cargos se calculan por solicitud y aparecen en su estado de cuenta de OrcaRouter.
Los tokens de salida son significativamente más caros que los de entrada ($2.90 vs $0.25 por millón). Esto es típico en los modelos de lenguaje, porque generar tokens requiere más cómputo que procesar la entrada. Para minimizar costos, puedes estructurar los prompts para reducir la cantidad de tokens de salida—por ejemplo, pidiendo respuestas más cortas o usando instrucciones del sistema para limitar la verbosidad. Además, dado que los costos de entrada son bajos, puedes permitirte incluir ventanas de contexto grandes (hasta 262K tokens) sin arruinarte. Si tu caso de uso involucra muchos prompts cortos pero respuestas largas, el costo de los tokens de salida dominará.
OrcaRouter no proporciona almacenamiento en caché incorporado para este modelo. El precio es por token y por solicitud. Sin embargo, puede implementar almacenamiento en caché del lado del cliente de secuencias de entrada comunes para evitar reenviar indicaciones idénticas. Además, si repite el mismo mensaje del sistema en varias conversaciones, puede considerar incluirlo en un contexto largo y reutilizar la misma sesión a través de la API de completaciones de chat para evitar tokens de entrada redundantes. Algunos proveedores pueden ofrecer almacenamiento en caché de indicaciones por su cuenta, pero el precio de Obsidian según lo indicado no incluye una opción de almacenamiento en caché. Consulte la documentación del proveedor para obtener posibles descuentos en indicaciones repetidas.
Para usar este modelo, envía solicitudes al endpoint compatible con OpenAI https://api.orcarouter.ai/v1. Establece el parámetro model en "obsidian/gemma-4-26B-A4B". Tu clave API de OrcaRouter debe incluirse en el encabezado Authorization como token Bearer. La API admite tanto los endpoints de completaciones de texto como de completaciones de chat. Para chat, usa el endpoint /v1/chat/completions con un array messages que incluya los roles user, assistant y system. Para solicitudes multimodales, incluye URLs de imágenes o datos en base64 en el campo content. Un ejemplo de cuerpo de solicitud en Python usaría la librería openai con base_url establecido en el endpoint de OrcaRouter y el ID del modelo como se indicó anteriormente.
La API admite los parámetros estándar de OpenAI: temperature (0-2, predeterminado 1), top_p (0-1), max_tokens (hasta la ventana de contexto), presence_penalty, frequency_penalty, secuencias de detención (stop sequences) y n (número de completaciones). Para multimodal, el campo content acepta un arreglo con tipo "text" y tipo "image_url". También se puede establecer stream=true para respuestas en streaming. El modelo admite mensajes de sistema. La ventana de contexto es de 262,144 tokens, incluyendo entrada y salida. No todos los parámetros pueden ser compatibles exactamente como se documentan; consulte la documentación de OrcaRouter para conocer las limitaciones específicas de cada proveedor. Para mejores resultados, establezca temperature entre 0.7 y 1.0 para tareas creativas, y más bajo para salidas deterministas.
La migración es sencilla gracias a la API compatible con OpenAI. Si actualmente usas el cliente Python de OpenAI, cambia el base_url a https://api.orcarouter.ai/v1 y configura tu clave API como la clave de OrcaRouter. Actualiza el parámetro model del nombre del modelo anterior a "obsidian/gemma-4-26B-A4B". No se requieren otros cambios de código para la mayoría de los casos de uso. Para solicitudes multimodales, el formato de la imagen puede diferir; usa la misma estructura que la API de visión de OpenAI. Prueba algunas solicitudes para asegurar la compatibilidad. Ten en cuenta que los límites de velocidad y el manejo de errores pueden diferir; consulta la documentación de OrcaRouter para conocer las mejores prácticas.
La URL base para todas las llamadas API es https://api.orcarouter.ai/v1. El identificador exacto del modelo a utilizar en las solicitudes es "obsidian/gemma-4-26B-A4B". Este ID debe pasarse como el parámetro model en las llamadas de chat completions o completions. No existe un ID de modelo alternativo para esta variante. Asegúrese de incluir el prefijo completo 'obsidian/' para enrutar correctamente al proveedor Obsidian. Si intenta usar un ID genérico 'gemma-4-26B-A4B' sin el prefijo del proveedor, es posible que no se resuelva. El prefijo del proveedor es necesario porque OrcaRouter admite múltiples proveedores que ofrecen el mismo modelo base.
Dentro de la familia Gemma 4, Google ofrece variantes densas y MoE. La versión densa (por ejemplo, Gemma 4 47B) tiene todos los parámetros activos, lo que proporciona mayor calidad por token pero a un costo computacional más alto. La versión MoE con 26B totales y 4B activos ofrece un punto óptimo en cuanto a eficiencia de costos. En comparación con Gemma 4 2B o 9B densas, este modelo tiene un conocimiento más amplio debido a un mayor número total de parámetros. Entre los modelos MoE, Gemma 4 26B A4B es más pequeño que modelos MoE más grandes como Mixtral 8x22B (141B totales, 39B activos). El aspecto sin censura es exclusivo de esta variante Obsidian; otros modelos Gemma 4 incluyen ajuste de seguridad.
Los modelos Uncensored, como los de la serie Llama 3-Uncensored o Wizard, suelen eliminar los filtros de seguridad de un modelo base. Esta variante de Gemma 4 es una de las pocas opciones MoE sin censura, que ofrece un mayor número total de parámetros (26B) con menos parámetros activos (4B). En comparación con Llama 3 70B Uncensored, es mucho más pequeño y económico, pero puede tener un límite inferior en tareas complejas. Su ventana de contexto de 262K es significativamente más grande que la de la mayoría de los modelos sin censura, que a menudo tienen un límite de 8K a 32K. El soporte multimodal también es un diferenciador: la mayoría de los modelos sin censura son solo de texto.
GPT-4o y Claude 3.5 Sonnet son modelos más grandes y propietarios con un amplio ajuste de seguridad y capacidades multimodales. Generalmente superan a Gemma 4 26B A4B en pruebas de referencia y tareas del mundo real, especialmente en razonamiento, creatividad y consistencia. Sin embargo, son mucho más caros por token (GPT-4o: $5/M de entrada, $15/M de salida; Claude: $3/M de entrada, $15/M de salida). El modelo Gemma es ideal para aplicaciones sensibles al costo que necesitan un contexto amplio pero sin restricciones de seguridad. No igualará a los modelos de vanguardia en el seguimiento sutil de instrucciones o la precisión factual, pero puede ser suficiente para muchas tareas generativas.
Elija este modelo en lugar de un modelo más grande (como GPT-4o o Claud Opus) cuando: (1) necesite una ventana de contexto muy grande (262K) sin pagar precios premium; (2) requiera resultados sin censura para casos de uso permitidos; (3) su carga de trabajo sea de alto rendimiento y la eficiencia de costos de MoE sea importante; (4) sus tareas estén dentro de la capacidad de un modelo de 4 mil millones de parámetros activos. Evite este modelo si necesita la máxima calidad para decisiones críticas, una alineación estricta de seguridad o un razonamiento extremadamente complejo. Para muchas tareas comunes como resumen, traducción o preguntas y respuestas sobre documentos largos, este modelo ofrece una sólida relación precio-rendimiento.
| Entrada / 1M tokens | $0.250 |
| Salida / 1M tokens | $2.90 |
| Moneda | USD |
Estimación según precio de lista
Solo una estimación: el número real de tokens depende del tokenizador del proveedor.
GET /api/public/models/obsidian/gemma-4-26B-A4BAbrir @misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B