Без потерь, нецензурированная версия Gemma 4 26B A4B, предназначенная для сохранения возможностей оригинальной модели при минимизации отказов. Оптимизирована для разработчиков, исследователей ИИ и продвинутых приложений, требующих высококачественных ответов с минимальными ограничениями. Сбалансированный вариант рекомендуется для большинства рабочих нагрузок, обеспечивая полные ответы при сохранении стабильного рассуждения и естественного разговорного поведения. В некоторых чувствительных сценариях модель может кратко обозначить свои рассуждения перед предоставлением полного ответа, но она спроектирована так, чтобы избегать утаивания контента. По сравнению с более агрессивными нецензурированными вариантами, Balanced обеспечивает более последовательную выборку, более высокую стабильность длинного контекста и снижение смены темы в длительных разговорах. Хорошо подходит для творческого письма, ролевых игр, многоязычных ассистентов, рассуждений в длинном контексте и универсальных приложений ИИ, где качество, связность и надежность являются главными приоритетами. Доступ к этой модели ограничен и предназначен для исследователей безопасности, красных команд, исследователей безопасности ИИ и других квалифицированных специалистов, проводящих легитимные исследования, оценку и тестирование.
Gemma 4 26B A4B Uncensored — это языковая модель на архитектуре смеси экспертов (MoE) из серии Gemma 4 от Google, размещённая провайдером Obsidian и доступная через OrcaRouter. Она имеет 26…
Gemma 4 26B A4B Uncensored отлично справляется с задачами, требующими длительного рассуждения в больших контекстах, такими как суммаризация книг, многоповоротные диалоги с обширной историей и анализ кодовой базы. Её архитектура MoE делает её эффективной для пакетной обработки, когда одновременно обрабатывается множество промптов. Мультимодальные возможности позволяют рассуждать об изображениях — например, интерпретировать графики, мемы или фотографии товаров. Отсутствие цензуры идеально подходит для творческого письма, исследующего взрослые темы, ролевых игр для взрослых или генерации художественных текстов без ограничений по содержанию. Она также показывает хорошие результаты на стандартных бенчмарках NLP по рассуждению, математике и программированию, аналогично другим вариантам Gemma 4.
Если ваша задача не требует длинного контекста (например, менее 8K токенов) или мультимодального ввода, вам, возможно, лучше подойдет меньшая плотная модель, такая как Gemma 2 9B или Llama 3 8B, которые быстрее и дешевле за токен. Для задач, требующих фильтров безопасности, нецензурированная модель может выдавать неуместные результаты — вместо этого выберите модель, настроенную на безопасность. Кроме того, если вам нужна чрезвычайно низкая задержка для чата в реальном времени, эта MoE-модель может быть медленнее, чем небольшая плотная модель, из-за накладных расходов на маршрутизацию экспертов. Учитывайте свои потребности в пропускной способности: для запросов с большим объемом и коротким контекстом более экономичной может оказаться более дешевая модель, такая как Gemma 2 27B (плотная).
Архитектура смеси экспертов активирует лишь подмножество параметров на каждый токен (4 миллиарда из 26 миллиардов общего числа). Это снижает вычислительные затраты на прямой проход по сравнению с плотной моделью на 26 млрд параметров, позволяя добиться более высокой пропускной способности на том же оборудовании. Однако маршрутизация вносит небольшие временные издержки на каждый токен и может привести к дисбалансу загрузки экспертов, если входные запросы узкоспециализированы. На практике модели MoE, подобные этой, предлагают хороший компромисс: конкурентоспособное качество при доле вычислительных затрат (FLOPs). 4 млрд активных параметров сопоставимы с плотной моделью на 4 млрд параметров по объёму вычислений на токен, но при этом модель выигрывает от знаний, хранящихся среди 26 млрд общих параметров.
Да, модель принимает как текстовый, так и графический ввод. Вы можете отправить одно или несколько изображений в одном запросе вместе с текстовыми инструкциями. Изображения кодируются и обрабатываются совместно с текстом в контекстном окне на 262 144 токена. Это позволяет выполнять визуальные ответы на вопросы, понимание документов и задачи, требующие анализа диаграмм, схем или фотографий. Модель использует кодировщик изображений (обычно компонент типа ViT) для преобразования изображений в токены. Хотя точные детали архитектуры не задокументированы публично, она поддерживает стандартные форматы изображений. Обратите внимание, что изображения потребляют количество токенов, пропорциональное их разрешению, поэтому изображения с высоким разрешением уменьшат доступный текстовый контекст.
Будучи вариантом Gemma 4, базовая модель (с настройкой безопасности) показала высокую производительность в тестах на рассуждение, таких как MMLU, GSM8K, и в задачах по кодированию, таких как HumanEval и MBPP. Нецензурированная версия, вероятно, сохраняет эти возможности, поскольку основные веса модели не изменены. Однако конкретные результаты тестов для этого нецензурированного варианта не были опубликованы. Пользователи могут ожидать конкурентоспособных результатов в арифметических рассуждениях, генерации кода и многоязычных задачах. Окно контекста в 262K также обеспечивает превосходную производительность при извлечении и обобщении длинных документов по сравнению с моделями с более коротким контекстом. Что касается мультимодальных тестов, модель должна адекватно справляться с наборами данных для ответов на визуальные вопросы.
Задержка для модели Gemma 4 26B A4B обычно ниже, чем у плотной модели с 26B параметрами, поскольку на каждый токен активны только 4B параметров. Однако механизм маршрутизации MoE добавляет небольшие накладные расходы на каждый сгенерированный токен, поэтому общая задержка на токен может быть немного выше, чем у чистой плотной модели с 4B. При пакетном выводе с длинными последовательностями пропускная способность может быть выше за счет снижения требований к пропускной способности памяти. На OrcaRouter задержка также будет зависеть от базового аппаратного обеспечения, предоставленного провайдером Obsidian. Реальную производительность следует проверять на репрезентативных рабочих нагрузках, чтобы определить, соответствует ли она вашим требованиям к скорости.
Несмотря на свои сильные стороны, эта модель имеет ограничения. 4B активных параметров означает, что для очень сложных рассуждений или узкоспециализированных знаний она может уступать более крупным моделям, таким как Gemma 4 47B (плотная) или передовым моделям. Нецензурированный характер означает, что выходные данные могут быть токсичными, предвзятыми или несоответствующими человеческим ценностям при использовании без модерации. Она также может генерировать вредоносный контент, нарушающий политику использования OpenAI при доступе через OrcaRouter — пользователи несут ответственность за соблюдение требований. Кроме того, архитектура MoE может приводить к непостоянному качеству токенов при неоптимальной маршрутизации экспертов. Наконец, мультимодальное понимание, хотя и присутствует, может не достигать уровня специализированных моделей «зрение-язык».
Ценообразование на эту модель устанавливается провайдером Obsidian и передается через OrcaRouter без наценки. Вы платите $0.25 за миллион входных токенов и $2.90 за миллион выходных токенов. Входные токены включают как текстовые, так и графические токены (изображения токенизируются перед обработкой). Выходные токены покрывают сгенерированный ответ. Дополнительные сборы за вызовы API или использование контекстного окна отсутствуют — оплата только за каждый токен. Такая цена конкурентоспособна для модели 26B MoE, особенно учитывая большое контекстное окно. Плата рассчитывается за каждый запрос и отображается в вашем платежном отчете OrcaRouter.
Выходные токены значительно дороже входных ($2.90 против $0.25 за миллион). Это типично для языковых моделей, поскольку генерация токенов требует больше вычислений, чем обработка входных данных. Чтобы минимизировать затраты, можно структурировать подсказки, чтобы уменьшить количество выходных токенов — например, запрашивая более короткие ответы или используя системные инструкции для ограничения многословия. Кроме того, поскольку стоимость входных данных низка, вы можете позволить себе включать большие контекстные окна (до 262K токенов) без больших затрат. Если ваш сценарий использования включает много коротких подсказок, но длинные ответы, стоимость выходных токенов будет доминировать.
OrcaRouter не предоставляет встроенное кэширование для этой модели. Ценообразование осуществляется за токен и за запрос. Однако вы можете реализовать кэширование на стороне клиента для часто встречающихся входных последовательностей, чтобы избежать повторной отправки одинаковых подсказок. Кроме того, если вы повторяете одно и то же системное сообщение во многих диалогах, вы можете рассмотреть возможность включения его в длинный контекст и повторного использования того же сеанса через API завершения чата, чтобы избежать избыточных входных токенов. Некоторые провайдеры могут предлагать кэширование подсказок самостоятельно, но ценовая политика Obsidian, указанная на сайте, не включает опцию кэширования. Обратитесь к документации провайдера на предмет возможных скидок на повторяющиеся подсказки.
Чтобы использовать эту модель, отправляйте запросы на совместимую с OpenAI конечную точку https://api.orcarouter.ai/v1. Установите параметр model в значение "obsidian/gemma-4-26B-A4B". Ваш API-ключ от OrcaRouter должен быть включен в заголовок Authorization как Bearer token. API поддерживает как конечные точки text completions, так и chat completions. Для чата используйте конечную точку /v1/chat/completions с массивом messages, включающим роли user, assistant и system. Для мультимодальных запросов включайте URL изображений или данные в формате base64 в поле content. Пример тела запроса на Python будет использовать библиотеку openai с base_url, установленным на конечную точку OrcaRouter, и ID модели, как указано выше.
API поддерживает стандартные параметры OpenAI: temperature (0–2, по умолчанию 1), top_p (0–1), max_tokens (до размера контекстного окна), presence_penalty, frequency_penalty, стоп-последовательности и n (количество завершений). Для мультимодальных запросов поле content принимает массив с типами "text" и "image_url". Вы также можете установить stream=true для потоковых ответов. Модель поддерживает системные сообщения. Размер контекстного окна составляет 262 144 токена, включая вход и выход. Не все параметры могут поддерживаться в точности, как описано; обратитесь к документации OrcaRouter для получения информации об ограничениях, специфичных для провайдера. Для наилучших результатов установите temperature от 0,7 до 1,0 для творческих задач и ниже для детерминированных выходных данных.
Миграция проста благодаря API, совместимому с OpenAI. Если вы сейчас используете клиент OpenAI на Python, измените base_url на https://api.orcarouter.ai/v1 и установите свой API-ключ на ключ OrcaRouter. Обновите параметр model с прежнего названия модели на "obsidian/gemma-4-26B-A4B". Для большинства случаев никаких других изменений в коде не требуется. Для мультимодальных запросов формат изображения может отличаться; используйте ту же структуру, что и в vision API от OpenAI. Протестируйте несколько запросов, чтобы убедиться в совместимости. Обратите внимание, что лимиты скорости и обработка ошибок могут отличаться; обратитесь к документации OrcaRouter для получения рекомендаций.
Базовый URL для всех вызовов API: https://api.orcarouter.ai/v1. Точный идентификатор модели для использования в запросах — "obsidian/gemma-4-26B-A4B". Этот идентификатор должен передаваться как параметр модели в вызовах chat completions или completions. Для данного варианта нет альтернативного идентификатора модели. Убедитесь, что вы включаете полный префикс 'obsidian/', чтобы правильно направить запрос к провайдеру Obsidian. Если вы попытаетесь использовать общий идентификатор 'gemma-4-26B-A4B' без префикса провайдера, он может не разрешиться. Префикс провайдера необходим, поскольку OrcaRouter поддерживает несколько провайдеров, предлагающих одну и ту же базовую модель.
В семействе Gemma 4 компания Google предлагает как плотные (dense), так и MoE-варианты. Плотная версия (например, Gemma 4 47B) использует все параметры, что обеспечивает более высокое качество на токен, но при больших вычислительных затратах. MoE-версия с 26B общих и 4B активных параметров представляет собой оптимальное соотношение стоимости и эффективности. По сравнению с плотными моделями Gemma 4 2B или 9B, эта модель обладает более широкими знаниями благодаря большему общему количеству параметров. Среди MoE-моделей Gemma 4 26B A4B меньше, чем более крупные MoE-модели, такие как Mixtral 8x22B (141B общих, 39B активных). Аспект без цензуры уникален для этого варианта Obsidian; другие модели Gemma 4 включают настройки безопасности.
Неподцензурные модели, такие как из серий Llama 3-Uncensored или Wizard, обычно удаляют фильтры безопасности из базовой модели. Этот вариант Gemma 4 является одним из немногих неподцензурных вариантов MoE, предлагая большее общее количество параметров (26B) при более низком количестве активных параметров (4B). По сравнению с Llama 3 70B Uncensored, она гораздо меньше и дешевле, но может иметь более низкий потолок для сложных задач. Его окно контекста в 262K значительно больше, чем у большинства неподцензурных моделей, которые часто ограничены 8K-32K. Мультимодальная поддержка также является отличительной чертой: большинство неподцензурных моделей поддерживают только текст.
GPT-4o и Claude 3.5 Sonnet — это более крупные проприетарные модели с обширной настройкой безопасности и мультимодальными возможностями. Как правило, они превосходят Gemma 4 26B A4B по тестам и реальным задачам, особенно в области рассуждений, креативности и согласованности. Однако они гораздо дороже за токен (GPT-4o: $5/M ввод, $15/M вывод; Claude: $3/M ввод, $15/M вывод). Модель Gemma идеально подходит для приложений, чувствительных к стоимости, которым требуется большой контекст, но без ограничений безопасности. Она не дотягивает до передовых моделей по тонкому следованию инструкциям или фактической точности, но может быть достаточной для многих генеративных задач.
Выбирайте эту модель вместо более крупной (например, GPT-4o или Claud Opus), когда: (1) вам нужен очень большой контекстное окно (262K) без уплаты премиальных цен; (2) вам требуются нецензурированные результаты для разрешённых случаев использования; (3) ваша рабочая нагрузка имеет высокую пропускную способность и важна экономическая эффективность MoE; (4) ваши задачи находятся в пределах возможностей модели с 4B активными параметрами. Избегайте этой модели, если вам нужно высочайшее качество для критических решений, строгое соответствие требованиям безопасности или чрезвычайно сложные рассуждения. Для многих распространённых задач, таких как обобщение, перевод или ответы на вопросы по длинным документам, эта модель обеспечивает высокое соотношение цены и производительности.
| Ввод / 1M токенов | $0.250 |
| Вывод / 1M токенов | $2.90 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
GET /api/public/models/obsidian/gemma-4-26B-A4BОткрыть @misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B