Gemma 4 26B A4B 的无损无审查版本,旨在保留原始模型的能力,同时最大程度减少拒绝行为。针对开发者、AI研究人员以及需要高质量响应且限制最少的高级应用进行了优化。 建议大多数工作负载使用平衡变体,它提供完整的答案,同时保持稳定的推理和自然的对话行为。在某些敏感场景中,模型可能会在提供完整响应前简要构建其推理框架,但其设计旨在避免保留内容。与更具侵略性的无审查变体相比,平衡版提供了更一致的采样、更强的长上下文稳定性,并在长时间对话中减少了主题漂移。 非常适合创意写作、角色扮演、多语言助手、长上下文推理以及以质量、连贯性和可靠性为首要优先级的通用AI应用。 该模型的访问受到管控,仅供安全研究人员、红队、AI安全研究员以及其他进行合法研究、评估和测试的合格专业人员使用。
Gemma 4 26B A4B Uncensored 是 Google Gemma 4 系列中的混合专家(MoE)语言模型,由提供商 Obsidian 托管,并通过 OrcaRouter 访问。该模型总参数量为 260 亿,但每个 token 仅激活 40 亿参数,因此在计算上比密集型 260…
Gemma 4 26B A4B 无审查版在处理需要长距离推理的大上下文任务中表现出色,例如书籍摘要、具有大量历史记录的多轮对话以及代码库分析。其 MoE 架构使其在处理同时处理多个提示的批量处理时效率极高。多模态能力使其能够对图像进行推理——例如,解读图表、模因或产品照片。无审查行为非常适合探索成熟主题的创意写作、成人角色扮演或生成不受内容限制的小说。它在推理、数学和编码等标准 NLP 基准测试上也表现良好,与其他 Gemma 4 变体类似。
如果你的任务不需要长上下文(例如 8K tokens 以下)或多模态输入,使用较小的密集模型(如 Gemma 2 9B 或 Llama 3 8B)可能更合适,它们每个 token 的处理速度更快、成本更低。对于需要安全过滤的任务,未经审查的模型可能产生不当输出——请选择安全调优的模型。此外,如果你需要极低延迟的实时聊天,由于专家路由开销,这个 MoE 模型可能比小型密集模型更慢。请考虑你的吞吐量需求:对于高容量、短上下文的请求,像 Gemma 2 27B(密集)这样更便宜的模型可能更具成本效益。
混合专家设计仅激活每个token的部分参数(总共260亿参数中的40亿)。相比稠密的260亿参数模型,这减少了每次前向传播的计算成本,使得在相同硬件上实现更高吞吐量。然而,路由机制会为每个token引入轻微延迟开销,并且如果提示高度专业化,可能导致专家负载不均衡。在实践中,像这样的MoE模型提供了一个良好的权衡:以较少的FLOPs(浮点运算次数)实现有竞争力的质量。40亿活跃参数在每token计算量上相当于一个40亿参数的稠密模型,但该模型受益于存储在260亿总参数中的知识。
是的,该模型同时支持文本和图像输入。您可以在请求中发送单张或多张图像,并附带文本指令。图像经过编码后与文本一同在262,144个令牌的上下文窗口内处理。这使其能够执行视觉问答、文档理解以及分析图表、示意图或照片等任务。模型使用视觉编码器(通常是类似ViT的组件)将图像转换为令牌。虽然架构的具体细节未公开,但它支持标准图像格式。请注意,图像消耗的令牌数量与分辨率成正比,因此高分辨率图像会减少可用的文本上下文。
作为Gemma 4的变体,基础模型(经过安全微调)在MMLU、GSM8K等推理基准测试以及HumanEval、MBPP等编程任务上表现出色。由于核心模型权重未变,无审查版本很可能保留这些能力。然而,该无审查变体的具体基准分数尚未公布。用户可以期待其在算术推理、代码生成和多语言任务中具有竞争力的表现。262K的上下文窗口使其在长文档检索和摘要任务上优于上下文较短的模型。在多模态基准测试中,该模型应能妥善处理视觉问答数据集。
Gemma 4 26B A4B 模型的延迟通常低于密集的 26B 参数模型,因为每个 token 仅激活 4B 参数。然而,MoE 路由机制为每个生成的 token 增加少量开销,因此每个 token 的总延迟可能略高于纯 4B 密集模型。对于长序列的批量推理,由于内存带宽需求降低,吞吐量可能更高。在 OrcaRouter 上,延迟还将取决于 Obsidian 提供商所配置的底层硬件。实际性能应使用具有代表性的工作负载进行测试,以确定是否满足您的速度要求。
尽管该模型有其优势,但仍存在局限性。4B的激活参数意味着,对于极其复杂的推理或特定领域知识,其表现可能不如Gemma 4 47B(密集模型)或前沿模型等更大规模的模型。未审查的特性意味着,若未经审核使用,输出内容可能带有毒性、偏见,或与人类价值观不一致。当通过OrcaRouter访问时,该模型还可能生成违反OpenAI使用政策的危害性内容——用户需自行负责合规性。此外,混合专家架构在优化专家路由失败时可能导致Token间质量不稳定。最后,多模态理解能力虽然存在,但可能不及专用视觉语言模型。
此模型的定价由提供商 Obsidian 决定,OrcaRouter 以零加价方式代收。您需支付每百万输入标记 0.25 美元,每百万输出标记 2.90 美元。输入标记包含文本和图像标记(图像在处理前会被标记化)。输出标记涵盖生成的回复。除按标记计费外,API 调用或上下文窗口使用无额外费用。对于 26B MoE 模型而言,此定价具有竞争力,尤其考虑到其大上下文窗口。费用按每次请求计算,并显示在您的 OrcaRouter 账单上。
输出令牌的成本远高于输入令牌(每百万个$2.90 vs $0.25)。这在语言模型中很常见,因为生成令牌所需的计算量比处理输入要大。为了最小化成本,你可以通过构造提示来减少输出令牌的数量——例如,要求更短的回复或使用系统指令限制冗长程度。此外,由于输入成本较低,你可以承受包含大上下文窗口(最多262K令牌)而不至于破费。如果你的用例涉及许多短提示但长回复,输出令牌成本将占主导地位。
OrcaRouter 不为此模型提供内置缓存。其定价基于每Token和每次请求。不过,您可以在客户端实现常见输入序列的缓存,以避免重复发送相同的提示。此外,如果在多个对话中重复同一系统消息,您可以考虑将其包含在长上下文中,并通过聊天补全API重复使用同一会话,从而避免冗余的输入Token。某些提供商可能自行提供提示缓存功能,但Obsidian所列出的定价未包含缓存选项。请查阅提供商文档,了解针对重复提示是否提供任何潜在折扣。
要使用此模型,请将请求发送至兼容 OpenAI 的端点 https://api.orcarouter.ai/v1,并将 model 参数设置为 "obsidian/gemma-4-26B-A4B"。您来自 OrcaRouter 的 API 密钥需包含在 Authorization 头中作为 Bearer token。该 API 支持文本补全和聊天补全两种端点。对于聊天,请使用 /v1/chat/completions 端点,并在 messages 数组中包含 user、assistant 和 system 角色。对于多模态请求,请在 content 字段中包含图片 URL 或 base64 数据。在 Python 中,示例请求体使用 openai 库,并将 base_url 设置为 OrcaRouter 的端点,模型 ID 如上所述。
该API支持标准的OpenAI参数:temperature(0-2,默认1)、top_p(0-1)、max_tokens(最大不超过上下文窗口)、presence_penalty、frequency_penalty、停止序列和n(生成补全数量)。对于多模态场景,content字段接受包含"text"类型和"image_url"类型的数组。您也可以设置stream=true以启用流式响应。该模型支持系统消息。上下文窗口为262,144个token(含输入和输出)。并非所有参数都能完全按文档支持,请查阅OrcaRouter文档以了解各提供商的具体限制。为获得最佳效果,创意任务可将temperature设置在0.7至1.0之间,确定性输出则使用较低值。
由于采用兼容OpenAI的API,迁移非常简单直接。如果您当前正在使用OpenAI Python客户端,请将base_url更改为https://api.orcarouter.ai/v1,并将您的API密钥设置为您的OrcaRouter密钥。将模型参数从之前的模型名称更新为"obsidian/gemma-4-26B-A4B"。对于大多数用例,不需要更改其他代码。对于多模态请求,图像格式可能有所不同;请使用与OpenAI视觉API相同的结构。测试几个请求以确保兼容性。请注意,速率限制和错误处理可能有所不同;请查阅OrcaRouter的文档以了解最佳实践。
所有API调用的基础URL为 https://api.orcarouter.ai/v1。在请求中使用的精确模型标识符为"obsidian/gemma-4-26B-A4B"。该ID必须作为模型参数传递给聊天补全或补全调用。此变体没有其他替代模型ID。请确保包含完整的前缀'obsidian/',以便正确路由到Obsidian提供商。如果您尝试使用不带提供商前缀的通用'gemma-4-26B-A4B' ID,可能无法解析。提供商前缀是必需的,因为OrcaRouter支持多个提供相同基础模型的提供商。
在Gemma 4系列中,Google同时提供密集型和MoE变体。密集型版本(如Gemma 4 47B)所有参数均处于激活状态,每个token的质量更高,但计算成本也更高。MoE版本总参数量为26B,激活参数量为4B,在成本效益上找到了最佳平衡点。相比Gemma 4 2B或9B密集型模型,该模型总参数量更大,因此知识覆盖更广。在MoE模型中,Gemma 4 26B A4B的规模小于Mixtral 8x22B(总141B,激活39B)等更大MoE模型。无审查特性是这款Obsidian变体独有的;其他Gemma 4模型均包含安全调校。
像Llama 3-Uncensored或Wizard系列这类无审查模型通常会在基础模型上移除安全过滤器。这款Gemma 4变体是为数不多的MoE无审查选项之一,拥有更大的总参数量(26B)但激活参数更少(4B)。与Llama 3 70B Uncensored相比,它体积更小、成本更低,但在复杂任务上的上限可能较低。其262K上下文窗口远超大多数无审查模型(通常限制在8K-32K之间)。多模态支持也是其差异化优势:大多数无审查模型仅支持文本。
GPT-4o和Claude 3.5 Sonnet 是体积更大、专有的模型,具备广泛的安全调优和多模态能力。它们在基准测试和现实任务中通常优于 Gemma 4 26B A4B,尤其是在推理、创造性和一致性方面。不过,它们的每 token 成本要高得多(GPT-4o:输入 $5/M,输出 $15/M;Claude:输入 $3/M,输出 $15/M)。Gemma 模型非常适合需要大上下文但无安全限制的成本敏感应用。它在细微的指令遵循或事实准确性上无法与前沿模型匹敌,但对于许多生成任务可能已经足够。
在以下情况选择此模型而非更大模型(如GPT-4o或Claud Opus):(1) 需要超大上下文窗口(262K)但无需支付高昂费用;(2) 在允许的用例下需要未经审查的输出;(3) 工作负载为高吞吐量且MoE成本效率至关重要;(4) 任务在4B活跃参数模型的能力范围内。若需要关键决策的最高质量、严格的安全对齐或极其复杂的推理,则应避免使用此模型。对于许多常见任务(如总结、翻译或长文档问答),此模型提供了出色的性价比。
| 输入 / 1M tokens | $0.250 |
| 输出 / 1M tokens | $2.90 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
@misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B