一個無損、未經審查的 Gemma 4 26B A4B 版本,旨在保留原始模型能力的同時,盡量減少拒絕行為。專為開發者、AI 研究人員及需要高品質回應且限制最少的進階應用而最佳化。 對於大多數工作負載,建議使用 Balanced 變體,它能提供完整的回答,同時維持穩定的推理與自然的對話行為。在某些敏感情境下,模型可能會在提供完整回應前先簡短建構其推理過程,但其設計目的是避免隱藏內容。相較於更激進的未審查變體,Balanced 版本提供更一致的取樣、更強的長上下文穩定性,並減少長對話中的主題偏移。 非常適合創意寫作、角色扮演、多語言助手、長上下文推理,以及以品質、連貫性與可靠性為首要考量的通用 AI 應用。 此模型的存取權限受到管制,僅供安全研究人員、紅隊、AI 安全研究人員及其他進行合法研究、評估與測試的合格專業人士使用。
Gemma 4 26B A4B Uncensored 是來自 Google Gemma 4 系列的混合專家模型(MoE),由供應商 Obsidian 託管,並可透過 OrcaRouter 存取。該模型擁有 260 億個總參數,但每個 token 僅啟動 40 億個參數,因此在運算上比密集型的 260…
Gemma 4 26B A4B Uncensored 在需要長程推理與處理大型上下文情境的任務中表現優異,例如書籍摘要、具備大量歷史記錄的多輪對話,以及程式碼庫分析。其 MoE 架構使其在同時處理大量提示詞(prompts)的批次處理中格外高效。多模態能力讓它能對影像進行推理——例如解讀圖表、迷因或產品照片。未經審查的行為特性非常適合探索成熟主題的創意寫作、成人角色扮演,或是在無內容限制下生成小說。此外,它在標準 NLP 基準測試(如推理、數學與程式設計)上的表現也與其他 Gemma 4 變體相當。
如果您的任务不需要长上下文(例如低于8K tokens)或多模态输入,那么较小的密集模型(如Gemma 2 9B或Llama 3 8B)可能更适合您,这些模型每个token更快且更便宜。对于需要安全过滤器的任务,未经审查的模型可能产生不适当的输出——请选择经过安全调优的模型。另外,如果您需要极低延迟的实时聊天,这种MoE模型可能比小型密集模型更慢,因为存在专家路由开销。考虑您的吞吐量需求:对于高容量、短上下文的请求,像Gemma 2 27B(密集)这样更便宜的模型可能更具成本效益。
專家混合設計每次僅啟用每個 token 的一部分參數(260億總參數中的40億)。這降低了每次前向傳遞的計算成本,相較於密集的260億參數模型,能在相同硬體上實現更高的吞吐量。然而,路由機制會為每個 token 帶來輕微的延遲開銷,且若提示高度專業化,可能導致專家負載不均。實務上,像這樣的 MoE 模型提供了良好的取捨:以較少的 FLOPs 達成具競爭力的品質。40億活躍參數在每個 token 的計算量上與40億參數的密集模型相當,但此模型受益於儲存在260億總參數中的知識。
是的,該模型同時接受文字與圖片輸入。您可以在單一請求中傳送單張或多張圖片,並附上文字指令。圖片會經過編碼,並與文字一同在 262,144 個 token 的上下文視窗內處理。這使得視覺問答、文件理解,以及需要分析圖表、圖示或照片的任務得以實現。該模型使用視覺編碼器(通常類似 ViT 元件)將圖片轉換為 token。雖然架構的具體細節並未公開文件化,但它支援標準的圖片格式。請注意,圖片會依據其解析度消耗相應的 token,因此高解析度圖片會減少可用的文字上下文。
作為Gemma 4的變體,基礎模型(經過安全調校)在推理基準測試(如MMLU、GSM8K)以及程式碼生成任務(如HumanEval和MBPP)中展現出優異表現。由於核心模型權重保持不變,未經審查的版本很可能保留這些能力。不過,該未審查變體的具體基準測試分數尚未公佈。用戶可以預期其在算術推理、程式碼生成及多語言任務中具備競爭力。262K的上下文視窗使其在長文件檢索與摘要任務上,相較於上下文較短的模型表現更出色。針對多模態基準測試,該模型應能妥善處理視覺問答資料集。
Gemma 4 26B A4B 模型的延遲通常低於密集的 26B 參數模型,因為每個 token 僅有 4B 參數處於活躍狀態。然而,MoE 路由機制會為每個生成的 token 增加少量開銷,因此每個 token 的總延遲可能略高於純 4B 密集模型。對於長序列的批次推理,由於記憶體頻寬需求降低,吞吐量可以更高。在 OrcaRouter 上,延遲還會取決於 Obsidian 供應商配置的底層硬體。實際效能應使用代表性工作負載進行測試,以確定是否符合您的速度要求。
儘管該模型有其優勢,但仍存在局限性。僅有4B活躍參數意味著,在處理非常複雜的推理或領域特定知識時,其表現可能不如更大的模型,如Gemma 4 47B(密集模型)或前沿模型。無審查的特性意味著,若未經適當的內容審核,其輸出可能帶有毒性、偏見或不符合人類價值觀。此外,當透過OrcaRouter存取時,它可能生成違反OpenAI使用政策的 harmful 內容,使用者需自行承擔合規責任。再者,MoE架構若專家路由效果不佳,可能導致各token間的品質不一致。最後,其多模態理解能力雖然存在,但可能不及專用的視覺語言模型。
此模型的定價由供應商 Obsidian 決定,並透過 OrcaRouter 以零加成方式傳遞。您每百萬輸入代幣支付 0.25 美元,每百萬輸出代幣支付 2.90 美元。輸入代幣包含文字與圖像代幣(圖像在處理前會先進行代幣化)。輸出代幣涵蓋生成的回應內容。除了按代幣計費外,API 呼叫或上下文窗口使用無需額外費用。對於一款 26B MoE 模型,此定價具有競爭力,尤其是考慮到其大型上下文窗口。費用按每次請求計算,並顯示在您的 OrcaRouter 帳單報表中。
輸出令牌遠比輸入令牌昂貴(每百萬個$2.90 vs $0.25)。這在語言模型中很常見,因為生成令牌需要比處理輸入更多的計算量。為了最小化成本,你可以設計提示來減少輸出令牌的數量——例如,要求較短的回應,或使用系統指令限制冗長度。此外,由於輸入成本較低,你可以承擔包含大型上下文窗口(最多262K個令牌)而不用花費太多。如果你的使用案例涉及許多簡短提示但回應較長,輸出令牌成本將佔主導地位。
OrcaRouter 本身並未為此模型提供內建快取。計費方式為按 token 與按請求計費。不過,您可以在客戶端實作常見輸入序列的快取,避免重複發送相同的提示。此外,若您在多個對話中重複使用相同的系統訊息,可以考慮將其放入長上下文,並透過聊天補全 API 重複使用同一工作階段,以節省冗餘的輸入 token。部分供應商可能自行提供提示快取功能,但 Obsidian 列出的定價中並未包含快取選項。請查閱供應商的說明文件,了解是否有針對重複提示的潛在折扣。
若要使用此模型,請將請求發送至 OpenAI 相容端點 https://api.orcarouter.ai/v1。將 model 參數設為 "obsidian/gemma-4-26B-A4B"。您來自 OrcaRouter 的 API 金鑰應包含在 Authorization 標頭中作為 Bearer token。API 支援文字完成和聊天完成端點。對於聊天,請使用 /v1/chat/completions 端點,並在 messages 陣列中包含 user、assistant 和 system 角色。對於多模態請求,請在 content 欄位中包含圖片 URL 或 base64 資料。用 Python 寫的範例請求主體將使用 openai 函式庫,並將 base_url 設為 OrcaRouter 的端點,model ID 如上所述。
此API支援標準的OpenAI參數:temperature(0-2,預設1)、top_p(0-1)、max_tokens(上限為上下文窗口)、presence_penalty、frequency_penalty、stop sequences以及n(完成數量)。對於多模態,content欄位接受包含type為"text"和type為"image_url"的陣列。您也可以設定stream=true以啟用串流回應。模型支援系統訊息。上下文窗口為262,144個token(包含輸入與輸出)。並非所有參數都能完全按照文檔支援;請查閱OrcaRouter文檔以了解任何特定於供應商的限制。為達到最佳效果,創意任務請將temperature設在0.7至1.0之間,而需要確定性輸出時則設為較低值。
由於採用與 OpenAI 相容的 API,遷移過程非常直接。如果您目前正在使用 OpenAI Python 客戶端,請將 base_url 改為 https://api.orcarouter.ai/v1,並將您的 API 金鑰設為您的 OrcaRouter 金鑰。將模型參數從先前的模型名稱更新為「obsidian/gemma-4-26B-A4B」。對於大多數使用情況,無需進行其他程式碼修改。對於多模態請求,影像格式可能有所不同;請使用與 OpenAI 的視覺 API 相同的結構。測試幾個請求以確保相容性。請注意,速率限制和錯誤處理可能有所不同;請查閱 OrcaRouter 的文件以了解最佳實踐。
所有API呼叫的基礎URL為https://api.orcarouter.ai/v1。在請求中使用的確切模型標識符是"obsidian/gemma-4-26B-A4B"。此ID必須作為聊天完成或完成呼叫中的模型參數傳遞。此變體沒有替代模型ID。請確保包含完整的前綴'obsidian/'以正確路由到Obsidian提供者。如果您嘗試使用不帶提供者前綴的通用'gemma-4-26B-A4B' ID,則可能無法解析。提供者前綴是必需的,因為OrcaRouter支援多個提供者提供相同的基礎模型。
在 Gemma 4 系列中,Google 同時提供密集(Dense)與 MoE 兩種變體。密集版本(例如 Gemma 4 47B)的所有參數皆處於啟用狀態,每個 Token 能產出更高品質,但運算成本也較高。而總參數 26B、活躍參數 4B 的 MoE 版本則在成本效益上達到最佳平衡點。相較於 Gemma 4 2B 或 9B 密集版,此模型因總參數數量更大而擁有更廣泛的知識。在 MoE 模型中,Gemma 4 26B A4B 的規模小於 Mixtral 8x22B(總參數 141B,活躍參數 39B)等更大的 MoE 模型。無審查(Uncensored)特性為此 Obsidian 變體所獨有;其他 Gemma 4 模型均包含安全調校。
像 Llama 3-Uncensored 或 Wizard 系列這類未經審查的模型,通常會移除基礎模型的安全過濾器。這個 Gemma 4 變體是少數 MoE 未經審查選項之一,提供更大的總參數量(26B)和較低的活躍參數(4B)。與 Llama 3 70B Uncensored 相比,它更小且更便宜,但在複雜任務上的天花板可能較低。其 262K 的上下文視窗遠大於大多數未經審查的模型,這些模型通常上限為 8K-32K。多模態支援也是個差異點:大多數未經審查的模型僅限文字。
GPT-4o 和 Claude 3.5 Sonnet 是較大型的專有模型,具有廣泛的安全調整和多模態能力。它們在基準測試和現實任務上通常勝過 Gemma 4 26B A4B,特別是在推理、創造力和一致性方面。然而,它們每個 token 的成本高得多(GPT-4o:$5/M 輸入,$15/M 輸出;Claude:$3/M 輸入,$15/M 輸出)。Gemma 模型非常適合需要大上下文但無安全限制的敏感成本應用。它在細微的指令遵循或事實準確性上無法與前沿模型匹敵,但對許多生成任務來說可能足夠。
當您有以下需求時,請選擇此模型而非較大型模型(如 GPT-4o 或 Claud Opus):(1) 需要極大的上下文窗口 (262K) 但不想支付高昂費用;(2) 在允許的使用情境下需要未經審查的輸出;(3) 工作負載為高吞吐量,且 MoE 成本效益很重要;(4) 任務在 4B 活躍參數模型的能力範圍內。若您需要關鍵決策的最高品質、嚴格的 safety alignment 或極度複雜的推理,則應避免使用此模型。對於許多常見任務(如長篇文件的摘要、翻譯或問答),此模型提供了極佳的價格性能比。
| 輸入 / 1M tokens | $0.250 |
| 輸出 / 1M tokens | $2.90 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
@misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B