Gemma 4 26B A4B のロスレスで無検閲版。元のモデルの能力を維持しつつ、拒否動作を最小限に抑えるよう設計されています。高品質な応答と最小限の制約を必要とする開発者や AI 研究者、高度なアプリケーション向けに最適化されています。 Balanced バリアントはほとんどのワークロードに推奨され、安定した推論と自然な会話動作を維持しながら完全な回答を提供します。一部のセンシティブなシナリオでは、モデルが応答前に推論を簡単に組み立てることがありますが、内容を保留しないように設計されています。よりアグレッシブな無検閲バリアントと比較して、Balanced はより一貫したサンプリング、より強力な長文コンテキスト安定性、および長い会話におけるトピックのずれの低減を実現します。 クリエイティブライティング、ロールプレイ、多言語アシスタント、長文コンテキスト推論、および品質・一貫性・信頼性が最優先される汎用 AI アプリケーションに適しています。 このモデルへのアクセスは制限されており、セキュリティ研究者、レッドチーム、AI 安全研究者、および正当な研究・評価・テストを実施するその他の適格な専門家を対象としています。
Gemma 4 26B A4B Uncensored は、Google の Gemma 4 シリーズに属する混合エキスパート(MoE)言語モデルであり、プロバイダ Obsidian によってホストされ、OrcaRouter を通じてアクセス可能です。26億の総パラメータを持ちながら、トークンごとに40億のみがアクティブになるため、高密度の26Bモデルよりも計算負荷が軽くなっています。"Uncens…
Gemma 4 26B A4B Uncensored は、ブックサマリゼーション、履歴が長いマルチターン会話、コードベース分析など、大規模なコンテキストにわたる長距離推論を必要とするタスクに優れています。そのMoEアーキテクチャにより、多くのプロンプトを同時に処理するバッチ処理で効率的に動作します。マルチモーダル機能により、グラフ、ミーム、商品写真の解釈など、画像に関する推論が可能です。検閲なしの動作は、成人向けのテーマを探求するクリエイティブなライティング、アダルトロールプレイ、またはコンテンツ制限のないフィクション生成に最適です。また、他のGemma 4バリアントと同様に、推論、数学、コーディングに関する標準的なNLPベンチマークでも優れたパフォーマンスを発揮します。
もしタスクが長いコンテキスト(例:8Kトークン未満)やマルチモーダル入力を必要としない場合、Gemma 2 9BやLlama 3 8Bのようなより小さな高密度モデルを使用すると、トークンあたりのコストが安く、高速です。安全フィルターが必要なタスクでは、検閲されていないモデルは不適切な出力を生成する可能性があります。代わりに安全調整済みモデルを選んでください。また、リアルタイムチャットに非常に低いレイテンシが必要な場合、このMoEモデルはエキスパートルーティングのオーバーヘッドのため、小さな高密度モデルよりも遅くなる可能性があります。スループットの要件を考慮してください。高ボリュームで短いコンテキストのリクエストには、Gemma 2 27B(高密度)のようなより安価なモデルの方が費用対効果が高いかもしれません。
mixture-of-experts 設計では、トークンごとにパラメータの一部のみ(合計260億のうち40億)が活性化されます。これにより、密な260億パラメータモデルと比較して順伝搬あたりの計算コストが削減され、同じハードウェアでより高いスループットが可能になります。ただし、ルーティングによりトークンあたりわずかなレイテンシオーバーヘッドが発生し、プロンプトが高度に特化されている場合、エキスパートの負荷不均衡を引き起こす可能性があります。実際には、このようなMoEモデルは、FLOPsの一部で競争力のある品質を提供するという良いトレードオフを提供します。40億のアクティブパラメータは、トークンあたりの計算という点では40億の密モデルに匹敵しますが、モデルは合計260億のパラメータに保存された知識の恩恵を受けます。
はい、このモデルはテキスト入力と画像入力の両方を受け付けます。リクエスト内で1枚または複数の画像をテキスト指示とともに送信できます。画像はエンコードされ、262,144トークンのコンテキストウィンドウ内でテキストと一緒に処理されます。これにより、視覚的質問応答、文書理解、グラフ、図表、写真の分析が必要なタスクが可能になります。モデルはビジョンエンコーダ(通常はViTのようなコンポーネント)を使用して画像をトークンに変換します。アーキテクチャの正確な詳細は公開されていませんが、標準的な画像フォーマットをサポートしています。画像は解像度に比例してトークンを消費するため、高解像度の画像は利用可能なテキストコンテキストを減少させることに注意してください。
Gemma 4の派生モデルとして、ベースモデル(安全チューニング済み)はMMLU、GSM8Kなどの推論ベンチマークやHumanEval、MBPPなどのコーディングタスクにおいて高い性能を示しています。検閲解除版はコアモデルの重みが変更されていないため、これらの能力を維持していると考えられます。ただし、この検閲解除版に特化したベンチマークスコアは公開されていません。ユーザーは算術推論、コード生成、多言語タスクにおいて競争力のある結果を期待できます。また、262Kのコンテキストウィンドウにより、短いコンテキストを持つモデルと比較して、長文書の検索や要約において優れた性能を発揮します。マルチモーダルベンチマークでは、視覚的な質問応答データセットを適切に処理できるはずです。
Gemma 4 26B A4Bモデルのレイテンシは、通常の26Bパラメータの密なモデルよりも一般的に低くなります。これは、トークンごとにアクティブなパラメータがわずか4Bだからです。ただし、MoEルーティング機構により、生成されるトークンごとに小さなオーバーヘッドが追加されるため、純粋な4B密モデルと比較してトークンあたりの合計レイテンシは若干高くなる可能性があります。長いシーケンスでのバッチ推論では、メモリ帯域幅の需要が減少するため、スループットが向上する可能性があります。OrcaRouterでは、レイテンシはObsidianプロバイダーが提供する基盤ハードウェアにも依存します。実際のパフォーマンスは、速度要件を満たしているかどうかを判断するために、代表的なワークロードを使用してテストする必要があります。
その強みにもかかわらず、このモデルには限界があります。4Bのアクティブパラメータは、非常に複雑な推論やドメイン固有の知識において、Gemma 4 47B(dense)やフロンティアモデルなどの大規模モデルよりも性能が劣る可能性があることを意味します。無検閲の性質は、モデレーションなしで使用すると、出力が有害、偏見、または人間の価値観と一致しない可能性があることを意味します。また、OrcaRouterを介してアクセスした場合、OpenAIの利用ポリシーに違反する有害なコンテンツを生成する可能性があります。コンプライアンスの責任はユーザーにあります。さらに、MoEアーキテクチャでは、エキスパートルーティングが最適でない場合、トークン間で品質に一貫性がなくなる可能性があります。最後に、マルチモーダル理解は存在するものの、専用の視覚言語モデルには及ばない可能性があります。
このモデルの価格はプロバイダーObsidianが決定し、OrcaRouterがマークアップなしでそのまま転送します。入力トークン100万個あたり0.25ドル、出力トークン100万個あたり2.90ドルをお支払いいただきます。入力トークンにはテキストトークンと画像トークンの両方が含まれます(画像は処理前にトークン化されます)。出力トークンは生成された応答をカバーします。トークンごとのコスト以外に、APIコールやコンテキストウィンドウの使用に対する追加料金はありません。この価格設定は、特に大きなコンテキストウィンドウを考慮すると、26B MoEモデルにとって競争力があります。料金はリクエストごとに計算され、OrcaRouterの請求明細書に表示されます。
出力トークンは入力トークンよりも大幅に高価です(100万トークンあたり$2.90対$0.25)。これは言語モデルでは一般的であり、トークンを生成するには入力の処理よりも多くの計算が必要だからです。コストを最小限に抑えるには、出力トークンの数を減らすようにプロンプトを構成できます。たとえば、短い応答を求めたり、システム指示を使用して冗長さを制限したりします。さらに、入力コストが低いため、大きなコンテキストウィンドウ(最大262Kトークン)を破産せずに含める余裕があります。ユースケースに多くの短いプロンプトと長い応答が含まれる場合、出力トークンのコストが支配的になります。
OrcaRouter自身にはこのモデル向けの組み込みキャッシュ機能はありません。料金はトークン単位およびリクエスト単位です。ただし、クライアント側で一般的な入力シーケンスをキャッシュして、同一プロンプトを再送信するのを避けることができます。また、多くの会話で同じシステムメッセージを繰り返し使用する場合、長いコンテキストにそれを含め、チャット補完APIを通じて同じセッションを再利用することで、入力トークンの重複を避けることができます。一部のプロバイダーは独自にプロンプトキャッシュを提供する場合もありますが、Obsidianの価格にはキャッシュオプションは含まれていません。繰り返しプロンプトに関する割引の可能性については、プロバイダーのドキュメントを確認してください。
このモデルを使用するには、OpenAI互換のエンドポイント https://api.orcarouter.ai/v1 にリクエストを送信してください。モデルパラメータには "obsidian/gemma-4-26B-A4B" を設定します。OrcaRouterのAPIキーは、AuthorizationヘッダーにBearerトークンとして含める必要があります。APIはテキスト補完とチャット補完の両方のエンドポイントをサポートしています。チャットの場合は、/v1/chat/completions エンドポイントを使用し、ユーザー、アシスタント、システムロールを含むmessages配列を指定します。マルチモーダルリクエストの場合は、contentフィールドに画像URLまたはbase64データを含めます。Pythonでのリクエスト本文の例では、openaiライブラリを使用し、base_urlにOrcaRouterのエンドポイント、モデルIDに上記の値を設定します。
APIは以下の標準的なOpenAIパラメータをサポートしています: temperature (0-2、デフォルト1)、top_p (0-1)、max_tokens (コンテキストウィンドウまで)、presence_penalty、frequency_penalty、stop sequences、n (生成数)。マルチモーダルでは、contentフィールドはtype "text"およびtype "image_url"の配列を受け入れます。また、stream=trueを設定してストリーミング応答を有効にすることもできます。モデルはsystem messagesをサポートしています。コンテキストウィンドウは262,144トークン(入力と出力を含む)です。すべてのパラメータがドキュメント通りにサポートされているとは限りません。プロバイダ固有の制限についてはOrcaRouterのドキュメントを確認してください。最良の結果を得るには、クリエイティブなタスクではtemperatureを0.7〜1.0に設定し、決定論的な出力が必要な場合は低めに設定してください。
移行はOpenAI互換APIにより簡単です。現在OpenAI Pythonクライアントを使用している場合は、base_urlをhttps://api.orcarouter.ai/v1に変更し、APIキーを自分のOrcaRouterキーに設定します。modelパラメータを以前のモデル名から"obsidian/gemma-4-26B-A4B"に変更します。ほとんどのユースケースでは、他のコード変更は必要ありません。マルチモーダルリクエストでは、画像形式が異なる場合があります。OpenAIのvision APIと同じ構造を使用してください。互換性を確認するために、いくつかのリクエストをテストしてください。レート制限とエラーハンドリングは異なる場合があることに注意してください。ベストプラクティスについてはOrcaRouterのドキュメントを参照してください。
すべてのAPIコールのベースURLは https://api.orcarouter.ai/v1 です。リクエストで使用する正確なモデル識別子は "obsidian/gemma-4-26B-A4B" です。このIDは、チャット完了または完了呼び出しのmodelパラメータとして渡す必要があります。このバリアントに代替のモデルIDはありません。Obsidianプロバイダーに正しくルーティングするために、完全なプレフィックス 'obsidian/' を含めるようにしてください。プロバイダープレフィックスなしで汎用的な 'gemma-4-26B-A4B' IDを使用しようとすると、解決されない可能性があります。OrcaRouterは同一のベースモデルを提供する複数のプロバイダーをサポートしているため、プロバイダープレフィックスが必要です。
Gemma 4ファミリーでは、GoogleはDenseモデルとMoEモデルの両方を提供しています。Denseバージョン(例:Gemma 4 47B)はすべてのパラメータがアクティブで、トークンあたりの品質は高いものの、計算コストが高くなります。総パラメータ数26B、アクティブパラメータ数4BのMoEバージョンは、コスト効率の最適なバランスを提供します。Gemma 4 2Bや9BのDenseモデルと比較すると、このモデルは総パラメータ数が多いため、より幅広い知識を持っています。MoEモデルの中では、Gemma 4 26B A4Bは、Mixtral 8x22B(総パラメータ数141B、アクティブ39B)のようなより大きなMoEモデルよりも小規模です。検閲なしの側面は、このObsidianバリアントに固有のものです。他のGemma 4モデルにはセーフティチューニングが含まれています。
非検閲モデル、例えばLlama 3-UncensoredやWizardシリーズのものは、通常ベースモデルから安全フィルターを除去します。このGemma 4バリアントは、数少ないMoE非検閲オプションの1つであり、総パラメータ数は大きい(26B)一方で、アクティブパラメータは少ない(4B)です。Llama 3 70B Uncensoredと比較して、はるかに小型で低コストですが、複雑なタスクの上限は低い可能性があります。その262Kのコンテキストウィンドウは、ほとんどの非検閲モデル(多くの場合8K〜32Kに制限されています)よりも大幅に大きいです。マルチモーダルサポートも差別化要因です。ほとんどの非検閲モデルはテキストのみです。
GPT-4oとClaude 3.5 Sonnetは、安全性の調整とマルチモーダル機能を備えた、より大規模なプロプライエタリモデルです。これらは一般的に、ベンチマークや現実世界のタスクにおいてGemma 4 26B A4Bを上回り、特に推論、創造性、一貫性において優れています。ただし、トークンあたりのコストははるかに高く(GPT-4o: 入力$5/M、出力$15/M;Claude: 入力$3/M、出力$15/M)。Gemmaモデルは、安全制限なしで大規模なコンテキストを必要とするコスト重視のアプリケーションに最適です。微妙な指示従順性や事実の正確性では最先端モデルに及びませんが、多くの生成タスクには十分かもしれません。
次の場合は、大規模モデル(GPT-4oやClaud Opusなど)ではなく、このモデルを選択してください。(1)プレミアム価格を支払わずに非常に大きなコンテキストウィンドウ(262K)が必要な場合。(2)許可されたユースケースで検閲されていない出力が必要な場合。(3)ワークロードが高スループットで、MoEのコスト効率が重要な場合。(4)タスクが4Bアクティブパラメータモデルの能力の範囲内である場合。重大な判断に最高品質が必要な場合、厳格な安全性の調整が必要な場合、または極めて複雑な推論が必要な場合は、このモデルを避けてください。要約、翻訳、長文書のQ&Aなど、多くの一般的なタスクでは、このモデルは優れた価格性能比を提供します。
| 入力 / 1M tokens | $0.250 |
| 出力 / 1M tokens | $2.90 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
@misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B