Eine verlustfreie, unzensierte Version von Gemma 4 26B A4B, die darauf ausgelegt ist, die Fähigkeiten des Originalmodells zu bewahren und gleichzeitig das Verweigerungsverhalten zu minimieren. Optimiert für Entwickler, KI-Forscher und fortgeschrittene Anwendungen, die hochwertige Antworten mit minimalen Einschränkungen erfordern. Die Balanced-Variante wird für die meisten Arbeitslasten empfohlen, da sie vollständige Antworten liefert und gleichzeitig stabiles Denken und natürliches Konversationsverhalten beibehält. In einigen sensiblen Szenarien kann das Modell kurz seine Überlegungen darlegen, bevor es die vollständige Antwort gibt, ist jedoch darauf ausgelegt, Inhalte nicht zurückzuhalten. Im Vergleich zu aggressiveren unzensierten Varianten bietet Balanced konsistenteres Sampling, stärkere Langzeitkontextstabilität und reduziertes Themendriften über längere Gespräche hinweg. Gut geeignet für kreatives Schreiben, Rollenspiele, mehrsprachige Assistenten, Langzeitkontext-Argumentation und universelle KI-Anwendungen, bei denen Qualität, Kohärenz und Zuverlässigkeit die Hauptprioritäten sind. Der Zugang zu diesem Modell ist eingeschränkt und richtet sich an Sicherheitsforscher, Red Teams, KI-Sicherheitsforscher und andere qualifizierte Fachleute, die legitime Forschung, Bewertung und Tests durchführen.
Gemma 4 26B A4B Uncensored ist ein Mixture-of-Experts (MoE)-Sprachmodell aus Googles Gemma 4-Reihe, das vom Anbieter Obsidian gehostet und über OrcaRouter zugänglich ist. Es hat insgesamt 26…
Gemma 4 26B A4B Uncensored zeichnet sich bei Aufgaben aus, die langes, kontextübergreifendes Denken erfordern, wie etwa Buchzusammenfassungen, mehrteilige Dialoge mit umfangreichem Verlauf und Codebasis-Analyse. Die MoE-Architektur macht es effizient für die Batch-Verarbeitung, bei der viele Prompts gleichzeitig bearbeitet werden. Die multimodalen Fähigkeiten ermöglichen das Verstehen von Bildern – zum Beispiel das Interpretieren von Grafiken, Memes oder Produktfotos. Das unzensierte Verhalten ist ideal für kreatives Schreiben, das reife Themen, erwachsene Rollenspiele oder das Erzeugen von Belletristik ohne Inhaltsbeschränkungen erkundet. Es schneidet auch bei standardmäßigen NLP-Benchmarks für logisches Denken, Mathematik und Programmierung gut ab, ähnlich wie andere Gemma 4-Varianten.
Falls Ihre Aufgabe keinen langen Kontext (z. B. unter 8K Token) oder multimodale Eingaben erfordert, sind Sie möglicherweise mit einem kleineren dichten Modell wie Gemma 2 9B oder Llama 3 8B besser bedient, die schneller und günstiger pro Token sind. Für Aufgaben, die Sicherheitsfilter benötigen, könnte das ungezensorierte Modell ungeeignete Ausgaben produzieren – wählen Sie stattdessen ein sicherheitsoptimiertes Modell. Auch wenn Sie extrem niedrige Latenz für Echtzeit-Chat benötigen, könnte dieses MoE-Modell aufgrund des Overheads durch Experten-Routing langsamer sein als ein kleines dichtes Modell. Berücksichtigen Sie Ihren Durchsatzbedarf: Bei kurzen Kontextanfragen mit hohem Volumen könnte ein günstigeres Modell wie Gemma 2 27B (dicht) kosteneffizienter sein.
Das Mixture-of-Experts-Design aktiviert pro Token nur einen Teil der Parameter (4 Milliarden von insgesamt 26 Milliarden). Dies reduziert den Rechenaufwand pro Vorwärtsdurchlauf im Vergleich zu einem dichten 26B-Modell und ermöglicht einen höheren Durchsatz auf derselben Hardware. Allerdings führt das Routing zu einem leichten Latenz-Overhead pro Token und kann bei hochspezialisierten Prompts zu einer ungleichmäßigen Auslastung der Experten führen. In der Praxis bieten MoE-Modelle wie dieses einen guten Kompromiss: konkurrierende Qualität für einen Bruchteil der FLOPs. Die 4B aktiven Parameter sind in Bezug auf den Rechenaufwand pro Token mit einem dichten 4B-Modell vergleichbar, doch das Modell profitiert von dem Wissen, das in insgesamt 26B Parametern gespeichert ist.
Ja, das Modell akzeptiert sowohl Text- als auch Bildeingaben. Sie können ein einzelnes Bild oder mehrere Bilder in einer Anfrage zusammen mit Textanweisungen senden. Die Bilder werden kodiert und zusammen mit dem Text innerhalb des 262,144-Token-Kontextfensters verarbeitet. Dies ermöglicht visuelle Fragenbeantwortung, Dokumentenverständnis und Aufgaben, die die Analyse von Diagrammen, Grafiken oder Fotos erfordern. Das Modell verwendet einen Vision-Encoder (typischerweise eine ViT-ähnliche Komponente), um Bilder in Tokens umzuwandeln. Während die genauen Details der Architektur nicht öffentlich dokumentiert sind, unterstützt es Standardbildformate. Beachten Sie, dass Bilder proportional zu ihrer Auflösung Tokens verbrauchen, sodass hochauflösende Bilder den verfügbaren Textkontext reduzieren.
Als eine Variante von Gemma 4 hat das Basismodell (mit Sicherheitsabstimmung) starke Leistungen bei Denk-Benchmarks wie MMLU, GSM8K und Programmieraufgaben wie HumanEval und MBPP gezeigt. Die unzensierte Version behält diese Fähigkeiten wahrscheinlich bei, da die Kernmodellgewichte unverändert sind. Allerdings wurden keine spezifischen Benchmark-Ergebnisse für diese unzensierte Variante veröffentlicht. Benutzer können wettbewerbsfähige Ergebnisse bei arithmetischem Denken, Codegenerierung und mehrsprachigen Aufgaben erwarten. Das 262K-Kontextfenster ermöglicht zudem eine überlegene Leistung bei der Abfrage und Zusammenfassung langer Dokumente im Vergleich zu Modellen mit kürzerem Kontext. Für multimodale Benchmarks sollte das Modell ausreichend mit visuellen Frage-Antwort-Datensätzen umgehen.
Die Latenz für das Gemma 4 26B A4B-Modell ist im Allgemeinen geringer als bei einem dichten Modell mit 26B Parametern, da nur 4B Parameter pro Token aktiv sind. Allerdings fügt der MoE-Routingmechanismus jedem generierten Token einen geringen Overhead hinzu, sodass die Gesamtlatenz pro Token etwas höher sein kann als bei einem reinen 4B-Dichtmodell. Bei der Batch-Inferenz mit langen Sequenzen kann der Durchsatz aufgrund geringerer Speicherbandbreitenanforderungen höher sein. Auf OrcaRouter hängt die Latenz auch von der zugrundeliegenden Hardware ab, die vom Obsidian-Anbieter bereitgestellt wird. Die Leistung in der Praxis sollte mit repräsentativen Arbeitslasten getestet werden, um festzustellen, ob sie Ihre Geschwindigkeitsanforderungen erfüllt.
Trotz seiner Stärken hat dieses Modell Einschränkungen. Die 4B aktiven Parameter bedeuten, dass es bei sehr komplexem Denken oder domänenspezifischem Wissen möglicherweise hinter größeren Modellen wie Gemma 4 47B (dicht) oder führenden Modellen zurückbleibt. Die unzensierte Natur bedeutet, dass Ausgaben toxisch, voreingenommen oder nicht mit menschlichen Werten übereinstimmend sein können, wenn sie ohne Moderation verwendet werden. Es kann auch schädliche Inhalte generieren, die gegen die Nutzungsrichtlinien von OpenAI verstoßen, wenn über OrcaRouter darauf zugegriffen wird – die Nutzer sind für die Einhaltung verantwortlich. Darüber hinaus kann die MoE-Architektur zu inkonsistenter Qualität über Tokens hinweg führen, wenn das Expert-Routing suboptimal ist. Schließlich entspricht das multimodale Verständnis, obwohl vorhanden, möglicherweise nicht dedizierten Vision-Language-Modellen.
Die Preisgestaltung für dieses Modell wird vom Anbieter Obsidian festgelegt und von OrcaRouter ohne Aufschlag weitergegeben. Sie zahlen 0,25 $ pro Million Input-Tokens und 2,90 $ pro Million Output-Tokens. Input-Tokens umfassen sowohl Text- als auch Bild-Tokens (Bilder werden vor der Verarbeitung tokenisiert). Output-Tokens decken die generierte Antwort ab. Es fallen keine zusätzlichen Gebühren für API-Aufrufe oder die Nutzung des Kontextfensters an, abgesehen von den Kosten pro Token. Diese Preisgestaltung ist wettbewerbsfähig für ein 26B MoE-Modell, insbesondere angesichts des großen Kontextfensters. Gebühren werden pro Anfrage berechnet und erscheinen auf Ihrer OrcaRouter-Abrechnungsabrechnung.
Ausgabetokens sind deutlich teurer als Eingabetokens ($2.90 vs $0.25 pro Million). Dies ist typisch für Sprachmodelle, da das Generieren von Tokens mehr Rechenleistung erfordert als die Verarbeitung von Eingaben. Um Kosten zu minimieren, können Sie Prompts so strukturieren, dass die Anzahl der Ausgabetokens reduziert wird – beispielsweise indem Sie kürzere Antworten anfordern oder Systemanweisungen verwenden, um die Ausführlichkeit zu begrenzen. Da die Kosten für Eingaben niedrig sind, können Sie sich große Kontextfenster (bis zu 262K Tokens) leisten, ohne Ihr Budget zu sprengen. Falls Ihr Anwendungsfall viele kurze Prompts, aber lange Antworten umfasst, dominieren die Kosten für Ausgabetokens.
OrcaRouter bietet kein integriertes Caching für dieses Modell. Die Abrechnung erfolgt pro Token und pro Anfrage. Sie können jedoch clientseitiges Caching von häufigen Eingabesequenzen implementieren, um das erneute Senden identischer Prompts zu vermeiden. Wenn Sie außerdem dieselbe Systemnachricht über viele Konversationen hinweg wiederholen, sollten Sie in Betracht ziehen, sie in einen langen Kontext aufzunehmen und dieselbe Sitzung über die Chat-Completions-API wiederzuverwenden, um redundante Eingabe-Token zu vermeiden. Einige Anbieter bieten möglicherweise ein eigenes Prompt-Caching an, aber die aufgeführte Preisgestaltung von Obsidian beinhaltet keine Caching-Option. Prüfen Sie die Dokumentation des Anbieters auf mögliche Rabatte für wiederholte Prompts.
Um dieses Modell zu verwenden, senden Sie Anfragen an den OpenAI-kompatiblen Endpunkt https://api.orcarouter.ai/v1. Setzen Sie den Modellparameter auf "obsidian/gemma-4-26B-A4B". Ihr API-Schlüssel von OrcaRouter sollte im Authorization-Header als Bearer-Token enthalten sein. Die API unterstützt sowohl Text-Completion- als auch Chat-Completion-Endpunkte. Für Chat verwenden Sie den Endpunkt /v1/chat/completions mit einem messages-Array, das die Rollen user, assistant und system enthält. Für multimodale Anfragen fügen Sie Bild-URLs oder Base64-Daten im content-Feld hinzu. Ein Beispiel-Anforderungstext in Python würde die openai-Bibliothek mit base_url, die auf den OrcaRouter-Endpunkt gesetzt ist, und der obigen Modell-ID verwenden.
Die API unterstützt standardmäßige OpenAI-Parameter: temperature (0-2, Standardwert 1), top_p (0-1), max_tokens (bis zum Kontextfenster), presence_penalty, frequency_penalty, Stopp-Sequenzen und n (Anzahl der Vervollständigungen). Für multimodale Inhalte akzeptiert das content-Feld ein Array mit type "text" und type "image_url". Sie können auch stream=true für Streaming-Antworten setzen. Das Modell unterstützt Systemnachrichten. Das Kontextfenster umfasst 262.144 Token, einschließlich Eingabe und Ausgabe. Möglicherweise werden nicht alle Parameter genau wie dokumentiert unterstützt; prüfen Sie die OrcaRouter-Dokumentation auf anbieterspezifische Einschränkungen. Für beste Ergebnisse setzen Sie temperature zwischen 0,7 und 1,0 für kreative Aufgaben und niedriger für deterministische Ausgaben.
Migration ist unkompliziert dank der OpenAI-kompatiblen API. Wenn Sie derzeit den OpenAI Python-Client verwenden, ändern Sie die base_url auf https://api.orcarouter.ai/v1 und setzen Sie Ihren API-Schlüssel auf Ihren OrcaRouter-Schlüssel. Aktualisieren Sie den Modellparameter vom vorherigen Modellnamen auf "obsidian/gemma-4-26B-A4B". Für die meisten Anwendungsfälle sind keine weiteren Codeänderungen erforderlich. Bei Multimodal-Anfragen kann das Bildformat abweichen; verwenden Sie die gleiche Struktur wie die OpenAI Vision-API. Testen Sie ein paar Anfragen, um die Kompatibilität sicherzustellen. Beachten Sie, dass Ratenbegrenzungen und Fehlerbehandlung abweichen können; konsultieren Sie die OrcaRouter-Dokumentation für bewährte Verfahren.
Die Basis-URL für alle API-Aufrufe ist https://api.orcarouter.ai/v1. Die genaue Modellkennung, die in Anfragen verwendet werden soll, ist "obsidian/gemma-4-26B-A4B". Diese ID muss als Modellparameter in Chat-Vervollständigungen oder Vervollständigungsaufrufen übergeben werden. Es gibt keine alternative Modell-ID für diese Variante. Stellen Sie sicher, dass Sie das vollständige Präfix 'obsidian/' einschließen, um korrekt zum Obsidian-Anbieter zu routen. Wenn Sie versuchen, eine generische ID 'gemma-4-26B-A4B' ohne das Anbieterpräfix zu verwenden, wird diese möglicherweise nicht aufgelöst. Das Anbieterpräfix ist notwendig, da OrcaRouter mehrere Anbieter unterstützt, die dasselbe Basismodell anbieten.
In der Gemma-4-Familie bietet Google sowohl dichte (dense) als auch MoE-Varianten an. Die dichte Version (z. B. Gemma 4 47B) hat alle Parameter aktiv, was eine höhere Qualität pro Token bei gleichzeitig höherem Rechenaufwand bietet. Die MoE-Version mit insgesamt 26B und 4B aktiven Parametern stellt einen optimalen Kompromiss für Kosteneffizienz dar. Im Vergleich zu Gemma 4 2B oder 9B dicht besitzt dieses Modell aufgrund der größeren Gesamtparameterzahl ein breiteres Wissen. Unter den MoE-Modellen ist Gemma 4 26B A4B kleiner als größere MoE-Modelle wie Mixtral 8x22B (141B insgesamt, 39B aktiv). Der unzensierte Aspekt ist einzigartig für diese Obsidian-Variante; andere Gemma-4-Modelle enthalten Sicherheitsanpassungen.
Unzensierte Modelle wie die aus der Llama 3-Uncensored- oder Wizard-Reihe entfernen in der Regel die Sicherheitsfilter eines Basismodells. Diese Gemma 4-Variante ist eine der wenigen unzensierten MoE-Optionen und bietet eine größere Gesamtparameteranzahl (26B) bei geringeren aktiven Parametern (4B). Im Vergleich zu Llama 3 70B Uncensored ist es deutlich kleiner und günstiger, hat aber möglicherweise eine niedrigere Obergrenze bei komplexen Aufgaben. Sein 262K-Kontextfenster ist wesentlich größer als das der meisten unzensierten Modelle, die oft bei 8K-32K gedeckelt sind. Der multimodale Support ist ebenfalls ein Unterscheidungsmerkmal: Die meisten unzensierten Modelle sind reine Textmodelle.
GPT-4o und Claude 3.5 Sonnet sind größere, proprietäre Modelle mit umfangreicher Sicherheitsoptimierung und multimodalen Fähigkeiten. Sie übertreffen Gemma 4 26B A4B in der Regel bei Benchmarks und realen Aufgaben, insbesondere in den Bereichen Reasoning, Kreativität und Konsistenz. Allerdings sind sie pro Token wesentlich teurer (GPT-4o: $5/M Eingabe, $15/M Ausgabe; Claude: $3/M Eingabe, $15/M Ausgabe). Das Gemma-Modell ist ideal für kostenbewusste Anwendungen, die einen großen Kontext benötigen, aber ohne Sicherheitseinschränkungen auskommen. Es wird die Spitzenmodelle bei subtiler Befolgung von Anweisungen oder faktischer Genauigkeit nicht erreichen, könnte aber für viele generative Aufgaben ausreichen.
Wählen Sie dieses Modell einem größeren Modell (wie GPT-4o oder Claud Opus) vor, wenn: (1) Sie einen sehr großen Kontextfenster (262K) benötigen, ohne Premiumpreise zu zahlen; (2) Sie unzensierte Ausgaben für zulässige Anwendungsfälle benötigen; (3) Ihr Arbeitsaufkommen einen hohen Durchsatz erfordert und die Kosteneffizienz des MoE wichtig ist; (4) Ihre Aufgaben im Rahmen der Fähigkeiten eines Modells mit 4B aktiven Parametern liegen. Vermeiden Sie dieses Modell, wenn Sie höchste Qualität für kritische Entscheidungen, strenge Sicherheitsausrichtung oder äußerst komplexe Argumentation benötigen. Für viele häufige Aufgaben wie Zusammenfassung, Übersetzung oder Fragen und Antworten zu langen Dokumenten bietet dieses Modell ein starkes Preis-Leistungs-Verhältnis.
| Eingabe / 1M Tokens | $0.250 |
| Ausgabe / 1M Tokens | $2.90 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
GET /api/public/models/obsidian/gemma-4-26B-A4BÖffnen @misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B