Bezstratna, nieocenzurowana wersja Gemma 4 26B A4B zaprojektowana w celu zachowania oryginalnych możliwości modelu przy jednoczesnym minimalizowaniu zachowań polegających na odmowie. Zoptymalizowana dla programistów, badaczy AI i zaawansowanych aplikacji wymagających wysokiej jakości odpowiedzi przy minimalnych ograniczeniach. Wariant Zrównoważony jest zalecany do większości zastosowań, zapewniając pełne odpowiedzi przy jednoczesnym zachowaniu stabilnego rozumowania i naturalnego zachowania konwersacyjnego. W niektórych wrażliwych scenariuszach model może najpierw pokrótce przedstawić swoje rozumowanie przed udzieleniem pełnej odpowiedzi, ale jest zaprojektowany tak, aby nie wstrzymywać treści. W porównaniu do bardziej agresywnych nieocenzurowanych wariantów, Zrównoważony oferuje bardziej spójne próbkowanie, większą stabilność w długim kontekście i zmniejszone odchodzenie od tematu w rozszerzonych rozmowach. Doskonale nadaje się do kreatywnego pisania, odgrywania ról, wielojęzycznych asystentów, rozumowania w długim kontekście oraz ogólnego zastosowania w aplikacjach AI, gdzie jakość, spójność i niezawodność są głównymi priorytetami. Dostęp do tego modelu jest ograniczony i przeznaczony dla badaczy bezpieczeństwa, czerwonych zespołów, badaczy bezpieczeństwa AI oraz innych wykwalifikowanych profesjonalistów prowadzących legalne badania, oceny i testy.
Gemma 4 26B A4B Uncensored to mieszany model ekspertów (MoE) z serii Gemma 4 firmy Google, hostowany przez dostawcę Obsidian i dostępny poprzez OrcaRouter. Ma łącznie 26 miliardów parametrów, ale…
Gemma 4 26B A4B Uncensored doskonale radzi sobie z zadaniami wymagającymi rozumowania na długich dystansach w dużych kontekstach, takimi jak streszczanie książek, wieloetapowe rozmowy z rozbudowaną historią oraz analiza bazy kodu. Jego architektura MoE sprawia, że jest wydajny w przetwarzaniu wsadowym, gdzie wiele promptów obsługiwanych jest jednocześnie. Możliwości multimodalne pozwalają mu analizować obrazy – na przykład interpretować wykresy, memy czy zdjęcia produktów. Niescenzurowane zachowanie jest idealne do kreatywnego pisania eksplorującego dojrzałe tematy, odgrywania ról dla dorosłych lub generowania fikcji bez ograniczeń treści. Osiąga także dobre wyniki w standardowych benchmarkach NLP dotyczących rozumowania, matematyki i kodowania, podobnie jak inne warianty Gemmy 4.
Jeśli Twoje zadanie nie wymaga długiego kontekstu (np. poniżej 8K tokenów) ani wejścia multimodalnego, lepszym wyborem może być mniejszy model gęsty, taki jak Gemma 2 9B lub Llama 3 8B, które są szybsze i tańsze za token. W przypadku zadań wymagających filtrów bezpieczeństwa, model bez cenzury może generować nieodpowiednie wyniki – zamiast tego wybierz model dostrojony pod kątem bezpieczeństwa. Również, jeśli potrzebujesz bardzo niskiego opóźnienia w czacie na żywo, ten model MoE może być wolniejszy niż mały model gęsty ze względu na narzut związany z routingiem ekspertów. Rozważ swoje potrzeby dotyczące przepustowości: w przypadku zapytań o dużej objętości i krótkim kontekście, tańszy model, taki jak Gemma 2 27B (gęsty), może być bardziej opłacalny.
Mieszanka ekspertów (mixture-of-experts) aktywuje tylko podzbiór parametrów na token (4 miliardy z 26 miliardów ogółem). Zmniejsza to koszt obliczeniowy na przejście w przód (forward pass) w porównaniu do gęstego modelu 26B, umożliwiając wyższą przepustowość na tym samym sprzęcie. Jednak routowanie wprowadza niewielki narzut opóźnienia na token i może prowadzić do nierównowagi obciążenia ekspertów, jeśli zapytania są wysoce wyspecjalizowane. W praktyce modele MoE, takie jak ten, oferują dobry kompromis: konkurencyjną jakość za ułamek FLOPów. 4B aktywnych parametrów jest porównywalne z gęstym modelem 4B pod względem obliczeń na token, ale model czerpie korzyści z wiedzy zgromadzonej w 26B całkowitych parametrów.
Tak, model akceptuje zarówno tekst, jak i obrazy jako dane wejściowe. Możesz wysłać pojedynczy obraz lub wiele obrazów w jednym zapytaniu wraz z instrukcjami tekstowymi. Obrazy są kodowane i przetwarzane razem z tekstem w oknie kontekstowym o rozmiarze 262 144 tokenów. Umożliwia to wizualne odpowiadanie na pytania, analizę dokumentów oraz zadania wymagające analizy wykresów, diagramów lub zdjęć. Model wykorzystuje enkoder wizyjny (zwykle komponent podobny do ViT) do konwersji obrazów na tokeny. Podczas gdy dokładne szczegóły architektury nie są publicznie udokumentowane, model obsługuje standardowe formaty obrazów. Należy pamiętać, że obrazy zużywają tokeny proporcjonalnie do swojej rozdzielczości, więc obrazy o wysokiej rozdzielczości zmniejszą dostępny kontekst tekstowy.
Jako wariant Gemmy 4, model bazowy (z dostrajaniem bezpieczeństwa) osiąga dobre wyniki w testach rozumowania, takich jak MMLU, GSM8K oraz zadaniach kodowania, np. HumanEval i MBPP. Niescenzurowana wersja prawdopodobnie zachowuje te możliwości, ponieważ podstawowe wagi modelu pozostają niezmienione. Nie opublikowano jednak szczegółowych wyników benchmarków dla tego niescenzurowanego wariantu. Użytkownicy mogą spodziewać się konkurencyjnych rezultatów w rozumowaniu arytmetycznym, generowaniu kodu i zadaniach wielojęzycznych. Okno kontekstu o rozmiarze 262K umożliwia także lepszą wydajność w wyszukiwaniu i podsumowywaniu długich dokumentów w porównaniu z modelami o krótszym kontekście. W przypadku testów multimodalnych model powinien odpowiednio radzić sobie z zestawami danych dotyczących odpowiedzi na pytania wizualne.
Opóźnienie dla modelu Gemma 4 26B A4B jest zazwyczaj niższe niż dla gęstego modelu o parametrach 26B, ponieważ tylko 4B parametrów jest aktywnych na token. Jednak mechanizm routingu MoE dodaje niewielki narzut do każdego wygenerowanego tokenu, więc całkowite opóźnienie na token może być nieco wyższe niż w przypadku czystego gęstego modelu 4B. W przypadku wnioskowania wsadowego z długimi sekwencjami przepustowość może być wyższa ze względu na zmniejszone wymagania dotyczące przepustowości pamięci. Na OrcaRouter opóźnienie będzie również zależeć od podstawowego sprzętu udostępnionego przez dostawcę Obsidian. Rzeczywistą wydajność należy przetestować przy użyciu reprezentatywnych obciążeń, aby określić, czy spełnia ona wymagania dotyczące szybkości.
Pomimo swoich zalet, model ten ma ograniczenia. 4B aktywnych parametrów oznacza, że w przypadku bardzo złożonego rozumowania lub wiedzy specyficznej dla domeny może on osiągać gorsze wyniki niż większe modele, takie jak Gemma 4 47B (dense) lub modele graniczne. Niecenzurowany charakter oznacza, że wyniki mogą być toksyczne, tendencyjne lub niezgodne z wartościami ludzkimi, jeśli są używane bez moderacji. Może również generować szkodliwe treści naruszające zasady użytkowania OpenAI podczas dostępu przez OrcaRouter – użytkownicy są odpowiedzialni za zgodność. Dodatkowo architektura MoE może prowadzić do niespójnej jakości w tokenach, jeśli routowanie ekspertów jest nieoptymalne. Wreszcie, multimodalne rozumienie, choć obecne, może nie dorównywać dedykowanym modelom wizyjno-językowym.
Cennik dla tego modelu jest ustalany przez dostawcę Obsidian i przekazywany przez OrcaRouter z zerową marżą. Płacisz 0,25 USD za milion tokenów wejściowych i 2,90 USD za milion tokenów wyjściowych. Tokeny wejściowe obejmują zarówno tokeny tekstowe, jak i obrazowe (obrazy są tokenizowane przed przetworzeniem). Tokeny wyjściowe dotyczą wygenerowanej odpowiedzi. Nie ma dodatkowych opłat za wywołania API lub użycie okna kontekstowego poza kosztem za token. Ta cena jest konkurencyjna dla modelu 26B MoE, szczególnie przy dużym oknie kontekstowym. Opłaty są naliczane za każde żądanie i widoczne na fakturze OrcaRouter.
Tokeny wyjściowe są znacząco droższe niż tokeny wejściowe (2,90 USD vs 0,25 USD za milion). Jest to typowe dla modeli językowych, ponieważ generowanie tokenów wymaga większej mocy obliczeniowej niż przetwarzanie danych wejściowych. Aby zminimalizować koszty, możesz tak skonstruować prompty, aby zmniejszyć liczbę tokenów wyjściowych – na przykład prosząc o krótsze odpowiedzi lub używając instrukcji systemowych w celu ograniczenia rozwlekłości. Dodatkowo, ponieważ koszty wejściowe są niskie, możesz pozwolić sobie na uwzględnienie dużych okien kontekstowych (do 262 000 tokenów) bez rujnowania budżetu. Jeśli Twój przypadek użycia obejmuje wiele krótkich promptów, ale długie odpowiedzi, koszt tokenów wyjściowych będzie dominujący.
OrcaRouter nie zapewnia wbudowanego buforowania dla tego modelu. Cena naliczana jest za token i za żądanie. Możesz jednak zaimplementować buforowanie po stronie klienta typowych sekwencji wejściowych, aby uniknąć ponownego wysyłania identycznych promptów. Ponadto, jeśli powtarzasz ten sam komunikat systemowy w wielu rozmowach, możesz rozważyć umieszczenie go w długim kontekście i ponowne użycie tej samej sesji za pomocą API dopełniania czatu, aby uniknąć zbędnych tokenów wejściowych. Niektórzy dostawcy mogą oferować własne buforowanie promptów, ale cennik Obsidian, jak podano, nie zawiera opcji buforowania. Sprawdź dokumentację dostawcy w poszukiwaniu potencjalnych zniżek na powtarzane prompty.
Aby użyć tego modelu, wyślij żądania do kompatybilnego z OpenAI punktu końcowego https://api.orcarouter.ai/v1. Ustaw parametr model na "obsidian/gemma-4-26B-A4B". Twój klucz API z OrcaRouter powinien być dołączony w nagłówku Authorization jako token Bearer. API obsługuje zarówno punkty końcowe do uzupełniania tekstu, jak i uzupełniania czatu. W przypadku czatu użyj punktu końcowego /v1/chat/completions z tablicą messages zawierającą role user, assistant i system. W przypadku żądań multimodalnych dołącz adresy URL obrazów lub dane base64 w polu content. Przykładowe ciało żądania w Pythonie używałoby biblioteki openai z base_url ustawionym na punkt końcowy OrcaRouter i identyfikatorem modelu jak powyżej.
API obsługuje standardowe parametry OpenAI: temperatura (0-2, domyślnie 1), top_p (0-1), maksymalna liczba tokenów (do rozmiaru okna kontekstowego), kara za obecność, kara za częstotliwość, sekwencje stop oraz n (liczba uzupełnień). W przypadku multimodalnym pole content przyjmuje tablicę z typami "text" i "image_url". Można również ustawić stream=true, aby otrzymywać odpowiedzi strumieniowe. Model obsługuje wiadomości systemowe. Okno kontekstowe wynosi 262 144 tokenów, wliczając wejście i wyjście. Nie wszystkie parametry mogą być obsługiwane dokładnie zgodnie z dokumentacją; sprawdź dokumentację OrcaRouter w poszukiwaniu ograniczeń specyficznych dla dostawcy. Aby uzyskać najlepsze wyniki, ustaw temperaturę między 0,7 a 1,0 dla zadań kreatywnych, a niższą dla deterministycznych wyników.
Migracja jest prosta dzięki kompatybilności z API OpenAI. Jeśli obecnie używasz klienta Python OpenAI, zmień base_url na https://api.orcarouter.ai/v1 i ustaw swój klucz API jako klucz OrcaRouter. Zaktualizuj parametr model z poprzedniej nazwy modelu na "obsidian/gemma-4-26B-A4B". W większości przypadków nie są wymagane żadne inne zmiany w kodzie. W przypadku zapytań multimodalnych format obrazu może się różnić; użyj tej samej struktury co w API vision OpenAI. Przetestuj kilka zapytań, aby upewnić się co do zgodności. Należy pamiętać, że limity zapytań i obsługa błędów mogą się różnić; skonsultuj się z dokumentacją OrcaRouter w celu poznania najlepszych praktyk.
Podstawowy URL dla wszystkich wywołań API to https://api.orcarouter.ai/v1. Dokładny identyfikator modelu, który należy używać w żądaniach, to "obsidian/gemma-4-26B-A4B". Ten identyfikator musi być przekazany jako parametr model w wywołaniach chat completions lub completions. Nie istnieje alternatywny identyfikator modelu dla tego wariantu. Upewnij się, że dodajesz pełny prefiks 'obsidian/', aby poprawnie kierować do dostawcy Obsidian. Jeśli spróbujesz użyć ogólnego identyfikatora 'gemma-4-26B-A4B' bez prefiksu dostawcy, może nie zostać rozpoznany. Prefiks dostawcy jest niezbędny, ponieważ OrcaRouter obsługuje wielu dostawców oferujących ten sam podstawowy model.
W rodzinie Gemma 4 Google oferuje zarówno gęste, jak i MoE warianty. Gęsta wersja (np. Gemma 4 47B) ma wszystkie parametry aktywne, zapewniając wyższą jakość na token, ale przy wyższych kosztach obliczeniowych. Wersja MoE z 26B całkowitymi i 4B aktywnymi zapewnia optymalny balans kosztów i wydajności. W porównaniu z Gemma 4 2B lub 9B (gęste), ten model ma szerszą wiedzę dzięki większej całkowitej liczbie parametrów. Wśród modeli MoE, Gemma 4 26B A4B jest mniejszy niż większe modele MoE, takie jak Mixtral 8x22B (141B całkowitych, 39B aktywnych). Aspekt bez cenzury jest unikalny dla tego wariantu Obsidian; inne modele Gemma 4 zawierają dostrajanie pod kątem bezpieczeństwa.
Modele nieocenzurowane, takie jak te z serii Llama 3-Uncensored czy Wizard, zazwyczaj usuwają filtry bezpieczeństwa z modelu bazowego. Ten wariant Gemma 4 jest jedną z nielicznych opcji MoE bez cenzury, oferując większą całkowitą liczbę parametrów (26B) przy niższej liczbie aktywnych parametrów (4B). W porównaniu z Llama 3 70B Uncensored jest znacznie mniejszy i tańszy, ale może mieć niższy sufit w przypadku złożonych zadań. Jego kontekstowe okno o rozmiarze 262K jest znacznie większe niż w większości modeli nieocenzurowanych, które często ograniczają się do 8K-32K. Wsparcie dla multimodalności również stanowi wyróżnik: większość nieocenzurowanych modeli jest wyłącznie tekstowa.
GPT-4o i Claude 3.5 Sonnet to większe, zastrzeżone modele z rozbudowanym dostrajaniem bezpieczeństwa i możliwościami multimodalnymi. Na ogół przewyższają one Gemmę 4 26B A4B w benchmarkach i zadaniach rzeczywistych, szczególnie w zakresie rozumowania, kreatywności i spójności. Są jednak znacznie droższe na token (GPT-4o: $5/M wejście, $15/M wyjście; Claude: $3/M wejście, $15/M wyjście). Model Gemma jest idealny do zastosowań wrażliwych na koszty, wymagających dużego kontekstu, ale bez ograniczeń bezpieczeństwa. Nie dorównuje on modelom granicznym w subtelnym podążaniu za instrukcjami ani dokładności faktograficznej, ale może być wystarczający do wielu zadań generatywnych.
Wybierz ten model zamiast większego modelu (takiego jak GPT-4o lub Claud Opus), gdy: (1) potrzebujesz bardzo dużego okna kontekstowego (262K) bez płacenia premium; (2) wymagasz niescensurowanych wyników dla dozwolonych przypadków użycia; (3) twoje obciążenie jest wysokoprzepustowe, a wydajność kosztowa MoE ma znaczenie; (4) twoje zadania mieszczą się w możliwościach modelu z 4B aktywnymi parametrami. Unikaj tego modelu, jeśli potrzebujesz najwyższej jakości do krytycznych decyzji, ścisłego dostosowania bezpieczeństwa lub wyjątkowo złożonego rozumowania. W przypadku wielu typowych zadań, takich jak podsumowywanie, tłumaczenie czy pytania i odpowiedzi na długich dokumentach, model ten oferuje korzystny stosunek ceny do wydajności.
| Wejście / 1M tokenów | $0.250 |
| Wyjście / 1M tokenów | $2.90 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
GET /api/public/models/obsidian/gemma-4-26B-A4BOtwórz @misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B