Gemma 4 26B A4B의 무손실 무검열 버전으로, 원본 모델의 기능을 유지하면서 거부 행동을 최소화하도록 설계되었습니다. 개발자, AI 연구자 및 최소한의 제한으로 고품질 응답이 필요한 고급 응용 프로그램에 최적화되었습니다. Balanced 변형은 대부분의 워크로드에 권장되며, 안정적인 추론과 자연스러운 대화 방식을 유지하면서 완전한 답변을 제공합니다. 일부 민감한 시나리오에서는 모델이 전체 응답을 제공하기 전에 잠시 추론을 구성할 수 있지만, 콘텐츠를 보류하지 않도록 설계되었습니다. 더 공격적인 무검열 변형과 비교하여 Balanced는 더 일관된 샘플링, 더 강력한 장기 컨텍스트 안정성 및 확장된 대화에서 주제 이탈 감소를 제공합니다. 품질, 일관성 및 신뢰성이 주요 우선순위인 창작 글쓰기, 롤플레이, 다국어 어시스턴트, 장기 컨텍스트 추론 및 범용 AI 응용 프로그램에 적합합니다. 이 모델에 대한 액세스는 제한되어 있으며, 보안 연구자, 레드 팀, AI 안전 연구자 및 합법적인 연구, 평가 및 테스트를 수행하는 기타 적격 전문가를 대상으로 합니다.
Gemma 4 26B A4B Uncensored는 Google의 Gemma 4 시리즈에 속하는 mixture-of-experts(MoE) 언어 모델로, 제공사 Obsidian이 호스팅하며 OrcaRouter를 통해 접근할 수 있습니다. 총 260억 개의 파라미터를 가지고 있지만 토큰당 40억 개만 활성화되어, 밀집(dense) 26B 모델보다 계산량이…
Gemma 4 26B A4B Uncensored는 책 요약, 긴 대화 기록이 있는 다중 턴 대화, 코드베이스 분석 등 대규모 맥락에서 장거리 추론이 필요한 작업에 탁월합니다. MoE 아키텍처는 여러 프롬프트를 동시에 처리하는 배치 처리에 효율적입니다. 멀티모달 기능을 통해 이미지(예: 그래프, 밈, 제품 사진)를 해석할 수 있습니다. 검열되지 않은 특성은 성인 주제를 탐구하는 창작 글쓰기, 성인 롤플레이, 콘텐츠 제한 없이 픽션을 생성하는 데 이상적입니다. 또한 다른 Gemma 4 변종과 유사하게 추론, 수학, 코딩에 대한 표준 NLP 벤치마크에서도 우수한 성능을 보입니다.
만약 작업에 긴 컨텍스트(예: 8K 토큰 미만)나 멀티모달 입력이 필요하지 않다면, 토큰당 더 빠르고 저렴한 Gemma 2 9B나 Llama 3 8B 같은 더 작은 밀집 모델을 사용하는 것이 더 나을 수 있습니다. 안전 필터가 필요한 작업의 경우, 검열되지 않은 모델은 부적절한 출력을 생성할 수 있으므로 안전 조정 모델을 선택하세요. 또한 실시간 채팅을 위해 매우 낮은 지연 시간이 필요하다면, 이 MoE 모델은 전문가 라우팅 오버헤드로 인해 작은 밀집 모델보다 느릴 수 있습니다. 처리량 요구 사항을 고려하세요: 높은 볼륨의 짧은 컨텍스트 요청의 경우 Gemma 2 27B(밀집) 같은 저렴한 모델이 더 비용 효율적일 수 있습니다.
혼합 전문가 설계는 토큰당 매개변수의 하위 집합(총 260억 개 중 40억 개)만 활성화합니다. 이는 밀집 260억 모델에 비해 순방향 전달당 계산 비용을 줄여 동일한 하드웨어에서 더 높은 처리량을 가능하게 합니다. 그러나 라우팅은 토큰당 약간의 지연 오버헤드를 발생시키며, 프롬프트가 고도로 전문화된 경우 전문가 부하 불균형을 초래할 수 있습니다. 실제로 이와 같은 MoE 모델은 적은 FLOP으로 경쟁력 있는 품질을 제공하는 좋은 절충안을 제공합니다. 40억 개의 활성 매개변수는 토큰당 계산 측면에서 40억 개의 밀집 모델과 유사하지만, 모델은 총 260억 개의 매개변수에 저장된 지식의 혜택을 누립니다.
네, 이 모델은 텍스트와 이미지 입력을 모두 받아들입니다. 단일 이미지 또는 여러 이미지를 텍스트 지시와 함께 요청에 보낼 수 있습니다. 이미지는 인코딩되어 텍스트와 함께 262,144토큰 컨텍스트 윈도우 내에서 처리됩니다. 이를 통해 시각적 질문 응답, 문서 이해, 차트, 다이어그램 또는 사진 분석이 필요한 작업이 가능합니다. 모델은 비전 인코더(일반적으로 ViT와 유사한 구성 요소)를 사용하여 이미지를 토큰으로 변환합니다. 아키텍처의 정확한 세부 사항은 공개적으로 문서화되지 않았지만, 표준 이미지 형식을 지원합니다. 이미지는 해상도에 비례하여 토큰을 소모하므로, 고해상도 이미지는 사용 가능한 텍스트 컨텍스트를 줄입니다.
Gemma 4 변종으로서, 기본 모델(안전 튜닝 적용)은 MMLU, GSM8K와 같은 추론 벤치마크와 HumanEval 및 MBPP와 같은 코딩 작업에서 강력한 성능을 보여주었습니다. 검열되지 않은 버전은 핵심 모델 가중치가 변경되지 않았으므로 이러한 기능을 그대로 유지할 것으로 예상됩니다. 그러나 이 검열되지 않은 변종에 대한 구체적인 벤치마크 점수는 공개되지 않았습니다. 사용자는 산술 추론, 코드 생성 및 다국어 작업에서 경쟁력 있는 결과를 기대할 수 있습니다. 또한 262K 컨텍스트 창은 컨텍스트가 짧은 모델에 비해 긴 문서 검색 및 요약에서 뛰어난 성능을 제공합니다. 멀티모달 벤치마크의 경우, 모델은 시각적 질문 응답 데이터세트를 적절히 처리할 수 있어야 합니다.
Gemma 4 26B A4B 모델의 지연 시간은 일반적으로 밀집형 26B 파라미터 모델보다 낮습니다. 토큰당 활성화되는 파라미터가 4B에 불과하기 때문입니다. 하지만 MoE 라우팅 메커니즘은 생성되는 각 토큰에 약간의 오버헤드를 추가하므로, 토큰당 총 지연 시간은 순수 4B 밀집형 모델보다 약간 더 높을 수 있습니다. 긴 시퀀스에 대한 배치 추론의 경우, 메모리 대역폭 요구량이 줄어들어 처리량이 더 높아질 수 있습니다. OrcaRouter에서의 지연 시간은 Obsidian 제공업체가 프로비저닝한 기본 하드웨어에 따라 달라집니다. 실제 성능은 대표적인 워크로드로 테스트하여 속도 요구 사항을 충족하는지 확인해야 합니다.
장점에도 불구하고, 이 모델에는 한계가 있습니다. 4B 활성 파라미터는 매우 복잡한 추론이나 도메인 특화 지식에 있어서 더 큰 모델(예: Gemma 4 47B (dense) 또는 프론티어 모델)보다 성능이 떨어질 수 있음을 의미합니다. 검열되지 않은 특성은 중재 없이 사용될 경우 출력이 유해하거나 편향되거나 인간의 가치와 일치하지 않을 수 있음을 의미합니다. 또한 OrcaRouter를 통해 접근할 때 OpenAI의 사용 정책을 위반하는 유해 콘텐츠를 생성할 수 있으며, 사용자는 이를 준수할 책임이 있습니다. 추가로 MoE 아키텍처는 전문가 라우팅이 최적이 아닐 경우 토큰 간 품질이 일관되지 않을 수 있습니다. 마지막으로, 멀티모달 이해는 존재하지만 전용 비전-언어 모델과는 일치하지 않을 수 있습니다.
이 모델의 가격은 제공업체 Obsidian이 결정하며, OrcaRouter가 마진 없이 전달합니다. 입력 토큰 100만 개당 0.25달러, 출력 토큰 100만 개당 2.90달러를 지불합니다. 입력 토큰에는 텍스트 토큰과 이미지 토큰(이미지는 처리 전에 토큰화됨)이 모두 포함됩니다. 출력 토큰은 생성된 응답을 포함합니다. API 호출이나 컨텍스트 윈도우 사용에 대한 추가 수수료는 토큰당 비용 외에 없습니다. 이 가격은 특히 큰 컨텍스트 윈도우를 고려할 때 26B MoE 모델에 대해 경쟁력이 있습니다. 요금은 요청별로 계산되며 OrcaRouter 청구 명세서에 표시됩니다.
출력 토큰은 입력 토큰보다 훨씬 비쌉니다(백만 개당 $2.90 대 $0.25). 이는 언어 모델에서 일반적인 현상인데, 토큰을 생성하려면 입력을 처리하는 것보다 더 많은 계산이 필요하기 때문입니다. 비용을 최소화하려면 프롬프트를 구성하여 출력 토큰 수를 줄이는 방법(예: 짧은 응답 요청, 시스템 지침을 사용해 장황함 제한)을 활용할 수 있습니다. 또한 입력 비용이 저렴하므로 큰 컨텍스트 윈도우(최대 262K 토큰)를 부담 없이 포함시킬 수 있습니다. 사용 사례에 짧은 프롬프트가 많지만 긴 응답이 필요한 경우, 출력 토큰 비용이 지배적이 됩니다.
OrcaRouter는 이 모델에 대해 내장 캐싱을 제공하지 않습니다. 가격은 토큰당 및 요청당 책정됩니다. 그러나 일반적인 입력 시퀀스에 대해 클라이언트 측 캐싱을 구현하여 동일한 프롬프트를 다시 전송하지 않을 수 있습니다. 또한 여러 대화에 걸쳐 동일한 시스템 메시지를 반복하는 경우, 긴 컨텍스트에 포함시키고 chat completions API를 통해 동일한 세션을 재사용하여 중복 입력 토큰을 피하는 것을 고려할 수 있습니다. 일부 제공업체는 자체적으로 프롬프트 캐싱을 제공할 수 있지만, Obsidian의 나열된 가격에는 캐싱 옵션이 포함되지 않습니다. 반복되는 프롬프트에 대한 잠재적 할인 혜택이 있는지 제공업체의 문서를 확인하세요.
이 모델을 사용하려면 OpenAI 호환 엔드포인트 https://api.orcarouter.ai/v1로 요청을 보내십시오. model 매개변수를 "obsidian/gemma-4-26B-A4B"로 설정하십시오. OrcaRouter의 API 키는 Authorization 헤더에 Bearer 토큰으로 포함되어야 합니다. API는 텍스트 완성 및 채팅 완성 엔드포인트를 모두 지원합니다. 채팅의 경우 /v1/chat/completions 엔드포인트를 사용하며, 사용자, 어시스턴트 및 시스템 역할을 포함한 messages 배열을 사용합니다. 멀티모달 요청의 경우 content 필드에 이미지 URL 또는 base64 데이터를 포함하십시오. Python의 예제 요청 본문은 openai 라이브러리를 사용하며 base_url을 OrcaRouter의 엔드포인트로 설정하고 모델 ID는 위와 같이 설정합니다.
API는 표준 OpenAI 매개변수를 지원합니다: temperature (0-2, 기본값 1), top_p (0-1), max_tokens (컨텍스트 창까지), presence_penalty, frequency_penalty, stop sequences, 및 n (완료 수). 멀티모달의 경우, content 필드는 type "text" 및 type "image_url"의 배열을 허용합니다. 또한 stream=true로 설정하여 스트리밍 응답을 받을 수 있습니다. 모델은 system messages를 지원합니다. 컨텍스트 창은 입력 및 출력을 포함하여 262,144 토큰입니다. 문서와 정확히 동일하게 지원되지 않는 매개변수가 있을 수 있습니다. 특정 제공업체의 제한 사항에 대해서는 OrcaRouter 문서를 확인하세요. 최상의 결과를 위해, 창의적인 작업에는 temperature를 0.7에서 1.0 사이로 설정하고, 결정론적 출력에는 낮게 설정하세요.
마이그레이션은 OpenAI 호환 API 덕분에 간단합니다. 현재 OpenAI Python 클라이언트를 사용 중이라면 base_url을 https://api.orcarouter.ai/v1로 변경하고 API 키를 OrcaRouter 키로 설정하세요. 모델 파라미터를 이전 모델 이름에서 "obsidian/gemma-4-26B-A4B"로 업데이트하세요. 대부분의 사용 사례에서 다른 코드 변경은 필요하지 않습니다. 멀티모달 요청의 경우 이미지 형식이 다를 수 있습니다. OpenAI의 vision API와 동일한 구조를 사용하세요. 호환성을 확인하기 위해 몇 가지 요청을 테스트하세요. 속도 제한 및 오류 처리 방식이 다를 수 있으므로, 모범 사례를 위해 OrcaRouter의 문서를 참조하세요.
모든 API 호출의 기본 URL은 https://api.orcarouter.ai/v1입니다. 요청에 사용할 정확한 모델 식별자는 "obsidian/gemma-4-26B-A4B"입니다. 이 ID는 채팅 완료(chat completions) 또는 완료(completions) 호출에서 model 매개변수로 전달되어야 합니다. 이 변형에 대한 대체 모델 ID는 없습니다. 올바르게 Obsidian 공급자로 라우팅되도록 전체 접두사 'obsidian/'를 포함해야 합니다. 공급자 접두사 없이 일반 'gemma-4-26B-A4B' ID를 사용하려고 하면 해결되지 않을 수 있습니다. OrcaRouter가 동일한 기본 모델을 제공하는 여러 공급자를 지원하기 때문에 공급자 접두사가 필요합니다.
Gemma 4 제품군에서 Google은 밀집(dense) 및 MoE 변형을 모두 제공합니다. 밀집 버전(예: Gemma 4 47B)은 모든 파라미터가 활성화되어 토큰당 품질은 높지만 계산 비용이 더 높습니다. 총 26B, 활성 4B의 MoE 버전은 비용 효율성 측면에서 최적의 지점을 제공합니다. Gemma 4 2B 또는 9B 밀집 모델과 비교할 때, 이 모델은 더 큰 총 파라미터 수로 인해 더 넓은 지식을 보유합니다. MoE 모델 중에서 Gemma 4 26B A4B는 Mixtral 8x22B(총 141B, 활성 39B)와 같은 더 큰 MoE 모델보다 작습니다. 검열되지 않은 측면은 이 Obsidian 변형에만 해당됩니다. 다른 Gemma 4 모델에는 안전 조정이 포함됩니다.
Llama 3-Uncensored 또는 Wizard 시리즈와 같은 검열되지 않은 모델은 일반적으로 기본 모델에서 안전 필터를 제거합니다. 이 Gemma 4 변형은 드문 MoE 검열되지 않은 옵션 중 하나로, 더 큰 총 파라미터 수(26B)와 더 낮은 활성 파라미터(4B)를 제공합니다. Llama 3 70B Uncensored와 비교하면 훨씬 작고 저렴하지만 복잡한 작업에서 낮은 성능 상한선을 가질 수 있습니다. 262K 컨텍스트 창은 대부분의 검열되지 않은 모델(보통 8K-32K로 제한됨)보다 훨씬 큽니다. 멀티모달 지원도 차별화 요소입니다: 대부분의 검열되지 않은 모델은 텍스트 전용입니다.
GPT-4o와 Claude 3.5 Sonnet은 더 크고 독점적인 모델로, 광범위한 안전 조정과 멀티모달 기능을 갖추고 있습니다. 일반적으로 Gemma 4 26B A4B보다 벤치마크와 실제 작업에서, 특히 추론, 창의성, 일관성 측면에서 더 뛰어납니다. 그러나 토큰당 비용이 훨씬 더 비쌉니다 (GPT-4o: 입력 $5/M, 출력 $15/M; Claude: 입력 $3/M, 출력 $15/M). Gemma 모델은 안전 제한이 없으면서 큰 컨텍스트가 필요한 비용 민감 애플리케이션에 이상적입니다. 미묘한 지시 따르기나 사실적 정확성에서 최첨단 모델과 견줄 수는 없지만, 많은 생성 작업에는 충분할 수 있습니다.
이 모델을 더 큰 모델(GPT-4o, Claud Opus 등)보다 선택해야 하는 경우: (1) 프리미엄 가격을 지불하지 않고 매우 큰 컨텍스트 창(262K)이 필요할 때; (2) 허용된 사용 사례에 대해 검열되지 않은 출력이 필요할 때; (3) 워크로드가 높은 처리량이고 MoE 비용 효율성이 중요할 때; (4) 작업이 4B 활성 파라미터 모델의 성능 범위 내에 있을 때. 중요한 결정을 위한 최고 품질, 엄격한 안전 정렬, 또는 극도로 복잡한 추론이 필요하다면 이 모델을 피하십시오. 요약, 번역, 긴 문서에 대한 Q&A와 같은 많은 일반적인 작업에서 이 모델은 강력한 가격 대비 성능 비율을 제공합니다.
| 입력 / 1M tokens | $0.250 |
| 출력 / 1M tokens | $2.90 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
@misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B