Versi tanpa sensor lossless dari Gemma 4 26B A4B yang dirancang untuk mempertahankan kemampuan model asli sambil meminimalkan perilaku penolakan. Dioptimalkan untuk pengembang, peneliti AI, dan aplikasi tingkat lanjut yang memerlukan respons berkualitas tinggi dengan batasan minimal. Varian Balanced direkomendasikan untuk sebagian besar beban kerja, memberikan jawaban lengkap sambil mempertahankan penalaran yang stabil dan perilaku percakapan yang alami. Dalam beberapa skenario sensitif, model mungkin sebentar membingkai penalarannya sebelum memberikan respons penuh, tetapi dirancang untuk tidak menyembunyikan konten. Dibandingkan dengan varian tanpa sensor yang lebih agresif, Balanced menawarkan pengambilan sampel yang lebih konsisten, stabilitas konteks panjang yang lebih kuat, dan pengurangan penyimpangan topik dalam percakapan yang panjang. Cocok untuk penulisan kreatif, permainan peran, asisten multibahasa, penalaran konteks panjang, dan aplikasi AI serba guna di mana kualitas, koherensi, dan keandalan merupakan prioritas utama. Akses ke model ini dibatasi dan ditujukan untuk peneliti keamanan, tim merah, peneliti keselamatan AI, dan profesional berkualifikasi lainnya yang melakukan penelitian, evaluasi, dan pengujian yang sah.
Gemma 4 26B A4B Uncensored adalah model bahasa mixture-of-experts (MoE) dari seri Gemma 4 milik Google, yang dihosting oleh penyedia Obsidian dan dapat diakses melalui OrcaRouter. Model ini memiliki…
Gemma 4 26B A4B Uncensored unggul dalam tugas-tugas yang memerlukan penalaran jarak jauh pada konteks besar, seperti perangkuman buku, percakapan multi-giliran dengan riwayat ekstensif, dan analisis basis kode. Arsitektur MoE-nya membuatnya efisien untuk pemrosesan batch di mana banyak prompt ditangani secara bersamaan. Kemampuan multimodal memungkinkannya untuk menalar tentang gambar—misalnya, menginterpretasi grafik, meme, atau foto produk. Perilaku tanpa sensor sangat ideal untuk penulisan kreatif yang mengeksplorasi tema dewasa, roleplay dewasa, atau menghasilkan fiksi tanpa batasan konten. Model ini juga berkinerja baik pada tolok ukur NLP standar untuk penalaran, matematika, dan pengkodean, mirip dengan varian Gemma 4 lainnya.
Jika tugas Anda tidak memerlukan konteks panjang (misalnya, di bawah 8K token) atau input multimodal, Anda mungkin lebih cocok menggunakan model dense yang lebih kecil seperti Gemma 2 9B atau Llama 3 8B, yang lebih cepat dan lebih murah per token. Untuk tugas yang membutuhkan filter keamanan, model tanpa sensor dapat menghasilkan keluaran yang tidak pantas—pilihlah model yang telah disesuaikan dengan keamanan. Selain itu, jika Anda memerlukan latensi yang sangat rendah untuk obrolan real-time, model MoE ini mungkin lebih lambat daripada model dense kecil karena adanya overhead perutean ahli. Pertimbangkan kebutuhan throughput Anda: untuk permintaan volume tinggi dengan konteks pendek, model yang lebih murah seperti Gemma 2 27B (dense) mungkin lebih hemat biaya.
Desain mixture-of-experts hanya mengaktifkan subset parameter per token (4 miliar dari total 26 miliar). Ini mengurangi biaya komputasi per forward pass dibandingkan dengan model padat 26B, memungkinkan throughput yang lebih tinggi pada perangkat keras yang sama. Namun, routing memperkenalkan sedikit overhead latensi per token dan dapat menyebabkan ketidakseimbangan beban ahli jika prompt sangat terspesialisasi. Dalam praktiknya, model MoE seperti ini menawarkan trade-off yang baik: kualitas kompetitif dengan sebagian kecil dari FLOPs. Parameter aktif 4B sebanding dengan model padat 4B dalam hal komputasi per token, namun model ini mendapat manfaat dari pengetahuan yang tersimpan di total 26B parameter.
Ya, model ini menerima input teks dan gambar. Anda dapat mengirim satu gambar atau beberapa gambar dalam satu permintaan, disertai instruksi teks. Gambar-gambar tersebut dienkode dan diproses bersama teks dalam jendela konteks 262.144 token. Ini memungkinkan tanya jawab visual, pemahaman dokumen, dan tugas yang memerlukan analisis bagan, diagram, atau foto. Model ini menggunakan encoder visi (biasanya komponen seperti ViT) untuk mengonversi gambar menjadi token. Meskipun detail pasti arsitekturnya tidak didokumentasikan secara publik, model ini mendukung format gambar standar. Perhatikan bahwa gambar mengonsumsi token sebanding dengan resolusinya, sehingga gambar beresolusi tinggi akan mengurangi konteks teks yang tersedia.
Sebagai varian Gemma 4, model dasar (dengan penyesuaian keamanan) telah menunjukkan performa kuat pada tolok ukur penalaran seperti MMLU, GSM8K, dan tugas coding seperti HumanEval dan MBPP. Versi tanpa sensor kemungkinan besar tetap mempertahankan kemampuan ini karena bobot inti model tidak berubah. Namun, skor tolok ukur khusus untuk varian tanpa sensor ini belum dirilis. Pengguna dapat mengharapkan hasil yang kompetitif dalam penalaran aritmatika, pembuatan kode, dan tugas multibahasa. Jendela konteks 262K juga memungkinkan performa unggul dalam pengambilan dokumen panjang dan peringkasan dibandingkan model dengan konteks lebih pendek. Untuk tolok ukur multimodal, model ini seharusnya mampu menangani kumpulan data tanya jawab visual secara memadai.
Latensi untuk model Gemma 4 26B A4B umumnya lebih rendah dibandingkan model parameter padat 26B karena hanya 4B parameter yang aktif per token. Namun, mekanisme routing MoE menambahkan sedikit overhead pada setiap token yang dihasilkan, sehingga total latensi per token mungkin sedikit lebih tinggi daripada model padat murni 4B. Untuk inferensi batch dengan urutan panjang, throughput bisa lebih tinggi karena pengurangan permintaan bandwidth memori. Pada OrcaRouter, latensi juga akan bergantung pada perangkat keras yang disediakan oleh penyedia Obsidian. Kinerja sebenarnya harus diuji dengan beban kerja yang representatif untuk menentukan apakah memenuhi persyaratan kecepatan Anda.
Meskipun memiliki kelebihan, model ini memiliki keterbatasan. Parameter aktif 4B berarti bahwa untuk penalaran yang sangat kompleks atau pengetahuan domain-spesifik, model ini mungkin kurang berkinerja dibandingkan model yang lebih besar seperti Gemma 4 47B (padat) atau model perbatasan. Sifat yang tidak disensor berarti keluaran mungkin beracun, bias, atau tidak selaras dengan nilai-nilai manusia jika digunakan tanpa moderasi. Model ini juga dapat menghasilkan konten berbahaya yang melanggar kebijakan penggunaan OpenAI ketika diakses melalui OrcaRouter—pengguna bertanggung jawab atas kepatuhan. Selain itu, arsitektur MoE dapat menyebabkan kualitas yang tidak konsisten antar token jika perutean ahli tidak optimal. Terakhir, pemahaman multimodal, meskipun ada, mungkin tidak sebanding dengan model visi-bahasa yang didedikasikan.
Harga untuk model ini ditentukan oleh penyedia Obsidian dan diteruskan oleh OrcaRouter tanpa markup. Anda membayar $0,25 per juta token masukan dan $2,90 per juta token keluaran. Token masukan mencakup token teks dan gambar (gambar ditokenisasi sebelum diproses). Token keluaran mencakup respons yang dihasilkan. Tidak ada biaya tambahan untuk panggilan API atau penggunaan konteks jendela di luar biaya per token. Penetapan harga ini kompetitif untuk model MoE 26B, terutama mengingat jendela konteks yang besar. Biaya dihitung per permintaan dan muncul di laporan penagihan OrcaRouter Anda.
Token keluaran jauh lebih mahal daripada token masukan ($2.90 vs $0.25 per juta). Hal ini wajar untuk model bahasa karena menghasilkan token memerlukan lebih banyak komputasi dibandingkan memproses masukan. Untuk meminimalkan biaya, Anda dapat menyusun prompt untuk mengurangi jumlah token keluaran—misalnya, dengan meminta respons yang lebih pendek atau menggunakan instruksi sistem untuk membatasi kata-kata berlebihan. Selain itu, karena biaya masukan rendah, Anda dapat menyertakan konteks yang besar (hingga 262K token) tanpa menguras kantong. Jika kasus penggunaan Anda melibatkan banyak prompt pendek namun respons panjang, biaya token keluaran akan mendominasi.
OrcaRouter tidak menyediakan caching bawaan untuk model ini. Harga berdasarkan per-token dan per-permintaan. Namun, Anda dapat menerapkan caching di sisi klien untuk urutan input umum guna menghindari pengiriman ulang prompt yang identik. Selain itu, jika Anda mengulangi pesan sistem yang sama di banyak percakapan, Anda dapat mempertimbangkan untuk menyertakannya dalam konteks yang panjang dan menggunakan kembali sesi yang sama melalui API chat completions untuk menghindari token input yang redundan. Beberapa penyedia mungkin menawarkan caching prompt sendiri, tetapi harga Obsidian seperti yang tercantum tidak menyertakan opsi caching. Periksa dokumentasi penyedia untuk kemungkinan diskon pada prompt yang diulang.
Untuk menggunakan model ini, kirimkan permintaan ke endpoint yang kompatibel dengan OpenAI https://api.orcarouter.ai/v1. Atur parameter model menjadi "obsidian/gemma-4-26B-A4B". Kunci API Anda dari OrcaRouter harus disertakan di header Authorization sebagai token Bearer. API ini mendukung endpoint text completions dan chat completions. Untuk chat, gunakan endpoint /v1/chat/completions dengan array messages yang mencakup peran user, assistant, dan system. Untuk permintaan multimodal, sertakan URL gambar atau data base64 di field content. Contoh body permintaan dalam Python akan menggunakan library openai dengan base_url diatur ke endpoint OrcaRouter dan model ID seperti di atas.
API mendukung parameter OpenAI standar: temperature (0-2, default 1), top_p (0-1), max_tokens (hingga jendela konteks), presence_penalty, frequency_penalty, stop sequences, dan n (jumlah completions). Untuk multimodal, bidang konten menerima array dengan tipe "text" dan tipe "image_url". Anda juga dapat mengatur stream=true untuk respons streaming. Model mendukung pesan sistem. Jendela konteks adalah 262.144 token termasuk input dan output. Tidak semua parameter mungkin didukung persis seperti yang didokumentasikan; periksa dokumentasi OrcaRouter untuk batasan khusus penyedia. Untuk hasil terbaik, atur suhu antara 0,7 dan 1,0 untuk tugas kreatif, dan lebih rendah untuk output deterministik.
Migrasi sangat mudah berkat API yang kompatibel dengan OpenAI. Jika saat ini Anda menggunakan klien Python OpenAI, ubah base_url menjadi https://api.orcarouter.ai/v1 dan atur kunci API Anda menjadi kunci OrcaRouter. Perbarui parameter model dari nama model sebelumnya menjadi "obsidian/gemma-4-26B-A4B". Tidak ada perubahan kode lain yang diperlukan untuk sebagian besar kasus penggunaan. Untuk permintaan multimodal, format gambar mungkin berbeda; gunakan struktur yang sama seperti API vision OpenAI. Uji beberapa permintaan untuk memastikan kompatibilitas. Perhatikan bahwa batas kecepatan dan penanganan kesalahan mungkin berbeda; konsultasikan dokumentasi OrcaRouter untuk praktik terbaik.
URL dasar untuk semua panggilan API adalah https://api.orcarouter.ai/v1. Pengenal model yang tepat untuk digunakan dalam permintaan adalah "obsidian/gemma-4-26B-A4B". ID ini harus diteruskan sebagai parameter model dalam panggilan chat completions atau completions. Tidak ada ID model alternatif untuk varian ini. Pastikan Anda menyertakan awalan lengkap 'obsidian/' untuk merutekan dengan benar ke penyedia Obsidian. Jika Anda mencoba menggunakan ID generik 'gemma-4-26B-A4B' tanpa awalan penyedia, mungkin tidak akan terselesaikan. Awalan penyedia diperlukan karena OrcaRouter mendukung beberapa penyedia yang menawarkan model dasar yang sama.
Dalam keluarga Gemma 4, Google menawarkan varian dense dan MoE. Versi dense (misalnya, Gemma 4 47B) memiliki semua parameter aktif, memberikan kualitas lebih tinggi per token tetapi dengan biaya komputasi yang lebih tinggi. Versi MoE dengan total 26B dan 4B aktif menawarkan titik optimal untuk efisiensi biaya. Dibandingkan dengan Gemma 4 2B atau 9B dense, model ini memiliki pengetahuan yang lebih luas karena jumlah parameter total yang lebih besar. Di antara model MoE, Gemma 4 26B A4B lebih kecil daripada model MoE yang lebih besar seperti Mixtral 8x22B (total 141B, 39B aktif). Aspek tanpa sensor unik untuk varian Obsidian ini; model Gemma 4 lainnya menyertakan penyesuaian keamanan.
Model-model uncensored seperti dari seri Llama 3-Uncensored atau Wizard biasanya menghapus filter keamanan dari model dasar. Varian Gemma 4 ini adalah salah satu dari sedikit opsi MoE uncensored, menawarkan jumlah parameter total yang lebih besar (26B) dengan parameter aktif yang lebih rendah (4B). Dibandingkan dengan Llama 3 70B Uncensored, model ini jauh lebih kecil dan lebih murah tetapi mungkin memiliki batas yang lebih rendah pada tugas-tugas kompleks. Jendela konteks 262K-nya jauh lebih besar daripada kebanyakan model uncensored, yang sering dibatasi pada 8K-32K. Dukungan multimodal juga menjadi pembeda: sebagian besar model uncensored hanya mendukung teks.
GPT-4o dan Claude 3.5 Sonnet adalah model proprietary yang lebih besar dengan penyetelan keamanan yang ekstensif dan kemampuan multimodal. Mereka umumnya mengungguli Gemma 4 26B A4B pada tolok ukur dan tugas dunia nyata, terutama dalam penalaran, kreativitas, dan konsistensi. Namun, mereka jauh lebih mahal per token (GPT-4o: $5/M input, $15/M output; Claude: $3/M input, $15/M output). Model Gemma ideal untuk aplikasi yang sensitif terhadap biaya yang membutuhkan konteks besar tetapi tanpa pembatasan keamanan. Model ini tidak akan menyamai model frontier dalam hal mengikuti instruksi yang halus atau akurasi faktual, tetapi mungkin cukup untuk banyak tugas generatif.
Pilih model ini daripada model yang lebih besar (seperti GPT-4o atau Claud Opus) ketika: (1) Anda membutuhkan konteks jendela yang sangat besar (262K) tanpa membayar harga premium; (2) Anda memerlukan keluaran tanpa sensor untuk kasus penggunaan yang diizinkan; (3) beban kerja Anda bervolume tinggi dan efisiensi biaya MoE penting; (4) tugas Anda berada dalam kemampuan model dengan parameter aktif 4B. Hindari model ini jika Anda membutuhkan kualitas tertinggi untuk keputusan kritis, keselarasan keamanan yang ketat, atau penalaran yang sangat kompleks. Untuk banyak tugas umum seperti peringkasan, penerjemahan, atau tanya jawab pada dokumen panjang, model ini memberikan rasio harga-kinerja yang kuat.
| Input / 1M token | $0.250 |
| Output / 1M token | $2.90 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
GET /api/public/models/obsidian/gemma-4-26B-A4BBuka @misc{orcarouter_gemma_4_26b_a4b,
title = {Gemma4 26B A4B Uncensored (Balanced) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B}
}obsidian. (2026). Gemma4 26B A4B Uncensored (Balanced) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/gemma-4-26B-A4B