Gemini 3.8 Flash adalah model Flash paling cerdas dari Google dengan peningkatan signifikan dibanding 3.7 Flash di bidang rekayasa perangkat lunak, tugas agen, dan penalaran multi-langkah.
Gemini 3.8 Flash ditujukan untuk tim yang membutuhkan model Google dengan input multimodal yang luas, jendela konteks yang panjang, batas output yang besar, dan API yang kompatibel dengan OpenAI.…
Kapabilitas yang dinyatakan mencakup dukungan input yang luas, konteks 1.048.576 token, batas output 65.536 token, serta skor 54,9 pada HLE-Verified. HLE-Verified adalah benchmark tingkat ahli, jadi skor tersebut mengindikasikan bahwa model ini mampu menangani pertanyaan yang menuntut pengingatan yang sulit, penalaran, dan komputasi. Karena menerima teks, gambar, video, file, dan audio, satu workflow dapat mengirimkan dokumen, rekaman, dan instruksi lanjutan secara bersamaan. Di OrcaRouter, tidak diperlukan Google SDK terpisah: model diekspos sebagai google/gemini-3.8-flash melalui API standar yang kompatibel dengan OpenAI. Ini memudahkan pipeline yang saat ini mengirim permintaan chat completion. Max output yang tinggi membuat model mampu menghasilkan laporan lengkap, file kode, atau output terstruktur dalam satu generasi. Apakah ini berarti model mendukung tool calling, eksekusi kode, atau output terstruktur? Entri katalog tidak mencantumkan fitur-fitur tersebut. Kapabilitas semacam ini perlu diuji terlebih dahulu sebelum Anda mengandalkannya.
Jendela konteks dengan 1.048.576 token memungkinkan prompt yang berisi dokumen besar, buku, kumpulan file yang ekstensif, atau transkrip rekaman yang panjang. Hal ini mengurangi kebutuhan akan pemotongan, pengambilan informasi, atau peringkasan multi-giliran ketika materi sumber dapat muat dalam batas penyedia. Ini juga memungkinkan Anda menyertakan teks sumber, instruksi tugas, dan contoh dalam satu panggilan. Anggaran konteks yang praktis mungkin lebih kecil jika Anda meminta keluaran yang sangat panjang, karena daftar ini tidak menyatakan bagaimana input dan output berbagi jendela yang sama. Untuk keandalan maksimal, letakkan instruksi di tempat yang paling mungkin ditanggapi oleh model, dan uji dengan tata letak prompt Anda sendiri. Jika total permintaan Anda melebihi batas penyedia, OrcaRouter akan mengembalikan kesalahan upstream. Panggilan dengan konteks panjang ditagih per token, jadi konteks yang luas tidak gratis; token masukan dikenakan biaya $0,75 per 1 juta token. Untuk tugas yang sebagian besar jendelanya tidak relevan, prompt yang lebih pendek mungkin memberikan kinerja yang sama baiknya dengan biaya yang lebih rendah.
Tidak semua tugas membutuhkan konteks 1.048.576 token, input multimodal, atau skor 54.9 HLE-Verified. Untuk klasifikasi teks pendek, pembuatan judul, routing sederhana, atau ekstraksi dengan kompleksitas rendah, model yang lebih murah sering kali dapat menghasilkan output yang dapat diterima dengan biaya lebih rendah. Di OrcaRouter, mengganti ID model tidak mengubah pola API secara keseluruhan, sehingga tim dapat membuat prototipe menggunakan model yang lebih murah dan meningkatkan ke google/gemini-3.8-flash hanya ketika kualitas atau panjang output membutuhkannya. Jika beban kerja hanya menggunakan teks dan prompt kecil, konteks besar dan dukungan media tidak memberikan nilai tambah. Jika output yang diinginkan melebihi 65.536 token, model ini tidak dapat menghasilkannya dalam satu penyelesaian. Struktur harga juga penting: token output dibanderol $3,75 per 1M, lima kali lipat tarif input. Beban kerja yang berat pada generasi akan didominasi oleh biaya output. Untuk kasus seperti ini, generasi yang lebih pendek atau model output yang lebih murah sering kali lebih ekonomis.
HLE-Verified adalah subset terverifikasi dari benchmark Humanity's Last Exam, yang berisi pertanyaan-pertanyaan sulit tingkat ahli yang telah diperiksa kebenarannya. Gemini 3.8 Flash mencapai 54.9 pada benchmark tersebut menurut katalog OrcaRouter. Skor yang lebih tinggi berarti model menjawab porsi yang lebih besar dari item-item sulit ini dengan benar. Skor di atas 50 menunjukkan bahwa model menangani lebih dari separuh item HLE terverifikasi dalam evaluasi ini. Ini adalah titik referensi untuk tugas pengetahuan, matematika, dan penalaran yang sulit, bukan profil kualitas yang lengkap. Daftar ini tidak memberikan skor benchmark lain, sehingga performa MMLU, coding, matematika, atau mengikuti instruksi tidak dapat diturunkan dari angka ini. Kualitas produksi bervariasi tergantung tugas dan gaya prompt, dan angka benchmark dapat dipengaruhi oleh metodologi evaluasi. Tim harus menjalankan contoh validasi privat melalui OrcaRouter dan membandingkan model ini dengan kandidat lain daripada memperlakukan satu skor agregat sebagai satu-satunya kriteria keputusan.
Output maksimum 65.536 token menetapkan batas atas pada panjang satu respons yang dihasilkan. Ini menjadi penting ketika tugas meminta analisis ekstensif, dokumen panjang, atau payload terstruktur yang besar. Untuk tugas benchmark jawaban singkat seperti HLE-Verified, batas output biasanya bukan hambatan utama. Untuk generasi konten, batas ini menghilangkan kebutuhan untuk membagi output di sebagian besar kasus umum. Batas output juga berinteraksi dengan jendela konteks 1.048.576 token, karena prompt yang mengisi seluruh konteks ditambah output dengan panjang maksimum dapat melampaui anggaran total penyedia layanan, kecuali penyedia layanan memisahkan alokasi input dan output. Catatan katalog ini tidak menentukan aturan penghitungan tersebut. Dalam praktiknya, atur max_tokens ke nilai terbesar yang Anda butuhkan, bukan selalu menggunakan 65.536. Output panjang ditagih sebesar $3.75 per 1M token, sehingga generasi yang tidak perlu meningkatkan biaya. Jika aplikasi membutuhkan lebih dari 65.536 token dalam satu respons, model ini saja tidak memadai.
Katalog OrcaRouter tidak mempublikasikan angka latensi atau throughput untuk Gemini 3.8 Flash. Waktu respons bergantung pada ukuran prompt, panjang keluaran, kondisi jaringan, konkurensi, dan beban sisi penyedia. Nama Flash dalam jajaran model Google umumnya menandakan model yang lebih responsif dibandingkan lini produk yang lebih besar atau lebih dalam, tetapi tidak ada target kecepatan konkret yang tercantum dalam daftar ini. Jika Anda melayani permintaan yang berhadapan langsung dengan pengguna, ukur waktu ujung-ke-ujung melalui OrcaRouter dengan muatan yang realistis. Jawaban singkat akan muncul lebih cepat daripada generasi yang panjang karena total waktu generasi biasanya bertambah seiring panjang keluaran. Model penetapan harga tidak menambahkan biaya latensi per permintaan; Anda membayar berdasarkan token masukan dan keluaran. Untuk mengurangi waktu berjalan (wall-clock), jangan sertakan konten yang tidak perlu dalam prompt, batasi max_tokens, dan hindari mengirim media besar saat tidak diperlukan. Tidak ada jaminan kecepatan yang dibuat di halaman katalog ini, sehingga aplikasi yang sensitif terhadap kinerja harus diuji beban sebelum diluncurkan.
Daftar ini tidak memberikan laporan keterbatasan terpisah. Fakta yang didokumentasikan adalah nama model, penyedia, jendela konteks, keluaran maksimum, modalitas masukan, harga, akses API, dan satu skor tolok ukur. Tidak ada klaim dukungan untuk pemanggilan alat, eksekusi kode, pembuatan gambar, keluaran audio, atau keluaran terstruktur dalam catatan ini. Fitur-fitur tersebut harus diverifikasi dengan permintaan nyata sebelum diandalkan. Skor HLE-Verified 54.9 masih berarti model melewatkan sekitar 45% item tingkat ahli yang terverifikasi dalam tolok ukur tersebut, sehingga bukan mesin penalaran yang sempurna. Jendela konteks yang besar tidak menjamin perhatian yang sama terhadap semua konten, dan tidak ada data halusinasi, bias, penolakan, atau akurasi domain yang dicantumkan. Masukan media didukung, tetapi katalog tidak menentukan bagaimana setiap jenis media diberi token atau batasan apa yang berlaku untuk ukuran file. Untuk keluaran yang kritis terhadap keselamatan atau diatur, buat validasi Anda sendiri. Jika tugas berada di luar masukan atau keluaran yang didukung, pilih model dengan entri katalog yang sesuai.
Gemini 3.8 Flash ditagih dengan tarif penyedia: $0,75 per 1.000.000 token input dan $3,75 per 1.000.000 token output. OrcaRouter tidak menambahkan markup apa pun di atas tarif tersebut. Token input mencakup teks plus konten media yang dikirimkan ke model, meskipun katalog ini tidak menyediakan formula token per gambar, per video, atau per audio. Token output mencakup teks yang dikembalikan oleh model. Karena tarif output lima kali lipat tarif input, jawaban yang panjang dapat mendominasi tagihan bahkan ketika prompt-nya besar. Untuk mengelola biaya, tulis prompt yang memberikan konteks relevan dan minta respons yang ringkas bila memungkinkan. Katalog ini tidak mencantumkan biaya sesi, biaya platform, atau biaya langganan tetap. Satu-satunya biaya yang ditentukan adalah jumlah per token. Kolom penggunaan respons yang dikembalikan oleh API harus digunakan untuk mengonfirmasi jumlah token input dan output yang ditagih untuk setiap panggilan.
Dengan harga $0,75 per juta token masukan, prompt lengkap berisi 1.048.576 token akan memakan biaya sekitar $0,79 untuk masukan sebelum keluaran dihasilkan, berdasarkan langsung pada harga yang tertera dan ukuran konteks. Keluaran lengkap berisi 65.536 token akan memakan biaya sekitar $0,25 dengan tarif $3,75 per juta. Permintaan yang menggunakan seluruh jendela masukan dan seluruh batas keluaran akan total sekitar $1,04 dengan tarif penyedia tanpa markup. Sebagian besar permintaan nyata menggunakan jauh lebih sedikit, sehingga nilai-nilai ini harus dianggap sebagai perhitungan batas atas, bukan tagihan tipikal. Karena token keluaran lebih mahal, desain yang paling murah adalah yang hanya mengirim konten yang benar-benar dibutuhkan model dan meminta hasil yang fokus. Masukan video dan audio tidak memiliki harga terpisah yang dirinci dalam catatan ini, sehingga total untuk prompt kaya media akan bergantung pada cara penyedia melakukan tokenisasi terhadap masukan tersebut. Pantau penggunaan dari setiap respons untuk memperkirakan pengeluaran agregat secara akurat.
OrcaRouter mencantumkan Gemini 3.8 Flash dengan tarif penyedia tanpa markup, jadi harga per token yang ditampilkan harus sesuai dengan tarif penyedia Google di hulu. Tidak ada biaya tambahan OrcaRouter per token yang muncul dalam catatan katalog. Caching adalah masalah terpisah: tidak ada harga prompt-cache hit, diskon cache, atau pengaturan cache otomatis yang disertakan dalam fakta model yang diberikan. Anda tidak boleh berasumsi bahwa prefiks identik yang berulang akan ditagih dengan tarif lebih rendah. Tidak adanya harga cache yang tercantum berarti model biaya teraman didasarkan pada penagihan token input penuh. Jika caching tersedia, caching dapat mengurangi biaya efektif untuk prompt berulang, tetapi perilaku tersebut tidak dijamin dalam entri ini. Untuk mengontrol biaya tanpa caching, jaga blok prompt bersama tetap pendek, gunakan penyimpanan eksternal untuk konten statis besar jika memungkinkan, dan hindari mengirim ulang materi duplikat kecuali tugas memerlukannya.
Ketika model OrcaRouter ditagih dengan tarif penyedia tanpa markup, perbedaan harga antar model berasal dari tarif upstream mereka. Gemini 3.8 Flash berbiaya $0.75 per 1 juta token input dan $3.75 per 1 juta token output. Apakah model lain lebih murah bergantung pada tarif penyedia model tersebut, yang tidak ditampilkan di entri ini. Karena tidak ada biaya per-token OrcaRouter, membandingkan harga bersifat langsung: Anda membandingkan kolom tarif penyedia. Harga bukan satu-satunya faktor. Model yang lebih murah namun menghasilkan keluaran yang tidak dapat digunakan mungkin memerlukan percobaan ulang, tinjauan manusia, atau prompting tambahan, yang pada akhirnya membuatnya lebih mahal daripada model dengan tingkat keberhasilan yang lebih tinggi. Untuk tugas pendek dan sederhana, model berbiaya lebih rendah masih memiliki keunggulan yang jelas. Untuk penalaran yang sulit atau pekerjaan multimodal/konteks panjang, evaluasi total pengeluaran per respons yang berhasil. Ukur kualitas dan biaya pada kumpulan data Anda sendiri sebelum memilih ID model default.
OrcaRouter menyediakan API yang kompatibel dengan OpenAI di https://api.orcarouter.ai/v1. Atur base_url Anda ke alamat tersebut dan kolom model ke google/gemini-3.8-flash. SDK OpenAI atau klien apa pun yang mendukung permintaan chat completion OpenAI kemudian dapat memanggil model tersebut. Sebagai contoh, klien Python akan membuat instance OpenAI dengan base_url=https://api.orcarouter.ai/v1 dan api_key diisi dengan kunci OrcaRouter Anda, lalu memanggil chat.completions.create dengan model=google/gemini-3.8-flash. Respons harus menyertakan kolom choices dan usage dengan gaya yang biasa. Ini berarti kode yang ada tidak memerlukan klien khusus Google. Untuk masukan gambar, video, file, atau audio, permintaan harus menggunakan format konten yang diterima oleh model dan diteruskan melalui OrcaRouter; halaman katalog ini tidak menampilkan skema media, jadi uji permintaan kecil terlebih dahulu. Gunakan ID model persis seperti yang tertulis, termasuk prefiks google.
Setidaknya, atur model ke google/gemini-3.8-flash dan berikan array messages yang berisi konten pengguna. Endpoint ini kompatibel dengan OpenAI, sehingga parameter standar seperti max_tokens, temperature, top_p, stop, dan stream mungkin tersedia, tergantung pada dukungan penyedia. Entri katalog tidak mencantumkan nilai default atau batasan rentang untuk parameter sampling. Karena output maksimum yang tercantum adalah 65.536 token, permintaan yang menetapkan max_tokens lebih tinggi dari nilai tersebut harus disikapi dengan hati-hati; model upstream dapat menolak atau membatasinya. Jika tugas Anda memerlukan respons yang panjang, tetapkan max_tokens secara eksplisit sesuai panjang yang diharapkan. Jika respons singkat sudah cukup, pertahankan max_tokens tetap rendah untuk menghindari biaya output yang tidak diperlukan. Array messages harus menggunakan peran yang sama dengan yang digunakan pada model bergaya OpenAI lainnya. Untuk input media, tambahkan konten media dalam format yang digunakan oleh klien API Anda, lalu verifikasi bahwa OrcaRouter mengembalikan completion yang valid, bukan kesalahan pengodean input.
Ya. Karena OrcaRouter menggunakan API yang kompatibel dengan OpenAI, migrasi biasanya melibatkan tiga perubahan: atur URL dasar menjadi https://api.orcarouter.ai/v1, gunakan kunci API OrcaRouter, dan ubah nama model menjadi google/gemini-3.8-flash. Kode yang membaca choices[0].message.content dan usage akan tetap berfungsi. Alur kerja khusus teks seharusnya bermigrasi dengan mulus. Alur kerja multimodal kurang pasti: jika kode Anda saat ini mengirim gambar dengan bagian konten khusus OpenAI, kolom-kolom tersebut mungkin diterima atau tidak persis seperti apa adanya oleh Gemini 3.8 Flash. Catatan katalog tidak menyertakan spesifikasi konversi media. Sebelum memigrasikan lalu lintas bervolume tinggi atau media berat, jalankan serangkaian permintaan identik yang kecil ke kedua endpoint dan bandingkan respons serta pesan kesalahan. Pertahankan ID model Anda yang ada sebagai fallback selama migrasi karena perilaku satu model tidak dijamin identik dengan model lain bahkan melalui bentuk API yang sama.
Halaman katalog ini hanya mencakup satu model Google, jadi halaman ini tidak menampilkan tabel berdampingan dengan varian Gemini lainnya. Dalam penamaan Google, Flash biasanya mengidentifikasi model yang dimaksudkan untuk keseimbangan kecepatan dan biaya, sementara tingkatan Gemini lainnya mungkin menargetkan kemampuan yang lebih tinggi atau titik harga yang berbeda. Klaim tersebut tidak didukung oleh fakta dalam entri ini, jadi pemilihan akhir harus didasarkan pada bidang katalog per model. Bandingkan jendela konteks, output maksimum, modalitas input, harga, dan skor benchmark. Gemini 3.8 Flash memiliki konteks 1,048,576 token, output maksimum 65,536, input multimodal, dan skor HLE-Verified 54.9. Model Gemini lain mungkin memiliki konteks yang lebih kecil atau harga yang berbeda, tetapi informasi tersebut tidak disediakan di sini. Jalankan prompt evaluasi yang sama melalui OrcaRouter terhadap setiap kandidat. Ini lebih andal daripada berasumsi bahwa dua model dari penyedia yang sama memiliki perilaku yang sama.
Untuk tugas sederhana, model yang lebih murah per token dapat mengalahkan Gemini 3.8 Flash dari segi biaya. Gemini 3.8 Flash mengenakan biaya $0,75 per 1M input dan $3,75 per 1M output; model lain dengan tarif lebih rendah mungkin menarik jika outputnya pendek dan tugasnya sederhana. Namun, harga saja tidak menentukan total biaya. Jika model yang lebih murah sering memulai ulang atau menghasilkan jawaban yang buruk untuk permintaan kompleks, panggilan tambahan dapat melebihi penghematan. Kekuatan penyeimbang utama Gemini 3.8 Flash adalah skor HLE-Verified 54,9, input multimodal, konteks besar, dan batas output panjang. Jika beban kerja Anda tidak memanfaatkan kekuatan tersebut, model yang lebih murah adalah pilihan yang rasional. Gunakan OrcaRouter untuk menjalankan kedua model pada sampel representatif dan bandingkan akurasi, panjang output, serta total pengeluaran per hasil yang berhasil. Batasan konteks juga penting karena model dengan jendela lebih kecil mungkin memerlukan pengambilan atau pemecahan tambahan, yang menambah biaya integrasi.
Model yang dikhususkan untuk penalaran biasanya dioptimalkan untuk mengeluarkan komputasi tambahan pada logika dan matematika yang sulit. Entri katalog ini tidak menyertakan model lain untuk perbandingan, sehingga arahan di bawah bersifat kualitatif. Gemini 3.8 Flash masuk akal ketika beban kerja Anda membutuhkan konteks panjang, keluaran sangat panjang, atau input teks plus gambar, video, file, dan audio. Fitur-fitur tersebut bisa lebih penting daripada tambahan satu poin pada tolok ukur yang sulit. Profil Flash juga menunjukkan opsi dengan latensi lebih rendah daripada model penalaran yang lebih berat, meskipun tidak ada klaim kecepatan yang dicantumkan di sini. Jika tugasnya berupa pembuktian sulit, analisis kode, atau pertanyaan perencanaan multi-langkah, bandingkan google/gemini-3.8-flash dengan model penalaran pada prompt bergaya HLE Anda sendiri. Jika Anda tidak memerlukan pertimbangan mendalam, model kelas Flash dapat menghindari biaya lebih tinggi dan respons yang lebih lambat. Tidak ada pemenang universal; faktor penentunya adalah ukuran konteks, dukungan modalitas, latensi yang diperlukan, panjang keluaran, dan kualitas tugas yang terukur.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-3.8-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Input / 1M token | $0.750 |
| Output / 1M token | $3.75 |
| Baca cache / 1M | $0.075 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
Yang dibicarakan developer minggu ini
GET /api/public/models/google/gemini-3.8-flashBuka @misc{orcarouter_gemini_3_8_flash,
title = {Gemini 3.8 Flash API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.8-flash}
}Google. (2026). Gemini 3.8 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.8-flash