Gemini 3.5 Flash-Lite adalah model Gemini yang paling hemat biaya dari Google, dirancang khusus untuk beban kerja dengan volume sangat tinggi dan sensitif terhadap latensi, di mana biaya per panggilan menjadi faktor utama. Meskipun memiliki harga yang rendah, model ini secara native multimodal — menerima teks, gambar, video, audio, dan file dengan output teks — serta memiliki jendela konteks 1 juta token dan hingga 64.000 token output yang sama dengan tingkatan Flash yang lebih besar, sehingga dokumen panjang dan input media campuran tetap dapat dijangkau. Dengan harga sekitar seperlima dari harga 3.6 Flash, model ini adalah alat yang tepat untuk klasifikasi, ekstraksi, routing, peringkasan, agen ringan, pembuatan data sintetis, dan pipeline apa pun yang dijalankan jutaan kali. Model ini masih mendukung upaya penalaran yang dapat dikonfigurasi, pemanggilan alat native, dan output terstruktur, serta memberikan kinerja di atas rata-rata untuk ukuran model lite pada tolok ukur agen dan konteks panjang — misalnya 74,0% pada OSWorld-Verified dan 72,2% pada pencarian multi-needle 128k, jauh di atas Flash-Lite 3.1 sebelumnya. Model ini mendukung format chat-completions OpenAI dan API generateContent native Gemini, sehingga Anda dapat menggabungkannya dengan model yang lebih berat dalam satu integrasi — mengarahkan lalu lintas mudah dan bervolume tinggi ke Flash-Lite, serta meningkatkan tugas sulit ke 3.6 Flash atau model Pro.
Google Gemini 3.5 Flash-Lite adalah model bahasa multimodal yang dikembangkan oleh Google, ditawarkan melalui API yang kompatibel dengan OpenAI milik OrcaRouter. Model ini menerima input teks,…
Gemini 3.5 Flash-Lite mampu menangani berbagai tugas berkat dukungan input multimodal dan penggunaan alat. Ia menangani tugas berbasis teks seperti peringkasan, tanya jawab, dan pembuatan kode. Dengan gambar, ia dapat mendeskripsikan pemandangan, mengekstrak teks dari dokumen, atau menafsirkan diagram. Input video memungkinkan pengenalan aktivitas, pembuatan keterangan, dan penalaran temporal. Input audio memfasilitasi transkripsi, identifikasi bahasa, dan analisis berbasis ucapan. Model ini juga mendukung pemanggilan alat, sebagaimana dibuktikan oleh skor CharXiv Reasoning sebesar 76,5 (dengan alat). Ini berarti ia dapat diintegrasikan ke dalam alur kerja agen di mana ia memanggil API atau basis data eksternal. Namun, ia tidak dirancang untuk penulisan kreatif, penalaran yang sangat abstrak, atau tugas yang membutuhkan keahlian domain yang mendalam. Kekuatannya terletak pada kecepatan, biaya, dan keluasan dukungan modalitas, bukan pada kinerja mentah.
Anda harus memilih Gemini 3.5 Flash-Lite ketika biaya dan throughput menjadi perhatian utama dan tugas sesuai dengan batas kemampuannya. Model ini unggul dalam jalur pemrosesan volume tinggi seperti mengindeks ribuan dokumen, mentranskripsikan berjam-jam audio, atau menjalankan klasifikasi real-time pada aliran gambar. Jendela konteksnya yang besar (1M token) menjadikannya ideal untuk tugas-tugas yang memerlukan pemahaman global terhadap input panjang, seperti analisis kasus peradilan atau refaktorisasi basis kode. Model yang lebih besar (misalnya, Gemini 3.5 Pro) mungkin mencapai akurasi lebih tinggi pada tolok ukur yang kompleks tetapi datang dengan biaya per token yang jauh lebih tinggi dan throughput yang lebih rendah. Jika aplikasi Anda dapat mentolerir pengorbanan kualitas kecil untuk pengurangan biaya 10-100x, model ini adalah pilihan yang tepat. Sebaliknya, untuk tugas yang memerlukan presisi faktual, generasi kreatif, atau penalaran mutakhir, model yang lebih besar disarankan.
Ya, model ini secara native menerima input video dan audio bersama dengan teks, gambar, dan file. Input video dapat diberikan sebagai urutan frame atau file video; model memproses frame visual dan track audio yang terkait. Input audio bekerja dengan format umum seperti WAV, MP3, atau FLAC. Jendela konteks yang besar memungkinkan rekaman panjang diproses dalam satu permintaan – misalnya, transkrip audio satu jam dengan detail tinggi mungkin mengonsumsi sekitar 10.000 token. Ini berguna untuk ringkasan rapat, analisis podcast, atau dukungan pelanggan berbasis suara. Catatan bahwa model tidak menghasilkan output audio atau video; respons selalu berupa teks. Kualitas pemahaman multimodal sesuai dengan tingkatan flash‑lite model: memadai untuk ekstraksi dan klasifikasi, tetapi mungkin melewatkan detail halus dibandingkan dengan model multimodal yang lebih besar.
Gemini 3.5 Flash-Lite mendukung pemanggilan alat, sebagaimana ditunjukkan oleh kinerja tolok ukurnya pada CharXiv Reasoning with tools (skor 76.5). Ini berarti Anda dapat mendefinisikan fungsi atau API yang dapat dipanggil model selama pembuatan respons. Kasus penggunaan umum meliputi pencarian basis data, pencarian web, atau operasi aritmatika. Model memilih kapan memanggil alat berdasarkan instruksi pengguna dan konteks. Penggunaan alat dapat meningkatkan akurasi faktual dan memungkinkan penalaran multi-langkah yang kompleks. Namun, karena model ini adalah varian flash-lite, keandalan pemanggilan alatnya mungkin lebih rendah dibandingkan model khusus yang lebih besar. Jika aplikasi Anda sangat bergantung pada orkestrasi alat yang sempurna, Anda mungkin perlu menambahkan lapisan validasi atau logika fallback. OrcaRouter meneruskan definisi alat dalam format yang sama dengan API OpenAI, sehingga integrasi menjadi mudah.
Model tersebut mencapai skor 76.5 pada tolok ukur CharXiv Reasoning ketika dievaluasi dengan alat. CharXiv menguji kemampuan untuk melakukan penalaran atas data visual berbasis grafik, yang mengharuskan model untuk menafsirkan gambar grafik dan menjawab pertanyaan tentangnya. Kondisi “dengan alat” berarti model tersebut dapat memanggil fungsi eksternal (misalnya, kalkulator) untuk membantu. Skor ini menunjukkan kinerja sedang – model tersebut mampu melakukan penalaran terkait grafik tetapi tidak pada level model spesialis. Tidak ada skor tolok ukur lain yang diberikan untuk model ini. Sebagai perbandingan, model yang lebih besar seperti Gemini 3.5 Pro kemungkinan akan mendapatkan skor lebih tinggi pada tugas ini. Nilai ini berguna sebagai titik referensi: Anda dapat mengharapkan interpretasi grafik yang wajar, tetapi harus diuji secara menyeluruh jika aplikasi Anda membutuhkan akurasi tinggi pada tugas penalaran visual.
Hanya skor CharXiv Reasoning (dengan alat) yang diberikan: 76,5. Tidak ada data tolok ukur tambahan – seperti MMLU, HumanEval, atau skor pengambilan konteks panjang – yang tersedia untuk Gemini 3.5 Flash‑Lite dalam informasi yang disediakan. Ini berarti bahwa menggeneralisasi kinerjanya ke tugas lain memerlukan pengujian empiris pada data Anda sendiri. Mengingat sifat model yang flash‑lite, kinerjanya diperkirakan akan lebih rendah dibandingkan model ukuran penuh pada sebagian besar tolok ukur standar. Namun, efisiensi dan biayanya yang rendah sering kali mengungguli kekurangan ini dalam lingkungan produksi. Jika Anda memerlukan kinerja yang terverifikasi pada tolok ukur tertentu (misalnya, pembuatan kode atau pemahaman multibahasa), Anda harus menjalankan evaluasi sendiri. OrcaRouter tidak menyediakan hasil tolok ukur terpisah; angka yang dikutip di sini berasal langsung dari penyedia.
Detail latensi tidak disebutkan dalam data yang disediakan. Sebagai aturan praktis, model flash‑lite dirancang untuk latensi rendah dibandingkan dengan saudara-saudaranya yang lebih besar, tetapi waktu respons aktual bergantung pada banyak faktor: panjang input, panjang output, beban permintaan bersamaan, dan perangkat keras yang mendasarinya. Dengan jendela konteks 1M, memproses prompt yang sangat panjang dapat meningkatkan latensi secara substansial karena penskalaan kuadrat dari perhatian. Untuk input pendek (misalnya, beberapa ratus token), Anda dapat mengharapkan respons dalam waktu kurang dari satu detik. Untuk input yang mendekati batas 1M token, latensi bisa mencapai puluhan detik. OrcaRouter tidak menjamin SLA latensi tertentu untuk model ini. Jika latensi rendah sangat penting, pertimbangkan untuk menggunakan konteks yang lebih kecil (misalnya, melalui pemotongan) atau titik akhir khusus. Anda dapat memantau waktu respons melalui dasbor OrcaRouter.
Gemini 3.5 Flash-Lite tidak dirancang untuk akurasi mutakhir. Keunggulannya adalah kecepatan, biaya, dan konteks yang besar. Keterbatasannya mencakup kinerja yang lebih rendah pada tolok ukur penalaran kompleks, pengingatan fakta yang berkurang dibandingkan model yang lebih besar, serta kecenderungan untuk "berhalusinasi" pada input yang ambigu. Model ini mungkin kesulitan dengan tugas yang memerlukan keahlian domain mendalam (misalnya, penalaran hukum, diagnosis medis) atau karya kreatif yang bernuansa. Kemampuan penggunaan alatnya, meskipun fungsional, mungkin tidak seandal model agen khusus. Selain itu, karena hanya satu skor tolok ukur yang diberikan (CharXiv Reasoning 76.5 with tools), Anda tidak dapat mengasumsikan kinerja yang baik pada domain lain tanpa pengujian. Untuk aplikasi kritis, selalu lakukan tolok ukur pada data Anda sendiri dan pertimbangkan untuk menggunakan fallback ke model yang lebih mampu saat tingkat keyakinan rendah.
Harga adalah $0.30 per 1 juta token input dan $2.50 per 1 juta token output. Tarif ini adalah tarif penyedia yang ditagih tanpa markup apa pun oleh OrcaRouter. Token input mencakup semua token dalam prompt (teks, token gambar, bingkai video, sampel audio, konten file) tanpa memandang modalitas. Token output adalah token teks yang dihasilkan. Untuk kueri konteks panjang tipikal yang mengonsumsi 100.000 token input dan 1.000 token output, biayanya akan sekitar ($0.30 * 0.1) + ($2.50 * 0.001) = $0.030 + $0.0025 = $0.0325 per permintaan. Dalam skala besar, model ini dapat memproses jutaan kueri dengan biaya beberapa ratus dolar. Bandingkan ini dengan model yang lebih besar yang seringkali memakan biaya 10‑50x lebih per token. Harga output yang rendah ini sangat menguntungkan untuk aplikasi yang menghasilkan respons panjang (misalnya ringkasan dokumen penuh).
Informasi yang diberikan tidak menyebutkan mekanisme caching atau harga diskon untuk token yang di-cache. Oleh karena itu, Anda harus berasumsi bahwa setiap token yang dikirim ke model dikenakan biaya tarif input standar sebesar $0,30 per juta token, terlepas dari pengulangan. Beberapa penyedia menawarkan caching prompt otomatis di mana prefiks yang diulang dikenakan biaya lebih rendah (misalnya, diskon 50%). Untuk model ini, belum ada pengumuman diskon caching semacam itu. Jika Anda sering mengirim ulang konteks yang sama (misalnya, system prompt yang besar), Anda mungkin ingin menyelidiki apakah OrcaRouter atau Google menerapkan caching transparan. Tanpa adanya informasi eksplisit, cara paling aman adalah menganggarkan biaya per token penuh untuk semua input. Mengoptimalkan dengan memangkas konten yang digunakan kembali dapat mengurangi tagihan efektif Anda.
Markup nol berarti OrcaRouter membebankan tarif persis seperti yang ditetapkan penyedia tanpa menambahkan margin tambahan. Untuk Gemini 3.5 Flash-Lite, harga input adalah $0.30/1M token dan harga output adalah $2.50/1M token – itulah yang dibebankan Google, dan OrcaRouter meneruskannya tanpa kenaikan. Anda tidak membayar biaya platform tambahan per token. Hal ini tidak biasa di antara gerbang API, yang biasanya menambahkan 10‑20% atau lebih. Tidak adanya markup membuat model ini semakin hemat biaya ketika diakses melalui OrcaRouter. Anda tetap membayar bandwidth dan infrastruktur API, tetapi biaya tersebut sudah termasuk dalam tarif penyedia; OrcaRouter tidak merincinya secara terpisah. Model penetapan harga ini transparan: biaya yang ditampilkan di dasbor penggunaan Anda adalah biaya akhir.
Anda memanggilnya menggunakan API OrcaRouter yang kompatibel dengan OpenAI di URL dasar https://api.orcarouter.ai/v1. Atur parameter model ke "google/gemini-3.5-flash-lite". Baik chat completions (POST /v1/chat/completions) maupun embeddings (jika didukung) berfungsi. Untuk input multimodal, Anda menyusun pesan dengan array roles dan objek konten yang dapat menyertakan kolom teks, image_url, atau file_url. Contoh permintaan cURL: curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' Anda harus menggunakan kunci API OrcaRouter, bukan kunci API Google.
Model ini mendukung parameter standar yang kompatibel dengan OpenAI: model, messages, max_tokens (hingga batas 65,536 model), temperature, top_p, stop, frequency_penalty, presence_penalty, dan tools (untuk pemanggilan fungsi). Parameter tambahan spesifik Google (seperti safety_settings) mungkin tidak diekspos secara langsung; jika Anda membutuhkannya, periksa dokumentasi OrcaRouter untuk padanannya. Model akan mematuhi batas max_tokens. Untuk input multimodal, bidang type dalam konten mendukung: text, image_url, video_url (jika OrcaRouter mengeksposnya), audio_url, dan file_url. Tipe file dapat menerima PDF, CSV, dll. Catat bahwa file media besar mungkin perlu dienkode sebelumnya sebagai data URI atau dihosting secara publik. OrcaRouter mungkin juga memerlukan file di bawah ukuran tertentu. Selalu konsultasikan dokumentasi API terbaru untuk dukungan parameter yang tepat.
Untuk bermigrasi dari penyedia API lain (misalnya, Google AI Studio, Vertex AI, atau gateway lainnya) ke OrcaRouter, ganti URL dasar dengan https://api.orcarouter.ai/v1 dan atur ID model menjadi "google/gemini-3.5-flash-lite". Jika kode yang ada menggunakan klien OpenAI Python, berikan base_url dan api_key. Contoh: from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_ORCAROUTER_API_KEY") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) Anda mungkin perlu menyesuaikan format pesan multimodal jika penyedia sebelumnya menggunakan skema yang berbeda (misalnya, Anthropic). OrcaRouter mengharapkan format OpenAI. Array konten pengguna dapat mencakup beberapa bagian. Definisi alat juga bergaya OpenAI. Tidak ada biaya migrasi tambahan; Anda hanya membayar per token seperti yang dijelaskan.
Data perbandingan langsung tidak disediakan, tetapi kita dapat bernalar secara kualitatif. Gemini 2.0 Flash (jika ada) kemungkinan merupakan model flash generasi sebelumnya. Gemini 3.5 Flash‑Lite adalah varian lite yang lebih baru dengan jendela konteks yang lebih besar (1M vs. kemungkinan 128K) dan harga yang lebih rendah. Biaya per token untuk Gemini 3.5 Flash‑Lite adalah $0.30/$2.50 per juta token, yang sangat rendah. Model flash yang lebih lama mungkin memiliki biaya per token yang lebih tinggi dan jendela konteks yang lebih pendek. Namun, Gemini 2.0 Flash mungkin memiliki akurasi mentah yang lebih baik jika itu adalah model flash penuh, bukan varian lite. Jika tugas Anda memerlukan kualitas tertinggi dan Anda mampu membayar biaya yang lebih tinggi, model flash penuh yang lebih lama bisa lebih baik. Jika Anda membutuhkan konteks besar dan biaya rendah, 3.5 Flash‑Lite adalah pilihan yang logis.
GPT-4o mini dari OpenAI adalah model multimodal berbiaya rendah yang serupa. Model ini memiliki jendela konteks 128K token (jauh lebih kecil dari 1M) dan dibanderol seharga $0,15 per juta token input dan $0,60 per juta token output (per awal 2025; harga mungkin telah berubah). Gemini 3.5 Flash‑Lite menawarkan jendela konteks 8x lebih besar dengan harga input 2x lipat dan harga output 4x lipat. Jadi Gemini lebih mahal per token tetapi menyediakan kapasitas konteks yang jauh lebih besar. Untuk tugas-tugas yang membutuhkan konteks 1M penuh (misalnya, memproses seluruh buku), Gemini Flash‑Lite lebih hemat biaya dibandingkan mencoba memotong input ke beberapa panggilan GPT‑4o mini. Jika konteksnya pendek, GPT‑4o mini lebih murah dan mungkin memiliki kinerja tolok ukur yang lebih baik. Skor tolok ukur keduanya tidak dapat dibandingkan secara langsung tanpa data.
Tidak ada perbandingan benchmark yang disediakan. Llama 3.2 90B (dengan asumsi model ini ada) adalah model open‑weights yang besar dengan jendela konteks yang lebih kecil (biasanya 128K token) dan biaya per token yang lebih tinggi saat dijalankan melalui API. Gemini 3.5 Flash‑Lite adalah model proprietary dengan jendela konteks yang jauh lebih besar dan harga yang sangat rendah – salah satu model multimodal per token termurah yang tersedia. Llama 3.2 90B mungkin mencapai akurasi yang lebih tinggi pada banyak benchmark NLP karena ukurannya, tetapi tidak multimodal dan memiliki batas konteks yang lebih ketat. Jika tugas Anda hanya berupa teks dan Anda membutuhkan akurasi tertinggi, Llama 90B (jika dapat diakses melalui OrcaRouter) bisa lebih baik. Untuk skenario multimodal, konteks panjang, atau throughput tinggi, Gemini Flash‑Lite memiliki keunggulan yang jelas. Pilihan tergantung pada kebutuhan spesifik aplikasi Anda.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Input / 1M token | $0.300 |
| Output / 1M token | $2.50 |
| Baca cache / 1M | $0.030 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
GET /api/public/models/google/gemini-3.5-flash-liteBuka @misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite