Gemini 2.5 Flash-Lite adalah model penalaran ringan dalam keluarga Gemini 2.5, yang dioptimalkan untuk latensi ultra-rendah dan efisiensi biaya. Model ini menawarkan peningkatan throughput, pembuatan token yang lebih cepat, dan kinerja yang lebih baik...
Google Gemini 2.5 Flash Lite adalah varian yang lebih kecil, lebih cepat, dan lebih terjangkau dari model Gemini 2.5 Flash milik Google. Model ini dirancang untuk menangani berbagai masukan…
Gemini 2.5 Flash Lite unggul dalam skenario di mana throughput tinggi dan biaya rendah sangat penting. Kasus penggunaan teratas meliputi: pemecahan masalah matematika dan bimbingan belajar (didukung oleh skor 92.6 MATH-500); peringkasan dan tanya-jawab atas dokumen yang sangat panjang (hingga 1 juta token); tugas multimodal seperti menganalisis gambar dengan instruksi teks atau mengekstrak informasi dari file audio dan video; serta pemrosesan batch yang sensitif terhadap biaya dari kumpulan data besar. Latensi rendahnya membuatnya cocok untuk aplikasi yang berhadapan langsung dengan pengguna yang membutuhkan respons cepat. Untuk penulisan kreatif atau pengkodean kompleks, pertimbangkan untuk menggunakan model yang lebih besar, tetapi untuk tugas terstruktur berbasis fakta, Flash Lite adalah pilihan yang kuat dan ekonomis.
Gemini 2.5 Flash Lite sudah termasuk model yang paling terjangkau dengan biaya input $0,10 dan output $0,40 per 1 juta token. Alternatif yang lebih murah, seperti Gemini 1.5 Flash atau varian Llama 3.2 di OrcaRouter, mungkin cukup untuk tugas-tugas yang sangat sederhana seperti klasifikasi dasar, pembuatan teks pendek, atau eksperimen berisiko rendah. Jika aplikasi Anda tidak memerlukan input multimodal atau konteks 1 juta token yang besar, model yang lebih kecil dapat lebih mengurangi biaya. Untuk tugas-tugas yang mengutamakan latensi dan kualitas sebagai prioritas kedua, pertimbangkan model dengan overhead komputasi yang lebih rendah. Selalu ukur beban kerja spesifik Anda untuk menentukan keseimbangan harga-kinerja yang optimal.
Ya. Dengan jendela konteks sebesar 1.048.576 token, Gemini 2.5 Flash Lite dapat memproses dokumen yang sangat panjang—setara dengan beberapa buku—dalam satu panggilan API. Hal ini memungkinkan Anda untuk melakukan tugas seperti merangkum seluruh ringkasan hukum, menganalisis laporan keuangan selama setahun, atau mempertahankan percakapan yang panjang tanpa kehilangan konteks sebelumnya. Output maksimum sebesar 65.536 token juga memungkinkan pembuatan respons yang panjang, seperti laporan lengkap atau analisis yang diperluas. Namun, perlu diperhatikan bahwa memproses konteks yang sangat panjang dapat menimbulkan biaya token yang lebih tinggi dan dapat menyebabkan latensi, terutama dengan konten multimodal. Untuk sebagian besar tugas berbasis teks dengan dokumen panjang, model ini menawarkan keseimbangan praktis antara biaya dan kedalaman konteks.
Model ini menerima input dari modalitas teks, gambar, file, audio, dan video, sehingga serbaguna untuk analisis media campuran. Meskipun tolok ukur multimodal spesifik untuk varian Lite ini tidak disediakan, arsitektur Gemini yang mendasarinya dikenal memiliki pemahaman bahasa dan visual yang kuat. Berdasarkan skor MATH-500-nya, penalaran logis atas soal matematika visual kemungkinan besar solid. Untuk tugas seperti pembuatan teks pada gambar, OCR dokumen dengan penalaran, atau transkripsi audio, Flash Lite seharusnya bekerja dengan andal, meskipun mungkin dengan akurasi yang lebih rendah dibandingkan model Flash penuh pada skenario visual atau audio yang sangat kompleks. OrcaRouter mendukung semua modalitas asli, jadi Anda dapat langsung meneruskannya dalam permintaan API Anda.
Gemini 2.5 Flash Lite mencapai skor 92,6 pada tolok ukur MATH-500, yang mengevaluasi pemecahan masalah matematika di seluruh aljabar, geometri, kalkulus, dan lainnya. Skor ini menunjukkan bahwa model tersebut dengan benar menyelesaikan 92,6% dari 500 soal matematika yang beragam dalam tolok ukur tersebut. Ini menempatkan model di antara yang berkinerja terbaik untuk model kelas Lite, yang mencerminkan kemampuan penalaran dan aritmetika yang kuat. Meskipun tidak setinggi model yang lebih besar (misalnya, Gemini 2.5 Flash atau GPT-4o mungkin mendapat skor lebih tinggi), kinerja ini sangat baik untuk aplikasi yang sadar biaya di bidang pendidikan, keuangan, dan analisis data. Tolok ukur dilakukan dalam kondisi evaluasi standar; kinerja dunia nyata dapat bervariasi berdasarkan susunan kata perintah dan domain.
Gemini 2.5 Flash Lite dirancang secara eksplisit untuk latensi rendah dan throughput tinggi. Sebagai varian "Flash Lite", model ini dioptimalkan agar lebih cepat daripada model Flash standar, sehingga cocok untuk aplikasi real-time. Meskipun angka latensi yang tepat bergantung pada panjang input, panjang output, dan beban server, pengguna dapat mengharapkan waktu respons yang jauh lebih rendah dibandingkan dengan seri Pro. OrcaRouter tidak menambahkan latensi tambahan di luar API penyedia. Untuk performa yang konsisten, terutama dengan konteks yang panjang, pertimbangkan untuk menggunakan pengaturan max_tokens yang lebih rendah. Kecepatan dan biaya rendah model ini menjadikannya kandidat yang baik untuk aplikasi yang memerlukan respons cepat, seperti chatbot interaktif atau transkripsi langsung.
Kelebihan: Biaya per token sangat rendah ($0,10 input, $0,40 output), konteks token 1M yang besar, dukungan multimodal, penalaran matematika yang kuat (92,6 pada MATH-500), dan kecepatan tinggi. Ini ideal untuk beban kerja bervolume tinggi dengan keterbatasan anggaran dan tugas dokumen panjang. Keterbatasan: Sebagai varian Lite, mungkin kurang optimal dalam penalaran kompleks, penulisan kreatif, pembuatan kode, dan pemahaman bahasa yang bernuansa dibandingkan dengan model yang lebih besar. Tidak ada tolok ukur spesifik untuk kode atau pengetahuan umum yang disediakan, jadi nilailah kinerjanya pada tugas Anda. Model ini mungkin juga memiliki kemampuan yang berkurang pada tugas pemahaman visual atau audio yang halus dibandingkan dengan Flash penuh. Selalu uji dengan data Anda sendiri untuk memastikan kesesuaiannya.
Meskipun tidak ada tolok ukur khusus pengodean yang disediakan, skor MATH-500 yang tinggi dari model ini menunjukkan kemampuan penalaran logis yang kuat, yang berguna untuk tugas pengodean algoritmik dan matematis. Untuk pembuatan kode, debugging, atau penjelasan yang sederhana, Gemini 2.5 Flash Lite seharusnya bekerja cukup baik untuk banyak kasus penggunaan. Namun, untuk tugas pemrograman yang kompleks, multi-file, atau sangat kreatif, model yang lebih besar seperti Gemini 2.5 Flash atau GPT-4o mungkin memberikan hasil yang lebih baik. Penalaran pada topik non-matematika (misalnya, akal sehat, analisis multi-langkah) kemungkinan baik tetapi belum setingkat terdepan. Pengguna yang membutuhkan penalaran tingkat atas di semua domain harus mempertimbangkan untuk meningkatkan ke model skala penuh. OrcaRouter memungkinkan Anda mengganti model dengan mudah dengan mengubah ID model.
Penetapan harga didasarkan pada token yang diproses, dengan tarif terpisah untuk token input dan output. Untuk Gemini 2.5 Flash Lite, token input berharga $0.10 per 1 juta token, dan token output berharga $0.40 per 1 juta token. Tarif ini adalah harga yang ditetapkan penyedia, dan OrcaRouter tidak menambahkan markup. Token dihitung untuk teks dan representasi tersemat dari modalitas lainnya (gambar, audio, video, file). Total biaya suatu permintaan adalah (input_tokens * $0.10/1M) + (output_tokens * $0.40/1M). Tidak ada biaya tambahan per permintaan atau minimum bulanan. Penagihan biasanya dilakukan secara pasca-bayar melalui OrcaRouter, dan Anda dapat melacak penggunaan token di dasbor.
Gemini 2.5 Flash Lite secara signifikan lebih murah dibandingkan model yang lebih besar seperti Gemini 2.5 Flash (yang bisa 2-3x lebih mahal) dan Gemini 2.5 Pro (yang bisa 5-10x lebih mahal). Untuk tugas yang tidak memerlukan kedalaman penalaran tertinggi, Flash Lite memberikan rasio biaya-manfaat yang kuat. Sebagai contoh, memproses 1 juta token input dengan Flash Lite berbiaya $0.10, sedangkan dengan model Pro mungkin berbiaya $1.00 atau lebih. Imbalannya adalah kualitas yang lebih rendah pada tugas yang kompleks. Jika aplikasi Anda dapat mentolerir akurasi yang sedikit lebih rendah sebagai imbalan penghematan biaya yang dramatis, Flash Lite adalah pilihan yang sangat baik. Untuk aplikasi kritis di mana setiap jawaban harus sangat akurat, berinvestasilah pada model yang lebih besar.
Fakta yang diberikan tidak menyebutkan adanya program caching atau diskon khusus untuk Gemini 2.5 Flash Lite di OrcaRouter. Sebagai aturan, OrcaRouter menagih sesuai tarif penyedia tanpa markup, sehingga biayanya persis sama dengan harga token yang tertera. Jika Anda memiliki penggunaan volume tinggi, Anda dapat menghubungi dukungan OrcaRouter untuk menanyakan kemungkinan perjanjian enterprise. Saat ini, harga per token standar berlaku. Untuk meminimalkan biaya, Anda dapat mengurangi panjang output (max_tokens) dan menggunakan prompt yang lebih pendek. Karena Flash Lite sudah murah, caching mungkin tidak diperlukan untuk sebagian besar kasus penggunaan, tetapi secara native tidak menyediakan diskon cache.
OrcaRouter meneruskan harga dari penyedia tanpa markup tambahan. Biaya $0.10 per 1M token input dan $0.40 per 1M token output persis seperti yang dikenakan Google untuk Gemini 2.5 Flash Lite. Peran OrcaRouter adalah menyediakan permukaan API yang kompatibel dengan OpenAI secara terpadu, memungkinkan Anda mengakses model ini tanpa memerlukan kunci API Google langsung. Tidak ada biaya tersembunyi, biaya langganan, atau harga bertingkat. Anda hanya membayar untuk token yang Anda gunakan, tepatnya pada tarif penyedia. Transparansi ini memudahkan Anda memperkirakan dan mengontrol pengeluaran.
Gunakan klien yang kompatibel dengan OpenAI (misalnya, pustaka Python openai, curl, Postman) dengan URL dasar https://api.orcarouter.ai/v1. Atur parameter model ke "google/gemini-2.5-flash-lite". Berikan kunci API OrcaRouter Anda di header Authorization. Contoh minimal Python: ```python from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your_key") response = client.chat.completions.create(model="google/gemini-2.5-flash-lite", messages=[{"role":"user","content":"What is 2+2?"}]) print(response.choices[0].message.content) ``` Anda juga dapat mengirim konten multimodal menggunakan format parts standar. Tidak diperlukan konfigurasi tambahan.
API ini mendukung parameter OpenAI standar termasuk: messages (dengan peran user/assistant/system), max_tokens (hingga 65.536), temperature, top_p, n, stop, stream, dan lainnya. Untuk input multimodal, sertakan daftar bagian konten (misalnya, teks, image_url, audio_url, file_url) dalam pesan pengguna. Model akan secara otomatis menafsirkan modalitas. Jendela konteks adalah 1.048.576 token; model akan memotong jika permintaan melebihi ini. Anda dapat mengatur max_tokens yang lebih rendah untuk mengontrol biaya dan latensi. OrcaRouter meneruskan parameter langsung ke API Google, sehingga sebagian besar parameter khusus Gemini juga didukung (misalnya, pengaturan keamanan, generationConfig) ketika disertakan dalam body permintaan.
Jika Anda beralih dari OpenAI, Anthropic, atau penyedia lain dengan endpoint yang kompatibel dengan OpenAI, migrasinya mudah. Ubah URL dasar Anda menjadi https://api.orcarouter.ai/v1 dan perbarui kolom model menjadi "google/gemini-2.5-flash-lite". Format pesan dan struktur parameter Anda yang ada sebagian besar tetap sama. Misalnya, jika sebelumnya Anda menggunakan "gpt-4o-mini", cukup ganti string model dan arahkan ke endpoint OrcaRouter. Format respons identik, termasuk choices, usage (prompt_tokens, completion_tokens, total_tokens), dan finish_reason. Uji dengan beberapa contoh kueri untuk memastikan kompatibilitas, terutama dengan konten multimodal, di mana Anda mungkin perlu menyesuaikan format bagian konten agar sesuai dengan ekspektasi penyedia.
Gemini 2.5 Flash Lite adalah versi yang lebih hemat biaya dan lebih cepat dari Gemini 2.5 Flash. Model Flash non-Lite kemungkinan menawarkan skor benchmark yang lebih tinggi baik dalam matematika maupun penalaran umum, dan mungkin menangani input multimodal yang lebih kompleks dengan akurasi yang lebih besar. Namun, harganya lebih tinggi (angka pasti tidak diberikan). Varian Lite mengorbankan beberapa kedalaman dan kreativitas untuk mencapai latensi yang lebih rendah dan biaya yang lebih rendah. Keduanya memiliki jendela konteks token 1M dan dukungan multimodal yang sama. Untuk aplikasi produksi skala besar di mana biaya menjadi perhatian utama, Flash Lite adalah pilihan yang lebih baik. Untuk kualitas maksimal, tingkatkan ke model Flash penuh melalui OrcaRouter dengan mengganti id model menjadi "google/gemini-2.5-flash".
GPT-4o mini adalah model hemat biaya dari OpenAI, dengan harga $0,15 untuk input dan $0,60 untuk output per 1 juta token (dapat berubah). Gemini 2.5 Flash Lite ($0,10/$0,40) lebih murah baik untuk input maupun output. Jendela konteks: GPT-4o mini sebesar 128 ribu token, sedangkan Flash Lite menawarkan 1 juta token, membuat Flash Lite jauh lebih unggul untuk tugas konteks panjang. Pada MATH-500, Flash Lite mencapai skor 92,6; skor GPT-4o mini tidak disebutkan tetapi kemungkinan lebih rendah. Dalam kemampuan multimodal, keduanya mendukung gambar dan audio, tetapi Gemini juga mendukung input video dan file. GPT-4o mini mungkin lebih baik dalam generasi kode dan beberapa tolok ukur penalaran. Pilihan tergantung pada kebutuhan spesifik Anda: jika konteks panjang dan penalaran matematika sangat penting, Flash Lite lebih kuat; jika pengodean dan teks kreatif menjadi prioritas, GPT-4o mini mungkin lebih baik.
Anthropic’s Claude 3 Haiku adalah model lain yang murah dan cepat, dengan harga sekitar $0,25 untuk input dan $1,25 untuk output per 1 juta token (pada saat peluncurannya). Gemini 2.5 Flash Lite secara signifikan lebih murah. Jendela konteks: Claude 3 Haiku mendukung 200K token; Flash Lite mendukung 1M token. Multimodal: Haiku menerima teks dan gambar; Flash Lite juga menangani file, audio, dan video. Dalam penalaran matematika, tidak ada tolok ukur spesifik yang diberikan untuk Haiku, tetapi nilai 92,6 Flash Lite pada MATH-500 merupakan indikator yang kuat. Haiku dikenal karena respons cepat dan kinerja kuat pada tugas terstruktur. Flash Lite menawarkan konteks yang lebih besar dengan biaya lebih rendah, sehingga lebih cocok untuk aplikasi dokumen panjang dan multimedia. Untuk throughput yang sangat tinggi dengan kualitas sedang, keduanya layak; biaya lebih menguntungkan Flash Lite.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-2.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Input / 1M token | $0.100 |
| Output / 1M token | $0.400 |
| Baca cache / 1M | $0.010 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
Yang dibicarakan developer minggu ini
GET /api/public/models/google/gemini-2.5-flash-liteBuka @misc{orcarouter_gemini_2_5_flash_lite,
title = {Gemini 2.5 Flash Lite API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-lite}
}Google. (2025). Gemini 2.5 Flash Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-lite