Gemini 3.5 Flash-Lite

google/gemini-3.5-flash-lite
BaruUnggulan
VisiAudioAlatJSONPenalaran
oleh Google · 2026-07-21

Gemini 3.5 Flash-Lite adalah model Gemini yang paling hemat biaya dari Google, dirancang khusus untuk beban kerja dengan volume sangat tinggi dan sensitif terhadap latensi, di mana biaya per panggilan menjadi faktor utama. Meskipun memiliki harga yang rendah, model ini secara native multimodal — menerima teks, gambar, video, audio, dan file dengan output teks — serta memiliki jendela konteks 1 juta token dan hingga 64.000 token output yang sama dengan tingkatan Flash yang lebih besar, sehingga dokumen panjang dan input media campuran tetap dapat dijangkau. Dengan harga sekitar seperlima dari harga 3.6 Flash, model ini adalah alat yang tepat untuk klasifikasi, ekstraksi, routing, peringkasan, agen ringan, pembuatan data sintetis, dan pipeline apa pun yang dijalankan jutaan kali. Model ini masih mendukung upaya penalaran yang dapat dikonfigurasi, pemanggilan alat native, dan output terstruktur, serta memberikan kinerja di atas rata-rata untuk ukuran model lite pada tolok ukur agen dan konteks panjang — misalnya 74,0% pada OSWorld-Verified dan 72,2% pada pencarian multi-needle 128k, jauh di atas Flash-Lite 3.1 sebelumnya. Model ini mendukung format chat-completions OpenAI dan API generateContent native Gemini, sehingga Anda dapat menggabungkannya dengan model yang lebih berat dalam satu integrasi — mengarahkan lalu lintas mudah dan bervolume tinggi ke Flash-Lite, serta meningkatkan tugas sulit ke 3.6 Flash atau model Pro.

ctx1.05M token
Output maks65.5K
Masukantext + image + video + file + audio
Keluarantext
p50 TTFT1.30 s
INPUT$0.30/ 1M token
OUTPUT$2.50/ 1M token
p50 TTFT1.30 s7h
p95 TTFT10.00 s7h
LALU LINTAS5.9Mtoken / 7h

Google Gemini 3.5 Flash-Lite adalah model bahasa multimodal yang dikembangkan oleh Google, ditawarkan melalui API yang kompatibel dengan OpenAI milik OrcaRouter. Model ini menerima input teks,…

Apa itu Google Gemini 3.5 Flash-Lite?

Untuk siapa model ini dirancang?

Apa saja modalitas yang didukung oleh model ini?

Seberapa besar jendela konteks dan output maksimum?

Contoh kode

Panggil dari SDK apa pun

Kompatibel OpenAI — pakai SDK Anda yang sekarang

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.5-flash-lite",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parameter yang didukung

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Harga

Input / 1M token$0.300
Output / 1M token$2.50
Baca cache / 1M$0.030
Mata uangUSD

Kalkulator biaya

Token / bulan10MM
Porsi input70%%
Perkiraan / bulan $9.60 · Dengan cache prompt $8.66

Perkiraan berdasarkan harga daftar

Estimator token & biaya

Token masukan: 17Biaya per permintaan: $0.001255

Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.

Performa

p50 TTFT
1.30 s
Kecepatan output
829 tok/s
p95 TTFT
10.00 s
Tingkat kesalahan
5.0%

Benchmark publik

49.3
AA Coding
Lebih baik dari 60% model yang dibandingkan
#49 dari 122
36.5
AA Intelligence
Lebih baik dari 54% model yang dibandingkan
#57 dari 124
CharXiv Reasoning (no tools)
74.5
CharXiv Reasoning (with tools)
76.5
GDM-MRCR v2 8-needle (128k avg)
72.2
GDM-MRCR v2 8-needle (1M pointwise)
21.3
GPQA Diamond
83.8
Humanity's Last Exam
17.5
Long-Context Recall
62.0
MLE-Bench
39.2
OSWorld-Verified
74.0
SciCode
40.9
SWE-Bench Pro (Public)
54.2
tau_banking
16.5
Terminal-bench 2.1 (Terminus-2)
54.0
terminalbench_v2_1
53.6
Sumber: artificialanalysis.ai, deepmind.google

Perbandingan

Gemini 3.5 Flash-LiteGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Input $/M$0.30$2.00$4.00$0.50
Output $/M$2.50$12.00$18.00$3.00
Konteks1.0M1.0M1.0M1.0M
Kualitas6/1010/1010/109/10
Bandingkan berdampinganBandingkan berdampinganBandingkan berdampinganBandingkan berdampingan

FAQ

Berapa harga per token untuk Gemini 3.5 Flash-Lite di OrcaRouter?
Harganya adalah $0.30 per juta token masukan dan $2.50 per juta token keluaran. Ini adalah tarif penyedia tanpa markup. Token masukan mencakup semua modalitas (teks, gambar, video, audio, file). Token keluaran adalah teks yang dihasilkan.
Berapa ukuran jendela konteksnya?
Jendela konteks adalah 1.048.576 token (sekitar 1 juta). Panjang output maksimum adalah 65.536 token. Hal ini memungkinkan penanganan dokumen, video, atau rekaman audio yang sangat panjang dalam satu permintaan API.
Apa saja kekuatan utama dari model ini?
Kekuatan utamanya adalah: biaya per token yang sangat rendah, dukungan untuk lima modalitas input (teks, gambar, video, audio, file), jendela konteks 1M yang besar, dan kemampuan penggunaan alat (skor CharXiv Reasoning 76.5 dengan alat). Ini dirancang untuk jalur produksi berthroughput tinggi dan sensitif biaya.
Bagaimana perbandingannya dengan model yang lebih besar seperti Gemini 3.5 Pro?
Tidak ada perbandingan benchmark langsung yang disediakan. Sebagai varian flash‑lite, model ini memprioritaskan efisiensi dan biaya rendah dibandingkan performa mentah. Model yang lebih besar seperti Gemini 3.5 Pro kemungkinan akan mencapai akurasi yang lebih tinggi pada tugas penalaran yang kompleks tetapi biayanya jauh lebih tinggi per token. Gunakan model ini ketika biaya dan throughput sangat penting.
Apakah model menyimpan cache prompt untuk mengurangi biaya?
Informasi yang diberikan tidak menyebutkan mekanisme caching atau harga token cache yang didiskon. Anda harus menganggap semua token ditagih dengan tarif input standar. Jika caching penting, periksa dengan OrcaRouter atau Google untuk diskon yang tersedia.
Bagaimana cara mengakses model ini melalui API yang kompatibel dengan OpenAI?
Gunakan API OrcaRouter di URL basis https://api.orcarouter.ai/v1. Atur parameter model menjadi "google/gemini-3.5-flash-lite". API ini sepenuhnya kompatibel dengan format penyelesaian obrolan OpenAI, termasuk konten multimodal dan definisi alat.
Penanganan data dan privasi apa yang dapat saya harapkan?
Penanganan data diatur oleh kebijakan Google (penyedia) dan ketentuan OrcaRouter. Model memproses masukan Anda, dan keluaran dikembalikan kepada Anda. Tidak ada sertifikasi privasi khusus yang disediakan untuk model ini. Untuk data sensitif, tinjau perjanjian pemrosesan data penyedia.
Bisakah saya menggunakan model ini untuk aplikasi real-time?
Detail latensi tidak ditentukan. Model dapat mengembalikan respons dalam hitungan detik untuk input pendek, tetapi memproses prompt yang sangat panjang (hampir 1M token) mungkin memerlukan waktu puluhan detik. Ini cocok untuk aplikasi hampir real-time dengan ukuran input sedang. Untuk persyaratan real-time yang ketat, uji dengan panjang input yang Anda harapkan.
Apa skor benchmark CharXiv Reasoning?
Model mencapai skor 76,5 pada CharXiv Reasoning with tools. Tolok ukur ini menguji pemahaman grafik dan penalaran. Skor tersebut menunjukkan kinerja sedang; model dapat menginterpretasikan grafik dan menjawab pertanyaan, tetapi belum setara dengan model penalaran khusus. Tidak ada skor tolok ukur lain yang disediakan.
Apakah ada biaya minimum atau komitmen untuk menggunakan OrcaRouter?
OrcaRouter tidak memberlakukan pengeluaran minimum bulanan. Anda hanya ditagih untuk token yang Anda gunakan dengan tarif penyedia tanpa markup. Tidak ada biaya di muka atau kontrak jangka panjang. Cukup daftar untuk mendapatkan kunci API dan mulailah membuat permintaan.

Sematkan lencana ini

Google: Gemini 3.5 Flash-Lite$0.30/M in1298ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg" alt="Google: Gemini 3.5 Flash-Lite di OrcaRouter" /> </a>
Markdown [![Google: Gemini 3.5 Flash-Lite](https://www.orcarouter.ai/embed/google/gemini-3.5-flash-lite.svg)](https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite)

Kartu model sebagai data

GET /api/public/models/google/gemini-3.5-flash-liteBuka