Gemini 3.5 Flash

google/gemini-3.5-flash
VisiAudioAlatJSONPenalaran
oleh google · 2026-05-23

Google Gemini 3.5 Flash — model Flash-tier terkuat dari Google, berada tepat di bawah 3.1-pro-preview dalam hal kecerdasan (AA Intel 55.3 vs 57.2) dengan latensi Flash. Jendela konteks 1M token (1,048,576), output maksimal 64K (65,536). Input multimodal penuh meliputi teks, gambar, audio, video, dan file; hanya output teks. AA Coding 45, GPQA Diamond 92.2%, IFBench 76.3% (pengikut instruksi tingkat atas), Long-Context Recall 69.3%, SciCode 53.1%, τ²-Bench 95.3% (penggunaan alat agen), HLE 41%. Mendukung reasoning (include_reasoning / reasoning), output terstruktur, panggilan alat, response_format, seed, stop, dan kontrol sampling standar. Endpoint: chat_completions, gemini_generate. Paling cocok untuk: loop agen bervolume tinggi, analisis dokumen panjang, dan ekstraksi multimodal di mana latensi atau biaya Pro-tier berlebihan.

ctx1.05M token
Output maks65.5K
Masukantext + image + video + file + audio
Keluarantext
p50 TTFT864 ms
INPUT$1.50/ 1M token
OUTPUT$9.00/ 1M token
p50 TTFT864 ms7h
p95 TTFT3.55 s7h
LALU LINTAS4.4Mtoken / 7h

Gemini 3.5 Flash adalah model bahasa besar yang dikembangkan oleh Google, yang disesuaikan untuk kecepatan dan efisiensi. Model ini termasuk dalam keluarga Gemini dan dirancang untuk menangani…

Apa itu Gemini 3.5 Flash?

Siapa yang harus menggunakan Gemini 3.5 Flash?

Modalitas input apa yang didukung Gemini 3.5 Flash?

Bagaimana cara mengakses Gemini 3.5 Flash melalui OrcaRouter?

Contoh kode

Panggil dari SDK apa pun

Kompatibel OpenAI — pakai SDK Anda yang sekarang

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Gemini SDKhttps://api.orcarouter.ai
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="google/gemini-3.5-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parameter yang didukung

  • include_reasoning
  • max_tokens
  • reasoning
  • response_format
  • seed
  • stop
  • structured_outputs
  • temperature
  • tool_choice
  • tools
  • top_p

Harga

Input / 1M token$1.50
Output / 1M token$9.00
Baca cache / 1M$0.150
Tulis cache / 1M$0.083
Mata uangUSD

Kalkulator biaya

Token / bulan10MM
Porsi input70%%
Perkiraan / bulan $37.50 · Dengan cache prompt $32.78

Perkiraan berdasarkan harga daftar

Estimator token & biaya

Token masukan: 17Biaya per permintaan: $0.004526

Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.

Performa

p50 TTFT
864 ms
Kecepatan output
218 tok/s
p95 TTFT
3.55 s
Tingkat kesalahan
1.7%

Benchmark publik

49.0
AA Coding
Lebih baik dari 68% model yang dibandingkan
#34 dari 106
47.0
AA Intelligence
Lebih baik dari 58% model yang dibandingkan
#46 dari 110
51.0
AA Math
Lebih baik dari 27% model yang dibandingkan
#59 dari 81
GPQA Diamond
45.0 index
MMLU-Pro
59.0 index
τ²-Bench
42.0 index
Sumber: artificialanalysis.ai

Perbandingan

Gemini 3.5 FlashGemini 3.1 Pro PreviewGemini 3.1 Pro Preview Custom ToolsGemini 3 Flash Preview
Input $/M$1.50$2.00$4.00$0.50
Output $/M$9.00$12.00$18.00$3.00
Konteks1.0M1.0M1.0M1.0M
Kualitas9/1010/1010/109/10
Bandingkan berdampinganBandingkan berdampinganBandingkan berdampinganBandingkan berdampingan

FAQ

Berapa biaya Gemini 3.5 Flash di OrcaRouter?
Token masukan adalah $1.50 per 1 juta token; token keluaran adalah $9.00 per 1 juta token. OrcaRouter menagih pada tarif penyedia tanpa markup. Tidak ada biaya tambahan.
Berapa ukuran jendela konteks dari Gemini 3.5 Flash?
Ini mendukung jendela konteks sebesar 1,048,576 token (sekitar 1 juta token). Ini mencakup token input dan output yang digabungkan.
Apa saja kekuatan utama dari Gemini 3.5 Flash?
Ini dioptimalkan untuk latensi rendah, throughput tinggi, dan efisiensi biaya. Ini mendukung input multimodal (teks, gambar, video, file, audio) dan jendela konteks yang besar, menjadikannya ideal untuk aplikasi waktu nyata dan pemrosesan dokumen panjang.
Bagaimana perbandingan Gemini 3.5 Flash dengan Gemini 3.5 Pro?
Flash lebih cepat dan lebih murah tetapi memiliki kinerja tolok ukur yang lebih rendah pada tugas penalaran kompleks dan matematis. Pro lebih akurat tetapi lebih lambat dan lebih mahal. Flash lebih baik untuk aplikasi bervolume tinggi yang sensitif terhadap latensi.
Bagaimana data ditangani saat menggunakan Gemini 3.5 Flash melalui OrcaRouter?
OrcaRouter bertindak sebagai proxy dan tidak menyimpan data Anda. Namun, kebijakan penanganan data Google berlaku untuk model yang mendasarinya. OrcaRouter merekomendasikan untuk meninjau ketentuan Google terkait retensi data dan privasi.
Bagaimana cara memanggil Gemini 3.5 Flash menggunakan API yang kompatibel dengan OpenAI?
Gunakan URL dasar https://api.orcarouter.ai/v1, ID model "google/gemini-3.5-flash", dan berikan kunci API OrcaRouter di header Authorization. API ini mendukung penyelesaian obrolan standar dan streaming.
Berapa panjang output yang dapat dihasilkan Gemini 3.5 Flash?
Ini dapat menghasilkan hingga 65.536 token per respons. Jumlah ini jauh lebih besar dibandingkan banyak model, memungkinkan konten bentuk panjang, kode, atau penalaran yang diperpanjang.
Apakah ada diskon untuk token yang berulang atau di-cache?
Berdasarkan fakta yang diberikan, OrcaRouter tidak menawarkan caching atau diskon volume. Setiap token ditagih dengan tarif standar terlepas dari penggunaan ulang.

Sematkan lencana ini

Gemini 3.5 Flash$1.50/M in864ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/google/gemini-3.5-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/google/gemini-3.5-flash.svg" alt="Gemini 3.5 Flash di OrcaRouter" /> </a>
Markdown [![Gemini 3.5 Flash](https://www.orcarouter.ai/embed/google/gemini-3.5-flash.svg)](https://www.orcarouter.ai/models/google/gemini-3.5-flash)

Kartu model sebagai data

GET /api/public/models/google/gemini-3.5-flashBuka