Gemini 2.5 Flash Image, alias "Nano Banana," kini tersedia secara umum. Ini adalah model generasi gambar tercanggih dengan pemahaman kontekstual. Model ini mampu menghasilkan gambar,...
Google: Nano Banana (Gemini 2.5 Flash Image) adalah model bahasa multimodal yang dikembangkan oleh Google, bagian dari seri Gemini 2.5 Flash. Model ini menerima input gambar dan teks, serta…
Kemampuan inti berfokus pada pemahaman dan penalaran tentang konten visual yang disajikan sebagai gambar. Dengan diberikan sebuah gambar dan petunjuk teks, model dapat mendeskripsikan adegan, mengidentifikasi objek, menjawab pertanyaan tentang konten, mengekstrak teks (OCR), dan melakukan penalaran visual dasar (misalnya, hubungan spasial, warna, tindakan). Model ini juga dapat memproses teks yang menyertai gambar, seperti instruksi atau konteks. Karena menggunakan arsitektur tingkat flash, model ini dioptimalkan untuk latensi rendah dan throughput tinggi, sehingga cocok untuk aplikasi real-time atau bervolume tinggi. Namun, model ini mungkin tidak sebanding dengan kedalaman penalaran atau akurasi model yang lebih besar dan lebih mahal seperti Gemini 2.5 Pro pada tugas visual kompleks yang memerlukan analisis mendetail atau rangkaian penalaran yang panjang. Model ini tidak dirancang untuk tugas seperti pembuatan gambar, analisis video, atau percakapan multi-giliran yang memerlukan konteks panjang melebihi 32K token.
Jika aplikasi Anda sama sekali tidak memerlukan input gambar, menggunakan model hanya teks (misalnya, varian Gemini yang lebih kecil atau model sumber terbuka) akan lebih hemat biaya. Demikian pula, jika tugas Anda hanya melibatkan penalaran berbasis teks tanpa komponen visual, overhead pemrosesan gambar tidak diperlukan. Untuk skenario di mana panjang keluaran besar—seperti menghasilkan laporan atau cerita terperinci dari sebuah gambar—biaya $30 per juta token keluaran bisa menjadi mahal. Dalam kasus seperti itu, pertimbangkan model dengan harga keluaran yang lebih rendah, atau gunakan model ini untuk menghasilkan ringkasan singkat lalu perluas dengan model hanya teks yang lebih murah. Selain itu, jika Anda perlu memproses beberapa gambar per permintaan atau menangani gambar yang sangat besar, model dengan jendela konteks yang lebih besar atau dukungan resolusi gambar tertentu mungkin lebih sesuai.
Penerapan volume tinggi mendapatkan manfaat dari biaya input rendah model ini ($0,30 per juta token) dan inferensi yang cepat. Kasus penggunaan ideal meliputi pelabelan gambar otomatis untuk pustaka foto besar, menghasilkan teks alternatif untuk ribuan gambar produk, melakukan OCR pada kumpulan dokumen yang dipindai, dan moderasi konten secara real-time pada gambar yang diunggah pengguna. Karena biaya outputnya tinggi, respons harus dibuat singkat—seringkali berupa satu kata, label, atau kalimat. Misalnya, mengklasifikasikan gambar ke dalam kategori yang telah ditentukan, mengekstrak beberapa bidang kunci dari formulir, atau menjawab pertanyaan ya/tidak tentang suatu gambar. Pemrosesan batch dapat dilakukan melalui API OrcaRouter dengan permintaan bersamaan. Latensi model umumnya rendah, tetapi throughput aktual bergantung pada ukuran dan kompleksitas gambar. Tidak ada batas kecepatan terpisah di OrcaRouter selain penggunaan API secara keseluruhan.
Keterbatasan utama adalah biaya token output yang tinggi relatif terhadap biaya input, sehingga membuat pembuatan teks panjang menjadi mahal. Jendela konteks sebesar 32.768 token membatasi seberapa banyak teks dan seberapa besar gambar (dalam ukuran token) yang dapat diproses dalam satu permintaan. Model ini tidak dirancang untuk tugas yang memerlukan penalaran multimodal yang mendalam, detail visual yang rumit, atau menangani beberapa gambar sekaligus (setiap gambar tambahan mengonsumsi konteks). Selanjutnya, sebagai model tingkat flash, model ini mungkin menunjukkan akurasi yang lebih rendah pada tugas visual khusus seperti analisis gambar medis, deteksi objek yang terperinci, atau pengenalan objek langka dibandingkan dengan model yang lebih mumpuni tetapi lebih lambat atau lebih mahal. Data pelatihan model dan kinerja spesifik pada tolok ukur tidak diungkapkan dalam fakta yang disediakan; pengguna harus mengevaluasi pada kumpulan data mereka sendiri. Terakhir, model ini hanya mendukung masukan gambar dan teks, bukan video atau audio.
Fakta yang diberikan tidak mencakup skor benchmark spesifik untuk Google: Nano Banana (Gemini 2.5 Flash Image). Ini adalah bagian dari seri Gemini 2.5 Flash Google, yang secara umum menargetkan efisiensi daripada akurasi tingkat atas. Dengan tidak adanya angka, pengguna seharusnya mengharapkan kinerja yang sebanding dengan model multimodal flash-tier lainnya pada tugas visi-bahasa standar seperti VQAv2, COCO Captions, dan OCR. Namun, skor pasti tidak diberikan. Kami merekomendasikan untuk mengevaluasi model pada dataset representatif Anda sendiri untuk menentukan apakah kemampuannya memenuhi kebutuhan Anda. OrcaRouter tidak menyediakan benchmark internal selain yang tersedia secara publik dari Google. Jika Anda memerlukan metrik akurasi yang tepat, konsultasikan dokumentasi resmi Google untuk seri Gemini 2.5 Flash, tetapi perhatikan bahwa pengenal model spesifik ini mungkin memiliki fine-tuning sendiri.
Fakta yang diberikan tidak mencakup pengukuran latensi untuk model ini. Sebagai bagian dari keluarga Gemini 2.5 Flash, model ini dirancang untuk latensi rendah dan throughput tinggi. Biasanya, model flash-tier dari Google mengorbankan sebagian kualitas penalaran demi kecepatan, sehingga cocok untuk aplikasi yang hampir real-time. Latensi aktual tergantung pada faktor seperti ukuran dan resolusi gambar input, panjang teks prompt, jumlah token output yang diminta, serta beban API saat itu. Secara umum, tugas pelabelan gambar sederhana dapat selesai dalam beberapa ratus milidetik hingga beberapa detik, sementara prompt yang lebih kompleks dengan output yang lebih panjang akan memakan waktu lebih lama. Untuk hasil terbaik, pertahankan resolusi gambar yang wajar dan batasi panjang output. API OrcaRouter tidak memiliki tambahan overhead di luar waktu respons penyedia.
Kelebihan: Model ini unggul dalam tugas-tugas yang membutuhkan jawaban cepat dan hemat biaya dari satu gambar. Ia dapat dengan cepat mengidentifikasi objek umum, membaca teks dari gambar, dan menjawab pertanyaan langsung tentang konten visual. Biaya input yang rendah membuatnya layak untuk memproses volume gambar yang besar. Keterbatasan: Model ini mungkin kesulitan dengan tugas-tugas yang membutuhkan presisi tinggi, seperti menghitung objek kecil, membedakan tekstur yang sangat mirip, atau memahami diagram yang kompleks. Pemahaman model terbatas pada apa yang dapat disimpulkan dari data piksel dan perintah teks; ia tidak memiliki akses ke pengetahuan eksternal di luar data pelatihannya (tanggal batas tidak diketahui). Selain itu, karena biaya output yang tinggi, menghasilkan jawaban yang panjang untuk setiap gambar dapat dengan cepat menjadi mahal. Untuk tugas-tugas yang membutuhkan analisis panjang dan mendetail, model yang lebih canggih (dan biasanya lebih mahal) akan lebih sesuai. Performa pada kasus-kasus tepi seperti gambar gelap buram atau sudut pandang yang tidak biasa mungkin lebih rendah.
Penetapan harga sangat sederhana: $0.30 per 1 juta token input dan $30.00 per 1 juta token output. Token input mencakup token dari teks prompt dan gambar (gambar ditokenisasi oleh model). Token output adalah token yang dihasilkan sebagai respons. Tidak ada biaya pengaturan, tidak ada minimum bulanan, dan OrcaRouter tidak menambahkan markup apa pun—Anda membayar persis sesuai tarif penyedia. Token dihitung oleh sistem OrcaRouter. Penagihan biasanya berdasarkan pemakaian, dengan biaya yang dikenakan saat Anda mengirim permintaan. Anda dapat memantau penggunaan melalui dasbor OrcaRouter. Karena token input jauh lebih murah daripada token output, total biaya untuk permintaan umum (output pendek) didominasi oleh sisi input, terutama jika Anda menyertakan gambar besar. Sebagai contoh, gambar berukuran 1024x1024 dapat menghabiskan beberapa ribu token input.
Dibandingkan dengan model teks-saja (misalnya, Gemini 1.5 Flash teks-saja dengan biaya input $0.075/M, biaya output $0.30/M), biaya input model ini 4x lebih tinggi dan biaya output 100x lebih tinggi, mencerminkan kompleksitas tambahan dari visi. Untuk tugas yang tidak memerlukan analisis gambar, model teks-saja tersebut jauh lebih murah. Dibandingkan dengan model multimodal yang lebih besar seperti Gemini 2.5 Pro (yang memiliki biaya per-token lebih tinggi tetapi penalaran lebih baik), model ini lebih murah pada input tetapi serupa atau lebih tinggi pada output tergantung pada tingkatan Pro tertentu. Trade-off tingkatan flash adalah akurasi yang lebih rendah untuk biaya input yang lebih rendah. Jika aplikasi Anda membutuhkan akurasi tinggi dan dapat mentolerir biaya input yang lebih tinggi, model Pro mungkin lebih baik. Jika panjang output besar, biaya output model ini menjadi mahal, jadi pertimbangkan model dengan harga output yang lebih rendah, seperti Gemini 1.5 Flash (teks+visi) yang mungkin memiliki tarif berbeda.
Fakta yang diberikan tidak menyebutkan mekanisme caching atau diskon volume untuk model ini di OrcaRouter. OrcaRouter meneruskan harga penyedia tanpa markup, sehingga diskon apa pun harus berasal dari pengaturan penagihan langsung Google. Saat ini, tidak ada caching otomatis dari embedding gambar atau prompt dalam informasi yang dipublikasikan OrcaRouter. Pengguna harus berasumsi bahwa setiap permintaan ditagih berdasarkan token input dan output yang digunakan. Untuk pengguna volume tinggi, mungkin ada baiknya menghubungi OrcaRouter untuk menanyakan tentang potensi perjanjian perusahaan, tetapi harga standar bayar sesuai pemakaian adalah $0.30/M input dan $30.00/M output. Untuk meminimalkan biaya, gunakan kembali output yang telah dihasilkan sebelumnya jika memungkinkan, dan batasi jumlah token dalam setiap permintaan (misalnya, dengan mengubah ukuran gambar atau menggunakan prompt yang singkat).
Untuk menggunakan Google: Nano Banana (Gemini 2.5 Flash Image) melalui OrcaRouter, kirimkan permintaan POST ke https://api.orcarouter.ai/v1/chat/completions dengan parameter model diatur ke "google/gemini-2.5-flash-image". API ini mengikuti format chat completions OpenAI. Sertakan kunci API OrcaRouter Anda di header Authorization sebagai "Bearer YOUR_API_KEY". Dalam body permintaan, berikan array messages dengan pesan pengguna yang berisi gambar dan teks. Untuk gambar, sertakan bagian konten dengan tipe "image_url" yang berisi URL atau data base64. Contoh: {"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"What is in this image?"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}. Responsnya akan berupa chat completion standar dengan jawaban model.
API OrcaRouter mendukung banyak parameter yang sama dengan API OpenAI. Parameter penting: model (wajib, diatur ke "google/gemini-2.5-flash-image"), messages (wajib, array dari objek pesan), max_tokens (integer, token maksimum yang akan dihasilkan), temperature (float, default 1.0, mengontrol keacakan), top_p (float, default 1.0), presence_penalty dan frequency_penalty (float), stop (string atau array string, hingga 4 urutan), dan stream (boolean, untuk respons streaming). Untuk input gambar, messages harus menyertakan setidaknya satu pesan pengguna dengan konten berupa array dari bagian-bagian, masing-masing bagian memiliki bidang tipe ("text" atau "image_url"). Bagian image_url harus memiliki objek "image_url" dengan string "url" (baik URL yang dapat diakses publik atau URL data dengan base64). Tidak ada fine-tuning atau parameter khusus model tambahan yang diekspos. Jendela konteks adalah 32,768 token, jadi pastikan prompt_token_count + image_token_count + max_tokens <= 32768.
Migrasi ke OrcaRouter memerlukan perubahan kode minimal jika Anda sudah menggunakan API yang kompatibel dengan OpenAI. Cukup ubah base URL dari endpoint sebelumnya menjadi https://api.orcarouter.ai/v1. Perbarui kunci API Anda menjadi kunci OrcaRouter. Saat memanggil model, atur parameter model menjadi "google/gemini-2.5-flash-image" (atau model yang Anda inginkan). Sesuaikan ID model yang sudah ada. Untuk input gambar, pastikan format permintaan Anda sesuai dengan konvensi OpenAI (misalnya, menggunakan array konten dengan image_url). Biasanya tidak diperlukan perubahan kode lain. Jika Anda menggunakan format API yang berbeda (misalnya, endpoint cloud), Anda mungkin perlu menulis ulang struktur permintaan. OrcaRouter menyediakan dokumentasi untuk SDK umum. Uji dengan sejumlah kecil permintaan untuk memverifikasi jumlah token dan harga. Perhatikan bahwa OrcaRouter menagih tarif penyedia tanpa markup, sehingga harga mungkin berbeda dari penyedia sebelumnya.
Dibandingkan dengan Gemini 2.5 Flash versi teks-saja (jika tersedia di OrcaRouter), model ini menambahkan kemampuan input gambar tetapi dengan biaya input yang lebih tinggi. Versi teks-saja biasanya lebih murah per token input dan memiliki biaya output yang jauh lebih rendah, sehingga lebih disukai untuk tugas teks murni. Dibandingkan dengan model Gemini 2.5 Pro, model flash-tier ini lebih murah pada input tetapi mungkin memiliki akurasi dan kedalaman penalaran yang lebih rendah. Model Pro memiliki jendela konteks yang lebih besar (seringkali 1 juta token) dan kinerja yang lebih baik pada tugas multi-langkah yang kompleks. Biaya output untuk model Pro mungkin serupa atau lebih tinggi. Untuk tugas yang memerlukan pemahaman gambar bersamaan dengan teks, model ini menawarkan titik masuk yang hemat biaya. Namun, jika Anda perlu memproses video, audio, atau beberapa gambar secara bersamaan, Anda harus mempertimbangkan model yang mendukung modalitas tersebut (misalnya, Gemini 2.5 Pro yang mendukung video dan audio dalam beberapa konfigurasi).
Model ini adalah salah satu dari banyak opsi multimodal yang tersedia melalui OrcaRouter. GPT-4o (OpenAI) biasanya memiliki jendela konteks yang lebih besar (128k) dan mungkin menawarkan pemahaman serta penalaran gambar secara keseluruhan yang lebih baik, namun dengan biaya input dan output yang lebih tinggi. Model visi Claude (misalnya, Claude 3.5 Sonnet) juga kompetitif tetapi berbeda dalam harga dan panjang konteks. Keunggulan utama Gemini 2.5 Flash Image adalah biaya input yang rendah, menjadikannya menarik untuk tugas-tugas volume tinggi dengan output pendek. Namun, untuk penalaran visual yang kompleks, pencitraan perawatan kesehatan, atau analisis dokumen terperinci, model yang lebih canggih mungkin memberikan hasil yang lebih baik. Pilihan tergantung pada pertukaran spesifik antara biaya, akurasi, dan latensi. OrcaRouter memungkinkan Anda dengan mudah beralih antar model dengan mengubah ID model, sehingga memungkinkan untuk menguji model ini bersama alternatif lain untuk menentukan yang paling sesuai.
Model yang lebih mahal—seperti Gemini 2.5 Pro, GPT-4o, atau Claude 3.5 Sonnet—menjadi justifikasi ketika tugas membutuhkan akurasi lebih tinggi, konteks yang lebih panjang, atau penalaran yang memerlukan lebih banyak langkah. Jika aplikasi Anda menghasilkan output yang salah atau tidak lengkap dengan model ini, penghematan biaya akan sia-sia jika Anda perlu melakukan pasca-pemrosesan atau koreksi manual. Untuk tugas seperti menganalisis gambar medis, menafsirkan dokumen hukum, atau menangani konten kepatuhan yang sensitif, keandalan model premium mungkin sepadan dengan biaya yang lebih tinggi. Selain itu, jika Anda perlu menghasilkan output panjang (misalnya, deskripsi halaman penuh) atau memproses gambar yang sangat besar, model dengan jendela konteks yang lebih besar dan biaya token output yang lebih rendah bisa lebih hemat biaya secara keseluruhan. Sifat flash-tier dari model ini berarti model ini dirancang untuk kecepatan dan throughput, bukan untuk kedalaman. Gunakan model ini ketika pemahaman yang mendekati sudah cukup; tingkatkan ketika presisi menjadi penting.
Privasi dan penanganan data bergantung pada kebijakan Google untuk model Gemini. Seperti halnya API cloud lainnya, data input (gambar dan teks) dikirim ke server Google untuk diproses. Google dapat menggunakan data tersebut untuk peningkatan model kecuali Anda memilih untuk tidak ikut serta atau menggunakan akun tingkat perusahaan yang melarang penggunaan tersebut. Fakta yang diberikan tidak menentukan detail penanganan data untuk model tertentu ini. Saat menggunakan OrcaRouter sebagai gateway, data melewati infrastruktur OrcaRouter tetapi pada akhirnya diproses oleh Google. OrcaRouter tidak menyimpan data Anda atau menggunakannya untuk pelatihan. Pengguna harus meninjau ketentuan pemrosesan data Google untuk API Gemini dan mempertimbangkan enkripsi ujung-ke-ujung jika diperlukan. Untuk data sensitif, beberapa organisasi lebih memilih model yang dihosting di infrastruktur mereka sendiri (misalnya, melalui Vertex AI dengan residensi data) daripada gateway pihak ketiga. Namun, OrcaRouter menyediakan kunci API dan penagihan terpadu, yang dapat menyederhanakan akses jika masalah penanganan data dapat diterima.
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| Input / 1M token | $0.300 |
| Output / 1M token | $30.00 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
GET /api/public/models/google/gemini-2.5-flash-imageBuka @misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image