Gemini 2.5 Flash Image, znany również jako „Nano Banana”, jest teraz ogólnie dostępny. To najnowocześniejszy model generowania obrazów z rozumieniem kontekstu. Jest zdolny do generowania obrazów,...
Google: Nano Banana (Gemini 2.5 Flash Image) to multimodalny model językowy opracowany przez Google, część serii Gemini 2.5 Flash. Przyjmuje zarówno obrazy, jak i tekst jako dane wejściowe, a…
Główne możliwości koncentrują się na rozumieniu i analizowaniu treści wizualnych prezentowanych jako obrazy. Mając obraz i podpowiedź tekstową, model może opisać scenę, zidentyfikować obiekty, odpowiedzieć na pytania dotyczące treści, wyodrębnić tekst (OCR) oraz wykonać podstawowe rozumowanie wizualne (np. relacje przestrzenne, kolory, akcje). Może również przetwarzać tekst towarzyszący obrazowi, taki jak instrukcje czy kontekst. Ponieważ korzysta z architektury flash-tier, jest zoptymalizowany pod kątem niskiego opóźnienia i wysokiej przepustowości, co czyni go odpowiednim do zastosowań czasu rzeczywistego lub o dużej objętości danych. Jednakże może nie dorównywać głębokości rozumowania ani dokładności droższych, większych modeli, takich jak Gemini 2.5 Pro, w złożonych zadaniach wizualnych wymagających szczegółowej analizy lub długich łańcuchów wnioskowania. Model nie jest przeznaczony do zadań takich jak generowanie obrazów, analiza wideo czy konwersacje wieloetapowe, które wymagają długiego kontekstu przekraczającego 32K tokenów.
Jeśli Twoja aplikacja w ogóle nie wymaga wprowadzania obrazów, użycie modelu tekstowego (np. mniejszej wariantu Gemini lub modelu open-source) będzie bardziej opłacalne. Podobnie, jeśli zadanie polega wyłącznie na rozumowaniu tekstowym bez elementów wizualnych, narzut związany z przetwarzaniem obrazu jest niepotrzebny. W scenariuszach, gdzie wymagana jest długa odpowiedź – takich jak generowanie szczegółowych raportów lub opowiadań na podstawie obrazu – cena $30 za milion tokenów wyjściowych może stać się kosztowna. W takich przypadkach rozważ modele z niższymi stawkami za dane wyjściowe lub użyj tego modelu do wygenerowania krótkiego podsumowania, a następnie rozszerz go za pomocą tańszego modelu tekstowego. Dodatkowo, jeśli musisz przetworzyć wiele obrazów w jednym żądaniu lub obsłużyć bardzo duże obrazy, bardziej odpowiednie mogą być modele z większymi oknami kontekstu lub specyficznym wsparciem dla rozdzielczości obrazów.
Wdrożenia o dużej objętości korzystają z niskiego kosztu wejściowego tego modelu ($0.30 za milion tokenów) i szybkiego wnioskowania. Idealne przypadki użycia obejmują automatyczne tagowanie obrazów dla dużych bibliotek zdjęć, generowanie tekstu alternatywnego dla tysięcy zdjęć produktów, przeprowadzanie OCR na partiach zeskanowanych dokumentów oraz moderację treści w czasie rzeczywistym obrazów przesyłanych przez użytkowników. Ponieważ koszt wyjściowy jest wysoki, odpowiedź powinna być krótka – często pojedyncze słowo, etykieta lub zdanie. Na przykład klasyfikowanie obrazu do predefiniowanych kategorii, wyodrębnianie kilku kluczowych pól z formularza lub odpowiadanie na pytanie typu tak/nie dotyczące obrazu. Przetwarzanie wsadowe można wykonać za pomocą API OrcaRouter z równoczesnymi żądaniami. Opóźnienie modelu jest zazwyczaj niskie, ale rzeczywista przepustowość zależy od rozmiaru i złożoności obrazu. W OrcaRouter nie ma oddzielnego limitu szybkości poza ogólnym użyciem API.
Głównym ograniczeniem jest wysoki koszt tokenów wyjściowych w stosunku do kosztu tokenów wejściowych, co sprawia, że generowanie długiego tekstu jest kosztowne. Okno kontekstu o rozmiarze 32 768 tokenów ogranicza ilość tekstu i rozmiar obrazu (w przeliczeniu na tokeny), które można przetworzyć w pojedynczym żądaniu. Model nie jest przeznaczony do zadań wymagających głębokiego wnioskowania multimodalnego, skomplikowanych szczegółów wizualnych ani obsługi wielu obrazów jednocześnie (każdy dodatkowy obraz pochłania kontekst). Ponadto jako model flash, może wykazywać niższą dokładność w wyspecjalizowanych zadaniach wizualnych, takich jak analiza obrazów medycznych, szczegółowe wykrywanie obiektów czy rozpoznawanie rzadkich obiektów, w porównaniu z bardziej wydajnymi, ale wolniejszymi lub droższymi modelami. Dane treningowe modelu oraz jego konkretna wydajność w testach porównawczych nie są ujawnione w dostarczonych informacjach; użytkownicy powinni ocenić go na własnych zestawach danych. Wreszcie, model obsługuje tylko obrazy i tekst, a nie wideo ani audio.
Podane fakty nie zawierają konkretnych wyników benchmarków dla Google: Nano Banana (Gemini 2.5 Flash Image). Jest on częścią serii Google Gemini 2.5 Flash, która ogólnie stawia na wydajność, a nie najwyższą dokładność. Wobec braku liczb użytkownicy powinni spodziewać się wydajności porównywalnej z innymi modelami wielomodalnymi klasy flash w standardowych zadaniach wizyjno-językowych, takich jak VQAv2, COCO Captions i OCR. Dokładne wyniki nie są jednak podane. Zalecamy ocenę modelu na własnym reprezentatywnym zbiorze danych, aby sprawdzić, czy jego możliwości spełniają Twoje wymagania. OrcaRouter nie udostępnia wewnętrznych benchmarków wykraczających poza te publicznie dostępne od Google. Jeśli potrzebujesz precyzyjnych metryk dokładności, zapoznaj się z oficjalną dokumentacją Google dla serii Gemini 2.5 Flash, ale pamiętaj, że ten konkretny identyfikator modelu może mieć własne dostrojenie.
Przedstawione fakty nie zawierają pomiarów opóźnienia dla tego modelu. Jako część rodziny Gemini 2.5 Flash, jest zaprojektowany z myślą o niskim opóźnieniu i wysokiej przepustowości. Zazwyczaj modele flash-tier od Google poświęcają część jakości wnioskowania na rzecz szybkości, co czyni je odpowiednimi do zastosowań bliskich rzeczywistemu czasowi. Rzeczywiste opóźnienie zależy od takich czynników jak rozmiar i rozdzielczość obrazu wejściowego, długość promptu tekstowego, liczba żądanych tokenów wyjściowych oraz bieżące obciążenie API. Ogólnie rzecz biorąc, proste zadania opisywania obrazów mogą zakończyć się w ciągu kilkuset milisekund do kilku sekund, podczas gdy bardziej złożone prompte wymagające dłuższego wyjścia będą trwać dłużej. Aby uzyskać najlepsze rezultaty, utrzymuj rozsądną rozdzielczość obrazu i ograniczaj długość wyjścia. API OrcaRouter nie dodaje żadnego narzutu poza czasem odpowiedzi dostawcy.
Mocne strony: Model doskonale radzi sobie w zadaniach, w których potrzebna jest szybka i tania odpowiedź z pojedynczego obrazu. Potrafi szybko identyfikować typowe obiekty, odczytywać tekst z obrazów oraz odpowiadać na bezpośrednie pytania dotyczące treści wizualnej. Niski koszt wejściowy sprawia, że jest wykonalny do przetwarzania dużych ilości obrazów. Ograniczenia: Model może mieć trudności z zadaniami wymagającymi dużej precyzji, takimi jak liczenie małych obiektów, rozróżnianie bardzo podobnych tekstur lub rozumienie skomplikowanych diagramów. Zrozumienie modelu jest ograniczone do tego, co można wywnioskować z danych pikseli i podpowiedzi tekstowej; nie ma on dostępu do wiedzy zewnętrznej poza danymi treningowymi (data odcięcia nieznana). Dodatkowo, ponieważ koszt wyjściowy jest wysoki, generowanie szczegółowych odpowiedzi dla każdego obrazu może szybko stać się kosztowne. W przypadku zadań wymagających długiej, szczegółowej analizy bardziej odpowiedni byłby model o większych możliwościach (i zazwyczaj droższy). Wydajność w przypadkach skrajnych, takich jak ciemne, rozmazane obrazy lub nietypowe kąty, może być niższa.
Cennik jest prosty: 0,30 USD za 1 milion tokenów wejściowych i 30,00 USD za 1 milion tokenów wyjściowych. Tokeny wejściowe obejmują tokeny zarówno z promptu tekstowego, jak i obrazu (obraz jest tokenizowany przez model). Tokeny wyjściowe to tokeny wygenerowane jako odpowiedź. Nie ma opłaty konfiguracyjnej, minimalnego miesięcznego progu, a OrcaRouter nie dodaje żadnej marży – płacisz dokładnie stawkę dostawcy. Tokeny są liczone przez system OrcaRouter. Rozliczenia są zazwyczaj oparte na użyciu, a opłaty naliczane przy wysyłaniu zapytań. Użycie można monitorować za pomocą pulpitu nawigacyjnego OrcaRouter. Ponieważ tokeny wejściowe są znacznie tańsze niż wyjściowe, całkowity koszt typowego zapytania (krótkie wyjście) jest zdominowany przez stronę wejściową, zwłaszcza jeśli dołączony jest duży obraz. Na przykład obraz o wymiarach 1024x1024 może pochłonąć kilka tysięcy tokenów wejściowych.
W porównaniu do modeli tekstowych (np. Gemini 1.5 Flash tylko tekst w cenie $0,075/M wejście, $0,30/M wyjście), koszt wejścia tego modelu jest 4x wyższy, a koszt wyjścia 100x wyższy, co odzwierciedla dodatkową złożoność widzenia. W przypadku zadań, które nie wymagają analizy obrazu, te modele tekstowe są znacznie tańsze. W porównaniu do większych modeli multimodalnych, takich jak Gemini 2.5 Pro (które mają wyższe koszty na token, ale lepsze rozumowanie), ten model jest tańszy pod względem wejścia, ale podobny lub wyższy pod względem wyjścia, w zależności od konkretnego poziomu Pro. Kompromisem w warstwie Flash jest niższa dokładność za niższy koszt wejścia. Jeśli Twoja aplikacja wymaga wysokiej dokładności i może tolerować wyższy koszt wejścia, model Pro może być lepszy. Jeśli długość wyjścia jest duża, koszt wyjścia tego modelu staje się zaporowy, dlatego rozważ modele z niższymi cenami wyjścia, takie jak Gemini 1.5 Flash (tekst+widzenie), które mogą mieć inne stawki.
Podane fakty nie wspominają o żadnych mechanizmach buforowania ani rabatach ilościowych dla tego modelu na OrcaRouter. OrcaRouter przekazuje ceny dostawcy bez narzutu, więc wszelkie rabaty musiałyby pochodzić z bezpośrednich ustaleń rozliczeniowych z Google. Obecnie w opublikowanych informacjach OrcaRouter nie ma automatycznego buforowania osadzeń obrazów ani promptów. Użytkownicy powinni zakładać, że każde żądanie jest rozliczane na podstawie użytych tokenów wejściowych i wyjściowych. Dla użytkowników o dużym wolumenie może warto skontaktować się z OrcaRouter, aby zapytać o potencjalne umowy korporacyjne, ale standardowa cena pay-as-you-go wynosi $0.30/M za wejście i $30.00/M za wyjście. Aby zminimalizować koszty, należy w miarę możliwości ponownie wykorzystywać wcześniej wygenerowane wyniki oraz ograniczać liczbę tokenów w każdym żądaniu (np. poprzez zmianę rozmiaru obrazów lub używanie krótkich promptów).
Aby użyć Google: Nano Banana (Gemini 2.5 Flash Image) przez OrcaRouter, wyślij żądanie POST na adres https://api.orcarouter.ai/v1/chat/completions z parametrem model ustawionym na "google/gemini-2.5-flash-image". API jest zgodne z formatem chat completions OpenAI. Dołącz swój klucz API OrcaRouter w nagłówku Authorization jako "Bearer YOUR_API_KEY". W treści żądania podaj tablicę messages z wiadomością użytkownika, która zawiera zarówno obraz, jak i tekst. W przypadku obrazów dołącz część content typu "image_url" z URL-em lub danymi base64. Przykład: {"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"What is in this image?"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}. Odpowiedź będzie standardową odpowiedzią czatu z odpowiedzią modelu.
API OrcaRouter obsługuje wiele tych samych parametrów co API OpenAI. Parametry podstawowe: model (wymagane, ustaw na "google/gemini-2.5-flash-image"), messages (wymagane, tablica obiektów wiadomości), max_tokens (liczba całkowita, maksymalna liczba tokenów do wygenerowania), temperature (liczba zmiennoprzecinkowa, domyślnie 1.0, kontroluje losowość), top_p (liczba zmiennoprzecinkowa, domyślnie 1.0), presence_penalty i frequency_penalty (liczby zmiennoprzecinkowe), stop (ciąg znaków lub tablica ciągów znaków, do 4 sekwencji) oraz stream (wartość logiczna, do odpowiedzi strumieniowych). W przypadku wejścia obrazu, messages muszą zawierać co najmniej jedną wiadomość użytkownika z treścią będącą tablicą części, każda część z polem type („text” lub „image_url”). Część image_url musi zawierać obiekt "image_url" z ciągiem "url" (publicznie dostępny adres URL lub data URL z base64). Nie ma możliwości dostrajania ani dodatkowych parametrów specyficznych dla modelu. Okno kontekstu wynosi 32 768 tokenów, więc upewnij się, że prompt_token_count + image_token_count + max_tokens <= 32768.
Migracja do OrcaRouter wymaga minimalnych zmian w kodzie, jeśli już używasz API zgodnego z OpenAI. Po prostu zmień podstawowy URL z poprzedniego punktu końcowego na https://api.orcarouter.ai/v1. Zaktualizuj swój klucz API na klucz OrcaRouter. Podczas wywoływania modelu ustaw parametr model na "google/gemini-2.5-flash-image" (lub wybrany model). Dostosuj wszystkie istniejące identyfikatory modeli odpowiednio. W przypadku wprowadzania obrazów upewnij się, że format żądania jest zgodny z konwencją OpenAI (np. używając tablicy content z image_url). Inne zmiany w kodzie zazwyczaj nie są potrzebne. Jeśli używałeś innego formatu API (np. punktów końcowych w chmurze), być może będziesz musiał przepisać strukturę żądania. OrcaRouter udostępnia dokumentację dla popularnych zestawów SDK. Przetestuj na małej liczbie żądań, aby zweryfikować liczbę tokenów i ceny. Uwaga: OrcaRouter rozlicza stawki dostawcy bez marży, więc ceny mogą różnić się od poprzedniego dostawcy.
W porównaniu do modelu Gemini 2.5 Flash obsługującego tylko tekst (jeśli dostępny na OrcaRouter), ten model dodaje możliwość przetwarzania obrazów, ale przy wyższym koszcie wejściowym. Wersja tylko tekstowa zazwyczaj kosztuje mniej na token wejściowy i ma znacznie niższy koszt wyjściowy, co czyni ją preferowaną w przypadku zadań czysto tekstowych. W porównaniu do modeli Gemini 2.5 Pro, ten model z warstwy Flash jest tańszy pod względem wejścia, ale może charakteryzować się niższą dokładnością i głębią rozumowania. Modele Pro mają większe okno kontekstu (często 1 milion tokenów) i lepszą wydajność w złożonych zadaniach wieloetapowych. Koszt wyjściowy dla modeli Pro może być podobny lub wyższy. W przypadku zadań wymagających zrozumienia obrazów wraz z tekstem, ten model stanowi opłacalny punkt wejścia. Jeśli jednak potrzebujesz przetwarzać wideo, audio lub wiele obrazów jednocześnie, powinieneś rozważyć model obsługujący te modalności (np. Gemini 2.5 Pro, który w niektórych konfiguracjach obsługuje wideo i audio).
Model ten jest jednym z wielu multimodalnych opcji dostępnych za pośrednictwem OrcaRouter. GPT-4o (OpenAI) zazwyczaj ma większe okno kontekstowe (128k) i może oferować lepsze ogólne rozumienie obrazów i wnioskowanie, ale przy wyższych kosztach wejścia i wyjścia. Modele wizyjne Claude'a (np. Claude 3.5 Sonnet) są również konkurencyjne, ale różnią się cennikiem i długością kontekstu. Główną zaletą Gemini 2.5 Flash Image jest niski koszt wejściowy, co czyni go atrakcyjnym dla zadań o dużej objętości i krótkim wyjściu. Jednak w przypadku złożonego wnioskowania wizualnego, obrazowania medycznego lub szczegółowej analizy dokumentów, bardziej zaawansowane modele mogą dawać lepsze wyniki. Wybór zależy od konkretnego kompromisu między kosztem, dokładnością i opóźnieniem. OrcaRouter umożliwia łatwe przełączanie się między modelami poprzez zmianę identyfikatora modelu, więc możliwe jest przetestowanie tego modelu obok alternatyw, aby określić najlepsze dopasowanie.
Droższy model – taki jak Gemini 2.5 Pro, GPT-4o lub Claude 3.5 Sonnet – staje się uzasadniony, gdy zadanie wymaga wyższej dokładności, dłuższego kontekstu lub rozumowania wymagającego większej liczby kroków. Jeśli aplikacja produkuje nieprawidłowe lub niekompletne wyniki przy użyciu tego modelu, oszczędności kosztowe są marnowane, jeśli potrzebne jest przetwarzanie końcowe lub korekta ludzka. W przypadku zadań takich jak analiza obrazów medycznych, interpretacja dokumentów prawnych lub obsługa wrażliwych treści zgodnościowych, niezawodność modelu premium może uzasadniać wyższy koszt. Ponadto, jeśli potrzebujesz generować długie wyniki (np. opisy całych stron) lub przetwarzać bardzo duże obrazy, modele z większymi oknami kontekstowymi i niższymi kosztami tokenów wyjściowych mogą być bardziej opłacalne ogólnie. Natura flash-tier tego modelu oznacza, że jest on zaprojektowany dla szybkości i przepustowości, a nie dla głębi. Używaj go tam, gdzie wystarczy przybliżone zrozumienie; przejdź na wyższy model, gdy liczy się precyzja.
Prywatność i przetwarzanie danych zależą od polityki Google dotyczącej modeli Gemini. Podobnie jak w przypadku każdego interfejsu API w chmurze, dane wejściowe (obrazy i tekst) są wysyłane na serwery Google w celu przetworzenia. Google może wykorzystywać dane do ulepszania modeli, chyba że zrezygnujesz z tego lub użyjesz kont klasy enterprise, które zabraniają takiego wykorzystania. Podane fakty nie określają szczegółów przetwarzania danych dla tego konkretnego modelu. W przypadku korzystania z OrcaRouter jako bramy, dane przechodzą przez infrastrukturę OrcaRouter, ale ostatecznie są przetwarzane przez Google. OrcaRouter nie przechowuje Twoich danych ani nie wykorzystuje ich do uczenia. Użytkownicy powinni zapoznać się z warunkami przetwarzania danych Google dla interfejsów API Gemini i rozważyć szyfrowanie end-to-end, jeśli to konieczne. W przypadku wrażliwych danych niektóre organizacje wolą modele hostowane na własnej infrastrukturze (np. za pośrednictwem Vertex AI z rezydencją danych) zamiast bramy innej firmy. Jednak OrcaRouter zapewnia ujednolicony klucz API i rozliczenia, co może uprościć dostęp, jeśli obawy dotyczące przetwarzania danych są akceptowalne.
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| Wejście / 1M tokenów | $0.300 |
| Wyjście / 1M tokenów | $30.00 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
GET /api/public/models/google/gemini-2.5-flash-imageOtwórz @misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image