Gemini 3.5 Flash-Lite to najbardziej opłacalny model Gemini od Google, stworzony specjalnie do zadań o bardzo dużej objętości i wrażliwych na opóźnienia, gdzie dominuje koszt pojedynczego wywołania. Pomimo swojej ceny jest natywnie multimodalny – akceptuje tekst, obrazy, wideo, audio i pliki z wyjściem tekstowym – i oferuje to samo okno kontekstowe 1 miliona tokenów oraz do 64 tys. tokenów wyjściowych co większy poziom Flash, dzięki czemu długie dokumenty i mieszane dane wejściowe pozostają w zasięgu. Przy cenie mniej więcej jednej piątej ceny 3.6 Flash, jest to odpowiednie narzędzie do klasyfikacji, ekstrakcji, routingu, podsumowań, lekkich agentów, generowania danych syntetycznych i wszelkich potoków uruchamianych miliony razy. Nadal obsługuje konfigurowalny wysiłek wnioskowania, natywne wywoływanie narzędzi i strukturalne wyniki, a w porównaniu do lekkich modeli osiąga lepsze wyniki w benchmarkach agentowych i długiego kontekstu – na przykład 74,0% w OSWorld-Verified i 72,2% w 128k multi-needle retrieval, zdecydowanie wyprzedzając poprzedni model 3.1 Flash-Lite. Obsługuje zarówno format OpenAI chat-completions, jak i natywny interfejs API generateContent Gemini, dzięki czemu można go mieszać z cięższymi modelami w ramach jednej integracji – kierując łatwy, wielkoskalowy ruch do Flash-Lite i przekazując trudne zadania do 3.6 Flash lub modelu Pro.
Google Gemini 3.5 Flash-Lite to multimodalny model językowy opracowany przez Google, udostępniany za pośrednictwem zgodnego z OpenAI API OrcaRouter. Akceptuje dane wejściowe w postaci tekstu, obrazu,…
Gemini 3.5 Flash-Lite jest zdolny do szerokiego zakresu zadań dzięki obsłudze multimodalnego wejścia i narzędzi. Radzi sobie z zadaniami wyłącznie tekstowymi, takimi jak streszczanie, odpowiadanie na pytania i generowanie kodu. Dzięki obrazom może opisywać sceny, wyodrębniać tekst z dokumentów lub interpretować diagramy. Wejścia wideo umożliwiają rozpoznawanie aktywności, tworzenie podpisów i wnioskowanie temporalne. Wejścia audio ułatwiają transkrypcję, identyfikację języka i analizę opartą na mowie. Model obsługuje również wywoływanie narzędzi, o czym świadczy jego wynik CharXiv Reasoning na poziomie 76,5 (z narzędziami). Oznacza to, że można go zintegrować z przepływami pracy agentów, gdzie wywołuje zewnętrzne API lub bazy danych. Nie jest jednak przeznaczony do kreatywnego pisania, wysoce abstrakcyjnego rozumowania ani zadań wymagających głębokiej wiedzy dziedzinowej. Jego siła leży w szybkości, koszcie i szerokości wsparcia dla modalności, a nie w surowej wydajności.
Należy wybrać Gemini 3.5 Flash-Lite, gdy koszt i przepustowość są głównymi czynnikami, a zadanie mieści się w zakresie jego możliwości. Sprawdza się doskonale w potokach o dużej objętości, takich jak indeksowanie tysięcy dokumentów, transkrypcja godzin nagrań audio czy prowadzenie klasyfikacji w czasie rzeczywistym na strumieniach obrazów. Jego duże okno kontekstowe (1M tokenów) czyni go idealnym do zadań wymagających globalnego zrozumienia długich danych wejściowych, jak analiza spraw sądowych czy refaktoryzacja bazy kodu. Większe modele (np. Gemini 3.5 Pro) mogą osiągać wyższą dokładność w złożonych benchmarkach, ale wiążą się ze znacznie wyższymi kosztami na token i niższą przepustowością. Jeśli Twoja aplikacja może tolerować niewielkie kompromisy jakościowe w zamian za 10‑100x redukcję kosztów, ten model jest dobrym wyborem. Z kolei w przypadku zadań wymagających precyzji faktograficznej, kreatywnego generowania lub najnowocześniejszego rozumowania zalecany jest większy model.
Tak, model natywnie akceptuje wejście wideo i audio obok tekstu, obrazów i plików. Wejście wideo można podać jako sekwencję klatek lub plik wideo; model przetwarza klatki wizualne i wszelkie powiązane ścieżki audio. Wejście audio działa z popularnymi formatami, takimi jak WAV, MP3 lub FLAC. Duże okno kontekstowe pozwala na przetworzenie długich nagrań w jednym żądaniu – na przykład godzinny transkrypt audio z wysoką szczegółowością może zużyć około 10 000 tokenów. Jest to przydatne do podsumowań spotkań, analizy podcastów lub głosowej obsługi klienta. Należy pamiętać, że model nie generuje wyjścia audio ani wideo; odpowiedzi są zawsze tekstowe. Jakość multimodalnego rozumienia odpowiada poziomowi flash‑lite modelu: odpowiednia do ekstrakcji i klasyfikacji, ale może pomijać subtelne szczegóły w porównaniu z większymi modelami multimodalnymi.
Gemini 3.5 Flash-Lite obsługuje wywoływanie narzędzi, co potwierdzają wyniki testów na CharXiv Reasoning z narzędziami (wynik 76.5). Oznacza to, że możesz zdefiniować funkcje lub interfejsy API, które model może wywoływać podczas generowania odpowiedzi. Typowe przypadki użycia obejmują zapytania do baz danych, wyszukiwanie w sieci lub operacje arytmetyczne. Model decyduje, kiedy wywołać narzędzie, na podstawie instrukcji użytkownika i kontekstu. Użycie narzędzi może poprawić dokładność faktograficzną i umożliwić złożone wieloetapowe rozumowanie. Jednakże, ponieważ model jest wariantem flash‑lite, jego niezawodność wywoływania narzędzi może być niższa niż w przypadku większego wyspecjalizowanego modelu. Jeśli Twoja aplikacja w dużej mierze opiera się na bezbłędnej orkiestracji narzędzi, może być konieczne dodanie warstw walidacji lub logiki awaryjnej. OrcaRouter przekazuje definicje narzędzi w tym samym formacie co API OpenAI, co ułatwia integrację.
Model osiągnął wynik 76,5 w benchmarku CharXiv Reasoning przy ocenie z użyciem narzędzi. CharXiv testuje umiejętność wnioskowania na podstawie danych wizualnych przedstawionych na wykresach, wymagając od modelu interpretacji obrazu wykresu i odpowiedzi na pytania dotyczące go. Warunek „z narzędziami” oznacza, że model mógł wywoływać funkcje zewnętrzne (np. kalkulator) w celu wspomagania. Wynik ten wskazuje na umiarkowaną wydajność – model jest w stanie wnioskować na temat wykresów, ale nie na poziomie specjalistycznych modeli. Nie podano innych wyników benchmarków dla tego modelu. Dla porównania, większe modele, takie jak Gemini 3.5 Pro, prawdopodobnie osiągnęłyby wyższy wynik w tym zadaniu. Wartość ta jest przydatna jako punkt odniesienia: można oczekiwać rozsądnej interpretacji wykresów, ale należy dokładnie przetestować, jeśli aplikacja wymaga wysokiej dokładności w zadaniach wnioskowania wizualnego.
Tylko wynik CharXiv Reasoning (z narzędziami) został podany: 76.5. Żadne dodatkowe dane porównawcze – takie jak MMLU, HumanEval czy wyniki zadań związanych z wyszukiwaniem w długich kontekstach – nie są dostępne dla Gemini 3.5 Flash‑Lite w dostarczonych informacjach. Oznacza to, że uogólnienie jego wydajności na inne zadania wymaga empirycznych testów na własnych danych. Biorąc pod uwagę lekką naturę modelu typu flash‑lite, należy spodziewać się, że będzie on osiągał gorsze wyniki niż pełnowymiarowe modele w większości standaryzowanych testów. Jednak jego wydajność i niski koszt często przeważają nad tymi niedoborami w środowiskach produkcyjnych. Jeśli potrzebujesz potwierdzonej wydajności w konkretnym teście (np. generowaniu kodu lub rozumieniu wielojęzycznym), powinieneś przeprowadzić własną ocenę. OrcaRouter nie udostępnia osobnych wyników testów; cytowane tutaj liczby pochodzą bezpośrednio od dostawcy.
Szczegóły dotyczące opóźnienia nie są określone w dostarczonych danych. Z grubsza, modele flash‑lite są zaprojektowane tak, aby charakteryzowały się niskim opóźnieniem w porównaniu do większych odpowiedników, ale rzeczywisty czas odpowiedzi zależy od wielu czynników: długości wejścia, długości wyjścia, obciążenia równoczesnymi żądaniami oraz podstawowego sprzętu. Przy oknie kontekstu wynoszącym 1M, przetwarzanie bardzo długich promptów może znacznie zwiększyć opóźnienie ze względu na kwadratowe skalowanie uwagi. W przypadku krótkich danych wejściowych (np. kilkuset tokenów) można spodziewać się odpowiedzi poniżej sekundy. W przypadku danych wejściowych bliskich limitu 1M tokenów opóźnienie może sięgać kilkudziesięciu sekund. OrcaRouter nie gwarantuje konkretnych SLA dotyczących opóźnienia dla tego modelu. Jeśli niskie opóźnienie jest krytyczne, rozważ użycie mniejszego kontekstu (np. poprzez przycięcie) lub dedykowanego punktu końcowego. Czasy odpowiedzi możesz monitorować za pomocą panelu OrcaRouter.
Gemini 3.5 Flash-Lite nie jest zaprojektowany do osiągania dokładności na poziomie stanu najnowszej techniki. Jego mocne strony to szybkość, niski koszt i duży kontekst. Ograniczenia obejmują niższą wydajność w złożonych testach rozumowania, mniejszą dokładność faktograficzną w porównaniu z większymi modelami oraz tendencję do „halucynowania” na niejednoznacznych wejściach. Model może mieć trudności z zadaniami wymagającymi głębokiej wiedzy dziedzinowej (np. rozumowanie prawne, diagnoza medyczna) lub niuansowej pracy twórczej. Jego zdolność korzystania z narzędzi, choć funkcjonalna, może nie być tak niezawodna jak w przypadku dedykowanego modelu agentowego. Ponadto, ponieważ podano tylko jeden wynik benchmarku (CharXiv Reasoning 76,5 z narzędziami), nie można zakładać dobrej wydajności w innych dziedzinach bez testowania. W przypadku krytycznych zastosowań zawsze przeprowadzaj testy na własnych danych i rozważ użycie bardziej wydajnego modelu jako rozwiązania zapasowego, gdy poziom pewności jest niski.
Cennik wynosi 0,30 USD za 1 milion tokenów wejściowych i 2,50 USD za 1 milion tokenów wyjściowych. Są to stawki dostawcy naliczane bez żadnej marży przez OrcaRouter. Tokeny wejściowe obejmują wszystkie tokeny w podpowiedzi (tekst, tokeny obrazów, klatki wideo, próbki audio, zawartość plików) niezależnie od modalności. Tokeny wyjściowe to wygenerowane tokeny tekstowe. Dla typowego zapytania o długim kontekście, zużywającego 100 000 tokenów wejściowych i 1000 tokenów wyjściowych, koszt wyniósłby około (0,30 USD * 0,1) + (2,50 USD * 0,001) = 0,030 USD + 0,0025 USD = 0,0325 USD na zapytanie. Przy większej skali model ten może przetwarzać miliony zapytań za kilkaset dolarów. Porównaj to z większymi modelami, które często kosztują 10–50 razy więcej na token. Niska cena za tokeny wyjściowe jest szczególnie korzystna w przypadku aplikacji generujących długie odpowiedzi (np. podsumowania całych dokumentów).
Podane informacje nie określają żadnego mechanizmu buforowania ani zniżek za buforowane tokeny. Należy zatem założyć, że każdy token wysłany do modelu jest rozliczany według standardowej stawki wejściowej wynoszącej 0,30 USD za milion tokenów, niezależnie od powtórzeń. Niektórzy dostawcy oferują automatyczne buforowanie promptów, w przypadku którego powtarzające się prefiksy są rozliczane po niższej stawce (np. 50% taniej). Dla tego modelu nie ogłoszono żadnej takiej zniżki za buforowanie. Jeśli często wysyłasz ponownie ten sam kontekst (np. duży prompt systemowy), warto sprawdzić, czy OrcaRouter lub Google wdrażają przezroczyste buforowanie. W przypadku braku jednoznacznych informacji najbezpieczniej jest budżetować pełny koszt za token dla wszystkich danych wejściowych. Optymalizacja poprzez przycinanie wielokrotnie używanego kontekstu może obniżyć faktyczny rachunek.
Zero marży oznacza, że OrcaRouter pobiera dokładnie stawkę dostawcy, nie dodając żadnej dodatkowej marży. Dla Gemini 3.5 Flash-Lite cena wejściowa wynosi 0,30 USD/1M tokenów, a cena wyjściowa 2,50 USD/1M tokenów – tyle właśnie pobiera Google, a OrcaRouter przekazuje tę kwotę bez podwyżki. Nie płacisz żadnej dodatkowej opłaty platformowej za token. Jest to nietypowe wśród bram API, które zazwyczaj dodają 10–20% lub więcej. Brak narzutu sprawia, że ten model jest jeszcze bardziej opłacalny, gdy korzysta się z niego przez OrcaRouter. Nadal płacisz za przepustowość i infrastrukturę API, ale te koszty są wliczone w stawkę dostawcy; OrcaRouter nie wyszczególnia ich osobno. Ten model cenowy jest przejrzysty: koszt pokazany w panelu użycia jest kosztem ostatecznym.
Wywołujesz to za pomocą kompatybilnego z OpenAI API OrcaRouter pod adresem bazowym https://api.orcarouter.ai/v1. Ustaw parametr model na "google/gemini-3.5-flash-lite". Działają zarówno chat completions (POST /v1/chat/completions), jak i embeddings (jeśli obsługiwane). W przypadku wejść multimodalnych strukturujesz wiadomości za pomocą tablicy ról i obiektów treści, które mogą zawierać pola text, image_url lub file_url. Przykładowe żądanie cURL: curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' Musisz użyć klucza API OrcaRouter, a nie klucza API Google.
Model obsługuje standardowe parametry zgodne z OpenAI: model, messages, max_tokens (do limitu 65 536 dla modelu), temperature, top_p, stop, frequency_penalty, presence_penalty oraz tools (do wywoływania funkcji). Dodatkowe parametry specyficzne dla Google (takie jak safety_settings) mogą nie być bezpośrednio udostępnione; jeśli ich potrzebujesz, sprawdź dokumentację OrcaRouter w poszukiwaniu odpowiedników. Model będzie respektować limit max_tokens. W przypadku danych multimodalnych pole type w treści (content) obsługuje: text, image_url, video_url (jeśli OrcaRouter to udostępnia), audio_url i file_url. Typ file może przyjmować pliki PDF, CSV itp. Należy pamiętać, że duże pliki multimedialne mogą wymagać wcześniejszego zakodowania jako data URI lub hostowania publicznego. OrcaRouter może również wymagać, aby plik nie przekraczał określonego rozmiaru. Zawsze sprawdzaj najnowszą dokumentację API, aby uzyskać dokładne informacje o obsługiwanych parametrach.
Aby przeprowadzić migrację od innego dostawcy API (np. Google AI Studio, Vertex AI lub innych bram) do OrcaRouter, zastąp podstawowy adres URL na https://api.orcarouter.ai/v1 i ustaw identyfikator modelu na "google/gemini-3.5-flash-lite". Jeśli Twój obecny kod używa klienta OpenAI w Pythonie, przekaż base_url i api_key. Przykład: ``` from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_ORCAROUTER_API_KEY") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) ``` Może być konieczne dostosowanie formatowania wiadomości multimodalnych jeśli Twój poprzedni dostawca używał innego schematu (np. Anthropic). OrcaRouter oczekuje formatu OpenAI. Tablice treści użytkownika mogą zawierać wiele części. Definicje narzędzi są również w stylu OpenAI. Nie ma dodatkowej opłaty za migrację; płacisz tylko za token, jak opisano.
Nie ma bezpośrednich danych porównawczych, ale możemy rozumować jakościowo. Gemini 2.0 Flash (jeśli istnieje) byłby prawdopodobnie wcześniejszą generacją modelu flash. Gemini 3.5 Flash‑Lite to nowszy, lżejszy wariant z większym oknem kontekstowym (1M wobec prawdopodobnie 128K) i niższymi cenami. Koszt za token dla Gemini 3.5 Flash‑Lite wynosi $0,30/$2,50 za milion tokenów, co jest bardzo niskie. Starsze modele flash mogą mieć wyższe koszty za token i krótsze okna kontekstowe. Jednak Gemini 2.0 Flash może mieć lepszą dokładność surową, jeśli jest to pełny model flash, a nie wariant lite. Jeśli twoje zadanie wymaga najwyższej jakości i możesz pozwolić sobie na wyższy koszt, starszy pełny model flash może być lepszy. Jeśli potrzebujesz dużego kontekstu i niskiego kosztu, 3.5 Flash‑Lite jest logicznym wyborem.
GPT-4o mini od OpenAI to podobny tani, multimodalny model. Ma okno kontekstu 128K tokenów (znacznie mniejsze niż 1M) i jest wyceniony na $0.15 za milion tokenów wejściowych i $0.60 za milion tokenów wyjściowych (stan na początek 2025; ceny mogły się zmienić). Gemini 3.5 Flash‑Lite oferuje 8x większe okno kontekstu przy 2x cenie wejściowej i 4x cenie wyjściowej. Zatem Gemini jest droższy na token, ale zapewnia znacznie większą pojemność kontekstu. W zadaniach, gdzie potrzebne jest pełne 1M kontekstu (np. przetwarzanie całych książek), Gemini Flash‑Lite jest bardziej opłacalny niż próby dzielenia wejścia na wiele wywołań GPT‑4o mini. Jeśli kontekst jest krótki, GPT‑4o mini jest tańszy i może mieć lepsze wyniki benchmarkowe. Żadne wyniki benchmarków nie są bezpośrednio porównywalne bez danych.
Nie podano porównań benchmarków. Llama 3.2 90B (zakładając, że ten model istnieje) to duży model o otwartych wagach z mniejszym oknem kontekstu (zazwyczaj 128K tokenów) i wyższym kosztem na token przy uruchomieniu przez API. Gemini 3.5 Flash‑Lite to zastrzeżony model o znacznie większym oknie kontekstu i bardzo niskiej cenie – jeden z najtańszych multimodalnych modeli dostępnych pod względem kosztu na token. Llama 3.2 90B może osiągać wyższą dokładność w wielu benchmarkach NLP ze względu na swój rozmiar, ale nie jest multimodalny i ma bardziej restrykcyjne ograniczenie kontekstu. Jeśli Twoje zadanie dotyczy tylko tekstu i potrzebujesz najwyższej dokładności, Llama 90B (jeśli dostępna przez OrcaRouter) może być lepszym wyborem. W scenariuszach multimodalnych, długiego kontekstu lub wysokiej przepustowości, Gemini Flash‑Lite ma wyraźne zalety. Wybór zależy od konkretnych wymagań Twojej aplikacji.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Wejście / 1M tokenów | $0.300 |
| Wyjście / 1M tokenów | $2.50 |
| Odczyt cache / 1M | $0.030 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
GET /api/public/models/google/gemini-3.5-flash-liteOtwórz @misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite