Gemini 3.8 Flash to najbardziej inteligentny model Flash firmy Google, oferujący znaczące ulepszenia względem 3.7 Flash w zakresie inżynierii oprogramowania, zadań agentowych i wieloetapowego rozumowania.
Gemini 3.8 Flash jest skierowany do zespołów, które potrzebują modelu Google z szerokim wejściem multimodalnym, długim oknem kontekstu, dużym limitem tokenów wyjściowych oraz API zgodnym ze…
Deklarowane możliwości obejmują szerokie wsparcie danych wejściowych, kontekst o długości 1 048 576 tokenów, limit wyjścia wynoszący 65 536 tokenów oraz wynik 54,9 w HLE-Verified. HLE-Verified to benchmark na poziomie eksperckim, więc wynik sugeruje, że model potrafi obsługiwać pytania wymagające trudnego przywoływania wiedzy, rozumowania i obliczeń. Ponieważ akceptuje tekst, obraz, wideo, pliki i audio, jeden przepływ pracy może przekazać dokument, nagranie i dodatkowe instrukcje razem. W OrcaRouter nie jest potrzebny osobny pakiet SDK Google: model jest udostępniany jako google/gemini-3.8-flash za pośrednictwem standardowego API zgodnego z OpenAI. To wygodne dla potoków, które obecnie wysyłają żądania czatu. Wysoki maksymalny limit wyjścia sprawia, że model jest w stanie wygenerować pełne raporty, pliki kodu lub ustrukturyzowane dane jako pojedynczą generację. Czy to oznacza, że model obsługuje wywoływanie narzędzi, wykonywanie kodu lub ustrukturyzowane dane wyjściowe? Rekord katalogu nie wymienia tych funkcji. Każdą taką możliwość należy przetestować, zanim na niej polegniesz.
Okno kontekstowe o pojemności 1 048 576 tokenów umożliwia tworzenie promptów zawierających duży dokument, książkę, obszerny zestaw plików lub długi zapis transkrypcji. Zmniejsza to potrzebę dzielenia na fragmenty, wyszukiwania lub wieloetapowego streszczania, gdy materiał źródłowy mieści się w limicie dostawcy. Umożliwia również uwzględnienie tekstu źródłowego, instrukcji zadania i przykładów w jednym wywołaniu. Praktyczny budżet kontekstu może być mniejszy, jeśli żądasz bardzo długiej odpowiedzi, ponieważ niniejsze zestawienie nie określa, w jaki sposób dane wejściowe i wyjściowe współdzielą okno. Aby zapewnić maksymalną niezawodność, umieść instrukcję w miejscu, w którym model najprawdopodobniej na nią zareaguje, i przetestuj własny układ promptu. Jeśli łączne żądanie przekroczy limit dostawcy, OrcaRouter zwróci błąd nadrzędny. Wywołania z długim kontekstem są rozliczane za token, więc szeroki kontekst nie jest darmowy; tokeny wejściowe są naliczane w cenie 0,75 USD za 1 mln. W przypadku zadań, w których większość okna jest nieistotna, krótszy prompt może działać równie dobrze przy niższych kosztach.
Nie każde zadanie wymaga kontekstu o długości 1,048,576 tokenów, wejścia multimodalnego ani wyniku 54.9 HLE-Verified. W przypadku klasyfikacji krótkich tekstów, generowania tytułów, prostego routowania lub ekstrakcji o niskiej złożoności tańszy model często może zapewnić akceptowalne wyniki przy niższych kosztach. W OrcaRouter zmiana identyfikatorów modeli nie zmienia ogólnego wzorca API, więc zespoły mogą prototypować na tańszym modelu i przechodzić na google/gemini-3.8-flash tylko wtedy, gdy wymaga tego jakość lub długość odpowiedzi. Jeśli obciążenie wykorzystuje wyłącznie tekst i małe prompty, duży kontekst i obsługa multimediów nie wnoszą żadnej wartości. Jeśli pożądane wyjście przekracza 65,536 tokenów, ten model nie może go wygenerować w jednej odpowiedzi. Struktura cenowa również ma znaczenie: tokeny wyjściowe kosztują $3.75 za 1M, czyli pięć razy więcej niż stawka za tokeny wejściowe. Obciążenie intensywnie generujące będzie zdominowane przez koszt wyjścia. W takich przypadkach krótsze generacje lub tańszy model wyjściowy są często bardziej ekonomiczne.
HLE-Verified to zweryfikowany podzbiór benchmarku Humanity's Last Exam, który zawiera trudne, eksperckie pytania sprawdzone pod kątem poprawności. Gemini 3.8 Flash osiąga 54,9 w tym benchmarku według katalogu OrcaRouter. Wyższe wyniki oznaczają, że model poprawnie odpowiada na większą część tych trudnych pozycji. Wynik powyżej 50 oznacza, że model radzi sobie z ponad połową zweryfikowanych pozycji HLE w tej ewaluacji. Jest to punkt odniesienia dla trudnych zadań z wiedzy, matematyki i rozumowania, a nie pełny profil jakości. To zestawienie nie podaje innych wyników benchmarków, więc wydajność w MMLU, kodowaniu, matematyce czy podążaniu za instrukcjami nie wynika z tej liczby. Jakość produkcyjna różni się w zależności od zadania i stylu promptu, a na wyniki benchmarków może wpływać metodologia ewaluacji. Zespoły powinny uruchamiać prywatne przykłady walidacyjne przez OrcaRouter i porównywać ten model z innymi kandydatami, zamiast traktować jeden zagregowany wynik jako jedyne kryterium decyzyjne.
Maksymalny limit wyjścia wynoszący 65 536 tokenów wyznacza górną granicę długości pojedynczej wygenerowanej odpowiedzi. Ma to znaczenie, gdy zadanie wymaga pogłębionej analizy, długiego dokumentu lub dużego ustrukturyzowanego payloadu. W przypadku zadań benchmarkowych z krótkimi odpowiedziami, takich jak HLE-Verified, limit wyjścia zwykle nie jest wąskim gardłem. W przypadku generowania treści limit ten eliminuje potrzebę dzielenia wyjścia w większości typowych przypadków. Limit wyjścia powiązany jest też z oknem kontekstowym o pojemności 1 048 576 tokenów, ponieważ prompt wypełniający cały kontekst wraz z wyjściem o maksymalnej długości może przekroczyć łączny limit dostawcy, chyba że dostawca rozlicza osobno limity wejścia i wyjścia. Ten wpis w katalogu nie określa tej zasady rozliczania. W praktyce należy ustawiać max_tokens na największą potrzebną wartość, zamiast zawsze używać 65 536. Długie wyjścia rozliczane są w cenie 3,75 USD za 1 mln tokenów, dlatego zbędne generowanie podnosi koszty. Jeśli aplikacja potrzebuje więcej niż 65 536 tokenów w jednej odpowiedzi, sam ten model nie wystarczy.
Katalog OrcaRouter nie publikuje wartości opóźnienia ani przepustowości dla Gemini 3.8 Flash. Czas odpowiedzi zależy od rozmiaru promptu, długości wyniku, warunków sieciowych, współbieżności oraz obciążenia po stronie dostawcy. Nazwa Flash w linii modeli Google zwykle sygnalizuje model bardziej responsywny niż większe lub głębsze linie produktowe, ale w tym zestawieniu nie pojawia się konkretny cel szybkości. Jeśli obsługujesz żądania skierowane do użytkowników, zmierz czas end-to-end przez OrcaRouter z realistycznymi ładunkami. Krótka odpowiedź pojawi się szybciej niż długa generacja, ponieważ całkowity czas generacji zwykle rośnie wraz z długością wyniku. Model cenowy nie dolicza opłaty za opóźnienie na żądanie; płacisz za tokeny wejściowe i wyjściowe. Aby skrócić czas rzeczywisty, trzymaj niepotrzebne treści poza promptem, ogranicz max_tokens i unikaj wysyłania dużych multimediów, gdy nie są wymagane. Na tej stronie katalogu nie ma gwarancji szybkości, więc aplikacje wrażliwe na wydajność powinny zostać przetestowane pod obciążeniem przed uruchomieniem.
Ten wpis nie zawiera osobnego raportu dotyczącego ograniczeń. Udokumentowane fakty to nazwa modelu, dostawca, okno kontekstu, maksymalna długość odpowiedzi, modalności wejściowe, cena, dostęp przez API oraz jeden wynik benchmarku. W tym rekordzie nie ma deklaracji wsparcia dla wywoływania narzędzi, wykonywania kodu, generowania obrazów, wyjścia audio ani wyjścia strukturalnego. Te funkcje należy zweryfikować za pomocą rzeczywistego żądania, zanim się na nich oprzesz. Wynik 54.9 HLE-Verified nadal oznacza, że model nie rozwiązuje około 45% zweryfikowanych pozycji na poziomie eksperckim w tym benchmarku, więc nie jest idealnym silnikiem rozumowania. Duże okno kontekstu nie gwarantuje równej uwagi dla całej treści, a w zestawieniu nie podano żadnych danych dotyczących halucynacji, stronniczości, odmów ani dokładności dziedzinowej. Wejście multimedialne jest obsługiwane, ale katalog nie określa, w jaki sposób tokenizowany jest każdy typ multimediów ani jakie limity dotyczą rozmiaru plików. W przypadku wyników krytycznych dla bezpieczeństwa lub regulowanych zbuduj własną walidację. Jeśli zadanie wykracza poza obsługiwane wejścia lub wyjścia, wybierz model z pasującym wpisem w katalogu.
Gemini 3.8 Flash jest rozliczany według stawki dostawcy: 0,75 USD za 1 000 000 tokenów wejściowych i 3,75 USD za 1 000 000 tokenów wyjściowych. OrcaRouter nie dodaje żadnej marży do tej stawki. Tokeny wejściowe obejmują tekst oraz treści multimedialne przesłane do modelu, choć katalog nie podaje wzoru na liczbę tokenów przypadających na obraz, wideo czy audio. Tokeny wyjściowe obejmują tekst zwrócony przez model. Ponieważ stawka za tokeny wyjściowe jest pięciokrotnie wyższa od stawki za tokeny wejściowe, długie odpowiedzi mogą zdominować rachunek nawet przy obszernym promptcie. Aby zarządzać kosztami, pisz prompty zapewniające odpowiedni kontekst i, gdy to możliwe, proś o zwięzłą odpowiedź. Katalog nie wymienia żadnych opłat za sesję, opłat platformowych ani stałych opłat abonamentowych. Jedynymi określonymi opłatami są kwoty za token. Pola użycia (usage) zwracane przez API w odpowiedzi należy wykorzystać do potwierdzenia liczby tokenów wejściowych i wyjściowych rozliczonych za każde wywołanie.
Przy cenie 0,75 USD za milion tokenów wejściowych pełny prompt o długości 1 048 576 tokenów kosztowałby około 0,79 USD za samo wejście, zanim wygenerowane zostanie wyjście — wynika to wprost z podanej ceny i rozmiaru kontekstu. Pełne wyjście o długości 65 536 tokenów kosztowałoby około 0,25 USD przy stawce 3,75 USD za milion. Żądanie wykorzystujące pełne okno wejściowe i pełny limit wyjścia kosztowałoby łącznie około 1,04 USD według stawek dostawcy, bez żadnej marży. Większość rzeczywistych żądań zużywa znacznie mniej, więc wartości te należy traktować jako górną granicę szacunków, a nie typowy rachunek. Ponieważ tokeny wyjściowe są droższe, najtańszym rozwiązaniem jest wysyłanie modelowi wyłącznie treści, których potrzebuje, i proszenie o konkretny wynik. Wejścia wideo i audio nie mają w tym zestawieniu osobno wyszczególnionej ceny, więc łączny koszt promptów zawierających multimedia będzie zależał od tego, jak dostawca tokenizuje te dane wejściowe. Monitoruj zużycie raportowane w każdej odpowiedzi, aby dokładnie oszacować łączne wydatki.
OrcaRouter oferuje Gemini 3.8 Flash po stawce dostawcy, z zerową marżą, więc wyświetlane ceny za token powinny odpowiadać stawce nadrzędnego dostawcy Google. W rekordzie katalogu nie ma żadnej dodatkowej opłaty OrcaRouter za token. Buforowanie to osobna kwestia: w dostarczonych informacjach o modelu nie uwzględniono ceny trafienia w pamięć podręczną promptów, zniżki za buforowanie ani automatycznego ustawienia buforowania. Nie należy zakładać, że powtarzające się identyczne prefiksy będą rozliczane według niższej stawki. Brak podanej ceny buforowania oznacza, że najbezpieczniejszy model kosztów opiera się na pełnym rozliczaniu tokenów wejściowych. Jeśli buforowanie stanie się dostępne, może obniżyć efektywny koszt powtarzanych promptów, ale nie jest to gwarantowane w tym wpisie. Aby kontrolować koszty bez buforowania, utrzymuj krótkie współdzielone bloki promptów, korzystaj z zewnętrznej pamięci do dużych treści statycznych tam, gdzie to możliwe, i unikaj ponownego wysyłania zduplikowanych materiałów, chyba że wymaga tego zadanie.
Gdy modele OrcaRouter są rozliczane według stawki dostawcy z zerową marżą, różnica cen między modelami wynika z ich stawek upstream. Gemini 3.8 Flash kosztuje 0,75 USD za 1 mln tokenów wejściowych i 3,75 USD za 1 mln tokenów wyjściowych. To, czy inny model jest tańszy, zależy od stawki dostawcy tego modelu, której nie wyświetlono w tym wpisie. Ponieważ OrcaRouter nie pobiera opłaty za token, porównywanie cen jest bezpośrednie: wystarczy porównać kolumny stawek dostawcy. Cena to nie jedyny czynnik. Tańszy model, który generuje bezużyteczne wyniki, może wymagać ponownych prób, przeglądu przez człowieka lub dodatkowych podpowiedzi, przez co może ostatecznie okazać się droższy niż model o wyższym wskaźniku skuteczności. W przypadku krótkich i prostych zadań modele o niższych kosztach nadal mają wyraźną przewagę. W przypadku zadań wymagających trudnego rozumowania albo pracy multimodalnej lub z długim kontekstem należy ocenić łączny koszt przypadający na jedną udaną odpowiedź. Zmierz zarówno jakość, jak i koszt na własnym zbiorze danych przed wyborem domyślnego identyfikatora modelu.
OrcaRouter udostępnia API zgodne z OpenAI pod adresem https://api.orcarouter.ai/v1. Ustaw base_url na ten adres, a pole model na google/gemini-3.8-flash. SDK OpenAI lub dowolny klient obsługujący żądania chat completion OpenAI może następnie wywołać model. Na przykład klient w Pythonie utworzyłby instancję OpenAI z parametrami base_url=https://api.orcarouter.ai/v1 i api_key ustawionym na Twój klucz OrcaRouter, a następnie wywołałby metodę chat.completions.create z parametrem model=google/gemini-3.8-flash. Odpowiedź powinna zawierać pola choices i usage w standardowym stylu. Oznacza to, że istniejący kod nie wymaga klienta specyficznego dla Google. W przypadku danych wejściowych w postaci obrazu, wideo, pliku lub audio żądanie musi używać formatu treści akceptowanego przez model i przekazywanego przez OrcaRouter; ta strona katalogu nie pokazuje schematu multimediów, więc najpierw przetestuj niewielkie żądanie. Użyj identyfikatora modelu dokładnie tak, jak zapisano, łącznie z przedrostkiem google.
Co najmniej ustaw model na google/gemini-3.8-flash i podaj tablicę messages z treścią użytkownika. Endpoint jest zgodny z OpenAI, więc standardowe parametry, takie jak max_tokens, temperature, top_p, stop i stream, mogą być dostępne, w zależności od wsparcia dostawcy. Wpis w katalogu nie podaje wartości domyślnych ani ograniczeń zakresów dla parametrów próbkowania. Ponieważ podany maksymalny wynik to 65 536 tokenów, żądania ustawiające max_tokens na wartość wyższą należy traktować ostrożnie; model nadrzędny może je odrzucić lub obciąć. Jeśli Twoje zadanie wymaga długiej odpowiedzi, ustaw max_tokens jawnie na oczekiwaną długość. Jeśli krótka odpowiedź wystarczy, utrzymuj max_tokens na niskim poziomie, aby uniknąć płacenia za zbędne wyjście. Tablica messages powinna używać tych samych ról, których używa się w innych modelach w stylu OpenAI. W przypadku danych multimedialnych dodaj treść multimediów w formacie używanym przez Twojego klienta API i sprawdź, czy OrcaRouter zwraca prawidłowe uzupełnienie, a nie błąd kodowania wejścia.
Tak. Ponieważ OrcaRouter korzysta z API zgodnego z OpenAI, migracja zwykle wymaga trzech zmian: ustaw adres bazowy URL na https://api.orcarouter.ai/v1, użyj klucza API OrcaRouter i zmień nazwę modelu na google/gemini-3.8-flash. Kod odczytujący choices[0].message.content oraz usage powinien nadal działać. Przepływy pracy wyłącznie tekstowe powinny migrować bezproblemowo. Przepływy multimodalne są mniej pewne: jeśli Twój obecny kod wysyła obrazy z częściami treści specyficznymi dla OpenAI, te pola mogą, ale nie muszą, zostać zaakceptowane dokładnie tak, jak są, przez Gemini 3.8 Flash. Wpis w katalogu nie zawiera specyfikacji konwersji multimediów. Przed migracją ruchu o dużej objętości lub silnie obciążonego mediami uruchom mały zestaw identycznych żądań wobec obu punktów końcowych i porównaj odpowiedzi oraz komunikaty błędów. Zachowaj swój obecny identyfikator modelu jako rozwiązanie zapasowe podczas migracji, ponieważ zachowanie jednego modelu nie jest gwarantowane jako identyczne z zachowaniem innego, nawet przy tej samej strukturze API.
Ta strona katalogu zawiera tylko jeden model Google, więc nie wyświetla tabeli porównawczej z innymi wariantami Gemini. W nazewnictwie Google Flash zwykle oznacza model przeznaczony do zachowania równowagi między szybkością a kosztem, podczas gdy inne poziomy Gemini mogą stawiać na wyższe możliwości lub inne punkty cenowe. Te twierdzenia nie są poparte faktami zawartymi w tym wpisie, więc ostateczny wybór powinien opierać się na polach katalogowych poszczególnych modeli. Porównaj okno kontekstu, maksymalną długość wyjścia, modalności wejścia, cenę i wynik benchmarku. Gemini 3.8 Flash ma kontekst o długości 1 048 576 tokenów, maksymalną długość wyjścia 65 536 tokenów, wejście multimodalne oraz wynik 54,9 w HLE-Verified. Inny model Gemini może mieć mniejsze okno kontekstu lub inną cenę, ale te informacje nie są tutaj podane. Uruchom te same prompty ewaluacyjne przez OrcaRouter dla każdego kandydata. To bardziej wiarygodne niż zakładanie, że dwa modele od tego samego dostawcy mają identyczne zachowanie.
W przypadku prostych zadań tańszy model rozliczany za token może pokonać Gemini 3.8 Flash pod względem kosztów. Gemini 3.8 Flash kosztuje $0.75 za 1M tokenów wejściowych i $3.75 za 1M tokenów wyjściowych; inny model z niższą stawką może być atrakcyjny, gdy odpowiedzi są krótkie, a zadania proste. Jednak sama cena nie przesądza o całkowitym koszcie. Jeśli tańszy model restartuje się lub udziela słabych odpowiedzi na złożone zapytania, dodatkowe wywołania mogą przewyższyć oszczędności. Główne atuty Gemini 3.8 Flash, które równoważą koszty, to wynik 54.9 HLE-Verified, obsługa danych multimodalnych, duży kontekst i długi limit odpowiedzi. Jeśli Twoje zadania nie wykorzystują tych atutów, tańszy model jest racjonalnym wyborem. Użyj OrcaRouter, aby uruchomić oba modele na reprezentatywnej próbce i porównać dokładność, długość odpowiedzi oraz całkowity koszt na pomyślny wynik. Limity kontekstu również mają znaczenie, ponieważ model z mniejszym oknem kontekstowym może wymagać dodatkowego wyszukiwania lub dzielenia treści, co zwiększa koszt integracji.
Modele wyspecjalizowane w rozumowaniu są zwykle optymalizowane pod kątem poświęcania dodatkowych obliczeń na trudną logikę i matematykę. Ten wpis w katalogu nie zawiera innego modelu do porównania, więc poniższy kierunek ma charakter jakościowy. Gemini 3.8 Flash ma sens, gdy Twoje obciążenie wymaga długiego kontekstu, bardzo długiego wyjścia lub wejścia w postaci tekstu, obrazu, wideo, pliku i audio. Te funkcje mogą być ważniejsze niż dodatkowy punkt w trudnym benchmarku. Profil Flash sugeruje również opcję o niższym opóźnieniu niż cięższy model rozumujący, chociaż nie podano tu żadnych deklaracji dotyczących szybkości. Jeśli zadanie to trudny dowód, analiza kodu lub pytanie wymagające wieloetapowego planowania, porównaj google/gemini-3.8-flash z modelem rozumującym na własnych promptach w stylu HLE. Jeśli nie potrzebujesz głębokiego namysłu, model klasy Flash może pozwolić uniknąć wyższych kosztów i wolniejszych odpowiedzi. Nie ma uniwersalnego zwycięzcy; czynnikami decydującymi są rozmiar kontekstu, obsługa modalności, wymagane opóźnienie, długość wyjścia i zmierzona jakość wykonywania zadań.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-3.8-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Wejście / 1M tokenów | $0.750 |
| Wyjście / 1M tokenów | $3.75 |
| Odczyt cache / 1M | $0.075 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
O czym mówią programiści w tym tygodniu
GET /api/public/models/google/gemini-3.8-flashOtwórz @misc{orcarouter_gemini_3_8_flash,
title = {Gemini 3.8 Flash API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.8-flash}
}Google. (2026). Gemini 3.8 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.8-flash