Gemini 3.8 Flash — это самая интеллектуальная модель Flash от Google, демонстрирующая значительные улучшения по сравнению с 3.7 Flash в области разработки программного обеспечения, агентных задач и многошаговых рассуждений.
Gemini 3.8 Flash ориентирована на команды, которым требуется модель Google с широкой поддержкой мультимодального ввода, длинным контекстным окном, большим лимитом выходных токенов и API, совместимым…
Заявленные возможности включают широкую поддержку входных данных, контекст на 1 048 576 токенов, лимит вывода на 65 536 токенов и показатель 54.9 в HLE-Verified. HLE-Verified — это бенчмарк экспертного уровня, поэтому такой результат говорит о том, что модель способна справляться с вопросами, требующими сложного воспроизведения знаний, рассуждений и вычислений. Поскольку модель принимает текст, изображения, видео, файлы и аудио, один рабочий процесс может одновременно передавать документ, аудиозапись и уточняющие инструкции. На OrcaRouter отдельный Google SDK не требуется: модель доступна как google/gemini-3.8-flash через стандартный OpenAI-совместимый API. Это удобно для пайплайнов, которые сейчас отправляют запросы chat completion. Большой лимит вывода позволяет модели генерировать полноценные отчёты, файлы кода или структурированные результаты за одну генерацию. Означает ли это, что модель поддерживает вызов инструментов, выполнение кода или структурированный вывод? В карточке каталога эти функции не указаны. Прежде чем полагаться на такие возможности, их следует проверить.
Окно контекста на 1 048 576 токенов позволяет использовать промпты, содержащие большой документ, книгу, обширный набор файлов или длинную стенограмму записи. Это снижает необходимость в разбиении на фрагменты, поиске или суммаризации в несколько шагов, когда исходный материал умещается в лимит провайдера. Также это позволяет включить исходный текст, инструкции к задаче и примеры в один вызов. Практический бюджет контекста может оказаться меньше, если вы запрашиваете очень длинный ответ, поскольку в этом описании не указано, как входные и выходные данные разделяют окно. Для максимальной надежности размещайте инструкцию там, где модель с наибольшей вероятностью отреагирует на нее, и тестируйте со своей структурой промпта. Если общий размер запроса превышает лимит провайдера, OrcaRouter вернет ошибку вышестоящего сервиса. Вызовы с длинным контекстом тарифицируются по токенам, поэтому широкий контекст не бесплатен; входные токены стоят $0.75 за 1M. Для задач, где большая часть окна нерелевантна, более короткий промпт может показать не худший результат при меньшей стоимости.
Не каждой задаче нужен контекст на 1 048 576 токенов, мультимодальный ввод или оценка 54.9 HLE-Verified. Для классификации коротких текстов, генерации заголовков, простой маршрутизации или извлечения данных низкой сложности более дешёвая модель часто может обеспечить приемлемый результат с меньшими затратами. В OrcaRouter смена идентификатора модели не меняет общий шаблон API, поэтому команды могут прототипировать на менее дорогой модели и переходить на google/gemini-3.8-flash только тогда, когда это требуется по качеству или длине. Если рабочая нагрузка использует только текст и небольшие промпты, большой контекст и поддержка мультимедиа не добавляют ценности. Если желаемый результат превышает 65 536 токенов, эта модель не сможет выдать его за одну генерацию. Структура ценообразования также важна: выходные токены стоят $3.75 за 1M, в пять раз больше входной ставки. При нагрузке с интенсивной генерацией основную часть затрат будут составлять выходные токены. В таких случаях часто экономичнее использовать более короткие генерации или менее дорогую модель для выходных данных.
HLE-Verified — это верифицированное подмножество бенчмарка Humanity's Last Exam, включающее сложные вопросы экспертного уровня, проверенные на корректность. Согласно каталогу OrcaRouter, Gemini 3.8 Flash достигает в этом бенчмарке результата 54.9. Более высокие баллы означают, что модель правильно отвечает на большую долю этих трудных вопросов. Результат выше 50 указывает, что модель обрабатывает более половины проверенных заданий HLE в рамках этой оценки. Это ориентир для сложных задач на знания, математику и рассуждения, а не полный профиль качества. Данный список не содержит других результатов бенчмарков, поэтому показатели MMLU, программирования, математики или следования инструкциям не выводятся из этого числа. Качество работы варьируется в зависимости от задачи и стиля промпта, а результаты бенчмарков могут зависеть от методологии оценки. Командам следует пропускать приватные валидационные примеры через OrcaRouter и сравнивать эту модель с другими кандидатами, а не рассматривать один агрегированный балл как единственный критерий для принятия решения.
Максимальный объем вывода в 65 536 токенов устанавливает верхнюю границу длины одного сгенерированного ответа. Это имеет значение, когда задача требует расширенного анализа, длинного документа или большого структурированного payload. Для задач с короткими ответами, таких как HLE-Verified, ограничение вывода обычно не является узким местом. При генерации контента это устраняет необходимость разделять вывод в большинстве распространенных случаев. Ограничение вывода также взаимосвязано с контекстным окном в 1 048 576 токенов, поскольку prompt, заполняющий весь контекст, в сочетании с выводом максимальной длины может превысить общий бюджет провайдера, если провайдер не разделяет лимиты ввода и вывода. В данной записи каталога это правило учета не указано. На практике задавайте max_tokens в наибольшее необходимое значение, а не всегда используйте 65 536. Большие объемы вывода тарифицируются по ставке $3.75 за 1 млн токенов, поэтому излишняя генерация повышает стоимость. Если приложению требуется более 65 536 токенов в одном ответе, данной модели самой по себе недостаточно.
Каталог OrcaRouter не публикует показатель задержки или пропускной способности для Gemini 3.8 Flash. Время ответа зависит от размера промпта, длины выходных данных, условий сети, параллелизма и нагрузки на стороне провайдера. Название Flash в линейке моделей Google обычно указывает на более отзывчивую модель, чем более крупные или более сложные продуктовые линейки, но в этом списке не указано конкретного целевого показателя скорости. Если вы обслуживаете пользовательские запросы, измеряйте сквозное время прохождения через OrcaRouter на реалистичных запросах. Короткий ответ появится быстрее, чем длинная генерация, потому что общее время генерации обычно растет с увеличением длины выходных данных. Модель ценообразования не добавляет плату за задержку в расчете на запрос; вы платите за входные и выходные токены. Чтобы сократить фактическое время выполнения, исключите ненужный контент из промпта, ограничьте max_tokens и не отправляйте большие медиафайлы, если это не требуется. На этой странице каталога не дается никаких гарантий скорости, поэтому приложения, чувствительные к производительности, следует протестировать под нагрузкой перед запуском.
В этом описании нет отдельного отчета об ограничениях. Задокументированные факты включают название модели, провайдера, контекстное окно, максимальный выход, входные модальности, цену, доступ к API и один показатель бенчмарка. В этой записи нет заявлений о поддержке вызова инструментов, выполнения кода, генерации изображений, аудиовыхода или структурированного вывода. Эти функции следует проверять реальным запросом, прежде чем полагаться на них. Результат 54.9 HLE-Verified по-прежнему означает, что модель пропускает примерно 45% проверенных задач экспертного уровня в этом бенчмарке, так что она не является идеальным механизмом рассуждений. Большое контекстное окно не гарантирует равного внимания ко всему содержимому, и в списке нет данных о галлюцинациях, предвзятости, отказах или точности в предметной области. Медиавход поддерживается, но каталог не указывает, как токенизируется каждый тип медиа и какие ограничения применяются к размеру файлов. Для критически важных для безопасности или регулируемых выходных данных создавайте собственную валидацию. Если задача выходит за пределы поддерживаемых входов или выходов, выберите модель с соответствующей записью в каталоге.
Gemini 3.8 Flash тарифицируется по ставке провайдера: $0.75 за 1 000 000 входных токенов и $3.75 за 1 000 000 выходных токенов. OrcaRouter не добавляет никакой наценки к этой ставке. Входные токены включают текст и медиаконтент, отправленные модели, хотя в данном каталоге не указана формула расчёта токенов для изображений, видео или аудио. Выходные токены покрывают текст, возвращённый моделью. Поскольку ставка для выходных токенов в пять раз выше входной, длинные ответы могут составлять основную часть счёта, даже если промпт большой. Чтобы управлять расходами, составляйте промпты, которые содержат релевантный контекст, и по возможности запрашивайте краткий ответ. В каталоге не указана плата за сессию, платформенная комиссия или фиксированная подписка. Единственные указанные расходы — это суммы за токены. Поля использования ответа, возвращаемые API, следует использовать для подтверждения количества входных и выходных токенов, оплаченных за каждый вызов.
При цене $0.75 за миллион входных токенов полный промпт из 1 048 576 токенов будет стоить около $0.79 за входные данные ещё до генерации выходных данных, исходя непосредственно из указанной цены и размера контекста. Полный выход из 65 536 токенов обойдётся примерно в $0.25 при цене $3.75 за миллион. Запрос, использующий полное входное окно и полностью исчерпывающий лимит вывода, суммарно составит около $1.04 по тарифам провайдера без какой-либо наценки. Большинство реальных запросов используют гораздо меньше, поэтому эти значения следует рассматривать как расчёт верхней границы, а не как типичный счёт. Поскольку выходные токены дороже, самое дешёвое решение — отправлять модели только тот контент, который ей действительно нужен, и запрашивать сфокусированный результат. Видео- и аудиовходные данные не имеют отдельной построчной цены в этой записи, поэтому общая стоимость медианасыщенных промптов будет зависеть от того, как провайдер токенизирует такие входные данные. Следите за расходом токенов в каждом ответе, чтобы точно оценить совокупные затраты.
OrcaRouter предлагает Gemini 3.8 Flash по тарифу провайдера с нулевой наценкой, поэтому указанные цены за токен должны соответствовать тарифу вышестоящего провайдера Google. В записи каталога не указано никакой дополнительной платы OrcaRouter за токен. Кэширование — это отдельный вопрос: в предоставленных данных о модели не указаны ни цена попадания в кэш промптов, ни скидка на кэш, ни автоматическая настройка кэширования. Не следует предполагать, что повторяющиеся идентичные префиксы будут тарифицироваться по сниженной ставке. Отсутствие указанной цены кэша означает, что наиболее безопасная модель расчета стоимости основана на полной тарификации входных токенов. Если кэширование станет доступно, оно может снизить эффективную стоимость повторяющихся промптов, но такое поведение в данной записи не гарантируется. Чтобы контролировать расходы без кэширования, держите общие блоки промпта короткими, по возможности используйте внешнее хранилище для больших статических материалов и избегайте повторной отправки дублирующего материала, если этого не требует задача.
Когда модели OrcaRouter тарифицируются по тарифу провайдера без наценки, разница в цене между моделями обусловлена тарифами их вышестоящих провайдеров. Gemini 3.8 Flash стоит $0,75 за 1 млн входных токенов и $3,75 за 1 млн выходных токенов. Будет ли другая модель дешевле, зависит от тарифа провайдера этой модели, который в данной записи не отображается. Поскольку у OrcaRouter нет платы за токены, сравнение цен прямое: достаточно сравнить столбцы тарифов провайдера. Цена — не единственный фактор. Более дешёвая модель, выдающая непригодный для использования результат, может потребовать повторных попыток, ручной проверки или дополнительных промптов и в итоге оказаться дороже модели с более высокой долей успешных ответов. Для коротких и простых задач более дешёвые модели по-прежнему имеют явное преимущество. Для сложных задач на рассуждение, мультимодальных задач или задач с длинным контекстом оценивайте суммарные затраты на каждый успешный ответ. Измеряйте как качество, так и стоимость на собственном наборе данных, прежде чем выбирать ID модели по умолчанию.
OrcaRouter предоставляет API, совместимый с OpenAI, по адресу https://api.orcarouter.ai/v1. Укажите base_url на этот адрес, а в поле model — значение google/gemini-3.8-flash. Затем модель можно вызывать через OpenAI SDK или любой клиент, поддерживающий запросы chat completion от OpenAI. Например, Python-клиент должен создать экземпляр OpenAI с base_url=https://api.orcarouter.ai/v1 и api_key, равным вашему ключу OrcaRouter, после чего вызвать chat.completions.create с model=google/gemini-3.8-flash. Ответ должен содержать поля choices и usage в стандартном формате. Это означает, что существующему коду не нужен специальный клиент для Google. Для ввода изображений, видео, файлов или аудио запрос должен использовать формат содержимого, принимаемый моделью и передаваемый через OrcaRouter; на этой странице каталога схема медиаданных не показана, поэтому сначала протестируйте небольшой запрос. Используйте идентификатор модели точно как написано, включая префикс google.
Как минимум установите модель google/gemini-3.8-flash и передайте массив messages с содержимым от пользователя. Эндпоинт совместим с OpenAI, поэтому стандартные параметры, такие как max_tokens, temperature, top_p, stop и stream, могут быть доступны в зависимости от поддержки провайдера. В записи каталога не указаны значения по умолчанию или ограничения диапазона для параметров выборки. Поскольку указанный максимальный объем вывода составляет 65 536 токенов, запросы с max_tokens выше этого значения следует рассматривать с осторожностью; вышестоящая модель может отклонить их или ограничить. Если ваша задача требует длинного ответа, задайте max_tokens явно, указав ожидаемую длину. Если достаточно короткого ответа, держите max_tokens низким, чтобы не платить за лишний вывод. Массив messages должен использовать те же роли, что и в других моделях в стиле OpenAI. Для ввода медиа добавьте медиаконтент в формате, используемом вашим API-клиентом, и убедитесь, что OrcaRouter возвращает корректное завершение, а не ошибку кодирования ввода.
Да. Поскольку OrcaRouter использует OpenAI-совместимый API, миграция обычно включает три изменения: установите базовый URL на https://api.orcarouter.ai/v1, используйте ключ API OrcaRouter и измените имя модели на google/gemini-3.8-flash. Код, читающий choices[0].message.content и usage, должен продолжать работать. Текстовые рабочие процессы должны переноситься без проблем. Мультимодальные рабочие процессы менее предсказуемы: если ваш текущий код отправляет изображения с частями контента, специфичными для OpenAI, эти поля могут приниматься или не приниматься Gemini 3.8 Flash без изменений. Запись в каталоге не содержит спецификации преобразования медиа. Перед миграцией трафика с высокой нагрузкой или интенсивным использованием медиа запустите небольшой набор одинаковых запросов к обеим конечным точкам и сравните ответы и сообщения об ошибках. Держите существующий идентификатор модели доступным в качестве запасного варианта во время миграции, поскольку поведение одной модели не гарантированно идентично поведению другой, даже при одинаковой форме API.
Эта страница каталога включает только одну модель Google, поэтому она не выводит сравнительную таблицу с другими вариантами Gemini. В системе наименований Google Flash обычно обозначает модель, предназначенную для баланса скорости и стоимости, тогда как другие уровни Gemini могут быть нацелены на более высокую производительность или иные ценовые точки. Эти утверждения не подтверждаются фактами в данной записи, поэтому окончательный выбор должен основываться на полях каталога для каждой модели. Сравните контекстное окно, максимальный выход, модальности ввода, цену и результат бенчмарка. Gemini 3.8 Flash имеет контекст в 1 048 576 токенов, максимальный выход 65 536, мультимодальный ввод и результат 54,9 HLE-Verified. Другая модель Gemini может иметь меньшее контекстное окно или другую цену, но эта информация здесь не указана. Запустите те же оценочные промпты через OrcaRouter для каждого кандидата. Это более надёжно, чем предполагать, что две модели одного поставщика ведут себя одинаково.
Для простых задач более дешёвая модель с оплатой за токен может обойтись выгоднее, чем Gemini 3.8 Flash, по стоимости. Gemini 3.8 Flash взимает $0.75 за 1 млн входных токенов и $3.75 за 1 млн выходных; другая модель с более низкой ставкой может быть привлекательной, когда выходные данные короткие, а задачи несложные. Однако цена сама по себе не определяет общую стоимость. Если более дешёвая модель перезапускается или выдаёт неудовлетворительные ответы на сложные запросы, дополнительные вызовы могут превысить экономию. Основные компенсирующие преимущества Gemini 3.8 Flash — это результат 54.9 HLE-Verified, мультимодальный ввод, большой контекст и длинный лимит выходных данных. Если ваш рабочий процесс не использует эти преимущества, более дешёвая модель является рациональным выбором. Используйте OrcaRouter для запуска обеих моделей на репрезентативной выборке и сравните точность, длину выходных данных и общие расходы на каждый успешный результат. Ограничения контекста также имеют значение, поскольку модели с меньшим окном может потребоваться дополнительный поиск или разбиение данных, что добавляет затраты на интеграцию.
Модели, специализированные на рассуждениях, обычно оптимизированы на то, чтобы тратить дополнительные вычисления на сложную логику и математику. Эта запись каталога не включает другую модель для сравнения, поэтому направление ниже носит качественный характер. Gemini 3.8 Flash имеет смысл, когда вашей рабочей нагрузке нужен длинный контекст, очень длинный вывод или ввод текста с изображениями, видео, файлами и аудио. Эти функции могут быть важнее, чем дополнительный балл в сложном тесте. Профиль Flash также предполагает вариант с более низкой задержкой, чем более тяжелая модель для рассуждений, хотя здесь не указано никаких заявлений о скорости. Если задача — сложное доказательство, анализ кода или многошаговое планирование, сравните google/gemini-3.8-flash с моделью для рассуждений на ваших собственных промптах в стиле HLE. Если вам не нужно глубокое обдумывание, модель класса Flash может позволить избежать более высоких затрат и более медленных ответов. Универсального победителя нет; решающими факторами являются размер контекста, поддержка модальностей, требуемая задержка, длина вывода и измеренное качество выполнения задач.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="google/gemini-3.8-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Ввод / 1M токенов | $0.750 |
| Вывод / 1M токенов | $3.75 |
| Чтение кэша / 1M | $0.075 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
О чём говорят разработчики на этой неделе
GET /api/public/models/google/gemini-3.8-flashОткрыть @misc{orcarouter_gemini_3_8_flash,
title = {Gemini 3.8 Flash API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.8-flash}
}Google. (2026). Gemini 3.8 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.8-flash