Gemini 3.6 Flash — это последняя быстрая и экономичная модель Google в семействе Gemini 3, изначально мультимодальная модель, которая читает текст, изображения, видео, аудио и файлы и отвечает текстом, с окном контекста в 1M токенов и до 64K выходных токенов. Она создана для команд, которым нужно качество, близкое к передовым моделям, при скорости и цене уровня Flash, и является надежным выбором для кодовых агентов, понимания документов и медиа, генерации с дополнением извлеченной информации и высокопроизводительной автоматизации. По сравнению с предыдущей версией 3.5 Flash она заметно более эффективна по токенам и менее многословна — достигает того же или лучшего качества, генерируя меньше выходных токенов, что напрямую снижает стоимость и задержку при длительных агентных запусках. Она поддерживает настраиваемые усилия при рассуждении (так что вызывающие пользователи могут регулировать глубину в зависимости от скорости на запрос), нативный вызов инструментов и структурированные выходные данные, и показывает отличные результаты в оценках длинного контекста и агентного кодирования для своего уровня, включая 91,8% при извлечении множественных иголок в среднем по 128K, а также конкурентные баллы на SWE-Bench Pro, Terminal-Bench и OSWorld. Gemini 3.6 Flash поддерживает как формат chat-completions от OpenAI, так и собственный API generateContent от Gemini, что позволяет легко обновить существующие интеграции, совместимые с Gemini и OpenAI. Используйте её как повседневную рабочую лошадку, когда вам нужно большинство функций передовой модели без оплаты передовых цен.
Google Gemini 3.6 Flash — это крупная мультимодальная модель, разработанная Google, предлагаемая через API OrcaRouter с прозрачной ценовой политикой (без наценки). Она принимает текст, изображения,…
Gemini 3.6 Flash отлично справляется с обработкой длинных контекстов (до 1 048 576 токенов) и мультимодальных входных данных. Его результат в бенчмарке GDM-MRCR v2 8-needle (128k average) составляет 91.8, что говорит о высоком качестве извлечения и понимания информации среди множества «иголок в стоге сена»: модель может точно находить нужные сведения в больших документах. Модель также поддерживает аудио- и видеовходы, что позволяет решать такие задачи, как расшифровка речи из видео, анализ диаграмм или ответы на вопросы по последовательности изображений. Название Flash подразумевает низкую задержку и экономичность, что делает модель подходящей для приложений реального времени или с большим объемом запросов. Поскольку модель предлагается через OrcaRouter по цене провайдера без наценки, общая стоимость является прозрачной и предсказуемой.
Gemini 3.6 Flash уже является оптимизированной по стоимости Flash-вариацией от Google. Однако, если ваш вариант использования не требует мультимодальных входных данных (например, только текст), меньшая текстовая модель с более коротким контекстным окном может быть дешевле и быстрее. Если ваша задача укладывается в 8K–32K токенов, такие модели, как Gemini 1.5 Flash (если доступна через OrcaRouter) или другие легковесные модели, могут быть достаточны при более низкой стоимости за токен. Кроме того, если вы никогда не используете аудио, видео или файлы, вы можете платить за возможности, которые вам не нужны. Решение должно основываться на точных модальностях ввода, требуемой длине контекста и требованиях к качеству. OrcaRouter приводит цены для каждой модели, поэтому вы можете сравнить ставки за токен и выбрать наиболее экономичный вариант.
Задачи, для которых подходит Gemini 3.6 Flash, включают: (1) извлечение из длинного контекста и ответы на вопросы по документам, превышающим 100K токенов, (2) мультимодальное рассуждение, где необходимо объединить визуальные, аудио и текстовые данные, (3) обобщение или анализ видео, (4) обработка файлов, таких как разбор PDF, электронных таблиц или презентаций, содержащих изображения и текст, и (5) приложения, чувствительные к стоимости, но все еще нуждающиеся в мультимодальных возможностях. Лимит вывода в 65,536 токенов позволяет генерировать длинные сводки, отчеты или код. Модель менее подходит для задач, требующих строгого логического вывода или математических рассуждений, которые могут потребовать варианта, отличного от Flash; такие случаи использования могут выиграть от более высокой точности, но с более высокими затратами. Оценивайте свои конкретные задачи, чтобы подтвердить качество по сравнению с альтернативами.
Через совместимый с OpenAI API OrcaRouter, Gemini 3.6 Flash поддерживает потоковую передачу ответов (с использованием параметра `stream`) и вызов функций (т.е. использование инструментов) при правильной настройке. Точная доступность этих функций зависит от базового API Google, но OrcaRouter преобразует формат запроса OpenAI в конечные точки Google. Для потоковой передачи укажите `"stream": true` в запросе. Для вызова функций определите инструменты в теле запроса, используя стандартную схему OpenAI. Вам следует протестировать эти функции с идентификатором модели `google/gemini-3.6-flash` по базовому URL OrcaRouter. Обратите внимание, что не все версии модели Gemini могут поддерживать каждую возможность; обращайтесь к документации Google для конкретной версии модели, скрытой за псевдонимом.
Предоставленный эталонный показатель составляет 91.8 по тесту GDM-MRCR v2 с 8 иглами и средней длиной контекста в 128K токенов. GDM-MRCR (Google’s Multi-Context Retrieval) v2 измеряет способность модели извлекать и рассуждать над несколькими фрагментами информации («иглами»), размещёнными в длинном контексте. Оценка 91.8 указывает на то, что модель успешно нашла и правильно ответила на запросы в среднем о 91.8% игл. Это отличный результат для модели Flash, демонстрирующий, что Gemini 3.6 Flash может надёжно извлекать факты из очень длинных документов. Бенчмарки не являются всеобъемлющими; они проверяют определённые сценарии. Производительность в реальных условиях может варьироваться в зависимости от сложности задачи извлечения, количества отвлекающих факторов и формата информации.
Данные о задержке не предоставляются для Gemini 3.6 Flash, но модели Flash обычно оптимизированы для более низкого времени вывода по сравнению с вариантами, не относящимися к Flash. Фактическое время ответа зависит от таких факторов, как длина входного контекста, количество запрошенных выходных токенов, сложность мультимодального кодирования (например, количество изображений или видеокадров) и нагрузка на сервер у провайдера. Поскольку OrcaRouter выступает в качестве шлюза, задержка включает как время кругового пути до серверов Google, так и любые накладные расходы от маршрутизации API OrcaRouter. Для приложений, требующих очень низкой задержки, вы можете протестировать с репрезентативными промптами и измерить сквозное время. В целом, модели Flash спроектированы быть быстрее, чем модели Pro, а стриминг может уменьшить воспринимаемую задержку.
Хотя Gemini 3.6 Flash хорошо показывает себя в предоставленном бенчмарке с длинным контекстом, его Flash-вариация может иметь более низкую точность в задачах на рассуждение, математику или генерацию кода по сравнению с более крупными и дорогими моделями. Точные сравнительные оценки для таких задач не предоставлены. Кроме того, лимит вывода в 65,536 токенов, хотя и щедрый, может оказаться недостаточным для генерации очень длинных документов или целых кодовых баз. Модель также может демонстрировать предвзятость или фактические ошибки, свойственные большим языковым моделям. Качество мультимодального понимания может ухудшаться при работе с большим количеством изображений или длинными видео из-за сжатия токенов. Наконец, поскольку модель доступна через OrcaRouter, любые сбои в работе Google или OrcaRouter могут повлиять на доступность. Всегда тестируйте модель на своих конкретных данных, чтобы подтвердить качество.
Gemini 3.6 Flash предоставляет контекстное окно размером 1 048 576 токенов (примерно 1 миллион токенов) для общего ввода, включая весь текстовый, графический, видео-, файловый и аудиоконтент. Максимальное количество выходных токенов в одном ответе — 65 536 токенов. Это означает, что вы можете загружать очень длинные документы, несколько изображений или длинные стенограммы и все равно получать значительный ответ. Большое контекстное окно является ключевым преимуществом, позволяя выполнять такие задачи, как суммаризация книг, анализ юридических документов и многоходовые диалоги с обширной историей. Однако использование полного контекста в 1М может привести к значительному времени обработки и затратам на токены. Учтите, что использование больших контекстов расходует входные токены по ставке $1.50 за 1М токенов, поэтому ввод в 1М будет стоить $1.50 за запрос (плюс стоимость вывода).
Цены составляют $1.50 за 1 000 000 входных токенов и $7.50 за 1 000 000 выходных токенов. OrcaRouter выставляет счета по этим тарифам точно так, как предоставлено Google, без наценки. Дополнительные платы за запрос или комиссии платформы отсутствуют. Входные токены включают все токены из сообщений пользователя (системные, пользовательские и историю ассистента), а также любой мультимодальный контент, закодированный в токены. Выходные токены учитывают только сгенерированный текст. Стоимость запроса зависит от длины ваших входных и выходных данных. Например, вход на 100 000 токенов с выходом на 1 000 токенов будет стоить $0.15 (вход) + $0.0075 (выход) = $0.1575. Для использования с большими объемами такая прозрачная ценовая политика позволяет точно прогнозировать затраты.
OrcaRouter в настоящее время не предлагает кэширования или скидок при оптовых закупках для Gemini 3.6 Flash. Ценообразование плоское — за токен по тарифу провайдера. Некоторые AI-платформы предоставляют скидки на кэширование для повторяющихся контекстов, но эта функция не упоминается для данной модели через OrcaRouter. Вы можете снизить затраты, оптимизируя длину промптов, ограничивая ненужный контекст и используя более короткие выходные токены. Если вам требуются более низкие ставки за токен, рассмотрите возможность использования меньшей модели (например, Gemini 1.5 Flash) для вашей задачи. Google может предлагать различные уровни цен для зарезервированных мощностей, но это недоступно через API OrcaRouter с оплатой по мере использования. Всегда проверяйте документацию OrcaRouter на предмет обновлений по вариантам ценообразования.
Поскольку OrcaRouter передаёт стоимость провайдера без наценки, цена за токен для Gemini 3.6 Flash через OrcaRouter должна быть идентична той, что Google взимает напрямую. Однако, используя OrcaRouter, вы получаете единый API, совместимый с OpenAI, и можете извлечь выгоду из упрощённого биллинга и интеграции. Дополнительная плата за шлюз отсутствует. Если у вас есть прямой контракт с Google Cloud, вы можете получить оптовые скидки, которые снизят цену ниже $1.50/$7.50 за 1M токенов. OrcaRouter таких скидок не предоставляет, поэтому для очень больших объёмов (>10 млрд токенов в месяц) прямая сделка может оказаться дешевле. Для большинства пользователей OrcaRouter обеспечивает паритет цен с удобством стандартного API.
Когда вы включаете изображения, видео, аудио или файлы в свой запрос, сервис преобразует их в токены, которые учитываются в вашем лимите входных токенов и оплачиваются по тарифу для входных данных ($1.50 за 1 млн токенов). Точное количество токенов, потребляемых на одно изображение или секунду аудио, не указано, но в качестве ориентира каждое изображение может потреблять от нескольких сотен до пары тысяч токенов в зависимости от разрешения (выше разрешение = больше токенов). Видео обычно обрабатываются как последовательность кадров, каждый из которых стоит токенов. Файлы, такие как PDF, извлекаются как текст и изображения, при этом изображения токенизируются соответствующим образом. Чтобы оценить затраты, следует протестировать примеры мультимодальных запросов и отслеживать использование токенов через поле `usage` в ответе API (если доступно). Минимизация визуального контента или использование версий с более низким разрешением может сократить расходы.
Чтобы использовать Gemini 3.6 Flash, отправляйте запросы к совместимому с OpenAI эндпоинту OrcaRouter. Установите базовый URL: `https://api.orcarouter.ai/v1`. В теле запроса укажите модель как `"google/gemini-3.6-flash"`. API поддерживает тот же эндпоинт для завершения чатов, что и OpenAI: `POST /chat/completions`. Вы можете использовать любой SDK OpenAI (Python, Node.js и т.д.), настроив `api_key` и `base_url`. Пример на Python: `client = OpenAI(api_key="your_orcarouter_key", base_url="https://api.orcarouter.ai/v1")`, затем `response = client.chat.completions.create(model="google/gemini-3.6-flash", messages=[...])`. Модель принимает стандартные параметры, такие как `temperature`, `max_tokens`, `stream` и `tools`.
Поддерживаемые параметры включают `messages` (массив объектов сообщений с ролями и содержимым), `max_tokens` (до 65536), `temperature`, `top_p`, последовательности `stop`, `stream` (логическое значение), `tools` (для вызова функций) и `tool_choice`. Мультимодальное содержимое может быть включено в поле `content` сообщения с использованием массива частей (например, текст, image_url, audio_data). Точный формат соответствует соглашению API OpenAI Vision. OrcaRouter переводит эти параметры в базовый API Google. Обратите внимание, что не все OCR-специфические параметры (например, `response_modalities`) могут быть доступны. За подробностями о поддерживаемых форматах изображений и аудио обратитесь к документации OrcaRouter, но в целом принимаются JPEG, PNG, GIF, MP3 и WAV. Установите `max_tokens` на желаемую длину вывода в пределах 65536.
Если ваше приложение в настоящее время вызывает API OpenAI (например, `gpt-4o`), миграция на Gemini 3.6 Flash через OrcaRouter требует изменения двух вещей: базового URL и имени модели. Обновите конфигурацию клиента: установите базовый URL `https://api.orcarouter.ai/v1` и используйте ID модели `"google/gemini-3.6-flash"`. Ваш существующий формат сообщений, включая роли system, user и assistant, должен работать без изменений. Для поддержки мультимодальности вы можете адаптировать свой код, чтобы включить URL-адреса изображений или аудио, используя структуру сообщений OpenAI vision. OrcaRouter обрабатывает трансляцию API, поэтому вам не нужно изменять структуру запроса, кроме модели и базового URL. Сначала протестируйте с небольшим количеством запросов, чтобы убедиться в ожидаемом поведении и использовании токенов.
Чтобы использовать OrcaRouter, вам нужен API-ключ, предоставленный платформой. Включите этот ключ в заголовок `Authorization` как `Bearer <your_key>`. Данные, отправляемые через OrcaRouter, передаются на серверы вывода Google; OrcaRouter не обучается на ваших данных и не хранит промпты сверх необходимого для обработки запросов (например, ведение журнала для выставления счетов). Политики обработки данных Google применяются к поставщику модели. OrcaRouter не добавляет никакого дополнительного хранения данных сверх стандартных журналов запросов. Для конфиденциальной информации ознакомьтесь с политикой конфиденциальности OrcaRouter и условиями использования данных Gemini от Google. Поскольку API совместим с OpenAI, вы можете реализовать стандартные меры безопасности, такие как шифрование при передаче (HTTPS) и ротация ключей.
Обе модели поддерживают мультимодальные входные данные (текст, изображения, аудио) и предлагают большие контекстные окна. GPT-4o имеет стандартные 128K контекста (расширяемые до 256K), в то время как Gemini 3.6 Flash предлагает 1 048 576 токенов (1M). Цены различаются: GPT-4o стоит $2.50 за 1M ввода и $10 за 1M вывода (на момент написания), против $1.50/$7.50 у Gemini 3.6 Flash. Результаты бенчмарков не подлежат прямому сравнению из-за разных тестов, но показатель 91.8 у Gemini 3.6 Flash в конкретном бенчмарке на извлечение информации свидетельствует о высокой производительности. GPT-4o может превосходить в выполнении инструкций и рассуждениях во многих задачах, тогда как Gemini 3.6 Flash выделяется в обработке длинного контекста и экономической эффективности. Выбор зависит от того, что для вас важнее: длина контекста, стоимость или точность в конкретном сценарии использования.
Claude 3.5 Sonnet (контекст 200K) имеет более короткое окно контекста, чем 1M токенов у Gemini 3.6 Flash. Ценообразование за токен: Claude 3.5 Sonnet стоит $3.00 за 1M входных и $15.00 за 1M выходных токенов, что выше, чем $1.50/$7.50 у Gemini. Claude может иметь преимущества в нюансированных рассуждениях и соблюдении безопасности, в то время как Gemini Flash ориентирован на мультимодальную универсальность и извлечение из длинного контекста. Поддержка Gemini видео- и аудиовходов дает ему преимущество в задачах, связанных с этими модальностями. Однако выходные данные Claude обычно длиннее (до 8192 токенов против 65K у Gemini). Для задач, требующих очень длинных выходных данных (например, генерация целых отчетов), Gemini 3.6 Flash может быть более подходящим. Сравнительные бенчмарки на стандартных наборах данных не предоставлены, поэтому рекомендуется эмпирическое тестирование.
Выбирайте Gemini 3.6 Flash, если ваши основные требования: (a) контекстное окно больше 128K токенов (до 1M), (b) необходимость обрабатывать аудио, видео или файловые входные данные, и (c) низкая стоимость за токен среди мультимодальных моделей. Эта модель особенно хороша для поиска по длинным документам (о чем свидетельствует ее оценка 91.8 по бенчмарку). Если ваша задача чисто текстовая и укладывается в 128K токенов, такие модели, как GPT-4o mini или Claude 3 Haiku, могут быть дешевле. Если вам нужна максимальная точность рассуждений и бюджет позволяет, модель Pro (например, Gemini 3.6 Pro, если доступна через OrcaRouter) может быть лучше, несмотря на более высокую стоимость. Используйте данные бенчмарков и сравнение цен на OrcaRouter для принятия решения.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.6-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Ввод / 1M токенов | $1.50 |
| Вывод / 1M токенов | $7.50 |
| Чтение кэша / 1M | $0.150 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
GET /api/public/models/google/gemini-3.6-flashОткрыть @misc{orcarouter_gemini_3_6_flash,
title = {Gemini 3.6 Flash API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.6-flash}
}Google. (2026). Gemini 3.6 Flash API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.6-flash