Gemini 3.5 Flash-Lite — это самая экономичная модель Gemini от Google, специально созданная для рабочих нагрузок с очень большим объемом и чувствительных к задержкам, где доминирует стоимость за вызов. Несмотря на свою цену, она является нативно мультимодальной — принимает текст, изображения, видео, аудио и файлы с выводом текста — и имеет такое же окно контекста на 1M токенов и до 64K выходных токенов, как и более крупный уровень Flash, так что длинные документы и смешанные медиа-входные данные остаются доступными. Примерно за пятую часть цены 3.6 Flash, это правильный инструмент для классификации, извлечения, маршрутизации, суммаризации, легковесных агентов, генерации синтетических данных и любых конвейеров, выполняемых миллионы раз. Он по-прежнему поддерживает настраиваемые усилия по рассуждению, встроенный вызов инструментов и структурированные выходные данные, и превосходит свои возможности в агентских и длинно-контекстных бенчмарках для облегченной модели — например, 74.0% на OSWorld-Verified и 72.2% на извлечении 128k multi-needle, уверенно опережая предыдущую 3.1 Flash-Lite. Он поддерживает как формат чат-завершений OpenAI, так и собственный API generateContent от Gemini, поэтому вы можете смешивать его с более тяжелыми моделями в рамках одной интеграции — направляя легкий трафик большого объема на Flash-Lite и передавая сложные задачи на 3.6 Flash или модель Pro.
Google Gemini 3.5 Flash-Lite — это мультимодальная языковая модель, разработанная Google и предлагаемая через совместимый с OpenAI API сервиса OrcaRouter. Она принимает текстовые, графические,…
Gemini 3.5 Flash-Lite способен выполнять широкий круг задач благодаря поддержке мультимодального ввода и использованию инструментов. Он справляется с текстовыми задачами, такими как суммаризация, ответы на вопросы и генерация кода. С изображениями он может описывать сцены, извлекать текст из документов или интерпретировать диаграммы. Видеовходы позволяют распознавать действия, создавать подписи и выполнять временные рассуждения. Аудиовходы обеспечивают транскрипцию, определение языка и анализ речи. Модель также поддерживает вызов инструментов, о чем свидетельствует ее оценка CharXiv Reasoning 76.5 (с инструментами). Это означает, что его можно интегрировать в агентные рабочие процессы, где он вызывает внешние API или базы данных. Однако он не предназначен для творческого письма, высокоабстрактных рассуждений или задач, требующих глубоких знаний в предметной области. Его сила заключается в скорости, стоимости и широте поддержки модальностей, а не в сырой производительности.
Следует выбирать Gemini 3.5 Flash-Lite, когда стоимость и пропускная способность являются основными приоритетами, а задача соответствует его возможностям. Эта модель отлично подходит для высокообъёмных конвейеров, таких как индексация тысяч документов, транскрибирование часов аудио или выполнение классификации в реальном времени на потоках изображений. Большое контекстное окно (1 млн токенов) делает её идеальной для задач, требующих глобального понимания длинных входных данных, например, анализа судебных дел или рефакторинга кодовой базы. Более крупные модели (например, Gemini 3.5 Pro) могут достигать более высокой точности на сложных тестах, но имеют значительно более высокую стоимость за токен и меньшую пропускную способность. Если ваше приложение может мириться с незначительными компромиссами по качеству ради снижения стоимости в 10–100 раз, эта модель — хороший выбор. И наоборот, для задач, требующих фактической точности, творческой генерации или самых современных рассуждений, рекомендуется более крупная модель.
Да, модель изначально поддерживает видео- и аудиовходы наряду с текстом, изображениями и файлами. Видеовход может быть предоставлен в виде последовательности кадров или видеофайла; модель обрабатывает визуальные кадры и любую связанную аудиодорожку. Аудиовход работает с распространенными форматами, такими как WAV, MP3 или FLAC. Большое контекстное окно позволяет обрабатывать длинные записи в одном запросе – например, стенограмма часового аудио с высокой детализацией может потребовать около 10 000 токенов. Это полезно для суммаризации встреч, анализа подкастов или голосовой поддержки клиентов. Обратите внимание, что модель не генерирует аудио- или видеовыход; ответы всегда текстовые. Качество мультимодального понимания соответствует уровню flash‑lite модели: достаточно для извлечения и классификации, но может упускать тонкие детали по сравнению с более крупными мультимодальными моделями.
Gemini 3.5 Flash-Lite поддерживает вызов инструментов (tool calling), о чём свидетельствуют его бенчмарк-показатели в CharXiv Reasoning with tools (оценка 76.5). Это означает, что вы можете определять функции или API, которые модель может вызывать во время генерации ответа. Типичные случаи использования включают запросы к базам данных, веб-поиск или арифметические операции. Модель решает, когда вызывать инструмент, на основе инструкции пользователя и контекста. Использование инструментов может повысить фактическую точность и обеспечить сложные многошаговые рассуждения. Однако, поскольку модель является вариантом flash‑lite, её надёжность вызова инструментов может быть ниже, чем у более крупной специализированной модели. Если ваше приложение сильно зависит от безупречной оркестрации инструментов, вам может потребоваться добавить слои валидации или резервную логику. OrcaRouter передаёт определения инструментов в том же формате, что и API OpenAI, что упрощает интеграцию.
Модель достигла результата 76.5 в тесте CharXiv Reasoning при оценке с использованием инструментов. CharXiv проверяет способность выполнять рассуждения на основе визуальных данных в виде диаграмм, требуя от модели интерпретировать изображение диаграммы и отвечать на вопросы о ней. Условие «с инструментами» означает, что модель могла вызывать внешние функции (например, калькулятор) для помощи. Эта оценка указывает на среднюю производительность — модель способна к рассуждениям, связанным с диаграммами, но не на уровне специализированных моделей. Другие результаты тестов для этой модели не предоставлены. Для сравнения, более крупные модели, такие как Gemini 3.5 Pro, вероятно, показали бы более высокие результаты в этой задаче. Это значение полезно как ориентир: можно ожидать разумной интерпретации диаграмм, но следует тщательно тестировать, если ваше приложение требует высокой точности в задачах визуального анализа.
Предоставлен только показатель CharXiv Reasoning (с инструментами): 76.5. Никаких дополнительных данных бенчмарков – таких как MMLU, HumanEval или оценки извлечения длинного контекста – для Gemini 3.5 Flash‑Lite в предоставленной информации нет. Это означает, что для обобщения его производительности на другие задачи требуется эмпирическое тестирование на ваших собственных данных. Учитывая flash‑lite природу модели, ожидается, что она будет показывать более низкие результаты, чем полноразмерные модели, на большинстве стандартизированных бенчмарков. Однако её эффективность и низкая стоимость часто перевешивают эти недостатки в производственных условиях. Если вам нужна проверенная производительность на конкретном бенчмарке (например, генерация кода или многоязычное понимание), вам следует провести собственную оценку. OrcaRouter не размещает отдельные результаты бенчмарков; указанные здесь цифры получены непосредственно от провайдера.
Детали задержки не указаны в предоставленных данных. Как правило, модели flash‑lite рассчитаны на низкую задержку по сравнению с их более крупными аналогами, но фактическое время ответа зависит от многих факторов: длины входных и выходных данных, одновременной нагрузки запросов и используемого оборудования. При контекстном окне в 1 млн токенов обработка очень длинных запросов может существенно увеличить задержку из-за квадратичного масштабирования внимания. Для коротких входных данных (например, несколько сотен токенов) можно ожидать время ответа менее секунды. Для входных данных, близких к лимиту в 1 млн токенов, задержка может достигать десятков секунд. OrcaRouter не гарантирует конкретных SLA по задержке для этой модели. Если низкая задержка критична, рассмотрите использование меньшего контекста (например, через усечение) или выделенной конечной точки. Вы можете отслеживать время ответа через панель управления OrcaRouter.
Gemini 3.5 Flash-Lite не предназначена для обеспечения самой современной точности. Ее сильные стороны — скорость, стоимость и большой контекст. Ограничения включают более низкую производительность на тестах сложных рассуждений, сниженное воспроизведение фактов по сравнению с более крупными моделями и склонность к «галлюцинациям» на неоднозначных входных данных. Модель может испытывать трудности с задачами, требующими глубокой экспертизы в предметной области (например, юридические рассуждения, медицинская диагностика) или тонкой творческой работы. Возможность использования инструментов, хотя и функциональна, может быть не такой надежной, как у специализированной агентной модели. Кроме того, поскольку предоставлен только один показатель теста (CharXiv Reasoning 76.5 с инструментами), нельзя предполагать хорошую производительность в других областях без тестирования. Для критически важных приложений всегда проводите тестирование на своих собственных данных и при низкой уверенности рассмотрите возможность использования более мощной модели в качестве резервной.
Цена составляет $0.30 за 1 миллион входных токенов и $2.50 за 1 миллион выходных токенов. Эти тарифы — это ставки провайдера, выставляемые без какой-либо наценки со стороны OrcaRouter. Входные токены включают все токены в промпте (текст, токены изображений, видеокадры, аудиосэмплы, содержимое файлов) независимо от модальности. Выходные токены — это сгенерированные текстовые токены. Для типичного запроса с длинным контекстом, потребляющего 100,000 входных токенов и 1,000 выходных токенов, стоимость составит примерно ($0.30 * 0.1) + ($2.50 * 0.001) = $0.030 + $0.0025 = $0.0325 за запрос. В масштабе эта модель может обрабатывать миллионы запросов за несколько сотен долларов. Сравните это с более крупными моделями, которые часто стоят в 10‑50 раз больше за токен. Низкая цена выходных токенов особенно выгодна для приложений, генерирующих длинные ответы (например, сводки полных документов).
Предоставленная информация не указывает ни механизма кэширования, ни льготного тарифа для кэшированных токенов. Поэтому следует исходить из того, что каждый токен, отправленный модели, оплачивается по стандартной ставке ввода $0.30 на миллион токенов, независимо от повторений. Некоторые провайдеры предлагают автоматическое кэширование подсказок, при котором повторяющиеся префиксы тарифицируются по сниженной ставке (например, со скидкой 50%). Для данной модели такой скидки на кэширование объявлено не было. Если вы часто повторно отправляете один и тот же контекст (например, большой системный промпт), возможно, стоит выяснить, реализуют ли OrcaRouter или Google прозрачное кэширование. При отсутствии явной информации безопаснее всего закладывать в бюджет полные затраты на каждый токен для всех входных данных. Оптимизация путём сокращения повторно используемого контента может снизить ваш фактический счёт.
Нулевая наценка означает, что OrcaRouter взимает ровно тариф провайдера без добавления какой-либо дополнительной маржи. Для Gemini 3.5 Flash-Lite цена ввода составляет $0.30/1M токенов, а цена вывода — $2.50/1M токенов – это то, что взимает Google, и OrcaRouter передает это без увеличения. Вы не платите никакой дополнительной комиссии платформы за токен. Это необычно среди API-шлюзов, которые обычно добавляют 10‑20% или больше. Отсутствие наценки делает эту модель еще более экономически эффективной при доступе через OrcaRouter. Вы по-прежнему платите за пропускную способность и инфраструктуру API, но эти затраты включены в тариф провайдера; OrcaRouter не детализирует их отдельно. Эта модель ценообразования прозрачна: стоимость, отображаемая в панели использования, является окончательной.
Вы вызываете его через OpenAI-совместимый API OrcaRouter по базовому URL https://api.orcarouter.ai/v1. Установите параметр model в "google/gemini-3.5-flash-lite". Работают как чат-завершения (POST /v1/chat/completions), так и эмбеддинги (если поддерживаются). Для мультимодальных входных данных структурируйте сообщения с массивом roles и объектами content, которые могут содержать поля text, image_url или file_url. Пример cURL-запроса: ```bash curl -X POST https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"google/gemini-3.5-flash-lite","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}' ``` Вы должны использовать ключ API OrcaRouter, а не ключ Google API.
Модель поддерживает стандартные параметры, совместимые с OpenAI: model, messages, max_tokens (до 65,536, что является лимитом модели), temperature, top_p, stop, frequency_penalty, presence_penalty и tools (для вызова функций). Дополнительные параметры, специфичные для Google (например, safety_settings), могут не предоставляться напрямую; если они вам нужны, обратитесь к документации OrcaRouter для поиска аналогов. Модель будет соблюдать лимит max_tokens. Для мультимодального ввода поле type в content поддерживает: text, image_url, video_url (если OrcaRouter это предоставляет), audio_url и file_url. Тип file может принимать PDF, CSV и т.д. Обратите внимание, что большие медиафайлы могут потребовать предварительного кодирования как data URI или публичного хостинга. OrcaRouter также может требовать, чтобы файл не превышал определенный размер. Всегда обращайтесь к последней документации API для получения точной информации о поддерживаемых параметрах.
Для миграции с другого API-провайдера (например, Google AI Studio, Vertex AI или других шлюзов) на OrcaRouter замените базовый URL на https://api.orcarouter.ai/v1 и укажите идентификатор модели "google/gemini-3.5-flash-lite". Если ваш существующий код использует клиент OpenAI Python, передайте base_url и api_key. Пример: from openai import OpenAI client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_ORCAROUTER_API_KEY") response = client.chat.completions.create(model="google/gemini-3.5-flash-lite", messages=[...]) Возможно, потребуется скорректировать форматирование мультимодальных сообщений, если ваш предыдущий провайдер использовал другую схему (например, Anthropic). OrcaRouter ожидает формат OpenAI. Массивы содержимого пользователя могут включать несколько частей. Определения инструментов также выполнены в стиле OpenAI. Дополнительная плата за миграцию отсутствует; вы платите только за токены, как описано.
Прямых сравнительных данных нет, но мы можем провести качественное рассуждение. Gemini 2.0 Flash (если он существует) вероятно был бы более ранним поколением flash-модели. Gemini 3.5 Flash‑Lite — это более новый облегченный вариант с большим контекстным окном (1M против предположительно 128K) и более низкой ценой. Стоимость за токен для Gemini 3.5 Flash‑Lite составляет $0.30/$2.50 за миллион токенов, что очень низко. Более старые flash-модели могут иметь более высокую стоимость за токен и более короткие контекстные окна. Однако Gemini 2.0 Flash может обладать лучшей сырой точностью, если это полноценная flash-модель, а не облегченный вариант. Если ваша задача требует наивысшего качества и вы можете позволить более высокую стоимость, то более старая полноценная flash-модель может быть лучше. Если вам нужен большой контекст и низкая стоимость, то 3.5 Flash‑Lite является логическим выбором.
GPT-4o mini от OpenAI — это похожая недорогая мультимодальная модель. Она имеет контекстное окно размером 128K токенов (значительно меньше, чем 1M) и оценивается в $0.15 за миллион входных токенов и $0.60 за миллион выходных токенов (по состоянию на начало 2025 года; цены могли измениться). Gemini 3.5 Flash‑Lite предлагает в 8 раз большее контекстное окно при вдвое большей цене за ввод и в 4 раза большей цене за вывод. Таким образом, Gemini дороже за токен, но предоставляет гораздо большую контекстную емкость. Для задач, где требуется полный контекст размером 1M (например, обработка целых книг), Gemini Flash‑Lite более экономически эффективен, чем попытки разбивать ввод на несколько вызовов GPT‑4o mini. Если контекст короткий, GPT‑4o mini дешевле и может иметь лучшие показатели в бенчмарках. Показатели бенчмарков напрямую несопоставимы без данных.
Сравнительные бенчмарки не приводятся. Llama 3.2 90B (предполагая, что такая модель существует) — это крупная модель с открытыми весами, имеющая меньший контекст (обычно 128K токенов) и более высокую стоимость за токен при использовании через API. Gemini 3.5 Flash‑Lite — проприетарная модель с гораздо большим контекстным окном и очень низкой ценой — одна из самых дешёвых мультимодальных моделей за токен. Llama 3.2 90B может показывать более высокую точность на многих NLP-бенчмарках благодаря своему размеру, но она не является мультимодальной и имеет более строгие ограничения по контексту. Если ваша задача — работа только с текстом и требуется максимальная точность, Llama 90B (если доступна через OrcaRouter) может быть лучше. Для мультимодальных сценариев, работы с длинным контекстом или высокой пропускной способностью Gemini Flash‑Lite имеет явные преимущества. Выбор зависит от конкретных требований вашего приложения.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="google/gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Ввод / 1M токенов | $0.300 |
| Вывод / 1M токенов | $2.50 |
| Чтение кэша / 1M | $0.030 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
GET /api/public/models/google/gemini-3.5-flash-liteОткрыть @misc{orcarouter_gemini_3_5_flash_lite,
title = {Gemini 3.5 Flash-Lite API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite}
}Google. (2026). Gemini 3.5 Flash-Lite API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.5-flash-lite