Gemini 2.5 Flash Image, также известная как «Nano Banana», теперь общедоступна. Это передовая модель генерации изображений с контекстуальным пониманием. Она способна генерировать изображения,...
Google: Nano Banana (Gemini 2.5 Flash Image) — это мультимодальная языковая модель, разработанная Google, входящая в серию Gemini 2.5 Flash. Она принимает на вход как изображения, так и текст, и…
Основные возможности сосредоточены на понимании и рассуждении о визуальном контенте, представленном в виде изображений. Получив изображение и текстовый запрос, модель может описать сцену, идентифицировать объекты, ответить на вопросы о содержимом, извлечь текст (OCR) и выполнить базовые визуальные рассуждения (например, пространственные отношения, цвета, действия). Она также может обрабатывать текст, сопровождающий изображение, например инструкции или контекст. Благодаря архитектуре flash-уровня модель оптимизирована для низкой задержки и высокой пропускной способности, что делает её подходящей для приложений реального времени или с большим объёмом данных. Однако она может не соответствовать глубине рассуждений или точности более дорогих и крупных моделей, таких как Gemini 2.5 Pro, при выполнении сложных визуальных задач, требующих детального анализа или длинных цепочек рассуждений. Модель не предназначена для таких задач, как генерация изображений, анализ видео или многосеансовые диалоги, требующие длительного контекста, превышающего 32K токенов.
Если ваше приложение вообще не требует ввода изображений, использование текстовой модели (например, меньшего варианта Gemini или модели с открытым исходным кодом) будет более экономически эффективным. Аналогично, если ваша задача включает только текстовые рассуждения без визуального компонента, дополнительные затраты на обработку изображений не нужны. В сценариях, где длина вывода велика, например, при создании подробных отчетов или историй на основе изображения, цена в $30 за миллион токенов вывода может оказаться высокой. В таких случаях рассмотрите модели с более низкой стоимостью вывода или используйте эту модель для создания краткого резюме, а затем разверните его с помощью более дешевой текстовой модели. Кроме того, если вам нужно обрабатывать несколько изображений в одном запросе или работать с очень большими изображениями, могут быть более подходящими модели с большими контекстными окнами или поддержкой определенного разрешения изображений.
Развертывания с большими объемами выигрывают от низкой стоимости ввода этой модели ($0.30 за миллион токенов) и быстрого вывода. Идеальные сценарии использования включают автоматическую разметку изображений для больших фотоархивов, генерацию альтернативного текста для тысяч изображений товаров, выполнение OCR в пакетах отсканированных документов и модерацию контента в реальном времени для изображений, загружаемых пользователями. Поскольку стоимость вывода высока, ответ должен быть коротким — часто одно слово, метка или предложение. Например, классификация изображения по заданным категориям, извлечение нескольких ключевых полей из формы или ответ на вопрос "да/нет" об изображении. Пакетную обработку можно выполнять через API OrcaRouter с одновременными запросами. Задержка модели обычно низкая, но фактическая пропускная способность зависит от размера и сложности изображения. В OrcaRouter нет отдельного лимита на частоту запросов, кроме общего использования API.
Основным ограничением является высокая стоимость выходных токенов по сравнению с входными, что делает генерацию длинного текста дорогостоящей. Контекстное окно в 32 768 токенов ограничивает объем текста и размер изображения (в пересчете на токены), которые можно обработать за один запрос. Модель не предназначена для задач, требующих глубокого мультимодального анализа, сложных визуальных деталей или одновременной работы с несколькими изображениями (каждое дополнительное изображение потребляет контекст). Кроме того, как модель класса flash, она может показывать меньшую точность в специализированных визуальных задачах, таких как анализ медицинских изображений, мелкозернистое обнаружение объектов или распознавание редких объектов, по сравнению с более мощными, но более медленными или дорогими моделями. Данные обучения модели и конкретные показатели производительности на эталонах не раскрываются в предоставленных фактах; пользователям следует оценивать модель на собственных наборах данных. Наконец, она поддерживает только ввод изображений и текста, но не видео или аудио.
Предоставленные факты не включают конкретных показателей бенчмарков для Google: Nano Banana (Gemini 2.5 Flash Image). Эта модель входит в серию Gemini 2.5 Flash от Google, которая в целом ориентирована на эффективность, а не на максимальную точность. При отсутствии цифр пользователям следует ожидать производительности, сопоставимой с другими мультимодальными моделями флэш-уровня в стандартных задачах визуально-языкового анализа, таких как VQAv2, COCO Captions и OCR. Однако точные оценки не приводятся. Мы рекомендуем оценить модель на собственном репрезентативном наборе данных, чтобы определить, соответствуют ли ее возможности вашим требованиям. OrcaRouter не предоставляет внутренних бенчмарков помимо тех, что общедоступны от Google. Если вам требуются точные метрики точности, обратитесь к официальной документации Google по серии Gemini 2.5 Flash, но учтите, что данный конкретный идентификатор модели может иметь собственную тонкую настройку.
Предоставленные факты не включают измерения задержки для этой модели. Будучи частью семейства Gemini 2.5 Flash, эта модель спроектирована для низкой задержки и высокой пропускной способности. Обычно flash-модели от Google жертвуют некоторым качеством рассуждений в пользу скорости, что делает их подходящими для приложений, работающих почти в реальном времени. Фактическая задержка зависит от таких факторов, как размер и разрешение входного изображения, длина текстового запроса, количество запрошенных выходных токенов и текущая нагрузка на API. В целом, простые задачи по созданию подписей к изображениям могут выполняться от нескольких сотен миллисекунд до пары секунд, в то время как более сложные запросы, требующие более длинного вывода, займут больше времени. Для достижения наилучших результатов поддерживайте разумное разрешение изображения и ограничивайте длину вывода. API OrcaRouter не добавляет дополнительных накладных расходов сверх времени ответа провайдера.
Сильные стороны: Модель отлично справляется с задачами, где требуется быстрый и экономичный ответ по одному изображению. Она может быстро определять распространённые объекты, считывать текст с изображений и отвечать на прямые вопросы о визуальном содержании. Низкая стоимость ввода делает её пригодной для обработки больших объёмов изображений. Ограничения: Модель может испытывать трудности с задачами, требующими высокой точности, такими как подсчёт мелких объектов, различение очень похожих текстур или понимание сложных диаграмм. Понимание модели ограничено тем, что можно вывести из пиксельных данных и текстового запроса; у неё нет доступа к внешним знаниям, выходящим за рамки её обучающих данных (дата отсечки неизвестна). Кроме того, из-за высокой стоимости вывода формирование подробных ответов для каждого изображения может быстро стать дорогим. Для задач, требующих длительного и детального анализа, более подходящей будет более производительная (и, как правило, более дорогая) модель. Производительность в граничных случаях, таких как тёмные размытые изображения или необычные ракурсы, может быть ниже.
Ценообразование простое: $0.30 за 1 миллион входных токенов и $30.00 за 1 миллион выходных токенов. Входные токены включают токены как из текстового промпта, так и из изображения (изображение токенизируется моделью). Выходные токены — это токены, сгенерированные в качестве ответа. Нет платы за подключение, нет ежемесячного минимума, и OrcaRouter не добавляет никакой наценки — вы платите ровно по тарифу провайдера. Токены подсчитываются системой OrcaRouter. Оплата обычно осуществляется по факту использования, с начислением платы по мере отправки запросов. Вы можете отслеживать использование через панель управления OrcaRouter. Поскольку входные токены намного дешевле выходных, общая стоимость типичного запроса (короткий вывод) определяется в основном входной стороной, особенно если вы включаете большое изображение. Например, изображение размером 1024x1024 может потреблять несколько тысяч входных токенов.
По сравнению с текстовыми моделями (например, Gemini 1.5 Flash только для текста по цене $0.075/M на вход, $0.30/M на выход), стоимость входных данных этой модели в 4 раза выше, а выходных — в 100 раз выше, что отражает повышенную сложность обработки изображений. Для задач, не требующих анализа изображений, эти текстовые модели гораздо дешевле. По сравнению с более крупными мультимодальными моделями, такими как Gemini 2.5 Pro (у которых выше стоимость на токен, но лучше логика), эта модель дешевле на входе, но сравнима или дороже на выходе в зависимости от конкретного уровня Pro. Компромисс уровня Flash — более низкая точность за меньшую стоимость входа. Если вашему приложению требуется высокая точность и оно может терпеть более высокую стоимость входа, модель Pro может быть лучше. Если длина вывода велика, стоимость вывода этой модели становится запретительной, поэтому рассмотрите модели с более низкой ценой вывода, такие как Gemini 1.5 Flash (текст+изображения), у которых могут быть другие тарифы.
Предоставленные факты не упоминают никаких механизмов кэширования или скидок за объём для этой модели на OrcaRouter. OrcaRouter пропускает цены провайдера без наценки, поэтому любые скидки должны исходить из прямых соглашений с Google. В настоящий момент в опубликованной информации OrcaRouter нет автоматического кэширования встраиваемых изображений или подсказок. Пользователям следует исходить из того, что каждый запрос оплачивается на основе использованных входных и выходных токенов. Для пользователей с большим объёмом может быть полезно связаться с OrcaRouter, чтобы узнать о возможных корпоративных соглашениях, но стандартная цена «плати по мере использования» составляет $0.30/M за ввод и $30.00/M за вывод. Чтобы минимизировать затраты, по возможности повторно используйте ранее созданные выходные данные и ограничьте количество токенов в каждом запросе (например, изменяя размер изображений или используя краткие подсказки).
Чтобы использовать Google: Nano Banana (Gemini 2.5 Flash Image) через OrcaRouter, отправьте POST-запрос на https://api.orcarouter.ai/v1/chat/completions с параметром модели "google/gemini-2.5-flash-image". API следует формату чат-запросов OpenAI. Включите ваш ключ API OrcaRouter в заголовок Authorization как "Bearer YOUR_API_KEY". В теле запроса укажите массив messages с сообщением пользователя, содержащим как изображение, так и текст. Для изображений добавьте часть содержимого типа "image_url" с URL или данными в base64. Пример: {"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"What is in this image?"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}. В ответ вы получите стандартный чат-запрос с ответом модели.
API OrcaRouter поддерживает многие из тех же параметров, что и OpenAI API. Основные параметры: model (обязательный, установите "google/gemini-2.5-flash-image"), messages (обязательный, массив объектов сообщений), max_tokens (целое число, максимальное количество токенов для генерации), temperature (число с плавающей точкой, по умолчанию 1.0, управляет случайностью), top_p (число с плавающей точкой, по умолчанию 1.0), presence_penalty и frequency_penalty (числа с плавающей точкой), stop (строка или массив строк, до 4 последовательностей) и stream (логическое значение, для потоковых ответов). Для ввода изображений сообщения должны содержать хотя бы одно сообщение пользователя с содержимым в виде массива частей, каждая часть имеет поле type ("text" или "image_url"). Часть image_url должна содержать объект "image_url" со строкой "url" (либо общедоступный URL, либо data URL с base64). Тонкая настройка или дополнительные параметры, специфичные для модели, не предоставляются. Контекстное окно составляет 32,768 токенов, поэтому убедитесь, что prompt_token_count + image_token_count + max_tokens <= 32768.
Миграция на OrcaRouter требует минимальных изменений кода, если вы уже используете API, совместимый с OpenAI. Просто измените базовый URL с вашего предыдущего endpoint на https://api.orcarouter.ai/v1. Обновите ваш API-ключ на ключ OrcaRouter. При вызове модели установите параметр model в "google/gemini-2.5-flash-image" (или желаемую модель). Соответственно измените любые существующие идентификаторы моделей. Для ввода изображений убедитесь, что формат запроса соответствует соглашению OpenAI (например, использование массива content с image_url). Обычно других изменений кода не требуется. Если вы использовали другой формат API (например, облачные endpoint'ы), возможно, потребуется переписать структуру запроса. OrcaRouter предоставляет документацию для распространенных SDK. Протестируйте с небольшим количеством запросов, чтобы проверить количество токенов и ценообразование. Обратите внимание, что OrcaRouter выставляет счета по тарифам провайдера без наценки, поэтому цены могут отличаться от вашего предыдущего провайдера.
По сравнению с текстовой версией Gemini 2.5 Flash (если она доступна на OrcaRouter), эта модель добавляет возможность ввода изображений, но с более высокой стоимостью ввода. Текстовая версия обычно стоит дешевле за токен ввода и имеет значительно более низкую стоимость вывода, что делает ее предпочтительной для чисто текстовых задач. По сравнению с моделями Gemini 2.5 Pro, эта модель flash-уровня дешевле по вводу, но может иметь более низкую точность и глубину рассуждений. Модели Pro имеют большее контекстное окно (часто 1 миллион токенов) и лучшую производительность в сложных многошаговых задачах. Стоимость вывода для моделей Pro может быть аналогичной или выше. Для задач, требующих понимания изображений вместе с текстом, эта модель предоставляет экономичный входной порог. Однако, если вам нужно обрабатывать видео, аудио или несколько изображений одновременно, вам следует рассмотреть модель, поддерживающую эти модальности (например, Gemini 2.5 Pro, которая поддерживает видео и аудио в некоторых конфигурациях).
Эта модель — одна из многих мультимодальных опций, доступных через OrcaRouter. GPT-4o (OpenAI) обычно имеет больший контекстный окно (128k) и может предложить лучшее общее понимание изображений и рассуждение, но при более высоких затратах на ввод и вывод. Модели зрения Claude (например, Claude 3.5 Sonnet) также конкурентоспособны, но отличаются по цене и длине контекста. Основное преимущество Gemini 2.5 Flash Image — низкая стоимость ввода, что делает его привлекательным для задач с большим объемом и коротким выводом. Однако для сложного визуального рассуждения, медицинской визуализации или детального анализа документов более продвинутые модели могут дать лучшие результаты. Выбор зависит от конкретного компромисса между стоимостью, точностью и задержкой. OrcaRouter позволяет легко переключаться между моделями, изменяя идентификатор модели, поэтому можно протестировать эту модель вместе с альтернативами, чтобы определить наилучшее соответствие.
Более дорогая модель, такая как Gemini 2.5 Pro, GPT-4o или Claude 3.5 Sonnet, становится оправданной, когда задача требует более высокой точности, более длинного контекста или рассуждений, состоящих из нескольких шагов. Если ваше приложение выдает неверные или неполные результаты с этой моделью, экономия средств сводится на нет, когда требуется постобработка или ручная корректировка. Для таких задач, как анализ медицинских изображений, интерпретация юридических документов или обработка конфиденциального контента, надежность премиум-модели может оправдать более высокую стоимость. Кроме того, если вам нужно создавать длинные выходные данные (например, описания целых страниц) или обрабатывать очень большие изображения, модели с большими контекстными окнами и меньшей стоимостью выходных токенов могут быть более экономически эффективными в целом. Природа этой модели как flash-уровня означает, что она разработана для скорости и пропускной способности, а не для глубины. Используйте её там, где достаточно приблизительного понимания; переходите на более дорогую модель, когда важна точность.
Конфиденциальность и обработка данных зависят от политик Google для моделей Gemini. Как и в случае с любым облачным API, входные данные (изображения и текст) отправляются на серверы Google для обработки. Google может использовать данные для улучшения модели, если вы не откажетесь от этого или не используете корпоративные аккаунты, запрещающие такое использование. Предоставленные факты не уточняют детали обработки данных для данной конкретной модели. При использовании OrcaRouter в качестве шлюза данные проходят через инфраструктуру OrcaRouter, но в конечном итоге обрабатываются Google. OrcaRouter не хранит ваши данные и не использует их для обучения. Пользователям следует ознакомиться с условиями обработки данных Google для API Gemini и рассмотреть возможность сквозного шифрования при необходимости. Для конфиденциальных данных некоторые организации предпочитают модели, размещенные на собственной инфраструктуре (например, через Vertex AI с соблюдением локальности данных), а не через сторонний шлюз. Однако OrcaRouter предоставляет унифицированный API-ключ и биллинг, что может упростить доступ, если вопросы обработки данных приемлемы.
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| Ввод / 1M токенов | $0.300 |
| Вывод / 1M токенов | $30.00 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
GET /api/public/models/google/gemini-2.5-flash-imageОткрыть @misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image