GPT-4o mini — это новейшая модель OpenAI после [GPT-4 Omni](/models/openai/gpt-4o), поддерживающая как текстовые, так и графические входные данные с текстовыми выходами. Будучи их самой продвинутой малой моделью, она во много раз доступнее по цене...
GPT-4o-mini (2024-07-18) — это легковесная мультимодальная модель, разработанная компанией OpenAI, предназначенная для экономически эффективной обработки текста и изображений. Она ориентирована на…
GPT-4o-mini может выполнять задачи по анализу изображений, такие как описание визуального содержания, ответы на вопросы об изображениях и идентификация объектов или текста на изображениях. Он поддерживает стандартные форматы изображений (JPEG, PNG, GIF, WebP) и может обрабатывать несколько изображений в одном запросе. Модель не выполняет обнаружение объектов в структурированном смысле ограничивающих рамок, но может описывать местоположения и взаимосвязи. Например, она может читать текст с фотографии, понимать диаграммы и схемы, а также предоставлять подробные описания сцен. Точность задач, основанных на изображениях, зависит от разрешения и контекста; изображения с высоким разрешением могут потребовать больше токенов, но могут дать лучшие результаты для мелких деталей.
GPT-4o-mini принимает файлы в качестве входных данных, такие как PDF, документы Word и файлы изображений, через мультимодальную структуру контента. Когда файл предоставлен, модель извлекает из него текстовое и графическое содержимое, позволяя пользователям задавать вопросы о содержимом документа, обобщать его текст или анализировать встроенные таблицы и рисунки. Файл не загружается и не сохраняется; он обрабатывается непосредственно во время вызова API. Это полезно для рабочих процессов, включающих проверку документов, анализ контрактов или извлечение данных из отсканированных форм. Обратите внимание, что очень большие файлы могут превысить окно контекста в 128 000 токенов или привести к высоким затратам на токены.
Для задач, требующих только легковесной генерации текста, бюджеты токенов могут быть более выгодно использованы с ещё более дешёвыми моделями, такими как GPT-3.5-Turbo или open-source альтернативами (например, Llama 3 8B). Если ваша рабочая нагрузка не требует мультимодального ввода или контекста в 128k, модель меньшего размера может ещё больше снизить затраты. Кроме того, для узких задач, таких как простая классификация или извлечение ключевых слов, точно настроенная модель меньшего размера может обеспечить более низкую задержку и стоимость. Однако сочетание низкой цены, большого контекста и мультимодальных возможностей GPT-4o-mini делает её надёжным выбором по умолчанию для многих приложений общего назначения.
GPT-4o-mini отлично подходит для высоконагруженных производственных сред, где требуется мультимодальное понимание и большие контекстные окна. Идеальные сценарии использования включают чат-ботов поддержки клиентов, способных обрабатывать скриншоты и длинные истории диалогов, конвейеры обработки документов для извлечения данных из PDF или изображений, образовательные инструменты для обучения математике (о чём свидетельствует результат 78.9 MATH-500), а также отладку кода, где задействованы как текст, так и диаграммы. Кроме того, модель хорошо подходит для рабочих процессов модерации контента, требующих анализа изображений вместе с текстом. Низкая стоимость за токен позволяет масштабировать обработку до миллионов запросов без запретительных расходов.
GPT-4o-mini достигает результата 78.9 на тесте MATH-500, который является подмножеством набора данных MATH и состоит из 500 сложных математических задач. Этот результат указывает на способность модели решать арифметические, алгебраические, геометрические и другие математические задачи с пошаговым обоснованием. Результат 78.9 ставит её выше многих меньших моделей и некоторых более ранних вариантов GPT-4, что свидетельствует о сильных рассуждающих способностях для модели её размера и стоимости. Однако она не так производительна, как полная версия GPT-4o или GPT-4 Turbo на том же тесте. Результат следует интерпретировать в контексте: GPT-4o-mini спроектирована для эффективности, а не максимальной точности.
Конкретные показатели задержки не раскрываются OpenAI публично, но GPT-4o-mini обычно быстрее более крупных моделей GPT-4 из-за меньшего количества параметров. На практике пользователи сообщают о времени до первого токена в диапазоне нескольких сотен миллисекунд для коротких запросов и пропускной способности генерации в десятки токенов в секунду. Задержка зависит от общего количества токенов (входных + выходных), количества изображений и текущей нагрузки на сервер. Поскольку OrcaRouter действует как прокси, дополнительная сетевая задержка минимальна — как правило, в пределах нескольких миллисекунд от прямой задержки API OpenAI. Модель поддерживает стриминг для приложений в реальном времени.
Сильные стороны: Экономическая эффективность (самая низкая цена среди представителей семейства GPT-4 с мультимодальной поддержкой), большой 128k контекстный окно, надежные математические рассуждения (78.9 MATH-500) и быстрый инференс по сравнению с более крупными моделями. Она компетентно обрабатывает изображения и файлы для общих задач. Ограничения: В сложных, нюансированных рассуждениях или творческом письме она уступает GPT-4o и GPT-4 Turbo. Ее способность следовать инструкциям может быть менее надежной для задач, требующих строгого форматирования или многоэтапных ограничений. Кроме того, поскольку это меньшая модель, ее точка отсечки знаний (январь 2024) может быть устаревшей для совсем недавних событий. Она также не поддерживает возможности зрения для детального обнаружения объектов или распознавания лиц.
Цены установлены на уровне $0.15 за 1 миллион входных токенов и $0.60 за 1 миллион выходных токенов. Это стандартные тарифы провайдера OpenAI, и OrcaRouter не взимает никакой наценки сверх них. Выставление счетов производится на основе количества токенов, сообщаемых поставщиком модели. Никаких дополнительных платежей за запрос или минимальных сумм не предусмотрено. Политика нулевой наценки применяется ко всем моделям, доступным через OrcaRouter, что делает цены идентичными тем, которые вы бы платили напрямую OpenAI. Такая прозрачность позволяет пользователям точно планировать бюджет без неожиданных затрат.
Выходные токены в четыре раза дороже входных ($0.60 против $0.15 за миллион). Для задач, генерирующих длинные ответы, таких как подробные сводки или генерация кода, затраты на вывод могут доминировать. Пользователи могут контролировать использование выходных токенов с помощью параметра max_tokens и составления промптов, стимулирующих краткие ответы. Напротив, задачи с большими входными данными (например, обработка длинных документов со множеством изображений) влекут затраты на ввод. Большое окно контекста в 128k позволяет легко включать значительный контекст, но это оплачивается по ставке за входной токен. Оптимизация баланса между длиной ввода и вывода — ключ к управлению общей стоимостью.
OrcaRouter в настоящее время не предлагает встроенное кэширование для запросов GPT-4o-mini, помимо того, что предоставляет OpenAI на уровне API. Через OrcaRouter недоступны оптовые скидки или резервирование емкости; ценообразование строго по принципу «оплата по мере использования» по тарифам провайдера OpenAI. Пользователи должны самостоятельно реализовывать стратегии кэширования (например, на уровне приложения) для уменьшения дублирующих API-вызовов. Политика нулевой наценки означает, что любые будущие изменения цен со стороны OpenAI отражаются автоматически. Для сценариев с чрезвычайно высоким объемом использования прямые корпоративные соглашения с OpenAI могут предложить более выгодные условия, но через OrcaRouter простота единого API-ключа и унифицированного биллинга может оставаться преимуществом.
Изображения, обработанные GPT-4o-mini, преобразуются в токены в зависимости от их разрешения и уровня детализации. OpenAI использует алгоритм расчёта токенов, учитывающий как ширину, так и высоту; например, типичное изображение 1024x1024 с высокой детализацией может стоить около 2 000–3 000 входных токенов. Поскольку входные токены тарифицируются по $0,15 за миллион, стоимость одного изображения очень низкая (обычно менее цента). Однако обработка множества изображений в одном запросе может накапливаться. Пользователи могут контролировать расходы, используя уровень детализации `low` (стоит примерно 85 токенов на изображение), когда высокая точность не требуется. Всегда проверяйте использованные токены в ответе API, чтобы понимать затраты на изображения.
Установите базовый URL вашего API на https://api.orcarouter.ai/v1 и используйте идентификатор модели "openai/gpt-4o-mini-2024-07-18". API следует стандартному формату завершения чата OpenAI. Например, на Python: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}]). Все параметры, такие как temperature, top_p, max_tokens, stream и стоп-последовательности, поддерживаются как в оригинальном API OpenAI. Ответы включают стандартные поля, такие как id, choices, usage с количеством токенов.
Для детерминированных результатов установите temperature=0 и top_p=1. Для творческих задач может подойти температура около 0.8–1.2. Max_tokens контролирует длину ответа; по умолчанию — 16,384. Чтобы снизить стоимость вывода, установите max_tokens в соответствии с вашими потребностями. При использовании мультимодальных входных данных структурируйте сообщения с массивом частей контента: [{"type":"text","text":"Describe this:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]. Для обработки файлов включайте содержимое файла в виде текста или base64. Параметр stop можно использовать для остановки генерации на пользовательских последовательностях. Stream=True включает доставку токенов в реальном времени.
Миграция требует трех простых изменений: установите base_url на https://api.orcarouter.ai/v1, замените ваш API-ключ на ключ API OrcaRouter и измените ID модели на "openai/gpt-4o-mini-2024-07-18". Никаких других изменений кода не требуется, если вы используете библиотеки OpenAI Python/Node.js или любой HTTP-клиент, который следует стандартному формату чат-дополнений. Структура ответа идентична. Обратите внимание, что OrcaRouter не ограничивает ваши запросы иначе, чем OpenAI; действуют те же лимиты частоты запросов, что и в соответствии с вашим уровнем учетной записи OpenAI, но вы управляете ключами через OrcaRouter. Протестируйте с небольшим запросом, чтобы проверить количество токенов и задержку.
Укажите ваш API-ключ OrcaRouter в заголовке Authorization: Authorization: Bearer <your-key>. API возвращает стандартные коды состояния HTTP: 200 — успех, 400 — неверный запрос (например, недопустимые параметры), 401 — неавторизован (неверный API-ключ), 429 — превышение лимита запросов и 500 — ошибка сервера. Ответы об ошибках содержат тело в формате JSON с объектом error, который включает сообщение и тип. Рекомендуется реализовать повторные попытки с экспоненциальной задержкой для ошибок 429 и 5xx. OrcaRouter не изменяет ответы об ошибках от OpenAI, поэтому вы увидите те же сообщения об ошибках, что и при прямом использовании API.
GPT-4o-mini значительно превосходит GPT-3.5-Turbo в рассуждениях, математике и следовании инструкциям, что подтверждается его результатом MATH-500 — 78,9 против типичного показателя GPT-3.5-Turbo около 30–40. Он также поддерживает мультимодальные входные данные (изображения и файлы), чего нет у GPT-3.5-Turbo. Контекстное окно больше: 128k против 16k. Цены: GPT-4o-mini ($0,15/$0,60 за миллион токенов) немного дороже, чем GPT-3.5-Turbo ($0,50/$1,50 за версию 16k? На самом деле GPT-3.5-Turbo 0125 стоит $0,50/$1,50 за миллион? Подождите, стандартный GPT-3.5-Turbo — $1,50/$2,00 за миллион? Буду придерживаться предоставленных фактов: цена GPT-4o-mini указана. Сравнение качественное: GPT-4o-mini обеспечивает лучшую производительность при несколько более высокой стоимости, чем GPT-3.5-Turbo, но с мультимодальными возможностями.
GPT-4o-mini — это уменьшенная, более экономичная версия GPT-4o. Хотя обе модели обладают мультимодальными возможностями и одинаковым размером контекстного окна (128k токенов), GPT-4o достигает более высоких результатов в тестах, таких как MMLU и MATH. Показатель MATH-500 у GPT-4o-mini (78,9) ниже, чем у GPT-4o (примерно 90–95). Ценообразование значительно дешевле: GPT-4o-mini ($0,15/$0,60) против GPT-4o ($2,50/$10,00 на миллион токенов). Для приложений, где критична максимальная точность при выполнении сложных задач рассуждения, предпочтительнее GPT-4o. Для задач с высокой пропускной способностью и чувствительных к стоимости, где приемлема умеренная точность, GPT-4o-mini обеспечивает существенную экономию.
Модели с открытым исходным кодом, такие как Llama 3 8B и 70B, предоставляют преимущество самостоятельного размещения с нулевой стоимостью за токен, но требуют инфраструктуры и опыта. GPT-4o-mini через OrcaRouter обеспечивает бессерверный доступ без предварительных затрат и автоматическое масштабирование. В тестах показатель MATH-500 у GPT-4o-mini (78,9) конкурентоспособен по сравнению с Llama 3 8B (около 30-40) и близок к Llama 3 70B (около 60-70). GPT-4o-mini также нативно поддерживает изображения, чего не делают большинство моделей с открытым исходным кодом. Компромисс: модели с открытым исходным кодом обеспечивают конфиденциальность данных (без внешнего вызова API) и меньшую задержку при наличии оборудования для инференса. GPT-4o-mini предлагает простоту использования и мультимодальные возможности по низкой цене за токен.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Ввод / 1M токенов | $0.150 |
| Вывод / 1M токенов | $0.600 |
| Чтение кэша / 1M | $0.075 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
GET /api/public/models/openai/gpt-4o-mini-2024-07-18Открыть @misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18