GPT-4o mini — это новейшая модель OpenAI после [GPT-4 Omni](/models/openai/gpt-4o), поддерживающая как текстовые, так и графические входные данные с текстовыми выходами. Будучи их самой продвинутой малой моделью, она во много раз доступнее по цене...
GPT-4o-mini — это меньшая и более быстрая версия модели OpenAI GPT-4o, оптимизированная для снижения вычислительных затрат при сохранении мультимодальных возможностей. Она может обрабатывать текст,…
GPT-4o-mini отлично справляется с широким спектром языковых задач, включая суммаризацию, перевод, классификацию и ответы на вопросы. Он поддерживает структурированный вывод JSON, вызов функций и использование инструментов, что позволяет интегрироваться с внешними API и базами данных. Контекстное окно на 128K токенов позволяет обрабатывать большие документы или историю диалогов для связного анализа. Модель показывает хорошие результаты на стандартных бенчмарках (оценка MATH-500: 78,9) и подходит для учебных математических задач, объяснения кода и извлечения данных. Для более простых задач GPT-4o-mini часто не уступает более крупным моделям при значительно меньшей стоимости. Однако для задач, требующих глубоких экспертных знаний или высокой творческой отдачи, качество может быть ниже по сравнению с GPT-4o.
Изображения могут быть переданы в API-запросе в виде URL-адресов или данных, закодированных в base64. Модель интерпретирует изображения, понимая визуальное содержимое, такое как объекты, текст на изображениях и пространственные отношения. Это позволяет решать такие задачи, как визуальные вопросы-ответы, интерпретация диаграмм и распознавание рукописных цифр. Токены изображений учитываются в лимите контекста, поэтому изображения высокого разрешения или большого размера потребляют больше из бюджета в 128 000 токенов. Модель не генерирует изображения, а только обрабатывает их. Для задач, требующих высокой детализации (например, медицинская визуализация), более точной может быть специализированная модель зрения, но GPT-4o-mini предлагает универсальное решение с разумной стоимостью.
GPT-4o-mini принимает загружаемые файлы в дополнение к тексту и изображениям. Распространённые типы файлов включают PDF, .docx, .txt, .csv и .json. Модель извлекает текст и соответствующие визуальные элементы (если файл содержит встроенные изображения) и обрабатывает их как часть контекста. Это полезно для анализа научных статей, юридических контрактов или таблиц без ручного копирования. Обратите внимание, что содержимое файла учитывается в расходах токенов; например, PDF объёмом 50 страниц может потреблять несколько тысяч токенов. OrcaRouter взимает плату на основе общего количества входных токенов, включая токены из файлов. Плата за обработку файлов сверх потребления токенов не взимается.
Если ваша рабочая нагрузка включает только текст без изображений или файлов, и требуемый контекст составляет менее 16K токенов, меньшая модель (например, GPT-3.5-turbo) может предложить более низкую стоимость за токен. Аналогично, для задач с очень высокой пропускной способностью, таких как простая классификация или тривиальные вопросы-ответы, специализированная тонко настроенная модель может быть более экономичной. GPT-4o-mini экономически эффективен для мультимодальных или длинноконтекстных сценариев использования, но его сила заключается в балансе производительности и цены. Если ваше приложение может допустить более медленные ответы или более высокую стоимость ради максимальной точности, GPT-4o является альтернативой. Протестируйте свою конкретную задачу, чтобы подтвердить, какая модель соответствует вашим порогам качества и бюджета.
MATH-500 — это подмножество бенчмарка MATH, состоящее из 500 математических задач олимпиадного уровня, охватывающих алгебру, геометрию, теорию чисел и теорию вероятностей. Результат 78.9 означает, что GPT-4o-mini правильно ответил примерно на 78.9% этих задач. Это высокий показатель для модели меньшего размера, отражающий её способность к математическим рассуждениям. Она превосходит многие более ранние модели аналогичного размера. Однако производительность может различаться в зависимости от конкретных областей задач. Бенчмарк проводится в условиях zero-shot, то есть без предоставления предварительных примеров. Для реального репетиторства по математике модели может потребоваться тщательная настройка подсказок, чтобы корректно обрабатывать многошаговые решения.
Хотя единственным предоставленным бенчмарком является MATH-500, широко известная публичная информация указывает на то, что GPT-4o-mini также показывает конкурентоспособные результаты в MMLU (массовое многозадачное понимание языка), HellaSwag и GSM8K. По этим метрикам он обычно занимает место ниже GPT-4o, но выше GPT-3.5-turbo. На бенчмарках рассуждений он демонстрирует высокую производительность для своего количества параметров. В области творческого письма или генерации открытого текста его выводы связны, но могут уступать в нюансах более крупным моделям. Задержка обычно ниже, чем у GPT-4o, что делает его подходящим для приложений реального времени. За точными показателями обращайтесь к документации OpenAI. OrcaRouter предоставляет доступ без дополнительных наценок.
Задержка зависит от сложности запроса, количества токенов и нагрузки на API. GPT-4o-mini спроектирован для быстрой работы — обычно первый токен возвращается менее чем за одну секунду для запросов умеренной длины. Для длинных документов (например, 50K токенов) задержка увеличивается, так как модель обрабатывает весь контекст. OrcaRouter не изменяет скорость — вы получаете такое же время ответа, как при прямых вызовах API OpenAI. Поддерживается потоковая передача (streaming) для снижения воспринимаемой задержки. Для критичных к задержке приложений рекомендуется поддерживать короткую длину промптов и использовать streaming. Точное время до первого токена можно измерить, отслеживая время ответа; конкретный SLA не предоставляется.
Несмотря на свои возможности, GPT-4o-mini имеет ограничения из-за меньшего размера. По сравнению с GPT-4o он может давать менее точные ответы на задачи, требующие многошаговых рассуждений. Иногда он может неправильно интерпретировать тонкие инструкции или терять связность в очень длинных выводах. Его мультимодальное понимание хорошее, но не безупречное: он может упускать мелкие детали на изображениях или неправильно подсчитывать элементы. Модель может проявлять предвзятости, присутствующие в её обучающих данных. Она не поддерживает поиск в интернете или доступ к данным в реальном времени без специальной тонкой настройки для использования инструментов. Для задач, требующих высокой точности (например, юридические консультации, медицинская диагностика), необходима проверка человеком. Показатели бенчмарков отражают контролируемые условия; реальная производительность может отличаться.
OrcaRouter передает точные цены OpenAI без наценки: $0.15 за 1 миллион входных токенов и $0.60 за 1 миллион выходных токенов. Входные токены включают весь текст, токены изображений и содержимое файлов. Выходные токены учитывают сгенерированный текст. Ежемесячной платы или скрытых комиссий нет. Это одна из самых низких цен за токен для мультимодальной модели с контекстным окном 128K. Для сравнения, GPT-4o стоит $2.50 за 1M входных токенов и $10 за 1M выходных, что делает GPT-4o-mini на 94% дешевле по входным токенам и на 94% дешевле по выходным. Преимущество в стоимости значительно для приложений с большими объемами.
Хотя GPT-4o-mini дешев за токен, его меньший размер может потребовать большего количества попыток или более детальных подсказок для достижения желаемой точности, что потенциально увеличивает общее потребление токенов. Для задач, где GPT-4o получает правильный ответ с одной попытки, а GPT-4o-mini требуется три, общая стоимость может быть схожей или даже выше. Кроме того, если вам нужно отправлять много маленьких запросов, накладные расходы на вызовы API могут добавить задержку, но не прямую стоимость. Кэширование не применяется; каждый запрос обрабатывается заново. Оценивайте свой вариант использования с обеими моделями, чтобы найти наилучший баланс стоимости и производительности. OrcaRouter предлагает стабильные цены без скидок за объем.
OrcaRouter не реализует кэширование промптов. Каждый запрос к GPT-4o-mini отправляется на серверы OpenAI и тарифицируется за токен. Скидки на повторяющиеся промпты не предусмотрены. Если ваша рабочая нагрузка часто повторяет одно и то же системное сообщение или длинный контекст, вы можете сохранять ответы на своей стороне, чтобы избежать повторной отправки одинаковых запросов. Некоторые провайдеры предлагают скидки за кэширование промптов, но через OrcaRouter вы платите по стандартному тарифу провайдера. Это прозрачно и предсказуемо. Отсутствие кэширования упрощает ценообразование, но означает, что вы должны проектировать свои запросы так, чтобы минимизировать избыточное использование токенов.
(Примечание: Другие варианты GPT-4o-mini не предоставлены. Предполагается, что вопрос касается сравнения с другими мини-моделями, такими как Claude 3 Haiku или Gemini Flash, но приведены только факты. Вместо этого мы сравниваем с GPT-4o.) По сравнению с GPT-4o, GPT-4o-mini значительно дешевле: $0,15 против $2,50 за 1 млн входных токенов (дешевле на 94%) и $0,60 против $10 за 1 млн выходных токенов (дешевле на 94%). Многие пользователи считают GPT-4o-mini достаточным для 80-90% задач, что дает огромную экономию. Однако для задач, требующих максимальной точности (например, сложная генерация кода, тонкие юридические рассуждения), экономия может не оправдать снижения качества. OrcaRouter позволяет легко переключаться между моделями через один и тот же API-эндпоинт, изменяя идентификатор модели.
Используйте клиентскую библиотеку OpenAI или любой HTTP-клиент, указав базовый URL https://api.orcarouter.ai/v1. Установите параметр model в значение "openai/gpt-4o-mini". Для аутентификации требуется ключ API OrcaRouter. Минимальный пример на Python: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your-key") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explain quantum computing."}]) Поддерживаются все параметры API OpenAI, включая temperature, max_tokens, stream и tools. OrcaRouter проксирует запросы к OpenAI и возвращает ответы без изменений.
Стандартные параметры чат-завершений OpenAI: model (обязательно: "openai/gpt-4o-mini"), messages (массив объектов сообщений), temperature (0-2, по умолчанию 1), top_p (0-1, по умолчанию 1), n (количество ответов, по умолчанию 1), stream (логическое значение), stop (строка/массив), max_tokens (до 16384), presence_penalty, frequency_penalty, logit_bias, user (необязательно) и tools для вызова функций. Для зрения вставляйте содержимое изображений в сообщения (тип "image_url" или "image_url" с детализацией). Входные файлы могут быть в кодировке base64. OrcaRouter передаёт все параметры в OpenAI. Примечание. Поддерживается формат ответа (JSON mode); задайте response_format={ "type": "json_object" } при необходимости.
Миграция проста: измените базовый URL в вашем клиенте с «https://api.openai.com/v1» на «https://api.orcarouter.ai/v1» и замените ваш API-ключ на ключ OrcaRouter. Обновите название модели на «openai/gpt-4o-mini» (или оставьте «gpt-4o-mini»? В документации указан идентификатор модели «openai/gpt-4o-mini», так что используйте его). Весь остальной код остаётся без изменений, поскольку API полностью совместим с OpenAI. Вы также можете хранить несколько строк с моделями и маршрутизировать на основе стоимости или возможностей. OrcaRouter не изменяет формат ответа. Протестируйте с несколькими запросами, чтобы убедиться, что заголовки и потоковая передача работают как ожидается.
Да, GPT-4o-mini поддерживает стриминг через server-sent events (SSE). Установите stream=true в запросе. Ответ будет представлять собой серию фрагментов, содержащих дельта-контент. Это сокращает время до первого токена (time-to-first-token) для пользователей и обеспечивает отображение в реальном времени. OrcaRouter передаёт стриминговые ответы без изменений. Обратите внимание, что общее количество затраченных токенов остаётся прежним. Стриминг совместим со всеми типами входных данных (текст, изображение, файл). Вы также можете комбинировать стриминг с вызовами функций; модель будет стримить фрагмент вызова инструмента, когда это необходимо. Параметр max_tokens применяется ко всему ответу.
GPT-4o-mini — это меньшая и более дешевая версия GPT-4o. Она стоит примерно на 94% меньше как на входных, так и на выходных токенах. У нее такое же контекстное окно в 128K и максимальный вывод в 16K. Она поддерживает те же мультимодальные входные данные, но в целом немного менее точна в сложных рассуждениях и творческих задачах. На MATH-500 GPT-4o-mini набирает 78,9 балла, в то время как GPT-4o набирает 92+ (приблизительно). Для многих повседневных задач, таких как поддержка клиентов, суммаризация и простое зрение, GPT-4o-mini достаточно. Выбирайте GPT-4o, когда вам нужна производительность высшего уровня и вы готовы принять более высокую задержку и стоимость.
Сравнение с моделями, такими как Claude 3 Haiku или Gemini 1.5 Flash: GPT-4o-mini предлагает контекстное окно на 128K, в то время как Haiku поддерживает 200K, а Flash — 1M. Цены схожи (Haiku $0.25/$1.25 за 1M токенов; Flash $0.35/$1.05). Показатель MATH-500 у GPT-4o-mini равен 78.9, что конкурентоспособно; у Haiku — около 73, а у Flash — около 78 на аналогичных математических тестах. Для мультимодальных входных данных все три модели принимают изображения. GPT-4o-mini может иметь лучшее качество рассуждений для своей цены, но контекстное окно меньше, чем у некоторых конкурентов. Лучший выбор зависит от ваших конкретных требований к задержке, стоимости и качеству. OrcaRouter также предоставляет доступ к Haiku и Flash, что позволяет сравнивать их бок о бок.
GPT-3.5-turbo более старая модель, имеет окно контекста 16K и стоит немного дешевле ($0.50 за 1M входных токенов против $0.15 для GPT-4o-mini? На самом деле GPT-3.5-turbo-0125 стоит $0.50/$1.50, но с меньшим контекстом. Исходя из предоставленных цен, GPT-4o-mini дешевле за токен и предлагает больший контекст, а также мультимодальный ввод. Поэтому для большинства задач GPT-4o-mini превосходит её. Однако некоторые устаревшие приложения, уже использующие GPT-3.5-turbo, могут требовать минимальных изменений. GPT-4o-mini также показывает лучшие результаты на тестах рассуждения. Если только задержка не является критической или у вас нет тонко настроенной модели GPT-3.5, GPT-4o-mini является рекомендуемой заменой без дополнительных изменений.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Ввод / 1M токенов | $0.150 |
| Вывод / 1M токенов | $0.600 |
| Чтение кэша / 1M | $0.075 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
GET /api/public/models/openai/gpt-4o-miniОткрыть @misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini