GPT-4o ("o" означает "omni") — это последняя модель ИИ от OpenAI, поддерживающая как текстовые, так и графические входные данные с текстовыми выходными данными. Она сохраняет уровень интеллекта [GPT-4 Turbo](/models/openai/gpt-4-turbo), будучи в два раза...
GPT-4o (2024-05-13) — это мультимодальная языковая модель от OpenAI, доступная через API OrcaRouter. Она обрабатывает текст, изображения и файлы, что делает её подходящей для задач, сочетающих…
GPT-4o может анализировать изображения, переданные как часть входных данных. Он способен описывать визуальное содержимое, отвечать на вопросы об объектах, тексте внутри изображений и пространственных отношениях. Также может извлекать и транскрибировать текст из отсканированных документов или фотографий. Поскольку он обрабатывает изображения напрямую, вам не нужна отдельная модель OCR или компьютерного зрения. Изображение токенизируется для размещения в контекстном окне. Например, пользователь может загрузить скриншот графика и попросить модель интерпретировать тренды. Понимание модели не ограничивается простыми подписями; она может рассуждать о содержимом, сравнивать несколько изображений и использовать визуальные подсказки вместе с текстовыми инструкциями. Эта возможность интегрирована в тот же вызов API с использованием того же формата сообщений, что и для текстовых запросов. На OrcaRouter вы отправляете изображения в виде данных в кодировке base64 или URL-адресов в массиве content. Идентификатор модели остается «openai/gpt-4o-2024-05-13».
GPT-4o принимает файлы в качестве входных данных. Поддерживаемые форматы включают PDF, документы Microsoft Office (Word, Excel, PowerPoint), текстовые файлы и форматы изображений. Для PDF и файлов Office модель извлекает текстовое содержимое и анализирует макет. Она не отображает напрямую сложное форматирование, а читает текстовое содержимое. Это полезно для обработки отчетов, контрактов, электронных таблиц или презентаций без ручного извлечения. Содержимое файла токенизируется и учитывается в общем количестве входных токенов. Модель может отвечать на вопросы о содержимом файлов, составлять их краткое содержание или выполнять вычисления над табличными данными. При использовании файлов вы включаете их как часть содержимого сообщения с помощью соответствующих полей API OpenAI. OrcaRouter обрабатывает передачу без изменений. Обратите внимание, что возможности модели зависят от качества извлеченного текста; сильно отсканированные изображения в PDF могут быть не полностью читаемы, если только они не содержат встроенные текстовые слои.
GPT-4o — это премиальная модель с более высокой стоимостью по сравнению с альтернативами, такими как GPT-4o-mini или более ранние варианты GPT-3.5. Если ваша задача не требует мультимодальных возможностей (например, только текст), большого контекста (до 128K) или уровня математического мышления, измеренного на MATH-500 (79.1), более дешевая модель может быть экономичнее. Например, простая классификация, генерация короткого контента или базовый чат могут быть выполнены более дешевыми моделями, которые все еще обеспечивают приемлемое качество. Кроме того, если ваше приложение чувствительно к задержкам и меньшая модель работает быстрее, компромисс может склоняться в пользу скорости, а не абсолютной точности. Наконец, если вам редко требуется обрабатывать изображения или файлы, дополнительные мультимодальные возможности излишни. OrcaRouter предлагает ряд моделей, чтобы вы могли выбрать наилучшее соотношение цены и производительности. Оцените требования вашего сценария использования на основе бенчмарков и цен, чтобы определить, оправдывают ли преимущества GPT-4o дополнительные затраты.
GPT-4o может генерировать до 16 384 токенов на один запрос. Это щедрый лимит, позволяющий создавать развёрнутые ответы, подробный код или многоабзацевые анализы. Однако выходные токены тарифицируются по ставке 15,00 доллара за миллион, поэтому более длинные ответы обходятся дороже. Вы можете управлять длиной вывода с помощью параметра max_tokens в вызове API. Если вы планируете очень длинные генерации, рассмотрите возможность пакетной обработки или разделения запроса. Лимит в 16 384 токена распространяется на всю законченную последовательность, включая шаги рассуждения или цепочки мыслей, если они запрошены. Для очень сложных задач, требующих продолжительного обдумывания, может потребоваться несколько вызовов. На OrcaRouter количество выходных токенов указывается в поле usage ответа API, что позволяет точно отслеживать затраты. OrcaRouter не накладывает дополнительных ограничений — действует собственный лимит модели.
GPT-4o набрал 79.1 балла на тесте MATH-500. MATH-500 включает 500 сложных математических задач по различным темам, таким как алгебра, геометрия, теория чисел и теория вероятностей. Оценка 79.1 означает, что модель правильно ответила на 79.1% задач. Это сильный результат, который свидетельствует о надежной способности к математическому рассуждению, особенно для мультимодальной модели. Тест проверяет как решение задач, так и пошаговое рассуждение. Эта оценка может задать ожидания для приложений, связанных с репетиторством по математике, научными вычислениями или логическими головоломками. Обратите внимание, что производительность на тесте не гарантирует идентичных результатов в реальных задачах; может потребоваться доменная настройка или разработка промптов. При рассмотрении этой модели сравнивайте ее оценку MATH-500 с оценками других моделей, которые вы оцениваете. OrcaRouter не предоставляет дополнительных данных тестирования, поэтому это единственная точка отсчета для данной модели.
Задержка зависит от нескольких факторов: длины входных данных, длины ожидаемого вывода, текущей нагрузки на серверы OpenAI и сетевого пути между вашим приложением и OrcaRouter. OrcaRouter не добавляет значительных накладных расходов сверх времени ответа базового провайдера. Для типичных запросов с умеренным вводом (несколько тысяч токенов) и коротким выводом (до 1,000 токенов) ответы часто поступают в течение нескольких секунд. Более длинные выводы (близкие к 16,384 токенам) естественно займут больше времени, поскольку модель генерирует токены последовательно. Ввод изображений также увеличивает задержку из-за токенизации и обработки. Вы можете оптимизировать задержку, сокращая длину вывода, используя более короткие промпты или пакетируя запросы. OrcaRouter предоставляет стандартные конечные точки API, которые возвращают результаты асинхронно через потоковую передачу, если это необходимо. Для интерактивных приложений реального времени рассмотрите возможность использования потокового режима (stream: true), чтобы начать обработку сразу после поступления токенов. Конкретные значения задержки не указаны в характеристиках модели, поэтому это качественные оценки.
**Сильные стороны:** Мультимодальный ввод (текст, изображение, файл), большое контекстное окно (128K), сильные математические рассуждения (MATH-500: 79.1) и высокий лимит выходных токенов (16 384). Эффективно обрабатывает длинные документы и многошаговые диалоги. API совместим со стандартом OpenAI, что упрощает интеграцию. **Ограничения:** Более высокая стоимость по сравнению с меньшими моделями. Не оптимизирован для задач, не требующих мультимодальности или большого контекста. Нет информации о производительности на неродных языках или о конкретных тестах безопасности. Понимание изображений может быть ограничено для очень сложных сцен или изображений с низким разрешением. Также модель может выдавать неверные ответы на задачи, выходящие за рамки её обучающего распределения. Отсутствует гарантия задержки. Для пользователей, которым требуется чрезвычайно низкая задержка или крайне низкая стоимость, лучше подойдёт другая модель. Результат 79.1 на MATH-500 указывает на потенциал улучшения самых сложных математических задач. Оцените, соответствуют ли эти компромиссы требованиям вашего приложения.
GPT-4o тарифицируется за токен, с отдельными ставками для входных и выходных токенов. Входные токены стоят $5.00 за 1 миллион токенов. Выходные токены — $15.00 за 1 миллион токенов. Это тарифы провайдера, передаваемые через OrcaRouter без наценки. Стоимость за запрос = (входные токены/1e6 * 5) + (выходные токены/1e6 * 15). Например, разговор с 4,000 входных токенов и 200 выходных токенов будет стоить (0.004*$5) + (0.0002*$15) = $0.02 + $0.003 = $0.023. Нет дополнительных сборов за сами API-вызовы; вы платите только за потребленные токены. Цены обновляются динамически на основе изменений провайдера; OrcaRouter передает любые будущие корректировки. Поскольку наценка отсутствует, пользователи получают те же тарифы, что и прямые клиенты OpenAI, но с удобством единого управления и выставления счетов от OrcaRouter. Имейте в виду, что изображения и файлы токенизируются и учитываются в количестве входных токенов, что часто увеличивает стоимость по сравнению с текстовыми вводами.
Нет. OrcaRouter не предлагает скидки, кэшированные токены или сниженные цены за повторные вводы. Каждый токен оплачивается по стандартной ставке провайдера. Отдельная плата за кэширование или надбавки за большой объём отсутствуют. $5/$15 за миллион токенов — это фиксированные тарифы. Пользователям, которым требуется очень высокая пропускная способность, могут обратиться за индивидуальными условиями, но стандартное обслуживание не включает оптовые скидки. Кроме того, нет скрытых платежей, таких как плата за подключение или ежемесячный минимум. Ценообразование прозрачно и напрямую привязано к использованию токенов. Для оптимизации затрат рассмотрите возможность уменьшения размера ввода (например, сокращение истории, использование более коротких запросов) и длины вывода (например, установка более низкого max_tokens). Также использование модели только при необходимости её возможностей (мультимодальность, большой контекст) помогает контролировать расходы. Если ваше приложение имеет повторяющиеся запросы, идентичные каждый раз, кэширование на уровне приложения может сократить использование токенов, но сам OrcaRouter не предоставляет такой функции.
GPT-4o имеет премиальную цену. Для многих задач может быть достаточно более дешевой модели (например, GPT-4o-mini или GPT-3.5-turbo). Сделайте компромисс, оценив сложность и требуемую точность. Если ваша задача включает простое извлечение или классификацию с ограниченным контекстом, более дешевая модель может показать аналогичные результаты за долю стоимости. И наоборот, если задача требует тонкого понимания изображений, длинных документов или высокой математической точности (оценка MATH-500 79.1 против более низких оценок у более дешевых моделей), GPT-4o может стоить своей премии. Используйте A/B-тестирование на репрезентативной выборке для сравнения качества и стоимости. Также учтите, что одинаковая цена за миллион токенов применяется независимо от длины текста; короткие запросы дешевле. Если ваш рабочий процесс часто использует полный контекст 128K, затраты на входные токены для такого запроса могут быть высокими; убедитесь, что контекст действительно необходим. OrcaRouter предоставляет метрики использования, чтобы вы могли отслеживать и оптимизировать.
Для вызова GPT-4o на OrcaRouter используйте совместимый с OpenAI API эндпоинт: base_url = "https://api.orcarouter.ai/v1". Установите параметр model в значение "openai/gpt-4o-2024-05-13". Вам понадобится API-ключ от OrcaRouter. Формат запроса соответствует стандартному OpenAI Chat Completions API: массив messages с ролями (system, user, assistant), опциональное содержимое для изображений и файлов, а также параметры, такие как temperature, max_tokens, top_p, frequency_penalty, presence_penalty и stop. Например, простой текстовый запрос отправляется как POST на /chat/completions. Для изображений включите содержимое как часть сообщения пользователя с типом "image_url". Для файлов также включите их как часть содержимого (конкретный формат соответствует спецификации OpenAI). Ответ будет содержать сообщение ассистента, статистику использования (prompt_tokens, completion_tokens, total_tokens) и другие метаданные. Никаких специальных заголовков, кроме стандартных Content-Type и Authorization, не требуется. Интеграция идентична прямому использованию OpenAI.
Все стандартные параметры OpenAI Chat Completions поддерживаются: messages (обязательный), model (обязательный, установлен на "openai/gpt-4o-2024-05-13"), temperature (0–2, по умолчанию 1), top_p (0–1, по умолчанию 1), n (количество завершений, по умолчанию 1), stop (строки или список строк), max_tokens (по умолчанию 16,384, ограничение 16,384), presence_penalty (−2 до 2, по умолчанию 0), frequency_penalty (−2 до 2, по умолчанию 0), logit_bias (сопоставление ID токенов с величиной смещения), user (строка для мониторинга нарушений), stream (логическое, по умолчанию false), и functions/tools (для вызова функций). Для мультимодальных вводов содержимое messages может быть массивом частей контента с типом "text" или "image_url". Дополнительно вы можете включать контент типа "file" в соответствии с документацией OpenAI (например, для вложений PDF). OrcaRouter передает эти параметры напрямую провайдеру без изменений. Убедитесь, что не превышаете окно контекста в 128K токенов. API возвращает стандартные коды ошибок для недопустимых запросов, ограничения частоты или ошибок аутентификации.
Миграция проста, поскольку API OrcaRouter полностью совместим с OpenAI. Вам нужно изменить только две вещи: базовый URL с https://api.openai.com/v1 на https://api.orcarouter.ai/v1 и идентификатор модели с "gpt-4o-2024-05-13" на "openai/gpt-4o-2024-05-13". Ваш API-ключ от OrcaRouter заменяет ключ OpenAI. Весь существующий код, использующий библиотеку OpenAI Python/Node или обычные HTTP-запросы, будет работать без других изменений. Формат сообщений, имена параметров и структура ответа идентичны. Для библиотек, принимающих параметр базового URL, просто установите его на конечную точку OrcaRouter. Если вы использовали клиент OpenAI, вы можете создать его экземпляр с base_url, установленным на конечную точку OrcaRouter. Никаких изменений в проектировании подсказок или логике кэширования не требуется. OrcaRouter также поддерживает потоковую передачу (stream: true) и вызов функций точно так же, как и раньше. Тестирование можно провести с помощью небольшого набора запросов, чтобы убедиться, что поведение совпадает.
OrcaRouter не изменяет поведение модели. Он действует исключительно как шлюз, передавая ваши запросы на серверы OpenAI и возвращая ответ без изменений. OrcaRouter не применяет никакой дополнительной предобработки, постобработки или фильтрации контента. Что касается обработки данных: OrcaRouter не хранит и не регистрирует данные подсказок или завершений, за исключением данных, необходимых для выставления счетов и операционного мониторинга. Политики обработки данных OpenAI применяются к использованию модели через OrcaRouter. Согласно предоставленной информации, нет упоминаний о хранении данных OrcaRouter за пределами стандартного логирования API. Пользователям следует ознакомиться с политикой конфиденциальности как OrcaRouter, так и OpenAI, чтобы понять порядок обработки данных. Если у вас есть строгие требования к месту хранения данных, обратитесь в OrcaRouter за информацией о доступных вариантах. Нет никаких указаний на то, что OrcaRouter передает данные другим клиентам. Единственным необходимым изменением является идентификатор модели; никакие пользовательские инструкции не внедряются.
Основные различия между GPT-4o и GPT-4o-mini заключаются в размере контекстного окна, мультимодальных возможностях, производительности на тестах и стоимости. GPT-4o предлагает контекстное окно размером 128К и поддерживает ввод изображений и файлов. GPT-4o-mini (на основе предложений OpenAI) обычно имеет меньший контекст (например, 128К или 16К в некоторых версиях) и может не поддерживать все модальности. На тесте MATH-500 GPT-4o набирает 79,1; GPT-4o-mini наберёт меньше. Цены: GPT-4o стоит $5/$15 за миллион токенов, тогда как GPT-4o-mini значительно дешевле (например, $0,15/$0,60 за миллион токенов в некоторых версиях). Таким образом, GPT-4o-mini подходит для простых задач, где важна низкая стоимость, а GPT-4o лучше для сложных рассуждений, длинного контекста и мультимодальных задач. При выборе между ними учитывайте требования к точности и необходимость работы с изображениями или файлами. OrcaRouter предлагает обе модели под разными идентификаторами. Если ваш рабочий процесс редко использует изображения или большой контекст, GPT-4o-mini может быть экономически более выгодным выбором.
GPT-4o (2024-05-13) — это мультимодальная модель с контекстным окном 128K, в то время как более старые версии GPT-4 (например, gpt-4-0613) обычно имеют контекст 8K или 32K и являются только текстовыми (некоторые более поздние версии поддерживают изображения через отдельные конечные точки для зрения). Цены на GPT-4o ($5/$15 за миллион токенов) в целом ниже, чем цены на GPT-4 Turbo на пике (например, $10/$30 за миллион токенов). Производительность по бенчмаркам: указанный балл MATH-500 79.1 относится к GPT-4o; у GPT-4 не было официального балла MATH-500 в предоставленных данных, но было известно, что он показывает более низкие результаты на аналогичных математических бенчмарках. GPT-4o также предлагает более высокий лимит вывода (16K токенов) по сравнению с более старыми GPT-4 (4K или 8K в зависимости от версии). В целом, GPT-4o обеспечивает лучшее соотношение цены и качества для мультимодальных приложений с длинным контекстом. Однако более старые модели GPT-4 могли быть донастроены для конкретных задач; оцените на своих собственных данных. Через OrcaRouter доступны оба семейства моделей.
Прямое сравнение требует конкретных фактов о моделях, которые здесь не приведены. В целом обе модели конкурентоспособны в рассуждениях и мультимодальных возможностях. GPT-4o имеет контекстное окно размером 128K, аналогично 200K контексту Claude (для Sonnet). Обе модели поддерживают изображения. Результаты бенчмарков различаются: GPT-4o показывает результат MATH-500, равный 79.1; показатели Claude 3.5 Sonnet по этому бенчмарку не предоставлены. Цены: GPT-4o стоит $5/$15 за миллион токенов; цены на Claude Sonnet обычно составляют около $3/$15 за миллион токенов (могут меняться). Таким образом, затраты на ввод для GPT-4o выше. Различия в производительности зависят от задачи: некоторые пользователи считают Claude лучше для длинных текстов, в то время как GPT-4o превосходит в математике и программировании. Без контролируемой оценки рекомендуется тестировать обе модели на репрезентативных выборках. OrcaRouter предлагает обе модели, поэтому вы можете легко сравнить их, изменив ID модели. В конечном итоге лучшая модель зависит от ваших конкретных требований к точности, задержке и стоимости. Предоставленные факты не включают показатели Claude, поэтому это сравнение остается качественным.
Llama 3 (например, Llama 3 70B) — это модель с открытым исходным кодом, которую можно размещать самостоятельно, тогда как GPT-4o является проприетарной и доступна через API. GPT-4o поддерживает мультимодальные входные данные (текст, изображение, файл) с контекстом в 128K, тогда как Llama 3 обычно работает только с текстом (если не дообучена для работы с изображениями) и имеет меньший контекст (например, 8K или 32K). Показатели бенчмарков: балл GPT-4o на MATH-500 — 79,1; Llama 3 70B набирает около 70–75 на аналогичных математических тестах (не из предоставленных фактов, но из общих знаний). Стоимость: стоимость API GPT-4o за токен фиксирована; самостоятельное размещение Llama 3 требует затрат на инфраструктуру (GPU, электричество), которые могут быть ниже при больших объёмах. Задержка: API GPT-4o может быть быстрее при пиковых нагрузках; самостоятельно размещённые модели могут обеспечивать постоянную задержку при зарезервированной мощности. Гибкость: Llama 3 можно дообучать; GPT-4o — нет. Для пользователей, желающих избежать привязки к поставщику или обрабатывать чувствительные данные полностью на собственных серверах, модели с открытым исходным кодом привлекательны. OrcaRouter предоставляет доступ к обоим типам: вы можете использовать GPT-4o через API, а также получать доступ к моделям с открытым исходным кодом через OrcaRouter, если они доступны.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-05-13",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamtemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Ввод / 1M токенов | $5.00 |
|---|---|
| Вывод / 1M токенов | $15.00 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
О чём говорят разработчики на этой неделе
GET /api/public/models/openai/gpt-4o-2024-05-13Открыть @misc{orcarouter_gpt_4o_2024_05_13,
title = {GPT-4o (2024-05-13) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13}
}OpenAI. (2024). GPT-4o (2024-05-13) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13