Экономичная текстовая модель от OpenAI с показателем MMLU-Pro 46.2, доступная через OrcaRouter API.
openai/gpt-3.5-turbo-0125 — это модель генерации текста, разработанная OpenAI и доступная через API OrcaRouter. Она входит в семейство GPT-3.5-Turbo, оптимизирована для диалоговых задач и…
GPT-3.5-Turbo-0125 отлично справляется с широким спектром текстовых задач, включая чат, обобщение, перевод, ответы на вопросы и генерацию контента. Он хорошо выполняет инструкции и может создавать связные, контекстуально подходящие ответы для службы поддержки, мозгового штурма и разметки данных. Его обучающие данные охватывают различные области до апреля 2023 года, что позволяет добиться приемлемой производительности в отношении общеизвестных знаний и стилей письма. Для структурированного вывода он может форматировать JSON или следовать пользовательским схемам при четком указании.
Если ваше приложение предполагает очень высокие объёмы с простыми повторяющимися задачами, такими как прямая классификация или генерация одиночных предложений, вы можете рассмотреть использование меньших моделей, например GPT-3.5-Turbo-Instruct, или даже альтернатив с открытым исходным кодом, размещённых на OrcaRouter. Экономия средств может быть значительной при низком количестве токенов и минимальных требованиях к точности. Однако GPT-3.5-Turbo-0125 остаётся экономически эффективным выбором для большинства задач общего назначения, особенно учитывая его высокий бенчмарковый показатель 46.2 на MMLU-Pro.
Да, модель обучалась на многоязычном тексте, однако её наилучшие результаты достигаются на английском языке. Она может понимать и генерировать текст на многих языках, включая испанский, французский, китайский, арабский и другие. Точность может снижаться для языков, недостаточно представленных в обучающих данных, или для сложных идиоматических выражений. Для задач, требующих точного многоязычного владения, рекомендуется дополнить модель тонкой настройкой на конкретный язык или использовать нативную модель. Входные и выходные данные всегда являются текстом, поэтому поддерживаются символы не только английского языка.
Поскольку общий контекстный окно составляет 16 385 токенов (широко известная публичная спецификация), модель может обрабатывать документы средней длины за один проход. Однако вывод ограничен 4096 токенами на запрос. Для более длинных результатов необходимо реализовать подход map-reduce или скользящего окна. Механизм внимания модели может поддерживать связность во всём контексте, но производительность может снижаться для задач, требующих обращения к самому началу длинного промпта. Для очень длинных текстов рекомендуется использование стратегий разбиения на части и суммаризации.
MMLU-Pro — это улучшенная версия бенчмарка Massive Multitask Language Understanding, оценивающая способность модели отвечать на вопросы по 57 предметам, включая естественные науки, право и гуманитарные науки. Результат 46.2 означает, что GPT-3.5-Turbo-0125 правильно отвечает примерно на 46.2% вопросов, что является конкурентоспособным показателем среди небольших моделей. Этот балл отражает хорошие общие знания, но также показывает, что есть возможности для улучшения по сравнению с более крупными моделями, такими как GPT-4. Для задач, требующих глубокой экспертизы, рассмотрите возможность оценки модели на предметно-ориентированных бенчмарках.
Точная задержка зависит от размера запроса, состояния сети и текущей нагрузки на инфраструктуру OpenAI. При обычном использовании GPT-3.5-Turbo-0125 отвечает в течение нескольких секунд на короткие запросы, часто быстрее, чем более крупные модели. OrcaRouter не добавляет значительных накладных расходов сверх времени ответа провайдера. Для приложений реального времени протестируйте с вашей нагрузкой. Скорость и стоимость модели делают её популярным выбором для интерактивных чат-ботов и производственных конвейеров, где важна задержка на каждый запрос.
GPT-3.5-Turbo-0125 широко используется благодаря своей надежности, единообразному форматированию и высокой способности следовать инструкциям. Он редко выдает несвязные ответы и легко справляется с опечатками или неоднозначными формулировками. Охват его обучающих данных до апреля 2023 года позволяет точно отвечать на вопросы о текущих событиях того периода. Модель также поддерживает системные сообщения для настройки поведения, что упрощает ее адаптацию для различных приложений, таких как ролевые игры или генерация с ограничениями.
Эта модель может испытывать трудности со сложными рассуждениями, многошаговыми вычислениями и очень тонкими инструкциями. Она иногда может выдавать правдоподобные, но неверные ответы (галлюцинации) и не всегда последовательно соблюдать строгие правила форматирования. Максимальная длина её вывода составляет 4096 токенов, что может быть недостаточно для генерации длинного контента. Кроме того, по умолчанию она не имеет доступа к интернету и не может получать актуальную информацию или выполнять действия за пределами интерфейса чата. Для сложной логики или актуальных данных рассмотрите использование генерации с дополнением поиска (RAG) или более мощной модели.
OrcaRouter передает точные цены OpenAI без наценки: $0.50 за 1 миллион входных токенов и $1.50 за 1 миллион выходных токенов. Нет дополнительной платы за платформу, стоимости подписки или платы за каждый запрос, помимо этих тарифов на токены. Входные токены включают промпт, системное сообщение и историю разговора; выходные токены — это сгенерированный ответ. Выставление счетов производится на основе количества обработанных токенов, измеряемых токенизатором tiktoken для GPT-3.5.
Хотя GPT-3.5-Turbo-0125 уже является одной из самых экономически эффективных моделей от OpenAI, вы можете дополнительно оптимизировать использование, отправляя более короткие подсказки, обрезая историю разговора по возможности и используя меньшее значение max_tokens, если это позволяет ваш сценарий использования. Избегайте чрезмерно длинных системных сообщений, если они не нужны. Для очень больших объёмов рассмотрите, может ли бесплатная или открытая модель на OrcaRouter соответствовать вашим требованиям к точности. Компромисс заключается в том, что более дешёвые модели могут потребовать более тщательной разработки подсказок или тонкой настройки.
OrcaRouter в настоящее время не предоставляет встроенного механизма кэширования для промптов или ответов. Каждый API-вызов тарифицируется на основе токенов, отправленных и полученных в этом запросе. Если вы повторно используете один и тот же промпт в нескольких вызовах (например, одинаковые системные сообщения), вы платите за эти токены каждый раз. Чтобы снизить затраты, рассмотрите возможность кэширования идентичных запросов на уровне приложения или группировки нескольких запросов в один промпт с несколькими пользовательскими сообщениями.
Используйте стандартную конечную точку OpenAI Chat Completions с базовым URL https://api.orcarouter.ai/v1. Укажите параметр модели 'openai/gpt-3.5-turbo-0125'. Включите ваш API-ключ OrcaRouter в заголовок Authorization. Пример с помощью cURL: curl https://api.orcarouter.ai/v1/chat/completions -H 'Authorization: Bearer YOUR_API_KEY' -H 'Content-Type: application/json' -d '{"model":"openai/gpt-3.5-turbo-0125","messages":[{"role":"user","content":"Hello"}]}'. Формат ответа соответствует спецификации OpenAI.
Все стандартные параметры OpenAI chat completions доступны, включая: 'messages', 'max_tokens' (до 4096), 'temperature', 'top_p', 'frequency_penalty', 'presence_penalty', 'stop' и 'stream'. Также поддерживается параметр 'n' (количество завершений). Для этой модели на шлюзе OrcaRouter не поддерживаются 'logprobs' или 'logit_bias'. Обратите внимание, что параметр 'max_tokens' ограничен 4096, чтобы соответствовать лимиту вывода модели. Для потоковой передачи установите 'stream': true, чтобы получать инкрементальные обновления.
Если вы сейчас используете OpenAI напрямую, миграция на OrcaRouter проста: измените базовый URL с https://api.openai.com/v1 на https://api.orcarouter.ai/v1, обновите ID модели на 'openai/gpt-3.5-turbo-0125', если вы использовали общий псевдоним, и замените свой API-ключ на ключ от OrcaRouter. Никаких изменений кода в формате сообщений или параметрах не требуется. Если вы использовали другого провайдера, убедитесь, что ваша клиентская библиотека поддерживает схему, совместимую с OpenAI. OrcaRouter обеспечивает прямую замену.
GPT-4 обычно превосходит GPT-3.5-Turbo-0125 в сложных рассуждениях, фактической точности и следовании нюансированным инструкциям, что подтверждается более высокими показателями бенчмарков MMLU и других тестов. Однако GPT-4 значительно дороже (обычно в 10 раз больше стоимость за токен) и может иметь более высокую задержку. GPT-3.5-Turbo-0125 предлагает привлекательное соотношение цены и производительности для задач, не требующих глубины GPT-4. Выбирайте более крупную модель для продвинутого анализа или в случаях, где допустимая погрешность мала.
Anthropic's Claude 3 Haiku — это конкурирующая недорогая модель с быстрым выводом и надежными функциями безопасности. Обе модели работают только с текстом и предназначены для высоконагруженных приложений. Хотя конкретные сравнения бенчмарков различаются, GPT-3.5-Turbo-0125 широко распространена и выигрывает от обширной документации и экосистемы. Claude 3 Haiku может иметь иные сильные стороны в творческом письме и поведении отказа. Выбор зависит от предпочтений разработчика и требований к интеграции. OrcaRouter поддерживает обе модели, поэтому вы можете сравнить их напрямую.
Модели с открытым исходным кодом (например, Llama 3, Mistral) могут выполняться на вашем собственном оборудовании или через OrcaRouter для потенциально более низкой стоимости за токен, особенно в масштабе. Однако они часто требуют больше настройки, инженерии промптов и могут хуже следовать инструкциям. GPT-3.5-Turbo-0125 предлагает надежность «под ключ», стабильное качество и отсутствие управления инфраструктурой. Для команд без опыта в ML использование управляемого API часто предпочтительнее. Запустите бенчмарки на вашей конкретной рабочей нагрузке, чтобы принять решение.
OpenAI может выпустить новые версии GPT-3.5-Turbo или прекратить поддержку этого конкретного снимка. OrcaRouter обновит доступные модели соответствующим образом. Если ваше приложение зависит от стабильного поведения, вы можете закрепить конкретную версию модели, используя точный идентификатор модели. OrcaRouter предоставляет предварительное уведомление о прекращении поддержки. Для высокорисковых производственных систем рассмотрите тестирование новых версий в промежуточной среде перед переключением.
Совместимо с OpenAI — оставьте свой SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-3.5-turbo-0125",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_pparallel_tool_calls| Ввод / 1M токенов | $0.500 |
| Вывод / 1M токенов | $1.50 |
| Валюта | USD |
Оценка по прайс-листу
Только оценка — фактическое число токенов зависит от токенизатора провайдера.
GET /api/public/models/openai/gpt-3.5-turbo-0125Открыть @misc{orcarouter_gpt_3_5_turbo_0125,
title = {openai/gpt-3.5-turbo-0125 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125}
}openai. (n.d.). openai/gpt-3.5-turbo-0125 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125