來自OpenAI的高性價比文本模型,MMLU-Pro得分46.2,通過OrcaRouter API訪問。
openai/gpt-3.5-turbo-0125 是由 OpenAI 開發的文字生成模型,可透過 OrcaRouter 的 API 使用。它是 GPT-3.5-Turbo 系列的一部分,專為對話任務和結構化文字輸出最佳化。此模型僅接受文字輸入並產生文字輸出,最大輸出長度為 4096 個 token。可透過 OrcaRouter 相容於 OpenAI 的端點…
GPT-3.5-Turbo-0125 擅長廣泛的基於文字任務,包括聊天、摘要、翻譯、問答以及內容生成。它能良好地理解指令,並能針對客戶支援、腦力激盪和資料標註產出連貫且符合語境的回應。其訓練資料涵蓋截至2023年4月的多樣化領域,使其在常識和寫作風格上展現合理表現。在結構化輸出方面,若有明確提示,它能格式化JSON或遵循自訂架構。
如果您的應用涉及極大量且簡單重複的任務,例如直觀的分類或單句生成,可以考慮使用較小的模型,如GPT-3.5-Turbo-Instruct,甚至託管在OrcaRouter上的開源替代方案。當Token數量低且準確性要求不高時,成本節省可能相當可觀。不過,GPT-3.5-Turbo-0125對於大多數通用用途仍是具成本效益的選擇,特別是在MMLU-Pro上擁有46.2分的強勁基準成績。
是的,該模型已針對多語言文本進行訓練,但英文表現最為出色。它能理解並生成多種語言的文字,包括西班牙文、法文、中文、阿拉伯文等。若語言在訓練資料中代表性不足,或包含高度慣用的表達方式,其準確度可能會下降。對於需要精確多語流暢度的任務,建議搭配語言專屬的微調或使用原生模型。輸入與輸出皆為文字,因此支援非英文字元。
由於總上下文窗口為16,385個token(眾所周知的公開規格),該模型可以在單次處理中處理中等長度的文檔。然而,每次請求的輸出限制為4096個token。對於較長的輸出,您需要實現map-reduce或sliding window方法。模型的注意力機制可以在整個上下文中保持連貫性,但對於需要引用長提示詞開頭的任務,性能可能會下降。建議對非常長的文本使用分塊和摘要策略。
MMLU-Pro 是大規模多任務語言理解基準的增強版本,用於衡量模型在涵蓋科學、法律、人文等 57 個學科中回答問題的能力。得分 46.2 表示 GPT-3.5-Turbo-0125 正確回答了約 46.2% 的問題,在較小模型中具有競爭力。這個分數反映了強大的通用知識,但與 GPT-4 等較大模型相比仍有改進空間。對於需要深度專業知識的任務,建議在特定領域的基準上評估模型。
確切延遲取決於請求大小、網路狀況以及 OpenAI 基礎設施的當前負載。在典型使用中,GPT-3.5-Turbo-0125 對短提示的回應時間通常在數秒內,往往比大型模型更快。OrcaRouter 不會在提供者的回應時間之外增加顯著開銷。對於即時應用,請使用您的工作負載進行測試。該模型的速度與成本使其成為互動式聊天機器人和生產管線的熱門選擇,尤其在每個請求的延遲至關重要的情境中。
GPT-3.5-Turbo-0125 因其可靠性、一致的格式和強大的指令遵循能力而被廣泛使用。它很少無法產生連貫的回應,並能優雅地處理錯字或模糊措辭。其訓練資料涵蓋至2023年4月,使其能準確回答該時期的時事。該模型還支援系統訊息來設定行為,方便針對不同應用進行自訂,例如角色扮演或受限生成。
此模型可能在複雜推理、多步驟算術以及非常微妙的指令上表現不佳。它有時會產生聽起來合理但錯誤的答案(幻覺),且可能無法始終如一地執行嚴格的格式規則。其輸出長度上限為4096個令牌,可能不足以應付長篇內容生成。此外,它預設情況下缺乏網路存取權限,無法檢索即時資訊或在聊天介面之外執行操作。對於進階邏輯或最新數據,請考慮使用檢索增強生成(RAG)或更強大的模型。
OrcaRouter 以 OpenAI 的原始定價傳遞,無任何加價:輸入 token 每百萬個 $0.50,輸出 token 每百萬個 $1.50。除這些 token 費率外,無任何額外平台費、訂閱費或每次請求費用。輸入 token 包括提示、系統訊息和對話歷史;輸出 token 則為生成的回應。計費基於處理的 token 數量,透過 GPT-3.5 的 tiktoken 分詞器測量。
雖然 GPT-3.5-Turbo-0125 已是 OpenAI 最具成本效益的模型之一,但你仍可透過發送更簡短的提示、盡可能縮短對話歷史,以及在用途允許下使用較小的 max_tokens 值,來進一步優化。若非必要,請避免使用過長的系統訊息。對於極高流量的情境,可考慮是否能在 OrcaRouter 上使用免費或開源模型來滿足你的準確度需求。取捨在於,較便宜的模型可能需要更嚴謹的提示工程或微調。
OrcaRouter 目前不提供內建的提示或回應快取機制。每次 API 呼叫會根據該請求中發送和接收的 token 進行計費。如果您在多個呼叫中重複使用相同的提示(例如相同的系統訊息),每次都會被收取這些 token 的費用。為了降低成本,建議在應用程式層級快取相同的請求,或將多個查詢批次處理成一個包含多個使用者訊息的單一提示。
使用標準的 OpenAI Chat Completions 端點,基礎 URL 為 https://api.orcarouter.ai/v1。將模型參數設為 'openai/gpt-3.5-turbo-0125'。在 Authorization 標頭中包含你的 OrcaRouter API 金鑰。使用 cURL 的範例:curl https://api.orcarouter.ai/v1/chat/completions -H 'Authorization: Bearer YOUR_API_KEY' -H 'Content-Type: application/json' -d '{"model":"openai/gpt-3.5-turbo-0125","messages":[{"role":"user","content":"Hello"}]}'。回應格式符合 OpenAI 的規格。
所有標準的 OpenAI 聊天補全參數皆可使用,包括:'messages'、'max_tokens'(最高 4096)、'temperature'、'top_p'、'frequency_penalty'、'presence_penalty'、'stop' 及 'stream'。同時也支援 'n'(補全數量)。此模型在 OrcaRouter 閘道上不支援 'logprobs' 或 'logit_bias'。請注意,'max_tokens' 參數上限為 4096,以符合模型的輸出限制。若要使用串流,請設定 'stream': true 以接收增量差異。
如果你目前直接使用 OpenAI,遷移至 OrcaRouter 非常簡單:將基礎 URL 從 https://api.openai.com/v1 改為 https://api.orcarouter.ai/v1,如果你之前使用的是通用別名,請將模型 ID 更新為 'openai/gpt-3.5-turbo-0125',並將你的 API 金鑰替換為 OrcaRouter 提供的金鑰。訊息格式或參數無需任何程式碼變更。如果你之前使用的是其他供應商,請確保你的客戶端函式庫支援 OpenAI 相容的架構。OrcaRouter 提供了直接的替代方案。
GPT-4 在複雜推理、事實準確性及遵循細微指令方面通常優於 GPT-3.5-Turbo-0125,這反映在 MMLU 及其他測試中較高的基準分數上。然而,GPT-4 的價格顯著較高(通常每 Token 成本為 10 倍),且可能具有更高的延遲。對於不需要 GPT-4 深度的任務,GPT-3.5-Turbo-0125 提供了極具吸引力的性價比平衡點。在進行進階分析或誤差範圍較窄時,請選擇較大的模型。
Anthropic的Claude 3 Haiku是具競爭力的低成本模型,具備快速推論與強大的安全功能。兩者皆為純文字模型,專為高流量應用設計。雖然具體基準測試比較各有不同,GPT-3.5-Turbo-0125已被廣泛採用,並受益於豐富的文件與生態系統。Claude 3 Haiku在創意寫作與拒絕行為上可能具有不同優勢。選擇取決於開發者偏好與整合需求。OrcaRouter支援這兩種模型,因此您可以直接進行比較。
開源模型(例如 Llama 3、Mistral)可以在自己的硬體上運行,或透過 OrcaRouter 來降低每 token 成本,尤其是在大規模使用時。然而,它們通常需要更多的設定和提示工程,且指令遵循能力可能較弱。GPT-3.5-Turbo-0125 提供開箱即用的可靠性、一致的品質,以及零基礎設施管理。對於沒有機器學習專業知識的團隊,託管 API 通常是更好的選擇。請針對你的具體工作負載執行基準測試來做決定。
OpenAI 可能會發布更新版本的 GPT-3.5-Turbo,或淘汰此特定快照。OrcaRouter 會相應地更新可用的模型。如果您的應用程式依賴於一致的行為,您可能希望透過使用確切的模型 ID 來鎖定特定模型版本。OrcaRouter 會提前通知淘汰事宜。對於高風險的生產系統,建議在切換前先在測試環境中針對新版本進行測試。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-3.5-turbo-0125",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_pparallel_tool_calls| 輸入 / 1M tokens | $0.500 |
| 輸出 / 1M tokens | $1.50 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
@misc{orcarouter_gpt_3_5_turbo_0125,
title = {openai/gpt-3.5-turbo-0125 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125}
}openai. (n.d.). openai/gpt-3.5-turbo-0125 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125