Mô hình văn bản hiệu quả về chi phí từ OpenAI với điểm MMLU-Pro 46.2, truy cập qua API OrcaRouter.
openai/gpt-3.5-turbo-0125 là một mô hình tạo văn bản do OpenAI phát triển và có sẵn qua API của OrcaRouter. Nó thuộc dòng GPT-3.5-Turbo, được tối ưu hóa cho các tác vụ hội thoại và đầu ra văn bản có…
GPT-3.5-Turbo-0125 xuất sắc trong nhiều tác vụ dựa trên văn bản, bao gồm trò chuyện, tóm tắt, dịch thuật, trả lời câu hỏi và tạo nội dung. Nó xử lý tốt các hướng dẫn và có thể tạo ra phản hồi mạch lạc, phù hợp ngữ cảnh cho hỗ trợ khách hàng, động não và gắn nhãn dữ liệu. Dữ liệu huấn luyện của nó bao gồm nhiều lĩnh vực đa dạng cho đến tháng 4 năm 2023, cho phép hiệu suất hợp lý về kiến thức phổ thông và phong cách viết. Đối với đầu ra có cấu trúc, nó có thể định dạng JSON hoặc tuân theo các lược đồ tùy chỉnh khi được nhắc rõ ràng.
Nếu ứng dụng của bạn liên quan đến khối lượng rất lớn với các tác vụ đơn giản, lặp đi lặp lại như phân loại đơn giản hoặc tạo câu đơn, bạn có thể cân nhắc sử dụng các mô hình nhỏ hơn như GPT-3.5-Turbo-Instruct hoặc thậm chí các giải pháp mã nguồn mở được lưu trữ trên OrcaRouter. Chi phí có thể được tiết kiệm đáng kể khi số lượng token thấp và yêu cầu về độ chính xác ở mức tối thiểu. Tuy nhiên, GPT-3.5-Turbo-0125 vẫn là một lựa chọn hiệu quả về chi phí cho hầu hết các mục đích sử dụng chung, đặc biệt là với điểm chuẩn mạnh mẽ 46.2 trên MMLU-Pro.
Có, mô hình đã được huấn luyện trên văn bản đa ngôn ngữ, mặc dù hiệu suất mạnh nhất của nó là trên tiếng Anh. Nó có thể hiểu và tạo văn bản bằng nhiều ngôn ngữ bao gồm tiếng Tây Ban Nha, tiếng Pháp, tiếng Trung, tiếng Ả Rập và các ngôn ngữ khác. Độ chính xác có thể giảm đối với các ngôn ngữ có ít đại diện trong dữ liệu huấn luyện hoặc các biểu đạt mang tính thành ngữ cao. Đối với các tác vụ yêu cầu khả năng đa ngôn ngữ chính xác, hãy cân nhắc bổ sung tinh chỉnh theo ngôn ngữ cụ thể hoặc sử dụng mô hình bản địa. Đầu vào và đầu ra luôn là văn bản, do đó các ký tự không phải tiếng Anh đều được hỗ trợ.
Vì tổng cửa sổ ngữ cảnh là 16,385 token (thông số kỹ thuật công khai được biết đến rộng rãi), mô hình có thể xử lý các tài liệu có độ dài vừa phải trong một lần duy nhất. Tuy nhiên, đầu ra bị giới hạn ở 4096 token cho mỗi yêu cầu. Đối với các đầu ra dài hơn, bạn phải triển khai phương pháp map-reduce hoặc cửa sổ trượt. Cơ chế chú ý của mô hình có thể duy trì sự mạch lạc trên toàn bộ ngữ cảnh, nhưng hiệu suất có thể suy giảm đối với các tác vụ yêu cầu tham chiếu đến phần đầu của một prompt dài. Các chiến lược phân đoạn và tóm tắt được khuyến nghị cho các văn bản rất dài.
MMLU-Pro là phiên bản nâng cao của benchmark Massive Multitask Language Understanding, đo lường khả năng của mô hình trong việc trả lời các câu hỏi trên 57 chủ đề bao gồm khoa học, luật pháp và nhân văn. Điểm số 46.2 cho thấy GPT-3.5-Turbo-0125 trả lời đúng khoảng 46.2% các câu hỏi, mức cạnh tranh trong số các mô hình nhỏ hơn. Điểm số này phản ánh kiến thức tổng quát mạnh nhưng cũng cho thấy còn cần cải thiện so với các mô hình lớn hơn như GPT-4. Đối với các tác vụ yêu cầu chuyên môn sâu, hãy cân nhắc đánh giá mô hình trên các benchmark dành riêng cho lĩnh vực.
Độ trễ chính xác phụ thuộc vào kích thước yêu cầu, điều kiện mạng và tải hiện tại trên hạ tầng của OpenAI. Trong sử dụng thông thường, GPT-3.5-Turbo-0125 phản hồi trong vài giây đối với các lời nhắc ngắn, thường nhanh hơn các mô hình lớn hơn. OrcaRouter không gây thêm độ trễ đáng kể ngoài thời gian phản hồi của nhà cung cấp. Đối với các ứng dụng thời gian thực, hãy kiểm tra với khối lượng công việc của bạn. Tốc độ và chi phí của mô hình khiến nó trở thành lựa chọn phổ biến cho các chatbot tương tác và quy trình sản xuất nơi độ trễ từng yêu cầu có tầm quan trọng.
GPT-3.5-Turbo-0125 được sử dụng rộng rãi nhờ độ tin cậy, định dạng nhất quán và khả năng làm theo hướng dẫn mạnh mẽ. Nó hiếm khi thất bại trong việc tạo ra phản hồi mạch lạc và xử lý tốt các lỗi chính tả hoặc cách diễn đạt mơ hồ. Dữ liệu huấn luyện của nó bao gồm đến tháng 4 năm 2023 cho phép nó trả lời chính xác các sự kiện hiện tại trong khoảng thời gian đó. Mô hình cũng hỗ trợ tin nhắn hệ thống để thiết lập hành vi, giúp dễ dàng tùy chỉnh cho các ứng dụng khác nhau như nhập vai hoặc tạo sinh có ràng buộc.
Mô hình này có thể gặp khó khăn trong suy luận phức tạp, tính toán nhiều bước và các hướng dẫn rất chi tiết. Đôi khi nó có thể đưa ra các câu trả lời nghe có vẻ hợp lý nhưng không chính xác (ảo giác) và có thể không nhất quán trong việc tuân thủ các quy tắc định dạng nghiêm ngặt. Độ dài đầu ra của nó bị giới hạn ở 4096 token, có thể không đủ cho việc tạo nội dung dài. Ngoài ra, theo mặc định, nó không có quyền truy cập internet và không thể truy xuất thông tin thời gian thực hoặc thực hiện các hành động bên ngoài giao diện trò chuyện. Đối với logic nâng cao hoặc dữ liệu cập nhật, hãy cân nhắc sử dụng phương pháp tăng cường truy xuất (RAG) hoặc một mô hình mạnh hơn.
OrcaRouter cho phép chuyển qua mức giá chính xác của OpenAI mà không có phụ phí: $0.50 cho 1 triệu token đầu vào và $1.50 cho 1 triệu token đầu ra. Không có phí nền tảng bổ sung, phí đăng ký, hoặc phí theo yêu cầu nào ngoài các mức token này. Token đầu vào bao gồm prompt, thông báo hệ thống và lịch sử hội thoại; token đầu ra là phản hồi được tạo ra. Việc tính phí dựa trên số lượng token được xử lý, được đo bằng bộ token hóa tiktoken cho GPT-3.5.
Mặc dù GPT-3.5-Turbo-0125 đã là một trong những mô hình hiệu quả về chi phí nhất từ OpenAI, bạn có thể tối ưu hơn nữa bằng cách gửi các prompt ngắn hơn, cắt bớt lịch sử hội thoại khi có thể, và sử dụng giá trị max_tokens nhỏ hơn nếu trường hợp sử dụng cho phép. Tránh các thông báo hệ thống quá dài nếu không cần thiết. Đối với khối lượng rất lớn, hãy cân nhắc xem một mô hình miễn phí hoặc mã nguồn mở trên OrcaRouter có thể đáp ứng yêu cầu về độ chính xác của bạn hay không. Sự đánh đổi là các mô hình rẻ hơn có thể yêu cầu kỹ thuật prompt hoặc tinh chỉnh chặt chẽ hơn.
OrcaRouter hiện không cung cấp cơ chế lưu đệm tích hợp sẵn cho lời nhắc hoặc phản hồi. Mỗi lệnh gọi API được tính phí dựa trên số token được gửi và nhận trong yêu cầu đó. Nếu bạn sử dụng lại cùng một lời nhắc trong nhiều lệnh gọi (ví dụ: các thông báo hệ thống giống hệt nhau), bạn sẽ bị tính phí cho các token đó mỗi lần. Để giảm chi phí, hãy cân nhắc lưu đệm các yêu cầu giống hệt nhau ở cấp ứng dụng hoặc gộp nhiều truy vấn thành một lời nhắc duy nhất với nhiều tin nhắn người dùng.
Sử dụng endpoint Chat Completions tiêu chuẩn của OpenAI với base URL https://api.orcarouter.ai/v1. Đặt tham số model thành 'openai/gpt-3.5-turbo-0125'. Bao gồm khóa API OrcaRouter của bạn trong header Authorization. Ví dụ sử dụng cURL: curl https://api.orcarouter.ai/v1/chat/completions -H 'Authorization: Bearer YOUR_API_KEY' -H 'Content-Type: application/json' -d '{"model":"openai/gpt-3.5-turbo-0125","messages":[{"role":"user","content":"Hello"}]}'. Định dạng phản hồi tuân theo thông số kỹ thuật của OpenAI.
Tất cả các tham số hoàn tất trò chuyện tiêu chuẩn của OpenAI đều có sẵn, bao gồm: 'messages', 'max_tokens' (tối đa 4096), 'temperature', 'top_p', 'frequency_penalty', 'presence_penalty', 'stop' và 'stream'. 'n' (số lượng hoàn tất) cũng được hỗ trợ. Không có hỗ trợ 'logprobs' hoặc 'logit_bias' cho mô hình này trên cổng OrcaRouter. Lưu ý rằng tham số 'max_tokens' được giới hạn ở 4096 để phù hợp với giới hạn đầu ra của mô hình. Đối với streaming, đặt 'stream': true để nhận các bản cập nhật incremental.
Nếu bạn hiện đang sử dụng OpenAI trực tiếp, việc chuyển sang OrcaRouter rất đơn giản: thay đổi URL cơ sở từ https://api.openai.com/v1 thành https://api.orcarouter.ai/v1, cập nhật ID mô hình thành 'openai/gpt-3.5-turbo-0125' nếu bạn đang sử dụng bí danh chung, và thay thế khóa API của bạn bằng khóa từ OrcaRouter. Không cần thay đổi mã cho định dạng tin nhắn hay tham số. Nếu bạn đang sử dụng một nhà cung cấp khác, hãy đảm bảo thư viện client của bạn hỗ trợ lược đồ tương thích với OpenAI. OrcaRouter cung cấp một giải pháp thay thế trực tiếp.
GPT-4 thường vượt trội hơn GPT-3.5-Turbo-0125 trong suy luận phức tạp, độ chính xác thông tin và tuân theo các hướng dẫn tinh tế, thể hiện qua điểm chuẩn cao hơn trên MMLU và các bài kiểm tra khác. Tuy nhiên, GPT-4 đắt hơn đáng kể (thường gấp 10 lần chi phí mỗi token) và có thể có độ trễ cao hơn. GPT-3.5-Turbo-0125 mang lại điểm cân bằng hiệu năng-giá cả hấp dẫn cho các tác vụ không yêu cầu chiều sâu của GPT-4. Hãy chọn mô hình lớn hơn cho các phân tích nâng cao hoặc khi biên độ sai số hẹp.
Anthropic's Claude 3 Haiku là một mô hình chi phí thấp cạnh tranh với suy luận nhanh và các tính năng an toàn mạnh mẽ. Cả hai mô hình đều chỉ dùng văn bản và được thiết kế cho các ứng dụng khối lượng lớn. Mặc dù so sánh benchmark cụ thể có khác nhau, GPT-3.5-Turbo-0125 được áp dụng rộng rãi và hưởng lợi từ tài liệu phong phú và hệ sinh thái. Claude 3 Haiku có thể có thế mạnh khác trong viết sáng tạo và hành vi từ chối. Lựa chọn phụ thuộc vào sở thích của nhà phát triển và yêu cầu tích hợp. OrcaRouter hỗ trợ cả hai mô hình, vì vậy bạn có thể so sánh trực tiếp.
Các mô hình mã nguồn mở (ví dụ: Llama 3, Mistral) có thể chạy trên phần cứng của bạn hoặc thông qua OrcaRouter để có chi phí trên mỗi token tiềm năng thấp hơn, đặc biệt khi mở rộng quy mô. Tuy nhiên, chúng thường yêu cầu nhiều thiết lập hơn, kỹ thuật prompt, và có thể khả năng tuân theo hướng dẫn yếu hơn. GPT-3.5-Turbo-0125 mang lại độ tin cậy trọn gói, chất lượng nhất quán và không cần quản lý cơ sở hạ tầng. Đối với các nhóm không có chuyên môn về ML, API được quản lý thường là lựa chọn tốt hơn. Hãy chạy benchmark trên khối lượng công việc cụ thể của bạn để quyết định.
OpenAI có thể phát hành các phiên bản mới hơn của GPT-3.5-Turbo hoặc ngừng hỗ trợ snapshot cụ thể này. OrcaRouter sẽ cập nhật các model khả dụng tương ứng. Nếu ứng dụng của bạn phụ thuộc vào hành vi nhất quán, bạn có thể muốn ghim một phiên bản model cụ thể bằng cách sử dụng ID model chính xác. OrcaRouter cung cấp thông báo trước về việc ngừng hỗ trợ. Đối với các hệ thống sản xuất quan trọng, hãy cân nhắc kiểm tra với các phiên bản mới trong môi trường staging trước khi chuyển đổi.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-3.5-turbo-0125",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_pparallel_tool_calls| Đầu vào / 1M tokens | $0.500 |
| Đầu ra / 1M tokens | $1.50 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/openai/gpt-3.5-turbo-0125Mở @misc{orcarouter_gpt_3_5_turbo_0125,
title = {openai/gpt-3.5-turbo-0125 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125}
}openai. (n.d.). openai/gpt-3.5-turbo-0125 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125