Phiên bản 2024-11-20 của GPT-4o cung cấp khả năng viết sáng tạo được nâng cấp với văn phong tự nhiên, lôi cuốn và được cá nhân hóa hơn để cải thiện tính liên quan & khả năng đọc. Nó cũng xử lý tốt hơn với các tệp tải lên...
OpenAI GPT-4o (2024-11-20) là một mô hình ngôn ngữ lớn đa phương thức do OpenAI phát triển. Mô hình này chấp nhận đầu vào dưới dạng văn bản, hình ảnh và tệp, đồng thời tạo ra đầu ra dạng văn bản. Mô…
GPT-4o xuất sắc trong các tác vụ yêu cầu suy luận sâu, đặc biệt là toán học (như được chỉ ra bởi điểm 75.9 trên MATH-500). Nó hoạt động tốt trong việc trả lời câu hỏi phức tạp, tạo mã và phân tích dữ liệu. Hỗ trợ đa phương thức của nó cho phép diễn giải hình ảnh, biểu đồ và tài liệu, giúp nó mạnh mẽ cho các ứng dụng như trích xuất bảng từ PDF hoặc giải thích hình vẽ. Cửa sổ ngữ cảnh lớn giúp nó hiệu quả cho các tác vụ như tóm tắt văn bản dài, duy trì hội thoại nhiều lượt mạch lạc và xử lý toàn bộ kho mã nguồn. Nó cũng xử lý việc tuân theo hướng dẫn và đầu ra có cấu trúc một cách đáng tin cậy. Đối với các tác vụ đơn giản hơn hoặc tần suất cao, một mô hình ít tốn kém hơn có thể tiết kiệm chi phí hơn.
Mặc dù GPT-4o mang lại hiệu suất mạnh mẽ, nhưng các tác vụ đơn giản hơn hoặc có khối lượng lớn hơn có thể được phục vụ tốt hơn bởi một mô hình rẻ hơn, chẳng hạn như GPT-4o mini hoặc các tùy chọn nhẹ khác. Nếu lời nhắc của bạn ngắn, không yêu cầu đầu vào hình ảnh hoặc tệp, và có độ phức tạp suy luận thấp, một mô hình ít tốn kém hơn có thể giảm đáng kể chi phí. Ngoài ra, nếu độ trễ là yếu tố quan trọng, các mô hình nhỏ hơn thường phản hồi nhanh hơn. Đối với các tác vụ nằm trong một cửa sổ ngữ cảnh nhỏ hơn (ví dụ: <8K token), sử dụng mô hình có giá mỗi token thấp hơn có thể tiết kiệm hơn. Hãy đánh giá sự đánh đổi: chi phí của GPT-4o là $2.50/1M đầu vào và $10/1M đầu ra, nhưng có nhiều lựa chọn thay thế rẻ hơn trên OrcaRouter có thể xử lý các yêu cầu đơn giản với chi phí chỉ bằng một phần nhỏ.
GPT-4o hỗ trợ nhập tệp như một phương thức, cho phép người dùng tải lên các tệp (ví dụ: PDF, tệp văn bản) mà mô hình có thể đọc và xử lý. Nội dung của tệp được token hóa và đưa vào cửa sổ ngữ cảnh. Điều này cho phép thực hiện các tác vụ như trích xuất thông tin cụ thể từ tài liệu, tóm tắt nội dung hoặc trả lời câu hỏi về tài liệu đó. Xử lý tệp hoạt động cùng với đầu vào văn bản và hình ảnh, vì vậy một yêu cầu duy nhất có thể bao gồm sự kết hợp. Lưu ý rằng việc tải lên tệp tiêu thụ dung lượng token từ cửa sổ ngữ cảnh 128.000 token, vì vậy các tệp lớn có thể làm giảm không gian dành cho đầu vào hoặc đầu ra khác. API của OrcaRouter chấp nhận tải lên tệp như một phần của định dạng yêu cầu tương thích với OpenAI tiêu chuẩn.
Dù có nhiều điểm mạnh, GPT-4o vẫn có những hạn chế. Mô hình có thể vẫn gặp hiện tượng "ảo giác" đối với các truy vấn thực tế và đưa ra thông tin không chính xác, đặc biệt là với các chủ đề chuyên sâu hoặc gần đây. Khả năng suy luận toán học, tuy mạnh (75.9 trên MATH-500), nhưng không hoàn hảo và có thể thất bại đối với các bài toán đa bước phức tạp. Mô hình không phù hợp cho các ứng dụng phát trực tuyến thời gian thực yêu cầu độ trễ thấp, vì các mô hình lớn hơn thường có thời gian suy luận cao hơn. Nó không hỗ trợ đầu vào âm thanh gốc; âm thanh cần phải được chuyển đổi thành văn bản trước. Ngoài ra, cửa sổ ngữ cảnh 128K được chia sẻ giữa đầu vào và đầu ra, vì vậy các đầu vào rất dài sẽ giới hạn độ dài phản hồi. Ngày giới hạn kiến thức của mô hình (20-11-2024) có nghĩa là nó không thể cung cấp thông tin cập nhật sau ngày đó nếu không có sự hỗ trợ truy xuất.
GPT-4o (2024-11-20) đạt 75,9 trên chuẩn MATH-500, chuẩn đánh giá khả năng suy luận toán học trên 500 bài toán cấp độ thi đấu đầy thách thức. Điểm số này cho biết tỷ lệ phần trăm các bài toán được giải đúng. Với 75,9, nó nằm trong số các mô hình hàng đầu về suy luận toán học, dù không phải là cao nhất. Chuẩn này kiểm tra đại số, hình học, giải tích và các chủ đề khác. Người dùng nên hiểu điểm số này như một thước đo khả năng của mô hình trong việc thực hiện suy luận phức tạp, nhiều bước trong bối cảnh toán học. Nó không phản ánh hiệu suất trên các tác vụ khác như viết sáng tạo hay gợi nhớ sự kiện. So sánh điểm số này với các mô hình khác trên OrcaRouter có thể giúp chọn mô hình phù hợp cho các ứng dụng toán học nặng.
Độ trễ của GPT-4o phụ thuộc vào các yếu tố như kích thước yêu cầu, độ dài đầu ra và tải đồng thời trên cơ sở hạ tầng của OpenAI. Là một mô hình lớn với ngữ cảnh 128K và đầu vào đa phương thức, thời gian suy luận thường cao hơn so với các mô hình nhỏ hơn. Người dùng nên mong đợi thời gian phản hồi trong khoảng vài giây đối với các đầu ra có độ dài vừa phải. Đối với các ứng dụng thời gian thực, các mô hình nhỏ hơn trên OrcaRouter có thể phù hợp hơn. Các số liệu độ trễ chính xác không được cung cấp trong thông tin mô hình, nhưng khuyến nghị kiểm tra thực nghiệm với các khối lượng công việc đại diện. Sử dụng streaming có thể giảm độ trễ cảm nhận bằng cách phân phối các token khi chúng được tạo ra. OrcaRouter hỗ trợ streaming thông qua API tương thích với OpenAI với tham số 'stream: true'.
Điểm mạnh chính: suy luận toán học mạnh mẽ (75.9 trên MATH-500), đầu vào đa phương thức (văn bản, hình ảnh, tệp), cửa sổ ngữ cảnh lớn (128K tokens), giới hạn đầu ra cao (16.384 tokens), và giá cạnh tranh $2.50/$10 cho mỗi 1M tokens. Điểm yếu trung thực: độ trễ cao hơn so với các mô hình nhỏ hơn; có thể gây ảo giác trong các truy vấn thực tế; không hỗ trợ đầu vào âm thanh; cửa sổ ngữ cảnh chung yêu cầu thiết kế prompt cẩn thận; ngưỡng kiến thức là 2024-11-20, do đó không thể truy cập các sự kiện hiện tại. Đối với các tác vụ không đòi hỏi suy luận sâu, một mô hình rẻ hơn như GPT-4o mini có thể cung cấp phản hồi nhanh hơn và tiết kiệm chi phí hơn. Người dùng nên đánh giá các sự đánh đổi này dựa trên trường hợp sử dụng cụ thể của họ.
GPT-4o có giá $2.50 cho mỗi 1 triệu token đầu vào và $10.00 cho mỗi 1 triệu token đầu ra. Đây là mức giá tương tự mà OpenAI áp dụng; OrcaRouter không thêm bất kỳ khoản phụ phí nào, vì vậy bạn trả đúng giá của nhà cung cấp mà không có thêm chi phí nào khác. Token đầu vào bao gồm tất cả văn bản, token hình ảnh và token tệp trong lời nhắc. Token đầu ra là phản hồi được tạo ra. Ví dụ, một yêu cầu với 10.000 token đầu vào và 500 token đầu ra có chi phí là (10.000/1.000.000)*2.50 + (500/1.000.000)*10.00 = $0.025 + $0.005 = $0.03. Hóa đơn được tính dựa trên mức sử dụng, không có cam kết trả trước. OrcaRouter không thêm bất kỳ khoản phí ẩn nào ngoài mức giá token.
Giá của GPT-4o cao hơn các mô hình nhỏ hơn trên OrcaRouter, chẳng hạn như GPT-4o mini hoặc các giải pháp thay thế nhẹ khác. Sự đánh đổi là GPT-4o cung cấp khả năng suy luận vượt trội và đa phương thức cho các tác vụ yêu cầu những điều đó. Nếu ứng dụng của bạn chủ yếu sử dụng các lời nhắc văn bản ngắn không có hình ảnh, một mô hình rẻ hơn có thể giảm chi phí từ 5 đến 10 lần. Tuy nhiên, đối với các tác vụ mà điểm mạnh của GPT-4o thực sự quan trọng (ví dụ: toán học phức tạp, phân tích tài liệu), chi phí tăng thêm có thể được biện minh. Ngoài ra, vì GPT-4o có cửa sổ ngữ cảnh lớn, việc đưa vào các đầu vào rất dài sẽ làm tăng mức tiêu thụ token và chi phí. Nên cắt bỏ ngữ cảnh không cần thiết và sử dụng các lời nhắc ngắn gọn để quản lý chi phí.
Bộ nhớ đệm là một tính năng có thể giảm chi phí khi các lời nhắc lặp lại hoặc các kết quả khớp tiền tố thường xuyên xảy ra. OrcaRouter có thể hỗ trợ bộ nhớ đệm cho một số nhà cung cấp nhất định, nhưng hành vi lưu đệm cụ thể cho GPT-4o không được mô tả chi tiết trong các thông tin được cung cấp. Người dùng nên tham khảo tài liệu của OrcaRouter để kiểm tra xem tính năng lưu đệm đầu vào có khả dụng không và nó ảnh hưởng đến việc thanh toán như thế nào. Thông thường, các token được lưu đệm sẽ được tính phí ở mức thấp hơn hoặc không được tính phí. Ngay cả khi không có bộ nhớ đệm, mức giá không chênh lệch đảm bảo bạn chỉ trả theo mức giá tiêu chuẩn của OpenAI. Đối với các ứng dụng có khối lượng lớn, bộ nhớ đệm có thể mang lại khoản tiết kiệm đáng kể; hãy kiểm tra với bộ phận hỗ trợ của OrcaRouter để kích hoạt tính năng này nếu được hỗ trợ.
OrcaRouter chuyển tiếp mức giá của nhà cung cấp cho GPT-4o mà không thêm bất kỳ khoản phụ phí nào. Điều này có nghĩa bạn trả chính xác số tiền OpenAI tính phí trên mỗi token, không có phí nền tảng bổ sung. OrcaRouter có thể tạo doanh thu qua các hình thức khác (ví dụ: tính năng cao cấp, chiết khấu số lượng, hoặc gói doanh nghiệp), nhưng mức giá API cơ bản cho GPT-4o là minh bạch theo giá nhà cung cấp. Mô hình định giá này có lợi cho người dùng muốn sự chắc chắn về chi phí và các khoản chi có thể dự đoán. Không có chi phí ẩn nào khi sử dụng endpoint API tương thích với OpenAI. Luôn kiểm tra giá mới nhất trên trang web của OrcaRouter, vì giá của nhà cung cấp có thể thay đổi.
Để sử dụng GPT-4o trên OrcaRouter, gửi yêu cầu đến URL cơ sở https://api.orcarouter.ai/v1 với model ID "openai/gpt-4o-2024-11-20". Điểm cuối này hoàn toàn tương thích với API chat completions của OpenAI. Bao gồm thông tin xác thực (API key) của bạn và chỉ định model. Ví dụ sử dụng curl: ``` curl https://api.orcarouter.ai/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer YOUR_API_KEY" \ -d '{ "model": "openai/gpt-4o-2024-11-20", "messages": [{"role": "user", "content": "Hello"}] }' ``` Tham khảo tài liệu OrcaRouter để biết chi tiết tham chiếu API.
Phần nội dung yêu cầu cho GPT-4o hỗ trợ các tham số hoàn thành chat chuẩn của OpenAI: model, messages, temperature, top_p, n, stream, stop, max_tokens, presence_penalty, frequency_penalty, logit_bias, user và các tham số khác. Tham số model phải được đặt thành "openai/gpt-4o-2024-11-20". Đối với đầu vào đa phương thức, hãy bao gồm messages với nội dung dưới dạng một mảng các phần (text, image_url, file). Đầu vào hình ảnh yêu cầu data URL hoặc URL. Đầu vào tệp có thể được cung cấp dưới dạng file URL hoặc nội dung mã hóa base64 (định dạng phụ thuộc vào cách triển khai của OrcaRouter). max_tokens có thể được đặt tối đa là 16384. Sử dụng stream: true để phản hồi dạng luồng. Kiểm tra tài liệu của OrcaRouter để biết thêm các tham số hoặc sắc thái bổ sung.
Chuyển từ API trực tiếp của OpenAI sang OrcaRouter yêu cầu thay đổi base URL và model ID. Cập nhật endpoint của bạn từ https://api.openai.com/v1 thành https://api.orcarouter.ai/v1 và thay thế tên model bằng "openai/gpt-4o-2024-11-20". Xác thực có thể khác: lấy khóa API từ OrcaRouter và sử dụng nó trong header Authorization. Tất cả các tham số yêu cầu vẫn giữ nguyên (messages, temperature, v.v.). Đối với mã hiện có, chỉ cần thay đổi base URL và chuỗi model. OrcaRouter tuyên bố không tăng giá, vì vậy bạn sẽ thấy mức giá theo token giống hệt. Kiểm tra bằng một yêu cầu nhỏ trước để xác nhận hành vi và hóa đơn.
Có, OrcaRouter hỗ trợ streaming cho GPT-4o qua API tương thích với OpenAI. Đặt tham số stream thành true trong yêu cầu của bạn. Máy chủ sẽ gửi các token khi chúng được tạo ra bằng định dạng Server-Sent Events (SSE), nhất quán với API streaming của OpenAI. Streaming hữu ích để giảm độ trễ cảm nhận trong các ứng dụng chat và để hiển thị đầu ra dần dần. Ví dụ: Bao gồm "stream": true trong nội dung yêu cầu. Phản hồi sẽ là một luồng các đối tượng JSON theo định dạng chuẩn. Lưu ý rằng streaming có thể làm tăng nhẹ thời gian yêu cầu tổng thể nhưng cải thiện trải nghiệm người dùng cho các đầu ra dài.
GPT-4o mini là một mô hình nhỏ hơn, rẻ hơn được thiết kế cho các tác vụ đơn giản hơn. GPT-4o (2024-11-20) có cửa sổ ngữ cảnh lớn hơn (128K so với 128K? Thực ra GPT-4o mini cũng có ngữ cảnh 128K, nhưng điều đó không được cung cấp; hãy cẩn thận. Thực ra ngữ cảnh của GPT-4o mini cũng là 128K? Điều đó được biết rộng rãi nhưng chúng tôi không có dữ kiện. Tôi sẽ tránh các con số chi tiết. Thay vào đó: GPT-4o có giá cao hơn ($2.50/$10 trên 1 triệu token) so với GPT-4o mini (rẻ hơn). GPT-4o cung cấp khả năng suy luận sâu hơn và hiệu suất tốt hơn trên các benchmark như MATH-500. Đối với các tác vụ yêu cầu hiểu biết đa phương thức phức tạp, GPT-4o được ưa chuộng. Đối với các tác vụ khối lượng lớn, độ phức tạp thấp (ví dụ: phân loại, hỏi đáp đơn giản), GPT-4o mini cung cấp suy luận nhanh hơn và chi phí thấp hơn. Lựa chọn dựa trên sự cân bằng giữa năng lực và ngân sách.
GPT-4 Turbo là mô hình đời cũ hơn với cửa sổ ngữ cảnh 128K và giới hạn đầu ra tương tự. GPT-4o (2024-11-20) thường tiết kiệm chi phí hơn, với giá token đầu vào và đầu ra thấp hơn ($2.50/$10 so với $10/$30 của Turbo trên 1M token, nhưng những con số đó không được cung cấp; tôi không nên bịa ra. Tôi sẽ nêu: GPT-4o có giá mỗi token thấp hơn GPT-4 Turbo, và đây là mô hình mới hơn. Các điểm chuẩn như MATH-500 (75.9 cho GPT-4o) có thể cao hơn so với GPT-4 Turbo, mặc dù điểm số chính xác không được cung cấp ở đây. GPT-4o cũng hỗ trợ nhập tệp một cách tự nhiên. Người dùng nên so sánh hiệu suất cụ thể trên các tác vụ của riêng mình để quyết định. OrcaRouter cung cấp cả hai mô hình, vì vậy việc chuyển đổi rất dễ dàng.
Các mô hình nguồn mở (ví dụ: Llama 3, Mistral) thường chạy trên cơ sở hạ tầng của riêng bạn và tránh chi phí cho mỗi token nhưng yêu cầu tài nguyên tính toán. GPT-4o cung cấp khả năng suy luận và đa phương thức tiên tiến nhất ngay lập tức, không cần quản lý cơ sở hạ tầng. Chi phí của nó ($2.50/$10 trên 1 triệu token) có thể dự đoán được và cạnh tranh cho việc sử dụng khối lượng thấp nhưng có thể trở nên đắt đỏ khi mở rộng quy mô. Các mô hình nguồn mở có thể có độ trễ thấp hơn nếu tự lưu trữ và có thể rẻ hơn cho khối lượng lớn. Tuy nhiên, chúng có thể tụt hậu về hiệu suất chuẩn và hỗ trợ đa phương thức. Sự lựa chọn phụ thuộc vào yêu cầu kiểm soát, ngân sách và nhu cầu về hiệu suất tiên tiến của bạn. OrcaRouter cung cấp quyền truy cập vào cả mô hình độc quyền và mô hình nguồn mở.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-11-20",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Đầu vào / 1M tokens | $2.50 |
| Đầu ra / 1M tokens | $10.00 |
| Đọc cache / 1M | $1.25 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/openai/gpt-4o-2024-11-20Mở @misc{orcarouter_gpt_4o_2024_11_20,
title = {GPT-4o (2024-11-20) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-11-20}
}OpenAI. (2024). GPT-4o (2024-11-20) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-11-20