Phiên bản ngày 2024-08-06 của GPT-4o cung cấp hiệu suất cải thiện trong đầu ra có cấu trúc, với khả năng cung cấp một lược đồ JSON trong respone_format. Đọc thêm [tại đây](https://openai.com/index/introducing-structured-outputs-in-the-api/). GPT-4o ("o" viết tắt của "omni") là...
GPT-4o (2024-08-06) là một phiên bản của mô hình GPT-4o của OpenAI, được phát hành vào tháng 8 năm 2024. Đây là một mô hình ngôn ngữ lớn đa phương thức có khả năng xử lý đầu vào văn bản, hình ảnh và…
Điểm mạnh cốt lõi của mô hình nằm ở khả năng suy luận toán học và hiểu đa phương thức. Điểm MATH-500 79.5 cho thấy khả năng mạnh mẽ trong việc giải các bài toán phức tạp từng bước một. Mô hình có thể diễn giải hình ảnh, sơ đồ và biểu đồ, cung cấp mô tả hoặc phân tích chính xác. Cửa sổ ngữ cảnh 128K cho phép mô hình xử lý lượng lớn thông tin, chẳng hạn như một cuốn sách dài hoặc một loạt hình ảnh kèm văn bản. Mô hình cũng xử lý tải lên tệp, hữu ích cho các tác vụ như trích xuất dữ liệu từ bảng tính hoặc đọc tệp mã. Những khả năng này được hỗ trợ bởi sự tối ưu hóa liên tục của OpenAI và mô hình được sử dụng rộng rãi trong các môi trường sản xuất.
GPT-4o (2024-08-06) xuất sắc trong các tác vụ yêu cầu kết hợp thông tin hình ảnh và văn bản. Ví dụ bao gồm giải các bài toán có sơ đồ, phân tích ảnh chụp màn hình giao diện người dùng để báo cáo lỗi, trích xuất dữ liệu từ tài liệu quét và đưa ra lời giải thích chi tiết về các biểu đồ phức tạp. Mô hình này cũng hiệu quả trong việc tạo mã nguồn và gỡ lỗi khi ngữ cảnh bao gồm ảnh chụp màn hình lỗi hoặc cấu trúc tệp. Các ứng dụng giáo dục được hưởng lợi từ khả năng suy luận từng bước của nó. Đối với các tác vụ thuần văn bản và đơn giản, như hỏi đáp cơ bản hoặc tóm tắt văn bản ngắn, một mô hình rẻ hơn như GPT-4o mini có thể đủ dùng. Mô hình này nên được dành cho các quy trình công việc có giá trị cao, đa phương thức hoặc yêu cầu suy luận nhiều.
Đối với các tác vụ không sử dụng thị giác, xử lý tệp tin hoặc suy luận nâng cao, một mô hình nhỏ hơn và rẻ hơn sẽ tiết kiệm chi phí hơn. Ví dụ, các ứng dụng chat đơn giản, tạo nội dung ngắn hoặc tác vụ phân loại có thể được xử lý bởi các mô hình như GPT-4o mini hoặc GPT-3.5 Turbo. Nếu ứng dụng của bạn chỉ xử lý văn bản và không yêu cầu cửa sổ ngữ cảnh 128K, một mô hình có ngữ cảnh nhỏ hơn có thể giảm độ trễ và chi phí. Ngoài ra, nếu dữ liệu của bạn không liên quan đến hình ảnh hoặc tệp tin, mô hình chỉ văn bản là đủ. Hãy đánh giá xem độ phức tạp của tác vụ có biện minh cho mức giá cao hơn mỗi token của GPT-4o không. OrcaRouter cung cấp nhiều mô hình với các mức giá khác nhau để phù hợp với các trường hợp sử dụng khác nhau.
Có, mô hình chấp nhận đầu vào từ tệp tin. Bạn có thể tải lên các tệp như PDF, tài liệu Word, bảng tính, hình ảnh và tệp mã nguồn. Mô hình sẽ trích xuất và hiểu nội dung bên trong các tệp này, coi chúng như một phần của ngữ cảnh. Ví dụ, mô hình có thể đọc văn bản từ PDF, diễn giải số liệu trong CSV hoặc phân tích mã nguồn trong tệp .py. Khi kết hợp với đầu vào hình ảnh, mô hình có thể xử lý phương tiện hỗn hợp như tài liệu có biểu đồ nhúng. Điều này đặc biệt hữu ích cho việc tự động hóa trích xuất dữ liệu, đánh giá tài liệu và phân tích mã nguồn. Lưu ý rằng việc xử lý tệp tin được tính vào cửa sổ ngữ cảnh 128.000 token, do đó các tệp lớn có thể tiêu tốn dung lượng đáng kể.
Trên benchmark MATH-500, GPT-4o (2024-08-06) đạt điểm số 79.5. MATH-500 là một tập con của bộ dữ liệu MATH, bao gồm 500 bài toán cấp độ thi đấu đầy thách thức bao gồm các chủ đề như đại số, hình học, lý thuyết số và xác suất. Điểm số 79.5 cho thấy câu trả lời đúng trên khoảng bốn trong năm bài toán. Điều này đưa nó vào những mô hình hoạt động hàng đầu về suy luận toán học. Mặc dù không có điểm số benchmark nào khác được cung cấp, chỉ số này chứng minh sức mạnh của mô hình trong suy luận logic từng bước và số học. Người dùng có thể mong đợi hiệu suất đáng tin cậy trên các ứng dụng nặng về toán học như dạy kèm, xác minh và tạo bài toán.
Các điểm chuẩn cụ thể ngoài MATH-500 không được cung cấp trong các dữ kiện có sẵn. Tuy nhiên, GPT-4o với tư cách là một dòng mô hình được biết đến rộng rãi với khả năng cạnh tranh trên nhiều điểm chuẩn tiêu chuẩn bao gồm MMLU (khả năng hiểu ngôn ngữ đa nhiệm khổng lồ), HumanEval (sinh mã) và các nhiệm vụ ngôn ngữ-thị giác khác nhau. Phiên bản tháng 8 năm 2024 có thể bao gồm các bản cập nhật giúp cải thiện khả năng suy luận và tuân theo chỉ dẫn. Không có số liệu chính xác, người dùng nên tham khảo các đánh giá đã công bố của OpenAI để có dữ liệu mới nhất. Với mục đích thực tế, mô hình này được coi là tiên tiến nhất trong số các mô hình API mở về khả năng kết hợp văn bản và thị giác.
Không có số liệu cụ thể về độ trễ hoặc thông lượng cho mô hình này. Nhìn chung, GPT-4o được thiết kế nhanh hơn các phiên bản GPT-4 trước đó trong khi vẫn duy trì chất lượng. Độ trễ phụ thuộc vào các yếu tố như độ dài đầu vào, độ dài đầu ra, số lượng yêu cầu đồng thời và cơ sở hạ tầng phụ trợ. Khi truy cập qua OrcaRouter, các yêu cầu được định tuyến đến máy chủ của OpenAI và thời gian phản hồi tương tự như gọi API trực tiếp. Người dùng có thể tối ưu hóa bằng cách sử dụng ngữ cảnh nhỏ nhất cần thiết và đặt giới hạn max_tokens hợp lý. Đối với các ứng dụng thời gian thực, nên thử nghiệm với khối lượng công việc đại diện. OrcaRouter không tạo thêm độ trễ ngoài việc định tuyến mạng.
**Điểm mạnh:** khả năng suy luận toán học mạnh mẽ (MATH-500 79,5), đầu vào đa phương thức (văn bản, hình ảnh, tệp tin), cửa sổ ngữ cảnh lớn 128K và giới hạn token đầu ra cao (16.384). Mô hình đặc biệt hiệu quả đối với các tác vụ suy luận phức tạp, hiểu hình ảnh và các tác vụ yêu cầu ngữ cảnh xa. **Hạn chế:** chi phí cao hơn so với các mô hình nhỏ hơn; có thể không tối ưu cho các tác vụ đơn giản hoặc yêu cầu độ trễ thấp; độ chính xác có thể thay đổi trên các đầu vào mơ hồ hoặc định dạng kém; khả năng thị giác có thể không hoạt động tốt trên hình ảnh bị méo hoặc độ phân giải thấp. Ngoài ra, như với tất cả các LLM, mô hình có thể tạo ra các câu trả lời nghe có vẻ hợp lý nhưng không chính xác, đặc biệt trong các lĩnh vực ngoài dữ liệu huấn luyện. Giảm thiểu bằng cách xác thực đầu ra và sử dụng kỹ thuật prompt engineering.
Giá cho GPT-4o (2024-08-06) dựa trên mức sử dụng token. Token đầu vào được tính với giá $2.50 cho mỗi 1 triệu token. Token đầu ra được tính với giá $10.00 cho mỗi 1 triệu token. Đây là mức giá của nhà cung cấp (OpenAI), và OrcaRouter không tính thêm phí—bạn trả chính xác như khi gọi trực tiếp OpenAI. Token được đếm dựa trên văn bản gửi đi và nhận về. Hình ảnh và tập tin đầu vào tiêu thụ token tỷ lệ với kích thước và độ phức tạp xử lý của chúng (chi phí token hình ảnh theo chính sách của OpenAI). Không có phí bổ sung nào cho việc sử dụng điểm cuối API. Hóa đơn thường được tổng hợp theo kỳ sử dụng, và bạn có thể theo dõi mức tiêu thụ token qua bảng điều khiển của OrcaRouter.
Không có chi phí ẩn hay phụ phí. OrcaRouter tính phí theo đúng giá của nhà cung cấp với zero markup. Các mức giá được liệt kê ($2.50/1M đầu vào, $10/1M đầu ra) là trọn gói. Không có thêm phí xác thực, kết nối hay hỗ trợ. Tuy nhiên, đầu vào hình ảnh và tệp tin sẽ phải chịu chi phí token theo chính sách định giá của OpenAI, có thể vượt quá chi phí token chỉ dành cho văn bản. Ví dụ, một hình ảnh 1080x1080 có thể tiêu tốn một số lượng token nhất định ngoài các token văn bản. Hãy kiểm tra tài liệu của OpenAI để biết chính xác giá token cho hình ảnh. OrcaRouter chuyển tiếp các chi phí này mà không thêm markup. Hiện tại chưa có thông tin về giảm giá dựa trên bộ nhớ đệm (caching).
Việc chọn GPT-4o (2024-08-06) thay vì các mô hình rẻ hơn như GPT-4o mini hoặc GPT-3.5 Turbo đánh đổi giữa hiệu suất và chi phí. Giá mỗi token cao hơn, vì vậy đối với các ứng dụng khối lượng lớn, chi phí có thể tăng nhanh. Tuy nhiên, nếu tác vụ yêu cầu khả năng đa phương thức của mô hình hoặc cửa sổ ngữ cảnh 128K, các mô hình rẻ hơn có thể không đáp ứng được, dẫn đến đầu ra không hoàn chỉnh hoặc chất lượng thấp hơn. Đối với các tác vụ chỉ văn bản với suy luận đơn giản, mô hình rẻ hơn giúp giảm chi phí mà không hy sinh nhiều chất lượng. OrcaRouter cho phép bạn chuyển đổi giữa các mô hình một cách dễ dàng, vì vậy bạn có thể thử nghiệm để tìm ra sự cân bằng chi phí - hiệu suất tốt nhất cho từng trường hợp sử dụng.
Các dữ kiện hiện có không đề cập đến bất kỳ cơ chế lưu trữ tạm thời hay chiết khấu nào cho mô hình này. OrcaRouter tính phí theo giá của nhà cung cấp mà không có chênh lệch, vì vậy mọi khoản chiết khấu có lẽ sẽ đến từ định giá riêng của OpenAI (ví dụ: chiết khấu theo bậc cho việc sử dụng khối lượng lớn, nếu có). OrcaRouter có thể cung cấp tính năng lưu trữ tạm thời riêng, nhưng điều này chưa được xác nhận cho mô hình này. Để giảm thiểu chi phí, hãy cân nhắc giảm lượng token đầu vào bằng cách cắt ngắn lịch sử hội thoại, sử dụng lời nhắc ngắn hơn và giới hạn độ dài đầu ra bằng tham số max_tokens. Đối với các truy vấn lặp lại giống hệt nhau, bạn có thể triển khai lưu trữ tạm thời ở cấp ứng dụng.
Để gọi GPT-4o (2024-08-06) qua OrcaRouter, sử dụng base URL https://api.orcarouter.ai/v1 và đặt model ID là "openai/gpt-4o-2024-08-06". API này hoàn toàn tương thích với các thư viện client của OpenAI. Ví dụ, trong Python với thư viện openai, bạn sẽ cấu hình openai.api_base = "https://api.orcarouter.ai/v1" và openai.api_key = "your-orcarouter-api-key". Sau đó gọi openai.ChatCompletion.create(model="openai/gpt-4o-2024-08-06", messages=[...]). Tất cả các tham số chuẩn (temperature, max_tokens, top_p, v.v.) đều được hỗ trợ. Xem tài liệu OrcaRouter để biết chi tiết về xác thực và giới hạn tốc độ.
Vì mô hình hỗ trợ API tương thích OpenAI, bạn có thể sử dụng đầy đủ các tham số có trong endpoint chat completions của OpenAI. Các tham số chính bao gồm: model (đặt thành ID mô hình), messages (danh sách các đối tượng role-content), temperature (0-2), top_p (0-1), n (số lượng completions), max_tokens (tối đa 16384), stop (chuỗi dừng), frequency_penalty, presence_penalty, logit_bias và user (dùng để theo dõi sử dụng). Đối với đầu vào đa phương thức, bạn đưa hình ảnh hoặc file_url vào nội dung của tin nhắn theo định dạng phù hợp (ví dụ: content: [{type: "text", text: "..."}, {type: "image_url", image_url: {...}}]). Tham khảo tài liệu của OpenAI về cú pháp nhập hình ảnh và tệp.
Việc chuyển từ OpenAI API trực tiếp sang OrcaRouter yêu cầu hai thay đổi: 1) Đặt base URL thành https://api.orcarouter.ai/v1, và 2) Thay thế khóa API OpenAI của bạn bằng khóa API OrcaRouter. Không cần thay đổi mã cho định dạng tin nhắn hay tham số. ID mô hình thay đổi từ "gpt-4o-2024-08-06" thành "openai/gpt-4o-2024-08-06". Tất cả logic hiện có để xử lý streaming, function calling, và phân tích phản hồi vẫn giữ nguyên. API của OrcaRouter được thiết kế như một giải pháp thay thế tương thích. Sau khi chuyển đổi, bạn cũng có thể truy cập các mô hình của nhà cung cấp khác thông qua cùng một giao diện, cho phép so sánh và cân bằng tải dễ dàng.
Xác thực được thực hiện thông qua khóa API do OrcaRouter cung cấp. Đưa nó vào header dưới dạng "Authorization: Bearer YOUR_ORCAROUTER_API_KEY". Các giới hạn tốc độ được quản lý bởi OrcaRouter và có thể khác với giới hạn trực tiếp của OpenAI. Kiểm tra gói OrcaRouter của bạn để biết chi tiết. Nếu bạn vượt quá giới hạn tốc độ, bạn sẽ nhận được phản hồi HTTP 429. Để giảm thiểu, hãy triển khai logic retry với backoff theo cấp số nhân. OrcaRouter cũng có thể cho phép bạn đặt giới hạn tốc độ cho từng người dùng thông qua tham số user. Đối với nhu cầu thông lượng cao, hãy liên hệ với bộ phận hỗ trợ của OrcaRouter để có các thỏa thuận tùy chỉnh. Bản thân mô hình không có giới hạn tốc độ riêng; nó phụ thuộc vào các giới hạn tổng thể của endpoint.
GPT-4o (2024-08-06) là mô hình chủ lực kích thước đầy đủ, trong khi GPT-4o mini là biến thể nhỏ hơn và rẻ hơn. Khác biệt chính: GPT-4o có cửa sổ ngữ cảnh 128K (so với GPT-4o mini cũng 128K, nhưng mini có giới hạn đầu ra thấp hơn, thường là 16K? Thực ra GPT-4o mini cũng có ngữ cảnh 128K và đầu ra 16K, nhưng kém hơn về khả năng suy luận và thị giác). Mô hình đầy đủ đạt 79.5 trên MATH-500; GPT-4o mini đạt điểm thấp hơn trên các chuẩn toán học. Định giá: GPT-4o đắt hơn ($2.50/$10 so với GPT-4o mini ở $0.15/$0.60 trên 1M token). Đối với các tác vụ yêu cầu độ chính xác cao hoặc suy luận phức tạp, mô hình đầy đủ là phù hợp. Đối với các tác vụ đơn giản hơn, mini cung cấp giải pháp thay thế tiết kiệm chi phí.
So với GPT-4 (ví dụ: GPT-4-0613 hoặc GPT-4 Turbo), GPT-4o (2024-08-06) cung cấp một số cải tiến: khả năng đa phương thức gốc (văn bản, hình ảnh, tệp) mà không yêu cầu các mô hình thị giác riêng biệt, ngữ cảnh lớn hơn (128K so với 32K của các phiên bản GPT-4 cũ hơn) và suy luận nhanh hơn. Giá cả thấp hơn so với các biến thể GPT-4 trước đây, vốn thường đắt hơn. Ví dụ, GPT-4 Turbo có ngữ cảnh tương tự nhưng giá cao hơn. Về mặt điểm chuẩn, điểm MATH-500 đạt 79.5 vượt trội hơn các mô hình GPT-4 cũ. Tuy nhiên, một số người dùng có thể thấy các mô hình trước đó ổn định hơn cho các tác vụ cụ thể do lịch sử huấn luyện dài hơn. Nhìn chung, GPT-4o là một phiên bản kế nhiệm hiện đại và hiệu quả hơn.
Sự lựa chọn phụ thuộc vào nhu cầu cụ thể và sở thích của nhà cung cấp. GPT-4o (2024-08-06) vượt trội trong suy luận toán học (MATH-500 79.5) và các tác vụ đa phương thức với văn bản, hình ảnh và tệp. Các mô hình Claude từ Anthropic có thể cung cấp các tính năng an toàn mạnh hơn hoặc cửa sổ ngữ cảnh dài hơn trong một số phiên bản nhưng thường có giá cao hơn. Các mô hình Gemini từ Google cung cấp đa phương thức và ngữ cảnh lớn, nhưng có thể có cấu hình hiệu suất khác nhau. Sử dụng OrcaRouter, bạn có thể kiểm tra nhiều nhà cung cấp với một API duy nhất. Đối với các tác vụ yêu cầu độ chính xác toán học cao, GPT-4o là một ứng cử viên mạnh mẽ. Đối với tóm tắt văn bản thuần túy hoặc các tác vụ chi phí thấp, các mô hình khác có thể kinh tế hơn. Đánh giá điểm chuẩn và giá cả cho trường hợp sử dụng của bạn.
Khi sử dụng GPT-4o qua OrcaRouter, dữ liệu của bạn được gửi đến máy chủ của OpenAI để suy luận. OrcaRouter không lưu trữ hoặc xử lý các prompt của bạn ngoài việc chuyển tiếp chúng. Các chính sách sử dụng dữ liệu của OpenAI sẽ được áp dụng — hãy kiểm tra các điều khoản của OpenAI nếu bạn có thắc mắc về việc sử dụng dữ liệu huấn luyện hoặc lưu giữ dữ liệu. Nếu bạn yêu cầu dữ liệu phải ở trong một khu vực pháp lý cụ thể hoặc tránh một số nhà cung cấp nhất định, OrcaRouter cho phép bạn chọn giữa nhiều nhà cung cấp cho mỗi yêu cầu. Bạn cũng có thể sử dụng các tính năng định tuyến của OrcaRouter để hướng các yêu cầu đến các nhà cung cấp đáp ứng yêu cầu tuân thủ của bạn. Luôn xem xét tài liệu xử lý dữ liệu của cả OrcaRouter và nhà cung cấp cơ bản.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-08-06",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Đầu vào / 1M tokens | $2.50 |
| Đầu ra / 1M tokens | $10.00 |
| Đọc cache / 1M | $1.25 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/openai/gpt-4o-2024-08-06Mở @misc{orcarouter_gpt_4o_2024_08_06,
title = {GPT-4o (2024-08-06) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-08-06}
}OpenAI. (2024). GPT-4o (2024-08-06) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-08-06