GPT-4o mini là mô hình mới nhất của OpenAI sau [GPT-4 Omni](/models/openai/gpt-4o), hỗ trợ cả đầu vào văn bản và hình ảnh với đầu ra văn bản. Là mô hình nhỏ tiên tiến nhất của họ, nó có giá phải chăng hơn nhiều lần...
GPT-4o-mini là biến thể nhỏ hơn, nhanh hơn của mô hình GPT-4o của OpenAI, được tối ưu hóa để giảm chi phí tính toán trong khi vẫn giữ lại khả năng đa phương thức. Mô hình này có thể xử lý văn bản,…
GPT-4o-mini vượt trội trong nhiều tác vụ ngôn ngữ, bao gồm tóm tắt, dịch thuật, phân loại và trả lời câu hỏi. Nó hỗ trợ đầu ra JSON có cấu trúc, gọi hàm và sử dụng công cụ, cho phép tích hợp với các API và cơ sở dữ liệu bên ngoài. Cửa sổ ngữ cảnh 128K cho phép nó tiếp nhận các tài liệu lớn hoặc lịch sử hội thoại để phân tích mạch lạc. Nó hoạt động tốt trên các chuẩn mực phổ biến (điểm MATH-500 là 78.9) và phù hợp cho các bài toán giáo dục, giải thích mã và trích xuất dữ liệu. Đối với các tác vụ đơn giản hơn, GPT-4o-mini thường ngang bằng với các mô hình lớn hơn với chi phí thấp hơn nhiều. Tuy nhiên, các tác vụ yêu cầu chuyên môn sâu về lĩnh vực hoặc đầu ra sáng tạo cao có thể thấy chất lượng giảm so với GPT-4o.
Hình ảnh có thể được cung cấp dưới dạng URL hoặc dữ liệu mã hóa base64 trong yêu cầu API. Mô hình diễn giải hình ảnh, hiểu nội dung trực quan như các đối tượng, văn bản trong hình ảnh và mối quan hệ không gian. Điều này cho phép các trường hợp sử dụng như hỏi đáp trực quan, diễn giải sơ đồ và nhận dạng chữ số viết tay. Các token hình ảnh được tính vào giới hạn ngữ cảnh, vì vậy hình ảnh độ phân giải cao hoặc lớn sẽ tiêu tốn nhiều hơn trong ngân sách 128K token. Mô hình không tạo ra hình ảnh; nó chỉ xử lý chúng. Đối với các tác vụ yêu cầu chi tiết hình ảnh tinh vi (ví dụ: hình ảnh y tế), một mô hình thị giác chuyên biệt có thể chính xác hơn, nhưng GPT-4o-mini cung cấp giải pháp đa năng với chi phí hợp lý.
GPT-4o-mini chấp nhận các tệp tin tải lên bên cạnh văn bản và hình ảnh. Các loại tệp phổ biến bao gồm PDF, .docx, .txt, .csv và .json. Mô hình trích xuất văn bản và các yếu tố hình ảnh liên quan (nếu tệp chứa hình ảnh nhúng) và xử lý chúng như một phần của ngữ cảnh. Điều này hữu ích cho việc phân tích các bài nghiên cứu, hợp đồng pháp lý, hoặc bảng tính mà không cần sao chép thủ công. Lưu ý rằng nội dung tệp đóng góp vào mức sử dụng token; ví dụ, một tệp PDF dài 50 trang có thể tiêu tốn vài nghìn token. OrcaRouter tính phí dựa trên tổng số token đầu vào, bao gồm cả token từ các tệp. Không có phí xử lý tệp bổ sung ngoài mức tiêu thụ token.
Nếu khối lượng công việc của bạn chỉ bao gồm văn bản mà không có hình ảnh hoặc tệp, và ngữ cảnh yêu cầu dưới 16K token, một mô hình nhỏ hơn (như GPT-3.5-turbo) có thể mang lại chi phí trên mỗi token thấp hơn. Tương tự, đối với các tác vụ thông lượng rất cao như phân loại đơn giản hoặc hỏi đáp cơ bản, một mô hình tinh chỉnh chuyên dụng có thể kinh tế hơn. GPT-4o-mini hiệu quả về chi phí cho các trường hợp sử dụng đa phương thức hoặc ngữ cảnh dài, nhưng điểm mạnh của nó nằm ở sự cân bằng giữa hiệu suất và giá cả. Nếu ứng dụng của bạn có thể chấp nhận phản hồi chậm hơn hoặc chi phí cao hơn để đạt độ chính xác tối đa, GPT-4o là một lựa chọn thay thế. Hãy chuẩn hóa tác vụ cụ thể của bạn để xác nhận mô hình nào đáp ứng ngưỡng chất lượng và ngân sách của bạn.
MATH-500 là một tập con của chuẩn đánh giá MATH, bao gồm 500 bài toán cấp độ thi đấu bao gồm đại số, hình học, lý thuyết số và xác suất. Điểm số 78.9 cho thấy GPT-4o-mini đã trả lời đúng khoảng 78.9% các bài toán này. Đây là một kết quả mạnh mẽ đối với một mô hình nhỏ hơn, phản ánh khả năng suy luận toán học của nó. Nó vượt qua nhiều mô hình trước đó có kích thước tương tự. Tuy nhiên, hiệu suất có thể thay đổi trên các lĩnh vực bài toán cụ thể. Chuẩn đánh giá được thực hiện trong điều kiện zero-shot, nghĩa là không có ví dụ trước nào được cung cấp. Trong việc dạy kèm toán thực tế, mô hình có thể cần được nhắc nhở cẩn thận để xử lý chính xác các giải pháp nhiều bước.
Mặc dù điểm chuẩn duy nhất được cung cấp là MATH-500, thông tin công khai phổ biến cho thấy GPT-4o-mini cũng đạt điểm cạnh tranh trên MMLU (mức hiểu ngôn ngữ đa nhiệm lớn), HellaSwag và GSM8K. Nó thường xếp dưới GPT-4o nhưng trên GPT-3.5-turbo trên các chỉ số này. Trên các điểm chuẩn suy luận, nó thể hiện hiệu suất mạnh mẽ so với số lượng tham số của nó. Trong viết sáng tạo hoặc sinh văn bản mở, đầu ra của nó mạch lạc nhưng có thể thiếu sắc thái của các mô hình lớn hơn. Độ trễ thường thấp hơn GPT-4o, làm cho nó phù hợp cho các ứng dụng thời gian thực. Để biết điểm số chính xác, hãy tham khảo tài liệu của OpenAI. OrcaRouter cung cấp quyền truy cập mà không có additional markups.
Độ trễ phụ thuộc vào độ phức tạp của yêu cầu, số lượng token và tải API. GPT-4o-mini được thiết kế để nhanh—thường trả về token đầu tiên trong vòng dưới một giây đối với các prompt có độ dài vừa phải. Đối với các tài liệu dài (ví dụ: 50K token), độ trễ sẽ tăng lên khi mô hình xử lý toàn bộ ngữ cảnh. OrcaRouter không làm thay đổi tốc độ; bạn trải nghiệm thời gian phản hồi tương tự như các cuộc gọi API trực tiếp của OpenAI. Hỗ trợ phát trực tuyến (streaming) để giảm độ trễ cảm nhận. Đối với các ứng dụng yêu cầu độ trễ thấp, hãy cân nhắc giữ độ dài prompt ngắn và sử dụng streaming. Thời gian chính xác đến token đầu tiên có thể được đo bằng cách theo dõi thời gian phản hồi; không có SLA cụ thể nào được cung cấp.
Mặc dù có khả năng, GPT-4o-mini vẫn có những hạn chế do kích thước nhỏ hơn. Nó có thể đưa ra các câu trả lời kém chính xác hơn trong các tác vụ suy luận phức tạp nhiều bước so với GPT-4o. Đôi khi nó có thể hiểu sai các hướng dẫn tinh tế hoặc không duy trì được mạch lạc hoàn hảo trên các đầu ra rất dài. Khả năng đa phương thức của nó tốt nhưng không hoàn hảo; nó có thể bỏ lỡ các chi tiết nhỏ trong ảnh hoặc đếm sai các thành phần. Mô hình có thể thể hiện các thiên kiến có trong dữ liệu huấn luyện. Nó không hỗ trợ tìm kiếm internet hoặc truy cập dữ liệu thời gian thực trừ khi được tinh chỉnh rõ ràng cho mục đích sử dụng công cụ. Đối với các tác vụ yêu cầu độ chính xác cao (ví dụ: tư vấn pháp lý, chẩn đoán y tế), việc xem xét của con người là rất cần thiết. Điểm chuẩn phản ánh các điều kiện được kiểm soát; hiệu suất thực tế có thể khác nhau.
OrcaRouter chuyển tiếp giá chính xác của OpenAI mà không có phụ phí: $0.15 trên 1 triệu token đầu vào và $0.60 trên 1 triệu token đầu ra. Token đầu vào bao gồm tất cả văn bản, token hình ảnh và nội dung tệp. Token đầu ra tính văn bản được tạo ra. Không có phí hàng tháng hoặc phí ẩn. Đây là một trong những chi phí trên mỗi token thấp nhất cho mô hình đa phương thức với cửa sổ ngữ cảnh 128K. Để so sánh, GPT-4o có giá $2.50 trên 1M đầu vào và $10 trên 1M đầu ra, khiến GPT-4o-mini rẻ hơn 94% ở đầu vào và 94% ở đầu ra. Lợi thế về chi phí là đáng kể đối với các ứng dụng có khối lượng lớn.
Trong khi GPT-4o-mini có chi phí thấp trên mỗi token, kích thước nhỏ hơn của nó có thể đòi hỏi nhiều lần thử hơn hoặc hướng dẫn chi tiết hơn để đạt được độ chính xác mong muốn, có khả năng làm tăng tổng lượng token tiêu thụ. Đối với các tác vụ mà GPT-4o đưa ra câu trả lời đúng ngay lần đầu nhưng GPT-4o-mini cần ba lần, tổng chi phí có thể tương tự hoặc thậm chí cao hơn. Ngoài ra, nếu bạn cần gửi nhiều yêu cầu nhỏ, chi phí chung của các lệnh gọi API có thể làm tăng độ trễ nhưng không phải chi phí trực tiếp. Bộ nhớ đệm không được áp dụng; mỗi yêu cầu đều được xử lý mới. Hãy đánh giá trường hợp sử dụng của bạn với cả hai mô hình để xác định sự cân bằng chi phí-hiệu suất tốt nhất. OrcaRouter cung cấp mức giá nhất quán mà không có chiết khấu theo khối lượng.
OrcaRouter không triển khai bộ nhớ đệm lời nhắc. Mọi yêu cầu đến GPT-4o-mini được gửi đến máy chủ của OpenAI và tính phí theo token. Không có mức giá ưu đãi cho các lời nhắc lặp lại. Nếu khối lượng công việc của bạn thường xuyên lặp lại cùng một thông báo hệ thống hoặc ngữ cảnh dài, bạn có thể cân nhắc lưu trữ phản hồi ở phía bạn để tránh gửi lại các lời nhắc giống hệt nhau. Một số nhà cung cấp cung cấp giảm giá bộ nhớ đệm lời nhắc, nhưng qua OrcaRouter, bạn trả mức giá tiêu chuẩn của nhà cung cấp. Điều này minh bạch và có thể dự đoán trước. Việc thiếu bộ nhớ đệm giúp đơn giản hóa giá cả nhưng đồng nghĩa bạn nên thiết kế truy vấn để giảm thiểu việc sử dụng token dư thừa.
(Lưu ý: Không có phiên bản khác nào của GPT-4o-mini được cung cấp. Giả sử câu hỏi là về so sánh với các mô hình mini khác như Claude 3 Haiku hoặc Gemini Flash, nhưng chỉ có dữ kiện được cung cấp. Thay vào đó, chúng tôi so sánh với GPT-4o.) So với GPT-4o, GPT-4o-mini rẻ hơn đáng kể: $0,15 so với $2,50 trên 1M token đầu vào (rẻ hơn 94%) và $0,60 so với $10 trên 1M token đầu ra (rẻ hơn 94%). Nhiều người dùng nhận thấy GPT-4o-mini đáp ứng được 80-90% tác vụ, mang lại khoản tiết kiệm lớn. Tuy nhiên, đối với các tác vụ yêu cầu độ chính xác tối đa (ví dụ: tạo mã phức tạp, lập luận pháp lý tinh tế), việc tiết kiệm chi phí có thể không bù đắp được sự sụt giảm chất lượng. OrcaRouter cho phép bạn chuyển đổi giữa các mô hình dễ dàng thông qua cùng một điểm cuối API bằng cách thay đổi ID mô hình.
Sử dụng thư viện client OpenAI hoặc bất kỳ HTTP client nào, chỉ định base URL là https://api.orcarouter.ai/v1. Đặt tham số model thành "openai/gpt-4o-mini". Xác thực yêu cầu một khóa API OrcaRouter. Một ví dụ Python tối thiểu: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your-key") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explain quantum computing."}]) Tất cả các tham số API OpenAI đều được hỗ trợ, bao gồm temperature, max_tokens, stream và tools. OrcaRouter chuyển tiếp các yêu cầu đến OpenAI và trả về phản hồi không thay đổi.
Các tham số Standard OpenAI Chat Completions: model (bắt buộc: "openai/gpt-4o-mini"), messages (mảng các đối tượng message), temperature (0-2, mặc định 1), top_p (0-1, mặc định 1), n (số lượng phản hồi, mặc định 1), stream (boolean), stop (chuỗi/mảng), max_tokens (tối đa 16384), presence_penalty, frequency_penalty, logit_bias, user (tùy chọn), và tools cho function calling. Đối với vision, bao gồm nội dung hình ảnh trong messages (kiểu "image_url" hoặc "image_url" với detail). Đầu vào tệp có thể được mã hóa base64. OrcaRouter chuyển tất cả tham số tới OpenAI. Lưu ý: Response format (JSON mode) được hỗ trợ; đặt response_format={ "type": "json_object" } khi thích hợp.
Việc di chuyển rất đơn giản: thay đổi base URL trong client của bạn từ "https://api.openai.com/v1" sang "https://api.orcarouter.ai/v1" và thay thế khóa API của bạn bằng khóa OrcaRouter. Cập nhật tên mô hình thành "openai/gpt-4o-mini" (hoặc giữ nguyên là "gpt-4o-mini"? Thực tế cho biết model id là "openai/gpt-4o-mini", vì vậy hãy sử dụng nó). Tất cả mã nguồn khác vẫn không thay đổi vì API hoàn toàn tương thích với OpenAI. Bạn cũng có thể giữ nhiều chuỗi mô hình và định tuyến dựa trên chi phí hoặc khả năng. OrcaRouter không thay đổi định dạng phản hồi. Hãy kiểm tra với một vài truy vấn để đảm bảo các header và streaming hoạt động như mong đợi.
Vâng, GPT-4o-mini hỗ trợ phát trực tuyến qua sự kiện do máy chủ gửi (SSE). Đặt stream=true trong yêu cầu. Phản hồi sẽ là một loạt các chunk chứa nội dung delta. Điều này giảm thời gian đến token đầu tiên (time-to-first-token) cho người dùng và cho phép hiển thị theo thời gian thực. OrcaRouter chuyển tiếp các phản hồi phát trực tuyến mà không sửa đổi. Lưu ý rằng tổng số token được tính phí vẫn giữ nguyên. Phát trực tuyến tương thích với tất cả các phương thức đầu vào (văn bản, hình ảnh, tệp). Bạn cũng có thể kết hợp phát trực tuyến với các lệnh gọi hàm; mô hình sẽ phát trực tuyến một chunk gọi công cụ (tool call chunk) khi thích hợp. Tham số max_tokens áp dụng cho toàn bộ phản hồi.
GPT-4o-mini là phiên bản nhỏ hơn, rẻ hơn của GPT-4o. Chi phí của nó thấp hơn khoảng 94% cho cả token đầu vào và đầu ra. Nó có cùng cửa sổ ngữ cảnh 128K và đầu ra tối đa 16K. Nó hỗ trợ cùng loại đầu vào đa phương thức nhưng thường kém chính xác hơn một chút trong các tác vụ suy luận phức tạp và sáng tạo. Trên MATH-500, GPT-4o-mini đạt 78,9 điểm trong khi GPT-4o đạt khoảng 92+ (xấp xỉ). Đối với nhiều tác vụ hàng ngày như hỗ trợ khách hàng, tóm tắt và thị giác đơn giản, GPT-4o-mini là đủ. Hãy chọn GPT-4o khi bạn cần hiệu suất cao nhất và có thể chấp nhận độ trễ cùng chi phí cao hơn.
So sánh với các mô hình như Claude 3 Haiku hay Gemini 1.5 Flash: GPT-4o-mini cung cấp cửa sổ ngữ cảnh 128K, trong khi Haiku cho phép 200K và Flash 1M. Giá cả tương tự nhau (Haiku $0,25/$1,25 cho mỗi 1M token; Flash $0,35/$1,05). Điểm MATH-500 của GPT-4o-mini là 78,9 có tính cạnh tranh; Haiku đạt khoảng 73 và Flash khoảng 78 trên các bài kiểm tra toán tương tự. Về đầu vào đa phương thức, cả ba đều chấp nhận hình ảnh. GPT-4o-mini có thể có chất lượng suy luận tốt hơn so với mức giá của nó, nhưng cửa sổ ngữ cảnh nhỏ hơn một số đối thủ. Lựa chọn tốt nhất phụ thuộc vào yêu cầu cụ thể của bạn về độ trễ, chi phí và chất lượng. OrcaRouter cũng cung cấp quyền truy cập vào Haiku và Flash, cho phép so sánh song song.
GPT-3.5-turbo cũ hơn, có cửa sổ ngữ cảnh 16K và chi phí thấp hơn một chút ($0,50/1M input so với $0,15 của GPT-4o-mini? Thực tế GPT-3.5-turbo-0125 có giá $0,50/$1,50 nhưng ngữ cảnh nhỏ hơn. Dựa trên bảng giá đã cho, GPT-4o-mini rẻ hơn mỗi token và cung cấp ngữ cảnh lớn hơn cùng khả năng đa phương thức. Vì vậy, đối với hầu hết các tác vụ, GPT-4o-mini vượt trội hơn. Tuy nhiên, một số ứng dụng kế thừa đã sử dụng GPT-3.5-turbo có thể cần thay đổi tối thiểu. GPT-4o-mini cũng hoạt động tốt hơn trên các điểm chuẩn suy luận. Trừ khi độ trễ cực kỳ quan trọng hoặc bạn đã tinh chỉnh một mô hình GPT-3.5, GPT-4o-mini là bản nâng cấp thay thế được khuyến nghị.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Đầu vào / 1M tokens | $0.150 |
| Đầu ra / 1M tokens | $0.600 |
| Đọc cache / 1M | $0.075 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/openai/gpt-4o-miniMở @misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini