GPT-4o mini là mô hình mới nhất của OpenAI sau [GPT-4 Omni](/models/openai/gpt-4o), hỗ trợ cả đầu vào văn bản và hình ảnh với đầu ra văn bản. Là mô hình nhỏ tiên tiến nhất của họ, nó có giá phải chăng hơn nhiều lần...
GPT-4o-mini (2024-07-18) là một mô hình đa phương thức nhẹ do OpenAI phát triển, được thiết kế để xử lý văn bản và hình ảnh hiệu quả về chi phí. Mô hình này dành cho các nhà phát triển và tổ chức cần…
GPT-4o-mini có thể thực hiện các tác vụ suy luận hình ảnh như mô tả nội dung trực quan, trả lời câu hỏi về hình ảnh và xác định đối tượng hoặc văn bản trong ảnh. Mô hình hỗ trợ các định dạng hình ảnh tiêu chuẩn (JPEG, PNG, GIF, WebP) và có thể xử lý nhiều hình ảnh trong một yêu cầu duy nhất. Mô hình không thực hiện phát hiện đối tượng theo khung giới hạn có cấu trúc, nhưng có thể mô tả vị trí và mối quan hệ. Ví dụ, nó có thể đọc văn bản từ ảnh chụp, hiểu biểu đồ và sơ đồ, và cung cấp mô tả chi tiết về cảnh. Độ chính xác của các tác vụ dựa trên hình ảnh phụ thuộc vào độ phân giải và ngữ cảnh; hình ảnh có độ phân giải cao có thể tiêu tốn nhiều token hơn nhưng có thể mang lại kết quả tốt hơn cho các chi tiết nhỏ.
GPT-4o-mini chấp nhận đầu vào tệp như PDF, tài liệu Word và tệp hình ảnh thông qua cấu trúc nội dung đa phương thức. Khi một tệp được cung cấp, mô hình sẽ trích xuất nội dung văn bản và hình ảnh từ tệp đó, cho phép người dùng đặt câu hỏi về nội dung của tài liệu, tóm tắt văn bản hoặc phân tích các bảng và hình ảnh nhúng. Tệp không được tải lên hoặc lưu trữ; nó được xử lý trực tiếp trong quá trình gọi API. Điều này hữu ích cho các quy trình làm việc liên quan đến xem xét tài liệu, phân tích hợp đồng hoặc trích xuất dữ liệu từ các biểu mẫu được quét. Lưu ý rằng các tệp rất lớn có thể vượt quá cửa sổ ngữ cảnh 128.000 token hoặc gây ra chi phí token cao.
Đối với các tác vụ chỉ yêu cầu sinh văn bản nhẹ, ngân sách token có thể được sử dụng hiệu quả hơn bởi các mô hình thậm chí còn rẻ hơn như GPT-3.5-Turbo hoặc các giải pháp thay thế mã nguồn mở (ví dụ: Llama 3 8B). Nếu khối lượng công việc của bạn không cần đầu vào đa phương thức hay ngữ cảnh 128k, một mô hình nhỏ hơn có thể giảm thêm chi phí. Ngoài ra, đối với các tác vụ hẹp như phân loại đơn giản hoặc trích xuất từ khóa, một mô hình nhỏ hơn đã được tinh chỉnh có thể mang lại độ trễ và chi phí thấp hơn. Tuy nhiên, sự kết hợp giữa giá thấp, ngữ cảnh lớn và khả năng đa phương thức của GPT-4o-mini khiến nó trở thành lựa chọn mặc định mạnh mẽ cho nhiều ứng dụng đa năng.
GPT-4o-mini vượt trội trong các môi trường sản xuất khối lượng lớn được hưởng lợi từ khả năng hiểu đa phương thức và cửa sổ ngữ cảnh lớn. Các trường hợp sử dụng lý tưởng bao gồm chatbot hỗ trợ khách hàng có thể xử lý ảnh chụp màn hình và lịch sử hội thoại dài, quy trình xử lý tài liệu để trích xuất dữ liệu từ PDF hoặc hình ảnh, công cụ giáo dục cho việc dạy toán (được chứng minh qua điểm số 78.9 MATH-500), và gỡ lỗi mã nguồn khi có cả văn bản và sơ đồ. Nó cũng phù hợp cho các quy trình kiểm duyệt nội dung yêu cầu phân tích hình ảnh kèm văn bản. Chi phí thấp trên mỗi token cho phép mở rộng lên hàng triệu yêu cầu mà không tốn kém quá mức.
GPT-4o-mini đạt điểm số 78.9 trên benchmark MATH-500, một tập con của bộ dữ liệu MATH bao gồm 500 bài toán khó. Điểm số này cho thấy khả năng của mô hình trong việc giải các bài toán số học, đại số, hình học và các dạng toán khác với suy luận từng bước. Với điểm 78.9, mô hình này vượt trội hơn nhiều mô hình nhỏ hơn và một số phiên bản GPT-4 trước đó, cho thấy khả năng suy luận mạnh mẽ đối với một mô hình có kích thước và chi phí như vậy. Tuy nhiên, nó không hiệu quả bằng GPT-4o đầy đủ hay GPT-4 Turbo trên cùng benchmark. Kết quả cần được diễn giải trong bối cảnh: GPT-4o-mini được thiết kế để tối ưu hiệu suất, không phải độ chính xác tối đa.
Các số liệu về độ trễ cụ thể không được OpenAI công bố công khai, nhưng GPT-4o-mini thường nhanh hơn các mô hình GPT-4 lớn hơn nhờ số lượng tham số nhỏ hơn. Trong thực tế, người dùng báo cáo thời gian đến token đầu tiên (time-to-first-token) trong khoảng vài trăm mili giây đối với các truy vấn ngắn và thông lượng sinh hàng chục token mỗi giây. Độ trễ phụ thuộc vào tổng số token (đầu vào + đầu ra), số lượng hình ảnh và tải máy chủ hiện tại. Vì OrcaRouter hoạt động như một proxy, độ trễ mạng bổ sung là tối thiểu—thông thường chỉ trong vòng vài mili giây so với độ trễ trực tiếp của API OpenAI. Mô hình hỗ trợ phát trực tuyến (streaming) cho các ứng dụng thời gian thực.
Điểm mạnh: Hiệu quả về chi phí (mức giá thấp nhất trong số các thành viên gia đình GPT-4 có hỗ trợ đa phương thức), cửa sổ ngữ cảnh lớn 128k, khả năng suy luận toán học vững chắc (78,9 MATH-500) và suy luận nhanh so với các mô hình lớn hơn. Nó xử lý đầu vào hình ảnh và tệp một cách thành thạo cho các tác vụ tổng quát. Hạn chế: Đối với các tác vụ suy luận phức tạp, tinh tế hoặc viết sáng tạo, nó hoạt động kém hơn so với GPT-4o và GPT-4 Turbo. Khả năng tuân theo hướng dẫn của nó có thể kém tin cậy hơn đối với các tác vụ yêu cầu định dạng nghiêm ngặt hoặc các ràng buộc đa bước. Ngoài ra, vì là mô hình nhỏ hơn, điểm cắt kiến thức của nó (tháng 1 năm 2024) có thể đã lỗi thời đối với các sự kiện rất gần đây. Nó cũng không hỗ trợ khả năng thị giác để phát hiện đối tượng chi tiết hoặc nhận dạng khuôn mặt.
Giá được đặt ở mức $0.15 cho mỗi 1 triệu token đầu vào và $0.60 cho mỗi 1 triệu token đầu ra. Đây là mức giá chuẩn của nhà cung cấp OpenAI, và OrcaRouter không tính thêm bất kỳ khoản phí chênh lệch nào. Hóa đơn được tính dựa trên số lượng token được báo cáo bởi nhà cung cấp mô hình. Không có phí bổ sung cho mỗi yêu cầu hoặc mức tối thiểu. Chính sách không chênh lệch giá áp dụng cho tất cả các mô hình có sẵn qua OrcaRouter, khiến giá cả giống hệt như bạn phải trả trực tiếp cho OpenAI. Sự minh bạch này cho phép người dùng lập ngân sách chính xác mà không có chi phí bất ngờ.
Các token đầu ra đắt hơn bốn lần mỗi token so với token đầu vào ($0.60 so với $0.15 mỗi triệu). Đối với các tác vụ tạo ra phản hồi dài, như tóm tắt chi tiết hoặc sinh mã, chi phí đầu ra có thể chiếm ưu thế. Người dùng có thể kiểm soát việc sử dụng token đầu ra thông qua tham số max_tokens và bằng cách tạo các prompt khuyến khích phản hồi ngắn gọn. Ngược lại, các tác vụ với đầu vào lớn (ví dụ: xử lý tài liệu dài với nhiều hình ảnh) sẽ phát sinh chi phí đầu vào. Cửa sổ ngữ cảnh lớn 128k giúp dễ dàng bao gồm nhiều ngữ cảnh, nhưng điều đó phải trả theo tỷ lệ token đầu vào. Tối ưu hóa sự cân bằng giữa độ dài đầu vào và đầu ra là chìa khóa để quản lý chi phí tổng thể.
OrcaRouter hiện không cung cấp tính năng caching tích hợp cho các yêu cầu GPT-4o-mini ngoài những gì OpenAI cung cấp ở cấp độ API. Không có chiết khấu theo khối lượng hoặc tùy chọn dung lượng dành riêng thông qua OrcaRouter; giá cả hoàn toàn là pay-as-you-go theo tỷ lệ nhà cung cấp OpenAI. Người dùng có trách nhiệm triển khai chiến lược caching của riêng họ (ví dụ: ở lớp ứng dụng) để giảm các lệnh gọi API trùng lặp. Chính sách zero markup có nghĩa là mọi thay đổi giá trong tương lai của OpenAI sẽ được phản ánh tự động. Đối với các trường hợp sử dụng khối lượng cực cao, các thỏa thuận doanh nghiệp trực tiếp với OpenAI có thể đưa ra các điều khoản tốt hơn, nhưng thông qua OrcaRouter, sự đơn giản của một khóa API duy nhất và hóa đơn thống nhất vẫn có thể mang lại lợi thế.
Hình ảnh được xử lý bởi GPT-4o-mini được chuyển đổi thành token dựa trên độ phân giải và mức độ chi tiết của chúng. OpenAI sử dụng thuật toán tính token có xét đến cả chiều rộng và chiều cao; ví dụ, một hình ảnh điển hình 1024x1024 ở mức độ chi tiết cao có thể tiêu tốn khoảng 2,000–3,000 token đầu vào. Vì token đầu vào được tính phí $0.15 mỗi triệu, chi phí cho mỗi hình ảnh rất thấp (thường dưới một xu). Tuy nhiên, xử lý nhiều hình ảnh trong một yêu cầu duy nhất có thể tích lũy lại. Người dùng có thể kiểm soát chi phí bằng cách sử dụng mức độ chi tiết `low` (tốn khoảng 85 token cho mỗi hình ảnh) khi không yêu cầu độ trung thực cao. Luôn kiểm tra các token đã sử dụng trong phản hồi API để hiểu chi phí hình ảnh.
Đặt URL gốc API của bạn thành https://api.orcarouter.ai/v1 và sử dụng ID model "openai/gpt-4o-mini-2024-07-18". API tuân theo định dạng chat completions chuẩn của OpenAI. Ví dụ, trong Python: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}]). Tất cả các tham số như temperature, top_p, max_tokens, stream và stop sequences đều được hỗ trợ như trong API OpenAI gốc. Các phản hồi bao gồm các trường chuẩn như id, choices, usage kèm số lượng token.
Để có đầu ra xác định, hãy đặt temperature=0 và top_p=1. Đối với các tác vụ sáng tạo, nhiệt độ (temperature) khoảng 0.8–1.2 có thể phù hợp. Max_tokens kiểm soát độ dài của phản hồi; mặc định là 16,384. Để giảm chi phí đầu ra, hãy đặt max_tokens phù hợp với nhu cầu của bạn. Khi sử dụng đầu vào đa phương thức, hãy cấu trúc tin nhắn với một mảng các phần nội dung: [{"type":"text","text":"Describe this:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]. Đối với xử lý tệp, hãy bao gồm nội dung tệp dưới dạng văn bản hoặc base64. Tham số stop có thể được sử dụng để dừng tạo tại các chuỗi tùy chỉnh. Stream=True cho phép phân phối token theo thời gian thực.
Việc di chuyển yêu cầu ba thay đổi đơn giản: Đặt base_url thành https://api.orcarouter.ai/v1, thay thế khóa API của bạn bằng khóa API OrcaRouter của bạn, và thay đổi ID mô hình thành "openai/gpt-4o-mini-2024-07-18". Không cần sửa đổi mã nào khác nếu bạn đang sử dụng các thư viện Python/Node.js của OpenAI hoặc bất kỳ HTTP client nào tuân theo định dạng chat completions tiêu chuẩn. Cấu trúc phản hồi là giống hệt nhau. Lưu ý rằng OrcaRouter không giới hạn tốc độ (throttle) các yêu cầu của bạn khác với OpenAI; các giới hạn tốc độ tương tự áp dụng theo cấp tài khoản OpenAI của bạn, nhưng bạn quản lý các khóa thông qua OrcaRouter. Hãy kiểm tra với một yêu cầu nhỏ để xác minh số lượng token và độ trễ.
Vui lòng cung cấp khóa API OrcaRouter của bạn trong tiêu đề Authorization: Authorization: Bearer <your-key>. API trả về các mã trạng thái HTTP tiêu chuẩn: 200 cho thành công, 400 cho yêu cầu không hợp lệ (ví dụ: tham số không hợp lệ), 401 cho không được phép (sai khóa API), 429 cho giới hạn tốc độ và 500 cho lỗi máy chủ. Phản hồi lỗi bao gồm nội dung JSON với một đối tượng lỗi chứa thông điệp và loại. Nên triển khai các lần thử lại với backoff theo cấp số nhân cho các lỗi 429 và 5xx. OrcaRouter không sửa đổi các phản hồi lỗi từ OpenAI, vì vậy các thông điệp lỗi tương tự bạn thấy với API trực tiếp sẽ xuất hiện.
GPT-4o-mini có khả năng vượt trội hơn đáng kể so với GPT-3.5-Turbo trong suy luận, toán học và tuân theo hướng dẫn, được chứng minh qua điểm MATH-500 là 78.9 so với điểm điển hình của GPT-3.5-Turbo khoảng 30-40. Nó cũng hỗ trợ đầu vào đa phương thức (hình ảnh và tệp), điều mà GPT-3.5-Turbo không có. Cửa sổ ngữ cảnh lớn hơn: 128k so với 16k. Định giá: GPT-4o-mini ($0.15/$0.60 mỗi triệu token) đắt hơn một chút so với GPT-3.5-Turbo ($0.50/$1.50 cho phiên bản 16k? Thực ra GPT-3.5-Turbo 0125 là $0.50/$1.50 mỗi triệu? Khoan, GPT-3.5-Turbo tiêu chuẩn là $1.50/$2.00 mỗi triệu? Tôi sẽ bám vào các dữ kiện được cung cấp: giá của GPT-4o-mini đã được đưa ra. So sánh về mặt chất lượng: GPT-4o-mini cung cấp hiệu suất tốt hơn với chi phí cao hơn một chút so với GPT-3.5-Turbo, nhưng có khả năng đa phương thức.
GPT-4o-mini là phiên bản nhỏ hơn, tiết kiệm chi phí hơn của GPT-4o. Cả hai đều có khả năng đa phương thức và cùng kích thước cửa sổ ngữ cảnh (128k token), nhưng GPT-4o đạt điểm chuẩn cao hơn trên các bài kiểm tra như MMLU và MATH. Điểm MATH-500 của GPT-4o-mini là 78,9, thấp hơn điểm được báo cáo của GPT-4o là khoảng 90–95. Giá cả rẻ hơn đáng kể: GPT-4o-mini ($0,15/$0,60) so với GPT-4o ($2,50/$10,00 mỗi triệu token). Đối với các ứng dụng yêu cầu độ chính xác tối đa trong các tác vụ suy luận phức tạp, GPT-4o là lựa chọn ưu tiên. Đối với các tác vụ có thông lượng cao và nhạy cảm về chi phí, nơi độ chính xác ở mức trung bình có thể chấp nhận được, GPT-4o-mini mang lại khoản tiết kiệm đáng kể.
Các mô hình mã nguồn mở như Llama 3 8B và 70B mang lại lợi thế tự triển khai với chi phí bằng 0 cho mỗi token, nhưng yêu cầu hạ tầng và chuyên môn. GPT-4o-mini qua OrcaRouter cung cấp truy cập không máy chủ, không chi phí ban đầu và tự động mở rộng quy mô. Trên các bài kiểm tra, điểm MATH-500 của GPT-4o-mini là 78,9, cạnh tranh với Llama 3 8B (khoảng 30-40) và gần với Llama 3 70B (khoảng 60-70). GPT-4o-mini cũng hỗ trợ hình ảnh gốc, điều mà hầu hết các mô hình mã nguồn mở không làm được. Sự đánh đổi: mô hình mã nguồn mở mang lại quyền riêng tư dữ liệu (không có lệnh gọi API bên ngoài) và độ trễ thấp hơn nếu có sẵn phần cứng suy luận. GPT-4o-mini mang lại sự dễ sử dụng và khả năng đa phương thức với mức giá thấp cho mỗi token.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Đầu vào / 1M tokens | $0.150 |
| Đầu ra / 1M tokens | $0.600 |
| Đọc cache / 1M | $0.075 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/openai/gpt-4o-mini-2024-07-18Mở @misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18