GPT-4o mini Search Preview là một mô hình chuyên dụng cho tìm kiếm web trong Chat Completions. Nó được huấn luyện để hiểu và thực hiện các truy vấn tìm kiếm web.
GPT-4o-mini Search Preview là một biến thể của mô hình GPT-4o-mini của OpenAI, tích hợp sẵn khả năng tìm kiếm trên web. Mô hình này được thiết kế để cung cấp câu trả lời kết hợp thông tin thời gian…
Mô hình này kết hợp khả năng hiểu và sinh ngôn ngữ tổng quát với tìm kiếm web trực tiếp. Nó có thể trả lời các câu hỏi về sự kiện gần đây, lấy dữ liệu từ các trang web cụ thể và tổng hợp thông tin từ nhiều nguồn trực tuyến. Mô hình vẫn giữ các khả năng điển hình của GPT-4o-mini: tóm tắt văn bản, dịch thuật, sinh mã, suy luận logic và viết sáng tạo. Bản xem trước tìm kiếm bổ sung khả năng truy cập tin tức hiện tại, giá cổ phiếu, thời tiết, chi tiết sản phẩm và các dữ liệu nhạy cảm về thời gian khác. Tuy nhiên, vì mô hình được tinh chỉnh để đạt tốc độ và hiệu quả, độ sâu suy luận của nó có thể thấp hơn so với mô hình GPT-4o đầy đủ.
Mô hình hoạt động tốt trong các tình huống mà câu trả lời phụ thuộc vào thông tin thay đổi hoặc gần đây. Ví dụ bao gồm nhân viên hỗ trợ khách hàng trực tiếp cần kiểm tra trạng thái đơn hàng hoặc chính sách hoàn trả, các công cụ nội dung tạo bản tóm tắt về các chủ đề thịnh hành, và trợ lý nghiên cứu tổng hợp thông tin từ nhiều nguồn trực tuyến. Nó cũng hữu ích để xác minh các tuyên bố dựa trên dữ liệu hiện tại, chẳng hạn như kiểm tra thông báo mới nhất của một công ty hoặc tỷ số thể thao. Nhờ chi phí tương đối thấp và thời gian phản hồi nhanh, nó phù hợp cho các ứng dụng có khối lượng yêu cầu cao, nơi tính năng gắn kết với web là một yếu tố chính.
Nếu ứng dụng của bạn không yêu cầu tìm kiếm web hoặc thông tin cập nhật, hãy cân nhắc sử dụng GPT-4o-mini cơ sở (base) mà không có bản xem trước tìm kiếm. Mô hình cơ sở thậm chí còn rẻ hơn (cùng mức giá trên mỗi token, nhưng không có chi phí truy xuất tìm kiếm) và có thể nhanh hơn cho các tác vụ hội thoại thuần túy. Đối với các truy vấn rất đơn giản không cần kiến thức thế giới rộng, các mô hình nhỏ hơn như GPT-4o-mini (base) hoặc thậm chí các mô hình cũ hơn như GPT-3.5 Turbo có thể đủ dùng. Hãy đánh giá xem tính năng xem trước tìm kiếm có xứng đáng với chi phí cho trường hợp sử dụng cụ thể của bạn hay không.
Bản xem trước tìm kiếm được mô hình tự động kích hoạt khi nó cho rằng truy vấn cần thông tin bên ngoài. Bạn không cần phải cấu hình các API tìm kiếm hoặc truyền kết quả tìm kiếm theo cách thủ công. Tuy nhiên, bạn có thể ảnh hưởng đến hành vi của mô hình bằng cách yêu cầu nó sử dụng tìm kiếm web một cách rõ ràng hoặc chỉ định nguồn. Mô hình tôn trọng các bộ lọc an toàn và nội dung tiêu chuẩn do OpenAI áp dụng. Lưu ý rằng tìm kiếm web có thể gây ra độ trễ so với mô hình cơ sở, vì mô hình phải chờ kết quả tìm kiếm trước khi tạo phản hồi cuối cùng.
Các điểm chuẩn cụ thể cho GPT-4o-mini Search Preview chưa được công bố công khai dưới dạng một biến thể riêng biệt. Tuy nhiên, dựa trên GPT-4o-mini cơ bản, mô hình này được kỳ vọng sẽ hoạt động tốt trên các chuẩn NLP tiêu chuẩn như MMLU, HellaSwag và GSM8K, nhưng có độ chính xác thấp hơn so với GPT-4o đầy đủ. Tính năng xem trước tìm kiếm có thể cải thiện hiệu suất trên các tác vụ yêu cầu kiến thức hiện tại (như các câu hỏi về sự kiện gần đây) nhưng không thay đổi khả năng suy luận cốt lõi của mô hình. Về độ chính xác thực tế, mô hình phụ thuộc vào chất lượng và tính kịp thời của các nguồn web mà nó truy xuất.
GPT-4o-mini Search Preview được thiết kế để có độ trễ thấp hơn so với GPT-4o. GPT-4o-mini cơ bản nổi tiếng với tốc độ suy luận nhanh, và bản xem trước có tìm kiếm thêm thời gian để truy xuất web. Tổng thời gian phản hồi phụ thuộc vào các yếu tố như độ trễ mạng, số lượng kết quả tìm kiếm được truy xuất và độ dài ngữ cảnh. Trong sử dụng thông thường, phản hồi được tạo ra trong vòng vài giây. Đối với các ứng dụng yêu cầu độ trễ tối thiểu tuyệt đối, GPT-4o-mini cơ bản (không có tìm kiếm) sẽ nhanh hơn. API của OrcaRouter hỗ trợ phát trực tiếp để bắt đầu hiển thị token khi chúng được tạo ra.
Điểm mạnh: Mô hình cung cấp thông tin cập nhật mà không cần tích hợp tìm kiếm riêng, có cửa sổ ngữ cảnh lớn (128k token) và tiết kiệm chi phí cho khối lượng sử dụng lớn. Hạn chế: Chỉ chấp nhận văn bản; đôi khi có thể truy xuất nội dung web không đầy đủ hoặc không liên quan; khả năng suy luận kém sâu hơn GPT-4o; và bản xem trước tìm kiếm có thể làm tăng độ trễ. Ngoài ra, mô hình có thể không luôn trích dẫn nguồn rõ ràng, vì vậy người dùng nên xác minh thông tin quan trọng. Mô hình không được thiết kế cho các tác vụ như hiểu đa phương thức, toán học nâng cao hoặc suy luận chuỗi tư duy phức tạp mà GPT-4o thực hiện tốt hơn.
OrcaRouter tính phí GPT-4o-mini Search Preview theo giá nhà cung cấp, không tăng giá: $0,15 cho mỗi triệu token đầu vào và $0,60 cho mỗi triệu token đầu ra. Điều này có nghĩa là bạn trả chính xác số tiền mà OpenAI tính, không có bất kỳ khoản phí bổ sung nào. Giá được tính theo từng token, với token ngữ cảnh được tính là đầu vào và token sinh ra là đầu ra. Mô hình sử dụng lược đồ token hóa tiêu chuẩn của OpenAI. Không có phí phụ trội cho tính năng xem trước tìm kiếm; chi phí tương tự như GPT-4o-mini cơ bản, mặc dù có thêm khả năng truy xuất web.
So với GPT-4o (có giá $2.50 cho mỗi triệu token đầu vào và $10 cho mỗi triệu token đầu ra), GPT-4o-mini Search Preview rẻ hơn đáng kể—khoảng 16 lần cho đầu vào và 16,6 lần cho đầu ra. Điều này khiến nó trở thành ứng viên mạnh mẽ cho các ứng dụng mà chi phí cho mỗi truy vấn là quan trọng, đặc biệt khi bạn cần tìm kiếm web. Tuy nhiên, GPT-4o-mini cơ bản (không có search preview) có cùng chi phí mỗi token nhưng thiếu tính năng tìm kiếm. Nếu không cần tìm kiếm, bạn có thể tiết kiệm một chút độ trễ thêm, nhưng chi phí mỗi token là giống hệt nhau.
OrcaRouter có thể hỗ trợ lưu đệm kết quả tìm kiếm hoặc phản hồi của mô hình, tùy thuộc vào cấu hình. Nếu được bật, các truy vấn lặp lại cho cùng một thông tin có thể được phục vụ từ bộ nhớ đệm, giảm cả độ trễ và lượng token sử dụng. Tuy nhiên, chính sách lưu đệm có thể khác nhau. Để có thông tin mới nhất, mô hình thường thực hiện tìm kiếm web mới cho mỗi yêu cầu. Để giảm thiểu chi phí, hãy cân nhắc sử dụng base GPT-4o-mini nếu các truy vấn của bạn không yêu cầu dữ liệu web. Luôn theo dõi lượng token sử dụng qua bảng điều khiển của OrcaRouter để hiểu chi tiêu của bạn.
OrcaRouter truyền qua giá chính xác của OpenAI mà không thêm bất kỳ khoản chênh lệch nào. Việc tính phí dựa trên số lượng token theo báo cáo của nhà cung cấp. Không có phí thiết lập, phí tối thiểu hàng tháng hay phụ phí cho cổng API. Bạn chỉ trả tiền cho các token bạn sử dụng theo mức giá đã chỉ định. Đối với GPT-4o-mini Search Preview, có nghĩa là $0.15 mỗi triệu token đầu vào và $0.60 mỗi triệu token đầu ra. Đảm bảo tài khoản của bạn đã được thiết lập với OrcaRouter để truy cập mô hình theo các mức giá này.
Để sử dụng mô hình, hãy gửi yêu cầu POST đến https://api.orcarouter.ai/v1/chat/completions với trường model được đặt thành "openai/gpt-4o-mini-search-preview". Endpoint này tương thích với OpenAI, vì vậy bạn có thể sử dụng bất kỳ SDK hoặc client OpenAI nào bằng cách thay đổi base URL và API key. Ví dụ curl: curl https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_ORCAROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "openai/gpt-4o-mini-search-preview", "messages": [{"role": "user", "content": "What is the current weather in London?"}] }' Tính năng xem trước tìm kiếm sẽ được kích hoạt tự động.
API hỗ trợ tất cả các tham số hoàn tất chat tiêu chuẩn của OpenAI: temperature (0-2, mặc định 1), top_p, n, stream, stop, max_tokens (tối đa 16384), presence_penalty, frequency_penalty và logit_bias. Mô hình tôn trọng các tham số này. Đối với bản xem trước tìm kiếm, không cần thêm tham số nào; mô hình tự quyết định khi nào tìm kiếm. Tuy nhiên, bạn có thể nhắc nó yêu cầu tìm kiếm web một cách rõ ràng (ví dụ: "Tìm kiếm trên web tin tức mới nhất về...") để khuyến khích truy xuất. Lưu ý rằng mô hình vẫn có thể chọn không tìm kiếm nếu nó cho rằng kiến thức nội bộ đã đủ.
Nếu bạn đã sử dụng API của OpenAI, việc chuyển sang OrcaRouter rất đơn giản: thay đổi base URL từ https://api.openai.com/v1 thành https://api.orcarouter.ai/v1, và thay thế API key của bạn bằng key từ OrcaRouter. ID model trở thành "openai/gpt-4o-mini-search-preview". Tất cả các phần thân yêu cầu và định dạng phản hồi khác vẫn giữ nguyên. Bạn có thể sử dụng bất kỳ thư viện client nào của OpenAI (Python, Node.js, v.v.) mà không cần sửa đổi. OrcaRouter cũng hỗ trợ streaming, gọi hàm và các tính năng nâng cao khác tương thích với API của OpenAI.
Để phản hồi dạng stream, đặt "stream": true trong yêu cầu của bạn. OrcaRouter trả về dữ liệu dưới dạng các sự kiện do máy chủ gửi (server-sent events), giống hệt định dạng streaming của OpenAI. Mỗi sự kiện chứa một delta của phản hồi. Streaming đặc biệt hữu ích cho các ứng dụng hướng tới người dùng để hiển thị các token khi chúng được tạo ra. Đối với các truy vấn xem trước tìm kiếm, mô hình có thể trước tiên cho biết rằng nó đang tìm kiếm trước khi xuất ra câu trả lời cuối cùng. Stream sẽ bao gồm các token tạm thời đó. Đảm bảo client của bạn có thể xử lý các bản cập nhật một phần một cách linh hoạt.
GPT-4o-mini Search Preview là một biến thể nhỏ hơn, nhanh hơn và rẻ hơn của GPT-4o với khả năng tìm kiếm web được thêm vào. Trong khi GPT-4o có khả năng suy luận vượt trội, cơ sở kiến thức lớn hơn (tính đến thời điểm cắt đào tạo), và hỗ trợ đa phương thức (hình ảnh, âm thanh), mô hình này chỉ hỗ trợ văn bản và dựa vào tìm kiếm web để khắc phục kiến thức đào tạo hạn chế của nó. Đối với các tác vụ yêu cầu phân tích sâu hoặc toán học phức tạp, GPT-4o tốt hơn. Đối với các ứng dụng nhạy cảm về chi phí cần thông tin mới, GPT-4o-mini Search Preview là một lựa chọn thay thế mạnh mẽ. Giá thành rẻ hơn khoảng 16 lần.
Phiên bản GPT-4o-mini cơ bản không bao gồm tìm kiếm web; nó chỉ dựa vào dữ liệu huấn luyện của mình, có ngày cắt trong cuối năm 2023. GPT-4o-mini Search Preview thêm khả năng truy xuất thông tin hiện tại từ internet. Cả hai mô hình đều có cùng cửa sổ ngữ cảnh (128k token), đầu ra tối đa (16384) và giá trên mỗi token. Biến thể search preview có thể có độ trễ cao hơn một chút do truy xuất web. Nếu ứng dụng của bạn không cần dữ liệu trực tiếp, mô hình cơ bản có chức năng tương tự và có thể nhanh hơn. Cả hai mô hình đều được truy cập qua OrcaRouter với các ID mô hình khác nhau.
Các mô hình hỗ trợ tìm kiếm khác bao gồm Gemini với tính năng căn cứ tìm kiếm Google, hoặc các mô hình sử dụng truy xuất web dựa trên plugin. GPT-4o-mini Search Preview cung cấp tích hợp gốc mà không cần plugin bên ngoài. Nhìn chung, nó rẻ hơn so với các mô hình hỗ trợ tìm kiếm lớn hơn (như GPT-4 với tính năng duyệt web). Tuy nhiên, kết quả tìm kiếm của nó có thể kém toàn diện hơn so với các API tìm kiếm chuyên dụng. Đối với kiến thức web đòi hỏi độ chính xác cao, hãy cân nhắc bổ sung bằng một API tìm kiếm thực tế và đưa kết quả vào một mô hình cơ sở. Mô hình này phù hợp nhất cho các truy vấn đơn giản đến phức tạp vừa phải có lợi từ dữ liệu web hiện tại.
Chọn mô hình này khi bạn cần: (1) chi phí thấp cho mỗi truy vấn, (2) tìm kiếm web tự động mà không cần tích hợp tùy chỉnh, (3) thời gian phản hồi nhanh, và (4) cửa sổ ngữ cảnh lớn. Chọn một biến thể GPT-4o đầy đủ nếu bạn cần đầu vào đa phương thức hoặc suy luận sâu hơn. Chọn GPT-4o-mini cơ bản nếu bạn không cần tìm kiếm web và muốn phản hồi nhanh hơn một chút. Chọn API tìm kiếm chuyên dụng kết hợp với một mô hình nhỏ nếu bạn cần kiểm soát chi tiết nguồn và kết quả tìm kiếm. Mô hình này phù hợp nhất để thay thế trực tiếp cho GPT-3.5 hoặc GPT-4o-mini trong các ứng dụng có lợi từ thông tin trực tiếp.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-search-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatstreamstructured_outputsweb_search_options| Đầu vào / 1M tokens | $0.150 |
| Đầu ra / 1M tokens | $0.600 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/openai/gpt-4o-mini-search-previewMở @misc{orcarouter_gpt_4o_mini_search_preview,
title = {GPT-4o-mini Search Preview API},
author = {OpenAI},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview}
}OpenAI. (2025). GPT-4o-mini Search Preview API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview