GPT-4o mini Search Preview è un modello specializzato per la ricerca web in Chat Completions. È addestrato per comprendere ed eseguire query di ricerca web.
GPT-4o-mini Search Preview è una variante del modello GPT-4o-mini di OpenAI che include funzionalità di ricerca web integrate. È progettato per fornire risposte che incorporano informazioni in tempo…
Il modello combina la comprensione e la generazione del linguaggio generale con la ricerca web in tempo reale. Può rispondere a domande su eventi recenti, estrarre dati da siti web specifici e sintetizzare informazioni da più fonti online. Mantiene le tipiche capacità di GPT-4o-mini: riassunto del testo, traduzione, generazione di codice, ragionamento logico e scrittura creativa. L'anteprima di ricerca aggiunge la possibilità di accedere a notizie attuali, quotazioni azionarie, meteo, dettagli di prodotti e altri dati sensibili al tempo. Tuttavia, poiché il modello è ottimizzato per velocità ed efficienza, la sua profondità di ragionamento potrebbe essere inferiore a quella del modello GPT-4o completo.
Il modello eccelle in scenari in cui le risposte dipendono da informazioni variabili o recenti. Esempi includono agenti di assistenza clienti in tempo reale che devono verificare lo stato di un ordine o le politiche di reso, strumenti di generazione di contenuti che riassumono argomenti di tendenza e assistenti di ricerca che raccolgono dati da più fonti online. È utile anche per verificare affermazioni rispetto a dati aggiornati, come controllare l'ultimo annuncio di un'azienda o il punteggio di una partita sportiva. Grazie al costo relativamente basso e ai tempi di risposta rapidi, è adatto per applicazioni con volumi elevati di richieste in cui il grounding web rappresenta una caratteristica chiave.
Se la tua applicazione non richiede ricerca web o informazioni aggiornate, considera l'utilizzo del GPT-4o-mini base senza anteprima di ricerca. Il modello base è ancora meno costoso (stesso prezzo per token, ma senza il sovraccarico del recupero della ricerca) e potrebbe essere più veloce per compiti puramente conversazionali. Per query molto semplici che non necessitano di un'ampia conoscenza del mondo, modelli più piccoli come GPT-4o-mini (base) o anche modelli più vecchi come GPT-3.5 Turbo potrebbero essere sufficienti. Valuta se la funzionalità di anteprima di ricerca giustifica il costo per il tuo caso d'uso specifico.
L'anteprima di ricerca viene attivata automaticamente dal modello quando ritiene che la query necessiti di informazioni esterne. Non è necessario configurare API di ricerca o fornire manualmente i risultati della ricerca. Tuttavia, è possibile influenzare il comportamento del modello richiedendogli esplicitamente di utilizzare la ricerca sul web, oppure specificando le fonti. Il modello rispetta i filtri standard di sicurezza e contenuto applicati da OpenAI. Si noti che la ricerca sul web può introdurre latenza rispetto al modello base, poiché il modello attende i risultati della ricerca prima di generare la risposta finale.
I punteggi di benchmark specifici per GPT-4o-mini Search Preview non sono stati pubblicati come variante separata. Tuttavia, in base al GPT-4o-mini di base, ci si aspetta che questo modello ottenga buoni risultati su benchmark NLP standard come MMLU, HellaSwag e GSM8K, ma probabilmente con una precisione inferiore rispetto al GPT-4o completo. La funzione di anteprima di ricerca può migliorare le prestazioni su compiti che richiedono conoscenze aggiornate (come curiosità su eventi recenti), ma non modifica le capacità di ragionamento del modello sottostante. Per quanto riguarda l'accuratezza fattuale, il modello si basa sulla qualità e sull'attualità delle fonti web che recupera.
GPT-4o-mini Search Preview è progettato per una latenza ridotta rispetto a GPT-4o. Il GPT-4o-mini base è noto per l'inferenza veloce, e l'anteprima di ricerca aggiunge tempo extra per il recupero web. Il tempo di risposta totale dipende da fattori come la latenza di rete, il numero di risultati di ricerca recuperati e la lunghezza del contesto. Nell'uso tipico, le risposte vengono generate in pochi secondi. Per applicazioni che richiedono la latenza minima assoluta, il GPT-4o-mini base (senza ricerca) sarebbe più veloce. L'API di OrcaRouter supporta lo streaming per iniziare a visualizzare i token man mano che vengono generati.
Punti di forza: Il modello fornisce informazioni aggiornate senza necessità di integrazione separata con la ricerca, dispone di un'ampia finestra di contesto (128k token) ed è economico per un utilizzo ad alto volume. Limitazioni: Accetta solo testo; talvolta può recuperare contenuti web incompleti o irrilevanti; il suo ragionamento è meno profondo di GPT-4o; e l'anteprima di ricerca può aumentare la latenza. Inoltre, il modello potrebbe non citare sempre esplicitamente le fonti, quindi gli utenti dovrebbero verificare le informazioni critiche. Non è progettato per attività come la comprensione multimodale, la matematica avanzata o il ragionamento complesso a catena di pensiero, dove GPT-4o offre prestazioni migliori.
OrcaRouter fattura GPT-4o-mini Search Preview alla tariffa del provider senza alcun ricarico: $0,15 per milione di token in input e $0,60 per milione di token in output. Ciò significa che paghi esattamente quanto addebita OpenAI, senza commissioni aggiuntive. Il prezzo è per token, con i token di contesto conteggiati come input e i token generati come output. Il modello utilizza lo schema di tokenizzazione standard di OpenAI. Non ci sono costi aggiuntivi per la funzionalità di anteprima di ricerca; il costo è lo stesso del GPT-4o-mini base, nonostante il recupero aggiuntivo dal web.
Rispetto a GPT-4o (che costa $2,50 per milione di token in input e $10 per milione di token in output), GPT-4o-mini Search Preview è significativamente più economico—circa 16 volte meno per l'input e 16,6 volte meno per l'output. Ciò lo rende un candidato ideale per applicazioni in cui il costo per query è importante, specialmente quando è necessaria la ricerca web. Tuttavia, il GPT-4o-mini di base (senza anteprima di ricerca) costa lo stesso per token ma manca della funzionalità di ricerca. Se la ricerca non è necessaria, si potrebbe risparmiare una leggera latenza aggiuntiva, ma il costo per token è identico.
OrcaRouter potrebbe supportare la memorizzazione nella cache dei risultati di ricerca o delle risposte del modello, a seconda della configurazione. Se abilitata, le query ripetute per le stesse informazioni potrebbero essere servite dalla cache, riducendo sia la latenza che l'utilizzo dei token. Tuttavia, le politiche di caching variano. Per le informazioni più aggiornate, il modello in genere esegue una nuova ricerca web su ogni richiesta. Per ridurre i costi, considera l'utilizzo del GPT-4o-mini di base se le tue query non richiedono dati web. Monitora sempre il tuo utilizzo dei token tramite il dashboard di OrcaRouter per comprendere la tua spesa.
OrcaRouter applica esattamente i prezzi di OpenAI senza aggiungere alcun margine. La fatturazione si basa sul conteggio dei token come riportato dal fornitore. Non ci sono costi di configurazione, minimi mensili o costi aggiuntivi per il gateway API. Paghi solo per i token che utilizzi alle tariffe specificate. Per GPT-4o-mini Search Preview, ciò significa $0.15 per milione di token di input e $0.60 per milione di token di output. Assicurati che il tuo account sia configurato con OrcaRouter per accedere al modello a queste tariffe.
Per utilizzare il modello, invia una richiesta POST a https://api.orcarouter.ai/v1/chat/completions con il campo model impostato su "openai/gpt-4o-mini-search-preview". Questo endpoint è compatibile con OpenAI, quindi puoi usare qualsiasi SDK o client OpenAI modificando l'URL di base e la chiave API. Esempio con curl: curl https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_ORCAROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "openai/gpt-4o-mini-search-preview", "messages": [{"role": "user", "content": "What is the current weather in London?"}] }' La funzionalità di ricerca in anteprima verrà attivata automaticamente.
L'API supporta tutti i parametri standard di completamento chat di OpenAI: temperature (0-2, default 1), top_p, n, stream, stop, max_tokens (fino a 16384), presence_penalty, frequency_penalty e logit_bias. Il modello rispetta questi parametri. Per l'anteprima di ricerca, non sono necessari parametri aggiuntivi; il modello decide quando effettuare la ricerca. Tuttavia, è possibile sollecitarlo a richiedere esplicitamente una ricerca web (ad es. "Cerca sul web le ultime notizie su...") per incoraggiare il recupero di informazioni. Nota che il modello potrebbe comunque scegliere di non cercare se ritiene sufficienti le conoscenze interne.
Se usi già l'API di OpenAI, migrare a OrcaRouter è semplice: cambia l'URL di base da https://api.openai.com/v1 a https://api.orcarouter.ai/v1 e sostituisci la tua chiave API con una di OrcaRouter. L'ID del modello diventa "openai/gpt-4o-mini-search-preview". Tutti gli altri corpi delle richieste e formati di risposta rimangono identici. Puoi utilizzare qualsiasi libreria client di OpenAI (Python, Node.js, ecc.) senza modifiche. OrcaRouter supporta anche streaming, chiamate a funzioni e altre funzionalità avanzate compatibili con l'API di OpenAI.
Per trasmettere risposte in streaming, imposta "stream": true nella tua richiesta. OrcaRouter restituisce i dati come eventi inviati dal server, identici al formato di streaming di OpenAI. Ogni evento contiene un delta della risposta. Lo streaming è particolarmente utile per applicazioni rivolte all'utente per mostrare i token man mano che vengono generati. Per le query di anteprima di ricerca, il modello potrebbe prima indicare che sta cercando prima di produrre la risposta finale. Lo stream includerà questi token intermedi. Assicurati che il tuo client possa gestire aggiornamenti parziali in modo elegante.
GPT-4o-mini Search Preview è una variante più piccola, più veloce e più economica di GPT-4o, con funzionalità di ricerca web aggiuntive. Mentre GPT-4o ha ragionamento superiore, una base di conoscenze più ampia (fino al suo cutoff di addestramento) e supporto multimodale (immagini, audio), questo modello è solo testo e si basa sulla ricerca web per superare la sua limitata conoscenza di addestramento. Per attività che richiedono un'analisi approfondita o matematica complessa, GPT-4o è migliore. Per applicazioni sensibili ai costi che necessitano di informazioni aggiornate, GPT-4o-mini Search Preview è una valida alternativa. Il prezzo è circa 16 volte inferiore.
La versione base di GPT-4o-mini non include la ricerca web; si basa esclusivamente sui suoi dati di addestramento, la cui data limite risale alla fine del 2023. GPT-4o-mini Search Preview aggiunge la possibilità di recuperare informazioni correnti da internet. Entrambi i modelli hanno la stessa finestra di contesto (128k token), output massimo (16384) e prezzi per token. La variante con anteprima di ricerca potrebbe avere una latenza leggermente superiore a causa del recupero dal web. Se la tua applicazione non necessita di dati in tempo reale, il modello base è funzionalmente identico e potrebbe essere più veloce. Entrambi i modelli sono accessibili tramite OrcaRouter con diversi ID modello.
Altri modelli con funzionalità di ricerca includono Gemini con integrazione della ricerca Google, o modelli che utilizzano il recupero web basato su plugin. GPT-4o-mini Search Preview offre un'integrazione nativa senza plugin esterni. È generalmente più economico rispetto a modelli di ricerca più grandi (come GPT-4 con navigazione). Tuttavia, potrebbe essere meno completo nei risultati di ricerca rispetto ad API di ricerca dedicate. Per conoscenze web ad alta precisione, considera l'integrazione di un'API di ricerca fattuale e l'invio dei risultati a un modello base. Questo modello è ideale per query da semplici a moderatamente complesse che beneficiano di dati web aggiornati.
Scegli questo modello quando hai bisogno di: (1) basso costo per query, (2) ricerca web automatica senza integrazione personalizzata, (3) tempi di risposta rapidi e (4) un ampio contesto. Scegli una variante completa di GPT-4o se hai bisogno di input multimodali o di un ragionamento più approfondito. Scegli la versione base di GPT-4o-mini se non hai bisogno della ricerca web e desideri risposte leggermente più veloci. Scegli un'API di ricerca dedicata più un modello piccolo se hai bisogno di un controllo granulare sulle fonti e sui risultati di ricerca. Questo modello è ottimale come sostituto diretto di GPT-3.5 o GPT-4o-mini in applicazioni che trarrebbero vantaggio da informazioni in tempo reale.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-search-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatstreamstructured_outputsweb_search_options| Input / 1M token | $0.150 |
| Output / 1M token | $0.600 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
GET /api/public/models/openai/gpt-4o-mini-search-previewApri @misc{orcarouter_gpt_4o_mini_search_preview,
title = {GPT-4o-mini Search Preview API},
author = {OpenAI},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview}
}OpenAI. (2025). GPT-4o-mini Search Preview API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview