GPT-4o mini è il modello più recente di OpenAI dopo [GPT-4 Omni](/models/openai/gpt-4o), che supporta input sia di testo che di immagini con output di testo. Come loro modello piccolo più avanzato, è molte volte più conveniente...
GPT-4o-mini è una variante più piccola e veloce del modello GPT-4o di OpenAI, ottimizzata per ridurre i costi computazionali pur mantenendo le capacità multimodali. Può elaborare testo, immagini e…
GPT-4o-mini eccelle in un'ampia gamma di compiti linguistici, tra cui riassunto, traduzione, classificazione e risposta a domande. Supporta output JSON strutturato, chiamate di funzione e utilizzo di strumenti, consentendo l'integrazione con API e database esterni. La finestra di contesto di 128K gli permette di elaborare grandi documenti o cronologie di conversazioni per un'analisi coerente. Si comporta bene nei benchmark comuni (punteggio MATH-500 di 78,9) ed è adatto per problemi matematici educativi, spiegazione di codice ed estrazione di dati. Per compiti più semplici, GPT-4o-mini spesso eguaglia modelli più grandi a una frazione del costo. Tuttavia, compiti che richiedono competenze profonde in un dominio o output altamente creativi potrebbero vedere una qualità ridotta rispetto a GPT-4o.
Le immagini possono essere fornite come URL o dati codificati in base64 nella richiesta API. Il modello interpreta le immagini, comprendendo contenuti visivi come oggetti, testo nelle immagini e relazioni spaziali. Ciò consente casi d'uso come Q&A visivo, interpretazione di diagrammi e riconoscimento di cifre scritte a mano. I token delle immagini vengono conteggiati nel limite di contesto, quindi immagini ad alta risoluzione o grandi consumano più del budget di 128K token. Il modello non genera immagini; le elabora soltanto. Per attività che richiedono dettagli visivi a grana fine (ad es., imaging medico), un modello di visione specializzato può essere più accurato, ma GPT-4o-mini offre una soluzione generica con un costo ragionevole.
GPT-4o-mini accetta file caricati oltre a testo e immagini. I tipi di file comuni includono PDF, .docx, .txt, .csv e .json. Il modello estrae il testo e gli elementi visivi rilevanti (se il file contiene immagini incorporate) e li elabora come parte del contesto. Ciò è utile per analizzare articoli di ricerca, contratti legali o fogli di calcolo senza la necessità di copiare manualmente. Si noti che il contenuto del file contribuisce al consumo di token; ad esempio, un PDF di 50 pagine potrebbe consumare diverse migliaia di token. OrcaRouter fattura in base al totale dei token di input, inclusi quelli provenienti dai file. Non ci sono commissioni aggiuntive per l'elaborazione dei file oltre al consumo di token.
Se il tuo carico di lavoro coinvolge solo testo senza immagini o file, e il contesto richiesto è inferiore a 16K token, un modello più piccolo (come GPT-3.5-turbo) potrebbe offrire un costo inferiore per token. Allo stesso modo, per attività ad altissimo throughput come classificazione semplice o Q&A banale, un modello dedicato fine-tuned potrebbe essere più economico. GPT-4o-mini è efficiente in termini di costi per casi d'uso multimodali o a contesto lungo, ma il suo punto di forza sta nell'equilibrare prestazioni e prezzo. Se la tua applicazione può tollerare risposte più lente o un costo maggiore per la massima accuratezza, GPT-4o è un'alternativa. Esegui un benchmark del tuo compito specifico per confermare quale modello soddisfa le tue soglie di qualità e budget.
MATH-500 è un sottoinsieme del benchmark MATH, composto da 500 problemi matematici a livello di competizione che coprono algebra, geometria, teoria dei numeri e probabilità. Un punteggio di 78,9 indica che GPT-4o-mini ha risposto correttamente a circa il 78,9% di questi problemi. Questo è un risultato notevole per un modello più piccolo, che riflette la sua capacità di ragionamento matematico. Supera molti modelli precedenti di dimensioni simili. Tuttavia, le prestazioni possono variare in domini problematici specifici. Il benchmark viene condotto in condizioni zero-shot, il che significa che non vengono forniti esempi precedenti. Per il tutoraggio matematico nel mondo reale, il modello potrebbe necessitare di un'attenta generazione di prompt per gestire correttamente soluzioni multi-step.
Sebbene l'unico benchmark fornito sia MATH-500, informazioni pubbliche ampiamente note indicano che GPT-4o-mini ottiene punteggi competitivi anche su MMLU (massive multitask language understanding), HellaSwag e GSM8K. Tipicamente si classifica al di sotto di GPT-4o ma al di sopra di GPT-3.5-turbo su questi parametri. Sui benchmark di ragionamento, mostra prestazioni robuste per il suo numero di parametri. Sulla scrittura creativa o la generazione a finale aperto, i suoi output sono coerenti ma possono mancare della sfumatura dei modelli più grandi. La latenza è generalmente inferiore rispetto a GPT-4o, rendendolo adatto per applicazioni in tempo reale. Per punteggi esatti, fare riferimento alla documentazione di OpenAI. OrcaRouter fornisce accesso senza markup aggiuntivi.
La latenza dipende dalla complessità della richiesta, dal numero di token e dal carico API. GPT-4o-mini è progettato per essere veloce—tipicamente restituisce il primo token in meno di un secondo per prompt di lunghezza moderata. Per documenti lunghi (es. 50K token), la latenza aumenta poiché il modello elabora l'intero contesto. OrcaRouter non modifica la velocità; si sperimentano gli stessi tempi di risposta delle chiamate dirette all'API di OpenAI. Lo streaming è supportato per ridurre la latenza percepita. Per applicazioni critiche per la latenza, si consiglia di mantenere brevi le lunghezze dei prompt e di utilizzare lo streaming. Il tempo esatto al primo token può essere misurato monitorando il tempo di risposta; non viene fornito uno SLA specifico.
Nonostante sia capace, GPT-4o-mini ha dei limiti a causa delle sue dimensioni ridotte. Può produrre risposte meno accurate in ragionamenti complessi multi-step rispetto a GPT-4o. Talvolta può interpretare male istruzioni sfumate o non riuscire a mantenere una perfetta coerenza su output molto lunghi. La sua comprensione multimodale è buona ma non impeccabile; potrebbe trascurare piccoli dettagli nelle immagini o contare male gli elementi. Il modello può mostrare bias presenti nei suoi dati di addestramento. Non supporta la ricerca su Internet o l'accesso ai dati in tempo reale a meno che non sia esplicitamente ottimizzato per l'uso di strumenti. Per attività che richiedono alta precisione (es. consulenza legale, diagnosi medica), la revisione umana è essenziale. I punteggi di benchmark riflettono ambienti controllati; le prestazioni nel mondo reale possono variare.
OrcaRouter applica esattamente i prezzi di OpenAI senza markup: $0,15 per 1 milione di token in input e $0,60 per 1 milione di token in output. I token in input includono tutto il testo, i token delle immagini e il contenuto dei file. I token in output contano il testo generato. Non ci sono canoni mensili né costi nascosti. Si tratta di uno dei costi per token più bassi per un modello multimodale con una finestra di contesto di 128K. A titolo di confronto, GPT-4o costa $2,50 per 1M di input e $10 per 1M di output, rendendo GPT-4o-mini più economico del 94% in input e del 94% in output. Il vantaggio in termini di costo è significativo per applicazioni ad alto volume.
Sebbene GPT-4o-mini sia economico per token, le sue dimensioni ridotte potrebbero richiedere più tentativi o prompt più dettagliati per ottenere la precisione desiderata, aumentando potenzialmente il consumo totale di token. Per attività in cui GPT-4o ottiene la risposta corretta al primo tentativo, ma GPT-4o-mini ne richiede tre, il costo complessivo potrebbe essere simile o addirittura maggiore. Inoltre, se è necessario inviare molte richieste di piccole dimensioni, l'overhead delle chiamate API potrebbe aggiungere latenza ma non costi diretti. La memorizzazione nella cache non viene applicata; ogni richiesta viene elaborata ex novo. Valuta il tuo caso d'uso con entrambi i modelli per determinare il miglior equilibrio tra costo e prestazioni. OrcaRouter offre prezzi costanti senza sconti per volume.
OrcaRouter non implementa il caching dei prompt. Ogni richiesta a GPT-4o-mini viene inviata ai server di OpenAI e fatturata per token. Non esiste una tariffa scontata per i prompt ripetuti. Se il tuo carico di lavoro ripete frequentemente lo stesso messaggio di sistema o un contesto lungo, potresti considerare di memorizzare la risposta a tuo vantaggio per evitare di inviare nuovamente prompt identici. Alcuni fornitori offrono sconti per il caching dei prompt, ma tramite OrcaRouter paghi la tariffa standard del fornitore. Questo è trasparente e prevedibile. La mancanza di caching semplifica i prezzi, ma significa che dovresti progettare le tue query per ridurre al minimo l'uso ridondante di token.
(Nota: Non viene fornita nessun’altra variante di GPT-4o-mini. Supponendo che la domanda riguardi il confronto con altri modelli mini come Claude 3 Haiku o Gemini Flash, ma vengono forniti solo i fatti. Invece, confrontiamo con GPT-4o.) Rispetto a GPT-4o, GPT-4o-mini è drasticamente più economico: $0,15 contro $2,50 per 1 milione di token in input (94% in meno) e $0,60 contro $10 per 1 milione di token in output (94% in meno). Molti utenti trovano GPT-4o-mini adeguato per l’80–90% delle attività, con un enorme risparmio. Tuttavia, per attività che richiedono la massima precisione (ad es. generazione complessa di codice, ragionamento legale sfumato), il risparmio economico potrebbe non giustificare la perdita di qualità. OrcaRouter ti permette di passare facilmente da un modello all’altro tramite lo stesso endpoint API cambiando l’ID del modello.
Utilizza la libreria client di OpenAI o qualsiasi client HTTP, impostando l'URL di base su https://api.orcarouter.ai/v1. Imposta il parametro model su "openai/gpt-4o-mini". L'autenticazione richiede una chiave API OrcaRouter. Un esempio minimo in Python: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your-key") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explain quantum computing."}]) Tutti i parametri dell'API OpenAI sono supportati, inclusi temperature, max_tokens, stream e tools. OrcaRouter inoltra le richieste a OpenAI e restituisce le risposte senza modifiche.
Parametri standard di OpenAI Chat Completions: model (obbligatorio: "openai/gpt-4o-mini"), messages (array di oggetti messaggio), temperature (0-2, default 1), top_p (0-1, default 1), n (numero di risposte, default 1), stream (booleano), stop (stringa/array), max_tokens (fino a 16384), presence_penalty, frequency_penalty, logit_bias, user (opzionale) e tools per chiamate di funzioni. Per la visione, includere contenuti di immagini nei messaggi (tipo "image_url" o "image_url" con dettaglio). Gli input di file possono essere codificati in base64. OrcaRouter passa tutti i parametri a OpenAI. Nota: Il formato di risposta (modalità JSON) è supportato; impostare response_format={ "type": "json_object" } quando appropriato.
La migrazione è semplice: cambia l'URL di base nel tuo client da "https://api.openai.com/v1" a "https://api.orcarouter.ai/v1" e sostituisci la tua chiave API con una chiave OrcaRouter. Aggiorna il nome del modello a "openai/gpt-4o-mini" (o mantienilo come "gpt-4o-mini"? Il fatto dice che l'ID del modello è "openai/gpt-4o-mini", quindi usa quello). Tutto il resto del codice rimane invariato perché l'API è completamente compatibile con OpenAI. Puoi anche mantenere più stringhe di modelli e instradare in base al costo o alle capacità. OrcaRouter non altera il formato della risposta. Esegui test con alcune query per assicurarti che gli header e lo streaming funzionino come previsto.
Sì, GPT-4o-mini supporta lo streaming tramite eventi inviati dal server (SSE). Imposta stream=true nella richiesta. La risposta sarà una serie di blocchi contenenti contenuto delta. Questo riduce il tempo fino al primo token per gli utenti e consente la visualizzazione in tempo reale. OrcaRouter inoltra le risposte in streaming senza modifiche. Nota che il conteggio totale dei token fatturati rimane invariato. Lo streaming è compatibile con tutte le modalità di input (testo, immagine, file). Puoi anche combinare lo streaming con le chiamate a funzioni; il modello trasmetterà un blocco di chiamata a strumento quando appropriato. Il parametro max_tokens si applica all'intera risposta.
GPT-4o-mini è la versione più piccola ed economica di GPT-4o. Costa circa il 94% in meno sia per token di input che di output. Ha la stessa finestra di contesto di 128K e un output massimo di 16K. Supporta gli stessi input multimodali, ma è generalmente leggermente meno accurato in compiti di ragionamento complesso e creativi. Su MATH-500, GPT-4o-mini ottiene 78.9 mentre GPT-4o ottiene 92+ (approssimativo). Per molti compiti quotidiani come supporto clienti, sintesi e visione semplice, GPT-4o-mini è sufficiente. Scegli GPT-4o quando hai bisogno delle massime prestazioni e puoi accettare una latenza e un costo più elevati.
Confronto con modelli come Claude 3 Haiku o Gemini 1.5 Flash: GPT-4o-mini offre una finestra di contesto di 128K, mentre Haiku consente 200K e Flash 1M. I prezzi sono simili (Haiku $0.25/$1.25 per 1M di token; Flash $0.35/$1.05). Il punteggio MATH-500 di GPT-4o-mini di 78.9 è competitivo; Haiku ottiene circa 73 e Flash circa 78 su parametri di riferimento matematici simili. Per input multimodali, tutti e tre accettano immagini. GPT-4o-mini potrebbe avere una migliore qualità di ragionamento per il suo prezzo, ma la finestra di contesto è più piccola rispetto ad alcuni concorrenti. La scelta migliore dipende dai tuoi specifici requisiti di latenza, costo e qualità. OrcaRouter fornisce anche accesso a Haiku e Flash, permettendo un confronto affiancato.
GPT-3.5-turbo è più vecchio, ha una finestra di contesto di 16K e costa leggermente meno ($0.50 per 1M di input vs $0.15 per GPT-4o-mini? In realtà GPT-3.5-turbo-0125 costa $0.50/$1.50 ma con contesto più piccolo. Basandosi sui prezzi forniti, GPT-4o-mini è più economico per token e offre un contesto più ampio e input multimodale. Quindi per la maggior parte dei compiti, GPT-4o-mini è superiore. Tuttavia, alcune applicazioni legacy che già utilizzano GPT-3.5-turbo potrebbero richiedere modifiche minime. GPT-4o-mini ha anche prestazioni migliori nei benchmark di ragionamento. A meno che la latenza non sia estremamente critica o tu abbia ottimizzato un modello GPT-3.5, GPT-4o-mini è l'aggiornamento drop-in consigliato.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Input / 1M token | $0.150 |
| Output / 1M token | $0.600 |
| Lettura cache / 1M | $0.075 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
GET /api/public/models/openai/gpt-4o-miniApri @misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini