GPT-4o mini è il modello più recente di OpenAI dopo [GPT-4 Omni](/models/openai/gpt-4o), che supporta input sia di testo che di immagini con output di testo. Come loro modello piccolo più avanzato, è molte volte più conveniente...
GPT-4o-mini (2024-07-18) è un modello multimodale leggero sviluppato da OpenAI, progettato per un'elaborazione efficiente in termini di costi di testo e immagini. È pensato per sviluppatori e…
GPT-4o-mini può eseguire compiti di ragionamento sulle immagini come descrivere contenuti visivi, rispondere a domande sulle immagini e identificare oggetti o testo all'interno delle immagini. Supporta formati immagine standard (JPEG, PNG, GIF, WebP) e può gestire più immagini in una singola richiesta. Il modello non esegue il rilevamento di oggetti in un senso strutturato di bounding box, ma può descrivere posizioni e relazioni. Ad esempio, può leggere testo da una fotografia, comprendere grafici e diagrammi e fornire descrizioni dettagliate delle scene. La precisione dei compiti basati sulle immagini dipende dalla risoluzione e dal contesto; le immagini ad alta risoluzione possono comportare costi di token più elevati ma possono produrre risultati migliori per i dettagli fini.
GPT-4o-mini accetta input di file come PDF, documenti Word e file immagine tramite la struttura dei contenuti multimodali. Quando viene fornito un file, il modello estrae il contenuto testuale e delle immagini, consentendo agli utenti di porre domande sul contenuto del documento, sintetizzarne il testo o analizzare tabelle e figure incorporate. Il file non viene caricato né archiviato; viene elaborato in linea durante la chiamata API. Ciò è utile per flussi di lavoro che coinvolgono la revisione di documenti, l'analisi di contratti o l'estrazione di dati da moduli scansionati. Nota che file molto grandi potrebbero superare la finestra di contesto di 128.000 token o comportare costi elevati di token.
Per attività che richiedono solo generazione di testo leggera, i budget di token potrebbero essere meglio utilizzati da modelli ancora più economici come GPT-3.5-Turbo o alternative open-source (ad esempio, Llama 3 8B). Se il tuo carico di lavoro non necessita di input multimodale o di un contesto di 128k, un modello più piccolo potrebbe ridurre ulteriormente i costi. Inoltre, per attività ristrette come la semplice classificazione o l'estrazione di parole chiave, un modello più piccolo e ottimizzato può offrire latenza e costi inferiori. Tuttavia, la combinazione di prezzo basso, contesto ampio e capacità multimodale di GPT-4o-mini la rende una solida opzione predefinita per molte applicazioni generiche.
GPT-4o-mini eccelle in ambienti di produzione ad alto volume che beneficiano di comprensione multimodale e ampie finestre di contesto. I casi d'uso ideali includono chatbot per assistenza clienti in grado di gestire screenshot e lunghe cronologie di conversazione, pipeline di elaborazione documenti per estrarre dati da PDF o immagini, strumenti educativi per tutoraggio di matematica (come dimostrato dal suo punteggio di 78.9 su MATH-500) e debug del codice in cui sono coinvolti sia testo che diagrammi. È anche adatto per flussi di lavoro di moderazione dei contenuti che richiedono analisi delle immagini insieme al testo. Il basso costo per token consente di scalare fino a milioni di richieste senza spese proibitive.
GPT-4o-mini raggiunge un punteggio di 78.9 nel benchmark MATH-500, un sottoinsieme del dataset MATH composto da 500 problemi matematici impegnativi. Questo punteggio indica la capacità del modello di risolvere problemi aritmetici, algebrici, geometrici e altri problemi matematici con ragionamento passo-passo. Un punteggio di 78.9 lo colloca al di sopra di molti modelli più piccoli e di alcune varianti precedenti di GPT-4, suggerendo forti capacità di ragionamento per un modello delle sue dimensioni e costo. Tuttavia, non è performante come il GPT-4o completo o GPT-4 Turbo sullo stesso benchmark. Il risultato va interpretato nel contesto: GPT-4o-mini è progettato per l'efficienza, non per la massima precisione.
I dati specifici di latenza non vengono divulgati pubblicamente da OpenAI, ma GPT-4o-mini è generalmente più veloce dei modelli GPT-4 più grandi grazie al suo numero di parametri inferiore. In pratica, gli utenti riportano un tempo fino al primo token nell'ordine di poche centinaia di millisecondi per prompt brevi, e una velocità di generazione di decine di token al secondo. La latenza dipende dal numero totale di token (input + output), dal numero di immagini e dal carico attuale del server. Poiché OrcaRouter agisce come proxy, la latenza di rete aggiuntiva è minima—tipicamente entro pochi millisecondi dalla latenza diretta dell'API OpenAI. Il modello supporta lo streaming per applicazioni in tempo reale.
Punti di forza: efficienza economica (prezzo più basso tra i membri della famiglia GPT-4 con supporto multimodale), ampia finestra di contesto da 128k, solido ragionamento matematico (78.9 MATH-500) e inferenza rapida rispetto a modelli più grandi. Gestisce input di immagini e file in modo competente per attività generiche. Limitazioni: in compiti complessi di ragionamento sfumato o scrittura creativa, ha prestazioni inferiori rispetto a GPT-4o e GPT-4 Turbo. Il suo seguire le istruzioni può essere meno affidabile per attività che richiedono formattazione rigorosa o vincoli multi-step. Inoltre, essendo un modello più piccolo, il suo cutoff di conoscenza (Gennaio 2024) potrebbe essere obsoleto per eventi molto recenti. Non supporta nemmeno capacità visive per il rilevamento fine di oggetti o il riconoscimento facciale.
I prezzi sono fissati a $0,15 per 1 milione di token di input e $0,60 per 1 milione di token di output. Queste sono le tariffe standard del provider OpenAI e OrcaRouter non applica alcun margine su di esse. La fatturazione si basa sul conteggio dei token come riportato dal provider del modello. Non ci sono commissioni aggiuntive per richiesta né minimi. La politica di margine zero si applica a tutti i modelli disponibili tramite OrcaRouter, rendendo i prezzi identici a quelli che pagheresti direttamente a OpenAI. Questa trasparenza consente agli utenti di budgetare accuratamente senza costi a sorpresa.
I token di output costano quattro volte di più per token rispetto ai token di input ($0,60 contro $0,15 per milione). Per attività che generano risposte lunghe, come riassunti dettagliati o generazione di codice, i costi di output possono essere predominanti. Gli utenti possono controllare l'utilizzo dei token di output tramite il parametro max_tokens e creando prompt che richiedano risposte concise. Al contrario, le attività con input grandi (ad esempio, l'elaborazione di documenti lunghi con molte immagini) comportano costi di input. L'ampia finestra di contesto di 128k rende facile includere contesto sostanziale, ma ciò avviene al costo per token di input. Ottimizzare l'equilibrio tra lunghezza di input e output è fondamentale per gestire il costo complessivo.
OrcaRouter attualmente non offre cache integrata per le richieste a GPT-4o-mini oltre a quanto già fornito da OpenAI a livello API. Non sono disponibili sconti sul volume o opzioni di capacità riservata tramite OrcaRouter; il prezzo è strettamente pay-as-you-go alla tariffa del provider OpenAI. Gli utenti sono responsabili dell'implementazione delle proprie strategie di cache (ad esempio, a livello applicativo) per ridurre le chiamate API duplicate. La politica di margine zero fa sì che eventuali future modifiche dei prezzi da parte di OpenAI vengano riflesse automaticamente. Per casi d'uso con volumi estremamente elevati, gli accordi diretti con OpenAI per le imprese potrebbero offrire condizioni migliori, ma tramite OrcaRouter la semplicità di una singola chiave API e di una fatturazione unificata potrebbe comunque essere vantaggiosa.
Le immagini processate da GPT-4o-mini vengono convertite in token in base alla loro risoluzione e al livello di dettaglio. OpenAI utilizza un algoritmo di calcolo dei token che considera sia larghezza che altezza; ad esempio, un'immagine tipica 1024x1024 ad alto dettaglio può costare circa 2.000–3.000 token di input. Poiché i token di input vengono fatturati a $0,15 per milione, il costo per immagine è molto basso (tipicamente meno di un centesimo). Tuttavia, elaborare molte immagini in una singola richiesta può accumularsi. Gli utenti possono controllare i costi utilizzando il livello di dettaglio `low` (costa circa 85 token per immagine) quando non è richiesta un'elevata fedeltà. Controllare sempre i token utilizzati nella risposta dell'API per comprendere i costi delle immagini.
Imposta l'URL base della tua API su https://api.orcarouter.ai/v1 e usa l'ID modello "openai/gpt-4o-mini-2024-07-18". L'API segue il formato standard di chat completions di OpenAI. Ad esempio, in Python: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}]). Tutti i parametri come temperature, top_p, max_tokens, stream e le sequenze di stop sono supportati come nell'API originale di OpenAI. Le risposte includono campi standard come id, choices, usage con il conteggio dei token.
Per output deterministici, imposta temperature=0 e top_p=1. Per attività creative, una temperatura intorno a 0.8–1.2 può essere appropriata. Max_tokens controlla la lunghezza della risposta; il valore predefinito è 16.384. Per ridurre il costo dell'output, imposta max_tokens in base alle tue esigenze. Quando utilizzi input multimodali, struttura i messaggi con un array di parti di contenuto: [{"type":"text","text":"Describe this:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]. Per l'elaborazione di file, includi il contenuto del file come testo o base64. Il parametro stop può essere utilizzato per interrompere la generazione in corrispondenza di sequenze personalizzate. Stream=True abilita la consegna dei token in tempo reale.
La migrazione richiede tre semplici modifiche: Imposta base_url su https://api.orcarouter.ai/v1, sostituisci la tua chiave API con la tua chiave API OrcaRouter e modifica l'ID del modello in "openai/gpt-4o-mini-2024-07-18". Non dovrebbero essere necessarie altre modifiche al codice se stai utilizzando le librerie Python/Node.js di OpenAI o qualsiasi client HTTP che segua il formato standard di chat completions. La struttura della risposta è identica. Nota che OrcaRouter non limita le tue richieste in modo diverso da OpenAI; si applicano gli stessi limiti di velocità in base al tuo livello di account OpenAI, ma gestisci le chiavi tramite OrcaRouter. Testa con una piccola richiesta per verificare i conteggi dei token e la latenza.
Fornisci la tua chiave API OrcaRouter nell'intestazione Authorization: Authorization: Bearer <your-key>. L'API restituisce codici di stato HTTP standard: 200 per successo, 400 per richiesta errata (ad es., parametri non validi), 401 per non autorizzato (chiave API errata), 429 per limitazione della frequenza e 500 per errori del server. Le risposte di errore includono un corpo JSON con un oggetto error contenente un messaggio e un tipo. Si consiglia di implementare tentativi con backoff esponenziale per errori 429 e 5xx. OrcaRouter non modifica le risposte di errore da OpenAI, quindi gli stessi messaggi di errore che vedi con l'API diretta appariranno.
GPT-4o-mini è significativamente più capace di GPT-3.5-Turbo in ragionamento, matematica e rispetto delle istruzioni, come dimostrato dal suo punteggio MATH-500 di 78,9 rispetto al punteggio tipico di GPT-3.5-Turbo intorno a 30-40. Supporta anche input multimodali (immagini e file), cosa che GPT-3.5-Turbo non fa. La finestra di contesto è più grande: 128k contro 16k. Prezzi: GPT-4o-mini ($0,15/$0,60 per milione di token) è leggermente più costoso di GPT-3.5-Turbo ($0,50/$1,50 per la versione 16k? In realtà GPT-3.5-Turbo 0125 è $0,50/$1,50 per milione? Aspetta, il GPT-3.5-Turbo standard è $1,50/$2,00 per milione? Mi attengo ai fatti forniti: il prezzo di GPT-4o-mini è indicato. Confronto qualitativo: GPT-4o-mini offre prestazioni migliori a un costo leggermente superiore rispetto a GPT-3.5-Turbo, ma con capacità multimodale.
GPT-4o-mini è una versione più piccola e più conveniente di GPT-4o. Sebbene entrambe condividano capacità multimodali e la stessa dimensione della finestra di contesto (128k token), GPT-4o raggiunge punteggi più elevati in benchmark come MMLU e MATH. Il punteggio MATH-500 di GPT-4o-mini di 78.9 è inferiore al punteggio riportato di GPT-4o, circa 90–95. I prezzi sono significativamente più bassi: GPT-4o-mini ($0.15/$0.60) vs GPT-4o ($2.50/$10.00 per milione di token). Per applicazioni in cui la massima accuratezza in compiti di ragionamento complessi è critica, GPT-4o è preferibile. Per attività ad alto throughput e sensibili ai costi dove è accettabile una precisione moderata, GPT-4o-mini offre risparmi sostanziali.
I modelli open-source come Llama 3 8B e 70B offrono il vantaggio dell'auto-hosting a costo zero per token, ma richiedono infrastrutture e competenze. GPT-4o-mini tramite OrcaRouter fornisce accesso serverless senza costi iniziali e scaling automatico. Nei benchmark, il punteggio MATH-500 di GPT-4o-mini (78,9) è competitivo con Llama 3 8B (circa 30-40) e più vicino a Llama 3 70B (circa 60-70). GPT-4o-mini supporta anche le immagini in modo nativo, cosa che la maggior parte dei modelli open-source non fa. Il compromesso: i modelli open-source offrono privacy dei dati (nessuna chiamata API esterna) e latenza inferiore se l'hardware di inferenza è disponibile. GPT-4o-mini offre facilità d'uso e capacità multimodale a un prezzo basso per token.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Input / 1M token | $0.150 |
| Output / 1M token | $0.600 |
| Lettura cache / 1M | $0.075 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
GET /api/public/models/openai/gpt-4o-mini-2024-07-18Apri @misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18