La versione del 2024-08-06 di GPT-4o offre prestazioni migliorate negli output strutturati, con la possibilità di fornire uno schema JSON nel respone_format. Leggi di più [qui](https://openai.com/index/introducing-structured-outputs-in-the-api/). GPT-4o ("o" sta per "omni") è...
GPT-4o (2024-08-06) è una versione del modello GPT-4o di OpenAI, rilasciata nell'agosto 2024. È un modello linguistico multimodale di grandi dimensioni che elabora input di testo, immagini e file. Il…
I punti di forza del modello risiedono nel ragionamento matematico e nella comprensione multimodale. Il suo punteggio MATH-500 di 79,5 indica una forte capacità di risolvere problemi matematici complessi passo dopo passo. È in grado di interpretare immagini, diagrammi e grafici, fornendo descrizioni o analisi accurate. La finestra di contesto di 128K gli consente di elaborare grandi quantità di informazioni, come un libro completo o una serie di immagini con testo associato. Gestisce anche il caricamento di file, rendendolo utile per attività come l'estrazione di dati da fogli di calcolo o la lettura di file di codice. Queste capacità sono supportate dall'ottimizzazione continua di OpenAI e il modello è ampiamente utilizzato in ambienti di produzione.
GPT-4o (2024-08-06) eccelle in compiti che richiedono la combinazione di informazioni visive e testuali. Esempi includono la risoluzione di problemi matematici con diagrammi, l'analisi di screenshot di interfacce utente per segnalazioni di bug, l'estrazione di dati da documenti scansionati e la fornitura di spiegazioni dettagliate di figure complesse. È anche efficace per la generazione di codice e il debug quando il contesto include screenshot di errori o strutture di file. Le applicazioni educative beneficiano del suo ragionamento passo-passo. Per compiti puramente basati su testo e semplici, come semplici domande e risposte o riassunti di testi brevi, un modello più economico come GPT-4o mini può essere sufficiente. Questo modello è meglio riservato per flussi di lavoro di alto valore, multimodali o ad alto contenuto di ragionamento.
Per i compiti che non sfruttano la visione, l'elaborazione di file o il ragionamento avanzato, un modello più piccolo ed economico è più conveniente. Ad esempio, semplici applicazioni di chat, generazione di contenuti brevi o attività di classificazione possono essere gestite da modelli come GPT-4o mini o GPT-3.5 Turbo. Se la tua applicazione elabora solo testo e non richiede la finestra di contesto da 128K, un modello con contesto più ridotto può ridurre latenza e costi. Inoltre, se i tuoi dati non includono immagini o file, un modello solo testo è sufficiente. Valuta se la complessità del compito giustifica il prezzo più elevato per token di GPT-4o. OrcaRouter offre una gamma di modelli con diversi livelli di prezzo per adattarsi a vari casi d'uso.
Sì, il modello accetta input di file. Puoi caricare file come PDF, documenti Word, fogli di calcolo, immagini e file di codice. Il modello estrae e comprende il contenuto di questi file, trattandoli come parte del contesto. Ad esempio, può leggere il testo da un PDF, interpretare i numeri in un CSV o analizzare il codice sorgente in un file .py. Se combinato con input di immagini, può elaborare media misti come un documento con grafici incorporati. Questo è particolarmente utile per automatizzare l'estrazione di dati, la revisione di documenti e l'analisi del codice. Nota che l'elaborazione dei file conta verso la finestra di contesto di 128.000 token, quindi file grandi possono consumare spazio significativo.
Nel benchmark MATH-500, GPT-4o (2024-08-06) ha ottenuto un punteggio di 79.5. MATH-500 è un sottoinsieme del dataset MATH, composto da 500 problemi di matematica di livello competitivo che coprono argomenti come algebra, geometria, teoria dei numeri e probabilità. Un punteggio di 79.5 indica risposte corrette su circa quattro problemi su cinque. Questo lo colloca tra i modelli con le migliori prestazioni per il ragionamento matematico. Sebbene non vengano forniti altri punteggi di benchmark, questa metrica dimostra la forza del modello nella deduzione logica passo-passo e nell'aritmetica. Gli utenti possono aspettarsi prestazioni affidabili in applicazioni matematiche come tutoraggio, verifica e generazione di problemi.
Punteggi specifici di benchmark oltre MATH-500 non sono forniti nei fatti disponibili. Tuttavia, GPT-4o come famiglia di modelli è ampiamente noto per essere competitivo su una serie di benchmark standard tra cui MMLU (massive multitask language understanding), HumanEval (generazione di codice) e vari compiti di visione-linguaggio. La versione di agosto 2024 potrebbe incorporare aggiornamenti che migliorano il ragionamento e il seguire le istruzioni. Senza cifre esatte, gli utenti dovrebbero fare riferimento alle valutazioni pubblicate da OpenAI per i dati più aggiornati. A fini pratici, il modello è considerato all'avanguardia tra i modelli open-API in termini di capacità combinate di testo e visione.
Per questo modello non vengono forniti dati specifici di latenza o throughput. In generale, GPT-4o è progettato per essere più veloce delle precedenti varianti di GPT-4, pur mantenendo la qualità. La latenza dipende da fattori come la lunghezza dell'input, la lunghezza dell'output, le richieste concorrenti e l'infrastruttura backend. Quando si accede tramite OrcaRouter, le richieste vengono instradate ai server di OpenAI e i tempi di risposta sono simili a quelli delle chiamate API dirette. Gli utenti possono ottimizzare utilizzando il contesto più piccolo necessario e impostando limiti max_tokens ragionevoli. Per applicazioni in tempo reale, è consigliabile testare con carichi di lavoro rappresentativi. OrcaRouter non introduce latenza aggiuntiva oltre al routing di rete.
Punti di forza: forte ragionamento matematico (MATH-500 79.5), input multimodale (testo, immagini, file), ampia finestra di contesto di 128K e limite elevato di token di output (16.384). È particolarmente efficace per ragionamenti complessi, comprensione visiva e attività che richiedono un contesto di lungo raggio. Limiti: costo più elevato rispetto ai modelli più piccoli; potrebbe non essere ottimale per attività semplici o a bassa latenza; la precisione può variare su input ambigui o mal formattati; le capacità visive potrebbero non funzionare bene su immagini distorte o a bassa risoluzione. Inoltre, come per tutti gli LLM, può produrre risposte plausibili ma errate, specialmente in ambiti al di fuori dei suoi dati di addestramento. Mitigare validando gli output e utilizzando l'ingegneria dei prompt.
Il prezzo per GPT-4o (2024-08-06) si basa sull'utilizzo dei token. I token di input sono fatturati a $2.50 per 1 milione di token. I token di output sono fatturati a $10.00 per 1 milione di token. Questa è la tariffa del fornitore (OpenAI) e OrcaRouter non applica alcun margine—paghi esattamente lo stesso che se chiamassi OpenAI direttamente. I token vengono conteggiati in base al testo inviato e ricevuto. Gli input di immagini e file consumano token proporzionali alla loro dimensione e complessità di elaborazione (il costo dei token per le immagini è secondo la politica di OpenAI). Non ci sono costi aggiuntivi per l'utilizzo dell'endpoint API. La fatturazione è tipicamente aggregata per periodo di utilizzo e puoi monitorare il consumo di token tramite il dashboard di OrcaRouter.
Nessun costo nascosto o sovrapprezzo. OrcaRouter fattura alla tariffa esatta del fornitore senza alcun margine. I prezzi elencati ($2.50/1M input, $10/1M output) sono inclusivi di tutto. Non ci sono commissioni aggiuntive per autenticazione, connessione o supporto. Tuttavia, gli input di immagini e file comportano costi in token determinati dalle politiche tariffarie di OpenAI, che potrebbero superare il costo in token del solo testo. Ad esempio, un'immagine 1080x1080 potrebbe costare un certo numero di token oltre ai token di testo. Controlla la documentazione di OpenAI per i prezzi esatti dei token per le immagini. OrcaRouter applica questi costi senza maggiorazioni. Al momento non sono previsti sconti basati sulla memorizzazione nella cache.
Scegliere GPT-4o (2024-08-06) rispetto a modelli più economici come GPT-4o mini o GPT-3.5 Turbo implica un compromesso tra prestazioni e costo. Il prezzo per token è più alto, quindi per applicazioni ad alto volume i costi possono accumularsi rapidamente. Tuttavia, se l'attività richiede le capacità multimodali del modello o la finestra di contesto di 128K, i modelli più economici potrebbero non essere sufficienti, portando potenzialmente a output incompleti o di qualità inferiore. Per attività solo testuali con ragionamento semplice, un modello più economico riduce le spese senza sacrificare troppo la qualità. OrcaRouter consente di passare facilmente da un modello all'altro, così puoi sperimentare per trovare il miglior equilibrio tra costo e prestazioni per ogni caso d'uso.
I fatti disponibili non menzionano alcun meccanismo di caching o sconto per questo modello. OrcaRouter fattura alla tariffa del fornitore senza markup, quindi eventuali sconti proverrebbero presumibilmente dai prezzi di OpenAI (ad esempio, sconti a livelli per l'utilizzo ad alto volume, se applicabile). OrcaRouter potrebbe offrire proprie funzionalità di caching, ma ciò non è confermato per questo modello. Per ridurre i costi, considera di ridurre l'utilizzo di token di input troncando la cronologia della conversazione, usando prompt più brevi e limitando la lunghezza dell'output con il parametro max_tokens. Per query identiche ripetute, potresti implementare il caching a livello di applicazione.
Per chiamare GPT-4o (2024-08-06) tramite OrcaRouter, utilizza l'URL di base https://api.orcarouter.ai/v1 e imposta l'ID del modello su "openai/gpt-4o-2024-08-06". L'API è completamente compatibile con le librerie client di OpenAI. Ad esempio, in Python con la libreria openai, configureresti openai.api_base = "https://api.orcarouter.ai/v1" e openai.api_key = "your-orcarouter-api-key". Poi chiama openai.ChatCompletion.create(model="openai/gpt-4o-2024-08-06", messages=[...]). Tutti i parametri standard (temperature, max_tokens, top_p, ecc.) sono supportati. Consulta la documentazione di OrcaRouter per dettagli su autenticazione e limiti di velocità.
Poiché il modello supporta l'API compatibile con OpenAI, è possibile utilizzare l'insieme completo di parametri disponibili nell'endpoint di chat completions di OpenAI. I parametri principali includono: model (impostato sull'ID del modello), messages (elenco di oggetti ruolo-contenuto), temperature (0-2), top_p (0-1), n (numero di completamenti), max_tokens (fino a 16384), stop (sequenze), frequency_penalty, presence_penalty, logit_bias e user (per il monitoraggio dell'utilizzo). Per input multimodali, includere un'immagine o file_url nel contenuto di un messaggio utilizzando il formato appropriato (ad es., content: [{type: "text", text: "..."}, {type: "image_url", image_url: {...}}]). Fare riferimento alla documentazione di OpenAI per la sintassi di input di immagini e file.
Passare dall'API diretta di OpenAI a OrcaRouter richiede due modifiche: 1) Imposta l'URL di base su https://api.orcarouter.ai/v1 e 2) Sostituisci la tua chiave API OpenAI con una chiave API OrcaRouter. Non sono necessarie modifiche al codice per la formattazione dei messaggi o i parametri. L'ID del modello cambia da "gpt-4o-2024-08-06" a "openai/gpt-4o-2024-08-06". Tutta la logica esistente per la gestione dello streaming, delle chiamate alle funzioni e dell'analisi delle risposte rimane invariata. L'API di OrcaRouter è progettata per essere un sostituto diretto. Dopo il passaggio, puoi anche accedere ai modelli di altri provider attraverso la stessa interfaccia, permettendo un facile confronto e bilanciamento del carico.
L'autenticazione avviene tramite una chiave API fornita da OrcaRouter. Includila nell'intestazione come "Authorization: Bearer YOUR_ORCAROUTER_API_KEY". I limiti di frequenza sono gestiti da OrcaRouter e potrebbero differire dai limiti diretti di OpenAI. Controlla il tuo piano OrcaRouter per i dettagli. Se superi i limiti di frequenza, riceverai risposte HTTP 429. Per attenuare il problema, implementa una logica di retry con backoff esponenziale. OrcaRouter potrebbe anche consentirti di impostare limiti di frequenza per utente tramite il parametro user. Per esigenze di alto throughput, contatta il supporto OrcaRouter per accordi personalizzati. Il modello stesso non ha limiti di frequenza separati; è soggetto ai limiti complessivi dell'endpoint.
GPT-4o (2024-08-06) è il modello di punta a grandezza naturale, mentre GPT-4o mini è una variante più piccola ed economica. Differenze principali: GPT-4o ha una finestra di contesto di 128K (anche GPT-4o mini ha 128K, ma il mini ha un limite di output tipicamente più basso, forse 16K? In realtà GPT-4o mini ha anch'esso 128K di contesto e 16K di output, ma è meno capace in ragionamento e visione. Il modello completo ottiene 79,5 su MATH-500; GPT-4o mini ottiene punteggi inferiori nei benchmark di matematica. Prezzi: GPT-4o è più costoso ($2,50/$10 contro GPT-4o mini a $0,15/$0,60 per 1M di token). Per attività che richiedono alta accuratezza o ragionamento complesso, si giustifica l'uso del modello completo. Per attività più semplici, il mini offre un'alternativa conveniente.
Rispetto a GPT-4 (ad esempio, GPT-4-0613 o GPT-4 Turbo), GPT-4o (2024-08-06) offre diversi miglioramenti: input multimodale nativo (testo, immagini, file) senza richiedere modelli di visione separati, finestra di contesto più ampia (128K rispetto ai 32K di GPT-4 per le versioni precedenti) e inferenza più veloce. Il prezzo è inferiore rispetto alle precedenti varianti di GPT-4, che spesso erano più costose. Ad esempio, GPT-4 Turbo aveva un contesto simile ma un prezzo più elevato. In termini di benchmark, il punteggio MATH-500 di 79,5 supera i modelli GPT-4 più vecchi. Tuttavia, alcuni utenti potrebbero trovare i modelli precedenti più stabili per attività specifiche a causa di una storia di addestramento più lunga. Nel complesso, GPT-4o è un successore più moderno ed efficiente.
La scelta dipende dalle esigenze specifiche e dalle preferenze del provider. GPT-4o (2024-08-06) eccelle nel ragionamento matematico (MATH-500 79,5) e nelle attività multimodali con testo, immagini e file. I modelli Claude di Anthropic possono offrire funzionalità di sicurezza più robuste o finestre di contesto più lunghe in alcune versioni, ma in genere hanno prezzi più elevati. I modelli Gemini di Google forniscono contesto multimodale e ampio, ma possono avere profili di prestazioni diversi. Utilizzando OrcaRouter, puoi testare più provider con una singola API. Per attività che richiedono un'elevata accuratezza matematica, GPT-4o è un candidato valido. Per la sintesi di testo puro o attività a basso costo, altri modelli potrebbero essere più economici. Valuta i punteggi dei benchmark e i prezzi per il tuo caso d'uso.
Quando utilizzi GPT-4o tramite OrcaRouter, i tuoi dati vengono inviati ai server di OpenAI per l'inferenza. OrcaRouter non memorizza né elabora i tuoi prompt oltre al loro inoltro. Si applicano le politiche di utilizzo dei dati di OpenAI: consulta i termini di OpenAI se hai dubbi sull'uso dei dati per l'addestramento o sulla conservazione. Se hai bisogno che i dati rimangano in una giurisdizione specifica o evitino determinati fornitori, OrcaRouter ti consente di scegliere tra più fornitori per ogni richiesta. Puoi anche utilizzare le funzionalità di routing di OrcaRouter per indirizzare le richieste a fornitori che soddisfano i tuoi requisiti di conformità. Esamina sempre la documentazione sulla gestione dei dati sia di OrcaRouter che del fornitore sottostante.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-08-06",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Input / 1M token | $2.50 |
| Output / 1M token | $10.00 |
| Lettura cache / 1M | $1.25 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
GET /api/public/models/openai/gpt-4o-2024-08-06Apri @misc{orcarouter_gpt_4o_2024_08_06,
title = {GPT-4o (2024-08-06) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-08-06}
}OpenAI. (2024). GPT-4o (2024-08-06) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-08-06