GPT-4o ("o" sta per "omni") è l'ultimo modello AI di OpenAI, che supporta sia input di testo che di immagine con output di testo. Mantiene il livello di intelligenza di [GPT-4 Turbo](/models/openai/gpt-4-turbo) pur essendo due volte più...
GPT-4o (2024-05-13) è un modello linguistico multimodale di OpenAI, accessibile tramite l'API di OrcaRouter. Elabora testo, immagini e file, rendendolo adatto a compiti che combinano dati visivi e…
GPT-4o può analizzare immagini fornite come parte dell'input. Può descrivere contenuti visivi, rispondere a domande su oggetti, testo all'interno delle immagini e relazioni spaziali. Può anche estrarre e trascrivere testo da documenti scansionati o foto. Poiché elabora le immagini direttamente, non hai bisogno di un modello OCR o di visione separato. L'immagine viene tokenizzata per rientrare nella finestra di contesto. Ad esempio, un utente potrebbe caricare uno screenshot di un grafico e chiedere al modello di interpretare le tendenze. La comprensione del modello non si limita a semplici didascalie; può ragionare sul contenuto, confrontare più immagini e utilizzare indizi visivi insieme a istruzioni testuali. Questa capacità è integrata nella stessa chiamata API, utilizzando lo stesso formato di messaggio delle richieste solo testo. Su OrcaRouter, invii le immagini come dati codificati in base64 o URL nell'array dei contenuti. L'ID del modello rimane "openai/gpt-4o-2024-05-13".
GPT-4o accetta file come input. I formati supportati includono PDF, documenti Microsoft Office (Word, Excel, PowerPoint), file di testo e formati immagine. Per PDF e file Office, il modello estrae il contenuto testuale e analizza l'impaginazione. Non riproduce direttamente la formattazione complessa, ma legge il contenuto testuale. Ciò è utile per elaborare report, contratti, fogli di calcolo o presentazioni senza estrazione manuale. Il contenuto del file viene tokenizzato e contribuisce al totale dei token di input. Il modello può rispondere a domande sul contenuto dei file, riassumerli o eseguire calcoli su dati tabellari. Quando si utilizzano file, è possibile includerli come parte del contenuto del messaggio utilizzando i campi appropriati dell'API OpenAI. OrcaRouter gestisce la trasmissione senza modifiche. Si noti che le capacità del modello dipendono dalla qualità del testo estratto; le immagini scansionate pesantemente nei PDF potrebbero non essere completamente leggibili a meno che non contengano livelli di testo incorporati.
GPT-4o è un modello premium con un costo più elevato rispetto ad alternative come GPT-4o-mini o varianti precedenti di GPT-3.5. Se il tuo compito non richiede le capacità multimodali (ad esempio, compiti solo testuali), un contesto ampio (fino a 128K), o il livello di ragionamento matematico misurato da MATH-500 (79.1), un modello più economico potrebbe essere più conveniente. Ad esempio, classificazioni semplici, generazione di contenuti brevi o chat di base possono essere gestiti da modelli a basso costo che producono comunque una qualità accettabile. Inoltre, se la tua applicazione è sensibile alla latenza e il modello più piccolo è più veloce, il compromesso potrebbe favorire la velocità rispetto all'accuratezza assoluta. Infine, se raramente hai bisogno di elaborare immagini o file, la capacità multimodale aggiuntiva non è necessaria. OrcaRouter offre una gamma di modelli così da poter selezionare il miglior rapporto qualità-prezzo. Valuta i requisiti del tuo caso d'uso confrontandoli con i punteggi di benchmark e i prezzi per determinare se i vantaggi di GPT-4o giustificano il costo aggiuntivo.
GPT-4o può generare fino a 16.384 token per richiesta. Questo è un limite generoso che consente risposte lunghe, codice dettagliato o analisi multi-paragrafo. Tuttavia, i token di output vengono fatturati a $15.00 per milione, rendendo gli output più lunghi più costosi. Puoi controllare la lunghezza dell'output usando il parametro max_tokens nella chiamata API. Se prevedi di aver bisogno di generazioni molto lunghe, considera di raggruppare o suddividere la richiesta. Il limite di 16.384 token si applica all'intera risposta, inclusi i passaggi di ragionamento o il chain-of-thought se richiesti. Per attività molto complesse che richiedono un ragionamento esteso, potresti dover effettuare più chiamate. Su OrcaRouter, il conteggio dei token di output viene riportato nel campo usage della risposta API, così puoi monitorare i costi con precisione. Non ci sono limiti aggiuntivi imposti da OrcaRouter; si applica il limite nativo del modello.
GPT-4o ha segnato 79.1 sul benchmark MATH-500. MATH-500 consiste in 500 problemi matematici impegnativi in vari argomenti come algebra, geometria, teoria dei numeri e probabilità. Un punteggio di 79.1 significa che il modello ha risposto correttamente al 79.1% dei problemi. Questo è un risultato forte che indica una robusta capacità di ragionamento matematico, specialmente per un modello multimodale. Il benchmark testa sia la risoluzione dei problemi che il ragionamento passo-passo. Questo punteggio può guidare le aspettative per applicazioni che coinvolgono tutoraggio matematico, calcolo scientifico o puzzle logici. Nota che le prestazioni del benchmark non garantiscono risultati identici in compiti reali; potrebbero essere necessari tuning specifici per dominio o ingegneria dei prompt. Quando si considera questo modello, confronta il suo punteggio MATH-500 con altri modelli che valuti. OrcaRouter non fornisce ulteriori dati di benchmark, quindi questo è l'unico punto di riferimento fornito per questo modello.
La latenza dipende da diversi fattori: la lunghezza dell'input, la lunghezza dell'output previsto, il carico attuale sui server di OpenAI e il percorso di rete tra la tua applicazione e OrcaRouter. OrcaRouter non aggiunge un sovraccarico significativo oltre ai tempi di risposta del fornitore sottostante. Per richieste tipiche con input moderati (qualche migliaio di token) e output brevi (meno di 1,000 token), le risposte arrivano spesso in pochi secondi. Output più lunghi (vicini a 16,384 token) richiederanno naturalmente più tempo perché il modello genera i token in sequenza. Anche gli input di immagini aumentano la latenza a causa della tokenizzazione e dell'elaborazione. Puoi ottimizzare la latenza riducendo la lunghezza dell'output, utilizzando prompt più brevi o raggruppando le richieste. OrcaRouter fornisce endpoint API standard che restituiscono risultati in modo asincrono tramite streaming, se desiderato. Per applicazioni interattive in tempo reale, considera l'utilizzo della modalità di streaming (stream: true) per iniziare l'elaborazione non appena arrivano i token. Non vengono forniti numeri specifici di latenza nei dati del modello, quindi queste sono stime qualitative.
Punti di forza: input multimodale (testo, immagine, file), grande finestra di contesto di 128K, forte ragionamento matematico (MATH-500: 79,1) e alto limite di token di output (16.384). Gestisce efficacemente documenti lunghi e conversazioni multi-turn. L'API è standard compatibile con OpenAI, facilitando l'integrazione. Limitazioni: costo più elevato rispetto a modelli più piccoli. Non ottimizzato per attività che non beneficiano della multimodalità o di un contesto ampio. Non vengono fornite informazioni sulle prestazioni in lingue non inglesi o su specifici benchmark di sicurezza. La comprensione delle immagini può essere limitata per scene molto complesse o immagini a bassa risoluzione. Inoltre, il modello può produrre risposte errate su problemi al di fuori della sua distribuzione di addestramento. Non esiste una garanzia di latenza dichiarata. Per gli utenti che richiedono una latenza estremamente bassa o un costo estremamente basso, un modello diverso potrebbe essere più adatto. Il punteggio benchmark di 79,1 su MATH-500 indica margine di miglioramento sui problemi matematici più difficili. Valuta se questi compromessi sono in linea con i requisiti della tua applicazione.
GPT-4o viene fatturato per token, con tariffe separate per token di input e output. I token di input sono $5.00 per 1 milione di token. I token di output sono $15.00 per 1 milione di token. Queste sono le tariffe del fornitore, trasmesse da OrcaRouter senza alcun ricarico. Il costo per richiesta = (token di input/1e6 * 5) + (token di output/1e6 * 15). Ad esempio, una conversazione con 4.000 token di input e 200 token di output costerebbe (0.004*$5) + (0.0002*$15) = $0.02 + $0.003 = $0.023. Non ci sono costi aggiuntivi per le chiamate API stesse; si paga solo per i token consumati. I prezzi vengono aggiornati dinamicamente in base alle modifiche del fornitore; OrcaRouter trasmette eventuali adeguamenti futuri. Poiché non c'è ricarico, gli utenti beneficiano delle stesse tariffe dei clienti diretti di OpenAI, ma con la comodità della gestione e fatturazione unificata di OrcaRouter. Si tenga presente che immagini e file vengono tokenizzati e contribuiscono al conteggio dei token di input, aumentando spesso il costo rispetto agli input di solo testo.
No. OrcaRouter non offre sconti, token memorizzati nella cache o prezzi ridotti per input ripetuti. Ogni token viene fatturato alla tariffa standard del provider. Non esiste un costo separato per la cache né alcun sovrapprezzo per volumi elevati. Le tariffe di $5/$15 per milione di token sono fisse. Gli utenti che necessitano di una produttività molto elevata possono informarsi su accordi personalizzati, ma il servizio standard non include sconti sul volume. Inoltre, non ci sono costi nascosti come spese di connessione o minimi mensili. Il prezzo è trasparente e direttamente legato all'utilizzo dei token. Per ottimizzare i costi, si consiglia di ridurre la dimensione dell'input (ad esempio accorciando la cronologia, usando prompt più brevi) e la lunghezza dell'output (ad esempio impostando un max_tokens più basso). Inoltre, utilizzare il modello solo quando le sue capacità sono necessarie (multimodale, contesto ampio) aiuta a contenere i costi. Se la tua applicazione ha prompt ripetitivi identici ogni volta, la memorizzazione nella cache a livello di applicazione può ridurre l'utilizzo dei token, ma OrcaRouter stesso non fornisce tale funzionalità.
GPT-4o ha un prezzo premium. Per molti compiti, un modello più economico (ad esempio GPT-4o-mini o GPT-3.5-turbo) potrebbe essere sufficiente. Valuta il compromesso valutando la complessità e l'accuratezza richiesta. Se il tuo compito prevede una semplice estrazione o classificazione con contesto limitato, un modello più economico potrebbe funzionare in modo simile a una frazione del costo. Al contrario, se il compito richiede una comprensione sfumata delle immagini, documenti lunghi o un'elevata precisione matematica (punteggio MATH-500 di 79,1 rispetto a punteggi inferiori su modelli più economici), GPT-4o potrebbe valere il premio. Utilizza test A/B su un campione rappresentativo per confrontare qualità e costo. Inoltre, considera che lo stesso prezzo per milione di token si applica indipendentemente dalla lunghezza del testo; le richieste più brevi sono più economiche. Se il tuo flusso di lavoro utilizza frequentemente l'intero contesto di 128K, il costo dei token di input per quella richiesta potrebbe essere elevato; assicurati che il contesto sia effettivamente necessario. OrcaRouter fornisce metriche di utilizzo per monitorare e ottimizzare.
Per chiamare GPT-4o su OrcaRouter, utilizza l'endpoint API compatibile con OpenAI: base_url = "https://api.orcarouter.ai/v1". Imposta il parametro model su "openai/gpt-4o-2024-05-13". Avrai bisogno di una chiave API da OrcaRouter. Il formato della richiesta segue l'API standard OpenAI Chat Completions: un array messages con ruoli (system, user, assistant), contenuto opzionale per immagini e file, e parametri come temperature, max_tokens, top_p, frequency_penalty, presence_penalty e stop. Ad esempio, una semplice richiesta testuale viene inviata come POST a /chat/completions. Per le immagini, includi il contenuto come parte del messaggio utente con type "image_url". Per i file, includili anch'essi come parte del contenuto (il formato specifico segue la specifica OpenAI). La risposta includerà il messaggio dell'assistant, le statistiche di utilizzo (prompt_tokens, completion_tokens, total_tokens) e altri metadati. Non sono necessarie intestazioni speciali oltre a Content-Type e Authorization standard. L'integrazione è identica all'uso diretto di OpenAI.
Tutti i parametri standard di OpenAI Chat Completions sono supportati: messages (obbligatorio), model (obbligatorio, impostato su "openai/gpt-4o-2024-05-13"), temperature (0–2, default 1), top_p (0–1, default 1), n (numero di completamenti, default 1), stop (stringhe o elenco di stringhe), max_tokens (default 16.384, limite massimo 16.384), presence_penalty (−2 a 2, default 0), frequency_penalty (−2 a 2, default 0), logit_bias (mappa di ID token a valore di bias), user (stringa per monitoraggio abusi), stream (booleano, default false) e functions/tools (per chiamate di funzioni). Per input multimodali, il contenuto dei messaggi può essere un array di parti di contenuto con tipo "text" o "image_url". Inoltre, puoi includere contenuto di tipo "file" come da documentazione di OpenAI (ad esempio, per allegati PDF). OrcaRouter passa questi parametri direttamente al provider senza modifiche. Assicurati di non superare la finestra di contesto di 128K token. L'API restituisce codici di errore standard per richieste non valide, limitazione della velocità o errori di autenticazione.
La migrazione è semplice poiché l'API di OrcaRouter è completamente compatibile con OpenAI. Devi solo cambiare due cose: l'URL di base da https://api.openai.com/v1 a https://api.orcarouter.ai/v1, e l'ID del modello da "gpt-4o-2024-05-13" a "openai/gpt-4o-2024-05-13". La tua chiave API di OrcaRouter sostituisce la tua chiave OpenAI. Tutto il codice esistente che utilizza la libreria Python/Node di OpenAI o richieste HTTP grezze funzionerà senza altre modifiche. Il formato dei messaggi, i nomi dei parametri e la struttura delle risposte sono identici. Per le librerie che accettano un parametro base URL, basta impostarlo sull'endpoint di OrcaRouter. Se stavi usando il client di OpenAI, puoi istanziarlo con base_url impostato sull'endpoint di OrcaRouter. Non sono necessarie modifiche all'ingegneria dei prompt o alla logica di caching. OrcaRouter supporta anche lo streaming (stream: true) e le chiamate alle funzioni esattamente come prima. I test possono essere effettuati con un piccolo insieme di richieste per verificare che il comportamento sia corrispondente.
OrcaRouter non modifica il comportamento del modello. Agisce puramente come un gateway, inoltrando le tue richieste ai server di OpenAI e restituendo la risposta testualmente. Nessuna pre-elaborazione, post-elaborazione o filtro dei contenuti viene applicato da OrcaRouter. Per quanto riguarda la gestione dei dati: OrcaRouter non memorizza né registra i dati dei prompt o delle risposte oltre quanto necessario per la fatturazione e il monitoraggio operativo. Le politiche sui dati di OpenAI si applicano all'utilizzo del modello tramite OrcaRouter. Secondo i fatti forniti, non si menziona la conservazione dei dati da parte di OrcaRouter oltre alla registrazione API standard. Gli utenti dovrebbero rivedere sia la politica sulla privacy di OrcaRouter che quella di OpenAI per comprendere la gestione dei dati. Se hai requisiti rigorosi di residenza dei dati, consulta OrcaRouter riguardo alle opzioni disponibili. Non vi è alcuna indicazione che OrcaRouter condivida dati con altri clienti. L'ID del modello è l'unica modifica necessaria; non vengono iniettate istruzioni personalizzate.
Le principali differenze tra GPT-4o e GPT-4o-mini riguardano la dimensione della finestra di contesto, le capacità multimodali, le prestazioni di benchmark e il costo. GPT-4o offre una finestra di contesto di 128K e supporta input di immagini e file. GPT-4o-mini (basato sull'offerta di OpenAI) ha tipicamente un contesto più ridotto (ad esempio 128K o 16K in alcune versioni) e potrebbe non supportare tutte le modalità. Su MATH-500, GPT-4o ottiene un punteggio di 79,1; GPT-4o-mini otterrebbe un punteggio inferiore. Prezzi: GPT-4o costa $5/$15 per milione di token, mentre GPT-4o-mini è significativamente più economico (ad esempio $0,15/$0,60 per milione di token in alcune versioni). Pertanto, GPT-4o-mini è adatto per compiti più semplici in cui è fondamentale un costo inferiore, mentre GPT-4o è migliore per ragionamenti complessi, contesto lungo e compiti multimodali. Quando si sceglie tra i due, considerare i requisiti di accuratezza e la necessità di gestione di immagini o file. OrcaRouter offre entrambi i modelli con ID distinti. Se il tuo carico di lavoro usa raramente immagini o contesto ampio, GPT-4o-mini potrebbe essere la scelta economicamente superiore.
GPT-4o (2024-05-13) è un modello multimodale con una finestra di contesto di 128K, mentre le versioni precedenti di GPT-4 (come gpt-4-0613) hanno tipicamente un contesto di 8K o 32K e sono solo testo (alcune versioni successive supportano le immagini tramite endpoint di visione separati). Il prezzo di GPT-4o ($5/$15 per milione di token) è generalmente inferiore rispetto al prezzo di GPT-4 Turbo al suo picco (ad esempio, $10/$30 per milione di token). Prestazioni di benchmark: il punteggio MATH-500 fornito di 79.1 è per GPT-4o; GPT-4 non aveva un punteggio ufficiale MATH-500 nei fatti forniti, ma era noto per ottenere punteggi inferiori in benchmark di matematica simili. GPT-4o offre anche un limite di output più elevato (16K token) rispetto ai GPT-4 più vecchi (4K o 8K a seconda della versione). Nel complesso, GPT-4o offre un valore migliore per applicazioni multimodali e a contesto lungo. Tuttavia, i modelli GPT-4 più vecchi potrebbero essere stati messi a punto per compiti specifici; valutate sui vostri dati. Tramite OrcaRouter, entrambe le famiglie di modelli sono accessibili.
Un confronto diretto richiederebbe dati specifici dei modelli che non sono forniti qui. In generale, entrambi i modelli sono competitivi per capacità di ragionamento e multimodalità. GPT-4o ha una finestra di contesto di 128K, simile ai 200K di Claude (per Sonnet). Entrambi supportano le immagini. I punteggi dei benchmark variano: GPT-4o ottiene un punteggio MATH-500 di 79,1; Claude 3.5 Sonnet non fornisce punteggi su quel benchmark. Prezzi: GPT-4o costa $5/$15 per milione di token; il prezzo di Claude Sonnet è tipicamente intorno a $3/$15 per milione di token (soggetto a modifiche). Pertanto, i costi di input per GPT-4o sono più elevati. Le differenze di prestazioni dipendono dal compito: alcuni utenti trovano Claude superiore per la scrittura di testi lunghi, mentre GPT-4o eccelle in matematica e programmazione. Senza una valutazione controllata, si consiglia di testare entrambi su campioni rappresentativi. OrcaRouter offre entrambi i modelli, quindi puoi confrontarli facilmente cambiando l'ID del modello. In definitiva, il modello migliore dipende dai tuoi requisiti specifici di accuratezza, latenza e costo. I dati forniti non includono i punteggi di Claude, quindi questo confronto rimane qualitativo.
Llama 3 (ad esempio, Llama 3 70B) è un modello open-source che può essere auto-ospitato, mentre GPT-4o è proprietario e accessibile tramite API. GPT-4o supporta input multimodali (testo, immagine, file) con un contesto di 128K, mentre Llama 3 è tipicamente solo testo (a meno che non sia stato ottimizzato per la visione) e ha un contesto più piccolo (ad esempio, 8K o 32K). Punteggi dei benchmark: il punteggio MATH-500 di GPT-4o è 79.1; Llama 3 70B ottiene circa 70–75 su benchmark di matematica simili (non fornito nei fatti, ma conoscenza generale). Costo: il costo API per token di GPT-4o è fisso; l'auto-hosting di Llama 3 comporta costi infrastrutturali (GPU, elettricità) che possono essere inferiori a volumi elevati. Latenza: GPT-4o basato su API può essere più veloce per carichi di lavoro a raffica; i modelli auto-ospitati possono offrire una latenza costante se la capacità è riservata. Flessibilità: Llama 3 può essere ottimizzato; GPT-4o no. Per gli utenti che desiderano evitare il vendor lock-in o gestire dati sensibili completamente on-premise, i modelli open-source sono interessanti. OrcaRouter fornisce accesso a entrambi i tipi: puoi usare GPT-4o tramite API e anche accedere a modelli open-source tramite OrcaRouter, se disponibili.
Compatibile con OpenAI: mantieni il tuo SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-05-13",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamtemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Input / 1M token | $5.00 |
|---|---|
| Output / 1M token | $15.00 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
Di cosa parlano gli sviluppatori questa settimana
GET /api/public/models/openai/gpt-4o-2024-05-13Apri @misc{orcarouter_gpt_4o_2024_05_13,
title = {GPT-4o (2024-05-13) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13}
}OpenAI. (2024). GPT-4o (2024-05-13) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13