Muse Spark 1.2 vs Claude Haiku 4.5: Prezzo misto identico, idee opposte sul pensiero
Guides & Insights

Muse Spark 1.2 vs Claude Haiku 4.5: Prezzo misto identico, idee opposte sul pensiero

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Artificial Analysis valuta Muse Spark 1.2 a 0,78 dollari per milione di token blended e Claude Haiku 4.5 a 0,77 dollari. Un centesimo di differenza, da due laboratori che non concordavano su nient'altro. Il modello di Meta non riesce a smettere di ragionare; Claude Haiku 4.5 ragiona solo quando glielo chiedi. Meta ti offre 1.048.576 token di contesto; Claude Haiku 4.5 te ne offre 200.000. Meta ha rilasciato questo modello il 5 agosto 2026 come modello di codifica con un agente terminale integrato; Claude Haiku 4.5 è stato rilasciato nell'ottobre 2025 come il lavoratore veloce ed economico a cui un modello più grande dice cosa fare. Stesso prezzo per token, macchine completamente diverse.

Quella coincidenza è il punto utile da cui iniziare un confronto, perché elimina la variabile su cui di solito le persone decidono e costringe la questione a riguardare invece la forma. Quello che segue utilizza numeri indipendenti dove esistono — Artificial Analysis per i punteggi degli indici e la latenza di laboratorio, la telemetria di produzione di sette giorni di OrcaRouter per la latenza del traffico reale — e segnala come tali i dati dichiarati dal fornitore, incluso un dato di benchmark di punta del fornitore che non ha alcuna controparte di terze parti.

Il contrasto delle specifiche, una dimensione alla volta

• Prezzo — Muse Spark 1.2 a $1,25 in ingresso / $4,25 in uscita per milione; Claude Haiku 4.5 a $1,00 in ingresso / $5,00 in uscita. Meta è più economico in ingresso, Claude Haiku 4.5 in uscita.

• Cache — $0,15 per milione per un cache hit su Muse Spark 1.2, uno sconto dell'88%; $0,10 per milione per una cache read su Claude Haiku 4.5, uno sconto del 90%, con le scritture in cache addebitate a $1,25.

• Contesto — 1.048.576 token contro 200.000. Una differenza di 5,2×, e il singolo divario più ampio tra i due.

• Output massimo — Claude Haiku 4.5 dichiara un tetto di 64.000 token; l'endpoint Muse Spark 1.2 non dichiara alcuna lunghezza massima di completamento, il che è abbastanza insolito da verificare piuttosto che dare per scontato.

• Ragionamento — obbligatorio su Muse Spark 1.2, con cinque livelli di sforzo da minimal a xhigh e un default di medium; opzionale su Claude Haiku 4.5, che è un modello non ragionante finché non attivi il pensiero esteso e gli assegni un budget di pensiero.

• Input — Meta supporta testo, immagini, video, audio e PDF; Claude Haiku 4.5 accetta testo e immagini. Entrambi restituiscono testo.

• Pesi e provider — entrambi chiusi. Muse Spark 1.2 è servito solo dalla Model API di Meta; Claude Haiku 4.5 è disponibile dal fornitore e tramite i consueti rivenditori e aggregatori cloud.

• Età — Muse Spark 1.2 ha solo pochi giorni. Claude Haiku 4.5 è in produzione dal 15 ottobre 2025, con un cutoff delle conoscenze di luglio 2025 e nove mesi di esperienza sul campo accumulata alle spalle.

Il divario dell'indice è reale. Il numero che tutti citeranno non lo è.

Artificial Analysis attribuisce a Muse Spark 1.2 un punteggio di 54 nel suo Intelligence Index, al 13° posto su 185. La sua attuale voce per Claude Haiku 4.5 è 24. Mettili fianco a fianco e ottieni un titolo; guarda cosa sono effettivamente le voci e il titolo crolla.

Il 54 è Muse Spark 1.2 valutato su xhigh, la sua impostazione di ragionamento più costosa. Il 24 è Claude Haiku 4.5 valutato come modello senza ragionamento — pensiero disattivato — e Artificial Analysis lo segnala come una stima anziché un'esecuzione completata. In una versione precedente dello stesso indice, prima della riponderazione v4.1, Artificial Analysis collocava Claude Haiku 4.5 a 55 con ragionamento attivo e a 42 senza. Anche quei valori più vecchi non sono confrontabili con 54, perché le versioni dell'indice vengono riscalate e un punteggio dell'era v3 non è un punteggio v4.1.

Quindi l'affermazione onesta è più limitata di quanto la classifica faccia sembrare: Muse Spark 1.2 al massimo sforzo ottiene 54 sull'indice attuale; non esiste un punteggio v4.1 pubblicato per Claude Haiku 4.5 con extended thinking attivo, quindi non esiste ancora un confronto alla pari tra questi due al massimo sforzo. Chiunque ti mostri 54 contro 24 sta confrontando un modello in piena deliberazione con un modello a cui è stato detto di non deliberare.

Dove il fornitore ha pubblicato un numero, si tratta di un numero specifico: Claude Haiku 4.5 ottiene il 73,3% su SWE-bench Verified, con una media su 50 tentativi e un budget di pensiero di 128K. È un dato fornito dal vendor, e il budget di pensiero è enorme per un modello venduto sulla velocità — ma è la stessa valutazione che il settore cita per i modelli di frontiera, e colloca Haiku in una fascia che il suo prezzo non lascerebbe immaginare. Le rivendicazioni corrispondenti di Meta per Muse Spark 1.2 sono Terminal-Bench 2.1 all'82,9% e DeepSWE v1.1 al 59,3%, anch'esse eseguite dal vendor, sull'harness proprietario di Meta, con ogni concorrente abbinato al proprio agente prodotto. Due fornitori, due benchmark, nessuna sovrapposizione. Al momento non esiste una singola valutazione in cui entrambi questi modelli abbiano un punteggio pubblicato dallo stesso valutatore.

Quattro numeri di latenza, due storie diverse

La latenza è il punto in cui l'inquadramento "stesso prezzo" smette di essere una curiosità e inizia a essere una decisione, ed è anche il punto in cui la fonte di misurazione conta di più.

Nell'harness di benchmark, Artificial Analysis registra un tempo al primo token di 26.12 secondi per Muse Spark 1.2 a xhigh, e 1.00 secondo per Claude Haiku 4.5. Un divario di 26×, e se questo fosse l'intero quadro, il confronto sarebbe già chiuso.

In produzione si inverte. Su sette giorni di traffico reale su OrcaRouter — chiamanti che usano lo sforzo che vogliono davvero — Claude Haiku 4.5 mostra un p50 del tempo al primo token di 3.84 secondi e un p95 di 10.00 secondi, a 214 token al secondo e con un tasso di errore dell'1.0%. Muse Spark 1.1, la versione del modello di Meta presente nel catalogo, mostra un p50 di 1.84 secondi e un p95 di 6.00 secondi, a 519 token al secondo e senza errori registrati. Sul traffico live, il modello di Meta è il più veloce.

Entrambi i set di numeri sono veri e misurano cose diverse. Il valore di laboratorio si riferisce a ogni modello con la massima deliberazione e una cache fredda: è un test equo del limite massimo, ma un test inadeguato per una chat box. Il valore di produzione include cache hit, prompt brevi, livelli di sforzo bassi e tutto il resto che fanno le applicazioni reali: è un test equo della mediana e nessun test del caso peggiore. La trappola è citare un valore e ragionare sull'altro. Se stai dimensionando un timeout lato utente, il p95 è il tuo numero. Se ti chiedi quanto costa un passo agentico profondo in termini di tempo wall-clock, il valore di benchmark è più vicino alla verità — e la nota onesta è che per Muse Spark 1.2 stesso non esiste ancora un valore di produzione del genere, perché è troppo nuovo e non ancora ampiamente instradato.

Entrambi i laboratori ti hanno venduto un subagente. Intendevano cose diverse.

La presentazione del fornitore per Claude Haiku 4.5 era esplicita sulla gerarchia: i modelli di classe Sonnet pianificano e orchestrano, le istanze Haiku eseguono in parallelo al di sotto. Economici, veloci, usa e getta, molti contemporaneamente. Il design del prodotto ne consegue — una finestra di 200K è ampiamente sufficiente per un sottocompito circoscritto e deliberatamente non abbastanza per un intero repository, la modalità di pensiero è disattivata per impostazione predefinita perché un lavoratore che riflette è un lavoratore che costa denaro all'orchestratore, e il marketing del fornitore stesso indica la chat in tempo reale, il servizio clienti e la programmazione in coppia come obiettivo.

La proposta di Meta per Muse Spark 1.2 rivendica entrambe le estremità della stessa gerarchia. Il testo di Meta afferma che il modello può essere l'agente principale che raccoglie il contesto, pianifica e delega, oppure un subagente che esegue in parallelo sotto uno di essi. Muse Code, l'agente da terminale rilasciato insieme ad esso, coordina più subagenti persistenti per task in worktree isolati, su un runtime basato su registro eventi con riproduzione esatta. La finestra da un milione di token e il ragionamento sempre attivo sono ciò di cui un pianificatore ha bisogno; sono esattamente ciò che non sceglieresti per un worker fan-out, perché ogni istanza parallela paga per una deliberazione che non hai richiesto.

Letto come architettura piuttosto che marketing, questa è la vera differenza: il venditore ha costruito un worker e si aspetta che tu porti un orchestratore; Meta ha costruito un orchestratore e sostiene che possa funzionare anche così. Se gestisci già una gerarchia, l'esperimento interessante non è scegliere tra i due — è Muse Spark 1.2 che pianifica e Claude Haiku 4.5 che esegue, una configurazione che nessuno dei due venditori ti venderà come pacchetto.

Quanto costa un vero passo su ciascuno

I tassi per milione non decidono nulla sui modelli di ragionamento, perché il modello sceglie quanti token spendere. Prezza invece il passaggio.

Prendi un task di codice circoscritto: 60.000 token di contesto del repository in ingresso, 3.000 token di patch in uscita. A freddo, Claude Haiku 4.5 costa 0,060 $ di input più 0,015 $ di output — 7,5 centesimi. Muse Spark 1.2 costa 0,075 $ più 0,013 $ — 8,8 centesimi. Abbastanza vicini da essere rumore, esattamente come promesso dalla tariffa media.

Ora aggiungi ciò che la tariffa combinata nasconde. Muse Spark 1.2 non può disattivare il ragionamento e, con l'impostazione predefinita media, un passaggio come questo emette plausibilmente qualche migliaio di token di ragionamento prima della patch — che vengono fatturati come output. Aggiungi 3.000 e lo stesso passaggio è $0,075 + $0,026 = 10,1 centesimi, circa il 35% in più rispetto a Haiku su input identici. Claude Haiku 4.5 con il ragionamento disattivato non paga nulla per la riflessione e rimane a 7,5 centesimi; con un ampio budget di ragionamento supererà Muse Spark 1.2, perché Claude Haiku 4.5 addebita $5,00 per milione di output contro i $4,25 di Meta.

Il caching ribalta ancora una volta l'enfasi. Mantenendo stabile il contesto del repository così che vada in cache, l'input di Haiku scende a $0.006 e quello di Muse Spark 1.2 a $0.009 — il lato dell'input smette del tutto di avere importanza e l'intero confronto diventa una battaglia sui token di output, cioè una battaglia su quanto ogni modello "pensa". Su un carico di lavoro che ripete il contesto, la stabilità della chiave di cache vale più della scelta del modello, e questo è vero per entrambi questi modelli.

La finestra da 1M è l'unico punto in cui i conti non tornano. Qualunque cosa che richieda davvero più di 200.000 token in una singola chiamata non può essere eseguita su Claude Haiku 4.5 a nessun prezzo. O suddividi e orchestri — che è ciò che il fornitore intende — oppure usi un modello con lo spazio necessario.

Provare entrambi senza un secondo contratto

Claude Haiku 4.5 è nel catalogo OrcaRouter a $1,00 e $5,00 — il prezzo di listino del fornitore, perché OrcaRouter applica un margine dello 0% e trasmette i prezzi del provider senza modifiche, il che significa anche che una modifica di prezzo del fornitore è attiva dalla nostra parte lo stesso giorno, anziché al successivo ciclo contrattuale. I dati di latenza in produzione sopra riportati provengono dallo stesso livello di routing.

Muse Spark 1.2 non è nel catalogo. Al momento, l'unico posto in cui chiamarlo è la Model API di Meta, quindi un vero confronto diretto oggi significa un'integrazione tramite noi e una diretta con Meta. Muse Spark 1.1 è ospitato agli stessi identici $1.25 e $4.25 che Meta applica per 1.2, il che lo rende un sostituto ragionevole per quanto riguarda costi e latenza della famiglia, ma non per i guadagni in ambito coding per cui 1.2 viene venduto. Quando 1.2 diventerà instradabile, il confronto diventerà un cambio di una sola riga di stringa del modello con la stessa chiave — e per l'esperimento orchestrator-plus-worker descritto sopra, il DSL di routing è il modo per collegare un planner e un worker fan-out in un'unica chiamata, invece di costruire il passaggio di consegne da soli.

Scegli in base alla forma del lavoro, non al punteggio.

Scegli Claude Haiku 4.5 quando il lavoro è ben definito e l'utente sta aspettando. Agenti di supporto, classificazione, estrazione, chat, completamenti di pair-programming e il livello dei worker paralleli di una gerarchia di agenti. È una quantità nota con nove mesi di storia sul campo, il ragionamento è opzionale, quindi paghi solo per la riflessione quando vuoi, e 200K è sufficiente per quasi qualsiasi sottoattività circoscritta. Il suo risultato pubblicato SWE-bench Verified dice che è molto più capace di quanto il prezzo lasci intendere, a condizione che tu sia disposto a spendere il budget di ragionamento utilizzato da quel risultato.

Scegli Muse Spark 1.2 quando l'unità di lavoro è un repository piuttosto che una richiesta. Refactoring multi-file, debug esteso, generazione dell'intero progetto, cicli di agenti a lungo orizzonte dove nessuno sta guardando uno spinner. La finestra da un milione di token elimina un problema di chunking che Haiku non può risolvere a nessun prezzo, e il ragionamento obbligatorio che lo rovina per la chat è l'impostazione giusta quando un piano sbagliato costa più di uno lento.

Il criterio decisivo non è il numero di indice. Fai invece due domande: una singola chiamata deve mai vedere più di 200.000 token, e c'è un essere umano in attesa del primo token? Un sì alla prima indica Meta. Un sì alla seconda indica il fornitore. Un sì a entrambe significa che vuoi due modelli, il che è la risposta onesta più spesso di quanto il marketing di uno o dell'altro fornitore ammetta.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno