Muse Spark 1.2 vs Claude Haiku 4.5: Prezzo misto identico, idee opposte sul pensiero
Guides & Insights

Muse Spark 1.2 vs Claude Haiku 4.5: Prezzo misto identico, idee opposte sul pensiero

Autore

Jim Song

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Artificial Analysis prices Muse Spark 1.2 at $0.78 per million tokens blended and Claude Haiku 4.5 at $0.77. One cent apart, from two labs that agreed on nothing else. Meta's model cannot stop reasoning; Claude Haiku 4.5 only reasons when you ask it to. Meta gives you 1,048,576 tokens of context; Claude Haiku 4.5 gives you 200,000. Meta shipped this one on August 5, 2026 as a coding model with a terminal agent attached; Claude Haiku 4.5 shipped in October 2025 as the fast, cheap worker a bigger model tells what to do. Same price per token, entirely different machines.

That coincidence is the useful place to start a comparison, because it removes the variable people usually decide on and forces the question to be about shape instead. What follows uses independent numbers where they exist — Artificial Analysis for index scores and lab latency, OrcaRouter's own seven-day production telemetry for real-traffic latency — and flags vendor-reported figures as such, including one benchmark headline of the vendor's that has no third-party counterpart.

Il contrasto delle specifiche, una dimensione alla volta

Price — Muse Spark 1.2 at $1.25 in / $4.25 out per million; Claude Haiku 4.5 at $1.00 in / $5.00 out. Meta is cheaper on input, Claude Haiku 4.5 on output.

Cache — $0,15 per milione per un cache hit su Muse Spark 1.2, uno sconto dell'88%; $0,10 per milione per una cache read su Claude Haiku 4.5, uno sconto del 90%, con le scritture in cache addebitate a $1,25.

Contesto — 1.048.576 token contro 200.000. Una differenza di 5,2×, e il singolo divario più ampio tra i due.

Output massimo — Claude Haiku 4.5 dichiara un tetto di 64.000 token; l'endpoint Muse Spark 1.2 non dichiara alcuna lunghezza massima di completamento, il che è abbastanza insolito da verificare piuttosto che dare per scontato.

Ragionamento — obbligatorio su Muse Spark 1.2, con cinque livelli di sforzo da minimal a xhigh e un default di medium; opzionale su Claude Haiku 4.5, che è un modello non ragionante finché non attivi il pensiero esteso e gli assegni un budget di pensiero.

Inputs — Meta advertises text, images, video, audio and PDF; Claude Haiku 4.5 takes text and images. Both return text.

Weights and providers — both closed. Muse Spark 1.2 is served only by Meta's own Model API; Claude Haiku 4.5 is available from the vendor and through the usual cloud resellers and aggregators.

Età — Muse Spark 1.2 ha solo pochi giorni. Claude Haiku 4.5 è in produzione dal 15 ottobre 2025, con un cutoff delle conoscenze di luglio 2025 e nove mesi di esperienza sul campo accumulata alle spalle.

Il divario dell'indice è reale. Il numero che tutti citeranno non lo è.

Artificial Analysis attribuisce a Muse Spark 1.2 un punteggio di 54 nel suo Intelligence Index, al 13° posto su 185. La sua attuale voce per Claude Haiku 4.5 è 24. Mettili fianco a fianco e ottieni un titolo; guarda cosa sono effettivamente le voci e il titolo crolla.

Il 54 è Muse Spark 1.2 valutato su xhigh, la sua impostazione di ragionamento più costosa. Il 24 è Claude Haiku 4.5 valutato come modello senza ragionamento — pensiero disattivato — e Artificial Analysis lo segnala come una stima anziché un'esecuzione completata. In una versione precedente dello stesso indice, prima della riponderazione v4.1, Artificial Analysis collocava Claude Haiku 4.5 a 55 con ragionamento attivo e a 42 senza. Anche quei valori più vecchi non sono confrontabili con 54, perché le versioni dell'indice vengono riscalate e un punteggio dell'era v3 non è un punteggio v4.1.

Quindi l'affermazione onesta è più limitata di quanto la classifica faccia sembrare: Muse Spark 1.2 al massimo sforzo ottiene 54 sull'indice attuale; non esiste un punteggio v4.1 pubblicato per Claude Haiku 4.5 con extended thinking attivo, quindi non esiste ancora un confronto alla pari tra questi due al massimo sforzo. Chiunque ti mostri 54 contro 24 sta confrontando un modello in piena deliberazione con un modello a cui è stato detto di non deliberare.

Where the vendor has published a number, it is a specific one: Claude Haiku 4.5 scores 73.3% on SWE-bench Verified, averaged over 50 trials with a 128K thinking budget. That is a vendor figure, and the thinking budget in it is enormous for a model marketed on speed — but it is the same evaluation the industry quotes for frontier models, and it puts Haiku in a bracket its price does not suggest. Meta's counterpart claims for Muse Spark 1.2 are Terminal-Bench 2.1 at 82.9% and DeepSWE v1.1 at 59.3%, also vendor-run, on Meta's own harness with each competitor paired to its own agent product. Two vendors, two benchmarks, no overlap. There is currently no single evaluation on which both of these models have a published score from the same evaluator.

Quattro numeri di latenza, due storie diverse

La latenza è il punto in cui l'inquadramento "stesso prezzo" smette di essere una curiosità e inizia a essere una decisione, ed è anche il punto in cui la fonte di misurazione conta di più.

Nell'harness di benchmark, Artificial Analysis registra un tempo al primo token di 26.12 secondi per Muse Spark 1.2 a xhigh, e 1.00 secondo per Claude Haiku 4.5. Un divario di 26×, e se questo fosse l'intero quadro, il confronto sarebbe già chiuso.

In produzione si inverte. Su sette giorni di traffico reale su OrcaRouter — chiamanti che usano lo sforzo che vogliono davvero — Claude Haiku 4.5 mostra un p50 del tempo al primo token di 3.84 secondi e un p95 di 10.00 secondi, a 214 token al secondo e con un tasso di errore dell'1.0%. Muse Spark 1.1, la versione del modello di Meta presente nel catalogo, mostra un p50 di 1.84 secondi e un p95 di 6.00 secondi, a 519 token al secondo e senza errori registrati. Sul traffico live, il modello di Meta è il più veloce.

Entrambi i set di numeri sono veri e misurano cose diverse. Il valore di laboratorio si riferisce a ogni modello con la massima deliberazione e una cache fredda: è un test equo del limite massimo, ma un test inadeguato per una chat box. Il valore di produzione include cache hit, prompt brevi, livelli di sforzo bassi e tutto il resto che fanno le applicazioni reali: è un test equo della mediana e nessun test del caso peggiore. La trappola è citare un valore e ragionare sull'altro. Se stai dimensionando un timeout lato utente, il p95 è il tuo numero. Se ti chiedi quanto costa un passo agentico profondo in termini di tempo wall-clock, il valore di benchmark è più vicino alla verità — e la nota onesta è che per Muse Spark 1.2 stesso non esiste ancora un valore di produzione del genere, perché è troppo nuovo e non ancora ampiamente instradato.

Entrambi i laboratori ti hanno venduto un subagente. Intendevano cose diverse.

The vendor's pitch for Claude Haiku 4.5 was explicit about hierarchy: Sonnet-class models plan and orchestrate, Haiku instances execute in parallel underneath. Cheap, fast, disposable, many at once. The product design follows — a 200K window is plenty for a scoped subtask and deliberately not enough for a whole repository, thinking is off by default because a worker that deliberates is a worker that costs orchestrator money, and the vendor's own marketing names real-time chat, customer service and pair programming as the target.

La proposta di Meta per Muse Spark 1.2 rivendica entrambe le estremità della stessa gerarchia. Il testo di Meta afferma che il modello può essere l'agente principale che raccoglie il contesto, pianifica e delega, oppure un subagente che esegue in parallelo sotto uno di essi. Muse Code, l'agente da terminale rilasciato insieme ad esso, coordina più subagenti persistenti per task in worktree isolati, su un runtime basato su registro eventi con riproduzione esatta. La finestra da un milione di token e il ragionamento sempre attivo sono ciò di cui un pianificatore ha bisogno; sono esattamente ciò che non sceglieresti per un worker fan-out, perché ogni istanza parallela paga per una deliberazione che non hai richiesto.

Read as architecture rather than marketing, that is the real difference: the vendor built a worker and expects you to bring an orchestrator; Meta built an orchestrator and claims it can also work. If you already run a hierarchy, the interesting experiment is not choosing between them — it is Muse Spark 1.2 planning and Claude Haiku 4.5 executing, which is a shape neither vendor will sell you as a package.

Quanto costa un vero passo su ciascuno

I tassi per milione non decidono nulla sui modelli di ragionamento, perché il modello sceglie quanti token spendere. Prezza invece il passaggio.

Prendi un task di codice circoscritto: 60.000 token di contesto del repository in ingresso, 3.000 token di patch in uscita. A freddo, Claude Haiku 4.5 costa 0,060 $ di input più 0,015 $ di output — 7,5 centesimi. Muse Spark 1.2 costa 0,075 $ più 0,013 $ — 8,8 centesimi. Abbastanza vicini da essere rumore, esattamente come promesso dalla tariffa media.

Now add the thing the blended rate hides. Muse Spark 1.2 cannot turn reasoning off, and at its default medium setting a step like this plausibly emits a few thousand reasoning tokens before the patch — they bill as output. Add 3,000 and the same step is $0.075 + $0.026 = 10.1 cents, about 35% above Haiku on identical inputs. Claude Haiku 4.5 with thinking off pays nothing for deliberation and stays at 7.5 cents; with a large thinking budget it will exceed Muse Spark 1.2, because Claude Haiku 4.5 charges $5.00 per million output against Meta's $4.25.

Il caching ribalta ancora una volta l'enfasi. Mantenendo stabile il contesto del repository così che vada in cache, l'input di Haiku scende a $0.006 e quello di Muse Spark 1.2 a $0.009 — il lato dell'input smette del tutto di avere importanza e l'intero confronto diventa una battaglia sui token di output, cioè una battaglia su quanto ogni modello "pensa". Su un carico di lavoro che ripete il contesto, la stabilità della chiave di cache vale più della scelta del modello, e questo è vero per entrambi questi modelli.

The 1M window is the one place the arithmetic is not close. Anything that genuinely needs more than 200,000 tokens in a single call cannot be run on Claude Haiku 4.5 at any price. You either chunk and orchestrate — which is what the vendor intends — or you use a model with the room.

Provare entrambi senza un secondo contratto

Claude Haiku 4.5 is in the OrcaRouter catalog at $1.00 and $5.00 — the vendor's list price, because OrcaRouter runs 0% markup and passes provider pricing through untouched, which also means a vendor price change is live on our side the same day rather than at the next contract cycle. The production latency figures above come from that same routing layer.

Muse Spark 1.2 non è nel catalogo. Al momento, l'unico posto in cui chiamarlo è la Model API di Meta, quindi un vero confronto diretto oggi significa un'integrazione tramite noi e una diretta con Meta. Muse Spark 1.1 è ospitato agli stessi identici $1.25 e $4.25 che Meta applica per 1.2, il che lo rende un sostituto ragionevole per quanto riguarda costi e latenza della famiglia, ma non per i guadagni in ambito coding per cui 1.2 viene venduto. Quando 1.2 diventerà instradabile, il confronto diventerà un cambio di una sola riga di stringa del modello con la stessa chiave — e per l'esperimento orchestrator-plus-worker descritto sopra, il DSL di routing è il modo per collegare un planner e un worker fan-out in un'unica chiamata, invece di costruire il passaggio di consegne da soli.

Scegli in base alla forma del lavoro, non al punteggio.

Scegli Claude Haiku 4.5 quando il lavoro è ben definito e l'utente sta aspettando. Agenti di supporto, classificazione, estrazione, chat, completamenti di pair-programming e il livello dei worker paralleli di una gerarchia di agenti. È una quantità nota con nove mesi di storia sul campo, il ragionamento è opzionale, quindi paghi solo per la riflessione quando vuoi, e 200K è sufficiente per quasi qualsiasi sottoattività circoscritta. Il suo risultato pubblicato SWE-bench Verified dice che è molto più capace di quanto il prezzo lasci intendere, a condizione che tu sia disposto a spendere il budget di ragionamento utilizzato da quel risultato.

Scegli Muse Spark 1.2 quando l'unità di lavoro è un repository piuttosto che una richiesta. Refactoring multi-file, debug esteso, generazione dell'intero progetto, cicli di agenti a lungo orizzonte dove nessuno sta guardando uno spinner. La finestra da un milione di token elimina un problema di chunking che Haiku non può risolvere a nessun prezzo, e il ragionamento obbligatorio che lo rovina per la chat è l'impostazione giusta quando un piano sbagliato costa più di uno lento.

What should decide it is not the index number. Ask two questions instead: does a single call ever need to see more than 200,000 tokens, and is there a human waiting on the first token? Yes to the first points at Meta. Yes to the second points at the vendor. Yes to both means you want two models, which is the honest answer more often than either vendor's marketing admits.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube