
Muse Spark 1.2 vs Claude Fable 5: Quanto costano realmente sei punti indice
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenNUOVOQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekNUOVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- qwenNUOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 197 tok/s
- orcaNUOVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
- tencentTencent: Hy32026-07-0642Intelligenza59Codice
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenza42Codice
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenza39Codice
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligenza72Codice
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenza52Codice57Matematica
- z-aiZ.ai: GLM 5.22026-06-1653Intelligenza69Codice60Matematica
Artificial Analysis pubblica qualcosa che la maggior parte delle tabelle di benchmark tralascia: quanto ha speso. Eseguire il suo Intelligence Index a nove valutazioni è costato $637.85 su Muse Spark 1.2 e $5,630.52 su Claude Fable 5. Stessa suite di benchmark, stesso banco di prova, un costo 8,8 volte l'altro. Fable 5 ha ottenuto 60 contro i 54 di Muse Spark 1.2.
Dividi la differenza e ottieni il numero su cui verte davvero questo confronto: su quel carico di lavoro, gli ultimi sei punti di intelligenza costano circa $832 per punto. Se valga la pena pagarli non è una questione di benchmark. È una questione di quanto del tuo traffico abbia effettivamente bisogno di quei punti, e per la maggior parte dei team la risposta è una piccola e identificabile frazione.
Il punto dell'indice marginale ha un prezzo, ed è salato.
Entrambi i valori provengono dallo stesso valutatore indipendente che esegue lo stesso composito — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience e AA-LCR. Nessuno dei due è un'affermazione del fornitore. Fable 5 si colloca al #3 su 185 modelli; Muse Spark 1.2 al #13, contro una mediana di classe di 32. Entrambi sono ben sopra la media; solo uno è alla frontiera.

I prezzi di listino spiegano gran parte del divario e sottostimano il resto:
• Input — Muse Spark 1.2 $1.25 per milione, Claude Fable 5 $10.00. Otto volte.
• Output — $4.25 contro $50.00. Quasi dodici volte.
• Input in cache — $0.15 contro $1.00. Circa sette volte, e Fable 5 addebita inoltre $12.50 al milione per scrivere la cache, o $20.00 per un TTL di un'ora, mentre Muse Spark 1.2 non prevede alcuna tariffa separata per la scrittura della cache.
• Tariffa mista — Artificial Analysis valuta Muse Spark 1.2 a $0,78 per milione di token e Fable 5 a $7,70. Poco meno di dieci volte.
Fable 5 era il modello più costoso che Artificial Analysis avesse mai benchmarkato al momento del lancio, e ha mantenuto quel titolo. Vale la pena essere precisi sul perché: il modello ha bruciato meno output token di Muse Spark 1.2 per superare l'indice — 87M contro 95M — quindi l'intera differenza di costo è data dalla tariffa, non dalla verbosità. Fable 5 non è dispendioso. È semplicemente prezzato come un prodotto di frontiera.
Tradotto in un passo di agente che legge 60.000 token di contesto del repository e scrive 3.000 token di patch: circa 8,8 centesimi su Muse Spark 1.2, circa 75 centesimi su Claude Fable 5. Mille passi al giorno sono 88 dollari contro 750 dollari. In un anno, 32.000 dollari contro 274.000 dollari.
Dove Claude Fable 5 non è sostituibile
Il caso dei costi sarebbe a senso unico se i sei punti fossero l'intera differenza. Non lo sono, e il punto in cui il divario si allarga è esattamente il punto in cui Meta ha riposizionato Muse Spark 1.2 per competere.
Fable 5 detiene il primo posto in un’ampia fetta delle classifiche a scontro diretto della Design Arena: 1399 Elo e 1º posto nello sviluppo di giochi, 1367 e 1º posto nell’ASCII art, 1353 e 1º posto nella generazione SVG, oltre al 1º posto nell’arena degli agenti per lo sviluppo di giochi Godot (1344), Android nativo (1318), sviluppo di giochi agentico (1300) e slide HTML (1260), con il secondo posto nelle app web e nel lavoro full-stack. Muse Spark 1.2 non ha alcuna voce nella Design Arena — il suo predecessore ha accumulato un rispettabile record di metà classifica (1334 nello sviluppo di giochi al 5º posto, 1309 nelle categorie generali di codice al 9º posto), ma la nuova versione non è stata valutata nemmeno una volta.
Gli indici per dimensione puntano nella stessa direzione. Artificial Analysis assegna a Claude Fable 5 un indice di coding di 76,5 e un indice agentico di 52,8. Muse Spark 1.1 si fermava a 71,3 e 37,5 — cinque punti indietro sul coding e quindici sul lavoro agentico. Per la 1.2 non sono ancora state pubblicate cifre per dimensione, quindi la dichiarazione onesta è che sappiamo che il divario composito si è chiuso di tre punti, ma non sappiamo quanto di questo sia ricaduto sull'asse agentico.

Il posizionamento di prodotto di Fable 5 sostiene che il vantaggio si amplia con la lunghezza e la complessità del compito. È un'affermazione del fornitore, non verificata così com'è formulata, ma è coerente con l'andamento dei dati indipendenti: i margini maggiori di Fable 5 si registrano nell'ambito degli agenti, dove un modello deve mantenere un piano coerente attraverso molti turni, piuttosto che nella generazione one-shot.
Dove Muse Spark 1.2 è semplicemente la risposta giusta
Tre cose lo rendono la scelta corretta indipendentemente dai sei punti.
• Input audio e video.La scheda di Meta pubblicizza testo, immagini, video, audio e PDF in. Claude Fable 5 accetta testo, immagini e file — niente audio, niente video. Per qualsiasi pipeline che gestisca registrazioni o filmati, questo non è un compromesso, è un filtro rigido. Un'onesta avvertenza: la scheda tecnica di Artificial Analysis per Muse Spark 1.2 registra come valutati solo testo e immagine, quindi la superficie più ampia è pubblicizzata piuttosto che verificata in modo indipendente.
• Velocità. 165,0 token al secondo contro 71,7. Muse Spark 1.2 trasmette l'output a una velocità più che doppia, e si classifica al #16 su 185 per velocità contro una mediana della categoria di 71 — Fable 5 si attesta sulla mediana.
• Costo al volume. Tutto nella sezione precedente.
Aggiungi una quarta opzione per chi ha richieste davvero enormi: entrambi i modelli dichiarano circa un milione di token di contesto — 1,048,576 per Muse Spark 1.2, 1,000,000 per Fable 5 — ma Muse Spark 1.2 applica una tariffa fissa su tutta l'estensione, mentre il prezzo di scrittura in cache di Fable 5 significa che mantenere un ampio prefisso stabile costa denaro reale in anticipo, prima che inizi a farti risparmiare qualcosa.
Nessuno di questi è un modello veloce.
Questa è la sezione che la maggior parte dei confronti diretti salta, e cambia l'architettura piuttosto che la fattura.
Con il massimo sforzo di ragionamento, Artificial Analysis misura il tempo al primo token in 26,12 secondi per Muse Spark 1.2 e 141,26 secondi per Claude Fable 5, con un tempo di risposta end-to-end per Fable 5 di 148,24 secondi. Nessuno dei due dovrebbe trovarsi davanti a un utente con quelle impostazioni.
I numeri di produzione sono molto più clementi e vale la pena conoscerli. Su OrcaRouter, Claude Fable 5 mostra un tempo al primo token (p50) di 7.04 secondi e un p95 di 10.00 secondi su una settimana mobile — cioè traffico reale a qualunque livello di sforzo richiesto dai chiamanti, non un benchmark al massimo. Muse Spark 1.1, per riferimento, registra un p50 di 1.84 secondi. Muse Spark 1.2 non ha ancora telemetria di produzione.

Il punto strutturale: entrambi i modelli hanno ragionamento obbligatorio. Il selettore dell'effort di Fable 5 va da low a max e il valore predefinito è high; quello di Muse Spark 1.2 va da minimal a xhigh e il valore predefinito è medium. Nessuno dei due consente di disattivare il pensiero. Se hai bisogno di risposte in meno di un secondo, tutto questo confronto è lo scaffale sbagliato — è a questo che serve un modello di classe Luna o Flash-Lite.
Lo stack a due modelli, fuori mercato.
Considerare questa una scelta in cui il vincitore prende tutto è l'errore, perché il traffico non è omogeneo. Quasi ogni agente in produzione ha una lunga coda di passaggi di routine — leggere un file, riassumere una diff, formattare una patch, decidere quale strumento chiamare dopo — e una breve testa di casi davvero difficili in cui una risposta sbagliata costa un'ora.
Considera gli stessi mille passi dell'agente al giorno. Tutti su Claude Fable 5: circa $750. Tutti su Muse Spark 1.2: circa $88. Dividi 900 compiti di routine sul modello economico e 100 difficili su quello costoso: circa $79 più $75, ovvero $154 al giorno. Questa è un quinto della spesa interamente su Fable, mantenendo la capacità di frontiera sul decimo delle chiamate che ne hanno davvero bisogno — e ammonta a circa $220.000 all'anno di differenza su un singolo ciclo agente.
Il motivo per cui vale la pena costruire lo split piuttosto che limitarsi a descriverlo è che in passato richiedeva due rapporti con i fornitori, due SDK e due set di credenziali. Ora non più. Claude Fable 5 è nel catalogo OrcaRouter a $10.00 e $50.00 — prezzo di listino del fornitore, applicato con margine 0% — e Muse Spark 1.1 è presente a $1.25 e $4.25 alle stesse condizioni, dietro lo stesso endpoint compatibile con OpenAI. Il DSL di routing consente di esprimere "prima il modello economico, scala in caso di bassa confidenza o di test fallito" come una singola chiamata invece che come codice di orchestrazione da mantenere, e la fusione dei modelli consente di inviare i passaggi davvero ambigui a un gruppo di modelli contemporaneamente e confrontarli. Muse Spark 1.2 di per sé non è ancora nel catalogo — Meta lo fornisce direttamente, in quanto unico fornitore — quindi oggi la cosa più simile a questo stack che puoi costruire usa 1.1 sul ramo economico.
Quel dettaglio del fornitore unico merita una riga propria in una valutazione del rischio. Claude Fable 5 ha più percorsi di servizio e failover automatico tra di essi. Muse Spark 1.2 ha esattamente un endpoint, gestito da Meta. Se va giù, non c'è alcun fallback che sia lo stesso modello.
Un modello di costo, non un verdetto
Il risultato utile di questo confronto non è "quale modello vince." È una soglia che puoi calcolare per il tuo carico di lavoro.
Stima la frazione delle tue chiamate in cui una risposta di classe Muse Spark 1.2 fallisce e una di classe Fable 5 riesce. Moltiplica per quanto costa un fallimento — minuti di ingegneria, una merge sbagliata, un loop di retry, un cliente. Confronta questo con 66 centesimi per step, ovvero il costo dell'aggiornamento di una singola chiamata da Muse Spark 1.2 a Claude Fable 5 nell'esempio 60K-in / 3K-out qui sopra. Se la perdita attesa da una risposta errata supera 66 centesimi, instrada quello step su Fable 5. In caso contrario, non farlo.
Per la maggior parte dei team, quel calcolo mette Fable 5 su code review, generazione finale delle patch, pianificazione architetturale e qualsiasi cosa tocchi i dati di produzione, e mette Muse Spark 1.2 su tutto il resto — lettura di file, sintesi, triage dei test, selezione degli strumenti, il nucleo ad alto volume di un ciclo agente dove il costo è reale e la posta in gioco per chiamata non lo è.
Una cosa da continuare a osservare: le classifiche della Design Arena e gli indici per dimensione per Muse Spark 1.2, nessuno dei quali esiste ancora. La prova più forte di Fable 5 sta proprio nelle arene testa a testa dove il nuovo modello di Meta non ha alcun record. Quando quel record apparirà, questa soglia si sposterà — probabilmente di molto.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
