Muse Spark 1.2 vs Claude Fable 5
Guides & Insights

Muse Spark 1.2 vs Claude Fable 5: Lo que realmente cuestan seis puntos de índice

Autor

Jim Song

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Artificial Analysis publica algo que la mayoría de las tablas de referencia omiten: lo que gastó. Ejecutar su Intelligence Index de nueve evaluaciones costó $637.85 en Muse Spark 1.2 y $5,630.52 en Claude Fable 5. La misma suite de evaluaciones, el mismo arnés, una factura 8.8 veces la otra. Fable 5 obtuvo 60 frente a los 54 de Muse Spark 1.2.

Divide la diferencia y obtienes el número del que realmente trata esta comparación: en esa carga de trabajo, los últimos seis puntos de inteligencia cuestan aproximadamente $832 por punto. Si deberías pagarlo no es una cuestión de benchmarks. Es una cuestión de cuánto de tu tráfico realmente necesita esos puntos, y la respuesta para la mayoría de los equipos es una fracción pequeña e identificable.

El punto de índice marginal tiene un precio, y es elevado.

Ambas cifras provienen del mismo evaluador independiente que ejecuta el mismo conjunto compuesto — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience y AA-LCR. Ninguna es una afirmación del proveedor. Fable 5 se ubica en el puesto #3 de 185 modelos; Muse Spark 1.2 en el #13, frente a una mediana de clase de 32. Ambas están muy por encima del promedio; solo una está en la frontera.

Muse Spark 1.2 vs Claude Fable 5

Los precios de lista explican la mayor parte de la brecha y subestiman el resto:

Entrada — Muse Spark 1.2 $1.25 por millón, Claude Fable 5 $10.00. Ocho veces.

Output — $4,25 frente a $50,00. Casi doce veces.

Entrada en caché — $0.15 frente a $1.00. Aproximadamente siete veces, y Fable 5 además cobra $12.50 por millón para escribir la caché, o $20.00 para un TTL de una hora, mientras que Muse Spark 1.2 no publica ninguna tarifa separada por escritura en caché.

Tarifa combinada — Artificial Analysis sitúa Muse Spark 1.2 en $0.78 por millón de tokens y Fable 5 en $7.70. Poco menos de diez veces.

Fable 5 fue el modelo más caro que Artificial Analysis había evaluado cuando se lanzó, y ha mantenido ese título. Vale la pena ser precisos sobre el porqué: el modelo consumió menos tokens de salida que Muse Spark 1.2 al recorrer el índice — 87M frente a 95M — por lo que toda la diferencia de costo se debe a la tarifa, no a la verbosidad. Fable 5 no es derrochador. Simplemente tiene el precio de un producto de vanguardia.

Traducido a un paso de agente que lee 60,000 tokens de contexto del repositorio y escribe 3,000 tokens de parche: aproximadamente 8.8 centavos en Muse Spark 1.2, aproximadamente 75 centavos en Claude Fable 5. Mil pasos al día son $88 frente a $750. En un año, $32,000 frente a $274,000.

Donde Claude Fable 5 no es reemplazable.

El argumento de los costos sería unilateral si los seis puntos fueran toda la diferencia. No lo son, y el punto donde la brecha se ensancha es precisamente donde Meta ha reposicionado Muse Spark 1.2 para competir.

Fable 5 ocupa el primer puesto en una amplia franja de las clasificaciones cara a cara de Design Arena: 1399 Elo y puesto 1 en desarrollo de juegos, 1367 y puesto 1 en arte ASCII, 1353 y puesto 1 en generación de SVG, además del puesto 1 en la arena de agentes para desarrollo de juegos Godot (1344), Android nativo (1318), desarrollo de juegos agéntico (1300) y diapositivas HTML (1260), con el segundo puesto en apps web y trabajo full-stack. Muse Spark 1.2 no tiene ninguna entrada en Design Arena en absoluto — su predecesor acumuló un respetable historial de mitad de tabla (1334 en desarrollo de juegos en el puesto 5, 1309 en categorías generales de código en el puesto 9), pero la nueva versión no ha sido evaluada ni una sola vez.

Los índices por dimensión apuntan en la misma dirección. Artificial Analysis puntúa a Claude Fable 5 con un índice de codificación de 76.5 y un índice agéntico de 52.8. Muse Spark 1.1 se situó en 71.3 y 37.5 — cinco puntos por detrás en codificación y quince en trabajo agéntico. Aún no se han publicado cifras por dimensión para la 1.2, así que la afirmación honesta es que sabemos que el compuesto recortó tres puntos y no sabemos cuánto de eso recayó en el eje agéntico.

Muse Spark 1.2 vs Claude Fable 5

El propio posicionamiento de producto de Fable 5 afirma que la ventaja se amplía con la longitud y la complejidad de la tarea. Esa es una afirmación del proveedor y, tal como se presenta, no está verificada, pero es consistente con la forma de los datos independientes: los mayores márgenes de Fable 5 se encuentran en el ámbito de los agentes, donde un modelo tiene que mantener un plan cohesionado a lo largo de muchos turnos, en lugar de en la generación de una sola pasada.

Donde Muse Spark 1.2 es simplemente la respuesta correcta.

Tres cosas lo convierten en la elección correcta independientemente de los seis puntos.

Entrada de audio y video.La lista de Meta anuncia texto, imágenes, video, audio y PDF en. Claude Fable 5 acepta texto, imágenes y archivos — ni audio, ni video. Para cualquier canal que trabaje con grabaciones o metraje, esto no es una concesión, es un filtro duro. Una advertencia honesta: la tarjeta de especificaciones de Artificial Analysis para Muse Spark 1.2 registra solo texto e imagen como evaluados, por lo que la superficie más amplia se anuncia en lugar de verificarse de forma independiente.

Velocidad. 165.0 tokens por segundo frente a 71.7. Muse Spark 1.2 transmite la salida más del doble de rápido y ocupa el puesto #16 de 185 en velocidad frente a una mediana de clase de 71 — Fable 5 se sitúa en la mediana.

Costo por volumen. Todo lo de la sección anterior.

Añade una cuarta opción para aquellos cuyas solicitudes son verdaderamente enormes: ambos modelos anuncian aproximadamente un millón de tokens de contexto — 1.048.576 para Muse Spark 1.2, 1.000.000 para Fable 5 — pero Muse Spark 1.2 cobra una tarifa plana por todo ello, mientras que la tarifa de escritura de caché de Fable 5 implica que mantener un prefijo estable grande cuesta dinero real por adelantado antes de que empiece a ahorrarte algo.

Ninguno de estos es un modelo rápido.

Esta es la sección que la mayoría de las comparativas omiten, y cambia la arquitectura en lugar de la factura.

Con el máximo esfuerzo de razonamiento, Artificial Analysis mide el tiempo hasta el primer token en 26,12 segundos para Muse Spark 1.2 y 141,26 segundos para Claude Fable 5, con un tiempo de respuesta de extremo a extremo para Fable 5 de 148,24 segundos. Ninguno debería estar frente a un usuario con esa configuración.

Las cifras de producción son mucho más amables y vale la pena conocerlas. En OrcaRouter, Claude Fable 5 muestra un tiempo p50 hasta el primer token de 7.04 segundos y un p95 de 10.00 segundos a lo largo de una semana móvil — eso es tráfico real al nivel de esfuerzo que pidan quienes llaman, no un benchmark al máximo. Muse Spark 1.1, como referencia, registra un p50 de 1.84 segundos. Muse Spark 1.2 aún no tiene telemetría de producción.

Muse Spark 1.2 vs Claude Fable 5

El punto estructural: ambos modelos tienen razonamiento obligatorio. El dial de esfuerzo del Fable 5 va de bajo a máximo y por defecto está en alto; el del Muse Spark 1.2 va de mínimo a extra alto y por defecto está en medio. Ninguno permite desactivar el razonamiento. Si necesitas respuestas en menos de un segundo, toda esta comparación está en el estante equivocado — para eso está un modelo de clase Luna o Flash-Lite.

La pila de dos modelos, con el precio calculado.

Plantear esto como una elección de todo o nada es el error, porque el tráfico no es homogéneo. Casi todo agente de producción tiene una larga cola de pasos rutinarios — leer un archivo, resumir un diff, formatear un parche, decidir a qué herramienta llamar a continuación — y una cabeza corta de tareas realmente difíciles donde una respuesta equivocada cuesta una hora.

Da los mismos mil pasos de agente al día. Todo con Claude Fable 5: unos $750. Todo con Muse Spark 1.2: unos $88. Reparte 900 rutinarios al modelo barato y 100 difíciles al caro: unos $79 más $75, o $154 al día. Eso es una quinta parte de la factura de solo Fable, manteniendo la capacidad de frontera en la décima parte de las llamadas que realmente la necesitan, y son unos $220,000 al año de diferencia en un solo bucle de agente.

La razón por la que vale la pena construir la división en lugar de solo describirla es que antes requería dos relaciones con proveedores, dos SDK y dos conjuntos de credenciales. Ya no. Claude Fable 5 está en el catálogo de OrcaRouter a $10.00 y $50.00 — precio de lista del proveedor, transmitido con un margen del 0% — y Muse Spark 1.1 está ahí a $1.25 y $4.25 en las mismas condiciones, detrás del mismo endpoint compatible con OpenAI. El DSL de enrutamiento te permite expresar "modelo barato primero, escalar ante baja confianza o una ejecución de prueba fallida" como una sola llamada, en lugar de código de orquestación que tengas que mantener, y la fusión de modelos te permite enviar los pasos genuinamente ambiguos a un panel de modelos a la vez y comparar. Muse Spark 1.2 en sí aún no está en el catálogo — Meta lo sirve directamente, como su único proveedor — así que hoy lo más cercano que puedes construir a esta pila usa 1.1 en el brazo económico.

Ese detalle de proveedor único merece su propia línea en una evaluación de riesgos. Claude Fable 5 tiene múltiples rutas de servicio y conmutación automática por error entre ellas. Muse Spark 1.2 tiene exactamente un endpoint, gestionado por Meta. Si se cae, no hay ningún respaldo que sea el mismo modelo.

Un modelo de costos, no un veredicto.

El resultado útil de esta comparación no es "qué modelo gana". Es un umbral que puedes calcular para tu propia carga de trabajo.

Estime la fracción de sus llamadas en las que una respuesta de clase Muse Spark 1.2 falla y una respuesta de clase Fable 5 tiene éxito. Multiplíquelo por lo que cuesta un fallo: minutos de ingeniero, un merge defectuoso, un bucle de reintentos, un cliente. Compárelo con 66 centavos por paso, que es lo que cuesta actualizar una sola llamada de Muse Spark 1.2 a Claude Fable 5 en el ejemplo anterior de 60K de entrada / 3K de salida. Si la pérdida esperada por una respuesta incorrecta supera los 66 centavos, enrute ese paso a Fable 5. Si no, no lo haga.

Para la mayoría de los equipos, ese cálculo sitúa a {{1}}Fable 5{{/1}} en la revisión de código, la generación de parches finales, la planificación arquitectónica y cualquier cosa que toque datos de producción, y sitúa a {{2}}Muse Spark 1.2{{/2}} en todo lo demás — lectura de archivos, resumen, clasificación de pruebas, selección de herramientas, el tramo central de alto volumen de un bucle de agente donde el coste es real y lo que está en juego por llamada no lo es.

Una cosa a la que seguir prestando atención: las escaleras de Design Arena y los índices por dimensión para Muse Spark 1.2, ninguno de los cuales existe todavía. La evidencia más sólida de Fable 5 se encuentra precisamente en las arenas cara a cara donde el nuevo modelo de Meta no tiene ningún registro. Cuando ese registro aparezca, este umbral se moverá — posiblemente mucho.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube