Una tarjeta destacada generada titulada 'Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base' con el antetítulo 'EL BARATO NO PUEDE RESPONDER A UNA PREGUNTA' y chips que indican $0.10 frente a $0.06 por millón de tokens de entrada, Índice AA 43 frente a 13 y listo para responder frente a checkpoint base.
Guides & Insights

Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base: el barato no puede responder una pregunta

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

En los dos números que más le importan a una hoja de cálculo de adquisiciones, gana el modelo más barato y más rápido. Nemotron 3.5 Lightning 30B A3B Base se ejecuta a 298,9 tokens de salida por segundo, el más rápido de 142 modelos monitoreados de forma independiente, y cuesta $0,06 por millón de tokens de entrada, frente a los $0,10 de Claude Haiku 5.5. Además, como te advierte la palabra «Base» en su nombre, no es un asistente. Es un checkpoint preentrenado —sin ajuste fino supervisado, sin aprendizaje por refuerzo, sin una plantilla de chat que merezca ese nombre—, publicado bajo la licencia OpenMDW-1.1 el 11 de agosto de 2026 para que otras personas puedan construir sobre él. Claude Haiku 5.5, lanzado el 7 de octubre de 2026, es un producto terminado al que puedes enviar una pregunta. Compararlos por precio es como comparar el precio de la harina con el del pan, y la parte interesante de este enfrentamiento es determinar cuál de los dos necesita realmente tu carga de trabajo.

Nadie en la cobertura del lanzamiento dice esa parte con claridad, porque «más barato y más rápido que Claude Haiku 5.5» es un titular mejor que «más barato, más rápido y no utilizable sin un ajuste fino». Ambas afirmaciones son ciertas. Solo una de ellas es útil.

Lo que cada modelo realmente es

Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, publicado el 7 de octubre de 2026. Entrada de texto e imágenes, salida de texto. Contexto de 1 M de tokens, salida máxima de 128 000 tokens (300 000 con un encabezado beta en la API Batch), fecha de corte de entrenamiento en junio de 2026, retiro no antes del 7 de octubre de 2027. Esfuerzo ajustable entre Low, Medium, High, Xhigh y Max, con valor predeterminado Medium, y pensamiento adaptativo activado de forma predeterminada. API con facturación por uso, lecturas de caché a $0.01 por millón, Batch a mitad de tarifa. Disponible a través de la API de Anthropic y, desde allí, dondequiera que se revendan los modelos de Anthropic.

Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, anunciado el 11 de agosto de 2026. Un checkpoint híbrido de mezcla de expertos de 30 mil millones de parámetros con aproximadamente 3000 millones de parámetros activos por token, construido sobre una pila de Mamba-2 más MoE más atención, destilado de Nemotron 3 Ultra, y que se distribuye con decodificación especulativa MTP, DFlash y DSpark. El contexto llega hasta 1M de tokens, aunque alrededor de 256 000 es el techo práctico en una sola H100. Es solo texto. Los pesos son abiertos bajo OpenMDW-1.1. Y es un checkpoint base: pesos preentrenados sin ajuste por instrucciones, lo que significa que completa texto en lugar de seguir instrucciones.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base — the scoreboard'. Claude Haiku 5.5 reads output speed 243.4 tokens per second, AA Index 43, proprietary weights, instruction-tuned yes, $0.10 per million input and $0.21 per task; the Nemotron column reads output speed 298.9 tokens per second, AA Index 13, weights open under OpenMDW-1.1, instruction-tuned no — base checkpoint, $0.06 per million input and $0.09 per task. A footer notes the Artificial Analysis figures are independently run and the NVIDIA figures are vendor-reported and unreproduced.

• Las dimensiones, una por línea

• Precio de entrada — Claude Haiku 5.5 $0.10 por millón hasta 100K tokens, luego $0.50; Nemotron 3.5 Lightning 30B A3B Base $0.06 por millón.

• Precio de salida — $0.50 por millón hasta 100K tokens, luego $2.50, frente a $0.20 por millón.

• Coste por tarea finalizada — 0,21 $ por tarea de índice independiente para Claude Haiku 5.5, frente a 0,09 $ para Nemotron — el modelo más barato es más barato por tarea, no solo por token.

• Velocidad de salida — 243,4 tokens por segundo para Claude Haiku 5.5, noveno de 182; 298,9 tokens por segundo para Nemotron, primero de 142.

• Tiempo hasta el primer token — alrededor de 0,3 segundos para Claude Haiku 5.5, frente a 0,54 segundos para Nemotron.

• Puntuación independiente — Índice de Inteligencia de Artificial Analysis 43 para Claude Haiku 5.5, segundo de 182, con la configuración Max en 43.40; Índice 13 para Nemotron, vigésimo noveno de 142.

• Ventana de contexto — 1.000.000 de tokens cada una, con aproximadamente 256.000 prácticos para Nemotron en una sola H100.

• Modalidades — entrada de texto e imagen para Claude Haiku 5.5; solo texto para Nemotron.

• Pesos — propietarios frente a abiertos bajo OpenMDW-1.1, un MoE híbrido de 30B en total y 3B activos.

• Ajuste por instrucciones — presente en Claude Haiku 5.5, ausente en el checkpoint Base.

El problema de la "Base", expuesto sin rodeos.

Un checkpoint base predice el siguiente token. Pregúntale algo y, a menudo, continuará el texto al estilo de un documento que podría contener esa pregunta, en lugar de responder. Si le das «Resume este contrato», un modelo base podría producir una continuación plausible de un documento legal de entrenamiento en lugar de un resumen del tuyo. NVIDIA publica un checkpoint BF16 aparte y modelos hermanos ajustados con instrucciones aparte precisamente porque los pesos base son materia prima.

En la propia tarjeta de modelo de NVIDIA —con cifras reportadas por el proveedor, no reproducidas de forma independiente—, el checkpoint base obtiene 78,59 en MMLU, 67,94 en MMLU-Pro, 91,28 en GSM8K, 77,44 en HumanEval y 69,62 en RULER con 1 M de tokens. La tarjeta de Lightning para el modelo hermano afinado reporta MMLU-Pro 81,94, GPQA Diamond 75,44, SWE-Bench Verified 51,56 y 86 % en PinchBench, con una inferencia aproximadamente un 30 % más rápida que el modelo al que reemplazó. Incluso las cifras del modelo afinado son de NVIDIA, y las cifras base son las que corresponden al checkpoint nombrado en el título de este artículo. Frente a ellas, el 43,40 de Claude Haiku 5.5, medido de forma independiente —segundo de 182 en el índice de Artificial Analysis, un índice distinto que mide cosas distintas— no es directamente comparable, y la lectura honesta es que un checkpoint base de 30B y un modelo pequeño terminado están siendo evaluados por instrumentos distintos para fines distintos.

Lo que puede decirse sin reservas es la forma de la brecha. Un checkpoint base que necesita un pipeline de ajuste fino, una pila de servicio y un arnés de evaluación antes de responder a cualquier cosa no es un sustituto de un modelo alojado a $0.10 por millón. Es un punto de partida para alguien que quiere ser dueño del modelo.

Donde Nemotron realmente gana, y no es un premio de consolación

Velocidad ante todo. 298,9 tokens de salida por segundo lo sitúan a la cabeza de una clasificación de 142 modelos: un 23 % más rápido que los 243,4 de Claude Haiku 5.5. Para un pipeline sensible a la latencia, esa es una diferencia real y medible, y es la razón por la que el nombre «Lightning» figura en la caja.

Los pesos abiertos van en segundo lugar, y esta es la más importante. Bajo OpenMDW-1.1 puedes descargar el checkpoint, ajustarlo con tus propios datos y servirlo tú mismo. Claude Haiku 5.5 no se puede ajustar en absoluto y no se puede autoalojar a ningún precio. Para un equipo con una tarea propietaria, una distribución de entrada inusual o un requisito de cumplimiento de que el tráfico nunca salga de su propia infraestructura, esa diferencia es decisiva independientemente de lo que digan las páginas de benchmarks. Un total de 30B con 3B activos también es lo suficientemente pequeño como para poder servirse de forma económica — la arquitectura está diseñada exactamente para eso.

Tercer precio: $0.06 de entrada y $0.20 de salida por millón, con un descuento de caché del 17% y $0.09 por tarea de indexación, es aproximadamente la mitad de los $0.21 de Claude Haiku 5.5. Ambos modelos son baratos; Nemotron es más barato.

Donde gana Claude Haiku 5.5, es decir, en todas las dimensiones que requieren una respuesta

Seguimiento de instrucciones, porque se ha entrenado para ello. Capacidad independiente, en Index 43 frente a 13 — una brecha de treinta puntos en una tabla que puntuó a ambas, que es la mayor brecha de este tipo en este conjunto de comparaciones. Entrada de imágenes, que Nemotron no acepta en absoluto. Salida máxima de 128.000 tokens frente a una cifra no publicada, con una ruta beta de 300.000 tokens en Batch. Y el dial de esfuerzo, que te permite recuperar el coste reduciendo el esfuerzo de razonamiento en lugar de reconstruir el modelo.

La advertencia sobre la verbosidad corta por ambos lados aquí. En la suite de Artificial Analysis, Claude Haiku 5.5 emite alrededor de 440 millones de tokens de salida frente a una mediana de aproximadamente 100 millones: piensa muchísimo. Nemotron emite unos 120 millones, lo que esa misma fuente describe como algo verboso para su tamaño. El costo por tarea de Haiku 5.5 es, no obstante, de $0.21 frente a los $0.09 de Nemotron, así que incluso el modelo charlatán no es el caro. Lo que eso te dice es que los precios por token engañan en ambas direcciones, y el número por tarea es el que hay que usar para presupuestar.

Autoalojamiento frente a un único endpoint

Nemotron 3.5 Lightning 30B A3B Base se distribuye como pesos abiertos y lo sirven varios proveedores de inferencia; NVIDIA también publica sus hermanos ajustados. Claude Haiku 5.5 está disponible a través de la API de Anthropic y, desde ahí, dondequiera que se revendan los modelos de Anthropic. Ninguno de los dos está en el catálogo de OrcaRouter, y no vamos a fingir lo contrario: lo que enrutamos de este vecindario es anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 y anthropic/claude-fable-5.1, el nivel superior al tema de este artículo.

Las dos vías que describe esta comparación tienen una infraestructura genuinamente distinta, y vale la pena nombrarlas. La vía autoalojada implica una GPU, un framework de servicio, una decisión de cuantización y una rotación de operaciones. La vía alojada implica una clave y una cadena de modelo. OrcaRouter existe para la segunda vía: una API para más de 200 modelos, una clave y una factura, el precio de lista del proveedor transferido con un 0 % de margen, de modo que un recorte de precios de un proveedor esté activo el mismo día, con conmutación por error automática por debajo. No es una vía hacia un checkpoint base de 30B, y comprar un equipo de clase DGX no es una vía hacia un modelo pequeño alojado.

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

¿Quién debería elegir cuál?

Si tu tarea está bien definida, tus datos de entrenamiento son lo bastante grandes como para importar y tu tráfico no puede salir de tu propia infraestructura, Nemotron 3.5 Lightning 30B A3B Base es el objeto más interesante: el más rápido de 142 en velocidad de salida, la mitad del precio por token y tuyo para modificarlo. Presupuesta la ejecución del ajuste fino y el coste de servicio antes de contar los ahorros, porque la tarifa de entrada de $0.06 asume que alguien ya ha hecho el trabajo que convierte un checkpoint en un asistente.

Si quieres enviar un prompt y obtener una respuesta esta tarde, Claude Haiku 5.5 es el que lo hace — 43 en el índice independiente frente a 13, entrada de imágenes, un límite de salida de 128.000 tokens y un precio que es realmente bajo. La comparación solo parece cercana en una hoja de precios. Deja de parecer cercana en el momento en que la tarea es responder una pregunta en lugar de continuar un documento.

A capture of the Artificial Analysis page for Nemotron 3.5 Lightning showing its Intelligence Index of 13 and rank of 29 of 142, the $0.06 per-million input and $0.20 output pricing, the $0.09 cost per index task, the 298.9 tokens-per-second output speed ranked first of 142, the 0.54-second time to first token, the 1M-token context window, text-only input and open weights.