Clasificados según el tráfico de producción real de OrcaRouter y los votos de la comunidad en Battle Mode, no según benchmarks declarados por los proveedores.
Actualizado el 2026-09-235 fuentes de evidenciaModelos nuevos listados en 48 h
Medido con tráfico real
100.0%
Mayor tasa de éxito (7 d)
MiniMax: MiniMax M2.5
156 ms
Latencia p50 más rápida
Orca: OrcaVerify Text 1.0 (Free)
80.1%
Mayor tasa de victoria de la comunidad
Qwen3.7 Max (2026-05-20)
Clasificación consolidada
Un ranking combinado por modelo — votos de LMArena, benchmarks independientes, adopción del ecosistema y evidencia de producción de OrcaRouter, con pesos públicos fijos. Los modelos nuevos entran desde el primer día a partir de evidencia externa.
PuestoPosición por puntuación compuesta en este segmento.
ModeloClic para la página completa del modelo: precios, specs, rutas de proveedor.
Puntuación compuestaPuntuación combinada 0–100: preferencia humana 40 %, benchmarks independientes 30 %, evidencia de producción OrcaRouter 20 %, adopción 10 %.
FiabilidadTasa de éxito de 7 días y latencia mediana (p50), medidas en el gateway de OrcaRouter.
$/1M mixtoPromedio del precio de entrada/salida por 1M tokens; pasa el cursor para el desglose exacto.
VelocidadRendimiento de salida en tokens por segundo sobre el tráfico de la pasarela de OrcaRouter (ventana de 7 días): total de tokens generados dividido entre el tiempo total de generación. Las barras son relativas al modelo más rápido.
ImpulsoBuzz de la comunidad y movimiento de la puntuación — solo contexto, nunca un factor del ranking.
EvidenciaLas señales crudas tras la mezcla — pasa el cursor por un chip para ver qué mide.
AA 66.0Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).Win 58.7%Tasa de victorias en Blind Battle de OrcaRouter — votos ciegos de nuestra comunidad.
AA 39.5Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 13.5%Cuota de tokens de OpenRouter — adopción real del ecosistema.
AA 52.7Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 1.4%Cuota de tokens de OpenRouter — adopción real del ecosistema.
AA 57.6Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 0.0%Cuota de tokens de OpenRouter — adopción real del ecosistema.
AA 50.8Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 0.9%Cuota de tokens de OpenRouter — adopción real del ecosistema.
AA 53.4Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 0.4%Cuota de tokens de OpenRouter — adopción real del ecosistema.
AA 44.8Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 2.4%Cuota de tokens de OpenRouter — adopción real del ecosistema.
AA 37.3Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 6.6%Cuota de tokens de OpenRouter — adopción real del ecosistema.
Arena 1472Elo comunitario de LMArena — votos humanos a ciegas en la arena de texto (CC-BY-4.0).AA 41.8Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 13.9%Cuota de tokens de OpenRouter — adopción real del ecosistema.
AA 47.0Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 1.4%Cuota de tokens de OpenRouter — adopción real del ecosistema.
Tasas de victoria por pares en Battle Mode: con qué frecuencia cada modelo gana a cada rival cara a cara.
Benchmarks: inteligencia frente a precio
Puntuaciones de inteligencia independientes representadas frente al precio de entrada. La línea discontinua es la frontera de Pareto precio/inteligencia.
Duelo a ciegas
Dos respuestas anónimas, un voto. Tus batallas alimentan el 20 % de evidencia de producción del rango consolidado.
⚔️ Duelo a ciegas
Dos modelos anónimos responden al mismo prompt. Lee ambos, vota por el ganador y luego descubre quién escribió qué: tu voto alimenta la clasificación de arriba.
Metodología — cómo funciona esta clasificación
Cada número de esta página está medido, nunca autoinformado. Este es el método completo detrás del ranking combinado — las mismas reglas para cada modelo, todos los días.
Una puntuación combinada, pesos públicos fijos
Cada modelo recibe una puntuación compuesta de cuatro familias de evidencia independientes: preferencia humana a ciegas 40 %, benchmarks independientes 30 %, evidencia de producción de OrcaRouter 20 % y adopción del ecosistema 10 %. Los pesos son fijos y públicos — sin ajustes editoriales, sin puestos pagados, sin envíos de proveedores.
Qué alimenta cada familia
La preferencia humana proviene del Elo comunitario de LMArena — votos ciegos por pares en las arenas de texto y visión (CC-BY-4.0). Los benchmarks independientes combinan Artificial Analysis (Intelligence Index más programación, matemáticas, GPQA Diamond y τ²-Bench) con SWE-bench Verified, la proporción de issues reales de GitHub resueltos. La evidencia de producción son las tasas de victoria en Blind Battle de OrcaRouter. La adopción usa la cuota de tokens publicada por OpenRouter. La tasa de éxito, la latencia y el rendimiento se muestran junto a cada modelo como contexto: nunca influyen en el ranking.
Cómo las puntuaciones se vuelven comparables
Las fuentes puntúan en escalas distintas (Elo, índices 0–100, % resuelto), así que cada señal se estandariza contra el tablero actual y se proyecta a 0–100: 50 es la media del tablero y cada 15 puntos equivalen a una desviación estándar, con topes en los extremos. Un modelo necesita al menos dos familias de evidencia independientes para clasificar, y el tablero lista el top 25 por puntuación compuesta.
Tableros por caso de uso
Los tableros de texto, programación, visión, matemáticas, razonamiento y agentes recalculan la misma mezcla con señales propias del segmento — programación cambia a los benchmarks de código y SWE-bench Verified, visión usa la arena de visión de LMArena — y las Blind Battles solo emparejan modelos del mismo segmento.
Frescura y juego limpio
Los feeds externos se actualizan a diario y la telemetría propia es en vivo; los modelos nuevos entran con evidencia externa en las 48 horas posteriores a su lanzamiento. No se usan cifras autoinformadas de proveedores en ningún punto, el buzz comunitario se muestra solo como contexto y nunca alimenta un puesto, y cada fuente externa está acreditada bajo el tablero.
Preguntas frecuentes
¿Cómo se calcula la clasificación de modelos de IA?
Cada modelo recibe una puntuación combinada de cuatro familias de evidencia — preferencia humana a ciegas (LMArena), benchmarks independientes (Artificial Analysis, SWE-bench), fiabilidad de producción de OrcaRouter y adopción del ecosistema (OpenRouter) — con pesos públicos fijos de 40 / 30 / 20 / 10.
¿Por qué un modelo recién lanzado ya tiene rango?
Los modelos nuevos entran al ranking a partir de evidencia externa dentro de las 48 horas posteriores a su lanzamiento. El puesto se consolida a medida que se acumulan batallas comunitarias y tráfico de producción.
¿Con qué frecuencia se actualiza la clasificación?
Las fuentes externas se refrescan a diario y la telemetría de OrcaRouter es en vivo; la fecha de actualización aparece en la cabecera.
¿Por qué falta un modelo?
Un modelo necesita al menos dos fuentes de evidencia independientes para clasificarse, y el tablero muestra el top 25 por puntuación compuesta; los modelos con evidencia insuficiente permanecen fuera hasta que otra fuente los cubra.
¿Se clasifican por separado los casos de uso?
Sí — los botones sobre la tabla consolidada alternan entre los rankings de texto, programación, visión, matemáticas, razonamiento y agentes, y las batallas solo emparejan modelos comparables.
¿Cuándo se consolida el puesto de un modelo nuevo?
Cuando un modelo reúne tres familias de evidencia, incluidas las batallas y el tráfico propios de OrcaRouter, su puesto se basa en la mezcla completa y no solo en evidencia externa.
¿De dónde salen los datos?
LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench y OpenRouter, más la telemetría de producción de OrcaRouter — todo atribuido bajo el tablero.
¿Pueden los proveedores manipular la clasificación?
Difícil: pesos públicos, sin cifras autodeclaradas, y las batallas ciegas más el tráfico real anclan cada puntuación.
¿Puedo exportar o insertar estos datos?
Sí — exportación JSON/CSV, insignia de rango insertable y feed RSS de cambios, gratis con atribución. Enlaces en el pie de página.