
Vista previa de Pareto 26.10 de Unbiased: un cambio de contexto de 1M tras la misma cadena de modelo
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
La integración no cambia. El modelo que hay detrás, sí. El 1 de octubre de 2026, Unbiased movió su cadena de modelo — pareto — a Pareto 26.10 Preview, una nueva versión con una ventana de contexto cuatro veces más grande, un precio más bajo en el catálogo enrutado, y una hoja de benchmarks que, según admite el propio proveedor, es preliminar y no está publicada en su forma final. Si hoy llamas a Pareto por su nombre, estás llamando a 26.10 Preview, y el registro de cambios del proveedor lo dice en los términos más claros posibles: "Pareto 26.10 Preview es ahora la versión actual de Pareto… La cadena de modelo sigue siendo pareto."
Esa única línea es toda la historia para cualquiera que tenga Pareto en un stack. Este no es un segundo producto lanzado junto con el primero. Es el primer producto, reemplazado en su lugar, bajo un nombre que no cambió — lo que significa que la versión que obtienes la decide el calendario de lanzamientos, no algo en tu solicitud.
¿Qué cambió realmente el 1 de octubre?
Cuatro cosas se movieron, y no todas apuntan en la misma dirección.
• Ventana de contexto — 262,144 tokens en la versión Pareto de septiembre, ahora 1,048,576. La propia documentación de Unbiased nunca indica la cifra; el número proviene del listado técnico público del modelo, donde es el límite por solicitud sin que se ofrezca un nivel más pequeño.
• Precio, según el enrutamiento — el par que suele citarse para Pareto ha sido de $2.50 por millón de tokens de entrada y $7.50 por millón de salida, con la entrada en caché a $0.25. El listado de 26.10 Preview incluye $0.80, $3.20 y $0.03 respectivamente — aproximadamente un tercio de la tarifa de entrada y un poco más del 40% de la tarifa de salida.
• Puntuaciones de benchmark — publicadas por primera vez para esta versión, y preliminares según la propia designación del proveedor.
• La opción estable — 26.10 Preview es una versión preliminar. El texto del catálogo de Unbiased dice que "puede cambiar sin previo aviso" y remite a quien necesite un comportamiento predecible a la versión anterior.
Todo lo demás se mantuvo. La salida máxima sigue siendo 131.072 tokens. La entrada sigue siendo texto e imagen; la salida sigue siendo solo texto. Todavía no hay un identificador de Hugging Face en el listado, por lo que los pesos siguen cerrados. Y sigue habiendo exactamente un proveedor de servicio — Unbiased mismo — sin un segundo host dentro del listado.

El precio es la parte que vale la pena leer dos veces.
En la propia plataforma de Unbiased, la tarjeta de tarifas no se movió. Tanto la ficha del modelo como la página de precios siguen indicando $2.50 por millón de entrada, $0.25 en caché, $7.50 de salida —las mismas tres cifras que traía el lanzamiento de septiembre— y, como la cadena del modelo siguió siendo pareto, un cliente de la API del proveedor está pagando esas tarifas por 26.10 Preview. Las cifras más bajas son las del listado del catálogo enrutado, y la diferencia entre ambas es exactamente el tipo de cosa que decide una migración.
Existen dos lecturas posibles y el proveedor no ha dicho cuál es la verdadera. O bien 26.10 Preview se ofrece realmente a un precio más bajo a través de esa vía como impulso introductorio, o bien el listado representa un acuerdo comercial distinto del de la plataforma directa. Unbiased no publica ninguna fecha de finalización de la promoción, y un precio fijado el día del lanzamiento no constituye un compromiso.
Esta es la única parte de la historia cuya forma cambia un router. OrcaRouter traslada el precio de lista del proveedor directamente, con un 0% de margen, de modo que una rebaja de precio del proveedor está activa en nuestro lado el mismo día en que se produce, en lugar de esperar a un ciclo de contrato — y la conmutación por error automática significa que una versión preliminar que se comporte de forma distinta la semana que viene puede sustituirse sin cambiar el código. No ofrecemos Pareto 26.10 Preview de Unbiased, así que la versión honesta es esta: si quieres este modelo en concreto, llámalo a través de la propia API de Unbiased. El punto es solo que, en una versión preliminar, tanto el precio como la versión son variables, y ninguno de los dos debería fijarse en el código.
La hoja de referencia, con las etiquetas que traía
Unbiased publicó cuatro puntuaciones para 26.10 Preview, cada una emparejada con un coste medido por tarea, y cada una con una advertencia que el propio proveedor escribió. Léelas como ejecutadas por el proveedor y no reproducidas, porque eso es lo que son:
• DeepSWE v1.1 (codificación agéntica) — 69,9 %, a 0,24 $ por tarea
• Terminal-Bench 4.0 (uso agéntico de terminal) — 50,8 %, a 0,48 $ por tarea
• Humanity's Last Exam, solo texto (razonamiento experto) — 49,9 %, a 0,008 $ por tarea
• GPQA-Diamond (razonamiento científico) — 92,4 %, a 0,004 $ por tarea

El planteamiento del proveedor es que 26.10 Preview «iguala o establece la frontera de Pareto en los cuatro benchmarks». La hoja que publica junto con esa afirmación es más específica, y es mérito de Unbiased que se publique siquiera: en Terminal-Bench 4.0, GPT 6 Astra figura con 58 y Fable 5.1 con 56, ambos por encima del 50.8 de Pareto, y la propia sección del proveedor «donde otros modelos obtienen mejores puntuaciones» lo dice directamente. En DeepSWE v1.1, la versión se sitúa en un grupo —GLM-5.3 y Kimi K3 figuran cada uno con 69.0 frente al 69.9 de Pareto—, lo que en la práctica es un empate y está dentro de cualquier margen de error que conlleve una sola ejecución.
Las cifras de la comparación conllevan una segunda advertencia que importa más que la primera: están transcritas de una comparación del 21 de septiembre y, en palabras del proveedor, "no están validadas de forma independiente", y se produjeron en una evaluación separada de modelos individuales, por lo que no deberían emparejarse con las cifras de costo por tarea de Pareto como si ambas procedieran del mismo banco de pruebas. El proveedor lo dice en los detalles de la evaluación. Un lector que se salte esa línea sobreinterpretará el gráfico.
Lo que nada de esto es: independiente. Artificial Analysis, la página que la mayoría de los equipos consultan antes de confiar en un nuevo nombre en una lista de precios, no tiene ninguna página para Pareto. Todos los números anteriores fueron producidos por la empresa que vende el modelo. Lo único que lo suaviza es que el arnés de evaluación es público — el proveedor publica una suite reproducible de enfrentamiento directo que cualquiera puede apuntar a un endpoint — lo que convierte "confía en nuestra puntuación" en "vuelve a ejecutar nuestra puntuación". Eso es una oferta real y no es lo mismo que un número verificado. Nadie ha publicado aún la reejecución.
Qué significa "preview" en el contrato
La palabra hace aquí más trabajo del que hacen las notas de la versión. La documentación propia de Unbiased describe el acceso actual como acceso de evaluación bajo sus términos, y afirma que el uso comercial o de producción requiere un acuerdo escrito por separado. Las cuentas nuevas se revisan a mano antes de emitir una clave de API. La API es compatible con OpenAI y Anthropic —URL base, clave, cadena de modelo, sin reescritura—, pero la superficie documentada es solo chat completions y messages, con lagunas conocidas que el proveedor enumera abiertamente: GET /v1/models no está implementado y no se rechazan los identificadores de modelo desconocidos, así que quienes llaman deben enviar pareto explícitamente en lugar de descubrir qué está disponible.
Junta la etiqueta de vista previa y el contrato de beta privada y el consejo operativo se escribe solo. Este es un modelo para evaluar con tu propia carga de trabajo detrás de una capa de enrutamiento, no uno para poner delante del tráfico de ingresos y olvidarte de él. El mecanismo para eso es poco glamuroso: una cadena de respaldo configurada una vez, de modo que una versión que cambia bajo tus pies a mitad de semana se convierta en un cambio de configuración en lugar de un incidente. Unbiased pasó septiembre corrigiendo exactamente este tipo de problema de su lado — una entrada del registro de cambios del 16 de septiembre registra que aproximadamente el 13% de las solicitudes largas sin streaming alcanzaban un tiempo de espera de 120 segundos, y el límite máximo de la puerta de enlace se elevó a 300 segundos. Eso es un proveedor hablando con franqueza de una imperfección. También es un recordatorio de que el perfil operativo de una vista previa todavía se está escribiendo.

Qué tener en cuenta antes de comprometerte
Tres cosas específicas resolverían las preguntas abiertas, y cada una es verificable.
El primero es una puntuación independiente. Hasta que un tercero ejecute 26.10 Preview en un arnés publicado, el 92,4 en GPQA-Diamond y el 50,8 en Terminal-Bench son afirmaciones del proveedor sobre trabajo del proveedor: lo bastante buenas para decidir si probar, pero no lo bastante buenas para decidir si migrar.
El segundo es lo que la vista previa hace con el precio. Si el listado enrutado se mantiene en $0.80 y $3.20 mientras que la plataforma propia del proveedor mantiene $2.50 y $7.50, la diferencia es una decisión de canal que vale la pena entender antes de construir un modelo de costos sobre cualquiera de las dos cifras.
El tercero es lo que "puede cambiar sin previo aviso" viene a significar en la práctica. Una vista previa que se revisa dos veces en un mes es un instrumento distinto de una que se congela y se rebautiza al final del trimestre, y el registro de cambios es donde eso aparecerá primero.
Nada de esto argumenta en contra de probarlo. Un modelo multimodal de 1 M de tokens que reporta puntuaciones cercanas a la frontera a $0,24 por tarea merece que le dediques una tarde de trabajo real con tus propios prompts, y esa evaluación cuesta menos que la discusión al respecto. Argumenta en contra de asumir que el modelo que evalúas esta semana es el modelo que tendrás la próxima semana —lo cual, para un lanzamiento que el propio proveedor llama vista previa, es la única suposición que debe ser correcta.
Una versión preliminar es exactamente el caso para el que se creó la conmutación por error automática: la conmutación por error automática convierte un modelo que cambia bajo tus pies a mitad de semana en un cambio de configuración en lugar de una interrupción.
