
GPT-6.7 y la pregunta de "Bob": ¿El buque insignia inédito de OpenAI realmente funcionará 2 veces más lento?
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
El 15 de agosto, una publicación en X de la cuenta @Yuchenj_UW condensó un rumor en una sola frase: «Bob, el rey de los kernels de GPU, ¿dejó la empresa? GPT-6.7 correrá 2x más lento…». Detrás de ese signo de interrogación se esconden dos afirmaciones: que el ingeniero más hermético de la empresa se ha marchado, y que su salida reduce a la mitad la velocidad de servicio de GPT-6.7, el buque insignia no lanzado de la empresa (rebautizado como GPT-6-7 en octubre pasado). Ninguna de las dos afirmaciones está verificada. Pero la publicación llega en un momento en que el próximo modelo de la empresa ya es una cuestión de cuándo, no si: el nombre de la familia Astra llegó el 1 de agosto, una revisión de seguridad lo puso en pausa el 7 de agosto, y GPT-5.6 Sol — el actual buque insignia, activo en OrcaRouter — es el único punto de referencia concreto que la próxima generación debe superar. Esto es lo que realmente se sabe a día de hoy.
Una cosa de entrada: nadie fuera de OpenAI ha ejecutado GPT-6.7. Cualquier afirmación sobre la rapidez con que servirá tokens es una extrapolación, incluida la cifra de "2x más lento". Lo que sigue separa los hechos verificados (el cambio de nombre, el cronograma de lanzamiento, las salidas que están en el registro) de la leyenda (Bob, el kernel y el número). Todo el material de rumores está etiquetado como tal.
Quién es "Bob", y por qué un solo ingeniero se convirtió en una leyenda
"Bob" es el apodo que los empleados de OpenAI usan para un ingeniero cuyo nombre la empresa nunca ha confirmado. Los reportajes de prensa de septiembre de 2025 —entre ellos QbitAI, The Paper e itbear, que citan a exempleados y actuales empleados de OpenAI— describen a un investigador reservado que escribe en solitario los kernels de CUDA utilizados para la inferencia, el código de bajo nivel para GPU que convierte las matemáticas de los transformers en tokens. Su kernel de atención, llamado el "kernel Bob" dentro de OpenAI, se ejecuta, según los informes, billones de veces al día en cientos de miles de GPU, con la precisión que ello exige: un fallo obligaría a revertir los checkpoints y a emprender un ciclo de reentrenamiento.
La leyenda es consistente entre los distintos relatos. Exempleados afirman que Bob resolvió en minutos un problema de rendimiento con el que sus colegas habían estado lidiando durante una semana. El Slack interno de OpenAI tiene un emoji de «magia de Bob». Las estimaciones de la industria citadas en el mismo informe sitúan el número de personas vivas capaces de escribir kernels CUDA de entrenamiento de alto rendimiento en menos de un centenar — razón por la cual una dependencia de una sola persona de este tipo se considera un riesgo real, y no algo meramente deseable.
En cuanto a la identidad, OpenAI nunca ha dicho quién es Bob. La hipótesis principal, repetida en la misma cobertura de prensa, es Scott Gray — un graduado en física y ciencias de la computación que se unió a OpenAI en 2016, fue autor principal de la publicación de blog de OpenAI de 2017 «Block-sparse GPU kernels», y más tarde coescribió el informe técnico de GPT-4 y el artículo sobre las leyes de escalado, con una bibliografía de 51 artículos y más de 80 000 citas. El encaje es circunstancial pero ampliamente repetido; es una inferencia, no una confirmación.
¿Bob realmente se fue?
El tuit es una pregunta, no una afirmación. Pero la salida a la que apunta tiene un rastro documental. Un resumen sobre la rotación de liderazgo publicado el 15 de agosto de 2026 sitúa a Scott Gray —descrito como un "ingeniero de sistemas GPU de larga trayectoria" que se incorporó en 2016 y ayudó a construir la infraestructura detrás de los transformers dispersos, las leyes de escalado y GPT-3— entre al menos doce altos cargos que abandonaron OpenAI en 2026. La misma lista menciona a la directora de ingresos Denise Dresser, al exdirector de operaciones Brad Lightcap, al CEO de aplicaciones Fidji Simo, al responsable de Sora Bill Peebles y a los jefes de seguridad, ética, marketing y hardware. Se trata de un informe secundario, no de una confirmación oficial, y no ofrece fecha de salida para Gray.
El contexto más amplio hace que el rumor sea menos sorprendente. Los informes de esa misma semana enmarcan la rotación como una reestructuración previa a la salida a bolsa: el cofundador Greg Brockman está atrayendo hacia sí la autoridad operativa antes de una prevista oferta pública, y CNBC informó de la salida del CRO el 13 de agosto. Y "Bob" ha sido un objetivo de contratación conocido desde hace un año: informes de septiembre de 2025 señalaban que Mark Zuckerberg, de Meta, había convertido "¿quién es Bob?" en un punto fijo en las reuniones de contratación. La guerra de talento en torno a este conjunto de habilidades específico es real, lo que en parte explica que la filtración resulte creíble.
Aun así, la cadena de afirmaciones tiene dos eslabones no verificados: que Scott Gray sea Bob, y que la lista del resumen sea la misma salida a la que se refiere el tuit. Es totalmente posible que el tuit esté repitiendo un rumor anterior a cualquier salida real. Esta sección es el resumen honesto: oficialmente, un ingeniero sénior de GPU llamado Scott Gray aparece en una lista de salidas de 2026; extraoficialmente, esa persona puede o no ser el Bob al que se refiere el tuit.
Por qué «2x más lento» importaría — y por qué probablemente no sea tan simple
Los kernels determinan los dos números que deciden la economía de un modelo: tokens por segundo y costo por token. Si GPT-6.7 se lanzara con kernels de inferencia la mitad de eficientes que la hipotética versión «optimizada por Bob», el mismo hardware serviría la mitad de los tokens y la misma solicitud tardaría el doble, con un costo marginal aproximadamente el doble. Para un desarrollador que enruta tráfico de producción, eso supone un impacto de 2x en latencia y 2x en costo en el modelo insignia, exactamente el tipo de cifra que cambia la elección de un modelo. Por eso el rumor tiene sustancia.
Ahora las razones para desconfiar de ello:
• El "2x" no tiene una base declarada. Es un número en una publicación — un experimento mental, no una medición, y la imagen enlazada tampoco incluye una.
• Los kernels son código, y el código sobrevive a sus autores. El stack de servicio que Bob (o cualquiera) escribió para modelos anteriores no desaparece cuando una persona se va; el siguiente modelo hereda la mayor parte de él.
La organización de infraestructura de OpenAI es grande, y la leyenda de que "una sola persona escribe todo" es casi con certeza una simplificación. El riesgo de persona clave es real, pero rara vez binario.
• Incluso una pérdida real de eficiencia no cambiaría la capacidad. Cambia el costo y la latencia — doloroso, pero un proveedor puede absorberla parcialmente o ajustar el precio, y OpenAI ya ha lanzado una función de velocidad (Ultrafast, hasta 14 veces más rápida en el buque insignia actual) dirigida exactamente a este tipo de presión sobre el costo de servir.
La versión más fuerte de la afirmación es la estadística de menos de cien. Si la persona que escribió los núcleos de servicio del buque insignia ya no está, el reemplazo no es una contratación por número de cabeza — es una rampa de varios años. Eso es un riesgo legítimo para la economía de servicio de OpenAI. Pero es un riesgo sobre el equipo, no un hecho medido sobre un modelo que aún no ha sido lanzado.
Lo que realmente sabemos sobre GPT-6.7
El modelo al que se refiere el rumor tiene un rastro público más largo de lo que sugiere el tuit, y la mayor parte es reciente:
• 31 oct 2025 — Sam Altman anunció en X que "GPT-6" pasaría a llamarse "GPT-6-7", interpretado ampliamente como un guiño a la jerga Gen-Alpha "6-7". Que "GPT-6.7" y "GPT-6-7" sean estrictamente lo mismo no es oficial; el tuit los trata como intercambiables, y también la mayoría de la cobertura.
• Abril de 2026 — Informes de que el preentrenamiento de GPT-6 estaba completo, con un lanzamiento rumoreado alrededor del 14 de abril. Esa fecha pasó sin un lanzamiento.
• Agosto de 2026 — Las filtraciones indicaban que el lanzamiento se adelantó a principios de agosto, y que OpenAI se saltaría las versiones GPT-5.7 a GPT-5.9. Sin verificar.
• 1 ago 2026 — OpenAI anunció "Astra" como el nombre de su próxima familia de modelos, a través de un informe de investigación que afirma haber resuelto diez problemas matemáticos abiertos. No se confirma si Astra se lanzará bajo el nombre de GPT-6.
• 7 de agosto de 2026 — OpenAI pausó el desarrollo de Astra y retrasó su lanzamiento después de que una revisión interna de seguridad señalara un riesgo de ciberseguridad "crítico" — el primer modelo en activar ese nivel. Altman dijo que el lanzamiento amplio "necesita un poco más de tiempo."
• Mercados de predicción — A mediados de agosto, los traders situaban la probabilidad de un lanzamiento de GPT-6 antes del 30 de septiembre en aproximadamente un 62%, y antes del 31 de diciembre en alrededor de un 90%.
• Especificaciones rumoreadas: un contexto de alrededor de 2 millones de tokens, un rendimiento aproximadamente un 40 % mejor que la generación actual, memoria personalizada y arquitectura multimodal nativa bajo el nombre en clave «Symphony». Todo sin verificar.
Así que el modelo detrás de "2x slower" no se ha lanzado, no tiene fecha de lanzamiento confirmada y es objeto de una revisión de seguridad en curso. Una cifra de velocidad de servicio asociada a él es especulativa por partida doble — una por la fecha, otra por la velocidad.

El único marcador que es honesto hoy
Debido a que GPT-6.7 aún no existe, un marcador solo puede contrastar el rumor con lo que está realmente en vivo:
• GPT-6.7 (no lanzado) — estado: no enviado; lanzamiento: rumoreado para otoño de 2026; contexto: ~2 millones de tokens (rumoreado); velocidad: "¿2 veces más lento?" sin verificar; precio: n/d; enrutable: aún no.
• GPT-5.6 Sol (en vivo) — estado: disponible; contexto: 1,05M tokens; salida máxima: 128K; velocidad: ~290 tok/s observada en las estadísticas de 7 días de OrcaRouter; precio: $5,00 de entrada / $30,00 de salida por millón de tokens en el nivel de entrada estándar; enrutable: sí, al precio de lista del proveedor.
La brecha interesante es la columna de precios. El buque insignia actual de OpenAI cuesta $5/$30 por millón de tokens a través de OrcaRouter, y la tarifa de traspaso es el precio de lista del propio proveedor con cero margen — así que, cualquiera que sea el precio que OpenAI le ponga a GPT-6.7, el número de nuestro lado se mueve el mismo día en que se lanza, sin renegociación. Esa es la parte útil del marcador para cualquiera que esté planificando en torno al próximo modelo.

Cómo tratar una fuga como esta.
El patrón es conocido: un modelo sin lanzar, una cifra llamativa, una persona con nombre. Cada elemento es plausible y ninguno está verificado. La respuesta correcta no es ignorar el rumor ni apostar por él — es estructurar la decisión para no tener que elegir.
Ese es el caso para el enrutamiento. Cuando GPT-6.7 se lance, la forma de evaluar una afirmación de ser 2 veces más lento sin apostar una ruta de producción en ello es ponerlo detrás del mismo endpoint que ya usas: una clave de API, conmutación automática a GPT-5.6 Sol en el momento en que el nuevo modelo rinda por debajo de lo esperado, y tráfico real decidiendo si el rumor era cierto. La afirmación se convierte entonces en una medición en lugar de un tuit. Si la lista de precios de OpenAI cambia con el nuevo lanzamiento, la tarifa de paso se actualiza el mismo día — OrcaRouter transmite los precios de lista de los proveedores sin margen adicional, por lo que un recorte (o aumento) de precio de un proveedor se refleja aquí de inmediato, sin renegociación.
Mientras tanto, el buque insignia actual es la realidad concreta. GPT-5.6 Sol está disponible en OrcaRouter hoy a $5/$30 por millón de tokens, con el contexto de 1.05M tokens y ~290 tok/s que muestra el marcador. El modo Ultrafast, anunciado el 13 de agosto — hasta 14 veces más rápido, aproximadamente 750 tokens por segundo en la infraestructura de Cerebras — se aplica a ese modelo, no a GPT-6.7, y es un recordatorio de que OpenAI puede atacar el costo de servicio con infraestructura tanto como con kernels.

Lo que estamos viendo ahora
• Que se confirme la salida de Bob. OpenAI no comenta quién es Bob; el evento registrado más cercano es el nombre de Scott Gray en la lista de salidas de 2026. Si OpenAI o Gray lo confirman, el primer eslabón de la cadena se convierte en un hecho.
Si la cifra de "2 veces más lento" llega a tener una base. Si GPT-6.7 se lanza y aparecen mediciones de velocidad independientes, la cifra deja de ser un rumor —ya sea confirmada o descartada—. Hasta entonces, es solo un número en un post.
— Si la pausa de seguridad de Astra retrasa la fecha. Los mercados de predicción ya sacaron a GPT-6 de agosto; la designación de "crítico" y las pruebas gubernamentales que OpenAI dice que quiere son ambas fuentes naturales de más retrasos.
• Si el benchmark del kernel vuelve a ordenar. Si el equipo de servicio de OpenAI absorbe la pérdida — o la leyenda exagera la participación de una persona — todo el rumor pierde sentido, y la primera señal será el rendimiento de servicio del próximo modelo en relación con su predecesor.
La lectura honesta: «2x más lento» es una historia convincente y, hasta ahora, solo eso. La salida del mago del kernel es un dato real con un rastro documental real; el número de velocidad es un número en un tuit. Hasta que GPT-6.7 se lance, la posición defendible es planificar para ambos resultados: asumir que el rumor podría ser parcialmente cierto, y construir el enrutamiento para que un buque insignia más lento de lo esperado no te cueste nada probarlo. Ese es el punto completo de enrutar un modelo que no has conocido.
