
RWKV-7 (Goose): Dentro de la Pull Request que Finalmente lo Cargaría en Transformers
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
El modelo RWKV más descargado en Hugging Face el mes pasado no fue RWKV-7 (Goose), la arquitectura que el proyecto ha lanzado desde marzo de 2025, y tampoco fue RWKV7-G1, la serie de razonamiento entrenada sobre ella. Fue RWKV/rwkv-4-169m-pile: un checkpoint RWKV-4 de 169 millones de parámetros de mayo de 2023, con 8.824 descargas en los 30 días hasta el 5 de agosto de 2026, frente a 215 para el lanzamiento RWKV-7 Goose World-3 de 1.5B y 316 para el de 2.9B. El modelo de 2023 no es mejor. Es el que se carga con una simple llamada a from_pretrained y nada más instalado.
El 4 de agosto de 2026, un colaborador llamado Hakureirm abrió la pull request #47780 contra huggingface/transformers, titulada "Add RWKV-7 (Goose)". Al 5 de agosto sigue abierta, sin revisar y sin fusionar, y es el segundo intento — una propuesta anterior, la #46984, fue rechazada. Nada ha aterrizado, y esta pieza no debe leerse como un anuncio de lanzamiento. Pero el diff es público, y aborda la cuestión más aburrida y a la vez más trascendental que se interpone entre el linaje de LLM sin atención más longevo y las pilas que la mayoría de los equipos usan realmente: un cargador.
Lo que sigue separa tres tipos de afirmaciones, porque la cobertura de RWKV suele mezclarlas. Está lo que se puede verificar en el pull request y en el Hub, que puedes comprobar tú mismo. Está lo que el proyecto RWKV reporta sobre sus propios modelos en sus propias evaluaciones. Y está el gran conjunto de preguntas que nadie ha respondido públicamente, que es donde reside la mayor parte del riesgo interesante.
¿Qué hay realmente en el pull request?

Los hechos mecánicos, leídos desde la página de PR y la API de GitHub el 5 de agosto de 2026:
• Alcance — tres commits, 12 archivos modificados, 4.423 líneas añadidas y cero eliminadas, de la rama add-rwkv7-upstream a huggingface:main. Etiquetado como "Nuevo modelo". Sin asignado, sin hito.
• Qué añade — RWKV-7 como dos clases públicas, Rwkv7Model y Rwkv7ForCausalLM, junto con un Rwkv7Cache construido sobre la LinearAttentionLayer de la librería. El dtype del estado WKV se puede configurar independientemente del dtype del modelo, lo cual importa porque el estado recurrente es donde se acumula la deriva numérica en esta familia.
• Cómo funciona — PyTorch portátil sin dependencias de runtime de terceros. El prefill utiliza una forma de recurrencia paralela por fragmentos; el decode ejecuta una ruta secuencial de un solo token. Los nombres de los parámetros siguen la implementación de referencia upstream de RWKV en lugar de ser renombrados para parecer propios de un Transformer.
• Postura de pruebas — más allá de los mixins de modelo estándar, una prueba de integración que coincide con el runtime propio de BlinkDL token por token, más una implementación de referencia en NumPy que no comparte código con el archivo de modelado. El bot de resumen de CI del repositorio informa que la última ejecución fue exitosa: 16 trabajos, 179 151 pruebas, cero fallos, 16 horas y 9 minutos de cómputo.
• En qué punto está — se ha solicitado revisión a ArthurZucker y Rocketknight1; la página indica que se requiere al menos una revisión aprobatoria para fusionar, y ninguno de los dos la ha proporcionado. La API de GitHub todavía describía el estado de fusión como "unstable" cuando la consultamos, y un bot orientado a mantenedores ha pedido que se ejecuten las suites de pruebas lentas (auto y rwkv7) antes de la fusión. En otras palabras: verde en la CI rápida, pero aún no bendecido por un humano.
La parte más interesante de la descripción es la concesión. El intento anterior, #46984, fue rechazado porque los checkpoints publicados de RWKV-7 no seguían las convenciones de Transformers, y el propio autor plantea que "esa objeción era correcta". El problema, expuesto en el PR, es que los pesos de RWKV-7 en el Hub vienen en dos formas no utilizables por la librería:
• Los repositorios PTH — archivos .pth sin procesar, no safetensors. Una implementación de biblioteca no puede cargarlos, y los archivos pickle de PyTorch son exactamente lo que una revisión de seguridad en una gran empresa rechazará.
• Los repositorios de HF — estos sí incluyen model.safetensors, pero cada uno también incluye un modeling_rwkv7.py y un auto_map, por lo que cargarlos requiere trust_remote_code. Eso es ejecución remota de código como condición para la inferencia, por lo que muchas listas de verificación empresariales se detienen ahí.
Entonces, el PR hace dos trabajos a la vez. Añade un archivo de modelado y apunta a un nuevo conjunto de conversiones hechas directamente desde los lanzamientos canónicos .pth de BlinkDL que siguen la disposición estándar — solo safetensors, sin pickle, sin código remoto, un config.json normal que incluye arquitecturas y model_type — que abarca de 0.1B a 7.2B. El más pequeño, Hakureirm/rwkv7-168m-pile-hf, tiene sus 399 tensores verificados como bit a bit idénticos contra el .pth fuente, en lugar de comprobarse solo por muestreo. Ese checkpoint es un modelo de Pile, por lo que su tokenizador es el tokenizador rápido GPT-NeoX-20B normal, en lugar del vocabulario RWKV World, por la misma razón por la que la página RWKV existente de la librería también documenta un checkpoint de Pile.
Por qué un checkpoint de 2023 supera en descargas a la arquitectura actual

Transformers está en la versión 5.14.1, publicada el 16 de julio de 2026. Si buscas RWKV en su documentación, obtienes exactamente una página de modelo, que describe «el modelo RWKV (versión 4)», aportado hace años, con RWKV/rwkv-4-169m-pile como ejemplo y un vocabulario predeterminado de 50 277 tokens. No hay páginas para RWKV-5, RWKV-6 ni RWKV-7. Tres generaciones de arquitectura se han lanzado desde que se escribió el soporte RWKV de la biblioteca, y ninguna de ellas está incluida.
Las cifras de descargas muestran lo que hizo el ecosistema al respecto: le dio la vuelta a la biblioteca. Ordenados por descargas en los últimos 30 días, los principales repositorios de RWKV-7 son los lanzamientos .pth sin procesar de BlinkDL (rwkv7-g1 con 8.288, rwkv-7-world con 4.489) y una gruesa capa de cuantizaciones GGUF de la comunidad del G1 de 13,3B — varios subidores independientes que mueven cada uno de mil a tres mil descargas al mes. Los espejos oficiales en formato transformers se sitúan dos órdenes de magnitud por debajo de los pesos sin procesar. El espejo flash-linear-attention del G1 de 2,9B alcanza las 1.843 descargas.
Ese patrón tiene una explicación sencilla. llama.cpp incorporó soporte para RWKV v7 el 17 de marzo de 2025 — un kernel GGML_OP_RWKV_WKV7 con backends de CPU, CUDA, SYCL, Vulkan y Metal — aproximadamente un día después de que se publicara el artículo. Si querías ejecutar RWKV-7 en tu propia máquina, la vía rápida era GGUF, y lo ha sido durante dieciséis meses. El camino que no existía era el que todo script de fine-tuning, todo adaptador PEFT, todo harness de evaluación y todo wrapper interno de servidores da por sentado: AutoModelForCausalLM.from_pretrained, sin flags.
Qué es realmente RWKV-7 (Goose)
RWKV-7 es una red neuronal recurrente, no un transformer con un kernel de atención más barato, y el nombre confunde constantemente a la gente. Transporta un estado de tamaño fijo a lo largo de la secuencia en lugar de una caché creciente de claves y valores pasados. Concretamente, frente a un modelo de atención estándar:
• La memoria a medida que crece el contexto — la caché KV de un transformador crece linealmente con el número de tokens en vuelo; RWKV-7 mantiene un estado cuyo tamaño lo fija la arquitectura, no la conversación. Ese es todo el argumento de eficiencia.
• Coste por token — la atención cuesta más por token a medida que el contexto se alarga; el coste de inferencia por token de RWKV-7 es constante, por eso sigue apareciendo en propuestas de edge y de streaming siempre activo.
• Forma de entrenamiento — a diferencia de una RNN clásica, la recurrencia es paralelizable sobre un bloque, por lo que el preentrenamiento no degenera en un proceso secuencial. Eso es lo que implementa la ruta de prefill paralelo por bloques del PR.
• Techo de contexto — no hay caché que desbordar, por lo que el proyecto promociona un contexto efectivamente ilimitado. Lo que un estado fijo no puede hacer es contener detalle ilimitado, lo cual es una limitación real, no una nota al pie.
La afirmación arquitectónica del artículo, publicado el 18 de marzo de 2025 por Bo Peng, Yu Zhang, Songlin Yang y Ruichong Zhang bajo el Proyecto RWKV en la LF AI & Data Foundation, es una regla delta generalizada con compuertas con valores vectoriales, tasas de aprendizaje en contexto y una regla relajada de reemplazo de valores, además de un MLP simplificado (la matriz de compuertas eliminada, el ancho de la capa oculta ampliado para compensar). El resultado teórico asociado es la mitad más provocadora: RWKV-7 puede realizar seguimiento de estados y reconocer todos los lenguajes regulares manteniéndose paralelizable en el entrenamiento, algo que, según los autores, supera lo que los transformers pueden lograr bajo las conjeturas de complejidad estándar.
Todo es Apache 2.0. La familia que puedes descargar incluye versiones de 0.1 B (12 capas, ancho 768), 0.4 B (24 / 1024), 1.5 B (24 / 2048), 2.9 B (32 / 2560), 7.2 B (32 / 4096) y 13.3 B (61 capas, ancho 4096), todas con un vocabulario World de 65 536 tokens y un tamaño de cabeza de 64. La serie base World se entrenó con un corpus multilingüe de 3,1 billones de tokens; la serie G1 "GooseOne" continúa ese entrenamiento en World v3.5, una mezcla ampliada de 5,16 billones de tokens con más novelas, texto web, matemáticas, código y datos de razonamiento. Los puntos de control G1 añaden un modo de razonamiento con etiqueta de pensamiento, llamadas a funciones JSON y completado de medio a partir de G1c. El nombre es realmente incómodo: G0 significa menos de una época, G1 significa más de una, y las letras de sufijo marcan revisiones de datos, con letras posteriores que traen mejores datos.
Los números, y de quién son los números.
Este es el estado honesto de la evidencia. La afirmación principal del benchmark — de que el modelo de 2.9B estableció un nuevo estado del arte en la categoría de 3B en tareas multilingües y igualó el estado del arte en inglés de 3B con drásticamente menos tokens de entrenamiento — es propia del artículo, publicado en marzo de 2025 y evaluado contra los modelos de 3B de ese período. Pasó por OpenReview, que es un escrutinio mayor que el que recibe una publicación de blog de un proveedor, y sigue siendo un resultado autoinformado sobre un conjunto de comparación de quince meses de antigüedad.
La otra medición pública del proyecto, UncheatableEval, es más interesante que una fila en la tabla de clasificación y apenas recibe cobertura. En lugar de calificar benchmarks de opción múltiple que se filtran en los conjuntos de entrenamiento, mide la tasa de compresión en datos que no existían cuando se entrenó el modelo: nuevos artículos de arXiv, repositorios recientes de GitHub, noticias recientes. Ese diseño hace que la contaminación sea mucho más difícil, y RWKV informa ser competitivo con transformers del mismo tamaño en esa evaluación. Sigue siendo una evaluación que el proyecto realiza sobre sí mismo.
Lo que no existe, hasta donde hemos podido averiguar, es una puntuación de índice independiente de terceros para cualquier checkpoint de RWKV-7 — ningún agregador neutral ha pasado el 7.2B o el 13.3B por el arnés de evaluación que utiliza con los modelos de frontera. Así que las comparaciones que puedas ver contra modelos como DeepSeek V4 Flash o Qwen3.8-Max son errores de categoría por partida doble: nadie ha ejecutado RWKV-7 en la misma evaluación, y una RNN densa de 13.3B no compite por el mismo trabajo que un sistema de frontera. La afirmación defendible es más acotada y más útil: de 1.5B a 13.3B, con memoria constante, en unos doce idiomas, con pesos permisivos.
Ejecutar RWKV-7 hoy, y lo que te cuesta

La página del Hub para RWKV/RWKV7-Goose-World3-1.5B-HF es una buena muestra de la fricción actual. Es un modelo BF16 de 1.52B parámetros con el tokenizador RWKV World, Apache 2.0, etiquetado como custom_code, que lista inglés, chino, japonés, coreano, francés, árabe, español y portugués. Sus instrucciones indican que instales flash-linear-attention y una versión reciente de transformers antes de cargarlo. Y en la barra lateral, donde un modelo alojado mostraría los proveedores, dice claramente: este modelo no está desplegado por ningún Inference Provider.
Así que tus opciones hoy son todas de autoservicio:
• flash-linear-attention más trust_remote_code — lo más cercano al uso normal del Hub, pero estás ejecutando código del repositorio e incorporando kernels de Triton, lo que te limita en hardware y en cualquier cosa que requiera una revisión de seguridad.
• GGUF vía llama.cpp — la ruta con mejor soporte en la práctica, incluso para la 13.3B, y la que, según las cifras de descargas, la gente realmente usa. Excelente para inferencia local, no es una vía para entrenamiento ni ajuste fino.
• El runtime propio del proyecto — el paquete pip de rwkv y el repositorio de referencia, los más cercanos a lo canónico, los más alejados de las herramientas que tu equipo ya tiene.
Ninguna de esas es una API a la que puedas llamar, y vale la pena ser directo sobre la implicación: RWKV-7 no está en OrcaRouter, porque no es un endpoint alojado en ningún lugar que podamos encontrar. Si quieres RWKV-7, ejecutas RWKV-7. Lo que podemos decir honestamente es dónde deja eso al resto de la pila. Evaluar una arquitectura no probada solo es barato si tu ruta de producción no depende del resultado, y la forma más barata de mantener eso cierto es no tener una integración por proveedor para nada más: una clave compatible con OpenAI entre más de 200 modelos, el precio de lista del proveedor transmitido directamente con un margen del 0% y conmutación automática por error cuando un proveedor se degrada. Entonces, un experimento de RWKV-7 autoalojado en las dos cargas de trabajo donde la memoria constante realmente compensa — un flujo de larga duración, un asistente en el dispositivo, un resumidor que nunca se detiene — es un experimento, no una migración. Esa es la forma que la mayoría de los equipos deberían querer aquí: un enrutamiento predeterminado y un modelo basado en estado que se gana su lugar en un trabajo específico.
¿Qué podría todavía impedir este aterrizaje?
Tómese en serio el precedente: una propuesta para añadir esta arquitectura exacta ya fue rechazada una vez, por razones que el autor acepta que eran válidas. La nueva está mejor argumentada y mejor probada, y sigue siendo un PR de la comunidad contra un repositorio que es deliberadamente conservador a la hora de admitir arquitecturas que luego mantendrá para siempre.
Las preguntas abiertas específicas que querríamos que se respondieran antes de dar esto por terminado:
• Revisión, no CI — las suites automatizadas están en verde; se ha pedido a dos mantenedores y ninguno ha aprobado. Transformers requiere una revisión aprobatoria, y las pruebas lentas no se han ejecutado.
• La velocidad de la ruta sin dependencias — PyTorch puro con decodificación secuencial de un solo token es portátil, y la portabilidad es el punto central, pero el PR no publica el rendimiento frente a los kernels de Triton en flash-linear-attention. Si la decodificación nativa es significativamente más lenta, la biblioteca se convierte en la ruta de compatibilidad mientras que el serving serio permanece en otro lugar.
• Qué checkpoints llegan — las conversiones conformes a la convención cubren de 0.1B a 7.2B. El G1 de 13.3B, que es el que la gente realmente quiere, no está en ese conjunto, y el ejemplo documentado es un modelo Pile con un tokenizador GPT-NeoX en lugar de un modelo de chat con vocabulario World. Un cargador fusionado sin un checkpoint insignia detrás cambia menos de lo que parece.
• El objetivo móvil — el proyecto no se queda quieto. El repositorio G1 de BlinkDL se actualizó la misma semana en que se abrió este PR, las cuantificaciones comunitarias han avanzado a revisiones de datos posteriores a G1c, y RWKV-8 «Heron» se ha presentado públicamente con un mecanismo de autómata de sufijos llamado ROSA. Heron no está publicado ni sometido a benchmarks; lo mencionamos solo porque una integración de biblioteca que llega tarde en la vida de una generación tiene una vida útil corta.
Cuatro preguntas que la ficha técnica no responde
¿Puedo usar RWKV-7 en Transformers ahora mismo, o no?
Ambas cosas, molestamente, y la distinción es toda la historia. Puedes cargar un checkpoint de RWKV-7 a través de la API de transformers hoy, si instalas flash-linear-attention y pasas trust_remote_code para que se ejecute el archivo de modelado del propio repositorio. Lo que no puedes hacer es cargarlo desde la propia biblioteca, que es lo que hace que funcione por defecto en las herramientas construidas sobre la biblioteca — scripts de entrenamiento y alineación, adaptadores, arneses de evaluación, rutas de exportación — y lo que hace que cumpla una política que prohíbe el código remoto. Eso segundo es para lo que sirve #47780.
¿La fusión hace que el modelo sea mejor?
Ni por un solo punto en ningún benchmark. Cambia la distribución, no la calidad — y para una arquitectura cuyo problema nunca ha sido la calidad, la distribución es la restricción vinculante. La comparación es la que aparece al principio de este artículo: un modelo de 169M de 2023 superando en descargas a los pesos de la generación actual en una proporción de cuarenta a uno, enteramente por la fuerza de cargar sin banderas.
Si no hay caché KV, ¿obtengo contexto ilimitado gratis?
Obtienes longitud de contexto ilimitada sin que la memoria se dispare, lo cual no es lo mismo que recuperación ilimitada. Un estado de tamaño fijo tiene una capacidad de información fija; dale un millón de tokens y no puede contener el equivalente a un millón de tokens en detalle recuperable. La atención con una caché completa puede hacerlo, a un costo que crece en todo el recorrido. Trata la historia de contexto largo de RWKV-7 como "transmite para siempre a bajo costo, comprime sobre la marcha", y prueba la recuperación específica que necesitas en lugar de confiar en la palabra infinito.
¿Vale la pena prestarle atención a 13.3B cuando los modelos de frontera tienen cientos de miles de millones?
Depende por completo de si la memoria constante tiene algún valor para ti. Si estás llamando a una API alojada y pagando por token, casi con seguridad no: la frontera está muy por delante en capacidad y no estás pagando directamente por la caché KV. Si estás desplegando inferencia en hardware que no controlas, o ejecutando un flujo persistente en el que una caché en crecimiento es lo que termina por matar el proceso, una arquitectura cuya huella de memoria no se mueve es una respuesta distinta a una pregunta distinta. Esas son las cargas de trabajo donde un RWKV-7 de 2.9B ha sido discretamente competitivo, y son donde más importaría un cargador nativo.
Lo que veríamos a continuación
Cuatro señales concretas, en orden aproximado de cuánto cambiarían nuestra lectura. Una reseña aprobatoria de ArthurZucker o Rocketknight1, que convierte esto de un diff prometedor en una función programada. Una conversión conforme a la convención del G1 de 13.3B con el tokenizador World, que es lo que hace que el cargador valga la pena. Cifras de rendimiento publicadas para la ruta de decodificación sin dependencias frente a los kernels de Triton, que deciden si el soporte nativo es una opción de servicio o un shim de compatibilidad. Y cualquier señal de RWKV-8, que te diría si esta integración llega al inicio de una generación o al final de una.
Hasta al menos la primera de esas, el resumen correcto es el poco glamoroso: RWKV-7 (Goose) es real, tiene licencia permisiva, se puede descargar hasta 13.3B, y todavía no se puede cargar de forma nativa en la biblioteca sobre la que se construye la mayor parte del ecosistema. Una pull request abierta el 4 de agosto de 2026 propone solucionarlo. No ha sido fusionada, y las pull requests para añadir arquitecturas a transformers sí se cierran.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
