En resumen
- Rho-1 procesa texto, imágenes, video y acciones de control robótico en un mismo modelo.
- El modelo no recurre a modelos externos ni a llamadas a herramientas para distintas tareas: procesa todas las modalidades dentro de una ventana de contexto compartida.
- Reka AI entrenó Rho-1 durante aproximadamente tres meses con 320 GPU H100.
- Ante la escasez de datos de entrenamiento robótico, la empresa desarrolló un modelo de dinámica inversa que extrae señales de control de videos de internet.
Reka AI publicó la vista previa de investigación de su modelo multimodal Rho-1 el 5 de octubre de 2026. El nuevo modelo de la empresa puede procesar y generar texto, imágenes, video y acciones de control robótico dentro de una sola red neuronal de 19.000 millones de parámetros. Según The Decoder, Rho-1 procesa todas las modalidades en una ventana de contexto compartida, en lugar de distribuir las tareas entre distintos modelos especializados.
¿Qué distingue a Rho-1?
Mientras que muchos sistemas multimodales recurren a modelos independientes o a llamadas a herramientas para tareas concretas, Rho-1 representa todas las modalidades dentro del mismo modelo. Según The Decoder, el sistema no recurre a modelos externos ni utiliza llamadas a herramientas para completar las tareas. Así, las salidas relacionadas con texto, imágenes, video y movimientos robóticos quedan dentro del alcance de un único modelo.
Reka AI afirma que el modelo puede generar video de forma continua y operar en tiempo real. Entre las funciones anunciadas también está la posibilidad de responder a nuevas instrucciones mientras la transmisión sigue en curso. Es posible guiar el proceso sin tener que reiniciar el video ante una nueva solicitud. La noticia original no incluye detalles sobre los casos de uso en los que funcionan estas capacidades ni sobre sus límites de rendimiento.
¿Cómo aprende los movimientos robóticos?
Rho-1 utiliza los mismos pesos tanto para predecir imágenes de cámara como para guiar movimientos robóticos. Debido a la disponibilidad limitada de datos de entrenamiento para el control robótico, Reka AI creó un modelo de dinámica inversa que extrae señales de control de videos comunes disponibles en internet.
La empresa entrenó Rho-1 durante aproximadamente tres meses utilizando 320 GPU H100. Este dato da una idea de la escala de desarrollo del modelo, pero no aclara qué hardware necesitarán quienes quieran utilizar la vista previa ni en qué equipos podrá ejecutarse. La noticia tampoco especifica las condiciones de acceso, los precios o el calendario para su disponibilidad general.
Qué significa para los flujos de arquitectura y visualización
En arquitectura, diseño de interiores y archviz, la integración de capacidades de texto, imagen y video en un mismo modelo podría aumentar el interés por las herramientas que trabajan con distintos tipos de contenido. La generación de video en tiempo real y la capacidad de responder a nuevas instrucciones durante la transmisión abren la posibilidad de trabajar de forma interactiva con contenido visual en movimiento. Sin embargo, entre los usos anunciados por Reka AI no se mencionan específicamente el diseño arquitectónico ni la visualización; por lo tanto, no hay información suficiente para concluir que el modelo ya aporte directamente a los flujos de trabajo actuales.
Para oficinas y equipos de visualización, los aspectos por seguir serán la disponibilidad del modelo, las condiciones de licencia y uso, los requisitos de hardware y la posibilidad de utilizar las salidas junto con las herramientas existentes. La noticia original no ofrece detalles sobre estos puntos. Por ahora, Rho-1 debe considerarse no como una herramienta de producción validada para arquitectura, sino como una vista previa de investigación de un enfoque que combina texto, imágenes, video y control robótico en un solo sistema.
Fuentes
1 fuenteNo republicamos los textos de las fuentes; las citas breves van marcadas y el resto es resumen y comentario propios.
Lo más llamativo de Rho-1 es que reúne en un mismo modelo la generación de texto e imágenes, el video en tiempo real y el control robótico. Este enfoque podría abrir el camino a herramientas en las que la generación de contenido visual y la interacción estén más integradas; sin embargo, todavía no se ha presentado un caso de uso directo para arquitectura o archviz.
Para las oficinas de Turquía, aún no se han publicado datos sobre acceso, licencias, precios y requisitos de hardware que permitan tomar una decisión. Por eso, lo más conveniente es seguir de cerca el alcance de la vista previa y los anuncios sobre estas condiciones, en lugar de incorporar el modelo a los flujos de producción actuales. En particular, habrá que ver cómo se desempeñan en tareas de diseño reales las funciones anunciadas de generación de video y respuesta instantánea a instrucciones.
Preguntas frecuentes
¿Qué tipos de datos procesa Reka AI Rho-1?
El modelo puede procesar y generar texto, imágenes, video y acciones de control robótico dentro de una sola red neuronal.
¿Cuándo se publicó Rho-1?
Reka AI publicó la vista previa de investigación de Rho-1 el 5 de octubre de 2026.
¿Se anunciaron el precio y los requisitos de hardware de Rho-1?
La noticia original no especifica el precio, las condiciones de acceso ni los requisitos de hardware para los usuarios.



