Kurz gesagt
- Rho-1 verarbeitet Text, Bild, Video und Aktionen zur Robotersteuerung innerhalb desselben Modells.
- Das Modell greift für verschiedene Aufgaben weder auf externe Modelle noch auf Tool-Aufrufe zurück, sondern verarbeitet alle Modalitäten in einem gemeinsamen Kontextfenster.
- Reka AI trainierte Rho-1 etwa drei Monate lang auf 320 H100-GPUs.
- Um dem Mangel an Trainingsdaten für Robotik entgegenzuwirken, entwickelte das Unternehmen ein inverses Dynamikmodell, das Steuersignale aus Internetvideos ableitet.
Reka AI hat am 5. Oktober 2026 eine Forschungsvorschau seines multimodalen Modells Rho-1 veröffentlicht. Das neue Modell des Unternehmens kann Text, Bild, Video und Aktionen zur Robotersteuerung innerhalb eines einzigen neuronalen Netzwerks mit 19 Milliarden Parametern verarbeiten und generieren. Laut The Decoder verarbeitet Rho-1 alle Modalitäten in einem gemeinsamen Kontextfenster, statt Aufgaben an verschiedene spezialisierte Modelle zu verteilen.
Was zeichnet Rho-1 aus?
Während viele multimodale Systeme für bestimmte Aufgaben auf separate Modelle oder Tool-Aufrufe zurückgreifen, bildet Rho-1 alle Modalitäten innerhalb desselben Modells ab. Laut einem Bericht von The Decoder greift das System zur Erledigung von Aufgaben weder auf externe Modelle zurück noch nutzt es Tool-Aufrufe. So fallen Ausgaben zu Text, Bild, Video und Roboterbewegungen in den Zuständigkeitsbereich eines einzigen Modells.
Reka AI zufolge kann das Modell kontinuierlich Videos generieren und in Echtzeit arbeiten. Zu den genannten Funktionen zählt auch, dass es auf neue Anweisungen reagieren kann, während der Stream weiterläuft. Eine neue Aufforderung kann eingearbeitet werden, ohne den Videoprozess von vorn zu beginnen. Der Quellbericht enthält keine Details dazu, in welchen Anwendungsszenarien und innerhalb welcher Leistungsgrenzen diese Funktionen arbeiten.
Wie lernt das Modell Roboterbewegungen?
Rho-1 verwendet dieselben Gewichte sowohl zur Vorhersage von Kamerabildern als auch zur Steuerung von Roboterbewegungen. Da nur begrenzte Trainingsdaten für die Robotersteuerung verfügbar sind, entwickelte Reka AI ein inverses Dynamikmodell, das Steuersignale aus alltäglichen Videos im Internet ableitet.
Reka AI trainierte Rho-1 etwa drei Monate lang auf 320 H100-GPUs. Diese Angabe vermittelt einen Eindruck vom Umfang der Modellentwicklung, macht jedoch keine Aussage darüber, welche Hardware für die Nutzung der Vorschau erforderlich ist oder auf welcher Hardware das Modell laufen wird. Der Bericht nennt auch keine Bedingungen für den Zugang, Preise oder einen Zeitplan für die allgemeine Verfügbarkeit.
Bedeutung für Architektur- und Visualisierungs-Workflows
In den Bereichen Architektur, Innenarchitektur und Archviz könnte die Bündelung von Text-, Bild- und Videofunktionen in einem Modell das Interesse an Tools steigern, die verschiedene Inhaltsarten miteinander verbinden. Die Echtzeit-Videogenerierung und die Möglichkeit, während des Streams auf neue Anweisungen zu reagieren, eröffnen potenzielle Ansätze für die interaktive Arbeit mit bewegten visuellen Inhalten. Allerdings führt Reka AI Architekturdesign oder Visualisierung nicht ausdrücklich als Anwendungsbereiche auf. Daher reichen die verfügbaren Informationen nicht aus, um einen direkten Nutzen für bestehende Workflows zu bestätigen.
Für Büros und Visualisierungsteams werden die Verfügbarkeit des Modells, Lizenz- und Nutzungsbedingungen, Hardwareanforderungen sowie die Möglichkeit, die generierten Ergebnisse mit vorhandenen Tools zu verwenden, wichtige Punkte sein. Der Quellbericht enthält dazu keine Einzelheiten. Rho-1 sollte daher vorerst nicht als bewährtes Produktionswerkzeug für die Architektur betrachtet werden, sondern als Forschungsvorschau auf einen Ansatz, der Text, Bild, Video und Robotersteuerung in einem System vereint.
Quellen
1 QuelleQuelltexte werden nicht neu veröffentlicht; kurze Zitate sind gekennzeichnet, der Rest ist eigene Zusammenfassung und Einordnung.
Bemerkenswert an Rho-1 ist, dass das Modell neben Text- und Bildgenerierung auch Echtzeitvideo und Robotersteuerung integriert. Dieser Ansatz könnte künftig Tools ermöglichen, bei denen visuelle Inhaltserstellung und Interaktion enger zusammenarbeiten. Ein konkretes Anwendungsbeispiel für Architektur und Archviz wurde jedoch noch nicht vorgestellt.
Für Büros in der Türkei fehlen derzeit Angaben zu Zugang, Lizenzierung, Preisen und Hardware, die eine fundierte Entscheidung ermöglichen würden. Daher ist es sinnvoller, den Umfang der Vorschau und Ankündigungen zu diesen Bedingungen zu verfolgen, statt das Modell schon jetzt in die bestehende Produktionspipeline aufzunehmen. Insbesondere muss sich erst zeigen, wie gut die behauptete Videogenerierung und die unmittelbare Reaktion auf Anweisungen bei realen Entwurfsaufgaben funktionieren.
Häufige Fragen
Welche Datentypen verarbeitet Reka AI Rho-1?
Das Modell kann Text, Bild, Video und Aktionen zur Robotersteuerung innerhalb eines einzigen neuronalen Netzwerks verarbeiten und generieren.
Wann wurde Rho-1 veröffentlicht?
Reka AI veröffentlichte die Forschungsvorschau von Rho-1 am 5. Oktober 2026.
Wurden der Preis und die Hardwareanforderungen von Rho-1 bekannt gegeben?
Der Quellbericht nennt weder Preise und Zugangsbedingungen noch die Hardwareanforderungen auf Nutzerseite.



