En bref
- Odyssey-3 crée des environnements interactifs en temps réel à partir de descriptions textuelles.
- La démo en ligne gratuite permet d’explorer les environnements à la première ou à la troisième personne.
- Le modèle de base compte 14 milliards de paramètres et produit des vidéos en 832 × 480 pixels ; la version Pro prend en charge le 1280 × 720 pixels.
- Les développeurs peuvent demander l’accès à l’API ; aucune information n’a été communiquée sur une intégration aux logiciels d’architecture.
Selon une information publiée le 11 octobre 2026, Odyssey, entreprise basée en Californie, a rendu son modèle de monde Odyssey-3 accessible au public sous la forme d’un aperçu de recherche. Le système génère des environnements interactifs en temps réel à partir de commandes textuelles ; les utilisateurs peuvent s’y déplacer selon différents points de vue et déclencher des événements. La démo en ligne gratuite utilise le modèle Odyssey-3 Flash, tandis que les développeurs doivent déposer une demande pour accéder à l’API.
Explorer des mondes décrits par du texte
Odyssey-3 repose sur un transformeur de diffusion autorégressif qui génère de nouvelles images vidéo en tenant compte des images précédentes et des actions de l’utilisateur. L’entreprise indique que le modèle apprend les relations physiques et les liens de cause à effet à partir d’observations visuelles. Son entraînement s’appuie sur des vidéos trouvées sur Internet et associées à des descriptions d’événements, des séquences de jeu accompagnées d’entrées clavier et souris, ainsi que des interactions physiques simulées.
Dans la démo, les utilisateurs peuvent choisir une vue à la première ou à la troisième personne, se déplacer dans l’environnement généré et observer la façon dont le système réagit à leurs actions. Selon l’entreprise, une technique d’entraînement supplémentaire, qui réduit le nombre d’étapes de calcul, permet la génération en temps réel.
Dans sa publication officielle consacrée aux benchmarks, Odyssey décrit le modèle de base Odyssey-3 comme un système de 14 milliards de paramètres qui génère des vidéos en 832 × 480 pixels. La résolution indiquée pour Odyssey-3 Pro est de 1280 × 720 pixels.
Une réserve importante sur les résultats des benchmarks
Selon les résultats communiqués par Odyssey, Odyssey-3 Pro a obtenu un score de 66,1 au test vidéo-à-vidéo Physics-IQ Verified. Toutefois, cette valeur provient d’une seule exécution du test, au cours de laquelle une vidéo sur huit générées pour chaque tâche a été sélectionnée. Les règles de benchmark citées par la source exigent quatre exécutions du test, avec l’écart-type également indiqué, pour pouvoir revendiquer un record. La moyenne des quatre exécutions sans méthode de sélection est de 63,37 points.
Dans l’évaluation WorldMark, d’après les propres résultats de test d’Odyssey, le modèle arrive en tête dans trois des quatre catégories : First-Person Stylized avec 77,2, Third-Person Real avec 79,0 et Third-Person Stylized avec 76,3 points. Il se classe troisième dans la catégorie First-Person Real, avec 80,6 points. Le test évalue notamment le respect des consignes, la qualité des images générées et la cohérence de l’environnement dans le temps. Il faut garder à l’esprit que ces résultats reposent sur l’évaluation de l’entreprise elle-même.
Des objectifs pour la robotique et le contrôle de jeux
Odyssey prévoit d’utiliser son modèle de monde à différentes fins, du pilotage de bras robotisés et de drones au contrôle de personnages de jeux vidéo. Les prédictions du modèle sont converties en commandes par l’intermédiaire de contrôleurs adaptés à chaque domaine d’application. L’entreprise indique qu’un système basé sur Odyssey-3 contrôle plusieurs bras robotisés et peut se remettre de tentatives de préhension infructueuses qui n’ont pas été montrées pendant l’entraînement. Pour ses travaux sur les robots humanoïdes, elle collabore avec l’entreprise suisse de robotique Flexion.
Le contrôleur de drone entraîné par l’entreprise à l’aide de données de vol simulées évite des obstacles et se dirige vers des cibles dans un environnement intérieur virtuel. Dans un autre exemple présenté par Odyssey, une IA conduit des véhicules et affronte des ennemis dans GTA V. L’entreprise cite également le cas d’un contrôleur entraîné sur environ deux heures de séquences de GTA, capable de déplacer un personnage à cheval dans Red Dead Redemption 2 sans entraînement supplémentaire.
Conséquences pour les flux de travail en architecture et en visualisation
L’aperçu public est actuellement axé sur la génération d’environnements interactifs. La source ne fournit aucune information sur une intégration aux logiciels de conception architecturale ou de visualisation ; rien ne permet donc de considérer Odyssey-3 comme une solution appelée à remplacer les outils de production actuels. Toutefois, la possibilité de se déplacer dans des espaces décrits par du texte et d’observer l’effet des actions sur l’environnement mérite l’attention des équipes qui explorent des idées de scènes interactives.
Pour les studios et les artistes 3D, les essais devraient permettre de vérifier la résolution des sorties, la cohérence de l’environnement en réaction aux actions et la compatibilité avec les logiciels utilisés. L’accès à l’API est soumis à une demande ; les tarifs et les conditions d’accès n’ont pas été communiqués. La source ne précise pas non plus la configuration matérielle requise. Pour la robotique et les systèmes autonomes, il ne faut pas en conclure que l’aperçu propose à lui seul une application prête à l’emploi : l’entreprise indique que ses travaux dans ces domaines se poursuivent.
Sources
1 sourceLes textes sources ne sont pas republiés ; les courtes citations sont signalées, le reste est notre propre résumé et commentaire.
Pour les équipes d’architecture et de visualisation, l’intérêt le plus immédiat d’Odyssey-3 est de pouvoir expérimenter un environnement généré à partir de texte en s’y déplaçant, plutôt que de simplement l’observer. Cette fonctionnalité peut aider à discuter d’idées d’espaces interactifs à un stade précoce ; toutefois, les informations disponibles ne montrent pas que le modèle remplacera les logiciels de production architecturale.
Pour les studios en Turquie, la démo gratuite permet de découvrir l’approche sans grande barrière à l’entrée. En revanche, le prix de l’API, les conditions d’accès, la configuration matérielle requise et la compatibilité logicielle n’ont pas été précisés. Avant de prendre une décision, mieux vaut donc effectuer des essais en fonction des besoins réels des projets et considérer les résultats des benchmarks comme des déclarations de l’entreprise.
Questions fréquentes
Odyssey-3 est-il gratuit ?
La démo en ligne qui utilise Odyssey-3 Flash est proposée gratuitement. Les développeurs doivent demander l’accès à l’API.
Quelle résolution vidéo Odyssey-3 prend-il en charge ?
Le modèle de base Odyssey-3 est indiqué en 832 × 480 pixels, et Odyssey-3 Pro en 1280 × 720 pixels.
Odyssey-3 est-il intégré aux logiciels d’architecture ?
La source ne mentionne aucune intégration aux logiciels d’architecture. L’aperçu public est axé sur la génération d’environnements interactifs.



