LEGO-Anything : des agents IA reconstruisent une scène 3D depuis une photo
Des chercheurs de l'université du Maryland et d'AWS ont mis au point LEGO-Anything, une méthode où un agent de codage génère un programme Blender exécutable à partir d'une seule photo. Leur benchmark LEGO-Bench révèle que les agents livrent des scènes exploitables mais échouent à juger eux-mêmes de leur exactitude géométrique.

Dans cet article
Une scène 3D générée sous forme de programme exécutable
Un agent de codage peut produire une scène 3D modifiable à partir d'une seule photographie, en écrivant et en affinant du code par étapes successives. C'est la promesse de LEGO-Anything, un projet mené par des chercheurs de l'université du Maryland et d'AWS, rapporte The Decoder.
La méthode, baptisée « Image-to-Code », confie une image à un agent qui rédige du code pour Blender, logiciel de 3D largement répandu. L'agent ne génère pas la scène en une seule passe : il écrit, exécute, observe le rendu, puis corrige jusqu'à ce que le résultat corresponde à la photo d'origine.
Le rendu prenant la forme d'un programme, il décrit explicitement les objets, la géométrie, la disposition et la position de la caméra. La scène peut être exécutée, contrôlée et modifiée comme n'importe quel autre code.
LEGO-Bench s'appuie sur des scènes de simulateur
Pour évaluer la performance des agents, l'équipe a conçu LEGO-Bench. Ce benchmark réunit 208 images issues de 104 scènes intérieures et extérieures, et mobilise 443 actifs enregistrés.
Les photographies réelles n'offrent pas de référence 3D précise pour la comparaison, selon les chercheurs, tandis que les scènes synthétiques simples manquent de réalisme. LEGO-Bench adopte donc une voie intermédiaire : ses images sont rendues à partir de scènes de simulateur construites par des professionnels. Les entrées paraissent naturelles, mais la géométrie exacte, la profondeur et l'affectation des objets restent masquées et servent de corrigé pour la notation automatisée. La complexité des scènes peut être augmentée sans modifier l'éclairage ni les réglages de caméra.
Le benchmark note chaque scène sur trois axes. La validité vérifie qu'un artefact de scène utilisable a bien été livré. La reconstruction mesure l'exactitude de la géométrie visible. L'apparence évalue la proximité du rendu avec l'original, en réaffichant la scène soumise et en la comparant pixel par pixel à l'image de référence.
Des artefacts utilisables, une géométrie encore fragile
Les six configurations GPT testées ont toutes livré une scène fonctionnelle dans la quasi-totalité des cas. La précision, elle, varie fortement. GPT-6 Astra, le meilleur modèle évalué, atteint 53,4 % sur les scènes intérieures et 39,6 % sur les scènes extérieures. Les configurations plus faibles plafonnent autour de 15 %.
Plus une scène est complexe, plus la précision chute, et les extérieurs sont plus difficiles que les intérieurs. En augmentant le budget de raisonnement des modèles, les variantes de GPT-6 progressent nettement : le score d'Astra sur un sous-ensemble de test dédié aux bureaux passe de 32,3 à 61,8 %.
L'analyse des étapes de travail des agents fait apparaître trois écueils récurrents : des tentatives initiales de mauvaise qualité, des révisions qui annulent des progrès antérieurs et une auto-évaluation peu fiable.
Ce dernier point est le plus révélateur. Invités à choisir entre deux versions laquelle correspond le mieux à l'original, les modèles obtiennent des jugements géométriques proches du hasard, voire en dessous. Un agent ne parvient pratiquement pas à dire si sa propre scène s'est améliorée. Les chercheurs en concluent que l'affinage doit s'appuyer sur des mesures concrètes, et non sur le jugement de l'agent.
LEGO-Plugin corrige l'auto-évaluation sans réentraînement
Cette observation a conduit les auteurs à développer LEGO-Plugin, une extension qui ne nécessite aucun entraînement supplémentaire. Elle ancre la scène de départ dans l'image de référence, remplace l'auto-jugement défaillant par des mesures concrètes et protège les progrès corrects contre les modifications régressives. Le plugin améliore les six modèles. Les agents les plus faibles en tirent le plus grand bénéfice, avec des gains allant jusqu'à 62,7 %. Le meilleur modèle, déjà solide, ne gagne qu'environ deux points de pourcentage.
Un écart persistant avec les modèles spécialisés
L'équipe a enfin testé si les scènes reconstruites pouvaient servir de base à des tâches de vision classiques. Chaque scène étant un programme exécutable, la détection d'objets, la segmentation et l'estimation de profondeur peuvent en être extraites directement.
Sans entraînement supplémentaire, les scènes produisent des résultats exploitables mais sans éclat sur les trois tâches. La détection d'objets s'en sort le mieux, les scènes reconstruites atteignant environ la moitié des performances du modèle spécialisé DINO. Pour la segmentation et l'estimation de profondeur, l'écart avec des modèles comme SAM 3 et Depth Anything 3 est plus marqué. Les auteurs estiment que les programmes de scènes exécutables issus des agents de codage actuels sont prometteurs, mais pas encore assez précis. Un écart important subsiste entre un résultat fonctionnel et une reconstruction fidèle.
L'avance marquée de GPT-6 Astra dans LEGO-Bench rejoint d'autres observations. Le chercheur en IA Yoav Artzi voit dans ce modèle un bond majeur en compréhension spatiale et soupçonne un entraînement sur de grandes quantités de données 3D, comme des scènes Blender. Les éditeurs de logiciels 3D se préparent déjà à ce type d'agents : Unity a publié des plugins officiels pour Claude Code et Codex. D'autres approches se passent totalement de code et reconstruisent les scènes directement dans le modèle, à l'image du world model Atlas de World Labs. Google Deepmind emprunte une troisième voie avec GenCeption, qui recourt à un modèle vidéo pour l'estimation de profondeur et la segmentation, avec des performances comparables à celles des modèles spécialisés.


