LEGO-Anything: агенты создают редактируемые 3D-сцены по фото, но не умеют оценить точность
Исследователи из Университета Мэриленда и AWS представили LEGO-Anything — подход Image-to-Code, где агенты поэтапно генерируют код Blender для восстановления редактируемой 3D-сцены по одному фото. Они выпустили бенчмарк LEGO-Bench (208 изображений из 104 сцен, 443 ассета), который оценивает валидность, реконструкцию и внешний вид; GPT-6 Astra показал лучшие результаты (≈53,4% в помещениях, 39,6% на улице), но модели плохо оценивают собственные улучшения и геометрию; расширение LEGO-Plugin (без дополнительного обучения) устраняет ряд ошибок и значительно помогает слабым агентам.