Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1469

LEGO-Anything: агенты создают редактируемые 3D-сцены по фото, но не умеют оценить точность

Исследователи из Университета Мэриленда и AWS представили LEGO-Anything — подход Image-to-Code, где агенты поэтапно генерируют код Blender для восстановления редактируемой 3D-сцены по одному фото. Они выпустили бенчмарк LEGO-Bench (208 изображений из 104 сцен, 443 ассета), который оценивает валидность, реконструкцию и внешний вид; GPT-6 Astra показал лучшие результаты (≈53,4% в помещениях, 39,6% на улице), но модели плохо оценивают собственные улучшения и геометрию; расширение LEGO-Plugin (без дополнительного обучения) устраняет ряд ошибок и значительно помогает слабым агентам.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Исследователи из Университета Мэриленда и AWS представили LEGO-Anything — подход Image-to-Code, где агенты поэтапно генерируют код Blender для восстановления редактируемой 3D-сцены по одному фото.
  2. Они выпустили бенчмарк LEGO-Bench (208 изображений из 104 сцен, 443 ассета), который оценивает валидность, реконструкцию и внешний вид; GPT-6 Astra показал лучшие результаты (≈53,4% в помещениях, 39,6% на улице), но модели плохо оценивают собственные улучшения и геометрию; расширение LEGO-Plugin (без дополнительного обучения) устраняет ряд ошибок и значительно помогает слабым агентам.
  3. Это демонстрирует, что агенты могут генерировать редактируемые 3D-программы по одному фото, но ненадёжная самооценка и точность геометрии остаются серьёзными препятствиями, что подчёркивает необходимость измерений на основе метрик и интеграции инструментов.

ПОЧЕМУ ЭТО ВАЖНО

Это демонстрирует, что агенты могут генерировать редактируемые 3D-программы по одному фото, но ненадёжная самооценка и точность геометрии остаются серьёзными препятствиями, что подчёркивает необходимость измерений на основе метрик и интеграции инструментов.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1