ИССЛЕДОВАНИЕ · RESEARCH · #1396
Frozen Scenes, Shifting Winners — аудит выявляет высокую чувствительность оценки text-to-3D к настройкам рендера и подписей
Препринт на arXiv (arXiv:2610.00447v1) проводит аудит оценки изображений рендера для text-to-3D: 300 зафиксированных сцен от шести генераторов подвергли вариациям по восьми параметрам рендера и подписей, оценивали 19 эвристик согласованности и один контроль перцептуального качества. Авторы показывают, что вариативность из-за конфигурации часто превосходит различия между генераторами, многие оценщики при некоторых настройках меняют точечного «победителя», направления ранжирования стабильнее оценок, и никакая инверсия не подтверждается после одновременной проверки — рекомендуется указывать (generator, score, card ID) и отчётливо оценивать неопределённость выборки и протокола.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Препринт на arXiv (arXiv:2610.00447v1) проводит аудит оценки изображений рендера для text-to-3D: 300 зафиксированных сцен от шести генераторов подвергли вариациям по восьми параметрам рендера и подписей, оценивали 19 эвристик согласованности и один контроль перцептуального качества.
- Авторы показывают, что вариативность из-за конфигурации часто превосходит различия между генераторами, многие оценщики при некоторых настройках меняют точечного «победителя», направления ранжирования стабильнее оценок, и никакая инверсия не подтверждается после одновременной проверки — рекомендуется указывать (generator, score, card ID) и отчётливо оценивать неопределённость выборки и протокола.
- Потому что выбор протокола (камера, рендер, подпись) может доминировать над измеряемыми различиями между генераторами text-to-3D, что ставит под сомнение утверждения о превосходстве и требует явной отчётности и оценки неопределённости.
ПОЧЕМУ ЭТО ВАЖНО
Потому что выбор протокола (камера, рендер, подпись) может доминировать над измеряемыми различиями между генераторами text-to-3D, что ставит под сомнение утверждения о превосходстве и требует явной отчётности и оценки неопределённости.