НОВОСТЬ · MODELS · #1070
GPT-6 Astra от OpenAI набирает 80% в бенчмарке по сборке мебели Epoch AI
Бенчмарк Epoch AI Furniture Assembly Benchmark (FAB) проверяет модели на выявление ошибок в фотографиях сборки мебели IKEA. Ранее лучший результат (Claude Opus 4.5) был 28% в ноябре 2025 года; через десять месяцев GPT-6 Astra от OpenAI достиг 80% при обработке примерно трёх минут на фото, за ним следуют Claude Fable 5.1 (70%) и Claude Opus 5 (61%), тогда как некоторые китайские open-weight модели, например Kimi K3, значительно отстают.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Бенчмарк Epoch AI Furniture Assembly Benchmark (FAB) проверяет модели на выявление ошибок в фотографиях сборки мебели IKEA.
- Ранее лучший результат (Claude Opus 4.5) был 28% в ноябре 2025 года; через десять месяцев GPT-6 Astra от OpenAI достиг 80% при обработке примерно трёх минут на фото, за ним следуют Claude Fable 5.1 (70%) и Claude Opus 5 (61%), тогда как некоторые китайские open-weight модели, например Kimi K3, значительно отстают.
- Результат обозначает существенный прогресс в визуально-языковых способностях с потенциалом для ремонта, робототехники и реального визуального устранения неисправностей, хотя текущая задержка мешает использованию в реальном времени.
ПОЧЕМУ ЭТО ВАЖНО
Результат обозначает существенный прогресс в визуально-языковых способностях с потенциалом для ремонта, робототехники и реального визуального устранения неисправностей, хотя текущая задержка мешает использованию в реальном времени.