Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

НОВОСТЬ · MODELS · #1070

GPT-6 Astra от OpenAI набирает 80% в бенчмарке по сборке мебели Epoch AI

Бенчмарк Epoch AI Furniture Assembly Benchmark (FAB) проверяет модели на выявление ошибок в фотографиях сборки мебели IKEA. Ранее лучший результат (Claude Opus 4.5) был 28% в ноябре 2025 года; через десять месяцев GPT-6 Astra от OpenAI достиг 80% при обработке примерно трёх минут на фото, за ним следуют Claude Fable 5.1 (70%) и Claude Opus 5 (61%), тогда как некоторые китайские open-weight модели, например Kimi K3, значительно отстают.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Бенчмарк Epoch AI Furniture Assembly Benchmark (FAB) проверяет модели на выявление ошибок в фотографиях сборки мебели IKEA.
  2. Ранее лучший результат (Claude Opus 4.5) был 28% в ноябре 2025 года; через десять месяцев GPT-6 Astra от OpenAI достиг 80% при обработке примерно трёх минут на фото, за ним следуют Claude Fable 5.1 (70%) и Claude Opus 5 (61%), тогда как некоторые китайские open-weight модели, например Kimi K3, значительно отстают.
  3. Результат обозначает существенный прогресс в визуально-языковых способностях с потенциалом для ремонта, робототехники и реального визуального устранения неисправностей, хотя текущая задержка мешает использованию в реальном времени.

ПОЧЕМУ ЭТО ВАЖНО

Результат обозначает существенный прогресс в визуально-языковых способностях с потенциалом для ремонта, робототехники и реального визуального устранения неисправностей, хотя текущая задержка мешает использованию в реальном времени.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1