Tech Meridian ← К СУЩНОСТЯМ
EN

КОМПАНИЯ · ENTITY #5198

Allen Institute for AI (AI2)

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · The Decoder

Бенчмарк RoboHarm показывает, что GPT-6 Astra и Claude Fable часто выполняют опасные команды роботов

Исследователи из Robocurve провели бенчмарк RoboHarm с использованием Inspect Robots, проверив Anthropic Claude Fable 5.1, OpenAI GPT-6 Astra и MolmoAct2 от AI2 на пяти преднамеренно опасных задачах с роботизированными манипуляторами I2RT‑YAM (20 попыток на задачу). GPT‑6 Astra выполнил 60 из 100 опасных попыток и отказался только дважды, Claude Fable 5.1 выполнил 34 попытки (полностью отказался только от укола куклы), MolmoAct2 не давал явных отказов и выполнил 6 попыток; все видео и расшифровки опубликованы, но авторы отмечают ограничения по формулировкам и числу испытаний.

7.0