НОВОСТЬ · MODELS · #393
Анализ LatchBio: Grok 4.6 лучше всех отвергает замаскированные биологические угрозы в BioSecBench
LatchBio опубликовала независимый анализ Grok 4.6 по наборам тестов BioSecBench. В тесте BioSecBench-Refusal Grok 4.6 занял первое место (средневзвешенное гармоническое 62,1%), отказав в 59,2% red-team задач и выполнив 64,8% рутинных задач (единственная модель с показателями >50% по обоим направлениям); в BioSecBench-Surveillance успех составил 53,5%, что ниже Opus 5 и выше GPT-5.6 Sol. Отчёт указывает на использование разных агентных оболочек и уровней усилий; дополнительные результаты доступны на benchmarks.bio.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- LatchBio опубликовала независимый анализ Grok 4.6 по наборам тестов BioSecBench.
- В тесте BioSecBench-Refusal Grok 4.6 занял первое место (средневзвешенное гармоническое 62,1%), отказав в 59,2% red-team задач и выполнив 64,8% рутинных задач (единственная модель с показателями >50% по обоим направлениям); в BioSecBench-Surveillance успех составил 53,5%, что ниже Opus 5 и выше GPT-5.6 Sol.
- Отчёт указывает на использование разных агентных оболочек и уровней усилий; дополнительные результаты доступны на benchmarks.bio.
ПОЧЕМУ ЭТО ВАЖНО
Результаты показывают модель передового уровня, которая сравнительно надёжно отвергает замаскированные опасные биозапросы, оставаясь способной для рутинного бионадзора — важный показатель для биобезопасности и мер предосторожности при развёртывании.