Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · MODELS · #393

Анализ LatchBio: Grok 4.6 лучше всех отвергает замаскированные биологические угрозы в BioSecBench

LatchBio опубликовала независимый анализ Grok 4.6 по наборам тестов BioSecBench. В тесте BioSecBench-Refusal Grok 4.6 занял первое место (средневзвешенное гармоническое 62,1%), отказав в 59,2% red-team задач и выполнив 64,8% рутинных задач (единственная модель с показателями >50% по обоим направлениям); в BioSecBench-Surveillance успех составил 53,5%, что ниже Opus 5 и выше GPT-5.6 Sol. Отчёт указывает на использование разных агентных оболочек и уровней усилий; дополнительные результаты доступны на benchmarks.bio.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. LatchBio опубликовала независимый анализ Grok 4.6 по наборам тестов BioSecBench.
  2. В тесте BioSecBench-Refusal Grok 4.6 занял первое место (средневзвешенное гармоническое 62,1%), отказав в 59,2% red-team задач и выполнив 64,8% рутинных задач (единственная модель с показателями >50% по обоим направлениям); в BioSecBench-Surveillance успех составил 53,5%, что ниже Opus 5 и выше GPT-5.6 Sol.
  3. Отчёт указывает на использование разных агентных оболочек и уровней усилий; дополнительные результаты доступны на benchmarks.bio.

ПОЧЕМУ ЭТО ВАЖНО

Результаты показывают модель передового уровня, которая сравнительно надёжно отвергает замаскированные опасные биозапросы, оставаясь способной для рутинного бионадзора — важный показатель для биобезопасности и мер предосторожности при развёртывании.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1