BioEVAL: глобальный многоинституциональный бенчмарк для оценки LLM и мультимодальных моделей в биоинжиниринге
BioEVAL (BioEngineering Validation of AI and LLMs) — многоинституциональный PhD-уровневый бенчмарк, опубликованный на arXiv (2609.30489v1), охватывающий 11 подполей биоинжиниринга и включающий 608 заданий: 380 тестовых вопросов (после аудита оставлено 359), 218 заданий по синтезу литературы и 10 мультимодальных задач по интерпретации экспериментальных изображений. Авторы оценили облачные и локально запускаемые фундационные/мультимодальные модели (например, ChatGPT, Gemini, Grok), зафиксировали до 90% точности по тестовым вопросам, 0.72 по метрике сходства для синтеза литературы и 80% на небольшой выборке мультимодальных задач, и поддерживают BioEVAL как расширяемый бенчмарк с едиными протоколами.