ИССЛЕДОВАНИЕ · RESEARCH · #1007
PFArena: бенчмарк PLM, LLM и агентов для модификации белков (arXiv:2609.28921v1)
PFArena — новый бенчмарк (arXiv:2609.28921v1), предлагающий четыре контролируемых интерфейса задач для модификации белков, включая генерацию одиночных мутантов и ранжирование множественных мутантов при разных уровнях данных о фитнесе. Авторы оценили шесть PLM, шесть LLM и пять LLM‑агентов, отметили, что PLM лучше в открытой генерации одиночных мутантов, а LLM и агенты — в ранжировании множественных мутантов при наличии таргет‑специфичных данных; все семьи моделей испытывают трудности при увеличении пространства поиска и глубины мутаций; код и набор для бенчмарка опубликованы.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- PFArena — новый бенчмарк (arXiv:2609.28921v1), предлагающий четыре контролируемых интерфейса задач для модификации белков, включая генерацию одиночных мутантов и ранжирование множественных мутантов при разных уровнях данных о фитнесе.
- Авторы оценили шесть PLM, шесть LLM и пять LLM‑агентов, отметили, что PLM лучше в открытой генерации одиночных мутантов, а LLM и агенты — в ранжировании множественных мутантов при наличии таргет‑специфичных данных; все семьи моделей испытывают трудности при увеличении пространства поиска и глубины мутаций; код и набор для бенчмарка опубликованы.
- Предоставляет стандартизованный и воспроизводимый бенчмарк, который проясняет сильные и слабые стороны PLM, LLM и агентов в реалистичных задачах модификации белков и помогает направлять дальнейшую разработку моделей и планирование экспериментов.
ПОЧЕМУ ЭТО ВАЖНО
Предоставляет стандартизованный и воспроизводимый бенчмарк, который проясняет сильные и слабые стороны PLM, LLM и агентов в реалистичных задачах модификации белков и помогает направлять дальнейшую разработку моделей и планирование экспериментов.
ИСТОЧНИКИ И ХРОНОЛОГИЯ
1arXiv:2609.28921v1 Announce Type: new Abstract: Protein modification requires navigating an immense sequence space, yet wet-lab validation remains low-throughput and costly. Although computational paradigms including protein language models (PLMs), large language models (LLMs), and LLM-based agents have shown promise in protein modification, their relative efficacy across realistic experimental decision-making settin…
arXiv:2609.28850v1 Announce Type: new Abstract: Reproducing a machine learning paper involves most research steps, from installing software and debugging to running experiments, work that AI agents increasingly do. We introduce RECLAIM, a benchmark of 100 NeurIPS 2025 papers that can be rebuilt yearly from new conferences. For each paper we fix in advance the result to reproduce, what counts as a successful reproduct…