ReviewBench: открытый бенчмарк для AI-код-ревью
ReviewBench — новый открытый офлайн-бенчмарк для AI-агентов код-ревью, включающий 219 публичных pull request из 19 языков, сформированный по распределениям GitHub и проверенный старшими инженерами. Он использует мульти-источниковый «золотой» набор (человеческие рецензии, последующие коммиты, статический анализ и несколько LLM), Claude Sonnet 5 в роли градации и предоставляет метрики и помеченные находки (по серьёзности и категории) для сравнения ревьюеров и оценки влияния на продакшн.