ИССЛЕДОВАНИЕ · RESEARCH · #1547
ReviewBench: открытый бенчмарк для AI-код-ревью
ReviewBench — новый открытый офлайн-бенчмарк для AI-агентов код-ревью, включающий 219 публичных pull request из 19 языков, сформированный по распределениям GitHub и проверенный старшими инженерами. Он использует мульти-источниковый «золотой» набор (человеческие рецензии, последующие коммиты, статический анализ и несколько LLM), Claude Sonnet 5 в роли градации и предоставляет метрики и помеченные находки (по серьёзности и категории) для сравнения ревьюеров и оценки влияния на продакшн.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- ReviewBench — новый открытый офлайн-бенчмарк для AI-агентов код-ревью, включающий 219 публичных pull request из 19 языков, сформированный по распределениям GitHub и проверенный старшими инженерами.
- Он использует мульти-источниковый «золотой» набор (человеческие рецензии, последующие коммиты, статический анализ и несколько LLM), Claude Sonnet 5 в роли градации и предоставляет метрики и помеченные находки (по серьёзности и категории) для сравнения ревьюеров и оценки влияния на продакшн.
- Реалистичный и валидационный бенчмарк с разнообразным «золотым» набором и проверкой против продакшн-экспериментов позволяет объективно сравнивать AI-рецензентов кода и предсказывать, какие улучшения будут важны в рабочем потоке.
ПОЧЕМУ ЭТО ВАЖНО
Реалистичный и валидационный бенчмарк с разнообразным «золотым» набором и проверкой против продакшн-экспериментов позволяет объективно сравнивать AI-рецензентов кода и предсказывать, какие улучшения будут важны в рабочем потоке.