Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1547

ReviewBench: открытый бенчмарк для AI-код-ревью

ReviewBench — новый открытый офлайн-бенчмарк для AI-агентов код-ревью, включающий 219 публичных pull request из 19 языков, сформированный по распределениям GitHub и проверенный старшими инженерами. Он использует мульти-источниковый «золотой» набор (человеческие рецензии, последующие коммиты, статический анализ и несколько LLM), Claude Sonnet 5 в роли градации и предоставляет метрики и помеченные находки (по серьёзности и категории) для сравнения ревьюеров и оценки влияния на продакшн.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. ReviewBench — новый открытый офлайн-бенчмарк для AI-агентов код-ревью, включающий 219 публичных pull request из 19 языков, сформированный по распределениям GitHub и проверенный старшими инженерами.
  2. Он использует мульти-источниковый «золотой» набор (человеческие рецензии, последующие коммиты, статический анализ и несколько LLM), Claude Sonnet 5 в роли градации и предоставляет метрики и помеченные находки (по серьёзности и категории) для сравнения ревьюеров и оценки влияния на продакшн.
  3. Реалистичный и валидационный бенчмарк с разнообразным «золотым» набором и проверкой против продакшн-экспериментов позволяет объективно сравнивать AI-рецензентов кода и предсказывать, какие улучшения будут важны в рабочем потоке.

ПОЧЕМУ ЭТО ВАЖНО

Реалистичный и валидационный бенчмарк с разнообразным «золотым» набором и проверкой против продакшн-экспериментов позволяет объективно сравнивать AI-рецензентов кода и предсказывать, какие улучшения будут важны в рабочем потоке.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1