В ReviewBench, открытом наборе тестов для ИИ-проверки кода, можно сравнить готовые системы и проверить собственную. GitHub пока предлагает предварительную версию.

В наборе 219 запросов на слияние изменений из 187 открытых репозиториев на 19 языках. Таблицу результатов можно настроить по важности и типу проблем, а также по тому, что важнее: найти больше проблем или получить меньше ложных замечаний.

Проверка учитывает как известные проблемы, так и новые находки, если оценивающая модель признаёт их верными. По данным GitHub, инженеры, не участвовавшие в создании набора, согласились с оценками известных проблем в 96,6% случаев.

Проверка утверждений:

  • GitHub представила открытый ReviewBench, в котором можно сравнить программы для ИИ-проверки кода и проверить собственную. (подтверждено самой публикацией: доказательство; «ReviewBench’s research preview version is now available through the ReviewBench website , where you can explore the full benchmark, compare code review agents, and bring your own agent to evaluate and iterate.»)
  • ReviewBench пока доступен в предварительной версии. (подтверждено самой публикацией: доказательство; «ReviewBench’s research preview version is now available through the ReviewBench website , where you can explore the full benchmark, compare code review agents, and bring your own agent to evaluate and iterate.»)
  • Набор содержит 219 запросов на слияние изменений из 187 открытых репозиториев на 19 языках. (подтверждено самой публикацией: доказательство; «ReviewBench contains 219 pull requests from 187 public open source licensed repositories spanning 19 languages, with its language and repository-size distributions closely matching GitHub overall.»)
  • Таблицу результатов можно настроить по важности и типу проблем, а также по тому, что важнее: найти больше проблем или получить меньше ложных замечаний. (подтверждено самой публикацией: доказательство; «ReviewBench lets results be sliced by severity and category, while precision and recall capture different operating preferences. Users can also adjust β in the Fβ score to place more weight on recall for broader coverage or precision for lower noise. As these preferences change, the leaderboard is re-ranked accordingly, helping users identify the systems that best match their review priorities.»)
  • Проверка учитывает как известные проблемы, так и новые находки, если оценивающая модель признаёт их верными. (подтверждено самой публикацией: доказательство; «Augmented precision, recall and F1 score also evaluate findings that do not match anything in the golden set. The judge independently determines whether those unmatched findings are true or false positives, allowing a reviewer to receive credit for valid issues that no producer in the golden set surfaced»)
  • По данным GitHub, инженеры, не участвовавшие в создании набора, согласились с оценками известных проблем в 96,6% случаев. (подтверждено самой публикацией: доказательство; «Before release, we asked senior engineers who had not participated in building the benchmark dataset to independently re-label every ground-truth finding from scratch. Their true/false-positive judgments agreed with ReviewBench 96.6% of the time.»)

Первоисточники:

оценка 55,5 из 100 · тип: анонс