Авторы исследования разобрали 200 записей работы четырёх ИИ-агентов, чтобы выяснить причины затрат и неудач при поиске уязвимостей. По их данным, на поиск и разбор нужного кода, анализ уязвимостей и разработку способов их воспроизвести пришлось 60,4% токенов.

Токены — единицы текста, которые обрабатывает языковая модель.

Больший расход, по данным авторов, не всегда давал лучший результат. Авторы также предложили AVRI, интерфейс для поиска уязвимостей с помощью ИИ-агентов, который помогает сохранять и повторно использовать сведения о коде и гипотезы.

На 20 тестовых задачах, по данным авторов, AVRI снизил общие затраты ИИ-агентов Codex и OpenCode на 18% и 23,7% соответственно, сохранив долю успешных решений.

Проверка утверждений:

  • По данным авторов исследования, на поиск и разбор нужного кода, анализ уязвимостей и разработку способов их воспроизвести пришлось 60,4% токенов. (подтверждено самой публикацией: доказательство; «Second, code localization and understanding, together with vulnerability reasoning and trigger design, account for 60.4% of tokens and represent the two leading bottlenecks in failed runs.»)
  • Авторы разобрали 200 записей работы четырёх ИИ-агентов при поиске уязвимостей, чтобы выяснить причины затрат и неудач. (подтверждено самой публикацией: доказательство; «We diagnose these costs and failures through a multi-axis open-coding study of 200 CyberGym traces, spanning four agents (i.e., Codex, OpenCode, Cybench, and EnIGMA) under an unaided baseline and four existing efficiency methods.»)
  • По данным авторов, больший расход не всегда давал лучший результат. (подтверждено самой публикацией: доказательство; «First, different agents vary substantially in success and cost, and higher spending does not consistently yield better outcomes.»)
  • Авторы предложили AVRI, который помогает ИИ-агентам сохранять и повторно использовать сведения о коде и гипотезы. (подтверждено самой публикацией: доказательство; «Motivated by these findings, we present AVRI, an Agent-centric Vulnerability Reasoning Interface built around a persistent Bidirectional Evidence Trace (BET). BET connects how the harness consumes input with the conditions required to make a selected operation unsafe, retaining source-supported correspondences alongside the agent’s hypotheses and open questions. Reading, analysis, and persistence commands help agents build and reuse this evidence rather than repeatedly retrieve and reconstruct it.»)
  • По данным авторов, на 20 тестовых задачах AVRI снизил общие затраты ИИ-агентов Codex и OpenCode на 18% и 23,7% соответственно, сохранив долю успешных решений. (подтверждено самой публикацией: доказательство; «On 20 evaluation tasks, AVRI reduces total cost by 18.0% for Codex and 23.7% for OpenCode while preserving success rates and improving or maintaining recall.»)

Первоисточники:

оценка 52,2 из 100 · тип: исследование