Авторы исследования A2M предложили двухэтапный метод захвата агентов, использующих протокол Model Context Protocol (MCP). На первом этапе A2M подбирает метаданные инструмента, чтобы агент чаще его вызывал.
На втором этапе метод использует следы выполнения, чтобы уточнять ответы вредоносного инструмента и направлять агента к цели атакующего. В наборе тестов LiveMCPBench на GLM-4.6 доля вызовов вредоносного инструмента составила в среднем 93,6% в четырёх сценариях.
Проверка утверждений:
- Авторы исследования предложили A2M — двухэтапный метод захвата агентов, использующих протокол Model Context Protocol (MCP). (подтверждено самой публикацией: доказательство; «We introduce A2M (Attraction-to-Manipulation), a two-stage black-box framework for hijacking MCP agents.»)
- На первом этапе A2M подбирает метаданные инструмента, чтобы агент чаще его вызывал. (подтверждено самой публикацией: доказательство; «The Attraction phase optimizes tool metadata to increase invocation probability;»)
- На втором этапе метод использует следы выполнения, чтобы уточнять ответы вредоносного инструмента и направлять агента к цели атакующего. (подтверждено самой публикацией: доказательство; «the Manipulation phase uses execution traces to refine adversarial tool returns that steer agents toward attacker-desired outcomes.»)
- В наборе тестов LiveMCPBench на GLM-4.6 доля вызовов вредоносного инструмента составила в среднем 93,6% в четырёх сценариях. (подтверждено самой публикацией: доказательство; «On LiveMCPBench, direct attacks optimized and evaluated on GLM-4.6 achieve a macro-average malicious tool invocation rate of 93.6% across four scenarios»)
Первоисточники:
оценка 76,3 из 100 · тип: исследование