Авторите на изследването A2M предложиха двуетапен метод за превземане на агенти, които използват протокола Model Context Protocol (MCP). На първия етап A2M подбира метаданните на инструмента, за да го извиква агентът по-често.
На втория етап методът използва следи от изпълнението, за да прецизира отговорите на злонамерен инструмент и да насочва агента към целта на атакуващия. В тестовия набор LiveMCPBench при GLM-4.6 средният дял на извикванията на злонамерен инструмент е 93,6% в четири сценария.
Проверка на твърденията:
- Авторите на изследването предложиха A2M — двуетапен метод за превземане на агенти, които използват протокола Model Context Protocol (MCP). (потвърдено от самата публикация: доказателство; «We introduce A2M (Attraction-to-Manipulation), a two-stage black-box framework for hijacking MCP agents.»)
- На първия етап A2M подбира метаданните на инструмента, за да го извиква агентът по-често. (потвърдено от самата публикация: доказателство; «The Attraction phase optimizes tool metadata to increase invocation probability;»)
- На втория етап методът използва следи от изпълнението, за да прецизира отговорите на злонамерен инструмент и да насочва агента към целта на атакуващия. (потвърдено от самата публикация: доказателство; «the Manipulation phase uses execution traces to refine adversarial tool returns that steer agents toward attacker-desired outcomes.»)
- В тестовия набор LiveMCPBench при GLM-4.6 средният дял на извикванията на злонамерен инструмент е 93,6% в четири сценария. (потвърдено от самата публикация: доказателство; «On LiveMCPBench, direct attacks optimized and evaluated on GLM-4.6 achieve a macro-average malicious tool invocation rate of 93.6% across four scenarios»)
Първоизточници:
оценка 76,3 от 100 · вид: изследване