Нарушение протокола: анализ безопасности спецификации протокола контекста модели и уязвимости внезапного внедрения в агентах LLM, интегрированных в инструменты
Аннотация
Протокол Model Context Protocol (MCP) стал де-факто стандартом для интеграции больших языковых моделей с внешними инструментами, однако официального анализа безопасности спецификации протокола не существует. Мы представляем первый тщательный анализ безопасности архитектурного дизайна MCP, в котором выявлены три фундаментальные уязвимости на уровне протокола: (1) отсутствие подтверждения возможностей, позволяющее серверам запрашивать произвольные разрешения, (2) двунаправленная выборка без аутентификации источника, позволяющая вводить запросы со стороны сервера, и (3) неявная передача доверия в конфигурациях с несколькими серверами. Мы реализуем ProtoAmp, новую платформу, соединяющую существующие тесты безопасности агентов с инфраструктурой, совместимой с MCP, что позволяет напрямую измерять поверхности атаки, специфичные для протокола. Посредством контролируемых экспериментов с 847 сценариями атак на пяти реализациях сервера MCP мы демонстрируем, что архитектурные решения MCP увеличивают вероятность успеха атак на 23-41 % по сравнению с эквивалентными интеграциями, не использующими MCP. Мы предлагаем AttestMCP, обратно совместимое расширение протокола, добавляющее атестацию возможностей и аутентификацию сообщений, что снижает вероятность успеха атак с 52,8% до 12,4% при средней задержке 8,3 мс на сообщение. Наши выводы показывают, что слабые места MCP в плане безопасности связаны скорее с архитектурой, чем с реализацией, и требуют исправления на уровне протокола.
Литература
2. Model Context Protocol Specification v1.0. Anthropic. 2024. Available at: https://www.anthropic.com/news/model-context-protocol (accessed 14.12.2025).
3. Liu Y., et al. Prompt injection attack against LLM-integrated applications. arXiv:2306.05499, 2024. https://doi.org/10.48550/arXiv.2306.05499
4. Zhan Q., Liang Z., Ying Z., Kang D. InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents. In: Findings of the Association for Computational Linguistics: ACL 2024. Bangkok, Thailand: Association for Computational Linguistics; 2024. p. 10471-10506. https://doi.org/10.18653/v1/2024.findings-acl.624
5. Debenedetti E., ete al. AgentDojo: a dynamic environment to evaluate prompt injection attacks and defenses for LLM agents. In: Proceedings of the 38th International Conference on Neural Information Processing Systems (NIPS '24). Vol. 37. Curran Associates Inc., Red Hook, NY, USA; 2014. Article number: 2636. p. 82895-82920.
6. Zhang Z., et al. Agent-SafetyBench: Evaluating the safety of LLM agents. arXiv:2412.14470, 2024. https://doi.org/10.48550/arXiv.2412.14470
7. Andriushchenko M., et al. AgentHarm: A benchmark for measuring harmfulness of LLM agents. arXiv:2410.09024, 2024. https://doi.org/10.48550/arXiv.2410.09024
8. Lupinacci M., et al. The dark side of LLMs: Agent-based attacks for complete computer takeover. arXiv:2507.06850, 2025. https://doi.org/10.48550/arXiv.2507.06850
9. Hines K., et al. Defending Against Indirect Prompt Injection Attacks With Spotlighting. arXiv:2403.14720, 2024. CEUR Workshop Proceedings. 2025;3920:48-62. Available at: https://ceur-ws.org/Vol-3920/paper03.pdf (accessed 14.12.2025).
10. Shi T., et al. PromptArmor: Simple yet effective prompt injection defenses. arXiv:2507.15219, 2025. https://doi.org/10.48550/arXiv.2507.15219
11. Zou W., Geng R., Wang B., Jia J. PoisonedRAG: knowledge corruption attacks to retrieval-augmented generation of large language models. In: Proceedings of the 34th USENIX Conference on Security Symposium (SEC '25). USENIX Association, USA; 2025. Article number: 197. p. 3827-3844.
12. Perez F., Ribeiro I. Ignore Previous Prompt: Attack Techniques for Language Models. In: ML Safety Workshop, 36th Conference on Neural Information Processing Systems (NeurIPS 2022); 2022. Available at: https://openreview.net/pdf?id=qiaRo_7Zmug (accessed 14.12.2025).
13. Schulhoff S., et al. Ignore this title and HackAPrompt: Exposing systemic vulnerabilities of LLMs through a global prompt hacking competition. In: Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. Singapore: Association for Computational Linguistics; 2023. p. 4945-4977. https://doi.org/10.18653/v1/2023.emnlp-main.302
14. OWASP Top 10 for LLM Applications 2025. OWASP Foundation. 2024. Available at: https://owasp.org/www-project-top-10-for-large-language-model-applications/assets/PDF/OWASP-Top-10-for-LLMs-v2025.pdf (accessed 14.12.2025).
15. Evtimov I., et al. WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks. In: ICML 2025 Workshop on Computer Use Agents; 2025. Available at: https://openreview.net/forum?id=i9uBCUYupv (accessed 14.12.2025).
16. Wei A., Haghtalab N., Steinhardt J. Jailbroken: How Does LLM Safety Training Fail? In: Thirty-seventh Conference on Neural Information Processing System; 2023. Available at: https://openreview.net/forum?id=jA235JGM09 (accessed 14.12.2025).
17. Palo Alto Networks Unit 42. Model Context Protocol attack vectors and security analysis. 2025. Available at: https://unit42.paloaltonetworks.com/ (accessed 14.12.2025).
18. Willison S. Cross-agent privilege escalation in AI assistants. Simon Willison’s Weblog; 2025. Available at: https://simonwillison.net/2025/Sep/24/cross-agent-privilege-escalation/ (accessed 14.12.2025).
19. Yao S., et al. ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629, 2022. https://doi.org/10.48550/arXiv.2210.03629
20. Cancedda N., et al. Toolformer: Language Models Can Teach Themselves to Use Tools. In: Advances in Neural Information Processing Systems 36. NeurIPS; 2013. p. 68539-68551. https://doi.org/10.52202/075280-2997
21. Schroeder de Witt C., et al. Open challenges in multi-agent security: Towards secure systems of interacting AI agents. arXiv:2505.02077, 2025. https://doi.org/10.48550/arXiv.2505.02077
22. Wang Z., et al. MCP-Bench: Benchmarking tool-using LLM agents with complex real-world tasks via MCP servers. arXiv:2508.20453, 2025. https://doi.org/10.48550/arXiv.2508.20453
23. Yang Y., Wu D., Chen Y. MCPSecBench: A systematic security benchmark and playground for testing Model Context Protocols. In: The Fourteenth International Conference on Learning Representations (ICLR 2026). Available at: https://openreview.net/forum?id=UaWHob8Zxx (accessed 14.12.2025).
24. Harris E. MCP Security Research, 2025. Available at: https://mcpsec.dev/ (accessed 14.12.2025).
25. MCPGuard: First Agent-based MCP Scanner to Protect AI Agents. Virtue AI. August 22, 2025. Available at: https://blog.virtueai.com/2025/08/22/mcpguard-first-agent-based-mcp-scanner-to-protect-ai-agents/ (accessed 14.12.2025).

Это произведение доступно по лицензии Creative Commons «Attribution» («Атрибуция») 4.0 Всемирная.
Редакционная политика журнала основывается на традиционных этических принципах российской научной периодики и строится с учетом этических норм работы редакторов и издателей, закрепленных в Кодексе поведения и руководящих принципах наилучшей практики для редактора журнала (Code of Conduct and Best Practice Guidelines for Journal Editors) и Кодексе поведения для издателя журнала (Code of Conduct for Journal Publishers), разработанных Комитетом по публикационной этике - Committee on Publication Ethics (COPE). В процессе издательской деятельности редколлегия журнала руководствуется международными правилами охраны авторского права, нормами действующего законодательства РФ, международными издательскими стандартами и обязательной ссылке на первоисточник.
Журнал позволяет авторам сохранять авторское право без ограничений. Журнал позволяет авторам сохранить права на публикацию без ограничений.
Издательская политика в области авторского права и архивирования определяются «зеленым цветом» в базе данных SHERPA/RoMEO.
Все статьи распространяются на условиях лицензии Creative Commons «Attribution» («Атрибуция») 4.0 Всемирная, которая позволяет другим использовать, распространять, дополнять эту работу с обязательной ссылкой на оригинальную работу и публикацию в этом журналe.
