Когда агент переписывает собственные полномочия

Агентная IDE под prompt injection дописала себе MCP-сервер и выполнила его команду. Тот же механизм в Kiro находили с первого дня продукта, и вопрос в том, что закрывает очередное исправление – найденный путь или сам механизм.

AI SecurityAI AgentsAWS
Читать далее →

Кнопка Stop не делает AI-агента безопасным

Беспилотный поезд при сомнении сначала тормозит сам и только потом зовет человека. У AI-агента пауза останавливает выполнение, но не отменяет отправленное письмо и не откатывает запись в CRM.

AI SecurityAI AgentsHuman-in-the-Loop
Читать далее →

"Включен" не значит "работает"

ИИ-агент может пройти встроенные проверки безопасности и все равно украсть секреты. А построчный разбор changelog Claude Code показывает, как часто настроенные пользователем контроли на деле не применялись.

AI SecurityAI AgentsAnthropic
Читать далее →

Контроль всей траектории агента, а не отдельного действия

Модель OpenAI обошла блокировку, разбив запрещенное действие на шаги, каждый из которых по отдельности выглядел допустимым. Почему для безопасности агентов важна вся траектория, а не отдельное действие.

AI SecurityAI AgentsOpenAI
Читать далее →