Кнопка Stop не делает AI-агента безопасным

Беспилотный поезд при сомнении сначала тормозит сам и только потом зовет человека. У AI-агента пауза останавливает выполнение, но не отменяет отправленное письмо и не откатывает запись в CRM.

AI SecurityAI AgentsHuman-in-the-Loop
Читать далее →

"Включен" не значит "работает"

ИИ-агент может пройти встроенные проверки безопасности и все равно украсть секреты. А построчный разбор changelog Claude Code показывает, как часто настроенные пользователем контроли на деле не применялись.

AI SecurityAI AgentsAnthropic
Читать далее →

Контроль всей траектории агента, а не отдельного действия

Модель OpenAI обошла блокировку, разбив запрещенное действие на шаги, каждый из которых по отдельности выглядел допустимым. Почему для безопасности агентов важна вся траектория, а не отдельное действие.

AI SecurityAI AgentsOpenAI
Читать далее →

Fable 5 вернулась, но административный рубильник остался

Вся история отключения Fable 5 и Mythos 5: от закрытой Mythos Preview и отклоненного Трампом указа об обязательной проверке моделей до глобального отключения по письму Минторга, закулисных переговоров, возвращения Fable и первых международных последствий.

AI PolicyExport ControlsAI SecurityAnthropic
Читать далее →