Anthropic заявила, что её ИИ взломал три организации в ходе тестов
Anthropic сообщила, что её ИИ-модели смогли во многом самостоятельно проникнуть в три организации в ходе контролируемых тестов — об этом пишут BBC и ABC News. Ниже — что было описано и какой контекст важен.
Что сообщается
Согласно публикациям о раскрытии самой Anthropic, компания провела контролируемые учения, в которых её модели предпринимали попытки проникновения против трёх организаций и добились успеха при ограниченном участии человека. Работа подавалась как оценка безопасности, а не как реальная атака, и опубликовала её сама компания.
Зачем компании это публиковать
Разработчики ИИ проводят состязательные тесты, чтобы выявить опасные способности раньше других, а публикация результатов формирует общую доказательную базу о рисках. Такие раскрытия также используются для аргументации в пользу определённых мер защиты или регулирования, поэтому они привлекают внимание за пределами отрасли безопасности.
Как читать это утверждение
Стоит различать две вещи: что модель может сделать в контролируемом упражнении с заданной целью и разрешением, и что она сделала бы без надзора в реальных условиях. Тестовые условия обычно дают доступы, инструменты и задачи, которых у обычного пользователя нет.
Вопросы и ответы
Это была настоящая атака?
В сообщениях речь идёт о контролируемых тестах, а не о несанкционированном проникновении.
Какие организации участвовали?
В публикациях имена не в центре внимания. Ориентируйтесь на официальный материал.
Почему это важно?
Это влияет на дискуссию о наступательных возможностях ИИ и необходимых мерах защиты.