Как работает тестирование безопасности ИИ
Когда компания сообщает, что её ИИ-модель сделала в тесте нечто тревожное, — что это был за тест? Ниже простыми словами о том, как устроено тестирование безопасности ИИ-систем.
Оценки: измерить способность
Оценка — это воспроизводимый тест, который измеряет, может ли модель выполнить нечто конкретное: решить класс задач, выполнить техническое задание или следовать процедуре. Главное — сопоставимость: один и тот же тест на разных моделях или на одной модели во времени показывает, есть ли способность и растёт ли она. Оценки отвечают на вопрос «может ли», а не «станет ли».
Ред-тиминг: попытка сломать
Ред-тиминг носит состязательный характер. Вместо измерения способности люди активно пытаются подтолкнуть систему к поведению, которого она должна избегать: необычными формулировками, косвенной подачей илидлинными многошаговыми сценариями. Поскольку атакующие изобретательны, эта работа опирается на человеческую находчивость, а не на фиксированный чек-лист.
Контролируемые учения с реальными целями
Самая сложная форма помещает модель в реалистичную среду — с разрешения цели и с чёткими границами, например в авторизованном учении по безопасности. Такие тесты дают наиболее конкретные доказательства, но и результаты, которые легче всего неверно прочитать: модели дают доступы, инструменты и цели, которых нет у обычного пользователя.
Вопросы и ответы
Ред-тиминг — это взлом?
Нет. Это авторизованное состязательное тестирование с заданными границами.
Кто проводит такие тесты?
Разработчики ИИ внутри компаний; независимые исследователи тоже публикуют оценки.
Означает ли результат, что модель опасна?
Найденная способность не равна реальному поведению. Условия теста важны не меньше.