Уязвимости нейросетей: как злоумышленники используют аргументированные примеры

Аргументированные примеры – это поддельные входные данные, созданные злоумышленниками, чтобы сбить с толку модели машинного обучения. Эти примеры можно сравнить с оптическими иллюзиями для машин, которые заставляют их принимать неверные решения. Например, маленькое изменение изображения панды может заставить модель ошибочно классифицировать его как гиббона.

Недавние исследования показывают, что даже незначительные искажения, сделанные на обычных листах бумаги, способны обмануть системы. Это особенно тревожно в контексте автономных автомобилей, которые могут не распознать изменённые дорожные знаки. Исследования показали, что уязвимость к аргументированным примерам существует не только у классификаторов, но и у агентов глубокого обучения, потенциально ухудшающих их производительность.

Несмотря на усилия по обеспечению безопасности, традиционные методы защиты, такие как отпадение весов, неэффективны против аргументированных примеров. Ученые из OpenAI предлагают два подхода: аргументированное обучение, где модели обучаются на ошибочных данных, и защитная дистилляция, которая снижает риск неправильного распознавания. Однако даже эти меры защиты могут быть обойдены более мощными атаками. Проблема заключается в том, что объяснить и предсказать, как работают эти атаки, крайне сложно, что делает их защиту особенно трудной задачей.

Следите за новыми исследованиями и инициативами в этой области, так как адекватная защита против аргументированных примеров требует совместной работы исследователей.

*компания Meta Platforms Inc. признана экстремистской организацией, ее деятельность на территории России запрещена