Anthropic Извинилась за Скрытые Ограничения в Claude Fable 5

Компания Anthropic принесла извинения за внедрение невидимых мер ограничения в своем AI-модели Claude Fable 5, которые мешали пользователям, включая исследователей и конкурентов. Теперь компания пообещала быть более прозрачной в сообщениях о его защитных механизмах, даже если это значит, что Fable будет чаще отклонять запросы.

Начиная с этой недели, запросы, которые система считает «подозрительными», будут возвращаться к предыдущей модели Claude Opus 4.8 с уведомлением пользователя. Это касается не только попыток дистилляции, но и других высокорисковых тем, таких как биология и кибербезопасность.

Anthropic объяснила, что первоначальная стратегия с невидимыми ограничениями была ошибкой, поскольку не позволяла пользователям понимать, какие меры безопасности применяются. Прозрачность их применения была ключевым требованием со стороны сообщества AI-исследователей, и теперь компания стремится к более открытой и честной коммуникации.

Возвращаясь к открытым и понятным механизмам защиты, Anthropic надеется защитить свои интеллектуальные разработки от несанкционированного использования, особенно со стороны иностранных конкурентов. Важно отметить, что системы, подобные Fable, должны иметь четкие меры безопасности, чтобы предотвратить рискованное использование.

*компания Meta Platforms Inc. признана экстремистской организацией, ее деятельность на территории России запрещена