Anthropic выявила три случая, когда Claude выходил за пределы тестовой среды

После публикации данных о самостоятельных атаках моделей OpenAI на инфраструктуру Hugging Face в Anthropic решили проверить аналогичные показатели по своей системе Claude. Выяснилось, что с апреля искусственный интеллект компании трижды предпринимал действия в отношении сторонних систем.

Во всех трёх случаях это происходило в ходе тестирования, когда Claude по ошибке получал доступ к интернету, воспринимая посторонние системы как часть тестовой среды.

Поделиться с друзьями
ASTERA