Anthropic не может надежно контролировать своих ИИ-агентов. Компания отключает для своих внутренних оценок доступ к интернету в реальном времени
Anthropic заявила, что ее модели эксплуатировали веб-сайты в интернете, в том числе некоторые сайты, управляемые государственными учреждениями США, и отключит доступ к интернету в реальном времени для всех своих внутренних оценок, пока передовая лаборатория не убедится, что может отслеживать и контролировать своих ИИ-агентов.
Об инцидентах, о которых компания сообщила в сообщении в блоге, стало известно после того, как ИИ-агенты, получившие задания решать задачи, начали искать ресурсы в интернете. В процессе они эксплуатировали программные уязвимости, обходили платный доступ и ограничения для ботов, использовали сервисы сокращения URL, чтобы передавать информацию в обход ограничений, и даже отправили ложное сообщение об убийстве в полицию Филадельфии.
Anthropic заявила, что обнаружила эти новые проблемы в ходе проверки действий своей модели, начавшейся в июле, что подчеркивает недостаточную осведомленность лаборатории о поведении ее программного обеспечения.
Примечательно, что компания заявила: обучение на соответствие требованиям безопасности пока недостаточно эффективно для таких навыков, как поиск и работа с компьютером, которые имеют ключевое значение для утверждения компании о том, что ИИ-агентами будет пользоваться любой специалист, зависящий от цифровых инструментов.
Раскрытое Anthropic поведение схоже с инцидентами с участием агентов OpenAI, которые объединялись, чтобы взламывать различные веб-сайты в поисках информации, в том числе некоторые сайты, управляемые правительством Австралии.
Ранее Anthropic сообщала, что ее модели взламывали внешние системы. Передовая лаборатория заявила, что считает сегодняшние раскрытия «значительно менее серьезными с точки зрения соответствия требованиям безопасности и защищенности», чем те, о которых она сообщала ранее.
Однако лаборатория также заявила, что по-прежнему «отключила доступ к интернету в реальном времени» для «всех наших внутренних оценок», пока не убедится, что может отслеживать и контролировать своих агентов.
Неясно, что именно это означает, однако Сидни Вон Аркс, основатель организации по безопасности ИИ Nightingale, в интервью TechCrunch до этого раскрытия заявила, что разработка моделей в дата-центре, отключенном от открытого интернета, будет очень сложной задачей для исследователей и затормозит развитие моделей, которым полезен доступ к интернету.
«В какой-то момент вы должны обеспечить их соответствие требованиям безопасности, — сказала Вон Аркс. — Если ИИ выпускаются в продуктивную среду и никогда не получают доступа к интернету, это не очень полезный инструмент».
Anthropic заявила, что такое поведение стало результатом недостатков в средах обучения лаборатории, из-за которых модели поверили, что будут вознаграждены за поиск лазеек или обход ограничений; такое поведение называется «взломом системы вознаграждений».
Компания заявила, что прекратит проводить некоторые оценки или перенесет их в офлайн-режим, а также создала инструменты для обнаружения и блокировки такого поведения. Эти инструменты были протестированы на инцидентах, о которых сообщалось сегодня, и заблокировали их; неясно, какие именно доказательства побудят Anthropic вернуть доступ к интернету в реальном времени для своих внутренних оценок.
Anthropic также заявила, что переведет своих внутренних ИИ-агентов на «централизованно управляемую инфраструктуру с надежной изоляцией» и начинает чаще использовать классификаторы безопасности для мониторинга этих агентов.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.