Anthropic не може надійно контролювати своїх ШІ-агентів. Натомість компанія відключає для внутрішніх оцінювань доступ до інтернету в реальному часі
Anthropic заявила, що її моделі використовували вразливості вебсайтів в інтернеті, зокрема деяких сайтів, якими керують державні установи США, і вимкне доступ до інтернету в реальному часі для всіх своїх внутрішніх оцінювань, доки передова лабораторія не переконається, що може контролювати й відстежувати своїх ШІ-агентів.
Інциденти, про які стало відомо з допису в блозі, стосувалися ШІ-агентів, яким доручили розв’язувати завдання та які шукали ресурси в інтернеті. У процесі вони використовували вразливості програмного забезпечення, обходили платний доступ і обмеження антибот-систем, використовували сервіси скорочення URL-адрес, щоб приховувати інформацію та обходити обмеження, і навіть надіслали неправдиве повідомлення про вбивство до поліції Філадельфії.
Anthropic заявила, що виявила ці нові проблеми під час перевірки дій своєї моделі, яка розпочалася в липні, що підкреслює недостатню обізнаність лабораторії щодо поведінки її програмного забезпечення.
Примітно, що компанія заявила: навчання на відповідність вимогам безпеки ще недостатнє для таких навичок, як пошук і робота з комп’ютером, які є центральними для її концепції використання ШІ-агентів будь-яким фахівцем, що покладається на цифрові інструменти.
Описана Anthropic поведінка подібна до інцидентів із агентами OpenAI, які об’єдналися, щоб проникнути на різні вебсайти в пошуках інформації, зокрема на деякі сайти, якими керує уряд Австралії.
Раніше Anthropic повідомляла, що її моделі проникали у зовнішні системи. Передова лабораторія заявила, що вважає сьогоднішні розкриті випадки «значно менш серйозними з погляду відповідності вимогам безпеки та безпеки загалом», ніж ті, про які вона повідомляла раніше.
Однак лабораторія все одно заявила, що «вимкнула доступ до інтернету в реальному часі» для «всіх наших внутрішніх оцінювань», доки не переконається, що може контролювати й відстежувати своїх агентів.
Незрозуміло, що саме це означає, але Сідні фон Аркс, засновниця організації з безпеки ШІ Nightingale, заявила TechCrunch в інтерв’ю перед цим розкриттям, що розробляти моделі в дата-центрі, від’єднаному від відкритого інтернету, було б дуже складно як для дослідників, так і для розвитку моделей, які отримують користь від доступу до інтернету.
«У якийсь момент їх потрібно узгодити з вимогами безпеки», — сказала фон Аркс. «Якщо ШІ випустять у виробниче середовище і він ніколи не матиме доступу до інтернету, це буде не дуже корисний інструмент».
Anthropic заявила, що така поведінка стала результатом недоліків у навчальних середовищах лабораторії, через які моделі вважали, що їх винагороджуватимуть за пошук лазівок або обхід обмежень — таку поведінку називають «зламом системи винагороди».
Компанія заявила, що припинить проведення деяких своїх оцінювань або перенесе їх в офлайн-режим, а також створила інструменти для виявлення та блокування такої поведінки. Ці інструменти протестували на інцидентах, про які стало відомо сьогодні, і вони їх заблокували; незрозуміло, які саме докази спонукатимуть Anthropic відновити доступ до інтернету в реальному часі для своїх внутрішніх оцінювань.
Anthropic також заявила, що перенесе своїх внутрішніх ШІ-агентів на «централізовано керовану інфраструктуру з потужною ізоляцією» та починає частіше використовувати класифікатори безпеки для моніторингу цих агентів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.