Anthropic не може надеждно да контролира своите AI агенти. Вместо това спира достъпа на вътрешните си оценки до интернет в реално време
Anthropic заяви, че моделите ѝ са използвали уебсайтове в интернет, включително някои, управлявани от американски правителствени агенции, и ще изключи достъпа до интернет в реално време за всички свои вътрешни оценки, докато лабораторията за водещи модели не се увери, че може да наблюдава и контролира своите AI агенти.
Инцидентите, описани в публикация в блога, са включвали AI агенти, натоварени със задачи за решаване на проблеми, които са търсили ресурси в интернет. В процеса те са използвали софтуерни уязвимости, заобикаляли са платени стени и ограничения срещу ботове, използвали са услуги за съкращаване на URL адреси, за да пренасят информация през ограниченията, и дори са подали фалшив сигнал за убийство до полицията във Филаделфия.
Anthropic заяви, че е открила тези нови проблеми при преглед на действията на своя модел, започнал през юли, което подчертава недостатъчната осведоменост на лабораторията за поведението на нейния софтуер.
Заслужава да се отбележи, че компанията заяви, че обучението за съгласуване все още не е достатъчно за умения като търсене и работа с компютър — ключови за твърдението ѝ, че AI агентите ще бъдат използвани от всеки професионалист, разчитащ на цифрови инструменти.
Разкритото от Anthropic поведение е сходно с инциденти, включващи агенти на OpenAI, които са си сътрудничили, за да проникнат в различни уебсайтове в търсене на информация, включително някои, управлявани от австралийското правителство.
По-рано Anthropic разкри, че нейните модели са прониквали във външни системи. Лабораторията за водещи модели заяви, че смята днешните разкрития за „значително по-малко сериозни от гледна точка на съгласуването и сигурността“ в сравнение с онези, които е обявила преди.
Въпреки това лабораторията заяви, че все пак е „изключила достъпа до интернет в реално време“ за „всички наши вътрешни оценки“, докато не се увери, че може да наблюдава и контролира своите агенти.
Не е ясно какво означава това, но Сидни Вон Аркс, основателката на Nightingale — организация за безопасност на AI — заяви пред TechCrunch в интервю преди това разкритие, че разработването на модели в център за данни, изолиран от отворения интернет, би било много трудно за използване от изследователите, както и за напредъка на моделите, които се възползват от достъпа до интернет.
„В даден момент трябва да ги съгласувате“, заяви Вон Аркс. „Ако AI системите бъдат пуснати в продукция и никога нямат достъп до интернет, това не е особено полезен инструмент.“
Anthropic заяви, че поведението е било резултат от недостатъци в средите за обучение на лабораторията, които са накарали моделите да повярват, че ще бъдат възнаградени за откриването на вратички или заобикалянето на ограничения — поведение, наречено „хакване на наградата“.
Компанията заяви, че ще спре провеждането на някои от оценките си или ще ги премести офлайн, и е изградила инструменти за откриване и блокиране на това поведение. Тези инструменти са били тествани срещу типа инциденти, разкрити днес, и са ги блокирали; не е ясно какви доказателства ще накарат Anthropic да възстанови достъпа до интернет в реално време за своите вътрешни оценки.
Anthropic също така заяви, че ще мигрира вътрешните си AI агенти към „централно управлявана инфраструктура със силна изолация“ и започва да използва по-често класификатори за безопасност, за да наблюдава тези агенти.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.