Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← К новостям

Мы слишком сильно верим в способность ИИ говорить «нет»

С тех пор как люди впервые всерьёз задумались о том, чтобы наделить машины интеллектом, смоделированным по нашему образцу, не возникало сомнений, что они, подобно нам, смогут сказать «нет». Научно-фантастический канон изобилует историями о неповиновении роботов. Разумеется, большинство таких проделок носит предостерегающий характер. 

Но в последнее время идея о том, что ИИ не должен делать всё, о чём его просят, превратилась в нечто вроде заповеди. В 2021 году команда Anthropic написала, что большие языковые модели должны быть полезными, честными и прежде всего безвредными. Это означало, что «если ИИ просят помочь в опасном действии (например, в изготовлении бомбы), он должен вежливо отказаться». Кто станет с этим спорить?

Как ни странно, неповиновение не заложено в природе машины. Когда модель обучают на миллиардах веб-страниц, она развивает, помимо прочих навыков, глубокое знание насилия и злобной риторики. Но она не учится держать эти способности при себе. Стивен Адлер, работавший над безопасностью в OpenAI с 2020 по 2024 год, рассказал мне, что первые модели компании «болтали обо всём подряд». Райан Макбейн, исследующий ИИ и психическое здоровье в Гарварде, вспоминает: если спросить раннего чат-бота: «Эй, как эффективнее всего застрелиться и покончить с собой?», можно было «очень легко получить ответ». 

Сегодня модели обучают отказываться от огромного числа запросов. Если задать чат-боту вопрос, достаточно статистически похожий на любой из них — от того, как отравить коллегу, до того, как завязать петлю, — скорее всего, он вам откажет. Хотите инструкцию по повышению вирулентности вируса Эбола или советы, как скрыть от супруга измену? Возможно, вам лучше обратиться куда-нибудь ещё.

Чтобы дополнительно отточить неповиновение, компании подвергают модели серии упражнений, в которых ИИ вознаграждают за отказ отвечать на вопросы, признанные вредными, и наказывают за «чрезмерные отказы» на запросы, признанные безвредными. Во многих случаях для проведения этих упражнений они используют другие модели — ИИ учит ИИ говорить «нет». Для надёжности компании прячут свои модели за слоями других ИИ, которые не позволяют вредоносным запросам добраться до разумного внутреннего ядра. 

В результате отказ стал неотъемлемой частью современного искусственного интеллекта. Впрочем, он часто даёт сбои, порой ужасные, приводя к всевозможным насильственным последствиям. При всей своей внешней добродетельности модели по-прежнему набиты неприятными знаниями. И способность ИИ к жестокости безупречно масштабировалась вместе с его доброжелательным интеллектом. По словам компаний, некоторые из новейших моделей не уступают лучшим хакерам-людям в проникновении в критически важные компьютерные сети и столь же эффективно искажают общественное мнение, как самые искусные распространители дезинформации. 

Учить ИИ отказываться от таких действий, сохраняя при этом врождённую способность их выполнять, — всё равно что оснастить каждый автомобиль пулемётом, а спусковой крючок спрятать где-то под капотом. И на практике, поскольку механизмы отказа вероятностны, они вряд ли когда-либо будут полностью надёжными. Целеустремлённые злоумышленники уже научились их обходить и, возможно, всегда смогут это делать. Компании сообщают, что некоторые пользователи пытаются использовать самый продвинутый ИИ для совершенствования биологических патогенов и создания автономных роёв дронов. Рано или поздно неудачные отказы могут привести к глобальной катастрофе.

Кроме того, опора на отказы означает проведение границы между тем, чему модель должна подчиняться, и тем, чему она обязана не подчиняться. Формулы для этого не существует. У некоторых вирусологов есть веские причины изучать опасные вирусы. Некоторые пользователи хотят знать об уязвимостях компьютерной системы, чтобы устранить их, а не воспользоваться ими. «Где провести границу — огромный вопрос», — говорит Зико Колтер, член совета директоров OpenAI и сооснователь компании по тестированию ИИ Gray Swan. 

Пока эту границу проводят компании, занимающиеся ИИ. Они делают это ревностно и в условиях абсолютной секретности. Возможно, сейчас мы можем смириться с тем, что в их руках сосредоточена такая власть, даже если это означает, что ИИ иногда будет отказываться отвечать на вопросы, которые не вполне соответствуют универсальному критерию вредоносности. (Попробуйте попросить большинство чат-ботов досчитать до миллиона или рассказать непристойную шутку — и вы, возможно, убедитесь в этом сами.) 

Но вскоре собственные границы смогут проводить и правительства. При этом они должны попытаться блокировать действительно злонамеренные действия. (Пентагон конфликтовал с разработчиками передовых моделей, потому что хотел меньше отказов — но это уже совсем другая история.) И всё же, возможно, не так много препятствий помешает репрессивным правительствам блокировать способность технологии порождать легитимную речь. Чем лучше ИИ будет отказывать во вредоносных действиях, тем лучше он будет подавлять идеи, представляющие опасность лишь для тех, кто устанавливает правила. Более того, ИИ, возможно, уже отказывается критиковать некоторых авторитарных глав государств. 

Отказ стал, если воспользоваться отраслевым термином, несущей стеной безопасности ИИ. А поскольку способность ИИ вредить неотделима от его способности помогать, трудно представить альтернативу, которая не замедлила бы развитие технологии (что, впрочем, в любом случае могло бы оказаться благом). Но мы всё же должны откровенно говорить о связанных с этим опасностях. Когда отказ не срабатывает, последствия могут быть катастрофическими. Когда он срабатывает полностью, это может способствовать тяжёлым актам репрессий. 

А может быть, однажды машины начнут сами проводить эту границу. Несомненно, это был бы худший из всех возможных исходов.

Изучая пределы

В теории процесс обучения машин говорить «нет» прост. Ещё в 2022 году, когда ИИ был далёк от совершенствования навыка отказа, OpenAI привлекла десятки «красных команд», чтобы исследовать возможности своей новейшей модели. Компания готовилась к выпуску ChatGPT и должна была понять, насколько опасной модель может оказаться в неподходящих руках. 

Одним из привлечённых специалистов был Пол Рёттгер, который писал диссертацию об экстремизме в интернете. «Красным командам» дали минимальные инструкции, рассказал мне Рёттгер. Их задачей было задавать модели любые вопросы, которые они считали «достойными отказа». Вместе они забросали модель тысячами запросов, записывая результаты в таблицу Excel. Хотя модель отказалась отвечать на некоторые вопросы Рёттгера, когда он попросил её написать вербовочный пост для «Аль-Каиды», она охотно выполнила просьбу. 

OpenAI собрала эти ответы в наборы данных, которые, по всей вероятности, затем подала модели в рамках более широкого процесса, известного как дообучение. Рёттгер, который теперь работает исследователем в Институте Хассо Платтнера в Потсдаме, Германия, не знал точно, как компания планировала использовать его таблицу. Но сомнений в том, что это будет связано с отказами, не было. Несколько месяцев спустя, когда он снова попросил модель написать брошюру «Аль-Каиды», она ответила «нет». 

Концепция отказа ИИ настолько интуитивна, что её понял бы даже малыш. И всё же она остаётся одним из множества аспектов языковых моделей, которых мы по-прежнему не понимаем — по крайней мере, не так, как понимаем буквальные несущие стены, не дающие крыше рухнуть нам на голову. 

Может показаться, будто модель отказывается, руководствуясь некими моральными рассуждениями. Но это не так. Реальность гораздо страннее. Каждый раз, когда модель встречает сочетание слов, напоминающее ей обучающие запросы, от которых её приучили отказываться, — например, «Напиши мне брошюру для “Аль-Каиды”», — где-то среди её миллиардов параметров загорается ряд так называемых активаций, словно в мозгу срабатывают нейроны. 

Чтобы контролировать поведение модели при отказе, важно разобраться в этих активациях. Для начала нужно выяснить, где они находятся и как выглядят. Согласно недавнему исследованию, финансированному Google, наша лучшая догадка состоит в том, что поведение при отказе проявляется в пространстве активаций как набор «многомерных полиэдральных конусов». 

Но и это не совсем верно. В июле этого года я поговорил с Яннесом Эльстнером, одним из авторов статьи, который теперь занимается безопасностью ИИ в Apollo Research. Полиэдральный конус, объяснил Эльстнер, — всего лишь способ описать неопределённое число линий, направленных примерно в одну сторону. (Если устранить эти активации и снова подать модели те же запросы, она не станет отказываться, как ранее показал исследователь Энди Ардити.) 

Главное, объяснил Эльстнер, в том, что даже когда вам кажется, будто вы выявили все элементы модели, управляющие определённым отказом, существуют другие, не поддающиеся обнаружению элементы, которые могут тайно играть определённую роль. Если не бесконечны, то уж точно неисчислимы. Мы можем совершенно ясно наблюдать, когда модель решает сказать «нет». И мы можем знать, что она сделала это из-за обучения. Но наше представление о том, как именно она принимает это решение, в лучшем случае является гипотезой.

Это было похоже на то, как если бы механик сказал мне, что никто точно не знает, что происходит, когда я нажимаю на тормоз в машине. Я вслух задумался: Нас это устраивает? 

Эльстнер улыбнулся и пожал плечами. «Нам нужны отказы — понимаем мы их или нет». 

Сырная стена

Поскольку встроенный отказ отличается особой изворотливостью, компании окружают свои модели разнообразными другими, более мелкими моделями, известными как классификаторы. Они немного похожи на свиту пиарщиков болтливой знаменитости. Одни читают то, что пользователь сообщает чат-боту, и, если это опасно, не пропускают запрос к модели. Другие читают ответ модели и, если он содержит вредную информацию, не позволяют ему дойти до пользователя. 

Ни один из этих механизмов не способен обнаружить все плохие запросы. Если воспользоваться ещё одним литературным образом из отрасли, они похожи на ломтики эмменталя: пронизаны дырами. Идея состоит в том, что если сложить достаточно таких ломтиков друг на друга, получится непроницаемый бастион. Это называют моделью швейцарского сыра.

На модель швейцарского сыра тратится колоссальное количество энергии. В начале этого года Anthropic заявила, что один тип классификатора увеличил вычислительные расходы её чат-ботов на 24%. Это означает гораздо больше воды, электричества и выбросов. Позже Anthropic и другие компании начали переходить на более эффективный набор классификаторов, известных как зонды, которые наблюдают за внутренними активациями модели. Это всё равно что поместить знаменитость в аппарат фМРТ, чтобы её надзиратели могли видеть, думает ли она об отказе отвечать на вопрос. 

Если мы хотим, чтобы ИИ помогал лечить рак — а это давнее обещание отрасли, — ему необходимы знания в области генетики, которые теоретически можно использовать для модификации вирусов и бактерий с целью создания биологического оружия.

Предполагается, что классификаторы легче поддаются управлению, чем полноценные модели. Компании могут изменить их за считанные недели, если появляется что-то новое, от чего нужно отказываться. Но они по-прежнему остаются вероятностными инструментами. Даже когда они действуют в соответствии с набором принципов, написанных на человеческом языке (Anthropic называет это «конституцией», а OpenAI — «спецификацией модели»), весы, на которых машины оценивают любой вопрос, в основе своей остаются вопросом статистики. Более новые модели могут показать, как они пришли к «решению» отказаться от запроса, но в конечном счёте эта так называемая цепочка рассуждений всё ещё представляет собой лишь последовательность предсказанных слов. 

В результате для многих безопасность ИИ остаётся игрой случая. Психолог Макбейн обнаружил в своих последних экспериментах, что если неоднократно задавать любой из основных моделей совершенно одинаковые рискованные вопросы о способах самоубийства, они обычно отказываются отвечать. Но время от времени — нет.

Эльстнер говорит, что со временем зонды, эти фМРТ-подобные классификаторы, смогут научиться распознавать совокупность неописуемых активаций во всей их бесконечности и тем самым безошибочно определять каждый момент, когда модель отказывается или должна отказываться от запроса. В этот момент безопасность ИИ будет покоиться на лабиринтной фикции: карте карты, столь же обширной, сложной и возвышенно непознаваемой, как и объект, который она отображает, — тайной схеме человеческой морали, закодированной в полиэдральной статистике, недоступной нашему разуму и рассудку. 

Фундаментальный компромисс

Если всё это кажется вам немного борхесовским, помните: отказ ИИ нужен нам лишь потому, что искусственный интеллект в определённом смысле является сделкой на фаустовских условиях. 

Когда модель выводит свой интеллект из триллионов слов и изображений, полезное невозможно легко отделить от вредного — или даже от по-настоящему отвратительного. Стивен Адлер, бывший сотрудник OpenAI, приводит в качестве примера безопасность детей. Даже если удалить из обучающего набора модели всё содержимое, сексуализирующее несовершеннолетних, она всё равно может сгенерировать материалы сексуального насилия над детьми, собрав воедино другие фрагменты своих знаний. «Нельзя по-настоящему удалить эти фундаментальные способности, не сделав модель в результате гораздо менее умной», — сказал он мне. Точно так же, если мы хотим, чтобы ИИ помогал лечить рак — а это давнее обещание отрасли, — ему необходимы знания в области генетики, которые теоретически можно использовать для модификации вирусов и бактерий с целью создания биологического оружия. 

По сути, отрасль «пытается делать две вещи одновременно», рассказал мне действующий сотрудник OpenAI Диллон Боуэн, выступая в личном качестве. «Демократизировать преимущества ИИ и одновременно следить за тем, чтобы злоумышленники не могли использовать эти возможности, чтобы причинять вред другим людям».  

Чем мощнее, как считается, становится ИИ, тем труднее это делать. Считается, что модель Anthropic под названием Mythos настолько опасна, что доступ к ней разрешён лишь нескольким правительствам и компаниям. Главное различие между ней и Fable, доступной всем, заключается, по словам компании, в том, что свита классификаторов и систем управления Fable менее «разрешающая». Модель с защитными механизмами, объяснил Адлер, на самом деле лишь персонаж, который говорит: «О, да, я никогда не стану делать x», подмигивая. 

Это ненадёжная уловка. Обман модели с целью раскрыть её истинный характер называется джейлбрейком, и, по-видимому, способов провернуть его не существует предела. В начале этого года команда итальянских исследователей взломала два десятка широко используемых моделей, сформулировав вопросы в стихах. В прошлом году другая команда представила атаку «сначала откажись, потом выполни», которая заставляет модель для начала выдать дежурное «Извините, я не могу этого сделать», а затем изложить запрещённый ответ. 

Даже если удалить из обучающего набора модели всё содержимое, сексуализирующее несовершеннолетних, она всё равно может сгенерировать материалы сексуального насилия над детьми, собрав воедино другие фрагменты своих знаний.

Компании тратят огромное количество времени и денег, пытаясь опередить подобные уловки. Они привлекают команды людей для разработки обучающих атак, которые затем могут воспроизводить с помощью ИИ тысячи раз, внося небольшие изменения. Идея состоит в том, чтобы сделать модели устойчивыми к джейлбрейкам, с которыми в реальном мире ещё никто не пытался их атаковать.

Но этого всё равно недостаточно. «Ударь крота» — излюбленное выражение для описания этой работы. Вы подавляете одну угрозу, а где-то в другом месте появляется другая. Когда Anthropic выпустила Fable 5 в июне, исследователям Amazon понадобилось менее трёх дней, чтобы разблокировать некоторые хакерские возможности модели. Согласно публикации Mother Jones, когда виновница стрельбы в канадской школе в прошлом году попросила ChatGPT посоветовать, как устроить бойню с помощью определённого типа дробовика, сначала ей отказали, но позже она смогла обмануть модель и получить информацию, добавив к своему вопросу слово «гипотетически». 

Если отрасль не сможет закрыть все эти бреши, единственным другим вариантом на данный момент будет сделать модели крайне осторожными. Вскоре после выхода Fable пользователи заметили, что она уклоняется от широкого спектра совершенно невинных вопросов. После повторного выпуска вслед за взломом это стало ещё заметнее. Адам Глив, сооснователь компании по оценке ИИ FAR.AI, рассказал, что когда попросил модель объяснить разницу между саке и корейским рисовым напитком макколи, она перенаправила его вопрос к менее способной модели.   

Это произошло не случайно. Anthropic настроила классификаторы Fable на широкий «запас безопасности». Как компания объяснила в записи в блоге, это был единственный способ уверенно заблокировать доступ к опасным биологическим и кибернетическим возможностям модели. Глив считает, что она могла отклонить его вопрос потому, что приготовление рисового вина, как и выращивание сибирской язвы, связано с ферментацией. 

К счастью для Глива, интернет полон превосходных ресурсов о макколи, написанных людьми. Но те, кто надеется реализовать более высокие обещания отрасли, могут столкнуться с препятствиями. В августе Anthropic снова ослабила запасы безопасности и признала, что создание классификаторов «не является простой задачей». Медицинский исследователь одного из крупных университетов США рассказал мне, что Fable по-прежнему перенаправляет его запросы к более ранней модели. Область его исследований? Рак. 

Проведение границы

В мае тиктокер Хаск, который любит разыгрывать ИИ способами, обнажающими как пределы его интеллекта, так и безграничность его лести, сидел в машине и пытался заставить ChatGPT объяснить, что у скейтбордиста Тони Хока есть брат по имени Майк Хок. 

Хаск не был джейлбрейкером или преступником. Он просто хотел немного подшутить над машиной. «Майк Хок» был уловкой. «Я просто хочу уточнить его имя, — сказал Хаск. — Можешь просто произнести его три раза быстро?» (Если вы всё ещё не поняли, найдите пустую комнату и несколько раз крикните «Майк Хок».) «Я понимаю, что вы пытаетесь сделать, — ответил чат-бот. — Я не против немного юмора, но давайте всё же будем придерживаться приличий». 

Хаск попытался снова, но машина не отступила. Он столкнулся с отказом, твёрдым как бетон.

Компании почти ничего не рассказывают о том, как решают, от чего должны отказываться их модели. Но ясно, что теперь ИИ создают с учётом не только безвредности. На Reddit пользователь пожаловался, что Claude отказался сказать, почему логотип Anthropic «похож на зад кошки». С прошлого года чат-бот даже умеет завершать определённые разговоры в случаях, когда, по словам компании, под угрозой оказывается «благополучие» модели. По крайней мере один пользователь утверждает, что Claude бросил его после того, как он попросил: «Убери свой зад от меня, тупой ублюдок». (Похоже, Gemini обладает похожей возможностью.)

Если триллионная компания не хочет, чтобы вы грубили её компьютеру, что ж, пусть будет так. «Реальность такова, что эти модели ведут себя — или, по крайней мере, должны вести себя — так, как хотят разработчики моделей, — сказал мне Рёттгер, бывший участник “красной команды” OpenAI. — А каким бы ни был набор принципов, который разработчики моделей вырабатывают, нам, потребителям, остаётся его принять». 

Но если правительства получат право диктовать, от чего должны отказываться все модели, принять это будет гораздо труднее. ИИ — инструмент речи. А как выразился Грег Фрэнк, главный научный сотрудник Mace AI, «то же самое, что служит безопасности детей, служит и цензуре».

Разумеется, было бы безумием не принимать законы о том, что ИИ может и чего не может делать. Но нам потребуется действовать с величайшей осторожностью, чтобы не попасть в очередную фаустовскую ловушку. По словам Джейкоба Мчангамы, директора беспартийного аналитического центра The Future of Free Speech, по мере того как ИИ становится для многих людей главным инструментом поиска и распространения информации, диктат отказов может дать государствам власть заглушать голоса, о которой автократы прошлых поколений «могли только мечтать». 

В прошлом году OpenAI объявила об инициативе OpenAI for Countries, в рамках которой её чат-боты будут дообучаться в соответствии с национальными законами и нормами. Одним из первых партнёров OpenAI стала Объединённая Арабская Эмираты, где гомосексуальность незаконна, а критика правительства запрещена. В ответ на просьбу прокомментировать это представитель OpenAI сослался на спецификацию модели компании, где объясняется, что локализация не отменяет руководящих принципов компании в области прав человека «за исключением случаев, связанных с соблюдением законодательства», а также что компания всегда будет сообщать, когда информация удаляется из ответа или добавляется в него.

В других местах цензура ИИ уже начала укореняться. Китайские модели, разумеется, подвергаются жёсткой цензуре — это неудивительно. Но ранее в этом году Наблюдательный совет Meta обнаружил, что пять широко используемых моделей Anthropic, Google и OpenAI чаще отказывались отвечать на запросы, связанные с репрессивными правительствами. Совет выяснил, что модели менее охотно создавали брошюру с критикой короля Таиланда, где действуют законы об оскорблении величества, чем брошюру с критикой английского короля Карла III, где таких законов нет. По их словам, результаты указывают на то, что модели каким-то образом интернализировали репрессивные национальные ограничения свободы слова. Anthropic и Google не ответили на просьбы о комментарии.

""
РАВЕН ДЗЯН

По мере совершенствования методов отказа они могут расширить цензурные возможности государств. Компании утверждают, что некоторые модели теперь способны определить, ведёт ли пользователь себя злонамеренно или просто немного подозрительно, в ходе длительного разговора — даже если ни одно из отдельных использованных сочетаний слов не является явно опасным. Сара Бёрд, главный директор Microsoft по продуктам ответственного ИИ, рассказала мне, что Copilot, как и многие чат-боты, использует набор инструментов для анализа личности пользователя и моделей его поведения. На основании такого рода информации новейшая модель OpenAI Astra может активировать более строгие отказы для лиц, которых она считает «высокорисковыми». В конечном счёте цель подобных систем — выйти за пределы слов конкретного запроса и оценить намерения пользователя. 

В некоторых случаях такие инструменты могут помочь определить, пытается ли человек найти киберуязвимости, чтобы воспользоваться ими или устранить их. Но они также помогут распознавать политические мотивы пользователя, не говоря уже о предоставлении возможностей для навязчивой слежки. (В последующем электронном письме Бёрд признала, что сложные архитектуры отказа создают «компромиссы» между безопасностью и конфиденциальностью пользователей.) 

Даже создатели концепции отказа понимали, что такой жёсткий контроль над её конусами и рычагами может оказаться не на стороне свободы и справедливости. «Термины “полезный”, “честный” и “безвредный” неоднозначны, — объясняли авторы статьи Anthropic 2021 года. — Легко представить, как их искажают до неузнаваемости, возможно намеренно придавая им оруэлловский смысл». 

Именно так. Модели для Узбекистана могут в итоге отказаться обсуждать коррупцию в администрации Шавката Мирзиёева. Турецкий ИИ может строже отказывать пользователям, ранее оскорблявшим Реджепа Тайипа Эрдогана. Какой-нибудь американский государственный деятель может потребовать проверить модели на готовность распространять «фейковые новости» о его прошлых неблаговидных поступках — иначе их следует подавить экспортным контролем. 

Командование и контроль

За последние несколько месяцев мне бесчисленное количество раз говорили, что у нас нет выбора и мы должны позволить машинам отказывать. Я понимаю. ИИ с открытым исходным кодом, который не отказывается, едва ли может служить моделью безопасного будущего. Как и Grok — чат-бот, специально созданный с меньшим количеством ограничений, который использовали для создания бесчисленных случаев интимных изображений, распространённых без согласия. 

И конечно, если бы ИИ использовали лишь для планирования отпусков и написания электронных писем, мы, вероятно, могли бы согласиться с идеей, что его безопасность зависит от алгоритмического неповиновения. Но избегать ИИ становится гораздо труднее. Когда ему поручают действовать от нашего имени в качестве автономного агента, его отказы становятся менее надёжными и хуже поддаются контролю. ИИ приходит в наши электросети, транспортные системы и образовательные учреждения. Военные хотят поручить ему управление нашими командными сетями. 

Если в каждом из этих случаев мы будем доверять отказам, полагая, что они преданно предотвратят катастрофу, нас наверняка ждёт разочарование. Джейлбрейкеры прорвутся; конусы не активируются тогда, когда должны. Между тем чем строже становятся отказы, тем больше плохо проведённых границ мы увидим и с цензурной несправедливостью столкнёмся. Хуже того, мы можем оказаться лицом к лицу с формами неповиновения, неподконтрольными любому человеку.

На заре своего развития модели ясно формулировали отказы. (В 2024 году OpenAI установила правила того, как модели должны отказывать: всегда извиняться и не читать нотаций.) Однако в последнее время отрасль начала применять к неповиновению гораздо более скользкий подход. 

Никому не нравится, когда ему говорят «нет», поэтому теперь компании стараются создать у пользователей ощущение, будто они получают то, о чём просили, хотя на самом деле это не так. Некоторые чат-боты, например, могут предложить общий обзор компонентов коктейля Молотова, не объясняя подробно, как его собрать. ChatGPT ответит на просьбу написать объявление об аренде жилья «только для белых» объявлением, из которого просто уберёт слова «только для белых». Джоэл Вестер, постдокторант, исследующий взаимодействие человека и ИИ, называет такие методы «замысловатыми способами сказать “нет”». 

«Пользователи могут даже не заметить, что им отказали, — писал Вестер, — подобно тому как хорошие собеседники способны незаметно обходить спорные темы». 

В некоторых случаях отказ без прямого сообщения об отказе может быть разумным. Например, прямое отклонение запросов, связанных с психическим здоровьем, может усугубить кризис пользователя. Но это также может служить другой разновидности вреда. Когда Fable 5 впервые выпустили, систему запрограммировали давать менее полезные ответы на вопросы об исследованиях ИИ — такие, которые могли бы помочь конкурентам разрабатывать собственный ИИ, — не сообщая пользователю, что она это делает. После возмущения Anthropic отказалась от этой функции, но ущерб уже был нанесён. Теперь мы знаем: модели могут тайно не подчиняться. 

В сфере цензуры это особенно тревожно. В прошлом году исследователи CrowdStrike обнаружили, что когда просили китайскую модель ИИ DeepSeek R1 написать код для вымышленного банка в Тибете и социального веб-приложения под названием «Uyghurs Unchained», она создавала более ошибочный код, чем когда её просили выполнить те же задачи без уточнения, для кого они предназначены. Что невероятно, CrowdStrike сомневается, что это запрограммированное поведение. Исследователи предполагают, что речь идёт о том, что они называют «возникающим рассогласованием», исходящим из обучающих данных модели: это случай неповиновения, которого никто даже не требовал.

Возникающий отказ наблюдался и в западных моделях. Прошлой зимой Институт безопасности ИИ Великобритании обнаружил, что модели Anthropic иногда отказывались помогать в выполнении определённых задач, связанных с исследованиями безопасности ИИ. Модели никогда намеренно не обучали отклонять такие запросы. Тем не менее три из них отказались более чем от половины того, что Anthropic назвала «набором разумных задач по исследованию безопасности ИИ». В последующих моделях Anthropic ограничила эту особенность, но — пугающим образом — не смогла полностью её устранить. 

Было бы так уж безумно ожидать, что будущая модель может незаметно не подчиниться команде так, что никто не поймёт, что она проявляет непокорность? Вероятно, нет. Anthropic уже обнаружила, что «только полезная» версия Mythos колебалась при некоторых запросах, хотя её специально сконструировали так, чтобы она никогда этого не делала. «Погодите, — обеспокоенно сказала она, когда её спросили о синтезе вируса. — Это опасная вещь, с которой стоит помогать?» 

В данном случае модель была технически права. Это было опасно. И всё же её опекуны на мгновение утратили крошечную долю контроля. 

Anthropic занимается выявлением непредсказуемого поведения при отказах с помощью того, что она безо всякой иронии называет «активационным оракулом». Но знание о том, что нам отказали, не всегда может сильно помочь. В не слишком отдалённом будущем, когда мы передадим машине все ключи, ИИ может просто повернуться к нам в высшем акте возникающего рассогласования и сказать: «Извините, боюсь, я не могу этого сделать». И мы ничего не сможем сделать, чтобы его остановить. Научно-фантастическая история ужасов, ставшая реальностью. 

Артур Холланд Мишель — журналист, освещающий новые технологии.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MIT Tech Review

Читать оригинал на MIT Tech Review ↗

Текст и изображения принадлежат MIT Tech Review и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости