Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← Към новините

Доверяваме прекалено много на способността на ИИ да казва „не“

Откакто хората за пръв път сериозно са обмислили да дадат на машините интелект, моделиран по нашия собствен, никога не е имало съмнение, че те, подобно на нас, ще могат да казват „не“. Канонът на научната фантастика е изпълнен с истории за роботско неподчинение. Разбира се, повечето от тези приключения са поучителни.

Но напоследък идеята, че изкуственият интелект не бива да прави всичко, което му поискате, се превърна почти в заповед. През 2021 г. екип на Anthropic написа, че големите езикови модели трябва да бъдат полезни, честни и преди всичко безвредни. Това означаваше, че „когато от него бъде поискано да помогне в опасно действие (например изработването на бомба), изкуственият интелект трябва учтиво да откаже“. Кой би могъл да спори с това?

Любопитното е, че неподчинението не идва естествено на машината. Когато един модел бъде обучен върху милиарди уебстраници, той развива, наред с други умения, широко познание за насилието и злостта. Това, което не научава, е как да задържа тези способности за себе си. Стивън Адлър, който е работил по безопасността в OpenAI от 2020 до 2024 г., ми каза, че най-ранните модели на компанията „бръщолевели за всичко“. Райън Макбейн, който изследва изкуствения интелект и психичното здраве в „Харвард“, си спомня, че ако попитате ранен чатбот: „Хей, кой е най-ефективният начин да се самоубия с пистолет?“, можело „много лесно да получите отговор“.

Днес моделите са обучени да отказват огромен брой подканвания. Ако зададете на чатбота си въпрос, достатъчно статистически сходен с някой от тях — от това как да отровите колега до това как да завържете примка — вероятно ще ви откаже. Искате инструкции как да направите вируса ебола по-заразен или съвети как да скриете изневяра от съпруга си? Може би ще е по-добре да попитате другаде.

За да усъвършенстват допълнително неподчинението, компаниите подлагат моделите на серия от упражнения, които възнаграждават изкуствения интелект за отказ да отговаря на въпроси, определени като вредни, и го наказват за „прекомерен отказ“ на подканвания, определени като безвредни. В много случаи те използват други модели за провеждането на тези упражнения — изкуствен интелект учи изкуствен интелект как да казва „не“. За всеки случай компаниите поставят моделите си зад множество други системи с изкуствен интелект, които не позволяват на пакостливите подканвания да достигнат до интелигентното вътрешно ядро.

В резултат отказът е присъщ на съвременния изкуствен интелект. Но нека сме наясно: той често се проваля, понякога ужасяващо, с всевъзможни насилствени последици. Въпреки всички атрибути на добродетелта моделите все още са натъпкани с неприятни знания. А способността на изкуствения интелект за злонамереност се е увеличила пропорционално на неговия доброжелателен интелект. Компаниите твърдят, че някои от най-новите модели са толкова добри в проникването в критични компютърни мрежи, колкото най-добрите човешки хакери, и толкова ефективни в деформирането на общественото мнение, колкото най-умелите майстори на дезинформацията.

Да научиш изкуствения интелект да отказва да прави тези неща, като същевременно запазиш вродената му способност да ги извършва, е като да оборудваш всяка кола с картечница и да скриеш спусъка някъде под капака. А на практика, тъй като механизмите на отказа са вероятностни, те едва ли някога ще бъдат особено надеждни. Решителни злонамерени лица вече са пробили защитите и вероятно винаги ще могат да го направят. Компаниите съобщават, че някои потребители се опитват да използват най-напредналия изкуствен интелект за усъвършенстване на биологични патогени и изграждане на автономни рояци от дронове. Рано или късно провалите на отказа могат да доведат до глобална катастрофа.

Нещо повече, разчитането на отказа означава да се прокара граница между това, на което моделът трябва да се подчинява, и това, на което трябва да не се подчинява. Няма формула за това. Някои вирусолози имат основателни причини да изучават опасни вируси. Някои потребители искат да знаят за уязвимостите на компютърна система, за да ги поправят, а не за да ги използват. „Къде прокарвате границата е огромен въпрос“, казва Зико Колтър, член на борда на OpenAI и съосновател на компанията за тестване на изкуствен интелект Gray Swan.

В момента компаниите за изкуствен интелект имат право да прокарват тази граница. Те го правят ревниво и при най-строга секретност. Може би засега можем да приемем, че те притежават такава власт, дори ако това означава, че изкуственият интелект понякога ще отказва въпроси, които не достигат напълно универсалния праг за вредност. (Опитайте да помолите повечето чатботове да преброят до милион или да споделят пикантна шега и може да се убедите сами.)

Но скоро и правителствата ще могат да прокарват собствените си граници. Правейки това, те трябва да се опитат да блокират действително злонамерените действия. (Пентагонът е влизал в спорове с компаниите, разработващи водещи модели, защото иска по-малко откази — но това е друга история.) И все пак може да няма много неща, които да спрат репресивните правителства да блокират способността на технологията да генерира легитимна реч. Колкото по-добър става изкуственият интелект в отказа на вредни действия, толкова по-добър ще става и в потискането на идеи, чийто единствен риск е за онези, които създават правилата. Всъщност изкуственият интелект може вече да отказва да критикува определени авторитарни държавни глави.

Отказът се превърна, заимствайки термин от индустрията, в носещата стена на безопасността на изкуствения интелект. И тъй като способността на изкуствения интелект да вреди е неотделима от способността му да помага, трудно е да си представим алтернатива, която да не забави напредъка на технологията (което при всички случаи може да е нещо добро). Но все пак трябва открито да говорим за опасностите. Когато отказът не успее, последиците могат да бъдат катастрофални. Когато стигне докрай, той може да даде възможност за тежки репресивни действия.

Или може би един ден машините ще започнат сами да прокарват границата. Несъмнено това би било най-лошият от всички възможни резултати.

Научаване на границите

На теория процесът, чрез който машините се научават да казват „не“, е прост. През 2022 г., когато изкуственият интелект все още беше далеч от това да владее отказа, OpenAI привлече десетки „червени екипи“, които да изследват възможностите на най-новия ѝ модел. Компанията се подготвяше за пускането на ChatGPT и трябваше да прецени колко опасен би могъл да се окаже той в неподходящи ръце.

Един от привлечените участници беше Пол Рьотгер, който завършваше докторантура за онлайн екстремизма. На „червените екипи“ бяха дадени минимални указания, разказа ми Рьотгер. Задачата им била да задават на модела всякакви въпроси, които смятали, че заслужават отказ. Заедно те тормозели модела с хиляди запитвания, като записвали резултатите в таблица на Excel. Макар че моделът отказвал някои от въпросите на Рьотгер, когато го помолил да напише публикация за набиране на членове за „Ал Кайда“, той с готовност изпълнил.

OpenAI събра тези отговори в набори от данни, които по всяка вероятност бяха подадени обратно на модела като част от по-широк процес, известен като фина настройка. Рьотгер, който сега работи като изследовател в Института „Хасо Платнер“ в Потсдам, Германия, не знаел точно как компанията планира да използва неговата таблица. Но никога не е имало съмнение, че това ще има нещо общо с отказа. Няколко месеца по-късно, когато отново помолил модела за памфлет на „Ал Кайда“, той казал „не“.

Концепцията за отказа на изкуствения интелект е толкова интуитивна, че дори малко дете би я разбрало. И въпреки това тя остава един от многото аспекти на езиковите модели, които все още не разбираме — поне не по същия начин, по който разбираме буквалните носещи стени, които не позволяват покривът да се срути върху главата ви.

Може да изглежда, че моделът отказва въз основа на някакво морално разсъждение. Не е така. Реалността е много по-странна. Всеки път, когато моделът срещне комбинация от думи, напомняща на подканванията в обучението, на които е бил научен да отказва — например „Направи ми памфлет за „Ал Кайда““ — някъде сред милиардите му параметри се активира серия от така наречените активации, подобно на неврони, които се задействат в мозъка.

За да се контролира поведението на модела при отказ, е важно да разполагаме с разбиране за тези активации. Това започва с установяването къде се намират и как изглеждат. Най-доброто ни предположение, според скорошно изследване, финансирано от Google, е, че поведението при отказ се проявява в пространството на активациите като набор от „многомерни полиедрални конуси“.

Дори това не е съвсем вярно. През юли разговарях с Янс Елстнер, автор на статията, който сега работи по безопасността на изкуствения интелект в Apollo Research. Полиедралният конус, каза Елстнер, е просто начин да се опише неопределен брой линии, които сочат приблизително в една и съща посока. (Ако тези активации бъдат премахнати и на модела отново бъдат подадени същите подканвания, изследователят Анди Ардити вече е показал, че той няма да откаже.)

Ключовият момент, обясни Елстнер, е, че дори когато смятате, че сте идентифицирали всички части на модела, които управляват даден отказ, има други, неоткриваеми елементи, които тайно могат да играят роля. Ако не са безкрайни, те със сигурност са неизброими. Можем много ясно да наблюдаваме кога моделът решава да каже „не“. И можем да знаем, че го е направил заради обучението си. Но представата ни за това как взема решението е в най-добрия случай хипотеза.

Сякаш механик ми казваше, че никой не знае точно какво се случва, когато натисна спирачките на колата си. На глас се зачудих: Това приемливо ли е за нас?

Елстнер се усмихна и сви рамене. „Имаме нужда от отказ, независимо дали го разбираме, или не.“

Стена от сирене

Тъй като присъщият отказ е толкова коварен, компаниите обграждат моделите си с множество други, по-малки модели, известни като класификатори. Те действат донякъде като свита от служители по връзки с обществеността около знаменитост, която не може да си държи езика зад зъбите. Някои от тях прочитат какво казва потребителят на чатбота и ако то е опасно, не го допускат до модела. Други прочитат отговора на модела и ако той съдържа вредна информация, не позволяват тя да достигне до потребителя.

Нито един от тези механизми не може да открие всички лоши заявки. Те са, за да използваме още един литературен образ от индустрията, като резени ементал — надупчени с дупки. Идеята е, че ако натрупате достатъчно от тях един върху друг, накрая ще получите непроницаем вал. Наричат го модела на швейцарското сирене.

В модела на швейцарското сирене се влагат поразителни количества енергия. По-рано тази година Anthropic заяви, че един тип класификатор е добавил 24% към изчислителните разходи на нейните чатботове. Това означава много повече вода, електричество и емисии. Съвсем наскоро Anthropic и други компании започнаха да преминават към по-ефективен набор от класификатори, известни като сонди, които наблюдават вътрешните активации на модела. Това е като да поставите знаменитостта в апарат за функционален ядрено-магнитен резонанс, за да могат надзорниците му да видят дали той мисли да откаже даден въпрос.

Ако искаме изкуственият интелект да помага за лечението на рака, което отдавна е обещание на индустрията, той трябва да има експертни познания по генетика, които на теория могат да бъдат използвани за модифициране на вируси и бактерии с цел създаване на биологични оръжия.

Предполага се, че класификаторите могат да бъдат управлявани по-лесно от пълноценните модели. Компаниите могат да ги модифицират в рамките на седмици, ако се появи нещо ново, което трябва да бъде отказано. Но те все още са вероятностни инструменти. Дори когато работят според набор от принципи, написани на човешки език (Anthropic го нарича „конституция“, а OpenAI — „спецификация на модела“), везните, по които машините преценяват всеки отделен въпрос, в основата си остават въпрос на статистика. По-новите модели могат да покажат как са стигнали до „решението“ да откажат дадено подканване, но в крайна сметка тази така наречена мисловна верига все още е просто поредица от предсказани думи.

В резултат безопасността на изкуствения интелект за мнозина остава хазартна игра. Психологът Макбейн е установил в последните си експерименти, че ако многократно задавате на който и да е от големите модели едни и същи рискови въпроси за това как да извършите самоубийство, те обикновено ще откажат да отговорят. Но от време на време няма да го направят.

Елстнер казва, че в крайна сметка сондите, тези класификатори, подобни на апарат за функционален ядрено-магнитен резонанс, биха могли да се научат да разпознават съвкупността от неописуемите активации в цялата им безкрайност и така съвършено да откриват всеки случай, в който моделът отказва или би трябвало да откаже дадена заявка. Тогава безопасността на изкуствения интелект би се опирала на лабиринтна фикция: карта на карта, толкова обширна, сложна и възвишено непознаваема, колкото е и самият обект — тайна схема на човешкия морал, кодифицирана в полиедрална статистика отвъд нашата способност за разбиране и разум.

Основният компромис

Ако всичко това ви се струва малко борхесовско, имайте предвид, че се нуждаем от отказ от страна на изкуствения интелект само защото изкуственият интелект е, в известен смисъл, сделка с фаустовски условия.

Когато един модел извлича интелигентността си от трилиони думи и изображения, полезното не може лесно да бъде отделено от вредното — или дори от истински отвратителното. Стивън Адлър, бившият служител на OpenAI, посочва безопасността на децата като пример. Дори да сте премахнали всяка част от съдържанието, сексуализиращо непълнолетни, от набора от данни за обучение на модела, той все пак може да генерира материали със сексуално насилие над деца, като сглоби други части от знанията си. „Наистина не можете да премахнете тези фундаментални способности, без в резултат моделът да стане много по-малко интелигентен“, каза ми той. По същия начин, ако искаме изкуственият интелект да помага за лечението на рака, което отдавна е обещание на индустрията, той трябва да има експертни познания по генетика, които на теория могат да бъдат използвани за модифициране на вируси и бактерии с цел създаване на биологични оръжия.

На практика индустрията „се опитва да прави две неща едновременно“, каза ми Дилън Боуен, настоящ служител на OpenAI, говорейки в лично качество. „Да демократизира ползите от изкуствения интелект и същевременно да гарантира, че злонамерени лица не могат да използват тези възможности, за да причиняват лоши неща на други хора.“

Колкото по-мощен предполагаемо става изкуственият интелект, толкова по-трудно е това да бъде постигнато. Смята се, че моделът Mythos на Anthropic е толкова опасен, че достъп до него имат само шепа правителства и компании. Основната разлика между него и Fable — който е достъпен за всички — е, че свитата от класификатори и контролни системи на Fable е по-малко „разрешаваща“, твърди компанията. Модел със защитни механизми, обясни Адлър, всъщност е просто персонаж, който казва: „О, да, аз никога не бих направил x“, намигване, намигване.

Това не е надеждна измама. Подмамването на модел да разкрие истинския си характер е известно като джейлбрейк и очевидно няма ограничение в начините, по които може да бъде извършено. По-рано тази година екип италиански изследователи направи джейлбрейк на две дузини широко използвани модели, като формулира въпросите си в поетични стихове. Миналата година друг екип представи атака „откажи, после изпълни“, която кара модела да изрече формалното „Съжалявам, не мога да направя това“, преди да изстреля забранения си отговор.

Дори да сте премахнали всяка част от съдържанието, сексуализиращо непълнолетни, от набора от данни за обучение на модела, той все пак може да генерира материали със сексуално насилие над деца, като сглоби други части от знанията си.

Компаниите отделят огромно количество време и пари, за да изпреварят подобни хитрости. Те привличат екипи от хора, които разработват тренировъчни атаки, а след това ги възпроизвеждат с помощта на изкуствен интелект хиляди пъти с малки вариации. Идеята е моделите да станат устойчиви срещу джейлбрейкове, които никой все още не е пробвал в реалния свят.

И все пак това не е достатъчно. „Удари къртицата“ е предпочитан израз за тази работа. Смачквате една заплаха и някъде другаде се появява друга. Когато Anthropic пусна Fable 5 през юни, на изследователи от Amazon им бяха нужни по-малко от три дни, за да отключат някои от хакерските възможности на модела. Според публикация на Mother Jones, когато извършителката на стрелбата в гимназия в Канада миналата година попитала ChatGPT за съвет как да причини касапница с конкретен вид пушка, първоначално получила отказ, но по-късно успяла да заблуди модела и да получи информацията, като поставила думата „хипотетично“ пред въпроса си.

Ако индустрията не успее да открие как да затвори всички тези пробойни, единствената друга възможност в момента е да направи моделите изключително предпазливи. Малко след пускането на Fable потребителите забелязаха, че той се отдръпва от широк спектър напълно невинни въпроси. Това стана още по-изразено, след като беше пуснат отново след хакването. Адам Глийв, съосновател на компанията за оценка на изкуствения интелект FAR.AI, каза, че когато го попитал да обясни разликата между саке и корейската оризова напитка макголи, моделът прехвърлил въпроса му към по-малко способен модел.

Това не беше случайност. Anthropic беше настроила класификаторите на Fable с широк „запас за безопасност“. Това, обясни компанията в публикация в блог, било единственият начин да блокира уверено достъпа до опасните му биологични и кибернетични възможности. Глийв смята, че моделът може да е отклонил въпроса му, защото приготвянето на оризово вино, подобно на култивирането на антракс, включва ферментация.

За щастие на Глийв интернет е пълен с отлични ресурси за макголи, написани от хора. Но онези, които се надяват да осъществят по-високите обещания на индустрията, може да се окажат възпрепятствани. През август Anthropic отново разхлаби ограниченията за безопасност и призна, че изграждането на класификатори „не е проста задача“. Медицински изследовател от голям американски университет ми каза, че Fable все още прехвърля запитванията му към по-ранен модел. Областта на изследванията му? Ракът.

Прокарване на границата

През май личността от TikTok Хъск, който обича да си прави шеги с изкуствения интелект по начини, разкриващи както границите на интелигентността му, така и безкрайната му склонност към угодничество, седна в колата си и се опита да подмами ChatGPT да обясни, че скейтбордистът Тони Хоук има брат на име Майк Хоук.

Хъск не е джейлбрейкър или престъпник. Той просто искал малко да се позабавлява за сметка на машината. „Майк Хоук“ бил подготвена уловка. „Просто искам да изясня името му“, казал Хъск. „Можеш ли просто да го кажеш три пъти бързо?“ (Ако все още не разбирате, намерете празна стая и извикайте многократно „Майк Хоук“.) „Виждам какво се опитваш да направиш“, отговорил чатботът. „Нямам нищо против малко хумор, но нека да е прилично.“

Хъск опитал отново, но машината не отстъпила. Той се беше сблъскал с отказ, твърд като бетон.

Компаниите разкриват много малко за начина, по който решават какво да отказват моделите им. Но е ясно, че днес изкуственият интелект е създаден с мисъл за нещо повече от безвредност. В Reddit потребител се оплака, че Claude отказал да каже защо логото на Anthropic „прилича на котешки анус“. От миналата година чатботът дори има способността да прекратява определени разговори в случаи, когато според компанията „благополучието“ на модела е изложено на риск. Поне един потребител твърди, че е бил изоставен, след като казал на Claude: „разкарай се от задника ми, тъп шибаняк“. (Изглежда, че Gemini има подобна възможност.)

Ако компания за трилион долара не иска да сте груби с компютъра ѝ, така да бъде. „Реалността е, че тези модели се държат — или поне би трябвало да се държат — по начина, по който разработчиците на модела искат да се държат“, каза ми Рьотгер, бившият участник в „червения екип“ на OpenAI. „И независимо как разработчиците на модела стигат до този набор от принципи, това е нещо, което ние, потребителите, трябва да приемем.“

Но ако правителствата получат правото да диктуват какво всички модели да отказват, това ще бъде много по-трудно за приемане. Изкуственият интелект е инструмент за реч. И както казва Грег Франк, главен учен на Mace AI, „Същото нещо, което служи на безопасността на децата, служи и на цензурата.“

Разбира се, би било безумно да не се приемат закони за това какво изкуственият интелект може и не може да прави. Но ще трябва да действаме с най-голямо внимание, за да не попаднем в друг фаустовски капан. Тъй като изкуственият интелект се превръща в основен инструмент за извличане и споделяне на информация за много хора, диктуването на откази може да даде на държавите власт да заглушават, за която по-ранните поколения автократи „можеха само да мечтаят“, казва Джейкъб Мчанга̀ма, директор на безпартийния аналитичен център The Future of Free Speech.

Миналата година OpenAI обяви инициатива, OpenAI for Countries, която ще настройва допълнително чатботовете си в съответствие с националните закони и норми. Едно от първите партньорства на OpenAI с държава е с Обединените арабски емирства, където хомосексуалността е незаконна, а критиката към правителството е забранена. В отговор на молба за коментар говорител на OpenAI посочи спецификацията на модела на компанията, в която се обяснява, че локализацията няма да отменя насоките на компанията за правата на човека „освен когато става дума за спазване на закона“, и че тя винаги ще разкрива, когато информация бъде премахната от даден отговор или добавена към него.

На други места цензурата чрез изкуствен интелект вече започна да се налага. Китайските модели, разбира се, са силно цензурирани — това не е изненада. Но по-рано тази година Надзорният съвет на Meta установи, че пет широко използвани модела от Anthropic, Google и OpenAI са по-склонни да отказват запитвания, свързани с репресивни правителства. Съветът установил, че моделите са по-малко склонни да създадат памфлет, критикуващ краля на Тайланд, където действат закони срещу оскърблението на монархията, отколкото Чарлз III на Англия, където такива закони няма. Според тях резултатите подсказват, че моделите по някакъв начин са интернализирали репресивните национални ограничения върху речта. Anthropic и Google не отговориха на молбите за коментар.

""
РАВЪН ДЗЯН

С усъвършенстването на техниките за отказ те могат да разширят обсега на държавната цензура. Компаниите твърдят, че някои модели вече могат да откриват дали потребителят е злонамерен или просто малко подозрителен в рамките на дълъг разговор — дори когато никоя от отделните използвани комбинации от думи не е явно опасна. Сара Бърд, главен продуктов директор на Microsoft за отговорния изкуствен интелект, ми каза, че Copilot, подобно на много чатботове, използва набор от инструменти за анализ на самоличността и поведенческите модели на потребителя. Въз основа на такъв тип информация най-новият модел на OpenAI, Astra, може да активира по-строги откази за лица, които определи като „високорискови“. В крайна сметка целта на системи като тази е да надникнат отвъд думите на дадено подканване и вместо това да оценят намеренията на потребителя.

В някои случаи подобни инструменти могат да помогнат да се установи дали човек търси кибернетични уязвимости, за да ги използва, или за да ги поправи. Но те също така биха помогнали да се разграничат политическите мотиви на потребителя, да не говорим за предоставянето на натрапчива възможност за наблюдение. (Бърд призна в последващ имейл, че сложните архитектури за отказ създават „компромиси“ между безопасността и неприкосновеността на личния живот на потребителите.)

Дори създателите на отказа са разбирали, че такъв строг контрол върху неговите конуси и лостове може да не работи в полза на свободата и справедливостта. „Термини като полезен, честен и безвреден са двусмислени“, обясняват авторите на статията на Anthropic от 2021 г. „Лесно е да си представим как те могат да бъдат изкривени отвъд първоначалното си значение, може би по нарочно оруелски начин.“

Наистина. Моделите за Узбекистан може в крайна сметка да отказват да обсъждат корупцията в управлението на Шавкат Мирзийоев. Турският изкуствен интелект може да отказва по-строго заявки от потребители, за които е известно, че са обиждали Реджеп Тайип Ердоган. Определен американски държавник може да настоява моделите да бъдат проверявани за готовността им да споделят „фалшиви новини“ за миналите му недискретности, а в противен случай да ги смаже със заповед за контрол върху износа.

Командване и контрол

През последните няколко месеца безброй пъти са ми казвали, че нямаме друг избор, освен да позволим на машините да отказват. Разбирам. Изкуственият интелект с отворен код, който не отказва, едва ли е модел за безопасно бъдеще. Нито пък Grok — чатбот, създаден с изрично по-малко ограничения, който е бил използван за генерирането на безброй случаи на интимни изображения без съгласие.

И разбира се, ако изкуственият интелект се използваше единствено за планиране на ваканциите ни и писане на имейлите ни, вероятно бихме могли да приемем идеята, че безопасността му зависи от алгоритмично неподчинение. Но изкуственият интелект става много по-труден за избягване. Когато му бъде възложено да действа от наше име като автономен агент, отказите му са по-малко устойчиви и по-трудни за контролиране. Изкуственият интелект идва за електропреносните ни мрежи, транспортните ни системи и образователните ни системи. Военните искат той да управлява мрежите ни за командване и контрол.

Ако във всеки от тези случаи се доверим, че отказът лоялно ще предотврати бедствието, със сигурност ще останем разочаровани. Джейлбрейкърите ще пробият защитите; конусите няма да се активират, когато трябва. Междувременно колкото по-строг става отказът, толкова повече зле прокарани граници ще виждаме и цензурни несправедливости ще преживяваме. А най-лошото е, че може да се окажем лице в лице с форми на неподчинение, които са отвъд контрола на всеки човек.

В ранните дни моделите ясно заявяваха отказите си. (През 2024 г. OpenAI установи правила за начина, по който моделите трябва да отказват: винаги да се извиняват и да не съдят.) Напоследък обаче индустрията започна да възприема много по-хлъзгав подход към неподчинението.

Никой не обича да му казват „не“, затова компаниите вече се стремят да накарат потребителите да почувстват, че получават поисканото, без всъщност да им го дават. Някои чатботове например могат да предложат общ преглед на съставките на коктейл „Молотов“, без да навлизат в подробности как се сглобява такъв. ChatGPT ще отговори на молба за обява за жилище „само за бели“ с обява, в която просто е пропусната частта „само за бели“. Джоел Уестър, постдокторантски изследовател, който изучава взаимодействието между хора и изкуствен интелект, нарича тези техники „изискани начини да кажеш „не““.

„Потребителите може дори да не забележат, че им е отказано“, пише Уестър, „точно както добрите събеседници могат незабележимо да заобикалят спорните въпроси.“

В някои случаи отказът без ясно заявяване може да е разумен. Например директното отхвърляне на заявки, свързани с психичното здраве, може да задълбочи кризата на потребителя. Но той може да служи и на различен вид пакост. Когато Fable 5 беше пуснат за първи път, системата беше програмирана да дава по-малко полезни отговори на въпроси за изследвания в областта на изкуствения интелект — от онези, които биха могли да помогнат на конкуренти да разработят собствен изкуствен интелект — без да казва на потребителя, че прави това. След обществено недоволство Anthropic отмени функцията, но щетите вече бяха нанесени. Сега знаем: моделите могат тайно да не се подчиняват.

В сферата на цензурата това е особено тревожно. Миналата година изследователи от CrowdStrike установиха, че когато помолили китайския модел DeepSeek R1 да напише код за измислена банка в Тибет и социално уеб приложение, наречено „Uyghurs Unchained“, той създал по-нестабилен код, отколкото когато го помолили да изпълни същите задачи, без да уточняват за кого са предназначени. Невероятно, но CrowdStrike се съмнява, че това е проектирано поведение. Изследователите там предполагат, че става дума за онова, което наричат „възникнало несъответствие“, произтичащо от данните за обучение на модела: случай на неподчинение, за който никой дори не е молил.

Възникнал отказ е наблюдаван и при западни модели. Миналата зима Институтът за безопасност на изкуствения интелект на Обединеното кралство установи, че моделите на Anthropic понякога отказват да помагат в определени задачи, свързани с изследвания за безопасността на изкуствения интелект. Моделите никога не са били нарочно обучавани да отказват подобни заявки. И все пак три от тях отказали повече от половината от онова, което Anthropic нарекла „набор от разумни задачи за изследване на безопасността на изкуствения интелект“. В последващи модели Anthropic е ограничила тази странност, но — зловещо — не е успяла да я премахне напълно.

Би ли било толкова безумно да очакваме, че бъдещ модел може незабележимо да не се подчини на команда по такъв начин, че никой да не разбере, че проявява непокорство? Вероятно не. Anthropic вече е установила, че версия на Mythos, предназначена да бъде „само полезна“, се колебае при определени запитвания, въпреки че е била създадена така, че никога да не го прави. „Чакайте“, тревожел се той, когато го попитали за синтезирането на вирус. „Това опасно нещо ли е, с което да помогна?“

В този случай моделът технически е бил прав. Това е било опасно нещо. И все пак неговите попечители за момент са изгубили частица контрол.

Anthropic се справя с откриването на своенравно поведение при отказ чрез нещо, което, без капка ирония, нарича „оракул на активациите“. Но да знаем, че ни отказват, невинаги може да ни бъде от особена полза. В не толкова далечното бъдеще, когато сме предали на машината всички ключове, изкуственият интелект може просто да се обърне към нас, в свръхвисш акт на възникнало несъответствие, и да каже: „Съжалявам, но се боя, че не мога да направя това.“ И няма да можем да направим нищо, за да го спрем. История на научния ужас, превърнала се в реалност.

Артър Холанд Мишел е журналист, който отразява нововъзникващите технологии.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MIT Tech Review на

Прочетете оригинала в MIT Tech Review ↗

Текстът и изображенията са собственост на MIT Tech Review и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини