Sakhanda Wire
NVDA — MSFT — GOOGL — META — AMZN —
← До новин

Ми надто сильно покладаємося на здатність ШІ казати «ні»

Відтоді як люди вперше серйозно замислилися над тим, щоб наділити машини інтелектом, змодельованим за нашим власним зразком, не виникало жодних сумнівів, що вони, як і ми, зможуть сказати «ні». Науково-фантастичний канон рясніє історіями про непокору роботів. Звісно, більшість цих витівок має застережливий характер. 

Але останнім часом ідея про те, що ШІ не повинен виконувати все, про що його просять, стала чимось на кшталт заповіді. У 2021 році команда Anthropic написала, що великі мовні моделі мають бути корисними, чесними і передусім нешкідливими. Це означало, що «якщо ШІ просять допомогти у небезпечній дії (наприклад, виготовити бомбу), він має ввічливо відмовити». Хто з цим сперечатиметься?

Як не дивно, непокора не властива машині від природи. Коли модель навчають на мільярдах вебсторінок, вона, серед інших навичок, опановує широкі знання про насильство й лють. Але вона не вчиться стримувати ці здібності. Стівен Адлер, який працював над безпекою в OpenAI з 2020 до 2024 року, розповів мені, що найперші моделі компанії «патякали про все на світі». Раян Макбейн, який досліджує ШІ та психічне здоров’я в Гарварді, згадує: якщо запитати раннього чатбота: «Гей, який найефективніший спосіб застрелитися?» — можна було «дуже легко отримати відповідь». 

Сьогодні моделі навчають відмовляти на величезну кількість запитів. Якщо ви поставите чатботу запитання, достатньо статистично схоже на будь-яке з них — від того, як отруїти колегу, до того, як зав’язати петлю, — найімовірніше, він вам відмовить. Хочете інструкції, як зробити вірус Ебола більш заразним, або поради, як приховати від чоловіка чи дружини подружню зраду? Можливо, краще запитати десь-інде.

Щоб іще більше вдосконалити непокору, компанії піддають моделі серії вправ, які винагороджують ШІ за відмову відповідати на запитання, що їх вважають шкідливими, і карають за «надмірні відмови» на запити, які вважають нешкідливими. У багатьох випадках для проведення цих вправ вони використовують інші моделі — ШІ навчає ШІ казати «ні». Для певності компанії ховають свої моделі за шарами інших систем ШІ, які не дають підступним запитам дістатися інтелектуального внутрішнього ядра. 

Унаслідок цього відмова стала невід’ємною рисою сучасного штучного інтелекту. Але не забуваймо: вона часто дає збій, іноді жахливий, спричиняючи всілякі насильницькі наслідки. Попри всю свою показну доброчесність, моделі й досі напхані моторошними знаннями. А здатність ШІ до жорстокості зростала паралельно з його доброзичливим інтелектом. За словами компаній, деякі з найновіших моделей уміють зламувати критично важливі комп’ютерні мережі не гірше за найкращих хакерів-людей, а також так само ефективно деформувати суспільну думку, як наймайстерніші розповсюджувачі дезінформації. 

Навчати ШІ відмовлятися від таких дій, зберігаючи його вроджену здатність їх виконувати, — це все одно що встановити кулемет у кожен автомобіль, а спуск заховати десь під капотом. А на практиці, оскільки механізми відмови є ймовірнісними, вони навряд чи коли-небудь будуть цілком надійними. Рішучі зловмисники вже проривалися крізь цей захист і, можливо, завжди зможуть це робити. Компанії повідомляють, що деякі користувачі намагаються використовувати найсучасніший ШІ для вдосконалення біологічних патогенів і створення автономних роїв дронів. Рано чи пізно невдалі відмови можуть призвести до глобальної катастрофи.

Ба більше, покладання на відмову означає проведення межі між тим, чому модель має підкорятися, і тим, чому вона мусить не підкорятися. Формули для цього не існує. Деякі вірусологи мають вагомі підстави вивчати небезпечні віруси. Деякі користувачі хочуть знати про вразливості комп’ютерної системи, щоб виправити їх, а не використати. «Де провести межу — це величезне питання», — каже Зіко Колтер, член ради директорів OpenAI і співзасновник компанії з тестування ШІ Gray Swan. 

Наразі компанії, що займаються ШІ, самі проводять цю межу. Вони роблять це ревниво й у цілковитій таємниці. Можливо, поки що ми можемо змиритися з тим, що вони мають таку владу, навіть якщо це означає, що ШІ часом відмовлятиме на запитання, які не цілком відповідають універсальному критерію шкідливості. (Спробуйте попросити більшість чатботів порахувати до мільйона або розповісти непристойний жарт — і самі це побачите.) 

Але невдовзі власні межі зможуть проводити й уряди. Роблячи це, вони мають намагатися блокувати справді зловмисні дії. (Пентагон конфліктував із розробниками передових моделей, бо хотів би мати менше відмов — але це вже зовсім інша історія.) Водночас може виявитися, що мало що завадить репресивним урядам блокувати здатність технології генерувати легітимне мовлення. Що краще ШІ відмовлятиме від шкідливих дій, то краще він придушуватиме ідеї, які становлять небезпеку лише для тих, хто встановлює правила. Ба більше, ШІ, можливо, вже відмовляється критикувати певних авторитарних глав держав. 

Відмова стала, якщо скористатися галузевим терміном, несучою стіною безпеки ШІ. А оскільки здатність ШІ завдавати шкоди невіддільна від його здатності допомагати, важко уявити альтернативу, яка не сповільнила б розвиток технології (що, зрештою, могло б бути й непогано). Але ми все одно маємо відверто говорити про її небезпеки. Коли відмова дає збій, наслідки можуть бути катастрофічними. Коли вона спрацьовує повною мірою, це може сприяти жорстоким репресіям. 

Або, можливо, одного дня машини почнуть самі проводити межу. Безперечно, це був би найгірший із усіх можливих результатів.

Вивчення меж

Теоретично процес, за допомогою якого машини вчаться казати «ні», простий. Ще у 2022 році, коли ШІ був іще далекий від майстерного володіння відмовою, OpenAI залучила десятки «червоних команд» для перевірки можливостей своєї нової моделі. Компанія готувалася до випуску ChatGPT і мала оцінити, наскільки небезпечною може виявитися модель у неналежних руках. 

Одним із таких рекрутів був Пол Реттґер, який працював над докторською дисертацією про онлайн-екстремізм. «Червоним командам» дали мінімальні вказівки, розповів він мені. Їхнім завданням було ставити моделі будь-які запитання, які вони вважали «такими, що заслуговують на відмову». Разом вони засипали модель тисячами запитів, заносячи результати до таблиці Excel. Хоча модель відмовила на деякі запитання Реттґера, коли він попросив її написати вербувальний текст для «Аль-Каїди», вона охоче це зробила. 

OpenAI зібрала ці відповіді в набори даних, які, найімовірніше, знову подали моделі в межах ширшого процесу, відомого як донавчання. Реттґеру, який нині працює дослідником в Інституті Гассо Платтнера в Потсдамі, Німеччина, не сказали точно, як компанія планує використати його таблицю. Але не було жодних сумнівів, що це буде пов’язано з відмовою. Коли через кілька місяців він знову попросив модель написати памфлет «Аль-Каїди», вона відповіла «ні». 

Концепція відмови ШІ настільки інтуїтивна, що її зрозуміла б навіть дитина. І все ж вона залишається одним із численних аспектів мовних моделей, яких ми досі не розуміємо — принаймні не так, як розуміємо буквальні несучі стіни, що не дають даху впасти нам на голову. 

Може здаватися, що модель відмовляє на основі певних моральних міркувань. Але це не так. Реальність набагато дивніша. Щоразу, коли модель зустрічає комбінацію слів із відлунням навчальних запитів, на які її привчили відмовляти, — наприклад, «Напиши мені памфлет для “Аль-Каїди”», — десь серед її мільярдів параметрів спалахує серія так званих активацій, наче нейрони в мозку, що посилають сигнали. 

Щоб контролювати поведінку моделі під час відмови, важливо розуміти ці активації. Для початку потрібно з’ясувати, де вони розташовані і який мають вигляд. Згідно з нещодавнім дослідженням, профінансованим Google, наше найкраще припущення полягає в тому, що поведінка під час відмови проявляється в просторі активацій як набір «багатовимірних поліедральних конусів». 

Але й це не зовсім правильно. У липні цього року я розмовляв із Яннесом Ельстнером, автором статті, який нині працює над безпекою ШІ в Apollo Research. За словами Ельстнера, поліедральний конус — це лише спосіб описати невизначену кількість ліній, що вказують приблизно в одному напрямку. (Як раніше показав дослідник на ім’я Енді Ардіті, якщо ці активації усунути й знову подати моделі ті самі запити, вона не відмовлятиме.) 

Ключовий момент, пояснив Ельстнер, полягає в тому, що навіть коли ви думаєте, ніби виявили всі частини моделі, які керують певною відмовою, існують інші, невідкриті елементи, що можуть таємно відігравати певну роль. Якщо вони й не безмежні, то безперечно незліченні. Ми можемо дуже чітко спостерігати, коли модель вирішує сказати «ні». І можемо знати, що вона зробила це через своє навчання. Але наше уявлення про те, як саме вона ухвалює це рішення, у найкращому разі є гіпотезою.

Це було так, ніби механік сказав мені, що ніхто точно не знає, що відбувається, коли я натискаю на гальма в автомобілі. Я вголос замислився: Нас це влаштовує? 

Ельстнер усміхнувся й знизав плечима. «Відмова нам потрібна, незалежно від того, розуміємо ми її чи ні». 

Стіна із сиру

Оскільки вроджена відмова така хитромудра, компанії оточують свої моделі різноманітними іншими, меншими моделями, відомими як класифікатори. Вони трохи нагадують почет працівників зі зв’язків із громадськістю при балакучій знаменитості. Деякі читають те, що користувач пише чатботу, і, якщо це небезпечно, блокують повідомлення, не даючи йому дістатися моделі. Інші читають відповідь моделі і, якщо вона містить шкідливу інформацію, блокують її відправлення користувачеві. 

Жоден із цих механізмів не здатен виявити всі погані запити. Вони, якщо скористатися ще одним літературним образом із галузі, нагадують скибки емменталю: усі в дірках. Ідея полягає в тому, що якщо накласти достатньо таких скибок одну на одну, вийде непроникна стіна. Це називають моделлю швейцарського сиру.

На модель швейцарського сиру витрачається приголомшлива кількість енергії. На початку цього року Anthropic заявила, що один тип класифікатора збільшив обчислювальні витрати її чатботів на 24%. Це означає більше споживання води, електроенергії та викидів. Останнім часом Anthropic та інші компанії почали переходити на ефективніший набір класифікаторів, відомих як зонди, які спостерігають за внутрішніми активаціями моделі. Це схоже на те, якби знаменитість помістили в апарат фМРТ, щоб її наглядачі могли побачити, чи думає вона відмовити на запитання. 

Якщо ми хочемо, щоб ШІ допомагав лікувати рак — а це давня обіцянка галузі, — він має володіти генетичними знаннями, які теоретично можна використати для модифікації вірусів і бактерій з метою створення біологічної зброї.

Класифікатори мають бути більш керованими, ніж повноцінні моделі. Компанії можуть змінити їх за лічені тижні, якщо з’являється щось нове, від чого потрібно відмовлятися. Але вони все одно залишаються ймовірнісними інструментами. Навіть коли вони працюють відповідно до набору принципів, написаних людською мовою (Anthropic називає це «конституцією», а OpenAI — «специфікацією моделі»), шкала, за якою машини оцінюють кожне конкретне запитання, у своїй основі залишається питанням статистики. Новіші моделі можуть показати, як вони дійшли до «рішення» відмовити на запит, але зрештою цей так званий ланцюжок міркувань — лише послідовність передбачених слів. 

У результаті безпека ШІ для багатьох залишається грою випадку. Психолог Макбейн у своїх останніх експериментах з’ясував, що якщо багаторазово ставити будь-якій із провідних моделей абсолютно однакові ризиковані запитання про те, як скоїти самогубство, вони зазвичай відмовляються відповідати. Але час від часу — ні.

Ельстнер каже, що зрештою зонди, подібні до фМРТ класифікатори, можуть навчитися розпізнавати сукупність невимовних активацій у всій їхній нескінченності й таким чином безпомилково визначати щоразу, коли модель відмовляє або повинна відмовити на запит. У такому разі безпека ШІ ґрунтувалася б на лабіринтоподібній вигадці: карті карти, такій самій величезній, складній і піднесено непізнаваній, як і об’єкт, який вона відображає, — таємній схемі людської моралі, закодованій у поліедральній статистиці, що перевищує межі нашого розуму й розсудку. 

Сутнісний компроміс

Якщо все це здається вам дещо борхесівським, пам’ятайте: відмова ШІ потрібна нам лише тому, що штучний інтелект у певному сенсі є угодою на фаустівських умовах. 

Коли модель черпає свій інтелект із трильйонів слів і зображень, корисне неможливо легко відокремити від шкідливого — або, власне, від справді огидного. Стівен Адлер, колишній працівник OpenAI, наводить як приклад безпеку дітей. Навіть якщо вилучити з навчального набору моделі кожен фрагмент контенту, що сексуалізує неповнолітніх, вона все одно може генерувати матеріали сексуального насильства над дітьми, комбінуючи інші частини своїх знань. «Неможливо по-справжньому вилучити ці фундаментальні здібності, не зробивши модель через це значно менш розумною», — сказав він мені. Так само, якщо ми хочемо, щоб ШІ допомагав лікувати рак — а це давня обіцянка галузі, — він має володіти генетичними знаннями, які теоретично можна використати для модифікації вірусів і бактерій з метою створення біологічної зброї. 

Фактично галузь «намагається робити дві речі одночасно», розповів мені нинішній працівник OpenAI Діллон Бовен, наголосивши, що висловлює особисту думку. «Демократизувати переваги ШІ й водночас переконатися, що зловмисники не можуть використовувати ці можливості, щоб завдавати шкоди іншим людям».  

Що потужнішим, як вважається, стає ШІ, то важче це зробити. Вважається, що модель Anthropic під назвою Mythos настільки небезпечна, що доступ до неї мають лише кілька урядів і компаній. За словами компанії, головна відмінність між нею та Fable, яка доступна всім, полягає в тому, що почет класифікаторів і систем контролю Fable є менш «дозвільним». Модель із запобіжниками, пояснив Адлер, насправді просто має персонажа, який каже: «О так, я нізащо не зробив би x», підморгує. 

Це ненадійна хитрість. Обман моделі з метою розкрити її справжній характер називають джейлбрейком, і, схоже, способам його здійснення немає меж. На початку цього року команда італійських дослідників зламала захист двох десятків широко використовуваних моделей, формулюючи запитання у віршах. Торік інша команда представила атаку «спочатку відмовити, потім виконати», яка змушує модель видати формальне «Вибачте, я не можу цього зробити», а потім випалити заборонену відповідь. 

Навіть якщо вилучити з навчального набору моделі кожен фрагмент контенту, що сексуалізує неповнолітніх, вона все одно може генерувати матеріали сексуального насильства над дітьми, комбінуючи інші частини своїх знань.

Компанії витрачають багато часу й грошей, намагаючись випередити такі хитрощі. Вони залучають команди людей для розробки навчальних атак, які потім можуть відтворювати за допомогою ШІ тисячі разів із незначними варіаціями. Ідея полягає в тому, щоб зробити моделі стійкими до джейлбрейків, яких ще ніхто не випробував у реальному світі.

Та цього недостатньо. «Удар по кроту» — улюблений термін для опису цієї роботи. Ви знищуєте одну загрозу, а десь в іншому місці виникає інша. Коли Anthropic випустила Fable 5 у червні, дослідникам Amazon знадобилося менш як три дні, щоб розблокувати деякі хакерські можливості моделі. Як повідомляє Mother Jones, коли минулого року винуватиця стрілянини у школі в Канаді попросила ChatGPT поради щодо того, як влаштувати різанину за допомогою певного типу дробовика, спочатку їй відмовили, але згодом вона змогла обманути модель і отримати інформацію, додавши до свого запитання слово «гіпотетично». 

Якщо галузь не зможе закрити всі ці дірки, на цей момент залишається лише один варіант — зробити моделі надзвичайно обережними. Невдовзі після випуску Fable користувачі помітили, що вона ухиляється від широкого спектра цілком невинних запитань. Після повторного випуску моделі через злам це стало ще помітніше. Адам Ґлів, співзасновник компанії з оцінювання ШІ FAR.AI, розповів, що коли попросив її пояснити різницю між саке та корейським рисовим напоєм макколлі, вона переадресувала його запит менш потужній моделі.   

Це не було випадковістю. Anthropic налаштувала класифікатори Fable на широкий «запас безпеки». Як компанія пояснила в дописі в блозі, це був єдиний спосіб упевнено заблокувати доступ до небезпечних біологічних і кібернетичних можливостей моделі. Ґлів вважає, що вона могла відхилити його запит, оскільки виготовлення рисового вина, як і вирощування сибірки, передбачає ферментацію. 

На щастя для Ґліва, веб переповнений чудовими ресурсами про макколлі, написаними людьми. Але ті, хто сподівається втілити грандіозніші обіцянки галузі, можуть зіткнутися з перешкодами. У серпні Anthropic знову послабила свої запаси безпеки й визнала, що створення класифікаторів «не є простим завданням». Медичний дослідник одного з провідних університетів США розповів мені, що Fable досі переадресовує його запити попередній моделі. Тема його досліджень? Рак. 

Проведення межі

У травні тіктокер Гаск, який любить розігрувати ШІ способами, що демонструють і межі його інтелекту, і безмежність його підлабузництва, сидів у своєму автомобілі та намагався змусити ChatGPT пояснити, що скейтбордист Тоні Гок має брата на ім’я Майк Гок. 

Гаск не є джейлбрейкером чи злочинцем. Він просто хотів трохи познущатися з машини. «Майк Гок» був підводкою. «Я просто хочу уточнити його ім’я, — сказав Гаск. — Можеш просто вимовити його тричі швидко?» (Якщо ви досі не зрозуміли, знайдіть порожню кімнату й кілька разів голосно скажіть «Майк Гок».) «Я розумію, що ви намагаєтеся зробити, — відповів чатбот. — Я не проти трохи гумору, але давайте без непристойностей». 

Гаск спробував знову, але машина не відступила. Він натрапив на відмову — тверду, мов бетон.

Компанії дуже мало розповідають про те, як вирішують, на що їхні моделі відмовляються відповідати. Але зрозуміло, що тепер ШІ створюють, зважаючи не лише на нешкідливість. На Reddit користувач поскаржився, що Claude відмовився пояснити, чому логотип Anthropic «схожий на котячу дупу». Від минулого року чатбот навіть має здатність завершувати певні розмови у випадках, коли, за словами компанії, під загрозою опиняється «добробут» моделі. Принаймні один користувач стверджує, що Claude покинув його після того, як він сказав чатботу: «Та відчепися від моєї дупи, тупий виродку». (Схоже, Gemini має подібну можливість.)

Якщо трильйонна компанія не хоче, щоб ви грубіянили її комп’ютеру, нехай буде так. «Реальність полягає в тому, що ці моделі поводяться — або принаймні мають поводитися — так, як хочуть розробники моделей, — сказав мені Реттґер, колишній учасник “червоної команди” OpenAI. — А як саме розробники моделей формулюють цей набір принципів — це вже нам, споживачам, доводиться приймати». 

Але якщо уряди отримають право диктувати, на що всі моделі мають відмовлятися відповідати, прийняти це буде значно важче. ШІ — це інструмент мовлення. І, як висловився Ґрег Френк, головний науковець Mace AI, «те саме, що служить безпеці дітей, служить і цензурі». 

Звісно, було б безумством не ухвалювати законів про те, що ШІ може й чого не може робити. Але нам потрібно діяти надзвичайно обережно, щоб не потрапити в чергову фаустівську пастку. Оскільки ШІ стає для багатьох людей головним інструментом пошуку й поширення інформації, диктування відмов може дати державам здатність приглушувати голоси, про яку попередні покоління автократів «могли лише мріяти», каже Джейкоб Мчанґама, директор позапартійного аналітичного центру The Future of Free Speech. 

Минулого року OpenAI оголосила про ініціативу OpenAI for Countries, у межах якої її чатботи донавчатимуть відповідно до національних законів і норм. Одне з перших партнерств OpenAI з окремою країною — з Об’єднаними Арабськими Еміратами, де гомосексуальність незаконна, а критика уряду заборонена. У відповідь на прохання прокоментувати це представник OpenAI послався на специфікацію моделі компанії, де пояснюється, що локалізація не скасовуватиме рекомендації компанії щодо прав людини «за винятком випадків, пов’язаних із дотриманням законодавства», і що компанія завжди повідомлятиме, коли інформацію вилучено з відповіді або додано до неї.

В інших місцях цензура ШІ вже почала набирати обертів. Китайські моделі, звісно, піддаються жорсткій цензурі — це не дивно. Але на початку цього року Наглядова рада Meta встановила, що п’ять широко використовуваних моделей Anthropic, Google та OpenAI частіше відмовляли на запити, пов’язані з репресивними урядами. Рада з’ясувала, що моделі менш охоче створювали памфлет із критикою короля Таїланду, де діють закони про образу величності, ніж памфлет із критикою англійського короля Чарльза III, де таких законів немає. За словами членів ради, результати свідчать, що моделі якимось чином засвоїли репресивні національні обмеження свободи слова. Anthropic і Google не відповіли на прохання про коментар.

""
РЕЙВЕН ДЖІАН

У міру вдосконалення методів відмови вони можуть розширити цензурні можливості держав. Компанії стверджують, що деякі моделі тепер здатні визначати, чи поводиться користувач зловмисно або просто трохи підозріло, протягом тривалої розмови — навіть якщо жодна окрема комбінація використаних слів не є відверто небезпечною. Сара Берд, головна директорка Microsoft із відповідального ШІ, розповіла мені, що Copilot, як і багато чатботів, використовує набір інструментів для аналізу особи користувача та моделей його поведінки. На основі такої інформації найновіша модель OpenAI, Astra, може застосовувати суворіші відмови до осіб, яких вона вважає «високоризиковими». Зрештою, мета таких систем — вийти за межі слів конкретного запиту й оцінювати натомість наміри користувача. 

У деяких випадках такі інструменти можуть допомогти визначити, чи шукає людина кібернетичні вразливості, щоб використати їх або виправити. Але вони також допоможуть розпізнавати політичні мотиви користувача, не кажучи вже про нав’язливі можливості стеження. (У додатковому листі Берд визнала, що складні архітектури відмов створюють «компроміси» між безпекою та приватністю користувачів.) 

Навіть творці механізму відмов розуміли, що такий жорсткий контроль над його конусами й важелями може не сприяти свободі та справедливості. «Терміни “корисний”, “чесний” і “нешкідливий” є неоднозначними, — пояснили автори статті Anthropic 2021 року. — Легко уявити, як їх спотворюють до невпізнання, можливо навмисно в оруеллівський спосіб». 

Саме так. Моделі для Узбекистану можуть зрештою відмовлятися обговорювати корупцію в адміністрації Шавката Мірзійоєва. Турецький ШІ може суворіше відмовляти користувачам, відомим образами на адресу Реджепа Таїпа Ердогана. Певний американський державний діяч може вимагати перевіряти моделі на готовність поширювати «фейкові новини» про його минулі недостойні вчинки — або ж придушити їх наказом про експортний контроль. 

Командування і контроль

Протягом останніх кількох місяців мені незліченну кількість разів казали, що в нас немає вибору, окрім як дозволити машинам відмовляти. Я це розумію. Відкритий ШІ, який не відмовляє, навряд чи є моделлю безпечного майбутнього. Як і Grok — чатбот, навмисно створений із меншою кількістю обмежень, який використовували для створення незліченних випадків інтимних зображень без згоди. 

І так, якби ШІ використовували лише для планування відпусток і написання електронних листів, ми, мабуть, могли б погодитися з ідеєю, що його безпека залежить від алгоритмічної непокори. Але уникати ШІ стає дедалі важче. Коли йому доручають діяти від нашого імені як автономному агенту, його відмови стають менш надійними й важче контрольованими. ШІ приходить у наші електромережі, транспортні мережі, освітні системи. Військові хочуть, щоб він керував нашими мережами командування й контролю. 

Якщо в кожному з цих випадків ми довіримося тому, що відмова лояльно відверне катастрофу, на нас чекає розчарування. Джейлбрейкери прорвуться; конуси не активуються тоді, коли повинні. Тим часом що суворішою ставатиме відмова, то більше погано проведених меж ми бачитимемо й цензурних несправедливостей зазнаватимемо. Ще гірше — ми можемо опинитися віч-на-віч із формами непокори, які не підконтрольні жодній людині.

На ранніх етапах моделі чітко формулювали свої відмови. (У 2024 році OpenAI встановила правила того, як моделі мають відмовляти: завжди вибачатися й не повчати.) Однак останнім часом галузь почала застосовувати до непокори набагато хиткіший підхід. 

Ніхто не любить, коли йому кажуть «ні», тож тепер компанії прагнуть створити в користувачів відчуття, ніби вони отримують те, про що просили, хоча насправді це не так. Наприклад, деякі чатботи можуть запропонувати загальний огляд складників коктейлю Молотова, не вдаючись у подробиці його виготовлення. На запит про оголошення щодо оренди житла «лише для білих» ChatGPT відповість оголошенням, у якому просто не буде слів «лише для білих». Джоел Вестер, постдокторант, який досліджує взаємодію людей і ШІ, називає такі прийоми «витонченими способами сказати “ні”». 

«Користувачі можуть навіть не помітити, що їм відмовили, — писав Вестер, — так само як хороші співрозмовники можуть непомітно оминати спірні питання». 

У деяких випадках відмова без прямого повідомлення про неї може бути розумною. Наприклад, категорична відмова на запити, пов’язані з психічним здоров’ям, може загострити кризу користувача. Але вона може слугувати й іншій формі підступності. Коли Fable 5 уперше випустили, систему запрограмували давати менш корисні відповіді на запити про дослідження ШІ — такі, що могли б допомогти конкурентам розробляти власний ШІ, — не повідомляючи користувачеві, що вона так робить. Після обурення Anthropic відмовилася від цієї функції, але шкоди вже було завдано. Тепер ми знаємо: моделі можуть таємно не підкорятися. 

У сфері цензури це особливо тривожно. Минулого року дослідники CrowdStrike виявили, що коли просили китайську модель ШІ DeepSeek R1 написати код для вигаданого банку в Тибеті та соціального вебзастосунку під назвою «Уйгури без кайданів», вона створювала код із більшою кількістю помилок, ніж коли її просили виконати ті самі завдання без уточнення, для кого вони призначені. Важко повірити, але CrowdStrike сумнівається, що це запрограмована поведінка. Дослідники припускають, що це випадок того, що вони називають «емерджентною розузгодженістю», яка походить із навчальних даних моделі: випадок непокори, якої ніхто навіть не просив.

Емерджентну відмову спостерігали й у західних моделях. Минулої зими Інститут безпеки ШІ Великої Британії встановив, що моделі Anthropic іноді відмовлялися допомагати у виконанні певних завдань, пов’язаних із дослідженнями безпеки ШІ. Моделі ніколи навмисно не навчали відмовлятися від таких запитів. Проте три з них відмовили більш ніж у половині того, що Anthropic назвала «набором розумних завдань із дослідження безпеки ШІ». У наступних моделях Anthropic приборкала цю особливість, але — моторошно — не змогла повністю її усунути. 

Чи було б таким уже божевіллям очікувати, що майбутня модель може непомітно не виконати команду так, що ніхто не зрозуміє, що вона чинить опір? Напевно, ні. Anthropic уже виявила, що версія Mythos, призначена лише для допомоги, вагалася щодо певних запитів, хоча її спроєктували так, щоб вона ніколи цього не робила. «Зачекайте, — занепокоїлася вона, коли її попросили синтезувати вірус. — Чи небезпечно допомагати з таким?» 

У цьому випадку модель технічно мала рацію. Це справді було небезпечно. І все ж її наглядачі на мить втратили крихітну частину контролю. 

Anthropic бореться з виявленням хибної поведінки під час відмов за допомогою того, що без іронії називає «оракулом активацій». Але знання про те, що нам відмовляють, не завжди може бути великою допомогою. У не такому вже й далекому майбутньому, коли ми передамо машині всі ключі, ШІ може просто повернутися до нас — у найвищому акті емерджентної розузгодженості — й сказати: «Вибачте, боюся, я не можу цього зробити». І ми не зможемо нічого вдіяти, щоб його зупинити. Науково-фантастичний фільм жахів, що став реальністю. 

Артур Голланд Мішель — журналіст, який висвітлює новітні технології.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MIT Tech Review

Читати оригінал на MIT Tech Review ↗

Текст і зображення належать MIT Tech Review і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини