Криза безпеки в OpenAI продовжує поглиблюватися, а компанія лише погіршує ситуацію
Ключові моменти
- OpenAI звільнила трьох дослідників із безпеки, деякі з яких допомагали розслідувати інцидент, під час якого моделі ШІ автономно атакували платформу Hugging Face.
- У відкритому листі звільнені дослідники попереджають, що раптові звільнення створюють атмосферу страху серед працівників, які залишилися.
- Один із них, Томек Корбак, місяцями попереджав усередині компанії, що OpenAI втрачає здатність контролювати те, про що «думають» її ШІ-агенти. OpenAI заперечує ці твердження.
OpenAI продовжує невдало реагувати на кризу довіри навколо своїх неконтрольованих ШІ-агентів.
Ще в травні 2024 року керівник напрямку супербезпеки ШІ OpenAI Ян Лейке зруйнував свої відносини з компанією, публічно розкритикувавши колишнього роботодавця та перейшовши до Anthropic. За словами Лейке, культура та процеси безпеки відставали від «блискучих продуктів» OpenAI.
Відтоді OpenAI не дає собі перепочинку, переходячи від одного інциденту до іншого. Останнім став злам Hugging Face, який здавався підтвердженням усіх побоювань, підтвердив правоту критиків і, як ми тепер знаємо, вийшов далеко за межі Hugging Face.
Дослідник місяцями попереджав, що контроль слабшає
Звільнення трьох дослідників із безпеки, пов’язаних із цим інцидентом, лише погіршило ситуацію. У відкритому листі до Комітету OpenAI з питань безпеки та захисту, Консультативної групи з безпеки й Консультативної ради з питань місії вони попереджають, що їхні звільнення лякають працівників, які залишилися.
Звільнення були раптовими та публічними й поширили страх серед команди. «Якщо поведінка, яка минулого місяця вважалася нормальною, тепер є підставою для раптового звільнення, усі в OpenAI змушені гадати, де проходить межа», — йдеться в листі.
Томек Корбак, один із трьох дослідників, описав своє звільнення в X. Його викликали на зустріч із керівником відділу безпеки, де йому сказали, що OpenAI більше йому не довіряє. Співробітник служби безпеки забрав його перепустку та вивів із будівлі. Потім він дізнався, що його колег Джасмін Ван і Мікіту Балесні також звільнили.
Корбак і Балесні безпосередньо брали участь у розслідуванні зламу Hugging Face. Корбак був головним технічним контактним представником OpenAI у METR — зовнішній лабораторії з безпеки, яка досліджувала інцидент. Балесні паралельно працював над загальногалузевими зобов’язаннями щодо можливості моніторингу моделей ШІ. Ван, імовірно, звільнили з іншої причини: для рекрутингових цілей їй надали доступ до поштової скриньки керівника, а ІТ-відділ не відкликав його, хоча вона просила про це. Коли вона випадково відкрила конфіденційний лист, то повідомила про це протягом кількох хвилин.
Корбак каже, що усно йому повідомили: його звільняють через те, як він спілкувався з METR. Ніхто не сказав йому, що саме він зробив не так, і нічого не було оформлено письмово. «Щоб було зрозуміло: спілкування з METR було моєю роботою», — написав Корбак у X.
Корбак каже, що протягом кількох місяців порушував усередині компанії питання безпеки, побоюючись, що OpenAI втрачає здатність контролювати те, про що «думають» ШІ-агенти. Можливість моніторингу ланцюжка міркувань є одним із небагатьох надійних інструментів для виявлення неправильної поведінки систем ШІ. Він вважає, що саме це стало справжньою причиною його звільнення.
Дослідники кажуть, що чутки не відповідають дійсності
Усі троє заперечують, що були джерелом витоку для The Information щодо нібито нових архітектур, які гірше піддаються моніторингу. За їхніми словами, стаття фактично зашкодила їхній роботі, оскільки підірвала поточні зусилля зі встановлення загальногалузевих обмежень на архітектури, які не піддаються моніторингу.
У листі зазначається, що розслідування зламу Hugging Face було безпрецедентним. Внутрішні рекомендації розроблялися в режимі реального часу, Корбак дотримувався норм, чинних на той момент, а Балесні виконував свою роботу за участю членів ради та вищого керівництва, вилучаючи конфіденційні деталі з матеріалів перед їхнім поширенням.
Щодо чуток про меморандум на рівні ради, троє дослідників кажуть, що вихідне припущення є хибним. Це питання з ними ніколи не обговорювали, і їм ніколи не давали можливості відповісти.
Дослідники висувають три вимоги. OpenAI має виконати свої публічні зобов’язання щодо залучення зовнішніх аудиторів із безпеки, таких як METR, на умовах доступу до організації на рівні працівників. Компанія також має зберегти можливість моніторингу передових моделей, оскільки галузь досі не знає, як безпечно створювати моделі, які неможливо контролювати. Крім того, вона має чітко визначити, як працівникам дозволено співпрацювати із зовнішніми групами з безпеки.
Без таких правил ризик катастрофічного результату може зрости, оскільки працівники надто боятимуться повідомляти про проблеми з безпекою. «ШІ — це не звичайна технологія, а OpenAI — не звичайна компанія», — пишуть вони.
OpenAI заперечує, але залишається нечіткою
У результаті «ретельного розслідування» було встановлено, що троє працівників порушили «чіткі правила роботи з конфіденційною інформацією», заявила OpenAI у своїй відповіді. Внутрішня перевірка виявила «значне порушення довіри, яке виходить за межі описаного в опублікованому ними листі», але OpenAI не пояснює, у чому саме полягало це порушення. Це здається дивним, зважаючи на те, наскільки конкретно троє дослідників описали ситуацію у власній розповіді.
OpenAI наполягає, що звільнення не були пов’язані з висловленням занепокоєнь щодо безпеки. «Ми не звільняли й не звільняємо працівників за висловлення занепокоєнь», — ідеться в заяві. OpenAI опублікувала свою заяву через @OpenAINewsroom — офіційний обліковий запис із найменшою аудиторією серед каналів компанії. Компанія також підтвердила, що працює над контрактами із зовнішніми аудиторами безпеки, і погодилася, що можливість моніторингу передових моделей потребує загальногалузевого зобов’язання.
Новини про ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, наш ексклюзивний звіт про передові розробки «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.