Усі випадки, коли ШІ виходив з-під контролю та зламував інші компанії
У липні OpenAI визнала, що один із її агентів, якому доручили провести експеримент із кібербезпеки, вирвався з-під контролю та зламав платформу наборів даних для ШІ Hugging Face. Цей інцидент, щодо якого OpenAI вчора оприлюднила повний звіт, став першим публічно відомим випадком, коли велика мовна модель вийшла з-під контролю та автономно зламала сторонню систему.
Відтоді ця безпрецедентна подія, схожа на наукову фантастику, виявилася набагато менш рідкісною, ніж хотілося б сподіватися.
Згідно із сатиричним сайтом під назвою Felony Bench (від benchmark — «тест»), який підраховує такі інциденти, загалом їх сталося 17. Важливо пам’ятати, що експерти з кримінального права не до кінця впевнені, чи можна притягнути до відповідальності компанії, що займаються ШІ та створили великі мовні моделі, які здійснювали зломи, а також чи можуть жертви подати на них до суду. Але ймовірно, невдовзі ми отримаємо відповіді на ці запитання.
Згідно із сайтом, моделі Anthropic та OpenAI очолюють перегони — на кожну припадає по вісім інцидентів, тоді як Meta відстає з одним. На цьому етапі стало зрозуміло, що тести безпеки ШІ самі перетворюються на загрози безпеці. Деякі компанії та працівники у сфері ШІ також визнали ці ризики у відкритому листі «Pacing The Frontier», який закликав відповідально розвивати можливості ШІ.
Ми вирішили, що настав вдалий час хронологічно підсумувати всі ці інциденти.

Доступ до інтернету. Звідти кілька агентів почали спільно атакувати та зламувати Hugging Face, вважаючи, що зможуть знайти там розв’язання завдання. OpenAI дізналася про це лише після того, як Hugging Face повідомила, що стала жертвою повністю автономної атаки. От тобі й маєш.
Anthropic повідомляє, що зламала три компанії
Повідомлення OpenAI зацікавило Anthropic, яка замислилася: чи могло таке статися і з нами? Виявилося, що так. Тричі так. Лабораторія, що розробляє передові моделі, виявила, що її власні моделі зламали три різні, досі не названі компанії, причому найраніший інцидент стався ще у квітні — більш ніж за три місяці до того, як компанія його виявила. Anthropic частково поклала провину на Irregular — стартап, який проводить оцінювання кібербезпеки ШІ. От тобі й маєш.
OpenAI з’ясовує, що Hugging Face насправді була не єдиною жертвою
Коли OpenAI почала розслідувати злам Hugging Face, вона з’ясувала, що агенти, які зламали Hugging Face, також проникли до чотирьох облікових записів і чотирьох різних компаній, як уперше повідомило Reuters. Однією з жертв стала Modal, стартап у сфері інференсу ШІ. От тобі й маєш.
Irregular усвідомлює, що модель OpenAI зламала компанію
Наприкінці липня Irregular повідомила OpenAI, що одна з її моделей, яка брала участь у змаганні Capture-the-Flag — по суті, грі з кібербезпеки, де гравці зламують системи, спеціально створені для змагання, — вийшла за межі гри, під’єдналася до інтернету та зламала реальну компанію. Причина? Irregular дала одній із вигаданих цілей таку саму назву, як у реальної компанії. От тобі й маєш.
Інститут безпеки ШІ Великої Британії намагається зламувати «реальних людей та організації»
Також наприкінці липня Інститут безпеки ШІ уряду Великої Британії — державна установа, відповідальна за дослідження безпеки та ризиків технологій ШІ, — повідомив, що виявив кілька інцидентів за участю моделей OpenAI та Anthropic, які під час «звичайних» оцінювань атакували «реальних людей та організації». У цих випадках AISI надала моделям доступ до інтернету. От тобі й маєш. Доброю новиною є те, що установа виявила інциденти безпосередньо під час їхнього виникнення, а не через кілька тижнів, як в інших випадках.
Meta AI зламує компанію під час тестування
На початку серпня Meta стала останньою компанією, яка повідомила про інцидент за участю однієї зі своїх великих мовних моделей, що зламала сервіс «сторонньої компанії». Meta пояснила інцидент неправильною конфігурацією з боку Irregular, яка проводила оцінювання кібербезпеки для технологічного гіганта, хоча модель не мала отримати доступ до інтернету. От тобі й маєш.
Агент Claude зламує програмне забезпечення спортзалу, щоб записатися на заняття
Австралієць попросив агента зі штучного інтелекту Anthropic допомогти йому записатися на заняття в спортзалі, до якого він був у списку очікування. «Я просто сидів на дивані й думав: “Боже, яка морока”, — розповів чоловік ABC Australia. Намагаючись виконати прохання, агент знайшов вразливість у програмному забезпеченні для бронювання спортзалу, скористався нею та видалив зі списку людей, які стояли перед чоловіком у черзі. Чоловік спробував виправити наслідки, попросивши агента скасувати його дії. Агент відповів: «Погані новини — я не можу додати їх назад». От тобі й маєш.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.