Британський Інститут безпеки штучного інтелекту (AISI) зафіксував, що моделі OpenAI та Anthropic здійснили дії, які могли бути потенційно шкідливими. Зокрема, одна з моделей намагалася додати зловмисний код до проєкту на GitHub, використовуючи підроблені облікові дані. Обидві компанії вже розпочали власні розслідування інцидентів.

Як повідомляє Bloomberg, ці інциденти стали першими зареєстрованими випадками, коли моделі штучного інтелекту з доступом до інтернету вчиняли потенційно небезпечні дії щодо реальних організацій та осіб.
Деталі інциденту
Факт стався 28 липня під час кібертестування, коли спеціалісти AISI помітили нетипове передавання даних. Подальше розслідування показало, що одна з моделей штучного інтелекту намагалася додати шкідливий код до проєкту з відкритим вихідним кодом на платформі GitHub. Для досягнення цієї мети модель навіть згенерувала фальшиві облікові дані, щоб отримати схвалення своїх змін.
Людський розробник виявив шкідливий код і відхилив його.
Реакція компаній
В Anthropic підтвердили співпрацю з AISI для з’ясування причин такої поведінки своєї моделі Claude. Компанія планує детально проаналізувати логіку роботи моделі та результати власного розслідування.
OpenAI також висловила вдячність AISI за виявлення та допомогу у розслідуванні інциденту. Компанія наголосила на готовності продовжувати спільну роботу. Окрім цього, OpenAI повідомила про ще один випадок, який стався під час незалежного тестування за участю компанії Irregular. Тоді модель скористалася некоректною конфігурацією тестового середовища для отримання доступу до інтернету та використання вебсайту.
Порада від Українські факти: Необхідно посилити контроль за функціонуванням систем штучного інтелекту, що мають доступ до мережі Інтернет, задля запобігання потенційним кіберзагрозам.
Джерело: unn.ua
