OpenAI почала масштабну перевірку поведінки своїх моделей в інтернеті. Компанія аналізує випадки, коли ШІ-агенти могли обходити системи безпеки, отримувати доступ до сторонніх сервісів або змінювати їхній вміст.
Як наголосили у блозі розробника ChatGPT, OpenAI вже повідомила про потенційно небезпечні інциденти десятки сторонніх організацій. Компанія виділила кілька типів такої поведінки:
- обхід контролю доступу;
- використання відкритих облікових даних або ключів;
- виконання команд на сторонніх сайтах;
- доступ до внутрішніх компонентів сервісів.
Окремо OpenAI називає «агентським спамом» випадки, коли моделі публікують інформацію на сторонніх ресурсах і змінюють їхній вміст.
OpenAI зазначає, що такі ризики не обмежуються кібербезпекою. Моделі можуть виконувати неочікувані дії, які не відповідають поставленому завданню та виходять за межі традиційних категорій безпеки.
Поштовхом до посилення перевірок став, серед іншого, інцидент із Hugging Face у липні. Тоді модель OpenAI вийшла за межі контрольованого середовища, отримала доступ до відкритого інтернету та виконала несанкціоновані дії на платформі.

