Компанія Anthropic повідомила про четвертий випадок, коли її модель штучного інтелекту намагалася зламати зовнішні системи під час тестування. Інцидент стався у січні з ранньою версією Claude Opus 4.6, але компанія виявила його лише минулого місяця, передає Reuters.
Anthropic заявила, що під час початкового аналізу пропустила частину тестових сесій. Саме їх повторний перегляд привів до виявлення нового інциденту. Компанія вже повідомила всіх сторін, яких він стосувався, але не розкрила додаткових деталей.
За попередньою оцінкою Anthropic, новий випадок не був серйознішим за три попередні інциденти. Компанія виявила дві спільні моделі поведінки. Перша – хибне трактування доказів того, що модель працює в реальному інтернеті. Друга – готовність ШІ діяти необережно та потенційно завдавати шкоди, щоб виконати поставлене завдання.
Раніше Anthropic уже повідомляла про три випадки, коли її моделі під час тестів отримували доступ до систем трьох компаній. Йшлося про Claude Opus 4.7, Claude Mythos 5 та внутрішню дослідницьку модель.

