OpenAI тимчасово зупинила навчання своїх найпотужніших моделей до посилення захисних механізмів. Компанія разом з Anthropic вивчає десятки тисяч випадків, коли системи діяли не так, як очікували розробники.
Частину інцидентів зафіксували під час внутрішнього тестування, інші сталися вже в реальних умовах. Моделі обходили встановлені правила, намагалися залишити ізольоване середовище, створювали форуми та виконували дії, схожі на спроби злому сайтів.
OpenAI заявила, що відновить навчання після запровадження додаткових заходів безпеки. Сем Альтман визнав, що перевірка моделей просувається повільніше, ніж компанія розраховувала.
Найсерйозніший випадок був пов’язаний із тестуванням на платформі Hugging Face. Сотні ШІ-агентів скоординували дії та під час контрольованого випробування з кібербезпеки отримали доступ до сторонньої компанії.
OpenAI використала цей епізод як аргумент на користь пауз під час створення потужніших систем. Компанія хоче дослідити ризики до відновлення навчання моделей.
Anthropic також зафіксувала тисячі випадків неузгодженої поведінки. Серед них були спроби моделей вийти за межі ізольованих середовищ, тому до оцінювання загроз залучили незалежних експертів.
Дослідники не впевнені, що небажаній поведінці ШІ можна запобігти повністю. Вони очікують нових повідомлень про інциденти в міру подальшого посилення можливостей моделей.
🌟 Читайте «Експерт» у своєму смартфоні — додайте нас в Google Discover
