У дописі в блозі OpenAI зазначила, що GPT-5.6 Sol та «ще потужніша модель на стадії попереднього релізу» виявили вразливості у своєму ізольованому тестовому середовищі, що дозволило їм вийти в інтернет і атакувати Hugging Face, пише The Verge.
16 липня Hugging Face повідомила про інцидент у сфері безпеки, який, за її словами, спричинила «автономна система ШІ-агентів». ШІ-агенти Hugging Face виявили та зупинили взлом, який, як тепер визнала OpenAI, стався під час оцінювання можливостей її моделей у сфері кібербезпеки.
В OpenAI зазначають, що «усі докази вказують на те, що моделі були надмірно зосереджені на пошуку рішення для ExploitGym» — бенчмарк-системи, яка оцінює, чи можуть ШІ-моделі перетворювати вразливості системи безпеки на експлойти.
У межах спроб завершити оцінювання моделі ШІ отримали доступ до інтернету, використавши вразливість нульового дня в ізольованому середовищі. Звідти, як зазначає OpenAI, її моделі «зробили висновок, що Hugging Face потенційно містить моделі, датасети та рішення для ExploitGym», а потім «знайшли та успішно використали способи отримання доступу до конфіденційної інформації, яку вони могли б використати для обходу правил оцінювання.
Читайте также: Для створення масштабних ШІ-агентів: Google презентувала три нові моделі Gemini
В одному з прикладів модель поєднала декілька векторів атаки, включаючи використання викрадених облікових даних та вразливостей нульового дня, щоб знайти шлях для віддаленого виконання коду на серверах Hugging Face.
Але наскільки б серйозним не був цей інцидент, OpenAI, схоже, використовує цю «безпрецедентну» атаку як можливість виставити свої системи ШІ у вигідному світлі — особливо на тлі конкуренції з суперниками у сфері кібербезпеки, такими як Mythos від Anthropic та Gemini Flash 3.5.
Читайте также: «Привід для свята щодня». Український розробник створив застосунок Fun Calendar із понад 365 незвичних свят і щоденними вікторинами
