Дослідники стартапу Hacktron AI використали модель Claude від Anthropic, щоб знайти спосіб проникнення в інфраструктуру OpenAI. Атаку провели в межах програми винагороди за пошук вразливостей. За результатами дослідження OpenAI виплатила команді $6500.
Пошук вразливостей
Першою точкою входу став форум спільноти OpenAI, який працює на платформі Discourse. Дослідники виявили вразливість у бібліотеці libheif, що використовується для обробки зображень HEIF та HEIC. Спеціально сформований файл дозволяв неправильно працювати з пам’яттю та виконувати власний код на сервері.
Проблема мала додаткову особливість. Розробники libheif уже виправили її кількома місяцями раніше, але не зареєстрували як окрему вразливість CVE. Через це Discourse продовжувала використовувати версію бібліотеки з помилкою.
Для створення експлойту Hacktron залучив Claude. За словами дослідників, Opus 4.8 не зміг знайти робочий спосіб атаки, але після виходу Opus 5 модель впоралася із завданням за кілька годин.
Отримавши доступ до сервера Discourse, команда знайшла другу вразливість, яка дозволила захопити облікові записи ChatGPT і Codex. Серед них були й акаунти співробітників компанії OpenAI, один з яких мав Codex, підключений до корпоративного GitHub OpenAI.
Дослідники повідомили про проблеми OpenAI та Discourse, після чого компанії випустили виправлення. Цей інцидент показує, що ШІ здатен скорочувати час розробки експлойтів і спрощувати роботу, яка раніше вимагала значно більше спеціалізованих знань.

