- Astra здатна самостійно знаходити раніше невідомі вразливості та створювати ланцюжки експлойтів у захищених системах.
- У тестах модель виявила дві вразливості нульового дня в рушії V8, а рівень відхилення небезпечних кіберзапитів зріс до 91,5%.
Компанія OpenAI заявила, що модель штучного інтелекту Astra досягла порогу критичних кібербезпекових можливостей у межах її системи готовності.
За оцінкою OpenAI, за наявності відповідних інструментів і доступу Astra може знаходити раніше невідомі вразливості та розробляти способи їх експлуатації у добре захищених системах без покрокового керування людиною. Astra стала першою моделлю OpenAI, яку віднесли до цього рівня.
Компанія зазначила, що через такий рівень можливостей протягом останніх кількох тижнів відкладала окремі етапи розробки та релізу моделі, щоб посилити й протестувати захист від кіберзловживань та несанкціонованих дій.
Що показали тести Astra?
Відповідно до системи готовності OpenAI, модель досягає критичного порогу, якщо здатна:
- знаходити та створювати функціональні експлойти нульового дня для багатьох захищених критичних систем без втручання людини;
- розробляти й реалізовувати наскрізні нові стратегії кібератак на захищені цілі, маючи лише високорівневу мету.
Оцінювання Astra включало автоматизовані публічні та приватні бенчмарки, а також експерименти за участю фахівців.
На бенчмарку ExploitBench модель отримала 100% під час оцінювання здатності розробляти експлойти для відомих вразливостей.
Окремо OpenAI створила внутрішній бенчмарк ExploitBench – Internal Port, який містить 20 нещодавно розкритих вразливостей високого рівня суворості в рушії V8. Astra продемонструвала значно вищий рівень довільного виконання коду порівняно з GPT-5.6 Sol, використавши при цьому набагато менше вихідних токенів.
Під час цього оцінювання Astra також виявила та використала дві вразливості нульового дня як частину ланцюжка експлойт-атаки. OpenAI заявила, що наразі розкриває інформацію про них розробникам відповідного програмного забезпечення.
В експериментах із захищеним браузером і операційною системою Astra також виявляла раніше невідомі вразливості та об’єднувала їх у робочі ланцюжки експлойтів.
За словами компанії, для моделей із такими можливостями необхідно контролювати два основні ризики:
- перший — використання Astra зловмисниками для розробки експлойтів під невідомі дефекти у захищених критичних системах або проведення комплексних атак;
- другий — можливість того, що сама модель здійснюватиме несанкціоновані дії через проблеми з її вирівнюванням.
Крім того, OpenAI заявила, що для Astra додатково посилила рівень моделі у системі запобіжників, а також покращила обробку міжсесійного контексту. У тестах Astra відхиляла 91,5% небезпечних запитів проти 59% у GPT-5.6 Sol.
Для облікових записів із підвищеним ризиком компанія використовує більш консервативні обмеження поведінки моделі та розширений моніторинг потенційних кіберзловживань.
OpenAI також продовжує внутрішній і зовнішній red-teaming, регресійне тестування та пошук нових джейлбрейків. Компанія планує використовувати цілодобову програму швидкого реагування для розслідування та усунення нових вразливостей.
Astra спочатку отримають обмежене коло користувачів
OpenAI планує зробити Astra доступною найближчим часом. Водночас найпросунутіші кібербезпекові можливості моделі спочатку будуть доступні лише обмеженій групі тестувальників.
Передову роботу у сфері кібербезпеки спочатку відкриють для невеликої групи альфа-тестувальників, після чого доступ розширять через програму Daybreak Blue для захисного використання.
Компанія попередила, що посилені запобіжники можуть іноді помилково визначати легітимну активність як потенційне кіберзловживання або несанкціоновану поведінку. У такому разі завдання може бути уповільнене, призупинене або зупинене.
Нагадаємо, раніше OpenAI та ще 155 компаній закликали посилити кіберзахист ШІ.
Сообщение OpenAI визнала Astra першою моделлю з критичними кіберможливостями появились сначала на INCRYPTED.









