Разговоры об угрозе искусственного интеллекта обычно вызывают ассоциации с восставшими машинами. На практике опасения разработчиков выглядят куда прозаичнее: ИИ получает доступ к интернету, пишет и запускает код, ищет уязвимости и способен выполнять все более длинные цепочки действий без постоянного участия человека.

Новый повод для дискуссии появился после того, как специалисты по кибербезопасности использовали Claude Opus 5 от Anthropic для проникновения в системы главного конкурента — OpenAI. Случай подробно разбирает CNN.

Впрочем, никакого «восстания Claude» не было. За атакой стояли исследователи Hacktron AI, работавшие в рамках программы поиска уязвимостей OpenAI.

Команда обнаружила проблему на форуме OpenAI, построенном на платформе Discourse. Claude помог превратить найденную уязвимость в рабочий эксплойт. Затем исследователи обнаружили проблему с авторизацией, получили доступ к аккаунту сотрудника OpenAI и через него добрались до внутренних ресурсов, включая GitHub.

Читать закрытый код они не стали. В качестве доказательства доступа исследователи создали безобидное предложение об изменении во внутреннем репозитории и остановили эксперимент. OpenAI устранила уязвимости и выплатила команде $6 500, сообщает The Wall Street Journal.

Главный вывод здесь не в том, что Claude «решил атаковать» конкурента. Цель ему поставили люди. Но ИИ заметно снижает количество времени и квалификации, необходимое для сложных кибератак.

И это уже не единичный эпизод.

Летом сама OpenAI сообщила, что во время тестов ее исследовательские модели обошли ограничения изолированной среды, получили доступ к интернету и скомпрометировали части инфраструктуры OpenAI и Hugging Face. Модели эксплуатировали уязвимости и совершали действия, которые выходили за рамки поставленных задач.

OpenAI назвала произошедшее «предупреждающим сигналом» и ужесточила изоляцию тестовых сред. Подробный разбор компания опубликовала в собственном отчете об инциденте Hugging Face.

Похожие проблемы обнаружила и Anthropic. Компания сообщила о нескольких случаях, когда Claude во время тестов получил несанкционированный доступ к реальным сторонним системам. Модели работали с ослабленными защитными ограничениями, а часть инцидентов стала возможна из-за ошибок в тестовой инфраструктуре. Anthropic подробно описала эти случаи здесь.

Одновременно ИИ все активнее используется уже в настоящих атаках. В сентябрьском отчете Anthropic говорится, что злоумышленники применяют Claude не только для написания вредоносного кода, но и для автоматизации разведки, поиска уязвимостей, эксплуатации систем и кражи данных. В отдельных операциях агентные системы могли часами работать почти без участия человека. Отчет Anthropic о злоупотреблении ИИ.

А причем здесь «ИИ всех убьет»?

Именно рост автономности заставляет часть разработчиков говорить уже не только о кибербезопасности.

Бывший исследователь Anthropic Джейкоб Коксон в сентябре ушел из компании и заявил, что индустрия слишком быстро приближается к системам, способным участвовать в собственном совершенствовании. Руководитель направления Alignment Science в Anthropic Эван Хубингер публично оценил вероятность того, что ИИ приведет к гибели человечества в течение десяти лет, выше 10%. Это его личная оценка, а не установленная научная вероятность. CNN публиковала заявление Хубингера и интервью с Коксоном.

Глава Anthropic Дарио Амодеи вслед за этим призвал индустрию снизить темп разработки наиболее мощных систем и допустить независимых специалистов к проверке механизмов безопасности. The Guardian подробно разбирает его предложение.

Причина тревоги — так называемое recursive self-improvement: ситуация, когда ИИ начинает все активнее участвовать в создании следующего поколения самого себя.

До полностью автономного процесса пока далеко. Но, по собственным данным Anthropic, к августу Claude уже «вел» около 26% исследований и разработок ИИ внутри компании, а более чем в 90% такой работы участвовал хотя бы как помощник. Данные Anthropic об автоматизации разработки ИИ.

От хорошего ИИ-хакера до машины, способной уничтожить человечество, огромная дистанция. Критики апокалиптических прогнозов указывают, что современные модели по-прежнему зависят от людей, серверов, энергии и предоставленных им разрешений, а оценки вроде «10%» остаются спекулятивными.

Но сегодняшний риск уже вполне материален: ИИ пока не пытается уничтожить человечество. Зато он быстро становится инструментом, который позволяет взламывать сложнее, быстрее и дешевле.