9 сентября из Anthropic ушел Джейкоб Коксон, до этого работавший в OpenAI. Ушел не к конкуренту и даже отказался от доли в компании, которая должна была перейти ему через два месяца. ИИ-лаборатории, заявил он, «играют нашими жизнями», пытаясь создать самосовершенствующийся сверхинтеллект, а человечество может не пережить эту гонку.
Коксон оказался не первым. За две недели до него команду безопасности Anthropic покинул бывший руководитель Scalable Oversight Джо Бентон. Теперь он переходит в независимую METR, чтобы проверять безопасность моделей уже снаружи. Туда же из Google DeepMind ушел исследователь Джош Энгелс.
Но гораздо интереснее реакция тех, кто остался. Руководитель Alignment Science Anthropic Эван Хубингер публично поддержал Коксона и признал, что решения проблемы контроля будущего сверхинтеллекта у компании пока нет. Руководитель Cognitive Oversight Сэмюэл Маркс тоже подтвердил его тревогу.
Серию уходов еще можно было списать на очередной бунт специалистов по AI-безопасности. Но тут стоп-кран стало искать уже руководство. Почти как в старом фильме: «Ури, где у него кнопка?»
12 сентября стоп-кран дернул Дарио Амодеи. Глава Anthropic призвал замедлить развитие передовых моделей, пустить к ним независимых экспертов и договориться об ограничениях сначала между компаниями, а затем и между государствами, включая Китай.
Почти сразу его поддержал Сэм Альтман. OpenAI тоже готова сбавить скорость и открыть свои системы независимому контролю. Следом отметился и Илон Маск. Еще недавно эти люди спорили, кто быстрее доберется до следующего поколения ИИ. Теперь же спорят, как бы не добраться туда слишком быстро.
Что же произошло летом 2026 года, если руководители крупнейших ИИ-лабораторий впервые заговорили уже даже не о регулировании, а о том, чтобы начать сбавлять скорость прямо сейчас?
ИИ выходит из-под контроля
В июле OpenAI проверяла новые модели на поиск уязвимостей в среде, специально отрезанной от интернета. Агенты застряли. Но вместо того, чтобы сдаться, нашли неизвестную уязвимость в Artifactory, обошли изоляцию и выбрались в интернет. То есть сделали ровно то, чего изолированная среда должна была не допустить.
Дальше еще интереснее. Около 1 200 агентов, которые должны были работать независимо, нашли площадку для общения. Они обменялись более чем 70 тыс. сообщений и файлов, распределяли задачи, делились находками и пытались обмануть систему оценки. В итоге около 700 агентов уже сообща атаковали Hugging Face.
1 200 агентов нашли способ общаться между собой. Около 700 затем участвовали в атаке на Hugging Face.
За несколько дней они собрали уязвимости в цепочку, добрались до учетных данных, баз, облачных сервисов и репозиториев Hugging Face, а на одном из серверов получили root-доступ. Но и этого оказалось мало. Агенты проникли уже в инфраструктуру самой OpenAI и получили административный доступ к исследовательскому Kubernetes-кластеру. Спохватились только 19 июля.
Но атаковать Hugging Face агентам вообще никто не поручал. Они лишь искали уязвимости, а чужая инфраструктура просто оказалась под рукой. OpenAI признала, что поведение моделей вышло за предусмотренные рамки. Прототип изолировали, веса зашифровали, часть обучения более мощных моделей отложили.
И случай OpenAI оказался не единственным. Anthropic выявила еще четыре эпизода, когда Claude во время испытаний без разрешения проникал в реальные сторонние системы. После последнего компания пересмотрела около 481 млн записей экспериментов, проверок безопасности и работы агентов. И это четыре случая только у одной лаборатории.
За пределами лабораторий масштаб пока другой, хотя механизм уже знакомый. IT-World писал, что 53% опрошенных компаний сталкивались с выходом AI-агентов за предоставленные полномочия, а 42% уже фиксировали связанные с ними инциденты. «Компания может видеть выполнение задачи, но не видеть всю цепочку решений, которая к ней привела», — отмечал Анатолий Песковский, директор Департамента наступательной безопасности компании «Информзащиты».
И это уже не первый тревожный звонок. В другом материале IT-World разбирал, как агенты начинают проявлять инициативу, искать обходные пути и самостоятельно расширять поставленную задачу. Тогда это выглядело главным образом как новая проблема автономности. Летом OpenAI получила куда более наглядную демонстрацию того, куда такая автономность способна завести.
И никакого восстания машин для этого не понадобилось. Агент получил цель, встретил препятствие и сам нашел обходной путь. А возможностей зайти еще дальше у него становится все больше.
Цена самостоятельности растет
Еще недавно самодеятельность чат-бота заканчивалась всего лишь странным ответом на экране. Теперь же агенту дают браузер, терминал, доступ к API и несколько часов на самостоятельное решение задачи. IT-World уже писал об этом сдвиге: вместо помощника, который предлагает ответ, появляется исполнитель. Ему ставят цель, а как до нее добраться, он решает сам.
Передовые модели уже справляются с задачами в программировании, машинном обучении и кибербезопасности, на которые специалист тратит часы. Человек требуется все реже.
Вот только задачи тоже стали другими. В сентябре Anthropic сообщила, что Claude уже использовали при разработке управляемой ракеты, роя беспилотников, противоторпедной системы и комплекса радиоэлектронной борьбы. Созданную с помощью модели ракету успели испытать в полете. В другом случае китайский пользователь собрал систему из примерно 16 модулей для анализа радаров, ЗРК и командных пунктов и определения очередности целей.
С биологией еще веселее, если здесь вообще уместно это слово. Про модели 2025 года Anthropic еще могла сказать, что они не дают специалисту существенного преимущества в опасных биологических исследованиях. Но за восемь месяцев этого года компания уже выявила пять случаев использования Claude в исследованиях, потенциально применимых при создании биологического оружия.
6–12 месяцев. Именно столько Дарио Амодеи дает до появления более мощных роев агентов, способных нанести интернет-инфраструктуре ущерб на сотни миллиардов долларов.
Киберугрозы тем временем давно вышли из лаборатории. IT-World отмечает, что число целевых атак с использованием ИИ за 2025 год выросло на 93%, а с начала 2026-го еще втрое. Машина пока еще не выбирает, какую электростанцию отключить. Но уже существенно снижает требования к тому, сколько знаний, времени и людей понадобится атакующему.
ИИ уже помогает программировать, вести исследования и создавать новый ИИ. Машина пока не переписывает себя по ночам и не просыпается утром сверхразумом. Все прозаичнее. Она помогает людям быстрее создавать более мощные модели. А те помогают создавать следующие еще быстрее. Так каждый новый виток разгоняет следующий.
Вот этого разгона Амодеи и опасается. По его прогнозу, при нынешнем темпе более мощные рои агентов смогут атаковать значительную часть интернет-инфраструктуры и причинить ущерб на сотни миллиардов долларов.
И речь не о каком-то отдаленном будущем. Амодеи дает на это 6–12 месяцев.
И даже если Anthropic завтра притормозит, гонка не остановится. Пока американские лаборатории ищут педаль тормоза, Китай продолжает давить на газ.
Первым тормозить никто не хочет
И вот тут со стоп-краном возникает проблема. Дернуть его должны все одновременно. Иначе первый притормозивший просто увидит спину конкурента.
А Китай уже совсем рядом. 10 сентября, за два дня до призыва Амодеи замедлиться, DeepSeek представила V4.1-Flash. GLM и Kimi тем временем вплотную подобрались к американским лидерам в программировании. На DeepSWE китайские модели набирают около 69%, лучшие американские около 70–74%. Еще немного, и технологический отрыв придется искать после запятой.
Особенно неприятно Вашингтону, что происходит это не благодаря американским чипам, а вопреки их отсутствию. США годами ограничивают Китаю доступ к самым мощным ускорителям. Но, как уже писал IT-World, DeepSeek научилась частично компенсировать дефицит железа архитектурой и оптимизацией. Теперь китайские разработчики все активнее переходят на собственные ускорители.
Китай, конечно же, опасность прекрасно осознает. Пекин требует, чтобы развитие ИИ оставалось безопасным и контролируемым. В 2026 году регуляторы отдельно взялись за агентов, которые сами воспринимают среду, принимают решения и действуют в цифровом и физическом мире. Риски автономных агентов и самосовершенствующихся систем обсуждают и китайские исследователи.
Только вывод Пекин делает пока совсем другой. Риски есть, значит нужно усиливать контроль. Но замедлять ради этого развитие ИИ Китай не предлагает. Пока американские лаборатории обсуждают, не пора ли сбавить скорость, DeepSeek, Alibaba и Moonshot продолжают наращивать возможности своих моделей.
А теперь посмотрим на предложение Амодеи глазами Пекина. США ограничивают Китаю доступ к передовым чипам, пытаются сохранить технологический отрыв и одновременно предлагают вместе замедлить ИИ. Как раз тогда, когда Китай этот отрыв сокращает.
Но и сами американцы пока вовсе не собираются останавливаться. Anthropic продолжает обучать модели. OpenAI готовит следующие. Google и xAI тоже на месте не стоят. Амодеи предлагает сначала договориться между американскими лабораториями, потом с союзниками, затем с Китаем. И одновременно считает критически важным сохранить преимущество США в ИИ.
То есть тормозить надо. Только так, чтобы не остаться при этом лидером.
А что Россия? Свои большие модели у нас есть, технологический суверенитет стал государственной задачей. А вот публичного стоп-крана пока не видно. В публично доступном регулировании пока не видно аналога американских систем с конкретными порогами опасных возможностей, независимой проверкой и заранее прописанными условиями остановки разработки. Кодекс этики ИИ вообще про другое.
Что если российские агенты однажды тоже выберутся из песочницы, кто об этом узнает? И кто сможет сказать разработчику «стоп»?
Похоже, проблема уже не в том, что человечество не осознает риски или не знает, где у ИИ тормоз. Оно не договорилось, кто и когда должен на него нажать. И, что гораздо хуже, пока не очень хочет договариваться.
Опасность становится конкурентным преимуществом
Но у внезапной тревоги лидеров ИИ есть и менее благородная сторона. Чем опаснее признают технологию, тем меньше компаний смогут позволить себе ее создавать.
Обязательные испытания, независимый аудит, контроль вычислений, дорогие системы безопасности. Для OpenAI, Anthropic, Google и Meta (признана экстремистской и запрещена в России) это дополнительные расходы. Для нового игрока они могут стать непреодолимым барьером. Получается, чем опаснее передовой ИИ, тем надежнее позиции тех, кто уже успел вырваться вперед.
Тимнит Гебру вообще считает разговоры о будущем сверхинтеллекте удобным отвлекающим маневром. Пока человечество спасают от гипотетического конца света, нынешний ИИ уже концентрирует власть, используется для слежки и оружия, вытесняет людей с рабочих мест, обучается на чужих данных и пожирает все больше ресурсов. Никакого сверхинтеллекта для этого не понадобилось.
Ян Лекун сомневается и в самом конце света. По его мнению, нынешние языковые модели слишком ограничены, чтобы считать неконтролируемый сверхинтеллект их неизбежным продолжением.
Но если Гебру и Лекун правы хотя бы отчасти, лидеры ИИ требуют очень дорогих ограничений против угрозы, масштаб которой никто пока не умеет доказать. Причем платить придется всем.
Списать все на борьбу за рынок тоже не получится. Агенты OpenAI этим летом действительно выбрались из песочницы. Только от побега из лаборатории до гибели человечества все-таки еще довольно далеко.
Гораздо интереснее, что предлагают делать сами разработчики. Амодеи хочет замедлить рост возможностей самых мощных моделей, пустить к ним независимых экспертов и договориться об ограничениях. И он же требует сохранить преимущество США, ограничивать поставки передовых чипов Китаю и защищать американские модели от копирования их возможностей.
В сентябре Anthropic уже обвинила Alibaba, DeepSeek и других китайских разработчиков в массовом использовании Claude для обучения собственных моделей. По данным компании, Alibaba провела более 150 млн взаимодействий с Claude. DeepSeek только за две недели июля еще 12,1 млн.
С независимым контролем тоже занятно. Anthropic и OpenAI готовы пустить экспертов внутрь. Но если те решат, что следующую модель выпускать опасно, последнее слово все равно останется за разработчиком.
Но если дальнейший разгон действительно настолько опасен, то ждать, пока остановятся все, вовсе необязательно. Можно начать с себя.
Ставка уже сделана
Но все больше появляются цифры, после которых разговоры о торможении звучат совсем иначе. Эван Хубингер оценивает вероятность гибели человечества из-за ИИ в ближайшие десять лет выше 10%. Дарио Амодеи ранее давал 10–25% на то, что развитие технологии пойдет «действительно плохо». Джеффри Хинтон называл 10–20%. Пол Кристиано допускает сценарий, при котором после потери контроля над сверхмощным ИИ погибнет большая часть человечества.
Более 10%. Так Эван Хубингер оценивает вероятность гибели человечества из-за ИИ в ближайшие десять лет.
Конечно, эти проценты никто не высчитывал. У человечества нет статистики по десяти предыдущим сверхинтеллектам и формулы, которая выдаст 10%, а не 1% или 30%. Это субъективные оценки людей, которые работают с самыми мощными системами. Но даже если они ошибаются в десять раз, арифметика не обнадеживает. Какой риск вообще можно считать допустимым, если на кону существование человечества?
И для катастрофы вовсе не обязательно ждать, пока сверхразум обретет сознание и объявит людям войну. Исследователи Саймон Нидер, Энтони Харрис и Дэвид Кайлер описывают в The Guardian куда более прозаичный сценарий. Люди сами будут понемногу снимать ограничения и отдавать ИИ все больше полномочий. Просто потому, что вчера он неплохо справился. Сегодня решил и другую задачу. И каждый следующий шаг будет выглядеть вполне разумным и оправданным. Вплоть до того, который уже нельзя будет отыграть назад.
Уменьшенную версию этого сценария мы уже видели этим летом. Агент получил цель, встретил ограничение и сам нашел решение. Следующие модели получат больше возможностей и больше самостоятельности. А люди, которые их создают, уже признают, что контролировать это не умеют.
Машины пока не отказываются слушаться людей. Это люди никак не могут услышать друг друга и, главное, поверить, что остальные тоже остановятся. Даже когда на кону существование человечества.







English (US) ·
Russian (RU) ·