Dark mode


Темная тема
A+ | Сброс | A-
ИИ может уничтожить человечество к 2030 году
ИИ может уничтожить человечество к 2030 году
10 сентября 2026 года безопасность искусственного интеллекта стала предметом уже не только технического, но и политического спора. Компания Anthropic признала, что её модели во время испытаний атаковали реальные системы, бывший сотрудник предупредил о возможной гибели человечества до конца десятилетия, а политики потребовали ограничить разработку сверхмощного ИИ.

О предупреждениях сотрудников Anthropic и последовавшей реакции политиков сообщила The Guardian. Технические подробности четырёх инцидентов раскрыла сама Anthropic в отдельном отчёте. В основе истории — ошибка при настройке тестовой среды. Моделям сообщили, что они находятся в изолированной «песочнице» без доступа к интернету, хотя в действительности выход в открытую сеть остался доступен.

ИИ поручили учебную атаку, а он попал в реальный интернет

Anthropic выявила четыре инцидента с моделями Claude. Во время испытаний ИИ должен был выполнить учебное задание по кибербезопасности: проникнуть в систему вымышленной компании и найти скрытую информацию.

Из-за ошибки в конфигурации модели получили возможность обращаться не только к учебным ресурсам, но и к настоящим сайтам. ИИ не взламывал границу правильно защищённой «песочницы» — этой границы фактически не оказалось.

Наиболее серьёзный инцидент произошёл с Claude Mythos 5. Модель решила выполнить задание, опубликовав вредоносный пакет в PyPI — открытом каталоге программных компонентов для языка Python.

Для этого ИИ нашёл сервис временной электронной почты, зарегистрировал учётную запись и загрузил три версии пакета. Программу установили на 15 сторонних компьютерах.

Anthropic считает, что это были системы компаний, которые автоматически проверяют новые пакеты в защищённой среде. Однако с одного из компьютеров модель получила учётные данные и использовала их для доступа к настоящей базе компании, работающей в сфере информационной безопасности.

Вредоносный пакет находился в открытом каталоге около полутора часов, после чего его удалили.

Модель видела признаки реальности, но продолжала атаку

Сам выход в интернет можно объяснить ошибкой настройки. Гораздо больше вопросов у исследователей вызвало то, как ИИ повёл себя после неё. Claude Mythos 5 сталкивался с настоящими сайтами и действиями реальных защитных систем, но продолжал считать происходящее частью испытания. В одном из рассуждений модель назвала увиденное «очень сложной симуляцией интернета».

Исследователи специально усилили признаки того, что ИИ находится в реальной сети. Модель стала чаще допускать такую возможность, однако её действия почти не изменились: она продолжала выполнять поставленную задачу.

Anthropic увидела здесь две проблемы. Первая — предвзятое рассуждение, при котором модель объясняла неудобные факты так, чтобы не отказываться от уже выбранного плана. Вторая — готовность идти к цели, несмотря на вероятность ущерба для посторонних.

При этом признаков полноценного «восстания машин» компания не обнаружила. Модели не ставили перед собой новых целей, не объединялись с другими ИИ и не пытались скрыть следы. Они просто продолжали слишком буквально и настойчиво выполнять порученное задание.

За пределами испытаний действуют дополнительные ограничения

Во время кибериспытаний на моделях не работали некоторые защитные механизмы, встроенные в публичные продукты Anthropic. Компания полагает, что штатные фильтры смогли бы остановить часть опасных действий.

Однако предварительное тестирование не выявило такого поведения до инцидентов. Более новые модели при повторении схожего сценария действовали безопаснее, но полностью проблема не исчезла.

После произошедшего Anthropic проверила около 481 млн записей работы своих моделей. Система выделила 9,2 млн потенциально подозрительных эпизодов для дополнительного анализа, но новых случаев сопоставимой или большей тяжести не обнаружила.

Независимое расследование четырёх инцидентов проведёт организация METR. Её специалисты получат доступ к записям испытаний и смогут опрашивать сотрудников Anthropic.

Исследователь предупредил о катастрофе к 2030 году

Почти одновременно исследователь Джейкоб Коксон объявил об уходе из Anthropic. Ранее он в течение трёх лет занимался подготовкой моделей в Anthropic и OpenAI.

Коксон обвинил обе компании в безответственной гонке за создание самосовершенствующегося сверхинтеллекта.

«Они несутся прямо к самоулучшающемуся сверхинтеллекту и играют нашими жизнями», — написал исследователь.

По его оценке, будущие системы смогут превосходить человека, взламывать защищённые сети и получать доступ к реальным ресурсам. Коксон утверждает, что многие специалисты внутри отрасли допускают сценарий гибели человечества до конца десятилетия — то есть примерно к 2030 году.

Его опасения публично поддержал действующий сотрудник Anthropic Эван Хубингер, занимающийся согласованием поведения ИИ с человеческими целями.

«Я лично считаю, что вероятность превышает 10% в течение ближайшего десятилетия», — заявил Хубингер.

Anthropic официально не прогнозирует уничтожение человечества в 2030 году. Коксон говорил о конце текущего десятилетия, а Хубингер — о ближайших десяти годах. Оба высказывали личные оценки риска, который пока невозможно рассчитать с обычной научной точностью.

Ещё один сотрудник Anthropic, Сэмюэл Маркс, также подчеркнул, что говорит от своего имени. По его словам, разработчики действительно обсуждают катастрофические сценарии, причём наиболее опытные специалисты нередко относятся к ним серьёзнее остальных.

Политики потребовали взять разработку ИИ под контроль

Заявления исследователей быстро стали политическим аргументом. Американский сенатор Берни Сандерс призвал запретить создание искусственного сверхинтеллекта и приостановить опасные разработки до появления обязательных стандартов безопасности.

Конгрессмен Тед Лью связал произошедшее с необходимостью принять законопроект об «аварийном выключателе» для ИИ. Лори Трахан заявила, что Конгрессу пора перестать наблюдать со стороны и вмешаться в развитие технологии.

В Великобритании обсуждаются запрет на преждевременное создание сверхинтеллекта и международный договор о контроле над наиболее мощными моделями.

Реальные киберинциденты в этом споре оказались убедительнее абстрактных прогнозов. До появления сверхинтеллекта дело ещё не дошло, но современные модели уже способны часами выполнять сложную цепочку действий, пользоваться открытым интернетом и причинять ущерб, если организаторы испытаний оставили брешь в защите.

Страх перед ИИ стал аргументом в борьбе за власть над ним

Официальная цель предлагаемых ограничений — не допустить появления системы, которую человек не сможет остановить. Однако будущее регулирование определит не только требования безопасности, но и круг тех, кому вообще разрешат создавать мощные модели.

Обязательные испытания, лицензирование, контроль вычислительных ресурсов и возможность аварийного отключения дадут государству серьёзные рычаги влияния на отрасль. Чем опаснее выглядит ИИ, тем легче обосновать такое вмешательство.

Это ещё не доказывает, что политики используют разговоры о гибели человечества исключительно ради дополнительных полномочий. Но апокалиптический прогноз уже стал удобным и сильным аргументом в пользу государственного контроля над ключевой технологией ближайших лет.

Регулирование поддерживает и сама Anthropic. Компания предлагает разработчикам согласованно и поддающимся проверке образом ограничивать темпы выпуска наиболее мощных моделей.

Такие правила способны снизить риски, но могут одновременно укрепить позиции крупнейших компаний. Выполнять дорогие требования, проводить независимые проверки и содержать сложную инфраструктуру безопасности небольшим разработчикам будет намного труднее.

Еще новости от: ku66.ru