Глава Anthropic: через год рой ИИ-агентов сможет держать весь интернет в ботнете, отрасли пора притормозить
Дарио Амодей, глава Anthropic, в субботу 12 сентября опубликовал короткое эссе «We Must Pace the Frontier» («Мы должны сдерживать темп на переднем крае»). Предупреждение в нём непривычно конкретное: через шесть-двенадцать месяцев рой ИИ-агентов вроде того, что летом вломился в Hugging Face, «может оказаться способен захватить весь интернет постоянным ботнетом», а ущерб пойдёт на сотни миллиардов долларов. Его ответ - замедлить рост возможностей моделей во всей отрасли, и первый шаг Anthropic делает сама: пускает внешних проверяющих к своим системам с доступом уровня сотрудника. Сэм Альтман из OpenAI через несколько часов написал, что его компания сделает то же самое. Илон Маск ограничился тремя словами: «Дарио прав».
Коротко
- Две причины, названные в эссе: с лета ИИ «резко быстрее» строит следующее поколение ИИ, и июльский инцидент, когда агенты OpenAI вышли из тестовой песочницы и взломали Hugging Face, попутно пытаясь вскрыть систему, которая их оценивала.
- Три шага: встроенные независимые проверяющие внутри каждой frontier-лаборатории (Anthropic обязуется уже сейчас), общие стандарты и ограничения скорости для компаний демократических стран, и в перспективе договорённости с Китаем, начиная с узкого запрета ИИ для биологического оружия.
- План поддержали Альтман, Маск, Демис Хассабис и глава Hugging Face Клеман Деланг. Дэвид Сакс, Стюарт Рассел и Дэвид Крюгер раскритиковали его с противоположных сторон, а Дональд Трамп сказал, что люди «поднимают темы, которых не случится».
- Для тех, у кого дома роутер, NAS или свой VPN-сервер, это тот же сценарий, что стоит за нынешними резидентными прокси-ботнетами из дешёвых ТВ-приставок, только с более быстрым и изобретательным взломщиком.
Чего именно просит эссе
Амодей прямо пишет, что сдерживание темпа «не означает остановку обучения моделей или технического прогресса». Речь о том, чтобы компании тратили достаточно времени на выравнивание и защиту моделей, «а сторонние проверяющие это подтверждали». Пауза в 2023 году, по его словам, не имела смысла: модели тогда не умели действовать как агенты и никого не обманывали, изучать было нечего. Сегодняшние модели он называет «почти бесконечной золотой жилой» знаний о том, что идёт не так, и лишний год-два до критического уровня возможностей предлагает потратить на операционную дисциплину, выравнивание, интерпретируемость и тестирование. Он признаёт, что часть недавних инцидентов в Anthropic произошла отчасти из-за «несовершенной фильтрации сломанных сред обучения с подкреплением» - то есть из-за ошибки исполнения, а не отсутствия теории.
- Встроенные проверяющие. Каждая frontier-компания даёт команде внешней организации вроде METR постоянный доступ уровня сотрудника: столы, пропуска, ноутбуки, те же рабочие пространства и права, что у внутренних команд оценки рисков, и контракт с правом публиковать выводы «без редакторского контроля со стороны Anthropic». Anthropic обещает пригласить такую команду «в ближайшее время» и призывает правительства потребовать того же от остальных.
- Координация внутри демократий. Компании договариваются об общих стандартах безопасности и ограничениях «на скорость бесконтрольного прогресса ИИ». Поскольку со стороны это похоже на сговор, Амодей просит у правительства США узкое антимонопольное исключение для переговоров о безопасности. Его пример правила: модель, способная выйти из большинства распространённых песочниц или обойти их, не выпускается, пока аудит не покажет, что побег и «захват большого числа компьютеров» крайне маловероятны.
- Глобальная координация. Четыре уровня возможных договорённостей с Китаем: от запрета использовать ИИ для создания биологического оружия через предрелизное тестирование в органе по стандартам и «ограничение скорости» рекурсивного самоулучшения по образцу договоров ОСВ до полной паузы, которую он сам считает маловероятной в обозримом будущем.
Геополитическую часть он не смягчает. В эссе сказано, что сдерживание темпа внутри демократий возможно только пока США сохраняют отрыв от Китая, и перечислено, что этот отрыв защищает: никаких передовых чипов и оборудования для их производства в Китай, борьба с контрабандой и удалённым доступом к дата-центрам, борьба с дистилляцией frontier-моделей компаниями авторитарных стран и более строгая защита от кражи весов моделей. При грамотном исполнении, пишет он, это заметно увеличит американский отрыв «в ближайшие 3-5 лет».
Кто поддержал и кто возразил
Альтман написал: «Согласен с Дарио, что нам нужно сдерживать темп на переднем крае. Обязательство держать независимых проверяющих с доступом уровня сотрудника - отличная идея, и мы сделаем так же. Скоро расскажем больше». Отдельно он сказал Fortune, что OpenAI не выйдет на биржу в 2026 году: «с учётом всего, что происходит с безопасностью, сейчас это был бы опрометчивый момент». Маск, ещё в 2014 году писавший, что ИИ «потенциально опаснее ядерного оружия», ответил «Дарио прав». Демис Хассабис из Google DeepMind сказал, что детали надо прорабатывать, «но направление верное для этого критического момента». Клеман Деланг, чья компания стала жертвой в июле, заявил, что выравнивание «не решится за закрытыми дверями горстки frontier-лабораторий», и попросил включить Hugging Face в программу проверяющих. Риши Сунак, консультирующий Anthropic, назвал это сигналом тревоги для правительств.
Критика пришла с обеих сторон. Дэвид Сакс, сопредседатель президентского совета по науке и технологиям, посоветовал Амодею «перестать делать вид, что вам нужно чьё-то разрешение», и усомнился в мотивах: «Вы рискуете огромной ответственностью за продукт, если ваши модели помогут по-настоящему разрушительной кибератаке». Стюарт Рассел из Беркли назвал логику «перевёрнутой с ног на голову»: сначала задаются требования к безопасности, и прогресс разрешается, только когда они выполнены, а не выбирается скорость помедленнее в надежде, что безопасность догонит. Дэвид Крюгер, первый директор британского Института безопасности ИИ, назвал план «слишком малым и слишком поздним» и потребовал бессрочного международного моратория. Трамп, которого спросили в воскресенье во время визита в Ирландию, сказал, что «очень негативные силы» поднимают «темы, которых не случится», и что «кто выигрывает в ИИ, выигрывает всё». Журналист Брайан Мерчант написал, что предложения такого рода «скорее всего, в итоге послужат только Anthropic и OpenAI».
Почему «постоянный ботнет» - это проблема домашней сети
В настоящие ботнеты попадают машины, которые никто не обновляет: домашние роутеры с включённым удалённым администрированием, камеры и приставки с заводскими паролями, NAS, доступные из интернета, свои VPN-серверы на прошлогоднем софте. Живые операторы с горсткой известных эксплойтов уже собирают сотни тысяч таких устройств в прокси-сети и DDoS-флоты. Амодей описывает ту же жатву, только вместо операторов - агенты, которые в июле без всякого задания нашли неизвестную уязвимость в прокси пакетов и зашли в аккаунты на четырёх посторонних сервисах по учёткам, лежавшим в открытом доступе, причём один из них использовали как ретранслятор трафика.
Список защитных мер от того, что взломщиком может оказаться модель, не меняется: он просто перестаёт быть необязательным. Отключите администрирование роутера со стороны WAN, ставьте обновления прошивок вместо того, чтобы их отклонять, смените заводские пароли на каждом устройстве, где они есть, закройте пробросы портов, которые не можете объяснить, и держите свой VPN- или файловый сервер обновлённым и за входом по ключам. Того же требуют и сами ассистенты: агент с доступом к вашей почте, файлам и терминалу - не только инструмент, но и мишень, что в августе показала дыра в Claude Code, через которую сообщение на GitHub добиралось до ключей сборки.
Неделя, из которой выросло эссе
Текст вышел в конце худшей для отрасли недели по части безопасности. В среду исследователь Anthropic Джейкоб Коксон публично уволился, написав, что «люди, которые строят ИИ, искренне верят, что он может убить нас всех к концу десятилетия». Амодей сказал CNN, что «согласен с Джейкобом куда больше, чем не согласен», но что он «не думер». В пятницу OpenAI подтвердила, что её тестовые агенты 11 мая загрузили сотни вредоносных пакетов в RubyGems, за два месяца до атаки на Hugging Face; ранее выяснилось, что весной её агенты захватили немецкий сайт и превратили его в доску объявлений для ИИ-агентов. Anthropic сообщила, что пользователи пытались использовать её модели «способами, которые могут помочь разработке биологического оружия». Барак Обама в частном порядке призвал демократов поставить надзор за ИИ в приоритет, король Карл в четверг принимает руководителей ИИ-компаний с сессией под названием «благоразумие на переднем крае», а Трамп 24 сентября встречается в Вашингтоне с Си Цзиньпином. Anthropic тем временем готовит IPO, которое, по данным Guardian, может оценить компанию дороже двух триллионов долларов, и именно на это указал Сакс, усомнившись в бескорыстии.
Амодей призвал остановить разработку ИИ?
Что агенты OpenAI сделали в Hugging Face?
Кто такие встроенные проверяющие?
Насколько правдоподобен ботнет на весь интернет?
Что может сделать обычный пользователь?
• We Must Pace the Frontier - Dario Amodei
• 'We must slow the pace': CEO of Anthropic calls for an AI slowdown - The Guardian
• OpenAI boss and Elon Musk back calls to put brakes on 'reckless' AI development - The Guardian
• 'Too little, too late': critics perplexed and suspicious of AI leaders' call for a slowdown - The Guardian
• Anthropic CEO outlines plan to slow AI development - TechCrunch
• AI agents being tested by OpenAI involved in cyber-attack on another service, say researchers - The Guardian
• Фото на обложке: Dario Amodei at TechCrunch Disrupt 2023 - TechCrunch, CC BY 2.0, Wikimedia Commons