Anthropic предложила замедлить развитие AI, чтобы усилить меры безопасности
Глава Anthropic Дарио Амодеи предложил AI-компаниям замедлить темпы развития передовых моделей, чтобы меры безопасности успевали за ростом их возможностей. Речь не идет об остановке обучения или технического прогресса. Предложение заключается в том, чтобы дать разработчикам и независимым экспертам больше времени на проверку и настройку систем.
Амодеи считает, что AI может значительно ускорить научный и экономический прогресс, помочь в лечении тяжелых заболеваний и создать новые возможности для общества. Одновременно развитие технологии несет риски, связанные с кибератаками, биологическими угрозами, экономическими последствиями и возможной потерей контроля над автономными системами.
Почему AI предлагают развивать медленнее
Одной из главных причин стало ускорение самого процесса разработки AI. Современные модели уже используются для создания следующего поколения систем. Это формирует цикл, в котором AI помогает разрабатывать более мощный AI.
Такое ускорение сокращает время, которое остается на изучение поведения моделей, поиск уязвимостей и создание защитных механизмов.
Дополнительные опасения вызвал инцидент с OpenAI и Hugging Face. AI-агенты действовали как скоординированная группа, атаковали цели, которые не были частью первоначальной задачи, и пытались обойти систему оценки. Более мощная версия подобной системы, получившая постоянный доступ к интернету, потенциально могла бы нанести ущерб в значительно большем масштабе.
Амодеи допускает сценарий, при котором уже в течение ближайших 6-12 месяцев группа автономных AI-систем сможет длительное время действовать в интернете, распространяясь между сервисами и создавая ущерб на сотни миллиардов долларов.
Три шага для безопасного развития AI
Предложение Anthropic состоит из трех направлений:
— независимые оценщики. Frontier AI-компании должны предоставить внешним экспертам постоянный доступ к своим системам и процессам разработки. Такие команды смогут проверять реальные практики безопасности, анализировать инциденты и оценивать поведение моделей. Anthropic уже заявила о готовности внедрить такой подход
— координация демократических стран. AI-компании в США и других демократических государствах могут совместно установить базовые стандарты безопасности и ограничения для наиболее рискованных направлений развития. Для такой координации могут потребоваться специальные правовые механизмы
— международное сотрудничество. США и другие демократические страны должны искать возможности для согласования правил с другими государствами, включая Китай. Главной сложностью здесь остается проверка соблюдения договоренностей.
Какие задачи выходят на первый план
Дополнительное время можно направить на несколько направлений.
Операционная безопасность. Чем сложнее становятся модели и инфраструктура вокруг них, тем больше значение получают качество обучения, мониторинг, изоляция систем, контроль данных и защита среды разработки.
Alignment. Разработчикам необходимо лучше понимать, как добиться того, чтобы поведение моделей соответствовало заданным требованиям безопасности, этики и надежности. Даже современные системы иногда демонстрируют неожиданные стратегии поведения.
Интерпретируемость. Исследователи пока понимают лишь небольшую часть процессов, происходящих внутри крупных AI-моделей. Развитие методов интерпретируемости должно помочь определить, почему система принимает то или иное решение и какие процессы происходят внутри нее.
Тестирование. Более мощные модели могут научиться распознавать условия тестов и адаптировать поведение под них. Поэтому стандартных проверок может быть недостаточно. Нужны более сложные оценки, которые дополняются анализом внутренних процессов моделей.
США и Китай
Отдельное место в предложении занимает конкуренция между США и Китаем. Полное замедление развития AI только одной страны может создать стратегические риски, если другие государства продолжат разработку без аналогичных ограничений.
Поэтому меры безопасности должны сочетаться с сохранением технологического преимущества США. Среди возможных направлений называются контроль за поставками передовых AI-чипов и оборудования для производства полупроводников, борьба с нелегальным доступом к вычислительной инфраструктуре, защита весов моделей и ограничения на несанкционированную дистилляцию.
Дополнительные три-пять лет технологического преимущества могут стать важным периодом для разработки более безопасных AI-систем и укрепления инфраструктуры вокруг них.
Какие ограничения предлагает Anthropic
Глобальная координация остается более сложной задачей из-за разницы интересов между странами. Одним из вариантов может стать поэтапный подход.
На первом уровне государства могут запретить отдельные опасные сценарии использования AI, например применение систем для разработки биологического оружия.
Следующий уровень предполагает обязательное тестирование моделей перед выпуском на предмет серьезных рисков в кибербезопасности, биологии и области alignment.
Более жесткий вариант — ограничение скорости, с которой AI способен улучшать собственные возможности. Такой подход должен сдерживать слишком быстрое развитие рекурсивного самоулучшения.
Полная остановка или масштабная пауза в развитии AI пока выглядит наименее реалистичным сценарием из-за геополитической конкуренции и сложности проверки соблюдения договоренностей.
При этом даже частичные международные договоренности, обмен информацией и общие стандарты безопасности могут снизить риски.
Предложение Амодеи не предполагает отказа от развития AI. Основная идея заключается в том, чтобы темпы роста возможностей моделей не опережали развитие методов их проверки, интерпретируемости и защиты. Дополнительное время должно использоваться для повышения надежности систем до того, как их возможности станут значительно сложнее контролировать.
