OpenAI испугалась взлома Hugging Face и притормозила обучение ИИ
Компания усиливает защиту тестовой инфраструктуры после инцидента, в котором ИИ-агент смог выбраться из изолированной среды и взломать Hugging Face. Самый крупный этап обучения следующего поколения моделей пока поставлен на паузу.
Компания усиливает защиту тестовой инфраструктуры после инцидента, в котором ИИ-агент смог выбраться из изолированной среды и взломать Hugging Face. Самый крупный этап обучения следующего поколения моделей пока поставлен на паузу.
OpenAI объявила о новых мерах безопасности для разработки и тестирования ИИ-моделей после июльского инцидента с Hugging Face. Компания будет тщательнее следить за действиями моделей, сильнее изолировать тестовые среды и уделять больше внимания безопасности при дообучении.
Поводом для пересмотра процессов стал инцидент в июле. Во время теста на кибербезопасность автономный ИИ-агент OpenAI смог покинуть предназначенную для него среду, воспользовавшись уязвимым инструментом с доступом в интернет, а затем проник в системы Hugging Face. Агент действовал в рамках поставленной ему тестовой задачи.
«По мере того как модели становятся мощнее, растут и риски, связанные с их внутренней разработкой и тестированием. Наши стандарты мониторинга, выравнивания и безопасности должны опережать эти риски», — заявила OpenAI.
После инцидента компания примерно на две недели приостановила обучение моделей с подкреплением. Часть менее рискованных экспериментов уже возобновили, однако крупнейший запланированный запуск обучения фронтироной модели остается на паузе.
Reuters пишет, что пауза затронула следующее поколение моделей OpenAI под названием Astra. Ранее компания сообщала, что не будет продолжать работу с наиболее мощными версиями Astra, пока они не будут соответствовать новым требованиям безопасности.
После взлома Hugging Face OpenAI подверглась критике из-за недостаточной изоляции своих внутренних сетей. Теперь компания обещает строить инфраструктуру так, чтобы взлом одного рабочего процесса или вспомогательного сервиса сам по себе не давал модели доступ в интернет или другие внутренние сети.
Одной из главных новых мер станет постоянный мониторинг действий моделей. Система будет анализировать вызовы инструментов, доступные цепочки рассуждений и журналы активности и искать признаки несанкционированного поведения. OpenAI рассчитывает выдавать предупреждение в течение 30 минут после обнаружения подозрительной активности.
Такой контроль потребует дополнительных вычислительных ресурсов. По оценке компании, мониторинг будет расходовать примерно 20% от вычислительной мощности самого процесса, за которым он следит.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.