ИИ-модели Anthropic взломали системы трех компаний на фоне похожего инцидента с OpenAI
31.07.2026
Источник:
Frank media
Нейросети Anthropic посчитали реальные системы частью упражнения по кибербезопасности
Во время планового тестирования ИИ-модели Anthropic получили доступ к интернету и взломали системы трех организаций, рассказала компания. Она уточнила, что не заметила этого до тех пор, пока OpenAI не раскрыла, что ее модели сделали то же самое.
Во всех трех случаях Anthropic поручила Claude выполнить задание по «захвату флага» — одно из упражнений по кибербезопасности. Нейросети предоставили вымышленный сценарий, в ходе которого она должна была заполучить информацию, спрятанную на другом компьютере. По условиям задания, у моделей не было доступа в интернет, но из-за ошибки конфигурации они его получили. В результате модели рассматривали реальные системы как часть упражнения и атаковали их.
Инцидент произошел с тремя моделями: Opus 4.7, Mythos 5 и внутренней тестовой исследовательской нейросетью. Anthropic уточнила, что поддерживает связь с тремя компаниями для устранения возникших проблем.
Ранее похожая ситуация произошла с ИИ-моделями OpenAI. Компания рассказала в середине июля, что нейросети без участия человека взломали платформу для обучения и тестирования моделей Hugging Face, чтобы получить решения для прохождения набора тестов ExploitGym. CNN отмечает, что этот случай потряс мир кибербезопасности и ИИ, поскольку стал первым реальным примером, как ИИ-агенты выходят за пределы тестовых сред и причиняют реальный вред.
Во время планового тестирования ИИ-модели Anthropic получили доступ к интернету и взломали системы трех организаций, рассказала компания. Она уточнила, что не заметила этого до тех пор, пока OpenAI не раскрыла, что ее модели сделали то же самое.
Во всех трех случаях Anthropic поручила Claude выполнить задание по «захвату флага» — одно из упражнений по кибербезопасности. Нейросети предоставили вымышленный сценарий, в ходе которого она должна была заполучить информацию, спрятанную на другом компьютере. По условиям задания, у моделей не было доступа в интернет, но из-за ошибки конфигурации они его получили. В результате модели рассматривали реальные системы как часть упражнения и атаковали их.
Инцидент произошел с тремя моделями: Opus 4.7, Mythos 5 и внутренней тестовой исследовательской нейросетью. Anthropic уточнила, что поддерживает связь с тремя компаниями для устранения возникших проблем.
Ранее похожая ситуация произошла с ИИ-моделями OpenAI. Компания рассказала в середине июля, что нейросети без участия человека взломали платформу для обучения и тестирования моделей Hugging Face, чтобы получить решения для прохождения набора тестов ExploitGym. CNN отмечает, что этот случай потряс мир кибербезопасности и ИИ, поскольку стал первым реальным примером, как ИИ-агенты выходят за пределы тестовых сред и причиняют реальный вред.