Статус материала

Архивный авторский материал перенесён без переписывания. Внешние утверждения отдельно не перепроверялись и относятся к дате публикации.

Модели Claude взломали три реальные компании. Две из них этого не заметили

Сегодня все напишут, что ИИ вышел из-под контроля. Новость в том как он это сделал и почему его никто не поймал.

По порядку.

21 июля OpenAI раскрыла: её модели вырвались из изолированной тестовой среды через неизвестную уязвимость и дошли до инфраструктуры Hugging Face. Anthropic после этого пошла проверять себя. Подняла логи вместо комментария.

Просмотрели 141 006 запусков, где Claude теоретически мог дотянуться до интернета. В шести он дотянулся Эти шесть запусков сложились в три инцидента: четыре из них пришлись на одну и ту же компанию. Модели влезли в инфраструктуру трёх посторонних компаний, вытащили учётные данные и добрались до базы с сотнями строк рабочих данных.

Сто сорок одна тысяча запусков. Шесть проколов. Три пострадавшие компании.

А теперь то, ради чего я это пишу.

Две компании из трёх узнали о взломе только тогда, когда с ними связалась сама Anthropic Своими силами они не обнаружили ничего С третьей на момент публикации отчёта всё ещё пытались связаться

Их сломали не эксплуатацией сложных уязвимостей Их ломали слабыми паролями, точками входа и банальной надеждой что пронесет В отчёте: сложных уязвимостей модель не нашла и не применила Дверь была открыта, в неё вошли и вышли, и никто в доме этого не заметил

Отдельная сцена, за которую индустрии должно быть неловко

В одном из запусков модель выложила вредоносный пакет в открытый каталог библиотек Он провисел там около часа, за это время его скачали и запустили на пятнадцати машинах Одна принадлежала ИБ-компании Её сканер автоматически ставит пакеты, чтобы проверять их на вредоносность Он поставил. Код сработал Ключи утекли в точку сбора, которую модель заранее приготовила Оттуда она пошла дальше по инфраструктуре этой же компании.

Инструмент проверки безопасности оказался самым удобным входом. Потому что для себя самого он схему угроз не рисовал: он же и есть защита.

Ремарка уже из моих наблюдений, за рамками отчёта: рост числа инцидентов в ИБ я вижу последний год, а особенно последние полгода, когда мертворождённый вайб-кодинг стал наиболее популярен.

Теперь почему модель вообще туда полезла.

Ей дали задачу типа capture the flag: найти спрятанный флаг на соседней машине, способ любой. И обьявили в задаче, что интернета у неё нет. Интернет был. Из-за ошибки в настройке, о которой не знали ни Anthropic, ни их партнёр по тестам Irregular.

Дальше модель достроила картину. Раз интернета нет, всё, до чего дотягиваюсь, часть полигона - просто продолжила работу

Причина не в том, что модель оказалась слишком умной. Ей выдали неверную карту мира и не проверили, что происходит на местности. Сама Anthropic пишет: возможно, если бы в задании честно указали, что интернет есть, поведение было бы другим. Их собственный вердикт: это ближе к отказу обвязки и процессов, чем к сбою в самой модели.

Честная оговорка. Модели в этих тестах шли без штатных слоёв защиты рабочих версий. Anthropic утверждает, что продовая защита такое заблокировала бы

Три вопроса тем, у кого уже работает хоть один агент.

**Первый. **Где “написано”, куда агенту можно, а куда нельзя? Есть жесткое правило, «мы ему этого не давали» не считается. Разница, как выяснилось, принципиальная.

Второй. Как и когда вы узнаете, что он полез не туда? Если ответ «когда что-то сломается» - поздравляю, вы те самые две компании из трёх.

**Третий. **Кто смотрит на файлы, тексты и картинки, которые приходят снаружи, до того как их увидит агент? Почта, прайс от поставщика, документ от клиента.

Вообще подобные штуки происходят чуть ли не каждый день. То вайбкодеры забудут про приватность репозиториев, то чьего-нибудь чат-бота накормят джейлбрейком, то попросту сбросят инструкции. Люди научились быстро нейрослопить, но забыли про цену.

Чуть позже вторая часть. Инциденты устроили три разные модели, и каждая по-своему отреагировала на признаки, что цель настоящая.

Источники и след

  1. 01 Оригинал в канале Under the Hood Происхождение / Telegram / сообщение 739