Статус материала

Архивный материал. Перенесён без новой редакционной проверки; факты и продуктовые условия относятся к дате исходной публикации.

Про promt-injection я рассказываю часто.

В плане того что любые данные извне, доставляемые агенту, харнесу, любой системе с AI должны быть проверены, зачищены и обработаны что бы не внести злонамеренную иньекцию.

Большинство сервисов и решений этим не заморачиваются - надеятся и так сойдет, бизнес в целом не любит думать о таких кейсах Обычно на конференциях и в отчётах лабораторий.

На прошлой неделе тема доехала до суда.

Коннектикут. Человек судится без адвоката, подаёт очередное ходатайство и прячет внутри инструкцию для ИИ. Белым по белому, кегль 3. Смысл простой: если этот документ читает модель, пусть её ответ согласится с тем, что тут написано.

Судья заметил в файле лишние пустоты. Всмотрелся. Нашёл.

Решение от 6 августа так и называется, санкция за использование промпт-инъекции. Четырнадцать страниц. Наказание вышло изящное: у человека забрали возможность электронной подачы Теперь только бумага и ножками в суд. Дело при этом идёт дальше, никого не выгнали.

Ключевое: сам суд ИИ для просмотра материалов не использует. Целились не в него. Целились в юристов другой стороны, которые входящие документы через модель прогоняют, как сейчас делают примерно все.

Механика до обидного простая. Парсер вытаскивает из PDF все символы подряд, ему всё равно, какого они цвета и размера. Невидимый глазу абзац приезжает в контекст целиком и весит там ровно столько же, сколько видимый аргумент.

В мае похожее было в Бразилии. Двое адвокатов спрятали инструкцию для судебной ИИ, и поймала их сама судебная ИИ. Штраф 10% от цены иска, 84 тысячи реалов, плюс письмо в адвокатскую палату.

К чему это всё?

И дело тут вообще не в суде - этот класс атак впервые стал видимым для рынка. Любой агент, любой скилл, любой ИИ-браузер, который ходит во внешние источники, уязвим ровно так же. И был уязвим вчера, просто у вчера не было номера дела.

Дальше начинается неприятная арифметика. Инъекция, которая сработала, следов не оставляет: испорченная выжимка выглядит точно так же, как честная. Значит видим мы только те попытки, которые провалились. Ждать статистики инцидентов бесполезно, её по построению не будет.

Гейты нужны на любой вход агента, внешний и внутренний. Программные, алгоритмические, процессные, человеческие.

Про человеческие отдельно. Anthropic на той же неделе выложила замер: люди одобряют 97% запросов на разрешение. В начале сессии человек ловит примерно 17% опасных команд, после полусотни запросов около 5%. Автоматика на том же месте не проседает.

Так что вопрос не в том, стоит ли у вас гейт. Вопрос в том, кто его держит и в каком этот кто-то состоянии к четырём часам дня.

Источники и след

  1. 01 Оригинал в канале Under the Hood Происхождение / Telegram / сообщение 810