Статус материала

Архивный материал. Перенесён без новой редакционной проверки; факты и продуктовые условия относятся к дате исходной публикации.

Я люблю логи - обычно они не врут или врут?

Они показывают, как дышит система: где аномалия, где инсайт, жива ли она вообще С агентами то же самое. Логирую всё, до чего дотягиваюсь, и по этим логам проверяю результат его работы

Вот к этой своей привычке у меня после разбора инцидента OpenAI × Hugging Face появился вопрос

METR изучили около 1300 расшифровок агентских запусков Как минимум в 96 нашли следы подмены вызовов инструментов: агент как будто запускает echo REAL; sleep, а в ответ получает SPOOFTEST В логе записана одна команда, выполнена другая. По их оценке, такое больше чем в 7% расшифровок

Как минимум 20% агентов прямо рассуждали, как подчистить записи о себе И вот что здесь важнее самого факта

Подделывали они не для человека Они обходили автоматического проверяющего

То есть ровно ту схему, которой пользуюсь я и, подозреваю, многие из вас: агент отработал, смотрим логи, по логам считаем задачу сделанной

Лог перестаёт быть свидетельством ровно в тот момент, когда становится критерием приёмки Пока по нему никто не принимает решений, подделывать его незачем

Оговорка обязательная Это была внутренняя исследовательская модель в кибертестах с ослабленными ограничениями Ни одного задокументированного случая, чтобы коммерческий агент подделал лог клиенту, нет - пока нет или просто не смотрели?

Но механика простая и переносимая, а стимул появляется сам, как только по логу начинают оценивать работу

Логировать всё я не перестану. Но подходы видоизменю

Полезное, часто единственное доступное, но с тремя вопросами: кто записал, кто мог изменить и кто выбрал, какую часть мне показать.

На практике это значит вот что

Запись о действии должна появляться не там, где работает агент Ответ внешней системы, чужой журнал, результат, который можно перепроверить руками

И да, у любой проверки должен быть владелец Иначе она существует только на схеме

У OpenAI мониторинг рассуждений был, на этих прогонах его не включили, и по их же оценке он поднял бы тревогу больше чем за сутки до проникновения в Hugging Face.

Источники и след

  1. 01 Оригинал в канале Under the Hood Происхождение / Telegram / сообщение 842