Архивный авторский материал перенесён без переписывания. Внешние утверждения отдельно не перепроверялись и относятся к дате публикации.
За два года AI-агенты стали надёжными. И ровно поэтому им стало опаснее доверять. Две свежие работы за неделю.
Хорошая новость первой.
Бенчмарк WorkBench гоняет агентов по офисным задачам: письма, встречи, CRM, поиск данных. Считает, сколько задач закрыли и как часто навредили (например, отправили письмо не тому).
2024: лучший агент закрывал 43% задач, вредил в 26%. Каждая четвёртая задача с риском. 2026: лучший агент закрывает 89%, вредит в 2.5%.
И приятное: безопасность выросла вместе со способностью, не в обмен. Сильнее теперь значит аккуратнее. Старого размена «автономия в обмен на проколы» больше нет.
Теперь к этим 2.5%. Авторы прямо говорят: часть ошибок исчезла насовсем, а базовые необратимые остались. Среди них письмо не тому. И вот ключевое: эти 2.5% не уменьшаются от того, что модель стала умнее. Остаточный риск, который ростом модели не лечится. И здесь как раз таки начинается территория на которую мы идем - а именно обвязка для моделей, guardrails, скрипты и все что защищает нас от нежелательных действий агентов
И 2.5% это не мелочь. Это на задачу. Агент крутит сто задач в день, и вот вам два-три необратимых косяка ежедневно, под полсотни в месяц. Маленький процент, большие числа. Процент показывает, куда ставить человека. (Оговорка: это один бенчмарк офисных задач, на вашем наборе доля может быть и выше, и ниже.)
На моем примере могу сказать - что одна из базовых, наивных проблем агентов без серьезной обвязки это сценарии типа:
- я перепишу файл и закину его в новый, а потом удалю старый, ой я старый удалил, а кто это сделал?
- я отправлю что то адресату, ой я не проверил таблицу адресов и взял ближайший из памяти или выдумал
Вторая работа бьёт в ту же точку. Все молча считают, что агент сам решит, когда инструменту доверять. Проверили: агент повторил за инструментом в 98% случаев, отключив своё мышление. И чем мощнее модель, тем более слепо она верит инструменту, а не наоборот. Даже когда у агента был вариант лучше, он всё равно шёл за инструментом.
Складываем. Агенты надёжны, но остаточные ошибки умом не лечатся. И агенты слепо верят инструментам, тем сильнее, чем умнее. Вывод один: способность выросла, доверие надо встраивать отдельно. Перестаньте ждать, что агент сам себя проверит. Не проверит.
Что делать, оба хода на вечер:
-
Гейт на необратимое. Выпиши действия, которые нельзя отменить (отправка, оплата, удаление, публикация, права), и поставь на них одно подтверждение человека. Остальное агент делает сам.
-
Проверяйте, что выдал инструмент. Где цена ошибки высокая, ставь второй контур, который сверяет результат инструмента. Не надейся, что агент сам заметит враньё.
И не покупай «здравый смысл» за счёт модели помощнее. Помощнее не значит критичнее.
Источники: arXiv 2606.13715, arXiv 2606.14476.
@gorilla_under_hood
Источники и след
- 01 Оригинал в канале Under the Hood Происхождение / Telegram / сообщение 459