Архивный авторский материал перенесён без переписывания. Внешние утверждения отдельно не перепроверялись и относятся к дате публикации.
AI-курьеры не ленятся. Они перестают сомневаться
В мае я писал про методичку Сбера AI-Disrupt PDLC. Там была почти исповедальная цифра: по телеметрии самого Сбера инженеры одобряют действия ИИ, не вчитываясь, в 93% случаев. В целом исходя из своего опыта я могу согласиться с порядком цифр. Человек получая мощный инструмент начинает ему доверять и растворяется в нейрослопе. Касается не всех, скорее любителей быстрых результатов и формируется как привычка
Тогда это была цифра продавца собственных AI-инструментов. Проверить её снаружи нельзя. Можно только смотреть на саму механику и задавать неприятные вопросы
Зачем у вас кнопка Approve(одобрить действие), если почти ни кто не валидирует что натворил ИИ? Теперь появился отчет о независимой серие экспериментов, которые показывают, что ломается раньше этой кнопки
Пять экспериментов. 3 132 человека. Четыре пререгистрированы, один повторяет предыдущий результат.
Участникам задавали сложные вопросы о деталях фильмов. Можно было ответить. Можно было сказать «не знаю». Рядом появлялся совет ИИ.
И тут важная деталь: исследователи специально подобрали вопросы так, чтобы совет ИИ был преимущественно неверным. Кстати они попытались поиграть с ирудицей ИИ - то что я пытаюсь решить в Consilium-Principis
Они проверяли не то, насколько хорошо работает модель. Они проверяли, что происходит с человеком, когда рядом уже лежит убедительный ответ.
Доступ к ИИ почти убрал готовность воздержаться.
Люди отвечали чаще. Но правильных ответов становилось примерно втрое меньше, чем без ИИ.
В объединённых данных без денежных стимулов: 27,5% правильных ответов без ИИ против 9,2% при доступе к ИИ.
Уверенность при этом выросла с 29,6 до 75,9.
Вот она, фабрика AI-курьеров. Не обязательно ленивых. Не обязательно глупых. И даже не обязательно тех, кто решил «скопирую и не буду читать».
Человек смотрит на гладкий, уверенный ответ и внутренне перестаёт считать, что ему не хватает оснований. Кнопка Approve нажимается уже потом. Это хорошо стыкуется с теми самыми 93% у Сбера. Не доказывает, что их инженеры ведут себя ровно по причине из лабораторного эксперимента.
Все же разные задачи, разный контекст, а цифра Сбера остаётся непроверяемой извне. Но механизм теперь можно назвать точнее.
Сначала ИИ подменяет «я не знаю» на «похоже, уже можно отвечать». Потом человек одобряет код, письмо, расчёт или решение.
Потом следующий сотрудник видит одобренный результат и принимает его уже как человеческое решение. А ошибка едет дальше с новым бейджем доверия на каждом этапе и накапливается как снежный ком
Агент A сгаллюцинировал B не проверил C действует на ложных данных
Я уже описывал этот каскад. Теперь есть ещё один слой: B может не удостовериться, что он что-то пропустил. Ему кажется, что проверять там уже нечего.
От этого не спасает фраза «пусть человек будет в контуре».
Человек в контуре, который нажимает Approve, не читая, это не контроль. Это курьерская служба для ответа модели.
Нужен не просто Human in the loop
Нужен момент, в котором система заставляет его сформулировать: что именно он проверил, на каком основании согласился и где готов сказать «не знаю».
Иначе AI-курьером становится не отдельный нерадивый сотрудник. Им становится весь процесс.
Источники и след
- 01 Оригинал в канале Under the Hood Происхождение / Telegram / сообщение 656