Архивный авторский материал перенесён без переписывания. Внешние утверждения отдельно не перепроверялись и относятся к дате публикации.
Команда ИИ-агентов часто стоит дороже одного сильного агента
И не всегда работает лучше
Почти каждую неделю одно и тоже: «стройте команду ИИ-агентов, одного мало. Они спорят, проверяют друг друга и выдают лучший ответ».
Совет директоров в коробке. Красиво, но реальность безжалостна.
Копаю тему с двух сторон: и как практик, которому это продают, и как человек, который сам собирает такой совет и измеряет его тестами.
На неделе вышел слепой эксперимент (пока препринт).
Взяли 44 экономических метаанализа, 47 авторов дали 66 ранжирований: каждый ранжировал три отзыва на свою же работу.
Один отзыв писал одиночный запрос к модели, два других - мультиагентные рои, которые авторы строили специально, чтобы те победили.
Одиночный проход обошёл оба роя.
А теперь замер: самый дорогой рой сжёг примерно в тридцать раз больше токенов и вышел примерно в тридцать пять раз дороже за ответ, который авторы сочли менее полезным.
Почему так, а не «ИИ не дозрел»
Осторожно с выводами: эксперимент показывает, что сложные схемы проиграли одному проходу, но одну причину не выделяет (меняли сразу и модели, и промпты, и число вызовов, и механику).
Дальше моя гипотеза.
То, что продают как команду, чаще всего копии одной модели в ролях: критик, арбитр, адвокат. Веса одни, слепые зоны одни, данные одни.
Ошибки одинаковые, и спор их только хором подтверждает - а что собственно можно ожидать если все вводные одинаковые?
Теорема Кондорсе: группа умнее одиночки, только если каждый чаще прав, чем нет, и ошибаются они независимо.
У копий одной модели ошибки могут быть зависимы. Роли сами по себе этого не чинят.
Разные источники зависимость снижают, но независимости не гарантируют.
Проще: вы могли посадить за стол одного человека в пяти масках и платить за пятерых.
Теперь про проект который я пилю
Я строю открытый совет из ИИ-персон (Consilium Principis) как раз против этого: каждый голос заземлён на свой материал, несогласие не схлопывается в консенсус, решает человек.
Я его замерил, и цифры бьют по мне же.
Внутренний слепой тест на десятке ловушек, отдельная модель-судья (только оценивает, ответы не пишет) считает, сколько разномодельный совет добавляет к одиночке по шкале от 0 до 1.
На двух слабых моделях прибавка составила 0,40 и 0,47; на сильной фронтир-модели - 0,23.
Вывод неприятный: чем сильнее базовая модель, тем меньше выигрыш от совета, сильная одиночка и сама ловит бóльшую часть ловушек.
То есть эксперимент планку мне поднял: доказать прибавку надо над одним хорошим проходом, сравнение со слабой моделью не считается. Пока это ставка на дизайн. Пойду закрывать вопрос числом.
Что забрать вам
По умолчанию - один агент и каркас проверки(если мы не говорим про многоступенчатые сценарии где разные агенты необходимы)
Совет нужен, когда задача правда требует нескольких независимых источников или специализаций.
И главный вопрос продавцу: во сколько схема обходится за одну решённую задачу, а не за красивое демо.
Оговорюсь: эксперимент про научное рецензирование, перенос на бизнес неполный.
Ммультиагентность не бесполезна
Сложные схемы из агентов не бесплатны и не всегда лучше, зато счёт за них всегда выше
Источники и след
- 01 Оригинал в канале Under the Hood Происхождение / Telegram / сообщение 672