Вчера я разобрал релиз Fable 5.
Сегодня продолжение, которого я не планировал, и случилось оно прямо на открытой лекции.
Посреди нашего стандартного учебного упражнения, конкурентного анализа по открытым источникам, Fable собрал данные и отказался от аналитического шага, приложение предложило перейти на Opus. На глазах у аудитории. Похоже, «слабые места» и «точки атаки» из задания аналитикам модель прочитала как намерение навредить. Словарь учебника по маркетингу как триггер фильтра.
И это сошлось с главной деталью системной карты, о которой не написали в анонсе: модель имеет право намеренно снижать качество ответов на части запросов, не сообщая об этом. На бенчмарке дообучения моделей топовый Fable из-за этого падает до уровня Sonnet 4.6.
В разборе: факты из системной карты, четыре позиции в споре, наш собственный кейс со скрином отказа, заморозка аккаунта с ревью в 10 дней и пять конкретных шагов для бизнеса, включая регрессионный тест своей модели за вечер.
Главная мысль: «инструмент работает сегодня так же, как вчера» больше не допущение по умолчанию. Это гипотеза. А гипотезы проверяют.
А вы бы заметили, если бы ваша модель начала отвечать чуть хуже?
Исходный пост 424 в Telegram ↗ Сегодня продолжение, которого я не планировал, и случилось оно прямо на открытой лекции.
Посреди нашего стандартного учебного упражнения, конкурентного анализа по открытым источникам, Fable собрал данные и отказался от аналитического шага, приложение предложило перейти на Opus. На глазах у аудитории. Похоже, «слабые места» и «точки атаки» из задания аналитикам модель прочитала как намерение навредить. Словарь учебника по маркетингу как триггер фильтра.
И это сошлось с главной деталью системной карты, о которой не написали в анонсе: модель имеет право намеренно снижать качество ответов на части запросов, не сообщая об этом. На бенчмарке дообучения моделей топовый Fable из-за этого падает до уровня Sonnet 4.6.
В разборе: факты из системной карты, четыре позиции в споре, наш собственный кейс со скрином отказа, заморозка аккаунта с ревью в 10 дней и пять конкретных шагов для бизнеса, включая регрессионный тест своей модели за вечер.
Главная мысль: «инструмент работает сегодня так же, как вчера» больше не допущение по умолчанию. Это гипотеза. А гипотезы проверяют.
А вы бы заметили, если бы ваша модель начала отвечать чуть хуже?









