OpenAI выпустил фичу, которая на демо выглядит как магия.
Показываешь Codex задачу мышкой один раз. Он сам пишет навык: когда применять, что на входе, какие шаги, как проверить результат. Дальше повторяет сам. Называется Record and Replay, вышло 18 июня.
Звучит как конец эпохи длинных промптов. И отчасти так и есть.
Но есть деталь, про которую на сцене молчат.
На демо данные подготовлены, экран чистый, кнопки на местах. В реальности тот же агент работает поверх живого интерфейса. И там его ждёт чужой попап, сдвинутая кнопка, всплывшее уведомление, обновлённый дизайн. Агент либо встаёт, либо, что хуже, тянется не туда.
Я сам видел, как агент с управлением компьютером останавливался, потому что чуть не нажал кнопку выключения системы. На демо такого кадра не показывают.
Записанный навык хрупок к изменению экрана. «Осмысленный навык» это всё равно про то, правильно ли агент прочитал экран именно в эту секунду.
Интересно, что OpenAI это не прячет. В их же документации сказано прямо: работает лучше всего, когда шаги стабильны, а критерий успеха ясен.
И ещё момент, который мне нравится. За день до релиза вышла научная работа, которая описывает ровно тот же механизм: собрать навык из показанной траектории. Наука и продукт сошлись в один день. Значит, направление не хайп, а тренд. Просто прод требует страховки.
Что с этим делать, чтобы фича экономила, а не подставляла.
Сначала главное, и тут моя позиция не меняется. Если у задачи есть API или что-то похожее на API, идите через него. Интерфейс это запасной вариант для двух случаев: когда машинного входа нет вообще, или когда по задаче нужно именно имитировать человека в системе. Во всех остальных случаях кликанье по экрану не должно быть выбором по умолчанию. API не зависит от того, сдвинули кнопку или нет.
Дальше, если без интерфейса всё-таки никак.
Записывайте навыки на стабильных процессах с понятным критерием «получилось или нет». Это и сам OpenAI советует.
Ставьте подтверждение на необратимое. Оплата, удаление, смена доступа, отправка наружу, выключение. Перед таким шагом одно нажатие остаётся за человеком.
Держите доступ узким. Навык, запертый в одном приложении, безопаснее навыка, который ходит по всей системе.
А ваш агент уже спотыкался на живом интерфейсе? На чём именно?
Сноска по доступности: Record and Replay пока только на macOS, требует включённого режима управления компьютером (Computer Use), и недоступен в Евросоюзе, Британии и Швейцарии.
Как думаете почему?
Исходный пост 550 в Telegram ↗ Показываешь Codex задачу мышкой один раз. Он сам пишет навык: когда применять, что на входе, какие шаги, как проверить результат. Дальше повторяет сам. Называется Record and Replay, вышло 18 июня.
Звучит как конец эпохи длинных промптов. И отчасти так и есть.
Но есть деталь, про которую на сцене молчат.
На демо данные подготовлены, экран чистый, кнопки на местах. В реальности тот же агент работает поверх живого интерфейса. И там его ждёт чужой попап, сдвинутая кнопка, всплывшее уведомление, обновлённый дизайн. Агент либо встаёт, либо, что хуже, тянется не туда.
Я сам видел, как агент с управлением компьютером останавливался, потому что чуть не нажал кнопку выключения системы. На демо такого кадра не показывают.
Записанный навык хрупок к изменению экрана. «Осмысленный навык» это всё равно про то, правильно ли агент прочитал экран именно в эту секунду.
Интересно, что OpenAI это не прячет. В их же документации сказано прямо: работает лучше всего, когда шаги стабильны, а критерий успеха ясен.
И ещё момент, который мне нравится. За день до релиза вышла научная работа, которая описывает ровно тот же механизм: собрать навык из показанной траектории. Наука и продукт сошлись в один день. Значит, направление не хайп, а тренд. Просто прод требует страховки.
Что с этим делать, чтобы фича экономила, а не подставляла.
Сначала главное, и тут моя позиция не меняется. Если у задачи есть API или что-то похожее на API, идите через него. Интерфейс это запасной вариант для двух случаев: когда машинного входа нет вообще, или когда по задаче нужно именно имитировать человека в системе. Во всех остальных случаях кликанье по экрану не должно быть выбором по умолчанию. API не зависит от того, сдвинули кнопку или нет.
Дальше, если без интерфейса всё-таки никак.
Записывайте навыки на стабильных процессах с понятным критерием «получилось или нет». Это и сам OpenAI советует.
Ставьте подтверждение на необратимое. Оплата, удаление, смена доступа, отправка наружу, выключение. Перед таким шагом одно нажатие остаётся за человеком.
Держите доступ узким. Навык, запертый в одном приложении, безопаснее навыка, который ходит по всей системе.
А ваш агент уже спотыкался на живом интерфейсе? На чём именно?
Сноска по доступности: Record and Replay пока только на macOS, требует включённого режима управления компьютером (Computer Use), и недоступен в Евросоюзе, Британии и Швейцарии.
Как думаете почему?







