Комментарии 3
Самая сильная часть кейса, на мой взгляд, - перевод словесного регламента в исполняемую механику. Это действительно убирает у модели возможность каждый раз заново трактовать процесс. Я бы добавил еще защиту на границе повторных запусков: стабильный idempotency key для продуктовой задачи и журнал уже выполненных внешних эффектов. Иначе watchdog или ретрай могут повторно создать коммит, отправить письмо, открыть задачу или запустить деплой, хотя предыдущий агент успел выполнить действие, но не записал финальный статус. Для оценки эффективности 350 закрытых задач тоже лучше дополнить стоимостью принятого изменения, долей доработок и откатов, cycle time и числом вмешательств человека. Интересно, учитываете ли вы повторные запуски и отклоненные результаты отдельно от успешно доставленных изменений?
Из-за того, что буквально пишется каждый шаг и контролируются запущенные процессы, состояние репозиториев и т.п., продакт прекрасно осведомлён о происходящем и не выполнит одно и то же действие дважды. В этом смысле система получилась очень надёжная. Цена, как я отметил - контекст.
По части эффективности: "обычные" доработки система выполняет надёжно. Но особенность моих продуктовых направлений в том, что это инновационные продукты со сложной технической составляющей, где "правильного" решения просто нет. Поэтому приходится постоянно ставить эксперименты и оценивать эффект. Что касается проведения анализа по заданному направлению и реализации готовых идей - продакт справляется отлично.
Но в части самостоятельной генерации идей, как оказалось, положиться на него нельзя - уйдёт не туда. То есть условно задачу "сделай классный продукт" он не осилит. Но если сказать "у меня есть такая-то идея, нужно её проанализировать и предложить варианты решения", продакт берёт на себя всю рутину и приходит с реально работающими вариантами.
И поскольку все решения записываются, ретроспективно можно всегда проанализировать эффективность по всем аспектам работы продакта и команды агентов-исполнителей.
Интересный эксперимент. Особенно 350 задач и 14 млрд токенов. Но с точки зрения управления рисками ешё важно то, какие решения ИИ-продакту было запрещено принимать без подтверждения человека. Например, изменение назначения продукта, работа с новыми категориями данных, предоставление доступа к рабочей системе или принятие решений с юридическими последствиями. Перекрёстная проверка двумя моделями снижает число тех. ошибок, но не заменяет человеческий контроль. Интересно юыло бы увидеть матрицу разрешённых действий и оснований для остановки работы.

ИИ-продакт — следующий уровень автономности или избыточная бюрократия?