AI-агенты в компании: что они делают сами и где ломаются
AI-агент это программа, которая получает цель, сама решает, из каких шагов состоит работа, и сама эти шаги выполняет. Именно этим он отличается от чат-бота, который только отвечает на вопросы, и от ассистента, который готовит черновик и ждёт, пока человек нажмёт кнопку.
Слово «агент» сейчас стоит почти в каждой презентации, и за ним прячутся очень разные вещи: от рассылки по расписанию до системы, которая сама решает, кому и что написать. Ниже разобрано, чем агент отличается от соседних понятий, какие три его свойства создают риск, три реальные поломки из нашей собственной практики и семь вопросов, которые стоит задать до запуска. Это взгляд практика, а не консультация по безопасности или праву.
Чем агент отличается от чат-бота и ассистента
Разница не в том, насколько умная модель внутри. Разница в том, кто принимает решение и кто нажимает кнопку.
| Что это | Кто решает, что делать | Кто выполняет действие | Цена ошибки |
|---|---|---|---|
| Чат-бот | Человек задаёт вопрос | Никто, он только отвечает | Вы получили неправильный ответ и увидели это |
| Ассистент | Человек ставит задачу | Человек, после просмотра черновика | Вы не заметили ошибку в черновике и согласовали её |
| Агент | Программа сама, из поставленной цели | Программа сама | Действие уже произошло, и вы узнаете об этом от клиента |
Практический вывод простой. Чат-бот ошибается в тексте, агент ошибается в действительности. Поэтому вопрос «насколько точна модель» для агента второстепенный. Первичный вопрос другой: что именно он имеет право сделать без человека.
Три свойства, из-за которых агент рискован
Он действует. Отправленное сообщение нельзя отозвать. Проведённый документ уже в учёте. Списанные деньги уже ушли. Чат-бот, который ошибся, тратит вашу минуту. Агент, который ошибся, тратит вашу репутацию перед клиентом.
Он решает сам. Ему дают цель, а не инструкцию. Это его сила: он справится со случаем, который вы не предусмотрели. Это же и его слабость: он справится с ним так, как понял, а не так, как вы имели в виду.
Он ошибается тихо. Сломанный отчёт видно сразу, потому что он не открывается. Агент, который делает не то, работает без единой ошибки в журнале. Он просто делает это уверенно и много раз.
Где агенты действительно работают
Общий признак удачных случаев один: результат можно проверить глазами быстрее, чем сделать руками.
- Рутина с чёткой границей: разобрать входящие письма по темам, собрать данные из нескольких источников в одну таблицу, подготовить черновик ответа.
- Действия, которые проходят через согласование человеком до того, как станут необратимыми.
- Работа, где ошибка стоит дёшево и обнаруживается сразу.
- Однотипные операции, которых много. Именно там экономия становится заметной.
Где они не работают
- Там, где действие необратимо: платежи, проведение документов в учёте, сообщения клиенту.
- Там, где правильность результата невозможно проверить быстрее, чем сделать работу самому.
- Там, где правильность зависит от контекста, которого нет в данных. Агент не знает, что с этим клиентом вы вчера поссорились по телефону.
- Там, где нет способа узнать об ошибке, кроме жалобы клиента.
Три поломки из нашей практики
Мы держим несколько агентов в собственной CRM: они обрабатывают заявки с рекламы и напоминают о встречах. Ниже три случая, когда они сломались. Во всех трёх агент делал ровно то, что ему сказали.
Напоминание каждые полчаса. Агент должен был один раз напомнить о демо. Отправка стояла внутри транзакции планировщика, и отметка «уже отправлено» сохранялась только в конце. Следующий цикл запускался раньше, чем отметка ложилась в базу, видел задачу невыполненной и слал то же сообщение снова. Человек получал его каждые тридцать минут.
Напоминание о встрече, которой не было. Агент искал в календаре ближайшее событие по клиенту и считал его демонстрацией. В календаре лежали личные записи менеджера, например «Перезвонить». Клиент получил напоминание о встрече, которую никто не назначал.
Одна заявка приходила бесконечно. Заявки с рекламы забирались фильтром «с такого времени», и этот фильтр включал саму отметку времени. Отметка обновлялась в конце цикла, а сообщение в мессенджер отправлялось до проверки на дубликаты. Одна заявка приходила снова каждые пять минут.
Ни одна из этих поломок не была ошибкой модели. Все три были ошибками в том, как агент понимал «я уже это сделал» и «что такое встреча». Именно там ломаются агенты на практике, а не в качестве формулировок.
Семь вопросов перед тем, как запускать агента
- Что именно он делает сам, а что только готовит на просмотр?
- Какие его действия необратимы и стоит ли перед ними подтверждение человеком?
- Как он понимает, что уже выполнил эту работу? Где эта отметка сохраняется и в какой момент?
- Что произойдёт, если он сработает дважды на одном и том же?
- Откуда он берёт контекст и что будет, если в том источнике мусор?
- Как вы узнаете об ошибке, если он не упал, а просто сделал не то?
- Кто его выключает, и сколько минут это займёт в десять вечера?
Если на четвёртый и шестой вопрос ответа нет, запускать рано. Эти два ломаются чаще всего.
Как это устроено в BAFDIM
Наш инструмент читает базу BAS и не пишет в неё. Он отвечает на вопросы и показывает, из каких документов посчитал ответ. Он не агент в том смысле, о котором эта статья: он не действует сам и ничего не отправляет от вашего имени.
Это осознанное ограничение, а не незавершённая функция. Решение и действие остаются за человеком, поэтому самый дорогой класс ошибок, описанный выше, у него просто отсутствует. Подробнее об уровнях доступа к базе мы разобрали в отдельной статье, а о том, какие вообще бывают AI-решения для BAS, в этой.
С чего начать
Возьмите одну рутину, у которой результат можно проверить глазами за минуту, и у которой ошибка ничего не ломает необратимо. Запустите агента на ней так, чтобы он готовил, а отправлял человек. Поживите с этим две недели и посчитайте, сколько раз человек исправил его перед отправкой. Это и будет ваша реальная готовность отдать ему кнопку.
Если вы хотите сначала навести порядок в цифрах, на которых потом будут работать агенты, сформулируйте три вопроса, ответы на которые вы сейчас ждёте дольше всего, и приходите с ними: демо длится 30 минут, на примере, близком к вашей сфере. Хочу увидеть демо.