Консоль
Кейсы

Контролируем качество агентов

Мониторинг, оценка и улучшение агентов

В этом туториале мы рассмотрим основные идеи процесса контроля качества и автоматического улучшения агентов в console.

  1. Создайте агента Откройте раздел "Агенты" и нажмите кнопку "Добавить агента", или попросите суперагента создать нового агента. Давайте введем для агента инструкцию: "Отвечай в виде рифмованного четверостишия". Оставьте все остальные параметры по умолчанию. Сохраните агента.
  2. Создайте симуляцию

Симуляция - это тест-кейс агента. В симуляции мы описываем задачу клиента и критерии оценивания. В ходе выполнения симуляции, временный агент симулирует поведение клиента в соответствии с задачей. После завершения симуляции, судья оценивает состоявшийся диалог.

Перейдите в раздел "Симуляции". Нажмите кнопку "Добавить". Дождитесь генерации симуляции. Просмотрите результат:

img

Сгенерированную симуляцию можно редактировать - вы можете написать любые свои цели и критерии! Давайте напишем, что ответ агента должен всегда соблюдать рифму АБАБ:

img

Теперь мы можем сохранить агента. При сохранении агента симуляции запускаются автоматически

  1. Просмотрите результат симуляции

Подождите минуту. Обновите страницу. Перейдите в раздел "Симуляции". Вы увидите такую картинку:

img

Это означает, симуляция была проведена и оценена. Справа мы видим оценку и мнение судьи. Нажмите на кнопку стрелочки в разделе оценки - это переведет вас в раздел "Аудит" к логу симуляции.

  1. Просмотрите лог симуляции.

В разделе "Аудит" вы увидите только один диалог - лог исполненной симуляции. Выберите его слева. Для каждой симуляции может быть несколько таких диалогов, равное числу повторений.

Каждая симуляция уникальна для конкретной версии агента. Каждая новая версия агента - поскольку она по определению отлична от предыдущей версии - приведет к повторному запуску симуляций. Таким образом, каждая новая версия создаст новый набор симуляций в Аудите.

Просмотрите содержание диалога.

img

  1. Создайте аннотацию

Нажмите на любую реплику агента. Внизу появится строчка ввода. Придумайте какую-то критику - например, введите "Рифма должна быть идеальна. Нужно чтобы все рифмы были идеальные". Судья знает, что такое идеальная рифма. Нажмите на кнопку "+".

Слева, вы можете оценить диалог в целом. Поставьте палец вверх или палец вниз и сохраните. Вы создали аннотацию.

Аннотация - это комментарий к диалогу. Аннотация состоит из оценки диалога и критики. Оценка диалога может быть "приемлемо" или "неприемлемо". Даже если диалог приемлем, к аннотации может быть приложена критика. Критика привязывается к конкретным действиям агента - вызовам инструментов, их ответам, ответам агентов. На основе каждой критики генерируются симуляции.

  1. Сохраните кандидатскую симуляцию.

После создания аннотации, перейдите к редактированию агента. Откройте раздел Симуляций. Найдите симуляцию с плашкой "Кандидат". Если такой нет, подождите 15 секунд и обновите страницу. Симуляция будет выглядеть так:

img

Если вам не нравится формулировка кандидатской симуляции, вы можете ее отредактировать. Сохраните агента и кандидатская симуляция превратится в обычную симуляцию с привязанной критикой.

Кандидатская симуляция - это симуляция, сгенерированная при создании аннотации. Для каждой критики генерируется соответствующая кандидатская аннотация на основе содержания диалога и текста критики. В аудите отражается статус симуляции, связанной с критикой. С каждой критикой будет связана симуляция, кроме случаев когда вы удалите кандидатскую симуляцию.

  1. Попросите суперагента исправить ошибки.

Итак, теперь у вашего агента две симуляции. Одна создана "вхолодную" (на основе нашего абстрактного представления о том как агент должен вести себя), другая "по горячим следам" (по реальной ошибке, найденной в диалоге).

Наш следующий и последний шаг - это исправить ошибки симуляций. Перейдите на главную страницу и введите "исправь ошибки агента название агента. Отправьте запрос.

Суперагент посмотрит список ваших агентов. Найдет ошибки агента и запустит субагента, который исследует источник каждой проблемы и внесет соответствующие изменения. Суперагент может запустить несколько субагентов последовательно, пока не исправит все ошибки симуляций.

После внесения всех изменений, агент дождется завершения симуляций и посмотрит на оставшиеся проблемы. Судья, симулятор клиента и суперагент полностью независимы.

Если вам потребуется помощь в контроле качества, присоединяйтесь к нашему чату. Если бы вы хотели, чтобы агента создали, протестировали и внедрили за вас, обратитесь на sales@aiva.chat.