В этом туториале мы рассмотрим основные идеи процесса контроля качества и автоматического улучшения агентов в console.
Симуляция - это тест-кейс агента. В симуляции мы описываем задачу клиента и критерии оценивания. В ходе выполнения симуляции, временный агент симулирует поведение клиента в соответствии с задачей. После завершения симуляции, судья оценивает состоявшийся диалог.
Перейдите в раздел "Симуляции". Нажмите кнопку "Добавить". Дождитесь генерации симуляции. Просмотрите результат:
img
Сгенерированную симуляцию можно редактировать - вы можете написать любые свои цели и критерии! Давайте напишем, что ответ агента должен всегда соблюдать рифму АБАБ:
img
Теперь мы можем сохранить агента. При сохранении агента симуляции запускаются автоматически
Подождите минуту. Обновите страницу. Перейдите в раздел "Симуляции". Вы увидите такую картинку:
img
Это означает, симуляция была проведена и оценена. Справа мы видим оценку и мнение судьи. Нажмите на кнопку стрелочки в разделе оценки - это переведет вас в раздел "Аудит" к логу симуляции.
В разделе "Аудит" вы увидите только один диалог - лог исполненной симуляции. Выберите его слева. Для каждой симуляции может быть несколько таких диалогов, равное числу повторений.
Каждая симуляция уникальна для конкретной версии агента. Каждая новая версия агента - поскольку она по определению отлична от предыдущей версии - приведет к повторному запуску симуляций. Таким образом, каждая новая версия создаст новый набор симуляций в Аудите.
Просмотрите содержание диалога.
img
Нажмите на любую реплику агента. Внизу появится строчка ввода. Придумайте какую-то критику - например, введите "Рифма должна быть идеальна. Нужно чтобы все рифмы были идеальные". Судья знает, что такое идеальная рифма. Нажмите на кнопку "+".
Слева, вы можете оценить диалог в целом. Поставьте палец вверх или палец вниз и сохраните. Вы создали аннотацию.
Аннотация - это комментарий к диалогу. Аннотация состоит из оценки диалога и критики. Оценка диалога может быть "приемлемо" или "неприемлемо". Даже если диалог приемлем, к аннотации может быть приложена критика. Критика привязывается к конкретным действиям агента - вызовам инструментов, их ответам, ответам агентов. На основе каждой критики генерируются симуляции.
После создания аннотации, перейдите к редактированию агента. Откройте раздел Симуляций. Найдите симуляцию с плашкой "Кандидат". Если такой нет, подождите 15 секунд и обновите страницу. Симуляция будет выглядеть так:
img
Если вам не нравится формулировка кандидатской симуляции, вы можете ее отредактировать. Сохраните агента и кандидатская симуляция превратится в обычную симуляцию с привязанной критикой.
Кандидатская симуляция - это симуляция, сгенерированная при создании аннотации. Для каждой критики генерируется соответствующая кандидатская аннотация на основе содержания диалога и текста критики. В аудите отражается статус симуляции, связанной с критикой. С каждой критикой будет связана симуляция, кроме случаев когда вы удалите кандидатскую симуляцию.
Итак, теперь у вашего агента две симуляции. Одна создана "вхолодную" (на основе нашего абстрактного представления о том как агент должен вести себя), другая "по горячим следам" (по реальной ошибке, найденной в диалоге).
Наш следующий и последний шаг - это исправить ошибки симуляций. Перейдите на главную страницу и введите "исправь ошибки агента название агента. Отправьте запрос.
Суперагент посмотрит список ваших агентов. Найдет ошибки агента и запустит субагента, который исследует источник каждой проблемы и внесет соответствующие изменения. Суперагент может запустить несколько субагентов последовательно, пока не исправит все ошибки симуляций.
После внесения всех изменений, агент дождется завершения симуляций и посмотрит на оставшиеся проблемы. Судья, симулятор клиента и суперагент полностью независимы.
Если вам потребуется помощь в контроле качества, присоединяйтесь к нашему чату. Если бы вы хотели, чтобы агента создали, протестировали и внедрили за вас, обратитесь на sales@aiva.chat.