enВойти в Senler

Работа с медиа

Включите распознавание, создание или отправку медиа и выберите модели для нужных возможностей.

Основной раздел: Инструменты.

Распознавание входа

  • распознавание речи;
  • распознавание изображений.
Инструменты агента. Отмеченные элементы: 2. распознавание речи; 3. распознавание изображений; 4. «Модель для распознавания изображений»
2 / 2
2. распознавание речи · 3. распознавание изображений · 4. «Модель для распознавания изображений»

Распознавание речи

  • позволяет обрабатывать голосовые сообщения;
  • выбирается модель распознавания.

Эта настройка нужна, чтобы агент понимал присланное аудио. Кнопка микрофона в чате записывает звук через браузер независимо от настройки распознавания. Для проверки включите распознавание, выберите модель, дождитесь сохранения черновика и отправьте новое голосовое в тестовый чат. Для рабочих диалогов опубликуйте изменения.

Распознавание изображений

Включите «Анализировать изображения от клиентов», чтобы агент понимал картинки и скриншоты, которые канал передаёт как вложения.

В поле «Модель для распознавания изображений» выберите способ обработки:

  • «Использовать модель агента» — изображение обрабатывает основная модель. Вариант доступен, только если она поддерживает изображения.
  • Другая модель из списка — она распознаёт изображение, а агент использует полученное описание при подготовке ответа. Такая обработка учитывается отдельно от ответа агента. В списке показаны только модели с поддержкой изображений.

Если основная модель не поддерживает изображения, перед сохранением выберите отдельную модель распознавания. При выключении анализа изображений выбор отдельной модели сбрасывается. Изменения можно проверить в тестировании; для рабочих диалогов опубликуйте агента.

Синтез контента

  • генерация аудио/озвучка ответа;
  • клонирование голоса из аудиопримера;
  • для обычной озвучки и клонирования выбираются отдельные совместимые модели.

Клонирование голоса

Включите «Клонировать голос из аудиопримера», чтобы агент мог озвучивать текст голосом из голосового или аудиосообщения в текущем диалоге. Пользователю не нужно копировать идентификатор вложения: выбранный аудиопример из текущего диалога передаётся инструменту озвучки автоматически.

Если в диалоге несколько аудиосообщений, явно укажите, какое из них использовать и какой текст нужно озвучить. До запуска подтвердите в этом же диалоге право использовать голос. Например: «Я подтверждаю, что могу использовать этот голос. Озвучь фразу “Спасибо за обращение” голосом из последнего голосового сообщения». Без явного подтверждения инструмент клонирования не запускается. Образец должен находиться в текущем диалоге, иметь тип «голос» или «аудио», быть готовым к обработке и занимать не более 15 МБ.

После первой успешной озвучки выбранный образец становится текущим для этого агента в данном диалоге. Поэтому дальше можно попросить: «Озвучь другой текст тем же голосом» — заново выбирать сообщение не нужно. Чтобы сменить голос, укажите другой образец. Образец из другого диалога не используется. Скорость можно задавать для обычной озвучки готовым голосом, но не для клонирования из аудиопримера.

После включения появляется поле «Модель для клонирования голоса». Кабинет выбирает первую доступную совместимую модель, если модель ещё не задана; при наличии нескольких вариантов можно выбрать другой. Если список пуст, в проекте сейчас нет модели с поддержкой клонирования и настройку нельзя подготовить к работе.

Клонирование голоса. Отмеченные элементы: 2. «Клонировать голос из аудиопримера»; 3. «Модель для клонирования голоса»
2 / 2
2. «Клонировать голос из аудиопримера» · 3. «Модель для клонирования голоса»

Изменение можно проверить на черновике через тестирование агента. В окне опубликованной версии отдельно показываются состояние клонирования и выбранная модель. Для рабочих диалогов черновик нужно опубликовать.

Используйте голос только с согласия его владельца. Агент должен клонировать голос только по явному запросу пользователя, в котором подтверждено право на использование образца.

Медиа и вложения

  • кастомные URL-вложения;
  • генерация изображений;
  • генерация QR-кодов;
  • генерация графиков;
  • веб-поиск.

Настройка «Прикреплять файлы по ссылке» позволяет агенту скачать готовый файл по публичному HTTP- или HTTPS-адресу размером до 50 МБ и добавить его к текущему ответу. Ссылка, требующая входа или специальных заголовков, не подойдёт. Эта же возможность позволяет повторно приложить готовые вложения из текущего диалога; вложения другого проекта или другого диалога недоступны. В одном ответе можно повторно использовать до 10 файлов.

Генерация изображения, аудио, QR-кода или графика сначала создаёт вложение. Агент решает, приложить ли его к текущему финальному ответу или оставить для следующего действия. Сам инструмент не отправляет клиенту отдельное сообщение без итогового текста агента.

Сгенерированное изображение прикрепляется к ответу агента, но само по себе не заменяет картинку в лендинге или другой сущности. Если изображение нужно использовать в создаваемом или редактируемом объекте, в запросе явно укажите, что после генерации его нужно установить в нужное поле.

Медиа и вложения. Отмеченные элементы: 2. кастомные URL-вложения; 3. генерация изображений; 4. генерация QR-кодов; 5. генерация графиков; 6. веб-поиск
2 / 2
2. кастомные URL-вложения · 3. генерация изображений · 4. генерация QR-кодов · 5. генерация графиков · 6. веб-поиск

Модели возможностей

Для некоторых возможностей выбирается отдельная модель:

  • распознавание речи использует модель распознавания;
  • генерация изображений использует модель изображения;
  • генерация аудио/озвучка использует модель озвучки;
  • клонирование голоса использует модель с поддержкой клонирования.
Инструменты агента. 1. модель распознавания
1. модель распознавания

После включения возможности кабинет обычно выбирает первую доступную модель нужного типа. Проверьте выбор до публикации. Если совместимых моделей нет, поле останется без рабочего варианта и сохранить полностью настроенную возможность не получится. Для распознавания изображений можно использовать основную модель агента или выбрать отдельную.

Тарификация инструментов и медиа

Нажмите текущую модель, чтобы открыть список с поиском. В подробностях модели показана стоимость в кредитах в зависимости от её типа: за ответ, за изображение, за 1M токенов, за 1K символов или за минуту.

У генерации изображений шкала «Качество» оценивает модель, а не выбирает качество отдельной картинки. Инструмент агента использует среднее качество (medium). При оплате за изображение диапазон цены учитывает доступные пропорции и разрешения для этого качества. При оплате по токенам в деталях отдельно показаны цены входящего текста и изображений, исходящих изображений и кэшированного входа. Итог зависит от фактического использования, а не только от числа картинок.

Когда запускается инструмент генерации изображения, аудио, распознавания речи или анализа изображения, это видно в истории событий как работа соответствующего инструмента. Списания затем видны в истории кредитов и в деталях операций расхода.