Развитие технологий генерации видео и синтеза речи достигло уровня, позволяющего создавать реалистичные интерактивные аватары, способные вести диалог. Одним из лидеров этого направления является компания Synthesia, базирующаяся в Великобритании и недавно открывшая новый офис в Нью-Йорке. Стартап, достигший в этом году оценки в 4 миллиарда долларов и преодолевший отметку в 100 миллионов долларов годового регулярного дохода (ARR), специализируется на создании цифровых копий для бизнеса. В число конкурентов компании на этом рынке входят D-ID, HeyGen и Colossyan.

Технологии создания цифровых двойников в Synthesia
Процесс создания аватара начинается в студии, где фиксируются внешние параметры и записывается голос пользователя. В рамках эксперимента по созданию цифрового двойника журналиста потребовалось несколько дней работы команды специалистов. Основой интерактивного аватара послужил стек технологий, включающий комбинацию моделей преобразования речи в текст, агентных языковых моделей для анализа запросов, генерации ответа в виде текста, его озвучивания и финальной анимации персонажа.
Компания Synthesia предоставляет клиентам гибкость в выборе инструментов: можно использовать собственные модели стартапа или сторонние решения от таких разработчиков, как Cartesia, ElevenLabs, Google или OpenAI. Хостинг аватаров также остается на усмотрение заказчика — это может быть собственное облако предприятия или серверы самой Synthesia.
Варианты функциональности цифровых персонажей
На сегодняшний день Synthesia предлагает три основных направления продуктов:
- Платформа для создания видео: классические аватары, которые произносят заранее написанный сценарий.
- Агентная платформа Sessions: интерактивное взаимодействие для проведения опросов или тренировочных сессий, например, для отработки навыков продаж.
- API-платформа: интеграция видео- и голосовых моделей компании с другими технологическими сервисами для построения пользовательских решений.
Интерактивный опыт взаимодействия с аватаром
Созданный для эксперимента аватар был обучен отвечать строго на вопросы, касающиеся конкретной статьи о венчурном финансировании и рисках мошенничества. Особенность такой модели заключается в ее детерминированности: она не выходит за рамки заданного контекста, даже если собеседник пытается получить информацию о личной жизни или биографии человека. Для пользователя, который привык к живому общению, это создает необычный эффект: модель неизменно перенаправляет любые сторонние вопросы к исходному материалу.
В ходе тестов с друзьями и семьей выяснилось, что восприятие аватара неоднозначно. Одни находят сходство с оригиналом «удивительным», другие замечают определенную неестественность голоса или мимики, характерную для текущего этапа развития технологий. Тем не менее, возможность делегировать ответы на рутинные вопросы цифровой копии выглядит перспективно для корпоративного сектора.
Перспективы и этические вопросы использования аватаров
Появление интерактивных двойников ставит вопросы о будущем журналистики и коммуникаций. Может ли аватар заменить специалиста в эфире или при общении с аудиторией? Если для бизнеса клонирование сотрудников ради экономии времени и повышения эффективности выглядит как логичный шаг, то для профессий, основанных на доверии, вопрос остается открытым. Интерактивные аватары уже сегодня могутAugment (дополнять) работу профессионалов, однако полная замена человеческого общения кажется маловероятной из-за фундаментальной роли доверия в таких процессах.
Современные возможности ИИ создают ощущение научной фантастики, воплощенной в реальности. При этом цифровые аватары воспринимаются менее тревожно, чем сложные человекоподобные роботы, так как взаимодействие с ними всегда можно прекратить, просто завершив сеанс. Тем не менее, использование не детерминированных, а свободно обучаемых моделей-чат-ботов в будущем может привести к психологическому дискомфорту пользователей, ожидающих от технологии большего эмоционального отклика, чем та способна дать в действительности.
Технологические особенности и процесс создания
Создание цифрового двойника — процесс, требующий профессиональной подготовки. В случае с созданием аватара журналиста, съемка проходила в мини-студии внутри офиса Synthesia. Для обучения модели потребовались многочисленные фотографии автора и двухминутная запись голоса. Важно отметить, что процедура строго регламентирована: каждый участник должен дать официальное согласие на создание своей цифровой версии. В ходе проекта было создано несколько типов аватаров: как персональные (для зачитывания заранее подготовленных скриптов), так и интерактивные (способные слушать и отвечать на реплики). При этом для каждого типа были предусмотрены вариации «в очках» и «без них».
Технически интерактивный аватар функционирует как сложная оркестровая система. В ее основе лежит стек, объединяющий технологии voice-to-text (преобразование речи в текст), агентные языковые модели для обработки смыслов и принятия решений, системы text-to-voice для озвучивания, а также проприетарные видеомодели Synthesia, отвечающие за реалистичную мимику и артикуляцию персонажа в процессе речи.
Практическое применение и кейсы
Помимо демонстрационных примеров, Synthesia активно продвигает продукт под названием Roleplay Sessions. Это специализированная платформа, предназначенная для обучения корпоративных сотрудников. Например, менеджеры по продажам могут практиковать свои питчи, взаимодействуя с интерактивным ИИ-аватаром. Система не просто имитирует собеседника, но и анализирует ответы пользователя, выставляя им соответствующие оценки. Это наглядно показывает, как компания переходит от простого видеопроизводства к созданию активных цифровых агентов для бизнеса.
Гибкость интеграции является одной из ключевых характеристик платформы. Хотя Synthesia предлагает собственные качественные видео- и голосовые модели, архитектура API позволяет корпоративным клиентам подключать сторонние решения. В качестве альтернатив для отдельных модулей могут выступать инструменты от Cartesia, ElevenLabs, Google или OpenAI. Клиенты также имеют выбор в вопросах инфраструктуры: они могут размещать свои аватары на собственных облачных мощностях или воспользоваться услугами хостинга от Synthesia.
Социальное восприятие и барьеры
В ходе тестов интерактивного аватара выяснилось, что даже близкие люди склонны испытывать легкое чувство тревоги («creepy»), наблюдая за тем, как их знакомый или родственник «оживает» в цифровом пространстве. При попытках «проверить» модель вопросами, на которые может ответить только реальный человек, система стабильно возвращала пользователя к обучающему материалу — статье о венчурном мошенничестве. Этот эффект детерминизма подчеркивает разницу между специализированными бизнес-инструментами и потенциально более опасными «свободными» чат-ботами, способными к самостоятельной генерации суждений.
Автор отмечает, что, несмотря на всю технологичность процесса, сохраняется психологический барьер. Вопрос о том, станут ли люди доверять аватару в качестве журналиста, остается дискуссионным. Многие инвесторы и эксперты скептически относятся к идее замены живого репортера на цифровую копию, так как фундаментом журналистской работы является человеческое доверие, которое невозможно «аутсорсить» алгоритмам. Тем не менее, для корпоративной среды использование цифровых двойников кажется неизбежным — это способ избавиться от рутины, например, отвечать на одни и те же вопросы после отпуска или праздников, позволяя своей копии всегда «оставаться на рабочем месте».
«Я нахожу цифровые аватары менее пугающими, чем антропоморфных роботов. По крайней мере, если ситуация становится странной, я всегда могу просто выйти из системы», — отмечает автор эксперимента.
Таким образом, мы видим зарождение новой реальности, где грань между «реальным» и «цифровым» представителем личности становится все более тонкой. Для поколения Z, которое выросло на фантастических фильмах, воплощение этих идей в жизнь кажется странным, но вполне ожидаемым развитием событий. В ближайшие годы нам предстоит увидеть, насколько глубоко подобные инструменты проникнут в повседневную жизнь корпоративной Америки и за её пределы.






