Как создать цифровой аватар: этапы работы с внешностью, голосом и видео
Цифровой аватар эксперта — это видеокопия человека, которая произносит любой новый текст его лицом и голосом. Чтобы её получить, эксперт снимает двухминутное исходное видео по правилам сервиса, записывает чистый образец голоса, подтверждает согласие на создание копии, затем пишет сценарии, генерирует ролики и монтирует их. Освоить придётся съёмку исходника, подготовку голоса, текст для синтеза речи, проверку брака и правовую сторону: согласие на образ и голос и пометку синтетического контента.
Содержание

Главное решается до первой генерации. Сервис не исправит то, что попало в исходник: если человек на записи отводит взгляд, жестикулирует у лица и говорит без пауз, аватар будет так же смотреть мимо камеры, а губы поплывут на каждой второй фразе. Поэтому первые усилия уходят на две минуты съёмки, а не на выбор нейросети.
Какие задачи решает аватар и когда лучше снимать вживую
Аватар хорош там, где нужна «говорящая голова»: разбор новостей отрасли, ответы на частые вопросы клиентов, вводные уроки онлайн-курса, приветствие на сайте. Экономится время на свет, грим и дубли, а исправленную формулировку не нужно переснимать — достаточно поправить текст и сгенерировать фрагмент заново.
Вживую лучше снимать то, где важны руки и предметы: упражнение, работу с инструментом, распаковку товара. То же касается личных историй и эфиров: мимика аватара беднее живой, и долгий монолог без смены плана утомляет. Есть и ограничение синтеза речи на русском: сервисы ошибаются в ударениях, аббревиатурах и иностранных названиях, поэтому каждый ролик прослушивают целиком.
Этап 1. Исходное видео
От исходника зависят сходство, мимика и синхронизация губ. В справке HeyGen о съёмке цифрового двойника (обновлена 28 августа 2026 года) требуется минимум одна непрерывная речь на две минуты, перед первой фразой — пауза 2–3 секунды. Разрешение — от 1080p; телефон подойдёт, но качество будет ниже. Между длинными предложениями делают паузу в 1–2 секунды с сомкнутыми губами — это улучшает синхронизацию. Руки не поднимают выше груди, голову не поворачивают больше чем на 30 градусов, смотрят в объектив. Запись нельзя резать, а одежда с логотипами, надписями и пёстрым рисунком даёт искажения.
Остальное — обычная видеосъёмка. Камера на уровне глаз, кадр по грудь, свет мягкий: окно сбоку или софтбокс, без теней под глазами и бликов на очках. Фон неподвижный. Говорят в обычном темпе: зачитанный с нажимом текст аватар сочтёт вашей нормой.
Этап 2. Голос
Голос клонируют двумя способами. В руководстве ElevenLabs по клонированию голоса для быстрого клона рекомендуют 1–2 минуты хорошего звука и предупреждают, что запись длиннее 2–3 минут почти ничего не добавляет. Профессиональный клон, который дообучают на вашем голосе, требует 30–180 минут записи и доступен с тарифа Creator. Перед обучением владелец голоса читает вслух строки с проверочной картинки, а клонировать так можно только собственный голос — чужой нельзя «даже с согласия».
Чистота записи важнее длины: один говорящий, комната без эха, одинаковая громкость и манера. Модель копирует тембр, темп и интонационные привычки, поэтому голос записывают так, как будут говорить в роликах: клон, обученный на чтении вслух, будет звучать как чтение.
Этап 3. Сценарий, генерация и монтаж
Текст для аватара пишут на слух: короткие предложения, числа и сокращения так, как их произносят, — «эн-де-эс», а не «НДС». Ударения в омографах и фамилиях проверяют на тестовом фрагменте и при необходимости меняют слово. Длинный ответ лучше разбить на серию роликов.
Генерацию начинают с короткого фрагмента: так дешевле найти ошибки. Готовый ролик смотрят целиком и ищут брак: губы опаздывают за звуком, зубы «плывут», взгляд дёргается, интонация ломается посреди фразы. В монтаже аватар перебивают слайдами и записью экрана — смена плана оживляет ролик и прячет неудачные секунды. Субтитры обязательны.
Учебный пример: налоговый консультант
Ситуация учебная. Налоговый консультант хочет выпускать два коротких ролика в неделю с ответами на вопросы клиентов. Она снимает у окна две минуты рассказа о своей работе на телефон на штативе, с паузами и руками на столе, а в комнате со шторами записывает голос тем тоном, каким отвечает клиентам. В первом ролике аватар читает «ИП» как одно слово и ошибается с ударением в фамилии. Она переписывает текст под произношение, делит ответ на две части со слайдом между ними и пересматривает каждый ролик до публикации: за советы отвечает она, а не сервис.
Согласие: что проверяет сервис, а что остаётся на вас
Сервисы не дают создать видеокопию человека, пока он сам не подтвердит согласие, но проверяют это по-разному. В документации HeyGen о согласии на аватар порядок для видеоаватара такой: человек, которого клонируют, получает ссылку, действующую 24 часа, и на камеру произносит короткое заявление, в веб-версии — ещё и проверочный код. Видео согласия короче 35 секунд, в кадре одно лицо, и сервис сверяет, тот ли это человек, что на исходной записи. Если нет, согласие отклоняется и аватар не создаётся.
Для фотоаватара, который «оживляют» по снимку, правила другие. В той же документации сказано, что HeyGen не проверяет согласие и не хранит его запись для фотоаватара, а отсутствие проверки не означает разрешения использовать чужую внешность. Корпоративные клиенты могут обойтись без процедуры, если подписали соглашение о возмещении убытков, то есть взяли риски на себя. Вывод для того, кто делает аватары на заказ: в самом удобном сценарии, по фотографии, защиту от претензий обеспечиваете только вы. Письменное согласие клиента с перечнем сервисов, сроком хранения исходников и порядком удаления модели должно быть у вас, даже если сервис его не спросил.
Российское право требует того же. Изображение гражданина используют с его согласия (ст. 152.1 ГК РФ). Отдельной статьи о голосе нет: законопроект № 718834-8 о статье 152.3, которая охраняла бы и синтезированный голос, опубликован в сентябре 2024 года, но правительство его не поддержало, указав, что запись голоса уже считается обработкой биометрических персональных данных. Жёстче правило для выборов: в апреле 2026 года Госдума приняла закон, по которому созданные ИИ изображение и голос человека в агитации допустимы только с его письменного согласия.
Маркировка ролика с аватаром
Закон № 243-ФЗ об искусственном интеллекте даёт автору возможность сопроводить аудио- и видеоматериал предупреждением о применении ИИ, а крупные площадки обязывает такую возможность предоставить; статья вступит в силу 1 марта 2027 года (ст. 9 243-ФЗ).
Правила площадок действуют уже сейчас. Справка YouTube о синтетическом контенте требует отмечать реалистичные ролики, где человек говорит то, чего не говорил, или даёт советы, которых не давал, а клонирование собственного голоса для озвучки называет примером, где пометка не нужна. Про аватар со своим текстом справка прямо не говорит, поэтому надёжнее ставить отметку при загрузке и упоминать аватар в описании.
С чего начать и в каком порядке осваивать
Шаги идут от того, что труднее всего исправить потом, к тому, что легко переделать. Исходник и голос записывают один раз, и их ошибки переходят во все ролики, поэтому их отрабатывают первыми. Сценарий и монтаж правят для каждого видео, а работа с чужой внешностью требует отлаженного процесса и документов о согласии.
- Снимите три пробных исходника: у окна, при лампе и на улице — и сравните аватары.
- Запишите две минуты голоса в двух комнатах и сравните быстрые клоны.
- Сделайте ролик на минуту и выпишите ошибки: ударения, губы, взгляд, паузы.
- Перепишите сценарий под произношение и смонтируйте ролик со слайдами и субтитрами.
- Только после этого делайте аватары для клиентов — с их письменным согласием.
Пройти первый цикл поможет бесплатное руководство EdLit «Цифровой аватар для экспертов»: по обзору, это PDF о четырёх действиях — снять исходник, загрузить его в сервис, написать текст и скачать ролик — с разбором ошибок новичков: водяные знаки, минуты сервиса и оплата. В примере назван HeyGen, упомянуто согласие человека в кадре. Проверки заданий нет.
Сервисы по функциям
Инструмент выбирают по задаче. Видеоаватар по исходной записи делает, например, HeyGen, «оживление» по фотографии — Hedra, Higgsfield и тот же HeyGen, голос клонируют в ElevenLabs или во встроенных модулях сервисов аватаров, монтируют в CapCut, Premiere Pro или DaVinci Resolve. Лимиты минут, водяные знаки и коммерческие права зависят от тарифа, а доступность из России и способ оплаты у зарубежных сервисов разные, поэтому до подписки прочитайте условия и сделайте пробный ролик бесплатно. Портреты по фото без видео — отдельная задача, о ней статья о нейрофотосессии на нашем сайте.
Видео с аватарами в составе общей программы по нейросетям есть на онлайн-курсе «Нейросети: с нуля до PRO» Bonnie&Slide: в модуле о видео и аудио на восемь уроков названы Runway, HeyGen и Hedra, домашние задания проверяют, есть бонусный блок о юридических вопросах ИИ. Что разбирают в HeyGen и есть ли клонирование голоса, уточните у школы.
Как навык влияет на доход
Эксперту аватар прямого дохода не даёт, но позволяет выпускать видео регулярно без съёмочных дней, обновлять уроки онлайн-курса правкой текста и переводить ролики на другие языки. Окупается он при регулярном выпуске: ролик раз в квартал проще снять вживую.
Для продюсера, монтажёра или SMM-специалиста аватары — дополнительная услуга. Средних цен нет, видны отдельные предложения: на FL.ru в сентябре 2026 года исполнитель предлагал за 6 500 ₽ три изображения аватара и «оживлённый» ролик до 10 секунд по 5–10 фотографиям клиента. Это одно объявление и фотоаватар без клона голоса, а не цена рынка. Из выручки вычитаются подписки, повторные генерации, монтаж и налог, а платит клиент за готовые к публикации ролики, а не за сам аватар.
Как выбрать обучение
Длинных программ именно по аватарам почти нет: тема входит в курсы по нейросетям для видео и контента. Ищите в описании съёмку исходника, клонирование голоса, монтаж и правовые вопросы и уточните, кто проверяет задания и оплачиваются ли подписки отдельно.
Вариант с практикой — онлайн-курс «Работа с нейросетями» Брунояма: два месяца, девять модулей, в модуле о видео и звуке — Runway, Kling, HeyGen и синтез речи, среди задач есть короткое видео с озвучкой. Разбор работ есть только на тарифах «Оптимальный» и «Плюс», правовые темы на странице не указаны.
Перед покупкой попросите пример проверенного задания с видео: если в нём не говорят о губах, ударениях и согласии, этому придётся учиться самому.
Сравнить школы по цене и практике поможет рейтинг онлайн-школ с обучением нейросетям для работы и бизнеса — он шире темы аватаров. А до выбора снимите две минуты исходника, сделайте один ролик и выпишите его ошибки: станет ясно, чему учиться в первую очередь — съёмке, голосу или монтажу.