Перейти к содержимому
Учи.Онлайн Выбрать школу
Статья

Как создать цифровой аватар: этапы работы с внешностью, голосом и видео

Цифровой аватар эксперта — это видеокопия человека, которая произносит любой новый текст его лицом и голосом. Чтобы её получить, эксперт снимает двухминутное исходное видео по правилам сервиса, записывает чистый образец голоса, подтверждает согласие на создание копии, затем пишет сценарии, генерирует ролики и монтирует их. Освоить придётся съёмку исходника, подготовку голоса, текст для синтеза речи, проверку брака и правовую сторону: согласие на образ и голос и пометку синтетического контента.

Автор: редакция Учи.ОнлайнОтветственный редактор: Дмитрий Игнатьев
Содержание
Иллюстрация к статье: Как создать цифровой аватар: этапы работы с внешностью, голосом и видео

Главное решается до первой генерации. Сервис не исправит то, что попало в исходник: если человек на записи отводит взгляд, жестикулирует у лица и говорит без пауз, аватар будет так же смотреть мимо камеры, а губы поплывут на каждой второй фразе. Поэтому первые усилия уходят на две минуты съёмки, а не на выбор нейросети.

Какие задачи решает аватар и когда лучше снимать вживую

Аватар хорош там, где нужна «говорящая голова»: разбор новостей отрасли, ответы на частые вопросы клиентов, вводные уроки онлайн-курса, приветствие на сайте. Экономится время на свет, грим и дубли, а исправленную формулировку не нужно переснимать — достаточно поправить текст и сгенерировать фрагмент заново.

Вживую лучше снимать то, где важны руки и предметы: упражнение, работу с инструментом, распаковку товара. То же касается личных историй и эфиров: мимика аватара беднее живой, и долгий монолог без смены плана утомляет. Есть и ограничение синтеза речи на русском: сервисы ошибаются в ударениях, аббревиатурах и иностранных названиях, поэтому каждый ролик прослушивают целиком.

Этап 1. Исходное видео

От исходника зависят сходство, мимика и синхронизация губ. В справке HeyGen о съёмке цифрового двойника (обновлена 28 августа 2026 года) требуется минимум одна непрерывная речь на две минуты, перед первой фразой — пауза 2–3 секунды. Разрешение — от 1080p; телефон подойдёт, но качество будет ниже. Между длинными предложениями делают паузу в 1–2 секунды с сомкнутыми губами — это улучшает синхронизацию. Руки не поднимают выше груди, голову не поворачивают больше чем на 30 градусов, смотрят в объектив. Запись нельзя резать, а одежда с логотипами, надписями и пёстрым рисунком даёт искажения.

Остальное — обычная видеосъёмка. Камера на уровне глаз, кадр по грудь, свет мягкий: окно сбоку или софтбокс, без теней под глазами и бликов на очках. Фон неподвижный. Говорят в обычном темпе: зачитанный с нажимом текст аватар сочтёт вашей нормой.

Этап 2. Голос

Голос клонируют двумя способами. В руководстве ElevenLabs по клонированию голоса для быстрого клона рекомендуют 1–2 минуты хорошего звука и предупреждают, что запись длиннее 2–3 минут почти ничего не добавляет. Профессиональный клон, который дообучают на вашем голосе, требует 30–180 минут записи и доступен с тарифа Creator. Перед обучением владелец голоса читает вслух строки с проверочной картинки, а клонировать так можно только собственный голос — чужой нельзя «даже с согласия».

Чистота записи важнее длины: один говорящий, комната без эха, одинаковая громкость и манера. Модель копирует тембр, темп и интонационные привычки, поэтому голос записывают так, как будут говорить в роликах: клон, обученный на чтении вслух, будет звучать как чтение.

Этап 3. Сценарий, генерация и монтаж

Текст для аватара пишут на слух: короткие предложения, числа и сокращения так, как их произносят, — «эн-де-эс», а не «НДС». Ударения в омографах и фамилиях проверяют на тестовом фрагменте и при необходимости меняют слово. Длинный ответ лучше разбить на серию роликов.

Генерацию начинают с короткого фрагмента: так дешевле найти ошибки. Готовый ролик смотрят целиком и ищут брак: губы опаздывают за звуком, зубы «плывут», взгляд дёргается, интонация ломается посреди фразы. В монтаже аватар перебивают слайдами и записью экрана — смена плана оживляет ролик и прячет неудачные секунды. Субтитры обязательны.

Учебный пример: налоговый консультант

Ситуация учебная. Налоговый консультант хочет выпускать два коротких ролика в неделю с ответами на вопросы клиентов. Она снимает у окна две минуты рассказа о своей работе на телефон на штативе, с паузами и руками на столе, а в комнате со шторами записывает голос тем тоном, каким отвечает клиентам. В первом ролике аватар читает «ИП» как одно слово и ошибается с ударением в фамилии. Она переписывает текст под произношение, делит ответ на две части со слайдом между ними и пересматривает каждый ролик до публикации: за советы отвечает она, а не сервис.

Согласие: что проверяет сервис, а что остаётся на вас

Сервисы не дают создать видеокопию человека, пока он сам не подтвердит согласие, но проверяют это по-разному. В документации HeyGen о согласии на аватар порядок для видеоаватара такой: человек, которого клонируют, получает ссылку, действующую 24 часа, и на камеру произносит короткое заявление, в веб-версии — ещё и проверочный код. Видео согласия короче 35 секунд, в кадре одно лицо, и сервис сверяет, тот ли это человек, что на исходной записи. Если нет, согласие отклоняется и аватар не создаётся.

Для фотоаватара, который «оживляют» по снимку, правила другие. В той же документации сказано, что HeyGen не проверяет согласие и не хранит его запись для фотоаватара, а отсутствие проверки не означает разрешения использовать чужую внешность. Корпоративные клиенты могут обойтись без процедуры, если подписали соглашение о возмещении убытков, то есть взяли риски на себя. Вывод для того, кто делает аватары на заказ: в самом удобном сценарии, по фотографии, защиту от претензий обеспечиваете только вы. Письменное согласие клиента с перечнем сервисов, сроком хранения исходников и порядком удаления модели должно быть у вас, даже если сервис его не спросил.

Российское право требует того же. Изображение гражданина используют с его согласия (ст. 152.1 ГК РФ). Отдельной статьи о голосе нет: законопроект № 718834-8 о статье 152.3, которая охраняла бы и синтезированный голос, опубликован в сентябре 2024 года, но правительство его не поддержало, указав, что запись голоса уже считается обработкой биометрических персональных данных. Жёстче правило для выборов: в апреле 2026 года Госдума приняла закон, по которому созданные ИИ изображение и голос человека в агитации допустимы только с его письменного согласия.

Маркировка ролика с аватаром

Закон № 243-ФЗ об искусственном интеллекте даёт автору возможность сопроводить аудио- и видеоматериал предупреждением о применении ИИ, а крупные площадки обязывает такую возможность предоставить; статья вступит в силу 1 марта 2027 года (ст. 9 243-ФЗ).

Правила площадок действуют уже сейчас. Справка YouTube о синтетическом контенте требует отмечать реалистичные ролики, где человек говорит то, чего не говорил, или даёт советы, которых не давал, а клонирование собственного голоса для озвучки называет примером, где пометка не нужна. Про аватар со своим текстом справка прямо не говорит, поэтому надёжнее ставить отметку при загрузке и упоминать аватар в описании.

С чего начать и в каком порядке осваивать

Шаги идут от того, что труднее всего исправить потом, к тому, что легко переделать. Исходник и голос записывают один раз, и их ошибки переходят во все ролики, поэтому их отрабатывают первыми. Сценарий и монтаж правят для каждого видео, а работа с чужой внешностью требует отлаженного процесса и документов о согласии.

  1. Снимите три пробных исходника: у окна, при лампе и на улице — и сравните аватары.
  2. Запишите две минуты голоса в двух комнатах и сравните быстрые клоны.
  3. Сделайте ролик на минуту и выпишите ошибки: ударения, губы, взгляд, паузы.
  4. Перепишите сценарий под произношение и смонтируйте ролик со слайдами и субтитрами.
  5. Только после этого делайте аватары для клиентов — с их письменным согласием.

Пройти первый цикл поможет бесплатное руководство EdLit «Цифровой аватар для экспертов»: по обзору, это PDF о четырёх действиях — снять исходник, загрузить его в сервис, написать текст и скачать ролик — с разбором ошибок новичков: водяные знаки, минуты сервиса и оплата. В примере назван HeyGen, упомянуто согласие человека в кадре. Проверки заданий нет.

Сервисы по функциям

Инструмент выбирают по задаче. Видеоаватар по исходной записи делает, например, HeyGen, «оживление» по фотографии — Hedra, Higgsfield и тот же HeyGen, голос клонируют в ElevenLabs или во встроенных модулях сервисов аватаров, монтируют в CapCut, Premiere Pro или DaVinci Resolve. Лимиты минут, водяные знаки и коммерческие права зависят от тарифа, а доступность из России и способ оплаты у зарубежных сервисов разные, поэтому до подписки прочитайте условия и сделайте пробный ролик бесплатно. Портреты по фото без видео — отдельная задача, о ней статья о нейрофотосессии на нашем сайте.

Видео с аватарами в составе общей программы по нейросетям есть на онлайн-курсе «Нейросети: с нуля до PRO» Bonnie&Slide: в модуле о видео и аудио на восемь уроков названы Runway, HeyGen и Hedra, домашние задания проверяют, есть бонусный блок о юридических вопросах ИИ. Что разбирают в HeyGen и есть ли клонирование голоса, уточните у школы.

Как навык влияет на доход

Эксперту аватар прямого дохода не даёт, но позволяет выпускать видео регулярно без съёмочных дней, обновлять уроки онлайн-курса правкой текста и переводить ролики на другие языки. Окупается он при регулярном выпуске: ролик раз в квартал проще снять вживую.

Для продюсера, монтажёра или SMM-специалиста аватары — дополнительная услуга. Средних цен нет, видны отдельные предложения: на FL.ru в сентябре 2026 года исполнитель предлагал за 6 500 ₽ три изображения аватара и «оживлённый» ролик до 10 секунд по 5–10 фотографиям клиента. Это одно объявление и фотоаватар без клона голоса, а не цена рынка. Из выручки вычитаются подписки, повторные генерации, монтаж и налог, а платит клиент за готовые к публикации ролики, а не за сам аватар.

Как выбрать обучение

Длинных программ именно по аватарам почти нет: тема входит в курсы по нейросетям для видео и контента. Ищите в описании съёмку исходника, клонирование голоса, монтаж и правовые вопросы и уточните, кто проверяет задания и оплачиваются ли подписки отдельно.

Вариант с практикой — онлайн-курс «Работа с нейросетями» Брунояма: два месяца, девять модулей, в модуле о видео и звуке — Runway, Kling, HeyGen и синтез речи, среди задач есть короткое видео с озвучкой. Разбор работ есть только на тарифах «Оптимальный» и «Плюс», правовые темы на странице не указаны.

Перед покупкой попросите пример проверенного задания с видео: если в нём не говорят о губах, ударениях и согласии, этому придётся учиться самому.

Сравнить школы по цене и практике поможет рейтинг онлайн-школ с обучением нейросетям для работы и бизнеса — он шире темы аватаров. А до выбора снимите две минуты исходника, сделайте один ролик и выпишите его ошибки: станет ясно, чему учиться в первую очередь — съёмке, голосу или монтажу.