Перейти к содержимому
Учи.Онлайн Выбрать школу
Статья

Специалист по глубокому обучению: чем занимается, что нужно знать и как учиться

Специалист по глубокому обучению обучает нейросети решать задачи на «сырых» данных — фотографиях, видео, текстах, звуке, где классические модели на табличных признаках не справляются. Чаще всего он берёт заранее обученную сеть и дообучает её на данных компании: собирает и размечает выборку, ставит эксперименты, разбирается, почему модель ошибается, укладывает обучение в бюджет видеокарт и проверяет, можно ли по лицензии использовать чужие веса в продукте. Нужны Python, фреймворк для нейросетей, линейная алгебра и привычка проверять модель на неудобных примерах.

Автор: Александра СыщенкоАвтор об IT и профессиональном обучении · О редакции
Содержание

Слова «глубокое обучение» создают впечатление, что человек в этой профессии придумывает новые архитектуры нейросетей. Так работают немногие исследователи в крупных лабораториях. В обычной компании задача звучит приземлённее: у склада есть тысячи фотографий повреждённых коробок, у банка — сотни тысяч обращений клиентов, у колл-центра — записи разговоров, и нужно, чтобы машина научилась в них разбираться. Готовые архитектуры и обученные на миллионах примеров веса для этого уже существуют. Работа в том, чтобы превратить их в модель, которая уверенно работает именно на этих данных. Поэтому большая часть времени уходит не на формулы, а на данные и эксперименты.

Иллюстрация к статье «Специалист по глубокому обучению: чем занимается, что нужно знать и как учиться»

Чем он отличается от соседних профессий

Обязанности соседних ролей в вакансиях часто смешивают, поэтому удобнее различать их по типу данных и по тому, что человек сдаёт в конце.

Data Scientist чаще работает с таблицами: клиентами, заказами, транзакциями. Его модели — градиентный бустинг и линейные модели, а главная забота — признаки и честная проверка качества. Специалист по глубокому обучению работает там, где признаки вручную не придумаешь: невозможно описать формулой, чем фотография треснувшей коробки отличается от целой. Нейросеть находит эти признаки сама, если дать ей достаточно хороших примеров.

Инженер машинного обучения отвечает за то, чтобы уже обученная модель надёжно работала в продукте: пайплайны, версии, мониторинг, нагрузка. Специалист по глубокому обучению передаёт ему модель, и граница между ними зависит от размера команды.

Прикладной специалист по ИИ обычно подключает готовые большие языковые модели через API и настраивает их инструкциями. Специалист по глубокому обучению меняет саму модель: дообучает её веса на своих данных. В вакансиях эта роль называется по-разному — Deep Learning Engineer, CV-инженер для задач компьютерного зрения, NLP-инженер для текстов, иногда просто ML-разработчик. Смотрите на описание задач, а не на заголовок.

Учебный пример: модель, которая научилась смотреть на фон

Ситуация вымышленная. Логистическая компания хочет автоматически отмечать повреждённые коробки на фотографиях, которые делают при приёмке товара. Есть 12 000 снимков: около 1 500 с повреждениями, остальные — целые коробки.

Специалист начинает с того, что просматривает несколько сотен снимков, и замечает проблему: «повреждённые» фотографии почти все сделаны в зоне возвратов, где другое освещение и серый пол, а целые — на основной линии приёмки. Он берёт сеть, заранее обученную на большом наборе изображений. Последние слои он заменяет под две категории и дообучает модель на своих данных.

Первый результат выглядит отлично: на проверке больше 95 % верных ответов. Но специалист строит тепловые карты — картинки, показывающие, на какие области снимка модель смотрит при решении. Выясняется, что сеть смотрит на пол и тени, а не на коробку. Она выучила не «повреждение», а «зону возвратов». На 200 свежих снимках, где повреждённые коробки сфотографированы на основной линии, качество резко проседает.

Дальше работа идёт по шагам. Склад по просьбе специалиста фотографирует повреждённые коробки в обычной зоне приёмки. Снимки обрезают по границе коробки, чтобы фон занимал меньше места. Специалист добавляет аугментации — случайные изменения яркости, поворота и масштаба при обучении, чтобы модель не цеплялась за освещение. Проверку теперь ведут на отдельном наборе «неудобных» снимков. Итог — модель с более скромной цифрой на старой проверке, но устойчивая на новых данных, и отчёт о том, где она ошибается.

Из чего состоит работа

Данные и разметка

Нейросеть учится на примерах, и их качество ограничивает всё остальное. Специалист составляет инструкцию для разметчиков: что считать повреждением, как рисовать рамку, что делать с неоднозначными случаями. Если два разметчика по-разному оценили одну фотографию, инструкция неясна. Часто самый дешёвый способ поднять качество — не новая архитектура, а исправление тысячи неверных меток.

Эксперименты и отладка обучения

Обучение нейросети не сообщает об ошибке, если что-то пошло не так: код отрабатывает, но модель учится плохо или учится не тому. Поэтому у специалиста есть набор привычных проверок. Может ли сеть переобучиться на одном небольшом батче — если нет, в коде ошибка. Как ведут себя кривые ошибки на обучении и проверке. Каждый запуск записывают: версию данных, параметры, результат. Без этого через месяц невозможно ответить, почему модель из вторника лучше модели из пятницы.

Вычисления и память

Обучение идёт на видеокартах, и их время стоит денег — своих или облачных. Специалист оценивает, поместится ли модель в память, какой размер батча выдержит карта, сколько часов займёт эпоха. Он решает, нужна ли большая модель или хватит меньшей, которая быстрее ответит на телефоне или сервере без GPU. Иногда модель на два процента хуже, но заметно дешевле в работе — и это разумный выбор.

Чужие веса: что разрешает лицензия

Почти каждый проект начинается с чужой обученной модели, и новички редко смотрят, на каких условиях её можно использовать. Лицензия кода и лицензия весов — не одно и то же, и именно веса оказываются в продукте компании.

Пример — детекторы объектов YOLO от компании Ultralytics, популярные в компьютерном зрении из-за простого запуска. Библиотека и модели распространяются по лицензии AGPL-3.0. Раздел 13 этой лицензии требует: если вы изменили программу и пользователи взаимодействуют с ней по сети, им нужно предоставить исходный код вашей версии. На странице лицензирования Ultralytics компания прямо пишет, что все обученные модели YOLO по умолчанию подпадают под AGPL-3.0, в том числе если вы обучили модель на своих данных с нуля. Использовать YOLO в коммерческом продукте, закрытом программном обеспечении или в сервисе, который вызывает модель «за кулисами» через API, без раскрытия кода всего проекта можно только по платной корпоративной лицензии. В репозитории Ultralytics на GitHub AGPL-3.0 адресована студентам и исследователям, а бизнесу предложена Enterprise License.

На практике это значит следующее. Учебный проект или исследование на YOLO — нормальный выбор. Но если модель склада из примера выше пойдёт в закрытую систему компании, до начала работы нужно решить вопрос с лицензией: купить корпоративную или взять архитектуру с разрешительной лицензией. Иначе после трёх месяцев экспериментов часть работы придётся повторить на другой модели. Решение принимают юристы, но модель выбирает специалист, и вопрос должен задать он. Та же проверка нужна для любых чужих весов: у многих открытых моделей свои условия — ограничения на коммерческое использование, на число пользователей, требования указывать авторство.

Что нужно знать и уметь

Основа — Python и уверенная работа с массивами данных. Нужен один из фреймворков для нейросетей; в вакансиях и программах обучения сейчас чаще всего встречается PyTorch, реже TensorFlow и Keras. Математика нужна рабочая: линейная алгебра, чтобы понимать, что происходит с тензорами, производные и градиентный спуск, чтобы понимать обучение, основы теории вероятностей, чтобы читать метрики и функции потерь.

Классическое машинное обучение пропускать не стоит. Разделение выборок, утечки данных, выбор метрики важны и для нейросетей, только ошибки здесь дороже. Дальше путь обычно ветвится по типу данных: компьютерное зрение со свёрточными сетями, детекцией и сегментацией, обработка текстов с трансформерами, реже звук. Посмотреть, как это ветвление выглядит в программе, можно на курсе Machine Learning от TeachMeSkills: за 8 месяцев после основ идут отдельные блоки по компьютерному зрению (свёрточные сети, YOLO, U-Net) и по текстам и звуку (рекуррентные сети, трансформеры), а в конце — Docker и MLflow. Занятия идут вживую по вечерам без записей; в обзоре отмечено, что вход «с нуля» при таком объёме математики условен, а цена в каталоге и на сайте школы расходится, так что условия стоит уточнить у школы.

Что может оказаться трудным

Долгая обратная связь. Разработчик видит результат правки через секунды, а специалист по глубокому обучению — через часы или дни обучения. Ошибка в подготовке данных может обнаружиться, когда потрачена неделя вычислений. Тем, кто не любит ждать и планировать эксперименты заранее, в этой работе тяжело.

Непредсказуемый результат. Никто не может заранее пообещать заказчику, что модель достигнет нужного качества: иногда данных просто недостаточно или задача сложнее, чем казалось. Приходится честно говорить об этом и предлагать промежуточные решения, например отправлять спорные случаи человеку.

Сколько платят

Отдельной статистики по специалистам по глубокому обучению в открытых источниках нет. В калькуляторе зарплат Хабр Карьеры ближайшая категория — «ML разработчик», куда попадают и CV- и NLP-инженеры, и те, кто работает с классическими моделями. На сентябрь 2026 года калькулятор показывает по России в целом, без разбивки по городам, такие медианы фактических зарплат с учётом премий:

Уровень Медиана, ₽ в месяц Число анкет
Intern 82 808 48
Junior 121 966 116
Middle 224 166 245
Senior 381 466 103
Lead 485 500 56

Это зарплаты, которые специалисты сами указали в анкетах, а не предложения работодателей в вакансиях. Выборки по уровням небольшие, так что это ориентир, а не точная цена. Вакансии смотрите отдельно: на hh.ru и в Хабр Карьере отфильтруйте их по региону и опыту и проверяйте, указана ли сумма до вычета налога или на руки. Первую работу можно искать не только на позиции Deep Learning Engineer, но и среди вакансий младших ML-разработчиков.

Как начать учиться

Путь зависит от стартовой точки. Если вы уже программируете на Python и знаете классическое машинное обучение, логично сразу браться за нейросети. Если нет, сначала придётся пройти Python, основы анализа данных и классические модели — без этого обучение нейросетям превращается в копирование чужого кода.

Для второго случая есть длинные программы, где путь начинается с нуля. На курсе Нетологии «Специалист по глубокому обучению» 16–17 месяцев: сначала общая база машинного обучения, нейросети, MLOps, затем специализация — компьютерное зрение или обработка текстов, обе одновременно пройти нельзя. В программе 14 проектов и дипломная модель, по окончании выдают диплом о профессиональной переподготовке. В обзоре отмечено, что для глубокого понимания понадобится больше математики, чем даёт бонусный блок, а обучение больших моделей может потребовать платных вычислений.

Попробовать себя можно и до оплаты обучения. Возьмите открытый набор изображений из двух-трёх категорий, дообучите готовую сеть в бесплатном облачном ноутбуке и постройте тепловые карты внимания для десятка ошибок модели. Затем перемешайте часть меток и посмотрите, как изменится результат. Если эта работа затягивает, профессия, скорее всего, вам подойдёт.

Тем, у кого уже есть база, подойдёт короткая программа, посвящённая только нейросетям. Например, «Основы глубокого обучения нейросетей» Яндекс Практикума рассчитан на 2 месяца и требует до старта уверенного Python с ООП, классического машинного обучения и базовой линейной алгебры. За это время проходят основные типы сетей и перенос обучения, делают четыре проекта — от многослойной сети на PyTorch до мультимодального, где калорийность блюда оценивают по фотографии и текстовому описанию. Для обучения выдают виртуальные машины с GPU в Yandex Cloud. Развёртыванию моделей в программе уделено мало места.

Ни одна программа не заменит практики на чужих, неудобных данных. Соревнования на Kaggle по изображениям и текстам полезны тем, что после них можно сравнить свой подход с решениями других участников и увидеть, какие приёмы действительно дают прирост.

При выборе любого онлайн-курса задайте несколько вопросов. Дают ли вычислительные ресурсы или за видеокарты придётся платить самостоятельно? Разбирают ли подготовку и разметку данных или все проекты идут на готовых учебных наборах? Говорят ли о лицензиях моделей и данных? Сравнить школы поможет рейтинг онлайн-школ по машинному обучению. Он охватывает всё направление — от программ с нуля до инженерной подготовки, — поэтому выбирайте в нём курсы, где нейросетям отведена основная часть программы, а не один модуль.

Что показать работодателю

Работодатель смотрит не на число выученных архитектур, а на то, как вы обращаетесь с неидеальными данными. Хороший учебный проект по глубокому обучению содержит постановку задачи, описание данных и их проблем, разбиение выборки с объяснением, почему оно такое, несколько экспериментов с записанными параметрами, разбор ошибок модели и честный список ограничений. Укажите и то, на каких весах основана модель и по какой лицензии.

Два-три таких проекта говорят больше, чем десять повторений популярных учебных задач. Если вам интереснее разбираться, почему модель ошибается и как это исправить данными, стоит двигаться в сторону компьютерного зрения или обработки текстов. Если больше нравится доводить модель до работающего сервиса, ближе окажется роль инженера машинного обучения. Обе дороги начинаются с одного навыка: не верить красивой цифре на проверке, пока вы не посмотрели, на что именно смотрит модель.