Перейти к содержимому
Учи.Онлайн Выбрать школу
Статья

Data Scientist: чем занимается, как проверяет модели и что нужно знать на старте

Data Scientist строит модели, которые прогнозируют событие или классифицируют объект по данным: например, вероятность ухода клиента. Работа начинается с постановки задачи и подготовки признаков, затем модель проверяют на данных, которых она не видела при обучении. Высокая метрика сама по себе не доказывает пользу: важны корректная проверка, устойчивость и смысл результата для бизнеса. Для входа нужны программирование, статистика и понимание того, как устроены исходные данные.

Автор: Александра СыщенкоАвтор об IT и профессиональном обучении · О редакции
Содержание

Data Scientist строит модели, которые предсказывают то, чего в данных ещё нет: уйдёт ли клиент в следующем месяце, сколько заявок придёт в колл-центр в пятницу вечером. Итог его работы — не презентация с выводами, а обученная модель, которая принимает описание конкретного объекта и возвращает число или метку класса. Отсюда вырастает и содержание профессии, и её главная трудность: предсказание проверяет будущее, а не согласие заказчика.

Иллюстрация к статье «Data Scientist: чем занимается, как проверяет модели и что нужно знать на старте»

Что специалист сдаёт компании

Готовая работа обычно состоит из четырёх частей. Код, который превращает сырые таблицы в набор признаков — числовых характеристик объекта, по которым модель делает вывод. Обученная модель с зафиксированными параметрами. Отчёт о проверке: на каких данных модель измеряли, какой метрикой, как она ведёт себя на разных срезах. И правила применения: на каком пороге вероятности срабатывает действие и когда модель переобучать.

Заказчику нужна не точность сама по себе, а изменение бизнес-показателя. Поэтому разговор с продуктовой командой начинается с вопроса, какая ошибка дороже — пропустить уходящего клиента или напрасно потревожить лояльного.

Учебный пример: от постановки до внедрения

Ситуация вымышленная, но собрана из типовых шагов. Сервис подписки теряет около четырёх процентов платящих пользователей в месяц. Отдел удержания готов обзванивать полторы тысячи человек и просит список тех, кто вот-вот отпишется.

Специалист начинает с определения события: отток — отсутствие продления в течение тридцати дней после окончания оплаченного периода. Дальше он собирает признаки на момент, когда предсказание реально делается, за неделю до окончания подписки: глубина использования за четыре недели, число обращений в поддержку, смена тарифа, способ оплаты, срок жизни аккаунта. Данные делятся по времени: обучение на январе — сентябре, проверка на октябре — ноябре. Порог вероятности подбирают так, чтобы в список попадало ровно полторы тысячи человек — столько, сколько отдел способен обзвонить.

Результат формулируется в терминах работы отдела: среди выбранных моделью пользователей доля ушедших в ноябре оказалась втрое выше, чем среди случайно отобранных полутора тысяч. Дальше запускается эксперимент с контрольной группой, и только его итог покажет, окупились ли звонки. Здесь Data Scientist работает бок о бок с аналитиком, который считает эффект, и с инженером, который поднимает сервис предсказаний.

Признаки и валидация: где ломается работа

Основное время уходит не на выбор алгоритма, а на признаки и проверку. Собрать признак — значит ответить, что о клиенте известно в момент предсказания, а что появляется позже. Возьмите в обучение поле, которое заполняется после события, и метрика взлетит, а в бою модель окажется бесполезной.

Документация scikit-learn называет это утечкой данных и формулирует правило коротко: «никогда не вызывайте fit на тестовых данных» (scikit-learn, Common pitfalls). Там же приведён пример, который стоит увидеть до первого собеседования. Берутся двести объектов, десять тысяч случайных признаков и целевая переменная, никак с ними не связанная, — предсказывать здесь нечего в принципе. Если отобрать двадцать пять «лучших» признаков на всей выборке, а потом разделить её на обучающую и тестовую, классификатор показывает на тесте точность 0,76 при ожидаемых 0,5. Отбор успел подсмотреть тест. Выполните его после разделения — точность честно падает до 0,5. Метрика 0,76 здесь не достижение, а измеренный побочный эффект неправильного порядка операций, и отличить одно от другого по цифре в отчёте невозможно.

Практическое следствие: разделение делают первым действием, а предобработку собирают в конвейер (Pipeline), который на кросс-валидации обучается только на обучающих частях. Второй источник ложного оптимизма — подбор гиперпараметров по тестовой выборке. Документация предупреждает, что знание о тесте «протекает» в модель, если параметры крутить, пока она не покажет лучший результат, и рекомендует держать отдельную валидационную часть (scikit-learn, Cross-validation).

Третий источник — неверная схема разбиения. Обычный KFold предполагает независимость объектов. Для временных рядов это неверно из-за автокорреляции, и нужен TimeSeriesSplit, где обучение идёт по прошлому, а проверка по будущему. Если на одного человека приходится несколько записей — снимков пациента, заказов клиента, — применяют GroupKFold, чтобы один объект не попал сразу в обучение и в проверку. Иначе модель запомнит человека, а не закономерность.

Почему хорошая метрика на тесте не спасает в продакшне

Даже честно измеренная модель проседает после запуска. Google в руководстве Rules of Machine Learning называет три причины расхождения: разная обработка данных в обучающем и боевом конвейерах, изменение самих данных между обучением и применением, и обратная связь, когда решения модели меняют поведение пользователей, а с ним и будущие данные (Google, Rules of Machine Learning).

Первая причина самая частая. Признак «средний чек за месяц» в обучении считался по историческому хранилищу, а в бою — по оперативной базе, где возвраты учитываются иначе, и числа расходятся. Руководство советует переиспользовать один код в обоих конвейерах и логировать те значения признаков, которые модель видела в момент предсказания, а обучаться уже на них. Там же есть совет, экономящий месяцы: учились на данных до 5 января — тестируйте на данных с 6 января.

Ловушек добавляют и библиотеки. В PyTorch режимы переключают явно: в туториале по обучению параметров вызовы model.train() и model.eval() снабжены пояснением, что это «важно для слоёв батч-нормализации и дропаута» (PyTorch, Optimizing Model Parameters). Забыть про eval() — получить на валидации числа, которые не воспроизведутся при поштучных запросах.

После запуска за моделью следят: не поплыло ли распределение входных признаков, держится ли качество на свежем периоде. Переобучение по расписанию здесь часть жизненного цикла, а не признак неудачи.

Чем Data Scientist отличается от соседних ролей

В вакансиях названия перемешаны, но по сдаваемому результату роли различаются.

Роль Что сдаёт Типичный вопрос
Аналитик данных отчёты, дашборды, выводы по метрикам и экспериментам что произошло и почему
Data Scientist обученную модель, код признаков, отчёт о валидации что произойдёт с этим объектом
ML-инженер сервис с моделью под нагрузкой, пайплайны обучения как это стабильно работает в проде
Дата-инженер хранилища и ETL-процессы, на которых всё это стоит откуда берутся и где лежат данные

Граница между аналитиком и дата-сайентистом проходит по типу ответа: первый объясняет прошлое и помогает принять решение человеку, второй передаёт решение алгоритму. Похожим образом разделены роли в классификации Яндекса: аналитик ищет закономерности и даёт рекомендации, исследователь улучшает качество моделей, ML-разработчик отвечает за внедрение под нагрузкой (Яндекс Образование). В небольшой компании все четыре роли нередко достаются одному человеку, и ожидания стоит уточнять до выхода на работу.

Сколько нужно математики

Перечень короче, чем пугают на форумах, но каждый пункт рабочий. Линейная алгебра нужна, чтобы понимать данные как матрицы, а операции над ними — как преобразования; без неё не объяснить разложение матрицы при снижении размерности. Производные и градиент объясняют, как модель учится: градиентный спуск двигает параметры в сторону уменьшения ошибки. Теория вероятностей и статистика дают язык для метрик, доверительных интервалов и проверки гипотез.

Вывод формул с нуля от джуниора обычно не требуют, интерпретации требуют постоянно: почему регуляризация уменьшает переобучение, что означает разница между precision и recall для конкретного бизнес-решения, почему средняя ошибка ничего не говорит о поведении на редких объектах. Тем, кто идёт на программу по Data Science без математической базы, разумно закрыть пробелы заранее — например, курс «Математика для Data Science» от Skillbox рассчитан на четыре месяца и собирает производные и градиент, линейную алгебру и статистику вокруг задач анализа данных.

Что говорит профстандарт об образовании и опыте

Профессиональный стандарт «Специалист по большим данным» (приказ Минтруда России № 405н от 6 июля 2020 года) описывает четыре обобщённые трудовые функции. Начальная из них, уровень квалификации 6, — «Анализ больших данных с использованием существующей в организации методологической и технологической инфраструктуры», и среди возможных должностей там прямо указан исследователь данных. Требования к ней: высшее образование — бакалавриат и опыт практической работы не менее одного года в области анализа данных или бизнес-анализа (текст приказа, ГАРАНТ).

Даже в самой младшей функции стандарта заложены диплом бакалавра и год опыта, а следующий уровень требует специалитета или магистратуры и двух лет работы. Нанимать иначе стандарт не запрещает: в коммерческих компаниях он носит рекомендательный характер, и на практике джуниоров берут по портфолио и тестовому заданию. Но он задаёт ориентир для государственных организаций и для описания должностей в крупных компаниях — и объясняет, откуда в части вакансий берётся строка о профильном высшем образовании. Онлайн-курс закрывает навыки, но не заменяет диплом там, где его требуют по документам.

Сколько платят

Зарплаты стоит смотреть по двум типам источников: они измеряют разное. Калькулятор Хабр Карьеры собирает суммы, которые специалисты указывают о себе сами, то есть фактические доходы. По специализации «Учёный по данным» на сентябрь 2026 года медиана по России — 233 333 ₽; по уровням: Junior — 124 000 ₽ (81 анкета), Middle — 227 750 ₽ (197 анкет), Senior — 393 333 ₽ (76 анкет) (Хабр Карьера). Выборки по грейдам небольшие, читайте эти цифры как порядок величины.

Для контекста: по отчёту Хабр Карьеры за первую половину 2026 года медиана по всему IT — 191 000 ₽ (расчёт по 45 226 зарплатам), рост за полугодие 4%, ниже прогнозной годовой инфляции ЦБ в 4,5–5,5% (Хабр Карьера). Направление платит выше среднего по отрасли, но быстрого роста вилок сейчас не показывает.

Второй тип источника — статистика вакансий. Сервис hh.ru показывает медианы зарплат, которые работодатели предлагают в объявлениях, и сам это оговаривает: «зарплаты — это доходы, которые указывают в вакансиях» (career.hh.ru). Предложение в вакансии и фактический доход — разные величины, смешивать их в одном числе некорректно. Если смотрите сами, фильтруйте по региону и опыту, берите медиану вместо среднего и уточняйте, идёт речь о сумме до вычета НДФЛ или на руки. Ни курс, ни диплом не гарантируют трудоустройства и конкретной зарплаты: на старте влияют отрасль, размер компании, город и убедительность ваших работ.

Что может оказаться трудным

Работа плохо переносит нетерпеливость. Между постановкой задачи и подтверждённым эффектом проходят недели, а часть гипотез не подтверждается — нормальный итог месяца иногда звучит как «предсказывать это с доступными данными нельзя». Много времени уходит на неинтересное: согласование определений, поиск того, кто помнит смысл поля в таблице, разбор расхождений между двумя источниками одного числа.

Отдельная нагрузка — ответственность за скрытые ошибки. Сломанный сервис заметят за минуты, а модель, тихо деградировавшую из-за изменившегося признака, могут не замечать месяцами, пока кто-нибудь не сверит бизнес-метрику.

Как начать и что показать работодателю

Порядок освоения обычно такой: Python и работа с таблицами (pandas), SQL для выгрузки данных, статистика, классическое машинное обучение, затем специализация — нейросети, тексты или временные ряды. SQL здесь обслуживает свою задачу: собрать корректную обучающую выборку с привязкой к моменту предсказания.

Выбирая программу, смотрите не на число модулей, а на то, что будете делать руками: есть ли в практике разбор утечки данных, работа с несбалансированными классами, подбор порога под бизнес-ограничение и хотя бы простая выкатка модели в виде сервиса. В программе «Data Scientist + ИИ» от Skillbox заявлены двенадцать месяцев, Python, SQL, машинное обучение и нейросети, более двадцати проектов — и содержание проектов разумно уточнить до оплаты, потому что их количество ничего не говорит о разнообразии.

Портфолио убеждает не темой, а честностью проверки. Три-четыре доведённых до конца проекта работают лучше десяти брошенных, причём в каждом стоит показать схему разбиения данных и объяснить, почему выбрана именно она, привести базовое решение для сравнения и описать поведение модели при внедрении. Отдельный плюс — задача на данных, похожих на отраслевые, с аккуратным репозиторием.

Чем короче программа, тем внимательнее стоит смотреть на объём практики. Тем, кто ориентируется на быстрый выход к первой позиции, ближе окажется курс «Data Scientist с нуля до Junior»: девять месяцев, базовый этап и специализация, задания на данных с проверкой кураторов.

Первые профессиональные шаги бывают разными. Кто-то приходит в Data Science из аналитики внутри своей компании, добавляя к отчётам предсказательные задачи; кто-то стартует стажёром там, где есть кому проверять код. Разработчики заходят со стороны продакшна, выпускники математических факультетов — через исследовательские задачи. Ни один маршрут не обязателен.

Сравнивать образовательные платформы удобнее по одинаковым критериям: глубина практики, проверка заданий живым человеком, длительность, доступ к материалам после окончания. Для первого отбора подойдёт рейтинг онлайн-школ с обучением Data Science — подборка по всему направлению, так что программы внутри неё придётся сопоставлять по содержанию.

Понять, готовы ли вы начинать, проще всего на небольшом опыте: возьмите открытый набор данных, поставьте задачу предсказания с привязкой к моменту времени, разделите выборку до любой предобработки и доведите дело до честно измеренной метрики. Если путь вызвал интерес, а не раздражение, дальше выбирайте программу и смотрите, сколько в ней практики на валидации и внедрении.