Перейти к содержимому
Учи.Онлайн Выбрать школу
Статья

Компьютерная лингвистика: с чего начать, что изучить и как практиковаться

Компьютерная лингвистика — область на стыке языкознания и программирования. Специалисты описывают язык так, чтобы программа могла с ним работать: составляют словари и грамматические правила, собирают корпуса текстов и размечают в них части речи, синтаксические связи и имена, обучают модели и проверяют, где те ошибаются. Внутри области есть роли разметчика и асессора, лингвиста в команде голосового ассистента, специалиста по оценке языковых моделей, компьютерного лингвиста и NLP-инженера. Для входа нужны уверенное знание грамматики, Python и привычка проверять любой результат на вручную размеченных данных.

Автор: редакция Учи.ОнлайнОтветственный редактор: Дмитрий Игнатьев
Содержание
Иллюстрация к статье: Компьютерная лингвистика: с чего начать, что изучить и как практиковаться

Распространённое заблуждение — будто после появления больших языковых моделей лингвист в этой области лишний. Модель действительно отвечает связным текстом, но кто-то должен решить, какой ответ считать верным. Возьмём слово «стали» во фразе «Цены на сталь стали расти». Морфологический анализатор честно выдаёт два варианта — форму существительного «сталь» и глагол «стать», — а выбрать нужный помогает только контекст. Правила, по которым люди делают такой выбор, и проверочные наборы, на которых меряют качество программ, пишет лингвист.

Что делают в компьютерной лингвистике

Работа складывается из нескольких типов задач. Первый — разбор языка в коде. Библиотека pymorphy3 для каждого слова возвращает начальную форму и грамматические признаки, spaCy и Natasha строят синтаксическое дерево предложения и показывают, какое слово подлежащее, а какое к нему относится. Лингвист проверяет, где разбор ломается: на сленге, опечатках, именах собственных.

Второй тип — корпуса. Корпус — это собрание текстов с описанием (автор, год, жанр) и разметкой, по которому можно искать не только слова, но и грамматические конструкции. Специалист отбирает тексты, договаривается о схеме разметки, размечает часть вручную и следит за единообразием.

Третий — прикладные задачи: извлечение именованных сущностей (NER), то есть поиск в тексте людей, организаций и мест; классификация текстов по темам; поиск, который находит документ по смыслу запроса. Четвёртый, самый новый, — оценка языковых моделей: составление заданий, критериев и шкал, сравнение ответов разных систем и разбор ошибок.

Корпус и ручная разметка: на чём держится область

Чтобы понять, где в этой области ручной труд, полезно посмотреть на устройство Национального корпуса русского языка. По статистике НКРЯ, обновлённой 2 октября 2026 года, в основном корпусе 140 804 текста и 426 186 466 слов. Подкорпус со снятой омонимией — тот, где эксперты вручную выбрали для каждого слова единственный верный разбор, — составляет 2 164 текста и 5 988 177 слов, то есть около 1,4 % основного корпуса.

Остальное размечено автоматически. На странице основного корпуса сказано, что большинство текстов параллельно обрабатывают две программы: MyStem выдаёт все разборы, допустимые словарём и правилами, а Rubic, нейросетевая модель, обученная на вручную размеченных текстах, выбирает один, наиболее вероятный в контексте. Получается, что полтора процента выверенной людьми разметки служат эталоном для сотен миллионов слов. Ошибка, закравшаяся в инструкцию для разметчиков, повторится в обученной модели и затем в каждом исследовании, построенном на корпусе.

Отсюда практический вывод для новичка. Сырых текстов в мире много, дефицитна выверенная разметка и умение её делать: писать инструкцию, разбирать спорные случаи, измерять согласие между разметчиками. Именно с этого часто начинается работа в области.

Какие роли есть внутри области

Роли различаются тем, сколько в работе языка и сколько кода. Ниже они идут от самой языковой к самой инженерной, чтобы было видно, какие знания добавляются на каждом шаге.

  • Разметчик и асессор: размечает тексты по инструкции, оценивает ответы поиска или модели по шкале, отмечает спорные случаи. Нужны внимательность и грамотность, программирование не обязательно.
  • Специалист по оценке языковых моделей: пишет задания и критерии, проверяет ответы на фактические и языковые ошибки, сравнивает версии модели. Работодатели нередко ищут сюда экспертов предметных областей.
  • Лингвист в команде голосового ассистента: составляет сценарии диалогов, варианты формулировок запросов, словари для распознавания и синтеза речи, проверяет, как ассистент понимает разговорные фразы.
  • Компьютерный лингвист: проектирует схемы разметки, словари и правила, собирает корпуса, пишет скрипты на Python для их обработки.
  • NLP-инженер: обучает и дообучает модели, строит конвейеры обработки текста, отвечает за качество и скорость в продукте.

С соседними направлениями границы такие. Обработка естественного языка как навык нужна аналитику или разработчику для конкретной задачи, вроде сортировки обращений; компьютерная лингвистика шире и включает работу с самим описанием языка. Машинное обучение и промпт-инжиниринг — отдельные направления со своими инструментами. Лингвистическая экспертиза, несмотря на общее слово, связана с судебными и правовыми вопросами, а не с программами.

Учебный пример: разметка имён в новостях

Ситуация учебная. Небольшая редакция хочет автоматически отмечать в новостях людей, организации и места. Лингвист берёт 300 заметок и пишет инструкцию: считать ли «Газпром Арену» организацией или местом, размечать ли «москвичи» как место, что делать с должностью перед фамилией. Два человека независимо размечают одни и те же 50 заметок, а там, где они расходятся, правила уточняются.

Затем готовая модель из Natasha прогоняется по оставшимся заметкам, и для каждого типа сущностей считаются точность (сколько найденного верно) и полнота (сколько верного найдено). Самое ценное — список ошибок: модель путает названия стадионов и клубов, пропускает фамилии в косвенных падежах. Итог — размеченный набор, инструкция и отчёт, по которому понятно, где доучивать модель.

С чего начать и в каком порядке осваивать

Порядок ниже идёт от языка к коду и от простых методов к сложным. Если начать с нейросетей, не понимая морфологии и метрик, трудно объяснить, почему модель ошиблась, и нечем проверить её ответы.

  1. Грамматика русского языка на уровне вузовского курса: части речи, падежи, омонимия, синтаксические связи.
  2. Поиск в корпусе: в НКРЯ есть лексико-грамматический поиск, которым удобно отвечать на вопросы вроде «как часто после глагола идёт инфинитив».
  3. Python, регулярные выражения и pandas: прочитать файл с текстами, почистить его, посчитать частоты.
  4. Морфология и синтаксис в коде: pymorphy3, spaCy с русской моделью, Natasha.
  5. Разметка и метрики: инструкция, согласие разметчиков, точность, полнота, F1.
  6. Классические модели и затем трансформеры, после них — оценка больших языковых моделей на собственном проверочном наборе.

Филологу, который хочет сначала разобраться в теории, подойдёт программа переподготовки АПОК «Компьютерная лингвистика»: 256 часов, модули о корпусах и частотности, словарях, машинном переводе и извлечении именованных сущностей, в конце аттестационная работа и диплом о переподготовке. Программирования, библиотек обработки языка и нейросетевых моделей в опубликованном плане нет, поэтому практику на Python придётся добирать отдельно.

Как практиковаться

Тренироваться лучше на задачах, где можно проверить себя. Возьмите сотню предложений, разберите их вручную, затем прогоните через pymorphy3 и сравните: в каких словах программа выбрала не тот разбор и почему. Повторите то же с синтаксисом в spaCy. Для NER подойдут новости: разметьте 100 заметок по своей инструкции и посчитайте точность готовой модели.

Для разметки удобны бесплатные инструменты вроде Label Studio, а задачи с готовыми данными и метриками ежегодно публикует конференция «Диалог» в соревнованиях Dialogue Evaluation. Хороший проект для портфолио — небольшой проверочный набор: 200 вопросов по одной теме с эталонными ответами и критериями оценки, на котором вы сравнили две языковые модели и описали типичные ошибки.

Если вы решили идти в инженерную сторону, понадобится прочная база по Python и машинному обучению. На курсе Skillbox «Data Scientist + ИИ» за 12 месяцев проходят Python, pandas, SQL, статистику, классические алгоритмы и введение в нейросети, по описанию это больше ста практических работ и свыше двадцати проектов с проверкой. Обработке текста отдельный модуль в описании не выделен, так что языковую часть вы будете строить сами на этой основе.

Сколько зарабатывают

Отдельной статистики по компьютерным лингвистам нет, поэтому ориентиры приходится собирать по соседним специализациям. Калькулятор зарплат Хабр Карьеры на 2 октября 2026 года показывает по специализации «Учёный по данным» по России медиану 112 500 ₽ для уровня Junior (74 анкеты) и 226 666 ₽ для Middle (193 анкеты). Это зарплаты, которые сообщили сами специалисты, а не предложения в вакансиях.

Вакансий именно по NLP немного, и большинство рассчитано на опытных. В выдаче Хабр Карьеры по запросу «NLP» на ту же дату 13 вакансий, стажёрская среди них одна, а зарплата прямо указана лишь в двух; например, в удалённой вакансии Data Scientist / AI Engineer в аутстафф-компании BGStaff — от 200 000 до 230 000 ₽. По такой выборке рынок не оценить.

Вход через оценку моделей устроен иначе: там ценят экспертизу в предметной области. Например, у подразделения «Яндекс | AI-тренеры» на Хабр Карьере на 2 октября 2026 года 24 открытые вакансии, в том числе удалённая работа юриста по обучению нейросетей уровня Middle с зарплатой до 188 000 ₽. Вакансий для лингвистов в этом списке на ту дату нет, так что следите за подобными предложениями сами.

Как выбрать обучение

Сначала определите, в какую сторону вы идёте. Для роли разметчика и специалиста по оценке достаточно грамматики, внимательности и знакомства с метриками. Компьютерному лингвисту нужен Python, NLP-инженеру — ещё машинное обучение и нейросети. В программе ищите задания на русскоязычных данных, ручную разметку с инструкцией и разбор ошибок модели, а не только обзор технологий.

Для инженерного маршрута подойдёт программа Нетологии «NLP-инженер»: по карточке она длится 13 месяцев, идёт онлайн и заканчивается выдачей документа. Модули и проекты в карточке не расписаны, поэтому подробную программу, требования к входу и долю работы с русским языком уточните у школы до оплаты.

Перед выбором спросите, кто проверяет практические работы и на каких данных делают проекты. Если нужна лингвистическая часть, попросите план модулей о морфологии, корпусах и оценке моделей.

Поскольку отдельного рейтинга школ по компьютерной лингвистике на сайте нет, а почти любой маршрут в области начинается с Python, сравнить онлайн-школы по цене, формату и поддержке можно по общему рейтингу онлайн-школ с обучением Python. Он не посвящён обработке языка, зато поможет выбрать, где освоить программирование, без которого дальше первых ролей не продвинуться.