Перейти к содержимому
Учи.Онлайн Выбрать школу
Статья

Статистика: что это, где применяется и как освоить

Статистика — это умение делать выводы о большом целом по его части и честно говорить, насколько вывод надёжен. На практике человек считает долю или среднее по выборке, оценивает погрешность, решает, хватит ли наблюдений, отличает настоящее изменение от случайного колебания и раскладывает общий итог по группам. Маркетолог так читает опросы, менеджер продукта — эксперименты, врач — результаты анализов, журналист — рейтинги и соцопросы, студент — данные курсовой. Освоить придётся описательные меры, основы вероятности, выборку, доверительные интервалы и проверку гипотез.

Автор: редакция Учи.ОнлайнОтветственный редактор: Дмитрий Игнатьев
Содержание
Иллюстрация к статье: Статистика: что это, где применяется и как освоить

Главная мысль навыка: любое число, посчитанное по части данных, дрожит. Опросите других 400 клиентов — и доля довольных выйдет не 62 %, а 59 % или 65 %, хотя клиенты не изменились. Статистика не устраняет этот разброс, а измеряет его. Поэтому на фразу «удовлетворённость упала на 4 пункта» владеющий ею человек сначала спрашивает, больше ли это падение обычного колебания, и только потом ищет виноватых.

Кому и для чего нужен навык

Маркетолог проводит опрос после запуска новой упаковки и должен понять, отличается ли 54 % «нравится» от 50 % или это одно и то же в пределах погрешности. Менеджер продукта сравнивает две версии экрана оплаты и решает, сколько дней держать эксперимент, чтобы не остановить его на случайном всплеске. Врач оценивает, насколько вероятна болезнь у пациента с положительным скрининговым тестом. Журналист проверяет пресс-релиз, где «рост на 50 %» на деле означает переход с 2 % до 3 %, то есть на один процентный пункт. Студент пишет курсовую по анкетам однокурсников и объясняет, на кого можно распространить выводы.

Своих навыков бывает мало. Клиническое исследование с рандомизацией и расчётом мощности планирует биостатистик ещё до набора пациентов, а официальную статистику нужно уметь читать, а не пересчитывать. Навык помогает задать специалисту правильный вопрос и не принять слабый результат за доказанный.

Учебный пример: упала ли удовлетворённость клиентов

Ситуация вымышленная. Интернет-магазин каждый квартал опрашивает 400 случайно выбранных покупателей. Во втором квартале довольны были 62 %, в третьем — 58 %. Руководитель просит к пятнице объяснить, что сломалось.

Сначала стоит оценить погрешность одного замера. Для доли её приближённо считают как 1,96 × √(p × (1 − p) / n). При p = 0,62 и n = 400 выходит около 0,048, то есть ±4,8 процентного пункта. Значит, настоящая доля довольных во втором квартале с большой вероятностью лежала где-то между 57 % и 67 %, а в третьем — между 53 % и 63 %. Интервалы почти целиком перекрываются.

Затем считают интервал для разницы. Стандартная ошибка разности двух долей — корень из суммы p × (1 − p) / n для каждого замера, здесь около 3,5 пункта. Падение на 4 пункта даёт 95-процентный интервал примерно от −10,8 до +2,8. Ноль попадает внутрь: данные не исключают, что удовлетворённость не изменилась вовсе, но не исключают и заметного падения. Честный ответ руководителю звучит так: «По этим двум опросам мы не можем отличить падение от случайного колебания».

Третий шаг — понять, что делать дальше. Чтобы надёжно замечать изменение на 4 пункта (с вероятностью 80 % при пороге 5 %), в каждой волне нужно около 2 350 ответов, а не 400. Если это дорого, смотрят тренд за несколько кварталов или связанные показатели: возвраты, повторные покупки, жалобы.

Формула при этом видит не всё. Погрешность ±4,8 пункта верна только для случайной выборки. Если анкету заполняют лишь те, кто сам захотел, опрос может ошибаться на десяток пунктов в одну сторону, и интервал этого не покажет.

Когда общий итог обманывает: приём в Беркли

Осенью 1973 года в аспирантуру Калифорнийского университета в Беркли подали заявления 8 442 мужчины и 4 321 женщина. Приняли около 44 % мужчин и около 35 % женщин; по расчёту статистиков Питера Бикела, Юджина Хаммела и Уильяма О'Коннелла, женщин взяли на 277 человек меньше, чем следовало бы ожидать при одинаковых шансах. Картина выглядела как явная дискриминация, но авторы разобрали решения по факультетам и опубликовали результат в журнале Science (Bickel, Hammel, O'Connell, Science, 1975, т. 187, № 4175, с. 398–404).

Из 101 факультета и междисциплинарной программы они исключили 16, где не было заявлений от женщин или никому не отказали. В оставшихся 85 значимый перекос против женщин нашёлся в четырёх, а в пользу женщин — в шести. Объяснение оказалось в том, куда подавали заявления: доля женщин была высокой как раз на факультетах, куда трудно поступить, и низкой там, где принимают многих (взвешенная корреляция 0,56). При учёте факультетов вместо общего котла получился небольшой, но статистически значимый перекос в пользу женщин. Авторы прямо пишут, что простое сложение данных здесь вводит в заблуждение, и называют это явление парадоксом Симпсона.

Важна и концовка статьи. Бикел и соавторы не заявили, что проблемы нет: они предположили, что женщин ещё на прежних ступенях образования направляли в переполненные и хуже обеспеченные области. Статистика не закрыла вопрос, а указала, где искать причину.

Урок переносится на любую работу. Конверсия канала падает, хотя в каждом регионе растёт, — выросла доля регионов с низкой конверсией. Одна больница выглядит хуже другой по смертности, потому что туда везут более тяжёлых пациентов. Прежде чем объяснять общий итог, посмотрите, из каких групп он сложен и как изменились их доли.

С чего начать и в каком порядке осваивать

До начала нужна школьная алгебра: дроби, проценты, степени и корни. Порядок ниже выбран так, чтобы каждое следующее понятие опиралось на предыдущее. Без разброса непонятна погрешность, без вероятности — выборка, а проверка гипотез без интервалов превращается в ритуал «p меньше 0,05». Поэтому формальные тесты стоят в конце: сначала нужно почувствовать, как ведут себя случайные числа.

  1. Описательные меры: доля, среднее, медиана, квантили, стандартное отклонение, чтение гистограммы.
  2. Вероятность: независимые события, условная вероятность, формула Байеса на примере медицинского теста.
  3. Распределения: биномиальное, нормальное, почему средние по выборкам распределены почти нормально.
  4. Выборка и погрешность: случайный отбор, смещение, стандартная ошибка, доверительный интервал для доли и среднего.
  5. Сравнение групп: интервал для разницы, объём выборки, проверка гипотез и её ограничения.
  6. Связи: корреляция, простая регрессия, стратификация по группам.

Попробовать можно сразу: повторите учебный пример с опросом на собственных цифрах. Ориентир готовности — умение без подсказки объяснить коллеге, что значит «±4,8 пункта». Если ближе всего вам эксперименты с рекламой и продуктом, посмотрите онлайн-курс Бруноям «Статистика и A/B-тестирование»: за два месяца в записи программа ведёт от теории вероятностей до расчёта объёма выборки и типичных ошибок A/B-тестов, а задания проверяет преподаватель. SQL и визуализации там нет — это именно математика эксперимента.

Упражнения и ошибки новичков

Первое упражнение проверяет понимание формулы Байеса. Тест находит болезнь у 90 % больных и даёт ложную тревогу у 5 % здоровых, а болеет 1 % обследуемых. В учебной группе из 10 000 человек 100 больных, из них тест найдёт 90; среди 9 900 здоровых ложноположительных будет 495. Значит, из 585 положительных ответов верны только 90, около 15 %. Посчитайте это на бумаге, затем повторите для 10 % больных.

Второе упражнение — на парадокс Симпсона. В языке R есть встроенный набор данных UCBAdmissions с заявлениями на шесть крупнейших факультетов Беркли 1973 года. Посчитайте долю принятых по полу сначала в целом, потом по каждому факультету, и объясните расхождение одним абзацем.

Третье — симуляция: сгенерируйте в таблице 1 000 опросов по 400 человек, где довольны ровно 60 %, и посмотрите на разброс результатов.

Ошибки новичков повторяются. Путают процентные пункты и проценты. Сравнивают доли без погрешности. Останавливают эксперимент в день, когда разница «стала значимой». Проверяют двадцать показателей и докладывают о единственном «значимом», хотя при пороге 5 % одна проверка из двадцати срабатывает случайно. Защищает простая привычка: заранее записать, что и на скольких наблюдениях вы собираетесь сравнивать.

Если вы готовы к более плотной математике и хотите решать много задач, на курсе Яндекс Практикума «Математика для анализа данных» есть более тысячи задач с автоматической проверкой и шесть воркшопов; вероятность и статистика там идут вместе с линейной алгеброй, а практические темы включают доверительные интервалы, p-значение, A/B-тесты и регрессию. Программа рассчитана на шесть месяцев и может оказаться тяжёлой при больших пробелах в алгебре.

Как статистика влияет на доход

Отдельной надбавки «за статистику» источники рынка труда не публикуют. Навык входит в вакансию строкой среди других требований — «опыт A/B-тестирования», «понимание статистической значимости» — и меняет доход через задачи, которые вам доверяют.

Маркетолог, который сам рассчитывает объём выборки, отвечает за решение о кампании, а не только за её запуск. Менеджер продукта, способный спланировать эксперимент, меньше зависит от очереди к аналитикам. Врачу статистика нужна в научной работе и клинических исследованиях, журналисту — в материалах на данных, где ошибка в процентах бьёт по репутации редакции.

Чтобы оценить эффект, сравните вакансии своей профессии с требованием статистики или A/B-тестов и без него: в одном регионе, на одном уровне опыта, за один месяц. Смотрите на медиану вилок и помните, что вилка — предложение работодателя, а не фактическая зарплата.

Что проверить при выборе обучения

Во-первых, есть ли в программе расчётные задания на реальных или хотя бы правдоподобных данных. Статистику, выученную по определениям, трудно применить к своему опросу. Во-вторых, объясняют ли на курсе, откуда берутся формулы, или только дают кнопки в программе. В-третьих, разбирают ли смещение выборки, множественные сравнения и стратификацию: именно на них ошибаются чаще, чем в арифметике.

Если вам нужен документ и методология официальной статистики — наблюдение, группировка, ряды динамики, статистика доходов и трудовых ресурсов, — посмотрите программу переподготовки АПОК «Статистика»: 856 академических часов дистанционно в своём темпе и диплом по квалификации «Специалист в сфере статистики». Учтите, что по описанию на ней нет расчётных заданий, статистических пакетов и регрессионного анализа, так что считать придётся учиться отдельно; уточните программу у школы.

Перед записью решите одну задачу из этой статьи самостоятельно. Если трудно дался расчёт погрешности, начните с базового курса статистики; если считаете легко, но не уверены, как спланировать сравнение, ищите программу с разбором экспериментов.

Отдельного рейтинга школ по статистике нет, поэтому сравнивать программы по цене, объёму практики и поддержке удобнее в более широком рейтинге онлайн-школ с обучением анализу данных.