Статистика и анализ данных: что такое EDA, описательные статистики и методы статистической обработки
Данные сами по себе редко дают готовый ответ. Чтобы понять, что за ними стоит, аналитик последовательно изучает их структуру, ищет закономерности, проверяет предположения и только после этого делает выводы. В этом помогают разведочный анализ данных, описательные показатели и статистические методы. В статье разберем, как они связаны между собой.
Содержание

Зачем нужен статистический анализ данных
Представим, что интернет-магазин изменил дизайн корзины, после чего конверсия выросла с 8 до 9%. Однако рост мог быть связан не с новым дизайном, а с сезонной распродажей, изменением источников трафика или случайными колебаниями. Чтобы понять, насколько заметен эффект, не возник ли он случайно и какие факторы могли на него повлиять, используют статистический анализ данных.
С его помощью:
- описывают информацию и находят характерные значения;
- сравнивают группы;
- выявляют связи между показателями;
- проверяют предположения;
- оценивают влияние разных факторов;
- строят прогнозы на основе прошлых наблюдений.
Но специалист не начинает со сложных тестов или моделей. Сначала нужно проверить качество сведений, изучить распределения, найти пропуски, выбросы и необычные значения. Затем — рассчитать описательные показатели, построить графики и сформулировать вопросы, которые можно проверить. Только после этого выбираются подходящие методы статистического анализа.
К примеру, аналитик изучает данные сервиса доставки. Он замечает, что пользователи, которым показывали персональные рекомендации, в среднем оформляли более дорогие заказы. Это полезное наблюдение, но оно не доказывает, что рекомендации действительно увеличили сумму покупки. Возможно, их чаще видели изначально более активные потребители. Чтобы отделить влияние рекомендаций от других факторов, понадобятся сравнение групп, проверка гипотез или регрессионный анализ.
Запускать ли новую функцию на всех пользователей? Менять ли рекламную стратегию? Влияет ли скорость доставки на повторные покупки? Без статистической проверки легко принять случайное совпадение за устойчивую закономерность.
Бизнесу нужен не просто человек, который умеет строить графики и считать средние значения. Востребованы специалисты, которые помогут понять причины изменений, проверить идеи до дорогостоящего запуска и принять решение на основе фактов. Освоить необходимые для этого инструменты можно на курсе «Аналитик данных». Студенты изучают SQL, Python, статистику, продуктовую аналитику, A/B-тесты и визуализацию, а после курса имеют более десяти проектов в портфолио.
Что такое EDA (разведочный анализ данных)
Итак, сервис доставки хочет понять, почему одни клиенты возвращаются, а другие — нет. У аналитика есть таблица со сведениями о пользователях: сумма заказа, размер скидки, время доставки, город, устройство, источник привлечения и информация о повторных покупках.
Хочется сразу сравнить две группы или построить модель? Но нужно убедиться, что это можно исследовать. Возможно, в таблице есть дубликаты заказов, пропуски во времени доставки, отрицательные суммы или несколько необычно крупных покупок, которые искажают средние показатели. С такого первичного исследования и начинается EDA.
В чем суть
Разведочный анализ данных (англ. Exploratory Data Analysis, EDA) — это начальный этап работы с набором фактов. Здесь специалист знакомится с информацией, проверяет ее качество, ищет закономерности и определяет, какие вопросы стоит изучить подробнее.
В нашем примере аналитик сначала проверит, за какой период собраны заказы, сколько уникальных клиентов и как определяется повторная покупка. Затем он посмотрит на распределение времени доставки, суммы заказа и скидки, сравнит города и источники привлечения.
Допустим, выяснится, что пользователи с повторными покупками в среднем получают заказ быстрее. Это еще не означает, что именно скорость доставки заставляет их возвращаться. Но такое наблюдение помогает сформулировать вопрос для дальнейшего анализа.
В результат нам нужен не окончательный вывод, а понятная картина и список предположений, которые можно проверить.
Чем EDA отличается от классического статистического анализа
Если коротко, то первый помогает обнаружить возможную закономерность, а второй — оценить, насколько она надежна.
| EDA | Классический статистический анализ | |
| Основная цель | Понять данные и найти интересные закономерности | Проверить конкретное предположение |
| Начинается с… | общего изучения набора сведений | заранее сформулированной гипотезы |
| Вопросы | Что происходит в датасете? Есть ли аномалии, связи и различия? | Можно ли считать найденное различие или связь статистически обоснованными? |
| Инструменты | Графики, описательные статистики, анализ распределений, поиск выбросов | Статистические тесты, доверительные интервалы, корреляционный и регрессионный анализ |
| Результат | Наблюдения и гипотезы для дальнейшей проверки | Вывод о том, подтверждается ли гипотеза имеющимися данными |
Цели EDA
1. Понять, с чем предстоит работать.
Аналитик выясняет, что означает каждая строка и колонка, за какой период собрана информация, в каких единицах записаны значения и насколько полно заполнена таблица.
Например, одна строка может соответствовать заказу, а не отдельному пользователю. Тогда клиент, который сделал десять покупок, появится в таблице десять раз. Если не учесть эту особенность, можно неправильно рассчитать количество клиентов или долю повторных обращений.
2. Найти ошибки, выбросы и аномалии.
В таблицах сервиса доставки могут быть:
- заказы с нулевой или отрицательной стоимостью;
- время доставки в несколько секунд или несколько дней;
- повторяющиеся строки;
- пропуски в информации о городе;
- резкий рост заказов в отдельную дату;
- один клиент с сотнями покупок.
Необычное значение не всегда ошибка. Крупную заявку мог оформить корпоративный клиент, а резкий всплеск продаж произошел во время акции. Поэтому специалист не удаляет аномалии автоматически, а сначала выясняет их причину.
3. Сформулировать гипотезы.
После первичного анализа могут появиться предположения:
- клиенты чаще возвращаются, если доставка занимает меньше 40 минут;
- размер скидки связан с суммой заказа;
- доля повторных покупок различается по городам;
- пользователи из разных рекламных каналов ведут себя неодинаково;
- крупные скидки привлекают клиентов, которые редко заказывают повторно.
Пока это предварительные выводы. Они основаны на наблюдениях, но еще не учитывают случайные колебания и влияние других факторов. Дальше аналитик описывает найденные закономерности с помощью статистических показателей, выбирает подходящие методы и проверяет гипотезы.
Инструменты и методы EDA
После первичной проверки нужно внимательнее изучить значения и возможные связи между ними. Для этого используют разные методы анализа данных: строят графики, исследуют распределения, ищут аномалии и при необходимости преобразуют признаки.
Эти инструменты дополняют друг друга. График помогает заметить закономерность, числовые показатели — точнее ее описать, а проверка исходных сведений — убедиться, что наблюдение не появилось из-за ошибки.
Визуализация
Визуализация упрощает интерпретацию данных: показывает форму распределения, различия между группами, возможные связи и необычные значения. Выбор графика зависит от вопроса, на который хочет ответить аналитик.
Гистограмма показывает, как часто встречаются значения из разных диапазонов. Например, с ее помощью можно изучить время доставки. Допустим, большинство заказов доставляют за 30-50 минут, но у распределения есть длинный «хвост»: небольшая часть клиентов ждет больше двух часов. Это повод проверить, в каких городах, ресторанах или временных интервалах возникают задержки.

Диаграмма рассеяния помогает исследовать связь между двумя числовыми переменными. Каждая точка на таком графике соответствует одному наблюдению.
К примеру, аналитик может расположить по одной оси размер скидки, а по другой — сумму заказа. Если точки постепенно поднимаются слева направо, можно предположить, что более крупные скидки связаны с более высоким чеком. Но график также может показать, что явной связи нет или она сохраняется только до определенного размера скидки.

По диаграмме рассеяния нельзя сделать вывод, что один показатель стал причиной другого. Возможно, крупные скидки чаще получают постоянные клиенты, которые и без них оформляют дорогие заявки. Пока это только наблюдение, которое нужно изучить с помощью других методов.
Диаграмма размаха (англ. box plot) показывает положение основной части значений, медиану и наблюдения, которые заметно отличаются от остальных. Такой график удобно использовать для сравнения нескольких групп.
Например, можно построить отдельные диаграммы времени доставки для клиентов с повторными заказами и для тех, кто больше не вернулся. Аналитик увидит не только средние или медианные значения, но и разброс внутри каждой группы.

Точки за пределами основной части диаграммы часто называют потенциальными выбросами. Это не значит, что их нужно сразу удалить. Доставка за четыре часа может быть ошибкой, а может быть реальным случаем, произошедшим во время сильного снегопада.
Тепловая карта представляет числовые значения с помощью оттенков. В EDA ее часто используют для отображения корреляций между несколькими переменными.
Например, аналитик может сравнить сумму заказа, размер скидки, время доставки, расстояние и количество товаров. Тепловая карта поможет быстро заметить пары показателей с сильной положительной или отрицательной связью. Главное, помнить, что высокая корреляция не доказывает причинно-следственную связь, а слабая корреляция не всегда означает отсутствие зависимости.

EDA-анализ данных обычно включает несколько визуализаций, потому то один график редко дает полную картину.
Анализ распределений и проверка нормальности
Распределение показывает, какие значения встречаются чаще и насколько сильно они различаются. Его форма влияет на выбор статистических методов анализа данных.
Например, редкие крупные заказы могут завысить средний чек. В таком случае дополнительно используют медиану и квантили.
Близость информации к нормальному распределению проверяют с помощью гистограммы, графика квантилей (Q-Q plot) и статистических тестов. Несколько пиков на графике могут указывать на разные группы, которые стоит анализировать отдельно.
Выявление выбросов и аномалий
Выбросы — это значения, которые заметно отличаются от большинства наблюдений. Например, в данных сервиса доставки могут встретиться отрицательная сумма заказа, нулевое время доставки или покупка на 150 000 рублей при обычном чеке до 5 000.
Такие значения ищут с помощью графиков, межквартильного размаха, Z-оценки и бизнес-правил. Но удалять их автоматически нельзя: выброс может оказаться не ошибкой, а редкой корпоративной заявкой, сбоем в продукте или признаком мошенничества. Сначала нужно выяснить, почему он появился и как влияет на результат.
Преобразование данных: нормализация и стандартизация
Если признаки измеряются в разных масштабах, их иногда преобразуют перед дальнейшим анализом. Например, сумма может достигать десятков тысяч рублей, а время доставки — сотен минут.
Нормализация приводит значения к общему диапазону, обычно от 0 до 1. Стандартизация показывает, насколько каждое значение отличается от среднего. Эти методы особенно полезны в машинном обучении и моделях, чувствительных к масштабу признаков.
Преобразование требуется не всегда: для графиков и понятной интерпретации исходные минуты, рубли и проценты часто удобнее.
Описательные статистики
После первичного анализа нужно кратко описать датасет: сколько заказов попало в выборку, каков типичный чек, сколько обычно занимает доставка и насколько сильно значения отличаются друг от друга. Для этого используют описательные статистики.
Они помогают свести тысячи строк к нескольким понятным показателям:
- среднее — сумма всех значений, разделенная на их количество;
- медиана — значение, которое находится в середине упорядоченного ряда;
- минимум и максимум — границы наблюдаемых значений;
- квантили — значения, ниже которых находится определенная доля наблюдений;
- размах — разница между максимумом и минимумом;
- дисперсия и стандартное отклонение — показатели разброса данных;
- доли и частоты — количество или процент наблюдений с определенным признаком.
Допустим, среднее время доставки составляет 46 минут, а медианное — 38 минут. Разница может означать, что небольшая часть очень долгих доставок повышает среднее. В этом случае медиана лучше описывает время ожидания типичного клиента.
Методы статистической обработки данных
EDA и описательные статистики помогли заметить, что клиенты с повторными заказами обычно получают доставку быстрее, а сумма покупки может быть связана с размером скидки. Но пока это только наблюдения в конкретной выборке.
Основные виды статистического анализа помогут проверить их и оценить влияние разных факторов. Корреляция — выявлять связи, регрессия — учитывать несколько факторов одновременно, а статистические тесты — проверить гипотезы.
Корреляционный анализ: как выявить связи между переменными
Корреляционный анализ показывает, связаны ли изменения двух показателей. Коэффициент корреляции принимает значения от −1 до 1.
- Чем ближе значение к 1, тем сильнее показатели растут вместе.
- Чем ближе к −1, тем сильнее один показатель снижается, когда другой растет.
- Значение около 0 означает, что явной связи между показателями не видно.
Например, аналитик может проверить связь между расстоянием и временем доставки. Положительная корреляция будет означать, что с увеличением расстояния доставка обычно занимает больше времени.
Для числовых данных часто используют коэффициент Пирсона. Если распределение сильно скошено, есть выбросы или зависимость не похожа на прямую линию, применяют ранговую корреляцию Спирмена.
При этом корреляция не доказывает причинно-следственную связь. Если клиенты с крупными скидками делают более дорогие заказы, это еще не значит, что именно скидка увеличила чек. Возможно, специальные предложения чаще получают изначально активные пользователи.
Регрессионный анализ: от связей к прогнозам
Представим, что аналитик хочет понять, влияет ли скорость доставки на повторное обращение. Но клиент может вернуться и по другим причинам: из-за скидки, суммы покупки, города или рекламного канала. Регрессионный анализ помогает учесть несколько факторов одновременно и оценить роль каждого из них.
Линейную регрессию используют, когда нужно спрогнозировать число, например сумму следующего заказа. Логистическую — когда возможны два результата: клиент вернулся или нет.
Допустим, анализ показал: чем дольше доставка, тем ниже вероятность повторного заказа, даже если учесть город и сумму покупки. Это точнее простого сравнения средних. Но регрессия не всегда доказывает причину: на результат могут влиять и другие факторы, которых нет в распоряжении.
Проверка статистических гипотез: t-тест, ANOVA, критерии согласия
Статистическая гипотеза — это предположение, которое можно проверить с помощью данных. Например: скорость доставки влияет на повторные заявки или клиенты из разных городов ждут курьера одинаково долго.
Обычно сначала предполагают, что различий или связи нет. Затем с помощью статистического теста проверяют, достаточно ли информации, чтобы отказаться от этого предположения.
t-тест сравнивает средние значения в двух группах. Например, можно проверить, отличается ли среднее время доставки у клиентов, которые вернулись, и у тех, кто больше не делал заказ.
Если групп больше двух, используют дисперсионный анализ (ANOVA). С его помощью можно сравнить среднее время доставки сразу в нескольких городах. Метод покажет, есть ли различия между группами, но для поиска конкретных пар понадобятся дополнительные тесты.
Критерии согласия помогают анализировать категориальные данные. Например, критерий хи-квадрат поможет проверить, связаны ли рекламный канал и повторное обращение.
Результат теста часто оценивают с помощью p-value — показателя, который помогает понять, могло ли найденное различие возникнуть случайно. Небольшое значение означает, что найденное различие вряд ли возникло только случайно. Но этого недостаточно для практического вывода.
Например, разница во времени доставки может быть статистически подтверждена, но составлять всего 20 секунд. Для бизнеса она почти не имеет значения. Поэтому аналитик оценивает не только p-value, но и размер различия, доверительный интервал и контекст задачи.
Параметрические и непараметрические методы: что когда применять
Параметрические методы подходят, когда сведения соответствуют определенным условиям. Например, распределены достаточно равномерно и не содержат слишком много выбросов. К ним относятся t-тест, ANOVA и корреляция Пирсона.
Непараметрические методы предъявляют к данным меньше требований. Их часто используют для небольших выборок, сильно скошенных распределений или наборов с выбросами.
| Задача | Параметрический метод | Непараметрический метод |
| Сравнить две группы | t-тест | критерий Манна — Уитни |
| Сравнить несколько групп | ANOVA | критерий Краскела — Уоллиса |
| Оценить связь показателей | корреляция Пирсона | корреляция Спирмена |
| Сравнить значения до и после изменения | парный t-тест | критерий Уилкоксона |
Например, аналитик сравнивает суммы заказов двух групп. В распоряжении мало наблюдений и есть несколько очень крупных покупок. В такой ситуации критерий Манна — Уитни может подойти лучше t-теста.
Но непараметрический метод не нужно выбирать автоматически при любом отклонении от нормального распределения. Учитывайте размер выборки, тип сведений, наличие выбросов и вопрос, на который нужно ответить.
Интерпретация результатов: как превратить цифры в выводы
Качественная интерпретация данных — это объяснить, что означают полученные показатели в контексте задачи. Недостаточно сообщить, что коэффициент корреляции равен −0,3, а p-value меньше выбранного уровня значимости. Нужно перевести результат на понятный язык.
Вернемся к примеру сервиса доставки. Анализ показал, что клиенты, которые получили заказ быстрее, чаще совершали повторную покупку. Статистический тест подтвердил различия между группами, а регрессионная модель показала, что связь сохраняется даже с учетом города, суммы и скидки.
Итоговый вывод не должен звучать так:
❌Скорость доставки влияет на повторные покупки, потому что результат статистически значим.
Такое утверждение слишком категорично. По набору можно говорить о связи, но не обязательно о прямой причине. Возможно, пользователей мотивирует вернуться качество работы ресторана, удобство приложения или другие факторы, которых нет в таблице.
Более точная интерпретация выглядит так:
✅В исследуемой выборке более быстрая доставка связана с большей вероятностью повторного заказа. Связь сохраняется при учете города, суммы покупки и скидки. Сервису стоит проверить эффект в контролируемом эксперименте и отдельно изучить случаи с задержками.
При интерпретации учитывайте:
- направление и силу связи;
- размер различий между группами;
- доверительные интервалы;
- объем и качество данных;
- возможное влияние других факторов;
- практическую пользу результата.
Например, сокращение доставки на одну минуту может быть связано с ростом доли повторных заказов всего на 0,01%. Даже если результат статистически значим, перестраивать ради него всю логистику невыгодно. Важно не только убедиться, что эффект существует, но и оценить, насколько он заметен для бизнеса.
Хороший аналитический вывод обычно отвечает на три вопроса: что обнаружили, насколько надежен результат и что с ним делать дальше.
Пошаговый алгоритм анализа данных: от EDA до вывода
- Сформулировать задачу.
- Собрать и проверить информацию.
- Провести EDA-анализ.
- Рассчитать описательные статистики.
- Сформулировать гипотезу.
- Выбрать статистический метод.
- Проверить условия метода.
- Провести расчеты.
- Интерпретировать результат.
- Сформулировать рекомендации.
Процесс не всегда идет строго по прямой. Результаты теста могут заставить вернуться к таблицам, проверить отдельную группу или пересмотреть первоначальную гипотезу. Анализ заканчивается не тогда, когда рассчитан последний показатель, а когда получен понятный и обоснованный ответ на исходный вопрос.
Типичные ошибки и как их избежать
Даже правильный метод может привести к неверному выводу, если ошибиться на одном из этапов.
- Сразу переходить к тестам.
Сначала нужно провести EDA: проверить пропуски, дубликаты, выбросы и структуру данных.
- Опираться только на среднее.
Крупные или редкие значения могут его исказить. Поэтому дополнительно смотрят медиану, квантили и разброс.
- Удалять все выбросы.
Аномалия может быть ошибкой, редким случаем или важным сигналом. Сначала нужно выяснить ее причину.
- Принимать корреляцию за причину.
Связь между быстрой доставкой и повторными заказами еще не доказывает, что одно вызвало другое.
- Смотреть только на p-value.
Статистически значимый эффект может быть слишком мал для бизнеса. Важно оценивать размер различия и его практическую пользу.
- Обобщать результаты на всех.
Выводы должны относиться только к тем пользователям и условиям, которые представлены в данных.
Избежать ошибок помогает последовательный процесс: изучить сведения, описать их, выбрать подходящий метод и только после этого формулировать вывод.
Заключение
Анализ данных начинается с наблюдений, но не заканчивается ими. EDA помогает увидеть закономерности, описательные статистики — выразить их в числах, а статистические методы — проверить, насколько они надежны. Такой подход позволяет отличать реальные эффекты от случайных совпадений и принимать решения на основе фактов.