Предыдущий пост не отвечает на главный вопрос — значимость коэффициента, даже 0.9. Для чего нужно указывать объём выборки?Представьте, что вы измерили урожайность пшеницы и содержание гумуса на двух полях.
Поле 1:
R = 0.99 (выборка n=2).
Поле 2:
R = 0.6 (выборка n=1000).
В какой ситуации вы больше уверены, что связь
действительно существует, а не стала результатом случайного стечения обстоятельств? Очевидно, во второй.
Объём выборки (
n) — это ключ к статистической значимости. Чем больше выборка, тем «увереннее» статистика и тем меньшее значение R требуется для достижения значимости.
Например, по таблице (рис.2):
При
n=12 даже коэффициент
R=0.55 не будет статистически значимым на уровне p < 0.05.
При
n=100 для значимости уже достаточно
R=0.20.
Об ограничениях этого подхода в эпоху big data писали в предыдущем посте (!)
Вот почему в научных статьях всегда требуют указывать и
R, и
n, и
p-value.
Как подтвердить значимость и надежность
R? Рассчитайте доверительный интервал.
Точечная оценка
R (например, 0.9) — это наше лучшее предположение. Но насколько оно точно? Доверительный интервал (ДИ) показывает диапазон, в котором с заданной вероятностью (обычно 95%) находится истинное значение коэффициента корреляции в генеральной совокупности.
Узкий ДИ (например, от 0.85 до 0.93) говорит о высокой точности оценки.
Широкий ДИ (напр. 0.5, 0.97) — о большой неопределенности, даже если коэффициент значим.
ДИ, включающий ноль (напр. -0.1, 0.8) — прямое указание на то, что связь может не отличаться от нуля, и выводы ненадежны.
Расчет ДИ можно провести вручную в эксель с помощью t-критерия, в программе R или Statistica. Всегда стремитесь указывать доверительный интервал вместе с
R.
🧭
Краткая инструкция по корреляционному анализу1. Визуализируйте данные. Постройте диаграмму рассеяния (scatterplot). Это поможет оценить линейность связи и выявить очевидные выбросы.
2. Проверьте нормальность распределения. Для корректного применения коэффициента Пирсона данные должны быть аппроксимированы нормальным распределением.
3. Выберите коэффициент. Если данные нормальны и связь линейна — используйте параметрический коэффициент Пирсона. Если есть отклонения от нормальности или есть выбросы — используйте непараметрический коэффициенты Спирмена или Кендалла.
4. Рассчитайте коэффициент и проверьте его значимость. Используйте статистические пакеты. Они выдадут вам значение коэффициента, p-value и, часто, доверительный интервал.
5. Интерпретируйте результат. Учитывайте не только силу связи, но и ее статистическую значимость (
p-value) и точность оценки (
доверительный интервал). Помните: корреляция — не причинно-следственная связь!
Какой пост сделать следующим?
👍 — если хотите разобраться, как проверить распределение на нормальность: виды анализов (Шапиро-Уилка, Колмогорова-Смирнова, хи-квадрат), их особенности и визуализация в R
🔥 — если вам интересно, что значат такие коэффициенты как R², SSR, RMSE, AIC в регрессии, как их считать и интерпретировать, и в чем их ключевые различия.
Что вам интереснее? Сможете рассчитать доверительный интервал для коэффициента корреляции? Пишите в комментарии!
#корреляционный_анализ #регрессионный_анализ #Полезное_педометрикаДОП
Использован материал из практикума Мешалкиной Ю.Л. (
https://sites.google.com/site/soilsstatistics/geography)