Комиссия по педометрике ДОП


Гео и язык канала: не указан, не указан
Категория: не указана



Гео и язык канала
не указан, не указан
Категория
не указана
Статистика
Фильтр публикаций


Что вы используете для статистической обработки (и визуализации) данных? Можно выбрать несколько вариантов и написать в комментариях программы, которыми вы пользуетесь, и которые не попали в опрос) #опросы_педометрики
Опрос
  •   R (например, в оболочке R-studio и др.)
  •   Python 🐍 (питон)
  •   STATISTICA
  •   Excel (кажется, в эксель таблицах хранится большинство данных))
  •   Визуализация отдельно, в специальных программах (coreldraw/illustrator/canva/paint/photoshop и др.)
  •   Работаю с картографическими данными, обработка в ГИС (Qgis/Arcgis/MapInfo/SAGA/Global Mapper и др.)
28 голосов


От классической ANOVA к PERMANOVA: как сравнивать группы, когда данные "слишком разбросаны"

Всем прекрасен дисперсионный анализ (ANOVA), который позволяет сравнивать средние значения двух или более групп, оценивая, насколько дисперсия между группами превышает дисперсию внутри групп, и статистически проверять эту разницу с помощью F-критерия.

Но есть в нём и недостатки, а именно — условия применимости (допущения):

- Нормальность распределения
- Однородность дисперсий в группах по градациям фактора(ов).
- Независимость наблюдений.

С первым пунктом (нормальность) можно бороться работать различными способами: данные можно преобразовать и не забывать вернуть как было (рис.1), использовать различные тесты проверки на нормальность (рис.2) или, в крайнем случае, применить ANOVA на рангах (ANOVA on ranks) — непараметрический аналог, где сравниваются не исходные значения, а их ранги.

Однако нарушение однородности дисперсий часто становится непреодолимым барьером для классического ANOVA. Для однофакторного случая в такой ситуации традиционно используется непараметрический критерий Краскела-Уоллиса (Kruskal-Wallis). Он также работает с рангами всех наблюдений и проверяет гипотезу о том, что выборки происходят из одного распределения, или что медианы групп равны (рис. 3 - картинка из Википедии).

❓ Но что делать, если у вас:

- Многомерные данные (например, данные по видовому составу сообществ)?
- Сложные дизайны с несколькими фиксированными и случайными факторами?
- Нетипичные данные, с высоким разбросом значений (например, если один из ваших параметров - потоки CO2))?

Здесь на сцену выходит PERMANOVA (Permutational* Multivariate Analysis of Variance).
*Слово permutational здесь и далее будет переведено как "перестановочный", так как автор не уверен в корректности применения слова "перматуционный", какое-то оно менее интуитивно понятное 👀

PERMANOVA — это непараметрический многомерный перестановочный тест, предназначенный для сравнения групп объектов. Его ключевая идея — проверить нулевую гипотезу о том, что центроиды и дисперсия групп в выбранном метрическом пространстве (например, в пространстве каких-либо расстояний) эквивалентны.

Проще говоря: PERMANOVA отвечает на вопрос: "Различаются ли группы по своему многомерному 'составу'?".

Основа метода — матрица расстояний. В отличие от классической ANOVA, которая работает с исходными данными, PERMANOVA начинает с вычисления матрицы попарных расстояний между всеми объектами исследования. Это может быть расстояние Брея-Кёртиса (для экологических данных), UniFrac (для микробиомных данных) или любая другая подходящая для вашего исследования мера.

На основе этой матрицы расстояний вычисляются привычные из ANOVA компоненты дисперсии:

- Общая сумма квадратов (SStotal) — общее многомерное варьирование.
- Сумма квадратов внутри групп (SSwithin) — варьирование внутри каждой группы.
- Сумма квадратов между группами (SSbetween) — варьирование, объяснённое фактором (разницей между группами).

Перестановочный F-тест. Строится псевдо-F статистика, аналогичная F-отношению в ANOVA:
F = (SSbetween / (число групп - 1)) / (SSwithin / (число объектов - число групп))
Но здесь главный трюк! Мы не смотрим это значение в таблице F-распределения (которое предполагает нормальность). Вместо этого, мы многократно перемешиваем (переставляем) метки групп между объектами, каждый раз заново вычисляя псевдо-F для перемешанных данных.

Оценка значимости. P-value определяется как доля перестановок, в которых полученное значение F оказалось больше или равно фактическому значению F, вычисленному для настоящих групп.
P = (число перестановок, где Fпер ≥ Fнабл) / (общее число переставлений)

Преимущества PERMANOVA:

- Не требует нормальности и однородности дисперсий (хотя чувствителен к последней — различия в дисперсии между группами могут влиять на результат).
- Работает с любыми данными, для которых можно определить меру расстояния.

Краткий итог представлен на рис.4
Остались вопросы? Пишите в комментариях!

#Дисперсионный_анализ #Полезное_педометрикаДОП


Уже завтра в 17:00 в аудитории М-1 состоится защита кандидатской диссертации Добровольской Валерии Андреевны на тему:

«Оценка потенциала секвестрации углерода пахотными почвами ряда областей Европейской территории России»

📍 Место: МГУ, биолого-почвенный корпус, ауд. М-1.
📅 Дата и время: 9 декабря 2025 г. (вторник), 17:00.
🎓 Специальность: 4.1.3. Агрохимия, агропочвоведение, защита и карантин растений.

Исследование Валерии Андреевны — это важный вклад в понимание роли сельского хозяйства в борьбе с изменением климата:

🌱 Оценен потенциал пахотных почв нескольких регионов России к поглощению углерода из атмосферы.

📊 С использованием модели RothC показано, как внедрение углеродсберегающих практик влияет на скорость секвестрации.

🎯 Работа проверяет осуществимость международных инициатив «4 промилле» и «2 промилле». Результаты — на защите!

🇷🇺 Доказано, что расчёты на основе статистики Росстата дают более точные и детальные оценки, выявляя значительную пространственную неоднородность.

Приглашаются все желающие! ↗️

Соискатель: Добровольская Валерия Андреевна (МГУ)
Научный руководитель: Мешалкина Юлия Львовна, к.с.-х.н., доц. (МГУ)
Оппоненты: Романовская А.А., Семёнов В.М., Рыжова И.М.

#Доклады_педометрикаДОП


Вы знаете, что такое PERMANOVA? ❤ на пост и мы расскажем больше про этот анализ! #опросы_педометрики
Опрос
  •   Конечно знаю! Я (или мои коллеги) использую его в своих работах (и могу прислать ссылку на статьи)
  •   Слышал(а) что-то такое, но ясного представления нет, какая-то ANOVA видимо..
  •   Впервые слышу!
21 голосов


Репост из: Факультет почвоведения МГУ
⚡️ Возможности инфракрасной спектрометрии для оценки химических свойств почвы

Уважаемые коллеги!
👩‍🎓 Секция сельскохозяйственных наук Центрального Дома ученых РАН и Общество почвоведов им. В.В.Докучаева приглашают вас 2 декабря (вторник) 2025 г., в 18:30 часов в Зеленую гостиную на заседание по теме:
 
Возможности инфракрасной спектрометрии 
для оценки химических свойств почвы
 
⚗️ Доклад кандидата биологических наук, научного сотрудника лаборатории органического вещества и биохимии почв ФИЦ «Почвенный институт им. В.В. Докучаева» Игоря Вячеславовича Данилина.
 
Адрес: Пречистенка,16 (ст. м. «Кропоткинская»)

#факультет_почвоведения #МГУ #жизнь_почвы


Уже завтра!


R², скорректированный R² и MEC

В продолжение темы количественных критериев оценки моделей рассмотрим подробнее коэффициент детерминации R², который мы немного проскочили мимо, его скорректированную версию и коэффициент эффективности модели (MEC).

На рис.1 представлена таблица дисперсионного анализа в общем виде, она поможет понять некоторые термины. На рис.2 представлен пример дисперсионного анализа при проверке возможности проведения регрессионного анализа при помощи F-критерия. В качестве предикторов выступают почвенные свойства, а в качестве зависимой переменной - урожайность.

R² представляет собой долю дисперсии зависимой переменной, объясненную моделью.

Формулы расчета:

Общий случай:
R² = 1 - SS_res / SS_tot = 1 - Cw / Ct
где:
SS_res = Σ(y_i - ŷ_i)² — сумма квадратов остатков (необъясненная дисперсия Cw).
SS_tot = Σ(y_i - ȳ)² — общая сумма квадратов (общая дисперсия Ct).

yᵢ — Наблюдаемое значение
ŷᵢ — Предсказанное значение
ȳ — Выборочное среднее

Интуитивно понятна и следующая запись:
R² = SS_reg / SS_tot = Ca / Ct
где SS_reg = Σ(ŷ_i - ȳ)² — объясненная сумма квадратов Ca.

Главный недостаток: значение R² не может уменьшиться при добавлении в модель новых предикторов, даже если они статистически незначимы (рис.2). Также он чувствителен к выбросам и сам по себе не говорит о величине ошибки прогноза.

Основы концепции регрессионного анализа заложил Фрэнсис Гальтон в 1870-х. Термин «дисперсия» и формальное обоснование связи коэффициентов корреляции и детерминации принадлежат Рональду Фишеру и Карлу Пирсону. Критика в адрес R² за рост при добавлении переменных привела к появлению скорректированного R², предложенного Анри Тейлом в 1961 году.

Скорректированный R² (R²_adj) учитывает число параметров модели *k* и объем выборки *n*.

Формула:
R²_adj = 1 - [ (SS_res / (n - k)) / (SS_tot / (n - 1)) ] = 1 - (1 - R²) * [(n - 1) / (n - k)]
где: n - k и n-1 - это число степеней свободы, по таблице запись можно представить так:

R²_adj = 1 - (Cw / Vw) / (Ct / Vt) = 1 - Qw/Qt

Скорректированный R-квадрат увеличивается только в том случае, если новый предиктор улучшает модель больше, чем можно было бы ожидать случайно, позволяет сравнивать модели с разным количеством предикторов. Однако, при таком подходе теряется строгая интерпретация R-квадрат как «доли дисперсии».

MEC (Modelling Efficiency Coefficient / Nash-Sutcliffe Model Efficiency Coefficient)

Используемый в почвоведении и гидрологии коэффициент, оценивает, насколько модель превосходит по точности простое предсказание средним значением.

Формула:
MEC = 1 - [ Σ(y_i - ŷ_i)² / Σ(y_i - ȳ)² ]

Интерпретация:
MEC = 1: Идеальное соответствие.
MEC = 0: Качество модели сопоставимо с предсказанием средним значением (ȳ).
MEC < 0: Модель предсказывает хуже, чем простое среднее.

Наблюдательный читатель заметит, что эта формула в точности повторяет формулу R², так в чём же дело?

Коэффициент MEC пришёл к нам из гидрологии, где известен как Nash–Sutcliffe model efficiency coefficient (NSE) (Коэффициент эффективности модели Нэша — Сатклиффа) и используется, когда можно наблюдать дисперсии ошибки смоделированного временного ряда к дисперсии наблюдаемого временного ряда. В общем, детективная история в формате скриншотов представлена на рисунке 3. И да, отвечая внимательному читателю, при использовании NSE (=MEC) в регрессионном анализе (т. е. когда общая сумма квадратов может быть разделена на компоненты ошибки и регрессии) эффективность Нэша — Сатклиффа эквивалентна коэффициенту детерминации (R²) и, следовательно, находится в диапазоне от 0 до 1.

Считается, что MEC устойчив к систематическим ошибкам (завышениям и тд, сдвигам) в моделировании.

Для всесторонней оценки модели рекомендуется использовать эти метрики вместе с визуализацией остатков и другими критериями (AIC, BIC, RMSE). Об этом подробнее написано выше :)

#моделирование #регрессионный_анализ #Полезное_педометрикаДОП


Количественные критерии оценки моделей

Регрессионный анализ используется для моделирования связи между зависимой переменной (откликом Y) и одной или несколькими независимыми переменными (предикторами X1, X2,...Xn). Текст ниже будет посвящен обзору коэффициентов проверки качества моделей, регрессионный анализ взят для примера, в принципе это можно применить к моделированию в целом.

R² — это множественный коэффициент корреляции (максимальное значение простого коэффициента корреляции между Y и линейной комбинацией X1, X2, ... Xn), помноженный сам не себя :Р Показывает долю дисперсии зависимой переменной, объяснённой моделью.
Интерпретация: изменяется от 0 до 1; чем ближе к 1, тем лучше модель описывает данные.
Ограничения: Чувствителен к выбросам; Растёт при добавлении любых предикторов, даже незначимых; Не показывает величину ошибки.

Как узнать эту самую ошибку? Вспомним про остатки:
Остатки (Residuals) - разность между наблюдаемыми и предсказанными значениями. По ним проверяется адекватность модели, обнаруживаются выбросы, нелинейность, гетероскедастичность.

Требования к остаткам:
Нормальное распределение (с параметрами 0 и 1).
Независимость от предикторов и предсказанных значений.
Гомоскедастичность (постоянная дисперсия).

Краткий экскурс по коэффициентам:

Adjusted R² - R² с поправкой на число предикторов, используется для сравнения моделей с разным числом переменных.
ME (средняя ошибка - среднее арифметическое остатков), Сумма остатков - эти величины помогают найти систематическое завышение или занижений моделью предсказанных значений. Может быть положительным или отрицательным, не устойчив к выбросам, обычно где-то около нуля.
MAE (средняя абсолютная ошибка) - модуль средней ошибки.
MAD (Медианное абсолютное отклонение) - альтернатива MAE для данных с выбросами.
RMSE (Среднеквадратическая ошибка) - используется чаще всего.
MAPE (Средняя абсолютная процентная ошибка) - используется для интерпретации в %; не подходит, если есть нулевые значения Y. (тогда берут sMAPE версию для нулевых значений).
MSE, nRMSE - производные и нормированные (на Y) значения RMSE, удобны для сравнения моделей, убирают влияние единиц измерения (шкал) данных на результат.
SSE (Сумма квадратов ошибок) - хорошо работает, если ошибки распределены нормально, но чувствителен к выбросам.
SAE (Сумма абсолютных ошибок) - устойчив к выбросам и длинным хвостам, распределению отличному от нормального, в некоторых случаях может быть менее информативным по сравнению с SSE, если необходимо учитывать вес больших отклонений.
WI (Индекс согласия Уиллмотта; Willmott index of agreement) - был введён для устранения некоторых ограничений других метрик ошибок. Диапазон значений WI от 0 до 1; значение 1- совпадение предсказанных и фактических значений; Безразмерный.

Учёт сложности модели (Дабы они не были слишком шумными с кучей лишних предикторов, немного увеличивающих R²)
AIC (Информационный критерий Акаике) - метрика, разработанная японским статистиком Хиротугу Акаике (Hirotugu Akaike) в 1970 году. Основная идея AIC заключается в том, чтобы наказывать за включение в модель дополнительных переменных. Чем ниже значение AIC, тем лучше модель.
AICc (Скорректированный AIC) - для малых выборок
BIC (Байесовский информационный критерий) - Строже AIC; штрафует за сложность.

✅ Обязательно указывать:
R² и Adjusted R² — для объяснённой дисперсии. RMSE или MAE — для величины ошибки. AIC или BIC — для учёта сложности модели. MAD, SAE — если в данных есть выбросы.
❌ Не использовать:
Только R² (может давать завышенную оценку) или только RMSE (чувствителен к выбросам).

Дополняйте численные метрики визуализацией (остатки, графики предсказаний). Всегда указывайте формулу расчета коэффициента и ссылку на работу, в которой она приводится. Не забывайте сравнивать ошибки вашего моделирования с естественным разбросом. А то вдруг у вас на самом деле всё хорошо, а вы расстраиваетесь из-за каких-то там коэффициентов 🐸

#моделирование #регрессионный_анализ #Полезное_педометрикаДОП




Предыдущий пост не отвечает на главный вопрос — значимость коэффициента, даже 0.9. Для чего нужно указывать объём выборки?

Представьте, что вы измерили урожайность пшеницы и содержание гумуса на двух полях.

Поле 1: R = 0.99 (выборка n=2).
Поле 2: R = 0.6 (выборка n=1000).

В какой ситуации вы больше уверены, что связь действительно существует, а не стала результатом случайного стечения обстоятельств? Очевидно, во второй.

Объём выборки (n) — это ключ к статистической значимости. Чем больше выборка, тем «увереннее» статистика и тем меньшее значение R требуется для достижения значимости.

Например, по таблице (рис.2):

При n=12 даже коэффициент R=0.55 не будет статистически значимым на уровне p < 0.05.
При n=100 для значимости уже достаточно R=0.20.
Об ограничениях этого подхода в эпоху big data писали в предыдущем посте (!)

Вот почему в научных статьях всегда требуют указывать и R, и n, и p-value.

Как подтвердить значимость и надежность R? Рассчитайте доверительный интервал.

Точечная оценка R (например, 0.9) — это наше лучшее предположение. Но насколько оно точно? Доверительный интервал (ДИ) показывает диапазон, в котором с заданной вероятностью (обычно 95%) находится истинное значение коэффициента корреляции в генеральной совокупности.

Узкий ДИ (например, от 0.85 до 0.93) говорит о высокой точности оценки.
Широкий ДИ (напр. 0.5, 0.97) — о большой неопределенности, даже если коэффициент значим.
ДИ, включающий ноль (напр. -0.1, 0.8) — прямое указание на то, что связь может не отличаться от нуля, и выводы ненадежны.

Расчет ДИ можно провести вручную в эксель с помощью t-критерия, в программе R или Statistica. Всегда стремитесь указывать доверительный интервал вместе с R.

🧭 Краткая инструкция по корреляционному анализу

1. Визуализируйте данные. Постройте диаграмму рассеяния (scatterplot). Это поможет оценить линейность связи и выявить очевидные выбросы.

2. Проверьте нормальность распределения. Для корректного применения коэффициента Пирсона данные должны быть аппроксимированы нормальным распределением.

3. Выберите коэффициент. Если данные нормальны и связь линейна — используйте параметрический коэффициент Пирсона. Если есть отклонения от нормальности или есть выбросы — используйте непараметрический коэффициенты Спирмена или Кендалла.

4. Рассчитайте коэффициент и проверьте его значимость. Используйте статистические пакеты. Они выдадут вам значение коэффициента, p-value и, часто, доверительный интервал.

5. Интерпретируйте результат. Учитывайте не только силу связи, но и ее статистическую значимость (p-value) и точность оценки (доверительный интервал). Помните: корреляция — не причинно-следственная связь!

Какой пост сделать следующим?

👍 — если хотите разобраться, как проверить распределение на нормальность: виды анализов (Шапиро-Уилка, Колмогорова-Смирнова, хи-квадрат), их особенности и визуализация в R

🔥 — если вам интересно, что значат такие коэффициенты как R², SSR, RMSE, AIC в регрессии, как их считать и интерпретировать, и в чем их ключевые различия.

Что вам интереснее? Сможете рассчитать доверительный интервал для коэффициента корреляции? Пишите в комментарии!

#корреляционный_анализ #регрессионный_анализ #Полезное_педометрикаДОП

Использован материал из практикума Мешалкиной Ю.Л. (https://sites.google.com/site/soilsstatistics/geography)


Какие ошибки или неточности в статьях встречались вам чаще всего?
Опрос
  •   Нарушение единообразия временных и пространственных масштабов в экспериментальных данных
  •   Безповторностные эксперименты
  •   Некорректное сравнение данных из разных условий без учета контекста (например, разные почвы/климат)
  •   Игнорирование неоднородности почвенных свойств в пространстве и времени при сборе и анализе данных
27 голосов


r = 0.9. И что с того?

Коэффициент корреляции Пирсона (the Pearson correlation coefficient (PCC)) является мерой линейной статистической связи между двумя непрерывными переменными. Он вычисляется как стандартизованная ковариация (рис.3). Это, без преувеличения, краеугольный камень количественного анализа в эмпирических исследованиях. Несмотря на его повсеместное использование, понимание его ограничений часто остается за кадром.

Ключевые предпосылки для корректного применения:

📈 Линейность взаимосвязи.
📊 Нормальное распределение. Данные для обеих переменных должны быть распределены нормально (или приближены к нормальности), особенно при проверке статистической гипотезы о значимости коэффициента.
🔍 Отсутствие значимых выбросов. Их наличие может критически искажать значение r (рис.4).
🧮 Также не забывайте указывать объём вашей выборки.

Сильные стороны
- Шкала от -1 до +1 универсальна и понятна. Отсутствие линейной связи равно нулю (рис.1).
- При соблюдении условий применимости является наиболее мощным критерием для обнаружения линейной связи.
- Служит основой для более сложных многомерных моделей, включая множественный регрессионный анализ, где понимание парных корреляций — первый шаг к построению качественной модели.

Частые ошибки интерпретации ⚠️
Causation ≠ Correlation. Это аксиома, однако на практике ей часто пренебрегают. Наблюдаемая ковариация может быть обусловлена:
- Присутствием скрытой (латентной) переменной. Например, жаркая погода влияет на рост числа солнечных ожогов и потребления мороженного.
- Обратной причинно-следственной связью. Исследователь может думать, что чрезмерное потребление кофе вызывает нервозность. Но, может быть, очень нервный человек выпивает кофе, чтобы успокоить свои нервы?
- Случайным совпадением.

"Слепота" к нелинейным паттернам. Нулевое или близкое к нулю значение r не означает отсутствие зависимости. Связь может быть сильной, но нелинейной (квадратичной, периодической и т.д.).

Чувствительность к выбросам. Одно аномальное наблюдение может как создать иллюзию сильной связи, так и маскировать существующую. Непараметрические аналоги могут быть предпочтительнее в условиях "загрязненных" данных.

Ошибочное применение к порядковым данным. Использование r для ранговых шкал методологически некорректно.

❗️ Иллюзия значимости в больших данных.
При очень большом объеме данных (n → ∞) мы почти гарантированно получим "статистически значимый" коэффициент r с ничтожно малым p-value (рис.2). Высокая значимость в таком случае — это не сила связи, а артефакт. В больших данных p-value теряет смысл без визуализации и анализа размера эффекта (effect size).

Практические рекомендации и дальнейший путь
- Всегда начинайте с визуализации. Построение диаграммы рассеяния — первый и обязательный шаг.
- Проверяйте условия применимости - оцените нормальность распределения, независимость переменных и наличие выбросов.
- Не ограничивайтесь значением r. Рассчитывайте и указывайте доверительные интервалы, объём выборки и p-value.
- Помните о "подводных камнях". Корреляция — инструмент для описания, а не для объяснения.

➡️ Что дальше? Логическое развитие анализа:

Если ваши данные не аппроксимируются нормальным распределением или содержат выбросы, закономерным выбором становится непараметрический аналог — коэффициент корреляции Спирмена. Он устойчивее к отклонениям от нормальности и может работать с ранжированными данными.

Для анализа сложных взаимосвязей, где на целевую переменную влияет множество факторов, потребуется переход к множественной регрессии, где парные корреляции являются отправной точкой для отбора предикторов.

В эпоху больших данных доверяйте глазам. Даже при "значимом" r и огромной выборке построение диаграммы рассеяния (scatterplot) — не опция, а необходимость. Именно визуализация покажет, является ли связь хоть сколько-нибудь осмысленной или же это просто статистический артефакт.

#Полезное_педометрикаДОП


LXIX Прянишниковские чтения

🌟 Завтра, 11 ноября (вторник), состоятся LXIX научные чтения, посвящённые 160-летию со дня рождения выдающегося учёного, академика Дмитрия Николаевича Прянишникова.

В программе:
▫️ Доклад-лекция члена-корреспондента РАН Валерия Николаевича Кудеярова
▫️ Тема: «Шестидесятилетняя динамика мобилизационного потенциала азота в пахотных почвах России»

Организаторы:
• Центральный дом ученых
• Общество почвоведов им. В.В. Докучаева
• Институт физико-химических и биологических проблем почвоведения
• Почвенный институт им. В.В. Докучаева

📅 Дата и время: 11 ноября 2025 г., 15:00
📍 Адрес очной встречи: Конференц-зал ФИЦ «Почвенный институт им. В.В. Докучаева», Пыжевский пер. 7, стр. 2 (ст. м. «Третьяковская», «Полянка»)
💻 Онлайн-формат:Мероприятие будет проходить также в Zoom.

Ссылку для подключения можно будет попросить завтра утром в комментариях к этому посту, также она указана в группе "Soil cartography and pedometrics" на почте.

Следите за обновлениями!

⚠️ Убедительная просьба: при регистрации в Zoom указывать свои ФИО.

#Доклады_педометрикаДОП


Случайные и фиксированные факторы
Или как иерархический дисперсионный анализ помогает экономить на повторностях


Почва, как весьма сложный объект для изучения, несёт в себе множество источников варьирования. Вот у вас отобрано множество повторностей, сделана куча аналитики в лаборатории, а результаты всё равно не сходятся. Ведь на ваши данные влияют разные источники вариаций: природные (гетерогенность почв) и технические (погрешность измерений). Чтобы разобраться в этом, ученые используют иерархический дисперсионный анализ (nested ANOVA) .

В экспериментах мы часто работаем с двумя типами факторов (рис.1):

Фиксированные факторы — это переменные, которые мы контролируем и которые имеют конкретные, повторяемые уровни. Например, глубина, как на рисунке слева.

Случайные факторы — это источники случайной вариации, такие как заложенный на участке разрез или прикопка. Их уровни нельзя точно воспроизвести — их влияние случайно, и именно они вносят варьирование в данные.

Допустим, мы изучаем плотность почвы (рис.2). Можно сделать двухфакторный дисперсионный анализ - заложить разрезы на разных частях склона в лесу и на поле, отобрать из них образцы на плотность в некоторой повторности. Так мы узнаем, какой фактор больше влияет на средние значения плотности.

Для поиска источников варьирования плотности почв можно на кажом из двух участков заложить несколько разрезов и также отобрать образцы в некоторой повторности. Так мы сможем узнать, где больше разброс данных - между двумя участками или между разрезами внутри каждого участка.

Особенностью иерархического ДА является то, что дисперсия (=варьирование) в нём соотностится не с дисперсией всей выборки, дисперсия на каждом уровне иерархии соотностится с уровнем ниже (рис.3). Горизонтальными линиями обозначены средние, а голубыми стрелочками - соотношение дисперсий.

Например, в случае с иерархическим анализом: Участок - разрезы - аналитическая повторность отбора плотности (случайная состовляющая), если окажется, что наибольшую дисперсию вносят разрезы, то нужно будет закладывать их большее количество, а не увеличивать повторность отбора образца с трёх до пяти и больше. То есть, увеличивать повторности необходимо на уровне с наибольшим варьированием. Это позволит сохранить высокую мощность критерия не повышая стоимость исследований например за счёт большего числа лабораторных анализов.

В следующих постах мы можем рассказать больше про мощность критерия и его расчет. Или может быть пора переходить на другие виды анализа - регрессионный и кластерный, метод главных компонент? Пишите, какая тема для вас наиболее интересна, и мы постараемся больше рассказать о ней!

Подробнее прочитать про пример использования ИДА можно тут (https://www.nature.com/articles/nmeth.3137#MOESM348)
На картинках использован материал из лекции Мешалкиной Ю.Л. (https://sites.google.com/site/soilsstatistics/ucenikam/zanatia-2-7-2014-1)

#Полезное_педометрикаДОП


Замысел природы: как Докучаев "предвосхитил" регрессионный анализ

В истории науки нередки случаи, когда гениальная интуиция исследователя опережает формальный математический аппарат, который лишь спустя десятилетия даст строгую форму наблюдаемым закономерностям. Яркий пример такого предвидения — работы Василия Васильевича Докучаева, основоположника генетического почвоведения, чьи идеи удивительным образом перекликаются с принципами регрессионного анализа, разработанными в статистике.

От наблюдения к системе
В 1880-х годах Докучаев сформулировал свою знаменитую концепцию почвы как совокупного влияния факторов почвообразования:
«... дневные или близкие к ним горизонты горных пород (все равно каких), которые более или менее естественно изменены взаимным влиянием воды, воздуха и различного рода организмов – живых и мертвых, что сказывается известным образом на составе, структуре и цвете таких продуктов выветривания»

Догадаетесь, откуда цитата 1883 года?

Докучаев интуитивно понял, что за наблюдаемым разнообразием почв скрывается строгая закономерность, определяемая количественным вкладом каждого фактора. В это же время в статистике, благодаря работам Фрэнсиса Гальтона и Карла Пирсона, формировался аппарат регрессионного анализа — метода, позволяющего оценить взаимосвязь между зависимой переменной (в нашем случае — свойствами почвы) и одной или несколькими независимыми переменными (факторами почвообразования). Гальтон, изучая наследственность, открыл феномен «регрессии к среднему» и заложил основы корреляционного анализа. Термин «регрессия» (regression), который он ввёл в 1886 году, изначально описывал биологический феномен, но был обобщён до мощного статистического инструмента.

Докучаев, не будучи математиком, по сути предсказал основную задачу множественной регрессии: найти функцию, которая наилучшим образом описывает зависимость результативного признака от нескольких предикторов. Позже в историю вошла формула, опубликованная в 1941 году в работе "Factors of Soil Formation: A System of Quantitative Pedology", которую сейчас мы знаем как формула Докучаева-Йенни:
s = f(cl, o, r, p, t, ...)

Сегодня геостатистика и машинное обучение, используя принципы, родственные регрессионному анализу, строят цифровые карты почв, предсказывая их свойства на основе данных о рельефе, растительности и климате. История с Докучаевым — это напоминание о том, что глубокое понимание природы часто рождается из целостного, системного взгляда, который затем находит своё строгое математическое выражение.



Показано 16 последних публикаций.

68

подписчиков
Статистика канала