Каждый уже, наверное, слышал про SAE — разреженные автоэнкодеры — способные интерпретировать нейронные сети.
Популярность SAE обязаны публикациям исследований от Anthropic. Однако не смотря на весь хайп, с последующими попытками применить и исследовать эти автоэнкодеры возникали сомнения в том, насколько они способны обнаруживать важные и полезные фичи.
Что если на самом деле SAE не обучаются значимым признакам — они лишь немного лучше случайных моделей?
Коллеги показали, что SAE в их текущем виде недостаточно надежны для декомпозиции и понимания внутренних механизмов моделей. Существующие метрики для SAE (reconstruction, interpretability scores, sparse probing, causal editing) недостаточны для оценки того, выучили ли автоэнкодеры полезные и важные фичи.
Также авторы предлагают простые методы проверки, позволяющие убедиться в том, что SAE обучаются осмысленным разложениям признаков, чтобы дополнить их оценку.
Читаем
статью и ставим апвоуты на хф!