SAELens — обучение разреженных автокодировщиков
★ 7.7 · ai-tooling
saelens — это скилл для Claude Code, который помогает обучать и анализировать разреженные автокодировщики (SAE) с помощью библиотеки SAELens для разложения активаций нейросетей на интерпретируемые признаки. Скилл опирается на исследования Anthropic по моносемантичности: в работе «Towards Monosemanticity» 70% признаков, обнаруженных SAE, оказались интерпретируемыми — среди них структуры ДНК, юридический язык, HTTP-запросы и грамматические конструкции. Поддерживаются два основных сценария: загрузка готовых SAE (например, gpt2-small-res-jb) и обучение собственных с настройкой архитектуры (standard, gated, topk), коэффициента разреженности и других гиперпараметров. Зависимости — sae-lens>=6.0.0, transformer-lens>=2.0.0, torch>=2.0.0. Подходит исследователям, изучающим суперпозицию, геометрию признаков, управление активациями и безопасность моделей через анализ концепций.
- #sparse-autoencoders
- #sae
- #interpretability
- #feature-discovery