TransformerLens — механистическая интерпретируемость трансформеров
★ 7.7 · research
transformer-lens — это скилл для Claude Code, который предоставляет руководство по исследованию механистической интерпретируемости с использованием библиотеки TransformerLens: инспекции и манипуляции внутренними структурами трансформеров через HookPoints и кэширование активаций. Библиотека создана Neel Nanda, поддерживается Bryce Meyer и набрала более 2900 звёзд на GitHub — де-факто стандарт для анализа GPT-подобных языковых моделей. Скилл помогает проводить activation patching и causal tracing, изучать паттерны внимания, анализировать схемы (induction heads, IOI circuit) и применять direct logit attribution; поддерживается более 50 моделей — GPT-2, LLaMA, Mistral, Pythia, Gemma и другие. Подходит исследователям, которые реверс-инжинирят алгоритмы, возникшие в процессе обучения, и хотят понять, как нейросеть принимает решения.
- #transformer-interpretability
- #mechanistic-interpretability
- #activation-analysis
- #neural-network-analysis
- #gpt-model-inspection