TransformerLens — механистическая интерпретируемость трансформеров

★ 7.7 · research

transformer-lens — это скилл для Claude Code, который предоставляет руководство по исследованию механистической интерпретируемости с использованием библиотеки TransformerLens: инспекции и манипуляции внутренними структурами трансформеров через HookPoints и кэширование активаций. Библиотека создана Neel Nanda, поддерживается Bryce Meyer и набрала более 2900 звёзд на GitHub — де-факто стандарт для анализа GPT-подобных языковых моделей. Скилл помогает проводить activation patching и causal tracing, изучать паттерны внимания, анализировать схемы (induction heads, IOI circuit) и применять direct logit attribution; поддерживается более 50 моделей — GPT-2, LLaMA, Mistral, Pythia, Gemma и другие. Подходит исследователям, которые реверс-инжинирят алгоритмы, возникшие в процессе обучения, и хотят понять, как нейросеть принимает решения.