Flash Attention — ускорение трансформеров и экономия видеопамяти

★ 7.7 · ai-tooling

flash-attention — это скилл для Claude Code, который оптимизирует механизм внимания в трансформерах с помощью Flash Attention, обеспечивая ускорение в 2–4 раза и снижение потребления видеопамяти в 10–20 раз за счёт IO-aware tiling и recomputation. Скилл охватывает два основных подхода: нативный PyTorch SDPA (начиная с версии 2.2) и библиотеку flash-attn с расширенными возможностями — поддержкой multi-query attention, скользящего окна (sliding window) и оптимизаций для H100 FP8. Внутри собраны пошаговые рабочие процессы: замена стандартного attention на Flash Attention, принудительное включение бэкенда, бенчмаркинг через torch.utils.benchmark и проверка точности относительно baseline. Зависимости: flash-attn, torch, transformers. Подходит разработчикам и исследователям, которые обучают или запускают трансформеры с длинными последовательностями (>512 токенов) и сталкиваются с нехваткой памяти GPU или медленным инференсом.