nanoGPT — обучение трансформера с нуля

★ 7.7 · learning

nanogpt — это скилл для Claude Code, который реализует GPT-архитектуру в ~300 строках кода для изучения трансформеров с нуля. Скилл воспроизводит GPT-2 (124M параметров) на датасете OpenWebText и поддерживает три режима работы: обучение символьной модели на Shakespeare (занимает ~5 минут на CPU), полноценное воспроизведение GPT-2 с multi-GPU через DDP (8× A100, ~4 дня), и дообучение на базе готовых весов OpenAI (gpt2, gpt2-medium, gpt2-large, gpt2-xl). Код разделён на два файла — model.py и train.py — без лишних абстракций, на чистом PyTorch с зависимостями torch, transformers, datasets, tiktoken и wandb. Подходит всем, кто хочет разобраться во внутреннем устройстве GPT, поэкспериментировать с вариантами архитектуры или обучить собственную модель на произвольном текстовом датасете.