Очередь ML-экспериментов на удалённых GPU
★ 7.1 · orchestration
experiment-queue — это скилл для Claude Code, который организует SSH-очередь многосидовых и мультиконфигурационных ML-экспериментов на удалённых GPU-серверах с отслеживанием состояния, повторными попытками при OOM и плавными переходами между волнами. Внутри реализован собственный планировщик с опросом каждые 60 секунд, поэтому не нужно оборачивать его в дополнительный cron-цикл — это приведёт к гонкам состояний. Скилл принимает YAML-манифест, Grid-спецификацию или описание на естественном языке, строит список задач и выполняет их параллельно на указанных GPU, соблюдая предусловия (например, наличие чекпоинта учителя перед запуском дистилляции). Каждая задача проходит через конечный автомат: pending → running → completed / failed_oom (с повторной попыткой) / stuck. Подходит для батчей из 10 и более заданий, сеток вида 21 сид × 12 ячеек и цепочек «учитель + студент» — сценариев, где /run-experiment уже недостаточен.
- #experiment-orchestration
- #job-queue
- #multi-seed-sweep
- #gpu-scheduling
- #ml-batch-processing