Очередь ML-экспериментов на удалённых GPU

★ 7.1 · orchestration

experiment-queue — это скилл для Claude Code, который организует SSH-очередь многосидовых и мультиконфигурационных ML-экспериментов на удалённых GPU-серверах с отслеживанием состояния, повторными попытками при OOM и плавными переходами между волнами. Внутри реализован собственный планировщик с опросом каждые 60 секунд, поэтому не нужно оборачивать его в дополнительный cron-цикл — это приведёт к гонкам состояний. Скилл принимает YAML-манифест, Grid-спецификацию или описание на естественном языке, строит список задач и выполняет их параллельно на указанных GPU, соблюдая предусловия (например, наличие чекпоинта учителя перед запуском дистилляции). Каждая задача проходит через конечный автомат: pending → running → completed / failed_oom (с повторной попыткой) / stuck. Подходит для батчей из 10 и более заданий, сеток вида 21 сид × 12 ячеек и цепочек «учитель + студент» — сценариев, где /run-experiment уже недостаточен.