Ray Data — распределённая обработка данных для ML

★ 7.7 · data

ray-data — это скилл для Claude Code, который обеспечивает масштабируемую распределённую обработку данных для ML-задач с потоковым выполнением на CPU и GPU. Поддерживает чтение форматов Parquet, CSV, JSON, изображений и других мультимодальных данных из облачных хранилищ и локальных источников; зависимости включают ray[data], pyarrow и pandas. Скилл интегрируется с PyTorch, TensorFlow, HuggingFace и Ray Train — позволяет строить пайплайны пакетного вывода, предобработки данных и распределённого ETL, масштабируясь от одной машины до сотен узлов кластера. Ключевые операции: map_batches, filter, groupby, repartition, GPU-ускоренные трансформации и стриминговое выполнение для датасетов, превышающих объём оперативной памяти. Подходит ML-инженерам и дата-инженерам, которым нужно обработать датасеты от 100 ГБ и выше без загрузки всего объёма в память.