Оптимизация Apache Spark jobs
★ 8.5 · data
spark-optimization — это скилл для Claude Code, который оптимизирует Apache Spark jobs с помощью партиционирования, кэширования, оптимизации shuffle и тонкой настройки памяти. Скилл охватывает ключевые паттерны производственного уровня: стратегии партиционирования, управление памятью executor, работу с перекосом данных (data skew) через salting и broadcast-джойны, а также настройку Adaptive Query Execution. Внутри — готовый шаблон SparkSession с AQE, Kryo-сериализацией и оптимальными параметрами shuffle, плюс таблица факторов влияния на производительность. Подходит инженерам данных, которые отлаживают медленные Spark-пайплайны, масштабируют обработку больших датасетов или снижают нагрузку на сеть при широких трансформациях.
- #apache-spark
- #performance-optimization
- #spark-tuning
- #data-processing
- #distributed-computing