WaterCrawl — сбор и парсинг данных с сайтов
★ 2K
WaterCrawl — это открытый инструмент обхода сайтов и извлечения данных, который вы разворачиваете у себя. Его берут, когда нужно собирать содержимое веба регулярно и управляемо: наполнить базу знаний, вытащить каталоги и статьи, готовить данные для моделей. Настраивается глубина и скорость обхода, есть несколько уровней детализации сбора — от беглого до глубокого. Построен на связке Python, Django, Scrapy и Celery, поэтому справляется с большими объёмами и работает по расписанию. Отличие от простого скрейпера — это готовый сервис с очередью задач и интерфейсом, а не библиотека, которую нужно обвязывать самому. Как и с любым сбором данных, соблюдайте условия использования сайтов и законы о персональных данных — ответственность за это на пользователе.
- #Analytics