CLIP-embeddings — семантический поиск изображений

★ 6.8 · general

clip-aware-embeddings — это скилл для Claude Code, который выполняет семантическое сопоставление изображений и текста с помощью CLIP и знает, когда стоит переключиться на альтернативные модели. Скилл активируется на запросы об «image similarity», «semantic search», «zero-shot classification» и «embeddings», а встроенное дерево решений направляет к нужному инструменту: CLIP — для поиска похожих изображений и широких категорий, DETR/Faster R-CNN — для подсчёта объектов, специализированные модели — для распознавания лиц или автомобильных марок, GQA/SWIG — для пространственных отношений, PC-CLIP/DCSMs — для композиционных запросов. Для работы устанавливаются transformers, pillow, torch и sentence-transformers; при необходимости задействуются MCP-интеграции с Firecrawl и Hugging Face. Подходит разработчикам и ML-инженерам, которым нужен готовый шаблон кода для image-text matching без ошибочного применения CLIP там, где он даёт нерелевантные результаты.