Inspect Evals — запуск и разработка оценок LLM

★ 7.6 · vibe-coding

inspect_evals — это скилл для Claude Code, который помогает работать с репозиторием Inspect Evals: коллекцией LLM-оценок для фреймворка Inspect AI, созданной совместно UK AISI, Arcadia Impact и Vector Institute. Репозиторий содержит готовые эвалы для тестирования языковых моделей, устанавливается через `pip install inspect-evals` или `uv sync`, а запуск конкретного эвала выглядит как `uv run inspect eval inspect_evals/arc_easy --model openai/gpt-5-nano`. Поддерживаются провайдеры OpenAI, Anthropic и другие; логи просматриваются командой `inspect view` или через расширение VS Code. Скилл подойдёт исследователям и инженерам, которые занимаются AI safety, бенчмаркингом моделей или хотят добавить собственный эвал в реестр через GitHub issue.