NeMo Evaluator — оценка LLM на 100+ бенчмарках
★ 7.7 · testing
nemo-evaluator — это скилл для Claude Code, который запускает оценку языковых моделей на 100+ бенчмарках из 18+ фреймворков, включая MMLU, HumanEval, GSM8K, GPQA Diamond и safety-тесты. Скилл использует enterprise-платформу NVIDIA NeMo Evaluator SDK с контейнерной архитектурой и поддерживает три бэкенда: локальный Docker, Slurm HPC и облако Lepton. Управление происходит через CLI-команды `nemo-evaluator-launcher run`, `status`, `ls`, `kill` и YAML-конфиги с Hydra; результаты экспортируются в MLflow. Подходит командам ML-инженеров, которым нужно воспроизводимо сравнивать несколько моделей или масштабировать тестирование на HPC-кластере с tensor- и data-параллелизмом.
- #nemo
- #nvidia
- #benchmarking
- #slurm
- #docker
- #distributed-evaluation