Model Evaluation / Đánh giá Mô hình
📖 Model Evaluation
Definition (English):
Model evaluation is the systematic process of assessing AI model performance, capabilities, safety, and alignment. It includes standard benchmarks (MMLU, HumanEval, GSM8K), human evaluation, red-teaming, and safety assessments. Comprehensive evaluation frameworks like HELM, lm-evaluation-harness, and OpenAI's evals help compare models across dimensions.
📖 Đánh giá Mô hình
Định nghĩa (Tiếng Việt):
Đánh giá mô hình là quy trình có hệ thống để đánh giá hiệu suất, khả năng, an toàn và căn chỉnh mô hình AI. Bao gồm benchmark tiêu chuẩn (MMLU, HumanEval, GSM8K), đánh giá con người, red-teaming và đánh giá an toàn. Các khung đánh giá toàn diện như HELM, lm-evaluation-harness và evals của OpenAI giúp so sánh mô hình trên nhiều chiều.
📂 Phân loại: Safety+
HỆ SINH THÁI CiCC