Model Evaluation / Đánh giá Mô hình

✍️
Từ điển và thuật ngữ trí tuệ nhân tạo

📖 Model Evaluation

Definition (English):

Model evaluation is the systematic process of assessing AI model performance, capabilities, safety, and alignment. It includes standard benchmarks (MMLU, HumanEval, GSM8K), human evaluation, red-teaming, and safety assessments. Comprehensive evaluation frameworks like HELM, lm-evaluation-harness, and OpenAI's evals help compare models across dimensions.


📖 Đánh giá Mô hình

Định nghĩa (Tiếng Việt):

Đánh giá mô hình là quy trình có hệ thống để đánh giá hiệu suất, khả năng, an toàn và căn chỉnh mô hình AI. Bao gồm benchmark tiêu chuẩn (MMLU, HumanEval, GSM8K), đánh giá con người, red-teaming và đánh giá an toàn. Các khung đánh giá toàn diện như HELM, lm-evaluation-harness và evals của OpenAI giúp so sánh mô hình trên nhiều chiều.


📂 Phân loại: Safety+

HỆ SINH THÁI CiCC

Đi tiếp cùng nội dung này

Hỏi AI Edu?