Policy Gradient / Gradient Chính sách

✍️
Từ điển và thuật ngữ trí tuệ nhân tạo

📖 Policy Gradient

Definition (English):

Policy gradient methods directly optimize the policy (mapping from states to actions) by ascending the gradient of expected reward. REINFORCE is the simplest policy gradient algorithm. Variance reduction techniques (baseline, advantage estimation) improve stability. Policy gradient methods handle continuous action spaces naturally and are used in robotics and game AI.


📖 Gradient Chính sách

Định nghĩa (Tiếng Việt):

Phương pháp gradient chính sách trực tiếp tối ưu hóa chính sách (ánh xạ từ trạng thái đến hành động) bằng cách đi lên gradient của phần thưởng kỳ vọng. REINFORCE là thuật toán gradient chính sách đơn giản nhất. Kỹ thuật giảm phương sai (baseline, advantage estimation) cải thiện độ ổn định. Phương pháp gradient chính sách xử lý không gian hành động liên tục tự nhiên và được sử dụng trong robot học và AI trò chơi.


📂 Phân loại: RL Tech

HỆ SINH THÁI CiCC

Đi tiếp cùng nội dung này

Hỏi AI Edu?