Red Teaming / Đội Red Team
📖 Red Teaming
Definition (English):
Red teaming in AI is the practice of deliberately probing AI systems for vulnerabilities, biases, harmful outputs, or unexpected behaviors before they are deployed. Inspired by cybersecurity red teaming, it involves adversarial testing where experts attempt to make the AI produce harmful, biased, or incorrect outputs. This helps identify risks and improve safety measures before public release.
📖 Đội Red Team
Định nghĩa (Tiếng Việt):
Red teaming trong AI là thực hành cố tình kiểm tra lỗ hổng, thiên vị, đầu ra có hại hoặc hành vi bất ngờ của hệ thống AI trước khi chúng được triển khai. Lấy cảm hứng từ red teaming an ninh mạng, nó liên quan đến thử nghiệm đối kháng trong đó các chuyên gia cố gắng làm cho AI tạo ra đầu ra có hại, thiên vị hoặc sai. Điều này giúp xác định rủi ro và cải thiện biện pháp an toàn trước khi phát hành công khai.
📂 Phân loại: AI Safety
HỆ SINH THÁI CiCC