Automatic Speech Recognition (ASR) / Nhận dạng Giọng nói Tự động
📖 Automatic Speech Recognition (ASR)
Definition (English):
ASR converts spoken language into text. Modern ASR uses end-to-end deep learning: encoder-decoder architectures with CTC or attention-based decoding (Whisper, Conformer). ASR handles multiple languages, accents, background noise, and conversational speech. Key metrics: Word Error Rate (WER), Character Error Rate (CER). Applications: transcription, voice assistants, subtitle generation.
📖 Nhận dạng Giọng nói Tự động
Định nghĩa (Tiếng Việt):
ASR chuyển đổi ngôn ngữ nói thành văn bản. ASR hiện đại sử dụng học sâu đầu cuối: kiến trúc encoder-decoder với CTC hoặc giải mã dựa trên attention (Whisper, Conformer). ASR xử lý đa ngôn ngữ, phương ngữ, tiếng ồn nền và nói chuyện. Chỉ số chính: Tỷ lệ Lỗi Từ (WER), Tỷ lệ Lỗi Ký tự (CER). Ứng dụng: phiên âm, trợ lý giọng nói, tạo phụ đề.
📂 Phân loại: Speech & Audio