-
어린이 방송 음성/맥락 데이터 : 20,000건의 WAV와 JSON 형식으로 구성
-
카테고리 : 미취학 아동 발달 교육, 어린이 교육, 어린이 드라마, 어린이 예능
-
대화 주체 : 어린이 <-> 성인 (약 96%), 어린이 <-> 어린이 (약 4%)로 구성
-
카테고리 중 어린이 예능 음성/맥락 데이터 셋 활용
-
자연스러운 언어 사용 패턴과 감정을 잘 반영할 수 있을 것 같아 선정
-
130건의 WAV와 JSON 파일을 활용
-
Whisper는 특이한 액센트나 강한 배경 소음과 같은 어려운 환경에서 효과적으로 음성을 인식할 수 있는 능력을 갖추고 있음
-
어린이 예능의 경우 배경 음악이 깔리는 경우가 많아 , Whipser 모델이 적합하다고 생각
-
다국어를 지원하는 모델 ( 한글 지원 )
'하였습니다'라는 한 단어는 '하', '였', '습니다'라는 세 개의 형태소로 구성되어 있다.
만약 '하였습니다'를 '했습니다'로 인식한다면, 단어 단위로 보면
완전히 다른 단어로 인식한 것이므로 오류율은 100%가 된다.
(S + D + I) / N = (S + D + I) / (S + D + C) = (1 + 1 + 0) / (1 + 1 + 3) = 0.4 즉, 40%가 된다.
'하였습니다'의 '하'를 '했'으로 대체하면 대체(S)가 1회 발생
그리고 '였'이 삭제되어야 하므로 삭제(D)도 1회 발생
추가로 삽입되는 문자(I)는 없음
따라서 정확한 문자 수(C)는 '습', '니', '다'인 3개의 문자가 정확하게 대응됨