Zettelkasten
Search
⌘K
Graph
Tags
#
dataset
3개
음성 AI 학습 입력은 인식·분석은 16kHz, 합성·대화는 24kHz 모노로 수렴한다
1,905자
speech-ai
audio
signal-processing
dataset
음성 대화 모델의 실제 2인 대화 데이터는 Fisher 약 2,000시간이 사실상 전부다
1,632자
speech-ai
dataset
full-duplex
spoken-dialogue
음성 인식 학습 데이터는 사람 전사 20만 시간이 한계라 의사라벨로 수천만 시간까지 늘린다
1,948자
speech-ai
dataset
asr
tts