Zettelkasten
Search
⌘K
Graph
Tags
#
speech-ai
4개
음성 AI 학습 입력은 인식·분석은 16kHz, 합성·대화는 24kHz 모노로 수렴한다
1,905자
speech-ai
audio
signal-processing
dataset
음성 대화 모델의 실제 2인 대화 데이터는 Fisher 약 2,000시간이 사실상 전부다
1,632자
speech-ai
dataset
full-duplex
spoken-dialogue
음성 인식 학습 데이터는 사람 전사 20만 시간이 한계라 의사라벨로 수천만 시간까지 늘린다
1,948자
speech-ai
dataset
asr
tts
통화 녹음의 고음 에너지는 성별보다 AAC 비트레이트 차이가 크게 좌우한다
1,596자
audio
codec
signal-processing
speech-ai