Zettelkasten

음성 AI 학습 입력은 인식·분석은 16kHz, 합성·대화는 24kHz 모노로 수렴한다

·수정 1회

요약

  • 음성 AI에 "표준 bps"는 없고, 사실상 표준은 샘플레이트·채널이다. 인식·분석은 16kHz 모노, 합성·대화 생성은 24kHz 모노로 모인다.
  • 원본 파일은 대부분 MP3·AAC·Opus 같은 손실 압축이다. 학습 직전에 PCM으로 풀고 리샘플하므로 저장 포맷은 학습 표준이 아니다.
  • 비트 깊이와 원본 코덱은 논문 대부분이 밝히지 않는다. 밝힌 곳은 16bit다.

본문

용도별 입력 스펙

용도 모델 입력 대표 사례
인식(ASR) 16kHz 모노, log-Mel 80 또는 128 bin, 10ms hop Whisper(30초 청크, v3부터 128 bin), FireRedASR, Parakeet·Canary
분석·이해 16kHz 모노 wav2vec 2.0·HuBERT·WavLM(Libri-Light 16kHz), Qwen2-Audio, Qwen3-Omni, pyannote
합성(TTS) 24kHz 모노 16bit, 3~30초 클립 Emilia(24kHz), F5-TTS, CosyVoice 2/3, MaskGCT
대화·생성 24kHz(Mimi 코덱) 또는 16kHz Moshi·J-Moshi(24kHz), DuplexChat(16kHz)
  • 16kHz(나이퀴스트 8kHz)면 음성 인식에 필요한 정보는 거의 다 담긴다. 합성은 음질을 만들어내야 해서 한 단계 올린다.
  • 2026년 TTS는 16kHz로 인코딩하고 48kHz로 복원하는 방향도 나온다(VoxCPM2).

인코더 출력 프레임레이트는 계속 낮아진다

  • 자기지도 표현 모델: 약 50Hz(20ms)
  • Qwen2-Audio: 25Hz
  • Kimi-Audio, Qwen3-Omni, Mimi, GLM-4-Voice: 12.5Hz

LLM에 붙이는 모델일수록 시퀀스 길이를 줄이려고 더 강하게 압축한다.

원본은 대부분 손실 압축이다

데이터셋 원본 → 배포
LibriSpeech·Libri-Light·LibriTTS·LJSpeech LibriVox MP3 → FLAC/WAV
Common Voice 48kHz MP3(브라우저 녹음)
GigaSpeech Opus로 배포(오디오북·팟캐스트·유튜브)
VoxCeleb2 유튜브 → m4a(AAC)
Emilia 영상·팟캐스트 → MP3

FLAC/WAV로 배포돼도 손실 원본을 변환한 것이다. 스튜디오에서 무손실로 녹음한 대표는 VCTK(96kHz/24bit로 녹음한 뒤 48kHz/16bit로 배포)다.

용도별 저장 판단

  • 인식·분석용: 손실 압축 잡음의 영향이 작다. Opus로 보관해도 업계 관행과 같다(GigaSpeech).
  • 합성·생성용: 모델이 압축 잡음까지 배울 수 있다. 무손실 원본이 좋고, 손실 원본이면 Emilia처럼 음량 정규화·목소리 분리·DNSMOS 필터를 거친다.

미검증

  • Qwen3-TTS의 24kHz는 초록에서만 확인했다.
  • 각 데이터셋의 비트 깊이는 대부분 원문에 없다.

관련 노트

참고