요약
- 음성 AI에 "표준 bps"는 없고, 사실상 표준은 샘플레이트·채널이다. 인식·분석은 16kHz 모노, 합성·대화 생성은 24kHz 모노로 모인다.
- 원본 파일은 대부분 MP3·AAC·Opus 같은 손실 압축이다. 학습 직전에 PCM으로 풀고 리샘플하므로 저장 포맷은 학습 표준이 아니다.
- 비트 깊이와 원본 코덱은 논문 대부분이 밝히지 않는다. 밝힌 곳은 16bit다.
본문
용도별 입력 스펙
| 용도 | 모델 입력 | 대표 사례 |
|---|---|---|
| 인식(ASR) | 16kHz 모노, log-Mel 80 또는 128 bin, 10ms hop | Whisper(30초 청크, v3부터 128 bin), FireRedASR, Parakeet·Canary |
| 분석·이해 | 16kHz 모노 | wav2vec 2.0·HuBERT·WavLM(Libri-Light 16kHz), Qwen2-Audio, Qwen3-Omni, pyannote |
| 합성(TTS) | 24kHz 모노 16bit, 3~30초 클립 | Emilia(24kHz), F5-TTS, CosyVoice 2/3, MaskGCT |
| 대화·생성 | 24kHz(Mimi 코덱) 또는 16kHz | Moshi·J-Moshi(24kHz), DuplexChat(16kHz) |
- 16kHz(나이퀴스트 8kHz)면 음성 인식에 필요한 정보는 거의 다 담긴다. 합성은 음질을 만들어내야 해서 한 단계 올린다.
- 2026년 TTS는 16kHz로 인코딩하고 48kHz로 복원하는 방향도 나온다(VoxCPM2).
인코더 출력 프레임레이트는 계속 낮아진다
- 자기지도 표현 모델: 약 50Hz(20ms)
- Qwen2-Audio: 25Hz
- Kimi-Audio, Qwen3-Omni, Mimi, GLM-4-Voice: 12.5Hz
LLM에 붙이는 모델일수록 시퀀스 길이를 줄이려고 더 강하게 압축한다.
원본은 대부분 손실 압축이다
| 데이터셋 | 원본 → 배포 |
|---|---|
| LibriSpeech·Libri-Light·LibriTTS·LJSpeech | LibriVox MP3 → FLAC/WAV |
| Common Voice | 48kHz MP3(브라우저 녹음) |
| GigaSpeech | Opus로 배포(오디오북·팟캐스트·유튜브) |
| VoxCeleb2 | 유튜브 → m4a(AAC) |
| Emilia | 영상·팟캐스트 → MP3 |
FLAC/WAV로 배포돼도 손실 원본을 변환한 것이다. 스튜디오에서 무손실로 녹음한 대표는 VCTK(96kHz/24bit로 녹음한 뒤 48kHz/16bit로 배포)다.
용도별 저장 판단
- 인식·분석용: 손실 압축 잡음의 영향이 작다. Opus로 보관해도 업계 관행과 같다(GigaSpeech).
- 합성·생성용: 모델이 압축 잡음까지 배울 수 있다. 무손실 원본이 좋고, 손실 원본이면 Emilia처럼 음량 정규화·목소리 분리·DNSMOS 필터를 거친다.
미검증
- Qwen3-TTS의 24kHz는 초록에서만 확인했다.
- 각 데이터셋의 비트 깊이는 대부분 원문에 없다.
관련 노트
- 나이퀴스트 정리는 샘플링 주파수를 정하는 좋은 기준이 된다
- 목표 비트레이트로 인코딩하면 샘플링 레이트를 낮춰도 파일이 작아지지 않는다
- Whisper 음성 처리와 최적화 방식
- 음성 인식 학습 데이터는 사람 전사 20만 시간이 한계라 의사라벨로 수천만 시간까지 늘린다
- 통화 녹음의 고음 에너지는 성별보다 AAC 비트레이트 차이가 크게 좌우한다
참고
- Whisper: https://arxiv.org/abs/2212.04356
- Whisper large-v3 모델 카드: https://huggingface.co/openai/whisper-large-v3
- Emilia: https://arxiv.org/abs/2407.05361
- F5-TTS: https://arxiv.org/abs/2410.06885
- CosyVoice 3: https://arxiv.org/abs/2505.17589
- Qwen2-Audio: https://arxiv.org/abs/2407.10759
- Qwen3-Omni: https://arxiv.org/abs/2509.17765
- Moshi: https://arxiv.org/abs/2410.00037
- VoxCPM2: https://arxiv.org/abs/2606.06928
- GigaSpeech: https://github.com/SpeechColab/GigaSpeech
- Libri-Light: https://github.com/facebookresearch/libri-light
- LJSpeech: https://keithito.com/LJ-Speech-Dataset
- VCTK: https://datashare.ed.ac.uk/handle/10283/3443