요약
- 사람이 전사한 라벨만 쓰는 ASR은 7만
21만 시간에서 멈춘다. 산업계는 기존 ASR 모델이 단 의사라벨로 수백만수천만 시간까지 늘린다. - 분석·이해 계열은 무라벨 대규모 사전학습 뒤 소량 라벨로 미세조정한다. 감정·화자 라벨 데이터는 여전히 수십~수천 시간이다.
- 제로샷 TTS는 3년 사이 약 100배 커졌지만, 목소리 하나를 미세조정하는 데는 클립 수백 개면 된다.
본문
인식(ASR)
| 모델 | 발표 | 학습 데이터 | 성격 |
|---|---|---|---|
| FireRedASR | 2025-01 | 약 7만h | 사람 전사 |
| Granite-speech | 2025-05 | 약 7.6만h | 공개 코퍼스 라벨 |
| OWSM v3.1 | 2024-01 | 18만h | 공개 코퍼스 라벨 |
| Dolphin | 2025-03 | 21.2만h | 라벨 |
| Whisper | 2022-12 | 68만h | 웹 자막(약라벨) |
| Parakeet-tdt v3 | 2025-08 | 약 67만h | 98.5% 의사라벨 |
| Whisper large-v3 | 2023 | 500만h | 400만h가 이전 모델의 의사라벨 |
| Kimi-Audio | 2025-04 | 1,300만h 이상 | 의사라벨 |
| Qwen3-ASR | 2026-01 | 약 4,000만h | 의사라벨 |
Google USM은 반대로 간다. 무라벨 약 1,250만h로 사전학습하고, 라벨은 약 20만h만 쓴다.
분석·이해
| 대상 | 규모 |
|---|---|
| wav2vec 2.0 / HuBERT / WavLM (자기지도) | 5.3만~9.4만h |
| w2v-BERT 2.0 | 450만h |
| Qwen3-Omni 오디오 인코더 | 2,000만h |
| VoxCeleb2 (화자 검증) | 2,442h, 6,112명 |
| MSP-Podcast (감정) | 409h |
| IEMOCAP (감정) | 약 12h |
사전학습과 과제별 라벨 사이에 3~4자릿수 차이가 난다. 그래서 큰 인코더를 가져와 소량 라벨로 미세조정하는 게 표준이다. 최근 보고서는 시간 대신 토큰 수로 규모를 밝히는 경우가 많아 서로 바로 비교하기 어렵다.
합성(TTS)
| 시기 | 규모 | 사례 |
|---|---|---|
| 2023 | 5만~6만h | VALL-E, Voicebox |
| 2024 | 10만~20만h | F5-TTS(Emilia 약 9.5만h), CosyVoice 2, NaturalSpeech 3 |
| 2025~2026 | 100만~500만h | CosyVoice 3(100만h), VoxCPM(180만h), Qwen3-TTS(500만h 이상) |
- 3.4만~10만h로도 경쟁력 있는 모델이 나온다(IndexTTS, Spark-TTS).
- 단일 화자를 처음부터 학습하는 기준은 LJSpeech 약 24h다.
- Orpheus 공식 권장 기준으로 목소리 하나 미세조정은 화자당 약 300개 샘플이다. 30분~1시간이라는 시간 환산은 추정이다.
미검증
- Seed-TTS, MiniMax-Speech, VibeVoice, Voxtral은 원문에 학습 시간이 없다.
- Qwen-Audio 합산치(약 12.8만h)는 원본 표와 다시 맞춰 보지 않았다.
관련 노트
- 음성 AI 학습 입력은 인식·분석은 16kHz, 합성·대화는 24kHz 모노로 수렴한다
- 음성 대화 모델의 실제 2인 대화 데이터는 Fisher 약 2,000시간이 사실상 전부다
- Whisper 음성 처리와 최적화 방식
참고
- Whisper: https://arxiv.org/abs/2212.04356
- Google USM: https://arxiv.org/abs/2303.01037
- OWSM v3.1: https://arxiv.org/abs/2401.16658
- FireRedASR: https://arxiv.org/abs/2501.14350
- Dolphin: https://arxiv.org/abs/2503.20212
- Granary: https://arxiv.org/abs/2505.13404
- Parakeet-tdt-0.6b-v3: https://huggingface.co/nvidia/parakeet-tdt-0.6b-v3
- Kimi-Audio: https://arxiv.org/abs/2504.18425
- Qwen3-ASR: https://arxiv.org/abs/2601.21337
- w2v-BERT 2.0 (Seamless): https://arxiv.org/abs/2312.05187
- VoxCeleb2: https://arxiv.org/abs/1806.05622
- MSP-Podcast: https://lab-msp.com/MSP/MSP-Podcast.html
- VALL-E: https://arxiv.org/abs/2301.02111
- CosyVoice 3: https://arxiv.org/abs/2505.17589
- Qwen3-TTS: https://arxiv.org/abs/2601.15621
- Orpheus-TTS: https://github.com/canopyai/Orpheus-TTS