Zettelkasten

음성 인식 학습 데이터는 사람 전사 20만 시간이 한계라 의사라벨로 수천만 시간까지 늘린다

·수정 1회

요약

  • 사람이 전사한 라벨만 쓰는 ASR은 7만21만 시간에서 멈춘다. 산업계는 기존 ASR 모델이 단 의사라벨로 수백만수천만 시간까지 늘린다.
  • 분석·이해 계열은 무라벨 대규모 사전학습 뒤 소량 라벨로 미세조정한다. 감정·화자 라벨 데이터는 여전히 수십~수천 시간이다.
  • 제로샷 TTS는 3년 사이 약 100배 커졌지만, 목소리 하나를 미세조정하는 데는 클립 수백 개면 된다.

본문

인식(ASR)

모델 발표 학습 데이터 성격
FireRedASR 2025-01 약 7만h 사람 전사
Granite-speech 2025-05 약 7.6만h 공개 코퍼스 라벨
OWSM v3.1 2024-01 18만h 공개 코퍼스 라벨
Dolphin 2025-03 21.2만h 라벨
Whisper 2022-12 68만h 웹 자막(약라벨)
Parakeet-tdt v3 2025-08 약 67만h 98.5% 의사라벨
Whisper large-v3 2023 500만h 400만h가 이전 모델의 의사라벨
Kimi-Audio 2025-04 1,300만h 이상 의사라벨
Qwen3-ASR 2026-01 약 4,000만h 의사라벨

Google USM은 반대로 간다. 무라벨 약 1,250만h로 사전학습하고, 라벨은 약 20만h만 쓴다.

분석·이해

대상 규모
wav2vec 2.0 / HuBERT / WavLM (자기지도) 5.3만~9.4만h
w2v-BERT 2.0 450만h
Qwen3-Omni 오디오 인코더 2,000만h
VoxCeleb2 (화자 검증) 2,442h, 6,112명
MSP-Podcast (감정) 409h
IEMOCAP (감정) 약 12h

사전학습과 과제별 라벨 사이에 3~4자릿수 차이가 난다. 그래서 큰 인코더를 가져와 소량 라벨로 미세조정하는 게 표준이다. 최근 보고서는 시간 대신 토큰 수로 규모를 밝히는 경우가 많아 서로 바로 비교하기 어렵다.

합성(TTS)

시기 규모 사례
2023 5만~6만h VALL-E, Voicebox
2024 10만~20만h F5-TTS(Emilia 약 9.5만h), CosyVoice 2, NaturalSpeech 3
2025~2026 100만~500만h CosyVoice 3(100만h), VoxCPM(180만h), Qwen3-TTS(500만h 이상)
  • 3.4만~10만h로도 경쟁력 있는 모델이 나온다(IndexTTS, Spark-TTS).
  • 단일 화자를 처음부터 학습하는 기준은 LJSpeech 약 24h다.
  • Orpheus 공식 권장 기준으로 목소리 하나 미세조정은 화자당 약 300개 샘플이다. 30분~1시간이라는 시간 환산은 추정이다.

미검증

  • Seed-TTS, MiniMax-Speech, VibeVoice, Voxtral은 원문에 학습 시간이 없다.
  • Qwen-Audio 합산치(약 12.8만h)는 원본 표와 다시 맞춰 보지 않았다.

관련 노트

참고