요약
- 음성 대화 모델의 사전학습 음성은 수백만 시간대로 늘었지만, 화자별 채널이 분리된 실제 2인 대화는 8kHz 전화 코퍼스(Fisher 약 2,000h)가 사실상 유일한 공개 데이터다.
- 부족분은 LLM 대본을 TTS로 읽힌 합성 대화, 또는 모노 웹 오디오를 화자 분리해 만든 가짜 두 채널로 메운다.
- 그래서 화자별로 분리 녹음된 실제 통화는 가장 희소한 데이터 유형이다.
본문
사전학습 규모와 실제 대화 규모
| 모델 | 사전학습 음성 | 대화 데이터 |
|---|---|---|
| dGSLM (2022) | 없음 | 실제 Fisher 2,000h |
| Moshi (2024-09) | 700만h | 실제 Fisher 2,000h + 자체 170h, 합성 2만h 이상 |
| SyncLLM (2024-09) | 없음 | 합성 약 21.2만h + 실제 Fisher 약 1,927h |
| GLM-4-Voice (2024-12) | 70만h | 합성(규모 비공개) |
| Kimi-Audio (2025-04) | 약 1,300만h | 합성(규모 비공개) |
| J-Moshi (2025-06, 일본어) | J-CHAT 약 6만h | 실제 두 채널 344h + 합성 602h |
실제 대화 비중은 전체의 0.03~1% 수준이다. 중국 쪽 대형 모델은 대화 데이터 양 자체를 공개하지 않는 경우가 많다.
원래부터 채널이 분리된 데이터는 전화 코퍼스뿐이다
| 코퍼스 | 스펙 | 규모 |
|---|---|---|
| Fisher English | 8kHz, μ-law, 2채널(화자별), NIST SPHERE | Part 1 984h, Part 2 포함 약 2,000h |
| Switchboard-1 R2 | 8kHz, μ-law, 2채널(화자별), SPHERE | 약 260h, 대화 약 2,400건 |
Moshi는 8kHz인 Fisher를 AudioSR로 24kHz까지 업샘플해 썼다.
웹 오디오로 두 채널을 만드는 방법
- Moshi: 모노 사전학습 음성을 PyAnnote로 화자 분리한 뒤, 한 명을 골라 파형에 마스크를 씌워 2스트림을 만든다.
- J-Moshi: J-CHAT(모노)에 화자 분리를 적용해 한 명은 모델 채널, 나머지는 사용자 채널에 배치한다.
- DuplexChat (2026-07): 팟캐스트를 화자별로 분리·복원해 스테레오 41.5만h(영어 28.3만 + 일본어 13.3만)를 만든다. 전화 녹음을 모으는 방식은 규모를 키우기 어렵다는 문제의식에서 출발했다.
함의
- 화자별로 따로 녹음되고 16kHz 이상인 실제 통화는 수천 시간만 모여도 공개 최대 규모인 Fisher급이다. 음질도 8kHz 전화보다 좋다.
- 다만 음성 데이터를 학습에 쓰려면 동의·보관 정책이 먼저 정리되어야 한다(기술 외 조건).
미검증
- Switchboard 약 260h는 LDC 카탈로그 기준이고 원 논문과는 대조하지 않았다.
- Kimi-Audio 학습 음성이 모노인지는 확인하지 못했다.
관련 노트
- 음성 AI 학습 입력은 인식·분석은 16kHz, 합성·대화는 24kHz 모노로 수렴한다
- 음성 인식 학습 데이터는 사람 전사 20만 시간이 한계라 의사라벨로 수천만 시간까지 늘린다
- WhisperX는 VAD로 청크 의존성을 제거해 배치 추론을 가능하게 한다
참고
- dGSLM: https://arxiv.org/abs/2203.16502
- Moshi: https://arxiv.org/abs/2410.00037
- SyncLLM: https://arxiv.org/abs/2409.15594
- GLM-4-Voice: https://arxiv.org/abs/2412.02612
- Kimi-Audio: https://arxiv.org/abs/2504.18425
- J-Moshi: https://arxiv.org/abs/2506.02979
- J-CHAT: https://arxiv.org/abs/2407.15828
- DuplexChat: https://arxiv.org/abs/2607.04941
- Fisher English Part 1 (LDC2004S13): https://catalog.ldc.upenn.edu/LDC2004S13
- Switchboard-1 R2 (LDC97S62): https://catalog.ldc.upenn.edu/LDC97S62