Zettelkasten

음성 대화 모델의 실제 2인 대화 데이터는 Fisher 약 2,000시간이 사실상 전부다

·수정 1회

요약

  • 음성 대화 모델의 사전학습 음성은 수백만 시간대로 늘었지만, 화자별 채널이 분리된 실제 2인 대화는 8kHz 전화 코퍼스(Fisher 약 2,000h)가 사실상 유일한 공개 데이터다.
  • 부족분은 LLM 대본을 TTS로 읽힌 합성 대화, 또는 모노 웹 오디오를 화자 분리해 만든 가짜 두 채널로 메운다.
  • 그래서 화자별로 분리 녹음된 실제 통화는 가장 희소한 데이터 유형이다.

본문

사전학습 규모와 실제 대화 규모

모델 사전학습 음성 대화 데이터
dGSLM (2022) 없음 실제 Fisher 2,000h
Moshi (2024-09) 700만h 실제 Fisher 2,000h + 자체 170h, 합성 2만h 이상
SyncLLM (2024-09) 없음 합성 약 21.2만h + 실제 Fisher 약 1,927h
GLM-4-Voice (2024-12) 70만h 합성(규모 비공개)
Kimi-Audio (2025-04) 약 1,300만h 합성(규모 비공개)
J-Moshi (2025-06, 일본어) J-CHAT 약 6만h 실제 두 채널 344h + 합성 602h

실제 대화 비중은 전체의 0.03~1% 수준이다. 중국 쪽 대형 모델은 대화 데이터 양 자체를 공개하지 않는 경우가 많다.

원래부터 채널이 분리된 데이터는 전화 코퍼스뿐이다

코퍼스 스펙 규모
Fisher English 8kHz, μ-law, 2채널(화자별), NIST SPHERE Part 1 984h, Part 2 포함 약 2,000h
Switchboard-1 R2 8kHz, μ-law, 2채널(화자별), SPHERE 약 260h, 대화 약 2,400건

Moshi는 8kHz인 Fisher를 AudioSR로 24kHz까지 업샘플해 썼다.

웹 오디오로 두 채널을 만드는 방법

  • Moshi: 모노 사전학습 음성을 PyAnnote로 화자 분리한 뒤, 한 명을 골라 파형에 마스크를 씌워 2스트림을 만든다.
  • J-Moshi: J-CHAT(모노)에 화자 분리를 적용해 한 명은 모델 채널, 나머지는 사용자 채널에 배치한다.
  • DuplexChat (2026-07): 팟캐스트를 화자별로 분리·복원해 스테레오 41.5만h(영어 28.3만 + 일본어 13.3만)를 만든다. 전화 녹음을 모으는 방식은 규모를 키우기 어렵다는 문제의식에서 출발했다.

함의

  • 화자별로 따로 녹음되고 16kHz 이상인 실제 통화는 수천 시간만 모여도 공개 최대 규모인 Fisher급이다. 음질도 8kHz 전화보다 좋다.
  • 다만 음성 데이터를 학습에 쓰려면 동의·보관 정책이 먼저 정리되어야 한다(기술 외 조건).

미검증

  • Switchboard 약 260h는 LDC 카탈로그 기준이고 원 논문과는 대조하지 않았다.
  • Kimi-Audio 학습 음성이 모노인지는 확인하지 못했다.

관련 노트

참고