KRAFTON의 Raon-Speech-9B 모델을 Apple Silicon(MPS) 환경에서 테스트하는 PoC 프로젝트.
이 PoC는 Claude Code를 통해 기획 및 테스트되었습니다.
- 모델: KRAFTON/Raon-Speech-9B (9B 파라미터, 한/영 지원)
- 테스트 환경: Mac Studio M4 Max, 128GB RAM
- Device: MPS (Apple Silicon)
- 라이선스: CC BY-NC 4.0 (비상업적 사용만 허용)
uv 가 설치되어 있어야 합니다.
brew install uv
uv syncTTS → Voice Cloning → STT 순서로 기본 기능을 검증합니다.
uv run python test_raon.py출력 파일
output_tts.wav— 한국어 TTS 결과output_cloned.wav— Voice Cloning 결과
마이크로 직접 녹음 후, 내 목소리를 복제해 다른 텍스트를 생성합니다.
uv run python record_and_test.py실행 흐름
- Enter 누르면 카운트다운 3초 후 15초 녹음
- 모델 로딩 (~7초, 캐시 기준)
- 내 목소리로 지정 텍스트 Voice Cloning 생성
- 원본 → 복제 순서로 자동 재생해서 바로 비교
출력 파일
my_voice.wav— 녹음 원본my_voice_cloned.wav— Voice Cloning 결과
복제할 텍스트 변경
record_and_test.py 상단의 CLONE_TEXT 변수를 수정하세요.
CLONE_TEXT = "원하는 텍스트를 여기에 입력하세요."| 기능 | RTF | 비고 |
|---|---|---|
| TTS | 1.76 | 실시간 대비 1.76배 소요 |
| Voice Cloning | 4.07 | 실시간 대비 4.07배 소요 |
| 모델 로딩 | ~7초 | 캐시 후 기준, 최초 다운로드 ~18GB |
CUDA GPU(RTX 6000 Pro) 기준 RTF 0.27 — MPS 대비 약 6~15배 빠름
- 입력:
"안녕하세요. 저는 크래프톤의 Raon 음성 모델입니다." - 출력:
output_tts.wav(40.9초) | 소요: 71.9초 | RTF: 1.76
- reference:
output_tts.wav(모델 자체 생성 음성) - 입력:
"이 목소리는 방금 생성된 음성을 복제해서 만들었습니다." - 출력:
output_cloned.wav(9.0초) | 소요: 36.4초 | RTF: 4.07
- 입력:
output_tts.wav - 인식 결과:
"안녕하세요, 저는 크래프톤의 알에이 음성 모델입니다." - 영문 고유명사
"Raon"→"알에이"오인식
- MPS 텐서 → numpy 변환 시
.cpu().to(torch.float32)필요 (bfloat16 미지원) - STT에서 영문 고유명사 오인식:
"Raon"→"알에이" - 토큰 mismatch 경고는 무시해도 동작에 무관함