영어 가사 강제정렬 모델 v1 (wav2vec2-base-960h CTC)
·
123 commits
to main
since this release
영어(팝송) 가사 강제정렬용 wav2vec2 CTC 모델의 ONNX 변환본입니다. 원본: facebook/wav2vec2-base-960h (Apache-2.0). 앱의 가사 싱크 탭에서 정렬 언어를 English로 선택하면 온디맨드로 다운로드됩니다.
- model.onnx (~360MB) — 입력 [1,N] float32 raw waveform(16kHz mono, ZMUV 정규화는 앱이 처리), 출력 [1,T,32] CTC logits
- tokens.txt — 대문자 A-Z, |(단어경계), //
/
원본 HF 모델과 출력 패리티 확인(max|diff| 5e-5). 낭독체 학습 모델이라 가창 도메인과 차이가 있어 완벽하지 않습니다 — AI가 초안을 제공하고 사용자가 다듬는 보조 도구로 설계되었습니다.