Skip to content

Releases: Temmis2077/OSW

GPU acceleration pack v1 (TensorRT + cuDNN/cuBLAS runtime)

Choose a tag to compare

@Temmis2077 Temmis2077 released this 05 Aug 06:25
20a1005

OSW의 GPU 가속 팩입니다. 앱이 자동으로 받아 설치하므로 여기서 직접 내려받을 필요는 없습니다.

앱에서 설정 → AI 엔진 → GPU 가속 팩 다운로드를 누르면 아래 파트를 순서대로 받아
sha256을 검증하고 %LOCALAPPDATA%\LiveMRManager\tools\gpu\에 풀어 넣습니다.

무엇에 쓰나

RoFormer 기반 MR 분리는 CPU에서 곡당 8~30분이 걸립니다. TensorRT가 그래프를 융합하면
청크당 14.1초 → 0.83초(약 17배) 로 떨어집니다(실측).

  • NVIDIA GPU가 있을 때만 의미가 있습니다.
  • 팩이 없어도 앱은 CPU 경로로 그대로 동작합니다(분리가 더 오래 걸릴 뿐입니다).

자산

파일 내용
manifest.json 파트 목록·크기·sha256 (앱이 먼저 읽습니다)
gpu-pack-v1.part0.zip cuDNN 엔진·cuFFT·TensorRT 코어 등 14개
gpu-pack-v1.part1.zip cuBLASLt·cuDNN adv/ops/graph 등 7개
gpu-pack-v1.part2.zip nvinfer_builder_resource_10.dll
NVIDIA-NOTICE.txt NVIDIA 재배포 고지

압축 전 3,803 MB / 22개 DLL, 압축 후 합계 약 2,488 MB. GitHub 에셋 한도(2GB) 때문에
세 파트로 나눴습니다. 각 파트는 독립된 zip이라 순서와 무관하게 풀립니다.

고지

이 릴리즈에는 NVIDIA Corporation이 제공한 소스 코드에서 비롯된 런타임 라이브러리가
포함됩니다. TensorRT SLA §8.2, cuDNN SLA, CUDA Toolkit EULA Attachment A에 따라
재배포하며, OSW에서 쓰기 위한 것으로 단독 배포할 수 없습니다. 자세한 내용은
NVIDIA-NOTICE.txt를 보세요.

MR 분리 모델: Mel-Band RoFormer Deux (ONNX)

Choose a tag to compare

becruily/mel-band-roformer-deux 체크포인트를 ONNX(opset 17)로 변환한 버전입니다. 앱의 '최고 품질 분리' 옵션에서 온디맨드로 다운로드됩니다.

  • 원본: https://huggingface.co/becruily/mel-band-roformer-deux (becruily)
  • 라이선스: CC-BY-NC-4.0 (비상업, 저작자 표시) — 원본 모델의 라이선스를 그대로 따릅니다
  • 변환 방식: 복소수 STFT/iSTFT를 실수 conv 연산으로 그래프에 내장 (외부 전/후처리 불필요)
  • 입력: mix [1, 2, 352800] float32 (44.1kHz 스테레오 8초 청크)
  • 출력: sources [1, 2, 2, 352800] (stem 0 = 보컬, stem 1 = 반주)
  • 변환 검증: PyTorch 원본 대비 최대 오차 1.9e-7, onnxruntime 대비 1.8e-7 (패리티 확인)

앱 릴리즈와 별개로 관리되는 모델 전용 릴리즈입니다.

영어 가사 강제정렬 모델 v1 (wav2vec2-base-960h CTC)

Choose a tag to compare

@Temmis2077 Temmis2077 released this 13 Jul 15:40

영어(팝송) 가사 강제정렬용 wav2vec2 CTC 모델의 ONNX 변환본입니다. 원본: facebook/wav2vec2-base-960h (Apache-2.0). 앱의 가사 싱크 탭에서 정렬 언어를 English로 선택하면 온디맨드로 다운로드됩니다.

  • model.onnx (~360MB) — 입력 [1,N] float32 raw waveform(16kHz mono, ZMUV 정규화는 앱이 처리), 출력 [1,T,32] CTC logits
  • tokens.txt — 대문자 A-Z, |(단어경계), ///

원본 HF 모델과 출력 패리티 확인(max|diff| 5e-5). 낭독체 학습 모델이라 가창 도메인과 차이가 있어 완벽하지 않습니다 — AI가 초안을 제공하고 사용자가 다듬는 보조 도구로 설계되었습니다.

AI 가사 강제정렬 모델 v1 (한국어 wav2vec2 CTC)

Choose a tag to compare

@Temmis2077 Temmis2077 released this 11 Jul 04:17

한국어 가사 강제정렬(forced alignment)에 쓰이는 wav2vec2 CTC 모델의 ONNX 변환본입니다. 원본: kresnik/wav2vec2-large-xlsr-korean (Apache-2.0). 앱 버전과 무관하게 별도로 관리되는 릴리즈이며, 앱 내 '가사 싱크' 탭에서 온디맨드로 다운로드됩니다.

  • model.onnx (~1.27GB)
  • tokens.txt

낭독체 음성으로 학습된 모델이라 가창 도메인과는 차이가 있을 수 있습니다. AI가 초안을 제공하고 사용자가 다듬는 보조 도구로 설계되었습니다.