本项目利用以下技术实现创新的磨听力视频格式:
- ChatTTS: 进行语音合成
- MSST: 进行人声分离
我们将传统的磨听力视频格式(“三句英文 + 一句中文 + 一句英文”)进行了改造:
- 英文部分: 替换为英文歌曲片段
- 中文部分: 用歌词的直译进行替换,并让 AI 朗读
最终,使用 ffmpeg 将这些音频片段按照原视频的节奏依次剪辑在一起,完成了项目。
请确保安装 FFmpeg、MSST WebUI一键包 、 ChatTTS WebUI一键包,然后运行 pip install -r requirements.txt 安装所需的库,
将任意格式的音频文件(支持 ncm、flac、mp3)放入 music 文件夹中,启动python __init__.py
- 移除 Faster-Whisper 语音识别,改用算法分割。
- 支持 日语及所有语言歌曲的语音处理(只要网易云有歌词)。
- 支持 music文件夹内批量处理音频。
- 自定义 生成视频封面(前两帧)。
- 自定义 生成视频内容文字。