[arXiv 2024] Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis
-
Updated
Feb 5, 2025 - Python
[arXiv 2024] Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis
可控 Foley / 环境声生成框架:文本与时序条件驱动,扩散与流匹配声学模型,Griffin-Lim 声码器,纯 numpy/scipy、离线优先
Codex skill for Doubao Seed Audio: voiceover, dialogue, ambience, Foley, subtitles, and Seedance audio post-production.
Add a description, image, and links to the foley topic page so that developers can more easily learn about it.
To associate your repository with the foley topic, visit your repo's landing page and select "manage topics."