Skip to content

仿生之耳 v1.0 · 远场目标说话人精准提取 演示程序

Latest

Choose a tag to compare

@deserted1011 deserted1011 released this 28 Sep 06:23
· 1 commit to master since this release
7164323

仿生之耳 · 远场目标说话人精准提取 v1.0

面向华为「难题 4:远场目标说话人精准提取」企业真实课题的端侧演示程序。

在单一音频模态、3–4 麦克风、16 kHz 的约束下,从含干扰说话人、混响与噪声的远场录音中精准提取目标说话人的语音。


一、下载

在本页下方的 Assets 区域下载 bionic-ear.zip(229.3 MB)—— 单个文件,不用合并、不用分卷。

本页下方的「Source code (zip / tar.gz)」是 GitHub 自动生成的源码包,里面只有本说明和第三方许可声明,与演示程序无关,无需下载。

国内访问 GitHub 较慢时,可改用 Gitee 镜像(内容完全一致,只是切成了 3 个分卷、需要合并):
v1.0 @ Gitee

校验(可选):该 zip 的 SHA256 应为
F9B549B86D10BCE6FBBEC722EBFE333E83F5E8E41ABD3FFB8F5E523344E4DAB7


二、使用(三步)

  1. 把 bionic-ear.zip 解压到一个纯英文路径下(例如 D:\bionic-ear\),路径里不要带中文,也不要放在桌面
  2. 进入解压出来的文件夹(解压后默认叫 bionic-ear),双击 仿生之耳.exe,程序会自动打开浏览器窗口
  3. 网页里选一段录音(自带 18 条样本在 素材\ 里),点「开始分离」,在「试听对比」里对比分离前后的效果

出问题先双击 诊断.bat,它会逐项打印检查结果。


三、如果被 Windows 拦住

本程序没有数字签名,Windows 上可能被拦两次,原因不同、处理方式也不同。

① 蓝色的「Windows 已保护你的电脑」(SmartScreen)

下载来的文件带「来自互联网」标记时会弹这个,跟下一条不是一回事。
点「更多信息」→「仍要运行」即可;也可以右键该文件 →「属性」→ 勾选「解除锁定」→ 确定,之后不再弹。
属性里的「解除锁定」是灰的(常见于企业管控的电脑)时,只能走「更多信息」→「仍要运行」。

② 报 [WinError 4551] 应用程序控制策略已阻止此文件(智能应用控制)

Windows 11 的「智能应用控制」只放行有数字签名、且云端有信誉的程序。本包里的 Python、
torch 等运行库都没有签名,所以在开着这个功能的电脑上,点「开始分离」会直接失败:

[WinError 4551] 应用程序控制策略已阻止此文件。 Error loading
"...\runtime\Lib\site-packages\torch\lib\shm.dll" or one of its dependencies.

处理(实测:多数电脑不用重启就能恢复):

  1. 关闭它:设置 → 隐私和安全性 → Windows 安全中心 → 应用和浏览器控制 → 智能应用控制 → 关闭
  2. 把程序完全退出:点网页最下面的「退出程序」,或在任务管理器里结束 pythonw.exe
  3. 重新双击 仿生之耳.exe,再点「开始分离」

三步走完仍报同样的错,再重启电脑,然后重复第 3 步。

切记:先「完全退出程序」再重开。在原来的窗口里直接重试,会报另一条看起来毫不相干的错
module 'torch' has no attribute '_utils' —— 那不是包坏了,退出重开就没了。

注意:关闭「智能应用控制」后无法再次打开,除非重装或重置 Windows。若这台电脑不允许关闭该功能,请换一台电脑运行本包。

本程序完全在本地运行,不联网、不上传任何音频,网页只监听 127.0.0.1,可放心运行。


四、环境要求

  • Windows 10 / 11,64 位
  • 不需要装 Python、不需要显卡驱动、不需要联网,纯 CPU 运行
  • 一条 4 秒录音约 1–3 秒出结果

五、包含内容

目录 说明
仿生之耳.exe / 启动.bat 启动入口
诊断.bat 故障自检,出问题先双击它
runtime/ 运行环境(Python + torch / numpy / scipy)。不要删、不要改名、不要单独移动
app/ 程序本体:分离引擎、网页界面、模型权重
素材/ 18 条演示样本(正负向、三种房间、1–10 m 距离、方位/SIR/SNR 扫描)
结果/ 分离结果输出目录
使用说明.txt 详细使用文档(含上面两类拦截的完整说明与实测报错原文)

六、技术要点

  • 输入:3–4 路麦克风,前 3 路为 2 cm 间距的线性三麦阵列
  • 分离骨干:空间分支 Conv-TasNet
  • 全流程本地运行,网页只监听 127.0.0.1,不上传任何音频

七、许可

演示样本由 LibriSpeech(CC BY 4.0)仿真生成。
程序打包的第三方组件(Python、PyTorch、NumPy、SciPy、libsndfile 等)的许可声明与全文见仓库根目录的
THIRD_PARTY_LICENSES.md。

© 2026 仿生之耳 保留所有权利,仅供竞赛评审使用。