Repository navigation
Releases: deserted1011/bionic-ear
Release list
仿生之耳 v1.0 · 远场目标说话人精准提取 演示程序
仿生之耳 · 远场目标说话人精准提取 v1.0
面向华为「难题 4:远场目标说话人精准提取」企业真实课题的端侧演示程序。
在单一音频模态、3–4 麦克风、16 kHz 的约束下,从含干扰说话人、混响与噪声的远场录音中精准提取目标说话人的语音。
一、下载
在本页下方的 Assets 区域下载 bionic-ear.zip(229.3 MB)—— 单个文件,不用合并、不用分卷。
本页下方的「Source code (zip / tar.gz)」是 GitHub 自动生成的源码包,里面只有本说明和第三方许可声明,与演示程序无关,无需下载。
国内访问 GitHub 较慢时,可改用 Gitee 镜像(内容完全一致,只是切成了 3 个分卷、需要合并):
v1.0 @ Gitee
校验(可选):该 zip 的 SHA256 应为
F9B549B86D10BCE6FBBEC722EBFE333E83F5E8E41ABD3FFB8F5E523344E4DAB7
二、使用(三步)
- 把
bionic-ear.zip解压到一个纯英文路径下(例如D:\bionic-ear\),路径里不要带中文,也不要放在桌面 - 进入解压出来的文件夹(解压后默认叫
bionic-ear),双击仿生之耳.exe,程序会自动打开浏览器窗口 - 网页里选一段录音(自带 18 条样本在
素材\里),点「开始分离」,在「试听对比」里对比分离前后的效果
出问题先双击
诊断.bat,它会逐项打印检查结果。
三、如果被 Windows 拦住
本程序没有数字签名,Windows 上可能被拦两次,原因不同、处理方式也不同。
① 蓝色的「Windows 已保护你的电脑」(SmartScreen)
下载来的文件带「来自互联网」标记时会弹这个,跟下一条不是一回事。
点「更多信息」→「仍要运行」即可;也可以右键该文件 →「属性」→ 勾选「解除锁定」→ 确定,之后不再弹。
属性里的「解除锁定」是灰的(常见于企业管控的电脑)时,只能走「更多信息」→「仍要运行」。
② 报 [WinError 4551] 应用程序控制策略已阻止此文件(智能应用控制)
Windows 11 的「智能应用控制」只放行有数字签名、且云端有信誉的程序。本包里的 Python、
torch 等运行库都没有签名,所以在开着这个功能的电脑上,点「开始分离」会直接失败:
[WinError 4551] 应用程序控制策略已阻止此文件。 Error loading
"...\runtime\Lib\site-packages\torch\lib\shm.dll" or one of its dependencies.
处理(实测:多数电脑不用重启就能恢复):
- 关闭它:设置 → 隐私和安全性 → Windows 安全中心 → 应用和浏览器控制 → 智能应用控制 → 关闭
- 把程序完全退出:点网页最下面的「退出程序」,或在任务管理器里结束
pythonw.exe - 重新双击
仿生之耳.exe,再点「开始分离」
三步走完仍报同样的错,再重启电脑,然后重复第 3 步。
切记:先「完全退出程序」再重开。在原来的窗口里直接重试,会报另一条看起来毫不相干的错
module 'torch' has no attribute '_utils'—— 那不是包坏了,退出重开就没了。注意:关闭「智能应用控制」后无法再次打开,除非重装或重置 Windows。若这台电脑不允许关闭该功能,请换一台电脑运行本包。
本程序完全在本地运行,不联网、不上传任何音频,网页只监听 127.0.0.1,可放心运行。
四、环境要求
- Windows 10 / 11,64 位
- 不需要装 Python、不需要显卡驱动、不需要联网,纯 CPU 运行
- 一条 4 秒录音约 1–3 秒出结果
五、包含内容
| 目录 | 说明 |
|---|---|
仿生之耳.exe / 启动.bat |
启动入口 |
诊断.bat |
故障自检,出问题先双击它 |
runtime/ |
运行环境(Python + torch / numpy / scipy)。不要删、不要改名、不要单独移动 |
app/ |
程序本体:分离引擎、网页界面、模型权重 |
素材/ |
18 条演示样本(正负向、三种房间、1–10 m 距离、方位/SIR/SNR 扫描) |
结果/ |
分离结果输出目录 |
使用说明.txt |
详细使用文档(含上面两类拦截的完整说明与实测报错原文) |
六、技术要点
- 输入:3–4 路麦克风,前 3 路为 2 cm 间距的线性三麦阵列
- 分离骨干:空间分支 Conv-TasNet
- 全流程本地运行,网页只监听
127.0.0.1,不上传任何音频
七、许可
演示样本由 LibriSpeech(CC BY 4.0)仿真生成。
程序打包的第三方组件(Python、PyTorch、NumPy、SciPy、libsndfile 等)的许可声明与全文见仓库根目录的
THIRD_PARTY_LICENSES.md。
© 2026 仿生之耳 保留所有权利,仅供竞赛评审使用。