v1.5.0-beta.5
Pre-release
Pre-release
下载哪个版本?
默认下载 MAW : 它内置了我们需要的 ffmpeg 和 ffprobe,解压即用。
如果你本机环境装有 ffmpeg : 可以选择体积更小的 MAW-lite 版本。
如何使用
- 下载安装包后解压
- 双击对应的
MAW可执行文件,打开启动器 - 在启动器中,可以执行字幕转写、生成工程等操作
- 完成后,启动字幕编辑器,进行字幕精修
[1.5.0-beta.5] - 2026-08-28
🚀 全新特性
- 录制文稿对齐(实验性) : 新增
server-align本地工具,输入.mosp、文稿与媒体后可把实际录制内容分为匹配、失败片段、不完整录制、备选 take、缺失文稿与 Extra;在波形上选择 take、试听、调整空隙并导出可继续交给 MAWE 编辑的工程。 - 腾讯云录音文件识别 : 新增腾讯云「录音文件识别」供应商:使用 TC3-HMAC-SHA256 鉴权、异步任务轮询和结构化毫秒时间戳,支持
16k_zh_en_2.0引擎(PR #65);5MB 以上媒体可通过 COS / 公网 URL 识别。 - Faster-Whisper 本地引擎(实验) :
generate_subtitle_local.py新增--engine whisper,通过 faster-whisper(CTranslate2 运行时、CT2 权重与 Silero VAD 内置)输出词级整数毫秒时间戳,并复用统一切句、SRT 与.mosp流程;依赖随uv sync --extra local安装。默认模型large-v3,可传--model切换turbo等 HF Hub 名称或本地 CTranslate2 目录;不提供说话人分离。Launcher「本地模型」同步提供 large-v3 入口,缓存发现与目录误判防护与其他引擎一致。 - MOSS 本地转录引擎 : 引入 MOSS Transcribe-Diarize(Transformers 5.x)本地识别引擎,独立安装到
local-runtime-moss环境,模型与其余引擎共用缓存目录;模型条目已标注仅提供段级时间戳、无字词级时间码。 - MAW 字幕颜色过滤与可配置拆分移除符号 : 编辑器支持按颜色过滤字幕段落查看,并可配置在断句拆分时移除哪些符号(PR #76)。
✨ 提升
- 大视频工程启动体验 : localhost 编辑器先绑定并响应端口,再后台读取工程和生成或读取波形;页面显示准备阶段,并在完成后自动载入完整工程,避免长视频首次打开被误报为服务器无响应。
- Launcher 与编辑器布局细节优化 : Launcher 改为上方内容独立滚动、下方操作区占据实际高度,并为上方区域保留适量底部留白;文稿预览及其他滚动区域统一使用细滚动条,编辑器窄屏下保留各区域的设置入口,跨行 cue block 的相接侧保持直角连续外观;字幕列表宽度不足时隐藏显示数量计数,为搜索和设置入口让位;全局设置中独立展示字幕语言类型及语言适用范围说明,并将「配置合并字符」与「配置拆分标点」收进同一行的按钮浮窗。
- 字幕列表操作按钮窄宽度显示优化 : 「批量操作」与「仅看超长」按钮在空间不足时保持单行,并以省略号显示文本。
- 窄屏播放器控制栏布局改进 : 媒体控制栏在窄屏下按优先级隐藏前后跳转按钮和音量控件,并缩短进度条,确保全屏按钮始终可见。
- Launcher 多类路径输入拖放 : 服务器媒体、主媒体,以及模型、OCR、FFmpeg、贴图目录等路径输入均支持拖放,并复用统一目标路由与格式校验。
- 导出菜单分组以及文案调整 : 导出菜单增加类别分隔线,新增去空隙 FCPXML 入口并统一 OTIO / OTIOZ 文案;包含点号的工程名在文件名清理时予以保留。
- 播放指针跨行拖动 : 多行波形中拖动播放指针越过当前行的开头或结尾后,仍可继续定位到前后行,保持与空隙拖动一致;同时降低连续 seek 与编辑器刷新的频率,减少跨行拖动时的卡顿。
- 静音空隙处理 : 编辑器支持右键添加空隙、跨行边界与中键范围操作、边界与中键组合模式、
Alt整体移动和Ctrl/Cmd复制;gap_remove.provenance将静音检测、台本对齐与人工调整分层保存,重扫时可保留手工结果。「空隙检测与调整」还可按当前前后预留量对已有空隙额外向内收缩,并支持重复操作与撤销。 - 空隙内字幕控制 : 在「空隙检测与调整」中按覆盖率和剩余时长阈值批量禁用静音空隙内的主字幕,不改写字幕时间并支持撤销。
- 预览字幕颜色下划线 : 播放预览可按字幕的颜色快照给文字加下划线以区分不同颜色的字幕,默认开启,可在「预览字幕样式」设置中关闭;只影响预览画面,不改变字幕文本。
- 颜色过滤全选过滤结果 : 颜色过滤菜单新增「全选过滤结果」,把当前过滤命中的主轨字幕一键全部选中,可配合批量替换(仅选中)等按选区工作的工具,例如给不同说话人的字幕批量加前缀;双列等不显示颜色条的列表模式下自动隐藏过滤按钮。
- 去空隙 OTIO 字幕标记 : 导出 OTIO 时把启用字幕作为媒体 clip 的 marker 写入,marker 名称为字幕内容;继承字幕颜色并映射到 DaVinci Resolve 的
RED、YELLOW、GREEN、BLUE、PURPLE,跨越被移除空隙的字幕按保留 clip 拆分,无颜色字幕使用白色默认标记。
🔄 变更
- 静音空隙默认参数与工具栏调整 : 默认最小空隙改为 400ms、音量阈值改为 -28dB、前端预留改为 120ms(后端预留 80ms、滞回 2dB 保持不变);移除工具栏 Gap 状态文字并将入口改名为「静音空隙」,将「进一步收缩空隙」和「禁用字幕」改为紧凑按钮与右侧提示,动态显示当前未禁用字幕数量,并放大扫描参数 hint 字号;帮助面板补充 Gap 的新增、移动、范围调整、清理与批量操作说明,并按基础操作、快捷操作、波形区和播放与导航展示常用内容,其余收进「进阶」Tab,新增字幕列表「批量操作」Tab;统一快捷键的上下文说明,重点显示 WASD、合并、颜色分配、框选、多重字幕和鼠标定位操作,帮助正文与 kbd 字号调整为 13px;波形区和媒体区的设置说明可直接打开对应设置,入口改为融入 hint 的可点击文本按钮并保留下划线,打开设置时保留帮助面板,波形区设置弹窗默认高度略微增加;帮助中的「静音空隙」入口也可直接打开静音空隙工具窗;静音空隙、拼接/合并字幕和延长字幕工具窗层级提高至 z-index 340,帮助保持 z-index 320;帮助分组标题统一使用 h5 层级,并采用原 h6 的样式;空隙操作按状态、移动与调整、清理、批量操作拆分为独立分组,并压缩说明文案,为指定快捷键条目增加独立换行。
- 暂时隐藏两款 FunASR 本地模型 : 因当前版本实测转写效果不理想,Launcher 暂时不再展示 Fun-ASR-Nano 2512 和 FunASR paraformer-zh;底层 CLI 与已有配置能力保留。
- 字幕颜色调色板单一来源 : 5 色调色板收敛到
maw/colors.py一处定义——speaker 自动取色、1~5 手动标记与编辑器/波形显示共用,渲染时注入window.ASR_EDITOR_PALETTE,web 侧不再各自硬编码色值。五色明度(OKLCH L≈0.718)以绿色#66bb6a为锚统一:黄#c4a019、红#f07f6f、紫#bf89e6、蓝#61a7fa,并顺带统一了此前蓝色在编辑器/波形与生成端不一致的取值;旧工程已存储的颜色快照值保持不变。 - 托管 Runtime 共性抽象 : local / ocr / moss 三个托管 Runtime 统一到
maw/runtimes(RuntimeSpec声明式规格 +ManagedRuntime生命周期基类),maw/local_runtime.py与maw/ocr_runtime.py收窄为薄壳委托,新增engine维度(local / moss)支持。 - 移除 bundled uv : Windows 打包版托管 Runtime 一律 embedded Python + get-pip +
pip install --target安装(unix 打包版与源码模式见下条);moss 依赖因与 local(qwen-asr 固定 Transformers 4.57.6)互斥而独立声明于moss-requirements.in,由uv pip compile冻结(与 local/ocr 的uv export管线并行),macOS 产物不再内置 uv。 - unix 打包版宿主 venv 与源码模式零资产安装 : unix(Linux / macOS)打包版不再内嵌解释器,runtime 安装改用系统
python3 -m venv创建环境后按同一份 frozen 清单直装(无 python3 或版本低于 3.11 时给出明确提示),产物不再携带 unix 平台用不到的引导资产;源码模式同样零引导资产,检测开发环境的 uv 后以uv pip install --python <MAW 解释器> --target <site-packages>接入与打包版一致的托管目录布局。全新 clone 首次安装时若build/下缺 frozen 清单,会按构建管线同款uv export/uv pip compile命令用 uv 自动补齐;未检测到 uv 时在进度日志输出安装指引警告。 - CUDA 检测前置 : 无 NVIDIA GPU(非 macOS)时在首次依赖安装前即切换 CPU 版 Torch——local / moss 的 CPU 清单由独立声明文件原生冻结(
local-cpu-requirements.in/moss-cpu-requirements.in,屏蔽 GPU 源)、随包分发且首装直接调用;不再"冻结后文本剔除 +cu130"(会遗留 cu130 wheel 哈希导致 pip 校验失败),也不再先下载完整 CUDA wheel 与 nvidia-* 依赖再覆盖。 - Runtime 安装镜像测速 : 本地 / OCR 运行环境通过 pip 安装依赖前对候选 PyPI 镜像测速,自动选用当前网络最快的镜像,失败时回退默认源。
- 本地运行环境升级至版本 6 : local 依赖新增 faster-whisper(连带 CTranslate2、onnxruntime、av),已安装用户首次进入时按提示重装本地运行环境以补齐依赖,避免转写时才报缺包。
- Launcher 本地面板路径与修复交互 : 运行环境与模型缓存路径可点击打开所在文件夹(后端白名单接口
open_runtime_folder,不接收任意路径);「安装本地模型支持」按钮按运行时状态区分首次安装与修复。 - 转写默认切句参数调整 :
--gap-split默认从 1500ms 收紧为 800ms(本地引擎原为 1000ms,一并对齐),--max-len默认从 21 字调整为 18 字;CLI 帮助文本与docs/CLI.md、docs/LOCAL_ASR.md同步更新。显式传参不受影响。 - Server 编辑器端口自动顺延 :
server-editor/serve.py不带--port启动时从 8250 起探测监听能力,端口被占用会自动改用下一个空闲端口并在终端提示实际地址;显式--port保持“必须监听该端口”,失败输出明确错误并以退出码 1 结束。
🐛 问题修复
- 英文设置文案翻译 : 补齐拆分与合并、静音空隙、文本处理等设置的英文翻译,切换英文后不再残留对应中文文案。
- 字幕时间重叠修复后的保存反馈 : 自动修复字幕时间重叠并重试保存后显示成功结果,避免只看到“正在重新保存”而无法确认是否已落盘。
- 字幕列表操作后的异常滚动 : 修复颜色/表情包分配与清除、合并字幕触发列表重建,以及搜索过滤和显示设置重排后因活动字幕自动跟随、懒布局回填导致列表跳回或漂移;属性更新改为原地刷新,其他列表重绘路径保留视觉锚点并让显式滚动优先。
- Launcher 大模型密钥读取与测试流程 : 已保存密钥会回填到密码输入框并显示掩码;测试连接成功后才自动写入本地环境,失败时不保存,并合并成功提示。
- 词间静音拆分边界 : 拆分带有字词时间码的字幕时,遇到词间静音采用非对称边界,左段停在自家词尾,避免两段时间码连在一起,使拆分结果更准确。
- 空隙人工调整 : 修复恢复空隙在边界缩小、整体移动或覆盖相邻空隙时产生残留区段、意外重新激活或连带移动的问题;时间轴改为始终显示一层可编辑空隙。
- 有分组色的字幕播放高亮被覆盖 : 主字幕列表播放中(active)行不再把背景统一覆盖成 accent 蓝,而是在原分组色上增强背景与左边条颜色;选中 + 播放中叠加时以原色为主轻混 accent,选中琥珀环保持不变。
- 本地模型准备入口崩溃 : 托管 Runtime 收紧子进程封装签名后,模型准备的两处调用未同步更新,GUI 点击「下载 / 准备模型」会直接抛出类型错误(影响 Qwen / FunASR / MOSS / Whisper 全部本地引擎)。现按必填参数补齐错误映射并新增回归测试。
- Whisper 模型下载目录偏离缓存发现布局 : faster-whisper 的显式
download_root曾指向缓存根本体,权重落在model-cache\models--*,而缓存发现只扫描model-cache\huggingface\hub,导致准备成功后状态仍显示「未检测到本地模型」。现对齐HF_HUB_CACHE约定,且缓存发现兼容已下载的扁平布局(无需重新下载)。 - 去空隙 OTIO 导出源范围错位 : 为去空隙 OTIO 的音视频外部引用写入完整源媒体 available_range,并保留各保留区间原始的 source_range 起点,修复 Resolve 导入后片段内容偏移。
- 多字幕黄条重叠与副字幕命名统一 : 多字幕主列的 dirty 黄色标记不再覆盖主字幕首字符(预留左侧内边距);同步中英文界面文案与导出选项,用户可见的「扩展 / 拓展字幕」一律称「副字幕」。
- 本地引擎忽略分段整理参数 :
build_local_segments在引擎自带分段时(Qwen3-ASR / FunASR / MOSS 均如此)原样放行,「最大字数」「短句合并阈值」「停顿切句」形同虚设。现对超过最大字数的分段走共享切句管线重组——粗粒度(一句一项)分段先按字符权重插值出子段时间再重切,词级时间戳仍优先使用真实值,结果段回填说话人信息。 - 本地引擎不剥尾标点 : 本地转写输出的每条字幕结尾现与云端默认一致,按「断句 / 保留符号」设置剥除结尾标点(默认去除全角逗号与句号)。
- MOSS 模型准备子进程环境 : 托管依赖目录统一经
site_packages()解析并按引擎传递 runtime root,修正 MOSS worker 曾误用 local 运行环境目录作为 PYTHONPATH 的问题。 - AppImage 打开外部程序失效 : Linux 打包版打开外部 URL / 路径前恢复
LD_LIBRARY_PATH_ORIG(AppImage 内的 Qt 库路径),避免污染外部xdg-open子进程(PR 74 移植)。 - NixOS 打开字幕编辑器崩溃 : PyInstaller 排除
readline模块并在 AppImage 内物理剔除libreadline.so(与既有 C++ 运行时剔除模式一致),避免 AppImage 内的旧版 readline 污染webbrowser.open→ xdg-open → bash 子进程;release CI 增加产物回归断言。 - Pages 部署路径过滤 :
deploy-editor-pages.yml的paths清理失效的reapeaks_io.py条目(main 实际文件为maw/reapeaks.py,已被maw/**覆盖,仅为消除残留)。
平台构建不完整
Windows 构建成功,但 macOS / Linux 构建未全部成功,本次 Release 仅包含成功平台的安装包。
开发者请查看本次 Actions 运行日志排查失败平台。