用本地 FFmpeg、Whisper 和 HyperFrames,把知识博主的原始口播素材,做成可发布的「口播优化版」「9:16 竖屏动态字幕包装版」和「同视觉封面」。
它不是普通字幕工具,而是一套面向知识博主的 AI 剪辑工作流:先理解整条口播,再删除气口、废话、口误和重复表达,从全片寻找最强钩子并前置,最后保持人物原始色彩,完成竖屏包装和封面交付。
大家好,我是Mens(vx:oops0731111)。这是我的开源 skill,看到大家正在 fork 以及 star 我们的项目,我非常开心。
这是我做的第一个实际的、长期可更新的 skill,它解决了一个具体的问题。我希望能够帮助到一类群体,就是知识博主,或者是做口播内容表达的博主。
这一类博主的内容创作基本上有一个特点:画面基本上是固定的,没有过度复杂的转场特效以及这种极端的场景。更多就是一个人在这里持续地说话,配上一些抓眼球的特效,基本上就是一个非常及格的口播内容。
所以,我希望能够做一个辅助口播的 skill,通过一些特效和效果,让口播更加个性化以及具备差异化,让用户更加沉浸式,并提供一些必要的辅助示意字体内容,去帮助他感受你的内容。
这样,大家所有的精力都能聚焦在“我到底要做哪些内容”上,而不是把所有的精力无谓地内耗在所谓的“剪辑出一个口播”上,而是去“创作出一个口播”。
- 家庭教育、知识付费、个人 IP、商业认知、心理成长类口播博主。
- 有一条完整原始口播,但不想手动听写、粗剪、找钩子、做字幕和封面的人。
- 想把「随手拍的长口播」稳定变成「开头更抓人、节奏更干净、视觉更统一」的短视频创作者。
| Feature 功能 | Advantage 优势 | Benefit 收益 |
|---|---|---|
| 本地 Whisper 中文转写 | 使用中文、词级时间戳,保留 JSON、SRT、TXT、TSV 和 16 kHz WAV | 不用先人工听写,后续剪辑点有时间依据 |
| AI 口播粗剪 | 删除气口、无效停顿、语气词空转、口误、自我纠正、重复词句和废弃版本 | 让原始口播更紧凑,但不破坏表达立场和自然语气 |
| 全片钩子筛选 | 从完整素材中找冲突、反转、好奇缺口或核心观点,而不是只看开头 | 前 3 秒更容易留人,减少好内容输在开场 |
| 钩子前置重排 | 把最强观点放到开头,再自然接回正文,并删除正文重复位置 | 提高短视频开头冲击力,同时保持逻辑完整 |
| 原色保护 | 延续原片色彩基色、传递函数、矩阵、范围和位深 | 避免导出后人物发白、发灰、变亮或失真 |
| HyperFrames 竖屏包装 | 默认 1080×1920,上层动态宋体大字幕,下层完整人物口播 | 适配抖音、视频号、小红书等竖屏信息流 |
| 同视觉封面 | 封面与动态字幕共享同一份 frame.md、字体和强调色 |
账号内容看起来更统一,更像一个专业栏目 |
| 可追溯工作文件 | 保留转写、edit_plan.json、复核记录和最终交付 |
后续复盘、返工、批量化生产都更稳 |
默认交付四类文件:
{素材名}_口播优化版.mp4{素材名}_竖屏包装版.mp4{素材名}_竖屏封面.png工作文件/:转写文件、剪辑计划、复核记录和中间素材
默认画面为 1080×1920 竖屏:上层动态文字,下层人物口播。默认中文字体为本地 Songti SC,主要字重 700。没有额外视觉要求时,使用内置 assets/frame.md。
- 解析输入视频,使用
ffprobe检查分辨率、帧率、音频、色彩和方向信息。 - 使用本地 Whisper 进行中文转写,生成词级时间戳。
- 通读整份转写,理解论点、故事结构和收尾。
- 标记可删除内容:气口、停顿、废话、口误、重复表达和废弃版本。
- 从全片寻找钩子候选,把最强、最真实、最能制造好奇的观点前置。
- 生成
edit_plan.json,每个保留片段都写明剪辑理由。 - 用 FFmpeg 渲染口播优化版,并延续原片色彩信息。
- 重新转写优化版,复核重复、截断、音画同步和生硬接缝。
- 用 HyperFrames 制作竖屏动态字幕包装和同视觉封面。
- 导出前检查布局、字幕溢出、对比度、人物色彩和最终文件可播放性。
三种安装方式:
1.手动复制到 ~/.workbuddy/skills/(用户级)或 <工作区>/.workbuddy/skills/(项目级) 2.在对话中让 WorkBuddy 从推荐市场搜索安装或从本地路径安装 3.通过 SkillManage 工具保存 AI 创建的技能
如果 WorkBuddy 已经内置这个技能,直接选择「知识口播 AI 剪辑」工具卡片;如果需要手动导入,把整个技能目录导入 WorkBuddy 的技能库,目录需要包含:
SKILL.md
scripts/
references/
assets/
agents/openai.yaml
然后新建任务,把原始视频上传到项目,或直接提供视频的绝对路径。推荐启动词:
使用「知识口播 AI 剪辑」处理这条口播视频:
素材:/你的/视频/绝对路径.MOV
目标:删除气口、废话、口误和重复内容,从全片寻找最强钩子并前置,输出口播优化版、竖屏包装版和封面。
视觉:没有额外要求时使用默认 frame.md,保持人物原始色彩。
WorkBuddy 更适合把它当成一个成品工具来用:给素材、说目标、等交付。
确认技能已经放在 Codex 技能目录:
~/.codex/skills/edit-knowledge-talking-head/
在 Codex 中打开你的素材项目目录,把视频放进 原始素材/,或者直接给绝对路径。推荐启动词:
use $edit-knowledge-talking-head
素材:/你的/视频/绝对路径.MP4
请按技能流程完成知识口播 AI 剪辑:本地转写、去废话、找钩子并前置、渲染口播优化版、复核、制作 9:16 竖屏动态字幕包装和同视觉封面。
Codex 适合偏工程化的批量处理:你可以把多个素材放在同一个项目里,让它按同一套交付目录和命名规则处理。
把技能目录安装或桥接到 Claude Code 的技能目录:
~/.claude/skills/edit-knowledge-talking-head/
也可以放在当前项目的技能目录中,只要 Claude Code 能识别到 SKILL.md、scripts/、references/ 和 assets/。进入素材项目后,使用类似提示:
请使用 edit-knowledge-talking-head 技能处理这个口播视频:
素材:/你的/视频/绝对路径.MOV
要求:删除气口、废话、口误、重复内容;从全片寻找并前置最强钩子;保持人物原始色彩;输出口播优化版、竖屏包装版和封面。
如果流程进入 HyperFrames 预览或导出阶段,npm run dev 这类长时间运行命令要在 Claude Code 中后台运行,避免前台阻塞任务。
- 支持常见口播视频格式:MP4、MOV、M4V、MKV 等。
- 素材最好是单人或主讲人为主的口播内容。
- 如果有品牌视觉要求,可以额外提供
frame.md。 - 如果没有提供
frame.md,默认使用内置视觉规范。 - 默认使用本地 Whisper
medium模型;如果本地模型缺失,需要先准备模型或明确允许下载。
- 不覆盖原始素材。
- 默认不上传媒体到云端。
- 不编造讲述者没说过的话。
- 不为了高密度而剪碎语气和音节。
- 不改变人物画面色彩,不加滤镜、不套 LUT、不用主观调色修正技术问题。
- 钩子必须来自真实素材,不能为了吸睛制造素材里不存在的结论。
- 字幕必须能在手机上快速阅读,不能溢出、遮挡人物或低对比度。
如果你会拍口播,但总是卡在剪辑、字幕、封面和开头留人,这套 kbcut 知识口播 AI 剪辑工作流,就是把「会说」变成「能发」的那一步。
如果你在使用过程不会使用、需要协助可以联系作者👇
作者:oops0731111 Mens
视频号:华子聊AI获客