Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

4 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

kbcut 知识口播 AI 剪辑

用本地 FFmpeg、Whisper 和 HyperFrames,把知识博主的原始口播素材,做成可发布的「口播优化版」「9:16 竖屏动态字幕包装版」和「同视觉封面」。

它不是普通字幕工具,而是一套面向知识博主的 AI 剪辑工作流:先理解整条口播,再删除气口、废话、口误和重复表达,从全片寻找最强钩子并前置,最后保持人物原始色彩,完成竖屏包装和封面交付。

作者的话

大家好,我是Mens(vx:oops0731111)。这是我的开源 skill,看到大家正在 fork 以及 star 我们的项目,我非常开心。

这是我做的第一个实际的、长期可更新的 skill,它解决了一个具体的问题。我希望能够帮助到一类群体,就是知识博主,或者是做口播内容表达的博主。

这一类博主的内容创作基本上有一个特点:画面基本上是固定的,没有过度复杂的转场特效以及这种极端的场景。更多就是一个人在这里持续地说话,配上一些抓眼球的特效,基本上就是一个非常及格的口播内容。

所以,我希望能够做一个辅助口播的 skill,通过一些特效和效果,让口播更加个性化以及具备差异化,让用户更加沉浸式,并提供一些必要的辅助示意字体内容,去帮助他感受你的内容。

这样,大家所有的精力都能聚焦在“我到底要做哪些内容”上,而不是把所有的精力无谓地内耗在所谓的“剪辑出一个口播”上,而是去“创作出一个口播”。

适合谁

  • 家庭教育、知识付费、个人 IP、商业认知、心理成长类口播博主。
  • 有一条完整原始口播,但不想手动听写、粗剪、找钩子、做字幕和封面的人。
  • 想把「随手拍的长口播」稳定变成「开头更抓人、节奏更干净、视觉更统一」的短视频创作者。

FAB

Feature 功能 Advantage 优势 Benefit 收益
本地 Whisper 中文转写 使用中文、词级时间戳,保留 JSON、SRT、TXT、TSV 和 16 kHz WAV 不用先人工听写,后续剪辑点有时间依据
AI 口播粗剪 删除气口、无效停顿、语气词空转、口误、自我纠正、重复词句和废弃版本 让原始口播更紧凑,但不破坏表达立场和自然语气
全片钩子筛选 从完整素材中找冲突、反转、好奇缺口或核心观点,而不是只看开头 前 3 秒更容易留人,减少好内容输在开场
钩子前置重排 把最强观点放到开头,再自然接回正文,并删除正文重复位置 提高短视频开头冲击力,同时保持逻辑完整
原色保护 延续原片色彩基色、传递函数、矩阵、范围和位深 避免导出后人物发白、发灰、变亮或失真
HyperFrames 竖屏包装 默认 1080×1920,上层动态宋体大字幕,下层完整人物口播 适配抖音、视频号、小红书等竖屏信息流
同视觉封面 封面与动态字幕共享同一份 frame.md、字体和强调色 账号内容看起来更统一,更像一个专业栏目
可追溯工作文件 保留转写、edit_plan.json、复核记录和最终交付 后续复盘、返工、批量化生产都更稳

最终交付

默认交付四类文件:

  • {素材名}_口播优化版.mp4
  • {素材名}_竖屏包装版.mp4
  • {素材名}_竖屏封面.png
  • 工作文件/:转写文件、剪辑计划、复核记录和中间素材

默认画面为 1080×1920 竖屏:上层动态文字,下层人物口播。默认中文字体为本地 Songti SC,主要字重 700。没有额外视觉要求时,使用内置 assets/frame.md

工作流程

  1. 解析输入视频,使用 ffprobe 检查分辨率、帧率、音频、色彩和方向信息。
  2. 使用本地 Whisper 进行中文转写,生成词级时间戳。
  3. 通读整份转写,理解论点、故事结构和收尾。
  4. 标记可删除内容:气口、停顿、废话、口误、重复表达和废弃版本。
  5. 从全片寻找钩子候选,把最强、最真实、最能制造好奇的观点前置。
  6. 生成 edit_plan.json,每个保留片段都写明剪辑理由。
  7. 用 FFmpeg 渲染口播优化版,并延续原片色彩信息。
  8. 重新转写优化版,复核重复、截断、音画同步和生硬接缝。
  9. 用 HyperFrames 制作竖屏动态字幕包装和同视觉封面。
  10. 导出前检查布局、字幕溢出、对比度、人物色彩和最终文件可播放性。

在 WorkBuddy 下怎么用

三种安装方式:

1.手动复制到 ~/.workbuddy/skills/(用户级)或 <工作区>/.workbuddy/skills/(项目级) 2.在对话中让 WorkBuddy 从推荐市场搜索安装或从本地路径安装 3.通过 SkillManage 工具保存 AI 创建的技能

如果 WorkBuddy 已经内置这个技能,直接选择「知识口播 AI 剪辑」工具卡片;如果需要手动导入,把整个技能目录导入 WorkBuddy 的技能库,目录需要包含:

SKILL.md
scripts/
references/
assets/
agents/openai.yaml

然后新建任务,把原始视频上传到项目,或直接提供视频的绝对路径。推荐启动词:

使用「知识口播 AI 剪辑」处理这条口播视频:

素材:/你的/视频/绝对路径.MOV
目标:删除气口、废话、口误和重复内容,从全片寻找最强钩子并前置,输出口播优化版、竖屏包装版和封面。
视觉:没有额外要求时使用默认 frame.md,保持人物原始色彩。

WorkBuddy 更适合把它当成一个成品工具来用:给素材、说目标、等交付。

在 Codex 下怎么用

确认技能已经放在 Codex 技能目录:

~/.codex/skills/edit-knowledge-talking-head/

在 Codex 中打开你的素材项目目录,把视频放进 原始素材/,或者直接给绝对路径。推荐启动词:

use $edit-knowledge-talking-head

素材:/你的/视频/绝对路径.MP4
请按技能流程完成知识口播 AI 剪辑:本地转写、去废话、找钩子并前置、渲染口播优化版、复核、制作 9:16 竖屏动态字幕包装和同视觉封面。

Codex 适合偏工程化的批量处理:你可以把多个素材放在同一个项目里,让它按同一套交付目录和命名规则处理。

在 Claude Code 下怎么用

把技能目录安装或桥接到 Claude Code 的技能目录:

~/.claude/skills/edit-knowledge-talking-head/

也可以放在当前项目的技能目录中,只要 Claude Code 能识别到 SKILL.mdscripts/references/assets/。进入素材项目后,使用类似提示:

请使用 edit-knowledge-talking-head 技能处理这个口播视频:

素材:/你的/视频/绝对路径.MOV
要求:删除气口、废话、口误、重复内容;从全片寻找并前置最强钩子;保持人物原始色彩;输出口播优化版、竖屏包装版和封面。

如果流程进入 HyperFrames 预览或导出阶段,npm run dev 这类长时间运行命令要在 Claude Code 中后台运行,避免前台阻塞任务。

输入要求

  • 支持常见口播视频格式:MP4、MOV、M4V、MKV 等。
  • 素材最好是单人或主讲人为主的口播内容。
  • 如果有品牌视觉要求,可以额外提供 frame.md
  • 如果没有提供 frame.md,默认使用内置视觉规范。
  • 默认使用本地 Whisper medium 模型;如果本地模型缺失,需要先准备模型或明确允许下载。

质量标准

  • 不覆盖原始素材。
  • 默认不上传媒体到云端。
  • 不编造讲述者没说过的话。
  • 不为了高密度而剪碎语气和音节。
  • 不改变人物画面色彩,不加滤镜、不套 LUT、不用主观调色修正技术问题。
  • 钩子必须来自真实素材,不能为了吸睛制造素材里不存在的结论。
  • 字幕必须能在手机上快速阅读,不能溢出、遮挡人物或低对比度。

一句话钩子

如果你会拍口播,但总是卡在剪辑、字幕、封面和开头留人,这套 kbcut 知识口播 AI 剪辑工作流,就是把「会说」变成「能发」的那一步。

如果你在使用过程不会使用、需要协助可以联系作者👇

作者:oops0731111 Mens

视频号:华子聊AI获客

About

一个可以满足口播博主、vlog 博主 等自媒体博主的视频 AI 剪辑工具

Resources

Stars

15 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages