我把口播粗剪和复盘交给一个 skill:75 分钟素材剪到 19 分钟
拍口播 1 小时,麻烦的是口播粗剪和复盘:冷场、口头禅、卡壳剪到半夜;发完只看播放量,视频差在哪没人说。我给自己写了个开源工作流 media-review,跑在自己每天的剪辑流程里——这期视频的粗剪就是它做的。本文记录它的结构和实测数据,想直接用的看安装一节。
它包了两件事:发前粗剪,发后归因
1 | 3h 素材 ──cut──▶ 剪映草稿 ──精剪发布──▶ review ──▶ 复盘报告 ──▶ 写回/改进实验 |
一个 /media 入口,按意图路由:要剪素材说”粗剪”,发完视频说”复盘”。粗剪时归档的逐字稿,就是复盘时的直接输入,工作流自己闭环。
发前:三层漏斗,AI 只删铁废料
三层漏斗的设计原则是 AI 不拍板:每一层都有人工复核点,删不删你说了算。
第一层:静音压缩,冷场全砍
挂机跑:ffmpeg 静音检测把思考停顿、喝水、翻稿子的空白压掉,产物时长逐秒对齐,不丢内容。实测 75:33 → 19:28,砍 74%。
第二层:FunASR 转录加 AI 初选
纯 CPU 转录出从句级字幕,9 分 48 秒音频 49 秒转完(RTF 0.06),热词、标点、中文全对。AI 按你的内容大纲初选,只删铁废料:整段重复、纯语气词、乱码。口吃和假起头保留下来标红,进剪映后是你的待办清单。句首口头禅按字级时间戳词级跳剪,实测 38 个句首”然后”逐字抠掉,字幕同步剥字。
第三层:草稿直出,打开剪映就能精剪
直接生成拼好的剪映草稿:主轨引用原素材零重编码,附字幕轨和红色标注轨,剪切点仍是可拖动的分割线。不用从头搭轨道。
发后:复盘是回答”下一条改什么”
复盘不是看播放量。review 子技能干三件事:
- 取数合参:B站创作中心接口自动拉自己账号的数据;DY、XHS截图丢进收集窗。刻意不做后两家的自动化访问:平台协议明确运营数据归平台所有,AI 风控可能导致限流,风险和低频复盘的收益不成比例。
- 三要素归因:数据不好不甩锅玄学,按”爆款 = 选题 × 素材 × 内容”逐要素检查,差在哪给答案。不出爆款,一定是三缺一。
- 跨期验收:D+3 / D+7 / D+30 观察点到点提醒,上期”下条改动”这期验收,改没改对有记录。复盘结果确认后写回知识库:选题池、复用片段、对标,下期开工先查。
素材和选题的验证必须来自人和市场,AI 深度提效的只有内容环节。这就是工具的设计边界。
实测数据(第 2 期 ESP32 环境搭建素材)
| 环节 | 结果 |
|---|---|
| 静音压缩 | 75:33 → 19:28(−74%),录屏段 67–86%,时长逐秒对齐 |
| 转录 | 9:48 音频 49 秒转完(RTF 0.06,纯 CPU),标点/中文/热词全对 |
| AI 初选 | 整句只删铁废料 15%;修错 58 条 |
| 词级跳剪 | 38 个句首”然后”按字级时间戳精确抠掉,字幕同步剥字 |
| 草稿直出 | 主轨 79 段零重编码,剪映 11.x 实测可开 |
安装
Windows + Python 3.10+,剪映专业版可选(草稿直出用)。仓库地址:media-review 开源仓库
1 | git clone https://github.com/zjqjy/media-review.git |
装完只需一次扫码登录 B站(复盘取数用),之后在 Claude Code 里喊 /media 就行。
常见坑
| 症状 | 原因 | 处理 |
|---|---|---|
| 装依赖时模型下载失败 | 装包和下模型对网络的要求相反 | 装包开 VPN;首次下模型(~1.2G)关 VPN 直连 |
| 剪映打不开生成的草稿 | 剪映版本不兼容 | 用剪映专业版 11.x |
| 复盘拉不到 B站数据 | SESSDATA 过期 | 重跑 fetch_bili.py login 扫码 |
| 口头禅没剪干净 | 词级跳剪只处理句首”然后” | 句中的在 Roadmap,精剪阶段手动处理 |
| DY/XHS 没有自动取数 | 刻意不做,见上文合规原因 | 复盘时用截图收件箱人工投喂 |
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 EmbedAI - 嵌入式与AI技术分享!

