导入视频,自动转写成带时间戳的字幕。之后你面对的不再是密密麻麻的轨道, 而是一篇可勾选、可编辑的文稿——留下的句子=成片,划掉的句子=删除。 AI 先帮你挑一遍,你说了算,一键导出。
口播、访谈、演讲、课程——这类以「说话」为主的视频,内容都写在字幕里。 可传统时间轴剪辑,逼你在波形上反复拖动、试听、定位,把一个「读文稿」就能做的决定, 变成了一次次机械的手部操作。效率低,也累。
我们换了个思路:字幕才是视频真正的索引。 把视频摊成一篇可读、可勾选的文稿,你像审稿一样决定去留,机器负责把这些决定精确落到时间线上。 判断回归内容,操作交给工具。
拖入视频后,转写、AI 初筛自动完成;你只做最值钱的那一步——决定留什么。
拖进一个本地视频,或粘贴文件路径。原始视频只读不改,全程非破坏性。
自动把视频里说的话变成字幕,每个字都能对回视频的精确位置;转写过的文件下次不重转。
导入即自动初剪,寒暄口癖重复默认取消勾选;想要整套成片,点「AI 智能剪辑」一次分主题、挑金句、按时长筛句。
勾选、改字、调顺序,边改边试听。满意后一键导出成片视频。
从粗剪到精修,从单句微调到整片重排,一个界面里全部搞定。
勾选=保留,取消=划线灰显的删除;文本能直接改,改动与勾选自动保存,永不丢。
默认只播「保留」的内容,进度条走成片时间轴;一键切回原片对照,点删掉的句子可单句试听、决定要不要捞回。
展开词块面板,点一个词就删/恢复一个词;波形上的切点竖线可鼠标拖动,每次调整自动做「接缝试听」。
一键先秒剪规则命中的「呃 / 嗯」和紧邻重复;同时 AI 深扫规则漏网的填充语("就是说""怎么说呢"),逐字落位补剪,一次撤销整批还原。
AI 通读全片,把看点(主题)与背景/案例分开,每段给出时长。它是「AI 出方案」的第一步,也能单独打开查看、改名、合并。
AI 在主题里挑 3–5 个「能单句立住」的金句并说明理由,你决定置顶/保留/弃用;任意句子也能手动点⭐自选。
设定目标时长(分钟),实时显示 目标 / 预计 / 差额;超支给「可删清单」,只建议、绝不静默删,锁定的金句永不进删除列表。
标出转写里可能听错的词,AI 结合上下文判断:确定的自动改(可整批撤销),拿不准的高亮留人工,宁漏改不错改。
改对一个词,系统提示「其他句还有 N 处,一起换?」,并可把正词存进词典——改一次,以后不再错。
抓住句首把手上下拖,金句提前、结论前置随便排;同一句可重复出现做强调,导出严格按你排的顺序。
已经想好留哪些话、什么顺序?把文字稿粘进来,系统自动对回原视频剪成这一版;错字标点自动容错,原片没有的改写只提醒、绝不硬凑。
同一个视频可以存多个剪辑版本——AI 出的、你手工精修的、从文字稿导入的,各存一份、随时切换、互不覆盖。
剪辑被理清成清清爽爽的两步:AI 通读字幕、一次调用出整套方案;剩下的判断与手感,交给你在编辑器里精修。原来割裂的「口播精剪 / 主题切片 / 金句混剪」三个模式,已合并成这一条流水线。
给一句意图、一个目标时长,点一下,AI 一次跑完三个阶段,几十秒出整套方案——它永远只从你已有的句子里选,不编造内容或时间。
看实际效果,做最后的判断——AI 只出方案,你说了算。每次 AI 出方案都只新增一套,绝不覆盖你手工的成果。
越是以语言为主、越是长的内容,用文字剪的效率优势越明显。
一条几分钟的口播,删掉废话口癖、提炼金句,几分钟出干净成片。
长课程按主题切片,一次录制拆成一系列可单发的知识短片。
长对话通读全片、定位重点段落,抓出可传播的高光片段。
把一场长演讲的精华浓缩成短片,金句前置,为社交平台重新组织节奏。
专注把一件事做透——用文字剪「以说话为主」的视频。下面这些它刻意不做,好让它在自己的领域足够好用。
项目、字幕、剪辑决策、成片都存在你自己电脑里;只把音频发去做转写。视频不上云,重启不丢。
AI 的每个判断都能被你一键推翻;它只能从你已有的句子里选,不会生成或改动任何时间戳。
全程不修改原始视频,所有决定都可回退。删错的句子随时勾回来,改坏的方案切回上一套。
成片里的每一段都能追回到原始的那句话,删了什么、改了什么都有据可查。
网页版用来人工精修,命令行用来让脚本 / AI 批量驱动——两边产物互通,可以来回接力。
浏览器里拖入视频,边看边改。播放器、字幕行、AI 面板、质检、预算、导出全在一个页面。
同一套引擎的 CLI,适合脚本或 AI 批量跑。产物与网页版共用工作区,可来回接力。
昨晚(07-23)补齐了内容规划的闭环,今天(07-24)把 AI 剪辑彻底重构成「两步核心」。以下是这两次更新的要点。