功能概述

功能位置

功能界面

做口播、知识分享、产品讲解、解说类视频时,有一个环节很容易把时间耗进去:音频和字幕已经准备好了,但画面还要一句一句地找素材、卡时长、切镜头。
一段配音可能只有几分钟,SRT 字幕却有几十句话。按照传统做法,需要先看每句话从什么时候开始、什么时候结束,再决定这一段配什么视频或图片,素材短了要补时长,长了又要裁剪,最后还要把几十个镜头重新拼起来。
如果一次只做一条,还能慢慢处理;当手里有多套音频、几十个甚至更多素材时,这些重复操作很快就会变成整个流程里比*耗时间的一部分。
这次万剪大师批量剪辑【基础版】新增的 「字幕分段多场景合成」,主要解决的就是这件事。
它不是简单把几段素材随机拼到一起,而是先读取音频对应的 SRT 字幕时间,再根据字幕节奏决定每个镜头应该持续多久,之后再去选择视频或图片素材进行处理。
换句话说,字幕时间轴开始真正参与画面剪辑。
这个功能的基础逻辑很直接。
准备一份音频,并放入一份与音频同名的 SRT 字幕,例如:
产品介绍01.mp3软件会读取字幕中的开始时间和结束时间,根据时间轴生成这一条视频需要的镜头段落。
比如字幕是:
00:00:00,100 --> 00:00:03,144系统拿到的不只是三句话,而是每句话对应的实际时间。
后续选择素材、裁剪、变速和镜头合成,都会围绕这些时间进行。
这也是「字幕分段多场景合成」和普通随机混剪比*明显的区别:不是先拼画面,再想办法把声音塞进去,而是先确定声音和字幕的节奏,再让画面去适配。
字幕很碎的时候,一句话一个镜头未必合适。
比如连续几句字幕分别只有:
0.9秒如果每句话都强制切一个画面,视频很容易出现过于频繁的切换。
所以目前做了两种镜头方式。
适合本身字幕句子比*完整、单句时长也比*合理的内容。
每一条字幕对应一个画面段落,字幕进入下一句,画面也跟着进入下一个镜头。
对于口播解说、产品介绍、知识类内容,这种方式比*直观。
如果觉得字幕切得太碎,可以设置一个最短镜头时长。
比如设为:
3秒第一句只有 0.9 秒,软件不会立刻结束这个镜头,而是继续把下一句的时间累加进去。
一直累加到达到设定时长,再形成一个完整镜头。
最后如果还剩下一小段不足设定时间,也不会单独留下一个很短的尾镜头,而是向前合并。
这样做的目的不是减少字幕,而是让字幕仍然按照原来的时间显示,但画面切换不要过于零碎。
主素材目录里可以同时放视频和图片。
当某个字幕镜头需要一段素材时,软件会根据当前混剪方式从素材池中选择内容。
如果抽到的是视频,就按照当前字幕镜头所需要的时长进行处理。
如果抽到的是图片,则会先把图片转换成视频片段,而且图片生成出来的持续时间不是固定值,而是直接使用当前字幕镜头需要的时间。
例如这一镜头需要:
2.73秒那么这张图片生成的视频片段,就会按照这个镜头需要的时长来处理,而不是统一生成 3 秒、5 秒以后再进行二次裁剪。
对于视频和图片混合使用的素材库,这种方式会更加自然。
字幕时间已经确定以后,素材长度不一定刚好合适。
比如当前镜头需要 4 秒,但抽到的视频有 8 秒。
这时可以选择:
时长多出的裁剪掉
软件会把视频处理到当前镜头需要的长度。
也可以选择:
时长多出的变速
这时会通过变速,让素材时长尽量适配当前字幕镜头。
反过来,如果当前镜头需要 5 秒,但视频素材只有 3 秒,也不会直接留下空缺,而是通过变速让素材补足当前镜头需要的时长。
目前这一部分已经接入新的 视频变速与音频一致2 处理逻辑。
所以从实际使用角度来看,不需要提前把素材全部手工裁成统一长度。
素材可以先按正常方式准备,真正参与合成时,再根据每一个字幕镜头的时间动态处理。
不同人的素材整理习惯不一样,所以主素材没有限制成一种组织方式。
如果所有素材都放在同一个目录,可以直接使用普通混剪。
如果本身已经把素材分成多个子文件夹,也可以按照子文件夹来组织镜头。
目前支持:
例如素材目录本身按照不同场景整理:
办公场景使用子文件夹方式后,可以让不同字幕镜头按照这些素材组进行取材,而不是完全在一个大素材池里随机寻找。
对于已经有固定素材分类习惯的项目,不需要为了使用这个功能重新整理一遍素材。
实际素材里,经常会同时存在横屏、竖屏、方图,以及各种不同比例的视频和图片。
「字幕分段多场景合成」在每个镜头完成时长处理之后,还会按照最终导出分辨率统一处理画面。
可以使用原画面模糊填充,也可以使用颜色填充、图片填充或者视频填充。
同时还可以配合画中画缩小、竖屏偏移等设置,对画面在最终画布中的位置继续调整。
这里的处理逻辑比*明确:
先解决这个镜头应该播放多久,再解决这个镜头应该以什么尺寸、什么方式出现在最终画布里。
这样时长处理和画面比例处理不会混在一起,面对不同来源的素材时也更容易统一。
字幕控制的是每段镜头的时间,但镜头之间不一定只能硬切。
目前可以选择不使用转场,也可以在连续镜头之间加入转场效果。
如果不需要转场,就按照正常镜头顺序直接合成。
如果使用转场,则会在相邻镜头之间加入对应效果。
因为部分转场本身会产生画面重叠,所以合成完成之后,还需要继续检查最终视觉时长,让整条画面尽量保持和原音频一致。
这一层处理的目的很简单:
无论前面有多少镜头、有没有转场,最后还是以原音频长度作为整条视频的时间基准。
这次在「字幕分段多场景合成」里,我们没有继续完全依赖原来的通用 ASS 字幕生成流程,而是针对当前功能重新做了一套独立字幕生成逻辑。
软件直接读取 SRT 中每一条字幕原本的开始时间和结束时间,然后生成标准 ASS 字幕文件。
字体、字号、字幕底边距、单行字数等设置仍然可以继续使用。
例如单行字数设置为:
12程序会在生成 ASS 之前,按照设定的字数主动插入换行。
也就是说,字幕怎么断行是在生成阶段提前确定的,而不是等视频烧录时再交给字幕渲染器自行判断。
对于中文内容来说,这种方式更容易控制每行字幕的长度,也能避免同一批视频里字幕换行位置差异过大。
字幕除了基础的白字黑边之外,也保留了经典花字配色。
勾选「随机用经典花字」以后,每条成片会从当前内置的经典配色中随机选择一套。
这里不是一句字幕换一种颜色,而是:
一条视频随机一次,整条成片保持同一种字幕配色。
这样既能让批量生成的视频之间有一些视觉差异,又不会让一条视频内部的字幕颜色不断变化。
当前配色里包含了普通描边、反色描边、背景框、阴影等不同类型,可以根据实际成片随机使用。
字幕特效这次也重新整理了一遍。
没有继续追求大量复杂效果,而是保留了一批使用 ASS 标准语法就能稳定实现的动画。
目前包括:
例如「弹性放大」不是直接突然出现,而是先从*小比例出现,再稍微放大,最后回到正常大小。
「字间距收拢」则是字幕刚出现时字间距**,随后逐渐收拢到正常状态。
「轻微旋入」会带一点角度和缩放变化,但不会进行大范围的画面移动。
这些效果有一个共同点:不依赖字幕在画面中的复杂坐标计算,也不需要提前知道文字实际宽度。
对于批量生成来说,这种方式更适合长期使用。
如果不需要字幕动画,也可以直接关闭字幕特效,只保留正常字幕显示。
以前比*常见的处理流程是:
视频镜头合成这样一条视频在后面还需要连续进行多次处理。
现在这部分流程已经重新调整。
如果需要字幕,会先生成 ASS 文件,然后在加入原音频时,同步完成字幕烧录。
新的流程更接近:
镜头处理完成如果关闭字幕,则同一个处理流程只负责合入音频。
这样做的好处不是单纯少一个步骤,而是避免成片在后期为了加字幕再单独进行一次完整的视频编码。
整个处理链会更直接一些。
当一次需要生成多条视频时,还有一个比*实际的问题:
同一个素材会不会被不同成片反复抽到?
目前可以开启「素材不重复使用」。
开启以后,程序会记录已经使用过的素材,在后面的任务里继续从未使用的素材中选择。
多线程同时处理时,也会对素材选择进行控制,尽量避免不同任务同时拿到同一个素材。
如果还开启「用完删除素材」,也不是素材刚刚被选中就马上删除。
当前逻辑是:
只有这一条视频最终成功导出以后,才删除本条成片实际使用过的原素材。
如果中途出现失败,原素材仍然保留。
对于一次性素材池、素材不能重复使用,或者希望不同成片之间尽量减少素材重复的项目,这两个选项可以配合使用。
最终成片分辨率仍然可以按照实际需求选择。
包括常见横屏、竖屏分辨率,也可以使用自定义宽度和高度。
每一个视频镜头或者图片镜头,在完成自己的时长处理以后,会继续按照最终导出分辨率进行画面适配。
也就是说,SRT 决定的是:
这一镜头应该播放多久最终分辨率决定的是:
这一镜头最后应该以什么画面尺寸输出两套逻辑分别处理。
这样在同一个素材库里混合使用横屏视频、竖屏视频、横图和竖图时,不需要先手工统一全部素材尺寸。
把整个「字幕分段多场景合成」流程放在一起,大概可以理解成:
读取音频真正决定整条视频节奏的,是最开始那份 SRT 时间轴。
后面的素材选择、时长处理、画面处理和字幕烧录,都围绕这条时间轴继续往下执行。
「字幕分段多场景合成」并不是为了替代所有剪辑方式。
它更适合一种很明确的使用场景:
已经有配音,也已经有对应的 SRT 字幕,同时手里还有一批可以用于画面组合的视频和图片素材。
比如:
这类内容通常都有一个共同点:
声音已经确定,字幕也已经确定,真正重复的是后面的画面匹配工作。
这次做「字幕分段多场景合成」,其实就是把原本需要人工反复查看字幕时间、计算镜头长度、调整素材时长的部分,尽量交给字幕时间轴来驱动。
以前的思路更多是:
我有一批素材,先看看怎么拼现在可以变成:
我的声音和字幕已经确定,这也是这次功能更新最想解决的问题。
让字幕不只是最后显示在画面上的文字,而是真正参与到整条视频的镜头组织里。