字幕分段多场景合成 - 音频SRT字幕生成视频

万剪大师批量剪辑软件
2026-09-25

功能概述

字幕分段多场景合成2 (1).png



功能位置

字幕分段多场景合成-位置.png



功能界面

字幕分段多场景合成-界面.png



做口播、知识分享、产品讲解、解说类视频时,有一个环节很容易把时间耗进去:音频和字幕已经准备好了,但画面还要一句一句地找素材、卡时长、切镜头。

一段配音可能只有几分钟,SRT 字幕却有几十句话。按照传统做法,需要先看每句话从什么时候开始、什么时候结束,再决定这一段配什么视频或图片,素材短了要补时长,长了又要裁剪,最后还要把几十个镜头重新拼起来。

如果一次只做一条,还能慢慢处理;当手里有多套音频、几十个甚至更多素材时,这些重复操作很快就会变成整个流程里比*耗时间的一部分。

这次万剪大师批量剪辑【基础版】新增的 「字幕分段多场景合成」,主要解决的就是这件事。

它不是简单把几段素材随机拼到一起,而是先读取音频对应的 SRT 字幕时间,再根据字幕节奏决定每个镜头应该持续多久,之后再去选择视频或图片素材进行处理。

换句话说,字幕时间轴开始真正参与画面剪辑。

一份音频、一份同名字幕,就能确定整条视频的镜头节奏

这个功能的基础逻辑很直接。

准备一份音频,并放入一份与音频同名的 SRT 字幕,例如:

产品介绍01.mp3
产品介绍01.srt

软件会读取字幕中的开始时间和结束时间,根据时间轴生成这一条视频需要的镜头段落。

比如字幕是:

00:00:00,100 --> 00:00:03,144
第一段字幕

00:00:03,144 --> 00:00:04,080
第二段字幕

00:00:04,080 --> 00:00:05,208
第三段字幕

系统拿到的不只是三句话,而是每句话对应的实际时间。

后续选择素材、裁剪、变速和镜头合成,都会围绕这些时间进行。

这也是「字幕分段多场景合成」和普通随机混剪比*明显的区别:不是先拼画面,再想办法把声音塞进去,而是先确定声音和字幕的节奏,再让画面去适配。

镜头不一定非要“一句话切一次”

字幕很碎的时候,一句话一个镜头未必合适。

比如连续几句字幕分别只有:

0.9秒
1.1秒
1.4秒
0.8秒

如果每句话都强制切一个画面,视频很容易出现过于频繁的切换。

所以目前做了两种镜头方式。

一句话一个镜头

适合本身字幕句子比*完整、单句时长也比*合理的内容。

每一条字幕对应一个画面段落,字幕进入下一句,画面也跟着进入下一个镜头。

对于口播解说、产品介绍、知识类内容,这种方式比*直观。

每个镜头大于指定秒数

如果觉得字幕切得太碎,可以设置一个最短镜头时长。

比如设为:

3秒

第一句只有 0.9 秒,软件不会立刻结束这个镜头,而是继续把下一句的时间累加进去。

一直累加到达到设定时长,再形成一个完整镜头。

最后如果还剩下一小段不足设定时间,也不会单独留下一个很短的尾镜头,而是向前合并。

这样做的目的不是减少字幕,而是让字幕仍然按照原来的时间显示,但画面切换不要过于零碎。

视频和图片都可以直接作为镜头素材

主素材目录里可以同时放视频和图片。

当某个字幕镜头需要一段素材时,软件会根据当前混剪方式从素材池中选择内容。

如果抽到的是视频,就按照当前字幕镜头所需要的时长进行处理。

如果抽到的是图片,则会先把图片转换成视频片段,而且图片生成出来的持续时间不是固定值,而是直接使用当前字幕镜头需要的时间。

例如这一镜头需要:

2.73秒

那么这张图片生成的视频片段,就会按照这个镜头需要的时长来处理,而不是统一生成 3 秒、5 秒以后再进行二次裁剪。

对于视频和图片混合使用的素材库,这种方式会更加自然。

素材时长不合适,软件自动处理

字幕时间已经确定以后,素材长度不一定刚好合适。

比如当前镜头需要 4 秒,但抽到的视频有 8 秒。

这时可以选择:

时长多出的裁剪掉

软件会把视频处理到当前镜头需要的长度。

也可以选择:

时长多出的变速

这时会通过变速,让素材时长尽量适配当前字幕镜头。

反过来,如果当前镜头需要 5 秒,但视频素材只有 3 秒,也不会直接留下空缺,而是通过变速让素材补足当前镜头需要的时长。

目前这一部分已经接入新的 视频变速与音频一致2 处理逻辑。

所以从实际使用角度来看,不需要提前把素材全部手工裁成统一长度。

素材可以先按正常方式准备,真正参与合成时,再根据每一个字幕镜头的时间动态处理。

素材怎么取,也不只一种方式

不同人的素材整理习惯不一样,所以主素材没有限制成一种组织方式。

如果所有素材都放在同一个目录,可以直接使用普通混剪。

如果本身已经把素材分成多个子文件夹,也可以按照子文件夹来组织镜头。

目前支持:

  • 普通混剪
  • 子文件夹顺序混剪
  • 子文件夹乱序混剪

例如素材目录本身按照不同场景整理:

办公场景
产品特写
人物操作
环境镜头
细节画面

使用子文件夹方式后,可以让不同字幕镜头按照这些素材组进行取材,而不是完全在一个大素材池里随机寻找。

对于已经有固定素材分类习惯的项目,不需要为了使用这个功能重新整理一遍素材。

不同尺寸的素材,也可以统一到最终画面

实际素材里,经常会同时存在横屏、竖屏、方图,以及各种不同比例的视频和图片。

「字幕分段多场景合成」在每个镜头完成时长处理之后,还会按照最终导出分辨率统一处理画面。

可以使用原画面模糊填充,也可以使用颜色填充、图片填充或者视频填充。

同时还可以配合画中画缩小、竖屏偏移等设置,对画面在最终画布中的位置继续调整。

这里的处理逻辑比*明确:

先解决这个镜头应该播放多久,再解决这个镜头应该以什么尺寸、什么方式出现在最终画布里。

这样时长处理和画面比例处理不会混在一起,面对不同来源的素材时也更容易统一。

镜头之间可以继续加入转场

字幕控制的是每段镜头的时间,但镜头之间不一定只能硬切。

目前可以选择不使用转场,也可以在连续镜头之间加入转场效果。

如果不需要转场,就按照正常镜头顺序直接合成。

如果使用转场,则会在相邻镜头之间加入对应效果。

因为部分转场本身会产生画面重叠,所以合成完成之后,还需要继续检查最终视觉时长,让整条画面尽量保持和原音频一致。

这一层处理的目的很简单:

无论前面有多少镜头、有没有转场,最后还是以原音频长度作为整条视频的时间基准。

字幕也重新做了一套独立生成逻辑

这次在「字幕分段多场景合成」里,我们没有继续完全依赖原来的通用 ASS 字幕生成流程,而是针对当前功能重新做了一套独立字幕生成逻辑。

软件直接读取 SRT 中每一条字幕原本的开始时间和结束时间,然后生成标准 ASS 字幕文件。

字体、字号、字幕底边距、单行字数等设置仍然可以继续使用。

例如单行字数设置为:

12

程序会在生成 ASS 之前,按照设定的字数主动插入换行。

也就是说,字幕怎么断行是在生成阶段提前确定的,而不是等视频烧录时再交给字幕渲染器自行判断。

对于中文内容来说,这种方式更容易控制每行字幕的长度,也能避免同一批视频里字幕换行位置差异过大。

经典花字配色继续保留

字幕除了基础的白字黑边之外,也保留了经典花字配色。

勾选「随机用经典花字」以后,每条成片会从当前内置的经典配色中随机选择一套。

这里不是一句字幕换一种颜色,而是:

一条视频随机一次,整条成片保持同一种字幕配色。

这样既能让批量生成的视频之间有一些视觉差异,又不会让一条视频内部的字幕颜色不断变化。

当前配色里包含了普通描边、反色描边、背景框、阴影等不同类型,可以根据实际成片随机使用。

字幕特效重新精简,**保证稳定

字幕特效这次也重新整理了一遍。

没有继续追求大量复杂效果,而是保留了一批使用 ASS 标准语法就能稳定实现的动画。

目前包括:

  • 无特效
  • 淡入淡出
  • 透明渐显
  • 弹性放大
  • 放大回落
  • 缩小出现
  • 轻微旋入
  • 字间距收拢
  • 横向弹跳
  • 纵向弹跳
  • 轻微摇摆
  • 随机安全特效

例如「弹性放大」不是直接突然出现,而是先从*小比例出现,再稍微放大,最后回到正常大小。

「字间距收拢」则是字幕刚出现时字间距**,随后逐渐收拢到正常状态。

「轻微旋入」会带一点角度和缩放变化,但不会进行大范围的画面移动。

这些效果有一个共同点:不依赖字幕在画面中的复杂坐标计算,也不需要提前知道文字实际宽度。

对于批量生成来说,这种方式更适合长期使用。

如果不需要字幕动画,也可以直接关闭字幕特效,只保留正常字幕显示。

加音频和烧录字幕,现在可以放在一次处理中完成

以前比*常见的处理流程是:

视频镜头合成
↓
加入原音频
↓
再次编码烧录字幕
↓
最终导出

这样一条视频在后面还需要连续进行多次处理。

现在这部分流程已经重新调整。

如果需要字幕,会先生成 ASS 文件,然后在加入原音频时,同步完成字幕烧录。

新的流程更接近:

镜头处理完成
↓
生成ASS字幕
↓
一次完成原音频合入 + ASS字幕烧录
↓
最终导出

如果关闭字幕,则同一个处理流程只负责合入音频。

这样做的好处不是单纯少一个步骤,而是避免成片在后期为了加字幕再单独进行一次完整的视频编码。

整个处理链会更直接一些。

批量处理时,可以控制素材是否重复使用

当一次需要生成多条视频时,还有一个比*实际的问题:

同一个素材会不会被不同成片反复抽到?

目前可以开启「素材不重复使用」。

开启以后,程序会记录已经使用过的素材,在后面的任务里继续从未使用的素材中选择。

多线程同时处理时,也会对素材选择进行控制,尽量避免不同任务同时拿到同一个素材。

如果还开启「用完删除素材」,也不是素材刚刚被选中就马上删除。

当前逻辑是:

只有这一条视频最终成功导出以后,才删除本条成片实际使用过的原素材。

如果中途出现失败,原素材仍然保留。

对于一次性素材池、素材不能重复使用,或者希望不同成片之间尽量减少素材重复的项目,这两个选项可以配合使用。

横屏、竖屏和自定义分辨率都可以继续使用

最终成片分辨率仍然可以按照实际需求选择。

包括常见横屏、竖屏分辨率,也可以使用自定义宽度和高度。

每一个视频镜头或者图片镜头,在完成自己的时长处理以后,会继续按照最终导出分辨率进行画面适配。

也就是说,SRT 决定的是:

这一镜头应该播放多久

最终分辨率决定的是:

这一镜头最后应该以什么画面尺寸输出

两套逻辑分别处理。

这样在同一个素材库里混合使用横屏视频、竖屏视频、横图和竖图时,不需要先手工统一全部素材尺寸。

一条成片,实际是按照这条链路跑下来的

把整个「字幕分段多场景合成」流程放在一起,大概可以理解成:

读取音频
↓
查找同名SRT字幕
↓
解析字幕时间轴
↓
按照字幕时间生成镜头长度
↓
根据混剪模式选择视频或图片素材
↓
按照镜头时长裁剪或变速
↓
图片转换为对应时长的视频镜头
↓
按照最终分辨率统一画面
↓
加入转场或直接合成
↓
校正最终画面总时长
↓
生成ASS字幕
↓
合入原音频并同步烧录字幕
↓
导出最终视频

真正决定整条视频节奏的,是最开始那份 SRT 时间轴。

后面的素材选择、时长处理、画面处理和字幕烧录,都围绕这条时间轴继续往下执行。

更适合已经有“音频 + 字幕 + 素材库”的工作方式

「字幕分段多场景合成」并不是为了替代所有剪辑方式。

它更适合一种很明确的使用场景:

已经有配音,也已经有对应的 SRT 字幕,同时手里还有一批可以用于画面组合的视频和图片素材。

比如:

  • 口播解说
  • 产品介绍
  • 知识类视频
  • 图文解说
  • 音频配画面
  • 批量内容剪辑
  • 多素材混合成片

这类内容通常都有一个共同点:

声音已经确定,字幕也已经确定,真正重复的是后面的画面匹配工作。

这次做「字幕分段多场景合成」,其实就是把原本需要人工反复查看字幕时间、计算镜头长度、调整素材时长的部分,尽量交给字幕时间轴来驱动。

以前的思路更多是:

我有一批素材,先看看怎么拼

现在可以变成:

我的声音和字幕已经确定,
先把镜头节奏算出来,
再让素材按照这个节奏去组成画面。

这也是这次功能更新最想解决的问题。

让字幕不只是最后显示在画面上的文字,而是真正参与到整条视频的镜头组织里。




分享