15 秒听起来不算短,真正写起来才知道紧。英语口播大约每秒三个词,日语更慢,西班牙语更快。开场留一拍呼吸、结尾留一拍落地之后,整条视频真正能用的口播大约只有四十个词。平台写出的每一版脚本都按这个预算来,每一条成片在交到人手里之前也按这个预算复核一次。
四个节拍
我们坚持的结构本身并不复杂:
| 0—3 秒 | 3—7 秒 | 7—12 秒 | 12—15 秒 |
|---|---|---|---|
| 争取停留 | 展示商品 | 演示价值 | 干净收尾 |
前三秒决定后面十二秒有没有人看,所以它承载的是一个具体情境,而不是一句总结:出问题的前一刻、用户想要的结果、大家反复追问的那个细节。中间两个节拍做商品详情页做不到的事——一次不被打断的商品特写,再加一件它看得见地能做到的事。结尾之所以短,是因为把最后两秒用来罗列卖点的视频,已经把刚刚争取到的观众丢掉了。
这张表是创作参考,不是节拍器。使用介绍型脚本往往需要商品在第二秒就出现,场景种草型可能会把问题多留一秒。固定不变的只有总时长,以及这四件事都要做完。
为什么时长是约束而不是建议
让一版好脚本超时、后期再想办法,听上去很合理。实际结果通常是两种糟糕情况之一:口播被加速到不像真人在说话,或者台词在第 15 秒被生硬截断。两者都会让画面显得"合成感"很重,而这恰恰是 UGC 内容最不能有的东西。
所以平台在生成之前先算一遍口播长度,生成之后再核一遍。系统自己写的脚本超时,就重写;你自己提供的脚本超时,不会被改写——平台会指出是哪一句超了,并提示你精简。锁定的脚本就是锁定的,这正是提供脚本的意义。
不同语言的预算算法也不同。拉丁字母语言按字符计入较宽的额度,中文、日语、韩语则按更紧的额度计算,因为每个字承载的语音时长更长。这也是英文脚本直译过去通常过不了检查的原因:同样的意思在日语里占不了同样的秒数。本地化要做的是按可用时长重写这句话,而不是把译文一点点删到塞得下。
字幕放在哪里
字幕由分镜节拍直接生成,而不是从音频转写回来。这样字幕与口播天然对齐,字幕文件在视频渲染完成之前就已经存在。
约束有两条。一是每行足够短,避开平台自身的界面元素——右侧的一列按钮和底部的商品卡片。二是画面里不得出现模仿可点击购物组件的元素。画上去的"立即购买"按钮不是设计选择,而是一个假控件,检查这一关不会放行。
三类模板
首期交付三类模板,每一类都是生产配方,而不是视觉风格:
- 人物讲解型。 真人手持商品对镜口播。适合那些需要有人亲口说出来的卖点。
- 场景种草型。 以问题开场,在真实场景中用商品化解。适合价值依赖上下文的商品——你得看见它用在哪儿。
- 使用介绍型。 简短的分步演示,落在最终结果上。适合"我不知道这东西怎么用"这类门槛。
在逐步制作流程里,开场角度会先明确写进脚本,再开始生成画面。如果角度不对或太泛,应当在脚本这一步修改,而不是花钱生成一条换了画面、核心创意仍然薄弱的视频。
通过检查的成片是什么样
在进入审核之前,每条成片都已经核对过:时长是否落在目标区间、口播长度是否符合该语言预算、字幕是否在安全区内、商品呈现是否与记录的事实一致、人物是否与参考帧一致、表达是否符合目标市场。任何一项不通过,这条视频会被标记为失败并附上具体结论,而不是默默交给人去发现。
这就是结构换来的东西:15 秒确实很紧,但产出是可预期的。