作者 Weirdfish
个人主页:https://www.modelscope.cn/profile/weirdfish
《齐马蓝》原本是英国科幻作家阿拉斯泰尔·雷诺兹的短篇小说,后来被《爱,死亡和机器人》改编成同名动画。我们保留了齐马、钴蓝色、泳池和清扫机,也保留了“回到起点”的故事走向,重新写旁白并安排镜头。
当然这未必一次很好的改编,从aigc的技术上来说也是,中间存在不少重复相似的画面,场景漂移,穿帮,画面大多缺少复杂的动态,剧情依靠旁白推动,分镜是为了有而有,离我心中比较完善的短片,大概还有很多的距离,写这个教程权当是给初学者以及像我这样跌跌撞撞的人一点点建议。
下面按实际制作顺序讲改编、旁白、镜头表、母图、视频生成、剪辑、声音和字幕。具体工具可以替换,但每一步都要有清楚的检查标准。片中的视频镜头统一使用 MiniMax H3 生成。
动手写剧本前,先把“保留什么、改什么”写清楚。否则制作到一半,很容易一边追求原作还原,一边又想加入新设定,最后两边都没有讲完整。
我们给这次改编划出的边界是:保留齐马对蓝色的追索、泳池清扫机的来历和回到原始形态的结尾;删去容纳不下的支线;把故事改写成齐马在公开展示现场进行的一段第一人称回顾。
可以先用一句话检查改编是否成立:
一位把作品扩展到行星尺度的机械艺术家,在最后一次公开展示中追查钴蓝色的来源,并回到泳池清扫机的形态。
这句话里要有主角、变化和结尾。若只能写出“一个关于自我与宇宙的故事”,后面就很难拆成可拍的动作。
这一步应留下两份东西:一段一句话梗概,以及一页改编说明。说明里写清保留的角色与意象、删去的情节和重新创作的部分。
第二步:先写行动线,再决定旁白或者台词
先暂时拿掉旁白,只写齐马做了什么,以及每个动作带来了什么结果。故事应由角色的选择推动:齐马回看不断扩大的蓝色作品,找到泳池清扫机的起源,最终脱下红布、进入泳池,重新开始清扫。即使静音播放,观众也应该能看懂他发现了什么、作出了什么决定,以及结尾发生了什么变化。
把关键行动按因果顺序排列,再根据动作本身确定时长。若两个段落只能依靠一句旁白连接,说明中间缺少可见的动作或转场。不要先写一段完整独白,再让画面被动填满它的时长。
行动线成立后,再判断哪里需要旁白。旁白只补充画面难以直接表达的内容,例如齐马的记忆、时间跨度和他对蓝色的理解;画面已经说清的动作,不必再解释。删掉旁白后,观众可以少知道一些齐马的内心,但不能看不懂故事。
第三步:把故事拆成分镜镜头表
先把故事分成几个视觉段落,再为每段写清观众必须看到什么。镜头数量不用提前锁死;能用一镜讲清的内容,不要为了凑节奏拆成两镜。
每个镜头至少填写以下内容:镜头编号、时长、叙事作用、首帧状态、唯一主动作、摄影机运动、结束状态、所需参考图、禁止出现的内容、与下一镜的连接方式。可以直接照下面这一行填写:
编号 | 时长 | 叙事作用 | 首帧 | 主动作 | 运镜 | 尾帧 | 参考图 | 禁止项 | 下一镜 |
S02 | 5秒 | 看清齐马的决定 | 齐马右侧中近景 | 视线移向泳池,头转约5度 | 慢推约6% | 停稳并保持视线 | 齐马近景、会场 | 不说话、不脱衣、不切镜 | 切入过去的宇宙作品 |
以开场为例,第一镜负责交代“很多人在等”,第二镜才让观众看清齐马。两镜共享会场,却承担不同信息。
图2:第一镜只建立会场、人群和远处的齐马
图3:第二镜收近到人物,让红布、机械脸和蓝眼可见
拆镜时不要跟着标点一刀一镜。我们更看重思路是否发生变化。宇宙段的五镜不能都写成“蓝色星球大全景”,否则虽然句子不同,画面仍在重复。
图4:人物与行星表面的施工尺度
图5:观看者补上了作品与公共世界的关系
镜头表填完后,把每镜按预计时长做成色块,配上临时朗读,得到一条占位时间线。检查时逐段问:这一镜新增了什么?去掉后是否影响下一镜?连续两镜是否承担同一任务?若说不出新增信息,就合并或删除,再进入母图阶段。
第四步:为角色、场景和关键动作准备母图
先准备角色、场景和关键道具参考图,再根据镜头需要组合使用。普通镜头用一张稳定首帧;需要明确落点的转场准备首尾两张;复杂镜头再补充人物、环境或道具参考图。每张图只承担清楚的一项职责。
先做人物与场景设定,再做镜头首帧
齐马至少需要三种状态:正式亮相时的红布造型、工作状态、脱下红布后的机械身体。它们要共享机械面孔、蓝眼和身体比例,但服装职责不同。清扫机也需要独立设定,不能让模型把人形轮廓带到机器上。
场景方面,我们分别固定会场、宇宙创作空间、档案设施和水下泳池。泳池尤其要提前规定长轴方向、瓷砖尺度、池壁与池底的关系,否则入水、落底和贴墙清扫很难接起来。
母图从一张设定卡开始
先为人物和场景各写一张设定卡,再据此生成镜头首帧。人物卡固定脸部或机械面孔、身体比例、服装穿法、材质和主色;场景卡固定空间轴线、地标、光线方向、色彩范围和禁止出现的元素。
静帧提示词可以按这个顺序写:主体身份与不可变化项、当前服装或状态、场景几何、景别和机位、光线与颜色、材质风格、排除项。例如:
「同一个齐马,黑色分段机械身体,窄钴蓝机械眼,厚重红布从左肩斜跨胸前;右侧中近景,黄昏会场在后方;哑光手绘块面;不改变面部结构,不增加披风层数。」
首帧构图要与最终画幅一致,并提前给遮幅和双语字幕留出空间。候选图按镜头编号和版本编号命名,方便比较和回退。
每轮只改一个主要问题。人物对但场景错,就只改场景描述;构图对但材质跑偏,就只改材质与排除项。连续三轮仍无法保住人物识别特征时,退回人物设定卡,不要继续在镜头提示词末尾堆词。
先选生成方式:首帧、首尾帧和全能参考各有用途
H3 的首帧模式、首尾帧模式和全能参考不是一回事。首帧模式适合构图已经确定、只需要画面从这张图开始运动的镜头;首尾帧模式适合起点和落点都必须明确的转场;全能参考则用多张图片、动作视频或声音样本共同约束人物、场景、动作和声音。
先问自己最需要锁住什么。如果必须与某张分镜图完全一致,就用首帧模式;如果必须从机械眼准确落到蓝色颜料,就用首尾帧模式;如果要同时保住齐马的外形、会场空间和清扫机结构,并参考一段动作节奏,就用全能参考。不要为了“控制更多”而选择全能参考。参考越多,冲突也越多。
首尾帧素材不能与全能参考的图片、视频和音频混在同一次任务里。要在提交前选定一条控制路线。既想锁首帧,又想复制动作时,可以先用全能参考生成动作版本,再从可用画面导出一帧,转入下一条首帧任务。
全能参考的素材怎么准备
全能参考可以同时接收图片、视频和音频。图片负责外形与空间,视频负责动作或运镜,音频负责声线、台词节奏或声音质感。单次最多可放 9 张图片、3 段视频和 3 段音频,全部素材合计不超过 12 个;但实际制作时应从最少素材开始,能用两张图解决,就不要先塞满九张。
每份素材先做一次清理。人物图要看清脸、身体比例和服装关系,避免手臂被遮挡;场景图要看清空间轴线和地标;道具图尽量使用干净背景,避免把摄影棚、展示台和文字一起带入画面;动作视频只截取需要模仿的动作,不要保留无关的开头和结尾;音频只保留要参考的声线或节奏,并去掉明显底噪。
素材之间也要互相检查。两张人物图的脸型、服装和材质若不一致,模型往往会在运动中来回混合;人物图和场景图若光线方向完全相反,主体容易像贴在背景上;动作视频里的人物比例与目标角色差别太大,手脚幅度也可能被错误继承。遇到这些冲突,先改素材,不要急着在提示词里解释。
一次全能参考任务怎么做
在 H3 中选择全能参考,不要同时启用首帧或首尾帧模式。 先上传人物图和场景图。需要锁定道具结构时再加道具图,需要模仿动作时再加参考视频。音频不能单独使用,至少要同时有一张图或一段视频。 上传完成后核对素材编号。网页、API 或 ComfyUI 的界面可能不同,但提示词里的“图 1”“视频 1”“音频 1”必须与实际顺序一致。顺序错了,后面的职责说明也会全部错位。 先设置画幅和时长,再写提示词。动作视频和音频只截取本镜头需要的部分;参考段落太长,会把无关动作、停顿或底噪一起带进来。 提示词按四段写:参考素材分工、首秒状态与主动作、摄影机和时间节拍、禁止项。不要把人物设定、动作、声音和排除项揉成一个长句。 第一次只生成短测试。先看人物和空间是否稳定,再检查动作,最后才听声音。若第一步已经变脸或串景,后面的音效再好也不值得保留。
全能参考的价值不是一次解决所有问题,而是把不同控制来源拆开。哪份素材控制哪件事,写得越清楚,返工时越容易只替换出问题的那一份。
给每份参考素材写“负责什么”和“不负责什么”
上传后按“图 1、图 2、视频 1、音频 1”给素材编号。每份素材只分配一个主要职责,再补一句禁止继承项。不要笼统地写“参考以上素材”。
提示词开头可以直接这样写:
「图 1 只锁定齐马的机械面孔、身体比例和红布穿法,不继承背景。图 2 只锁定同一座会场的看台、泳池与黄昏光线,不继承人物和机位。图 4 只锁定清扫机的机身比例与传感器,不继承白色展示背景。视频 1 只参考脱下红布的动作顺序,不继承演员身份与服装。」
接着再写本镜头要发生什么:
「镜头开始时,齐马站在干燥平台中央。0.5—3.4 秒,右手先解开胸前固定点,红布沿左肩完整滑落;身体比例、机械面孔和会场轴线保持不变。3.4—4.2 秒停稳。不要提前入水,不要增加第二块布,不要把红布变成外套或围巾。」
这里的顺序很重要:先写参考素材分工,再写时间轴,最后写高风险错误。这样生成失败后能看出问题出在身份、场景、动作还是负面约束,而不是面对一大段提示词反复猜。
全能参考不要一步堆满
先做一条短测试,只放人物图和场景图,让角色完成转头、抬手或向前走两步。人物和空间都稳定后,再加入道具图;动作仍不准确,才增加动作视频;确实需要同步台词或声音质感时,最后再加音频。每增加一种素材,只检查它是否改善了目标问题,同时观察是否引入新的漂移。
如果人物变脸,先减少人物参考,只留一张身份最清楚的正面或四分之三侧面图;如果背景里出现展示台或白底,检查道具图并明确“不继承背景”;如果动作正确但身体比例被带偏,保留动作视频的节奏,缩小对姿态细节的要求,必要时拆镜;如果模型把多张图混成新角色,说明职责有重叠,应删掉作用相近的参考图,而不是继续加图。
一条全能参考镜头通过后,要记下真正起作用的最小素材组合。下一镜只沿用仍需保持的参考,不要机械复制整套素材。角色近景可能只需要人物图和场景图;水下清扫镜头则需要水下空间图和清扫机图,不再需要红布造型。
选“能动五秒”的图,不只选最好看的图
筛选首帧时,除了构图,还要看前景是否给摄影机推进留出空间、人群能否产生分层运动、主角会不会在运动中被遮住。
每张候选图检查五项:叙事对象是否正确,人物的三项识别特征是否保留,场景锚点是否一致,主体前方是否有动作空间,手、脸和机械连接处是否已出现结构错误。前四项必须全部通过;运动主体已有结构错误,直接淘汰。
第五步:用 MiniMax H3 生成镜头
所有镜头统一使用 MiniMax H3 生成。分辨率和推理配置按镜头时长与构图分别测试,不必强行套用同一组参数。
H3 镜头提示词要跟生成方式对应。首帧或首尾帧模式先声明输入帧及其约束;全能参考先写各份素材的职责。后面的时长、分段动作、摄影机运动、声音、结束状态和禁止项,都要写清。
一条五秒镜头可以先写成这样的短骨架:
「0—0.6 秒保持首帧;0.6—4.2 秒完成一次主动作;4.2—5.0 秒稳定,留作剪辑尾柄。全程不切镜,无字幕和水印。」
画面和声音放进同一条时间轴
H3 可以在生成画面时同步完成旁白、环境声和动作音效。声音不要只写成“带环境声”,而要和画面动作使用同一组秒点。例如:
「0.6 秒后齐马开始转头,同时出现轻微机械关节声;1.2 秒开始说出旁白‘我曾用星光作画’,语气平静,句尾在 4.0 秒前结束;会场人群声保持在远处,不盖住旁白;全程无音乐。」
一条镜头的声音可以按四层写:旁白写清文本、说话者、语气和起止位置;环境声说明空间及远近;动作音效绑定可见动作;音乐只写是否出现以及何时进入或淡出。没有声音需要的镜头也直接写“无旁白,只保留水下低频与机械运转声”,不要让模型自行猜测。
如果多条镜头由同一人物旁白,全能参考可以加入一小段干净声音样本,并注明“音频 1 只负责齐马的声线、语速和克制语气,不继承原台词、底噪或音乐”。先用一句短台词测试;声线稳定后,再生成正式镜头。
把情绪翻译成身体变化
“齐马显得决然”太宽。开场近景最后写成了可见动作:视线移向泳池,机械头部转约五度,下颌轻抬一次,摄影机慢推约 6%。模型仍可能做错,但至少有明确的验收对象。
简单镜头只留一个主动作,复杂镜头必须分阶段
看瓷砖的镜头只负责让观众认出那件旧物,短写法可以是:
「齐马低头看手中的蓝色瓷砖,身体保持不动。」
图6:瓷砖特写只负责让观众看清这件旧物
有严格因果的动作要按阶段和切点编排。例如先脱下红布,保持片刻,再切到入水;身体完全入水并稳定仰卧后,才开始解体。
「0.5—3.4 秒脱下完整红布;3.4—4.2 秒保持;4.2 秒硬切;完全入水后才后仰;稳定仰卧后才开始解体。」
图7:先让红布与机械身体完整分离,再进入下一动作
只有一个主体变化时,用五秒单动作镜头;动作存在严格因果时,写成分段时间表;任一阶段无法单独验收,就拆成多条素材。顺序正确但出现形变或失重感,仍然判为失败,应缩短动作或改用可控动画。
用上一条素材的可用尾帧接下一镜
尾段失控时,在错误发生前截断,导出最后一个身份、方向和位置都正常的画面,作为下一镜的首帧参考。比如清扫机靠近墙面后开始碰撞,就在碰撞前切断,再由下一镜完成伸臂和擦洗。
对应的短提示词是:
「机器沿池底前进两到三块瓷砖,在墙前减速;接近状态保持稳定,供下一镜续接。」
这套做法可以直接复用:先在前一条素材里找到身份、方向和位置都正常的最后一帧,把它导出为下一镜的首帧参考。若前后两帧的机器朝向、大小或墙面位置对不上,就不要靠转场遮掩,退回去重做下一镜首帧。
负面约束只写高风险错误
眼睛到颜料的镜头要求机械眼保持金属外圈、平面蓝色玻璃和中央感光点,同时禁止有机虹膜、瞳孔隧道、门户、海洋和闪白。
图8:眼睛到颜料转场的起点
图9:转场终点是蓝色颜料表面
若机械结构逐渐漂成有机虹膜,就属于“物体身份改变”。这时应重新生成,或者放弃连续变形,改用两个稳定镜头剪接。继续增加形容词不能替代重生或改分镜。
水下解体要明确限制:红布不能入水,身体完全入水后才开始拆解,外壳不能爆炸或融化,清扫机第一次露面时就应是完整机器。即使事件顺序正确,只要部件缺少水阻和重量反馈,也应退回动作设计,把解体拆成更短阶段,或改用可控动画完成外壳运动。
图10:水下解体的事件顺序正确;重量反馈不符合验收项,应退回动作设计
每条视频生成后先看四项:首帧或首尾帧模式要核对端点,全能参考要核对首秒的人物、场景和道具状态;主动作是否完整发生且顺序正确;人物、物体和场景有没有改变身份;结尾是否有至少 0.3 秒稳定画面可供剪辑。端点或首秒状态不对,先检查输入素材和职责分工;动作失败就重生或拆镜;身份改变则重做参考素材或改分镜;局部失控则先标出可用区间,再判断能否通过剪辑保留。
第六步:先做粗剪,再继续生成
先把 H3 生成的镜头接成粗剪。第一遍静音播放,只检查故事骨架;第二遍打开 H3 同步生成的旁白和音效,检查声音是否帮助动作与节奏。此时先不要补音乐或重做声音。
粗剪前先统一尺寸、帧率和像素比例。然后逐镜只取可用区间,尤其要查看生成视频的最后一秒。很多形变、闪烁和多余动作都发生在尾部,提前切掉往往比修复更可靠。剪短画面后,也要同步检查原生旁白或音效是否被截断。
一处穿帮,不等于整条素材报废
先把一条素材从头到尾看完,再逐帧找到第一次异常出现和最后一次异常消失的位置。人物稳定、动作成立、场景没有跳变的部分都可以打上入点和出点,不必只保留最长的一段。比如一条五秒素材在 2.8 秒开始手指变形,前面已经完整做完「拿起瓷砖」,就把出点放在变形前;如果异常之后还有一段稳定的抬眼反应,也可以单独记成第二个可用区间。
两个可用区间能否重新接在一起,取决于中间被删掉的内容。缺失的只是停顿,可以直接跳切;人物姿态有轻微变化,可以在中间插入瓷砖特写、旁观者反应或环境空镜;画面切开后声音不顺,可以让上一镜的旁白、环境声或机械声延续到下一镜,先让耳朵接受连续,再完成画面切换。插入镜头必须提供信息或维持空间关系,不能只用闪白、叠化或快速转场盖住错误。
如果穿帮覆盖了这条镜头唯一需要完成的动作,或者人物身份、运动方向、道具位置已经改变,剩余片段就不能承担原来的叙事任务。前后姿态无法连接、动作因果被删断、下一镜必须接住的尾帧不存在时,也应重新生成或拆镜。判断标准不是「这条素材有没有瑕疵」,而是「留下的区间能否独立讲清这一步,并顺利接到下一镜」。
用 EDL 记录剪切决定。它不必复杂,一行对应一个时间线片段,至少填写:时间线编号、源文件、源入点、源出点、接入方式和剪切原因。同一源文件有两段可用内容,就分别记录为两个片段,例如「0.6—2.7 秒保留拿起瓷砖,变形前切出」「4.1—4.8 秒保留抬眼反应,由瓷砖特写接入」。无论使用剪映、Premiere、达芬奇还是 FFmpeg,都可以先维护这张表,再在软件里执行。
静止不是问题,没有变化才是
物件特写、人物反应和尺度建立镜头可以保持克制。观众需要时间看清蓝色瓷砖、齐马的表情或行星的大小,这时少动比无关的摆动更准确。镜头是否过静,不看运镜幅度,而看有效时长内有没有新信息:主体、摄影机、前后景和声音都没有变化,画面也没有让观众看清新的东西,停留就失去了作用。
先尝试缩短停留,只留下观众刚好能看清信息的长度;仍显停滞时,可以切入物件细节、旁观者反应或环境变化,也可以让环境声和下一句旁白提前进入。若重新生成,只增加一层明确运动,例如让人物转头、前景人群经过,或让摄影机缓慢推进,不要同时给所有元素加动作。缩短和重组后仍没有新增信息,就删除这镜;叙事确实缺少一个动作,再回到镜头表重写并生成。
接触表的做法是按固定间隔从整条粗剪抽帧,再按时间顺序排成网格。两分钟短片可以先每 4—5 秒取一帧;若某段有问题,再缩短到每秒两帧。影片条则针对单个镜头,把连续帧横向排开。接触表查重复构图、色彩突变和人物位置跳跃,影片条查闪烁、手脸形变和动作突然倒退。
粗剪按这个顺序推进:先接通故事骨架,再替换薄弱段落;统一画面区域后删除重复镜头;画面锁定后筛选 H3 同步声音,只替换不合格的旁白或音效;最后才处理字幕与调色。每一轮只解决一类问题,避免同时改变镜头、声音和字幕。
图11:蓝色扩张从墙面开始
图12:中景继续扩大尺度
图13:最后才进入世界尺度,三镜各自承担不同信息
一镜是否留下,用两个测试判断。先静音拿掉它:若故事信息没有减少、动作也没有断,它很可能重复。再保留它但缩短一半:若节奏更清楚,说明问题在停留时间。只有删镜造成信息缺口或动作断裂时,才回到镜头表补镜。若静音后连续镜头功能相近,应缩短或合并,而不是新增同类镜头。
第七步:先用 H3 的同步声音,不合格再单独替换
H3 生成镜头时,可以同时生成旁白、环境声和动作音效。优先保留这套同步声音,因为语气、动作和声响天然落在同一条时间线上。只有声音本身不合格,才拆出来单独制作;不要一开始就把全部声音推倒重来。
生成时把声音写具体
旁白要写出台词原文、说话者、语气、音量关系和大致秒点。环境声要写清空间,动作音效要绑定画面事件。例如:
「1.0 秒齐马开始说:‘I once painted with starlight.’ 声音低沉、克制,不带播音腔,4.0 秒前说完。远处有人群低声交谈和会场长混响;头部转动时只有轻微机械关节声。旁白始终清楚,不加音乐。」
水下镜头可以写:
「无旁白。入水瞬间有短促水声,随后进入低沉水下压力底噪;外壳分离时出现受水阻的金属摩擦,不爆炸,不使用夸张冲击音;清扫机落底后只保留轻微马达声和气泡。」
声音要求越接近画面中的具体事件,越容易检查。像“电影感音效”“震撼氛围”这类词没有明确触发点,生成后也很难判断对错。
先按镜头验收,再检查跨镜一致性
单镜先听四件事:台词有没有说错或漏字,发声是否落在预定时间内,动作音效是否与接触点同步,环境声是否符合空间。然后把相邻镜头连起来,只听声音:齐马的声线、语速和距离感是否突然改变;同一会场的底噪是否断掉;水下空间是否一镜闷、一镜过亮。
满足以下条件,就可以保留 H3 原声:台词准确且听得清;同一人物在相邻镜头中仍像同一个人;动作声音没有明显提前或滞后;环境声在切镜处不突变;没有削波、杂音或被截断的句尾。
哪一层出错,就只重做哪一层
旁白说错、声线变化或跨镜不一致时,保留画面,单独生成旁白。可以用同一段干净声音样本继续约束声线,也可以用 Qwen3-TTS-12Hz-1.7B-VoiceDesign 把整段旁白一次生成,再按句切开对位。替换语音的长度应接近原镜头;若一句话塞不下,先缩短台词或调整切点,不要把语音压得明显变快。
动作音效不准时,不必重做旁白。把画面中的触发时刻标出来,例如“手离开固定扣”“红布落地”“机身接触池底”“滚轮碰到墙砖”,再为这些点单独生成或寻找拟音。脚步、机械关节、布料和撞击必须落在可见动作上;错一两帧也会显得发飘。
环境声不连贯时,为同一空间做一条连续底噪,再铺到整段场景下方。会场可以保留远处人群、飞行器低频和长混响;水下段使用压力底噪、气泡和低沉机械声。跨镜头共用同一条环境底,通常比逐镜重新生成更稳。
如果 H3 输出的旁白、环境和动作声已经混在一起,无法干净地只删掉其中一层,与其强行分离留下水声或金属残影,不如静音该镜头的原音,重新搭建所需的几层声音。
按“旁白—环境—动作—音乐”的顺序混音
先关闭音乐,只听旁白,确认每句话在普通电脑或手机扬声器上都清楚。再加入环境声,让空间成立但不盖住词。然后放入动作音效,逐个核对同步点。音乐最后加入;在结尾的入水、解体和清扫前可以逐渐淡出,让关键动作由画面内声音承担。
音乐与外部音效要选授权范围清楚、可用于当前项目的素材,并记录来源和授权方式。导出前再检查削波、左右声道、句尾和关键词。出现削波、声道缺失、断尾或音乐盖住台词,就退回混音。
第八步:画面锁定后再做字幕和调色
双语字幕可以使用 ASS,中文字号略大于英文,两行分别设置描边和垂直位置。等画面和旁白锁定后再做字幕,避免每改一句话就重新调整时间轴。
具体顺序是:把锁定旁白稿作为原文,不再从音频重新猜词;按自然停顿拆成短句;完成中文译文并逐句核对含义;在字幕软件中标记每句发声入点和句尾;分别设置中英文样式与垂直位置;导出 ASS;先生成一条低码率预览,确认时间和样式后再烧录。发现错字时只回字幕环节修正。
字幕表至少保留五列:编号、入点、出点、英文、中文。断句以一次能读完为准,不按屏幕宽度硬切语义。若使用自动转写,只把它当初稿,仍需对照锁定旁白逐句修正专有名词和句尾。
调色按段落轻微匹配:开场保留暖色,蓝色扩张段稍加对比,档案段降低饱和度,水下段进一步去饱和并微调亮度。调整到相邻镜头不再明显跳色即可,不要用重度调色掩盖生成问题。
图14:档案段降低饱和度,让画面与前面的宇宙展示拉开一点距离
图15:进入泳池后,钴蓝色成为环境本身
调色不能修正角色变脸、错误动作或物体结构漂移。双语字幕虽然清楚,也会长期占用画面下方空间。设计构图时最好提前留出字幕安全区,而不是最后把字压在人物和关键物件上。
字幕导出前逐条检查四件事:入点不要早于发声,出点不要切掉句尾,中文和英文含义对应,文字不遮住脸、手和叙事物件。任何一句需要缩到明显小于全片字号才能放下,先改断句或缩短译文,不为塞进一行破坏可读性。
第九步:技术检查与人工验收分开做
技术检查回答“文件能不能稳定播放”,人工验收回答“片子是否真的成立”。两者不能互相替代。
先完整播放或解码一次导出文件,确认没有文件损坏、黑帧、静音、声道缺失或时长异常。再分四次检查内容:静音看故事和动作,只听声音查旁白与音效,逐帧找闪烁和形变,最后带字幕从头播放且不中断。
出现角色身份变化或动作因果倒置,退回生成与分镜;出现闪帧,退回剪辑;出现错字或字幕遮挡,退回字幕;出现削波、断尾或声道缺失,退回混音。不要用后期步骤掩盖上游问题。
图16:最后一镜必须清楚读出“机器重新开始清扫”,再进入片尾
九个阶段各自要完成什么
最后只守一条原则:问题出现在哪个环节,就回到哪个环节解决,不要用后期手段掩盖上游错误。
这个教程也仅仅只是我在制作短片过程中,自己的一些想法和心得,也未必完全正确,沿着这个循规蹈矩也未必可以做出很好的片子.好的作品终究是需要好的想法,好的创意,以及在失败过程中用时间和心血一次次打磨.期待大家都能做出自己心目中满意的作品,对教程中有问题的部分或者大家有更好的创作的方式,也欢迎大家批评指正
点击阅读原文,即可跳转开发者实践专区查看更多~
👇点击关注ModelScope公众号获取 更多技术信息~