阅读,与值得关注的内容Readance

重返那一片蓝:《齐马蓝》AI 短片改编手记

作者 Weirdfish

个人主页:https://www.modelscope.cn/profile/weirdfish


已关注
关注
重播 分享
观看更多
    魔搭ModelScope社区

    0/0

    00:00/02:11
    进度条,百分之0
    00:00
    /
    02:11
    02:11
    全屏

    倍速播放中
    您的浏览器不支持 video 标签

    继续观看

    重返那一片蓝:《齐马蓝》AI 短片改编手记

    转载
    ,
    重返那一片蓝:《齐马蓝》AI 短片改编手记
    魔搭ModelScope社区
    已同步到看一看写下你的评论


    《齐马蓝》原本是英国科幻作家阿拉斯泰尔·雷诺兹的短篇小说,后来被《爱,死亡和机器人》改编成同名动画。我们保留了齐马、钴蓝色、泳池和清扫机,也保留了“回到起点”的故事走向,重新写旁白并安排镜头。


    当然这未必一次很好的改编,从aigc的技术上来说也是,中间存在不少重复相似的画面,场景漂移,穿帮,画面大多缺少复杂的动态,剧情依靠旁白推动,分镜是为了有而有,离我心中比较完善的短片,大概还有很多的距离,写这个教程权当是给初学者以及像我这样跌跌撞撞的人一点点建议。


    下面按实际制作顺序讲改编、旁白、镜头表、母图、视频生成、剪辑、声音和字幕。具体工具可以替换,但每一步都要有清楚的检查标准。片中的视频镜头统一使用 MiniMax H3 生成。



    第一步先确定改编边界


    动手写剧本前,先把“保留什么、改什么”写清楚。否则制作到一半,很容易一边追求原作还原,一边又想加入新设定,最后两边都没有讲完整。


    我们给这次改编划出的边界是:保留齐马对蓝色的追索、泳池清扫机的来历和回到原始形态的结尾;删去容纳不下的支线;把故事改写成齐马在公开展示现场进行的一段第一人称回顾。


    可以先用一句话检查改编是否成立:

    一位把作品扩展到行星尺度的机械艺术家,在最后一次公开展示中追查钴蓝色的来源,并回到泳池清扫机的形态。

    这句话里要有主角、变化和结尾。若只能写出“一个关于自我与宇宙的故事”,后面就很难拆成可拍的动作。


    这一步应留下两份东西:一段一句话梗概,以及一页改编说明。说明里写清保留的角色与意象、删去的情节和重新创作的部分。


    第二步:先写行动线,再决定旁白或者台词

    先暂时拿掉旁白,只写齐马做了什么,以及每个动作带来了什么结果。故事应由角色的选择推动:齐马回看不断扩大的蓝色作品,找到泳池清扫机的起源,最终脱下红布、进入泳池,重新开始清扫。即使静音播放,观众也应该能看懂他发现了什么、作出了什么决定,以及结尾发生了什么变化。


    把关键行动按因果顺序排列,再根据动作本身确定时长。若两个段落只能依靠一句旁白连接,说明中间缺少可见的动作或转场。不要先写一段完整独白,再让画面被动填满它的时长。


    行动线成立后,再判断哪里需要旁白。旁白只补充画面难以直接表达的内容,例如齐马的记忆、时间跨度和他对蓝色的理解;画面已经说清的动作,不必再解释。删掉旁白后,观众可以少知道一些齐马的内心,但不能看不懂故事。


    第三步:把故事拆成分镜镜头表

    先把故事分成几个视觉段落,再为每段写清观众必须看到什么。镜头数量不用提前锁死;能用一镜讲清的内容,不要为了凑节奏拆成两镜。

    段落
    需要完成的视觉任务
    公众等待
    建立会场,并让齐马从人群中出现
    宇宙创作
    分别表现光、物质、施工尺度、完成形态与观看者
    蓝色出现
    让蓝色从局部痕迹扩大到世界尺度
    身份追查
    从抽象疑问走到可见记录
    泳池起源
    给出瓷砖、泳池和清扫机
    回归行动
    看瓷砖、脱下红布、入水、解体、重新清扫

    每个镜头至少填写以下内容:镜头编号、时长、叙事作用、首帧状态、唯一主动作、摄影机运动、结束状态、所需参考图、禁止出现的内容、与下一镜的连接方式。可以直接照下面这一行填写:

    编号

    时长

    叙事作用

    首帧

    主动作

    运镜

    尾帧

    参考图

    禁止项

    下一镜

    S02

    5秒

    看清齐马的决定

    齐马右侧中近景

    视线移向泳池,头转约5度

    慢推约6%

    停稳并保持视线

    齐马近景、会场

    不说话、不脱衣、不切镜

    切入过去的宇宙作品


    以开场为例,第一镜负责交代“很多人在等”,第二镜才让观众看清齐马。两镜共享会场,却承担不同信息。


    图2:第一镜只建立会场、人群和远处的齐马


    图3:第二镜收近到人物,让红布、机械脸和蓝眼可见


    拆镜时不要跟着标点一刀一镜。我们更看重思路是否发生变化。宇宙段的五镜不能都写成“蓝色星球大全景”,否则虽然句子不同,画面仍在重复。


    图4:人物与行星表面的施工尺度


    图5:观看者补上了作品与公共世界的关系


    镜头表填完后,把每镜按预计时长做成色块,配上临时朗读,得到一条占位时间线。检查时逐段问:这一镜新增了什么?去掉后是否影响下一镜?连续两镜是否承担同一任务?若说不出新增信息,就合并或删除,再进入母图阶段。


    第四步:为角色、场景和关键动作准备母图

    先准备角色、场景和关键道具参考图,再根据镜头需要组合使用。普通镜头用一张稳定首帧;需要明确落点的转场准备首尾两张;复杂镜头再补充人物、环境或道具参考图。每张图只承担清楚的一项职责。


    先做人物与场景设定,再做镜头首帧

    齐马至少需要三种状态:正式亮相时的红布造型、工作状态、脱下红布后的机械身体。它们要共享机械面孔、蓝眼和身体比例,但服装职责不同。清扫机也需要独立设定,不能让模型把人形轮廓带到机器上。


    场景方面,我们分别固定会场、宇宙创作空间、档案设施和水下泳池。泳池尤其要提前规定长轴方向、瓷砖尺度、池壁与池底的关系,否则入水、落底和贴墙清扫很难接起来。


    母图从一张设定卡开始

    先为人物和场景各写一张设定卡,再据此生成镜头首帧。人物卡固定脸部或机械面孔、身体比例、服装穿法、材质和主色;场景卡固定空间轴线、地标、光线方向、色彩范围和禁止出现的元素。


    静帧提示词可以按这个顺序写:主体身份与不可变化项、当前服装或状态、场景几何、景别和机位、光线与颜色、材质风格、排除项。例如:

    「同一个齐马,黑色分段机械身体,窄钴蓝机械眼,厚重红布从左肩斜跨胸前;右侧中近景,黄昏会场在后方;哑光手绘块面;不改变面部结构,不增加披风层数。」

    首帧构图要与最终画幅一致,并提前给遮幅和双语字幕留出空间。候选图按镜头编号和版本编号命名,方便比较和回退。


    每轮只改一个主要问题。人物对但场景错,就只改场景描述;构图对但材质跑偏,就只改材质与排除项。连续三轮仍无法保住人物识别特征时,退回人物设定卡,不要继续在镜头提示词末尾堆词。


    先选生成方式:首帧、首尾帧和全能参考各有用途

    H3 的首帧模式、首尾帧模式和全能参考不是一回事。首帧模式适合构图已经确定、只需要画面从这张图开始运动的镜头;首尾帧模式适合起点和落点都必须明确的转场;全能参考则用多张图片、动作视频或声音样本共同约束人物、场景、动作和声音。


    先问自己最需要锁住什么。如果必须与某张分镜图完全一致,就用首帧模式;如果必须从机械眼准确落到蓝色颜料,就用首尾帧模式;如果要同时保住齐马的外形、会场空间和清扫机结构,并参考一段动作节奏,就用全能参考。不要为了“控制更多”而选择全能参考。参考越多,冲突也越多。


    首尾帧素材不能与全能参考的图片、视频和音频混在同一次任务里。要在提交前选定一条控制路线。既想锁首帧,又想复制动作时,可以先用全能参考生成动作版本,再从可用画面导出一帧,转入下一条首帧任务。


    全能参考的素材怎么准备

    全能参考可以同时接收图片、视频和音频。图片负责外形与空间,视频负责动作或运镜,音频负责声线、台词节奏或声音质感。单次最多可放 9 张图片、3 段视频和 3 段音频,全部素材合计不超过 12 个;但实际制作时应从最少素材开始,能用两张图解决,就不要先塞满九张。


    每份素材先做一次清理。人物图要看清脸、身体比例和服装关系,避免手臂被遮挡;场景图要看清空间轴线和地标;道具图尽量使用干净背景,避免把摄影棚、展示台和文字一起带入画面;动作视频只截取需要模仿的动作,不要保留无关的开头和结尾;音频只保留要参考的声线或节奏,并去掉明显底噪。


    素材之间也要互相检查。两张人物图的脸型、服装和材质若不一致,模型往往会在运动中来回混合;人物图和场景图若光线方向完全相反,主体容易像贴在背景上;动作视频里的人物比例与目标角色差别太大,手脚幅度也可能被错误继承。遇到这些冲突,先改素材,不要急着在提示词里解释。


    一次全能参考任务怎么做

    1. 在 H3 中选择全能参考,不要同时启用首帧或首尾帧模式。
    2. 先上传人物图和场景图。需要锁定道具结构时再加道具图,需要模仿动作时再加参考视频。音频不能单独使用,至少要同时有一张图或一段视频。
    3. 上传完成后核对素材编号。网页、API 或 ComfyUI 的界面可能不同,但提示词里的“图 1”“视频 1”“音频 1”必须与实际顺序一致。顺序错了,后面的职责说明也会全部错位。
    4. 先设置画幅和时长,再写提示词。动作视频和音频只截取本镜头需要的部分;参考段落太长,会把无关动作、停顿或底噪一起带进来。
    5. 提示词按四段写:参考素材分工、首秒状态与主动作、摄影机和时间节拍、禁止项。不要把人物设定、动作、声音和排除项揉成一个长句。
    6. 第一次只生成短测试。先看人物和空间是否稳定,再检查动作,最后才听声音。若第一步已经变脸或串景,后面的音效再好也不值得保留。

    全能参考的价值不是一次解决所有问题,而是把不同控制来源拆开。哪份素材控制哪件事,写得越清楚,返工时越容易只替换出问题的那一份。


    给每份参考素材写“负责什么”和“不负责什么”

    上传后按“图 1、图 2、视频 1、音频 1”给素材编号。每份素材只分配一个主要职责,再补一句禁止继承项。不要笼统地写“参考以上素材”。

    素材
    负责什么
    不负责什么
    图 1:齐马人物图
    机械面孔、蓝眼、身体比例、红布穿法
    不继承背景和原机位
    图 2:会场图
    环形看台、泳池位置、黄昏光线
    不继承图中的小人物
    图 3:水下空间图
    瓷砖尺度、池壁与池底关系、排水口位置
    不继承写实摄影质感和原构图
    图 4:清扫机图
    低矮机身、传感器、滚轮和清洗机构
    不继承产品展示背景
    视频 1:动作参考
    脱下红布的顺序、速度和停顿
    不继承演员外貌、服装和场景
    音频 1:声音参考
    声线或一句台词的节奏
    不继承底噪和背景音乐

    提示词开头可以直接这样写:

    「图 1 只锁定齐马的机械面孔、身体比例和红布穿法,不继承背景。图 2 只锁定同一座会场的看台、泳池与黄昏光线,不继承人物和机位。图 4 只锁定清扫机的机身比例与传感器,不继承白色展示背景。视频 1 只参考脱下红布的动作顺序,不继承演员身份与服装。」

    接着再写本镜头要发生什么:

    「镜头开始时,齐马站在干燥平台中央。0.5—3.4 秒,右手先解开胸前固定点,红布沿左肩完整滑落;身体比例、机械面孔和会场轴线保持不变。3.4—4.2 秒停稳。不要提前入水,不要增加第二块布,不要把红布变成外套或围巾。」

    这里的顺序很重要:先写参考素材分工,再写时间轴,最后写高风险错误。这样生成失败后能看出问题出在身份、场景、动作还是负面约束,而不是面对一大段提示词反复猜。


    全能参考不要一步堆满

    先做一条短测试,只放人物图和场景图,让角色完成转头、抬手或向前走两步。人物和空间都稳定后,再加入道具图;动作仍不准确,才增加动作视频;确实需要同步台词或声音质感时,最后再加音频。每增加一种素材,只检查它是否改善了目标问题,同时观察是否引入新的漂移。


    如果人物变脸,先减少人物参考,只留一张身份最清楚的正面或四分之三侧面图;如果背景里出现展示台或白底,检查道具图并明确“不继承背景”;如果动作正确但身体比例被带偏,保留动作视频的节奏,缩小对姿态细节的要求,必要时拆镜;如果模型把多张图混成新角色,说明职责有重叠,应删掉作用相近的参考图,而不是继续加图。


    一条全能参考镜头通过后,要记下真正起作用的最小素材组合。下一镜只沿用仍需保持的参考,不要机械复制整套素材。角色近景可能只需要人物图和场景图;水下清扫镜头则需要水下空间图和清扫机图,不再需要红布造型。


    选“能动五秒”的图,不只选最好看的图

    筛选首帧时,除了构图,还要看前景是否给摄影机推进留出空间、人群能否产生分层运动、主角会不会在运动中被遮住。


    每张候选图检查五项:叙事对象是否正确,人物的三项识别特征是否保留,场景锚点是否一致,主体前方是否有动作空间,手、脸和机械连接处是否已出现结构错误。前四项必须全部通过;运动主体已有结构错误,直接淘汰。


    第五步:用 MiniMax H3 生成镜头

    所有镜头统一使用 MiniMax H3 生成。分辨率和推理配置按镜头时长与构图分别测试,不必强行套用同一组参数。


    H3 镜头提示词要跟生成方式对应。首帧或首尾帧模式先声明输入帧及其约束;全能参考先写各份素材的职责。后面的时长、分段动作、摄影机运动、声音、结束状态和禁止项,都要写清。


    一条五秒镜头可以先写成这样的短骨架:

    「0—0.6 秒保持首帧;0.6—4.2 秒完成一次主动作;4.2—5.0 秒稳定,留作剪辑尾柄。全程不切镜,无字幕和水印。」


    画面和声音放进同一条时间轴

    H3 可以在生成画面时同步完成旁白、环境声和动作音效。声音不要只写成“带环境声”,而要和画面动作使用同一组秒点。例如:

    「0.6 秒后齐马开始转头,同时出现轻微机械关节声;1.2 秒开始说出旁白‘我曾用星光作画’,语气平静,句尾在 4.0 秒前结束;会场人群声保持在远处,不盖住旁白;全程无音乐。」

    一条镜头的声音可以按四层写:旁白写清文本、说话者、语气和起止位置;环境声说明空间及远近;动作音效绑定可见动作;音乐只写是否出现以及何时进入或淡出。没有声音需要的镜头也直接写“无旁白,只保留水下低频与机械运转声”,不要让模型自行猜测。


    如果多条镜头由同一人物旁白,全能参考可以加入一小段干净声音样本,并注明“音频 1 只负责齐马的声线、语速和克制语气,不继承原台词、底噪或音乐”。先用一句短台词测试;声线稳定后,再生成正式镜头。


    把情绪翻译成身体变化

    “齐马显得决然”太宽。开场近景最后写成了可见动作:视线移向泳池,机械头部转约五度,下颌轻抬一次,摄影机慢推约 6%。模型仍可能做错,但至少有明确的验收对象。


    简单镜头只留一个主动作,复杂镜头必须分阶段

    看瓷砖的镜头只负责让观众认出那件旧物,短写法可以是:

    「齐马低头看手中的蓝色瓷砖,身体保持不动。」

    图6:瓷砖特写只负责让观众看清这件旧物


    有严格因果的动作要按阶段和切点编排。例如先脱下红布,保持片刻,再切到入水;身体完全入水并稳定仰卧后,才开始解体。

    「0.5—3.4 秒脱下完整红布;3.4—4.2 秒保持;4.2 秒硬切;完全入水后才后仰;稳定仰卧后才开始解体。」

    图7:先让红布与机械身体完整分离,再进入下一动作


    只有一个主体变化时,用五秒单动作镜头;动作存在严格因果时,写成分段时间表;任一阶段无法单独验收,就拆成多条素材。顺序正确但出现形变或失重感,仍然判为失败,应缩短动作或改用可控动画。


    用上一条素材的可用尾帧接下一镜

    尾段失控时,在错误发生前截断,导出最后一个身份、方向和位置都正常的画面,作为下一镜的首帧参考。比如清扫机靠近墙面后开始碰撞,就在碰撞前切断,再由下一镜完成伸臂和擦洗。


    对应的短提示词是:

    「机器沿池底前进两到三块瓷砖,在墙前减速;接近状态保持稳定,供下一镜续接。」

    这套做法可以直接复用:先在前一条素材里找到身份、方向和位置都正常的最后一帧,把它导出为下一镜的首帧参考。若前后两帧的机器朝向、大小或墙面位置对不上,就不要靠转场遮掩,退回去重做下一镜首帧。


    负面约束只写高风险错误

    眼睛到颜料的镜头要求机械眼保持金属外圈、平面蓝色玻璃和中央感光点,同时禁止有机虹膜、瞳孔隧道、门户、海洋和闪白。

    图8:眼睛到颜料转场的起点


    图9:转场终点是蓝色颜料表面


    若机械结构逐渐漂成有机虹膜,就属于“物体身份改变”。这时应重新生成,或者放弃连续变形,改用两个稳定镜头剪接。继续增加形容词不能替代重生或改分镜。


    水下解体要明确限制:红布不能入水,身体完全入水后才开始拆解,外壳不能爆炸或融化,清扫机第一次露面时就应是完整机器。即使事件顺序正确,只要部件缺少水阻和重量反馈,也应退回动作设计,把解体拆成更短阶段,或改用可控动画完成外壳运动。


    图10:水下解体的事件顺序正确;重量反馈不符合验收项,应退回动作设计


    每条视频生成后先看四项:首帧或首尾帧模式要核对端点,全能参考要核对首秒的人物、场景和道具状态;主动作是否完整发生且顺序正确;人物、物体和场景有没有改变身份;结尾是否有至少 0.3 秒稳定画面可供剪辑。端点或首秒状态不对,先检查输入素材和职责分工;动作失败就重生或拆镜;身份改变则重做参考素材或改分镜;局部失控则先标出可用区间,再判断能否通过剪辑保留。


    第六步:先做粗剪,再继续生成

    先把 H3 生成的镜头接成粗剪。第一遍静音播放,只检查故事骨架;第二遍打开 H3 同步生成的旁白和音效,检查声音是否帮助动作与节奏。此时先不要补音乐或重做声音。


    粗剪前先统一尺寸、帧率和像素比例。然后逐镜只取可用区间,尤其要查看生成视频的最后一秒。很多形变、闪烁和多余动作都发生在尾部,提前切掉往往比修复更可靠。剪短画面后,也要同步检查原生旁白或音效是否被截断。


    一处穿帮,不等于整条素材报废

    先把一条素材从头到尾看完,再逐帧找到第一次异常出现和最后一次异常消失的位置。人物稳定、动作成立、场景没有跳变的部分都可以打上入点和出点,不必只保留最长的一段。比如一条五秒素材在 2.8 秒开始手指变形,前面已经完整做完「拿起瓷砖」,就把出点放在变形前;如果异常之后还有一段稳定的抬眼反应,也可以单独记成第二个可用区间。


    两个可用区间能否重新接在一起,取决于中间被删掉的内容。缺失的只是停顿,可以直接跳切;人物姿态有轻微变化,可以在中间插入瓷砖特写、旁观者反应或环境空镜;画面切开后声音不顺,可以让上一镜的旁白、环境声或机械声延续到下一镜,先让耳朵接受连续,再完成画面切换。插入镜头必须提供信息或维持空间关系,不能只用闪白、叠化或快速转场盖住错误。


    如果穿帮覆盖了这条镜头唯一需要完成的动作,或者人物身份、运动方向、道具位置已经改变,剩余片段就不能承担原来的叙事任务。前后姿态无法连接、动作因果被删断、下一镜必须接住的尾帧不存在时,也应重新生成或拆镜。判断标准不是「这条素材有没有瑕疵」,而是「留下的区间能否独立讲清这一步,并顺利接到下一镜」。


    用 EDL 记录剪切决定。它不必复杂,一行对应一个时间线片段,至少填写:时间线编号、源文件、源入点、源出点、接入方式和剪切原因。同一源文件有两段可用内容,就分别记录为两个片段,例如「0.6—2.7 秒保留拿起瓷砖,变形前切出」「4.1—4.8 秒保留抬眼反应,由瓷砖特写接入」。无论使用剪映、Premiere、达芬奇还是 FFmpeg,都可以先维护这张表,再在软件里执行。


    静止不是问题,没有变化才是

    物件特写、人物反应和尺度建立镜头可以保持克制。观众需要时间看清蓝色瓷砖、齐马的表情或行星的大小,这时少动比无关的摆动更准确。镜头是否过静,不看运镜幅度,而看有效时长内有没有新信息:主体、摄影机、前后景和声音都没有变化,画面也没有让观众看清新的东西,停留就失去了作用。


    先尝试缩短停留,只留下观众刚好能看清信息的长度;仍显停滞时,可以切入物件细节、旁观者反应或环境变化,也可以让环境声和下一句旁白提前进入。若重新生成,只增加一层明确运动,例如让人物转头、前景人群经过,或让摄影机缓慢推进,不要同时给所有元素加动作。缩短和重组后仍没有新增信息,就删除这镜;叙事确实缺少一个动作,再回到镜头表重写并生成。


    接触表的做法是按固定间隔从整条粗剪抽帧,再按时间顺序排成网格。两分钟短片可以先每 4—5 秒取一帧;若某段有问题,再缩短到每秒两帧。影片条则针对单个镜头,把连续帧横向排开。接触表查重复构图、色彩突变和人物位置跳跃,影片条查闪烁、手脸形变和动作突然倒退。


    粗剪按这个顺序推进:先接通故事骨架,再替换薄弱段落;统一画面区域后删除重复镜头;画面锁定后筛选 H3 同步声音,只替换不合格的旁白或音效;最后才处理字幕与调色。每一轮只解决一类问题,避免同时改变镜头、声音和字幕。


    图11:蓝色扩张从墙面开始


    图12:中景继续扩大尺度


    图13:最后才进入世界尺度,三镜各自承担不同信息


    一镜是否留下,用两个测试判断。先静音拿掉它:若故事信息没有减少、动作也没有断,它很可能重复。再保留它但缩短一半:若节奏更清楚,说明问题在停留时间。只有删镜造成信息缺口或动作断裂时,才回到镜头表补镜。若静音后连续镜头功能相近,应缩短或合并,而不是新增同类镜头。


    第七步:先用 H3 的同步声音,不合格再单独替换

    H3 生成镜头时,可以同时生成旁白、环境声和动作音效。优先保留这套同步声音,因为语气、动作和声响天然落在同一条时间线上。只有声音本身不合格,才拆出来单独制作;不要一开始就把全部声音推倒重来。


    生成时把声音写具体

    旁白要写出台词原文、说话者、语气、音量关系和大致秒点。环境声要写清空间,动作音效要绑定画面事件。例如:

    「1.0 秒齐马开始说:‘I once painted with starlight.’ 声音低沉、克制,不带播音腔,4.0 秒前说完。远处有人群低声交谈和会场长混响;头部转动时只有轻微机械关节声。旁白始终清楚,不加音乐。」


    水下镜头可以写:

    「无旁白。入水瞬间有短促水声,随后进入低沉水下压力底噪;外壳分离时出现受水阻的金属摩擦,不爆炸,不使用夸张冲击音;清扫机落底后只保留轻微马达声和气泡。」

    声音要求越接近画面中的具体事件,越容易检查。像“电影感音效”“震撼氛围”这类词没有明确触发点,生成后也很难判断对错。


    先按镜头验收,再检查跨镜一致性

    单镜先听四件事:台词有没有说错或漏字,发声是否落在预定时间内,动作音效是否与接触点同步,环境声是否符合空间。然后把相邻镜头连起来,只听声音:齐马的声线、语速和距离感是否突然改变;同一会场的底噪是否断掉;水下空间是否一镜闷、一镜过亮。


    满足以下条件,就可以保留 H3 原声:台词准确且听得清;同一人物在相邻镜头中仍像同一个人;动作声音没有明显提前或滞后;环境声在切镜处不突变;没有削波、杂音或被截断的句尾。


    哪一层出错,就只重做哪一层

    旁白说错、声线变化或跨镜不一致时,保留画面,单独生成旁白。可以用同一段干净声音样本继续约束声线,也可以用 Qwen3-TTS-12Hz-1.7B-VoiceDesign 把整段旁白一次生成,再按句切开对位。替换语音的长度应接近原镜头;若一句话塞不下,先缩短台词或调整切点,不要把语音压得明显变快。


    动作音效不准时,不必重做旁白。把画面中的触发时刻标出来,例如“手离开固定扣”“红布落地”“机身接触池底”“滚轮碰到墙砖”,再为这些点单独生成或寻找拟音。脚步、机械关节、布料和撞击必须落在可见动作上;错一两帧也会显得发飘。


    环境声不连贯时,为同一空间做一条连续底噪,再铺到整段场景下方。会场可以保留远处人群、飞行器低频和长混响;水下段使用压力底噪、气泡和低沉机械声。跨镜头共用同一条环境底,通常比逐镜重新生成更稳。


    如果 H3 输出的旁白、环境和动作声已经混在一起,无法干净地只删掉其中一层,与其强行分离留下水声或金属残影,不如静音该镜头的原音,重新搭建所需的几层声音。


    按“旁白—环境—动作—音乐”的顺序混音

    先关闭音乐,只听旁白,确认每句话在普通电脑或手机扬声器上都清楚。再加入环境声,让空间成立但不盖住词。然后放入动作音效,逐个核对同步点。音乐最后加入;在结尾的入水、解体和清扫前可以逐渐淡出,让关键动作由画面内声音承担。


    音乐与外部音效要选授权范围清楚、可用于当前项目的素材,并记录来源和授权方式。导出前再检查削波、左右声道、句尾和关键词。出现削波、声道缺失、断尾或音乐盖住台词,就退回混音。


    第八步:画面锁定后再做字幕和调色

    双语字幕可以使用 ASS,中文字号略大于英文,两行分别设置描边和垂直位置。等画面和旁白锁定后再做字幕,避免每改一句话就重新调整时间轴。


    具体顺序是:把锁定旁白稿作为原文,不再从音频重新猜词;按自然停顿拆成短句;完成中文译文并逐句核对含义;在字幕软件中标记每句发声入点和句尾;分别设置中英文样式与垂直位置;导出 ASS;先生成一条低码率预览,确认时间和样式后再烧录。发现错字时只回字幕环节修正。


    字幕表至少保留五列:编号、入点、出点、英文、中文。断句以一次能读完为准,不按屏幕宽度硬切语义。若使用自动转写,只把它当初稿,仍需对照锁定旁白逐句修正专有名词和句尾。


    调色按段落轻微匹配:开场保留暖色,蓝色扩张段稍加对比,档案段降低饱和度,水下段进一步去饱和并微调亮度。调整到相邻镜头不再明显跳色即可,不要用重度调色掩盖生成问题。


    图14:档案段降低饱和度,让画面与前面的宇宙展示拉开一点距离


    图15:进入泳池后,钴蓝色成为环境本身


    调色不能修正角色变脸、错误动作或物体结构漂移。双语字幕虽然清楚,也会长期占用画面下方空间。设计构图时最好提前留出字幕安全区,而不是最后把字压在人物和关键物件上。


    字幕导出前逐条检查四件事:入点不要早于发声,出点不要切掉句尾,中文和英文含义对应,文字不遮住脸、手和叙事物件。任何一句需要缩到明显小于全片字号才能放下,先改断句或缩短译文,不为塞进一行破坏可读性。


    第九步:技术检查与人工验收分开做

    技术检查回答“文件能不能稳定播放”,人工验收回答“片子是否真的成立”。两者不能互相替代。


    先完整播放或解码一次导出文件,确认没有文件损坏、黑帧、静音、声道缺失或时长异常。再分四次检查内容:静音看故事和动作,只听声音查旁白与音效,逐帧找闪烁和形变,最后带字幕从头播放且不中断。


    出现角色身份变化或动作因果倒置,退回生成与分镜;出现闪帧,退回剪辑;出现错字或字幕遮挡,退回字幕;出现削波、断尾或声道缺失,退回混音。不要用后期步骤掩盖上游问题。


    图16:最后一镜必须清楚读出“机器重新开始清扫”,再进入片尾


    九个阶段各自要完成什么

    阶段
    本步输出
    如何判断
    有问题退回哪里
    改编
    一句话梗概、改编边界
    梗概包含主角、变化和结尾;改编属性写清
    重新删减情节,不进入旁白
    旁白
    四列表、朗读计时稿
    每句都有画面;正常朗读留有停顿;无重复解释
    改台词或让画面承担信息
    分镜
    镜头表、占位时间线
    每镜有新增信息;主动作只有一个;首尾状态可连接
    合并重复镜头或补承接镜头
    母图
    人物设定、场景设定、镜头首帧
    人物识别特征不变;场景锚点一致;动作路径无遮挡
    重做人物、场景或构图,不生成视频
    生成
    动作提示词、可用素材
    输入端点或首秒状态正确;动作顺序正确;身份不漂移;尾部至少稳定 0.3 秒
    调整参考分工、重生或拆镜头
    粗剪
    EDL、接触表、影片条
    静音仍能读懂行动;没有功能重复;无可见闪帧和倒退
    缩短、删镜或回到生成阶段补镜
    声音
    H3 同步声音、必要的替换音轨、混音文件
    台词准确;声线和环境连续;动作音效同步;无削波、断尾和声道缺失
    只替换有问题的旁白、环境声或动作音效
    字幕调色
    字幕文件、调色版本
    字幕与发声同步且不遮主体;相邻镜头颜色不突跳
    改断句、位置或分段匹配,不用调色救动作
    成片
    可完整播放的视频
    从头到尾没有黑帧、静音、字幕错误或明显形变
    按问题类型退回剪辑、声音、字幕或生成阶段

    最后只守一条原则:问题出现在哪个环节,就回到哪个环节解决,不要用后期手段掩盖上游错误。


    这个教程也仅仅只是我在制作短片过程中,自己的一些想法和心得,也未必完全正确,沿着这个循规蹈矩也未必可以做出很好的片子.好的作品终究是需要好的想法,好的创意,以及在失败过程中用时间和心血一次次打磨.期待大家都能做出自己心目中满意的作品,对教程中有问题的部分或者大家有更好的创作的方式,也欢迎大家批评指正


    点击阅读原文,即可跳转开发者实践专区查看更多~





    👇点击关注ModelScope公众号获取
    更多技术信息~




    前往微信阅读全文

    内容来自公众号,可前往微信查看原文。

    查看作者的更多文章 →