Overview

项目说明

《回声》是一支 全流程 AI 生成的情感剧情短片——2 分 17 秒 / 21 个镜头 / 5 位角色 / 5 处场景,由一人独立完成编剧、分镜、模型编排、生成与剪辑。

故事:母亲离世后,女儿委托 AI 影像修复服务复原了母亲的动态影像,带回家陪伴独居的父亲。父亲从抗拒到接受,最终能对着屏幕里的老伴,安静地吃完一顿饭。全片不炫技——所有技术难度只服务于一条情绪线。


工具链分工

工具承担的工序关键能力
Claude剧本 / 人物小传 / 分镜镜头表 / 镜头级提示词 / 成片质检清单把「用 AI 影像让逝者陪伴生者」拆成可执行的三幕结构与 21 场镜头表
gpt-image-2角色定妆图与场景锚点图2K 输出、单提示多图一致、人脸跨图一致——先把「人和屋子长什么样」钉死成资产
Seedance 2.0图生视频、多镜头序列规划、原生同期声多模态参考锁定外貌 / 服装 / 空间;视频延长接续长镜头;定向重生成只修不合格片段

情绪曲线:六段,一条线

全片情绪拆成六段,逐段标注时长配额与强度,作为后续所有生成的唯一依据:

缺席 → 委托 → 抗拒 → 松动 → 接受 → 团圆

关键帧一览

八格关键帧依次为:开场空间 · 女儿与影像 · 母亲的记忆片段 · 落泪 · 委托修复 · 独食特写 · 父女相握 · 院中团圆。

《回声》八格关键帧:开场空间、女儿与影像、母亲的记忆片段、落泪、委托修复、独食特写、父女相握、院中团圆


方法论:资产锚定 + 分镜驱动 + 质检回环

这支片子真正想验证的,不是某一个模型多强,而是一套能把 AIGC 影像做成「工业化流程」的方法

  • 资产锚定:先用 gpt-image-2 把 5 位角色、5 处场景钉成定妆图与空间锚点图,让「人和屋子长什么样」在生成之前就是确定的;
  • 分镜驱动:用 Claude 把整部片拆成 21 场结构化镜头表与镜头级提示词,镜头语言先于生成成立;
  • 质检回环:用统一清单逐镜复核一致性与连续性,不合格镜头回去改提示词而非重抽——把「修」而不是「赌」变成迭代方式。

正因为整条链路是这样跑出来的,《回声》才能在 21 个镜头里守住角色、道具与空间的一致,也把父亲那条「回避 → 接受」的表演曲线做得连贯不跳。技术都退到画面背后,留在台前的只有情绪。

🎬 在线观看:https://go.screenpal.com/watch/cOjrQonvNDw

Process

制作流程

每个详情页都把真正重要的步骤拆开,不只展示结果,也展示判断是如何形成的。

开场空间:独居的父亲坐在窗前,堂屋里挂钟与旧木家具静默
01

剧本与情绪曲线(Claude)

先定核心命题——「用 AI 影像让逝者陪伴生者」,再用 Claude 写人物小传与三幕结构。把整条情绪拆成「缺席 → 委托 → 抗拒 → 松动 → 接受 → 团圆」六段,逐段标注时长配额与情绪强度。这条情绪曲线不是文案,而是后续所有分镜、提示词与剪辑的唯一依据——先有情绪的骨架,才谈画面。

母亲定妆帧:被复原的母亲影像,暖光中微笑挥手
02

视觉锚点资产库(gpt-image-2)

AI 视频最易翻车的是「每镜重新描述,人和屋子越长越不像」。这里反过来做:先用 gpt-image-2 为 5 位角色各出一套多角度定妆图、5 处场景各出一套同机位同光位的空间锚点图,2K 输出、人脸跨图一致,把「人长什么样、屋子什么样」一次性钉死成图片资产,之后每一镜都引用这套资产,而不是重新抽卡。

女儿与影像:走廊里戴着耳机、握着手机的女儿侧影
03

分镜与镜头级提示词(Claude)

用 Claude 产出 21 场镜头表——逐镜写清景别、机位、运镜、光位、时长、情绪值与道具连续性备注,再为每镜生成一条结构化提示词,并按 Seedance 的「@素材指派」语法写明每张参考图的用途。分镜先行,把一部片子的镜头语言在生成之前就定死。

委托修复:女儿摊开旧照片,与 AI 影像修复服务人员对坐
04

视频生成与一致性控制(Seedance 2.0)

以定妆图 + 场景锚点图作为多模态全能参考(最多 9 图)投喂 Seedance 2.0,锁定角色外貌、服装与空间关系;用视频延长能力接续长镜头,用定向重生成只修不合格的片段、避免整镜重抽。一致性不靠运气,靠参考图约束。

独食特写:父亲布满皱纹的手执筷,对着一碗饭
05

声画节奏与留白(原生音频)

直接用 Seedance 生成同期对白、环境音与拟音,规避后期配音的口型错位。剪辑上按情绪曲线安排呼吸点,把全片最深的一次静默放在情绪转折的支点上——声音节奏与情绪曲线同构,留白本身也是一句台词。

院中团圆:阳光院子里,祖父母牵着小女孩的手
06

成片校验与交付(Claude + FFmpeg)

用统一质检清单逐镜复核角色一致性、道具连续性、光位色温与手部穿帮;不合格镜头回到「分镜与提示词」一步改提示词,而不是碰运气重抽。最后统一影调后套剪、用 FFmpeg 输出。质检回环让「修」而非「赌」成为迭代方式。

Thinking

设计思路

这里说明为什么这样做,而不是只列出做了哪些动作。

道具级叙事:让时间靠美术说话

两场餐桌戏相隔约一分钟,墙上挂历从「1」翻到「2」——用美术道具而非字幕交代时间跨度。这不只是叙事选择,也顺带验证了跨镜场景资产的可控复用:同一面墙、同一本挂历,只改了一个数字。

跨场景美术连续:靠锚点图,不靠素材复用

堂屋在 6 个不同机位的镜头里反复出现,挂历、木牌、碗柜、相框的位置全程一致。这不是把同一段素材剪进去,而是靠场景锚点图约束多次生成得到的结果——空间的可信度,是靠资产钉出来的。

统一影调与声音留白

21 个镜头全片暖调低照度、以窗光侧逆光为主光,无一次跳色。全片最深的一次静默,精确落在「遗照空镜 → 叠化 → 院子团圆」的转场支点上——把技术上的克制,用在情绪最需要喘息的地方。

表演调度:连续曲线,而非表情跳变

父亲一角在 8 个镜头内完成「回避 → 迟疑 → 开口 → 接受」的连续表演曲线,情绪强度逐镜递进,没有出现 AI 视频常见的表情跳变。表演的连贯,是在分镜阶段就把情绪值逐镜标好、再用定向重生成守住的。

为什么一个人能做完一部片

传统上这需要编剧、导演、摄影、美术、剪辑多工种协作。《回声》把它压成「资产锚定 + 分镜驱动 + 质检回环」三件事:先把人和场景钉成资产,再用分镜驱动生成,最后用质检清单回环修片。方法论跑通了,情感叙事这种最吃「一致性」的题材也能量产。

Result

交付与结果

交付内容
  • 2 分 17 秒完整成片:21 个镜头、5 位角色、5 处场景,全片统一暖调低照度影调
  • 剧本资产(Claude):核心命题、人物小传、三幕结构与「缺席 → 委托 → 抗拒 → 松动 → 接受 → 团圆」六段情绪曲线配额表
  • 视觉锚点资产库(gpt-image-2):5 位角色多角度定妆图 + 5 处场景同机位同光位空间锚点图(2K、人脸跨图一致)
  • 21 场镜头表:景别 / 机位 / 运镜 / 光位 / 时长 / 情绪值 / 道具连续性备注,每镜一条结构化提示词
  • 原生同期声:对白 / 环境音 / 拟音直接随画面生成,规避后期配音口型错位
项目结果
  • 由一人完成传统需编剧、导演、摄影、美术、剪辑多工种协作的短片制作
  • 21 个镜头全程角色、道具、空间一致:堂屋在 6 个机位反复出现,挂历 / 木牌 / 碗柜 / 相框位置全程不变
  • 父亲一角在 8 个镜头内完成「回避 → 迟疑 → 开口 → 接受」连续表演曲线,未出现 AI 视频常见的表情跳变
  • 全片 21 镜暖调低照度、窗光侧逆光为主光、无一次跳色;最深的一次静默精确落在情绪转折支点
  • 验证了「资产锚定 + 分镜驱动 + 质检回环」的 AIGC 影像量产方法在情感叙事题材上的可行性