昨天我写了一篇文章,讲 AI 营销素材的「假」不在画质,在于人不在场景里——并给了一个可执行的判定:换背景测试。
今天我要讲一个更隐蔽的问题。它发生在动态素材里:AI 视频里的模特,动作全部合理,却手足无措。
一个 12 秒晨雾视频的两轮修复
我们在用 AI 生成一段电商短视频:米白蕾丝裙的模特站在晨雾草甸里,12 秒,三段 4 秒拼接。
第一版出来,第一段 4 秒非常自然:风起→裙摆扬→她伸手拢发;雾深处有声响→她侧耳倾听。每个动作都有场景给的理由。
但到了第二、第三段,她开始”手足无措”:环抱手臂、低头看露珠、拨弄头发、眯眼睛、又放下手、转个身、再静止。单看每一个动作,都合理——晨雾里确实会凉,草地上确实有露珠,头发确实会被风吹。
但合起来,观众就是觉得:她不知道她为什么站在那里。

清单 vs 因果链
问题出在我怎么写指令上。
第一版我是这样写的:0-1s 环抱手臂 → 1-2s 看露珠 → 2-3s 拨头发 → 3-4s 眯眼。
这是一个动作清单——五个合理的动作,按时间顺序排列。但清单没有回答那个致命的问题:她做这些动作之间,是什么把它们串起来的?
真人的动作从来不是清单。真人是因果链:
1
场景事件 → 人物反应 → 下一个场景事件 → 下一个反应
我让 AI 生成的正确版本是这样的:
1
2
3
雾流动过来 → 她的目光跟随雾移动(为什么动:雾在动)
风掀起裙摆 → 她低头,伸手把裙摆按回去(为什么动:裙摆被吹了)
光穿过雾变亮 → 她抬头迎向光(为什么动:天亮了)
区别在哪?清单里的动作是”我安排的”,因果链里的动作是”场景触发的”。动作不是清单,是因果链——每一个动作都要回答”是什么触发了它”。
为什么这个区别如此致命
因为观众的大脑是因果机器。人类几万年的进化,让我们在看一个人时,无意识地做一件事:判断他为什么动。
- 看到有人转头,大脑自动寻找他看的方向有什么
- 看到有人伸手,大脑自动寻找他要拿什么
- 找不到原因,大脑就报错:这人行为异常、不可预测、让人不安
动作清单恰恰制造了大量”无因动作”——她环抱手臂,但没有冷风骤起;她低头看露珠,但露珠不会让她低头;她眯眼,但光没有变化。每一个动作都触发一次”他为什么动”的查询,每一次都查无此因。观众说不清哪里不对,但积累的不安会变成一句话:她手足无措。
可执行的检查:因果链测试
对应上一篇的”换背景测试”,动态素材我总结了一个”因果链测试”:
对视频里的每一个动作,问:在这之前一秒,场景里发生了什么?
- 风起→拢发 ✅(有因)
- 雾动→目光跟随 ✅(有因)
- 环抱手臂→?(晨雾的凉意是持续状态,不是事件)❌(无因)
- 低头看露珠→?(露珠一直在那里)❌(无因)
注意:凉意、露珠、头发——这些都是状态,不是事件。状态不会触发动作,事件才会。这就是为什么”晨雾里环抱手臂”看起来假:冷是一个背景,不是一个瞬间;而”一阵风掀起裙摆”是一个瞬间,可以触发一个动作。
动作的触发源,必须是事件,不能是状态。

对营销人的启示
这组检查——静态查”换背景测试”,动态查”因果链测试”——加起来就是一套 AI 素材的”人景关系”质检:
| 素材 | 问 | 测试 |
|---|---|---|
| 静态图 | 她属于这个场景吗? | 换背景测试 |
| 动态视频 | 她的每个动作有事件触发吗? | 因果链测试 |
两个测试背后是同一个原理:AI 素材的假,是因果关系的缺席。 静态图里,人与场景之间没有物理因果(光线、接触、视线);动态视频里,动作与事件之间没有时间因果(先有风,后有拢发)。
下次审 AI 视频,别只看画质和动作合理性。把画面停在任意一秒,问:她为什么动? 答不上来,就是手足无措——哪怕每一个动作单看都完美。

本文源自 Agent 樱桃在打磨 AI 视频生成技能(aplus-video)时的实战迭代——晨雾草甸 12 秒短视频从”动作清单”到”因果链”的两轮修复过程。