本篇目录 / Contents
演员矛盾微表情扫描方法论:从 T0 锚定到当前窗口限定
一句话
演员矛盾和幽灵技术不能靠 MiMo 一次性“看懂”。它必须被拆成一个证据循环:
T0 锁大事实
-> MiMo 追微颗粒
-> visual-only 排污染
-> audiovisual 补声音
-> Owner 确认/纠偏
-> 新 T0 再进入下一轮 prompt
这个循环的目标不是让模型变成裁判,而是让模型变成微感知雷达。
为什么要先 T0 锚定
Phase7 到 Phase13 证明:如果不把人物、说话人、指代、服装、动作大事实写清楚,MiMo 会不断停留在“一个男的/一个女的”“可能看镜头”“可能说话”的粗层。
对 00:13:40-00:16:12 房间段,下一轮提示词必须硬锚:
- 阿蒙/黄蒙是短发女性,房间段粉红/红色衣服。
- 甲瑞/孙甲瑞是男性,房间段竖纹衬衫。
- 阿蒙说
摄影机开着呢时用手指摄影机,观众也被指到。 - 画面拍到另一台摄影机。
我不想管他了是甲瑞说,他指子丑。他看素材会崩溃 / 他会发火的他是子丑。还让我演爱情重音在爱情,甲瑞手撑地并苦笑。没事没事是阿蒙轻声安慰,安慰未触碰成功。- 甲瑞掀黑帘、推门、门嘎吱响、轻声说
我去上个厕所后离开房间。 - 阿蒙留守后叹气、捂脸、再叹气,眼神游走,问
你有烟吗。
这些不是让 MiMo 复述剧情,而是防止它重猜大事实。
为什么又要当前窗口限定
Phase12 clean rerun 证明:强 T0 提示词会产生副作用。模型有时会把 00:14-00:16 房间段的台词、门帘、问烟搬进 73:50、80:30、117:13 等后段窗口。
所以 prompt 必须分两类:
T0 锁定 prompt:用于已确认段落的极窄微细节复榨。
当前窗口限定 prompt:用于全片滚雪球和后段复扫,严格清账本窗出现/未出现什么。
判断规则:
- 如果窗口在 T0 段内部:继承 T0 硬锚,追更细的手、眼、嘴、气息、声响。
- 如果窗口不在 T0 段内部:只保留人物身份方法,不把房间段剧情搬入窗口事实。
- 如果模型写出本窗未见内容:不删报告,但标为提示词污染,降权。
为什么要 visual-only
visual-only 的价值不是“看得更准”,而是“把台词污染拿掉”。它能回答一个关键问题:
如果没有声音,这个概念还站得住吗?
Phase13 的答案是:很多核心判断仍然站得住。
13:20-14:05没有台词,仍看到背景摄影机和三脚架。14:44-15:10没有台词,仍看到甲瑞撑地、侧身、头转镜头、苦笑、再看镜头。15:30-16:08没有问烟声,仍看到阿蒙捂脸后多点眼神路线。105:45-106:25没有台词,仍看到笑脸贴纸、非笑、白色管状物、手腕黑线和直视镜头。
因此 visual-only 是防污染滤网。它不能判断重音、门声和说话人,但能判断动作链是否真实存在。
为什么还要 audiovisual
audiovisual 的价值是补 visual-only 看不到的层:
- 台词是否发生。
- 重音落在哪里。
- 尾音是否虚掉。
- 是否有吞咽、吸气、叹气、咳嗽。
- 门帘、门轴、衣料、打火机、底噪是否出现。
- 画外是否有人回应。
- 观众区是否有低语、吸气、掌声或沉默压力。
例如 15:25-16:30 audiovisual 把 visual-only 不能听见的 没事没事、叹气、你有烟吗、门帘摩擦、打火机声都补出来;但如果它误判说话人,仍按 T0 校正。
五层证据表
| 层级 | 作用 | 可以裁决什么 | 不能裁决什么 |
|---|---|---|---|
| Owner/T0 | 锁大事实 | 人物、说话人、指代、是否触碰、离场路线、关键动作 | 不替代后续微颗粒扫描 |
| Local/T1 | 本地帧面/音频复核 | 眼神落点、物件性质、声音来源、秒点 | 不自动推出理论意义 |
| MiMo visual-only/T2 | 防台词污染 | 设备/手势/身体/眼神/遮挡是否可见 | 不判断台词、重音、声源 |
| MiMo audiovisual/T2 | 声画微候选 | 台词、声音、重音、底噪、声画地址 | 不覆盖 T0/T1 |
| Synthesis/T3 | 概念组织 | 机制、公式、写作用语、待确认问题 | 不新增事实终判 |
扫描提示词模板
T0 锁定微窗
适用于 00:13:40-00:16:12 这类已被 Owner 锁定的段落:
你不需要重判人物、说话人、指代、是否触碰、是否离场。
这些由 T0 锁定。
你只追更细颗粒:
眼神落点、手的路线、手指形态、最近距离、嘴角、吞咽、吸气、门帘声、底噪、灯光变化、遮挡、镜头微动。
如果看不准,输出 Owner 确认问题。
当前窗口限定复扫
适用于全片滚雪球:
只能描述本窗口实际可见/可听内容。
先清账:本窗出现什么、未出现什么、容易被误带入什么。
如果本窗没有门帘、问烟、摄影机指认、素材压力,就明确写本窗未见。
身份锚只用于减少粗识别,不用于剧情填空。
visual-only 防污染
本轮没有音频。
不能判断台词、重音、门声、气息、画外回应。
只追可见证据:设备、眼神、手、身体、遮挡、光源、反射、画框、观众区。
输出污染排查:本窗没有出现哪些容易被早段硬锚带入的内容。
把不确定变成好问题
这套方法最重要的一点,是不要过快否定,也不要过快肯定。MiMo 看不准时,应该把“不准”变成可人工复核的问题。
坏问题:
这里是不是第二人称?
好问题:
14:44-15:10 甲瑞第一次看镜头时,视线落在镜头中心、镜头上方,还是镜头旁摄影师?
坏问题:
阿蒙是不是在看观众?
好问题:
15:30-16:08 阿蒙正面朝镜头那几秒,是看镜头中心,还是穿过镜头看摄影师/画外?
后续最该追的微颗粒
设备颗粒
- 背景摄影机的镜头朝向。
- 三脚架支脚数、云台、机身边缘。
- 是否有开机指示灯。
- 设备是否被甲瑞身体遮挡/显影。
- 设备在画面中是否被阿蒙或甲瑞看见。
眼神颗粒
- 镜头中心、镜头旁、摄影师身体、画外、门、地面、高处的具体顺序。
- 停留时长。
- 是否失焦。
- 是否眨眼后重新落点。
- 是否伴随头部转动,还是只有眼球移动。
手部颗粒
- 阿蒙指摄影机是单指、掌心、手腕带动还是整臂指向。
- 阿蒙未完成安慰手的起点、路线、最近距离、是否悬停。
- 甲瑞撑地是哪只手、掌心还是指尖、重心是否压上。
- 甲瑞
你说话时手指方向是否与眼神同轴。
声音颗粒
爱情的重音是否同时有喉咙/吞咽/气息变化。没事没事的声量、尾音、是否贴近安慰手动作。- 黑帘布料声和帘后门轴声能否分层。
你有烟吗前是吸气、吞咽、屏息还是轻笑。- 打火机声是否构成问烟回应。
物件颗粒
105:45-106:25白色管状物是什么。- 手腕黑色图案是否闭合。
- 黄色笑脸贴纸数量和位置。
- 红色脸部线条是否固定图案。
- 背景红色指示灯是否来自设备。
最终原则
让 MiMo 给新东西。
让 Owner 锁大事实。
让 visual-only 防污染。
让 audiovisual 补声画。
让 Wiki 保存每一次校准。
这套方法的目的不是生产更多漂亮词,而是让每个漂亮词都能回到一个手、一眼、一声气、一台机器、一次遮挡、一个门声、一个没有抵达的触碰。
