P4 Theater

演员矛盾微表情扫描方法论:从 T0 锚定到当前窗口限定

来源版本:2026-06-04 · 公开:2026-09-08 · 2,953 字符 · P4 剧场研究档案

下载完整公开版 Markdown段落与引用数据(JSON)引用本文回到影片资料
本篇目录 / Contents

演员矛盾微表情扫描方法论:从 T0 锚定到当前窗口限定

一句话

演员矛盾和幽灵技术不能靠 MiMo 一次性“看懂”。它必须被拆成一个证据循环:

T0 锁大事实
-> MiMo 追微颗粒
-> visual-only 排污染
-> audiovisual 补声音
-> Owner 确认/纠偏
-> 新 T0 再进入下一轮 prompt

这个循环的目标不是让模型变成裁判,而是让模型变成微感知雷达。

为什么要先 T0 锚定

Phase7 到 Phase13 证明:如果不把人物、说话人、指代、服装、动作大事实写清楚,MiMo 会不断停留在“一个男的/一个女的”“可能看镜头”“可能说话”的粗层。

00:13:40-00:16:12 房间段,下一轮提示词必须硬锚:

这些不是让 MiMo 复述剧情,而是防止它重猜大事实。

为什么又要当前窗口限定

Phase12 clean rerun 证明:强 T0 提示词会产生副作用。模型有时会把 00:14-00:16 房间段的台词、门帘、问烟搬进 73:5080:30117:13 等后段窗口。

所以 prompt 必须分两类:

T0 锁定 prompt:用于已确认段落的极窄微细节复榨。
当前窗口限定 prompt:用于全片滚雪球和后段复扫,严格清账本窗出现/未出现什么。

判断规则:

为什么要 visual-only

visual-only 的价值不是“看得更准”,而是“把台词污染拿掉”。它能回答一个关键问题:

如果没有声音,这个概念还站得住吗?

Phase13 的答案是:很多核心判断仍然站得住。

因此 visual-only 是防污染滤网。它不能判断重音、门声和说话人,但能判断动作链是否真实存在。

为什么还要 audiovisual

audiovisual 的价值是补 visual-only 看不到的层:

例如 15:25-16:30 audiovisual 把 visual-only 不能听见的 没事没事、叹气、你有烟吗、门帘摩擦、打火机声都补出来;但如果它误判说话人,仍按 T0 校正。

五层证据表

层级 作用 可以裁决什么 不能裁决什么
Owner/T0 锁大事实 人物、说话人、指代、是否触碰、离场路线、关键动作 不替代后续微颗粒扫描
Local/T1 本地帧面/音频复核 眼神落点、物件性质、声音来源、秒点 不自动推出理论意义
MiMo visual-only/T2 防台词污染 设备/手势/身体/眼神/遮挡是否可见 不判断台词、重音、声源
MiMo audiovisual/T2 声画微候选 台词、声音、重音、底噪、声画地址 不覆盖 T0/T1
Synthesis/T3 概念组织 机制、公式、写作用语、待确认问题 不新增事实终判

扫描提示词模板

T0 锁定微窗

适用于 00:13:40-00:16:12 这类已被 Owner 锁定的段落:

你不需要重判人物、说话人、指代、是否触碰、是否离场。
这些由 T0 锁定。
你只追更细颗粒:
眼神落点、手的路线、手指形态、最近距离、嘴角、吞咽、吸气、门帘声、底噪、灯光变化、遮挡、镜头微动。
如果看不准,输出 Owner 确认问题。

当前窗口限定复扫

适用于全片滚雪球:

只能描述本窗口实际可见/可听内容。
先清账:本窗出现什么、未出现什么、容易被误带入什么。
如果本窗没有门帘、问烟、摄影机指认、素材压力,就明确写本窗未见。
身份锚只用于减少粗识别,不用于剧情填空。

visual-only 防污染

本轮没有音频。
不能判断台词、重音、门声、气息、画外回应。
只追可见证据:设备、眼神、手、身体、遮挡、光源、反射、画框、观众区。
输出污染排查:本窗没有出现哪些容易被早段硬锚带入的内容。

把不确定变成好问题

这套方法最重要的一点,是不要过快否定,也不要过快肯定。MiMo 看不准时,应该把“不准”变成可人工复核的问题。

坏问题:

这里是不是第二人称?

好问题:

14:44-15:10 甲瑞第一次看镜头时,视线落在镜头中心、镜头上方,还是镜头旁摄影师?

坏问题:

阿蒙是不是在看观众?

好问题:

15:30-16:08 阿蒙正面朝镜头那几秒,是看镜头中心,还是穿过镜头看摄影师/画外?

后续最该追的微颗粒

设备颗粒

眼神颗粒

手部颗粒

声音颗粒

物件颗粒

最终原则

让 MiMo 给新东西。
让 Owner 锁大事实。
让 visual-only 防污染。
让 audiovisual 补声画。
让 Wiki 保存每一次校准。

这套方法的目的不是生产更多漂亮词,而是让每个漂亮词都能回到一个手、一眼、一声气、一台机器、一次遮挡、一个门声、一个没有抵达的触碰。

引用与版本

P4 剧场研究档案:《演员矛盾微表情扫描方法论:从 T0 锚定到当前窗口限定》,来源版本 2026-06-04,公开研究版 2026-09-08

https://a.p4theater.top/research/hs-7d301d9639e0b542

馆内参考标记指尚未在本次文库公开的资料,不能视为读者已可访问的独立证据。不同版本、译文与同一材料的转述,不计作相互独立的证据。