# 人类投降派逐句对白声画解读-第930-979句-2026-06-21

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-07；不表示已完成同行评审。

来源版本日期：2026-06-29

证据边界：分段卷页。第930-979句已按 T0/T1 与四概念补强；本卷从 #930 起继续逐句深读；T0 台词账为逐句底盘，T1 4K/音频本地复核为声画底盘，MiMo 只作 T2 候选。当前已写至 #979 阿蒙 `我不知道我该干什么`，并已单独处理 #964 到 #965 前 66.000s 长尾/等待窗口、#965 精确句、#966 到 #967 前 3.100s 材料间隙、#967 精确句、#968 精确句、#968 到 #969 的微间隙/介质加压、#969 精确句、#969 到 #970 前 3.567s 低能量间隔、#970 精确句、#970 到 #971 前 2.333s 间隔与 #971 重复确认对照、#971 精确句、#971 到 #972 前 7.566s 长间隔与 #972 精确句、#972 到 #973 前 0.500s 短隙、#973 精确句与 #974/#975 前奏对照、#974 精确句与 #975-#981 干什么/说什么/压力链对照、#975 精确句与 #976 即时反句对照、#976 精确句、#976 到 #977 前 6.066s 低能非静音等待与 #977 预入声对照、#977 精确句、#977 到 #978 前 1.967s 低能非静音等待与 #978 预入声对照、#978 精确句、#978 到 #979 前 3.434s 低能非静音等待与 #979 预入声对照、#979 精确句、#979 到 #980 前 0.234s 极短低能非静音铰链与 #980 预入声对照；本卷封口，下一步进入新卷 #980 阿蒙 `我也不知道我该说什么`。既有 #930-#966 边界继续有效；#955 起采用无偏移文件时间轴，旧 +3480s 路径已由 ASR 判定为无关段落。#964 可写为 #962-#963 后的事件/掉出物命名句，但不得升级为画面出现桃子、圆形水果、包、包口、掉出轨迹、落地、滚动、物体碰撞、车站空间、交通声、包摩擦声、拉链声、音乐转场或硬切换场；#964 到 #965 前长尾不是 #964 的即时落地余声，而是公开观看场向平台/塑料/黑衣人物/近脸转入的材料等待；#965 可写为长尾材料等待后浮起的阿蒙声道知道/被知道关系句，但不得写成近脸口型同步、声源透明、全知事实、监控事实、温柔理解、心理诊断、音乐转场、完全静音或由画面近脸反向改派说话人；#966 可写为 #965 知道关系后的短促反问/知道权回扣，但不得写成口型同步、声源透明、完全静音、音乐转场、硬切换场、心理事实、具体材料来源或 #967 `空气中` 的提前解释；#967 可写为知道权反问后转入空气/介质/弥漫链条的入口，但不得写成 #966 的答案、可见口型同步、声源透明、完全静音、音乐转场、风声/气流声、空气直接显影、心理事实或 `奇怪的东西` 已在 #967 精确窗被交出；#968 可写为 #967 的重复抬亮和 #969 前的介质加压，但不得写成可见口型同步、声源透明、音乐转场、风声/气流声、空气声效、硬切换场、心理事实、可见人物即说话人或 `奇怪的东西` 已在 #968 精确窗显影；#969 可写为空气/介质链条的弥漫展开，但不得写成可见新实体、怪物、幽灵、具体物件、口型同步、声源透明、音乐转场、风声/气流声、空气声效、硬切换场、心理事实或由画面人物反推说话人；#970 可写为 #969 后低能等待场被命名为期待，但不得写成可见期待对象、心理事实、音乐性期待、风/空气声效、物体显影声、口型同步、声源透明、硬切换场或由画面可见人物反推说话人；#971 可写为 #970 后的重复确认和回钉，但不得写成期待对象显影、声学升级、音乐高潮、风/空气声、绝对静音、可见人物即说话人、可见人物即 #972 的 `他` 或心理事实透明化；#972 可写为无主期待被改写成第三人称归属，但不得写成可见人物身份裁决、心理事实透明化、期待对象显影、音乐高潮、风/空气声、声源透明、口型同步、硬切换场或 #973 `每一双眼睛` 的提前兑现；#973 可写为第三人称期待后转入集体观看压力，但不得写成具体眼睛对象显影、所有观众真实心理、口型同步、声源透明、音乐高潮、绝对静音、强硬切或 #972 的 `他` 已被回溯裁决；#974 可写为 #973 后对观看/记录/在场行为的低位追问，并前向连接 #979 `我不知道我该干什么`、#980 `我也不知道我该说什么` 和 #981 `它有一种压力`，但不得写成 `你` 已被可见对象裁决、手机拍摄事实已成立、白衣可见人物即说话人、口型同步、音乐转场、绝对静音、强硬切或 #975 的 `他们想说话` 已被提前证明；#975 可写为 #973 `每一双眼睛` 和 #974 `你在干嘛呢` 后的说话压力命名，但不得写成所有观众真实心理、所有人确实想说话、`肯定` 已被画面证实、可见白衣人物即说话人、可靠口型同步、音乐高潮、绝对静音破裂、强硬切或 #976 `没有人说出来` 已经把 #975 全部解释完；#976 可写为 #975 的降声反句和说话失败入口，但不得写成声学静音、所有人真实沉默心理、现场清空、音乐收束、口型同步、声源透明、强硬切、#977 已被 #976 完全解释或 #975 已由 #976 全部解释完；#977 可写为 #966 同句在 #976 无人说出后的第二次知道权回返，但不得写成 #976 已完全解释 #977、可见人物口型同步、声源透明、所有人真实知道、心理事实透明化、音乐高潮、绝对静音破裂、强硬切或 #978 的紧张已在 #977 内透明完成；#978 可写为 #977 后把知道权逼问回收到惯常时刻/自我状态，但不得写成心理事实透明化、`特别紧张` 是句内声学高潮、可见人物口型同步、声源透明、音乐高潮、绝对静音破裂、强硬切、可见人物身份裁决或 #979 `我不知道我该干什么` 已被 #978 完全解释；#979 可写为 #978 惯常紧张之后的行动债回收，并回接 #974 `你在干嘛呢`，但不得写成单纯无助心理、#978 已完全解释 #979、可见人物口型同步、声源透明、音乐高潮、强硬切、可见人物身份裁决或 #980 `我也不知道我该说什么` 已由 #979 完全解释。MiMo 可作 T2 反读辅助；MiMo 对声音性别、说话人、人物身份、材料来源、静音期、硬切、风/空气声、期待对象和心理动机等具体判断不作 canonical 采用。

# 人类投降派逐句对白声画解读-第930-979句-2026-06-21

## 本卷说明

- 返回总入口：人类投降派逐句对白声画解读总入口-2026-06-20（馆内参考，未随本文公开）
- 上一卷：[人类投降派逐句对白声画解读-第880-929句-2026-06-21](/research/hs-791294eecd42f498)
- 下一卷：[人类投降派逐句对白声画解读-第980-1029句-2026-06-22](/research/hs-40c4893d79a20143)。
- 计划覆盖范围：第 `930-979` 句；当前已写至 #979，本卷封口。已处理 #964 到 #965 前 `66.000s` 长尾/等待窗口、#965 精确句、#966 到 #967 前 `3.100s` 材料间隙、#967 精确句、#968 精确句、#968 到 #969 的微间隙/介质加压、#969 精确句、#969 到 #970 前 `3.567s` 低能量间隔、#970 精确句、#970 到 #971 前 `2.333s` 间隔与 #971 重复确认对照、#971 精确句、#971 到 #972 前 `7.566s` 长间隔、#972 精确句、#972 到 #973 前 `0.500s` 短隙、#973 精确句与 #974/#975 前奏对照、#974 精确句与 #975-#981 干什么/说什么/压力链对照、#975 精确句与 #976 即时反句对照、#976 精确句、#976 到 #977 前 `6.066s` 低能非静音等待与 #977 预入声对照、#977 精确句、#977 到 #978 前 `1.967s` 低能非静音等待与 #978 预入声对照、#978 精确句、#978 到 #979 前 `3.434s` 低能非静音等待与 #979 预入声对照、#979 精确句、#979 到 #980 前 `0.234s` 极短低能非静音铰链与 #980 预入声对照。
- 起点时间码：`01:25:16.900`。
- 下一条 T0：#980 阿蒙 `我也不知道我该说什么`，`01:32:33.200-01:32:34.566`；进入下一卷 [人类投降派逐句对白声画解读-第980-1029句-2026-06-22](/research/hs-40c4893d79a20143)。
- 证据底盘：T0 台词账 + #929 本地复核页 + #930-#978 本地 4K/音频复核页 + #964 到 #965 前 66s 长尾复核页 + MiMo T2 降级/反读观察；#932/#933 均已补带音频 MiMo，原无音频 review clip 不作声音证据；#946 MiMo 中国区 endpoint 旧尝试返回 401，#947 起恢复 CN endpoint；#949 第一次脚本调用被旧环境 key 触发 401，清掉环境变量后 keychain 读取成功；#953-#967 继续使用清掉旧环境变量后的 CN endpoint，声画/视觉/链条/音频报告成功；#968 到 #970 使用 public endpoint 跑通已有报告；#971 未新增 MiMo 运行，既有 #970-#971 T2 报告只作背景，#971 强弱、长间隔、静音和观看场判断以本地 T1 为准；#972 CN 端旧尝试返回 401，后经标准 API 复跑成功，只保留同一观看场、黑色遮挡、塑料/薄纱和手机微光候选，台词/人称误听不采用；#973 标准 API 两次复跑成功，可保留无眼睛特写、同一观看场、左侧持杯/喝水候选、右侧手机/发光物候选、无音乐和 #974 后低能转场，白衣可见人物即说话人、口型同步、硬切和心理动机均降级或不采用；#974 标准 API 视频两条与音频一条均成功，可保留同一观看场、暖色近身换载、塑料薄膜/设备/灯光压力场、无音乐和低能非静音声场；#975 标准 API 三路报告可保留低角度白衣近身场、后续塑料/薄膜/暖光/设备压力场、无明显音乐和低背景声，转写、声音性别、可见人物即说话人、口型同步、具体脚步/材料声来源和近乎静音判断均降级或不采用；#976 本地复核以 #976 精确句、#976 到 #977 前 `6.066s` 等待、#977 预入声和 #976 到 #981 压力链为底盘，现阶段未新增 MiMo 调用，只读取既有 #975-#981 T2 报告作边界参考；#977 本地复核以 #966 同句对照、#977 精确句、#977 到 #978 前 `1.967s` 等待、#978 预入声和 #977 到 #981 压力链为底盘，现阶段未新增 MiMo 调用，只读取既有 #975-#981 T2 报告作边界参考；#978 本地复核以 #978 精确句、句内粗切、#978 到 #979 前 `3.434s` 等待、#979 预入声和 #978 到 #981 压力链为底盘，现阶段未新增 MiMo 调用，只读取既有 #974-#981 T2 报告作边界参考；#955 起已校正为无偏移文件时间轴，旧 +3480s 路径不再作为内容证据；#956 MiMo ASR 误听为 `好像有一点黑黑的`，只能记录误听风险，不能覆盖 T0；#957 MiMo 声音性别判断不一致，不采用；#958 MiMo 对重复停顿的听感与 T1 波形分段存在轻微分歧，停顿判断以 T1 为准；#959 精确黑色视频声音包装因过短返回 `400`，改用 `01:29:48.000-01:29:50.300` 黑色视频声音上下文成功；#959 MiMo 对右侧暖色增强感知偏弱，暖色判断以 T1 密帧指标为准；#960 MiMo 静音视觉报告偏短但方向可用，声音黑色视频报告对两次 `飞呀` 强弱关系判断弱于 T1，强弱关系以 T1 rolling RMS 为准；#961 MiMo 对可见身体身份、声音性别和擦拭动作说得偏确定，已降级为右侧白衣/白色材料局部动作候选；#962 MiMo 对声音性别/说话人和 `静默/干音` 说法不采用，静默和声场判断以 T1 波形、silencedetect 和频谱为准；#963 MiMo 对声音性别/说话人、人物身份、雕塑/女性等具体身份描述不采用，只保留无情侣、无包、无桃子掉落、无车站声景和同一公开观看场持续的反读方向；#964 MiMo 纯音频通道自称未收到音频，降级为 weak/unusable output，声音判断以 T1 波形、频谱、silencedetect 和声画视频报告为准；#964-#965 长尾完整提示第一次 MiMo 输出过短不可用，三段中性形式、材料声峰值和 #965 边界报告可作 T2 候选；#965 MiMo 可保留口型不透明、无音乐、句后材料声、脸到背部/平台/观众转移，声音性别、声源方向、完全静音期和具体材料来源均降级或不采用；#966 MiMo 可保留无脸/无嘴、无音乐、#966 到 #967 前非静音材料间隙和同一材料/平台空间内遮挡变化，声音性别、声源方向、人物身份、材料来源、硬切和心理动机均降级或不采用；#967 MiMo 可保留无脸无嘴、无音乐、空气由塑料/薄膜/暖光间接显影和 #966-#969 介质链条方向，纯音频绝对时间点、声音性别、声源方向、人物身份、材料来源、EXIT 象征、硬切和心理动机均降级或不采用；#968 MiMo 可保留白衣黑下装人体、塑料薄膜、暖橙光、低顶空间、无音乐/无风声、#968 重复强调空气并接向 #969 的方向；精确视觉报告的声音判断、男声/同一男声、可见人物即说话人、口型同步、EXIT 象征和奇怪东西显影均降级或不采用；#969 MiMo 可保留无新实体、无硬切、塑料薄膜和暖橙光增强、#969 后低能非音乐间隔、#970 相对抬起；声音性别、可见人物即说话人、口型同步、EXIT 象征、风/空气声可能性和心理动机均降级或不采用；#970 MiMo 可保留同一空间、薄膜/暖光主导、无新实体、无硬切、无音乐、#970 与 #971 重复确认链；可见人物作为期待对象、风/空气声推断和 #971 强于 #970 均按 T1 降级或否决；T0 时间和说话人始终以台词账为准。
- 本卷边界：既有 #930-#966 边界继续有效；#964 可写为 #962-#963 后的事件/掉出物命名句，但不得升级为画面出现桃子、圆形水果、包、包口、包内空间、从包/容器掉出、落地、弹跳、滚动、物体碰撞、车站空间、交通声、包摩擦声、拉链声、音乐转场、硬切或空间换挡；#964 到 #965 前 `66.000s` 长尾不得并入 #964 的即时物证，应单独写作公开观看场向平台/塑料/黑衣人物/近脸转入的材料等待；#965 不得写成可见口型同步、声画归属透明、全知事实、监控事实、温柔理解、音乐转场或由画面人物反推说话人；#966 不得写成可见口型同步、声源透明、面对面质问、完全静音、音乐转场、硬切换场或 #967 `这空气中` 的提前答案；#967 不得写成 #966 的答案、可见口型同步、声源透明、完全静音、音乐转场、风声/气流声、空气直接显影、心理事实或 `奇怪的东西` 已在 #967 精确窗被交出；#968 不得写成可见口型同步、声源透明、音乐转场、风声/气流声、空气声效、硬切换场、心理事实、可见人物即说话人或 `奇怪的东西` 已在 #968 精确窗显影；#969 不得写成可见新实体、怪物、幽灵、雾团、空气实体、具体物件、口型同步、声源透明、音乐转场、风声/气流声、空气声效、硬切换场、心理事实或由画面人物反推说话人；#970 不得写成可见期待对象、人物心理事实、音乐性期待、风声/气流声、空气声效、物体显影声、口型同步、声源透明、硬切换场、可见人物即说话人或 #971 声学强于 #970；#971 不得写成期待对象显影、音乐高潮、风/空气声、声学升级、绝对静音、可见人物即说话人、可见人物即 #972 的 `他`、硬切换场或心理事实透明化；#972 不得写成可见人物身份裁决、心理事实透明化、期待对象显影、音乐高潮、风/空气声、声源透明、口型同步、硬切换场、#973 `每一双眼睛` 的提前兑现或 #972 的 `他` 已被 #973 回溯裁决；#973 不得写成具体眼睛对象显影、所有观众真实心理、口型同步、声源透明、音乐高潮、绝对静音、强硬切、#974 的 `你` 已被可见对象裁决或 #972 的 `他` 已被回溯裁决；#974 不得写成 `你` 已被画面裁决为某个具体人、手机/发光物等于拍摄事实、白衣可见人物即说话人、可靠口型同步、音乐转场、绝对静音、强硬切或 #975 的 `他们想说话` 是他人真实心理事实。不得裁决心理事实、真实梦境/记忆、现实犯罪、声源透明、口型逐音同步或梦/现实层级。
- #975 边界补充：#975 可写为 #973 `每一双眼睛` 和 #974 `你在干嘛呢` 后的说话压力命名，但不得写成所有观众真实心理、所有人确实想说话、`肯定` 已被画面证实、可见白衣人物即说话人、可靠口型同步、音乐高潮、绝对静音破裂、强硬切或 #976 `没有人说出来` 已经把 #975 全部解释完。
- #976 边界补充：#976 可写为 #975 的降声反句和说话失败入口，但不得写成声学静音、所有人真实沉默心理、现场被清空、音乐收束、可见白衣人物即说话人、口型同步、声源透明、强硬切、#977 已被 #976 完全解释或 #975 已由 #976 全部解释完。
- #977 边界补充：#977 可写为 #966 同句在 #976 无人说出后的第二次知道权回返，但不得写成 #976 已完全解释 #977、可见人物口型同步、声源透明、所有人真实知道、心理事实透明化、音乐高潮、绝对静音破裂、强硬切或 #978 的紧张已在 #977 内透明完成。
- #978 边界补充：#978 可写为 #977 第二次 `就你知道吗` 后把知道权逼问回收到惯常时刻/自我状态，但不得写成心理事实透明化、`特别紧张` 是句内声学高潮、可见人物口型同步、声源透明、音乐高潮、绝对静音破裂、强硬切、可见人物身份裁决或 #979 `我不知道我该干什么` 已被 #978 完全解释。
- #979 边界补充：#979 可写为 #978 惯常紧张之后的行动债回收，并回接 #974 `你在干嘛呢`；不得写成单纯无助心理、#978 已完全解释 #979、可见人物口型同步、声源透明、音乐高潮、强硬切、可见人物身份裁决、#980 `我也不知道我该说什么` 已被 #979 完全解释，或采用 MiMo 误听的 `干什么事`。

## 逐句深读

### #930｜甲瑞：你是怎么感觉的

```text
T0：#930
时间：01:25:16.900-01:25:18.066
说话人：甲瑞 / ACT-JIARUI
台词：你是怎么感觉的
机制标签：偷入 / 偷入关系
```

这一句不能离开 #929 读。#929 刚刚说的是 `对那个更大的东西`。这句话已经把一个对象放进语言里，但画面没有交付对象：没有切到某个物，没有切到某个装置，没有反打到某个被问者，也没有把 `更大的东西` 变成可见实体。

#930 做的不是解释，而是转换。它不说“那个更大的东西是什么”，而说：

```text
你是怎么感觉的
```

也就是说，未被画面兑现的对象被转移给 `你` 的感觉系统。`更大的东西` 没有成为可知对象，而成为可被询问、可被报告、可被索取的感觉对象。

声学上，#930 也不是 #929 的延长。#929 全句 RMS=`-15.6765dBFS`，Peak=`0.0000dBFS`，20-250Hz 占比 `0.2262`，250-1000Hz 占比 `0.7426`，是人物声道强行回入。#930 全句 RMS=`-22.1353dBFS`，Peak=`-8.1641dBFS`，比 #929 低约 `6.46dB`，没有触顶。但 #930 的 20-250Hz 占比达到 `0.8035`，谱心约 `448.7Hz`。这说明它不是强闯入，而是低位追问：声音更弱，却更沉。

两句之间的 `85:14.966-85:16.900` 也不是空白。它 RMS=`-39.3464dBFS`，4-12kHz 占比 `0.3566`，12-20kHz 占比 `0.5095`，谱心约 `11207.8Hz`。这个高频/超高频薄段像一个冷却缝：#929 把模糊对象推出来，声音退薄，然后 #930 才把这个对象改写成感觉问题。

把 #930 自身拆开看，会更清楚：

```text
85:16.900-85:17.250  RMS=-20.1785dBFS，20-250Hz=0.6506，谱心=291.2Hz
85:17.250-85:17.650  RMS=-20.5118dBFS，20-250Hz=0.6405，谱心=563.2Hz
85:17.650-85:18.066  RMS=-32.8268dBFS，1-4kHz=0.6244，谱心=3971.2Hz
```

前两段是低频/低中频人声主体，尾段突然抽薄。问句真正的重量落在前面，而不是最后的尾音。最后的 `的` 更像被放出去后迅速变薄，留下一个等待空位。MiMo sound-first T2 也注意到尾音“抽薄并消失”，但它的时间轴整体提前，精确时间仍以 T1 为准。

这一句也不能写成音乐。`85:14.500-85:21.000` 的本地声谱和 MiMo sound-first 都没有支持明确音乐结构。这里有持续公共声床、环境底噪、高频/超高频尾部和低频人声问句；没有可确认旋律、节拍、主题音乐或配乐进入。换句话说，#930 的压力不是“音乐煽情”，而是人声从公共声床里低位浮出、问完又沉回环境尾部。

画面同样不给答案。#930 入声、句中、句尾都维持固定低机位公开空间：反光水平面、白色半透明屏障、观众剪影、中部背向身体候选、右前景白衣/白布身体、水瓶、红色前景物和手部遮挡都在。对 `8514p500-8521p000` review clip 做 `scene>0.04` 检测，无硬切命中。没有反打，没有被问者特写，没有可签收的回答脸。

右前景身体处在低头侧向姿态，下颌/嘴部轮廓有变化候选；但角度、阴影和遮挡仍然使逐音口型不可确认。T0 锁说话人为甲瑞，逐句正文可以写甲瑞声道；但 T1 不给“画面透明地证明这个嘴说了这句话”的权限。人物语言回来了，仍然回到一个屏障、反光、观众和边缘身体构成的公开装置空间里。

这就是 #930 的锋利处：`你是怎么感觉的` 日常听起来像关心，但在这里不能直接写成温柔或共情。它紧接一个未显影的 `更大的东西`，T0 机制标签又是 `偷入 / 偷入关系`。它不是先确认对方已经有可说的感受，而是把不可见对象交给第二人称去承担感觉。它问的是 `你`，但画面不给稳定的 `你`；它索取感觉，但不给回答空间。

逐词看，这句话的“温柔”其实一层一层把人推入结构。

`你` 是第二人称进入。它看起来亲近，像终于从“那个更大的东西”回到一个人身上；但顺序不能倒过来读。不是先有一个被镜头保护、被关系承认的 `你`，再去谈某个对象；而是 #929 先把 `那个更大的东西` 放到场上，#930 才把 `你` 叫进来。也就是说，这个 `你` 一出现，就已经站在一个未明对象面前。它不是自由主体的召唤，而是被安排到对象关系里的位置。

`是` 很小，但很硬。它把问句从“你有没有感觉”“你愿不愿意说”推到“你是怎么感觉的”。感觉被预设为已经发生，剩下的是形式、方式、状态的说明。`是` 像一枚语法卡扣，把 `你` 和 `怎么感觉` 扣在一起：你已经在感觉了，现在说出你是怎样感觉的。它取消了“我不感觉”“我不回答”“我不进入这个框架”的空间。

`怎么` 表面最开放，潜台词最程序化。它不像“疼吗”“害怕吗”那样给出一个明确情绪，也不像“你想什么”那样让对方转入判断。它要的是方式、程度、形状、路径。`怎么` 把不可见对象改造成可描述格式：你要给出一种感觉的样子。它不是让对象变清楚，而是让感受变可采集。

`感觉` 是这句话最柔软、也最危险的词。它好像比“想法”“解释”“答案”更尊重身体；但在这里，身体恰恰被变成了传感器。#929 的 `更大的东西` 没有显影，#930 就让感觉替它显影。换句话说，画面不给对象，语言也不解释对象，于是 `你` 的感觉被要求承担对象存在的证据功能。

最后的 `的` 把问句收成一个可被提取的单位。它不像“你感觉怎么样啊”那样散在口语尾部，而是把 `怎么感觉` 收束成一种可回答、可记录、可回收的结果：你是怎么感觉的。声学上，尾段恰好抽薄，RMS 降到 `-32.8268dBFS`，1-4kHz 占比升高；像采集框已经闭合，声音自己却撤开，把压力留给被问者。

所以这句话的潜台词不是：

```text
我关心你。
你可以安全地说。
我会接住你的感受。
```

更接近：

```text
那个东西我不解释。
画面也不把它交出来。
现在由你来感觉它。
而且你要把这种感觉变成现场可以读取的形式。
```

它最深的“偷入”就在这里：它不用命令的外壳，而用关心的语气；不用说“交代”，而说“感觉”；不用把对象说明白，而让对象通过你的身体返回。它像给你一个内在空间，实际上把内在变成了公共证据。观众、屏障、反光地面、白布身体和低机位都还在，所以这个“你”的感觉并没有被私密地收容，而是在一个可观看的场里被召唤。

所以本句的稳定读法是：

```text
#929：人物声道强行回入，提出未交付的“更大的东西”
#930：低频追问，把未交付对象转成“你的感觉”
```

它不是回答成立，而是回答权被悬置；不是对象显影，而是对象被感觉化；不是关系缓和，而是第二人称再次被叫进一个公开观看场。下一句 #931 `对那个` 会重新回到对象指称，这也说明 #930 没有解决 `那个更大的东西`，只是把它暂时推给了感觉。

### #931｜甲瑞：对那个

```text
T0：#931
时间：01:25:27.433-01:25:28.200
说话人：甲瑞 / ACT-JIARUI
台词：对那个
机制标签：未标记 / 语气残片
```

#931 必须先从它前面的空隙读起。#930 刚刚问的是 `你是怎么感觉的`，这句话把 #929 的 `那个更大的东西` 转给了第二人称的感觉系统。正常的对话期待，是这里会出现一个回答：一种感受、一点犹豫、一个拒绝，或者至少一个被问者的反应。但 #930 结束于 `85:18.066`，#931 要到 `85:27.433` 才进入，中间有 `9.367s` 无新 T0。这个空隙本身就是事件的一部分：问题被抛出去，回答没有回来。

这 `9.367s` 不是静音。T1 复核显示，#930 后到 #931 前 RMS=`-34.0493dBFS`，Peak=`-8.3306dBFS`，250-1000Hz 占比 `0.2670`，1-4kHz 占比 `0.2614`，4-12kHz 占比 `0.2952`，谱心约 `5006.4Hz`。它是一段公共声床/环境尾部，而不是一个被回答填满的私人空白。画面也没有切走：低机位、观众、白色半透明屏障、反光水平面、右前景白衣/白布身体、水瓶、红色前景物都还在。`scene>0.04` 没有 filtered frame。也就是说，#930 的问题没有被带进私密空间，而是在公开观看结构里被悬着。

然后 #931 突然进来：

```text
对那个
```

这句话最重要的事实，是它没有接 #930 的 `感觉`。它没有说“你是不是觉得……”，没有说“你感觉到……”，也没有说“那是什么感觉”。它删掉了 `你`，删掉了 `感觉`，只把语言重新绕回 `对那个`。所以 #931 不是回答，而是回指。它把 #930 打开的感受通道重新折回 #929 的对象空位。

声音上，#931 比 #930 强得多，也短得多。#931 全句只有 `0.767s`，但 RMS=`-13.1320dBFS`，Peak=`-0.6999dBFS`，没有 clipped samples。#930 的 RMS 是 `-22.1353dBFS`，因此 #931 比 #930 高约 `9.00dB`。这不是一个轻轻补上的半句，而是长等待后突然压回来的低中频短声块。它的 20-250Hz 占比 `0.4008`，250-1000Hz 占比 `0.5935`，谱心约 `353.7Hz`；1kHz 以上几乎撤掉。#931 的力量不来自清亮高频，而来自低部和低中部的回压。

内部两段也能看出它不是平滑口语。前 `0.367s` RMS=`-10.8189dBFS`，Peak=`-0.6999dBFS`，250-1000Hz 占比 `0.8239`；后 `0.400s` RMS 降到 `-17.6340dBFS`，20-250Hz 占比升到 `0.4232`。最强 `0.05s` RMS 窗在精确窗内 `0.010-0.060s`，RMS=`-9.3333dBFS`；低频占比最高的 `0.05s` 窗在 `0.290-0.340s`，20-250Hz 占比 `0.9169`。这只能支持“强起、低拖”的粗声学结构，不能拿来逐字锁死 `对 / 那个` 的口型位置。但它足够说明：#931 不是柔和解释，而是把指称重新压回场上的短促入声。

逐词看，`对` 是方向，不是内容。它再次建立“面对某物 / 关于某物 / 朝向某物”的姿态。#929 已经说过 `对那个更大的东西`；#931 又回到 `对`，说明语言又回到对象关系，而不是停留在 #930 的感觉关系里。#930 问“你怎么感觉”，像是把主体拉进来；#931 说“对”，又把主体从中心移开，重新让关系结构先行。

`那个` 则是更冷的词。它不像 `这个` 那样贴近现场可见物，也不像物名那样交出内容。`那个` 假装对象已经共同在场：我不必说明，你应该知道。可是画面没有给出这个对象。#931 入声、句中、句尾都没有反打，没有特写，没有新的物、身体或装置被切出来承担 `那个`。于是 `那个` 不是答案，而是一根指针；它指向前文的 `更大的东西`，也指向画面拒绝兑现的空位。

这句的潜台词不是：

```text
你刚才已经回答了，我来确认一下。
```

而更像：

```text
没有关系，回答没有出现。
我们还是回到那个。
不是你的感觉先说话，
而是那个对象继续组织你。
```

这就是 #931 的残酷处。#930 看似给了 `你` 一个感觉入口，#931 却证明这个入口没有真正释放主体。因为一旦没有回答出现，甲瑞并不等待那个 `你` 自己组织语言，而是重新抛出 `对那个`。第二人称被叫进来，又被对象空位覆盖。感觉没有成为自由表达，反而变成对象回来的中转站。

画面在这里非常重要。右前景白衣/白布身体仍然贴在画面边缘，背部、肩部和侧向头部可见，但嘴部/下颌被角度、阴影和遮挡吞掉，不能逐音确认口型。左侧观众仍坐着，白色屏障仍横在后方，反光面仍复制所有人和物。声源在 T0 上归甲瑞，画面却不给一个透明的“甲瑞正在说”的嘴。这让 #931 更像一个通过公共装置返回的声音：它被锁定为人物台词，但它的可见承担者没有被镜头温柔交出来。

MiMo T2 这次只能当边界提醒：它看到了固定镜头、反射分割、白色屏障和公开空间持续，但没有听清 #931 的 `对那个`，还疑似把入声误写成硬物/金属敲击。因此本卷不采用 MiMo 的对白和声源判断；它只帮我们确认一个方法规则：多模态模型听不清时，不能把“没听清”写成“无对白”，更不能让物声猜测覆盖 T0/T1 的人声底账。

#931 后也立刻退空。`85:28.200-85:29.000` RMS=`-43.8933dBFS`，Peak=`-25.8183dBFS`，4-12kHz 占比 `0.2990`，12-20kHz 占比 `0.3912`，谱心约 `8897.9Hz`。强短句之后不是解释，而是高频/超高频尾部。下一句 #932 `就那个更大的东西` 要到 `85:31.766` 才来。#931 因此不是完整重述，它只是把指针抛回来，留下一个还要被下一句补写的缺口。

稳定读法：#931 `对那个` 是 #930 感觉提问后的强回指短句。它不是回答成立，不是对象显影，也不是关系缓和。它删掉 #930 的 `你` 和 `感觉`，只保留 #929 的朝向和指示：`对`、`那个`。声音上，它以比 #930 更强的低中频短声块重新入场；画面上，它仍发生在观众、屏障、反光和边缘身体构成的公开空间里。它真正做的事，是让问题绕了一圈之后回到对象空位：感觉没有被接住，回答没有回来，`那个` 继续取得事件组织权。

### #932｜甲瑞：就那个更大的东西

```text
T0：#932
时间：01:25:31.766-01:25:33.200
说话人：甲瑞 / ACT-JIARUI
台词：就那个更大的东西
机制标签：未标记 / 语气残片
```

#932 不能被当成一句孤立的解释。它必须从 #929 开始读。

```text
#929：对那个更大的东西
#930：你是怎么感觉的
#931：对那个
#932：就那个更大的东西
```

这四句看起来像在绕同一个对象，其实每一步都在改变对象和人的位置。#929 先把 `那个更大的东西` 放进现场，但画面没有给出对象；#930 不解释对象，而把它转给 `你` 的感觉系统；#931 没有得到回答，删掉 `你` 和 `感觉`，只剩 `对那个`；#932 再把 `那个` 补回 `更大的东西`。所以 #932 不是新话题，也不是迟来的说明书。它是回名：把刚才那个短促指针重新补成对象名。

但“回名”不等于“兑现”。#932 说得更完整，可画面仍没有把对象交出来。这一点是本句的核心。

#931 结束于 `85:28.200`，#932 要到 `85:31.766` 才进入。中间 `3.566s` 无新 T0。T1 复核显示，这段 RMS=`-40.1071dBFS`，Peak=`-19.9151dBFS`，1-4kHz 占比 `0.3586`，4-12kHz 占比 `0.2569`，12-20kHz 占比 `0.3013`，谱心约 `7509.5Hz`。这不是一个被回答填满的段落，也不是“安静地理解了”的心理空间。它是高频/中高频环境尾部，是 `对那个` 之后继续空着的公共声场。

换句话说，#932 不是接在对方回答之后。它接在无回答之后。#930 的 `你是怎么感觉的` 没有收到可确认回应；#931 已经把语言绕回对象；#932 再把这个对象说全。它的动作不是“我听见你了，所以我解释”，而更像“没有回答出现，那我们继续回到那个东西”。

声音上，#932 是这一组三句里最重的一次压回。#932 全句 `1.434s`，RMS=`-11.1340dBFS`，Peak=`0.0000dBFS`，存在 full-scale/near-clipped samples。ffmpeg `volumedetect` 复验 mean volume=`-11.1dB`，max volume=`0.0dB`，`histogram_0db=1076`；`astats` 复验 RMS level=`-11.1337dB`，Peak count=`582`。这些数字说明它不是轻声补语，而是满幅附近的强入声。

和 #931 比，差异很明显。#931 `对那个` RMS=`-13.1320dBFS`，Peak=`-0.6999dBFS`，已经很强；#932 又比它高约 `2.00dB`，并且更长。和 #930 `你是怎么感觉的` 的 RMS=`-22.1353dBFS` 相比，#932 高约 `11.00dB`。#930 是低位追问，#931 是强回指，#932 则是把对象名完整压回现场。它不是把话说清楚那么简单，它是把那个未显影对象说得更响、更满、更不可绕开。

频带也说明这个力量主要来自人声低部和低中部。#932 20-250Hz 占比 `0.1827`，250-1000Hz 占比 `0.7725`，1-4kHz 占比 `0.0445`，4kHz 以上几乎撤掉，谱心约 `520.9Hz`。它比 #931 的谱心 `353.7Hz` 更高一点，但仍然完全不是明亮解释或高频清晰化。它是一块厚的人声材料，从低中频里把 `更大的东西` 扛出来。

句内分段也有意义，但要谨慎使用。#932 前 `0.350s` RMS=`-9.4229dBFS`，Peak=`0.0000dBFS`；`0.350-0.800s` 更强，RMS=`-8.5875dBFS`，Peak=`0.0000dBFS`；`0.800-1.200s` 降到 RMS=`-16.9070dBFS`，20-250Hz 占比升到 `0.8331`；最后 `1.200-1.434s` 迅速退空，RMS=`-40.0830dBFS`，谱心升到 `10160.4Hz`。这只能说明它的粗形状：强起，中段最满，后段低拖，尾部抽空。不能据此把 `就 / 那个 / 更大的东西` 逐字锁在波形位置，也不能把满幅声压写成心理爆发。

MiMo 带音频版在这里可以补一条声音边界：它也把 #931 后到 #932 前听成 room tone / 低电平室内底噪，而不是数字静音；并且判断本窗不能确认音乐结构，听不到节拍、旋律、和声、乐器或配乐进入。它同样承认画面不能确认口型同步或声源透明。可是它说 #932 “未过载、无明显压缩感”，这只能算 T2 主观听感，不能覆盖 T1 的 Peak=`0.0000dBFS`、full-scale/near-clipped samples 和频带统计。初跑 MiMo 因审看片段没有音轨，不进入声音证据，只作为流程警示：以后问 MiMo 声音前必须先确认音频流存在。

逐词看，`就` 是第一道收窄。它像在取消旁支：不是别的，就是那个。可是这个“就是”并没有给对象增加内容。它只是把可能散开的理解重新压回同一个指向。`就` 表面上让句子变确定，实际上只让空位变得更难逃开。

`那个` 是第二道回指。它继承 #931 的 `那个`，也继承 #929 的 `那个更大的东西`。这个词最阴冷的地方在于，它假装对象已经被共享：说话人不需要说明，听者应该知道，观众也被迫跟着承认有一个“那个”。但画面没有给观众这个特权。观众只能听到指示，不能拿到对象。

`更大的` 是第三道扩张。它不说“大”，而说“更大”，这意味着它隐含比较：比什么更大？比眼前的身体更大？比刚才的感觉更大？比游戏、关系、房间、观看本身更大？T1 不能裁决这些答案，但语言结构本身在扩大对象的尺寸。它把对象从一个可指认物推向一个超过现场可见物的尺度。

`东西` 是最后的泛化。它不是“人”、不是“机器”、不是“伤口”、不是“情绪”、不是“规则”。`东西` 是中文里最能把对象留在半明半暗中的词之一：有物感，但没有物名；能被谈论，但不必被交付。#932 说出了 `东西`，却仍然没有告诉我们那是什么东西。

所以这句话最表层的意思像是：

```text
我说的就是刚才那个更大的东西。
```

但它真正的潜台词更接近：

```text
不要离开那个对象。
不要把问题带回你的感觉。
我们还在说那个更大的东西。
它必须继续组织这个场面，
即使它仍然不被画面交出来。
```

这里的残酷和 #930 不同。#930 的残酷，是用 `感觉` 这样柔软的词把对象交给第二人称身体。#932 的残酷，是在感觉没有回来之后，把对象名再度说满。它好像补充说明，其实是在宣布：刚才没有回答也没关系，对象仍然有效；你没有把感觉说出来也没关系，`更大的东西` 仍然在场。

画面把这种机制固定得很死。`85:27.433-85:35.500` 没有硬切，`scene>0.04` 没有 filtered frame。仍然是低机位公开空间：左侧和中后方观众坐着，白色半透明屏障横在后场，中部有背向身体候选，右前景白衣/白布身体贴着画面边缘，水瓶/透明容器、红色前景物、黑色条状物和反光水平面都在。屏障右中区域的暖黄/橙色光面也还在。

如果 #932 真的是对象交付，画面至少可以给一个落点：一个物，一个身体，一个反打，一个被问者的表情，一个被“更大”组织起来的空间变化。它都没有给。右前景身体在 #932 期间更清楚，背部、肩部、侧向头部、白布和裸露背部轮廓都可见；但嘴部/下颌仍受侧向姿态、遮挡和阴影影响，不能逐音确认口型。T0 锁甲瑞，逐句正文可以写甲瑞声道；T1 不给“这张嘴透明地说出这句话”的升级。

这让 #932 形成一种很尖锐的声画错位：声音把对象名说到满幅，画面却不让对象成像。观众被放在一个被迫接收的位置：你听见 `就那个更大的东西`，而且听得很重，甚至在数字声道上接近触顶；但你不能把它转换成一个可消费的画面事实。电影不是让你看见“更大的东西”，而是让你承受一个没有被交出来的对象名如何压住现场。

#932 后也没有立刻进入解释。`85:33.200-85:35.500` RMS=`-40.4422dBFS`，Peak=`-19.9098dBFS`，4-12kHz 占比 `0.2915`，12-20kHz 占比 `0.3046`，谱心约 `7583.5Hz`。强声块之后又退回高频/超高频尾部。下一条 #933 `好像在 在` 要到 `85:55.700` 才来；本页先不裁决这段长等待，但 #932 后最初 `2.300s` 已经足够说明：对象名被说满之后，没有马上获得画面解释，也没有马上获得回答。

稳定读法：#932 `就那个更大的东西` 是 #931 `对那个` 的满幅回名句。它把 #931 的指针补回 #929 的对象名，但并不解决 #930 的感觉提问，也不让 `更大的东西` 在画面中显影。声音上，它比 #931 更长、更强、更接近满幅；画面上，它仍被放在观众、屏障、反光、边缘身体和物件构成的公开观看装置里。它真正做的事，是让未显影对象重新获得组织权：感觉没有回来，回答没有回来，画面没有交付，但 `更大的东西` 被说得更满，因而更难被绕开。

### #933｜甲瑞：好像在 在

```text
T0：#933
时间：01:25:55.700-01:25:57.466
说话人：甲瑞 / ACT-JIARUI
台词：好像在 在
机制标签：未标记 / 语气残片
```

#933 的第一层意思很简单：甲瑞像是在说，那个东西似乎在某个地方。但这句话真正危险的地方，是它没有把“某个地方”说出来。它不是一句完整定位，而是一句定位开始失败、暂停、重启的残句。

必须先把它放回 #929-#932 的链条里：

```text
#929：对那个更大的东西
#930：你是怎么感觉的
#931：对那个
#932：就那个更大的东西
#933：好像在 在
```

#929 提出 `那个更大的东西`，画面没有交出对象。#930 把对象转交给 `你` 的感觉系统，但没有得到可确认回答。#931 删除 `你` 和 `感觉`，只剩 `对那个`。#932 把 `那个` 补成 `就那个更大的东西`，而且用接近满幅的低中频人声把对象名说重。到 #933，句子终于不再只是命名对象，而开始把它放进位置语法：`好像在 在`。问题从“那个东西是什么”转成“那个东西好像在哪里”。可是这一步仍然没有完成。

#932 结束于 `85:33.200`，#933 到 `85:55.700` 才进入。中间 `22.500s` 无新 T0。这个长等待不能被当成单纯空白。T1 复核显示，这段 RMS=`-33.1502dBFS`，Peak=`-9.0777dBFS`，4-12kHz 占比 `0.2477`，12-20kHz 占比 `0.4974`，谱心约 `11012.9Hz`。它不是数字静音，也不是回答已经发生。它是一段公共声场：`更大的东西` 被说满之后，没有对象显影，没有回答回来，没有剪辑给落点，只有同一个空间继续拖着这个未完成的名字。

所以 #933 不是 #932 的即时说明，而是长等待之后的重新起句。它像终于要给 `更大的东西` 找一个所在，但它给出的只是所在的开口。

声音上，#933 的强度也发生了变化。#932 全句 RMS=`-11.1340dBFS`，Peak=`0.0000dBFS`，有明显 full-scale/near-clipped samples，是满幅回名。#933 全句 `1.766s`，RMS=`-18.3414dBFS`，Peak=`0.0000dBFS`，有 `20` 个 full-scale/near-clipped samples。它比 #932 低约 `7.21dB`，所以不能把它写成同等强度的对象压回；但它又比前面 `22.500s` 长等待高约 `14.81dB`，所以也不是被环境吞掉的微弱气口。它是长等待后重新突出的可听人声，只是这次突出出来的不是对象名，而是一个不完整的位置句。

频带上，#933 仍由低频和低中频主导：20-250Hz 占比 `0.2050`，250-1000Hz 占比 `0.7767`，1-4kHz 只有 `0.0163`，4kHz 以上几乎撤掉。它不是明亮地解释，也不是清楚地陈列地点，而是低中频里的犹疑定位。

句内粗分段更能看出这种“不完整”。#933 前 `0.450s` RMS=`-18.1451dBFS`；`0.450-0.900s` 升到 `-13.9793dBFS`，Peak=`0.0000dBFS`，250-1000Hz 占比 `0.8596`；`0.900-1.300s` 掉到 `-34.6997dBFS`；最后 `1.300-1.766s` 又回到 `-27.4435dBFS`。这不像一条稳定滑过去的说明句，更像前部入声、中段加压、随后抽空、尾部再小幅回入。它可以和文本里的 `在 在` 对读，但不能逐字锁死：我们只能说声形和语法同样带有重启感，不能说第一个 `在` 或第二个 `在` 精确对应某个波峰。

MiMo 带音频版只作为边界补盲：它也把 #932 后到 #933 前听成 room tone / 环境底噪，不是数字静音；它判断本窗不能确认音乐结构，也确认 #933 入声、句中、句尾没有地点显影或对象显影。它还听到两个 `在` 之间有可感知的停顿/重启感。需要降级的是，MiMo 对“音量低于环境底噪”“低频/低中频不明显”和“右侧身体呼吸/对白后呼气”的说法不能覆盖 T1；#933 比长等待高约 `14.81dB`、低中频主体和声源不透明这些判断仍以本地取证为准。

逐词看，`好像` 是这句话的第一道撤退。#932 的 `就那个更大的东西` 里有一个很硬的 `就`：不是别的，就是那个。可是 #933 开头不是 `就在`，而是 `好像在`。从 `就` 到 `好像`，确定性突然降级。#932 刚把对象名压实，#933 又把对象的所在放进似乎、仿佛、不完全承担的判断里。

这不能被写成甲瑞真实心理。T1 不证明甲瑞真的不确定、害怕、回忆困难或临时改口。但语言形式本身足够重要：`好像` 让后面的 `在` 不能成为事实陈述，只能成为候选定位。它不是“它就在那儿”，而是“它像是在某处”。对象仍然通过语言发生，却不被语言完全负责。

第一个 `在` 是位置语法的入口。它把 `更大的东西` 从对象名转成空间关系。前面几句一直围绕 `那个` 旋转，#933 开始让观众听见一个新的问题：它在哪里？可是这并不是答案，而是答案的框架。

第二个 `在` 是更尖的地方。正常句子应该在第一个 `在` 后给出地点，但它没有给，而是又说了一次 `在`。这一次重复不是补充内容，而是语法重启。语言已经走到地点门口，却没有跨进去；它只让观众听见“地点即将出现”的卡顿。

这里千万不能提前把 #934、#935 塞进来。#934 是 `很`，#935 是 `黑的地方`，它们会在后面把地点往下补。但 #933 本身还没有说到那里。它只停在：

```text
好像在 在
```

如果直接把它读成“好像在很黑的地方”，就会抹掉 #933 的真正动作：不是完成地点，而是让地点成为新的空位。

画面同样拒绝替这句话补完。`85:33.200-85:59.066` 没有硬切，`scene>0.04` 没有 filtered frame。仍是同一个低机位公开空间：左侧和中后方观众，白色半透明屏障，中部背向身体，右前景白衣/白布身体，水瓶/透明容器，红色前景物，黑色条状物，反光水平面，都还在。屏障右中区域有暖黄/橙色光面，窗口中也有轻微暖红/橙色反射变化，但这只是同一空间里的光面变化，不能被升级成新地点或 `更大的东西` 的显影。

#933 入声、句中、句尾，画面没有给出一个“那里”。没有反打，没有特写，没有把观众带离现场，也没有切到可以承接 `在` 的空间。右前景身体仍在画面边缘，侧向头部、肩背、白布和前景容器都可见，但嘴部/下颌受角度、遮挡和阴影影响，不能逐音确认口型同步。T0 锁甲瑞说话，T1 不把画面升级为声源完全透明。

这形成很强的声画错位：声音开始定位，画面拒绝移动；声音说 `在`，画面不给“在”的地点；声音像要把 `更大的东西` 放到某处，画面却继续让观众待在公开观看装置里。观众接收到的不是一个可见位置，而是位置的延迟。

从 Daney 式的观看伦理看，这里不是对白解释画面，而是画面让对白暴露自己的未完成。电影没有用影像替语言完成意义；它让语言停在影像前面，听起来已经到了“在”，看起来却仍然没有地方。观众不是被告知答案，而是被训练去承受一个不被图解的定位动作。

这句话的表层意思像是：

```text
它好像在某个地方。
```

但更深的潜台词是：

```text
那个更大的东西仍然不能被直接交出来。
它开始需要一个所在，
可是这个所在还不能被确定地说出。
我只能把语言推到“在”的门口，
然后又卡在那里。
```

所以 #933 的稳定读法是：它是 #932 满幅回名之后的犹疑定位句。它把 `更大的东西` 从对象名拖进位置语法，但位置语法没有完成。声音上，它从长等待后重新突出，却比 #932 弱得多；画面上，它仍被固定在同一个低机位公开空间里，没有对象显影、地点显影或回答回收。它真正做的事，不是说明“它在哪里”，而是让“在哪里”成为新的空位。对象仍不在画面里，回答仍没有回来，地点也还没有被交出来。

### #934｜甲瑞：很

```text
T0：#934
时间：01:25:59.066-01:25:59.833
说话人：甲瑞 / ACT-JIARUI
台词：很
机制标签：未标记 / 程度词残片
```

#934 只有一个字：`很`。

这一个字最容易被下一句吞掉，直接读成完整的 `很黑的地方`。但 T0 把它拆开了。#934 是 `85:59.066-85:59.833` 的 `很`，#935 才是 `86:01.033-86:01.900` 的 `黑的地方`。两者之间还有 `1.200s` 无新 T0 尾部。所以 #934 不能被提前写成地点完成。它只是程度词先行，是一个“很……”的开口，还不是“很黑的地方”的完成句。

把它接回上一句，就能看出这个一字句为什么重要。#933 说：

```text
好像在 在
```

#933 把 #932 的 `就那个更大的东西` 从对象名拖进位置语法，但位置没有完成。它停在两个 `在` 上，像是走到地点门口却没有交出地点。#934 的 `很` 就从这个门口之后冒出来。

这一步很微妙。`在` 需要地点，`很` 需要性质。#933 还没给地点，#934 又先给了程度。语言没有直接回答“在哪里”，而是先说“很”。它把一个位置空位转成性质空位：不是“在什么地方”马上被回答，而是“很……”先到，真正被修饰的东西还没出现。

所以 #934 的功能不是补完 #933，而是把未完成感再推进一格。#933 留下“在”的空位；#934 留下“很”的空位。一个地点句变成程度句的开头，而地点仍然没有被交付。

声音上，#934 前有 `1.600s` 无新 T0 尾部，RMS=`-41.11dBFS`。#934 本身只有 `0.767s`，RMS=`-20.99dBFS`，Peak=`-3.09dBFS`，没有 full-scale/near-clipped samples。它比 #933 的 RMS=`-18.3414dBFS` 低约 `2.65dB`，比 #932 的 RMS=`-11.1340dBFS` 低约 `9.86dB`。所以它不是 #932 那种满幅回名，也不是 #933 那种较长的犹疑定位。

但它比前面的 `1.600s` 尾部高约 `20.12dB`。这说明它不是环境声床里自动滑出来的一点残噪，而是一个明确短促入声。只是这个入声不承担完整句子，只承担一个程度入口。

频带上，#934 几乎全在低部：20-250Hz 占比 `0.6599`，250-1000Hz 占比 `0.3364`，1kHz 以上几乎撤掉。它不是明亮解释，不是把地点照亮，而是低部短促地把 `很` 推出来。

句内声形也很集中。前 `0.250s` RMS=`-17.24dBFS`，Peak=`-3.09dBFS`；`0.250-0.550s` 降到 `-23.38dBFS`，20-250Hz 占比升到 `0.9170`；最后 `0.550-0.767s` 退到 `-41.55dBFS`。最强 `0.05s` RMS 窗在 `0.100-0.150s`，RMS=`-12.72dBFS`。也就是说，#934 的力量在开头打出来，随后拖低、抽空。它像一个短促的程度标记，而不是一条展开的描述。

逐词看，`很` 不是名词，不是地点，不是对象。它只是程度副词。它必须依附后面的性质，才能完成意义。但 #934 只有 `很`。所以它让观众听到的是一个还没找到对象的强度。

如果 #933 的问题是：

```text
它好像在……哪里？
```

那么 #934 不是回答“哪里”，而是说：

```text
很……
```

这个 `很` 把语言从地点转到感质。它不告诉我们地方在哪，只告诉我们将要出现的地方带着某种强度。可是强度先到了，性质还没到。#935 的 `黑的地方` 会补上这个性质和地点，但那是下一句。#934 自己必须停留在“程度被释放，内容仍未交付”的状态。

这就是它的潜台词：

```text
那个地方还没有说出来。
但它不是中性的。
它已经被一种强度预先压住。
```

画面仍然不给这个强度一个对象。`85:57.466-86:01.033` 没有硬切，`scene>0.04` 没有 filtered frame。镜头仍是同一个低机位公开空间：左侧和中后方观众，白色半透明屏障，中部背向身体，右前景白衣/白布身体，水瓶/透明容器，红色前景物，黑色条状物，反光水平面。屏障右中区域仍有暖黄/橙色光面；画面没有切到一个可被独立称为“黑的地方”的新空间。

当然，画面里有暗部：右侧墙面、屏障后方、反光面、前景遮挡都偏暗。但 T1 不能把这些直接升级成 #935 的 `黑的地方`，更不能说 #934 已经把地点交出来。#934 入声、句中、句尾，画面没有切到新空间，也没有把 `很` 的修饰对象显影。影像给的是同一场所的滞留，不是地点解释。

这形成一个更细的声画关系：声音开始把即将出现的地点加重，画面却仍不移动。`很` 在声音里打开强度，影像却不给强度的对象。观众被训练去等待一个尚未到来的词，而不是立刻消费一个可见的黑处。

从 Daney 式的观看伦理看，#934 不是影像向观众传递答案，而是影像把答案推迟成一次接收训练。观众不是看见一个黑暗地点，再听见它被描述；观众先听见一个程度词，画面保持不说明，等下一个词来承担意义。电影让语言的每个小颗粒都通过观众身体，而不是把它们合成一个顺滑说明。

所以 #934 的稳定读法是：它是 #933 未完成位置句之后的程度词开口。它把 `好像在 在` 留下的位置空位，推向一个即将被加重的性质；但它自己不交付性质，也不交付地点。声音上，它短促、低部、前部集中；画面上，它仍被锁在同一个低机位公开空间里。它不能写成 `黑的地方` 已经完成，也不能把画面暗部直接命名为那个地方。它真正做的事，是把“在哪里”的空位转成“很什么”的空位，让黑处到来之前的压力先压进声音里。

### #935｜甲瑞：黑的地方

```text
T0：#935
时间：01:26:01.033-01:26:01.900
说话人：甲瑞 / ACT-JIARUI
台词：黑的地方
机制标签：身体材料 / 程度地点命名
```

#935 是：

```text
黑的地方
```

这句话终于把前面悬着的句法补出来。#933 停在：

```text
好像在 在
```

#934 又只给了一个：

```text
很
```

#935 才说：

```text
黑的地方
```

所以它不是孤立的一句。它必须接着 #933 和 #934 读。#933 留下的是位置空位，`在` 后面没有地点；#934 留下的是程度空位，`很` 后面没有性质。#935 同时补两个空：`黑` 补上 `很`，`地方` 补上 `在`。它让前面几乎可以被回读成：

```text
好像在 很 黑的地方
```

可是这个“完整句”不是一口气说出来的。电影把它拆成三次入声：先是 `好像在 在` 的卡顿，再是 `很` 的悬置，最后才是 `黑的地方` 的落名。这个拆开非常重要，因为它让观众不是直接得到一个地点说明，而是先经历定位失败，再经历程度空位，最后才听见地点名落下。

表层意思可以写成：

```text
那个更大的东西好像在一个很黑的地方。
```

但潜台词更复杂：

```text
那个更大的东西还是不能直接出现。
我只能给它一个所在。
这个所在也不能给你看，
只能被说成黑。
```

所以 #935 是补足，但不是显影。它补足的是语言，不是画面。它交出的是地点名，不是地点本身。

声音上，#935 前有 `1.200s` 无新 T0 尾部，RMS=`-36.19dBFS`。#935 本身 `0.867s`，RMS=`-16.36dBFS`，Peak=`-1.84dBFS`，没有 full-scale/near-clipped samples。它比 #934 的 RMS=`-20.99dBFS` 高约 `4.63dB`，Peak 也从 #934 的 `-3.09dBFS` 推到 `-1.84dBFS`。这说明它比 `很` 更强、更完整，也更像一次短促的地点命名。

但这个强度不能被误读成“问题解决”。#935 没有触顶，也不是爆裂。它不是把整个空间打开，而是把空间名打出来。前 `0.300s` 最强，RMS=`-12.49dBFS`，Peak=`-1.84dBFS`；`0.300-0.650s` 降到 `-20.63dBFS`；最后 `0.650-0.867s` 退到 `-32.10dBFS`。50ms 滑窗里，`0.150-0.200s` 达 RMS=`-10.30dBFS`，随后快速退低。也就是说，地点名在开头被推出，后面迅速收走。

频带上，#935 主要集中在低中频：250-1000Hz 占比 `0.6259`，20-250Hz 占比 `0.3562`，1kHz 以上很少。它比 #934 那种几乎压在低部的程度残片更展开，但仍不是明亮解释音。它像一句从低部被推到口边的短语，完成了命名，却没有展开说明。

逐词看，`黑` 首先回应 #934 的 `很`。#934 让观众听见“很什么”的空位，#935 说“黑”。这不是装饰性的形容词，而是性质落点。它告诉我们：那个地方不是普通地点，不是中性的所在，而是被黑暗性质压住的所在。

可是这个 `黑` 不能直接等于画面事实。画面里确实有暗部：右侧墙面、屏障后方、反光面、前景遮挡都偏暗。但这些暗部在 #933、#934、#935 前后持续存在，没有在 #935 入声点被镜头切出、推近、框住或变成独立空间。因此 T1 只能支持“黑作为语言性质被说出”，不能支持“黑处作为画面地点被交付”。

`地方` 则回应 #933 的 `在`。#933 连说两个 `在`，却没有给出地点；#935 终于说出一个地点名。可是地点名不等于地点显影。画面没有反打，没有新场景，没有黑场，没有从公共现场穿越到某个内部空间。地点进入了语言，空间没有进入影像。

这就是这句最残酷的地方：它看似给答案，实际只给一个无法观看的答案。它说出了“哪里”，但没有让我们看见那里。它说出了“黑”，但没有把黑变成可消费的景观。观众只能听见地点名，被迫承认自己仍然没有看见地点。

画面把这种未兑现压得很紧。`85:59.833-86:03.900` 没有硬切，`scene>0.04` null 复验无 filtered frame 输出。镜头仍是同一个低机位公开空间：左侧和中后方观众，白色半透明屏障，中部背向身体，右前景白衣/白布身体，水瓶/透明容器，红色前景物，黑色条状物，反光水平面。屏障右中区域仍有暖黄/橙色光面。右侧偏暗，但没有成为一个被镜头交付的黑处。

这让声画关系非常明确：声音把地点说出来，画面拒绝离开现场。声音说 `黑的地方`，画面给的却是白色屏障、观众、反光地面、右前景身体和容器。声音下潜，画面公开；声音内化，画面旁观；声音给地点，画面不给进入。

因此 #935 也不能被写成 #930 的稳定回答。#930 问：

```text
你是怎么感觉的
```

#935 似乎交出了一个感觉图像：黑的地方。可是它没有明确“你”的感觉主体，也没有让被问者真的回应。它仍是甲瑞这条声音链的一部分：`那个更大的东西`、`你是怎么感觉的`、`对那个`、`就那个更大的东西`、`好像在 在`、`很`、`黑的地方`。这条链一直绕着对象和感觉走，但没有真正把回答交回来。#935 只是把感觉地点化了，不是把回答完成了。

更深一层，#935 是甲瑞声道的尾端。它之后有 `2.000s` 尾部，RMS=`-34.80dBFS`，然后 #936 换成子丑：

```text
红色的卡车驶过
```

这个换手很重要。甲瑞把 `更大的东西` 推到 `黑的地方`，子丑马上把声音带向外部意象：红色、卡车、驶过。黑处没有在画面里打开，红色卡车也还没有进入 #935。#935 是黑色底片，#936 才会开始把红色运动叠上去。

所以不能把 #935 写成梦像段落已经完成。它只是甲瑞这组定位链的末端，是意象接力开始变色之前的暗点。黑被说出，但没有成为画面；地点被命名，但没有被进入；回答像要落下，却又被下一句换手带走。

从 Daney 式的观看伦理看，#935 不是给观众一个黑暗景观，而是让观众接收一个无法被观看的地点名。电影在这里训练的不是“看见黑处”，而是“承认没有看见”。影像成为声音传递的阻力：它承受 `黑的地方`，但不把它消费成图像。

稳定读法：#935 `黑的地方` 是 #933 `好像在 在` 和 #934 `很` 的迟到补足。它用 `黑` 补上 `很`，用 `地方` 补上 `在`，让前两句的位置空位和程度空位终于落成一个地点名。声音上，它比 #934 更强、更完整，前段强力推出，后段迅速退低；画面上，它仍锁在同一个低机位公开空间里，没有硬切、反打、对象显影或地点显影。它不是黑处被看见，而是黑处被说出；不是回答完成，而是感觉被地点化后继续悬置。下一句 #936 会把声道交给子丑的红色卡车，#935 则把未被兑现的黑留在公开现场里。

### #936｜子丑：红色的卡车驶过

```text
T0：#936
时间：01:26:03.900-01:26:06.100
说话人：子丑 / ACT-ZICHOU
台词：红色的卡车驶过
机制标签：未标记 / 外部运动意象换手
```

#936 不能从 `红色的卡车` 这个画面想象开始读，而要先从换手开始读。#935 还是甲瑞：

```text
黑的地方
```

#936 换成子丑：

```text
红色的卡车驶过
```

这一步不是画面突然给出一辆车，而是声音链从甲瑞的黑色地点命名，换到子丑的红色外部运动意象。#935 把 #933 的 `在` 和 #934 的 `很` 补成一个不可见地点：`黑的地方`。#936 没有继续解释这个黑处，没有说“那里为什么黑”，也没有说“那个更大的东西在黑处里是什么”。它突然给出一个更具体、更可成像的东西：颜色、车辆、经过动作。

所以 #936 的第一层动作，是把上一句的静态地点改写成运动物。`地方` 是所在，`卡车` 是物；`黑` 是暗色，`红色` 是亮色；`在` 的语法指向静止位置，`驶过` 则指向经过、横移、离开。语言像是从黑暗内部突然跳到外部道路。但这只是声音里的跳转，画面没有跟着跳。

#935 结束于 `86:01.900`，#936 要到 `86:03.900` 才进入，中间有 `2.000s` 无新 T0 尾部。T1 显示这段尾部 RMS=`-34.80dBFS`，Peak=`-18.37dBFS`，4-12kHz 占比 `0.2900`，12-20kHz 占比 `0.2236`，谱心约 `5268.8Hz`。这不是回答、解释或转场音乐，而是 #935 之后的一段公共声场尾部。黑处被说出以后，画面没有打开，声音也没有马上给出下一幅图像；它先退到一个较薄的等待区。

然后 #936 入声。#936 全句 `2.200s`，RMS=`-18.36dBFS`，Peak=`-0.77dBFS`，没有 full-scale/near-clipped samples。它比前面 `2.000s` 尾部高约 `16.44dB`，比后面到 #937 前的 `1.300s` 尾部高约 `22.74dB`。所以这是一句明确的前景台词，不是环境尾巴里听出来的残影。

但它不是比 #935 更响的升级。#935 `黑的地方` RMS=`-16.36dBFS`，#936 反而低约 `2.00dB`。这点很重要。#936 不是“黑处之后更强烈地爆出红车”，而是一次声道和意象的换形：从地点名，换成运动名；从甲瑞的低中频地点落名，换到子丑的低中频外部图像。

频带也说明这句并没有靠音乐或高频亮度来制造“红”。#936 20-250Hz 占比 `0.1613`，250-1000Hz 占比 `0.7921`，20-1000Hz 合计约 `0.9534`，1kHz 以上整体很低。也就是说，`红色` 不是被配乐染出来的，`卡车` 不是被拟音开出来的，`驶过` 也不是由可确认车辆声音完成的。它主要是一句低中频人声，把一个强视觉性意象压进声音里。

句内粗分段可以看出它的形状，但不能把波峰硬套到每个字。前 `0.500s` RMS=`-15.31dBFS`，Peak=`-0.77dBFS`，是全句最强的推入段；`0.500-1.200s` 保持在 RMS=`-17.66dBFS`；`1.200-1.700s` 降到 RMS=`-25.58dBFS`；最后 `1.700-2.200s` 又回到 RMS=`-20.95dBFS`，250-1000Hz 占比升到 `0.8143`。最强 `0.05s` RMS 窗在精确窗内 `0.450-0.500s`，RMS=`-11.45dBFS`；句尾附近 `1.850-1.900s` 又有一次 RMS=`-16.07dBFS` 的回抬。

这可以稳写成：前部把意象推出，中部下沉，尾部重新抬起后退空。它和 `驶过` 的运动语义可以互相照亮，但不能说“某个波峰就是车驶过”，也不能把这句升级为车声、发动机声或配乐段落。声音分析到这里要守住分寸：我们抓的是声形和台词意象的关系，不是用频谱替代画面造证据。

画面恰恰不交付这辆车。`86:01.900-86:07.400` 没有硬切，`scene>0.04` 没有 filtered frame。关键帧 mean luma 只在 `64.38-65.48` 之间轻微漂移，帧间平均差约 `1.38-1.95`，仍是同一个低机位公开空间：左侧和中后方观众、白色半透明屏障、中部背向身体、右前景白衣/白布身体、水瓶/透明容器、红色前景物、黑色条状物和反光水平面都还在。没有道路，没有车轮，没有车身，没有窗外交通，也没有横向穿越画面的移动主体。

红色也要谨慎。#936 入声帧 red-dominant ratio full=`0.056175`，right crop=`0.151497`，确实比前一帧高；但这些红/暖色像素落在右前景身体、前景材料、既有红色物和暖色反射范围里。句中、句尾又降到 full=`0.008374` 和 `0.003297`。这只能支持“右侧既有红色/暖色材料波动”，不能支持“红色卡车显影”。红色材料不是红色卡车，颜色相似不是物证成立。

逐词看，`红色` 先和 #935 的 `黑` 形成反差。#935 的黑是不可见地点的性质；#936 的红色是更明亮、更外向、更像可被看见的颜色。语言像从暗处抽出一块亮色。但电影没有给红色一个车辆形体，最多给了右前景既有红色材料和暖色反射的波动。于是 `红色` 在这里不是画面物证，而是声音把颜色词投进不兑现的场面。

`的` 很小，但它把颜色和物名扣在一起。不是“红色出现了”，而是“红色的卡车”。颜色不独立存在，而被语法归到一个物上。问题是这个物没有出现。于是 `的` 造成一个更具体的缺席：观众不是没有看见红色，而是没有看见那个被红色修饰的物。

`卡车` 比 `地方` 更硬。`地方` 可以虚，可以梦，可以只是一种所在；`卡车` 是一个有重量、有道路、有外部社会空间的交通物。它把语言从内在黑处带向外部世界。但越具体，越要守证据边界。画面没有任何能独立识别为卡车的形体。这里的卡车是语言里的物，不是画面里的物。

`驶过` 最后给这个物一个动作。它不是“红色卡车停在那里”，而是“驶过”。这意味着时间性、横向运动、经过、离开。但画面没有运动相应物。镜头和公共空间不动，人物和前景材料只是同一场景内部轻微漂移。于是 `驶过` 也不能写成画面动作，只能写成声音动作：运动被说出，但没有被看见。

这句话的表层意思像是：

```text
有一辆红色卡车经过。
```

但在这一段声画关系里，它更像：

```text
黑处没有打开。
于是声音换了一个更彩色、更外部、更运动的图像。
可这个图像仍然只能被说出，
不能成为现场可见物。
```

这也是 #936 和 #930-#935 的关系。#930 问 `你是怎么感觉的`，像把对象交给感受；#931/#932 又把感受空位收回 `那个更大的东西`；#933/#934/#935 把对象拖到 `黑的地方`。#936 则像是在这个黑色地点之后，突然给出一串更容易被想象的可视物：红色、卡车、驶过。可是它没有真正回答 #930，也没有真正解释 #935。它只是把未兑现的黑处，接给另一个未兑现的运动图像。

所以不能把 #936 写成子丑真实回忆了一辆车，也不能写成梦境已经切入外部道路。T0 只锁子丑说出这句话；T1 只锁这句话如何在声音里成为前景，以及画面如何拒绝兑现它。心理、梦、记忆、现实车辆、现实道路都不能从这句升级出来。

它也不能被 #937 倒推。下一句 #937 是子丑 `向日葵`，时间从 `86:07.400` 开始；#936 后到 #937 前有 `1.300s` 尾部，RMS=`-41.10dBFS`。所以 #936 只到红色卡车，不到向日葵。不能把后一句植物意象提前写进这一句，也不能把 #936 写成一串完整风景已经显影。

从观看伦理上说，#936 很锋利，因为它给了一个最容易被观众自动补画面的词组。`红色的卡车驶过` 几乎天然带着插图诱惑：红、车、路、经过。但电影不给插图。它让观众意识到：我听见了一个画面，但我没有看见那个画面；我的想象不能替影片作证。

稳定读法：#936 `红色的卡车驶过` 是 #935 `黑的地方` 之后的说话人换手和意象换色。它从甲瑞的不可见地点链转入子丑的外部运动图像链；从黑转到红，从地方转到卡车，从静态所在转到驶过动作。声音上，它是明确前景入声，RMS=`-18.36dBFS`，Peak=`-0.77dBFS`，250-1000Hz 占比 `0.7921`，但比 #935 低约 `2.00dB`，不是更响升级，也不是音乐段落。画面上，它仍发生在同一个低机位公开空间里，没有硬切、道路、车辆、车轮、驶过运动或口型逐音确认。红色前景/暖色反射不能升级为卡车。它真正做的事，是把未被画面兑现的黑处之后，接上一枚同样未被画面兑现的红色运动意象。

### #937｜子丑：向日葵

```text
T0：#937
时间：01:26:07.400-01:26:08.166
说话人：子丑 / ACT-ZICHOU
台词：向日葵
机制标签：未标记 / 植物日光意象短促入声
```

#937 是：

```text
向日葵
```

它接在 #936 后面。#936 说：

```text
红色的卡车驶过
```

#937 只说：

```text
向日葵
```

这一步不是叙述扩展，而是意象换形。`红色的卡车驶过` 有颜色、车辆、动作和外部道路的潜在空间；`向日葵` 没有动作，也没有地点。它把外部世界从一个移动的交通物，压成一个静态的植物名词。

所以 #937 首先要当作一枚短促的名词入声来读。它不是完整句，不解释 #936 的卡车从哪里来，也不说明 #935 的黑处在哪里。它只是把另一个高度可视的东西交给声音：一朵会让人想到太阳、黄色、户外和生长的花。

可是画面仍然不给花。

#936 结束于 `86:06.100`，#937 到 `86:07.400` 才进入，中间有 `1.300s` 无新 T0 尾部。T1 显示这段尾部 RMS=`-41.10dBFS`，Peak=`-21.94dBFS`。它比 #936 句内低很多，像是上一句红色运动意象退空后的短暂空带。

然后 #937 入声。#937 全句只有 `0.766s`，RMS=`-17.95dBFS`，Peak=`-0.97dBFS`，没有 full-scale/near-clipped samples。它比前面的 `1.300s` 尾部高约 `23.15dB`，比 #937 后到 #938 前的 `0.734s` 尾部高约 `16.43dB`。所以这不是环境声里含混冒出来的残词，而是非常明确的前景台词。

它甚至比 #936 的 RMS=`-18.36dBFS` 略高约 `0.41dB`。但这种“高”不能读成更大场面的展开。#936 有 `2.200s`，能说出颜色、物和动作；#937 只有 `0.766s`，只打出一个名词。它更像是把一张图像卡片短促地拍到桌面上，然后马上收走。

频带上，#937 20-250Hz 占比 `0.2831`，250-1000Hz 占比 `0.6944`，20-1000Hz 合计约 `0.9775`，1kHz 以上几乎撤掉。也就是说，`向日葵` 并不是被高频亮光、音乐、和声或配器“晒”出来的。它仍然是低中频人声主体。太阳感、黄色感、植物感，都来自词本身，而不是来自配乐替它显影。

句内声形非常集中。前 `0.250s` RMS=`-14.37dBFS`，Peak=`-0.97dBFS`，是全句最强；`0.250-0.500s` 降到 RMS=`-20.12dBFS`；`0.500-0.766s` 再降到 RMS=`-25.84dBFS`。最强 `0.05s` RMS 窗在精确窗内 `0.030-0.080s`，RMS=`-10.33dBFS`。这支持一个很清楚的声形：名词一开始被推出，随后迅速回落。

但这个声形不能被用来逐音拆字。不能说某个波峰就是 `向`，另一个就是 `日`，另一个就是 `葵`。T1 只能支持：这是一次前部很强、后部快速退低的短促名词入声。

逐词看，`向日葵` 本身已经带着方向和太阳。它不是普通花名。`向日` 把花的朝向写进词里，`葵` 则把它固定成植物。这个词天然向外，向光，向一个不在室内公共空间里的世界。它跟 #936 的 `红色的卡车驶过` 一样，带有强烈的画面诱惑。

但 #937 比 #936 更凝缩。#936 的词组里还有动作 `驶过`，它让观众想象横向运动；#937 没有动词，只有物名。红色卡车是经过的外部物，向日葵是被命名的外部物。前者像一个经过事件，后者像一个静止图像。

这让子丑的意象链出现一个细微转向：

```text
红色的卡车驶过：外部世界以运动方式出现。
向日葵：外部世界被压缩成静态名词。
```

如果把 #935 也放进来，链条更清楚：

```text
黑的地方 -> 红色的卡车驶过 -> 向日葵
```

黑处、红车、向日葵都很容易被看成画面。但三者都没有被画面兑现。它们是一连串被声音抛出来的可视词，而不是一连串真的切入的可视物。

画面在 #937 期间仍然是同一个低机位公开空间。`86:06.100-86:08.900` 没有硬切，`scene>0.04` 阈值下未输出 filtered frame。左侧和中后方观众还在，白色半透明屏障还在，中部背向身体还在，右前景白衣/白布身体还在，水瓶/透明容器、暖红/红褐色前景材料、黑色条状物和反光水平面都还在。没有户外，没有田野，没有花头、花瓣、花茎、绿叶。

亮度只是轻微漂移。#937 入声帧 mean luma=`64.6052`，句中帧 `65.3436`，出声帧 `66.5475`；右侧裁切区 mean luma 从 `48.5637` 到 `52.1166`。这说明右侧在 #937 尾部略转亮、略转暖，但仍是同一场景内部变化，不是切到日光或花田。

颜色也要守住边界。#937 入声和句中，右侧黄色比例只有 `0.006362` 和 `0.007755`；出声帧右侧黄色比例反而降到 `0.001199`。右侧绿色比例基本为零。右侧 warm yellow/orange ratio 到出声帧升到 `0.093010`，但它位于右前景容器/材料、墙面暖光和反射范围里。

所以不能把暖黄/橙色写成向日葵。这里的稳定事实是：

```text
暖色存在。
花形不存在。
```

这条规则和 #936 完全一致。#936 里，红色/暖红材料不能升级为红色卡车。#937 里，暖黄/橙色材料也不能升级为向日葵。颜色相似不是对象成立。像素候选不能替代花头、花瓣、茎叶和田野形体。

更不能把 #937 和 #938 提前合并。下一句 #938 是：

```text
麦田
```

它从 `86:08.900` 才开始。#937 结束在 `86:08.166`，中间还有 `0.734s` 尾部。#937 是 `向日葵`，#938 才是 `麦田`。二者在意象上相邻，都会把声音带向植物、黄色、户外和开阔地，但 T0 把它们分成两句。

这个拆分很重要。`向日葵` 是花名，不是田名；`麦田` 才是场域名。#937 先给一个朝日植物，#938 才会给一片农业空间。如果提前把它们合并成“向日葵麦田”，就会把 #937 的短促、孤立、名词性抹掉，也会把 #938 的场域转换提前偷走。

所以 #937 不回答 #930，也不完成 #935。它继续绕开“你是怎么感觉的”这个提问。甲瑞问感觉，语言却一路给出：更大的东西、黑的地方、红色卡车、向日葵。感受没有被内心化地解释，反而被外部图像不断替换。感觉被图像接管，但图像又不被画面接管。

这就是 #937 的锋利之处。它让观众听见一个非常容易自动成像的词，然后马上让观众意识到自己没有看见它。电影不是给向日葵，而是给“向日葵”这个词。观众必须把听见和看见拆开。

稳定读法：#937 `向日葵` 是 #936 `红色的卡车驶过` 之后的第二枚子丑意象。它把外部运动物转成植物/日光名词，从经过动作转成静态花名。声音上，它是短促而明确的前景入声，RMS=`-17.95dBFS`，Peak=`-0.97dBFS`，250-1000Hz 占比 `0.6944`，前 `0.250s` 最强，之后快速退低；它不是音乐段落，也不是环境尾巴。画面上，它仍被扣在同一个低机位公开空间里，没有向日葵、植物、户外日光或田野显影。暖黄/橙色光面不能升级为花。#938 `麦田` 也不能提前并入 #937。它真正做的事，是把未被画面兑现的红色运动意象后面，接上一枚同样未被画面兑现的植物日光名词。

### #938｜子丑：麦田

```text
T0：#938
时间：01:26:08.900-01:26:09.733
说话人：子丑 / ACT-ZICHOU
台词：麦田
机制标签：未标记 / 场域名词弱化入声
```

#938 是：

```text
麦田
```

它接在 #937 后面，但不能被 #937 吞掉。#937 是：

```text
向日葵
```

#938 是：

```text
麦田
```

这不是一句 `向日葵麦田`。T0 把它们分成两条：#937 `向日葵` 到 `86:08.166` 结束，#938 `麦田` 从 `86:08.900` 才开始，中间有 `0.734s` 尾部。这个拆分必须保留，因为它让我们看见声音链的尺度变化：先是花名，再是田名；先是一个植物图像，再是一片场域。

`向日葵` 还是物名。它让人想象一朵花，或者一种朝向太阳的植物。`麦田` 则是空间名。它不是一株麦子，而是一片田。它把外部世界从单个物，推向可进入、可铺展、可远望的场。

但画面仍不进入这个场。

#937 结束后，#938 前有 `0.734s` 无新 T0 尾部，RMS=`-34.38dBFS`，Peak=`-18.51dBFS`。这段很短，但它足够把 `向日葵` 和 `麦田` 分开。声音不是一口气说出一个合成景，而是先让花名退掉，再让田名进入。

#938 本句 `0.833s`，RMS=`-23.90dBFS`，Peak=`-5.73dBFS`，没有 full-scale/near-clipped samples。它比句前尾部高约 `10.48dB`，所以仍是明确入声，不是尾巴里的误听。但它比 #937 `向日葵` 低约 `5.95dB`。#937 是 RMS=`-17.95dBFS`、Peak=`-0.97dBFS`；#938 明显低下去。

这个差异非常重要。#938 不是 #937 后更强地展开风景，而是较弱地补出场域。`向日葵` 像被短促钉入声场；`麦田` 则像在这个钉入之后被轻轻铺开。它不是高潮，也不是更响的梦像爆发。

句内声形也是前强后弱。前 `0.250s` RMS=`-20.06dBFS`，Peak=`-5.73dBFS`；`0.250-0.550s` 降到 RMS=`-25.84dBFS`；`0.550-0.833s` 退到 RMS=`-32.92dBFS`。最强 `0.05s` 窗在精确窗内 `0.080-0.130s`，RMS=`-15.95dBFS`。也就是说，`麦田` 在开头被推出，后半很快抽薄。

频带也比 #937 更散。#937 的 20-1000Hz 合计约 `0.9775`，几乎全是低中频人声主体；#938 的 20-1000Hz 合计只有约 `0.6086`。#938 句尾 12-20kHz 占比升到 `0.4608`，说明尾部已经变得很薄、很气化。它不是配乐，不是风声，不是麦浪声，也不是户外声音进入。它只是一个场域名在声音里短促出现，然后退掉。

逐词看，`麦` 把 #937 的植物性转成农作物性。向日葵是花，麦是粮食作物；一个朝向太阳，一个连着田地、收成、风、开阔平面。它们都带黄色想象，但黄色的性质不同。向日葵是花头的黄，麦田是大面积成熟植物的黄。

`田` 则把 `麦` 从物种推成场地。不是麦粒，不是麦穗，而是一片田。这个字让外部世界忽然变宽：有地面，有远处，有可走进去的空间，有风吹过的可能。可是这一切都只在词里发生。

画面没有给田。`86:08.166-86:32.566` 保持同一个低机位公开空间，没有硬切，`scene>0.04` 阈值下没有 filtered frame。左侧和中后方观众还在，白色半透明屏障还在，中部背向身体还在，右前景白衣/白布身体还在，水瓶/透明容器、暖红/红褐前景材料、黑色条状物和反光水平面还在。没有地平线，没有田埂，没有麦穗，没有麦浪，没有户外。

颜色也不能替麦田作证。#938 入声帧 wheat/golden ratio full=`0.002570`，句中 `0.004665`，句尾 `0.008900`；右侧裁切区更低，最高只有 `0.000068`。绿色比例几乎为零。#938 句尾 straw/brown right crop 升到 `0.131292`，但它落在右前景容器/材料、身体边缘、暗暖反射范围里。

所以稳定事实不是“画面出现麦色田野”，而是：

```text
暖黄、红褐和反射材料存在。
麦田形体不存在。
```

这条规则延续 #936 和 #937。红色不能自动变成卡车，暖黄不能自动变成向日葵，棕黄也不能自动变成麦田。颜色只是颜色，除非它组织成可辨认的物或场。#938 里没有这个组织。

更细一点，#938 后还有很长的尾部。下一句 #939 阿蒙 `现在正在海里游泳` 要到 `86:32.566` 才进入。也就是说，#938 说完以后，有 `22.833s` 无新 T0 空间。这个空间不能被忽略。

这个长尾不是静默。整体 RMS=`-32.26dBFS`，Peak=`-4.04dBFS`。前 10 秒较低，后段逐步回潮。最后 `20.000-22.833s` 的 RMS 到 `-27.46dBFS`，比 #938 本句还更响。也就是说，`麦田` 不是直接流成 `海`，而是在说出以后落入一段长等待，随后声场重新抬起来，才把 #939 的海推到门口。

这让梦像链的节奏变得更复杂。粗看像是：

```text
卡车、向日葵、麦田、海
```

细看则是：

```text
红色卡车
短尾
向日葵
短尾
麦田
长尾回潮
海
```

这些图像不是顺滑成一条风景游记，而是一枚一枚被声音抛出，再被现场低位声场吞回去。每个词都很远，画面都很近。每个词都打开外部，影像都把它扣回公开装置。

所以 #938 也不能回答 #930。#930 问 `你是怎么感觉的`，而 #938 给的是一个外部场域。感觉没有被心理化说明，而被图像化、空间化。可是图像和空间又都不被画面兑现。于是感受被推向外部，外部又被现场拦住。

从观看伦理上说，#938 的力量比 #937 更冷。`向日葵` 让人想象一朵花，`麦田` 让人想象一片可以逃出去的地方。可是电影没有给这片地方。观众听见“田”，却仍然看见屏障、反光地面、观众和右侧白布身体。于是“田”不再是出口，而成了出口没有出现的证据。

稳定读法：#938 `麦田` 是 #937 `向日葵` 之后的场域补名。它把植物名扩成空间名，但比 #937 明显更弱，RMS=`-23.90dBFS`，Peak=`-5.73dBFS`，前部推出后迅速退低；它不是音乐段落，不是风吹麦浪，也不是户外声。画面仍是同一个低机位公开空间，没有麦田、麦穗、麦浪、田埂、地平线或户外显影。右侧暖橙/红褐材料和反射不能升级为田野。#938 后到 #939 前 `22.833s` 长尾不是空白，而是梦像爆发后一次低位等待和回潮，为下一句 `现在正在海里游泳` 准备入口。

### #939｜阿蒙：现在正在海里游泳

```text
T0：#939
时间：01:26:32.566-01:26:34.433
说话人：阿蒙 / ACT-AMENG
台词：现在正在海里游泳
机制标签：未标记 / 换声水中动作句
```

#939 是：

```text
现在正在海里游泳
```

这句要从 #938 后面那段长尾里听出来。#938 子丑说的是：

```text
麦田
```

#938 到 `86:09.733` 结束，#939 要到 `86:32.566` 才进入，中间有 `22.833s` 无新 T0。这个间隔很长。它不允许我们把 `麦田` 和 `海里游泳` 写成一串顺滑的风景词，也不允许把 #938 后半段提前写成海。T1 显示这段长尾整体 RMS=`-32.26dBFS`，不是静默；末端还有声场回潮。也就是说，电影先让 `麦田` 落进一个低位等待，再把阿蒙的海句推上来。

从说话人看，#939 是一次明确换声。#935 到 #938 的外部图像链主要由子丑推进：`黑的地方`、`红色的卡车驶过`、`向日葵`、`麦田`。到 #939，阿蒙接入：

```text
现在正在海里游泳
```

这个换声不能被写成阿蒙“解释了”子丑，也不能写成阿蒙替子丑完成了梦。它更像梦像接力的一次转手。子丑把外部世界从黑处推到路、花、田；阿蒙把田后的场域进一步推入水中，把静态名词变成正在进行的身体动作。

逐词看，`现在` 是一个很锋利的词。它把图像从回忆、想象、比喻里拉到当前时刻。前面 `红色的卡车驶过` 还可以像一件经过的事，`向日葵` 和 `麦田` 还可以像被命名的图像；`现在` 一出，句子开始假装自己不是远处的图像，而是此刻正在发生的现场。

`正在` 又把这种此刻性加重。它不是“游过”，不是“会游”，也不是“想游”，而是正在发生。进行时会逼迫观众在画面里找动作：谁正在？在哪里？身体是不是在动？可这正是这句最危险的地方。语言给出动作的进行，画面却不交付动作的地点和身体条件。

`海里` 把场域从 #938 的田推到水。#938 的 `麦田` 还是陆地，还是可以站立、行走、远望的空间；#939 的 `海里` 让身体失去地面，进入流动介质。它把外部世界从可站立的场，改成必须漂浮、游动、承受包围的场。

`游泳` 则把场域重新压到身体上。海不是单纯背景；它要求身体用一种动作维持自己。这里不是“在海边”，也不是“看海”，而是“海里游泳”。这比 `麦田` 更强，因为它不只给空间，还给身体状态：身体已经在水中，而且正在通过动作处理水。

但画面没有给这具正在游泳的身体。

4K/T1 的画面非常冷。`86:09.733-86:43.600` 仍是同一个低机位公开空间。左侧和中后方观众还在，白色半透明屏障还在，中部背向身体还在，右前景白衣/白布身体还在，水瓶/透明容器、暖红/红褐材料、黑色条状物和反光水平面都还在。`scene>0.04` 和 `scene>0.02` 都没有 showinfo 选帧记录。

这里确实有水感。反光地面复制身体、屏障、观众、容器和白布；右前景透明容器也会让“水”这个词变得很诱人。可水感不是水。反光水平面不是海面，透明容器不是海，白布/身体的倒影不是入水身体。T1 没有海、没有水面、没有浪、没有户外水域、没有身体在水中运动，也没有游泳动作。

颜色也不能替海签字。#939 精确窗内，blue/cyan full 最高只有 `0.001475`，right crop 最高只有 `0.001720`；deep blue full 最高只有 `0.000139`。这些比例太低，只能说明画面里有极少量蓝青像素，不能说明海水显影。更重要的是，#939 mid 的 low-sat gray 升到 `0.752703`，画面更像灰化、暗化的屏障、地面和反射材料，而不是水域。

所以这里必须写成：

```text
水感存在。
海不成立。
```

这条边界非常重要。因为 #939 的词太强，会强迫读者把反光当水、把容器当海的引线、把右前景白色身体的反射当成游泳身体。可是《人类投降派》在这里做的恰恰是：让语言给你一个水中动作，再让画面把你钉回公开空间。

声音上，#939 比 #938 更完整。#938 `麦田` 只有 `0.833s`，RMS=`-23.90dBFS`，Peak=`-5.73dBFS`。#939 有 `1.867s`，RMS=`-21.29dBFS`，Peak=`-6.14dBFS`。它比 #938 高约 `2.61dB`，但峰值还低一点。这意味着 #939 不是用更尖的爆点压过 #938，而是用更长的时间、更完整的语法和更稳定的声能占住前景。

它也比 #938 后长尾高约 `10.97dB`。所以这不是尾巴里飘出来的幻听，而是明确入声。但这个入声不是一拳打出，而是像一句“已经组织好的场景说明”被递上来。

句内三段很有意思。前 `0.550s` RMS=`-19.43dBFS`，250-1000Hz 占比 `0.9016`，低中频人声主体非常集中。中段 `0.550-1.150s` RMS=`-20.29dBFS`，4-12kHz 和 12-20kHz 合计约 `0.3695`，谱心升到 `6642.2Hz`，像一句话中部突然变亮。尾段 `1.150-1.867s` 降到 RMS=`-25.54dBFS`，20-1000Hz 又占主要部分，像是动作句尾部被重新压回低中频。

这个声形可以写成：阿蒙先用低中频把句子推进来，中段亮一下，尾部退回。不能写成浪声，不能写成水声，不能写成音乐主题。水不是由声音设计模拟出来的，而是由词语交给观众的。

还有一个门槛细节。全上下文最强 `0.05s` 短窗不在 #939 精确窗内部，而在 `86:32.513-86:32.563`，也就是 #939 入声前极短一瞬，RMS=`-13.61dBFS`，Peak=`-4.04dBFS`。#939 精确窗内最强 `0.05s` 在 `0.190-0.240s`，RMS=`-14.38dBFS`。这说明海句的入口不是孤立冒出，而是被前一段长尾末端的声场回潮顶到门口；但那一下门槛不能被并入 #939 正文。

所以 #939 的声画结构很像这样：

```text
麦田
长尾等待
门槛回潮
阿蒙入声：现在正在海里游泳
退回低位公开声场
```

#939 后到 #940 前还有 `9.167s`。这段整体 RMS=`-34.22dBFS`，没有触发 `-45dB / 0.3s` 的 silence event。前三秒 RMS=`-31.87dBFS`，中三秒 `-34.23dBFS`，最后 `3.167s` 退到 `-39.09dBFS`。它不是空白，而是海句之后的一次退声。

下一句 #940 是：

```text
青蓝色的按钮按下
```

这让 #939 更狠。声音刚刚把身体放进海里，后面马上要把意象转交给按钮。也就是说，海不会展开成海景，游泳不会展开成动作段落。它被说出，然后被收回到低位等待，随后进入装置化的按钮词。

如果把 #935 到 #940 连起来看，路线是：

```text
黑的地方
红色的卡车驶过
向日葵
麦田
现在正在海里游泳
青蓝色的按钮按下
```

粗读会觉得这是越来越外部、越来越开阔：黑处、路、花、田、海。细读则刚好相反。每一次开阔都只发生在声音里；画面不跟出去。到 #940，还会从海回到按钮。外部不是自由展开，而是被声音制造、被画面扣押、再被装置词回收。

这也让 #930 的问题继续悬着。#930 问的是：

```text
你是怎么感觉的
```

#939 仍然不是感觉报告。它没有说“我害怕”“我舒服”“我像在海里”。它直接说一个场景：现在正在海里游泳。感觉被外部场景代替，外部场景又不被画面兑现。于是“感觉”没有被解释，反而变成一个更难落地的水中动作。

从潜台词上说，#939 像一次逃逸幻觉，但不能写成真实逃逸。它把身体从黑处、车、花、田推向海，好像终于可以离开这间公开空间；但画面没有让任何人离开。观众听见 `海里游泳`，眼前仍是观众、屏障、反光地面、白布身体和透明容器。海变成未被批准的出口。

从观看伦理上说，这句最刺人的地方，是它把“自由动作”说得很具体。游泳看起来像自主动作：身体自己在水里移动，自己维持浮力，自己决定方向。可是电影不给我们看到这个自主身体。它只给一个被公开空间、屏障和反光包住的现场。于是 `游泳` 不再是自由，而是一种被声音想象出来、被画面拒绝承认的自由。

稳定读法：#939 `现在正在海里游泳` 是 #938 `麦田` 后的一次换声和换语法。阿蒙把子丑的静态场域名推成水中进行时动作句；`现在/正在/海里/游泳` 同时制造此刻性、进行时、水中位置和身体动作。声音上，它比 #938 更长、更完整，RMS=`-21.29dBFS`，Peak=`-6.14dBFS`，前段低中频集中，中段亮化，尾段回落；不是水声、浪声或音乐主题。画面上，它仍是同一个低机位公开空间，没有海、水面、浪、户外水域、入水或游泳动作。反光地面和透明容器只能制造水感，不能替海作证。#939 真正做的事，是把身体说进海里，同时让画面证明海没有被交付。

### #940｜子丑：青蓝色的按钮按下

```text
T0：#940
时间：01:26:43.600-01:26:45.500
说话人：子丑 / ACT-ZICHOU
台词：青蓝色的按钮按下
机制标签：未标记 / 装置触发词
```

#940 是：

```text
青蓝色的按钮按下
```

这句要先从 #939 后面的 `9.167s` 退声里听出来。#939 阿蒙刚说完：

```text
现在正在海里游泳
```

海句结束后，电影没有马上让海展开。#939 后到 #940 前整体 RMS=`-34.22dBFS`，Peak=`-11.97dBFS`，没有触发 `-45dB / 0.3s` 的 silence event。它不是空白，而是海句之后的低位等待。这个等待很重要：`海里游泳` 没有变成海景，也没有变成游泳动作，而是在低声场里被搁置了 `9.167s`，然后才由子丑把下一枚词推出来。

说话人也换回来了。#939 是阿蒙，#940 是子丑。子丑前面已经说过 `红色的卡车驶过`、`向日葵`、`麦田`。这些词都把外部世界抛出来，却都没有被画面兑现。#940 重新接回子丑，不是回到现实说明，而是把这条外部图像链继续往装置化方向推：

```text
红色的卡车驶过
向日葵
麦田
现在正在海里游泳
青蓝色的按钮按下
```

从链条上看，#940 是一个急转弯。#938 是田，#939 是海，外部场域看起来越来越大；#940 却不是更大的自然空间，而是一个按钮。它把海的流动性收回到一个可触发的物件。前一句把身体放进水，后一句把事件压成“按下”。

逐词看，`青蓝色的` 先给颜色。它不像 `红色的卡车` 那样把颜色挂在运动物上，也不像 `向日葵` 那样把颜色藏在植物意象里，而是直接把按钮染成一种很冷的颜色。`青蓝色` 介于蓝和绿之间，既能把 #939 的海色余波带过来，又能让人想到屏幕、开关、电子界面、冷光和装置。可是这些都只能是词的诱导，不能变成画面事实。

4K 画面里确实有青蓝候选，但它们很小、很碎。#940 中帧的 cyan/blue full 最高只有 `0.001681`，bright cyan/blue full 最高只有 `0.000010`，deep blue full 最高只有 `0.000154`。青蓝色主要落在人物轮廓边缘、横向反射线、白色屏障附近的冷色漂移，以及右前景透明容器标签/刻度一带。最大 bright cyan/blue 连通组件只有 `21px`，不是按钮形体。

所以这里必须写成：

```text
青蓝色被诱发。
青蓝按钮不显影。
```

`按钮` 是第二个关键。按钮是一个非常特殊的物：它不是风景，不是自然物，不是身体动作本身，而是把动作压缩成触发的装置。按钮的意义不在它看起来怎样，而在它被按下之后会发生什么。它天生带着程序感：一按，后面就会出现结果。

这正好把 #939 的海句收回来了。`现在正在海里游泳` 让观众想象身体正在处理一个包围性的介质；`按钮` 则把身体的复杂动作缩成一个开关。游泳需要持续动作，按钮只需要一次触发。海要求身体在场，按钮可以把身体的手也删掉。于是外部世界从“人在海里”变成“某个按钮被按下”。

最狠的是 `按下`。这句话没有说：

```text
我按下青蓝色的按钮
你按下青蓝色的按钮
他按下青蓝色的按钮
```

它说：

```text
青蓝色的按钮按下
```

主语像是按钮自己。动作的执行者不见了。谁按的？为什么按？按下时手在哪里？按下以后谁负责？句子都不回答。它只保留颜色、物件和结果。这个无主语结构把人的动作擦掉，只留下一个已经发生的触发状态。

因此 #940 不是“有人做了一个动作”的句子，而更像“系统状态已经改变”的句子。按钮被按下，条件成立，后面可以生成下一幅图像。可这仍然发生在语言里，不发生在画面里。

声音上，#940 是清楚前景入声。全句 `1.900s`，RMS=`-21.69dBFS`，Peak=`-5.20dBFS`，无 full-scale/near-clipped samples。它比 #939 后到 #940 前尾部高约 `12.53dB`，所以不是尾音里的错听，而是子丑重新进入。

但 #940 和 #939 的声形不一样。#939 的 RMS 是 `-21.29dBFS`，#940 低约 `0.40dB`，峰值却更高。#939 靠更完整的语法和更长句子把“海里游泳”推出来；#940 更像短促触发词，整体不更厚，但瞬时峰更高。全上下文最强 `0.05s` 短窗落在 `86:44.103-86:44.153`，RMS=`-14.48dBFS`，Peak=`-5.20dBFS`；它在 #940 正文内部，不像 #939 那样由入声前门槛抢走最高点。

句内三段也支持这个读法。前 `0.650s` RMS=`-19.42dBFS`，250-1000Hz 占比 `0.6781`，像短句前部被低中频推出。中段 `0.650-1.250s` RMS=`-21.17dBFS`，20-250Hz 占比升到 `0.7206`，谱心降到 `304.5Hz`，声音变得更低、更钝。尾段 `1.250-1.900s` 降到 RMS=`-28.85dBFS`，像“按下”之后迅速退掉。

这组数据不能被写成按钮音。#940 全句 4-12kHz 占比只有 `0.0010`，12-20kHz 占比只有 `0.0002`。波形是连续人声起伏，中间有两个强峰，尾部衰退；没有可单独确认的机械咔哒声、电子提示音或配乐主题。`按下` 是台词里的动作，不是声音里出现了一个真实开关。

所以这句的声音边界是：

```text
人声说出触发。
声音没有模拟触发。
```

画面边界更硬。`86:34.433-86:45.866` 仍然是同一个低机位公开空间。左侧和中后方观众还在，白色半透明屏障还在，中部背向身体还在，右前景白衣/白布身体还在，透明容器/水瓶样物、标签/刻度样冷色竖线、暖红/红褐材料、黑色条状物和反光地面都还在。`scene>0.04` 和 `scene>0.02` 都没有 showinfo 选帧记录。

#940 入声帧、中帧、出声帧之间只有轻微漂移。全幅平均差为 `1.6002` / `1.6933`，右侧差为 `1.7954` / `1.9363`。这说明画面没有发生一次“按钮按下”应有的显著物件位移、手部动作、界面变化或装置启动。右前景透明容器的冷色竖线很容易诱发 `青蓝色`，但容器标签不是按钮；屏障和地面反射有冷色碎片，但反射不是开关；人物边缘有青蓝像素，但轮廓边缘不是按钮。

这里有一个微妙的观看陷阱。因为台词说得非常具体，观众会开始找“哪个东西像按钮”。右侧容器、黑色条状物、反光面上的小亮点、屏障上的冷色痕迹，都可能被临时认成按钮候选。但 T1 证据不允许这么写。按钮如果成立，至少要有相对稳定的形体、边界、功能位置或动作关系；这段没有。

所以本句的画面规则是：

```text
颜色词不能自动生成物件。
物件词不能自动生成动作。
动作词不能自动生成事件。
```

#940 后只有 `0.366s` 短尾。整体 RMS=`-45.23dBFS`，Peak=`-33.48dBFS`，已经很接近静默阈值，但本次 `-45dB / 0.1s` 检测没有报 silence event。它不是长等待，而是一个很窄的门缝。下一句 #941 很快进来：

```text
会出现很多的棒棒糖和鲸鱼
```

这让 #940 的机制更清楚。#940 说按钮按下，#941 说会出现。两句之间形成触发和生成的关系：

```text
按钮按下
会出现
```

但是这个关系仍在语言里。#940 没有把按钮交给画面；#941 也需要下一轮单独复核，不能让棒棒糖和鲸鱼提前进入 #940 的画面事实。我们只能说，#940 在语法上为 #941 打开“出现”的条件，而不是在影像上启动了一个可见机器。

从 #930 的大问题看，#940 仍然不是感觉回答。#930 问的是 `你是怎么感觉的`。之后语言一路把感觉外部化：`黑的地方`、`红色的卡车驶过`、`向日葵`、`麦田`、`现在正在海里游泳`。到 #940，感觉已经被外部化到一个按钮机制里。它不再像感受，而像输入条件。感觉没有被说出来，反而被转成“按下某个按钮之后会出现什么”的程序。

这使 #940 的潜台词非常冷：

```text
不要解释感觉。
把感觉放进装置。
按下。
让图像出现。
```

可是电影最残酷的地方，是这个装置也没有被交付。没有按钮，没有手，没有启动，没有界面。语言像在操作机器，画面却让所有机器保持不可见。于是观众被夹在两种失败之间：感觉不能直接说，装置也不能直接看。

稳定读法：#940 `青蓝色的按钮按下` 是 #939 `现在正在海里游泳` 后的一次声道回收和语法转向。子丑从阿蒙的水中动作句后重新进入，把海的开放场域收回到颜色化、物件化、无主语的装置触发词。声音上，#940 是 `1.900s` 清楚入声，RMS=`-21.69dBFS`，Peak=`-5.20dBFS`，低频/低中频主导；不是机械咔哒声、电子按钮音或音乐主题。画面上，青蓝候选只是不稳定的小比例色彩诱导，主要来自透明容器标签、屏障/地面反射和人物边缘；没有可见按钮、按压动作、机械开关、屏幕 UI 或装置启动。#940 真正做的事，是把“按钮已被按下”作为语言机制宣布出来，为 #941 的 `会出现很多的棒棒糖和鲸鱼` 开门，但这扇门仍没有成为可见物。

### #941｜子丑：会出现很多的棒棒糖和鲸鱼

```text
T0：#941
时间：01:26:45.866-01:26:49.066
说话人：子丑 / ACT-ZICHOU
台词：会出现很多的棒棒糖和鲸鱼
机制标签：借身;身体材料 / 借身显影
```

#941 是：

```text
会出现很多的棒棒糖和鲸鱼
```

它几乎是贴着 #940 进来的。#940 `青蓝色的按钮按下` 结束后只有 `0.366s` 短尾，RMS=`-45.23dBFS`，Peak=`-33.48dBFS`，接近静默阈值，但本次 `-45dB / 0.1s` 没有报 silence event。这个短尾不像 #939 到 #940 之间那种 `9.167s` 低位等待，它更像一道极窄的门缝。按钮句刚说完，结果句马上进来。

所以 #941 必须先和 #940 连读：

```text
青蓝色的按钮按下
会出现很多的棒棒糖和鲸鱼
```

这两句组成一个触发-生成结构。#940 负责说条件已经成立：按钮按下。#941 负责说条件成立以后会发生什么：会出现很多对象。可是这套结构的悖论也从这里开始。#940 没有交出按钮，#941 也没有交出对象。触发是语言触发，生成也是语言生成。

最先要抓住的是 `会`。它不是“已经出现”，也不是“正在出现”，而是“将要出现”。这一个字把对象推迟了。它让观众在下一秒等待图像兑现，却不给兑现的时间点。它制造的是承诺，不是事实。电影在声音里说“马上会有东西出现”，画面却让这个“马上”一直悬着。

`出现` 也很关键。前面 #936 是 `驶过`，#937 是名词，#938 是场域名，#939 是进行时动作，#940 是装置触发。到 #941，语言终于直接说出影像动作：出现。出现本来是最接近电影画面的词，因为电影的基本能力就是让东西出现在画面上。可是这里偏偏没有出现。于是 #941 变成一句很反电影的电影台词：它说“会出现”，但镜头不让出现发生。

`很多的` 把这个承诺放大。它不是一个棒棒糖、一条鲸鱼，而是很多。数量被说大了，画面却没有增殖。这里没有一堆物体落入画面，没有动画扩散，没有灯光爆开，没有群众反应，也没有镜头切换去接住“很多”。数量只在声音里变多，画面仍然维持那个低机位公开空间。

声音上也没有把 `很多` 做成爆炸。#941 全句 `3.200s`，RMS=`-25.34dBFS`，Peak=`-4.56dBFS`，无 full-scale/near-clipped samples。它比 #940 后短尾高约 `19.89dB`，所以它是明确入声；但它比 #940 的 RMS=`-21.69dBFS` 低约 `3.65dB`。也就是说，`很多` 不是靠更厚的声压来成立的。它更长，峰值更高，却不是更饱满、更奇观化的声音。

句内四段也能看出这一点。前 `0.800s` RMS=`-24.92dBFS`，第二段降到 `-27.01dBFS`，第三段升到 `-23.76dBFS`，最后一段又退到 `-26.41dBFS`。最强 `0.05s` 短窗在精确窗内 `1.880-1.930s`，约等于绝对时间 `86:47.746-86:47.796`，RMS=`-16.28dBFS`，Peak=`-4.56dBFS`。强点不在一开头把对象炸出来，而是在句子中后部短促抬起。

最后一段尤其值得记住。#941 后四分之一 20-250Hz 占比升到 `0.6992`，250-1000Hz 降到 `0.2976`，谱心降到 `243.0Hz`。这不像糖果色、鲸鱼声或生成音效，而像人声把这串对象往低处收掉。#941 的声音不是“出现的声音”，而是“说出会出现的声音”。

频带边界更硬。#941 全句 4-12kHz 占比约 `0.0010`，12-20kHz 占比约 `0.0002`。没有可单独确认的糖果音效、鲸鱼叫声、海洋声、电子生成音或传统配乐主题。这里不能写“声音里出现鲸鱼”，也不能写“音乐制造了童话感”。可确认的是低频/低中频人声把一串不可见对象列出来。

再看两个对象：

```text
棒棒糖
鲸鱼
```

它们的尺度差异极大。`棒棒糖` 是小物，是手能拿住的东西，是甜的、圆的、儿童化的、口腔性的。它带有奖励、安抚、糖果色、塑料包装和游乐感。它很小，通常属于人的手和嘴。

`鲸鱼` 则完全相反。鲸鱼是巨大身体，是海里的生物，是远远大于人的尺度。它不能被手拿住，甚至很难被一个室内空间容纳。它把 #939 的海重新牵回来：刚才说过 `现在正在海里游泳`，现在又说 `鲸鱼`。但是 #939 没有海，#941 也没有鲸鱼。水域没有被交付，水中巨物也没有被交付。

这两个词被 `和` 平放在一起，就像同一台看不见的生成器可以同时吐出儿童糖果和深海巨物。一个小到可以舔，一个大到可以吞没场景。一个是甜味的物，一个是海的身体。它们被同一个 `会出现很多的` 收进清单里，说明 #941 不在讲自然逻辑，而在讲梦像逻辑、图像生成逻辑、公共声场里的自由并置。

但自由并置不等于可见事实。4K 画面里确实有颜色诱导，尤其是右侧暖红/橙色反光。#941 中帧 `warm_orange_right=0.409888`，`candy_saturated_full=0.007283`，`red/pink_full=0.039447`。这些数值说明画面不是完全无色反应。右侧材料、反光、身体边缘和屏障表面会给出糖果色的诱惑。

可是糖果色不是棒棒糖。连通组件表显示，#941 中帧 candy-saturated 最大组件在 960 宽图上面积 `1283px`，位置约 `x=749, y=148, w=71, h=49`。它对应右侧暖红橙反光/材料，不是圆形糖体加棒柄。第二个 candy-saturated 组件面积 `771px`，位置约 `x=311, y=199, w=24, h=54`，更像人物或局部反光轮廓。它也不是棒棒糖。4K 把颜色看清楚了，但看清楚以后反而更确定：这是颜色诱导，不是物件出现。

鲸鱼一侧也一样。#941 中帧 whale-blue 最大组件只有 `194px`，位置约 `x=842, y=232, w=15, h=24`。这只是右侧容器/边缘冷色小块，不是鲸鱼身体。`cyan/blue_full` 最高约 `0.001146`，`deep_blue_full` 最高约 `0.000201`。这些小蓝块可以把观看者的想象往水感和鲸鱼方向推一下，但它们没有体量，没有尾鳍，没有海面，没有运动轨迹，也没有任何可辨的动物轮廓。

所以 #941 的画面边界可以压成四句：

```text
糖果色有诱导。
棒棒糖不显影。
鲸鱼蓝有碎片。
鲸鱼不显影。
```

这一点非常重要，因为 #941 的台词太容易让观众主动补图像。我们听见 `棒棒糖`，就会在右侧暖红橙反光里找糖；听见 `鲸鱼`，就会在透明容器、冷色竖线、地面反光里找水和蓝。4K 的细节越多，误认的机会越多。但这套分析必须反过来工作：细节越多，越要把诱导和物证分开。

画面整体仍是同一低机位公开空间。左侧和中后方观众还在，白色半透明屏障还在，中部背向身体还在，右前景白衣/白布身体还在，透明容器/标签、红褐/暖橙材料、黑色条状物和反光地面都还在。`scene>0.04` 与 `scene>0.02` 都没有 showinfo 选帧记录。#941 入声帧、句中帧、出声帧只是亮度和反光轻微漂移：全幅 mean luma 从 `65.4135` 到 `66.4564` 再回到 `64.5191`；右侧 mean luma 从 `49.1856` 到 `50.4533` 再回到 `48.1177`。这不是生成物落场，而是场内光色波动。

#941 后的长尾更能说明这句的残酷。#941 到 #942 之间有 `21.534s`。如果 `会出现` 是立即兑现的承诺，观众会期待后面马上看到棒棒糖、鲸鱼或某种显影过程。可这段没有。画面继续停在同一公开空间，暖红橙反光和冷色小块继续作为诱导存在，但对象没有来。

声音也没有变成空白。#941 后长尾 RMS=`-39.01dBFS`，Peak=`-14.03dBFS`，没有 silence event。它的频带重心反而很高：4-12kHz 占比 `0.2496`，12-20kHz 占比 `0.5286`，谱心约 `10700.7Hz`。内部 `post 5-10s` RMS=`-35.91dBFS`，12-20kHz 占比 `0.5169`；`post 15-end` RMS=`-39.15dBFS`，12-20kHz 占比 `0.5920`。也就是说，`会出现` 之后不是安静结束，而是把等待拉进偏高频/超高频的薄声场。

这段长尾不能写成对象出现，也不能写成完全沉默。它是一种有声未兑现。声音仍在，图像不来。下一句 #942 要到 `01:27:10.600` 才由甲瑞说：

```text
森林里有光
```

因此 #941 后的 `21.534s` 是一段非常清楚的延迟：棒棒糖和鲸鱼没有出来，森林光也还没有进入。电影让“出现”这个词独自承担它没有兑现的压力。

从 #935 到 #941 连起来，链条现在变成：

```text
黑的地方
红色的卡车驶过
向日葵
麦田
现在正在海里游泳
青蓝色的按钮按下
会出现很多的棒棒糖和鲸鱼
```

这条链越来越像图像生成器。先给地点，再给运动物，再给植物，再给场域，再给水中动作，再给按钮，再给生成结果。可是它每一步都被画面扣住。黑处没有变成黑处，卡车没有驶过，向日葵没有开，麦田没有铺开，海没有出现，按钮没有被看见，棒棒糖和鲸鱼也没有到场。

这让 #930 的问题更尖锐。#930 问的是：

```text
你是怎么感觉的
```

但从 #935 到 #941，没有人真正回答“感觉”。他们交出的是一串外部图像：地方、车、花、田、海、按钮、糖果、鲸鱼。感觉不是被说出来，而是被转换成可生成对象。更准确地说，是被转换成一批本该出现、却没有出现的对象。感觉越被要求表达，语言越交出外部物；外部物越丰富，画面越拒绝兑现。

所以 #941 的潜台词不是童话，也不是梦境完成，而更像：

```text
感觉不能直接说。
那就生成图像。
按钮已经按下。
它们会出现。
可是它们仍然没有出现。
```

这也是它和“梦”的区别。梦境电影通常会让不合逻辑的对象出现，以证明我们已经进入梦。这里相反：不合逻辑的对象只被说出，不被显示。电影不是带我们进入梦境，而是让公开空间吸收梦像词。棒棒糖和鲸鱼属于公共梦像接力，不属于一个可以被画面确认的私人梦场。

稳定读法：#941 `会出现很多的棒棒糖和鲸鱼` 是 #940 `青蓝色的按钮按下` 后的生成承诺句。子丑用 `会出现` 把按钮触发词推成将来结果，用 `很多的` 放大数量，用 `棒棒糖和鲸鱼` 把儿童糖果小物与深海巨物并置。声音上，它是 `3.200s` 清楚入声，RMS=`-25.34dBFS`，Peak=`-4.56dBFS`，比 #940 后短尾高约 `19.89dB`，但比 #940 RMS 低约 `3.65dB`；全句低频/低中频主导，不是糖果音效、鲸鱼声、海洋声、电子生成音或音乐主题。画面上，右侧暖红橙反光只支持糖果色诱导，小面积青蓝只支持水感/鲸鱼蓝诱导；没有棒棒糖、糖棒、糖果群、鲸鱼身体、鲸尾、海面、生成特效或可见出现动作。#941 后 `21.534s` 长尾也不是兑现，而是高频/超高频等待。#941 真正做的事，是把“会出现”说成声音承诺，同时让画面证明出现没有发生。

### #942｜甲瑞：森林里有光

```text
T0：#942
时间：01:27:10.600-01:27:11.866
说话人：甲瑞 / ACT-JIARUI
台词：森林里有光
机制标签：借身;观看显影 / 借身显影
```

#942 不能从 `森林` 这个词开始读。它必须从 #941 之后的长等待开始读。#941 说的是：

```text
会出现很多的棒棒糖和鲸鱼
```

这句话把 #940 `青蓝色的按钮按下` 扩成一个生成承诺：按钮按下，很多物会出现。可是 #941 结束后，电影没有让棒棒糖和鲸鱼出现。#941 后到 #942 前有 `21.534s` 长尾，本轮 #942 资产截取了其中最后 `7.600s`。这段末尾 RMS=`-39.58dBFS`，Peak=`-14.03dBFS`，4-12kHz 占比 `0.2494`，12-20kHz 占比 `0.5636`，谱心约 `13075.5Hz`。它不是静默，也不是对象兑现，而是一段偏高频/超高频的薄等待。

然后 #942 才进来：

```text
森林里有光
```

它不是 #941 的兑现。它没有说“棒棒糖出现了”，没有说“鲸鱼出现了”，没有说“很多东西出来了”。它换了一个层级：从物件清单换到场域和观看条件。从糖果和鲸鱼，换成森林和光。从“会出现”这个将来承诺，换成“有光”这个存在判断。

说话人也换了。#941 是子丑，#942 回到甲瑞。子丑负责把按钮触发后的对象清单说出来；甲瑞则把这段未兑现的生成承诺接回一种更抽象、更像观看结构的句子。这个换声不能写成普通接话。它像把“物会出现”的失败，重新压缩成“可见性仍然存在”的句子：虽然东西没有出来，但某个地方有光。

逐词看，`森林` 先给的是一个密集空间。它不是 #937 的单个 `向日葵`，也不是 #938 的开阔 `麦田`，更不是 #939 的 `海`。森林是多重遮挡、多重纵深、多重枝叶构成的场。它天然带着看不清、进不去、被包围、光被缝隙切碎的感觉。它不是一个物，而是一种环境。

但这里没有环境。画面没有切到户外，没有树干，没有枝叶，没有树冠，没有地面落叶，也没有森林里的空间透视。`87:03.000-87:13.266` 仍是同一个低机位公开空间：左侧观众、白色半透明屏障、反光水平面、中部背向身体、右前景白衣/白布身体、透明容器/水瓶样物、暖红橙反射都还在。`scene>0.04` 和 `scene>0.02` 没有选帧记录。森林只在语言里出现。

`里` 是这句话最容易被忽略、其实最关键的字。它不说“森林有光”，而说“森林里有光”。`里` 把光放进内部。光不是挂在外面，不是照向森林，也不是天上有光；光在森林里面。这个字让观看变得更复杂：如果光在里面，那么要看见它，就必须承认有一个外部看不见的内部空间。

但是电影恰恰不让我们进去。我们仍被留在观众、屏障、反光地面和右前景身体组成的公开场内。白色半透明屏障像一块假墙或假幕，反光面把所有东西翻到下面，右侧身体挡在近处。`里` 说有内部，画面却不给进入内部的路。它只给一个被屏障和反光组织起来的观看外部。

`有` 也很冷。它不是“亮了”，不是“照着”，不是“闪出来”，不是“出现了光”。它只是确认存在：有光。这个 `有` 的力度很低，不负责描述过程。它像在补一条存在记录，而不是展示一个视觉事件。#941 的关键词是 `会出现`，它还带着未来动作；#942 的关键词是 `有`，它把动作取消了，只剩存在句。

`光` 则把这条链推进到最接近观看本身的位置。前面从 #935 开始，语言一直在给图像：黑处、红车、向日葵、麦田、海、按钮、棒棒糖、鲸鱼。到 #942，语言不再先给一个对象，而是给让对象可能被看见的条件。光不是被看的东西之一，它是看见得以发生的媒介。换句话说，#942 说的不是“又一个物”，而是“观看仍可能发生”。

可这也是它最残酷的地方。因为 T1 刚好证明：这句关于光的话，并没有让画面亮起来。

#942 入声帧 mean luma=`65.0262`，中帧降到 `64.3465`，出声帧降到 `64.2655`；right crop mean luma 从 `48.7447` 降到 `47.8317`、`47.7350`，right bright ratio 始终是 `0.000000`。如果只看亮度，#942 说 `有光` 的过程中，画面没有整体升亮，右前景也没有亮起。既有白色屏障和亮面仍在那里，但它们没有在 #942 这一刻变成新光源。

绿色候选也不支持森林。#942 入声帧 forest_green 最大组件只有 `1px`，中帧最大 `3px`，出声帧最大 `2px`；`forest_green_full` 分别只有 `0.000002`、`0.000003`、`0.000015`。broad green 最大组件虽然有 `94px`、`157px`、`189px`，但都落在固定场景边缘或反射区域，不能构成树、枝叶或林地结构。这里不是森林显影，只是零星色彩噪点和既有空间反射。

所以画面边界必须说清楚：

```text
有光感诱导。
无新光源。
有零星绿点。
无森林显影。
```

声音比画面更反直觉。台词说 `光`，但声音不是亮的。#942 全句 `1.266s`，RMS=`-13.68dBFS`，Peak=`-2.00dBFS`，无 full-scale/near-clipped samples。它比入声前 `7.600s` 长尾末段高约 `25.90dB`，比 #941 精确句 RMS=`-25.34dBFS` 高约 `11.66dB`。这是强回入，不是薄薄带过。

但它强在低部。#942 全句 20-250Hz 占比 `0.5940`，250-1000Hz 占比 `0.4057`，1kHz 以上几乎撤空；4-12kHz 和 12-20kHz 均记为 `0.0000`。它不是清亮、闪烁、上扬的光声，不是森林鸟鸣，不是风吹树叶，不是音乐铺开。它是一句低频/低中频人物声道，把 `光` 这个词沉沉地说出来。

内部能量也很有意思。#942 不是一个平滑小句，而是强入、双峰、后撤。前 `0.400s` RMS=`-12.23dBFS`，中段 `0.400-0.850s` RMS=`-12.30dBFS`，尾段降到 `-20.42dBFS`。两个强短窗分别在 `0.200-0.275s` 和 `0.500-0.575s` 附近，其中 `0.525-0.575s` RMS=`-9.19dBFS`，是精确窗内最强短窗。`0.700s` 后快速掉下去，`1.100s` 后多个 50ms 窗低于 `-44dBFS`。也就是说，#942 把“森林里有光”打成两下低部强点，然后迅速撤空。

这让这句话的声画关系非常紧：

```text
语言说光。
声音变低。
画面不亮。
```

这不是矛盾，而是机制。#942 把“光”从自然明亮事件，改造成低频人物声道里的存在判断。它不让光照亮空间，而让光成为一个被说出的、被信任或被怀疑的句子。

从 #930 的原始问题回看，#942 也不是回答。#930 问的是 `你是怎么感觉的`。之后这些句子并没有回答“我感觉……”，而是一路把感觉转成外部图像：黑处、红车、向日葵、麦田、海、按钮、棒棒糖、鲸鱼。#942 继续这个路线，但它把外部图像推进到观看条件本身：森林里有光。感觉不直接出现，而是化成一个“某处有光”的空间判断。

潜台词因此不是：

```text
画面已经变亮了。
森林终于出现了。
奇观开始兑现了。
```

更接近：

```text
那些东西没有出现。
但语言还可以继续给出一个可见性的承诺。
有一个内部。
那个内部里有光。
只是你仍然看不见它。
```

这句的温度也在这里。它听起来像一个安慰性的自然意象：森林里有光，暗处不是全暗，里面还有一点可看见的东西。但在当前声画结构里，它不是安慰完成，而是安慰被扣住。因为观众没有进入森林，也没有看到光。甲瑞说出“有光”，但镜头让我们继续坐在公开空间的边缘，看反光、屏障、观众和白布身体。

这也让 #942 成为下一组小链的起点：

```text
森林里有光
有风
他变得很轻
好像要飞起来
```

后面会从光到风，从环境条件到身体轻化，再到飞起想象。#942 先打开这条链，但它不能预支后面的风和飞。此刻只发生了一件事：甲瑞把 #941 未兑现的生成承诺，换成一句低频的观看承诺。

稳定读法：#942 `森林里有光` 是 #941 `会出现很多的棒棒糖和鲸鱼` 后的甲瑞强回入。它不兑现棒棒糖和鲸鱼，而把语言从生成物清单改写成自然场域和可见性条件。声音上，它是 `1.266s` 的低频/低中频短句，RMS=`-13.68dBFS`，Peak=`-2.00dBFS`，比入声前长尾末段高约 `25.90dB`，比 #941 高约 `11.66dB`；不是森林环境声、鸟鸣、风声、明亮音效或音乐段落。画面上，固定低机位公开空间没有切场，没有森林、树木、枝叶、户外空间、自然光束或独立新光源；既有白色屏障、亮区、暖红橙反射、反光地面和零星绿点只能作为光感/颜色诱导。#942 真正做的事，是让“光”留在语言中：它声明某个内部有光，同时让观众继续处在不能进入、不能看见那个内部的外部。

### #943｜甲瑞：有风

```text
T0：#943
时间：01:27:13.266-01:27:14.033
说话人：甲瑞 / ACT-JIARUI
台词：有风
机制标签：未标记 / 语气残片
```

#943 不能当作一条自然描写读。它必须紧贴 #942：

```text
森林里有光
有风
```

两句共享一个词：`有`。#942 说 `有光`，#943 说 `有风`。这不是随口列举两个自然元素，而是在连续建立一种“存在条件”。先有光，后有风。先是让东西可能被看见的条件，再是让东西可能被推动、变轻、飘移的条件。

但差别也很重要。#942 还有位置：

```text
森林里
```

#943 把位置删掉，只剩：

```text
有风
```

风没有地点，没有方向，没有来源，没有吹向谁，也没有吹动什么。它是一个被宣布的存在，而不是一个被展开的环境。#942 至少给了一个看不见的内部；#943 连内部也不说了。它像把空间进一步抽空，只保留一个条件名。

逐词看，`有` 是继续 #942 的存在句。它不说“风吹起来了”，不说“风从哪里来”，不说“谁感觉到了风”。它只说“有”。这个 `有` 看似最平静，其实最霸道：它不需要证明过程，不需要交代源头，甚至不需要画面响应。它把风作为已经存在的条件放进场内。

`风` 则是一个很特别的对象，因为风本身不可见。风只有通过后果被看见：布被吹起，头发飘动，树叶摇晃，尘粒流动，声音里有空气摩擦。也就是说，风天然要求“传递”。它必须经过另一个材料，才变成可见或可听的东西。

但 #943 恰恰不给传递。T1 复核没有树叶、窗帘、烟尘、飘带、头发飘动、白布被吹起，也没有可确认风源。右前景白衣/白布身体还在，但它的边缘变化只能写成小幅位置/亮度漂移，不能写成被风吹动。运动热图主要亮在既有屏障/亮面、反光和身体边缘，没有连续风向、布料飘动或粒子流。

这就是 #943 的核心反差：

```text
风这种东西必须借物显影。
电影却不给它借物。
```

声音也不让风成立。#943 精确窗 `0.767s`，RMS=`-16.82dBFS`，Peak=`-2.13dBFS`，无 full-scale/near-clipped samples。它比 #942 后到 #943 前 `1.400s` 尾部高约 `26.41dB`，比 #943 后到 #944 前 `1.233s` 尾部高约 `27.29dB`。所以它是非常清楚的短句入声，不是环境声慢慢变成风。

频谱更关键。#943 全句 250-1000Hz 占比 `0.7816`，20-250Hz 占比 `0.2172`，1kHz 以上几乎撤空；4-12kHz 只有 `0.0003`，12-20kHz 只有 `0.0005`。风噪、树叶声、空气摩擦或户外声景，都应该需要更连续的中高频/高频材料。这里没有。这里是一句低频/低中频人物声道，把“风”这个词说出来。

内部结构也说明它不是持续风声。前 `0.250s` RMS=`-18.99dBFS`，中段 `0.250-0.550s` 升到 `-13.71dBFS`，尾段掉到 `-39.62dBFS`。最强 `0.05s` 短窗集中在 `0.325-0.450s`，其中 `0.325-0.375s` RMS=`-9.65dBFS`，Peak=`-2.13dBFS`。它像短促地打出两下语音重心，然后迅速撤空；不是风在空间里持续铺开。

所以声音边界可以压成：

```text
有风被说出。
风声不出现。
```

画面边界也同样清楚。#943 入声帧 mean luma=`65.2923`，中帧 `65.4747`，出声帧 `66.0703`；warm full 从 `0.218926` 升到 `0.305654`，右侧 mean luma 从 `49.1181` 升到 `50.0807`。这说明右侧暖红橙反射在增强，光色确实有漂移。

但这不是风。right bright ratio 始终为 `0.000000`，没有新强光；green/forest green 基本为零，没有树叶或户外线索；10fps 运动差分在 #943 精确段没有跳出前后基线，full mean diff 多在 `0.52-0.82`，而全窗更高的差值反而多出现在 #942 语境段。换句话说，画面在微动，但它没有把微动组织成风。

这就让 #943 成为一种非常微妙的“不可见条件句”。它不像 #942 的 `光` 那样还可能被亮度诱导；`风` 连这种诱导都更薄。光至少可以找亮区，风只能找后果。可电影不给后果。风被宣布在场，却没有材料替它作证。

从 #930 的问题继续看，#943 仍然不是感觉回答。#930 问 `你是怎么感觉的`，但语言没有回到“我感觉到风”或“我觉得风”。它不说主体感觉，只说世界条件：

```text
有风
```

这句话把感觉再一次外部化。它好像在描述一个环境，实际上是在把内在状态翻译成一个不可见的外部介质。不是“我轻了”，不是“我害怕/舒服/冷”，而是“有风”。人的感觉被改写为空气条件。

它也为下一句做准备。#944 是：

```text
他变得很轻
```

风和轻之间有自然联系：风可以让东西飘，轻的东西更容易被风带走。但 #943 还不能预支 #944。此刻没有“他”，没有变轻动作，没有飘起，也没有飞起。#943 只是把一个不可见的空气条件放在场上，让下一句可以借它继续推进。

潜台词不是：

```text
现场真的起风了。
布被吹动了。
身体被风托起来了。
```

更接近：

```text
光之后，语言继续给出一个环境条件。
这个条件本该通过材料显影。
但材料不替它作证。
所以风只作为一句话存在。
```

这正是本段链条的残酷训练。观众被迫学会区分：听见风，不等于听见风声；看见白布，不等于看见风吹白布；看到边缘差分，不等于看到空气流动。电影不断抛出可被想象的自然条件，却让声画拒绝把它们变成事实。

稳定读法：#943 `有风` 是 #942 `森林里有光` 后的第二个存在句。它重复 `有`，删掉 `森林里` 的位置，把光后的可见性条件继续推进为不可见的运动条件。声音上，它是 `0.767s` 的人物短句，RMS=`-16.82dBFS`，Peak=`-2.13dBFS`，比前后尾部高约 `26-27dB`；全句 250-1000Hz 主导，不是风噪、树叶声、户外声景、鸟鸣、明亮音效或音乐段落。画面上，同一低机位公开空间没有切场，没有风源、风吹布、风吹头发、树叶摇动、尘粒/烟雾流动、户外空间或声画同步风效；暖红橙反射增强和身体/白布边缘小幅差分只能作为光色/位置漂移。#943 真正做的事，是把“风”作为不可见条件放进语言，为 #944 的 `他变得很轻` 铺出空气，但暂时仍不让风在声画中显影。

### #944｜甲瑞：他变得很轻

```text
T0：#944
时间：01:27:15.266-01:27:16.366
说话人：甲瑞 / ACT-JIARUI
台词：他变得很轻
机制标签：偷入 / 偷入关系
```

#944 必须紧贴前两句读：

```text
森林里有光
有风
他变得很轻
```

前两句都是条件句。#942 给出可见性条件：`有光`。#943 给出空气/运动条件：`有风`。#944 才第一次把这些条件落到身体上：`他变得很轻`。

这个落点非常危险，因为它很容易被读成画面事实。我们听到 `变得很轻`，就会立刻想象一个身体开始漂浮、被风托住、离地，或者至少姿态变得松、薄、轻。但 T1 复核恰恰要把这个想象刹住。#944 只是把身体状态说出来；它还没有让身体状态变成画面物证。

先看代词。#944 不说：

```text
我变得很轻
```

也不说：

```text
你变得很轻
```

而说：

```text
他变得很轻
```

这个 `他` 没有被画面单独确认。画面里有中部背向身体，有右前景白衣/白布身体，有观众和反光身体，但电影没有切反打，没有给特写，没有用动作把某一个身体标出来说“就是他”。所以 #944 的 `他` 是语言里的第三人称身体，不是画面已经圈出的身体。

这就是 `偷入` 的位置。#944 把一个未指认身体偷入场中，让我们以为刚才的光和风已经找到了承接者。但承接者并没有被影像明确交付。语言先行，身体跟不上。

再看 `变得`。它不是静态形容：

```text
他很轻
```

而是过程句：

```text
他变得很轻
```

`变得` 自带一个之前和之后：原来不这么轻，现在变轻了。可是画面没有给出这个过程。没有可见重量变化，没有起身，没有离地，没有上升轨迹，没有身体从重到轻的动作阶段。过程在语法里完成，画面不补过程。

声学上，#944 是这一串里更重的一句。精确窗 `1.100s`，RMS=`-14.98dBFS`，Peak=`0.00dBFS`，出现 `47` 个 full-scale / near-clipped samples。它比 #943 后到 #944 前 `1.233s` 尾部高约 `29.14dB`，比 #944 后到 #945 前 `1.867s` 尾部高约 `26.16dB`，也比 #943 `有风` 的全句 RMS 高约 `1.85dB`。

这意味着 #944 不是从尾部里轻轻浮出来的。它是被人物声道强行顶到前景的身体状态句。它说 `轻`，但声音并不轻。

频谱更能说明这个反差。#944 全句 20-250Hz 占比 `0.4215`，250-1000Hz 占比 `0.5772`，两者合计约 `0.9987`。1kHz 以上几乎撤空；4-12kHz 只有 `0.0004`，12-20kHz 接近零。也就是说，这个 `很轻` 不是被高频、轻盈、明亮或上升的声音托出来，而是被低频/低中频人声压出来。

可以把它写成一个悖论：

```text
轻化被说出。
声音却变重。
```

这不是配乐在帮身体飞。没有可确认独立音乐主题，没有轻盈音效，没有上升音型，没有风托声，也没有飞行动效。#944 的声学事件，是人物声道本身把 `变得很轻` 说到近乎满幅。

内部粗分也支持这个判断。#944 的 early 段 `0.000-0.360s` RMS=`-12.20dBFS`，Peak=`0.00dBFS`，所有 `47` 个 near/full-scale samples 都在这里；mid 段 `0.360-0.760s` RMS=`-16.22dBFS`，20-250Hz 占比升到 `0.8794`；tail 段 `0.760-1.100s` RMS=`-19.57dBFS`，仍以低频为主。最强 `50ms` 短窗集中在 `0.250-0.400s`，`0.325-0.375s` RMS=`-7.35dBFS`，`0.300-0.350s` RMS=`-7.49dBFS`。这一句内部不是柔软滑走，而是先被顶满，再向低频压下去，再由尾部收束。

波形上可以粗看成三个声块：开头短声块，约 `0.25-0.60s` 的强主声块，约 `0.73-0.95s` 的尾部声块。但这只能说明一句话内部有推进，不能拿来逐字锁定 `他/变得/很轻` 的精确边界，更不能拿来确认口型。

再看画面。#944 入声到出声期间，画面仍是同一低机位公开空间：观众、白色半透明屏障、反光地面、中部背向身体、右前景白衣/白布身体、透明容器、暖红橙反射都还在。没有切到户外，没有切到一个轻起来的身体，没有切到风把身体托住，也没有切到即将飞起的动作。

右前景白衣/白布身体尤其重要。它在 #944 期间持续坐着。肩、背、白布、膝部和倒影都还保持同一关系。白布有皱褶，身体边缘和反射有细微变化，但这只能写成坐姿持续下的光色、边缘和反射漂移，不能写成轻化。

中部背向身体也不能替 #944 作证。它仍在观众前方，位置没有因为台词而被托起、变轻、离地或漂浮。#944 的 `他` 可以让我们想到这个背向身体，也可以让我们想到右前景身体，甚至让我们在场内寻找任何一个“他”。但寻找不是证明。没有画面锁定，就不能把某个身体写成已经变轻。

亮度统计还给出一个反向证据。#944 入声帧 mean luma=`65.3405`，中段 `64.9201`，出声 `64.6298`；right mean luma 从 `50.0394` 降到 `48.9658`；warm full 从 `0.054298` 降到 `0.021578`，cyan/blue full 从 `0.163554` 升到 `0.189805`。也就是说，`很轻` 出现时，画面不是变亮、变空、变轻盈，而是在略微变暗、变冷，暖色反射回落。

这很关键。#942 说 `有光`，画面没有变成森林光。#943 说 `有风`，画面没有变成风。#944 说 `他变得很轻`，画面也没有变成轻。电影没有把语言里的自然条件和身体状态转化成可见结果。

运动差分同样压住误读。`944_in -> 944_mid` 的 motion ratio `>12` 只有 `0.000449`，`944_mid -> 944_out` 只有 `0.000156`。差分主要落在屏障、反光、身体边缘、透明容器和局部亮点上。它没有连续上升方向，没有身体轮廓整体移动，没有白布被托起，也没有离地轨迹。#944 后到 #945 前的 `post944_mid -> pre945_in` 变化更高一些，但它发生在 #944 之后，不能倒推 #944 已经飞起。

所以 #944 的潜台词不是：

```text
他真的轻了。
身体已经飘起来。
风把他托住。
下一句的飞已经开始发生。
```

更接近：

```text
光和风之后，语言需要一个身体来承接。
于是一个未被指认的“他”被放进句子。
这个身体在语法中变轻。
但画面拒绝让它变轻。
```

从 #930 的 `你是怎么感觉的` 回看，#944 也不是一个感受报告。它不是“我觉得他很轻”，不是“我感觉自己轻了”，而是第三人称陈述：

```text
他变得很轻
```

感觉被继续外部化。先是 `森林里有光`，再是 `有风`，现在是 `他变得很轻`。内在经验被说成一个外部世界里的身体状态。问题是，电影只让这件事在语言中发生。

它也为 #945 做准备。下一句是：

```text
好像要飞起来
```

`轻` 和 `飞` 的关系比 `风` 和 `轻` 更直接。轻的东西更容易飞，风可以托轻的东西。但 #944 还不是 #945。此刻只有“变得很轻”，没有“要飞起来”。不能把下一句的飞行可能性倒写成这一句已经有飞起动作，更不能把 #944 写成飞行开始。

稳定读法：#944 `他变得很轻` 是 #943 `有风` 后的身体状态句。它把不可见空气条件转成第三人称身体变化，但这个 `他` 没有被画面单独指认，`变得` 的过程也没有被画面交付。声音上，它是 `1.100s` 的强前景低频/低中频人物声道，RMS=`-14.98dBFS`，Peak=`0.00dBFS`，有 `47` 个 near/full-scale samples，比前后尾部高约 `26-29dB`；它不是音乐主题、轻盈音效、风托声或飞行动效。画面上，同一低机位公开空间没有身体离地、上升、漂浮、风托、飞起或真实重量变化；右前景白衣/白布身体保持坐姿，中部背向身体也没有被托起。#944 真正做的事，是让“轻”以很重的人声进入语言，为 #945 的 `好像要飞起来` 铺出身体条件，但暂时仍不让轻化在声画中显影。

### #945｜甲瑞：好像要飞起来

```text
T0：#945
时间：01:27:18.233-01:27:19.266
说话人：甲瑞 / ACT-JIARUI
台词：好像要飞起来
机制标签：借身 / 流程规则 / 身体材料
```

#945 必须紧贴 #944 读：

```text
他变得很轻
好像要飞起来
```

这两句构成一个很自然的语义坡度：轻的东西容易被风带走，也容易飞。#942 先说 `森林里有光`，#943 说 `有风`，#944 说 `他变得很轻`，到 #945 才说 `好像要飞起来`。可见性、空气、身体状态、运动趋向，一层一层被语言补齐。

但这条坡度不能被写成事实完成。#945 没有说：

```text
他飞起来了
```

它说的是：

```text
好像要飞起来
```

`好像` 是这句话最重要的刹车。它把飞行放在似乎、像是、近似和不确定的位置上。它不把 `飞起来` 变成证词，只把它变成一种即将发生的样子。这里不是完成时，而是趋向。

`要` 是第二个刹车。`要飞起来` 不是已经飞起来，而是将要飞起来。它把动作放到未来的门槛上。这个未来还没有被画面签收。

`起来` 是方向词。它让我们想象垂直上升，想象身体离开支撑面。但方向词需要画面轨迹支持：身体高度、重心、接触面、倒影、边缘运动、上升路径都要能跟上。#945 的画面没有给这些。

声学上，#945 反而比 #944 收了很多。#945 精确窗 `1.033s`，RMS=`-23.29dBFS`，Peak=`-8.57dBFS`，没有 near/full-scale samples。它比入声前 `1.867s` 尾部高约 `17.85dB`，比句后 `2.000s` 短尾高约 `22.83dB`，比句后到 #946 前 `10.500s` 长尾高约 `20.98dB`。所以它确实是前景人声，不是环境尾巴。

但它不是升级。#944 `他变得很轻` 的 RMS 是 `-14.98dBFS`，Peak=`0.00dBFS`，有 `47` 个 near/full-scale samples。#945 比 #944 低约 `8.31dB`，峰值也从触顶退到 `-8.57dBFS`。这很关键：语言从“轻”走向“飞”，声音却没有变得更强、更高、更亮。飞行不是被声压推起来的。

频谱也不让飞成立。#945 全句 20-250Hz 占比 `0.7517`，250-1000Hz 占比 `0.2450`，二者合计约 `0.9967`。1kHz 以上几乎撤空；4-12kHz 只有 `0.0005`，12-20kHz 接近零。它没有上升音型，没有独立音乐主题，没有轻盈音效，没有风托声，也没有飞行动效。`飞起来` 是被低频/低中频人声说出来的，不是被音乐托起来的。

波形上也没有一条连续上升线。#945 更像三块短声团：开头进入，中段推出，尾部迅速撤空。内部粗分显示，early 段 `0.000-0.300s` RMS=`-22.69dBFS`，mid 段 `0.300-0.650s` RMS=`-20.39dBFS`，tail 段 `0.650-1.033s` 已降到 `-40.89dBFS`。最强 `50ms` 短窗在 `0.525-0.575s`，RMS=`-15.34dBFS`，Peak=`-8.57dBFS`。这是一句被分块推出、又很快撤回的飞行句，不是连续飞行声。

画面更清楚。#945 入声、中段、出声都维持同一低机位公开空间：观众、白色半透明屏障、反光地面、中部背向身体、右前景白衣/白布身体、透明容器、暖红橙反射都还在。没有天空，没有户外，没有高处，没有镜头跟随一个身体上升。

右前景白衣/白布身体最容易诱发误读。它穿白色，背后有暖光，白布边缘也有细微漂移。可是 4K 接触表显示，它在 #945 期间一直坐着。肩、背、骨盆、膝部、白布、透明容器和倒影继续维持同一支撑关系。它没有离开地面/座位，没有被风托起，也没有从反光里脱开。

中部背向身体也不能替 #945 完成飞行。它仍在观众前方，背向场内。#945 精确窗没有把它从地面或观众关系中托出来。#945 后长尾末段有更多姿态和光色变化候选，但那已经在 #945 结束之后，不能倒写成这句已经飞起。

亮度统计说明这里有一个微妙反差：#945 期间画面确实略微变亮、变暖。#945 入声帧 mean luma=`64.5709`，中段 `65.0366`，出声 `65.8617`；warm full 从 `0.014803` 升到 `0.063560`；right mean luma 从 `48.6557` 升到 `50.2279`。这可以写成暖色反射回升，或者公开空间在 `飞起来` 这句话下被光色轻轻抬了一下。

但这仍不是身体升空。right bright 始终是 `0.000000`，右前景身体没有被新强光托出。亮度上升是画面材料和反射的变化，不是重心、支撑面和轨迹的变化。

运动差分把这个边界压得更牢。`945_in -> 945_mid` 的 motion ratio `>12` 只有 `0.000345`，`945_mid -> 945_out` 只有 `0.000533`。这些变化主要落在屏障、反光、身体边缘、透明容器和暖色区域。没有垂直连续轨迹，没有身体轮廓整体上移，没有白布被风持续托起，也没有坐姿支撑关系断开。

所以 #945 的潜台词不是：

```text
他飞起来了。
身体终于离开现场。
风把他托走了。
画面兑现了轻化。
```

更接近：

```text
轻已经被说出。
语言于是把身体推到飞行的边缘。
但这只是好像、只是将要。
画面仍把身体扣在公开空间里。
```

从 #930 的 `你是怎么感觉的` 回看，这一串梦像并不是越来越自由，而是越来越被公开空间吸收。`森林里有光` 没有变成森林光，`有风` 没有变成风，`他变得很轻` 没有变成轻化，`好像要飞起来` 也没有变成飞行。每一句都把想象推远一点，但画面每一次都把它收回同一个现场。

这也解释了 #945 为什么用 `好像`。电影不是不知道飞没有发生；它正是要把飞停在“像要发生”的位置。这个词让想象有一点空间，也让证据保留诚实。飞不是现实动作，而是语言在固定现场中制造的未完成趋向。

下一句 #946 是：

```text
硬币的中间开了一朵花
```

它会把飞行趋向转成另一个微型奇迹：硬币、中心、开花。但 #945 不能预支 #946。不能因为后面出现硬币和花，就把 #945 写成自由完成，也不能把 #945 后长尾中的光色变化写成硬币或花的提前显影。

稳定读法：#945 `好像要飞起来` 是 #944 `他变得很轻` 后的未完成飞行句。它把轻化推进到飞行趋向，但 `好像` 和 `要` 都把动作留在未完成门槛上。声音上，它是 `1.033s` 的低频/低中频人物短句，RMS=`-23.29dBFS`，Peak=`-8.57dBFS`，比 #944 低约 `8.31dB`，没有 near/full-scale samples；没有独立音乐主题、上升音型、轻盈音效、风托声或飞行动效。画面上，同一低机位公开空间没有身体离地、上升、漂浮、风托、逃脱或真实飞行；右前景白衣/白布身体保持坐姿，中部背向身体没有在精确窗内升空。#945 真正做的事，是把“轻”推到“飞”的边缘，同时用 `好像` 和 `要` 让飞停在语言里，而不是让身体离开画面。

### #946｜恽剑辉：硬币的中间开了一朵花

```text
T0：#946
时间：01:27:29.766-01:27:31.600
说话人：恽剑辉 / ACT-YUNJIANHUI
台词：硬币的中间开了一朵花
机制标签：未标记/语气残片
```

这一句和 #945 之间隔了 `10.500s`。#945 说：

```text
好像要飞起来
```

但画面没有让身体飞起来。于是 #946 并不是“飞行完成后的下一步”，而是换一种更小、更硬、更内部的奇迹：

```text
硬币的中间开了一朵花
```

方向变了。#945 的方向是向上，身体似乎要离开地面。#946 的方向是向内，一个硬币的中间被打开。飞行需要离开现场；硬币开花不需要离开现场，只需要一个小物内部发生变化。它把“逃出去”的想象缩成“中心发生奇迹”。

这句很美，但也很危险。因为右侧画面确实给了一个容易诱发“花”的东西：暖橙光在右前景白衣身体后方抬起来，白布或屏障皱褶有放射感，透明容器、红色前景材料和地面倒影一起构成局部中心。可是 4K 复核必须把这个诱导和物证分开。画面没有硬币，没有钱币，没有手部拿起，没有桌面特写，没有一个小圆物的中间被打开，也没有花瓣、花心、花茎或物件变形。

所以这一句的第一条边界是：

```text
语言有硬币中心。
画面只有暖光中心。
语言有花。
画面只有反射、皱褶和颜色诱导。
```

声音上，#946 比 #945 重新抬高。#946 精确窗 `1.834s`，RMS=`-17.86dBFS`，Peak=`-4.25dBFS`，没有 full-scale / near-clipped samples。它比 #946 前 `10.500s` 长尾高约 `26.41dB`，比 #946 后到 #947 前 `12.800s` 长尾高约 `22.30dB`，比 #945 `好像要飞起来` 高约 `5.43dB`。这不是环境声里的幻听，而是人物声道重新压到前景。

但这也不是音乐。#946 全句 20-250Hz 占比 `0.7622`，250-1000Hz 占比 `0.2083`，两者合计约 `0.9705`。1kHz 以上合计不足 `0.03`。没有金属硬币声，没有花开声，没有魔术音效，没有亮片声，没有配乐主题。硬币和花不是通过音效显影，而是通过人声命名。

精确窗内部还有一个很值得记的细节。最强 `50ms` 窗在句子开头：`0.050-0.100s` RMS=`-10.89dBFS`，`0.075-0.125s` RMS=`-10.98dBFS`。粗分段里，前半段也明显更重：`rough early hard coin` RMS=`-14.27dBFS`，20-250Hz 占比 `0.8556`；`rough middle center` RMS=`-16.51dBFS`，20-250Hz 占比 `0.8517`。到尾段，`rough tail flower` RMS 已退到 `-30.65dBFS`。

不能把这当成逐字口型对齐，但可以作为声学结构来读：硬币和中间被低频压重，开花退到句尾。硬物被说得很重，花被说得更轻。电影没有用高频亮化或音乐来让花开出来，反而让花停在尾部、气声和房间底噪边缘。

画面对应的是另一种结构。#946 入声到中段，mean luma 从 `66.5266` 升到 `69.6329`，warm ratio 从 `0.060961` 升到 `0.124258`，right mean luma 从 `52.2160` 升到 `59.0736`。右侧确实更暖、更亮，暖光像从身体后方和布面皱褶里扩开。

但这个扩开不是花开。right bright ratio 始终是 `0.000000`，没有一个被强光点亮的清楚小物。自动 scene threshold 在 `gt(scene,0.04)` 和 `gt(scene,0.02)` 下都没有实际选帧，也没有硬切、反打或新空间。`946_in -> 946_mid` 的 motion ratio `>12` 虽然达到 `0.105667`，但高亮主要落在暖色反射、布面皱褶、透明容器、人物边缘和地面反光上，不是物件中心打开。

这句因此不是“画面终于兑现了奇迹”。它恰恰把公共梦像接力的机制推进一步：越美的图像，越被固定现场替换成材料诱导。前面 `森林里有光` 没有森林，`有风` 没有风，`他变得很轻` 没有轻化，`好像要飞起来` 没有飞。到 #946，硬币和花也没有变成物件。只是右侧暖光、透明容器、红色材料、白布皱褶和倒影一起给了一个“像中心、像开花”的场。

恽剑辉的换声也重要。甲瑞连续推进的是光、风、轻、飞，是一条身体想要逃离地面的链。恽剑辉进来以后，这条链被压缩：不再往外飞，而是往硬币中心开。身体没有离开，奇迹被放回物件内部。飞行没有完成，花也没有显影。

更接近：

```text
飞没有发生。
于是语言把奇迹缩小。
硬币里开花。
但画面只让暖光在同一现场里扩一下。
```

这让 #946 有一种冷的美。硬币是价值、交换、硬度、圆形封闭；花是开放、柔软、无用、生命感。句子把无用的开放塞进有用的硬物中心。可是电影不让我们真的看到这个反转。它只让这句话在同一公开空间里响一下，然后把它交回反光地面、屏障、透明容器和坐着的身体。

下一句 #947 是：

```text
开始跑了起来
```

这会把 #946 的内部开花再换成动作起跑。但 #946 不能预支 #947。不能因为后面出现 `跑`，就把 #946 的暖色运动写成跑动；也不能因为 #946 说 `开花`，就把右侧布面、暖光或透明容器写成花已经出现。

稳定读法：#946 `硬币的中间开了一朵花` 是 #945 未完成飞行后的中心奇迹句。它把向上逃离的幻想缩成硬币内部的开花想象。声音上，它是 `1.834s` 的强前景低频/低中频人物句，RMS=`-17.86dBFS`，Peak=`-4.25dBFS`，比 #945 高约 `5.43dB`，但不是金属声、花开声、魔术音效或音乐段落。画面上，右侧暖橙光、白布/屏障皱褶、透明容器、红色前景材料和反光地面在入声到中段增强，形成中心/花状诱导；但没有可见硬币、硬币中心、开孔、花瓣、花心、花茎或物件变形。#946 真正做的事，是把一个很漂亮的奇迹说出来，同时让画面只交出同一现场里的暖光和反射。

### #947｜阿蒙：开始跑了起来

```text
T0：#947
时间：01:27:44.400-01:27:45.266
说话人：阿蒙 / ACT-AMENG
台词：开始跑了起来
机制标签：流程规则
```

这一句接在 #946 后面。#946 说：

```text
硬币的中间开了一朵花
```

那个奇迹在一个小中心里发生。硬币、中心、开花，都是向内的词。#947 突然改成动作：

```text
开始跑了起来
```

方向从“物件内部”变成“身体路线”。`开始` 是流程开关，表示事情进入执行；`跑` 是位移词，要求身体从一个点移动到另一个点；`起来` 又把动作推成起势，同时偷偷回接前面的 `好像要飞起来`。这三个词连在一起，听起来像终于要从语言里的奇迹进入画面里的行动。

但 #947 的核心正是：行动被说出，行动没有被画面放行。

先看声音。#947 全句只有 `0.866s`，RMS=`-24.66dBFS`，Peak=`-5.76dBFS`，没有 full-scale / near-clipped samples。它比 #946 后到 #947 前的 `12.800s` 长尾高约 `15.50dB`，所以它确实是一个前景人声进入，不是尾部误听。

可它不是动作爆发。它比 #946 `硬币的中间开了一朵花` 低约 `6.80dB`，也比 #945 `好像要飞起来` 低约 `1.37dB`。如果说 #946 把中心奇迹压到前景，#947 反而把动作启动说得更短、更低、更像流程指令。

频带也不支持跑步声。#947 全句 250-1000Hz 占比 `0.7642`，20-250Hz 只有 `0.0796`，1-4kHz 为 `0.1023`，4-12kHz 为 `0.0489`。它主要还是人物声道，不是鞋底连续触地、奔跑呼吸、衣物高速摩擦或配乐推进。

精确窗内部最值得记的是尾部。`rough up tail` 也就是 `0.580-0.866s`，RMS=`-22.04dBFS`，Peak=`-5.76dBFS`，4-12kHz 占比高达 `0.8530`，谱心升到 `7536.4Hz`。最强 `50ms` 窗在 `0.725-0.775s`，RMS=`-18.30dBFS`。这看上去很尖，很容易被误听成动作声；但它没有连续步频，也没有地面触点节奏，更没有画面里脚步和位移配合。更稳的读法是：这是人声尾部的齿擦、爆破、气息或口腔高频，不是脚步声。

画面更直接地把 `跑` 拦住。#947 入声、中段、出声三帧里，右前景白衣/白布身体仍侧向坐在原位，中部背向身体仍在观众前方，左侧和中后方观众也没有追视、闪避或惊动。镜头固定，没有跟拍、摇移、推拉，也没有给出奔跑路线。空间关系没有重新组织。

关键帧统计很小。#947 入声到出声，mean luma 从 `64.2727` 到 `64.6910`，right mean luma 从 `47.6550` 到 `48.6288`，warm ratio 从 `0.004417` 到 `0.017098`。这只能说明右侧暖光和材料边缘有一点回升，不能说明身体跑了起来。

运动差分也很低。`947_in -> 947_mid` 的 mean diff 只有 `1.2146`，ratio `>12` 只有 `0.000177`；`947_mid -> 947_out` 的 mean diff 是 `1.5663`，ratio `>12` 是 `0.004861`。如果真有跑动、横移、脚步或跟拍，精确窗内部不会这么安静。较明显的差分反而出现在 #947 出声后到 #948 前，那主要是右侧暖光、透明容器、红色前景材料和边缘反射变化，不能反推 #947 已经跑动。

这一句还给我们一个新的 MiMo 方法论边界。MiMo 中国区 endpoint 已经重新跑通；但两次带音频/带动作主题的报告都被 `跑` 诱导了。精确小窗报告写出跑动、脚步、跟随镜头；宽窗报告甚至补出一个背影男子 `01:27:38-42` 从中央跑向左侧。T1 完全不支持这些，所以这两份报告不能当作内容证据。

真正有用的是第三次：同一宽窗去掉音轨，让 MiMo 只做盲视觉反读。它确认没有身体从一个位置移动到另一个位置，没有腿部快速交替，没有脚离地，没有镜头跟随，没有背景透视快速变化，也没有人物进入或离开画框。这个结论和本地帧一致，只能作为 T2 辅助，但它说明：当台词里的动作词被隔离后，模型也看不到跑动。

所以 #947 的稳定读法是：

```text
动作开始被说出。
声音没有交付脚步。
画面没有交付位移。
空间没有让路。
```

这让 #947 和前面几句形成一条更连贯的链。#943 `有风` 没有风，#944 `他变得很轻` 没有轻化，#945 `好像要飞起来` 没有飞起，#946 `硬币的中间开了一朵花` 没有硬币开花。到 #947，连 `跑` 这种最基础的身体动作也没有被画面兑现。

不是因为语言无效。语言非常有效，它不断启动对象、状态、场域、动作和奇迹。问题是，电影把这些启动都留在公开空间里，让观众看见启动和不兑现之间的缝。#947 不是“终于行动”，而是“行动也被纳入同一个不兑现机制”。

下一句 #948 是：

```text
好像在找什么东西
```

它会把 `跑` 的路线继续改成 `找` 的目的。但 #947 不能预支 #948。不能因为下一句出现 `找什么东西`，就把 #947 写成已经开始寻找；也不能因为 #947 说 `跑`，就把后面的暖光、容器、观众边缘或反光变化写成路线、脚步或空间让路。

稳定读法：#947 `开始跑了起来` 是 #946 中心奇迹之后的动作启动句。它把硬币内部开花的奇迹改成流程化身体动作，但声画仍不交付动作。声音上，它是 `0.866s` 的短促人物声，RMS=`-24.66dBFS`，Peak=`-5.76dBFS`，尾部高频尖峰不能升级为脚步声。画面上，同一低机位公开空间没有跑动、快速位移、腿部交替、脚离地、镜头跟随、路线打开或空间让路。#947 真正做的事，是把“行动开始”作为一句话放入现场，同时让现场维持原地。

### #948｜阿蒙：好像在找什么东西

```text
T0：#948
时间：01:27:49.766-01:27:51.200
说话人：阿蒙 / ACT-AMENG
台词：好像在找什么东西
机制标签：未标记 / 语气残片
```

#948 必须接在 #947 的失败动作后面读。#947 说：

```text
开始跑了起来
```

可是画面没有跑。没有路线，没有脚步，没有镜头跟随，也没有空间让路。#948 随后补上一句：

```text
好像在找什么东西
```

这句话像是在给前一句补目的：如果他开始跑，也许不是乱跑，而是在找。可是这一步同样没有得到画面支撑。#947 没有跑出来，#948 也没有把“要找的东西”交出来。于是这一小段的核心不是动作连续完成，而是语言连续给动作补解释，画面连续拒绝兑现。

逐词看，`好像` 是第一道证据边界。它不是确认词，而是降级词。说话人并不说“他在找”，而说“好像在找”。这个 `好像` 把动作放进观察、猜测、似乎和不确定里。它提醒我们：这句话内部已经知道自己不是硬事实。

`在` 把动作放进进行时。它制造一种“事情正在发生”的感觉。但进行时需要声画承接：身体应该有持续动作，眼睛应该有方向，手应该和物发生关系，镜头应该至少让我们知道动作发生在哪里。#948 没有给这些。

`找` 是这句话最诱人的词。它会自动在观众脑中制造一个目标物，也会让我们回头去看右侧的白布、瓶子、红色前景材料、透明容器，试图从里面找出“东西”。但这正是要小心的地方。`找` 是台词给出的意图，不是画面给出的动作事实。

`什么东西` 则把对象保持在未命名状态。它不像 #946 的 `硬币` 和 `花` 那样给出具体物名，也不像下一句 #949 的 `信` 和 `最里面的房间` 那样给出叙事物证。它只是说：似乎有一个东西，但这个东西还不能被命名，也没有被画面挑出来。

声音上，#948 很克制。精确窗 `1.434s`，RMS=`-27.57dBFS`，Peak=`-14.83dBFS`，没有 full-scale / near-clipped samples。它比 #947 后到 #948 前的 `4.500s` 短尾高约 `4.43dB`，比 #948 后到 #949 前的 `4.233s` 短尾高约 `12.86dB`，所以它确实是前景人声，不是环境尾音。

但它比 #947 `开始跑了起来` 低约 `2.91dB`。这点很重要：语言从 `跑` 走向 `找`，声音没有升级。它不像一个动作完成后的强声判断，更像一个低位观察句，轻轻把前一句失败动作改写成“也许他在找”。

频带也说明它不是翻找声。#948 全句 20-250Hz 占比 `0.5948`，250-1000Hz 占比 `0.3324`，20-1000Hz 合计约 `0.9271`。这是低频/低中频人物声道，不是纸张连续翻动、物件碰撞、脚步、衣物高速摩擦或音乐主题。

句内粗分更能看出“找”没有被物理化。前部 `好像` RMS=`-25.63dBFS`，低频占比 `0.7102`；`找` 的候选段 RMS=`-29.17dBFS`，低频占比 `0.7558`；尾部 `什么东西` 候选段 RMS=`-28.24dBFS`，4-12kHz 占比升到 `0.5896`，谱心约 `4453.7Hz`。这个尾部高频很容易被误写成材料摩擦，但更稳的判断是人声尾部的齿擦、气息或口腔摩擦。没有连续翻找节奏，也没有一个可见物件与声音同步。

还有一个反常点：整个 `87:45.266-87:55.433` 窗口中，最强 `100ms` 不在 #948 内，而在 #948 入声前约 `0.15s`，RMS=`-20.18dBFS`、Peak=`-8.40dBFS`。#948 像是从一个更强的前尾之后低位进入。它不是本窗声场的爆点，而是对前尾和前一句的解释性补语。

画面上，#948 更不给答案。入声、中段、出声都仍是同一低机位公开空间：左侧和中后方观众队列在，白色半透明屏障在，中部背向身体在，右前景白衣/白布身体在，瓶子/透明容器在，红色前景材料和反光地面也在。没有硬切，没有反打，没有目标物特写，没有房间门口，没有抽屉、口袋、盒子或隐藏处。

如果 `找什么东西` 被画面兑现，至少要有一种证据：要么身体在找，要么东西被指认。但 #948 两者都没有。没有低头搜寻的清楚动作，没有手部翻找的稳定轨迹，没有视线沿空间扫描，没有镜头跟随某个寻找方向，也没有一个新物被画面推到前景。

关键帧的变化主要是光色。#948 入声到出声，mean luma 从 `64.2513` 升到 `65.3996`，warm ratio 从 `0.0176` 升到 `0.0652`，右侧平均亮度从 `48.8758` 升到 `51.1956`。可以写右侧暖光、红色前景材料和反光面有轻微回潮；不能写目标物出现。

运动差分也压住了动作。`948_in -> 948_mid` 的 mean diff 只有 `1.2120`，ratio `>12` 仅 `0.00048`；`948_mid -> 948_out` mean diff `1.9111`，ratio `>12` 为 `0.00823`。真正比较大的变化在 #948 入声前和句后，主要来自右侧暖光、边缘材料和反射。#948 精确句内部没有寻找动作需要的运动量。

MiMo 在这里很有参考价值，但也要分层使用。带声音上下文报告认为 `找什么东西` 没有被声画直接兑现，#949 的 `信/最里面的房间` 在本片段中也没有视觉物证，这个方向可以保留。但它同时把右侧材料写成纸/薄膜目标物，把前后声响写成沙沙声，把可见姿态写成整理或操作。这些都只能当候选。T1 本地帧只能确认白衣/白布、瓶子/透明容器、红色前景材料和反光在场，不能确认它们就是“东西”，也不能确认人物正在找。

无音轨盲视觉反读更稳。它没有听台词，因此不容易被 `找` 带走；它只看到空间持续、光色波动、无可验证位移、寻找或场景切换动作。这和本地接触表、scene detect、运动差分一致。它可以作为 T2 辅助，但仍不能覆盖 T1。

所以 #948 的潜台词不是：

```text
他真的在找。
画面里已经有要找的东西。
右侧那些材料就是目标。
下一句的信已经在这里出现。
```

更接近：

```text
跑没有跑出来。
语言于是给跑补了一个目的。
目的叫“找什么东西”。
但现场仍不给东西。
```

这句话也为 #949 铺路。下一句是：

```text
杀人犯把信装在最里面的房间
```

#949 会把 #948 的不定 `什么东西` 具体化成 `信`，又把未明空间具体化成 `最里面的房间`。但顺序不能倒过来读。不能因为 #949 有信和房间，就说 #948 已经看见了信和房间。#948 只是把目标空位打开；#949 才会用更具体、更黑暗的叙事词来填这个空位。

稳定读法：#948 `好像在找什么东西` 是 #947 动作启动后的寻找句。它把未兑现的跑动改写成未兑现的目标搜索。声音上，它是 `1.434s` 的低频/低中频人物声，RMS=`-27.57dBFS`，Peak=`-14.83dBFS`，比 #947 低约 `2.91dB`，句尾高频不能升级为物件翻找声。画面上，同一低机位公开空间没有寻找动作、目标物、信、房间、隐藏处、镜头跟随或空间让路。#948 真正做的事，是让“目的”进入语言，同时让目的物继续缺席。

### #949｜子丑：杀人犯把信装在最里面的房间

```text
T0：#949
时间：01:27:55.433-01:27:58.366
说话人：子丑 / ACT-ZICHOU
台词：杀人犯把信装在最里面的房间
机制标签：借身；退出反证；身体材料 / 退出或反证
```

#949 必须接着 #948 读。#948 说：

```text
好像在找什么东西
```

这句话给了一个目标空位，但没有命名目标。#949 立刻把这个空位填得非常具体：

```text
信
```

而且不只给出物，还给出一整条小叙事：

```text
杀人犯 -> 把 -> 信 -> 装在 -> 最里面的房间
```

这几乎是一句完整的犯罪故事。它有人物角色，有物件，有动作，有空间层级。和 #948 的 `什么东西` 相比，#949 像是突然把迷雾补成了情节。

但这恰好是危险之处。语言越完整，越容易诱导我们和模型把画面里的白布、衣料、遮挡、前景伏身身体、右侧棕色身体、静坐观众都组织成“藏信现场”。可是 T1 不支持这样写。

先看画面。#949 所在窗口不再只是 #948 那种目标空位边缘的模糊寻找感，它更清楚地显出一个白布围合的观看区：白布/屏障覆盖背景，前景伏身身体挡住下方中心，中央黑 T 恤女性抱臂坐着，右侧长发女性低头或凝视，左侧白衣人物逐渐出画，右侧棕色身体成为边缘遮挡。这个空间比前一句更“室内”，更“围合”，也更容易让人想到 `房间`。

但围合不等于房间。白布不等于墙。遮挡不等于最里面。前景身体挡住了画面，不等于里面藏着信。画面没有门，没有墙角，没有房间入口，没有抽屉、盒子、口袋、桌面，也没有任何可验证的信件、纸张、信封或卡片。所谓 `最里面的房间` 只在台词里成立，画面只给出“被围住的观看区”。

这句最核心的断裂就是：

```text
语言给出房间层级。
画面只给出白布围合。
语言给出信。
画面不给纸。
语言给出装入动作。
画面不给手部操作。
```

声音上，#949 也很值得细看。全句 `2.933s`，RMS=`-31.52dBFS`，Peak=`-8.51dBFS`，没有 full-scale / near-clipped samples。它比 #948 后到 #949 前的 `4.233s` 尾部高约 `6.17dB`，说明它确实是前景入声，不是环境里漏出来的词。

但它比 #949 后到 #950 前的 `6.700s` 尾部低约 `4.99dB`。这和前几句不同。#943 到 #948 多数是台词压出来，然后句后退回或等待；#949 说完以后，声场反而整体更响。也就是说，`杀人犯把信装在最里面的房间` 并不是这个窗口的声压终点。台词交出叙事，现场却继续在它后面回潮。

句内粗分也有一个很尖的结构。前几个候选段都很弱：`杀人犯` 候选段 RMS=`-45.80dBFS`，`把信` 候选段 RMS=`-44.63dBFS`，`装在` 候选段 RMS=`-45.37dBFS`。真正变强的是尾部 `房间` 候选段，RMS=`-23.95dBFS`，Peak=`-8.51dBFS`。声音像是把最后那个空间词钉出来。

可是“房间”变强，不等于房间出现。强尾不是门声，不是纸声，不是装入声，也不是空间层级被打开。`最里面` 候选段的谱心很高，12-20kHz 占比也高，但这也不能写成“最里面”被声音物理化。它更稳的判断是：人声尾部、齿擦、气息和现场高频噪声在空间词附近抬起。

这句因此不是“信被装进去的声音”，而是“房间这个词在声音尾部变重”。这非常重要。语言把物和空间说得更完整，声音把最后的空间词按了一下，但画面和声源都没有交付物证。

运动差分也会诱导人。#949 的帧差明显比 #948 大。`949_in -> 949_mid` mean diff=`29.40`，ratio `>12` 达 `0.6880`；`949_mid -> 949_out` mean diff=`27.05`，ratio `>12` 达 `0.6396`。如果只看数字，会觉得“这一句真的发生了什么”。但接触表说明没有硬切，scene detect 也没有实际选帧。变化主要来自同一观看区内的连续重组：左侧白衣人物出画，右侧棕色身体进边缘，前景伏身身体遮挡，白布和人物边缘改变。它是构图和遮挡的变化，不是空间切到“最里面房间”。

这让 #949 和 #948 形成一个非常清楚的连续机制：

```text
#948：目标空位被打开，但没有目标物。
#949：目标被命名为信，但仍没有目标物。
#948：寻找动作被说出，但没有寻找。
#949：装入动作被说出，但没有装入。
#948：空间还未命名。
#949：空间被命名为最里面的房间，但画面仍只给观看区。
```

MiMo 这次反而比较稳。带声音报告和无音轨盲视觉反读都没有把 `信/房间` 升级成可见事实。无音轨报告逐项判定：信件不可见，纸张不可见，房间门不可见，最里面空间不可见，抽屉/盒子/口袋不可见，装入动作不可见，寻找动作不可见，相关手部操作轨迹不可见。只有 `隐藏处` 被保留为不确定，因为遮挡确实让画面下方和侧边不可见。

但遮挡只能证明看不见，不能证明藏好了。这个差别一定要保住。很多误读就发生在这里：画面不给，于是我们把不给当成“藏起来”；画面遮挡，于是我们把遮挡当成“最里面”；白布围合，于是我们把围合当成“房间”。#949 正是在利用这种诱导。

`杀人犯` 这个词也必须降级。它是叙事角色词，不是现实身份裁决。画面里没有任何人被视觉标记为杀人犯，也没有犯罪动作、攻击动作、藏匿动作或犯罪现场。子丑说出 `杀人犯`，不是电影给出一个现实犯罪事实。

所以 #949 的潜台词不是：

```text
杀人犯真的出现了。
信真的被放进房间。
白布空间就是最里面的房间。
遮挡证明有隐藏处。
```

而是：

```text
上一句的目标空位被具体化。
具体化靠语言完成。
画面只交出观看区、白布和遮挡。
叙事物证仍然缺席。
```

这句话也为 #950 做准备。下一句是：

```text
下午阳光最亮的时候
```

也就是说，#949 先把空间推到“最里面的房间”，#950 又会把时间和光线推到“下午阳光最亮的时候”。但顺序不能倒。不能因为后一句有 `阳光`，就把 #949 的白布反光写成下午阳光；也不能因为 #949 有 `房间`，就把 #950 前的围合空间写成真实室内建筑。

稳定读法：#949 `杀人犯把信装在最里面的房间` 把 #948 的 `什么东西` 具体化成 `信`，把未明目标空间具体化成 `最里面的房间`。声音上，它是 `2.933s` 的前景人声，RMS=`-31.52dBFS`，Peak=`-8.51dBFS`，句尾 `房间` 候选段明显变强，但这不是房间声、纸声或装入声。画面上，白布围合观看区、前景伏身身体、静坐观众和右侧遮挡连续重组；没有信、纸、房间门、最里面空间、抽屉、盒子、口袋、隐藏处、装入动作或寻找动作。#949 真正做的事，是让叙事物证在语言里变得极完整，同时让物证继续不进入画面。

### #950｜甲瑞：下午阳光最亮的时候

```text
T0：#950
时间：01:28:05.066-01:28:07.166
说话人：甲瑞 / ACT-JIARUI
台词：下午阳光最亮的时候
机制标签：借身；观看显影 / 借身显影
```

#950 要接在 #949 后面读。#949 刚说：

```text
杀人犯把信装在最里面的房间
```

那一句把 #948 的 `什么东西` 补成 `信`，又把未明目标空间补成 `最里面的房间`。但是画面没有交付信，没有交付纸张，没有交付房间，也没有交付装入动作。到了 #950，语言不再继续给物件，而是换成条件：

```text
下午
阳光
最亮
的时候
```

这是一个很细的转向。#949 给的是叙事物证和空间层级；#950 给的是时间和光照条件。好像只要把时间推到下午、把光源推到阳光、把强度推到最亮，前一句的信和房间就会因此变得可见。但 T1 复核正好把这个诱导拆开：画面确实更亮，阳光没有出现；白布空间确实更清楚，房间仍没有出现。

先看 `下午`。它是时间词，但画面没有时间证据。没有钟表，没有窗外天色，没有太阳方向，没有户外景别，也没有人物对下午的身体反应。我们只能确认甲瑞说了 `下午`，不能确认电影画面进入下午。

`阳光` 是光源词，但画面也没有自然光源证据。没有窗户，没有户外，没有天空，没有太阳，没有直射光束，也没有硬阴影。白布/半透明屏障变得更亮、更冷、更散射，但散射白布不是阳光本身。这里能写的是光感和反射，不能写自然日照。

`最亮` 是强度词，它最诱人，因为本窗画面确实变亮了。但精确探针显示：亮度不是在 #950 句内突然被触发，而是从 #949 出声后逐步爬升。逐秒 luma 是：

```text
8758.366 mean_luma=63.70
8759.000 mean_luma=65.72
8760.000 mean_luma=66.39
8761.000 mean_luma=65.88
8762.000 mean_luma=66.63
8763.000 mean_luma=67.76
8764.000 mean_luma=69.28
8765.066 mean_luma=71.66
8766.116 mean_luma=71.79
8767.166 mean_luma=71.62
8768.266 mean_luma=69.46
```

也就是说，到 #950 入声时，画面已经站上较亮平台。#950 句内只是 `71.66 -> 71.79 -> 71.62` 的小幅维持，不是“说出阳光，阳光立刻显影”。更稳的说法是：前一段白布观看区逐步变亮，#950 把这个已经形成的亮度平台命名为“下午阳光最亮的时候”。

这也是 #950 最狡猾的地方。它不是纯粹无物。它有一点视觉支撑：画面确实比 #949 出声时亮。可是它把这个支撑说得过满：从“亮度平台”说成“下午阳光最亮”。中间缺了自然光源、时间线索和光照方向。

声音更反向。#950 全句 `2.100s`，RMS=`-36.54dBFS`，Peak=`-19.48dBFS`，没有 full-scale / near-clipped samples。它比 #949 后到 #950 前的 `6.700s` 尾部低约 `10.01dB`，也比 #950 后到 #951 前的 `1.100s` 尾部低约 `10.23dB`。这说明 `下午阳光最亮的时候` 不是本窗声压中心，而是嵌在更响的前后声场之间的一句低能量薄声。

频带也不支持“明亮化”。#950 的 12-20kHz 占比约 `0.5574`，4-12kHz 占比约 `0.2716`，20-1000Hz 合计只有约 `0.0819`，谱心约 `12828.7Hz`。这不是温暖、饱满、低中频承托的前景宣告，也不是传统配乐里“阳光出现”的明亮扩张。更像低声压、高频气息、齿擦和现场薄声。

句内粗分尤其重要。`阳光` 候选段 RMS=`-35.35dBFS`，略强；但 `最亮` 候选段降到 RMS=`-36.88dBFS`，尾部 `的时候` 又降到 `-39.11dBFS`。也就是说，语言说到 `最亮` 时，声音没有变亮。最强 `50ms` 也只有 RMS=`-31.86dBFS`，落在句内 `0.890-0.940s`。整个 context 最强 `100ms` 则在窗口末尾 `9.800-9.900s`，已经接近 #951 门槛，RMS=`-16.04dBFS`。#950 的声学事实是：亮词以薄声出现。

所以这句不能写成：

```text
阳光被声音带进来。
音乐把光托起来。
户外声景打开。
鸟声、风声或明亮音效证明下午。
```

本地音频不支持这些。它支持的是：人声把一个光照条件放进现场，而声音本身不替这个条件做物理证明。

画面也不换空间。#950 精确句内部仍是同一个白布/半透明屏障围合的观看区：中央黑 T 恤女性，右侧长发女性，后方条纹衬衫人物，左侧黑衣人物，前景伏身身体，右侧棕色遮挡。没有硬切到户外，没有窗，没有门，没有家具，没有真实客厅，也没有床单作为床上用品出现。

运动差分说明 #950 不是空间转换句。#949 后尾到 #950 入声前的 mean diff 是 `19.19`，ratio `>12` 是 `0.4810`；而 #950 入声到中段只有 `7.14`，中段到出声只有 `6.93`。句内反而稳定。空间没有因为 `下午阳光` 打开，也没有因为 `最亮` 改成自然日照场景。

到 #951 入声前，中央黑 T 恤女性抬手触额，画面也开始为下一句 `白色的床单在客厅里` 提供新的可误读材料。但这个动作属于下一句门槛，不能反向塞回 #950。#950 只能停在这里：白布空间更亮，但仍只是白布围合观看区。

MiMo 在这一句有用，但必须分层。带声音上下文报告确认了无直射阳光、无窗外、无户外、无鸟声、无风声、无明亮音效；无音轨盲视觉反读也确认画面不支持下午、自然阳光、客厅、真实房间或床单，只支持白色柔性材料围合的内部空间。这些可以保留。

但 MiMo 也被 `阳光/最亮` 诱导了一部分。它把亮度提升说得像和 #950 台词强同步，又把 #950 声音说成正常前景对话。T1 必须校正这两点：亮度主要在 #950 入声前爬升，句内只是平台；声音 RMS=`-36.54dBFS`，比前后尾部低约 `10dB`，不是正常强前景对话。

这让 #948-#950 形成一条很整齐的缺席链：

```text
#948：好像在找什么东西 -> 目标空位被打开，但没有目标物。
#949：杀人犯把信装在最里面的房间 -> 物证和空间被具体化，但没有信和房间。
#950：下午阳光最亮的时候 -> 时间和光照条件被给出，但没有下午和自然阳光。
```

每一步都比前一步更具体。#948 只有 `什么东西`，#949 有 `信/最里面的房间`，#950 有 `下午/阳光/最亮`。可是越具体，声画越显示这些具体性主要由语言完成。画面交出的不是信、房间、阳光，而是同一公开观看区里的白布、遮挡、反射、静坐观众和逐步变亮的散射平台。

稳定读法：#950 `下午阳光最亮的时候` 接在 #949 的信/房间叙事之后，把空间物证句转成时间与光照条件。画面确实从 #949 后尾逐步变亮，到 #950 入声时已经处在较亮平台，但没有自然阳光、下午时间、窗户、户外、直射光束、硬阴影、客厅或床单显影。声音上，它是 `2.100s` 的低声压、高频薄句，RMS=`-36.54dBFS`，Peak=`-19.48dBFS`，比前后尾部低约 `10dB`，不支持明亮配乐、阳光音效或户外声景。#950 真正做的事，是把已经变亮的白布观看区纳入“下午/阳光/最亮”的语言框架，同时继续拒绝把自然光源和时间事实交出来。

### #951｜甲瑞：白色的床单在客厅里

```text
T0：#951
时间：01:28:08.266-01:28:10.833
说话人：甲瑞 / ACT-JIARUI
台词：白色的床单在客厅里
机制标签：未标记 / 未标记或语气残片
```

#951 必须贴着 #950 读。#950 刚把 #949 的 `信 / 最里面的房间` 转成了一个光照条件：

```text
下午阳光最亮的时候
```

那一句没有让自然阳光出现，只让白布观看区在句前已经变亮的平台上被命名为 `下午 / 阳光 / 最亮`。#951 接得很顺，它不再说光源，而是把光照条件落到一个具体家居图像上：

```text
白色
床单
客厅
在客厅里
```

这几乎像是前几句的补偿。#948 只有 `什么东西`，#949 给出 `信` 和 `最里面的房间`，#950 给出 `下午阳光最亮的时候`，#951 终于给出一个可以被光照照见的白色物和一个看似日常的空间：床单，客厅。可是本地 4K 取证刚好把这个诱导拆开：白色有，床单没有；室内有，客厅没有；白物稳定在场，`飘` 还没有发生。

先说 `白色`。这不是一个完全无物的词。#951 窗口里，画面确实有白亮和浅色材料。左侧有大面积白亮墙面、投影面或反射面；右侧人物身上和前景附近有暗曝光下的浅色布料、衣物或包裹道具候选。接触表和局部裁切都能看见这个白/浅色系统。

但它不是一块确定的床单。局部指标反而提醒我们小心：#951 入声时，右侧浅色包裹区 mean luma 约 `62.49`，`pale_dim_ratio` 约 `0.57579`；中段 mean luma 约 `62.11`，`pale_dim_ratio` 约 `0.56465`。它是低饱和、浅色、褶皱、包裹状，所以看起来像白物；不是高亮白，也不是被日光照亮的平整床品。

真正的高亮白更多在左侧。#951 入声时，左侧白亮区 mean luma 约 `110.92`，`pale_dim_ratio` 约 `0.97316`，`pale_high_ratio` 约 `0.57074`。但那一块更像墙面、投影面、反射面或光源区域，表面平整，没有布料褶皱和床单使用形态。它能支持 `白色`，不能支持 `床单`。

所以这句最重要的视觉判断是：

```text
白色：有支撑。
床单：不支持。
```

如果把左侧的白亮和右侧的浅色包裹合并，就会误读出“白色床单”。但画面本身把它们分开了。左边给颜色强度，右边给布料感；`床单` 是语言把二者捏成一个家居物名。画面没有床，没有床上用品铺展方式，没有床单边缘，没有床头/床面，也没有悬挂床单或被风吹动的床单。

再看 `客厅`。这也是一个强诱导词，因为 #949 已经说过 `最里面的房间`，#951 又把空间进一步日常化成 `客厅`。好像前面那个不可见房间终于有了家居用途。但画面空间不支持客厅。低机位、强反光地面或台面、横向反光面、背景多人坐成行、空旷公共室内感，这些都更像展演/排练/观看空间。没有沙发、茶几、电视、窗帘、家居陈设、家庭动线或生活杂物。

这不是要把空间命名成另一个绝对地点，而是要守住证据边界：当前画面只能支持公共室内/展演式空间，不能支持家庭客厅。`客厅` 是甲瑞说出的空间名，不是画面交付的空间事实。

声音上，#951 很重。全句 `2.567s`，RMS=`-20.37dBFS`，Peak=`-3.07dBFS`。它比入声前 `1.100s` 尾部高约 `26.02dB`，比句后到 #952 前尾部高约 `26.74dB`。这和 #950 完全不同。#950 是低能量高频薄声，#951 是一个强低频/低中频前景命名句。

频带也很集中：20-250Hz 占比约 `0.61577`，250-1000Hz 占比约 `0.37805`，1kHz 以上几乎没有。它不是明亮、飘动、风声、布料摩擦声，也不是家居环境声。它是低频承重的人声把一个白物和一个空间名压出来。

内部粗分更清楚：

```text
rough 白色：RMS=-16.47dBFS
rough 的床单：RMS=-20.38dBFS
rough 在客厅里：RMS=-24.42dBFS
```

最强的是 `白色`。这和画面证据正好对上：`白色` 是这句里最有可见支撑的部分。后面的 `床单` 和 `客厅里` 逐步变弱，像是声音把一个本来可见的白/浅色材料继续命名成家居物和家居空间。声音强，不等于床单强；声音重，不等于客厅成立。它只是说明命名动作很重。

这里还必须卡住 #952。下一句是：

```text
飘
```

日常语法很容易把 #951 和 #952 合成一句：

```text
白色的床单在客厅里飘
```

但工程边界不能这样偷懒。#951 的时间是 `01:28:08.266-01:28:10.833`，#952 要到 `01:28:12.366` 才入声。#951 内部的运动差分很低，`951_in -> 951_mid` full mean diff 只有 `1.392`，right white/body zone `diff_gt8_ratio` 只有 `0.00050`。也就是说，#951 期间白/浅色物主要是稳定在场，没有独立飘动、风吹摆动、悬挂摆动或漂浮。`飘` 必须留给 #952 重新取证，不能提前塞进 #951。

MiMo 这一轮也形成了很好的反读。带声音上下文报告和无音轨盲视觉报告都支持：白色/浅色物可见，但床单和客厅不被直接证实；#951 内也没有明确 `飘` 的视觉运动。无音轨报告尤其稳，它把右侧浅色物读成包裹在人物身上的布料、道具或仪式性包裹物，把空间读成公共室内/展演/排练空间，还明确区分左侧白亮区域和右侧浅色布料不是同一个东西。

这次 MiMo 还顺手解决了一个工具问题。之前看起来 MiMo 不能跑，是因为当前 shell 里旧/无效的 `MIMO_API_KEY` 环境变量覆盖了 keychain 中可用凭据，直接触发 `401 Invalid API Key`。临时取消环境变量后，脚本从 keychain 读取凭据并显式走 CN endpoint，两路报告都成功。所以这次不是 API 不能继续用，而是环境变量优先级把可用 key 盖住了。

稳定读法：#951 `白色的床单在客厅里` 把 #950 的光照条件落成一个家居图像。画面确有白亮区和浅色包裹物，也确有室内空间；但白亮区不是床单，浅色包裹物也不能确认为床单，公共/展演式室内也不能确认为客厅。声音上，#951 是强低频/低中频前景命名句，尤其 `白色` 被打得最重；但声音强度只说明命名动作很重，不能替画面证明床单和客厅。#951 真正做的事，是把一个暧昧白物强行命名为床单，把一个公共室内强行命名为客厅，同时把 `飘` 留在下一句门槛外。

### #952｜甲瑞：飘

```text
T0：#952
时间：01:28:12.366-01:28:13.133
说话人：甲瑞 / ACT-JIARUI
台词：飘
机制标签：未标记 / 语气残片
```

#952 必须贴着 #951 读，但不能和 #951 直接揉成一个已经被画面证实的事实。#951 刚说：

```text
白色的床单在客厅里
```

#952 接上一个单字：

```text
飘
```

从日常语法看，它当然会诱导出一句完整的话：

```text
白色的床单在客厅里飘
```

但这里恰好要慢一点。T0 把 #951 和 #952 分开。#951 结束在 `01:28:10.833`，#952 要到 `01:28:12.366` 才入声，中间有 `1.533s` 的空隙。电影没有把它们做成一个无缝动作句，而是让 `飘` 这个动词迟到、变短、单独落下。它像补词，也像语气残片：前一句已经把家居图像说满，这个字才在后面补上运动。

声音上，#952 很轻，也很低。全字 `0.767s`，RMS=`-33.16dBFS`，Peak=`-16.39dBFS`。和 #951 全句 RMS=`-20.37dBFS` 相比，它弱约 `12.79dB`；和 #953 边界 RMS=`-19.38dBFS` 相比，它弱约 `13.78dB`。这不是一个被声音高高托起来的“飘”。

频带更说明问题。#952 的 20-250Hz 占比约 `0.70045`，250-1000Hz 占比约 `0.29512`，1kHz 以上几乎没有。它不是高频轻飘声，不是风声，不是布料摩擦声，不是音乐提示，也不是拟音。它是一个低频/低中频占主导的短人声，好像从上一句后面低低补出来。

50ms 滑窗里，#952 的 RMS 范围约 `-48.43dBFS` 到 `-24.76dBFS`。它有一个短促峰值，但没有拖成空间声场。#952 后到 #953 前的 `6.967s` 间隙，RMS=`-32.99dBFS`，谱心很高，主要像现场高频底噪、投影/电子噪声或环境噪声候选。它不能写成风吹进来，不能写成布料在响，也不能写成音乐开始托举“飘”。

所以声音层最稳的结论是：

```text
有“飘”的人声。
没有“飘”的物声。
```

画面也不飘。#952 精确窗里，画面仍是低机位、强反光的公共室内/展演式空间。右侧浅色包裹/衣物/身体区域在场，前景反光在场，橙色光带在右侧和倒影中逐渐更明显，左侧投影和暗部噪声也在微动。但没有一块白色布料、床单或衣物脱离身体/支撑结构，形成独立漂浮、悬浮、风吹摆动或明显摇曳。

关键帧差分很低。#952 入声到中段，full mean diff=`1.585`，full `diff_gt8_ratio=0.00748`；右侧浅色包裹区 mean diff=`1.919`，`diff_gt8_ratio=0.01218`。#952 中段到出声，full mean diff=`1.861`，右侧浅色包裹区 mean diff=`2.364`。这些数字能支持反光、暗部噪声、投影、边缘和身体微动，不能支持床单飘动。

更严格的密帧也一样。`01:28:11.800-01:28:13.500` 抽了 42 张 24fps 帧；#952 精确窗内 full-frame `diff_gt8` 最高只有 `0.00498`，右侧浅色包裹区最高只有 `0.00452`。换句话说，单字期间超过阈值的变化面积不足半个百分点。这不是风吹床单、悬浮物或独立飘动的运动规模。

真正更明显的暖色变化发生在 #952 结束后。`88:13.133 -> 88:14.500` 的 full `diff_gt8_ratio` 升到 `0.05401`，右侧区升到 `0.08387`。但那已经在 #952 句后，而且主要是橙色反光、整体光线和倒影增强，不能倒填为 #952 精确窗内的漂浮证据。

这里有三个特别容易误读的地方。

第一是右侧浅色包裹物。它有白/浅色、褶皱、人体接触和反射，所以很容易被 #951 的 `床单` 带着走。但 #951 已经锁住：它不能确认为床单。#952 也没有让它独立飘起来。

第二是前景反光。低机位反光面会把身体、包裹物和橙色光带倒映出来。倒影同步变化会制造一种“漂移感”，但那不是物体自己在空中动。

第三是橙色光带。#952 出声附近，橙色反光开始变明显；#952 结束后更明显。它会让浅色物边缘像被光擦过，甚至像微微浮动。但这是光线和反射，不是布料受风。

MiMo 这次的反读很有用。带声音上下文报告判断：#952 期间画面构图、光影、人物姿态没有发生可感知突然变化，右侧白衣/浅色区域没有被风吹动、悬浮或独立漂浮；#952 后到 #953 前没有明显风声、布料摩擦声或音乐性声场。无声视觉反读更直接，给出 `漂浮支持度：0分`，并把可见变化归到人体/包裹物微动、反射、光线和投影误读风险。它没有说画面完全不变，而是说这些变化不构成“飘”。

这让 #952 的机制很清楚。它不是没有意义的一个字。它是在 #951 的过满命名后，补上一个运动词：

```text
白色：有支撑。
床单：不支持。
室内：有支撑。
客厅：不支持。
飘：被说出，但不被画面和声音物证支持。
```

#952 把上一句那个不成立的家居图像补完整了。语言上，白色床单终于在客厅里“飘”；证据上，白色仍然分裂，床单仍然不成立，客厅仍然不成立，飘动也没有显影。

它也为 #953 做铺垫。#952 说 `飘`，#953 会说 `大括号和小括号在跳舞`。两个词都把东西推向运动：一个是漂浮，一个是跳舞。但 #953 要到 `01:28:20.100` 才进入，不能把后面的 `跳舞` 反向拿来证明 #952 已经出现运动。

稳定读法：#952 `飘` 接在 #951 `白色的床单在客厅里` 之后，像一个迟到的动词，把上一句没有被画面证实的家居图像补成“白色床单在客厅里飘”。但本地 4K 和音频都不支持真实飘动。声音上，它是 `0.767s` 的低频/低中频短词，RMS=`-33.16dBFS`，没有风声、布料声、拟音或音乐性托举。画面上，#952 精确窗内密帧变化极小，右侧浅色包裹物、前景倒影、橙色反光和背景投影都没有形成独立漂浮路径。#952 真正做的事，是让词语开始飘，而不是让物真的飘。

### #953｜恽剑辉：大括号和小括号在跳舞

```text
T0：#953
时间：01:28:20.100-01:28:22.100
说话人：恽剑辉 / ACT-YUNJIANHUI
台词：大括号和小括号在跳舞
机制标签：未标记 / 语气残片
```

#953 要接着 #952 读，但不能让 #952 替它作证。#952 说的是：

```text
飘
```

到了 #953，动作还在，但动作对象变了。它不再是床单在空气里飘，而是括号在跳舞。#952 还保留了物理想象：床单、客厅、风、轻飘。#953 直接进入符号想象：大括号、小括号、包围、插入、嵌套、补充说明。也就是说，运动从物转到符号，从家居物转到标点结构。

这句的诱导更强。`飘` 可以只是一个轻轻的动词；`跳舞` 会立刻召唤身体、节拍、姿态、重心、重复和可见动作。`括号` 又会召唤曲线。于是观看时很容易在右侧白衣/包裹体、衣物褶皱、地面倒影、橙色反光和容器边缘里寻找 `{}` 或 `()`。

但本地 4K 不支持这种升级。#953 精确窗里，画面仍然是低机位反光空间。左侧是半透明屏障和观众/人群，中部是深色反光地面，右侧是白衣/包裹体、橙色光和容器边缘。没有可直接识别的大括号、小括号、文字、数学符号、独立投影符号，也没有一个曲线形体被画面标成“括号”。

关键帧说明这个差别。#953 入声时，full mean luma=`66.98`，右侧白衣/包裹区 luma=`57.34`，右侧暖色比例 `0.700944`；中段降到 full mean luma=`65.28`、右侧区 `54.07`；出声时降到 full mean luma=`64.05`、右侧区 `51.26`，暖色比例退到 `0.097968`。这些数字支持光线、反光、曝光和右侧边缘变化，不能支持括号符号出现。

密帧更严格。#953 精确窗内 full-frame `diff_gt8` 最高约 `0.005166`，平均约 `0.002513`；右侧白衣/包裹区最高约 `0.009896`，平均约 `0.003985`；右侧橙色反光区最高约 `0.007947`。相邻帧超过阈值的变化面积很小，主要散在右侧身体/衣物/包裹、容器边缘、暖色反光和左侧暗部/观众带中。它不是一条括号运动轨迹，也不是一个符号在画面里起舞。

声音上，#953 确实比 #952 强得多。全句 `2.000s`，RMS=`-19.38dBFS`，Peak=`-0.40dBFS`。和 #952 的 RMS=`-33.16dBFS` 相比，它强约 `13.78dB`。50ms 滑窗里，最强 RMS=`-12.01dBFS`，Peak=`-0.40dBFS`，落在入句后 `0.225-0.275s`。所以 `大括号` 不是轻轻飘出来，而是被人声钉到前景。

但声学前景不是音乐前景。#953 的 20-250Hz 占比约 `0.33925`，250-1000Hz 占比约 `0.49732`，合计约 `0.83657`。这主要是低频/低中频到中频人声。没有旋律、和声、持续配乐、鼓点、规律脉冲、掌声、脚步，或布料/塑料连续节奏。也就是说，声音里有 `跳舞` 这个词，没有把 `跳舞` 变成节拍或动作声。

MiMo 这次三路复核都帮我们压住了诱导。带声音上下文报告给出：括号图形可见支持度 `0/5`，括号/曲线运动支持度 `0/5`，舞蹈动作支持度 `0/5`，音乐/节奏支持度 `0/5`。无声视觉反读更细：画面直接出现括号符号 `0分`，括号状曲线 `1分`，括号状形体独立运动 `0分`，舞蹈动作 `0分`。这个 `1分` 不是括号显影，而是身体轮廓、衣物褶皱、倒影和容器边缘会形成曲线联想。音频专问也一致：音乐/配乐 `0分`，节拍/舞蹈节奏 `0分`，物质动作声 `0.5分`，人声把词推成动作感 `0分`。那 `0.5分` 只是间隙里零散物体声候选，不是 #953 精确句内同步舞蹈声。

所以这一句最重要的不是“画面里出现了跳舞的括号”。恰好相反，它让语言承担了画面不承担的东西。大括号和小括号是用来包住意义、插入意义、限定意义的符号。现在它们被说成会跳舞，像是包围意义的边界自己开始活动。可是电影不给符号身体。括号只在句子里有身体，画面里没有。

稳定读法：#953 `大括号和小括号在跳舞` 把 #952 的运动残词继续推进，但把运动对象从床单/物理漂浮转成标点/符号动作。声音上，它是强前景人声，RMS=`-19.38dBFS`，Peak=`-0.40dBFS`，但没有音乐、节拍、鼓点、脚步、掌声或连续物质动作声。画面上，右侧衣物/身体曲线、倒影、橙色反光和容器边缘可以被诱导成括号状联想，但没有独立 `{}` 或 `()`，也没有括号形体在运动。#953 真正做的事，是让词语里的括号开始跳舞，而不是让画面里的括号真的跳舞。

### #954｜甲瑞：要下雨了

```text
T0：#954
时间：01:28:30.066-01:28:31.066
说话人：甲瑞 / ACT-JIARUI
台词：要下雨了
机制标签：未标记 / 语气残片
```

#954 要接着 #953 读，但不能让 #953 替它作证。#953 说：

```text
大括号和小括号在跳舞
```

那一句把运动从床单、风和物理漂浮推向标点/符号动作。到了 #954，甲瑞忽然把对象拉回自然世界：

```text
要下雨了
```

这看起来像从符号回到天气，从括号回到空气和水。但最关键的是第一个字：`要`。它不是 `下雨了`，不是“正在下雨”，也不是“已经下雨”，而是“要下雨了”。`要` 把事件放到即将发生的门槛上。电影因此可以说出一个自然状态，同时不必在这一秒交出自然事实。

先看声音。#954 是一个很强的前景人声，全句 `1.000s`，RMS=`-16.00dBFS`，Peak=`-0.20dBFS`。它比 #953 后到 #954 前 `7.966s` 间隙高约 `21.07dB`，比 #954 后到 `88:38.000` 的即时尾部高约 `27.79dB`。所以这句不是弱弱地飘过，而是被甲瑞的声音推到前台。

可是这个强，不是雨的强。#954 的 20-250Hz 占比约 `0.43966`，250-1000Hz 占比约 `0.54819`，两段合计约 `0.98785`。4kHz 以上合计只有约 `0.00096`。如果这里真的有雨声、风声、水滴颗粒、雷声前奏或天气音效，高频和宽带成分不会这样几乎撤空。它主要是一句低频/低中频前景人声。

50ms 滑窗也说明峰值都在句内人声上：

```text
0.400-0.450s：RMS=-9.63dBFS，Peak=-2.31dBFS
0.100-0.150s：RMS=-10.42dBFS，Peak=-0.29dBFS
0.325-0.375s：RMS=-10.53dBFS，Peak=-0.20dBFS
```

这些不是雨点的连续颗粒，也不是风声铺底，更不是音乐变暗。#954 后，声场立刻退回很低的 room tone / hiss：`01:28:31.066-01:28:38.000` 的 RMS 只有 `-43.79dBFS`。它没有让 `要下雨了` 延展成雨前氛围。

所以声音层必须写成：

```text
有“要下雨了”的人声。
没有雨声。
没有风声。
没有雷声。
没有水滴声。
没有音乐变暗。
```

画面同样不下雨。#954 入声时，画面仍是同一低机位室内观看/展演空间。左侧是白墙、投影或半透明屏障，背景坐着一排人，中间是强反光台面或地面，右侧有站立身体、浅色包裹/衣物、透明容器和橙色反光。没有窗户，没有窗外，没有天空，没有云层，没有雨线，没有雨滴，没有水流，没有伞，也没有湿痕或积水。

更重要的是，画面没有变暗。#954 入声 full mean luma=`66.290`，中段 `67.200`，出声 `67.195`。台词说 `要下雨了` 的时候，画面不是被云影压暗，而是小幅变亮后维持。这个数字直接挡住了“雨前天光变化”的诱导。

24fps 密帧也很干净。#954 精确窗内 full-frame `diff_gt8` 平均只有 `0.000278`，最高约 `0.001148`；左侧白墙/投影区最高约 `0.000454`；反光面最高约 `0.001160`。如果雨线进入画面，或者水滴打在反光面上，密帧不会只有这样的变化面积。差分图显示，变化主要集中在右侧身体/浅色包裹边缘、倒影边缘和压缩噪声中，不是从上往下的雨线，也不是反光面上的涟漪。

这一句最容易误读的是画面已有“像水”的材料。反光台面像平静水面，背景白墙/幕布褶皱像雨幕，透明容器带来水的联想，橙色暖光又像雨夜湿面反射。可是它们都停在材料层：

```text
反光像水面，但没有水波和水滴。
幕布像雨幕，但没有雨线和风吹。
容器像水的线索，但没有倒水、滴水或液面运动。
橙光像湿夜反射，但没有窗外或街灯。
```

MiMo 四路反读也把这些诱导压住了。带声音宽窗报告给雨线、雨滴/水流、湿痕/积水、窗外天气、雨声、风声、雷声、水滴、天气音效、音乐变暗和画面变暗全部 `0分`。无声视觉报告也给雨线、雨滴/水流、湿痕/积水、窗外/室外、天空/云和画面变暗全部 `0分`，只把“材料反光误导”给到 `4分`。这正好说明：画面不是没有误导力，而是误导力不能升级成天气事实。

精确 1 秒音频 MiMo 报告更简单：雨声、风声、雷声、水滴声、天气音效、音乐/旋律、节奏/鼓点、音乐变暗全部 `0分`，room tone / hiss 只有 `1分`。长音频报告有一个时间错位：它把 `要下雨了` 的相对位置写到接近尾部，和 T0/T1 不一致，所以只能保留“无雨声/无音乐”的方向，不能采用它的时间轴。

于是 #954 在整条公共梦像接力里很清楚。前面 #943 说 `有风`，风没有显影；#950 说 `下午阳光最亮的时候`，自然阳光没有显影；#954 说 `要下雨了`，雨也没有显影。自然条件越来越具体，但它们越来越显示出同一个规则：自然被说出来，声画不替自然兑现。

它和 #953 的关系也因此更细。#953 让括号跳舞，但括号没有身体；#954 让雨将要到来，但雨没有声画。一个是符号动作未兑现，一个是天气预告未兑现。两句连在一起，像是语言先让标点动起来，再让气候快要变化；可电影仍把我们留在同一个室内反光空间里。

稳定读法：#954 `要下雨了` 把公共梦像接力从符号动作句转成天气预告句。声音上，它是强前景低频/低中频人声，RMS=`-16.00dBFS`，Peak=`-0.20dBFS`，20-1000Hz 合计约 `0.98785`，没有雨声、风声、雷声、水滴声、天气音效、音乐或音乐变暗。画面上，#954 入声到出声没有变暗，full mean luma 从 `66.290` 到 `67.195`；密帧 full-frame `diff_gt8` 最高约 `0.001148`，不支持雨线、水滴、湿痕或天气空间切换。#954 真正做的事，是把“将要下雨”作为语言门槛投进现场；词说天气，空间不下雨。

### #955｜阿蒙：有一双眼睛一直在看着我

```text
T0：#955
时间：01:28:52.900-01:28:54.766
说话人：阿蒙 / ACT-AMENG
台词：有一双眼睛一直在看着我
机制标签：借身 / 回返 / 观看显影 / 身体材料
```

#955 必须先从时间轴校正说起。前面 #954 的取证曾使用 `+3480s` 文件偏移，但这一偏移放到 #955 时会切到无关对白。用无偏移文件秒数复核后，`5310.066-5311.066` 对上 #954 `要下雨了`，`5324.000-5343.000` 又对上 #955/#956 的眼睛链。因此这一句的声画底盘改用无偏移时间轴：`01:28:52.900` 就是文件 `5332.900s`。这是方法上非常重要的一步，避免把完全不相干的声画材料拿来做精密分析。

这句接在 #954 后面，但不能让 #954 替它作气氛。#954 说 `要下雨了`，声画没有下雨。#955 说：

```text
有一双眼睛一直在看着我
```

这里和 #954 不一样。`雨` 几乎没有对应物证；`眼睛` 却有一个可见的基础：画面里确实有观众席，有人群，有公开观看关系。问题在于，画面给的是观看场，不是一双清楚眼睛。

#955 入声时，画面仍是同一低机位室内展演/观看空间。左侧是一排观众或参与者，隔着白色屏障和长水平反光面；右侧有白衣/浅色身体侧面、透明容器、水瓶和橙色反光。这个空间已经在看了。它不是空无一人的房间，也不是完全没有观看者的梦像。但它也没有突然切到眼部特写，没有给出独立眼睛物件，没有给出某一张脸稳定盯着阿蒙，也没有用推近、变焦、光线变化或硬切把 `眼睛` 兑现成视觉物。

密帧指标很能说明这一点。#955 精确窗内 full mean luma 从 `66.955` 到 `64.444`，只是小幅走低；full-frame `diff_gt8` 平均约 `0.002370`，最高约 `0.006921`；`scene>0.04` 没有硬切。左侧观众带、中心远处观众、右侧身体/容器区都有极小变化，但都不是眼睛显影、凝视主体切出或观看动作被画面放大。

所以这一句的画面不是：

```text
一双眼睛出现了。
```

而是：

```text
观看场一直在。
阿蒙把这个观看场命名成“一双眼睛”。
```

声音上，#955 也不是强声压爆点。#954 `要下雨了` 的 RMS 约 `-16.00dBFS`，#955 只有 `-26.33dBFS`，低约 `10.33dB`。但是它并没有消失。#955 入声前从 `01:28:31.066` 到 `01:28:52.900` 的长间隙 RMS 约 `-41.30dBFS`，#955 比这个长间隙高约 `14.97dB`。这说明眼睛句不是被配乐托起来的高潮，而是从很低的公共声床里被说出来。

频带集中在低频/低中频：

```text
20-250Hz = 0.52974
250-1000Hz = 0.35102
20-1000Hz 合计 = 0.88076
4-20kHz 合计 = 0.08963
```

这是一句人物声，不是眼睛声效。没有监控电子声，没有心跳，没有悬疑音乐进入，没有 `眼睛` 被做成一个可听物。#955 后到 #956 前的尾部有更强瞬态和高频回升，但那已经靠近 #956 `好像没有眼睛黑黑的`，不能倒写成 #955 的眼睛效果。

逐词看，#955 的结构很精确。

`有` 是存在判断。它不说“我好像觉得”，也不说“是不是有人”，而是直接把观看压力说成存在物：有。但电影没有把这个存在物交出来。`有` 的力量在这里不是证明，而是把压力硬压成可说对象。

`一双` 把分散观看缩成了二。画面左侧不是一双眼睛，而是一排人、一片观看带、远处脸部和身体朝向。`一双` 让公共观看变得像来自一个具体者，像有一个位置正在盯住她。它把群体观看私人化，也把空间压力器官化。

`眼睛` 是器官名。它比 `目光` 更硬，比 `有人` 更具体。可这一秒没有器官特写。眼睛只在声音里变成器官，在画面里仍然分散在观众、反光面、白色屏障和镜头位置之间。

`一直` 最关键。它说明这不是此刻突然出现的眼睛，而是已经持续了一段时间的观看。也正因为 `一直`，画面没有变化反而成立：电影不需要在这一秒制造一个新视觉事件，因为阿蒙说的是“早已在场的观看压力”。`一直` 把观看从瞬间事件改成持续状态。

`在看着` 是进行时。它让观看不是过去完成，也不是未来威胁，而是此刻正在发生。可是动作主体没有被交出。观看的动作由语法维持，观看的主体由空间分散。

最后的 `我` 把这一切收回阿蒙。左侧观众、右侧身体、反光面、镜头位置都能参与观看结构，但被观看的地址被这个 `我` 固定。它不是抽象讨论“观看”，而是阿蒙说：这个观看正在落到我身上。

MiMo 反读在这里帮忙守边界。带声音上下文报告和无声视觉报告都不支持清晰眼睛特写、独立眼睛物件、单一凝视主体、视觉运动强化或音乐/声效强化；但它们都承认观众/观看关系在场。也就是说，这不是“眼睛完全没有”，而是“一双眼睛没有作为清楚物证出现”。这正好压住了两个相反误读：既不能因为看不见眼睛就否认观看压力，也不能因为有观众就说已经看见一双眼睛。

这句和 [外置眼睛](/research/hs-bc12d753bd345450) 的关系也因此更清楚。外置眼睛不是一上来就以身体图案或蓝色眼形出现。它先以声音里的观看压力进入：有人被看，但看者不被交出；眼睛被说出，但眼睛不归还给某个脸。后面 `每一双眼睛都在看着我` 会把 `一双` 扩成公共全体，身体表面的眼形图案会把观看器官再转移到被观看者身上。#955 是这条链的起点之一：观看先从空气里被命名。

稳定读法：#955 `有一双眼睛一直在看着我` 不是眼睛特写显影，而是阿蒙把公开观看场压缩成一个持续凝视。画面支持观众席、屏障、反光面和展演空间构成的观看关系，但不支持清晰一双眼睛、独立眼睛物件、单一凝视主体或眼睛图案。声音上，它比 #954 弱约 `10.33dB`，但比前段长间隙高约 `14.97dB`，是低频/低中频人物声，不是眼睛声效、监控声、心跳、悬疑音乐或配乐进入。#955 真正做的事，是把“我正在被看”从空间事实和身体感受之间说出来；观看已经在场，眼睛仍不交出。

### #956｜阿蒙：好像没有眼睛黑黑的

```text
T0：#956
时间：01:28:59.900-01:29:02.400
说话人：阿蒙 / ACT-AMENG
台词：好像没有眼睛黑黑的
机制标签：借身 / 退出反证 / 观看显影 / 身体材料
```

#956 要贴着 #955 读。#955 刚刚说：

```text
有一双眼睛一直在看着我
```

#956 马上说：

```text
好像没有眼睛黑黑的
```

这两句不是简单重复，而是互相拆开。#955 的第一个词是 `有`，#956 的第一个词是 `好像`。#955 先把观看压力说成一个存在物，#956 立刻把这个存在物降回不确定。#955 说 `一双眼睛`，#956 说 `没有眼睛`。#955 说 `一直在看着我`，#956 只剩 `黑黑的`。也就是说，第一句把公开观看场压成器官，第二句又把这个器官撤掉，只留下一个暗暗的来源。

这句最危险的误读，是以为电影终于把“没有眼睛”的东西拍出来了。4K 本地复核不支持这一点。#956 入声时，画面仍是同一低机位公开装置：左侧观众/参与者一排坐着，白色半透明屏障或墙面在后方，中间是强反光地面/台面，右侧有白衣/浅色身体侧坐、透明容器、水瓶和暖橙反光。画面里确实有观看关系，也有暗部；但它没有交出空眼眶、黑洞、独立眼形物、黑色眼睛图案、吸入通道，或一张被镜头确认的无眼脸。

接触表和局部裁切把 `黑黑的` 的物理来源压得很清楚：观众席剪影，右侧人物脸部/头发的背光阴影，反光地面暗部，背景低照度，容器和画面边缘暗部。这些都能作为弱触发。尤其右侧脸部处在背光里，眼睛不可辨；无声视觉反读也能支持“眼部看不清”。但“眼部不可辨”和“没有眼睛被拍到”不是同一件事。前者是阴影、曝光和距离；后者需要电影把无眼结构交出来。#956 没有交出来。

密帧指标也在压低这个显影欲望。#956 精确窗共 60 帧，full mean luma 从最低 `63.688` 到最高 `65.705`，首尾只升约 `+1.096`。最大 full mean_absdiff=`1.0737`，最大 full ratio_gt8=`0.005585`，`scene>0.04` 无硬切。分区也一样：左侧观众带 max ratio_gt8=`0.010295`，中心屏障/墙面 `0.006225`，右侧身体/容器 `0.005663`，低处反光 `0.003307`，右侧暖橙区 `0.009574`。这些数字支持微小暗部噪声、反光、人物边缘和压缩变化，不支持一个无眼物被召出，也不支持画面突然朝黑洞或眼部通道打开。

声音层更值得细读，因为它把 #956 和 #955 的差异做出来了。#955 全句 RMS=`-26.33dBFS`，#956 全句 RMS=`-24.57dBFS`，#956 只高约 `1.76dB`。它不是一个巨大声压爆点，但确实从 #955 后的低位场里稍微浮起来。#956 入声前 `5334.766-5339.900` 的 pre-gap RMS=`-31.02dBFS`，#956 后 `5342.400-5350.000` 的短尾 RMS=`-38.38dBFS`，再到 #957 前的长尾 `5342.400-5383.333` RMS=`-37.42dBFS`。所以 #956 是一个短促的语言凸起，说完以后现场又掉回低位，将近 41 秒都没有让 `黑黑的` 直接变成吸入。

频谱上，#956 和 #955 更不一样。#955 20-1000Hz 合计约 `0.88076`，是低频/低中频人物声。#956 的高频占比明显上来：20-250Hz=`0.06054`，250-1000Hz=`0.11374`，1000-4000Hz=`0.25054`，4000-8000Hz=`0.16736`，8000-20000Hz=`0.40782`，4-20kHz 合计约 `0.57518`。这不是眼睛声效，也不是心跳、监控、恐怖低频或音乐主题。更稳的解释是：这句话里有更薄、更擦、更气的发声边缘，`黑黑的` 尾部留下了气声、擦音、口腔高频和环境底噪。声音把黑处说出来，但没有把黑处做成可听物。

这也解释了为什么 ASR 会出问题。MiMo ASR 对上下文给出的是：

```text
好像有一点黑黑的。
```

这个结果不能覆盖 T0。它反而暴露了 #956 的可听脆弱性：`黑黑的` 容易被抓到，`没有眼睛` 容易被吞掉、改写或听成程度词。如果只剩 `有一点黑黑的`，这一句只是黑色程度描述；但 T0 锁定的 `好像没有眼睛黑黑的`，真正强的地方恰恰在 `没有眼睛`。它不是单纯说黑，而是在反证上一句的 `有一双眼睛`。

MiMo CN 这次最有价值的不是“发现新物”，而是反诱导。带声音上下文、无声视觉和纯声音三路都不支持清晰眼睛特写、空眼眶、黑色眼形物、黑洞、吸入图像、眼睛声效、监控/电子声、心跳、恐怖低频或音乐性铺底。无声视觉唯一保留下来的正向候选，是右侧人物面部背光、眼睛不可辨。这个候选正好应该停在“阴影使眼部不可辨”，不能越界写成“没有眼睛被证实”。

逐词看，这句几乎是 #955 的拆解机器。

`好像` 是第一道撤回。它不像 #955 的 `有` 那样把观看压力硬压成存在物，而是把刚说出的存在物放回犹疑。这里的犹疑不是弱，而是一种方法：电影让语言自己承认它还没有拿到物证。

`没有` 是反证词。它不是在找眼睛，也不是在描述一个已经看清的器官，而是把刚刚成立的器官从句子里拿走。它撤销的不是画面，因为画面本来就没有给出清晰眼睛；它撤销的是 #955 语言刚刚造出的那双眼睛。

`眼睛` 第二次出现，功能已经变了。#955 的 `眼睛` 是观看压力的器官化，#956 的 `眼睛` 是器官化失败后的残名。第一次它像一个被命名的主体，第二次它变成一个找不到的部件。

`黑黑的` 是最后留下的材料。它不是 `空的`，不是 `坏的`，不是 `洞`，也不是 `眼眶`。它只给颜色、暗度和感觉。正因为它不够结构化，才危险：它会让观众想把阴影、剪影、反光暗部和眼部不可辨全部组装成一个无眼物。但 #956 的证据恰好要求我们不要替电影补完。

所以 #956 对 [外置眼睛](/research/hs-bc12d753bd345450) 的推进，是负形推进。#955 说“眼睛在看我”，外置眼睛像一个压力器官；#956 说“好像没有眼睛黑黑的”，外置眼睛又变成没有器官的压力来源。它既在看，又没有眼睛；既有凝视压力，又没有可归属主体；既依赖观众席、镜头位置、背光阴影和反光暗部，又不能落到任何一双可见眼睛上。

稳定读法：#956 `好像没有眼睛黑黑的` 不是无眼怪物显影，也不是空眼眶、黑洞、黑色眼形物或吸入通道出现。它是 #955 `有一双眼睛一直在看着我` 的立即撤回：公开观看场先被阿蒙命名为一双眼睛，随后又被她说成“好像没有眼睛”的黑处。画面只支持阴影、剪影、反光暗部和眼部不可辨的弱触发；声音上 #956 RMS=`-24.57dBFS`，比 #955 高约 `1.76dB`，4-20kHz 合计约 `0.57518`，更像气声/擦音/高频底噪抬起的人声边缘，不是眼睛声效、心跳、监控声、恐怖低频或音乐托举。#956 真正做的事，是把门口变黑，但还没有把人吸进去。

### #957｜阿蒙：我被眼睛给吸了进去

```text
T0：#957
时间：01:29:43.333-01:29:45.400
说话人：阿蒙 / ACT-AMENG
台词：我被眼睛给吸了进去
机制标签：借身 / 回返 / 观看显影 / 身体材料
```

#957 要从前两句连读：

```text
有一双眼睛一直在看着我
好像没有眼睛黑黑的
我被眼睛给吸了进去
```

三句像一个小型装置。#955 把公开观看场压成“一双眼睛”；#956 又把这双眼睛撤成“没有眼睛”的黑处；#957 则把这个刚刚失去器官的黑处重新说成有力量的入口。眼睛不只看，它现在还能吸。问题是，声画没有跟着把这个动作兑现。

本地 4K 画面复核很明确。#957 入声时，画面仍是同一个低机位公开装置：左侧远处观众/参与者排，中央大面积反光平面，右侧白衣/浅色身体侧坐，旁边有透明容器和暖橙反光。没有切到眼睛，没有眼睛图案、独立眼睛物件、空眼眶、黑洞、入口、通道或漩涡。也没有身体被拖动、坠入、缩小、穿过边界，没有镜头推进、变焦、硬切，或者切入另一个内部空间。

画面不是没有诱因。右侧人物侧脸处在暗部里，眼部不可辨；左侧观众席仍是一条模糊暗的观看带；下方反光面会让人想到“另一个空间”。但这些都只是弱触发。它们能让 `眼睛` 和 `进去` 变得可想，不能让它们成为可见事实。这里最重要的边界是：眼部不可辨不是眼睛显影，倒影像深处不是入口打开。

密帧指标也压住了“吸入显影”的欲望。#957 精确窗共 50 帧：

```text
full mean luma min = 64.467
full mean luma max = 68.020
last-first delta   = -3.393

max full mean_absdiff = 1.6409
max full ratio_gt8    = 0.006476
scene>0.04 无硬切
```

这一秒不是绝对冻结。它有轻微暗化，变化主要集中在右侧暖色脸部/身体区域：

```text
right_face_warm_edge max ratio_gt8 = 0.069071
right_body_container max ratio_gt8 = 0.030261
right_warm_orange max ratio_gt8    = 0.036140
left_audience_row max ratio_gt8    = 0.001544
lower_reflection max ratio_gt8     = 0.002368
```

所以可以写右侧暖色暗面、身体边缘、容器附近有轻微光变和边缘变化；不能写成吸入。因为变化没有形成方向性：观众席没有被吸动，中央空间没有开口，反光面没有吞没主体，身体没有离开原位，镜头也没有把我们带进某个里面。

声音层更细。#957 确实比 #955、#956 更凸出：

```text
#955 exact RMS = -26.33dBFS
#956 exact RMS = -24.57dBFS
#957 exact RMS = -21.04dBFS
```

它还从一个很低的前置声场里浮出：

```text
post956_to957 gap              RMS = -37.42dBFS
pre957 short 5375.000-5383.333 RMS = -40.37dBFS
#957 exact 5383.333-5385.400  RMS = -21.04dBFS
post957_to958 gap              RMS = -36.70dBFS
```

因此 #957 是一个清楚的人声入口。可是“人声入口”不是“吸入声效”。要判断 `吸` 有没有被电影声音物理化，至少要问三件事：声音有没有从人声里分离成独立声源；声音有没有方向、力度、声像或空间变化，能模拟吸力；声音有没有和画面同步给出进入、坠落或被拉走的转场标记。#957 三项都没有。

没有 whoosh，没有抽气声，没有风洞，没有反向混响，没有坠落低频，没有左右声像移动，没有心跳、监控电子声、恐怖音乐进入，也没有突然静默。声音确实让这句话变重，但变重的是人声，不是一个外部机器或空间在吸。

频谱也支持这个判断：

```text
20-250Hz     = 0.26762
250-1000Hz   = 0.44810
1000-4000Hz  = 0.00467
4000-8000Hz  = 0.15883
8000-20000Hz = 0.12077

20-1000Hz 合计 = 0.71572
4-20kHz 合计   = 0.27960
```

#956 的 4-20kHz 合计约 `0.57518`，更薄、更擦、更像 `黑黑的` 尾部的气声和高频底噪。#957 则回到低频/低中频主导，20-1000Hz 合计约 `0.71572`。它听起来更沉、更稳、更像一句已经发生的陈述。声音把 `吸进去` 说稳了，但没有把吸做成音效。

这里要把声音理论再分细一点。`吸` 这个字本身会有语音性的吸感。人说出 `吸` 时，口腔气流和清擦音会带出一点吸、擦、虚的质地。MiMo 的纯声音反读也抓到这一点：吸感主要来自发音、气声和节奏。但这只是语音性吸感，不是声效性吸入。

可以固定成三层：

```text
语音性吸感：词语自身的发音、气流、停顿、口腔摩擦让“吸”听起来像吸。
声效性吸入：电影另加一个非人声或加工声，模拟物理吸力、空间位移或身体坠入。
音乐性吸入：配乐/低频/和声/节奏进入，把吸入变成情绪或结构转场。
```

#957 有第一种，没有第二种和第三种。它让 `吸` 留在嘴里，不让 `吸` 离开人声变成一个外部声音事件。

逐词看，这句的语法也非常硬。

`我` 接回 #955 的 `看着我`。观看压力不是抽象关系，而是落到一个受力点上。这个 `我` 不是行动者，是被处理的材料。

`被` 把句子改成被动态。不是“我走进去”，不是“我看进去”，而是我被某个外部力量吸进去。主动权从主体身上撤走。

`眼睛` 在 #956 刚被否定后重新出现。这个反复很关键：眼睛越没有可见器官，越像一个不可归属的力场。它没有脸，却能看；没有形状，却能吸。

`给` 是口语被动里的加强。它让这件事听起来不只是抽象被动，而像一个已经遭遇的、身体被外部处理过的事实。

`吸` 把观看从光学动作改成力学动作。眼睛不再只是看见我，而是把我拉向它。可这正是声画拒绝兑现的地方：画面没有拉，声音没有吸。力学只在词里成立。

`了` 把动作说成完成。可画面结果没有出现，于是 `了` 变成语言上的完成，声画上的未完成。

`进去` 给出内外边界，暗示有一个里面、一个外面和一个入口。但电影不交这个边界。反光面像里面，右侧暗面像里面，观众席像压力来源；可它们都没有被确认成入口。

MiMo CN 三路反读的价值在这里不是发现新物，而是守边界。有声上下文、静音画面和纯声音黑色视频包装都不支持清晰眼睛特写、入口、黑洞、吸入图像、身体位移、镜头运动、吸入声效、音乐进入或声场换挡。它们能保留的只有右侧侧脸阴影、眼部不可辨、观众观看带、反光深处和台词人声凸起。MiMo 对声音性别判断前后不一致，不能采用；但它对“无独立吸入声效”的判断与 T1 指标一致。

所以 #957 和 #958/#959 的边界也要守住。#957 后很快是：

```text
我一直 我一直在
飞呀
飞呀飞呀
```

不能因为后面说 `飞呀`，就把 #957 写成已经完成飞入。#957 当前只完成一件事：把观看压力说成吸入。#958 才把主体状态拉长，#959/#960 才把语言推向飞行。每一步都还需要重新查声画，不能倒填。

稳定读法：#957 `我被眼睛给吸了进去` 不是眼睛、黑洞、入口、通道、身体位移或吸入声效的显影。它是 #955/#956 眼睛链的第三次变形：公开观看场先被说成一双眼睛，又被撤成没有眼睛的黑处，最后被说成能把 `我` 吸进去的外部力场。画面保留观众席、侧脸阴影和反光深处，但不交出入口；声音让台词从低位里浮出，RMS=`-21.04dBFS`，比 #956 高约 `3.53dB`，但不交出 whoosh、抽气、风洞、低频推进、声像移动、恐怖音乐或突然静默。吸入被说出，吸入不被兑现。这句真正冷的地方，是眼睛仍看不见，却已经能在语言里把人卷进去。

### #958｜阿蒙：我一直 我一直在

```text
T0：#958
时间：01:29:46.866-01:29:48.433
说话人：阿蒙 / ACT-AMENG
台词：我一直 我一直在
机制标签：借身 / 回返 / 观看显影 / 身体材料
```

#958 是 #957 的后果句，但它不给后果画面。前一句说：

```text
我被眼睛给吸了进去
```

按普通叙事，下一步应该回答“进去哪里”。可是 #958 不回答地点，只重复：

```text
我一直 我一直在
```

这句话看似在确认存在，实际上把位置留空了。`在` 需要一个所在之处，但句子没有说；画面也没有替它说。于是 #958 的工作，不是交代吸入后的空间，而是把“进入之后应该出现的结果”压回一句卡住的人声里。

本地 4K 复核显示，#958 入声时画面仍是同一低机位公开装置：左侧观众/参与者形成模糊观看带，中间是反光平面，右侧是白衣/浅色身体、侧脸暗轮廓、透明容器和暖橙反光。没有硬切，没有镜头推进，没有入口后空间，没有内部空间，也没有任何身体被拖动、坠入、飞起或离地。反光面仍像一个可能的深处，但它没有打开；右侧脸部仍是暗处侧脸，眼部不可辨；左侧观众仍是暗的观看带。

所以 #958 的画面只能支持：

```text
同一公开空间持续存在。
同一观看带持续存在。
同一身体/容器/反光结构持续存在。
```

不能支持：

```text
进入后空间出现。
内部空间、洞口、黑洞、通道出现。
身体被移入、拖入、坠入或飞起。
镜头推进、硬切或空间断裂。
观众席明确反应。
眼睛或无眼物进一步显影。
```

密帧指标也说明这是一个低差分持续场。#958 精确窗共 38 帧：

```text
full mean luma min = 64.262
full mean luma max = 67.817
first mean luma    = 66.196
last mean luma     = 64.648
last-first delta   = -1.548

max full mean_absdiff = 1.0858
max full ratio_gt8    = 0.004863
scene>0.04 无硬切
```

区域变化也很低：

```text
right_body_container max ratio_gt8 = 0.008760
lower_reflection max ratio_gt8     = 0.006222
right_warm_orange max ratio_gt8    = 0.005130
right_face_warm_edge max ratio_gt8 = 0.005018
left_audience_row max ratio_gt8    = 0.004030
```

这比 #957 更不具备事件形态。#957 至少还有右侧暖色脸部/身体区域更明显的局部变化；#958 的变化更低、更均匀，更像同一场景继续承压。可以写轻微暗化、暖色退下、反光和身体边缘微动；不能写成抵达、进入、升空或空间换挡。

声音层更有意思。#958 全句 `1.567s`：

```text
RMS      = -22.09dBFS
Peak     = -5.33dBFS

20-250Hz     = 0.23754
250-1000Hz   = 0.68964
1000-4000Hz  = 0.01584
4000-8000Hz  = 0.01296
8000-20000Hz = 0.04402

20-1000Hz 合计 = 0.92718
4-20kHz 合计   = 0.05698
```

它比 #957 低约 `1.05dB`：

```text
#957 exact RMS = -21.04dBFS
#958 exact RMS = -22.09dBFS
```

但它比 #957 后到 #958 前的低位间隔高很多：

```text
post957_to958 gap RMS = -36.70dBFS
#958 exact RMS        = -22.09dBFS
```

因此 #958 不是 #957 的残响，也不是低位尾声。它是一个新的入声。只是这个新入声仍完全在人声里完成：没有飞行音效，没有升空音型，没有低频推进，没有心跳、监控电子声、空间混响突变、左右声像移动、突然静默或音乐转场。20-1000Hz 合计约 `0.92718`，它比 #957 更集中在低频/低中频人物声道里。

最重要的是重复结构。把 #958 粗分成三段：

```text
first_wo_yizhi_approx_0.00-0.55s   RMS = -18.69dBFS
middle_low_interval_0.55-1.02s      RMS = -37.50dBFS
second_wo_yizhi_zai_1.02-1.567s     RMS = -24.05dBFS
```

第一段 `我一直` 很强，像一句没补完的话。中间约 `0.47s` 掉回低位。第二段 `我一直在` 再起来，但比第一段弱约 `5.36dB`。这个结构不能写成音乐节拍，也不能写成机械重复；它更像口语里的自我定位卡顿：先说 `我一直`，停住，再补上 `我一直在`。

MiMo 在这个点上给出一个值得保留的分歧。有声上下文报告听到两个声学凸起和短停顿；声音黑色视频报告则认为停顿不明显，更像一口气连贯语流。这里以 T1 波形为主：能量上确实有一个明显低位间隔。但听感上，它可能因为语流连续而被感到一口气。这正好让 #958 更细：它不是断成两句，也不是平滑一句，而是在连贯语流里有一次能量塌落。

逐词看，#958 的每个词都在补 #957 的空白。

第一个 `我` 接住 #957 的受力点。刚刚那个被眼睛吸进去的 `我` 没有从声场里消失，而是重新发声。但重新发声不等于重新掌控，它更像在确认自己还没被画面交代。

第一个 `一直` 把时间拉长。它不是“刚刚在”，也不是“现在在”，而是持续在。这个词会反过来改写 #957：所谓“吸进去”未必是刚发生的一次动作，也可能是主体发现自己早已处在某种被吸入的状态里。

第二个 `我` 是回返。第一次 `我一直` 没有完成，第二次重新起句。这个重复不是修辞，而是卡住了的自我确认：主体需要再说一次自己。

第二个 `一直` 把持续状态加重。它和 #955 的 `一直在看着我` 形成回声。#955 是外部观看一直在，#958 是主体自己一直在。外部一直看，我也一直在；观看压力和主体存在被压在同一个持续词里。

最后的 `在` 是全句最危险的空位。`在` 需要位置，但没有位置名。画面也没有给新位置。于是 `在` 不是抵达证明，而是一个空的定位词：她在，但在哪里不被交出。

#958 和 #959 的边界必须守住：

```text
#958 01:29:46.866-01:29:48.433  我一直 我一直在
#959 01:29:48.433-01:29:49.200  飞呀
#960 01:29:49.733-01:29:50.833  飞呀飞呀
```

#958 出声结束点和 #959 入声点紧贴，这很容易让人把 `飞呀` 倒回去解释 `我一直在`。但当前声画不支持这么做。#958 没有飞行声效，没有升空音型，没有身体位移；#959 才正式说 `飞呀`。所以连续关系应该写成：

```text
#957：观看压力被说成吸入。
#958：主体把吸入之后的状态说成持续在场。
#959/#960：语言再把状态推向飞行。
```

MiMo CN 三路反读也帮助压住这个边界。静音视觉报告给出：视觉“进入后空间”支持度 `0/5`，视觉“持续在场”支持度 `1/5`，视觉“飞行已发生”支持度 `0/5`。这个 `1/5` 只能说明同一身体和同一空间在画面中持续存在，不能说明新空间出现。带声音上下文和声音黑色视频报告都不支持飞行/升空音效、心跳、监控声、空间混响突变、声像移动或音乐转场。

稳定读法：#958 `我一直 我一直在` 不是阿蒙已经抵达某个内部空间，也不是飞行已经发生。它是 #957 吸入句之后的自我定位重复。画面仍锁在同一公开观看场，声音把重复句做成前强、低落、后弱的低频/低中频人声结构。#958 真正做的事，是把 `进去` 后本该出现的空间结果悬置起来，只剩一句重复的在场声明。她没有告诉我们她在哪里；电影也不告诉我们。她只是说：我一直，我一直在。

### #959｜阿蒙：飞呀

```text
T0：#959
时间：01:29:48.433-01:29:49.200
说话人：阿蒙 / ACT-AMENG
台词：飞呀
机制标签：借身;身体材料 / 借身显影
```

#959 是一记很短的转向。#958 刚说完：

```text
我一直 我一直在
```

这句话把吸入之后的状态压成持续在场，但没有说出位置。#959 立刻接上：

```text
飞呀
```

这两个字把问题从“在哪里”改成“怎么动”。可是电影没有让这个动作变成画面事实。它只让“飞”先进入语言。

T0 台词账给 #959 的机制标签是 `借身;身体材料 / 借身显影`。这个标签很重要，但不能读快。`借身显影` 不是“身体已经飞起来”，而是飞行这个词需要先借一具身体、一个人声、一个右侧近处暖色身体/反光场来被说出。显影的是“飞行词如何借身体材料出现”，不是飞行事实本身。

本地 4K 复核显示，#959 入声时画面仍是同一低机位公开观看场：左侧观众/参与者仍是一条模糊观看带，中间反光平面仍横在画面下部，远处人物和倒影还在，右侧白衣身体、透明容器、红褐杯状物和暖色前景仍占据画面右侧。没有硬切，没有镜头推进，没有空间换挡，没有新入口或内部空间，也没有身体离地、上升、漂浮、飞起或位移轨迹。

换句话说，#959 说 `飞`，但画面没有给 `飞` 需要的空间和力学条件。它不给天空，不给上升方向，不给支撑断开，不给观众追随，不给镜头跟随，也不给一个从这里到那里的路线。

不过 #959 不是视觉上完全无事。它的变化集中在右侧暖色前景和反光。密帧指标显示，#959 精确窗共 19 帧：

```text
full mean luma first = 64.427
full mean luma last  = 66.667
delta                = +2.240

full warm ratio first = 0.000001
full warm ratio last  = 0.048601
warm delta            = +0.048600

max full ratio_gt8 = 0.005176
scene>0.04 无硬切
```

最明显的是右侧：

```text
right_foreground_warm_edge luma delta = +8.551
right_foreground_warm_edge warm delta = +0.341696

right_body_container luma delta       = +4.531
right_body_container warm delta       = +0.139529

right_lower_warm_reflection luma delta = +5.173
right_lower_warm_reflection warm delta = +0.146309
```

左侧观看带和中心墙面几乎不动：

```text
left_audience_row luma delta  = +0.458
center_screen_wall luma delta = +0.229
```

所以 #959 的画面不是“整体场面飞起来”，而是右侧热区压进来。右上方暖色前景、右侧身体/容器区域和下方暖色倒影增强，像是“飞呀”这个词没有打开空间，反而被近处身体材料和反光压住了。电影没有把飞行交给远方，而是交给右侧近前景的热、肉身边缘和反光。

声音也不支持升空。#959 全句只有 `0.767s`：

```text
RMS      = -29.12dBFS
Peak     = -14.81dBFS

20-250Hz     = 0.18709
250-1000Hz   = 0.77285
1000-4000Hz  = 0.01731
4000-8000Hz  = 0.00424
8000-20000Hz = 0.01850

20-1000Hz 合计 = 0.95994
4-20kHz 合计   = 0.02274
```

它比两边都弱：

```text
#958 exact RMS = -22.09dBFS
#959 exact RMS = -29.12dBFS
#960 exact RMS = -23.30dBFS
```

#959 比 #958 低约 `7.03dB`，比 #960 低约 `5.82dB`。所以它不是一个声压高潮。它更像一声短促的试探，或者一个还没有被系统放大的起飞词。频带上 20-1000Hz 合计约 `0.95994`，说明这句几乎完全在人声低频/低中频里完成；没有独立飞行音效、升空音型、风声、低频推进、心跳、监控电子声、空间混响突变、声像移动、突然静默或音乐转场。

句内还可以再拆细：

```text
attack_fei_approx_0.00-0.24s = -27.71dBFS
sustain_ya_approx_0.24-0.60s = -28.56dBFS
tail_0.60-0.767s             = -37.25dBFS

first_half  = -26.66dBFS
second_half = -35.34dBFS
```

前半推出，后半退低。`飞` 和 `呀` 并没有形成向上膨胀的声音。相反，尾部迅速掉回低位。#959 到 #960 前有 `0.533s` 间隔：

```text
gap RMS  = -36.89dBFS
gap Peak = -24.74dBFS
```

这个间隔不是突然静默，也不是飞行声效切断。它更像普通房间底噪。也就是说，#959 说完“飞呀”以后，声音没有被托上去，而是退回房间。#960 才再以更高能量回来，重复成 `飞呀飞呀`。

逐词看，#959 的 `飞` 是一个动词，也是一个命令式/推动式的方向词。它继承 #945 `好像要飞起来` 的未完成飞行线索，但不同之处在于：#945 还有 `好像` 和 `要`，把飞行放在不确定的未来；#959 去掉这些缓冲，直接说 `飞`。语言层级上，它确实更硬、更近、更像执行口令。

但后面的 `呀` 又把它软化。`飞呀` 不是 `飞`，也不是 `飞起来`，更不是 `飞了`。`呀` 让它像呼唤、催促、自我推动，甚至像对某个身体材料说话。它不是结果句，而是推动句。它不是“已经飞”，而是“飞吧 / 飞呀”。所以 #959 本身仍在门槛上。

这里最危险的误读，是把台词里的动词直接当作画面里的动作。这个误读在本片里反复出现：说风，不等于出风；说轻，不等于轻化；说飞起来，不等于身体起飞；说硬币开花，不等于物件开花；说跑，不等于画面跑动。#959 也一样。`飞呀` 是飞行词，不是飞行物证。

MiMo CN 三路反读也帮助压住这个边界。静音视觉报告给出：

```text
视觉飞行已发生：0/5
身体已经离地：0/5
新空间出现：0/5
同一公开观看场继续存在：5/5
右侧暖色前景增强：2/5
```

声音黑色视频上下文报告给出：

```text
飞行声效：0
音乐主题：0
空间混响换挡：0
声像移动：1
#959 是纯人声：5
#959 与 #960 之间有低位间隔：5
```

需要降级的是：MiMo 有声上下文报告在 #958/#959 的编号表述上混乱，不能拿来改写 T0；它对右侧暖色增强的感知也偏弱，T1 指标显示右侧暖色确实明显增强。可是这个分歧反而让判断更稳：暖色增强成立，但它不是飞行。

所以 #959 应该这样读：

```text
#958：我仍在，但没有所在之处。
#959：我说飞，但没有飞行空间。
#960：飞行词再重复，才成为下一步的声画问题。
```

稳定判断：#959 `飞呀` 不是阿蒙已经飞起来，也不是声画系统开始物理化飞行。它是飞行第一次从持续在场里冒出来的语言动作。画面仍锁在公开观看场里，声音仍是低频/低中频人声，右侧暖色前景增强却不打开空间。电影让飞行词出现，但不让飞行发生。这个“不发生”不是空白，而是一种更细的限制：飞行被借身体说出，又被身体材料压回原地。

### #960｜阿蒙：飞呀飞呀

```text
T0：#960
时间：01:29:49.733-01:29:50.833
说话人：阿蒙 / ACT-AMENG
台词：飞呀飞呀
机制标签：借身;身体材料 / 借身显影
```

#960 是 #959 的重复，也是 #959 的放大。

```text
#959：飞呀
#960：飞呀飞呀
```

这看起来像一个很直白的推进：上一句刚说 `飞呀`，这一句就说 `飞呀飞呀`。但本片最不能直接相信的，恰恰就是这种动词推进。它说风，不一定出风；说轻，不一定轻化；说跑，不一定跑动；说飞，也不一定飞起来。

#960 真正做的事，是把飞行词从一次变成两次。它让语言更用力，但没有让空间更打开。

先看声音。#959 到 #960 之间有 `0.533s` 间隔：

```text
#959_to_#960_gap
duration = 0.533s
RMS      = -36.89dBFS
Peak     = -24.74dBFS
```

这不是突然静默，也不是飞行声效切入。它更像低位房间底噪。#959 的 `飞呀` 没有被一条升空音型接住，而是先掉回房间。

然后 #960 入声。全句 `1.100s`：

```text
RMS  = -23.30dBFS
Peak = -8.18dBFS

20-250Hz     = 0.48730
250-1000Hz   = 0.49491
1000-4000Hz  = 0.00653
4000-8000Hz  = 0.00296
8000-20000Hz = 0.00829

20-1000Hz 合计 = 0.98221
4-20kHz 合计   = 0.01126
```

#960 比 #959 明显更强：

```text
#959 exact RMS = -29.12dBFS
#960 exact RMS = -23.30dBFS
差值           = +5.82dB
```

所以不能说 #960 只是 #959 的同等重复。它确实把飞行词放大了一次。可是这个放大几乎完全发生在低频/低中频人声里。20-1000Hz 合计约 `0.98221`，4kHz 以上只剩约 `0.01126`。没有飞行声效，没有 whoosh，没有风声，没有低频推进，没有升空音型，没有音乐主题，也没有声像移动或混响换挡。

更细地看，#960 的波形分成两个声音团：

```text
第一团：0.04-0.39s
RMS  = -19.48dBFS
Peak = -8.18dBFS

第二团：0.53-0.88s
RMS  = -25.01dBFS
Peak = -13.76dBFS
```

这个分段很重要。`飞呀飞呀` 不是越喊越强，而是第一声推出，第二声回落。它不是一个上升阶梯，而是一次强推后的衰减。听感上是重复，结构上却不是升空。

MiMo 声音黑色视频报告把两次 `飞呀` 听成“基本一致”，这个判断要降级。T1 波形和 rolling RMS 更精确，第一团比第二团强很多。MiMo 可以保留“纯人声重复、无飞行声效、无音乐托举、无混响换挡、无声像移动、无蝴蝶/翅膀声”的方向，但不能覆盖本地强弱分段。

再看画面。#960 精确窗 27 帧，仍是同一低机位公开观看场。左侧观众/参与者仍是一条暗色观看带，中间反光平面仍在，右侧白衣身体、透明容器、暖色前景和下方倒影仍然是这一段的主要视觉材料。

没有硬切：

```text
scene>0.04 = 0 lines
```

没有镜头推进，没有空间换挡，没有入口、通道、天空、户外或飞走路线。右侧身体没有离地、漂浮、上升、飞起，也没有支撑断开或清楚位移。#960 到 #961 前也没有蝴蝶、昆虫、翅膀或飞行动物。

密帧指标反而显示：#960 的画面没有跟着声音扩张。

```text
full luma first = 66.262
full luma last  = 65.152
delta           = -1.111

full warm first = 0.018104
full warm last  = 0.003676
warm delta      = -0.014428

max full ratio_gt8 = 0.002540
```

#959 的右侧暖色是增强的；#960 变成回落：

```text
right_foreground_warm_edge luma delta = -3.933
right_foreground_warm_edge warm delta = -0.066125

right_body_container luma delta       = -1.486
right_body_container warm delta       = -0.043054

right_lower_warm_reflection luma delta = -3.534
right_lower_warm_reflection warm delta = -0.048900
```

这形成了一个很漂亮但也很冷的反差：声音在重复飞行词，右侧暖色却退下去。#959 是“飞行词刚出现，右侧热区压进来”；#960 是“飞行词被重复放大，右侧热区开始回落”。电影没有把重复变成向上，而是让重复和退光同时发生。

这意味着 #960 不能写成飞行完成。它只能写成飞行词在人声中放大，身体/空间/光却没有配合。

#960 到 #961 前还有 `1.500s` 间隔：

```text
#960_to_#961_gap
duration = 1.500s
RMS      = -37.88dBFS
Peak     = -25.56dBFS
```

这个间隔也不是突然静默，不是音乐转场，不是翅膀声或昆虫拟音。它只是低位房间底噪。#961 会说：

```text
突然看见一只特别漂亮的蝴蝶
```

但 #960 里还没有蝴蝶。#961 的 `蝴蝶` 不能提前拿来证明 #960 的飞行，也不能倒写成 #960 画面已经出现飞行动物。

MiMo CN 三路反读在这个边界上很稳定。带声音上下文报告说：镜头固定，右侧白衣/身体保持同一场域内，没有离地、上升、新空间、入口、通道、蝴蝶或飞行动物；声音没有 whoosh、气流、音高上升、多普勒、混响突变或配乐。静音视觉报告给出：

```text
视觉飞行：0/5
身体离地：0/5
新空间：0/5
蝴蝶已显影：0/5
同一公开观看场持续：5/5
右侧暖色/反光局部变化：3/5
```

声音黑色视频报告给出：

```text
纯人声重复：5/5
飞行声效：0/5
音乐托举：0/5
空间混响换挡：0/5
声像移动：0/5
蝴蝶/翅膀声：0/5
```

所以 #960 的稳定读法是：

```text
#959：飞行第一次被语言说出。
#960：飞行词被重复放大。
#961：蝴蝶才被语言说出。
```

三步都不能压缩成“已经飞了”。#960 的精细之处，是它让飞行词变响，但不让身体升起；让重复听起来更有力，但不让空间打开；让下一句蝴蝶快要到来，但仍然不让蝴蝶提前出现。它不是飞行完成，而是飞行被困在人声重复里。

### #961｜阿蒙：突然看见一只特别漂亮的蝴蝶

```text
T0：#961
时间：01:29:52.333-01:29:55.200
说话人：阿蒙 / ACT-AMENG
台词：突然看见一只特别漂亮的蝴蝶
机制标签：借身;观看显影 / 借身显影
```

#961 是这一小串飞行句里最容易诱导误读的一句。

前面两句刚刚说：

```text
#959：飞呀
#960：飞呀飞呀
```

然后 #961 立刻说：

```text
突然看见一只特别漂亮的蝴蝶
```

如果只按语义顺着读，几乎会自然补出一条完整小叙事：飞起来，然后看见蝴蝶。可是这正是本片在这一段反复设置的陷阱。它说风，不等于出风；说轻，不等于轻化；说飞，不等于飞起；现在说蝴蝶，也不等于画面里有蝴蝶。

#961 的变化在语言层是明确的：飞行从动词变成了观看对象。#959/#960 还在推动身体，#961 则说自己看见了一个东西，而且这个东西不是普通东西，是 `特别漂亮的蝴蝶`。它有对象名，有审美修饰，也有 `突然看见` 这个观看事件。

但 4K 声画没有跟着把这个对象交出来。

先看 #960 到 #961 前的间隔。#960 结束后到 #961 入声前有 `1.500s`：

```text
RMS  = -37.88dBFS
Peak = -25.56dBFS
```

这个间隔已经在 #960 复核里出现过。它不是突然静默，不是翅膀声，不是昆虫拟音，不是飞行声效，也不是音乐转场。飞行词说完以后，现场没有响起“飞行动物即将出现”的声音标记，只是低位房间底噪。

#961 全句 `2.867s`：

```text
RMS  = -24.58dBFS
Peak = -7.64dBFS

20-250Hz     = 0.50856
250-1000Hz   = 0.44451
20-1000Hz 合计 = 0.95307
4-20kHz 合计   = 0.02348
谱心约          = 662.1Hz
```

这仍是低频/低中频人声。它没有飞虫类高频扑动，没有 whoosh，没有音乐主题，没有空间混响突变，也没有声像移动。#961 甚至比 #960 略弱：

```text
#960 exact RMS = -23.30dBFS
#961 exact RMS = -24.58dBFS
差值           = -1.27dB
```

这说明 `蝴蝶` 并不是在 #960 的声能上继续升空。相反，#961 把声音从重复口令降回讲述句。

更细地看，#961 内部不是越接近蝴蝶越亮，而是一路退低：

```text
first_half  = -21.78dBFS
second_half = -34.82dBFS

first_third  = -20.41dBFS
middle_third = -29.30dBFS
last_third   = -37.29dBFS
```

按语义粗分，最强的是 `突然/看见`，不是 `蝴蝶`：

```text
突然              ≈ -19.95dBFS
看见一只          ≈ -22.70dBFS
特别漂亮的        ≈ -32.21dBFS
蝴蝶尾部候选      ≈ -38.13dBFS
```

这个分段很有意思。它让 `突然看见` 先被推到前景，然后让 `特别漂亮的蝴蝶` 自己落到低处。也就是说，声音强化的是“我看见了”这个观看动作，不是“蝴蝶”这个对象。蝴蝶被说出，但对象名不成为声音高潮。

50ms rolling clusters 也支持这一点：

```text
cluster 1: 0.05-0.97s, max RMS=-15.51dBFS
cluster 2: 1.01-1.30s, max RMS=-23.39dBFS
cluster 3: 1.32-1.69s, max RMS=-25.99dBFS
cluster 4: 1.87-1.96s, max RMS=-32.78dBFS
```

声音不是从 `飞呀飞呀` 上升到蝴蝶，而是从强入声逐级退低。#961 的“突然”更像语法突然，不是声画突然。

再看画面。#961 精确窗共 69 帧，仍是同一低机位公开观看场。左侧观众/参与者带、中间墙面和反光平面、远处人影、右侧白衣身体/白色材料、透明容器、暖色边缘和下方倒影都还在。

没有硬切：

```text
exact scene>0.04 = 0 lines
```

#961 到 #962 前的长尾也没有硬切：

```text
961 to #962 scene>0.04 = 0 lines
```

没有镜头推进，没有空间换挡，没有新空间、花园、天空、户外或飞走路线。没有蝴蝶、昆虫、翅膀、小型快速飞行物或飞行动物。右侧白衣/白色材料附近有轻微局部动作候选，暖色边缘也有小幅变化：

```text
full luma delta = +0.434
full warm delta = +0.000951
max full ratio_gt8 = 0.005386

right_body_container warm delta = +0.000521
right_foreground_warm_edge warm delta = +0.005974
```

这些变化只能写成身体/白色材料/反光/暖光的局部微动，不能写成蝴蝶。它们没有独立小物体轮廓，没有连续飞行轨迹，也没有翅膀形体。

#961 结束后到 #962 前还有 `10.366s` 长尾：

```text
RMS  = -41.23dBFS
Peak = -22.23dBFS
```

这个长尾没有绝对静音，`silencedetect -45dB:d=0.3` 没有报 silence event；但它很低。更重要的是，它没有补给蝴蝶：没有翅膀声、虫鸣、whoosh、飞行声效、音乐托举、空间混响突变、观众反应或镜头转向。蝴蝶说完以后，现场不回应。

MiMo CN 四路反读在这点上很稳。静音视觉报告给出：

```text
蝴蝶可见：0/5
昆虫可见：0/5
翅膀形态：0/5
小型快速飞行物：0/5
身体离地：0/5
视觉飞行：0/5
空间换挡：0/5
硬切：0/5
同一公开观看场持续：5/5
```

声音黑色视频报告给出：

```text
翅膀声：0/5
虫鸣：0/5
飞行声效：0/5
whoosh：0/5
音乐主题：0/5
空间混响换挡：0/5
声像移动：0/5
```

长尾报告也确认：#961 结束后到 #962 前没有蝴蝶、飞行物、翅膀声、虫鸣、音乐托举、空间换挡、观众反应或新的观看对象。

需要降级的是，MiMo 把可见身体身份和擦拭动作说得偏确定。T1 密帧只支持右侧白衣/白色材料有轻微局部动作候选，不支持身份、动作目的或心理状态。声音性别也不采用，T0 说话人仍以台词账为准。

所以 #961 的稳定读法是：

```text
#960：飞行词被重复放大，但不升空。
#961：蝴蝶作为观看对象被说出，但不显影。
#962：语言换手到午后车站，蝴蝶被越过。
```

这一句不是飞行完成后的美丽发现，而是飞行失败后的观看报告。它让“看见蝴蝶”进入语言，却不让蝴蝶进入画面和声音。蝴蝶在这里不是物证，而是一个被借身说出的观看对象：语言说“我看见”，电影回答“你仍然只看见这个现场”。

### #962｜子丑：在午后车站

```text
T0：#962
时间：01:30:05.566-01:30:07.300
说话人：子丑 / ACT-ZICHOU
台词：在午后车站
机制标签：未标记 / 未标记/语气残片
```

#962 很短，只有五个字，但它在结构上很重要。

前一句 #961 说的是：

```text
突然看见一只特别漂亮的蝴蝶
```

那只蝴蝶没有被画面交出来。#961 结束后，现场经过 `10.366s` 的低位长尾，声音没有翅膀声、虫鸣、飞行声效、音乐托举或观众反应，画面也没有转向任何看见蝴蝶的地方。然后 #962 不是继续讲蝴蝶，而是直接换成：

```text
在午后车站
```

这是一种很轻的越过。语言不解释蝴蝶，也不证明蝴蝶，只是把梦像接力推到另一个场所名上。飞行/蝴蝶的链条被放下，新的链条开始搭起来。

从语法看，#962 不是完整事件句。它只是一个地点/时间片段：`在` 打开位置，`午后` 给出时间和光感，`车站` 给出公共交通空间。这个片段还缺少事件主体和动作。到 #963/#964，句子才会继续往下接：

```text
#962：在午后车站
#963：分别的一对情侣的包里
#964：掉出了一颗桃子
```

也就是说，#962 是这条链的地点开口，不是整个事件本身。它提供一个场景框架，但还没有交出包、情侣、桃子或掉落动作。

声音上，#962 仍然是人声短句，不是车站声景。

```text
duration = 1.734s
RMS      = -25.14dBFS
Peak     = -8.23dBFS

20-1000Hz = 0.99196
4-20kHz   = 0.00400
谱心约    = 405.5Hz
```

这个频带非常集中在 20-1000Hz，人声低频/低中频占绝对主导。没有列车声、轨道声、广播、站内混响、交通环境、人群候车声、户外午后声景、风声、鸟声或音乐转场。`午后车站` 是被说出来的地点，不是被听见的空间。

句内粗分也很能说明问题：

```text
在        ≈ -21.89dBFS
午后      ≈ -25.13dBFS
车站      ≈ -27.90dBFS
```

最强的是句首 `在`。位置关系被打开时最重，地点名 `车站` 反而更弱。它不是声音高潮，不是空间爆开点，也不是被声效托出来的地点。

50ms rolling clusters 显示 #962 有几个短声音团：

```text
0.04-0.42s  max RMS=-18.35dBFS
0.46-0.84s  max RMS=-19.05dBFS
1.15-1.34s  max RMS=-24.62dBFS
1.32-1.64s  max RMS=-20.74dBFS
```

这些声音团仍在近场人声内部。它们让句子被清楚说出，但没有把我们带到一个新空间。

#962 前后也没有真正的声场断裂。#961 到 #962 前长尾：

```text
duration = 10.366s
RMS      = -41.23dBFS
Peak     = -22.23dBFS
```

#962 到 #963 前短间隙：

```text
duration = 1.100s
RMS      = -42.74dBFS
Peak     = -19.15dBFS
```

`silencedetect -45dB:d=0.3` 没有报 silence event。MiMo 声音黑色视频把它听成“静默/干音”，这个词要降级。更准确地说，前后都是低位 room tone / 空场声床。它很安静，但不是绝对无声；它也不是车站空气、站内混响、交通噪声或包/桃子的物声。

画面更坚决。#962 精确窗 42 帧，仍是同一低机位公开观看场：左侧观众/人群带，中央浅色墙面和反光地面，右侧白色身体/白色材料、透明容器和暖色边缘都持续存在。

本轮把 scene-detect 跑在抽出的 720p 相对时间小片段上，避免 4K 母文件底层时间戳干扰：

```text
962 exact 720p scene>0.04   = 0 internal hits
962 tight 720p scene>0.04   = 0 internal hits
962 context 720p scene>0.04 = 0 internal hits
```

没有硬切，没有镜头推进，没有空间换挡。画面没有站台、轨道、列车、候车室、站牌、售票口、检票口、电子屏，也没有户外空间、太阳方向或窗外街景。

密帧指标只显示很小的局部变化：

```text
full luma delta = +0.528
full warm delta = +0.014545
max full ratio_gt8 = 0.002035
```

右侧暖色边缘和白色材料稍微增强：

```text
right_body_material warm delta = +0.063792
right_foreground_warm_edge warm delta = +0.063552
right_wall_warm_patch warm delta = +0.068469
```

但这个暖不是午后自然光。它没有太阳方向，没有户外亮度，没有窗外空间，也没有把整个场域改成下午。中央墙面黄色比例反而从 `0.006186` 降到 `0.001333`。更稳的写法是：右侧人工暖边/材料暖色略有起伏，而不是午后光显影。

MiMo 四路反读也支持这个边界。静音视觉报告给：

```text
车站可见度：0
午后自然光可见度：0
交通空间可见度：0
包/桃子可见度：0
同一公开观看场持续度：5
```

声音黑色视频报告给：

```text
车站环境声：0
午后户外声景：0
交通/列车声：0
物体掉落声：0
纯人声短句程度：5
```

#962-#964 的语言链报告把这三句概括成：

```text
地点 -> 容器 -> 掉出物
```

这个概括可以保留，但必须守住声画边界。车站、包和桃子在语言里接起来了；画面和声音没有跟着接起来。没有包的摩擦声，没有桃子掉落声，没有物体滚动，也没有车站空间来承接这条叙事。

所以 #962 的稳定读法是：

```text
#961：蝴蝶被说出，但不显影。
#962：车站被说出，但不换场。
#963：包将被说出，但还不能倒填到 #962。
```

#962 不是“到了车站”。它是“车站这个地点被说出”。地点进入语言，空间没有移动。它把梦像接力从美丽对象推到外部叙事地点，但电影仍把我们扣在同一公开观看现场。

### #963｜子丑：分别的一对情侣的包里

```text
T0：#963
时间：01:30:08.400-01:30:10.400
说话人：子丑 / ACT-ZICHOU
台词：分别的一对情侣的包里
机制标签：未标记 / 未标记/语气残片
```

#963 接住 #962，但不是替 #962 证明车站。#962 说：

```text
在午后车站
```

那一句只打开地点和时间感，没有让声画进入车站。#963 则把这个地点空位继续具体化：

```text
分别的一对情侣的包里
```

这里的语言推进很清楚：

```text
#962：地点 / 时间感
在午后车站

#963：关系 / 容器
分别的一对情侣的包里

#964：事件 / 掉出物
掉出了一颗桃子
```

也就是说，#963 不是桃子句。它只把“车站”里的叙事材料推到“关系”和“容器”上：有人是 `一对情侣`，这对情侣处在 `分别` 的状态，某个东西处在 `包里`。真正的掉出动作和桃子，要到 #964 才进入 T0。

所以 #963 的第一条边界是：不能用 #964 倒填 #963。#963 自己必须单独问：画面有没有情侣，声音有没有包，镜头有没有进入包里。

声音上，#963 仍是近场人声，不是包的物声。全句 `2.000s`：

```text
RMS      = -23.60dBFS
Peak     = -4.80dBFS

20-250Hz   = 0.46386
250-1000Hz = 0.48933
20-1000Hz 合计 = 0.95319
4-20kHz 合计   = 0.03783
spectral centroid ≈ 853.1Hz
```

这说明声音主要压在 20-1000Hz 的人声低频/低中频里。没有包摩擦、拉链、翻找、布料/皮革摩擦、包内物体移动、物体掉落、桃子滚动、站内广播、列车、轨道、人群候车声或音乐转场。

句内粗分更重要：

```text
分别的     ≈ -21.29dBFS
一对情侣   ≈ -24.61dBFS
的包里     ≈ -26.33dBFS

前半       ≈ -22.37dBFS
后半       ≈ -25.33dBFS
```

最强的是 `分别的`，不是 `情侣`，也不是 `包里`。这意味着声音最先推出的是一种关系状态，而不是人物关系物证或容器物证。`包里` 反而更弱。它没有被声效打开，也没有被音乐托起来；它只是被说完。

50ms rolling cluster 也支持这个判断：

```text
0.01-1.74s  max RMS=-18.34dBFS
```

它只有一个主要人声团，不是“说到包里时出现第二个物声层”。如果真的要把 `包里` 写成片内物件，至少需要包口、拉链、翻动、手部接触、物体碰撞、包内闷响或画面进入容器内部。#963 都没有。

#963 前后也没有帮它补物证。#962 到 #963 前 `1.100s` 间隙：

```text
RMS      = -42.74dBFS
Peak     = -19.15dBFS
4-20kHz  = 0.48862
谱心约   = 7303.3Hz
```

这是薄的高频底噪，不是车站回应，也不是包的预备声。#963 到 #964 前 `0.666s` 间隙：

```text
RMS      = -39.12dBFS
Peak     = -19.89dBFS
4-20kHz  = 0.69187
谱心约   = 11414.0Hz
```

它也不是掉落预备声。`silencedetect -45dB:d=0.3` 没有把这些间隙判成绝对静默，但“不是绝对静默”不等于“有包声/掉落声”。更稳的写法是：低位 room tone / 高频薄底噪维持，物声未出现。

画面上，#963 精确窗 `48` 帧，仍是同一低机位公开观看场。抽出的 720p 相对时间小片段在 `scene>0.04` 下没有内部 `pts_time` 选帧命中；也就是说，没有硬切，没有空间换挡，没有从公开观看场转入车站、情侣双人空间或包内空间。

接触表上可以看到：左侧是一排观众/人物，中央是浅色墙面与反光面，右侧是白色身体/白色材料、透明容器、暖色边缘和倒影。这个画面能支持“公共观看关系仍在”，但不能支持“一对情侣正在分别”。

左侧观众带的指标很稳定：

```text
left_audience_row luma = 106.913 -> 106.994
max ratio_gt8 = 0.007682
```

这里有人，但不是“情侣”。缺少成对互动、离别动作、亲密姿态、站台关系、握手/拥抱/转身离开、包的归属关系或任何能让 `一对情侣` 从普通观众/人物排列中分离出来的证据。

透明容器区域也很关键，因为它最容易诱导“包里”的误读：

```text
transparent_container_area luma = 52.407 -> 52.589
max ratio_gt8 = 0.005285
```

这里确实有容器感：玻璃边缘、反射、远处人物被压在透明层里。但它不是包。没有包口、拉链、软质袋体、开口边缘、内部空间、手伸进去、翻找动作或包内物件。这个区域只能写成“容器性视觉诱导”，不能写成“情侣的包”。

右侧白色材料和暖色边缘也没有变成包：

```text
right_body_material luma = 49.177 -> 49.218
right_body_material max ratio_gt8 = 0.006254

right_foreground_warm_edge luma = 57.217 -> 56.422
right_foreground_warm_edge max ratio_gt8 = 0.008690
```

它们支持既有身体/材料/反光持续，不支持包、包内空间、桃子、掉落轨迹或从容器中掉出的动作。全幅也只是轻微漂移：

```text
full luma delta = -0.378
max full ratio_gt8 = 0.006115
```

因此 #963 的画面不是“进入包里”，而是“包里这个词进入语言，画面仍停在外部公开场”。

MiMo CN 四路反读与 T1 方向一致。带声上下文、静音视觉、黑色视频声音和 #962-#964 链条反读都支持：

```text
车站/交通空间：0/5
一对情侣：0/5
包/包口/包内空间：0/5
桃子/掉落动作：0/5
包摩擦/拉链/翻找声：0/5
物体掉落/滚动声：0/5
同一低机位公开观看场：5/5
```

可保留的是这个反诱导方向：#962-#964 确实形成“地点 -> 人物关系/容器 -> 掉出物”的语言链，但声画没有兑现这条链。

需要降级的是，MiMo 把声音说成男声/旁白，把右侧可见体说成女性或雕塑，把现场说成展览。这些都不能覆盖 T0/T1。T0 锁定 #963 为子丑；T1 只确认同一公开观看场、观众带、透明容器、反光面、白色材料和暖色边缘，不确认具体人物身份或场所身份。

所以 #963 的稳定读法是：

```text
#962：车站被说出，但不换场。
#963：情侣和包里被说出，但不交人、不交包。
#964：桃子和掉出还没到；不能提前倒填。
```

#963 把语言推进得更具体，但声画仍然撤证。它不是把观众带进车站生活场景，而是在同一公开观看场里继续让外部叙事名词一个个出现。车站没有出现，情侣没有出现，包也没有出现；只有语言越来越像一个可讲述的故事。

这一句最有用的细节，是 `分别的` 比 `包里` 更强。它说明声音先把关系状态推出来，再把关系压进容器名里。真正响起的不是包，而是“分别”。但“分别”也没有画面动作，它只是关系的声学压力入口。

更短的稳写法：

```text
#963 不是“看见情侣的包”，而是“情侣和包里被语言说出”。
关系进入语言，容器进入语言；声画仍不交物。
```

### #964｜子丑：掉出了一颗桃子

```text
T0：#964
时间：01:30:11.066-01:30:12.566
说话人：子丑 / ACT-ZICHOU
台词：掉出了一颗桃子
机制标签：未标记 / 语气残片
```

#964 是 #962-#963 之后第一个真正像“事件”的句子。#962 只有地点和时间：

```text
在午后车站
```

#963 把地点里的故事继续具体化：

```text
分别的一对情侣的包里
```

到 #964，句子终于出现动作和物：

```text
掉出了一颗桃子
```

如果只看语言，链条已经完整：

```text
车站 -> 分别的情侣 -> 包里 -> 掉出桃子
```

这就是它的诱惑。它太像一个完整故事了，以至于读者很容易自动补出站台、情侣、包口、手、桃子、落地声。但 #964 必须单独问：电影有没有给出这些东西。

声音先给出的不是桃子，而是动作词。#964 精确句 `1.500s`：

```text
RMS      = -27.11dBFS
Peak     = -8.45dBFS
20-1000Hz = 0.97653
4-20kHz   = 0.01339
谱心约    = 552.5Hz
```

这仍是低频/低中频主导的人声句。没有包摩擦、拉链、翻找、布料/塑料摩擦、包内闷响、物体脱离容器、落地、弹跳、滚动、硬物碰撞、车站广播、列车、人群候车声或音乐转场。

句内粗分最关键：

```text
掉出     ≈ -24.09dBFS
了一颗   ≈ -28.73dBFS
桃子     ≈ -36.53dBFS
```

最强的是 `掉出`，最弱的是 `桃子`。这意味着声音把动作词推到前面，却没有把物件名做成声学实体。`桃子` 没有被落地声托出来，也没有被滚动声延续。它只是作为词尾低弱地完成。

20ms rolling 最大 RMS 出现在句内约 `0.05s`，对应人声开头，不是句尾物体落地。`桃子` 尾部 4-20kHz 比例看起来抬高到约 `0.11100`，但它的整体 RMS 已经退到 `-36.53dBFS`；这是弱尾音和底噪比例变化，不是一个独立冲击。

#963 到 #964 前的 `0.666s` 间隙已经在 #963 里检查过：

```text
RMS      = -39.12dBFS
Peak     = -19.89dBFS
4-20kHz  = 0.69187
谱心约   = 11414.0Hz
```

它是高频薄底噪，不是包摩擦、拉链、翻找或取物预备声。#964 后 `2.434s` 短尾更低：

```text
RMS      = -45.47dBFS
Peak     = -31.45dBFS
```

这里也没有落地后余声、滚动声或弹跳声。`silencedetect -45dB:d=0.3` 对这些窗口没有报 silence event，但“不是绝对静默”不等于“有物声”。更稳的写法是：低位 room tone 仍在，物体事件没有出现。

画面上，#964 精确窗 `36` 帧，仍是同一低机位公开观看场。scene 检测在 tight、context 和 context long 三条 720p 小片段里都没有内部 `pts_time` 命中。没有硬切，没有推近，没有切到车站、包内、地面特写或桃子落地位置。

全幅指标只是轻微暗落：

```text
full luma = 67.263 -> 66.014
full luma delta = -1.249
max full ratio_gt8 = 0.007035
```

这不是物体从画面中落下。最容易误读的是右侧暖色和透明容器，因为它们确实带有橙/桃色。但指标显示橙色比例不是增加，而是在下降：

```text
right_foreground_warm_edge
orange_ratio max   = 0.181527
orange_ratio delta = -0.045724

transparent_container_area
orange_ratio max   = 0.191657
orange_ratio delta = -0.037468

peach_candidate_right_edge
orange_ratio max   = 0.125185
orange_ratio delta = -0.025773
```

这些橙/桃色更稳地属于暖光、肤色、材料反光、透明容器/液体和地面倒影。它们没有独立边界，没有圆形水果形体，没有离开包口/容器口的轨迹，也没有落地后的坐标延续。

透明容器区域在这里尤其危险。#963 里它已经诱导过“包里”的误读；到 #964，它又容易诱导“桃色物”的误读。但容器不是包，反光不是桃子。没有包口、拉链、软质袋体、手伸入、手松开、物体脱离、垂直轨迹、弹跳或滚动。

MiMo CN 的声画上下文和静音视觉报告都支持这个边界：

```text
桃子/水果可见度：0
掉落动作可见度：0
包/包内空间可见度：0
掉落/滚动/碰撞声可听度：0
空间切换：0
```

语言链报告也把 #962-#964 读成“地点 -> 人物关系/容器 -> 掉出物”的语言推进，而不是声画兑现。需要降级的是：MiMo 对女性、表演者、展览/装置、男声/旁白、暖色光斑隐喻等描述都不能覆盖 T0/T1。纯音频 MiMo 通道本轮自称未收到音频，虽有 audio tokens，也不作为声音证据采用。

所以 #964 的稳定读法是：

```text
桃子掉出，是一个语言事件。
桃子本身，没有成为声画事件。
```

这句话和 #963 的区别在于：#963 只是关系/容器名，#964 是动作/物件名。它把梦像链推到最像故事的一步。可是电影仍然不替故事作证。车站没有出现，情侣没有出现，包没有出现，现在桃子也没有出现。语言越来越完整，声画越来越像在拒绝给它盖章。

更短的稳写法：

```text
#964 不是“桃子掉出来被看见/听见”，而是“桃子掉出来被语言说出”。
动作进入语言，物件进入语言；声画仍不交桃子。
```

### 插段｜#964 到 #965 前 66 秒长尾

```text
性质：#964 结束到 #965 开始之间的无新 T0 等待窗口
时间：01:30:12.566-01:31:18.566
前句：#964 子丑「掉出了一颗桃子」
后句：#965 阿蒙「我就知道 你一来找我什么都知道」
```

这段不能简单算作 #964 的“桃子落地余声”。它太长，足足 `66.000s`；也不能直接并入 #965，因为 #965 的台词还没有开始。它是一个独立的等待窗：语言刚刚说出 `掉出了一颗桃子`，电影却没有马上给出桃子、地面、落点、滚动或碰撞，而是把公开观看场慢慢转向材料、身体和近脸。

声音上，整段不是绝对静默。完整长尾 RMS=`-32.54dBFS`，20-1000Hz 合计约 `0.915477`，谱心约 `835.5Hz`；最强 0.5 秒窗口落在长尾相对 `46.5s`，也就是约 `01:30:59.066`。这说明真正抬起来的不是 #964 之后立刻出现的物体声，而是长尾中段偏后的一次材料/身体接触声场。

三段拆开看更清楚：

```text
A段 01:30:12.566-01:30:34.566
RMS=-42.42dBFS，Peak=-12.34dBFS
薄、低、安静；不支持桃子落地或包内物声。

B段 01:30:34.566-01:30:56.566
RMS=-38.06dBFS，Peak=0.00dBFS
有一个孤立高峰，但混有较多高频；更像进入/移动候选，不能写成碰撞事实。

C段 01:30:56.566-01:31:18.566
RMS=-28.36dBFS，Peak=-2.89dBFS
声能明显抬起，20-1000Hz 合计约 0.915294。
```

真正值得单独标出的，是 `01:30:57.500-01:31:02.500` 这 5 秒材料声峰值：

```text
RMS=-22.27dBFS
Peak=-2.89dBFS
20-1000Hz=0.997864
1-4kHz=0.000833
4-20kHz=0.001303
谱心约=169.7Hz
```

这是非常低频/低中频的材料声，不像包口细响、拉链、硬物掉落、圆形物滚动或清脆碰撞。它更接近身体、平台、塑料/布料、白色材料之间的近距离接触。也就是说，#964 说出“桃子掉出”以后，声音没有去证明桃子，而是把注意力交给现场材料。

画面也配合这个转向。长尾开始时，仍是低机位公开观看场：左侧观众带，中部反光面/平台，右侧白色材料、透明容器和暖色反射。到约 `01:30:56.399-01:30:56.608`，scene detect 出现一组变化点；随后 `01:31:02.649-01:31:03.149` 和 `01:31:06.191-01:31:06.316` 继续出现变化。它们不是硬切成车站、包、地面或桃子落点，而是同一现场内部的身体/遮挡/近距离关系变化。

抽帧看，约 `01:30:56.566` 黑衣人物已经更明确地进入背景/右中区域；约 `01:31:07.566` 黑衣近身和前景遮挡开始压住画面；到 `01:31:18.566`，画面已经转成近黑衣脸部、亮眼部/妆面、暖墙/塑料光的关系。这里必须守住边界：T0 说话人仍然按台词账是 #965 阿蒙，不能因为画面出现近脸就反向改派说话人；同时也不能把这张近脸写成口型同步证据。

MiMo 这轮也要分层读。66 秒完整“时间雪球”提示返回太短，标记为 `too_short` 和高风险/拒答倾向，只能记录为失败边界。改成 A/B/C 三段中性形式、材料声峰值和 #965 到来边界后，报告可用，但仍只作 T2 候选。可保留的是：无车站、无包、无桃子、无掉落/滚动/碰撞声；公开观看/表演式空间、反光平台、塑料/布料/白色材料、黑衣人物靠近与近脸转入被多路报告支持。需要降级的是 A/B 段里过确定的人物身份、运动细节和声音归因，尤其任何把静态反光或遮挡误读成独立人物/物件的说法。

所以这段长尾的稳写法是：

```text
#964 的桃子没有落地。
落地的是现场材料、身体移动和观看空间的重组。
```

这句话把 #964 与 #965 接起来：#964 把语言链推到最像故事的一步，#964-#965 长尾却不兑现故事物件，而是把公开观看场推近到材料声、黑衣身体和近脸。于是 #965 的 `我就知道` 不是从桃子物证里长出来，而是从一段被拉长的现场等待里冒出来：声音和画面已经把“知道”准备成一种关系压力，但还没有给出口型透明、声源透明或事实答案。

下面进入工程 #965（T0 台词账 #965）。#964 到 #965 前的长尾已经单独处理；写 #965 时仍不得把这段长尾倒读成 #964 的桃子物证，也不得把 #965 的回返句倒填成可见近脸的口型同步。

### #965｜阿蒙：我就知道 你一来找我什么都知道

```text
T0：#965
时间：01:31:18.566-01:31:22.633
说话人：阿蒙 / ACT-AMENG
台词：我就知道 你一来找我什么都知道
机制标签：偷入;回返;流程规则 / 回返/偷入交叉
```

这句必须从长尾里出来读，而不是从一张脸里出来读。前面 `66.000s` 没有新 T0 台词，电影没有让桃子落地，也没有让车站、情侣、包或掉落动作显影；它把公开观看场慢慢推向平台、塑料、白色材料、黑衣人物和近脸。到 #965 开口时，语言已经从“物件故事失败”转到“关系压力被说出”。

所以 `我就知道` 不是一个孤立的开场白。它像是长尾等待的回声终于被人声说出来。不是“现在我获得了知识”，而是“果然如此”。但这个“果然”也不能升级成心理真相。稳妥地说，它是一句台词动作：阿蒙声道把已经堆在现场里的被观看、被预先解释、被别人提前掌握的感觉，压成一个 `知道` 字。

声音上，#965 比入声前的低位声场明显抬起，但并不爆炸：

```text
pre2      01:31:16.566-01:31:18.566  RMS=-42.97dBFS  Peak=-24.71dBFS
#965      01:31:18.566-01:31:22.633  RMS=-29.59dBFS  Peak=-12.10dBFS
post2     01:31:22.633-01:31:24.633  RMS=-30.83dBFS  Peak=-8.88dBFS
to #966   01:31:22.633-01:31:30.400  RMS=-34.24dBFS  Peak=-8.88dBFS
#966      01:31:30.400-01:31:31.633  RMS=-26.83dBFS  Peak=-10.11dBFS
```

从 `-42.97dBFS` 到 `-29.59dBFS`，它抬高约 `13.38dB`。这个差值说明人声从低位背景里浮出来了；但 `Peak=-12.10dBFS` 又说明它不是尖叫式爆发，也不是被音乐或冲击声托起的戏剧高潮。它是一句低位浮起的确认。

粗分后更有意思：

```text
我就知道             01:31:18.566-01:31:19.766  RMS=-31.25dBFS
你一来找我           01:31:19.766-01:31:21.200  RMS=-29.59dBFS
什么都知道           01:31:21.200-01:31:22.633  RMS=-28.56dBFS
```

最强的不是 `我就知道`，而是句尾 `什么都知道`。但即使到句尾，也只是 `-28.56dBFS`，没有把“什么都知道”做成控诉、审判或爆破。声音更像逐步推近：先确认，再把确认绑定到“你来找我”，最后把关系压力扩大成“什么都知道”。

这三段的频带也都在人声中低频和低中频里工作。`我就知道` 的 250-1000Hz 占比约 `0.7183`，`你一来找我` 的 20-250Hz 占比升到 `0.6194`，句尾 `什么都知道` 又回到 250-1000Hz 约 `0.6304`。换句话说，它不是靠高频尖锐度切开空间，而是在低处反复压住空间。这个声学形态和台词的动作相合：不是突然揭露，而是关系压力被低声确认。

画面却不让这句落在嘴上。#965 起声处确实出现黑衣近脸：短发、黑色高领、眼部亮粉/闪点、左侧暖墙、后方半透明塑料。这个画面非常容易诱导我们写成“近脸在说”。但 12fps 密帧不支持稳定口型同步。起始帧的嘴部并不清楚开合；到句中约 `1.4s-1.7s`，画面变化峰值出现，脸已经被侧面、背部、塑料墙和遮挡关系取代。

密帧指标是：

```text
frames=49 fps=12
luma_mean:    48.329 -> 45.004
dark_ratio:   0.209660 -> 0.253723
orange_ratio: 0.011343 -> 0.000000
top diff:     1.417s / 1.500s / 1.583s / 1.667s 附近
```

这说明 #965 的画面重心不是“脸持续签收台词”，而是“脸出现后撤离”。声音说 `知道`，画面却不给一个嘴来负责这个知道；声音说 `你一来找我`，画面也不给清楚的来者、找者或被找者。它给的是背部、下方观众/旁观者、平台边缘、塑料墙和白布/衣物。这就把 #965 从私人对话拉回公共观看场。

所以这句的声画结构可以写成：

```text
近脸出现
-> 人声进入
-> 口型不透明
-> 画面离开脸
-> 背部、平台、观众、塑料和白色材料接走这句
```

这里的 `知道` 不是由脸认证的知道，而是被空间分摊的知道。阿蒙声道说出“我就知道”，但画面把这句话交给一个更大的观看关系。谁在看，谁知道，谁被知道，谁被找，这些位置没有被镜头清算。

句后也不是空。#965 到 #966 前有 `7.767s` 无新 T0 台词，不能按字幕空白直接跳过。尤其 #965 后前 2 秒：

```text
01:31:22.633-01:31:24.633
RMS=-30.83dBFS
Peak=-8.88dBFS
4-12kHz=0.3804
12-20kHz=0.1724
谱心约=6282.3Hz
```

句后高频和超高频比例明显升高，听感更接近材料摩擦、衣物/塑料/平台接触或近距离移动。它不是继续对白，也不是旋律进入。更重要的是，`silencedetect -35dB:d=0.3` 和 `-45dB:d=0.3` 对整个 `01:31:16.566-01:31:32.633` 窗口都没有 silence event。因此，不能写成 #965 之后“完全静音”。正确写法是：人声说完以后，材料声接走了这句话。

这也让 #965 成为 `声音-音乐场` 里的一个很好的样本。本窗没有可确认配乐、旋律、节拍、主题音乐或音乐转场。压力不是由音乐煽出来的，而是由人声和材料声之间的换载形成：

```text
长尾材料等待
-> 阿蒙声道低位浮起
-> 口型不透明
-> 句后材料声继续
-> #966 前空间地址被准备
```

所以分析这句时，不能只问“有没有音乐”。更准确的问题是：声音如何组织事件。在 #965 里，声音不是音乐，但它承担了音乐常常承担的功能：它让等待形成结构，让关系压力有了节奏，让画面从脸退到背部和平台时仍然不断线。

再看词。`我就知道` 的 `就` 很关键。它不是“我知道了”，而是“我早就知道 / 果然如此”的口气。`就` 把知道向前推，推到台词发生之前，甚至推到对方出现之前。它让这句带着一种预先占位的感觉：你还没完全解释，现场已经替你解释了。

`你一来找我` 又把这个预先占位绑定到动作关系。`来` 是靠近，`找` 是定向，`我` 是被定位的人。可是画面恰恰不给稳定定位。它先给近脸，随即撤走；它给背部和平台，却不给清楚的寻找路径。于是 `找我` 在语言里非常明确，在画面里却被材料和观看空间吸收。

`什么都知道` 最危险，因为它最容易被写成“全知”。但 #965 不能这样写。这里的 `什么都知道` 更像一种被知道的压力，而不是一个事实命题。它不是证明某个人真的掌握全部事实；它是把“我被你提前读完了 / 我还没有说就已经被判断了”的关系状态说出来。电影同时拒绝给它三样东西：稳定口型、解释性反打、音乐结论。

MiMo 这轮有用，但必须继续降级读。可保留的是：近脸出现但口型不透明；#965 句中画面从脸转向背部/空间；句后到 #966 前有材料/摩擦/移动声候选；没有可确认音乐或节拍；#966 不能提前并入 #965。不能采用的是：声音性别判断、具体声源方向、完全静音期、心理解释和每一次材料声的具体来源。视频报告写过女性声，音频报告又写男性声，二者互相冲突，不能覆盖 T0。T0 仍锁定为阿蒙声道。

因此 #965 的稳定写法是：

```text
#965 不是近脸终于说出真相。
它是阿蒙声道把 #964 后长尾材料等待说成“果然被知道”；
画面不交口型，声音不交音乐，句后不交答案。
```

这句话在整条链上的位置也很清楚。#962 把梦像放到 `午后车站`，#963 把它推进到 `分别的一对情侣的包里`，#964 让 `桃子` 掉出，但声画都不兑现。#964-#965 长尾把物件故事交还给材料、身体和观看空间。到 #965，电影不再继续追问物件有没有出现，而是让阿蒙声道说：你已经知道了。梦像没有完成为证据，它转成了被知道的关系。

#966 已在下节处理为对 #965 的反问/回扣：它不能提前并入 #965 尾声，#965 后到 #966 前的 `7.767s` 等待窗也不能写成完全静音或音乐过场。当前阅读路径继续向 #967 阿蒙 `这空气中` 推进。

### #966｜阿蒙：就你知道吗

```text
T0：#966
时间：01:31:30.400-01:31:31.633
说话人：阿蒙 / ACT-AMENG
台词：就你知道吗
机制标签：偷入;回返 / 回返-偷入交叉
```

#966 不能从一句普通反问开始读。它必须紧贴 #965。上一句是：

```text
我就知道 你一来找我什么都知道
```

这句话把 `你` 放到一个已经知道的位置：你来了，你找我，你什么都知道。#966 马上把这个位置扣回来：

```text
就你知道吗
```

这里的 `就` 很小，但它改变了整句的力学。它不是单纯加强语气，而是在做排他检查：只有你知道吗？知道的位置只归你吗？#965 把“知道”说成被提前掌握的压力，#966 把这个压力反手推回去。它不是补充事实，而是争夺知道权。

声音上，这句非常短，只有 `1.233s`。它不像 #965 那样铺成一条完整关系句，而像一枚钉子：

```text
pre2        01:31:28.400-01:31:30.400  RMS=-35.65dBFS  Peak=-12.38dBFS
#966 exact  01:31:30.400-01:31:31.633  RMS=-26.83dBFS  Peak=-10.11dBFS
```

#966 比前 2 秒抬高约 `8.82dB`，也比 #965 全句 RMS=`-29.59dBFS` 高约 `2.76dB`。但它不靠长句推进，也不靠情绪爆发。`Peak=-10.11dBFS`，没有触顶；真正的特征是集中。它的 250-1000Hz 占比达到 `0.747329`，rolling 0.5s 最强窗在入句后 `0.1s`，RMS=`-24.39dBFS`。也就是说，反问几乎一出来就把声能钉住。

前 2 秒的声场更像高频材料/空间质感：

```text
pre2 centroid=9716.3Hz
4-12kHz=0.678225
12-20kHz=0.208432
```

所以 #966 不是从干净静音里冒出来的。它前面还有材料、空气、摩擦、空间底噪。只是 #966 一入声，声音从高频材料感迅速集中回人声低中频。这个转换让 `就你知道吗` 像是从材料噪声里突然伸出来的一根短针。

画面上，电影更冷。#965 还有近脸诱导，虽然不交稳定口型；#966 干脆不给脸。精确窗的接触表显示：前景是腰腿、手、浅色上衣边缘、黑色长衣/下身、白色褶皱塑料或布料、平台和透明材料。句中黑色衣物/身体遮挡慢慢扩张，到句尾，画面主要剩黑色遮挡、低处白色材料和局部手/边缘。

密帧指标也指向遮挡增强：

```text
frames=30 fps=24
luma_mean:    45.057 -> 36.382
dark_ratio:   0.259158 -> 0.480794
orange_ratio: 0.078242 -> 0.000000
```

最强变化集中在入句前 0.3 秒内，随后约 `0.625s` 又有一次暗部/遮挡变化。这个声画关系非常重要：声音问“就你知道吗”，画面却不给一个可见嘴部来承担这句反问。知道权在语言里被抢夺，口型证据在画面里被撤走。

所以这句不能写成“某个人面对某个人质问”。它没有给正反打，没有给清晰对视，没有给口型同步。更准确的写法是：

```text
反问落在材料和遮挡上。
嘴没有出场，身体局部、黑衣、平台、塑料和白布接住语言。
```

这也让 #966 和 #965 形成一个很漂亮也很难受的反差。#965 看似更接近脸，却不给口型；#966 更短、更硬，却彻底离开脸。电影不是越来越解释清楚，而是越到知道权争夺处，越把声源透明度撤掉。

#966 后到 #967 前有 `3.100s`。这段不能按字幕空白跳过，也不能写成完全静音：

```text
01:31:31.633-01:31:34.733
RMS=-34.84dBFS
Peak=-5.02dBFS
centroid=6038.9Hz
20-250Hz=0.170168
250-1000Hz=0.276632
4-12kHz=0.228955
12-20kHz=0.217032
```

这里的 RMS 很低，但 Peak 很高，说明有短促近场瞬态或材料/平台/身体接触候选。`silencedetect -35dB:d=0.3` 和 `-45dB:d=0.3` 对整个 `01:31:28.400-01:31:36.766` 都没有 silence event。它不是音乐，也不是空白；它是低位 room tone 里夹着材料声和硬瞬态的间隙。

画面也继续把反问拖到材料里。#966 后，黑色衣物/身体遮挡继续占住画面，随后才逐渐露出白色平台、透明塑料、灰色墙/块状结构、脚和黑色下摆。scene detect 的高阈值命中约在 `01:31:33.525`，落在 #966 后到 #967 前，而不是 #966 精确窗内部。也就是说，#966 本身不是靠硬切建立的；较强构图变化发生在反问之后。

到 #967，阿蒙继续说：

```text
这空气中
```

这句的谱心更低，250-1000Hz 占比更高：

```text
#967 exact  RMS=-26.54dBFS
centroid=955.9Hz
250-1000Hz=0.816198
```

但 #967 不能倒回解释 #966。#966 问的是知道权，#967 才开始把问题转向空气、介质、弥漫和期待。中间那 `3.100s` 材料间隙不能被抹掉。它让“知道”没有立刻得到答案，而是先经过黑衣、白色材料、平台、脚、塑料和低位底噪，再进入“空气中”。

MiMo 本轮三路都可用，但必须降级读。可保留的是：#966 精确窗无嘴部、口型不可确认；#966 到 #967 前不是完全静音；没有可确认配乐、旋律、节拍或音乐转场；画面更像同一材料/平台空间内部的遮挡和构图移动。不能采用的是声音性别、具体人物身份、具体材料来源、心理动机和硬切裁决。视频报告和纯音频报告对声音性别互相冲突，因此一律不采纳；T0 仍然锁定阿蒙声道。

因此 #966 的稳定写法是：

```text
#966 不是 #965 的重复，也不是 #967 的预告。
它把 #965 的“你什么都知道”反扣成“就你知道吗”；
声音短促集中，画面不交口型，间隙不交静音，音乐不交结论。
```

这句话在整条梦像/观看链里也很关键。#962 到 #964 把车站、情侣包、桃子一步步说成一个外部故事，但声画拒绝兑现。#964 到 #965 前长尾把故事物件交还给材料和近脸。#965 说“我就知道”，把失败物证改成被知道的关系。#966 则继续往里拧：既然你什么都知道，那就只有你知道吗？电影不回答。它只把这个问题放到低机位的材料、遮挡和下一句空气之前。

### #967｜阿蒙：这空气中

```text
T0：#967
时间：01:31:34.733-01:31:35.766
说话人：阿蒙 / ACT-AMENG
台词：这空气中
机制标签：介质命名 / 空气场入口 / 知道权转场
```

#967 不是 #966 的答案。#966 刚刚问：

```text
就你知道吗
```

如果电影要给一个普通回答，它可以让另一个人说“不是”或“还有谁知道”。但 #967 没有回答“谁知道”。它把问题转到另一个平面：

```text
这空气中
```

这里的 `这` 很重要。它不是抽象地说空气，而是指向当前这个低位空间：黑衣、脚、白色平台、透明塑料、灰色结构和刚刚开始出现的暖橙光。#966 争夺“知道”的位置，#967 把这个争夺放进一种介质里。好像问题已经不只在某个人知道不知道，而在这个空间本身已经含着某种东西。

声音上，#967 是一次清楚的人声入场。它前 2 秒很低：

```text
967_pre2    01:31:32.733-01:31:34.733
RMS=-36.1334dBFS
Peak=-11.7997dBFS
centroid=3508.821Hz
```

#967 一入声，能量明显抬起：

```text
#967 exact  01:31:34.733-01:31:35.766
RMS=-26.5413dBFS
Peak=-9.6494dBFS
centroid=942.3623Hz
250-1000Hz=0.816198
```

它比前 2 秒高约 `9.5921dB`。这不是背景里含混飘过的一句，而是一个被放到前景里的低中频人声。但它的谱心很低，250-1000Hz 占比特别高，1kHz 以上收得很窄。也就是说，`空气` 不是被风声做出来的，不是被气流声做出来的，也不是被配乐托起来的。它首先是被人声命名出来的。

这点要守住：#967 没有可确认音乐、旋律、节拍或空气声效。它说 `空气中`，但声音没有给“空气”一个漂亮的声效外壳。空气是语言把现场重新命名。

#967 后到 #968 前有 `3.500s`：

```text
01:31:35.766-01:31:39.266
RMS=-39.6147dBFS
Peak=-20.05dBFS
centroid=6410.8507Hz
4-12kHz=0.171047
12-20kHz=0.297298
```

这段很低能，50ms 小窗里约 `97.1429%` 低于 `-35dBFS`。但它不是音乐过场，也不是戏剧化的静音。更稳的说法是：#967 之后，声音退回低能高频材料/空间底噪；空气被说出来后，没有得到音乐解释，只被留在一个不空的间隙里。

画面也一样克制。#967 精确窗还是不给脸、不给嘴、不给口型同步。24fps 接触表里，画面主体是：

```text
黑色长衣/下身
手、脚
白色平台或表面
透明塑料/薄膜
灰色块状结构
句尾开始出现暖橙光
```

密帧指标显示，这句内部不是一次大开光，而是暖橙和塑料介质开始浮上来：

```text
frames=25
luma_mean:     62.5044 -> 63.8027
dark_ratio:    0.271630 -> 0.242321
warm_ratio:    0.000903 -> 0.051352
orange_ratio:  0.000000 -> 0.032060
neutral_grey:  0.862587 -> 0.685322
```

这说明 `这空气中` 不是把空气变成可见对象。画面没有“拍到空气”。它只是让空气开始借别的材料出现：透明塑料的褶皱，白色平台的反光，灰色块状边界，右侧暖橙光。这些东西一起把空气变成一种包裹人的介质。

到 #968，暖橙比例突然更高：

```text
968_start warm_ratio=0.290043
orange_ratio=0.166373
```

到 #969 中段和结尾，暖光和塑料薄膜才真正成为空间主导：

```text
969_mid warm_ratio=0.355163  orange_ratio=0.287177
969_end warm_ratio=0.461710  orange_ratio=0.336135
```

所以 #967 是启动，不是完成。它把介质词说出来，但画面只给一个开始显影的材料场。#968 重复 `空气中`，#969 才把这个介质扩成 `弥漫着一股特别特别奇怪的东西`。

MiMo 这轮三路都可用，但要降级读。可采用的是：#967 没有清晰脸、嘴和口型；画面主体是黑衣、脚、白色平台、透明塑料、灰色结构和暖橙光；没有可确认配乐、旋律或节拍；`空气` 通过塑料/薄膜/透光和低位空间间接显影。不能采用的是纯音频报告里的绝对时间点、声音性别、人物身份、声源方向、具体材料来源、心理动机、`EXIT` 象征和硬切裁决。T0 仍然锁定阿蒙声道。

因此 #967 的稳定写法是：

```text
#967 不是 #966 的答案。
它把 #966 的知道权反问转入空气/介质链条；
声音是低中频人声命名空气，画面不交口型，只让塑料、平台、灰墙和暖光开始把空气变得可感。
```

这句话继续接住 #962 到 #966 的失败物证链。车站没有显影，情侣包没有显影，桃子没有显影，知道关系也没有交出口型。到了 #967，电影不再继续追那个外部物件，而是把未兑现的东西放进空气里。不是“桃子在哪里”，也不是“谁知道”，而是：这空气中，已经有什么在弥漫。

### #968｜阿蒙：空气中

```text
T0：#968
时间：01:31:39.266-01:31:39.833
说话人：阿蒙 / ACT-AMENG
台词：空气中
机制标签：介质重复 / 重复抬亮 / 弥漫前加压
```

#968 很短，只有 `0.567s`。如果只按字幕看，它像是 #967 的重复：

```text
#967 这空气中
#968 空气中
```

但这两个句子不是同一个动作。#967 还有一个 `这`。`这` 把空气钉在当前现场：这块平台、这层塑料、这个低位空间、这段刚从 `就你知道吗` 转出来的声画关系。#968 把 `这` 去掉，只留下 `空气中`。这一下，指示词退后了，介质词本身被推到前景。

所以 #968 不是在增加一个新物件，而是在把 #967 已经说出的介质重新加压。它像是先把手指从“这里”撤开，让空气本身成为要被听见的东西。

声音上，这个加压很明显。#968 前 2 秒还是低能高频底噪/材料场：

```text
968_pre2  01:31:37.266-01:31:39.266
RMS=-38.9311dBFS
Peak=-20.6916dBFS
centroid=11112.9197Hz
4-12kHz=0.224862
12-20kHz=0.274114
```

#968 一入声，能量突然抬起：

```text
#968 exact  01:31:39.266-01:31:39.833
duration=0.567s
RMS=-23.0530dBFS
Peak=-7.2626dBFS
centroid=8632.9184Hz
250-1000Hz=0.570367
4-12kHz=0.358668
```

它比前 2 秒高约 `15.8781dB`，比 #967 `这空气中` 也高约 `3.4883dB`。这说明 #968 不是含混尾声，也不是低声重复，而是短促、前景化、更亮的一次人声再命名。

但这个“亮”不能写成音乐。#968 没有可确认旋律、节拍、配器或音乐主题；也没有风声、气流声或空气声效。它仍然是语言里的空气，不是声效里的空气。电影没有给 `空气中` 配一个漂亮的气流声音，只让人声在低能底噪上猛地出现。

更细的是 #968 和 #969 之间的微间隙。台词账上 #968 结束于 `01:31:39.833`，#969 开始于 `01:31:39.866`，中间只有约 `0.033s`：

```text
968_to969_microgap
RMS=-22.5485dBFS
Peak=-15.1824dBFS
centroid=2053.7936Hz
20-250Hz=0.638316
250-1000Hz=0.346403
```

这不是低到可以写成“完全断开”的空白。它更像一个尾音收束、气口或低频承接。也就是说，#968 不是结束，而是在把 `空气中` 直接递给 #969：

```text
空气中
弥漫着一股特别特别奇怪的东西
```

这里不能用一个大句号把它切断。更稳的是把它看成语流里的极短接缝：#968 把介质词顶到前面，#969 随即补上介质里到底“弥漫着”什么。

画面也支持这种“介质加压”，但支持的方式很克制。#968 精确窗不再像 #967 那样主要停留在脚、平台和下身局部；它可见一个白衣黑下装的人体站在低顶空间里。右侧是大面积透明塑料/薄膜和暖橙光，左侧是灰暗空间和薄膜/反光材料，上方还有绿色标识。脸部侧面可见，但光线和角度不足以确认口型同步。

密帧指标显示，这半秒内部有一个非常短的“暖光强显影 -> 退暗”：

```text
frames=15
luma_mean:     60.2551 -> 53.3847
dark_ratio:    0.231988 -> 0.273261
warm_ratio:    0.558509 -> 0.058996
orange_ratio:  0.071927 -> 0.000000
neutral_grey:  0.358349 -> 0.512856
```

这组数字很关键。#968 入声点，右侧暖橙和塑料薄膜非常强，warm_ratio=`0.558509`；到句尾，它退到 `0.058996`。这不是新物出现，也不是硬切换场，而是空气介质在薄膜和暖光里闪了一下，又缩回灰暗。

到 #969，暖光才重新扩张并持续：

```text
969_mid warm_ratio=0.734858  orange_ratio=0.218362
969_end warm_ratio=0.771000  orange_ratio=0.231368
```

所以 #968 是 #969 的前置脉冲，不是 #969 的完成。它先把空间点亮一下，让 `空气中` 获得更强的声画前景；随后 #969 才让 `弥漫着一股特别特别奇怪的东西` 展开。

这里最危险的误读，是把可见人物当成说话人。#968 画面比 #967 更给人体，也能看到侧脸和嘴部附近的轮廓。但 T0 锁定说话人为阿蒙，画面又没有足够口型证据，所以不能因为看见一个白衣黑下装人体，就改派声源。电影恰恰在这里继续保持声源不透明：越是说 `空气中`，越不能把这句话安回一张稳定的嘴里。

MiMo public endpoint 三路报告这次都成功。可采用的是：白衣黑下装人体、低顶空间、透明塑料/薄膜、右侧暖橙光、上方绿色标识、无音乐、无风声、#968 相对 #967 是确认/强调/重复加压，并接向 #969。必须降级的是：MiMo 的 `男声`、`同一男声`、可见人物即说话人、口型同步、`EXIT` 象征、人物心理、具体材料来源，以及精确视觉报告里“没有清晰人声”的声音判断。后者与 T1 音频指标和 MiMo 纯音频报告矛盾，不能采用。

因此 #968 的稳定写法是：

```text
#968 不是新物显影。
它删掉 #967 的 `这`，把 `空气中` 这个介质词再推到前景；
声音更响、更亮，画面让塑料薄膜和暖橙光短促强显影；
但它仍不交口型、不交风声、不交音乐，也不交出“奇怪的东西”。
```

### #969｜阿蒙：弥漫着一股特别特别奇怪的东西

```text
T0：#969
时间：01:31:39.866-01:31:42.466
说话人：阿蒙 / ACT-AMENG
台词：弥漫着一股特别特别奇怪的东西
机制标签：弥漫展开 / 对象诱导 / 实体化失败 / 暖光薄膜场
```

#969 是 #967/#968 介质链条的完整展开，但它展开的不是一个物件，而是一种场。

前面两句已经把空气推到前景：

```text
#967 这空气中
#968 空气中
```

到 #969，句子终于补上动词和对象：

```text
弥漫着一股特别特别奇怪的东西
```

这句话最容易误读。因为它里面有 `东西`，观众会等一个东西出现。可是电影偏偏不交。它让 `东西` 进入语言，却不让 `东西` 进入可命名的视觉实体。于是这句的核心不是“奇怪的东西出现了”，而是“奇怪的东西被说成正在弥漫，但声画仍拒绝把它交成一个东西”。

先看声音。#969 精确窗长 `2.600s`：

```text
#969 exact  01:31:39.866-01:31:42.466
RMS=-28.1080dBFS
Peak=-3.7856dBFS
centroid=2103.8033Hz
250-1000Hz=0.694257
4-12kHz=0.164893
```

它比 #968 `空气中` 低约 `5.0550dB`。这很重要。#968 是短促抬亮，#969 是拉长展开。台词的语义更大了，声音却没有变成更大的声学爆点。

所以 `特别特别奇怪的东西` 不是靠声音炸出来的。这里没有可确认旋律、节拍、配器、音乐主题；也没有风声、气流声、空气声效、whoosh、物体显影声或怪物声。声音仍然主要落在低中频人声里。奇怪性首先是被说出来，而不是被声效做出来。

`特别特别` 的功能也要细分。它不是自动等于“情绪更强”或“心理更紧张”。更稳的是把它看成一种延宕：句子不直接抵达 `东西`，而是在 `东西` 之前停留两次。它把观众对对象的等待拉长，但没有让对象更明确。

如果句子说：

```text
弥漫着一股奇怪的东西
```

对象会很快落地。现在它说：

```text
弥漫着一股特别特别奇怪的东西
```

两个 `特别` 把落地推迟了。它不是给我们更多事实，而是让“还没出现的东西”更久地悬在空气里。

画面正好对应这种悬置。#969 开始时，画面还偏暗：

```text
969_start
luma=54.1420
warm_internal=0.348921
orange_internal=0.014012
neutral_internal=0.544028
```

到中段，右侧半透明塑料/薄膜和暖橙光被强烈推出：

```text
969_mid
luma=67.8524
warm_internal=0.878308
orange_internal=0.374269
neutral_internal=0.050218
```

到结尾，亮度更高：

```text
969_end
luma=79.6546
warm_internal=0.791535
orange_internal=0.393340
neutral_internal=0.152955
```

从首帧到末帧，luma 增加约 `22.7615`，warm_internal 增加约 `0.377301`，orange_internal 增加约 `0.351073`。这说明画面确实强烈变化。但变化不是“出现一个新实体”，而是同一低顶空间里的光、塑料薄膜、透明介质和身体站位被推到前景。

联系表上可以看得很清楚：白衣黑下装人体在画面左/中左，右侧是一大片被暖橙光照亮的半透明薄膜，空间仍然低矮，上方绿色标识持续存在。没有新道具，没有怪物，没有雾团，没有空气被拍成可见实体，也没有一个可命名的奇怪物从画面中跳出来。

更细的是，#969 不是一路单调变暖。晚段出现一次回灰：

```text
969_late
luma=56.5671
warm_internal=0.283373
orange_internal=0.018755
neutral_internal=0.630563
```

然后结尾又重新亮起。这个回灰很要紧。它说明 `弥漫` 不是一次稳定占领，而是一种在薄膜和光之间起伏的可感状态。奇怪性被推出来，又被灰暗收回一点，再被暖光推出来。它不是一个东西，它像一个场的呼吸。

因此 #969 的画面支持“暖光薄膜场”，不支持“奇怪实体”。这也是这一句最核心的声画关系：语言给对象，画面给介质；语言说 `东西`，画面只给光、薄膜、低顶和身体。

#969 后到 #970 前，有约 `3.567s`：

```text
969_to970_gap  01:31:42.466-01:31:46.033
RMS=-35.2395dBFS
Peak=-14.4808dBFS
centroid=13102.2588Hz
4-12kHz=0.208041
12-20kHz=0.525343
```

这段不能写成音乐过场，也不能写成风声或空气流动声。它更像低能量、高频占比较高的空间/材料噪底。`silencedetect -35dB:d=0.3` 没有给出 silence event，所以也不能写成绝对静音。

画面上，这个间隔中点变得很亮，也更中性：

```text
969_gap_mid
luma=83.9458
warm_internal=0.170561
orange_internal=0.072083
neutral_internal=0.828039
```

这说明 #969 的暖橙弥漫没有直接一口气延续到 #970。人声结束后，暖色退成更灰、更亮、更空的等待场。然后 #970 才说：

```text
还有一种期待
```

所以 #970 的 `期待` 不是凭空跳出来的。#969 把空气扩成弥漫，句后间隔把弥漫退成等待，#970 再把等待命名为 `期待`。

剪辑层也不能夸大。`01:31:39.266-01:31:47.400` 上下文做 scene detect，低阈值 `0.015` 只抓到两个轻变化点，相对时间约 `0.0827s` 和 `2.7493s`；高阈值 `0.040` 无命中。这说明这里不是靠硬切、空间换挡或突然显影推动，而是同一空间内的光线、薄膜、人体位置和镜头关系慢慢改写。

MiMo public endpoint 三路报告这次也都跑通。可保留的是：#969 无新实体、无硬切、暖橙光和半透明薄膜增强，#969 后到 #970 前是低能量环境/room tone，不是音乐，#970 入声相对间隔有抬起感。必须降级的是：声音性别、可见人物即说话人、口型同步、`EXIT` 象征、心理动机、具体材料来源，以及音频报告里对风/空气声的可能性。风/空气声在 T1 本地波形和频谱里没有足够证据，只能写低能空间/材料噪底。

因此 #969 的稳定写法是：

```text
#969 说出了“奇怪的东西”，但没有交出奇怪的东西。
它把 #967/#968 的“空气中”扩成暖光、塑料薄膜和低顶空间里的弥漫场；
声音仍是人声，不是音乐、风声、空气声效或物体声；
画面仍是介质，不是实体。
```

这句在整条梦像链里很关键。#962 的车站没有显影，#963 的情侣包没有显影，#964 的桃子没有显影，#967/#968 的空气也没有被直接拍到。到 #969，电影没有突然兑现所有欠账；它只是把未兑现的东西放大成一种场。它让你感觉到“有东西”，但不允许你把它拿成“一个东西”。

### #970｜阿蒙：还有一种期待

```text
T0：#970
时间：01:31:46.033-01:31:47.400
说话人：阿蒙 / ACT-AMENG
台词：还有一种期待
机制标签：等待命名 / 期待入声 / 非对象化期待 / 重复确认前奏
```

#970 要从 #969 后面的空位里读。#969 刚刚说出：

```text
弥漫着一股特别特别奇怪的东西
```

但 #969 没有把 `东西` 交成一个东西。它只把暖光、塑料薄膜、低顶空间和人声后的低能噪底推到前景。#970 的 `期待`，就是从这个未交出的场里长出来的。

所以这句的第一层意思不是“我看见了期待对象”，而是：

```text
这个没有被交出的东西，还让现场处在一种等待里。
```

`还有` 是关键。它不是重新开一个话题，而是在 #969 的 `奇怪的东西` 之后追加一层。#969 已经说了有一种奇怪性；#970 说，不止如此，`还有一种期待`。这就是电影的连贯性：不是实体连续出现，而是未兑现的语义压力一层一层叠加。

声音上，#970 是强入声。精确窗 `1.367s`：

```text
#970 exact
RMS=-20.5467dBFS
Peak=-3.4306dBFS
centroid=8582.1191Hz
250-1000Hz=0.222641
4-12kHz=0.511937
12-20kHz=0.240096
```

它相对 #969 后到 #970 前的低能间隔抬起约 `14.6928dB`，相对 #970 前 2 秒抬起约 `16.0423dB`。波形上也很直观：#970 像从一段低位噪底里突然竖起来的人声柱。

但这不是音乐入场。它没有旋律、节拍、主题音乐或配器。`4-12kHz` 占比很高，更稳的解释是辅音、录音亮度和人声瞬态，而不是风声、空气声效或物体显影声。也就是说，期待不是被配乐制造的，也不是被空气声吹出来的；期待是人声把低噪等待命名出来。

更细地拆句，#970 的力量并不在 `期待` 两个字本身：

```text
还有  01:31:46.033-01:31:46.566  RMS=-19.2212dBFS
一种  01:31:46.566-01:31:46.966  RMS=-19.9125dBFS
期待  01:31:46.966-01:31:47.400  RMS=-24.3476dBFS
```

最响的是 `还有`，其次是 `一种`，最后的 `期待` 反而低下去。这很微妙。句子不是把 `期待` 当成一个声学爆点推出，而是先用 `还有` 把前一层继续加厚，再用 `一种` 把它保持在不具体的类别里，最后才落到 `期待`。概念词不是高潮，追加和分类才是动作。

这也解释了为什么不能把 #970 写成“期待对象出现”。如果对象真的被交出来，`期待` 应该更像一个落点。但它在声音里不是最强落点，在画面里也没有对应的新物。

画面上，#970 仍在同一低顶空间。联系表显示：左侧白衣黑下装人体，右侧白衣人物/白色材料，中央和下方是半透明塑料薄膜，暖橙光从下方或后方透过来。没有硬切，没有新空间，也没有一个新实体专门对应 `期待`。

关键帧指标：

```text
970_start
luma=78.8703
warm_internal=0.568808
orange_internal=0.146645
neutral_internal=0.700514

970_mid
luma=72.4517
warm_internal=0.928490
orange_internal=0.649813
neutral_internal=0.148932

970_end
luma=76.1969
warm_internal=0.991289
orange_internal=0.798282
neutral_internal=0.062070
```

从首帧到末帧，luma 反而略降约 `2.1699`，但 warm_internal 增加约 `0.422979`，orange_internal 增加约 `0.657812`，neutral_internal 下降约 `0.648319`。这说明 #970 的视觉变化不是“亮起来”，而是“变暖、变橙、变薄膜化”。灰色等待场退下去，暖橙塑料场重新占上来。

这很好地承接 #969。#969 后的间隔中点更亮、更灰、更中性；#970 说 `还有一种期待` 时，画面又被暖橙和薄膜拉回。期待没有对象，但有介质。期待不是看见了什么，而是这层薄膜、这片光、这几个被遮挡的身体共同让现场继续处在“等某物但不交某物”的状态。

#970 结束后到 #971 前，有约 `2.333s`：

```text
970_to971_gap
RMS=-39.4071dBFS
Peak=-18.4145dBFS
centroid=6964.2026Hz
250-1000Hz=0.260019
4-12kHz=0.263446
12-20kHz=0.251100
```

这个间隔比 #969 到 #970 前的间隔还低约 `4.1676dB`。这说明 #970 说完以后，电影没有把期待推成连续上升的高潮，而是又让现场掉回更低的噪底。`silencedetect -35dB:d=0.3` 没有输出 silence event，所以它不是绝对静音。它是更低能的非静音等待。

然后 #971 说：

```text
对 还有一种期待
```

#971 的存在很重要，因为它说明 #970 不是口误，不是飘过的词。`对` 把 #970 的判断确认了一遍。但 T1 音频同时显示，#971 并没有比 #970 更强：

```text
#971 exact RMS=-28.2129dBFS
#971 exact - #970 exact = -7.6662dB
```

所以 #971 是语义确认，不是声学升级。它把期待钉住，却没有把期待放大成可见对象或音乐高潮。

MiMo public endpoint 三路报告在 #970 这里也可用。可保留的是：同一空间、薄膜/塑料和暖橙光主导、无新实体、无硬切、无音乐、#970 与 #971 构成重复确认链、口型同步不能确认。必须降级的是：把右侧人物/薄膜动作写成“期待对象”、把薄膜运动推成可听风声或空气声、以及音频报告中 `#971 强于 #970` 的判断。T1 RMS 明确相反，强弱关系以本地波形和指标为准。

因此 #970 的稳定写法是：

```text
#970 不是期待对象出现。
它是 #969 后低能等待场被阿蒙声道命名为“期待”；
声音强入但不是音乐，画面变暖但不交新物；
#971 重复确认，但声学上降下来，期待继续悬置。
```

这句在整条梦像链里，是从“对象不交付”进入“等待被命名”的节点。前面车站、情侣包、桃子、空气、奇怪东西都没有按字面显影；到 #970，电影并不补偿这些欠账，而是把欠账本身说成一种期待。

### #971｜阿蒙：对 还有一种期待

```text
T0：#971
时间：01:31:49.733-01:31:51.500
说话人：阿蒙 / ACT-AMENG
台词：对 还有一种期待
机制标签：重复确认 / 降声回钉 / 期待归属前长等待 / 观看场转入
```

#971 要紧挨着 #970 读。#970 说：

```text
还有一种期待
```

#971 多了一个字：

```text
对
```

这个 `对` 很小，但它改变句子的地位。#970 的 `期待` 还可能被听成一个刚浮出来的命名；#971 的 `对` 把它确认了一遍，等于说：刚才这个判断不是口误，不是顺嘴漂过，而是现场确实要登记的一层压力。

但 `对` 不是兑现。它确认的是期待存在，不是期待对象出现。电影没有在 #971 里把“期待什么”“谁在期待”“期待对象在哪里”交出来。#971 做的是回钉，不是解谜。

声音上，#971 确实从低能间隔中重新入声：

```text
#970_to971_gap
RMS=-39.4071dBFS

#971 exact
duration=1.767s
RMS=-28.2129dBFS
Peak=-11.4818dBFS
centroid=3804.4832Hz
250-1000Hz=0.664491
4-12kHz=0.146983

#971 exact - #970_to971_gap = +11.1942dB
```

所以它不是完全贴着噪底的尾声。它重新进入，重新把 `期待` 放到前景。

但它也明确低于 #970：

```text
#970 exact RMS=-20.5467dBFS
#971 exact RMS=-28.2129dBFS
#971 exact - #970 exact = -7.6662dB
```

这就决定了 #971 的性质：它是语义确认，不是声学升级。它把 #970 的期待钉住，却没有把期待越推越响。这里没有音乐高潮，没有配器，没有节拍，没有风声/气流声，也没有物体显影声。期待仍然是被人声确认的现场压力，不是被声音设计做成的对象。

更细地拆 #971，能看出它不是简单复读：

```text
对        01:31:49.733-01:31:49.983  RMS=-27.1235dBFS
对后低位  01:31:49.983-01:31:50.233  RMS=-33.3409dBFS
还有      01:31:50.233-01:31:50.533  RMS=-22.9731dBFS
一种      01:31:50.533-01:31:50.833  RMS=-31.5664dBFS
期待      01:31:50.833-01:31:51.500  RMS=-32.8786dBFS
```

句首 `对` 给出确认姿态，但它不是句内最响处。最响的是第二个 `还有`。也就是说，#971 先确认，再追加。它不是说“期待已经解决了”，而是说“对，还有这笔东西在场”。

而 `期待` 本身在 #971 里很低。#970 的 `期待` 粗分 RMS=`-24.3476dBFS`，#971 的 `期待` 粗分 RMS=`-32.8786dBFS`，低约 `8.5310dB`。概念词第二次出现时没有被推成重音，反而退后。这很微妙：期待被确认了，但它的声音身体变小了。

所以 #971 的声音动作是：

```text
确认词进入；
追加词发力；
概念词退后；
期待被登记，而不是被放大。
```

画面上，#971 也不是显物。精确窗 43 帧仍在同一低顶空间里：左侧白衣黑下装人体垂立，右侧白衣人物/白色身体材料贴近半透明塑料/薄膜，暖橙光在薄膜上起伏。不能由可见身体反推说话人，也不能确认口型同步。

关键帧指标：

```text
971_start
luma=68.1888
warm_internal=0.907320
orange_internal=0.638772
neutral_internal=0.076195

971_mid
luma=57.2239
warm_internal=0.353994
orange_internal=0.225978
neutral_internal=0.518250

971_end
luma=74.2013
warm_internal=0.973082
orange_internal=0.543881
neutral_internal=0.008971
```

这不是一路变亮。#971 开始时暖橙和薄膜仍然很强，句中退灰，句尾又回暖。画面像做了一次呼吸：确认发生了，但现场没有被确认成一个对象。薄膜和光继续承压，身体继续遮挡，期待仍然没有归属。

#971 之后到 #972 前，有一个很长的间隔：

```text
971_to972_gap
duration=7.566s
RMS=-40.0340dBFS
Peak=-23.3390dBFS
centroid=6274.8956Hz
250-1000Hz=0.332258
4-12kHz=0.117802
12-20kHz=0.259565
```

这段比 #970 到 #971 前间隔还低约 `0.6269dB`，但 `silencedetect -35dB:d=0.3` 没有输出 silence event。它不是绝对静音，而是更长、更低的非静音等待。#971 把期待确认后，电影没有马上解释它，而是让现场沉下去。

这段长等待的画面很关键。它不是空白，而是让观看场慢慢露出来：

```text
5513.000  luma=56.1327  warm=0.318073  orange=0.120474  neutral=0.536151
5515.283  luma=75.0448  warm=0.035952  orange=0.015979  neutral=0.894608
5518.500  luma=37.9051  warm=0.103720  orange=0.055355  neutral=0.307906
5519.066  luma=37.1870  warm=0.038817  orange=0.021679  neutral=0.341132
```

在 #971 精确句里，主要是两个人、薄膜、暖光和低顶空间。到 #971 后的长间隔中，坐着的人群/观看者位置逐渐被看见；随后黑色前景遮挡压上来，#972 才从暗处重新入声。

这说明 #971 的确认不是把期待交给一个对象，而是把期待交给一个公开观看场。期待没有获得答案，却获得了环境。

#972 的预入声也很有用：

```text
#972 preview exact
RMS=-24.8493dBFS

#972 preview - #971_to972_gap = +15.1847dB
#972 preview - #971 exact = +3.3636dB
```

#972 `他有一种期待` 比 #971 更强。于是 #971 在整条链里的位置变得很清楚：

```text
#970：还有一种期待      -> 等待被命名
#971：对 还有一种期待   -> 命名被确认
#972：他有一种期待      -> 期待开始获得语法归属
```

注意，是“语法归属”，不是“身份裁决”。#972 的 `他` 还不能从 #971 的可见人物里直接反推。#971 到 #972 之间看见了观看者、薄膜、遮挡和黑色前景，但没有交出一个可以被直接命名为 `他` 的透明对象。写 #972 时必须继续守住这一点。

镜头层也不支持硬切。`01:31:46.033-01:32:00.400` 上下文 scene detect：

```text
threshold=0.015  仅起始边界附近有 pts_time=0.0416667
threshold=0.040  无 pts_time 命中
```

所以 #971 后不是换场，而是同一公开空间中的身体、薄膜、观看者和前景遮挡继续重新排列。

因此 #971 的稳定写法是：

```text
#971 不是期待对象出现。
它是 #970 期待命名后的“对”字确认；
声音上重新入声但低于 #970，
句内最响处在“还有”而不是“期待”；
画面中薄膜和暖光继续承压，长间隔把期待送进观看场；
#972 才开始把期待转向“他”，但仍不能提前裁决这个“他”的可见身份。
```

这句在梦像链里的作用，是把“未交对象的期待”登记为现场事实。登记以后，电影没有解决它，而是让它穿过观看场、遮挡和长等待，再进入下一句的 `他有一种期待`。

### #972｜阿蒙：他有一种期待

```text
T0：#972
时间：01:31:59.066-01:32:00.400
说话人：阿蒙 / ACT-AMENG
台词：他有一种期待
机制标签：第三人称归属 / 期待债务挂载 / 观看场遮挡 / 眼睛句前短隙
```

#972 必须从 #970 和 #971 后面读。#970 说：

```text
还有一种期待
```

#971 说：

```text
对 还有一种期待
```

到 #972，句子第一次变成：

```text
他有一种期待
```

这个变化不是简单换词。#970 的期待还没有主人，#971 只是确认它确实在场；#972 把期待挂到第三人称 `他` 上。期待从“现场里还有一种东西”变成“某个他有这种东西”。但电影很狡猾：它给了第三人称，却没有给第三人称的身份证。

所以 #972 的核心不是“他是谁”，而是“期待开始需要一个他”。这句话建立归属，但不完成身份裁决。

声音上，#972 从 #971 后的长等待里明显抬起：

```text
971_to972_gap
duration=7.566s
RMS=-40.0340dBFS

972_exact
duration=1.334s
RMS=-24.8493dBFS
Peak=-8.3306dBFS
centroid=5764.8772Hz
250-1000Hz=0.404829
4-12kHz=0.400070

#972 exact - #971_to972_gap = +15.1847dB
```

这说明 #972 不是噪底残响。它确实把期待重新推到前景，而且比 #971 更强：

```text
#971 exact RMS=-28.2129dBFS
#972 exact - #971 exact = +3.3636dB
```

但它还低于 #970：

```text
#970 exact RMS=-20.5467dBFS
#972 exact - #970 exact = -4.3026dB
```

这个强弱关系决定了 #972 的位置。#972 不是期待链的声学最高点，也不是音乐高潮。它是长等待之后的归属入口：声音更强，是因为句法开始指向 `他`；但它没有强到把 #970 的第一次期待命名压过去。

更细地拆句内，#972 的声学力点也不在 `他` 本身：

```text
他        01:31:59.066-01:31:59.316  RMS=-24.3499dBFS  centroid=777.3040Hz
有一种    01:31:59.316-01:31:59.833  RMS=-24.0365dBFS  centroid=8280.4519Hz
期待      01:31:59.833-01:32:00.400  RMS=-26.0492dBFS  centroid=1330.1517Hz
```

`他` 的 250-1000Hz 占比达到 `0.921400`，是一个低中频指称锚。它把句子立起来，但不把身份照亮。最亮的是 `有一种`：4-12kHz 占比 `0.552056`，12-20kHz 占比 `0.220694`，全句最强 50ms 也在这个区域。也就是说，#972 的声音不是在强调“那个人是谁”，而是在强调“他有 / 他持有 / 他被归属了一种东西”。

`期待` 本身 RMS=`-26.0492dBFS`。它比 #971 的 `期待` RMS=`-32.8786dBFS` 高约 `6.8294dB`，说明期待词从 #971 的低位退后中返回；但它仍比 #970 的 `期待` RMS=`-24.3476dBFS` 低约 `1.7016dB`。所以期待被重新放进句子中心，但没有成为新的声学顶点。

可以把 #972 的声音动作写成：

```text
他       -> 低中频指称锚；
有一种   -> 最亮的持有/分类动作；
期待     -> 回到前景，但不成为全链条峰值。
```

画面上，#972 更不能直接裁决 `他`。#972 精确窗 33 帧非常暗、非常灰：

```text
972_start
luma=37.1856
dark_ratio_lt45=0.718740
warm_internal=0.048683
orange_internal=0.000001
neutral_grey_ratio_internal=0.970003

972_mid
luma=38.2073
dark_ratio_lt45=0.691789
warm_internal=0.087714
orange_internal=0.003993
neutral_grey_ratio_internal=0.949398

972_end
luma=39.3650
dark_ratio_lt45=0.669271
warm_internal=0.215850
orange_internal=0.013279
neutral_grey_ratio_internal=0.908607
```

跟 #971 的暖橙薄膜起伏相比，#972 明显转向低亮、中性灰和黑色遮挡。画面中央偏左有一大块黑色前景遮挡，像一块帘幕或柱子，把场域切开。白衣/白布身体坐在平台边缘，主要以背部和侧身出现；右侧是一组坐着的观看者；后方仍是半透明塑料/薄膜；地面和平台继续反光。

这些都不能直接回答 `他是谁`。白衣身体不提供口型，不能改派说话人。右侧黑衣男人和其他观众可见，但没有被镜头用特写、对焦或剪辑锁成 `他`。左侧黑色遮挡边缘到句尾还露出一张局部侧脸，这个细节很重要：#972 的观看场不只在右侧，遮挡后面也有被压住的观看位置浮出来。可是这张脸同样不是身份答案。

所以 #972 的画面逻辑是：第三人称出现时，身份不是变清楚，而是被更多遮挡和更多观看位置包围。`他` 被现场推出，但不被现场交出。

#972 结束后到 #973 前，只有 `0.500s`：

```text
972_to973_gap
duration=0.500s
RMS=-40.1097dBFS
Peak=-20.4120dBFS
centroid=3342.8532Hz
```

`silencedetect -35dB:d=0.3` 对 #972 精确窗、#972 到 #973 短隙、#972-#973 上下文和 #971-#973 上下文都没有输出 silence event。这里不是绝对静音，也不是切换场。它只是短暂低能退后，让 #973 接上。

#973 预入声：

```text
973_preview_exact
duration=1.400s
RMS=-26.0576dBFS
Peak=-12.2255dBFS
centroid=848.3454Hz
250-1000Hz=0.747794

#973 preview - #972 exact = -1.2083dB
#973 preview - #972_to973_gap = +14.0521dB
```

#973 比 #972 略低，但从短隙里明显重新抬起，而且频谱降到低中频的集体压力。语义上也很连贯：`他有一种期待` 后面马上是 `每一双眼睛都在看着我`。期待没有停在 `他` 这里，它马上变成观看压力。

镜头检测也不支持硬切。`01:31:51.500-01:32:02.300` 上下文：

```text
threshold=0.015  仅起始边界附近有 pts_time=0.0416667
threshold=0.040  无 pts_time 命中
```

所以 #972 和 #973 是同一公开空间内部的连续重排，不是换场后重新开始。

MiMo 后补复跑也要这样降级读。新 key 改走标准 API endpoint 后，`01:31:59.066-01:32:02.300` 报告成功，见 [MiMo-4K无字幕第972他有一种期待到973每一双眼睛标准API复跑-2026-06-22](/research/hs-1e1bf98b962adf09)。可保留的是同一静态观看场、半透明塑料/薄纱、黑色前景遮挡、平台、右侧观看者群、手机微光候选和后一句声源距离感；不能采用的是它对台词和人称的误听。它漏掉 #972 的 `他`，又把 #973 的 `看着我` 误成“看着你”，所以它不能替代 T0，也不能裁决 `他` 的身份、说话人或口型同步。

因此 #972 的稳定写法是：

```text
#972 把 #970/#971 的无主期待改写成第三人称期待。
但 `他` 只是语法归属位，不是可见身份答案。
声音上，#972 从长低能等待里强入，比 #971 更响，但低于 #970；
句内最亮的是 `有一种`，不是 `他`。
画面上，黑色遮挡、白衣侧背、观众群、左侧边缘脸和塑料薄膜共同组成观看场；
它们制造第三人称压力，却不交出第三人称身份。
#973 随即把这笔期待转成 `每一双眼睛都在看着我`。
```

这句在梦像链里的作用，是把“期待”从无主压力推进到第三人称归属，但又立刻证明归属不等于拥有。`他` 被说出来，身份仍不归我们。

### #973｜阿蒙：每一双眼睛都在看着我

T0：

```text
#973
01:32:00.900-01:32:02.300
阿蒙：每一双眼睛都在看着我
```

这句必须接着 #972 读。#972 说：

```text
他有一种期待
```

它刚刚把期待挂到第三人称 `他` 上，但没有交出 `他` 的可见身份。#973 立刻把这笔第三人称期待改写成第一人称压力：

```text
每一双眼睛都在看着我
```

这不是“眼睛被拍出来”。恰恰相反，4K 画面没有给眼睛特写，也没有给一个独立眼睛物件。它保留的是一个观看场：黑色前景遮挡、左侧边缘脸/持杯动作、中央白衣侧背身体、右侧坐着的观看者、手机或发光物候选、半透明塑料/薄纱。台词说 `每一双眼睛`，画面给的却是这些分散的观看位置。

所以 #973 的动作不是显影，而是总称化。它把分散在场内的观看位置压成“每一双眼睛”。

声音上，#973 并没有比 #972 更响：

```text
#972 exact RMS=-24.8493dBFS
#973 exact RMS=-26.0576dBFS

#973 exact - #972 exact = -1.2083dB
```

这条关系很关键。#973 不是 #972 后的声学高潮。#972 完成的是“期待被第三人称化”；#973 完成的是“第三人称期待被压回第一人称被看”。它比 #972 略低，反而说明这不是一条越喊越高的情绪线，而是一条语法和观看关系的换轨。

但 #973 明显强于后面的 #974：

```text
#973 exact RMS=-26.0576dBFS
#974 exact RMS=-30.9143dBFS

#973 exact - #974 exact = +4.8567dB
```

这说明 `每一双眼睛都在看着我` 是前景压力，`你在干嘛呢` 是紧接着的低一点、短一点的追问。#974 不是把 #973 再推成更高音量，而是把“我被看”翻到另一个方向：`你` 正在做什么。

句内粗分更细：

```text
每一双      duration=0.433s  RMS=-25.2185dBFS  Peak=-13.1829dBFS
眼睛都      duration=0.500s  RMS=-25.6946dBFS  Peak=-12.2255dBFS
在看着我    duration=0.467s  RMS=-27.5508dBFS  Peak=-13.2618dBFS
```

最强的 50ms 在 `每一双` 内，最高峰在 `眼睛都`，`在看着我` 反而更低。这让 #973 的写法要再收紧一点：它不是单纯强调 `我`，而是先强调观看者的全体化，再把这个全体压到 `我` 身上。

可以把声音动作写成：

```text
每一双   -> 数量/总称被推出
眼睛都   -> 观看器官被集体化
在看着我 -> 集体观看落到第一人称身体
```

画面上，#973 仍处在低亮中性灰场：

```text
973_start luma=37.9845 dark=0.702362 neutral=0.857365
973_mid   luma=38.6861 dark=0.689049 neutral=0.874757
973_end   luma=39.3588 dark=0.664018 neutral=0.662024
```

这不是一个把眼睛照亮的画面。黑色遮挡仍然压在左侧，白衣侧背身体仍然坐在平台边缘，右侧观看者仍然被保留在暗处。左侧遮挡边缘的脸和抬手/杯子候选很重要：它说明观看位置不只在右侧观众席，也在遮挡边缘和半隐藏处。可是这些位置都没有被拍成清晰眼睛。

所以 `每一双眼睛` 在画面里的对应物，不是眼睛本身，而是观看位置的集合：

```text
左侧边缘脸
+ 黑色遮挡
+ 中央被观看身体
+ 右侧观看者
+ 手机/发光物候选
+ 半透明塑料背景
= 观看场
```

这里仍然不能改派说话人。MiMo 在 #973-#974 短片段里把中央白衣可见人物判成说话人，并写成口型同步；但本地 T1 不支持把可见身体直接当作声源。T0 锁定 #973 为阿蒙声道，MiMo 的人物/口型判断必须降级。

#973 到 #974 几乎没有视觉断裂：

```text
973_to974_delta mean_abs_rgbdiff=0.0000
```

因此 #974 `你在干嘛呢` 不是换场后的另一个话题，而是贴着 #973 来的反问。#973 说的是：

```text
我被每一双眼睛看着
```

#974 立刻变成：

```text
你在干嘛呢
```

这一步像是把被观看压力外翻成对观看/记录/在场行为的追问。MiMo 看到右侧手机或发光物候选，这个观察可以作为 T2 提示；但不能直接写成 #974 的 `你` 就是手机持有者，也不能写成观看行为已经被画面裁决。

接下来 #974 到 #975 前，有一个 `7.267s` 的长间隔：

```text
974_to975_gap
duration=7.267s
RMS=-40.1526dBFS
Peak=-18.4256dBFS
centroid=9457.4951Hz
```

`silencedetect -35dB:d=0.3` 对 #973 精确窗、#973-#974 对照、#974 到 #975 前长间隔和 #972-#975 上下文都没有输出 silence event。这里不是绝对静音，也不是音乐转场。它是低能现场底噪、材料声和视觉换载组成的等待。

视觉上，这段间隔把 #973/#974 的低亮灰观看场送向 #975 的更亮暖场：

```text
974_end   luma=47.1988 dark=0.521050 warm=0.009580
gap_mid   luma=49.1314 dark=0.346619 warm=0.001800
975_start luma=69.1804 dark=0.047764 warm=0.740760
```

`threshold=0.040` 的 scene detect 没有强命中；`threshold=0.015` 只在 #974 到 #975 前长间隔里给出一次低阈值变化。所以不要写强硬切。更准确的是：长间隔里发生视觉换载/遮挡改构图，最终把现场送到 #975 附近的暖亮近身场。

这样 #973 到 #975 的链条就很清楚：

```text
#972 他有一种期待
-> #973 每一双眼睛都在看着我
-> #974 你在干嘛呢
-> 7.267s 低能非静音视觉换载
-> #975 他们肯定都特别想要说话
```

#973 的 `每一双眼睛` 到 #975 变成 `他们`；#973 的 `看着我` 到 #975 变成 `想要说话`。电影把视觉压力转译成发声压力。观看者不只是眼睛，他们很快会被说成“想说话的人”。但这仍然不是心理事实。#975 还要继续复核，不能提前写成所有观众真的想说话。

MiMo 标准 API 两次复跑见 MiMo-4K无字幕第973每一双眼睛到975他们想说话标准API复跑-2026-06-22（馆内参考，未随本文公开）。可保留的是：同一观看场、左侧边缘喝水/持杯候选、右侧手机/发光物候选、无眼睛特写、无音乐、#974 紧接 #973、#974 后进入低能过渡。不能采用的是：白衣可见人物即说话人、口型同步、性别/身份裁决、硬切和心理动机。完整本地复核见 [2026-06-22-4K无字幕母文件开场92分00秒到92分12秒第973每一双眼睛与974你在干嘛呢到975说话压力前奏复核](/research/hs-7c707146744ba0ef)，综合页见 [4K无字幕重启细读-92分00秒到92分12秒-每一双眼睛把第三人称期待压成被看压力并转向他们想说话-2026-06-22](/research/hs-8973412d4b54b50d)。

因此 #973 的稳定写法是：

```text
#973 把 #972 的第三人称期待立刻改写成第一人称被看压力。
声音先强在 `每一双` 和 `眼睛都`，再落到 `我`；
画面没有眼睛特写，只有左侧边缘脸、黑色遮挡、中央白衣身体、右侧观看者、手机微光候选和塑料背景组成的观看场。
#974 紧接着把 `我被看` 翻成 `你在干嘛呢`；
#974 后长低能非静音间隔再把观看压力送向 #975 的 `他们肯定都特别想要说话`。
```

这句在梦像链里的作用，是把“期待”从第三人称归属推进到公共观看压力。`他` 没有被解出是谁，`我` 也没有因此获得清晰声源；只有观看场被说成每一双眼睛。

### #974｜阿蒙：你在干嘛呢

T0：

```text
#974
01:32:02.333-01:32:03.733
阿蒙：你在干嘛呢
```

这句必须贴着 #973 读。#973 刚说：

```text
每一双眼睛都在看着我
```

#974 立刻问：

```text
你在干嘛呢
```

这不是一个让我们急着找出 `你` 的问句。更稳的读法是：#974 把 #973 的被看压力外翻成行动追问。#973 说的是“我被每一双眼睛看着”；#974 马上转成“你正在做什么”。它把观看关系从第一人称身体翻到第二人称地址，但电影没有给这个 `你` 一个透明对象。

画面也支持这个边界。#973 末帧到 #974 起帧没有视觉断裂：

```text
973_end -> 974_start
mean_abs_rgbdiff=0.0000
diff_gt8=0.000000
```

所以 #974 仍在 #973 的观看场里：黑色垂挂遮挡、中央白衣可见身体、右侧坐着的观看者、左侧边缘人物和半透明塑料/薄膜仍然同场。它没有切到一个明确的 `你`，也没有把右侧手机/发光物候选升级成拍摄事实。这个 `你` 是一个被观看场挤出来的位置，不是一个已经被画面裁决的人。

声音上，#974 比 #973 低很多：

```text
#973 exact RMS=-26.0576dBFS
#974 exact RMS=-30.9143dBFS

#974 - #973 = -4.8567dB
```

这意味着 #974 不是声学升级。它不是在 #973 后更高地喊出来，而是把前一句的压力压低、缩短、反扣成一个问句。

#974 精确窗：

```text
duration=1.400s
RMS=-30.9143dBFS
Peak=-13.6614dBFS
centroid=4959.3044Hz
strongest50=-22.6691dBFS at 0.4789s
```

句内粗分很关键：

```text
你    duration=0.200s  RMS=-31.1730dBFS  Peak=-20.3015dBFS
在    duration=0.200s  RMS=-28.3935dBFS  Peak=-17.0369dBFS
干    duration=0.300s  RMS=-27.9802dBFS  Peak=-13.6614dBFS
嘛    duration=0.267s  RMS=-34.8410dBFS  Peak=-19.0941dBFS
呢    duration=0.433s  RMS=-35.3332dBFS  Peak=-19.8211dBFS
```

粗分不是音素学精确切分，但趋势非常清楚：最强处在 `干` 附近，句尾 `呢` 明显低下去。也就是说，这句的声学锋面不是疑问尾音，而是动作核。它不是把“呢”拖成情绪尾巴，而是把“正在干什么”这个行动问题推出来。

所以 #974 的声音动作可以写成：

```text
你   -> 地址被抛出，但声音不最强
在   -> 进行状态被抬起
干   -> 行动核成为声学重心
嘛/呢 -> 问句收束，尾部落低
```

这让 #974 和后面的 #979 形成一个很细的回声。#974 问：

```text
你在干嘛呢
```

#979 会说：

```text
我不知道我该干什么
```

原来被抛向 `你` 的 `干嘛`，最后回到 `我` 的 `该干什么`。这不是普通重复，而是地址回收：问别人正在做什么，最后变成自己不知道该做什么。

从 #974 到 #981 的每句声学对照更能说明这个回收：

```text
#974 你在干嘛呢                       RMS=-30.9143dBFS
#975 他们肯定都特别想要说话           RMS=-27.2006dBFS
#976 但是没有人 说出来                 RMS=-32.8810dBFS
#977 就你知道吗                       RMS=-23.6666dBFS
#978 平时我在这个时候都特别紧张       RMS=-26.0025dBFS
#979 我不知道我该干什么               RMS=-26.4011dBFS
#980 我也不知道我该说什么             RMS=-30.8377dBFS
#981 它有一种压力                     RMS=-28.7895dBFS
```

#974 不是这条链的能量峰。#977 `就你知道吗` 和 #978 `平时我在这个时候都特别紧张` 都比它强，#979 `我不知道我该干什么` 也比它高约 `4.5132dB`。这说明 #974 的重要性不在“响”，而在“开口方向”。它先把被看压力变成行动追问，后面再把这个追问吞回成行动瘫痪。

链条可以写成：

```text
#974 你在干嘛呢
-> #975 他们肯定都特别想要说话
-> #976 但是没有人 说出来
-> #979 我不知道我该干什么
-> #980 我也不知道我该说什么
-> #981 它有一种压力
```

这里有两个互相扣住的欠账：

```text
行动欠账：干嘛 -> 该干什么
发声欠账：想说话 -> 没有人说出来 -> 该说什么
```

#974 是行动欠账的入口，#975/#976 是发声欠账的入口，#981 把两条欠账共同命名成压力。

停顿也不能写成空白。`silencedetect -35dB:d=0.3` 对 #974 精确窗、#974 到 #976 上下文、#974 到 #981 长链都没有 silence event。#974 到 #975 前的低能间隔为：

```text
duration=7.267s
RMS=-40.1526dBFS
Peak=-18.4256dBFS
centroid=9457.6200Hz
strongest50=-28.1852dBFS at 6.7685s
```

这里不是绝对静音，也不是音乐转场。更稳的写法是：低能现场底噪、材料声/脚步声候选和视觉换载继续拖住现场。#976 说 `但是没有人 说出来`，但声音层并没有清空；“没有人说出来”和“现场仍在发声”同时成立。这一点很重要，文本上的沉默不等于声学上的空白。

视觉上，#974 之后空间会发生换载。#974 到 #975 起点：

```text
974_end   luma=47.1988  warm=0.055107
975_start luma=69.1804  warm=0.838433
974_end -> 975_start mean_abs_rgbdiff=29.7275 diff_gt8=0.882755
```

#975/#976 转向更暖、更近的低角度脸部/上半身场；#979/#980/#981 又把空间拉开到塑料薄膜、暖橙灯光、站立人物、设备和坡道/高处。MiMo 在这里可作 T2 补盲：它能看见塑料薄膜、灯光、设备和记录现场持续出现，也支持没有音乐证据。但它的台词转写、声音性别、可见人物身份、口型同步、脚步来源和硬切判断都不能采用。

MiMo 的误差反而有用：短链报告把声音和人物身份写得太确定，长链视频报告又说无清晰对话，音频报告把部分词听错。这说明 #974 这种低位问句很容易被模型误归因；真正稳定的底盘还是 T0 台词账和本地 T1 声画指标。

#974 和 [偷入关系](/research/hs-6891095e2239eafa) 的关系很紧。表面上它是二人称问句：

```text
你在干嘛呢
```

但这个 `你` 被摄影机、现场观看者、手机/发光物候选、未来观看者和我们这些复看者共同占着。它不再只是一个亲密对话对象。摄影机把第三位置偷入到 `你` 里面，让问句失去唯一收件人。

也因此，#974 不是 #973 的简单后续，而是一个结构翻面：

```text
被看压力 -> 行动追问
行动追问 -> 行动瘫痪
想说话 -> 说不出
说不出 -> 不知道该说什么
不知道该干什么/说什么 -> 压力
```

完整本地复核见 [2026-06-22-4K无字幕母文件开场92分02秒到92分38秒第974你在干嘛呢与干什么说什么压力链复核](/research/hs-5c2655917b55dcc7)，MiMo 降级复核见 [MiMo-4K无字幕第974你在干嘛呢到981压力链标准API复跑-2026-06-22](/research/hs-b06cdf9c2eeb805f)，综合页见 [4K无字幕重启细读-92分02秒到92分38秒-你在干嘛呢把被看压力翻成干什么说什么压力链-2026-06-22](/research/hs-aac759e7cf62c5ac)。

因此 #974 的稳定写法是：

```text
#974 紧接 #973，并不裁决一个具体的 `你`。
它把 `每一双眼睛都在看着我` 的被看压力低位翻成 `你在干嘛呢` 的行动追问。
句内最强在 `干` 附近，句尾 `呢` 落低；
画面仍在同一观看场，不交手机拍摄事实、口型同步或具体对象。
后面 #979 `我不知道我该干什么`、#980 `我也不知道我该说什么` 和 #981 `它有一种压力`
把这句短问吞回成阿蒙自己的行动/发声压力。
```

这句在梦像链里的作用，是把“被看”从一个视觉压力推进为行动压力。眼睛没有被画面交出，`你` 也没有被画面交出；真正被交出的，是现场开始追缴人物应该做什么、应该说什么。

### #975｜阿蒙：他们肯定都特别想要说话

T0：

```text
#975
01:32:11.000-01:32:12.900
阿蒙：他们肯定都特别想要说话
```

这句要从两个方向同时读。一个方向往前：#973 说 `每一双眼睛都在看着我`，#974 问 `你在干嘛呢`。另一个方向往后：#976 立刻接 `但是没有人 说出来`，#980 又说 `我也不知道我该说什么`。所以 #975 不是孤立的心理判断，而是在“眼睛/干嘛/说话/说不出”这条链上，第一次把观看压力明确说成发声压力。

最小链条是：

```text
#973 每一双眼睛都在看着我
-> #974 你在干嘛呢
-> #975 他们肯定都特别想要说话
-> #976 但是没有人 说出来
-> #980 我也不知道我该说什么
-> #981 它有一种压力
```

这里的 `他们` 很重要。它不是从天上来的代词，而是从 #973 的 `每一双眼睛` 压缩过来的。#973 还说的是观看器官：眼睛。#975 已经把观看器官改成了群体代词：他们。换句话说，电影把“看着我的每一双眼睛”变成“他们”。观看者不再只是眼睛，而被说成一个可能要说话的集体。

但这不能直接写成“所有观众真的想说话”。#975 的句法很确定，声画却不把这个确定性升级成心理事实。T0 锁定这是阿蒙的话；它是阿蒙在现场中对压力的命名和推断，不是每一个被称作 `他们` 的人的内心自述。

声音证据把这个边界钉得很硬。#975 全句：

```text
duration=1.900s
RMS=-27.2006dBFS
Peak=-9.8985dBFS
centroid=5789.7275Hz
strongest50=-15.7134dBFS at 0.080s
```

如果只看整句，会以为它只是 #974 后相对抬高的一句。但句内粗分一拆，真正的结构就出来了：

```text
他们    duration=0.333s  RMS=-21.2759dBFS  Peak=-9.8985dBFS
肯定    duration=0.400s  RMS=-27.3120dBFS  Peak=-13.0664dBFS
都      duration=0.200s  RMS=-30.0319dBFS  Peak=-18.5660dBFS
特别    duration=0.400s  RMS=-34.9008dBFS  Peak=-19.5476dBFS
想要    duration=0.300s  RMS=-38.2791dBFS  Peak=-26.0919dBFS
说话    duration=0.267s  RMS=-40.7980dBFS  Peak=-29.6164dBFS
```

最强的是 `他们`，不是 `说话`。而且后面几乎是一路退低：`肯定` 已经比 `他们` 低，`想要` 更弱，真正的 `说话` 是全句最弱段。这就让 #975 的意义发生了反转。它表面上在说“他们很想说话”，声音却把最大能量给了“他们”这个集体位置，而不是“说话”这个动作。

所以这句不能写成：

```text
说话欲望终于爆发。
```

更准确的是：

```text
集体位置被声音推出；
说话欲望被语法说出；
但说话动作在句尾退低。
```

`肯定` 也要慢一点读。它在语法上非常强，好像阿蒙已经确定了他们想说话；但它在声学上低于 `他们` 约 `6dB`，而且画面没有把每一个 `他们` 的心理打开给我们。`肯定` 在这里更像一种压力下的强判断：阿蒙把沉默群体的可能欲望替他们说了出来。确定性在语法里，证据不在画面里。

`都` 把 `他们` 推成全体化。它让这个判断不只是“有人想说”，而是“他们都想说”。但 `都` 的 RMS 继续降低到 `-30.0319dBFS`。全体化被说出，声音却不把它扩成更大的合唱或群声。没有多人开口，没有群体声，没有观众席回声。一个人声把群体说出来，群体本身仍然不说。

`特别` 是程度词。按普通语感，它应该把欲望推得更强；但它只有 RMS=`-34.9008dBFS`。程度词没有制造声学高潮，反而继续退。这里的“特别”像把强度写在语法上，而不是写在声音事件上。

`想要` 比 `特别` 更弱。它是欲望动词，但在声音里开始变薄。电影让“想”成为一个被说出来的东西，不让它成为可听的冲动。欲望是被阿蒙陈述出来的，不是被 `他们` 自己发声出来的。

最后的 `说话` 最弱，RMS=`-40.7980dBFS`。这几乎是整句最尖锐的地方：句子要到“说话”这个词时，声音已经退到低位。所谓“想要说话”，在声学上恰恰是说话的撤退。它不是说话开始，而是说话仍未获得发生条件。

画面上，#975 是低角度近身场。可见一位穿白色竖纹/褶纹衣服的短发人物，人物位于画面上方，背景有暖粉/灰色上方空间，右侧有半透明塑料或薄膜边界。这个画面很容易把我们推向一个错误：看见一个人，就把话归到这个人嘴里；看见一个无言身体，就把它写成 `他们` 的代表。

但边界必须守住。T0 锁定 #975 为阿蒙声道；本地 T1 不支持可靠口型同步；MiMo 对声音性别和可见人物身份前后不一致。可写的是：

```text
低角度白衣近身人物成为说话压力的视觉承载面。
```

不能写：

```text
可见白衣人物就是说话人。
这个人的口型证明了 #975。
这个人就是 `他们` 的心理代表。
```

密帧差分也说明 #975 内部不是硬切：

```text
frame_count=46
mean_of_mean_abs_rgbdiff=2.4430
max_mean_abs_rgbdiff=3.0703
```

也就是说，这句发生在一个连续的低角度近身变化里，不是靠切换镜头来制造结论。#975 到 #976 起点的差分也不强：

```text
975_end -> 976_start mean_abs_rgbdiff=7.3119
```

所以 #976 不是另起一个世界来否定 #975，而是在同一近身/上方空间里接着把它压低。#976 说：

```text
但是没有人 说出来
```

#975 到 #976 的短隙：

```text
duration=0.433s
RMS=-38.8779dBFS
Peak=-24.4285dBFS
```

#976 全句：

```text
duration=1.867s
RMS=-32.8810dBFS
Peak=-16.8467dBFS
```

#976 比 #975 低约 `5.6804dB`。所以它是一个降声反句。#975 把“他们想说话”推出来，#976 马上说“但没有人说出来”。这不是补充说明，而是把 #975 的全部语义拉进矛盾：想说话和说出来之间没有顺利过渡。

更细地看，#976 内部也没有把 `说出来` 推成强点：

```text
但是      RMS=-29.8258dBFS
没有人    RMS=-32.3971dBFS
内部间隙  RMS=-40.4596dBFS
说出来    RMS=-35.6438dBFS
```

`说出来` 仍然弱。也就是说，#975 里的 `说话` 弱，#976 里的 `说出来` 也弱。两个句子的尾部都没有真正把说话动作抬出来。电影连续两次让“说”成为语义中心，却不是声学中心。

停顿不能被写成死寂。`silencedetect -35dB:d=0.3` 对 #975 精确窗、#975-#976 对照和 #975-#981 压力链都没有 silence event。#975 到 #976 的短隙低，但不是空；#976 内部有短间隙，但不是绝对静音。这里最稳的句子是：

```text
没有人说出来，不等于现场没有声音。
```

这句话对整段非常关键。影片把“没有人说出来”和“声音仍然存在”放在一起。声场没有清空，音乐也没有进来接管情绪。没有旋律、节拍、配器或配乐高潮；只有低能现场底噪、材料/空间声候选和人声的退低。说话没有发生，但压力没有消失。

这也解释了为什么 #980 会回到：

```text
我也不知道我该说什么
```

#975 的 `他们想说话` 表面指向别人，#976 说别人没有说出来，#980 却把这件事回收到 `我`：我也不知道我该说什么。`他们` 的说话压力并没有停留在他们身上，而是绕回阿蒙自己的发声欠账。

所以 #975/#976 的稳定结构是：

```text
他们 -> 集体位置
肯定 -> 阿蒙的强判断
都 -> 全体化
特别 -> 程度加压
想要 -> 欲望被说出
说话 -> 声学退低
但是 -> 反句开关
没有人 -> 群体发声失败
说出来 -> 说的动作继续退低
```

在 [公共梦像接力](/research/hs-67011f206dcaaad5) 里，#975 是梦像链转向语言义务的一枚钉子。前面很多词都是“物被说出而物不显影”：车站、包、桃子、空气、奇怪东西、期待、眼睛。到 #975，未显影的已经不是一个物，而是说话本身。`说话` 被说出来，但说话不发生。

在 [说话权被系统接管](/research/hs-23c2dec5963ea385) 里，#975/#976 是一个早期压力形态。它还不是后面明确的 `你说话呀`、`需要我帮你说吗`、`说`、代说；但结构已经出现：说话被公共现场提出为义务，实际发声却没有落到任何一个人嘴里。系统不需要马上抢走某个人的话，只要让“大家都应该说”与“没人说出来”同时成立，压力就已经开始工作。

在 [被观看](/research/hs-bdc3e21c0c33b579) 里，#975 表明观看不会停留在眼睛。被观看之后，人物不仅要承受目光，还会被想象成有话要说；沉默也不再只是沉默，而会被阿蒙替它命名为“想说话”。这很残酷：连没有说出来，也会被解释成一种想说。

完整本地复核见 [2026-06-22-4K无字幕母文件开场92分11秒到92分15秒第975他们肯定都特别想要说话与976没有人说出来复核](/research/hs-c7a7c10700ce33b9)，MiMo 降级复核见 [MiMo-4K无字幕第975他们想说话到976没人说出来标准API复跑-2026-06-22](/research/hs-476b96930e9625f4)，综合页见 [4K无字幕重启细读-92分11秒到92分15秒-他们想说话把每一双眼睛改成说话压力但说话本身退低-2026-06-22](/research/hs-8f27551cada41aa5)。

因此 #975 的稳定写法是：

```text
#975 把 #973 的 `每一双眼睛` 改写成 `他们`，把被看压力改写成说话压力。
但声音最强在 `他们`，最弱在 `说话`；
所以它不是说话欲望爆发，而是集体位置被推出、说话本身退低。
#976 `但是没有人 说出来` 低于 #975，但不是绝对静音；
影片让“没有人说出来”和“现场仍然有声音”同时成立。
```

### #976｜阿蒙：但是没有人 说出来

```text
T0：#976
时间：01:32:13.333-01:32:15.200
说话人：阿蒙 / ACT-AMENG
台词：但是没有人 说出来
机制标签：流程规则 / 退出反证 / 声音代说
```

#976 不能只当成 #975 的脚注。#975 说 `他们肯定都特别想要说话`，#976 立刻说 `但是没有人 说出来`。它确实反扣前一句，但反扣不是把前一句取消，而是把“想说话”和“说出来”之间的断裂单独立起来。

这一小段的稳定链条是：

```text
#975 他们肯定都特别想要说话
-> #976 但是没有人 说出来
-> 6.066s 低能非静音等待
-> #977 就你知道吗
```

所以 #976 的功能不是结束说话压力，而是把压力从“大家想说话”推向“没有一个人能把话说出来”。这一步很微妙：文本上出现的是无人说出，声音层却没有清空。影片不是用一段绝对静音证明“没人说”，而是让低位现场声继续存在，让“没有人说出来”漂在一个仍然发声的空间里。

声音上，#976 全句为：

```text
duration=1.867s
RMS=-32.8810dBFS
Peak=-16.8467dBFS
centroid=5494.4722Hz
strongest50=-24.7219dBFS @0.375s
```

和 #975 相比，它低了约 `5.6804dB`。但这还不够细。真正关键的是句内强弱并不跟语义重心一致：

```text
但是        duration=0.400s  RMS=-29.8258dBFS  Peak=-17.8192dBFS
没有人      duration=0.600s  RMS=-32.3971dBFS  Peak=-16.8467dBFS
内部间隙    duration=0.200s  RMS=-40.4596dBFS  Peak=-28.2398dBFS
说出来      duration=0.667s  RMS=-35.6438dBFS  Peak=-22.3606dBFS
```

最强的粗分块不是 `说出来`，而是 `但是`。`但是` 像一个很轻的开关，把 #975 刚推出的集体说话欲望折回来；`没有人` 继续下降；中间有一个很短的低位间隙；到 `说出来` 时，声音仍然弱。也就是说，#975 里最弱的是 `说话`，#976 里 `说出来` 仍然没有被推成声学中心。电影连续两次把“说”放到语义中心，却都没有让它成为声音中心。

这对 声音-音乐场（馆内参考，未随本文公开） 很重要。这里不是“沉默作为效果音”，也不是“音乐把说不出口包起来”。`silencedetect -35dB:d=0.3` 对 #976 精确句、#976 到 #977 的 `9.100s` 上下文，以及 #976 到 #981 的 `25.100s` 压力链都没有 silence event。#976 内部的 `0.200s` 低位间隙太短，也不能被写成独立静音。最稳的声音句法是：

```text
台词说没有人说出来；
声场没有撤空；
说话失败不是静音，而是低能持续现场里的一个未完成动作。
```

#976 后到 #977 前的等待也不能写成空白。这个间隔为 `6.066s`：

```text
RMS=-37.2881dBFS
Peak=-12.7570dBFS
centroid=9719.4914Hz
strongest50=-28.4011dBFS @5.100s
```

它很低，但不是无声。更有意思的是，这个最强短窗靠近 #977，像是在 #977 入声前把声场略微托起来。到了 #977 精确句：

```text
#977 就你知道吗
duration=1.167s
RMS=-23.6666dBFS
Peak=-8.4154dBFS
strongest50=-15.0051dBFS
```

#977 比 #976 高约 `9.2144dB`，比 #976 到 #977 前的等待高约 `13.6215dB`。所以 #977 不是平滑接上一个低声尾巴，而是把 #976 的“说不出来”改造成另一个问题：既然没有人说出来，那“你知道吗”这个知道权从哪里回来？

视觉上，#976 精确窗内部非常稳定。密帧复核给出：

```text
frame_count=45
mean_of_mean_abs_rgbdiff=1.4504
max_mean_abs_rgbdiff=2.3231
max_diff_gt8_ratio=0.040417
```

这说明 #976 内部不是靠强切制造反句。可见的是低角度、白色衣物/竖褶、上方空间和近身关系继续维持；它可以作为近身场证据，不能升级为可见人物就是说话人，也不能拿来做口型同步。#976 起点、中点、终点的亮度/色彩状态确实有变化：

```text
976_start luma=69.4566  warm=0.930911
976_mid   luma=90.8140  neutral=0.999800
976_end   luma=94.5381  warm=0.714054
```

但真正明显的改构图发生在 #976 之后的等待里：

```text
976_end -> gap_mid mean_abs_rgbdiff=37.9172
scene threshold=0.040  无命中
scene threshold=0.015  低阈值提示约 01:32:16.291
```

所以也不能说 #976 本身由硬切完成。更稳的写法是：#976 在一个相对稳定的近身场里把说话压低；随后等待段发生低阈值视觉换载，把这句送向 #977 的更强入声。

在 [公共梦像接力](/research/hs-67011f206dcaaad5) 里，#976 是梦像链后段从“物不显影”转向“说话不完成”的关键小钉。前面很多句子是把车站、包、桃子、空气、奇怪东西、期待、眼睛说出来，但画面不交付；到 #975/#976，未交付的对象变成“说话本身”。不是蝴蝶不出现，不是桃子不出现，而是话没有从任何一个人那里出来。

在 [说话权被系统接管](/research/hs-23c2dec5963ea385) 里，#976 比 #975 更狠。#975 仍然像阿蒙替别人命名欲望，#976 则说这个欲望没有落到任何嘴里。说话义务已经被提出，发声位置却撤掉了。系统接管不一定先表现为一个明确命令，有时表现为这种无人完成的义务：大家应该说，但没有人说；没有人说，但声音场仍然把压力保留着。

在 [偷入关系](/research/hs-6891095e2239eafa) 里，#976 和 #977 的关系也要拆开。#977 `就你知道吗` 不是 #976 的解释完成，而是 #976 后的回返：没有人说出来之后，现场不转向“大家沉默”，而转向“你知道吗”。说不出口的问题，被换成知道权问题。这个换法非常关键，因为它让沉默不再是终点，而成为下一轮关系逼问的入口。

完整本地复核见 [2026-06-22-4K无字幕母文件开场92分13秒到92分22秒第976但是没有人说出来与977知道权回返复核](/research/hs-d642935acf517337)，#975/#976 旧窗口降级复核见 [MiMo-4K无字幕第975他们想说话到976没人说出来标准API复跑-2026-06-22](/research/hs-476b96930e9625f4)，综合页见 [4K无字幕重启细读-92分13秒到92分22秒-没有人说出来不是静音而是把说话压力转成知道权回返-2026-06-22](/research/hs-8b25b321a35b3dcf)。

因此 #976 的稳定写法是：

```text
#976 把 #975 的“他们想说话”压成“没有人说出来”；
但“没有人说出来”不是声学静音；
`说出来` 仍弱，声场仍在；
句后低能等待把问题交给 #977 `就你知道吗`。
```

### #977｜阿蒙：就你知道吗

```text
T0：#977
时间：01:32:21.266-01:32:22.433
说话人：阿蒙 / ACT-AMENG
台词：就你知道吗
机制标签：偷入 / 回返
```

#977 不能只当成 #976 的“下一句”。它还要和 #966 并读，因为 #966 已经出现过同一句：

```text
#966 阿蒙：就你知道吗
#977 阿蒙：就你知道吗
```

两次同句的位置完全不同。#966 的前文是 #965：

```text
我就知道 你一来找我什么都知道
-> 就你知道吗
```

那时 #966 把 `你什么都知道` 反扣成知道权争夺。#977 的前文则是：

```text
他们肯定都特别想要说话
-> 但是没有人 说出来
-> 就你知道吗
```

这一次，`就你知道吗` 从“没人说出来”后面回来。它不是单纯重复 #966，而是把无人说出的压力转成新的二人称逼问：既然没人说出来，那你知道吗？

声音上，#977 比 #966 更响：

```text
#966 就你知道吗
duration=1.233s
RMS=-26.8328dBFS
Peak=-10.1089dBFS

#977 就你知道吗
duration=1.167s
RMS=-23.6666dBFS
Peak=-8.4154dBFS
```

#977 比 #966 高约 `3.1662dB`，时长还略短。这不是弱回声，而是同一句话的加压回返。

句内粗分更关键：

```text
就你      duration=0.400s  RMS=-21.6831dBFS  Peak=-8.4154dBFS
知道吗    duration=0.767s  RMS=-25.2274dBFS  Peak=-9.6526dBFS
```

最强不在 `知道吗`，而在 `就你`。所以 #977 的声学重心不是“知识内容被确认”，而是二人称地址被钉住。`知道` 的词义当然重要，但声音先把 `就你` 推到前景。它问的不是一个可回答的知识题，而是把 `你` 这个位置重新压进现场。

#976 到 #977 前的 `6.066s` 等待已经很低，但不是空。#977 一入声，就比前等待高约 `13.6215dB`。这是一种强入声，但不能写成“打破绝对静音”。#976 说没人说出来，声音场没有撤空；#977 回来，声音场也不是从真空里爆开，而是从低能等待里把地址钉回来。

#977 后到 #978 前还有 `1.967s` 等待：

```text
duration=1.967s
RMS=-40.6991dBFS
Peak=-24.3014dBFS
strongest50=-37.5999dBFS @1.900s
```

它很低，最强短窗靠近 #978 入声前。`silencedetect -35dB:d=0.3` 对 #977 精确句、#977 到 #978 间隔、#977 到 #978 上下文和 #977 到 #981 压力链均没有 silence event。因此这里仍然是低能非静音等待，不是绝对静音、音乐收束或段落结束。

这让 #977 被夹在两个低能等待之间：

```text
6.066s 低能非静音等待
-> #977 强入声：就你知道吗
-> 1.967s 低能非静音等待
-> #978 平时我在这个时候都特别紧张
```

#977 是一枚短钉。它把 #976 的“说不出来”钉到 `你`，再把这个 `你` 交给 #978 的“紧张”。

画面上，#977 精确窗内部稳定：

```text
frame_count=30
mean_of_mean_abs_rgbdiff=1.6045
max_mean_abs_rgbdiff=2.2513
max_diff_gt8_ratio=0.032839
```

这不是强硬切。起始帧仍是低角度白衣/竖褶近身场：下半脸边缘、颈部和白色衣物被放得很大，左下有一个绿色小光点。嘴部并不完整，不能作为逐音口型同步证据；绿色光点也只能作为空间/设备提示，不能直接裁决成手机或某个具体装置。

句内静帧显示画面略微退暖、变中性、变暗：

```text
977_start luma=70.1938  warm=0.481270  neutral=0.659677
977_mid   luma=68.8723  warm=0.519025  neutral=0.668017
977_end   luma=63.9731  warm=0.162668  neutral=0.964403
```

到 #977 后等待和 #978 起点，画面慢慢露出白色衣物下摆、手/皮肤、黑色衣物、透明塑料、远处强光、暖橙斜光和站立者/观看者候选。这个变化很重要：声音说 `就你知道吗`，画面却不把 `你` 交给一张清楚的嘴、一张脸或一个固定对象。它让 `你` 留在白衣身体、绿点、塑料、灯光和观看场之间。

scene detect 也支持这个边界：

```text
threshold=0.040  无命中
threshold=0.015  只有低阈值提示
```

可以写低阈值改构图/换载，不能写硬切。#977 的力量来自声音把地址钉住，而不是画面把对象裁决出来。

和 #978 的关系尤其要守住。#978 `平时我在这个时候都特别紧张` 全句 RMS=`-26.0025dBFS`，比 #977 全句低约 `2.3359dB`，但 Peak 和 strongest50 更高：

```text
#977 Peak=-8.4154dBFS   strongest50=-15.0051dBFS
#978 Peak=-7.2602dBFS   strongest50=-13.8130dBFS
```

所以 #978 不是简单变小，而是把 #977 的短促地址压力拉成更长的自我状态。#977 问“就你知道吗”，#978 不回答“知道什么”，而说“我在这个时候特别紧张”。知识问题没有得到知识答案，它先被改写成身体/状态压力。

在 声音-音乐场（馆内参考，未随本文公开） 里，#977 是“二人称地址强入声”的样本。遇到 `你知道吗 / 你懂吗 / 你听见了吗` 这类句子，不能只看知识动词，也要看 `你` 是否被声音推到前景。#977 的最强块是 `就你`，说明地址本身是声学动作。

在 [偷入关系](/research/hs-6891095e2239eafa) 里，#977 说明 `你` 并不因为被喊出就拥有清楚对象。画面不给嘴，不给单一收件人，反而让 `你` 在白衣身体、绿点、塑料、灯光、站立者和观看场之间漂移。

在 [说话权被系统接管](/research/hs-23c2dec5963ea385) 里，#977 是 #976 的后果。无人说出不是流程停止，而是把未说出的部分换成知道权追缴。系统不需要马上替人说出内容，只要把 `你知道吗` 重新扔出来，发声债就继续存在。

完整本地复核见 [2026-06-22-4K无字幕母文件开场92分21秒到92分28秒第977就你知道吗与978紧张回收复核](/research/hs-53ac0e6c1f3e5a3e)，综合页见 [4K无字幕重启细读-92分21秒到92分28秒-就你知道吗第二次回返把无人说出转成紧张前的知道权逼问-2026-06-22](/research/hs-63f79338faa460cf)。

因此 #977 的稳定写法是：

```text
#977 是第二次 `就你知道吗`。
它比 #966 更响，且最强在 `就你`，不是 `知道吗`。
所以它不是知识事实确认，而是二人称地址的强回返。
#976 的无人说出没有让流程停止；
低能等待之后，现场把说不出的部分转成 `你知道吗`；
#978 又把这次逼问回收到 `特别紧张`。
```

### #978｜阿蒙：平时我在这个时候都特别紧张

```text
T0：#978
时间：01:32:24.400-01:32:27.966
说话人：阿蒙 / ACT-AMENG
台词：平时我在这个时候都特别紧张
机制标签：回返 / 回返自我
```

#978 紧接 #977 的 `就你知道吗`，但它没有回答“知道什么”。它说的是：

```text
平时我在这个时候都特别紧张
```

这句话表面上像阿蒙终于说出了心理状态：我紧张。可是如果只把它写成心理显影，反而会错过电影的细动作。#978 的关键词不只是 `紧张`，还有 `平时` 和 `这个时候`。它不是把一个私人心理突然端出来，而是把紧张放进一个会重复发生的时刻里：平时、到这个时候、都会紧张。

声音上，全句为：

```text
duration=3.566s
RMS=-26.0025dBFS
Peak=-7.2602dBFS
centroid=2096.2131Hz
strongest50=-13.7598dBFS @0.171s
```

句内粗切更关键：

```text
平时          duration=0.650s  RMS=-20.6525dBFS  Peak=-7.2602dBFS
我在          duration=0.900s  RMS=-27.7585dBFS  Peak=-12.2831dBFS
这个时候      duration=0.900s  RMS=-29.7867dBFS  Peak=-12.5398dBFS
都特别紧张    duration=1.116s  RMS=-30.9073dBFS  Peak=-15.3313dBFS
```

最响的不是 `特别紧张`，而是 `平时`。这会改变整句的重心。#978 不是把紧张喊成高潮，而是先把惯常性推出。`平时` 像一个时间开关，它让这句话从“我现在突然很紧张”变成“每次到这个位置，我都会进入这套状态”。

这也解释了为什么 #978 不能倒填为 #977 的心理真相。#977 问：

```text
就你知道吗
```

#978 不是说“我知道”或“我不知道”。它把知道权逼问折回到：

```text
我在这个时候会紧张。
```

因此 #978 是 #977 的回收，但不是 #977 的解释完成。#977 的强点在 `就你`，#978 的强点在 `平时`。两句连起来，稳定结构不是“你知道 -> 我紧张”，而是：

```text
地址被钉住
-> 时间位置被钉住
-> 紧张作为这个位置的惯常状态出现
```

它说出的不是透明心理，而是一种流程反应：到了这个时候，我就会这样。

#978 后到 #979 前有 `3.434s` 等待：

```text
duration=3.434s
RMS=-39.7171dBFS
Peak=-21.7951dBFS
centroid=3086.3192Hz
strongest50=-35.1285dBFS @3.334s
```

这个等待很低，最强短窗靠近 #979 入声前；但 `silencedetect -35dB:d=0.3` 对 #978 精确句、#978 到 #979 间隔、#978 到 #979 上下文和 #978 到 #981 压力链均无 silence event。它不是绝对静音，也不是音乐收束。更稳的写法是：#978 把状态说出以后，现场继续以低能声场把状态交给下一句。

#979 是：

```text
我不知道我该干什么
```

#979 全句 RMS=`-26.4011dBFS`，只比 #978 低约 `0.3986dB`，但 Peak 和 strongest50 都弱于 #978 句首。更长的 #978 到 #981 压力链里，最强 50ms 仍然落在 #978 的 `平时` 开头。这说明 #979 不是突然压过 #978 的新爆点，而是把 #978 的惯常紧张转成“我该做什么”的行动债。

链条因此可以写成：

```text
#974 你在干嘛呢
-> #978 平时我在这个时候都特别紧张
-> #979 我不知道我该干什么
```

#974 先从观看压力里问出“你在做什么”；#978 把这个位置说成“我到这个时候会紧张”；#979 再把紧张说成“不知道该干什么”。这里的 `干什么` 不是孤立无助，而是前面行动追问回到阿蒙自己身上。

画面上，#978 比 #977 明显更打开。#978 精确窗密帧：

```text
frame_count=29
mean_of_mean_abs_rgbdiff=5.6954
max_mean_abs_rgbdiff=13.3077
max_diff_gt8_ratio=0.565796
```

这说明句内确实有视觉重构，但 scene detect `threshold=0.040` 无命中，不能写成强硬切。`threshold=0.015` 只有低阈值提示，落在 #978 早段、中段和 #979 前后。稳定边界是：有改构图和空间打开，没有强切结案。

静帧变化也很清楚：

```text
978_start luma=83.3454  dark=0.136048  warm=0.125207  neutral=0.998855
978_q1    luma=79.1115  dark=0.133234  warm=0.345364  neutral=0.980675
978_mid   luma=49.2963  dark=0.451585  warm=0.552820  orange=0.039633
978_end   luma=58.2052  dark=0.262588  warm=0.861267  orange=0.090552
```

#978 起点仍是低角度白色竖褶衣物、皮肤、黑色衣物和绿色小光点。画面没有给一个清楚嘴部来签收 `紧张`。到句中，画面打开到黑衣站立者、半透明塑料/薄膜、暖橙光和观看者位置；句尾暖度继续升高。也就是说，画面没有把紧张交给脸部心理特写，而是把紧张放进公开观看/材料场。

这点非常重要。#978 不是阿蒙在一个心理特写中说“我紧张”。它是在白衣近身遮挡、黑衣站立者、塑料薄膜、暖橙光、观看者和低顶空间里说“平时我在这个时候都特别紧张”。紧张不是被一个内心拥有，而是被一个现场启动。

在 声音-音乐场（馆内参考，未随本文公开） 里，#978 是“惯常时刻强入声”的样本。以后遇到 `平时 / 每次 / 到这个时候 / 总是` 这类时间词，不能把它们当作普通铺垫。如果它们比情绪词更响，就要把声学重心放在“反复结构”上，而不是直接写心理爆发。

在 [说话权被系统接管](/research/hs-23c2dec5963ea385) 里，#978 是说话债转成状态债的中继。#976 没人说出，#977 改问你知不知道，#978 不给答案，而说自己平时到这个时候都会紧张。系统没有让主体拿回完整解释权，只是让主体说出自己在流程中的状态。

在 [偷入关系](/research/hs-6891095e2239eafa) 里，#978 说明被 #977 点名的 `你` 并没有停在外部；它折回了 `我在这个时候`。偷入关系不仅把第三位置塞进关系，也会让被问者把压力改写成自己的惯常身体状态。

完整本地复核见 [2026-06-22-4K无字幕母文件开场92分24秒到92分33秒第978平时我在这个时候都特别紧张与979干什么回收复核](/research/hs-8d72fc76f03509bb)，综合页见 [4K无字幕重启细读-92分24秒到92分33秒-平时我特别紧张把知道权逼问回收到惯常时刻而非心理显影-2026-06-22](/research/hs-cd462bb6015fb640)。

因此 #978 的稳定写法是：

```text
#978 不是“紧张终于显影”。
声学最强在 `平时`，不是 `特别紧张`。
它把 #977 的 `就你知道吗` 回收到一个惯常时刻：
到了这个时候，我平时都会紧张。
句后低能非静音等待把这份紧张继续交给 #979 的 `我不知道我该干什么`。
所以 #978 是状态债的入口，不是心理事实的结案。
```

该窗口现已完成，见下文 #979。写 #979 时必须守住：#979 是 #978 之后的行动债回收，并回接 #974 `你在干嘛呢`；不得写成单纯无助心理、#978 已完全解释 #979、口型同步、声源透明、音乐高潮、强硬切或可见人物身份裁决。

### #979｜阿蒙：我不知道我该干什么

```text
T0：#979
时间：01:32:31.400-01:32:32.966
说话人：阿蒙 / ACT-AMENG
台词：我不知道我该干什么
```

#979 看上去像一句很直白的自白：

```text
我不知道我该干什么
```

但这一句不能按“阿蒙突然说出无助心理”来读。它前面至少有三层压力。

第一层是 #974：

```text
你在干嘛呢
```

#974 的声学重心在 `干`，不是 `你`，所以那句不是单纯叫人，也不是确认身份，而是把观看压力翻成行动追问：你正在做什么。

第二层是 #978：

```text
平时我在这个时候都特别紧张
```

#978 的声学重心又不在 `特别紧张`，而在 `平时`。它把 #977 的知道权逼问回收到一个惯常时刻：到这个时候，我平时就会紧张。

第三层才是 #979：

```text
我不知道我该干什么
```

所以 #979 不是从空白里冒出的无助，而是把前面的“行动追问”和“惯常紧张”接到一起。现场先问 `你在干嘛呢`，主体后来回答成 `我不知道我该干什么`。这不是回答完成，而是行动债显形。

声音上，#979 全句 `1.566s`：

```text
RMS=-26.4011dBFS
Peak=-11.0361dBFS
centroid=853.0666Hz
strongest50=-19.8221dBFS @0.488s
```

粗分以后更清楚：

```text
我不知道      RMS=-25.3945dBFS
我该干什么    RMS=-27.4293dBFS
```

最强的不是 `干什么`，而是 `我不知道`。这说明行动词并没有成为声学高点。#979 先把不知道推出，再把行动词放到较低位置。行动不是马上开始，而是在开口时已经被不知道卡住。

这和 #978 的关系也要小心。#978 全句 RMS=`-26.0025dBFS`，#979 全句 RMS=`-26.4011dBFS`，两者只差约 `0.3986dB`；但 #978 的 Peak 和 strongest50 都强于 #979，且最强短窗落在 #978 句首 `平时`。所以 #979 不是压过 #978 的新爆点。它是 #978 状态债之后的一次行动债回收。

#979 到 #980 前只有 `0.234s`：

```text
duration=0.234s
RMS=-36.1060dBFS
Peak=-24.8490dBFS
strongest50=-33.6116dBFS @0.081s
```

这个间隔非常短，也很低。但用 `silencedetect -35dB:d=0.05` 检查，没有 silence event。#979 精确句、#979 到 #980 上下文和 #979 到 #981 压力链也没有对应 silence event。这里不能写成绝对静音，也不能写成音乐收束。更准确的是：极短低能非静音铰链。

这个铰链把 #979 迅速交给 #980：

```text
#979 我不知道我该干什么
-> #980 我也不知道我该说什么
```

#980 全句 RMS=`-30.8377dBFS`，比 #979 低约 `4.4366dB`。所以从 `干什么` 到 `说什么` 不是声学升级，而是退低。#980 的 `也` 说明它不是另起话题，而是把 #979 的行动债延展成说话债：我不知道该做什么，也不知道该说什么。

画面上，#979 更不能写成心理特写。它处在一个公开材料场里：巨大半透明塑料/薄膜占据右侧和中景；黑衣站立者在薄膜和设备附近；白衣坐者位于左侧低处；右下角还有模糊的观看者/局部身体；暖橙光透过薄膜，低顶空间显得压缩而临时。

#979 内部密帧相对稳定：

```text
frame_count=13
mean_of_mean_abs_rgbdiff=2.9445
max_mean_abs_rgbdiff=8.5313
max_diff_gt8_ratio=0.083333
```

从 #979 到 #980，变化主要是白光抬起：

```text
979_start luma=51.9150  dark=0.373735  warm=0.728576
979_mid   luma=61.4532  dark=0.345087  warm=0.949062
979_end   luma=63.2220  dark=0.322148  warm=0.969861
gap_mid   luma=72.6090  dark=0.192908  warm=0.888071
980_start luma=75.5383  dark=0.162067  warm=0.836517
980_mid   luma=92.3263  dark=0.043140  warm=0.423874
980_end   luma=100.6150 dark=0.016455  warm=0.316606
```

scene detect 在 `threshold=0.040` 对 #979 到 #980 上下文给出相对 #979 起点 `1.666667s` 的变化提示，落在 #980 入声前后；低阈值 `0.015` 也提示片段开头和这一位置附近有变化。但画面元素没有重置：同一空间、同一塑料薄膜、同一站立/坐着/观看关系持续。稳定写法是光源/曝光/材料反射变化，不是强硬切、不是空间换场。

MiMo 这一轮也能帮忙划边界。视频 T2 看见了同一空间、塑料薄膜、强点状白光出现、无明显音乐、无可靠口型同步，也承认声音不能直接归给某个可见人物。音频 T2 可保留低底噪、轻微混响、人声连续和无明显音乐。但它把 #980 误听成 `我也不知道我该干什么事`，这必须被 T0 否决；它对声音性别和身份的说法也不能覆盖阿蒙声道；它说片段末尾像硬切，是我们切片到 #980 末尾造成的边界效应，不能写成影片剪辑事实。

因此 #979 的稳定写法是：

```text
#979 不是普通无助。
它是 #978 惯常紧张之后的行动债。
它回接 #974 的行动追问：
你在干嘛呢 -> 我不知道我该干什么。
句内更强的是“不知道”，不是“干什么”。
行动债很快又通过 0.234s 极短低能非静音铰链，
滑到 #980 的说话债。
```

完整本地复核见 [2026-06-22-4K无字幕母文件开场92分31秒到92分35秒第979我不知道我该干什么与980说什么极短铰链复核](/research/hs-e77029b9b38c8782)；MiMo T2 摘要见 [MiMo-4K无字幕第979到980行动债说话债标准API反读-2026-06-22](/research/hs-3acd0e4315b02630)；综合页见 [4K无字幕重启细读-92分31秒到92分35秒-我不知道我该干什么把惯常紧张折成行动债并立刻滑向说什么-2026-06-22](/research/hs-223615c93222fe90)。

## 四概念补强小结（2026-06-29）

本卷的四概念补强，要从上一卷 #929 `对那个更大的东西` 留下的巨大空指开始读。#930-#979 不是单纯的“梦像段落”或“意识流段落”，而是一组更精密的指称实验：影片不断说出对象、地点、颜色、自然物、身体动作、眼睛、空气、期待和压力，但 T1 反复拒绝把这些词兑现为清楚可见的物。于是本卷的关键不是“说了什么画面”，而是“一个词怎样取得地址，又怎样在画面不给担保时回流成下一句的压力”。

### 1. #930-#935：从感觉提问到黑处命名

#930 `你是怎么感觉的` 把 #929 的 `那个更大的东西` 转给第二人称。指称上，`你` 被临时设成感受主体，`感觉` 被设成回答通道；但影片立刻给出约 `9.367s` 无新 T0 的回答空隙，说明这个通道没有被对方接住。自指上，电影在做一件和台词相反的事：台词要求感觉被说出，画面却维持低机位公开空间、屏障、反光面、观众剪影和边缘身体，不给心理特写，也不给清楚回应。

#931 `对那个` 删除 #930 的 `你` 和 `感觉`，只保留 #929 的朝向与指示；#932 `就那个更大的东西` 又把 `那个` 补回完整对象名。这里的递归非常清楚：感觉提问没有得到回答，于是输出不是“感觉”，而是对象空位的回返。上一轮没有被回答的对象，成为下一轮继续命名的条件。

#933 `好像在 在` 试图把对象放进地点语法，却停在两个 `在`；#934 `很` 又把未完成地点改成未完成程度；#935 `黑的地方` 同时补上 `很` 的性质和 `在` 的地点。它像是终于交出答案，但仍不是回答完成。`黑的地方` 只是语言补足，不是画面显影。反身上，甲瑞并没有成为解释者，而是成为被空指牵着继续找词的人；观众也被迫跟着补句：那个东西好像在……很……黑的地方。影片让我们参与补全，但不给我们看见。

### 2. #936-#941：外部意象接力与不显影的出现承诺

#936 子丑 `红色的卡车驶过` 从 #935 的黑处跳到红色运动物：黑/红、地方/卡车、静止/驶过同时换位。#937 `向日葵` 又把运动物变成植物日光名词；#938 `麦田` 把花名扩成场域；#939 阿蒙 `现在正在海里游泳` 再把田野推成水中进行时动作。指称在这里越来越外部化：感觉没有以心理词回来，而被一组可视名词和场景动作替代。

但自指层面更狠：这些词都高度可视，影片却不让它们成为画面事实。没有卡车、没有向日葵、没有麦田、没有海和游泳动作。画面继续扣在同一个公开空间、反光面、屏障、身体和暖色/冷色材料里。也就是说，电影不断把语言推向“应该被看见”的词，再用画面把这种应该看见的冲动拦住。

#940 `青蓝色的按钮按下` 把海中的身体动作收回一个按钮词；#941 `会出现很多的棒棒糖和鲸鱼` 则把按钮后的期待扩成出现承诺。递归链条是：海里游泳没有兑现为海，按钮按下也没有兑现为按钮，`会出现` 于是承担了补偿性承诺，好像下一刻会有很多东西来填空。可是 #941 后长尾仍不交出棒棒糖和鲸鱼，承诺本身变成新的欠账。

### 3. #942-#954：自然、身体、物证、家居与标点的连续失约

#942 `森林里有光` 把 #941 的未兑现对象转入自然场；#943 `有风` 删除地点，只留自然条件；#944 `他变得很轻` 把风后的条件转成第三人称身体状态；#945 `好像要飞起来` 又把轻变成趋向动作。这里的指称从环境到身体，从身体到飞行，逐步增强“应当发生”的趋势。但画面仍不出森林、不出风、不让身体变轻，也不让飞行发生。

#946 `硬币的中间开了一朵花` 是一次微缩奇迹：从身体趋向飞行，突然缩到硬币中心开花。#947 `开始跑了起来` 又把奇迹改成动作启动；#948 `好像在找什么东西` 让动作获得目标空位；#949 `杀人犯把信装在最里面的房间` 把目标空位具体化为信、杀人犯和最里面的房间；#950 `下午阳光最亮的时候` 再给这个物证叙事加上时间与光照条件。语言越来越像一段完整故事，证据却始终不来。

#951 `白色的床单在客厅里` 把外部叙事转成家居物；#952 `飘` 只用一个动词把床单图像补成运动；#953 `大括号和小括号在跳舞` 更进一步，把可见物换成标点图形；#954 `要下雨了` 又把跳舞的标点推向天气预告。反身上，被改变的不只是人物，也是观看习惯：观众不断被诱导去把暖色、白色、反光、遮挡和薄膜误接成这些词的证据。递归上，每个未兑现的名词都把自己的欠账交给下一句：森林欠光，风欠身体，身体欠飞行，飞行欠物，物欠故事，故事欠房间，房间欠床单，床单欠运动，运动欠天气。

### 4. #955-#961：眼睛、无眼、吸入、在场与飞行词

#955 `有一双眼睛一直在看着我` 是本卷中段的观看命名。它把公开空间中分散的观看位置压缩成 `一双眼睛`，又用 `一直` 把观看改成持续压力。T1 支持观看关系在场，却不支持眼睛特写、单一凝视主体或独立眼睛物。自指上，电影让“看”成为台词主题，同时拒绝把看者拍成清楚对象；它让观看发生，却不让观看者被完整拥有。

#956 `好像没有眼睛黑黑的` 立刻撤销 #955 的眼睛，把有眼改成无眼黑处；#957 `我被眼睛给吸了进去` 又把被看压力说成被吸入。这里不是心理事实显影，而是指称关系的翻转：眼睛先是看我的外部位置，随后变成能把我吞进去的入口。

#958 `我一直 我一直在` 是吸入后的结果句，却不给结果地点。`在` 需要所在之处，句子没有说，画面也没有替它说。#959 `飞呀`、#960 `飞呀飞呀` 把持续在场推向语言飞行，但仍没有飞行空间、飞行动作或声画升空。#961 `突然看见一只特别漂亮的蝴蝶` 则把飞行从动词改成观看对象：飞不起来，于是看见蝴蝶。但蝴蝶也不显影。递归链条是：被看 -> 无眼黑处 -> 被吸入 -> 一直在但无地点 -> 说飞但不飞 -> 看见蝴蝶但不给蝴蝶。

### 5. #962-#966：车站、情侣包、桃子与知道关系

#962 子丑 `在午后车站` 把蝴蝶后的美丽对象越过，转入外部地点；#963 `分别的一对情侣的包里` 把地点推进到关系容器；#964 `掉出了一颗桃子` 则把容器推进为事件和掉出物。指称上，地点、情侣、包、桃子和掉出都非常具体，几乎像一段可以被拍下来的叙事。但影片拒绝交出车站、情侣、包和桃子，也不交出掉出、落地或物体声。

#964 后到 #965 前的长尾非常关键：物件故事没有落地，反而被交还给公开观看场、塑料/薄膜、背部、白色材料、近脸和等待。#965 阿蒙 `我就知道 你一来找我什么都知道` 于是把失败的外部证据改写为知道关系。这里的指称不是“桃子在哪里”，而是“你知道”。`你一来找我` 又把知道绑定到到来和寻找。反身上，被称作 `你` 的位置不再只是观看者或寻找者，而成了已经知道的人；阿蒙自己也成了被知道的人。

#966 `就你知道吗` 马上把这份知道权扣回来。它不是 #965 的重复，而是反问：既然你一来就什么都知道，那么是不是只有你知道？递归上，外部物件不显影，输出为“知道”；知道没有被证实，又回流为知道权争夺。影片把未能看见的物，变成了必须被问责的知情位置。

### 6. #967-#973：空气、奇怪东西、期待与每一双眼睛

#967 `这空气中` 把 #966 的知道权争夺转入介质场；#968 `空气中` 删除 `这`，让介质本身前景化；#969 `弥漫着一股特别特别奇怪的东西` 终于说出 `东西`，但这个东西不是物件，而是弥漫状态。语言给对象，画面给光、薄膜、低顶空间和身体；语言说“东西”，画面不给“一个东西”。

#970 `还有一种期待` 把 #969 之后的等待命名为期待；#971 `对 还有一种期待` 是确认，但不是升级；#972 `他有一种期待` 把无主期待转成第三人称归属。指称上，期待先没有主人，随后有了 `他`；但 T1 不裁决这个 `他` 是谁，也不交出期待对象。期待获得语法归属，却没有获得可见身份。

#973 `每一双眼睛都在看着我` 把第三人称期待立刻扩成集体观看压力。它回接 #955 的眼睛，但形式更重：#955 还是 `一双眼睛`，#973 变成 `每一双眼睛`。递归上，眼睛链不是简单重复，而是增殖后返回：前一次的观看命名经过无眼、吸入、飞行、蝴蝶、车站、桃子、知道、空气和期待之后，回来时已经变成每一双眼睛对 `我` 的压迫性总称。

### 7. #974-#979：行动债、说话压力、知道权回返

#974 `你在干嘛呢` 紧接 #973，把 `我` 被每一双眼睛看，翻成对 `你` 的行动追问。这个 `你` 不能被画面裁决为某个稳定人物；它更像一个被观看、记录或在场行为临时占住的位置。指称上，#974 把观看压力转换为行动债：你正在做什么？

#975 `他们肯定都特别想要说话` 又把 #973 的 `每一双眼睛` 改写成 `他们`，把观看者变成想说话的人；#976 `但是没有人 说出来` 立刻把这份说话欲望降为说不出口的断裂。`他们` 被命名为想说话，但 `没有人` 又撤掉实际发声。这里的自指很强：影片正在让“说出来”成为主题，同时让声场维持低能等待，不给众人发声的完成。

#977 第二次 `就你知道吗` 把 #966 的知道权争夺加压回返：无人说出之后，知道权又被钉回 `你`。#978 `平时我在这个时候都特别紧张` 没有回答“知道什么”，而是把知道权逼问回收到惯常时刻和自我状态。#979 `我不知道我该干什么` 再把 #974 的行动追问回收到阿蒙自己：你在干嘛呢 -> 我不知道我该干什么。反身上，阿蒙从被观看的 `我`、被知道的 `我`、紧张的 `我`，变成背负行动债的 `我`。递归上，#979 不是普通无助，而是 #974 的问题穿过 #975-#978 后返身落回第一人称。

### 8. 本卷递回公式

```text
那个更大的东西
-> 你是怎么感觉的把巨大空指转成第二人称感受提问
-> 对那个 / 就那个更大的东西让感觉通道折回对象空位
-> 好像在 在 / 很 / 黑的地方把对象转成未显影地点
-> 红色卡车 / 向日葵 / 麦田 / 海里游泳把感觉外部图像化
-> 按钮按下 / 会出现很多棒棒糖和鲸鱼把未显影图像改成出现承诺
-> 森林光 / 风 / 他很轻 / 要飞把自然条件推入身体趋向
-> 硬币开花 / 跑 / 找东西 / 杀人犯与信 / 下午阳光 / 床单 / 飘 / 括号跳舞 / 下雨把欠账扩成故事和图形接力
-> 一双眼睛看我把观看关系命名
-> 没有眼睛黑黑的 / 被眼睛吸进去把观看变成入口
-> 我一直在 / 飞呀 / 蝴蝶让吸入后果变成语言飞行和未显影对象
-> 车站 / 情侣包 / 桃子把外部叙事具体化但不落地
-> 我就知道 / 就你知道吗把失败物件改成知道权争夺
-> 空气中 / 奇怪东西把未兑现之物弥漫化
-> 期待 / 他有期待把等待赋予归属但不交身份
-> 每一双眼睛看着我让眼睛链加压回返
-> 你在干嘛呢把被看压力翻成行动债
-> 他们想说话 / 没有人说出来把观看压力翻成发声欠账
-> 就你知道吗二次回返
-> 平时特别紧张
-> 我不知道我该干什么把行动债返身落回阿蒙
```

因此，第930-979句最重要的结构，不是“人物讲了一串梦中画面”，而是“巨大空指如何在一连串未兑现的名词、动作和观看压力中滚动”。每一个词都像要让电影看见更多：黑处、红车、花、麦田、海、按钮、糖果、鲸鱼、森林、风、硬币、信、车站、床单、括号、雨、眼睛、桃子、空气、期待。但影片一次次把它们留在语言里，让画面只给公开空间、身体、屏障、反光、薄膜、光和等待。最终，外部对象没有完成，观看压力和知道权却越来越重，直到 #979 变成一句行动债：不是“我只是无助”，而是“我被这么多看见、知道、期待和说不出口之后，不知道自己该做什么”。


本卷到 #979 封口。下一步进入新卷 [人类投降派逐句对白声画解读-第980-1029句-2026-06-22](/research/hs-40c4893d79a20143)，从工程 #980（T0 台词账 #980）阿蒙 `我也不知道我该说什么` 开始。写 #980 时必须守住：#980 是 #979 行动债之后的说话债降声，不得被 MiMo 误听改成 `干什么事`，不得写成 #979 简单重复、口型同步、声源透明、音乐高潮、强硬切或可见人物身份裁决。