# 4K无字幕第973：每一双眼睛都在看着我

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-22

证据边界：T0 台词账锁定 #973 阿蒙 `每一双眼睛都在看着我` 为 01:32:00.900-01:32:02.300，#974 阿蒙 `你在干嘛呢` 为 01:32:02.333-01:32:03.733，#975 阿蒙 `他们肯定都特别想要说话` 为 01:32:11.000-01:32:12.900。本页只使用 4K 无字幕母文件无偏移时间轴抽帧、音频、密帧、局部放大、波形、频谱、scene detect 和 silencedetect；MiMo 只作 T2 补盲，不覆盖 T0/T1。#973 可写为 #972 第三人称期待后转入集体观看压力，但不得写成具体眼睛对象显影、所有观众真实心理、口型同步、声源透明、音乐高潮、绝对静音、硬切换场或 #972 的 `他` 已被回溯裁决。

# 4K无字幕第973：每一双眼睛都在看着我

本页复核工程 #973，并把 #974 与 #975 前奏作为连续证据纳入：

```text
#972  01:31:59.066-01:32:00.400  阿蒙：他有一种期待
gap   01:32:00.400-01:32:00.900  0.500s，低能非静音短隙
#973  01:32:00.900-01:32:02.300  阿蒙：每一双眼睛都在看着我
#974  01:32:02.333-01:32:03.733  阿蒙：你在干嘛呢
gap   01:32:03.733-01:32:11.000  7.267s，低能非静音间隔和视觉换载
#975  01:32:11.000-01:32:12.900  阿蒙：他们肯定都特别想要说话
```

#973 的关键词不是“眼睛被看见”，而是“观看位置被总称”。4K 画面没有给出眼睛特写、独立眼睛物件或一个被锁定的凝视主体。它保留的是同一低亮观看场：左侧黑色遮挡、遮挡边缘的局部脸/喝水或持杯动作、中央白衣侧背身体、右侧坐着的观看者和手机/发光物候选、后方半透明塑料/薄膜。台词把这些分散位置压缩成 `每一双眼睛`，但画面没有逐一交出眼睛。

## 证据资产

核心目录：

`inspool-wiki-zh/raw/assets/4k-nosub-restart-20260622/973-every-eye-watching-nooffset/`

主要素材：

- `clips/973_exact_5520.900_5522.300_720p_audio.mp4`
- `clips/974_exact_5522.333_5523.733_720p_audio.mp4`
- `clips/973_974_pair_5520.900_5523.733_720p_audio.mp4`
- `clips/974_to975_gap_5523.733_5531.000_720p_audio.mp4`
- `clips/972_to975_context_5519.066_5532.900_720p_audio.mp4`
- `audio/973_exact_5520.900_5522.300_stereo.wav`
- `audio/974_exact_5522.333_5523.733_stereo.wav`
- `audio/973_974_pair_5520.900_5523.733_stereo.wav`
- `audio/974_to975_gap_5523.733_5531.000_stereo.wav`
- `audio/972_to975_context_5519.066_5532.900_stereo.wav`
- `audio/973_meiyishuang_5520.900_5521.333_stereo.wav`
- `audio/973_yanjingdou_5521.333_5521.833_stereo.wav`
- `audio/973_zaikanzhewo_5521.833_5522.300_stereo.wav`
- `frames/973_exact_dense/frame_0001.jpg` 到 `frame_0034.jpg`
- `frames/974_exact_dense/frame_0001.jpg` 到 `frame_0034.jpg`
- `frames/context_stills/973_start_5520.900.jpg`
- `frames/context_stills/973_mid_5521.600.jpg`
- `frames/context_stills/973_end_5522.299.jpg`
- `frames/context_stills/974_start_5522.333.jpg`
- `frames/context_stills/974_mid_5523.033.jpg`
- `frames/context_stills/974_end_5523.732.jpg`
- `frames/context_stills/974_to975_gap_mid_5527.300.jpg`
- `frames/context_stills/975_start_5531.000.jpg`
- `metrics/contact_sheet_973_exact.jpg`
- `metrics/contact_sheet_974_exact.jpg`
- `metrics/contact_sheet_973_974_pair.jpg`
- `metrics/contact_sheet_972_to975_context.jpg`
- `metrics/contact_sheet_973_detail_crops.jpg`
- `metrics/audio_waveform_972_to975_context.jpg`
- `metrics/audio_spectrogram_972_to975_context.jpg`
- `metrics/audio_summary_973.json`
- `metrics/visual_summary_973.json`
- `metrics/local_metrics_summary_973.md`
- `metrics/scene_detect_972_to975_context_threshold0015.txt`
- `metrics/scene_detect_972_to975_context_threshold0040.txt`
- `metrics/silencedetect_973_exact_-35dB_d0.3.txt`
- `metrics/silencedetect_973_974_pair_-35dB_d0.3.txt`
- `metrics/silencedetect_974_to975_gap_-35dB_d0.3.txt`
- `metrics/silencedetect_972_to975_context_-35dB_d0.3.txt`

MiMo 标准 API 复跑已成功，见 MiMo-4K无字幕第973每一双眼睛到975他们想说话标准API复跑-2026-06-22（馆内参考，未随本文公开）。MiMo 可保留“同一观看场、黑色遮挡、左侧边缘喝水/持杯候选、右侧手机/发光物候选、无眼睛特写、无音乐、#974 把观看转成质问、#974 后长低能过渡”的方向；不采用其对可见白衣人物即说话人、口型同步、性别身份、硬切和心理动机的过度确认。

## 声音复核：#973 不是 #972 的声学高潮，而是观看压力入口

#973 精确窗：

```text
duration=1.400s
RMS=-26.0576dBFS
Peak=-12.2255dBFS
centroid=4959.2327Hz
strongest 50ms=-20.7269dBFS at 0.340s
```

它与 #972 的关系：

```text
#972 exact RMS=-24.8493dBFS
#973 exact RMS=-26.0576dBFS
#973 exact - #972 exact = -1.2083dB
```

所以 #973 不是把 #972 推成更响的高潮。#972 已经完成“期待被第三人称化”，#973 做的是另一件事：把这个第三人称归属立即压回第一人称被看压力。它从 #972 到 #973 的短隙中重新入声，但音量略低于 #972。

与 #974 比较：

```text
#974 exact RMS=-30.9143dBFS
#973 exact - #974 exact = +4.8567dB
```

#973 明显强于 #974。`每一双眼睛都在看着我` 比后一句 `你在干嘛呢` 更靠前、更满。#974 不是声学升级，而是紧跟着把 #973 的 `我` 拉到一个具体行为问题里。

与 #974 到 #975 前的长间隔比较：

```text
974_to975_gap RMS=-40.1526dBFS
#973 exact - 974_to975_gap = +14.0950dB
#974 exact - 974_to975_gap = +9.2383dB
```

这段长间隔不是绝对静音，但能量显著退后。#973 和 #974 是前景人声，之后现场低位地继续存在，直到 #975 再起。

## 句内粗分：重心在 `每一双` 和 `眼睛都`，不是只在 `我`

#973 粗分：

```text
每一双      duration=0.433s  RMS=-25.2185dBFS  Peak=-13.1829dBFS  centroid=4134.7009Hz
眼睛都      duration=0.500s  RMS=-25.6946dBFS  Peak=-12.2255dBFS  centroid=5313.4563Hz
在看着我    duration=0.467s  RMS=-27.5508dBFS  Peak=-13.2618dBFS  centroid=6247.2073Hz
```

最强 50ms 出现在 `每一双` 内，`眼睛都` 的峰值最高，`在看着我` 反而低约 `1.8562dB` 到 `2.3323dB`。这说明声音首先推出的是集体枚举和眼睛总称，再把这个总称落到 `我`。如果只把这句理解成“我很怕被看”，会少掉前半句的形式动作：电影先扩大观看者，再把被看者放进去。

句内可以写成：

```text
每一双   -> 数量/总称被推出
眼睛都   -> 观看器官被集体化
在看着我 -> 集体观看落到第一人称身体
```

## 画面复核：没有眼睛特写，只有观看位置

#973 精确窗关键帧：

```text
973_start luma=37.9845 dark=0.702362 warm=0.002853 orange=0.000000 neutral=0.857365
973_mid   luma=38.6861 dark=0.689049 warm=0.002729 orange=0.000000 neutral=0.874757
973_end   luma=39.3588 dark=0.664018 warm=0.014156 orange=0.000000 neutral=0.662024
```

这是低亮、中性灰、黑色遮挡主导的观看场。画面左侧大块黑色前景遮挡切开空间；遮挡边缘有局部脸和抬手/杯子候选；中央白衣身体坐在平台边缘，以侧背和转身出现；右侧有几位坐着的观看者，其中有手机或发光物候选；后方是半透明塑料/薄纱。所有这些都支持“观看关系在场”，但不支持“眼睛对象显影”。

局部裁切很重要：

- 左侧边缘：有脸、手、杯子/物件候选，提供一个被遮挡的观看位置。
- 右侧观众：坐着的人群和手机/发光物候选把“看”接向记录或旁观，但不能升级为所有人确实都在看。
- 中央白衣身体：它是被看压力的主要可见承载面，但不能由画面反推说话人或口型同步。
- 塑料/薄纱：背景仍在，说明这不是脱离现场的心理独白，而是公开装置空间内部的压力命名。

所以 #973 的画面句法不是“给眼睛”，而是“不给眼睛，只给观看位置”。台词说 `每一双眼睛` 时，画面拒绝把每一双眼睛拍成对象。

## #973 到 #974：`我` 立刻被追问成行为

#974 与 #973 之间只有约 `0.033s`，并且 #973 末帧与 #974 起帧在抽帧指标中连续：

```text
973_to974_delta mean_abs_rgbdiff=0.0000 diff_gt8=0.000000 diff_gt20=0.000000
```

这说明 `每一双眼睛都在看着我` 和 `你在干嘛呢` 不应读成两次分开的场景。后一句是紧贴着前一句来的。声音上 #974 明显更低：

```text
#974 exact duration=1.400s
RMS=-30.9143dBFS
Peak=-13.6614dBFS
strongest50=-22.7272dBFS at 0.480s
```

句内粗分：

```text
你在    RMS=-29.5646dBFS
干嘛    RMS=-30.0136dBFS
呢      RMS=-35.3332dBFS
```

`你在干嘛呢` 不是把声音越推越高，而是把前一句的观看压力转为一个低一点、短促一点的活动追问。#973 说的是 `我` 被每一双眼睛看；#974 立刻把现场转成 `你` 正在做什么。这个 `你` 不等于一个已被身份裁决的画内人；更稳的是：`我` 的被看压力被立刻外翻成对某个观看/记录/在场行为的质问。

## #974 到 #975：长低能间隔把观看压力送入说话压力

#974 后到 #975 前：

```text
duration=7.267s
RMS=-40.1526dBFS
Peak=-18.4256dBFS
centroid=9457.4951Hz
strongest50=-28.1939dBFS at 6.770s
```

`silencedetect -35dB:d=0.3` 对 #973 精确窗、#973-#974 对照、#974 到 #975 前长间隔和 #972-#975 上下文均无 silence event。这里不是绝对静音。它是低能量现场底噪、材料声和视觉换载组成的等待。

视觉上，这段间隔逐步离开 #973/#974 的低亮灰观看场。指标显示：

```text
974_end     luma=47.1988 dark=0.521050 warm=0.009580 neutral=0.923473
gap_mid     luma=49.1314 dark=0.346619 warm=0.001800 neutral=0.851192
975_start   luma=69.1804 dark=0.047764 warm=0.740760 neutral=0.267933
gap_to975_delta mean_abs_rgbdiff=27.7500 diff_gt8=0.877391 diff_gt20=0.521374
```

也就是说，#975 起点不是 #973 的简单延长。它已经转向更亮、更暖、近身/低角度的场。scene detect `threshold=0.040` 没有强命中，不能写成强硬切；`threshold=0.015` 只在上下文约 `9s` 处给出一次低阈值变化，位置在 #974 到 #975 的长间隔里。因此更稳的写法是：长间隔里出现视觉换载/遮挡改构图，最后把现场送到 #975 的暖亮近身场，而不是把 #973/#974 写成当场硬切。

## #975 预告：从看着我，到他们想说话

#975 开始处在整段上下文里更强：

```text
973_to975_context strongest50=-15.7134dBFS at 10.180s
972_to975_context strongest50=-15.6989dBFS at 12.010s
```

这个最强 50ms 落在 #975 开始附近，而不是 #973/#974。链条因此变成：

```text
#972 他有一种期待
-> #973 每一双眼睛都在看着我
-> #974 你在干嘛呢
-> 7.267s 低能非静音视觉换载
-> #975 他们肯定都特别想要说话
```

#973 不是终点。`看着我` 之后，电影没有立刻让某个眼睛或某个人说出答案，而是先用 #974 追问观看/在场行为，再用长低能间隔把观看压力转成说话压力。到 #975 时，`每一双眼睛` 变成 `他们`，`看着我` 变成 `想要说话`。这是一条从视觉压力转向发声压力的链。

## 禁写边界

不能写：

- #973 出现了具体眼睛特写、眼睛物件或清晰凝视对象；
- 所有观众在心理上真实地想看或想说话；
- 中央白衣人物就是 #973/#974 的说话人；
- #973 或 #974 存在可靠口型同步；
- 右侧手机/发光物一定就是拍摄证据；
- #974 是声学高潮；
- #974 到 #975 前是绝对静音；
- #974 到 #975 前是强硬切或音乐转场；
- #973 可以回头裁决 #972 的 `他` 是谁。

## 稳定写法

```text
#973 把 #972 的第三人称期待立刻改写成第一人称被看压力。
声音上，它比 #972 略低，但强于 #974 和句后长间隔；
句内重心在 `每一双` / `眼睛都`，不是只在 `我`。
画面上没有眼睛特写，只有左侧边缘脸、黑色遮挡、中央白衣身体、右侧观看者、手机微光候选和塑料背景组成的观看场。
#974 紧贴其后，把 `我被看` 外翻成 `你在干嘛呢` 的活动追问。
长低能非静音间隔再把观看压力送到 #975 的 `他们肯定都特别想要说话`。
```

## 文中引用的图像资料

以下图像由本篇已有文件引用对应；保留历史引用范围，图像展示不增加新的事实判断。

![frame_0001.jpg](/research/images/47a6d415657d21b0e9cd.webp)

![974_start_5522.333.jpg](/research/images/0a54de3f3d7ca611dfa0.webp)

![974_mid_5523.033.jpg](/research/images/5ea6effa9f3906feb152.webp)

![974_end_5523.732.jpg](/research/images/eb8824e939c66abb2ce5.webp)

![974_to975_gap_mid_5527.300.jpg](/research/images/cd642544bcacdcba8ea0.webp)

![975_start_5531.000.jpg](/research/images/3bf4273d6352b76a8543.webp)

![contact_sheet_973_exact.jpg](/research/images/dbb82aa7d86e1af55291.webp)

![contact_sheet_974_exact.jpg](/research/images/05990cb09901e5b85cd1.webp)

![contact_sheet_973_974_pair.jpg](/research/images/d4a1457d661bc4d160b7.webp)

![contact_sheet_972_to975_context.jpg](/research/images/8f8dfdfd522ad76757ce.webp)

![contact_sheet_973_detail_crops.jpg](/research/images/0af018043e8f7d5d4c98.webp)

![audio_waveform_972_to975_context.jpg](/research/images/53be5bbaf533ec91514a.webp)

![audio_spectrogram_972_to975_context.jpg](/research/images/f1e1b5a27e96086e7e94.webp)