# 2026-06-24-4K无字幕母文件开场96分24秒到96分33秒第1052这一个月拍电影到1055一个什么东西复核

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-24

证据边界：T1 本地复核页。T0 台词、说话人和时间码以 角色逐时轴全台词幽灵机制账-2026-06-03.tsv 为准；本页只记录 4K 无字幕母文件抽取出的声音、画面、间隙、接触表和指标。MiMo 仅作 T2 对照，不覆盖本页判断。

# 2026-06-24-4K无字幕母文件开场96分24秒到96分33秒第1052这一个月拍电影到1055一个什么东西复核

## 取证边界

本页复核工程 #1052 子丑：

```text
#1052 01:36:24.833-01:36:25.900 子丑：这一个月拍电影
```

两侧链条为：

```text
#1051 阿蒙：我在很努力这样做
#1052 子丑：这一个月拍电影
#1053 子丑：我感受到的或者我体验到的
#1054 子丑：我扮演了一个
#1055 子丑：一个什么东西
```

问题不是 #1052 是否提到“拍电影”，而是它怎样提到“拍电影”：它是从现场逃到幕后解释，还是把 #1051 的 `这样做` 回接到这一个月正在发生的拍摄、表演、材料和感受经验里。

## 资产

资产目录：

```text
inspool-wiki-zh/raw/assets/4k-nosub-restart-20260624/1052-filming-month-experience-return-nooffset/
```

关键文件：

```text
audio/1052_exact_mono.wav
audio/1052_exact_stereo.wav
audio/1052_to1055_movie_role_chain_mono.wav
audio/1052_to1060_movie_fake_chain_mono.wav
clips/1052_exact_720p.mp4
clips/1052_to1055_movie_role_chain_540p.mp4
clips/1052_to1060_movie_fake_chain_540p.mp4
contact/contact_sheet_1052_time_order_labelled.jpg
contact/chain_contact_5781_5793_2fps_labelled.jpg
metrics/audio_summary_metrics.tsv
metrics/subsegment_metrics_1052.tsv
metrics/rms_100ms_curve_1052.tsv
metrics/top_windows.tsv
metrics/frame_color_metrics_time_order.tsv
metrics/frame_pair_difference_metrics_time_order.tsv
diagnostics/*silencedetect*
diagnostics/1052_to1055_540p_scene_gt018.log
diagnostics/1052_to1060_540p_scene_gt018.log
spectrograms/1052_exact_waveform.png
spectrograms/1052_exact_spectrogram.png
spectrograms/1052_to1054_chain_spectrogram.png
```

## 声音：#1052 是回接节点，不是 #1051 的余音

#1052 exact：

```text
duration=1.067s
RMS=-15.1580dBFS
Peak=-3.0688dBFS
voice250_4000_ratio=0.894792
presence4000_8000_ratio=0.000953
high8000_12000_ratio=0.000491
air12000_20000_ratio=0.001272
stereo_corr=1.000000
side_mid_ratio=0
```

相邻台词：

```text
#1051 我在很努力这样做 RMS=-13.1790dBFS
#1052 这一个月拍电影 RMS=-15.1580dBFS
#1053 我感受到的或者我体验到的 RMS=-19.6616dBFS
#1054 我扮演了一个 RMS=-15.9033dBFS
#1055 一个什么东西 RMS=-15.6995dBFS
```

#1052 比 #1051 低 `1.9790dB`，所以它不是继续把 #1051 的努力报账推到更高；但它比 #1053 高 `4.5036dB`，也接近 #1054/#1055 的声压。它更像一个短而清晰的回接节点：把前面的 `这样做` 命名为“这一个月拍电影”，然后让 #1053 进入“我感受到的或者我体验到的”。

## 句内形状：前半建立，后半回落

四等分：

```text
q1=-14.5148dBFS
q2=-12.2774dBFS
q3=-20.0622dBFS
q4=-17.5544dBFS
first_half=-13.2536dBFS
tail_half=-18.6297dBFS
```

粗略短语分段只能作为候选，不作字词级定锚：

```text
rough_phrase_zhe_yige_yue=-13.3316dBFS
rough_phrase_pai_dianying=-17.7177dBFS
```

100ms 曲线：

```text
5784.833-5784.933 RMS=-19.6411dBFS
5784.933-5785.333 RMS=-12.1678 到 -12.5002dBFS
5785.333-5785.533 RMS=-16.1909 到 -22.3468dBFS
5785.633-5785.733 RMS=-14.8576dBFS
5785.733-5785.900 RMS=-20.5715 到 -20.7939dBFS
```

这说明 #1052 不是平直地说完。它先把“这一个月”一类的时间框架抬出来，随后尾部明显回落。不能把它写成弱弱带过；也不能把它写成新的强声对抗。它是一个声学上收束、语义上打开的短节点。

短窗也支持这个判断。#1052 exact 的最强窗为：

```text
20ms 5784.989-5785.009 RMS=-10.6991dBFS
50ms 5785.128-5785.178 RMS=-11.0628dBFS
100ms 5785.083-5785.183 RMS=-11.6073dBFS
250ms 5785.108-5785.358 RMS=-12.1881dBFS
500ms 5784.883-5785.383 RMS=-12.9345dBFS
```

放到 #1052-#1054 链中，20/50/100/250ms 的最强窗落在 #1054 `我扮演了一个` 附近；但 500ms 最强窗仍落在 #1052 前半。也就是说，#1052 是框架抬起，#1054 才是后续扮演链里的局部短促增强。

## 空档和音乐边界：低能现场保持，不是干净静音或音乐桥

关键空档：

```text
#1051->#1052 gap duration=3.233s RMS=-39.1207dBFS Peak=-21.1969dBFS
#1054->#1055 gap duration=1.834s RMS=-36.9981dBFS Peak=-9.8918dBFS
```

`silencedetect -45dB:d=0.25` 对 #1051->#1052 和 #1054->#1055 均无 silence event；对 #1052 exact 使用 `-45dB:d=0.10` 也无 silence event。

所以这里不能写作“干净静音”。更稳的写法是：

```text
低能现场保持
相对安静的句间回落
人声尾部能量下降
无可确认音乐桥、设备提示、声道空间打开
```

#1052 exact 的 stereo_corr=`1.000000`、side_mid_ratio=`0`，不支持立体声空间突然打开。频谱也主要是人声低中频形状，不能确认配乐、旋律性音乐或设备提示。

## 画面：#1052 说“拍电影”时，没有离开材料现场

接触表显示，#1052 入声前后不是新空间：

```text
1051_tail_5781.500：胸口/上身蓝色眼状标记、肩臂、手部管状材料仍在同一近景中
1051_to1052_gap_pre1052_5784.600：画面压到身体侧面、蓝色线条局部、手部和管状材料
1052_start_5784.833：侧脸/嘴部在画面右缘，手持白紫/深蓝管状材料，管口贴近蓝色线条或标记
1052_mid_5785.366：构图继续保持，嘴部边缘、手、管状材料和身体侧面同框
1052_tail_5785.850：没有切入新空间，仍是身体侧面、手部材料、蓝色标记和侧脸边缘
1053_start_5785.900：几乎无可见转场，继续同一近景
```

这对 #1052 的判断非常关键。子丑说 `这一个月拍电影` 时，画面没有切到一个“拍电影说明空间”，也没有切到导演、摄影机、后台或远景。它把 `拍电影` 留在一个身体表面被看见、被画线、被材料接触的近景里。

图像指标也支持连续性：

```text
1051_to1052_gap_pre1052 luma=0.218848 dark=0.349190
1052_start luma=0.217195 dark=0.365394
1052_mid luma=0.219450 dark=0.281103
1052_tail luma=0.219808 dark=0.234468
1053_start luma=0.219373 dark=0.234900
```

帧差也没有显示硬断裂：

```text
pre1052->1052_start mean_abs_rgb_diff=0.021428
1052_start->1052_mid mean_abs_rgb_diff=0.035437
1052_mid->1052_tail mean_abs_rgb_diff=0.029748
1052_tail->1053_start mean_abs_rgb_diff=0.006683
```

`1052_to1055_540p_scene_gt018.log` 和 `1052_to1060_540p_scene_gt018.log` 均无 `scene_score` 命中。#1052 到 #1055 的变化更像同一室内近景中的身体、手、材料和构图滚动，而不是空间重置。

## MiMo T2 对照

MiMo standard API 音频报告可保留：

- #1052 是一个短而完整的陈述节点，尾部下降。
- 不能确认配乐、音乐桥、设备提示或声道空间打开。
- #1053 之后进入更长的经验叙述链。

MiMo formal-safe 视频报告可保留：

- #1052 开始时仍处于身体/材料极近景现场。
- 画面中侧脸在边缘，手部持管状材料，材料靠近蓝色线条或标记。
- #1052 到 #1055 没有明显空间重置、风格化转场或音乐桥。

必须降级：

- MiMo 的说话人性别/身份判断不进入本页；T0 说话人为子丑。
- MiMo 把句间写成“干净静音”，但 T1 `silencedetect` 不支持。只能写相对安静、低能现场保持。
- MiMo 的“颜料工具”“身体作为画布”等命名可作为描述便利，但本页只稳定写可见管状材料、蓝色线条/眼状标记、手部接触。
- MiMo 的“新解释入口”需要改写为“话题框架入口”。因为画面和声音没有支持离开现场的解释逃逸。

## 结论

#1052 最稳是 [拍电影经验回接](/research/hs-f77f4365a074792e)：

```text
#1051：我在很努力这样做
#1052：这一个月拍电影
#1053：我感受到的或者我体验到的
#1054/#1055：我扮演了一个 / 一个什么东西
```

它把 #1051 的 `这样做` 明确接到“这一个月拍电影”。但这个接法不是抽象解释，也不是幕后逃逸。因为 #1052 发声时，画面仍然贴在侧脸、嘴部边缘、手部、管状材料、蓝色标记和身体表面之间。

所以 #1052 的关键不是“终于说明这是拍电影”，而是：电影把“拍电影”重新放回正在被拍、正在被画、正在被材料接触的身体现场。它为 #1053 的感受/体验打开框架，也为 #1054/#1055 的“扮演了一个 / 一个什么东西”埋下空位。

## 文中引用的图像资料

以下图像由本篇已有文件引用对应；保留历史引用范围，图像展示不增加新的事实判断。

![contact_sheet_1052_time_order_labelled.jpg](/research/images/6397ae6f671f40b39cb7.webp)

![chain_contact_5781_5793_2fps_labelled.jpg](/research/images/830d702a8b0710cc6e9b.webp)

![1052_exact_waveform.png](/research/images/21f1d437ae816844d520.webp)

![1052_exact_spectrogram.png](/research/images/6adb2907ed3214d981d3.webp)

![1052_to1054_chain_spectrogram.png](/research/images/f454d3ee0bfc6cff59a7.webp)