# 2026-06-22-4K无字幕母文件开场93分30秒到93分41秒第993有些人说可能到995小说说可能声音转交复核

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-22

证据边界：T0 台词账锁定 #993 子丑 `因为有些人说 可能`、#994 子丑 `因为编剧说 可能`、#995 子丑 `因为我写的小说说 可能`。本页只复核 #993 如何在 #992 强重复后把理由交给匿名复数声音，并把 #994/#995 作为后续来源阶梯背景。不得把 `有些人说` 写成画面外部证人事实、观众真实发言、现实离场证明、口型同步、声源透明、编剧片外事实、小说实物或可确认音乐。

# 2026-06-22-4K无字幕母文件开场93分30秒到93分41秒第993有些人说可能到995小说说可能声音转交复核

## 取证范围

- 母文件：`〔本地资料路径省略〕 无字幕 28g 4k.mov`
- 资产目录：`inspool-wiki-zh/raw/assets/4k-nosub-restart-20260622/993-some-people-say-nooffset`
- 时间轴：无偏移文件时间轴。
- 关键资产：
  - `audio/993_exact_5610.700_5613.233_stereo.wav`
  - `audio/993_to994_gap_5613.233_5614.733_stereo.wav`
  - `audio/994_exact_5614.733_5616.466_stereo.wav`
  - `audio/994_to995_gap_5616.466_5617.866_stereo.wav`
  - `audio/995_exact_5617.866_5620.900_stereo.wav`
  - `audio/993_to995_chain_5610.700_5620.900_stereo.wav`
  - `clips/993_to995_chain_5610.700_5620.900_720p_audio.mp4`
  - `frames/993_to995_chain_contact_sheet.jpg`
  - `frames/992_to996_chain_contact_sheet.jpg`
  - `metrics/local_metrics_summary_993.md`
  - `metrics/rms_993_exact_50ms.tsv`
  - `metrics/rms_993_exact_100ms.tsv`
  - `metrics/rms_993_to995_chain_250ms.tsv`
  - `metrics/waveform_993_to995_chain_5610.700_5620.900.png`
  - `metrics/spectrogram_993_to995_chain_5610.700_5620.900.png`

## T0 链条

```text
#992 01:33:29.333-01:33:30.700 ACT-ZICHOU / 子丑  我可能要回地球了
#993 01:33:30.700-01:33:33.233 ACT-ZICHOU / 子丑  因为有些人说 可能
#994 01:33:34.733-01:33:36.466 ACT-ZICHOU / 子丑  因为编剧说 可能
#995 01:33:37.866-01:33:40.900 ACT-ZICHOU / 子丑  因为我写的小说说 可能
#996 01:33:41.033-01:33:42.033 ACT-ZICHOU / 子丑  你 是
```

#993 的位置非常锋利：它不是在 #992 之后隔一段空白才解释，而是从 #992 结束点 `01:33:30.700` 无缝进入。#992 刚把 `我可能要回地球了` 强行推出，#993 马上把原因交给 `有些人说`，且结尾仍是 `可能`。

## 声音事实

相邻窗口：

```text
#992_exact          duration=1.367s  RMS=-14.7381dBFS  Peak=0.0000dBFS
#993_exact          duration=2.533s  RMS=-18.5571dBFS  Peak=-1.9410dBFS
#993_to994_gap      duration=1.500s  RMS=-39.8485dBFS  Peak=-27.6318dBFS
#994_exact          duration=1.733s  RMS=-18.3065dBFS  Peak=-1.5835dBFS
#994_to995_gap      duration=1.400s  RMS=-39.8582dBFS  Peak=-26.6550dBFS
#995_exact          duration=3.034s  RMS=-21.8974dBFS  Peak=-3.8592dBFS
#995_to996_gap      duration=0.133s  RMS=-25.7877dBFS  Peak=-16.2037dBFS
#996_exact          duration=1.000s  RMS=-24.8316dBFS  Peak=-10.7426dBFS
```

对比关系：

```text
#993 比 #992 低 3.8190dB
#993 比 #994 低 0.2506dB，几乎同一声学层级
#993 比 #995 高 3.3403dB
#993 比 #993 到 #994 前低能间隔高 21.2914dB
#994 比 #994 到 #995 前低能间隔高 21.5517dB
```

这说明 #993 不是 #992 那样的峰值强推。#992 是爆出来的重复，#993 是解释句的第一阶。它的声学位置更接近 #994，而不是 #992；也就是说，#993 一进入，声音就从“强推出口”改成“列举理由”。

## #993 句内形状

#993 的 50ms/100ms 滑窗显示，句内不是一条平线，而是前段有起声，后段有一次更强的托起：

```text
#993_exact 50ms top:
1.800-1.850s  RMS=-11.8380dBFS  Peak=-1.9410dBFS
1.750-1.800s  RMS=-12.2818dBFS  Peak=-3.8147dBFS
1.700-1.750s  RMS=-12.8389dBFS  Peak=-4.4838dBFS
1.350-1.400s  RMS=-13.3723dBFS  Peak=-4.3805dBFS

#993_exact 100ms top:
1.700-1.800s  RMS=-12.5514dBFS  Peak=-3.8147dBFS
1.800-1.900s  RMS=-13.9444dBFS  Peak=-1.9410dBFS
1.600-1.700s  RMS=-14.1453dBFS  Peak=-5.3236dBFS
0.200-0.300s  RMS=-14.5669dBFS  Peak=-3.4712dBFS
```

这里不做逐字强行对齐，因为本地 T1 只能确认窗口，不直接确认每个字的精确口型和声源。但可以稳写：#993 的后段被托起，随后立刻进入低能谷。它不是把 `可能` 删除，而是在原因句内部制造一次托举后，把句子交给间隔。

## 三句连续链

#993-#995 链条的 250ms 滑窗最强处：

```text
993_to995_chain 250ms top:
4.250-4.500s  RMS=-14.2681dBFS  Peak=-1.5835dBFS
1.750-2.000s  RMS=-15.4267dBFS  Peak=-1.9410dBFS
1.500-1.750s  RMS=-15.5884dBFS  Peak=-4.4838dBFS
0.250-0.500s  RMS=-15.6653dBFS  Peak=-3.2885dBFS
8.000-8.250s  RMS=-16.1580dBFS  Peak=-3.8592dBFS
```

如果从 #993 链条起点 `01:33:30.700` 算，`4.250-4.500s` 大约落在 #994 内部，`1.750-2.000s` 落在 #993 后段，`8.000-8.250s` 落在 #995 内部。三句形成三块人声峰，中间由两段低能谷隔开。

因此更稳的声音句柄是：

```text
#993 不是证明句，
而是来源转交链的第一块人声。

它和 #994/#995 共同组成：
有些人说 -> 编剧说 -> 我写的小说说。

每一块都把理由推出来，
每一块又都把确定性落回“可能”。
```

## 间隔与静音边界

#993 到 #994 前的 `1.500s` 间隔 RMS=`-39.8485dBFS`，#994 到 #995 前的 `1.400s` 间隔 RMS=`-39.8582dBFS`。两者都很低，但在 `silencedetect -45dB:d=0.3` 下没有 silence event。

所以不能写成绝对静音或清场。更准确的是：电影让人声块之间下沉到低能房间/材料底噪，再让下一块理由从同一空间里冒出来。低能谷的功能不是清空现场，而是把理由一层一层送出来。

#995 到 #996 前只有 `0.133s`，太短，不适合作为常规静音判断。它更像把 `因为我写的小说说 可能` 快速推向 #996 `你 是` 的铰链。

## 音乐边界

本地 T1 不能确认稳定音乐。#993-#995 链条有清楚人声、低能环境/房间底噪、膜面/衣物/材料摩擦候选和轻微触碰声。频谱中没有足以写成旋律线、和声进行、稳定节拍、乐器或合成器进入的独立证据。

尤其需要注意：两个低能间隔的谱心偏高，更多说明低能噪声中高频纹理占比上升，不能据此写成音乐进入。#995 的高频比例也只能作为声音质地变化候选，不能写成配乐或合成器。

稳定写法：

```text
这里的音乐性不来自配乐。
它来自三次相似句法、三块人声峰、两段低能谷，以及每次句尾都退回“可能”的重复节奏。
```

## 画面事实

接触图显示，#993 开始时，画面没有切到“有些人”。低机位仍在，白衣竖纹/罗纹上衣身体在上方俯看，面向膜面和下方空间；半透明膜面/塑料面、墙角/天花板、橙色下光和线条/图案候选继续占据现场。

#993 内部出现动作和亮度变化：白衣身体抬手、触碰或整理膜面，橙色下光增强，膜面被照亮。scene detect 在 #993_to995 链条相对 `1.708333s` 处出现一个 `threshold=0.04` 候选，约对应 `01:33:32.408`。它支持写 #993 内部有身体/光/膜面的视觉变化，不支持写成切到外部证人、编剧、小说或新空间。

关键静帧指标：

```text
993_start mean_luma=63.795  warm=0.876032  orange=0.000000
993_mid   mean_luma=75.362  warm=0.970586  orange=0.194098
993_end   mean_luma=92.933  warm=0.689645  orange=0.114403

994_start mean_luma=78.876  dark=0.121177
994_mid   mean_luma=64.748  dark=0.211832
995_start mean_luma=59.600  dark=0.202571  warm=0.639559
995_mid   mean_luma=68.075  warm=0.838949  orange=0.091780
```

#993 从暗暖的低机位身体/膜面，推到更亮的橙色膜面和动作区。到了 #994/#995，黑色前景与白衣身体共同压入，随后逐渐出现背身和观众席。也就是说，画面不是离开现场，而是把“来源外包”的台词放回一个更公开、更被观看的房间。

## 取证结论

#993 的核心不是“有些人”终于被找到，而是“我可能要回地球了”的理由不再由 `我` 承担。

#992 说：

```text
我可能要回地球了
```

#993 紧接着说：

```text
因为有些人说 可能
```

这里的 `因为` 看似解释，实际削弱主体。它没有说“因为我知道”，也没有说“因为我决定”，而是把原因交给不具名复数。画面也没有给这群人的物证；没有外部证人发言，没有观众特写发言，没有编剧或小说实物。

所以 #993 应写成：

```text
#993 是来源转交的第一阶。
它不是把 #992 坐实，
而是把 #992 的理由交给匿名复数声音。
```

随后 #994/#995 把这条链继续推开：

```text
有些人说
编剧说
我写的小说说
```

这不是事实证据越来越强，而是原因来源越来越远离眼前关系。最冷的一点是：三次转交都没能删掉 `可能`。

## 文中引用的图像资料

以下图像由本篇已有文件引用对应；保留历史引用范围，图像展示不增加新的事实判断。

![992_to996_chain_contact_sheet.jpg](/research/images/1d1b0c9562a20ffedd11.webp)