# 4K 无字幕 #1030 本地复核

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-23

证据边界：T0 台词账锁定 #1030 ACT-AMENG/阿蒙 `难道你要一直这样下去吗`，时间 01:35:06.066-01:35:07.766；并以后续 #1031 ACT-AMENG/阿蒙 `哎`，时间 01:35:12.400-01:35:13.166，作为质问后等待的边界。本页只复核 #1030 如何接住 #1029 `不要一直做一个胆小鬼`，把人格标签推进为时间/存在质问，并复核 #1030 后等待如何把近脸推出到高台、观众与塑料围合的公开观看场。不得把 #1030 写成真实心理事实、真实人格事实、治疗判断、口型身份裁决、音乐进入、设备提示、无线电声像、报告 UI、绝对静音或硬切换场。

# 4K 无字幕 #1030 本地复核

## 来源信息

- 母文件：`〔本地资料路径省略〕 无字幕 28g 4k.mov`
- 复核素材目录：`inspool-wiki-zh/raw/assets/4k-nosub-restart-20260623/1030-duration-existence-question-nooffset`
- T0 台词账：[角色逐时轴全台词幽灵机制账-2026-06-03.tsv（台词字段公开版）](/research/dialogue)
- T0 锁定：#1030，ACT-AMENG / 阿蒙，`难道你要一直这样下去吗`，`01:35:06.066-01:35:07.766`
- 后续边界：#1031，ACT-AMENG / 阿蒙，`哎`，`01:35:12.400-01:35:13.166`
- MiMo T2：见 [MiMo-4K无字幕第1030一直这样下去到1031哎标准API声画音频复核-2026-06-23](/research/hs-10bdcd454b5c3571)。可保留 #1030 起于白衣近脸、连续拉开到高台/观众/塑料围合、无可确认音乐/设备声方向；声线性别、录音棚/小房间、心理动机、口型和声源位置均降级。

## 核心摘要

#1030 接住 #1029 的 `一直`，但把句法从命令改成反问：

```text
不要一直做一个胆小鬼
-> 难道你要一直这样下去吗
```

#1029 把 #1028 的 `害怕` 改写成 `胆小鬼`；#1030 不再重复这个人格标签，而是把它隐去，改说 `这样`。`这样` 是一个空指代：它可以回收 `紧张 / 害怕 / 胆小鬼`，但不再把词说满。随后 `下去吗` 把这个状态推向未来。稳定读法是：#1030 不是心理追问，而是时间化质问。

画面上，#1030 起点仍压在白衣男性近脸和膜面线画上；句尾已经拉开到高台、黑衣站立者、观众/参与者、手机记录和半透明塑料围合。当前阈值下 #1030 到 #1031 没有 scene 命中，说明这更像一个连续镜头运动完成的空间重构，而不是一句话后切到新解释空间。

## 声音指标

关键句与等待：

```text
1030_exact                         duration=1.700s RMS=-16.0118dBFS Peak=-0.5374dBFS
1029_to1030_gap                    duration=0.800s RMS=-36.9820dBFS Peak=-19.5703dBFS
1030_to1031_wait                   duration=4.634s RMS=-23.0775dBFS Peak=-8.1303dBFS
1030_to1031_question_wait_sigh      duration=7.100s RMS=-20.3488dBFS Peak=-0.5374dBFS
1029_to1031_label_question_sigh     duration=9.466s RMS=-19.8632dBFS Peak=-0.5374dBFS
```

#1030 比 #1029 高 `0.8833dB`，比 #1028 低 `0.0632dB`，比 #1027 高 `1.1737dB`，比 #1026 高 `5.6941dB`。它不是一次远超前文的爆发，而是仍处在 #1027-#1030 负向声压平台内。真正变化在句法：从“不要做某种人”变成“你要这样持续下去吗”。

句内能量前重后落：

```text
1030_first_half RMS=-14.8340dBFS
1030_tail_half  RMS=-17.6330dBFS
1030_q1         RMS=-13.6698dBFS
1030_q2         RMS=-16.4295dBFS
1030_q3         RMS=-16.4646dBFS
1030_q4         RMS=-19.2363dBFS
```

前半句比尾半句高 `2.7990dB`，q1 比 q4 高 `5.5665dB`。它不像 #1029 那样尾部大幅撤到 q4 `-27.0578dBFS`，但同样不是尾部加冕。最强短窗集中在句子前中段：

```text
50ms top  0.39-0.44s RMS=-8.0882dBFS
100ms top 0.36-0.46s RMS=-9.8374dBFS
250ms top 0.19-0.44s RMS=-11.3690dBFS
500ms top 0.09-0.59s RMS=-13.1566dBFS
```

50ms 细表也显示，开头不是立即爆发，而是从低能起步后迅速推起：

```text
0.00-0.05s RMS=-41.8500dBFS
0.10-0.15s RMS=-14.9220dBFS
0.20-0.25s RMS=-10.8984dBFS
0.40-0.45s RMS=-8.7337dBFS
0.80-0.85s RMS=-13.0875dBFS
1.05-1.10s RMS=-13.2952dBFS
1.65-1.70s RMS=-21.0714dBFS
```

这说明 #1030 的质问不是整句平铺，而是前部把反问格式推起，中段保留一小次抬头，尾部落下。`下去吗` 没有形成音乐式高潮或裁判式高点；它把问题交给后面的等待。

## 声音-音乐边界

#1030 精确句仍以人声频带为主：

```text
1030_exact voice_250_4000_ratio=0.755908
1030_exact low_20_250_ratio=0.232115
1030_exact high_4000_12000_ratio=0.011698
1030_exact air_12000_20000_ratio=0.000257
1030_exact spectral_centroid=778.8757Hz
1030_exact rolloff95=1720.0000Hz
1030_exact stereo_corr=1.000000
1030_exact side_mid_ratio=0
```

前半句人声占比更高：

```text
1030_first_half voice=0.982230 high=0.009844 air=0.000048
1030_tail_half  voice=0.606025 high=0.016099 air=0.000421
```

尾半句低频比例升高，不等于音乐进入。当前没有旋律、节拍、和声、配器、乐器、合成器序列、无线电声像、设备提示、声道空间打开或可见声源设备。`silencedetect -45dB:d=0.3` 对 #1030 精确句和 #1030 到 #1031 的等待均无 silence event。可写成低能房间/材料声床持续，不能写成绝对静音或音乐过门。

## 画面指标

关键静帧：

```text
1030_start 5706.066  白衣男性近脸、侧向视线、膜面线画、暖色边缘
1030_q1    5706.491  近脸仍在，镜头开始拉开，膜面线画和背景人物更可见
1030_mid   5706.916  近脸边缘退开，空间开始显露
1030_q3    5707.341  高台/黑衣站立者和观众结构进入主构图
1030_tail  5707.733  黑衣站立者、高台、观众、塑料围合成为主结构
1030_wait  5709.500  公共观看场稳定，观众/参与者静态等待
1031_start 5712.400  高台正面、观众席和塑料围合清晰
```

颜色和亮度变化：

```text
1030_start luma=73.5892 dark=0.0277 sat=0.3116
1030_q1    luma=70.3532 dark=0.0433 sat=0.2909
1030_mid   luma=63.2290 dark=0.0644 sat=0.2671
1030_q3    luma=64.2430 dark=0.0772 sat=0.2153
1030_tail  luma=65.8279 dark=0.1078 sat=0.1780
1030_wait  luma=71.9115 dark=0.1413 sat=0.0921
1031_start luma=97.6903 dark=0.0062 sat=0.0649
```

#1030 句内不是越来越暖、越来越贴脸；它从白衣近脸/暖色膜面，转向更暗、更低饱和的公开空间。#1031 起点则明显更亮、更冷、更公开。这个变化支持“近脸被推出到观看场”，不支持“脸签收了心理事实”。

场景检测：

```text
1030_to1031_question_wait_sigh_720p scene>0.04 hits=0
```

这不能证明绝对无剪辑，但足以支持保守判断：当前窗口内部没有可检测的硬切命中；#1030 的空间展开主要由连续镜头运动完成。

## 稳定读法

```text
#1029 人格化裁决：不要一直做一个胆小鬼
-> #1030 时间化质问：难道你要一直这样下去吗
-> #1030 后等待：近脸退出，公开观看场显影
-> #1031 哎：在公开场中接入下一口气
```

#1030 的关键不是“谁真的会这样下去”，而是声音把 #1029 已经给出的标签转成未来压力。`这样` 不说明白，反而更强：它把前面所有不合格状态压缩成一个可持续的姿态。画面不替这个判断作心理证明，而是把近脸、膜面、站立者、观众和记录手机一起打开，使质问进入公开观看机器。

## 待确认问题

- 口型同步不能由当前窗口确认；#1030 和 #1031 的具体可见声源位置仍回到 T0，不由画面裁决。
- #1030 后等待没有 silence event，但具体底噪来源不能确认。
- 高台黑衣站立者、观众席中各个个体身份不能由本页裁定。
- `这样` 的后续回返需要继续复核 #1040、#1115 等 T0 候选句；本页只处理 #1030 精确窗口和到 #1031 的等待。