# #1029：不要一直做一个胆小鬼

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-23

证据边界：本页综合 T0 台词账、T1 本地声画取证与 MiMo T2。T0 锁定 #1029 阿蒙 `不要一直做一个胆小鬼`；T1 锁定 #1029 声压仍处于 #1027-#1030 负向链平台，句首强开、前半句强、尾部撤落，画面不给真实胆小表情、心理诊断、音乐、设备声、无线电声像、报告 UI 或 #1029 后硬切证据。MiMo 只作 T2 辅助，性别/身份/心理/黑胶声源/象征过度解释和误转写均降级。

# #1029：`不要一直做一个胆小鬼`

#1029 的冷，不在于它比前后句更响。它的冷在语法。

前面两句是：

```text
你不要那么紧张
你不要那么害怕
```

到了 #1029，句子变成：

```text
不要一直做一个胆小鬼
```

`紧张` 和 `害怕` 还像身体反应。它们可以被看成现场压力、呼吸、肌肉、迟疑、眼神、动作僵硬。但 `胆小鬼` 不是反应，而是人。它把“你正在害怕”改写成“你一直在做一个这样的人”。

这就是 #1029 在链条里的位置：它不是更强的安慰，也不是更准确的心理判断，而是人格化裁决。

## 声音：不更大，但更像盖章

声压位置先摆出来：

```text
#1026 你应该更自在一点       RMS=-21.7059dBFS
#1027 你不要那么紧张         RMS=-17.1855dBFS
#1028 你不要那么害怕         RMS=-15.9486dBFS
#1029 不要一直做一个胆小鬼   RMS=-16.8951dBFS
#1030 难道你要一直这样下去吗 RMS=-16.0118dBFS
```

#1029 比 #1028 低 `0.9465dB`，比 #1030 低 `0.8833dB`。所以它不是这几句里最响的声音。不能写成“声音突然加大，于是形成裁决”。更准确的是：它在 #1027-#1030 的同一负向平台内，把语义性质换了。

它仍比 #1026 `你应该更自在一点` 高 `4.8109dB`，也比 #1027 高 `0.2904dB`。这说明它没有退回正向状态清单的低位。它仍在 `不要紧张 / 不要害怕` 的禁令声场里，只是把禁令对象从反应改成了人格。

句内形状很重要：

```text
1029_first_half RMS=-15.3779dBFS
1029_tail_half  RMS=-19.2469dBFS
1029_q1         RMS=-14.6054dBFS
1029_q2         RMS=-16.3209dBFS
1029_q3         RMS=-16.6068dBFS
1029_q4         RMS=-27.0578dBFS
```

前半句比尾半句高 `3.8691dB`，q1 比 q4 高 `12.4524dB`。这让 #1029 和 #1028 拉开了。#1028 前后半句几乎等强，像是把整句 `不要害怕` 持续压住；#1029 则是开口先压进去，尾部明显撤落。

最强短窗全在开头：

```text
50ms top  0.01-0.06s RMS=-8.5682dBFS
100ms top 0.00-0.10s RMS=-9.6003dBFS
250ms top 0.00-0.25s RMS=-12.9223dBFS
```

这给听感一个非常具体的形状：`不要` 先把命令格式钉住，然后 `一直` 把时间拉长，最后 `胆小鬼` 把人装进标签里。尾部撤落不是压力消失，而像裁决已经完成后，声音从标签上撤开。

## `一直`：把状态拉成长时段

#1029 不是只说：

```text
不要做一个胆小鬼
```

它说的是：

```text
不要一直做一个胆小鬼
```

`一直` 很关键。它把 #1028 的 `害怕` 从当下反应拉成长时段。你不是现在害怕一下，你是一直这样。到了 #1030，这个时间轴会进一步被拉开：

```text
难道你要一直这样下去吗
```

所以 #1029 是 #1030 的前奏。#1029 先把人格标签放进 `一直`，#1030 再把 `一直` 变成“下去吗”的未来质问。链条应读成：

```text
害怕
-> 胆小鬼
-> 一直做胆小鬼
-> 一直这样下去吗
```

这不是心理学判断的细化，而是时间化的裁决。一个短暂反应被改写成持续人格，一个持续人格又被送往未来。

## 不是音乐：高频候选仍不能越界

#1029 的频谱比 #1028 更复杂：

```text
1029_exact voice_250_4000_ratio=0.759278
1029_exact high_4000_12000_ratio=0.148037
1029_exact air_12000_20000_ratio=0.009988
1029_exact centroid=2112.5148Hz
```

这说明 #1029 的确比 #1028 多出一些中高频材料。但最强开头仍然是清楚人声：

```text
0.00-0.05s RMS=-8.6176 voice=0.975469 high=0.005285 air=0.000038
0.05-0.10s RMS=-10.8725 voice=0.990985 high=0.002165 air=0.000086
```

真正容易误听的地方在 `0.85-0.95s`：

```text
0.85-0.90s RMS=-15.4274 voice=0.116489 high=0.823610 air=0.019231
0.90-0.95s RMS=-16.2433 voice=0.045281 high=0.861315 air=0.057259
```

这里可以写成局部辅音、摩擦、材料或录音边缘候选，不能写成音乐或设备事实。没有旋律、节拍、和声、配器、合成器序列、无线电声像、可见设备或声道空间打开：

```text
1029_exact stereo_corr=1.000000
1029_exact side_mid_ratio=0
```

MiMo 音频报告猜测背景“噼啪/沙沙”可能类似黑胶或模拟底噪。这一点要降级。T1 能说的只是：有局部中高频/摩擦性材料，但目前没有黑胶、设备、音乐或无线电互证。

更长链条反而把它压回人声命名链：

```text
1029_to1030_coward_to_duration_question voice=0.922540 high=0.034202 air=0.001367
1028_to1030_fear_moral_chain            voice=0.861879 high=0.069027 air=0.005978
1027_to1030_negative_body_moral_chain    voice=0.901305 high=0.044192 air=0.004143
```

这一段的“系统感”来自人声连续命名，而不是配乐。

## 画面：近脸不等于人格签收

#1029 的画面比 #1028 更靠近脸，但这并不等于脸签收了 `胆小鬼`。

联系图显示，#1029 起点进入白衣男性近脸、侧向视线、膜面线画、黑衣旁观者和背景人物。膜面线画在头部上方或后方变得清楚，暖光和饱和度逐步增强：

```text
1029_start luma=80.2066 dark=0.0097 warm=0.9780 sat=0.0874
1029_q1    luma=74.3296 dark=0.0156 warm=0.9997 sat=0.1441
1029_mid   luma=65.1373 dark=0.0349 warm=0.99999 sat=0.2423
1029_q3    luma=66.2221 dark=0.0386 warm=0.99999 sat=0.2766
1029_tail  luma=67.8831 dark=0.0406 warm=1.0000 sat=0.3051
```

亮度从起点到中段降低，暖比和饱和度上升。它不是把心理真相照亮，而是把这句裁决放进一个更暖、更饱和、更近的膜面场里。

这时候最容易犯的错误，是把近脸当成心理证明。画面靠近脸，但没有给清楚的胆怯表情、逃避动作、心理特写或被旁观者裁判的动作。人物视线没有直接对镜头签收；膜面线画和旁观者在场，却没有把 `胆小鬼` 变成可见事实。

所以这句的声画关系应该写成：

```text
声音在裁决。
画面在承受。
脸没有签收。
```

这比“他说他是胆小鬼 / 他看起来胆小”要稳得多。#1029 的裁决力量来自外部声音，不来自画面证明。

场景检测也支持保守写法：

```text
1029_exact_coward_label_720p scene>0.04 hits=0
1029_to1030_coward_to_duration_question_720p scene>0.04 hits=0
1028_to1030_fear_moral_chain_720p scene>0.04 hits=0
```

这不能证明绝对无剪辑，但可以说：当前阈值下 #1029 没有被切入新空间、新设备或心理诊断界面。人格标签仍留在同一膜面/近脸/旁观结构里。

## MiMo T2：有用，但要把误转写拦住

MiMo 本轮标准 API 三路成功。可保留方向如下：

```text
无可确认背景音乐、设备提示或无线电声像
低机位、白衣近脸、半透明塑料膜、膜面黑色线画
右侧黑衣旁观者和背景人物形成观察结构
暖黄光与冷白环境光并置
声音主动施压，画面相对沉默
```

但 MiMo 的边界也很清楚。它倾向把声线说成女性，不能覆盖 T0 的 ACT-AMENG / 阿蒙。它把背景声猜成黑胶或模拟底噪，不能覆盖 T1 的“不确认设备/音乐”。它在 #1029-#1030 视频报告里误写台词，不能作为对白依据。

最重要的是，MiMo 会自然滑向“脆弱、恐惧投射、束缚、压抑”这类心理/象征词。这里必须拦住。#1029 的事实层不是“这个人胆小”，而是“这句话把人命名为胆小鬼”。心理不由画面证明，裁决由声音执行。

## 结构：身体反应被改写成人格

现在这条链可以更精确地写成：

```text
#1022 情绪规范入口：你应该更开心一点
#1023 认知规范：或许你不应该想这么多
#1024 正向状态复制 1：更开心
#1025 正向状态复制 2：更快乐
#1026 正向状态复制 3：更自在
#1027 身体反应禁止 1：不要紧张
#1028 身体反应禁止 2：不要害怕
#1029 人格化裁决：不要一直做一个胆小鬼
#1030 时间/存在质问：难道你要一直这样下去吗
```

#1029 是从“状态管理”到“人格管理”的跨越。#1027/#1028 还像在管理身体反应：不要紧张，不要害怕。#1029 已经不满足于让反应停下，它把反应解释成一种人。

这就是为什么 #1029 不能写成单纯辱骂，也不能写成真实心理判断。它更像一套程序的下一格：

```text
先规定你应该是什么状态。
再禁止你出现哪些反应。
最后把这些反应合成为你是什么人。
```

稳定读法：

```text
#1029 不是心理判断。
它是人格化裁决。
声音没有显著超过 #1028/#1030，但句首强开，把 `不要` 命令格式先钉住。
`一直` 把短暂反应拉成长时段。
`胆小鬼` 把 #1028 的 `害怕` 改写成人格标签。
画面给近脸、膜面线画、旁观者和暖光，但不给胆小表情事实。
```

完整 T1 复核见 [2026-06-23-4K无字幕母文件开场95分03秒到95分08秒第1029胆小鬼人格标签与一直这样质问前奏复核](/research/hs-a431d2bb39c83567)；MiMo T2 见 [MiMo-4K无字幕第1029胆小鬼到1030一直这样标准API声画音频复核-2026-06-23](/research/hs-902e7dcb8769a278)。下一步应进入 #1030 阿蒙 `难道你要一直这样下去吗`，复核 `一直这样` 如何把 #1029 的人格标签进一步推成时间/存在质问。