# 声音/音乐分析协议

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-19

证据边界：本页是方法协议，不新增影片事实裁决。外部电影声音理论只作 T4 术语参照；MiMo、ASR、OCR、视频索引和声学检测只作 T2 候选；涉及片内身份、说话人、声源、心理、关系、consent、现实伤害、导演意图、生产史或全片终极解释时，必须回到 T0/T1/T2 证据链。

# 声音/音乐分析协议

## 一句话判断

《人类投降派》的声音/音乐不能再只作为“氛围”“配乐”或“对白内容”分析。它应被当成一套事件组织系统：

```text
声音打开入口。
空间改写声音。
设备保存声音。
字幕压扁声音。
音乐召回声音。
后台继续发声。
但声音不能替我们结案。
```

因此，后续全片分析中，声音/音乐应和画面、身体、字幕、材料、摄影机、后台、档案同级进入底账。

## 为什么要升级

旧方法页已经有“声音优先”模块，但颗粒度仍偏粗：台词、呼吸、材料声、配乐、观众声、后台声、静默只是并列清单。

新的协议要多问四层：

```text
1. 声源层：声音听见了，但来源能否确认？
2. 归属层：它属于画内、画外、后台、回放、字幕、设计层，还是不确定？
3. 形式层：它的近远、干湿、低高、密度、节奏、混响、动态如何工作？
4. 组织层：它让谁进入、谁退场、谁被迫继续、谁获得或失去组织权？
```

这也是对 声音-音乐场（馆内参考，未随本文公开） 的方法化：声音不是画面之后的解释，而是穿过过滤、遮挡和解释失败的证据层。

## 外部理论只作为术语支架

本协议接入四组 T4 方法，不让它们裁决片内事实。

| 外部支架 | 给本片的用途 | 必须加的刹车 |
|---|---|---|
| Columbia Film Language Glossary 的 diegetic / non-diegetic / voice-over / soundtrack | 帮助区分声音的世界归属、画外关系和声轨层。 | 世界归属不等于真实归属。 |
| Michel Chion 系的 acousmatic / offscreen sound 术语 | 帮助描述“听见但看不见来源”的声源悬置。 | 看不见来源不能自动升级为神秘、内心或真相。 |
| Open Music Theory / SUNY 的 rhythm、melody、harmony、timbre、texture、dynamics、tempo 等音乐要素 | 把音乐/声床拆成节奏、音色、质地、动态、密度和持续方式。 | 音乐术语不能直接证明心理或情感答案。 |
| ELAN 式多层音视频注释 | 把台词、动作、材料声、字幕、声压、静默、镜头和后台声场放到同一时间轴。 | 注释层越多，越要标证据层级和不确定性。 |

## 十二轨细读协议

### 1. 声源与听者

先写“听见了什么”，再写“谁可能在听”，最后才写“来源能否命名”。

```text
听见，不等于知道来源。
声源候选，不等于声源事实。
共同听见，不等于共同裁决。
```

可标字段：`audible_fact / listener_position / source_status / source_certainty / next_t1_check`。

### 2. 声画同位与错位

看嘴、身体、字幕、镜头和声音是否同位。重点不是急着找“谁说的”，而是判断声音有没有稳定归还给嘴。

```text
嘴在场，不代表声音归位。
声音错位，只证明归属出现问题，不证明答案已经出现。
```

可标字段：`mouth_visible / lip_sync / body_sync / subtitle_sync / mismatch_type`。

### 3. 画内、画外与世界归属

区分画内声、画外声、非叙事声、后台声、回放声、档案声、字幕/转录声、设计层声。

```text
声音属于一个世界，不等于属于真相。
画外不等于幕后。
后台不等于隐喻。
```

可标字段：`world_status: diegetic / non_diegetic / ambiguous / backstage / playback / archive / subtitle_only / design_layer`。

### 4. 空间、回声与声场

记录房间、剧场、咖啡馆、水边、后台、黑场、白布下方、电脑前、片尾名单等空间怎样接走声音。

```text
嘴只让声音出发。
空间决定它怎样回来。
```

可标字段：`space / reverb / echo_tail / room_tone / distance / directionality / enclosure`。

### 5. 沉默、停顿与休止

沉默不是缺资料。要把停顿、黑场、低声能、静音切点、话语空窗、音乐休止都登记出来。

```text
不响，不是没有组织。
沉默不能被写成同意、理解或结案。
```

可标字段：`silence_type / pause_length / gap_before / gap_after / who_cannot_continue / residual_sound`。

### 6. 节奏、拍点与重复

记录问句重复、台词复演、声床脉冲、电子提示音、呼吸同步、笑声回返、字幕密度、片尾名单节奏。

```text
重复不是同义反复。
重复是时间替身体排队。
```

可标字段：`rhythm: isolated / repeated / looped / pulsed / interrupted / sustained`。

### 7. 旋律、主题与召回

音乐、祈祷歌、安眠曲、声床主题和片尾配乐要问：它召回了谁，召回了哪个场，是否让缺席者以声音形式回来。

```text
音乐可以召回缺席者。
召回不等于占有。
```

可标字段：`music_material / motif_return / lyric_or_language / recalled_scene / ownership_boundary`。

### 8. 音色、质地与动态

不要只写“压抑”“温柔”“诡异”。要拆成可听特征：干/湿、近/远、薄/厚、低/高、粗/亮、密/空、干净/噪、稳定/颤动、压缩/失真、突然/渐变。

```text
声音不只说了什么。
声音还决定你被它站在多近的地方。
```

可标字段：`texture / timbre / loudness / dynamic_change / density / frequency_band / attack_release`。

### 9. 合唱、复调与多声部

当多人同时说、一个人替另一个人说、字幕和原声不同步、歌曲/对白/环境声互相叠压时，先做多声部表。

```text
多个嘴不等于一个意志。
复调不等于共识。
```

可标字段：`voice_count / foreground_voice / background_voice / overlap / masking / hierarchy_shift`。

### 10. 噪声、环境声与设备声

摩擦、碰撞、门、打火机、呼吸、衣物、塑料、水、雨、空调、电脑、电吉他、现场设备、电子提示音，都应进入声轨。

```text
被当作杂音的东西也在作证。
噪声能进入证据纪律，但不能被随意命名。
```

可标字段：`material_sound / device_sound / noise_floor / event_sound / source_candidate / material_grounding`。

### 11. 录音、回放、声轨与混音

本片有现场录制层，也有后期入梦声音/音乐设计层。分析时不能把二者粗暴合并，也不能凭听感裁决具体混音生产史。

```text
保存声音，也会改写声音。
混音不是整理，它会重新分配前景和后台。
```

可标字段：`recording_layer / design_layer / mix_position / foreground_background / playback_or_live / archive_afterlife`。

### 12. 字幕、转录与歌词

字幕、ASR、OCR、歌词、知识库摘要都不是声音本身。它们让声音可保存，也会删掉音色、呼吸、停顿、口误、重音和空间。

```text
字幕接嘴，但不是嘴。
转录不是原声结案。
```

可标字段：`subtitle_text / spoken_text / translation_gap / asr_conflict / lyric_layer / text_reduction`。

## 《人类投降派》专属声音类型

| 类型 | 典型材料 | 分析问法 |
|---|---|---|
| 地址声 | “你怎么来了”“你在吗”“我在”“我在听呢” | 这句把谁叫进场？谁被迫回应？ |
| 近声/低声 | “我必须见你”“我爱你”、床边低语、近耳回应 | 近声有没有真的制造靠近，还是只制造聆听压力？ |
| 拒绝/切断声 | “你滚啊”“不想说”“走不通了”、沉默和硬切 | 声音是在拒绝、收束、拖延，还是把拒绝交给别的载体？ |
| 排练房间声 | 评价、纠错、坐姿调整、衣物和地面摩擦 | 声音如何把关系改造成可排练材料？ |
| 材料声 | 塑料、布、水、门、纸、打火机、床、地面、相机 | 哪个材料把说不出的东西接走了？ |
| 低频/电子/权限声 | 声床、提示音、验证/解锁、脉冲、设备感 | 系统声如何替代人声组织入口？ |
| 音乐/歌/祈祷 | 入梦配乐、法文祈祷、日语梦语、安眠曲候选 | 音乐在召回谁？它是否把缺席变成可听？ |
| 后台/档案声 | 报幕、设备、电脑、片尾名单、静默前后的低声能 | 台前结束后，谁还在用声音工作？ |
| 静默/低声能 | 黑场、声学真空、台词空窗、片尾收声 | 不响让谁停手？又留下什么没有被说完？ |

## 片段声轨模板

以后每个 30-90 秒关键声窗，先填这个，再写段落：

```yaml
timecode:
segment_name:
question:

audible_base:
  dialogue:
  voice_quality:
  music_or_score:
  low_frequency_or_bed:
  material_sound:
  device_or_system_sound:
  room_tone_or_ambience:
  silence_or_gap:
  subtitle_or_transcript:

source_and_world:
  source_status: onscreen_sync / onscreen_uncertain / offscreen / acousmatic / design_layer / subtitle_only / playback / archive / unknown
  world_status: diegetic / non_diegetic / ambiguous / backstage / documentary_layer / archive_layer
  listener_position:
  evidence_tier:
  source_certainty:

formal_sound:
  texture: dry/wet, near/far, thin/thick, clean/noisy, low/high, stable/pulsed
  rhythm: isolated/repeated/looped/interrupted/sustained
  dynamics: rising/falling/flat/dropout/sudden_peak
  space: close_room/reverberant_room/open_space/black_field/backstage/uncertain
  mix_position: foreground/midground/background/masked/unknown

sound_image_relation:
  mouth_visible:
  body_sync:
  camera_relation:
  subtitle_relation:
  contradiction:

organization:
  sound_switch:
  carrier_shift:
  event_organization_power:
  what_voice_cannot_finish:
  what_takes_over:

boundary:
  locked_fact:
  cannot_claim:
  counter_reading:
  next_t1_check:
  next_mimo_or_tool_check:
```

## 使用顺序

1. 先开 30-90 秒声窗，不急着解释。
2. 把所有可听事实列出来：人声、非人声、材料声、声床、音乐、静默、字幕。
3. 标声源状态：同步可见、画外、不可见来源、设计层、回放、档案、字幕-only、不确定。
4. 标世界归属：画内、画外、非叙事、后台、纪录层、档案层、含混。
5. 标形式：音色、动态、节奏、空间、混响、密度、近远。
6. 找“声音开关”：这一声响起/停下以后，现场组织权有没有换手？
7. 找“换载”：声音不能完成的东西，被身体、镜头、材料、字幕、音乐、后台或档案接走了吗？
8. 写 T3 机制，并同时写 `cannot_claim`。
9. 遇到声源、身份、心理、consent、伤害、生产史，降级为候选，回 T0/T1/T2。
10. 对冲突窗口优先用 MiMo 带音频复扫、本地音频切片、频谱/声能检测和人工听写复核。

## 前 5 分钟示范接入

| 时间窗 | 声音事实/候选 | 协议读法 | 边界 |
|---|---|---|---|
| `00:00-00:25` | 数字 `0`、红暗人脸、中文声音、英文字幕、低频电子声床和高频提示音候选。 | `0` 是声画地址协议；字幕、脸、问句和声床共同把“来者”登记出来。 | MiMo 的“无自然人声”与 T0/T1 冲突，必须降级。 |
| `00:50-01:15` | “我必须见你”近声，画面保持暗场、距离和静止。 | 近声没有自动制造靠近；声音要求靠近，画面把靠近交给黑场和位置阻力。 | “拉远”作为观看经验可写，具体镜头参数需 T1 复核。 |
| `02:00-04:20` | “我爱你”后人声退出，声床/电子声、暗区、观察位、相机和片名继续工作。 | 人声短，装置长；情话不是被回应，而是被观察、拍摄、命名系统接走。 | 身份和方位仍以 T0/T1 为准，不让 MiMo 裁决持机者。 |
| `04:20-05:15` | 数字 `1` 后房间混响、坐姿调整、衣物/地面摩擦、子丑评价声进入。 | 声音从电子声床切到排练房间；关系话语第一次被房间、地面和评价声改造成材料。 | 不把评价声写成片外真实关系裁决。 |

## 质量检查

每次声音/音乐分析写完后，问十个问题：

1. 我有没有只写“氛围感”，却没有写可听事实？
2. 我有没有把字幕当成原声？
3. 我有没有把听感直接写成心理？
4. 我有没有把声源候选写成已确认来源？
5. 我有没有登记沉默、低声能和休止？
6. 我有没有登记材料声、环境声和设备声？
7. 我有没有说明声音和画面是同位、错位、延迟还是互相遮蔽？
8. 我有没有说明空间、混响、距离和动态如何改变聆听位置？
9. 我有没有写出声音如何改变现场组织权？
10. 我有没有写出这段声音不能证明什么？

如果以上问题没有过关，就不能把声音分析升级为 T3 结论。

## 当前工作判断

这套协议的目标不是让声音分析变复杂，而是让它变稳：

```text
先承认听见。
再标记来源状态。
再分析形式。
再判断组织权转移。
最后写边界。
```

声音/音乐可以让《人类投降派》的全片分析更细，因为它常常比画面更早暴露压力，也常常比台词更晚退场。但它必须始终服从一句话：

```text
声音可以打开现场，不能替我们结案。
```