本篇目录 / Contents
声音/音乐分析协议
一句话判断
《人类投降派》的声音/音乐不能再只作为“氛围”“配乐”或“对白内容”分析。它应被当成一套事件组织系统:
声音打开入口。
空间改写声音。
设备保存声音。
字幕压扁声音。
音乐召回声音。
后台继续发声。
但声音不能替我们结案。
因此,后续全片分析中,声音/音乐应和画面、身体、字幕、材料、摄影机、后台、档案同级进入底账。
为什么要升级
旧方法页已经有“声音优先”模块,但颗粒度仍偏粗:台词、呼吸、材料声、配乐、观众声、后台声、静默只是并列清单。
新的协议要多问四层:
1. 声源层:声音听见了,但来源能否确认?
2. 归属层:它属于画内、画外、后台、回放、字幕、设计层,还是不确定?
3. 形式层:它的近远、干湿、低高、密度、节奏、混响、动态如何工作?
4. 组织层:它让谁进入、谁退场、谁被迫继续、谁获得或失去组织权?
这也是对 声音-音乐场(馆内参考,未随本文公开) 的方法化:声音不是画面之后的解释,而是穿过过滤、遮挡和解释失败的证据层。
外部理论只作为术语支架
本协议接入四组 T4 方法,不让它们裁决片内事实。
| 外部支架 | 给本片的用途 | 必须加的刹车 |
|---|---|---|
| Columbia Film Language Glossary 的 diegetic / non-diegetic / voice-over / soundtrack | 帮助区分声音的世界归属、画外关系和声轨层。 | 世界归属不等于真实归属。 |
| Michel Chion 系的 acousmatic / offscreen sound 术语 | 帮助描述“听见但看不见来源”的声源悬置。 | 看不见来源不能自动升级为神秘、内心或真相。 |
| Open Music Theory / SUNY 的 rhythm、melody、harmony、timbre、texture、dynamics、tempo 等音乐要素 | 把音乐/声床拆成节奏、音色、质地、动态、密度和持续方式。 | 音乐术语不能直接证明心理或情感答案。 |
| ELAN 式多层音视频注释 | 把台词、动作、材料声、字幕、声压、静默、镜头和后台声场放到同一时间轴。 | 注释层越多,越要标证据层级和不确定性。 |
十二轨细读协议
1. 声源与听者
先写“听见了什么”,再写“谁可能在听”,最后才写“来源能否命名”。
听见,不等于知道来源。
声源候选,不等于声源事实。
共同听见,不等于共同裁决。
可标字段:audible_fact / listener_position / source_status / source_certainty / next_t1_check。
2. 声画同位与错位
看嘴、身体、字幕、镜头和声音是否同位。重点不是急着找“谁说的”,而是判断声音有没有稳定归还给嘴。
嘴在场,不代表声音归位。
声音错位,只证明归属出现问题,不证明答案已经出现。
可标字段:mouth_visible / lip_sync / body_sync / subtitle_sync / mismatch_type。
3. 画内、画外与世界归属
区分画内声、画外声、非叙事声、后台声、回放声、档案声、字幕/转录声、设计层声。
声音属于一个世界,不等于属于真相。
画外不等于幕后。
后台不等于隐喻。
可标字段:world_status: diegetic / non_diegetic / ambiguous / backstage / playback / archive / subtitle_only / design_layer。
4. 空间、回声与声场
记录房间、剧场、咖啡馆、水边、后台、黑场、白布下方、电脑前、片尾名单等空间怎样接走声音。
嘴只让声音出发。
空间决定它怎样回来。
可标字段:space / reverb / echo_tail / room_tone / distance / directionality / enclosure。
5. 沉默、停顿与休止
沉默不是缺资料。要把停顿、黑场、低声能、静音切点、话语空窗、音乐休止都登记出来。
不响,不是没有组织。
沉默不能被写成同意、理解或结案。
可标字段:silence_type / pause_length / gap_before / gap_after / who_cannot_continue / residual_sound。
6. 节奏、拍点与重复
记录问句重复、台词复演、声床脉冲、电子提示音、呼吸同步、笑声回返、字幕密度、片尾名单节奏。
重复不是同义反复。
重复是时间替身体排队。
可标字段:rhythm: isolated / repeated / looped / pulsed / interrupted / sustained。
7. 旋律、主题与召回
音乐、祈祷歌、安眠曲、声床主题和片尾配乐要问:它召回了谁,召回了哪个场,是否让缺席者以声音形式回来。
音乐可以召回缺席者。
召回不等于占有。
可标字段:music_material / motif_return / lyric_or_language / recalled_scene / ownership_boundary。
8. 音色、质地与动态
不要只写“压抑”“温柔”“诡异”。要拆成可听特征:干/湿、近/远、薄/厚、低/高、粗/亮、密/空、干净/噪、稳定/颤动、压缩/失真、突然/渐变。
声音不只说了什么。
声音还决定你被它站在多近的地方。
可标字段:texture / timbre / loudness / dynamic_change / density / frequency_band / attack_release。
9. 合唱、复调与多声部
当多人同时说、一个人替另一个人说、字幕和原声不同步、歌曲/对白/环境声互相叠压时,先做多声部表。
多个嘴不等于一个意志。
复调不等于共识。
可标字段:voice_count / foreground_voice / background_voice / overlap / masking / hierarchy_shift。
10. 噪声、环境声与设备声
摩擦、碰撞、门、打火机、呼吸、衣物、塑料、水、雨、空调、电脑、电吉他、现场设备、电子提示音,都应进入声轨。
被当作杂音的东西也在作证。
噪声能进入证据纪律,但不能被随意命名。
可标字段:material_sound / device_sound / noise_floor / event_sound / source_candidate / material_grounding。
11. 录音、回放、声轨与混音
本片有现场录制层,也有后期入梦声音/音乐设计层。分析时不能把二者粗暴合并,也不能凭听感裁决具体混音生产史。
保存声音,也会改写声音。
混音不是整理,它会重新分配前景和后台。
可标字段:recording_layer / design_layer / mix_position / foreground_background / playback_or_live / archive_afterlife。
12. 字幕、转录与歌词
字幕、ASR、OCR、歌词、知识库摘要都不是声音本身。它们让声音可保存,也会删掉音色、呼吸、停顿、口误、重音和空间。
字幕接嘴,但不是嘴。
转录不是原声结案。
可标字段:subtitle_text / spoken_text / translation_gap / asr_conflict / lyric_layer / text_reduction。
《人类投降派》专属声音类型
| 类型 | 典型材料 | 分析问法 |
|---|---|---|
| 地址声 | “你怎么来了”“你在吗”“我在”“我在听呢” | 这句把谁叫进场?谁被迫回应? |
| 近声/低声 | “我必须见你”“我爱你”、床边低语、近耳回应 | 近声有没有真的制造靠近,还是只制造聆听压力? |
| 拒绝/切断声 | “你滚啊”“不想说”“走不通了”、沉默和硬切 | 声音是在拒绝、收束、拖延,还是把拒绝交给别的载体? |
| 排练房间声 | 评价、纠错、坐姿调整、衣物和地面摩擦 | 声音如何把关系改造成可排练材料? |
| 材料声 | 塑料、布、水、门、纸、打火机、床、地面、相机 | 哪个材料把说不出的东西接走了? |
| 低频/电子/权限声 | 声床、提示音、验证/解锁、脉冲、设备感 | 系统声如何替代人声组织入口? |
| 音乐/歌/祈祷 | 入梦配乐、法文祈祷、日语梦语、安眠曲候选 | 音乐在召回谁?它是否把缺席变成可听? |
| 后台/档案声 | 报幕、设备、电脑、片尾名单、静默前后的低声能 | 台前结束后,谁还在用声音工作? |
| 静默/低声能 | 黑场、声学真空、台词空窗、片尾收声 | 不响让谁停手?又留下什么没有被说完? |
片段声轨模板
以后每个 30-90 秒关键声窗,先填这个,再写段落:
timecode:
segment_name:
question:
audible_base:
dialogue:
voice_quality:
music_or_score:
low_frequency_or_bed:
material_sound:
device_or_system_sound:
room_tone_or_ambience:
silence_or_gap:
subtitle_or_transcript:
source_and_world:
source_status: onscreen_sync / onscreen_uncertain / offscreen / acousmatic / design_layer / subtitle_only / playback / archive / unknown
world_status: diegetic / non_diegetic / ambiguous / backstage / documentary_layer / archive_layer
listener_position:
evidence_tier:
source_certainty:
formal_sound:
texture: dry/wet, near/far, thin/thick, clean/noisy, low/high, stable/pulsed
rhythm: isolated/repeated/looped/interrupted/sustained
dynamics: rising/falling/flat/dropout/sudden_peak
space: close_room/reverberant_room/open_space/black_field/backstage/uncertain
mix_position: foreground/midground/background/masked/unknown
sound_image_relation:
mouth_visible:
body_sync:
camera_relation:
subtitle_relation:
contradiction:
organization:
sound_switch:
carrier_shift:
event_organization_power:
what_voice_cannot_finish:
what_takes_over:
boundary:
locked_fact:
cannot_claim:
counter_reading:
next_t1_check:
next_mimo_or_tool_check:
使用顺序
- 先开 30-90 秒声窗,不急着解释。
- 把所有可听事实列出来:人声、非人声、材料声、声床、音乐、静默、字幕。
- 标声源状态:同步可见、画外、不可见来源、设计层、回放、档案、字幕-only、不确定。
- 标世界归属:画内、画外、非叙事、后台、纪录层、档案层、含混。
- 标形式:音色、动态、节奏、空间、混响、密度、近远。
- 找“声音开关”:这一声响起/停下以后,现场组织权有没有换手?
- 找“换载”:声音不能完成的东西,被身体、镜头、材料、字幕、音乐、后台或档案接走了吗?
- 写 T3 机制,并同时写
cannot_claim。 - 遇到声源、身份、心理、consent、伤害、生产史,降级为候选,回 T0/T1/T2。
- 对冲突窗口优先用 MiMo 带音频复扫、本地音频切片、频谱/声能检测和人工听写复核。
前 5 分钟示范接入
| 时间窗 | 声音事实/候选 | 协议读法 | 边界 |
|---|---|---|---|
00:00-00:25 |
数字 0、红暗人脸、中文声音、英文字幕、低频电子声床和高频提示音候选。 |
0 是声画地址协议;字幕、脸、问句和声床共同把“来者”登记出来。 |
MiMo 的“无自然人声”与 T0/T1 冲突,必须降级。 |
00:50-01:15 |
“我必须见你”近声,画面保持暗场、距离和静止。 | 近声没有自动制造靠近;声音要求靠近,画面把靠近交给黑场和位置阻力。 | “拉远”作为观看经验可写,具体镜头参数需 T1 复核。 |
02:00-04:20 |
“我爱你”后人声退出,声床/电子声、暗区、观察位、相机和片名继续工作。 | 人声短,装置长;情话不是被回应,而是被观察、拍摄、命名系统接走。 | 身份和方位仍以 T0/T1 为准,不让 MiMo 裁决持机者。 |
04:20-05:15 |
数字 1 后房间混响、坐姿调整、衣物/地面摩擦、子丑评价声进入。 |
声音从电子声床切到排练房间;关系话语第一次被房间、地面和评价声改造成材料。 | 不把评价声写成片外真实关系裁决。 |
质量检查
每次声音/音乐分析写完后,问十个问题:
- 我有没有只写“氛围感”,却没有写可听事实?
- 我有没有把字幕当成原声?
- 我有没有把听感直接写成心理?
- 我有没有把声源候选写成已确认来源?
- 我有没有登记沉默、低声能和休止?
- 我有没有登记材料声、环境声和设备声?
- 我有没有说明声音和画面是同位、错位、延迟还是互相遮蔽?
- 我有没有说明空间、混响、距离和动态如何改变聆听位置?
- 我有没有写出声音如何改变现场组织权?
- 我有没有写出这段声音不能证明什么?
如果以上问题没有过关,就不能把声音分析升级为 T3 结论。
当前工作判断
这套协议的目标不是让声音分析变复杂,而是让它变稳:
先承认听见。
再标记来源状态。
再分析形式。
再判断组织权转移。
最后写边界。
声音/音乐可以让《人类投降派》的全片分析更细,因为它常常比画面更早暴露压力,也常常比台词更晚退场。但它必须始终服从一句话:
声音可以打开现场,不能替我们结案。
