本篇目录 / Contents
自动字幕与转录:机器如何把声音变成第三人称文件
基本对象
自动字幕和转录表面上是在“帮我们听清”。
但从人称角度看,它不是单纯帮忙。
它做的是一次很大的转换:
声音离开身体。
机器接住声音。
声音被压成文字。
文字进入检索。
检索再把文字带回来。
这不是中性的。
声音一旦被转成字,它就变硬了。
它从一次正在发生的声音,变成一个可以复制、搜索、引用、剪贴、误读的第三人称文件。
所以本页的核心句是:
字幕接嘴,但不是嘴。
转录保存声音,也会把声音压扁成文件。
人称机制
第一人称:我说过的话离开我
人以为声音属于说话者。
但转录一出现,说话者和声音就分开了。
一句“我”被写下来以后,它不再只在那张嘴里。
它变成文件里的“我”。
文件里的我可以被复制,可以被截取,可以被重新排序,也可以被别人拿去证明别的东西。
这就是第一人称的危险:
我说过,不等于文件里的我仍然归我。
这能直接帮助卷三。
声音离开身体以后,不是获得自由。
它进入另一套保存和误用制度。
第三人称:声音被放远,成为材料
转录最强的动作,是把声音第三人称化。
原来那句话有呼吸、迟疑、速度、断裂、口误、情境、身体。
转录把它压成一行字。
这一行字看起来更清楚,实际上也更危险。
因为读者很容易把“可读”误认为“可懂”。
所以必须写清楚:
可检索,不等于可理解。
可引用,不等于可结案。
第三人称不是坏东西。
没有第三人称,材料无法被保存。
但第三人称一旦装成真相,就会开始吃掉声音原来的阻力。
第六人称:机器替声音排队
自动字幕不是一个人在听。
它是麦克风、模型、时间码、字幕轨、播放器、平台、搜索系统一起工作。
这就是第六人称。
机器不只是“转写”。
机器会决定:
哪一句先出现。
哪一个词被识别。
哪里断句。
谁的声音被压成同一种字体。
哪些声音被当成噪声丢掉。
这就是技术幽灵性最具体的地方。
机器没有身体,却能反复回来听人。
机器不会负责,却能让某一句话变得像证据。
第四人称:观众被字幕带着听
自动字幕还会改变观众。
没有字幕时,观众听声音。
有字幕时,观众常常跟着字听声音。
字幕会提前替观众切分、命名、稳定声源。
这就让第四人称发生偏移:
大家不是一起听声音。
大家开始一起读机器给出的声音版本。
这对《人类投降派》尤其危险。
因为本片里很多关键处不该被过快稳定。
声源不稳、说话不稳、字幕空窗、声音退席,都不能被机器字幕直接抹平。
作用链
声音发生
-> 机器拾取
-> 自动切分
-> 字幕成行
-> 声音被第三人称化
-> 文字进入搜索和引用
-> 后来的机器继续召回
-> Owner 必须停手审查
对 000-048 的接口
| 小节 | 自动字幕/转录提供的动作 | 写作提醒 |
|---|---|---|
| 021 声音不住在嘴里 | 声音可以离开身体进入设备。 | 不把离身写成自由。 |
| 023 画外音不是内心 | 被写下的声音不等于心理独白。 | 字幕不是内心证明。 |
| 025 字幕不是原声 | 字幕接嘴,但不是嘴。 | 这节可直接吸收本卡。 |
| 027 听见不等于知道 | 听见、看见字幕、读到转录都不等于懂。 | 反对机器结案。 |
| 040 搜索把过去重新点名 | 转录让声音进入召回机器。 | 召回不是理解。 |
| 044 写在那里不等于是真的 | 文字存在不等于事实成立。 | 必须保留证据层级。 |
| 045 索引决定谁先开口 | 转录和字幕改变材料的出场顺序。 | 索引不是法官。 |
可迁移硬句
字幕接嘴,但不是嘴。
机器把声音写下来,不等于机器听懂了人。
可检索,不等于可理解。
可引用,不等于可结案。
转录不是把声音救出来。
转录也会把声音押进文件里。
风险边界
不能写成:
- 自动字幕等于片内原声。
- 转录结果等于声源归属已经成立。
- 字幕文本可以替代画面、声音和身体的证据。
- 机器识别出的词可以直接裁决人物心理、真实关系、consent 或现实伤害。
- 可检索材料越多,理解就越充分。
更稳的写法是:
自动字幕和转录只提供一种形式参照:
声音可以被机器转成可检索文件。
但文件不是声音本身。
回到电影时,仍要看声画事实、字幕状态、时间码、上下文和人工审查。
升格判断
建议保留 P1,但靠近 P0。
理由:
这张卡本身不一定要成为主干作品卡。
但它能强力支撑卷三和卷六:
卷三要说明声音如何离开身体;
卷六要说明机器如何把人的话重新召回。
进入前台正文时,不必讲完整技术流程。
只要让读者被这句话拦住:
看见字幕,不等于听见人。
