# MiMo 过滤信息拆分恢复 2026-05-05

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-05-05

证据边界：本页为历史研究资料的公开版本。原始文件未单列 source_rule；此说明仅补充公开阅读边界，不构成对原文事实、模型判断或人物解释的新认证。请结合原文来源、日期、校正与不确定性阅读。

# MiMo 过滤信息拆分恢复 2026-05-05

## 本轮做了什么

这轮不是继续对高压段落正面硬冲，而是把“被过滤的信息”拆成两个更低风险的证据通道：

1. MiMo-音频拆分过滤恢复总账-2026-05-05（馆内参考，未随本文公开）：把画面替换为黑场，保留原片音轨，得到 `12` 份报告，其中 `formal-safe=10`、`rejected=2`。
2. MiMo-边缘画面过滤恢复总账-2026-05-05（馆内参考，未随本文公开）：用极低 fps 只扫边缘画面、物件、空间、字幕和遮挡，得到 `8` 份报告，其中 `formal-safe=4`、`rejected=4`。
3. MiMo-超短音频过滤恢复总账-2026-05-05（馆内参考，未随本文公开）：把仍然拒绝的窗口拆成 `15s/5s` 黑场音频，得到 `10` 份报告，其中 `formal-safe=8`、`rejected=2`。
4. MiMo-针孔音频过滤恢复总账-2026-05-05（馆内参考，未随本文公开）：继续把最后缝隙拆成 `3s/1s` 针孔音频，得到 `5` 份报告；重建分类后为 `formal-safe=2`、`short=2`、`template-error=1`。其中 `99:03-99:06` 出现模板式误答，不进入证据链。
5. MiMo-无音频视觉过滤恢复总账-2026-05-05（馆内参考，未随本文公开）：把若干高压窗口转成 true no-audio 视觉-only clip，只问画面边缘、字幕、物件、遮挡和设备，得到 `6` 份报告，其中 `formal-safe=4`、`rejected=2`。
6. MiMo-补静音针孔音频过滤恢复总账-2026-05-05（馆内参考，未随本文公开）：给超短音频 clip 补静音以绕开 AAC 过短失败，得到 `8` 份报告，其中 `formal-safe=6`、`rejected=1`、`short=1`。

这个结果说明：同一段被 MiMo 正常视频理解过滤时，并不等于没有可用信息。把声画拆开以后，音频层、边缘物件层、字幕层、材质层仍能被救出来。

## 技术结论

```text
高压完整视频
-> 容易拒绝或短报告

黑场保留音频
-> 对对白、沉默、底噪、呼吸、水声、塑料摩擦更有效

低 fps 边缘帧
-> 对空间、物件、颜色、字幕、遮挡、设备边界更有效

仍拒绝
-> 只作为人工抽帧/人工听写/导演校正队列

超短/针孔音频
-> 可以把整段拒绝的区域继续拆成声源地形
-> 但更容易出现短报告或模板误答，必须人工筛掉

true no-audio 视觉
-> 可以把音画混合请求中的高压画面改写为字幕/物件/遮挡/光线/设备证据
-> 但绝不提供任何声音、对白或音乐证据

补静音针孔音频
-> 把 1s/3s 失败窗口重新封装成可上传音轨
-> 可以验证“编码失败”与“模型拒绝”不是一回事
```

所以这轮真正的发现不是某个单一片段，而是一套补全方法：不要要求模型一次性理解“场面”，而是让它分别听、分别看边、分别读字幕、分别记录物质。

## 新恢复一：16:30-18:00 的爱情不可能先以声音出现

audioonly-filtered-00990-01080-full90-early-gap（馆内参考，未随本文公开） 在黑场音频里恢复出长时间静默、低频电流底噪、细微摩擦、吱呀声，以及男声低语“妈的……我为什么没有办法爱上一个女人”。

这个发现把 [女人-浮动对象](/research/hs-f3145ac638c622de) 从前段的台词概念往声学层推进了一步：这里没有宏大的情节推进，只有几乎被房间底噪吞没的一句自问。它像一个隐藏在片内的负片标题：

```text
我要的是女人
-> 为什么没有办法爱上一个女人
```

前者像需求，后者像故障诊断。影片不是只展示“我要什么”，还在更低音量处暴露“我为什么不能抵达我声称要的东西”。

## 新恢复二：34:30-36:00 把床边关系切入雨路与钢琴

audioonly-filtered-02070-02160-full90-pre-ricky-gap（馆内参考，未随本文公开） 恢复出一组非常清楚的声音转场：室内关系对白、深呼吸、汽车引擎和喇叭、雨声、湿路车辆声、城市底噪、钢琴进入、关系变化对白。

edgeframe-filtered-02070-02085-pre-ricky-gap（馆内参考，未随本文公开） 则在同一区间的边缘画面里抓到深蓝/黑色水面、彩色光斑、投影/灯光，以及水层作为半透明遮挡。

这让 `34:30-36:00` 不只是“Ricky 之前的过渡”，而是一个三层门槛：

```text
关系对白
-> 深呼吸
-> 车/雨/湿路
-> 水面/投影/彩色光
-> 关系已变
```

水在这里同时是声场和画面介质：雨声把关系从室内拖到外部世界，水面又把画面变成一个半透明的观看屏障。

## 新恢复三：46:30-46:50 把纯感觉机器推进到感官占领

[audioonly-filtered-02790-02810-water-threshold-a1](/research/hs-8fdccfd4619c413a) 在黑场音频里恢复出男声关于“刷短视频”“感官被占据”“思维被占据”的表达。

[edgeframe-filtered-02790-02800-water-a1](/research/hs-8e22ce9aa1eb3502) 在边缘画面中抓到冷灰工业空间、前景透明塑料瓶、瓶内液体、英文字幕，以及塑料瓶对人物头部和身体轮廓的半透明遮挡。

这对 [纯感觉机器](/research/hs-d0714c688265314d) 是一次重要扩展。之前的[纯感觉机器](/research/hs-d0714c688265314d)是“没有记忆佐证，只剩感觉”；这段让它变成当代媒介状态：

```text
没有留下记忆材料
-> 只能相信此时此刻
-> 此时此刻又被短视频占据
-> 感官和思维被外部流接管
```

前景瓶子也不是无关物件。它像一个微型鱼缸，提醒我们：主体说自己被感官占据时，画面也正在用透明容器遮挡他。

## 新恢复四：50:15-51:00 不是空白转场，而是水、塑料和巷道的收束

[audioonly-filtered-03035-03060-container-proof-b2](/research/hs-875a321916849c6e) 恢复出水流/雨声、密集塑料摩擦、声音逐渐减弱、低频底噪重新露出，最后接近静默。

edgeframe-filtered-03035-03045-container-b2（馆内参考，未随本文公开） 则抓到冷灰水泥小巷、横跨线缆、空调外机、黄色标线、地面水渍、墙面框中框和空间收束。

这里的意义在于：声音里的塑料和水并没有消失，它们被转译成空间里的小巷、线缆、墙面和水渍。

```text
塑料摩擦/水声
-> 音量收束
-> 冷灰小巷
-> 墙面框中框
-> 身体被空间继续包围
```

这说明影片的转场不是从一个情节跳到另一个情节，而是从一种容器跳到另一种容器。

## 新恢复五：67:30-69:00 把恐惧做成枚举表

[audioonly-filtered-04050-04140-full90-memory-edge](/research/hs-ffc153ffe61936e1) 恢复出非常关键的恐惧问答：女声问“你会感到恐惧吗？”，随后列举“死亡……亲密关系……朋友……对这个社会”，男声最后回答“会”。

这段的形式力量在于枚举。它不是某一种恐惧，而是一张恐惧索引：

```text
死亡
亲密关系
朋友
社会
现在发生的一切
```

在 声音-音乐场（馆内参考，未随本文公开） 里，这是一种非常低成本但强力的结构：低频底噪托住问答，词与词之间的停顿让每个名词都变成一个单独入口。影片不解释恐惧，而是把恐惧变成数据库字段。

## 新恢复六：97:30-97:40 证明塑料膜是观看界面

[edgeframe-filtered-05850-05860-theatre-a1](/research/hs-378744934581afb0) 只做低风险边缘扫描，仍恢复出半透明[塑料薄膜](/research/hs-97c2c56b8b95997b)、暗黄/棕褐色、背景模糊观众或工作人员轮廓、疑似灯架/支撑结构、字幕和极近距离。

这对 [塑料薄膜](/research/hs-97c2c56b8b95997b) 是强补充。塑料膜不只是遮挡敏感画面的安全替代说法，而是影片真实的观看装置：

```text
人物/动作
-> 半透明塑料膜
-> 背景观众/工作人员
-> 字幕
-> 摄影机
-> 后续 Wiki 证据页
```

被过滤的视觉段落，恰好也是影片把“[被观看](/research/hs-bdc3e21c0c33b579)”物质化的地方。模型过滤和影片遮挡在这里形成一种意外的同构：两者都让我们不能直接抵达画面，只能通过边界、字幕、声源和设备来重建发生。

## 新恢复七：146:40-147:00 是表演之后的泄压和评价

audioonly-filtered-08800-08820-late-installation-b2（馆内参考，未随本文公开） 恢复出男声朗读“无脚的石头，敲打坚硬的地”，随后有人问“你觉得这戏相怎么样？”，再进入笑声、移动声和底噪。

这段非常像影片末端的自我拆台：

```text
诗性朗读
-> 戏相评价
-> 笑声
-> 表演解除
```

它把 [表演失效](/research/hs-abdd251e91ce91e6) 变得更复杂：不是表演失败所以坍塌，而是表演完成后又立刻被现场评价、闲聊、笑声重新打开。电影没有把现场封成庄严作品，而是保留了作品变回现场的那一秒。

## 新恢复八：99:15-100:30 的剧场后缘从“拒绝整段”变成声源地形

MiMo-超短音频过滤恢复总账-2026-05-05（馆内参考，未随本文公开） 把原本 `99:00-100:30` 的拒绝窗口拆成 `15s` 小段后，救出 `5/6` 份可用 formal-safe 报告；只有 `99:00-99:15` 仍拒绝。

可用的新声源包括：

- `99:15-99:30`：设备底噪、[塑料薄膜](/research/hs-97c2c56b8b95997b)摩擦/揉捏、疑似女性人声、轻笑、碰撞声。
- `99:30-99:45`：男声反复说“轻松一点啊 / 应该轻松一点”，女声候选为“我什么也没有 / 你想要讲的都没有”，伴随塑料摩擦和叹气。
- `99:45-100:00`：MiMo 候选听写为“不是没有 / 有了，忘了 / 自己忘的 / 你不忘它，它又回不来 / 你一个人在那儿生闷气”。
- `100:00-100:15`：前 8 秒有人声，随后进入呼吸/口腔音、沉默和稳定底噪。
- `100:15-100:30`：无清晰对白，只有底噪、疑似呼吸、织物、塑料、轻微碰撞和最终收束。

这里必须保留证据边界：`99:45-100:00` 的句子目前是 MiMo 候选听写，尚未被本地字幕资产稳定确认。但它和 [纯感觉机器](/research/hs-d0714c688265314d) 的“记忆 / 忘记 / 回不来 / 只有声音能证明”的问题高度同频，值得列为人工听写最高优先级。

这段新的意义是：剧场后缘不是空白，也不是单纯高压画面，而是一段“放松命令”和“记忆回不来”的声音争执。

```text
轻松一点
-> 我什么也没有
-> 不是没有
-> 有了，忘了
-> 不忘它，它又回不来
-> 底噪/塑料/沉默
```

如果人工听写确认，这会成为后半段极重要的记忆论补强：不是没有发生，而是发生过、忘了、回不来；人的困境从“没有证据”推进为“证据曾经有过，但已经失效”。

## 新恢复九：147:25-147:45 被切成沉默、突发语言、织物和硬切

MiMo-超短音频过滤恢复总账-2026-05-05（馆内参考，未随本文公开） 把 `147:25-147:45` 拆成 `5s` 小段后，救出 `3/4` 份 formal-safe；`147:30-147:35` 仍被拒绝。MiMo-针孔音频过滤恢复总账-2026-05-05（馆内参考，未随本文公开） 又把其中一部分切成 `1s` 声源分类，补出 `147:32-147:33` 沉默、`147:33-147:34` 疑似底噪。

新恢复的结构是：

```text
147:25-147:30
沉默 -> 低频电子底噪 -> 突然切断

147:30-147:35
仍拒绝/人工复核

147:35-147:40
突发对白候选 -> 织物摩擦 -> 底噪/沉默

147:40-147:45
底噪 -> 撞击 -> 织物/塑料摩擦 -> 疑似呼吸 -> 更强摩擦 -> 硬切静音
```

这段的新鲜之处是：它不像 `146:40-147:00` 的“戏相评价/笑声泄压”，而是变成一种更冷的声学断裂。语言只闪现一下，随即被织物、碰撞、呼吸和硬切接管。对 [表演失效](/research/hs-abdd251e91ce91e6) 来说，这说明后段不是一直在“演”，而是在“语言-物质-静音”之间反复断开。

## 新恢复十：99:00-99:15 从纯拒绝变成字幕、织物、金属物和反光地面

[visualonly-filtered-05940-05955-post-theatre-a1](/research/hs-646504283872cfe0) 用 true no-audio 视觉-only 路线救回了此前最顽固的 `99:00-99:15`。这批证据不提供任何声音判断，但稳定补出了四条视觉线索：

- `99:00-99:02`：室内一角/后台或布景边缘、深蓝与暖黄对比、大面积垂坠织物或塑料/帆布质感、暖色点光源，字幕为“so you have to keep living like this”。
- `99:02-99:07`：深蓝/青色表演区域、前景手臂和躯干遮挡、蓝色光效、金属物件、项链，字幕为“this is so boring”。
- `99:07-99:12`：青黑/暖黄低照度、前景人物轮廓遮挡、金属物件、疑似塑料或防水布表面，字幕为“Why do we have to do things according to the previous settings”。
- `99:12-99:15`：深青黑、前景和黑暗遮挡、地面、疑似水渍或反光表面，字幕为“Isn't this stupid”。

padded-pinhole-audio-05940-05943-post-theatre-a1a（馆内参考，未随本文公开） 和 padded-pinhole-audio-05943-05946-post-theatre-a1b-template-rerun（馆内参考，未随本文公开） 又把开头 `99:00-99:06` 的音频拆成底噪、疑似碰撞、碰撞和电子提示音候选；`99:12-99:15` 仍拒绝。

这让 `99:00-99:15` 的状态发生变化：它不再是“只有拒绝”，而是一个由字幕指令、视觉遮挡、物件触发声和反光地面组成的小型舞台机器。

```text
你必须继续这样活着
-> 这太无聊了
-> 为什么要按照之前的设定做事
-> 这不蠢吗
-> 织物/塑料边界 + 金属物件 + 反光地面 + 底噪/碰撞
```

这里的关键词不是“发生了什么”，而是“设定”。影片在此把角色/剧场/机器的预设暴露出来：人物不是在自然地生活，而是在一个带字幕、灯光、遮挡物、道具和预设命令的系统里被迫继续。

## 新恢复十一：145:30-145:40 把塑料薄膜、三脚架和摄影设备接成装置证据

[visualonly-filtered-08730-08740-late-a1](/research/hs-251c0d4b2bd10bb1) 是 true no-audio 视觉-only 证据，不能用于声音。但它非常清楚地补出了后段装置结构：紫色/灰蓝色调、半透明塑料膜或织物从上方垂落、塑料布覆盖的大型结构、三脚架及摄影设备、灰色纹理墙面、多个坐姿或半躺人物、底部英文字幕。

这条证据把 [塑料薄膜](/research/hs-97c2c56b8b95997b) 和 [剧场总系统](/research/hs-3ec9aa41c7efd254) 之间的边加粗：后段不是单一表演动作，而是被塑料、摄影设备、字幕、墙面、光色和多人物布置共同托住的装置。

```text
半透明塑料膜
-> 覆盖/围合空间
-> 三脚架/摄影设备显形
-> 多人物装置结构
-> 字幕继续命名现场
-> 剧场总系统不是背景，而是正在被拍到的机器
```

这也重新解释了“被过滤”：模型越难直接处理主体动作，越需要转向边缘物。边缘物不是次要信息；在这里，边缘物才是剧场作为系统的证据。

## 新恢复十二：147:30-147:35 的拒绝缝隙被补静音音频压成沉默/底噪/沉默

上一轮 `147:30-147:35` 还是拒绝和编码失败混在一起。补静音后，MiMo-补静音针孔音频过滤恢复总账-2026-05-05（馆内参考，未随本文公开） 把这 5 秒拆成更细的声学剖面：

- `147:30-147:31`：沉默清楚。
- `147:31-147:32`：底噪清楚。
- `147:32-147:33`：沉默清楚。
- `147:33-147:34`：沉默清楚。
- `147:34-147:35`：短报告，只能作为底噪线索。

[visualonly-filtered-08845-08855-late-a2](/research/hs-1286753eff8adee9) 同时在 visual-only 画面上补出低角度特写、淡紫/灰白、深紫/黑、白色字幕条、粗糙墙面、结构线、近距离晃动和局部光斑。

因此 `147:30-147:35` 不是“空白”，也不是简单的“拒绝”：它是低照度特写画面与沉默/底噪交替构成的冷区。

```text
近距离低角度视觉压力
-> 声音退为沉默
-> 1 秒底噪露出
-> 再次沉默
-> 147:34-147:35 仍需人工听写
```

这个冷区很重要，因为它告诉我们：后段的[表演失效](/research/hs-abdd251e91ce91e6)不一定表现为崩溃的声音，有时恰恰表现为声音被抽走，只留下画面的过近、墙面和字幕。

## 仍被过滤的核心缝隙

本轮仍有几处不能直接进入结论：

- `99:00-99:15`：visual-only 已恢复字幕/织物/金属物/反光地面；补静音音频已恢复 `99:00-99:06` 底噪、碰撞和电子提示音候选；但 `99:12-99:15` 仍拒绝。
- `147:30-147:35`：补静音针孔音频已恢复 `147:30-147:34` 的沉默/底噪/沉默地形；`147:34-147:35` 仍是 short，只能作为底噪线索；画面层已由 visual-only 恢复为低角度特写、字幕条、墙面和光斑。
- `99:45-100:00`：MiMo 恢复出高度关键的“忘了 / 回不来”候选对白，但尚未被字幕资产确认，必须标为候选听写。
- `145:30-145:40`：visual-only 已恢复塑料膜、三脚架/摄影设备和多人物装置结构；声音层仍需独立批次复核。
- `67:30-67:45`、`16:30-16:45`：true no-audio 视觉仍拒绝，但黑场音频分别已提供恐惧枚举和爱情不可能低语的候选证据；它们仍需人工抽帧或更低 fps/单帧路线。

这些缝隙不能被包装成“已经知道”。它们应该在图谱里标成模型高压区，并继续用更小颗粒度、更低刺激密度的方法补。

## 更新后的判断

这轮最大的结论是：所谓“被过滤掉的信息”，有一部分不是内容本身被彻底遮蔽，而是它们没有被拆成适合提取的证据形态。

《人类投降派》本身也在做同一件事：

```text
人说不清
-> 声音泄露
-> 水面遮挡
-> 塑料膜过滤
-> 设备记录
-> 观众见证
-> 名单/字幕/数据库保存
```

所以，MiMo 的过滤不只是技术障碍，也反过来揭示了影片的媒介结构：这部电影不断把不可直视、不可解释、不可共享的东西，改写成底噪、材质、遮挡、字幕、设备和现场残响。

更尖锐地说：

```text
《人类投降派》不是等待一个全能模型把它看懂的电影，
而是一部逼迫我们发明多通道证据学的电影。
```

## 下一轮补盲方向

- 对 `99:00-100:30` 做字幕带/模糊画面/低 fps 静帧三路复跑，只问字幕、物件、空间和声场。
- 对 `147:25-147:45` 做更短 `5s` 级别音频与字幕分离，不要求解释，只要声源清单。
- 对仍拒绝的 `99:12-99:15` 与 short 的 `147:34-147:35` 使用单帧 + 独立音频 + 字幕带三路复核。
- 人工优先听写 `99:30-100:00` 和 `147:35-147:45`，尤其核对“轻松一点 / 我什么也没有 / 有了忘了 / 回不来 / 你脑子有病”等 MiMo 候选句。
- 把本轮恢复出的“短视频占据感官”“恐惧枚举表”“戏相评价”分别接入 [纯感觉机器](/research/hs-d0714c688265314d)、声音-音乐场（馆内参考，未随本文公开） 和 [表演失效](/research/hs-abdd251e91ce91e6)。