# 4K 无字幕版 MiMo 极限复扫 Phase 2：T0 锚点微感知校准结果

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-03

证据边界：本页综合 2026-06-03 4K 无字幕 MiMo Phase 2 T0-aware 微感知复扫。它把 MiMo T2 候选、T0/T1 开场锚点和 4K 接触表补证组织成阶段性方法结论，不新增片内事实终判；人物身份、声源终判、左右手、物件名、镜头运动来源、心理动机、现实关系和最终理论仍需 Owner/T1 复核。

# 4K 无字幕版 MiMo 极限复扫 Phase 2：T0 锚点微感知校准结果

## 结论先行

Phase 2 最重要的结果是：

```text
把 T0/T1 锚点写进 prompt 后，MiMo 的观看颗粒度明显变细。
```

它不再主要产出“男人 / 女人 / 摄影者”这种粗描述，而开始给出：

```text
阿蒙的眼睑颤动、嘴角抽动候选；
甲瑞的吞咽、前倾、句尾气息；
子丑的托腮/抵下颌、眼镜反光、嘴部微动；
恽剑辉的 LCD 翻开、双手持机、戒指高光、片内镜头反光点。
```

来源总账见 MiMo-4K无字幕URL极限复扫Phase2-T0锚点微感知总账-2026-06-03（馆内参考，未随本文公开）。

但 Phase 2 同时给出一个技术边界：

```text
复杂旋转/设备显影窗口里，4K video 仍不稳定。
真正可行的 rescue 是：1080p 动态/声音 MiMo + 4K 接触表补微细节。
```

所以后续不能迷信“4K/max 一把梭”。真正的最大化，是让不同证据层分工。

## 对用户纠正的回应

用户指出：既然库里已经知道阿蒙就是黄蒙、子丑是谁、甲瑞是谁、他们穿什么、哪句台词是谁说的，就不该让 MiMo 一遍遍说“一个男的 / 一个女的”。

Phase 2 证明这个纠正完全正确。T0-aware prompt 的作用不是“告诉模型答案”，而是把模型从低级识别任务里解放出来，使它能专注于更细的材料：

```text
身份锁定以后，感知才真正开始。
```

这件事对“幽灵技术”尤其关键。因为幽灵不是模糊感。幽灵如果要变成论文里的概念，就必须有可复核的借身细节：

```text
眼睑、喉结、手指、镜头玻璃、LCD、底噪、咔哒声、反光面。
```

这些东西才是幽灵的临时肉身。

## 最重要的新增细节

### 1. 阿蒙开口不是“女性出现”，而是低声、近声、眼睑和数字 0 的共同入场

`00:00:03` 阿蒙说“你怎么来了”。Phase 2 MiMo 在 T0 锚点下提到：声音很低、近、干，句尾急收，口型与画面基本同步。它还标出 `00:05-00:07` 眼睑细微颤动、`00:11-00:12` 正常眨眼、`00:20-00:25` 嘴角细微抽动候选。

这些观察必须降级为 T2，但它们让开场更具体：

```text
不是一个抽象女人被红光照亮，
而是一个已知的阿蒙，在数字 0 之后以低声、眼睑和嘴角进入观看关系。
```

这里的“幽灵性”不是氛围，而是一个低频声场里的显现手续。

### 2. 甲瑞的台词前有身体预备

`00:00:56` “我必须见你”之前，MiMo 抓到甲瑞 `00:37` 喉结上下、`00:41` 缓慢眨眼、`00:42` 眼神游移、`00:49-00:51` 前倾和聚焦。台词本身声画同步，句尾“你”有轻微气息拖长。台词后有垂头和肩部下沉候选。

这给甲瑞开场位置加了一个新的身体层：

```text
他说“我必须见你”之前，身体已经先把“必须”预演了一遍。
```

这对第二人称非常重要。因为“你”不是台词才出现；它在吞咽、眼神游移、前倾和镜头停顿中已经开始形成。

### 3. “我爱你”被非中心构图和台词后停顿托住

`00:01:45-00:02:10` 的 4K formal rescue 补回甲瑞“我爱你”窗口。MiMo 记录到：甲瑞从画面左侧进入，脸部红暗，肩部蓝紫，构图并不完全居中，右侧保留大面积黑暗负空间；`00:02:04` “我爱你”后，镜头仍停留约数秒。

这个细节很关键：

```text
“我爱你”没有被剪辑立即回应。
它被留在黑暗负空间里。
```

这比“他说了我爱你”更有用。因为幽灵不是台词内容，而是台词说完以后没有被归还给一个稳定对象。

### 4. 子丑观察位是被旋转发现的评价身体

`02:24-02:40` 的 4K 视频失败，但 1080p rescue 和 4K 接触表一起补回子丑红暗观察位。可见信息包括：深色 Polo、眼镜反光、手抬起抵下颌/托腮、嘴部微动、白色物体边缘切入。

这让子丑不是“第三个人出现”，而是：

```text
一个已经摆好评价姿态的人，被镜头旋转发现。
```

这非常重要。因为子丑的 `演得太差了` 不是突然从无到有。他的评价位在前面已经以手、眼镜、红暗脸和静坐姿势存在。

### 5. 阿蒙 A2 让观看地址从人脸转给材料表面

`03:20-03:34` 中，阿蒙在蓝紫/红光中，粉红吊带和锁骨高光清楚。她的视线低垂偏向画面右下。随着镜头移动，身后的竖向颗粒状反光面从背景变成构图中心。`03:31` 还有一声轻微“咔哒”候选。

这一段对“幽灵承重面”的概念特别有价值：

```text
观看地址不只在人眼上。
当阿蒙出画，竖向反光面接走了观看。
```

这说明第二人称幽灵不是永远依附在人物身上。它可以从人物皮肤转给材料表面、反光面、低位物件和设备声音。

### 6. 恽剑辉显影为摄影劳动，而不是抽象摄影师

`03:46-03:58` 是 Phase 2 最扎实的设备窗口。MiMo 和 4K 接触表共同显示：恽剑辉在左侧低头进入，双手举相机；片内相机镜头、翻开的 LCD、左手无名指戒指反光、桌面瓶杯、金属支架、片内镜头玻璃上的小高光点都被看见。

这让“摄影机制显影”有了非常具体的写法：

```text
摄影机制不是抽象地显影。
它显影为一具低头的身体、两只手、一台相机、翻开的 LCD、镜头玻璃反光、戒指高光、桌面瓶杯和一次持机微抖。
```

这也是第二人称的关键：当前镜头拍到另一个拍摄者。观看不再是透明通道，而变成了互相拍摄的物理链条。

## 对“幽灵到底是什么”的加注

Phase 2 之后，幽灵的定义可以再压细：

```text
幽灵不是看不见的东西。
幽灵是一个观看地址借了某个身体、设备、材料或声音短暂落地，
但它的归属又不能稳定还给任何一个主体。
```

开场前五分钟里，它的借身顺序不是抽象的：

```text
数字 0
-> 阿蒙低声和眼睑
-> 甲瑞吞咽和前倾
-> “我爱你”后的黑暗负空间
-> 子丑眼镜反光和托腮
-> 阿蒙 A2 背后的竖向反光面
-> 恽剑辉手里的片内相机
-> 子丑评价语前的镜头推进
```

这条链条说明：第二人称不是一种固定视角，而是一种不断换载的观看权。

## 需要 Owner 立刻确认的 12 个点

这些不是质疑，而是最值得你确认的新东西：

1. `00:05-00:07` 阿蒙眼睑细微颤动是否真实存在？
2. `00:20-00:25` 阿蒙画面左侧嘴角不对称抽动是否真实存在？
3. 阿蒙“你怎么来了”的声音为什么这么低、近、干：现场耳语、后期处理，还是录音条件？
4. `00:37` 甲瑞喉结上下是否是清晰吞咽？
5. `00:42` 甲瑞眼神游移具体看向哪里？
6. `00:57-00:59` 甲瑞说完“我必须见你”后是否有肩部下沉/呼气？
7. `00:02:04` “我爱你”的口型与声音起始是否有轻微延迟？
8. `02:33-02:35` 子丑抵下颌的是哪只手，是否夹有小物？
9. `03:31` 阿蒙 A2 段轻微“咔哒”声是否存在，声源是什么？
10. 阿蒙 A2 的视线是看镜头、镜头旁、低位物件，还是某个设备位置？
11. 恽剑辉手中相机的 LCD 是否确实翻开，他是在看取景器、机身顶部还是屏幕？
12. `03:56` 片内相机镜头玻璃高光是否能反推出当前拍摄主光位置？

## 对后续滚雪球的协议修正

Phase 2 后，正式滚雪球方法应更新为：

```text
1. 每个窗口先加载 T0/T1 身份、台词、服装、方位锚点。
2. MiMo 只负责提微细节，不负责重新命名人物。
3. 4K/max 成功则保留高密度报告。
4. 4K/max 失败时，不硬跑同一请求；改用 1080p 动态/声音 + 4K 接触表。
5. 每批都必须输出 Owner 确认问题池。
6. 所有“幽灵/第二人称”判断都必须能回指到身体、设备、材料或声音承重面。
```

这套方法能避免两种失败：

- 过粗：MiMo 只说男/女/某人。
- 过玄：MiMo 为幽灵学补不存在的声音和事件。

真正要追的是中间那条路：

```text
具体到手指、喉结、眼镜反光、LCD、咔哒声；
同时让这些细节进入第二人称幽灵的理论链。
```