# MiMo-4K无字幕第1015和谁说话到1020自我标签标准API声画音频复核-2026-06-23

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-23

证据边界：MiMo 为 T2 候选，只用于补充声画反读；不得覆盖 T0 台词账或 T1 本地音频/画面指标。可保留：#1015 是较弱但清楚的对象追问；画面存在白衣二人、黑衣边缘身体、蓝衣旁观位、镜头/观众等多个可能指向；#1017/#1018 之后更强地把对象问题转向报告和自我标签。必须降级：性别/声源/口型/可见人物身份、真实心理诊断、真实通信系统、真实报告系统、具体声源位置和 MiMo 对可确认音乐声床的强说法。

# MiMo-4K无字幕第1015和谁说话到1020自我标签标准API声画音频复核-2026-06-23

## 运行材料

本页汇总 `inspool-wiki-zh/raw/assets/4k-nosub-restart-20260623/1015-who-are-you-speaking-to-nooffset/mimo-run` 下三次 MiMo 标准 API 成功报告：

```text
1015-video-object-question-to-selflabel-standard-api/mimo-report.md
1015-audio-exact-object-question-standard-api/mimo-audio-report.md
1015-audio-chain-object-to-selflabel-standard-api/mimo-audio-report.md
```

用量：

```text
video total_tokens=56900, prompt=55028, completion=1872, elapsed=40.328s
audio_exact total_tokens=1875, prompt=513, completion=1362, elapsed=29.311s
audio_chain total_tokens=3097, prompt=911, completion=2186, elapsed=36.360s
total_tokens=61872
```

## 可保留为 T2 的方向

MiMo 视频报告可保留以下方向：

- #1015 发生时，画面里同时存在白衣二人、黑衣边缘移动身体和蓝衣旁观者，构成多个可被 `谁` 指向的位置；
- 白衣二人相对而坐，黑衣身体从左侧边缘移动/退出，蓝衣旁观者在较低、更靠后的旁观位；
- #1017 之后画面推进到更近的人脸关系，#1018-#1020 转向自我标签式陈述；
- 没有看见报告 UI、屏幕、控制台、耳机、对讲机、无线电、飞船、太空或真实任务空间；
- 即便把对象错位降级成普通舞台调度或视线变化，白衣男子从双人关系转向镜头方向、构图从双人中景变为单人近景这一点仍成立。

MiMo #1015 精确音频报告可保留以下方向：

- #1015 音量不强，语速平稳，语气是清楚疑问，但没有强烈挑衅、逼迫或高压审问；
- 句尾自然收束，较适合写成较弱但语义明确的对象追问；
- 单独听 #1015 不能证明对象错位，只能支持轻微困惑或确认；
- 没有可确认音乐、节拍、旋律、乐器、合成器、设备提示音、无线电声像或声道空间打开；
- 声音里可能有高频/空气感，但来源不能直接判定为设备或音乐。

MiMo #1015 到 #1020 音频链报告可保留以下方向：

- 声音换手呈现为：对象追问 -> `我在` -> 心理监测报告指令 -> 自我标签链；
- #1015 声学上很弱，但语义裂口被保留下来；#1017 更强地把对话转向流程性指令；
- #1018-#1020 的 `我是自大狂 / 我是焦躁症 / 不擅长团队协作` 应作为片内自我标签/报告输出，而不是现实心理诊断；
- 没有听到典型无线电传输、设备接入、系统提示音、机械音或声道空间打开。

## 必须降级的内容

以下内容不能从 MiMo 升级为事实：

- MiMo 对可见人物、性别、声源和口型的判断必须降级；#1015/#1016/#1017/#1018-#1020 说话人仍以 T0 台词账为准。
- MiMo 把 #1015 到 #1020 说成 `A问 -> B答 -> C命令 -> B遵命陈述`，可作为结构性候选，但不能替代 T0/T1 的角色和声画分层。
- MiMo 对“持续音乐声床、合成器长音、心跳或鼓点”的说法必须降级。T1 只能确认低能声床和低频纹理持续存在；不能确认独立配乐主题、旋律、和声、乐器、合成器或设备声。
- MiMo 关于“白衣男子直视镜头打破第四面墙”的说法只能作为画面关系候选；不能直接写成人物心理、声源或观众地址的最终裁决。
- `自大狂 / 焦躁症 / 团队协作` 只能写成片内自我标签链，不能升级为真实临床事实或人物现实诊断。

## 与 T1 的对照

T1 本地复核对 MiMo 作如下校正：

- #1015 全句 RMS=`-28.7256dBFS`，比 #1014 低 `14.3507dB`，比 #1017 低 `17.1933dB`，比 #1018 低 `16.6508dB`。因此 #1015 不是强声中心。
- #1015 第一半 RMS=`-27.4506dBFS`，第二半 RMS=`-30.5382dBFS`；q4 低到 `-37.3998dBFS`，说明它前部点出、尾部撤低。
- #1015 最高 20ms 窗为 `01:34:19.536-01:34:19.556`，RMS=`-20.8873dBFS`；不能可靠裁给具体字词。
- #1015 精确窗 `voice_250_4000=0.724025`、`air_8000_16000=0.046916`，支持较薄、较亮的人声质感，但不能写成设备声或无线电声。
- #1015 精确窗左右声道 `corr=1.000000`，不能写成声道空间打开。
- #1015 到 #1016、#1016 到 #1017、#1017 到 #1018 相关间隙均无 `silencedetect -45dB:d=0.3` silence event。
- 本地音乐诊断支持低能声床和低频纹理：例如 #1015_to1016_gap RMS=`-38.6300dBFS`、low20_300_ratio=`0.652825`，但这不足以确认旋律、节拍、和声、乐器、合成器或配乐高潮。
- 画面上 #1015 仍是平台、膜面、白衣二人、黑衣边缘身体、蓝衣旁观位和反光地面；没有报告 UI、通信设备或新任务空间。

## 综合使用口径

本轮 MiMo 的价值，是帮助 #1015 变成“对象问题”的证据节点：它不靠音量接管，却发生在多个可被指向的位置同时在场时。MiMo 同时提醒：后面 #1017/#1018 的报告和自我标签声音，会把 #1015 开出的对象裂口重新收进流程。

最终写法仍以 T1 为准：#1015 是低位、短促、尾部撤低的对象追问；它把 #1014 的没有回复推进到“话到底朝向谁”。#1016 的 `我在` 没有真正回答这个问题；#1017 的心理监测报告和 #1018-#1020 的自我标签链，才用更强声学位置把它回收。