# MiMo-4K无字幕第1013你在说什么到1015和谁说话标准API声画音频复核-2026-06-23

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-23

证据边界：MiMo 为 T2 候选，只用于补充声画反读；不得覆盖 T0 台词账或 T1 本地音频/画面指标。可保留：同一固定舞台、无报告 UI/控制台/屏幕/设备物证、无可确认音乐、#1013 较弱且未完成夺权、#1014 更强并主导后续、#1015 把问题转向说话对象。必须降级：口型同步、可见人物即声源、心理动机、真实通信设备、真实外部任务、#1013 是否识破报告的强心理判断，以及 #1015 是否已经绝对夺权的过强表述。

# MiMo-4K无字幕第1013你在说什么到1015和谁说话标准API声画音频复核-2026-06-23

## 运行材料

本页汇总 `inspool-wiki-zh/raw/assets/4k-nosub-restart-20260623/1013-what-are-you-saying-overlap-nooffset/mimo-run` 下三次 MiMo 标准 API 成功报告：

```text
1013-video-weak-question-overlap-counterread-standard-api/mimo-report.md
1013-audio-exact-weak-question-standard-api/mimo-audio-report.md
1013-audio-chain-overlap-to-1015-standard-api/mimo-audio-report.md
```

用量：

```text
video total_tokens=24073, prompt=22058, completion=2015, elapsed=33.742s
audio_exact total_tokens=1697, prompt=392, completion=1305, elapsed=22.752s
audio_chain total_tokens=2550, prompt=533, completion=2017, elapsed=31.280s
total_tokens=28320
```

## 可保留为 T2 的方向

MiMo 视频报告可保留以下方向：

- #1012 到 #1015 维持同一室内舞台/膜面空间；
- 中间坐姿人物、右侧坐姿人物、左侧黑衣站立者和背景膜面关系连续；
- 画面没有报告界面、控制台、屏幕、通信设备、耳机、对讲机、塔台、飞船、太空或新任务空间；
- #1013 时长短、较低、带停顿感，没有完成完整对话回合；
- #1014 紧跟 #1013 末尾进入，信息量和语气都更具体；
- #1015 将问题转向“和谁说话”的对象层。

MiMo 音频报告可保留以下方向：

- #1013 可听作简短疑问、困惑反问或澄清请求；
- #1013 不是强势质问，不能写成已经夺回完整话语权；
- #1013 与 #1014 存在约 `0.134s` 的尾部重叠；
- #1014 更强、更前景化，把对话焦点从报告内容转到“为什么一天没有回复”；
- #1015 音量未必强于 #1014，但语义上把问题改成说话对象错位；
- 不能确认绝对静音、清场、换声场、音乐进入、设备提示音、无线电声像或空间化声源。

## 必须降级的内容

以下内容不能从 MiMo 升级为事实：

- 视频报告说“不应将 #1013 解释为识破报告后的反问”。这个提醒可保留为反心理化边界，但 #1013 与 #1012 的关系仍可在 T0/T1 支持下写成“弱声质疑/澄清报告内容”，只是不能写成可见心理事实或识破动作。
- 音频精确窗说“不支持弱声接收失败”。这只能说明单独 #1013 短窗不足以证明“失败”机制；本地 T1 和前后链仍支持它在 #1012 后承担弱声质疑位置。
- 视频报告关于谁的口型对应 #1013、谁在看谁、人物性别/身份等可见声源判断，不能覆盖 T0，也不能进入事实层。
- 音频链中“主动打断”“绝对前景”“夺取话语主导权”等措辞要降级：T1 显示 #1013 与 #1014 的重叠段本身较低，#1014 的声学优势是在进入后很快展开，而不是第一瞬间峰值压制。
- 真实通信、真实报告系统、真实无线电、真实外部任务、心理动机和导演意图都不能由 MiMo 确认。

## 与 T1 的对照

T1 本地复核对 MiMo 作如下修正：

- #1013 全句 RMS=`-29.7479dBFS`，比 #1012 低 `12.5533dB`，比 #1014 低 `15.3730dB`，只能写成弱声质疑，不是强势接管。
- #1013 first_half=`-27.6496dBFS`、tail_half=`-33.9632dBFS`，q1 到 q4 逐步撤低，说明它不是尾部上扬夺权。
- #1013 与 #1014 的重叠段 `01:34:17.766-01:34:17.900` RMS=`-35.8397dBFS`，低于 #1013 非重叠前段；所以覆盖不是瞬时峰值，而是 #1014 在后续展开为更强声音中心。
- #1013 频谱 `voice_250_4000=0.8913`，左右声道 `corr=1.000000`；不能确认音乐、无线电或设备声源。
- #1013、#1013 到 #1015、#1012 到 #1015 均无 silence event；视频窗无 `scene>0.04/0.015` 命中；画面无报告 UI、设备或新空间。

## 综合使用口径

本轮 MiMo 的价值在于给 #1013 设定边界：它支持同一现场、无设备/音乐/换场、#1013 弱、#1014 更前景、#1015 转向说话对象。最终写法仍以 T1 为准：#1013 是报告格式之后的弱声质疑，证明 #1012 没有被接住；它没有夺回说话权，而是很快被 #1014 的“没有回复”覆盖，并被 #1015 的“和谁说话”重新定位为对象错位。