# MiMo-4K无字幕第1011嗯到1015和谁说话标准API声画音频复核-2026-06-23

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-23

证据边界：MiMo 为 T2 候选，只用于补充声画反读；不得覆盖 T0 台词账或 T1 本地音频/画面指标。MiMo 关于 #1011 短促上扬、偏接收失败而非确认、同一平台/膜面连续、无硬切/换场、无报告 UI/设备物证、黑衣身体移动不能确认离场、无可确认音乐和通信设备只能候选的方向可保留；关于 #1010 到 #1011 间隔时长、#1011 到 #1012 间隔、口型同步、人物身份、性别、心理动机、真实设备和情绪判断必须低于 T1。

# MiMo-4K无字幕第1011嗯到1015和谁说话标准API声画音频复核-2026-06-23

## 运行材料

本页汇总 `inspool-wiki-zh/raw/assets/4k-nosub-restart-20260623/1011-hm-reception-failure-nooffset/mimo-run` 下三次 MiMo 标准 API 成功报告：

```text
1011-to1015-video-hm-reception-report-who-speaking-standard-api/mimo-report.md
1011-audio-hm-reception-report-who-speaking-standard-api/mimo-audio-report.md
1011-audio-with-1010-gap-hm-reception-standard-api/mimo-audio-report.md
```

用量：

```text
video total_tokens=30588, prompt=29104, completion=1484, elapsed=37.510s
audio_1011_to1015 total_tokens=1921, prompt=608, completion=1313, elapsed=30.184s
audio_1010_to1015 total_tokens=1937, prompt=624, completion=1313, elapsed=27.855s
```

## 可保留为 T2 的方向

MiMo 视频报告可保留以下方向：

- #1010 到 #1015 始终处在同一平台、半透明膜面、坐姿人物、旁观位置和黑衣站立/移动身体构成的公共现场；
- 未发生硬切、转场、空间跳转或新空间显影；
- #1011 `嗯？` 更像疑问、确认需求或接收失败候选，而不是明确同意或身份确认；
- #1012 到 #1015 期间，画面没有报告 UI、控制台、屏幕、仪表、对讲机、耳机、无线电设备、任务室或文字报告载体；
- 黑衣身体有移动，但不足以确认真实离场、换场或新空间；
- 后段暖黄光增强可作为同一舞台内部灯光、遮挡或身体位置变化候选。

MiMo 音频报告可保留以下方向：

- #1011 `嗯？` 短促，后部上扬，听感偏疑问、疑惑或接收失败，而非平稳确认；
- #1010 末尾有尾音退低和气息收束候选；
- #1010 到 #1011 之间不是绝对静音，仍有 room tone、低电平环境声床或空间声床；
- #1012 `07报告一切正常` 因格式化和报告语调突出；
- #1014/#1015 继续形成追问/说话对象错位链；
- 无可确认旋律、节拍、和声推进、明确乐器、合成器或配乐高潮；
- 通信感、设备感或滤波感只能作为声音处理候选。

## 必须降级的内容

以下内容不能从 MiMo 升级为事实：

- 视频报告中“#1012 由画面中坐着的白衣男性角色直接说出，与口型同步”的说法。T1 本轮不裁决口型同步、可见人物身份或可见人物即发声者。
- 视频报告中对“白衣男女”等人物性别和身份的命名。
- 第一次音频报告对 #1010 到 #1011 间隙的判断，因为该音频文件从 #1011 开始，不能作为 #1010 尾部到 #1011 的证据。
- 第二次音频报告把 #1010 到 #1011 间隔估为约 `1-1.5s`。T1/T0 锁定实际为 `0.533s`，RMS=`-37.9111dBFS`。
- MiMo 对 #1011 到 #1012 “短暂但可感知间隔”的说法。T0 台词账显示 #1011 结束与 #1012 起始同为 `01:34:15.066`；最多只能保留听感上的接缝，不可写成名义空隙。
- #1012 是否模拟真实通讯设备、是否来自不同物理空间、是否有无线电/耳机/对讲机物证。
- #1015 的突出性不能按 MiMo 听感直接升级为声学强点。T1 显示 #1015 RMS=`-28.7256dBFS`，低于 #1011/#1012/#1014；它更可能是语义追问或语气直接，而不是音量中心。

## 与 T1 的对照

本地 T1 指标对 MiMo 方向作如下修正：

- #1011 的接收失败方向可保留；T1 显示 #1011 q4 RMS=`-19.8623dBFS`，强于 q1/q2/q3，尾部抬起明显。
- #1011 不是确认句；T1 显示 #1011 后立刻贴到 #1012，`1011_1012_touch` 最高滑窗全部落在 #1012。
- #1010 到 #1011 不是绝对静音；T1 显示 `1010_to1011_gap` duration=`0.533s`、RMS=`-37.9111dBFS`，相关片段无 silence event。
- MiMo 关于同一平台连续、无报告 UI、黑衣移动不等于离场的方向可保留；T1 接触图与 scene 检测也支持高阈值无硬切，低阈值变化只支持同一现场内部光线/遮挡/身体变化。
- MiMo 关于无可确认音乐的方向可保留；T1 显示人声/低频声床为主，左右声道 corr=`1.000000`，不能确认旋律、节拍、和声、乐器或合成器。

## 综合使用口径

本轮 MiMo 的价值在于给 #1011 设定反确认边界：它支持“#1011 更像接收失败、不是明确同意；场景连续、没有报告物证、没有真实设备、没有可确认音乐”。但 MiMo 的口型、身份、时间估算和通信设备联想都必须降级。#1011 最终仍应按 T1 写成：从 #1010 低能尾声中被重新挑起的短促问号，并立刻被 #1012 报告格式接管。