# MiMo-4K无字幕第1012报告正常到1015和谁说话标准API声画音频复核-2026-06-23

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-23

证据边界：MiMo 为 T2 候选，只用于补充声画反读；不得覆盖 T0 台词账或 T1 本地音频/画面指标。可保留：同一固定舞台、无硬切、无报告 UI/控制台/屏幕/设备物证、#1012 报告感与后续质问形成断裂、无可确认音乐或真实设备声源。必须降级：MiMo 把 #1012 听成 `子丑零七`、可见人物身份/性别、口型同步、谁实际发声、#1012 内部平稳程度、真实通信设备、真实任务系统和心理动机。

# MiMo-4K无字幕第1012报告正常到1015和谁说话标准API声画音频复核-2026-06-23

## 运行材料

本页汇总 `inspool-wiki-zh/raw/assets/4k-nosub-restart-20260623/1012-report-normal-format-nooffset/mimo-run` 下三次 MiMo 标准 API 成功报告：

```text
1012-video-report-format-counterread-standard-api/mimo-report.md
1012-audio-exact-report-format-standard-api/mimo-audio-report.md
1012-audio-report-to-who-speaking-chain-standard-api/mimo-audio-report.md
```

用量：

```text
video total_tokens=31580, prompt=29181, completion=2399, elapsed=47.964s
audio_exact total_tokens=1813, prompt=387, completion=1426, elapsed=25.713s
audio_chain total_tokens=2985, prompt=597, completion=2388, elapsed=42.398s
```

`audio_exact` 报告 `content_chars=794`，略低于设定的 `800`，因此作为可读 T2 候选保留，但更要受 T1 指标校正。

## 可保留为 T2 的方向

MiMo 视频报告可保留以下方向：

- #1010 到 #1015 始终在同一固定剧场/装置空间内，无镜头切换或剪辑硬切；
- 画面核心仍是半透明膜面、平台、坐姿人物、旁观位置和黑衣站立/移动身体；
- #1012 `07报告一切正常` 与 #1010/#1011 的私密反问形成强烈格式反差；
- #1012 后 #1013/#1014/#1015 连续质问削弱“报告正常”的效力；
- 画面没有报告 UI、屏幕、控制台、仪表、对讲机、耳机、无线电、塔台室、飞船、太空、任务界面或新空间；
- “报告”更适合先当作舞台内语言格式变化，而不是现实设备已经显影。

MiMo 音频可保留以下方向：

- #1012 听感是流程化、非情绪化、报告/通信格式的人声；
- 无可确认音乐、旋律、节拍、和声、乐器、合成器或配乐高潮；
- 不能确认真实对讲机、耳机、无线电、扬声器、控制台提示音或特定物理空间；
- #1012 更像把 #1011 的潜在互动压平成单向报告输出，而不是解释性回答；
- #1013 与 #1014 存在重叠/抢入，#1014 和 #1015 分别把 #1012 拉向“没有回复”和“和谁说话”的回应失败与对象错位。

## 必须降级的内容

以下内容不能从 MiMo 升级为事实：

- `audio_exact` 把 #1012 听成“子丑零七，报告一切正常”。T0 锁定文本为 `07报告一切正常`，MiMo 的多听字不能进入正文事实。
- `audio_exact` 说 #1012 “整体平稳、重音均匀、未形成强烈内部峰值”。T1 本地指标显示 #1012 前半比后半高 `6.1240dB`，q2=`-13.5862dBFS` 为句内高点，不能按 MiMo 写成完全平直。
- 视频报告关于可见人物身份、性别、谁说哪句、口型同步和“结构内不同男性说出 #1012/#1014”的说法。T1 本轮不裁决口型同步或可见人物即发声者。
- 视频报告对“子丑/甲瑞是否同一角色”的提问本身可保留为误差提醒，但不能在本页引入角色混淆。T0 已锁定 #1012 子丑、#1014 甲瑞。
- `audio_chain` 中“基于纯文本与时间码，无法进行任何声学特征分析”的自我降级说法。该运行实际接收了音频，但它的声学细节不足，因此只保留重叠、内容关系和边界提醒，不采纳其对声场的缺席判断。
- 真实通信设备、真实任务系统、真实报告空间、真实无线电声源、人物心理动机和导演意图。

## 与 T1 的对照

T1 本地复核对 MiMo 作如下修正：

- #1012 全句 RMS=`-17.1946dBFS`，比 #1011 高 `6.7116dB`，比 #1013 高 `12.5533dB`，是 #1011 到 #1013 间的强报告点。
- #1012 前半 RMS=`-15.1329dBFS`，后半 RMS=`-21.2569dBFS`；q2 是句内高点，说明它不是平直播报，而是前半强、后半收束。
- `1012_to1013_gap` duration=`0.367s`、RMS=`-39.1743dBFS`，无 silence event；报告后不是绝对静音清场。
- `1012_to1015_chain` 的最高滑窗主要落在 #1014，说明 #1014 `你为什么一天没有回复` 以更强人声拆穿 #1012 的“正常”。
- #1012 频谱 `voice_250_4000=0.9618`，左右声道 `corr=1.000000`；可写报告格式人声，不可写可确认音乐、设备声源或声道空间打开。
- #1012 精确窗、#1012 到 #1015 均无高阈值 scene 命中；画面无报告 UI、设备或新空间。

## 综合使用口径

本轮 MiMo 的价值在于给 #1012 设定反读边界：它支持同一舞台、无报告物证、无硬切、无音乐和设备不可确认；也支持 #1012 后续被质问链削弱。但 MiMo 的台词漂移、身份/口型/设备联想、内部声学结构判断都必须低于 T1。#1012 最终应按 T1 写成：强报告格式接管接收失败，但没有真实报告系统显影，并被 #1014/#1015 拉回回应失败和说话对象错位。
