# MiMo-4K无字幕第1014没有回复到1017心理监测报告标准API声画音频复核-2026-06-23

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-23

证据边界：MiMo 为 T2 候选，只用于补充声画反读；不得覆盖 T0 台词账或 T1 本地音频/画面指标。可保留：#1014 是强势追问、同一舞台/膜面现场、无报告 UI/屏幕/控制台/通信设备、无可确认音乐或无线电声、#1014 从 #1013 尾部进入并在后续展开为中心、#1017 在长链里呈现更强流程性指令。必须降级：性别/声源/口型/可见人物身份、真实通信系统、真实报告系统、心理动机、具体声源位置和任何强过 T1 的峰值裁词。

# MiMo-4K无字幕第1014没有回复到1017心理监测报告标准API声画音频复核-2026-06-23

## 运行材料

本页汇总 `inspool-wiki-zh/raw/assets/4k-nosub-restart-20260623/1014-no-reply-overlap-nooffset/mimo-run` 下三次 MiMo 标准 API 成功报告：

```text
1014-video-no-reply-overlap-counterread-standard-api/mimo-report.md
1014-audio-exact-no-reply-standard-api/mimo-audio-report.md
1014-audio-chain-no-reply-to-report-standard-api/mimo-audio-report.md
```

用量：

```text
video total_tokens=15537, prompt=12099, completion=3438, elapsed=55.474s
audio_exact total_tokens=1649, prompt=446, completion=1203, elapsed=23.925s
audio_chain total_tokens=3093, prompt=627, completion=2466, elapsed=38.830s
total_tokens=20279
```

## 可保留为 T2 的方向

MiMo 视频报告可保留以下方向：

- #1014 到 #1015 维持同一昏暗舞台、平台、半透明塑料膜和面对面坐姿关系；
- 没有报告界面、屏幕、控制台、耳机、对讲机、塔台、飞船、太空或真实通信设备；
- 没有硬切、换场或视觉清场；
- #1014 从 #1013 尾部切入，更像紧凑对话或抢词，不像技术通信突然打开；
- #1014 的强度更像后续展开出来的一句完整追问，而不是第一瞬间爆破。

MiMo #1014 精确音频报告可保留以下方向：

- #1014 是清晰、近距离、强势追问；
- 能量和语气更集中在句子前半；
- 无法可靠把强点裁给某一个词，只能保守写到“前半整体略高”；
- 没有可确认音乐、配乐、节拍、乐器、提示音、无线电声像或声道空间打开；
- 更像关系/语用层面的回应失败追问，而不是单凭声音可证明的真实通信事实。

MiMo #1014 到 #1017 音频链报告可保留以下方向：

- #1014 开始于人际质询，#1015 转向说话对象，#1016 `我在` 没有解释没有回复，#1017 变为流程性指令；
- #1015 到 #1016、#1016 到 #1017 的长隙里只有轻微环境底噪，没有设备提示音或音乐段；
- #1017 在长链里具有更强的流程性、指令性和收束感；
- 整条链更像现场对话中的回应失败被报告格式回收，而不像真实通信任务展开。

## 必须降级的内容

以下内容不能从 MiMo 升级为事实：

- MiMo 把 #1014/#1015/#1017 声音描述为男性、把 #1016 描述为女性；T0 说话人和角色归属仍以台词账为准。
- MiMo 关于“坐着两人之一说话”“可见人物即声源”“近场/远场具体位置”的判断只能作听感提示，不能覆盖 T0/T1。
- 口型同步、人物身份、人物心理、真实通信设备、真实报告系统、真实控制室、真实任务空间都不能由 MiMo 确认。
- MiMo 对 #1014 强点可能在 `一天` 附近的听感只能保留为候选；T1 只能确认最高短窗在 `01:34:18.08` 左右，不能可靠裁给具体字词。
- MiMo 把 #1017 说成“强声中心”可作为 T2 方向，但最终强弱必须回到 T1 指标：#1017 RMS=`-11.5323dBFS`，确实比 #1014 高 `2.8426dB`。

## 与 T1 的对照

T1 本地复核对 MiMo 作如下校正：

- #1014 全句 RMS=`-14.3749dBFS`，比 #1013 高 `15.3730dB`，比 #1015 高 `14.3507dB`，是 #1013-#1015 窄链强声中心。
- #1014 与 #1013 重叠的开头 `0.134s` RMS=`-35.8397dBFS`，很低；#1014_after_overlap RMS=`-13.9976dBFS`，说明强势在重叠后展开。
- #1014 第一半 RMS=`-13.2771dBFS`，第二半 RMS=`-15.8476dBFS`；最高 20/50/100ms 窗在 `01:34:18.054-01:34:18.154` 附近。
- #1014_to1015_gap、#1015_to1016_gap、#1016_to1017_gap 均无 `silencedetect -45dB:d=0.3` silence event；不能写成绝对静音或新声场打开。
- #1014 精确窗左右声道 corr=`1.000000`，不能写成声道空间打开或无线电通道接通。
- #1014 到 #1017 画面维持同一平台/膜面/坐姿人物结构；高阈值 `scene>0.04` 无命中，低阈值变化只支持内部光线和构图变化。

## 综合使用口径

本轮 MiMo 的价值是给 #1014 设边界：它支持 #1014 是强势追问、同一现场、无设备/音乐/换场、#1017 又把前面的人际质询收进流程性报告指令。最终写法仍以 T1 为准：#1014 把 #1013 的弱声 `你在说什么` 改写成更强的没有回复追问；#1015 转向对象错位；#1016 只给出 `我在`，不解释失败；#1017 再用心理监测报告格式回收这条链。