# MiMo 4K无字幕第988到990标准 API 声画音频复核

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-22

证据边界：MiMo 标准 API 只作为 T2 候选复核；T0 台词账和本地 4K/音频指标优先。本页汇总 #988 精确视频、#988-#990 连续视频和 #988-#990 连续音频三条报告。可保留无清楚口型、无声源身份裁决、#988 期间材料动作持续、#988 后视觉打开进入观众席/公共空间、等待非绝对静音、无可辨认音乐、#990 补全 #989 `我可能` 等方向；必须降级可见人物身份、具体工具/图案/动作目的、黑衣身体即声源、白衣/观众心理和 MiMo 对精确时间边界或动作姿态的过度裁决。

# MiMo 4K无字幕第988到990标准 API 声画音频复核

本页汇总 #988 复核中三条 MiMo 标准 API 报告：

```text
01:33:10.600-01:33:11.833  #988 阿蒙：你怎么不说话呢
01:33:16.066-01:33:17.900  #989 子丑：我可能
01:33:22.033-01:33:23.466  #990 子丑：我可能要回地球了
```

原始运行目录：

`inspool-wiki-zh/raw/assets/4k-nosub-restart-20260622/988-why-not-speak-nooffset/mimo-api-988-20260622/`

## 运行摘要

```text
988-exact-why-not-speak-video-standard-api
total_tokens=6025
content_chars=1059

988-to990-chain-video-standard-api
total_tokens=26491
content_chars=2715

988-to990-chain-audio-sound-music-standard-api
total_tokens=2596
content_chars=1732
```

三条报告均成功返回。`mimo_wave_ledger.py` 当前只统计到两条视频报告，音频报告另见同目录 `mimo-audio-report.md`；本页的 `usage_total_tokens=35112` 已把音频报告纳入。

## 可保留 T2 候选

精确视频报告支持：

- #988 精确窗无法看见清楚嘴、脸或口型。
- 不能从画面确认台词声源归属。
- 画面保持在黑衣身体、手、半透明膜面/塑料、黄色线条/划痕候选、暖光和材料动作中。
- #988 期间没有明显剪切、转场、正反打或人物关系重排。

连续视频报告支持：

- #988 后的视觉打开不是立刻发生在 #988 入声，而是在 #988 后等待中逐步出现。
- 先是膜面、手、暖光和黑衣身体；之后空间深度、观众席、白衣人物、反光台面和室内结构逐步显影。
- 到 #989/#990，视觉重心更偏向整体空间装置和观众席，而不是单个说话者口型。
- 说话者身份、工具用途、图案意义、谁看谁、人物心理都不能升级为确定事实。

连续音频报告支持：

- #988 听感可作为低位追问。
- #989 是迟疑开口，不是完整回答。
- #990 以重复 `我可能` 开头，再补出 `要回地球了`，听感上更完整、更连贯。
- #988 到 #989、#989 到 #990 的等待都不是完全无声。
- 未听到可确认音乐；低频轰鸣、材料声和短促声事件应写成环境/材料声候选，不写成音乐。

## 必须降级

以下内容不能从 MiMo 升级为事实：

- 可见黑衣身体就是阿蒙、子丑或某个 T0 说话人。
- 黑衣身体的具体动作目的。
- 发光小物的具体工具类型。
- 膜面线条的明确图案含义。
- 观众席或白衣人物的心理状态。
- 声音中的具体机械来源或空间方位。

还需特别降级精确视频报告中“爬行/匍匐”的强姿态判断。本地 T1 接触表更稳的是：低角度黑衣身体弯身靠近膜面，手和发光小物/工具候选在膜面附近运动。不能把姿态意图或动作类型写死。

连续视频报告中把 #988 精确窗写成 `01:33:10.600-01:33:13.100` 也要降级。T0 #988 的精确边界仍以台词账为准：

```text
01:33:10.600-01:33:11.833
```

## 与本地 T1 合读

MiMo 最有价值的补充是两点。

第一，#988 本身没有把说话还给嘴。T1 的 #988 精确密帧 `mean_diff=3.9371`，scene detect 阈值 `0.04` 无命中；MiMo 同样支持没有清楚口型、声源身份或正反打。

第二，#988 后的视觉打开把追问推向公开空间。T1 显示：

```text
988_exact_dense       mean_diff=3.9371
988_to989_chain       mean_diff=15.8162
988_to990_chain       mean_diff=20.6004
988_to992_chain       mean_diff=23.4744
```

这与 MiMo 所说“观众席、空间深度、膜面整体装置、白衣人物和反光台面在 #988 后逐步显影”相合。

声音层上，MiMo 对“等待非静音、无可确认音乐、#990 补全 #989”的判断可以保留。但强弱排序必须以 T1 指标为准：

```text
#988  RMS=-34.2531dBFS  Peak=-16.8283dBFS
#989  RMS=-27.0067dBFS  Peak=-11.3349dBFS
#990  RMS=-21.7522dBFS  Peak=-5.3756dBFS
```

因此 #988 的稳定读法是：

```text
它不是更强的催促，
而是把沉默登记为问题。

问题被登记以后，
画面不切到嘴，
而是打开给膜面、观众席和公共空间；
声音不立刻给完整回答，
而是先给 `我可能`，
再延迟补成 `我可能要回地球了`。
```