# MiMo-4K无字幕第1018自大狂到1022更开心一点标准API声画音频复核-2026-06-23

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-23

证据边界：MiMo 为 T2 候选，只用于补充声画反读；不得覆盖 T0 台词账或 T1 本地音频/画面指标。可保留：#1018-#1020 是同一套口述自我标签/报告输出，画面为膜面下近脸连续承载；#1021 继续追问，#1022 转向纠正式关怀；未见报告 UI、屏幕、控制台、手机、键盘、耳机、对讲机、无线电或上传设备。必须降级：现实心理诊断、性别/身份/口型裁决、真实上传动作、设备/舱室/通信空间、音乐/合成器/电子鼓点、人物真实情绪和心理动机。

# MiMo-4K无字幕第1018自大狂到1022更开心一点标准API声画音频复核-2026-06-23

## 运行材料

本页汇总 `inspool-wiki-zh/raw/assets/4k-nosub-restart-20260623/1018-self-label-megalomaniac-nooffset/mimo-run` 下四次 MiMo 标准 API 成功报告：

```text
video-1018-to-1022-chain/01-34-30.866-01-34-50.233/mimo-report.md
audio-1018-exact/01-34-30.866-01-34-32.266/mimo-audio-report.md
audio-1018-to-1022-chain/01-34-30.866-01-34-50.233/mimo-audio-report.md
audio-1018-to-1022-counter-music/01-34-30.866-01-34-50.233/mimo-audio-report.md
```

用量：

```text
video total_tokens=57469, prompt=53254, completion=4215, elapsed=69.966s
audio_exact total_tokens=1243, prompt=341, completion=902, elapsed=18.368s
audio_chain total_tokens=1919, prompt=505, completion=1414, elapsed=26.912s
audio_counter_music total_tokens=1638, prompt=491, completion=1147, elapsed=24.278s
total_tokens=62269
```

## 可保留为 T2 的方向

MiMo 视频报告可保留以下方向：

- #1018-#1020 由近脸在半透明膜面下连续承载，身体状态相对平直，不出现能坐实 `自大` 或 `焦躁` 的对应情绪表演；
- #1018 `我是自大狂` 可读为对 #1017 上传命令的口述执行，而不是可见设备上的上传动作；
- #1021 `然后呢` 具有继续索取/要求清单继续的功能；
- #1022 `你应该更开心一点` 从信息追问转向纠正式关怀或情绪管理；
- 片段未见报告 UI、屏幕、控制台、手机、键盘、耳机、对讲机、无线电或明确上传设备。

MiMo #1018 精确音频报告可保留以下方向：

- 单独听 #1018，可清楚听到 `我是自大狂`；
- 声音干净、直接、平稳，更接近标签式第一人称陈述；
- 不能确认音乐、节拍、旋律、和声、乐器、合成器、设备提示音、无线电/对讲机空间或声道空间打开；
- 从时序和形式上看，它可以作为 #1017 之后“提交第一条标签”的响应模式，但不能写成真实报告已经上传。

MiMo #1018 到 #1022 音频链可保留以下方向：

- #1018-#1020 形成列点式自我标签/自我分类；
- #1020 因句式变长，和前两句短标签不同，开始带有半解释/项目说明的形状；
- #1021 是低位追问，不是强打断；
- #1022 将对话从自我标签转向情绪建议/纠正。

反读音频报告对音乐边界很重要，可保留：

- 除人声外，只能确认持续低频声响或环境底噪；
- 不能确认旋律、节拍、和声进行、乐器、合成器序列或可重复音乐结构；
- 不能确认设备提示音、无线电/对讲机声像或声道空间打开。

## 必须降级的内容

以下内容不能从 MiMo 升级为事实：

- MiMo 视频对人物性别、可见人物身份、口型同步、可见人物即声源的判断，不能覆盖 T0 台词账。
- `自大狂 / 焦躁症 / 不擅长团队协作` 不能写成现实心理诊断、人格事实或临床报告内容。
- MiMo 视频说“口述上传”“数据流”等可以保留为形式比喻，但不能写成真实上传动作或真实数字系统显影。
- MiMo 第一条音频链曾说存在稳定电子背景音乐、合成器低音和电子鼓点；该说法被反读报告和 T1 指标降级。最终只能写低频声床/环境底噪/材料声候选，不能写可确认音乐。
- #1022 的“开心一点”不能证明子丑现实情绪状态，只能说明话语方向转向外部纠正或情绪管理。

## 与 T1 的对照

T1 本地复核对 MiMo 作如下校正：

- #1018 RMS=`-12.0748dBFS`，Peak=`0.0000dBFS`，只比 #1017 低 `0.5425dB`，只比 #1022 高 `0.3253dB`；它被夹在上传命令和纠正式关怀两个强声之间。
- #1018 比 #1019 高 `5.0700dB`，比 #1020 高 `6.9870dB`，是自我标签链的强入口。
- #1018 后半 RMS=`-11.3812dBFS`，强于前半 `-12.9006dBFS`；它不是尾部塌落的低声自白。
- #1018 精确窗 `voice_250_4000_ratio=0.903998`，自我标签链 `voice_250_4000_ratio=0.910702`；声音主要是清楚人声，不是音乐本体。
- #1018 精确窗、#1018 到 #1020、#1018 到 #1022 链条左右声道均 `corr=1.000000`。
- 所有精确句、间隙和长链均无 `silencedetect -45dB:d=0.3` silence event，但“不是静音”不等于“有配乐”。
- #1018 精确窗 `scene>0.04` 无命中；低阈值命中只能写作近脸/光线/运动变化，不是硬切或新空间。

## 综合使用口径

本轮 MiMo 的价值，是帮助确认 #1018-#1020 确实像一套近脸口述自我标签，且没有可见报告设备；同时通过反读把音乐误判降级。最终写法仍以 T0/T1 为准：#1018 不是现实诊断，而是 #1017 上传命令后的第一条自我分类输出；#1021 说明输出还不够，#1022 则把主体重新推入“应该更开心”的纠正式关怀。
