本篇目录 / Contents
- MiMo-4K无字幕第1015和谁说话到1020自我标签标准API声画音频复核-2026-06-23
- 运行材料
- 可保留为 T2 的方向
- 1015 发生时,画面里同时存在白衣二人、黑衣边缘移动身体和蓝衣旁观者,构成多个可被 谁 指向的位置;
- 1017 之后画面推进到更近的人脸关系,#1018-#1020 转向自我标签式陈述;
- 1015 音量不强,语速平稳,语气是清楚疑问,但没有强烈挑衅、逼迫或高压审问;
- 1015 声学上很弱,但语义裂口被保留下来;#1017 更强地把对话转向流程性指令;
- 1018-#1020 的 我是自大狂 / 我是焦躁症 / 不擅长团队协作 应作为片内自我标签/报告输出,而不是现实心理诊断;
- 必须降级的内容
- 与 T1 的对照
- 1015 全句 RMS=-28.7256dBFS,比 #1014 低 14.3507dB,比 #1017 低 17.1933dB,比 #1018 低 16.6508dB。因此 #1015 不是强声中心。
- 1015 第一半 RMS=-27.4506dBFS,第二半 RMS=-30.5382dBFS;q4 低到 -37.3998dBFS,说明它前部点出、尾部撤低。
- 1015 最高 20ms 窗为 01:34:19.536-01:34:19.556,RMS=-20.8873dBFS;不能可靠裁给具体字词。
- 1015 精确窗 voice_250_4000=0.724025、air_8000_16000=0.046916,支持较薄、较亮的人声质感,但不能写成设备声或无线电声。
- 1015 精确窗左右声道 corr=1.000000,不能写成声道空间打开。
- 1015 到 #1016、#1016 到 #1017、#1017 到 #1018 相关间隙均无 silencedetect -45dB:d=0.3 silence event。
- 综合使用口径
MiMo-4K无字幕第1015和谁说话到1020自我标签标准API声画音频复核-2026-06-23
运行材料
本页汇总 inspool-wiki-zh/raw/assets/4k-nosub-restart-20260623/1015-who-are-you-speaking-to-nooffset/mimo-run 下三次 MiMo 标准 API 成功报告:
1015-video-object-question-to-selflabel-standard-api/mimo-report.md
1015-audio-exact-object-question-standard-api/mimo-audio-report.md
1015-audio-chain-object-to-selflabel-standard-api/mimo-audio-report.md
用量:
video total_tokens=56900, prompt=55028, completion=1872, elapsed=40.328s
audio_exact total_tokens=1875, prompt=513, completion=1362, elapsed=29.311s
audio_chain total_tokens=3097, prompt=911, completion=2186, elapsed=36.360s
total_tokens=61872
可保留为 T2 的方向
MiMo 视频报告可保留以下方向:
-
1015 发生时,画面里同时存在白衣二人、黑衣边缘移动身体和蓝衣旁观者,构成多个可被
谁指向的位置; - 白衣二人相对而坐,黑衣身体从左侧边缘移动/退出,蓝衣旁观者在较低、更靠后的旁观位;
-
1017 之后画面推进到更近的人脸关系,#1018-#1020 转向自我标签式陈述;
- 没有看见报告 UI、屏幕、控制台、耳机、对讲机、无线电、飞船、太空或真实任务空间;
- 即便把对象错位降级成普通舞台调度或视线变化,白衣男子从双人关系转向镜头方向、构图从双人中景变为单人近景这一点仍成立。
MiMo #1015 精确音频报告可保留以下方向:
-
1015 音量不强,语速平稳,语气是清楚疑问,但没有强烈挑衅、逼迫或高压审问;
- 句尾自然收束,较适合写成较弱但语义明确的对象追问;
- 单独听 #1015 不能证明对象错位,只能支持轻微困惑或确认;
- 没有可确认音乐、节拍、旋律、乐器、合成器、设备提示音、无线电声像或声道空间打开;
- 声音里可能有高频/空气感,但来源不能直接判定为设备或音乐。
MiMo #1015 到 #1020 音频链报告可保留以下方向:
- 声音换手呈现为:对象追问 ->
我在-> 心理监测报告指令 -> 自我标签链; -
1015 声学上很弱,但语义裂口被保留下来;#1017 更强地把对话转向流程性指令;
-
1018-#1020 的
我是自大狂 / 我是焦躁症 / 不擅长团队协作应作为片内自我标签/报告输出,而不是现实心理诊断; - 没有听到典型无线电传输、设备接入、系统提示音、机械音或声道空间打开。
必须降级的内容
以下内容不能从 MiMo 升级为事实:
- MiMo 对可见人物、性别、声源和口型的判断必须降级;#1015/#1016/#1017/#1018-#1020 说话人仍以 T0 台词账为准。
- MiMo 把 #1015 到 #1020 说成
A问 -> B答 -> C命令 -> B遵命陈述,可作为结构性候选,但不能替代 T0/T1 的角色和声画分层。 - MiMo 对“持续音乐声床、合成器长音、心跳或鼓点”的说法必须降级。T1 只能确认低能声床和低频纹理持续存在;不能确认独立配乐主题、旋律、和声、乐器、合成器或设备声。
- MiMo 关于“白衣男子直视镜头打破第四面墙”的说法只能作为画面关系候选;不能直接写成人物心理、声源或观众地址的最终裁决。
自大狂 / 焦躁症 / 团队协作只能写成片内自我标签链,不能升级为真实临床事实或人物现实诊断。
与 T1 的对照
T1 本地复核对 MiMo 作如下校正:
-
1015 全句 RMS=
-28.7256dBFS,比 #1014 低14.3507dB,比 #1017 低17.1933dB,比 #1018 低16.6508dB。因此 #1015 不是强声中心。 -
1015 第一半 RMS=
-27.4506dBFS,第二半 RMS=-30.5382dBFS;q4 低到-37.3998dBFS,说明它前部点出、尾部撤低。 -
1015 最高 20ms 窗为
01:34:19.536-01:34:19.556,RMS=-20.8873dBFS;不能可靠裁给具体字词。 -
1015 精确窗
voice_250_4000=0.724025、air_8000_16000=0.046916,支持较薄、较亮的人声质感,但不能写成设备声或无线电声。 -
1015 精确窗左右声道
corr=1.000000,不能写成声道空间打开。 -
1015 到 #1016、#1016 到 #1017、#1017 到 #1018 相关间隙均无
silencedetect -45dB:d=0.3silence event。 - 本地音乐诊断支持低能声床和低频纹理:例如 #1015_to1016_gap RMS=
-38.6300dBFS、low20_300_ratio=0.652825,但这不足以确认旋律、节拍、和声、乐器、合成器或配乐高潮。 - 画面上 #1015 仍是平台、膜面、白衣二人、黑衣边缘身体、蓝衣旁观位和反光地面;没有报告 UI、通信设备或新任务空间。
综合使用口径
本轮 MiMo 的价值,是帮助 #1015 变成“对象问题”的证据节点:它不靠音量接管,却发生在多个可被指向的位置同时在场时。MiMo 同时提醒:后面 #1017/#1018 的报告和自我标签声音,会把 #1015 开出的对象裂口重新收进流程。
最终写法仍以 T1 为准:#1015 是低位、短促、尾部撤低的对象追问;它把 #1014 的没有回复推进到“话到底朝向谁”。#1016 的 我在 没有真正回答这个问题;#1017 的心理监测报告和 #1018-#1020 的自我标签链,才用更强声学位置把它回收。
