本篇目录 / Contents
MiMo 4K无字幕第988到990标准 API 声画音频复核
本页汇总 #988 复核中三条 MiMo 标准 API 报告:
01:33:10.600-01:33:11.833 #988 阿蒙:你怎么不说话呢
01:33:16.066-01:33:17.900 #989 子丑:我可能
01:33:22.033-01:33:23.466 #990 子丑:我可能要回地球了
原始运行目录:
inspool-wiki-zh/raw/assets/4k-nosub-restart-20260622/988-why-not-speak-nooffset/mimo-api-988-20260622/
运行摘要
988-exact-why-not-speak-video-standard-api
total_tokens=6025
content_chars=1059
988-to990-chain-video-standard-api
total_tokens=26491
content_chars=2715
988-to990-chain-audio-sound-music-standard-api
total_tokens=2596
content_chars=1732
三条报告均成功返回。mimo_wave_ledger.py 当前只统计到两条视频报告,音频报告另见同目录 mimo-audio-report.md;本页的 usage_total_tokens=35112 已把音频报告纳入。
可保留 T2 候选
精确视频报告支持:
-
988 精确窗无法看见清楚嘴、脸或口型。
- 不能从画面确认台词声源归属。
- 画面保持在黑衣身体、手、半透明膜面/塑料、黄色线条/划痕候选、暖光和材料动作中。
-
988 期间没有明显剪切、转场、正反打或人物关系重排。
连续视频报告支持:
-
988 后的视觉打开不是立刻发生在 #988 入声,而是在 #988 后等待中逐步出现。
- 先是膜面、手、暖光和黑衣身体;之后空间深度、观众席、白衣人物、反光台面和室内结构逐步显影。
- 到 #989/#990,视觉重心更偏向整体空间装置和观众席,而不是单个说话者口型。
- 说话者身份、工具用途、图案意义、谁看谁、人物心理都不能升级为确定事实。
连续音频报告支持:
-
988 听感可作为低位追问。
-
989 是迟疑开口,不是完整回答。
-
990 以重复
我可能开头,再补出要回地球了,听感上更完整、更连贯。 -
988 到 #989、#989 到 #990 的等待都不是完全无声。
- 未听到可确认音乐;低频轰鸣、材料声和短促声事件应写成环境/材料声候选,不写成音乐。
必须降级
以下内容不能从 MiMo 升级为事实:
- 可见黑衣身体就是阿蒙、子丑或某个 T0 说话人。
- 黑衣身体的具体动作目的。
- 发光小物的具体工具类型。
- 膜面线条的明确图案含义。
- 观众席或白衣人物的心理状态。
- 声音中的具体机械来源或空间方位。
还需特别降级精确视频报告中“爬行/匍匐”的强姿态判断。本地 T1 接触表更稳的是:低角度黑衣身体弯身靠近膜面,手和发光小物/工具候选在膜面附近运动。不能把姿态意图或动作类型写死。
连续视频报告中把 #988 精确窗写成 01:33:10.600-01:33:13.100 也要降级。T0 #988 的精确边界仍以台词账为准:
01:33:10.600-01:33:11.833
与本地 T1 合读
MiMo 最有价值的补充是两点。
第一,#988 本身没有把说话还给嘴。T1 的 #988 精确密帧 mean_diff=3.9371,scene detect 阈值 0.04 无命中;MiMo 同样支持没有清楚口型、声源身份或正反打。
第二,#988 后的视觉打开把追问推向公开空间。T1 显示:
988_exact_dense mean_diff=3.9371
988_to989_chain mean_diff=15.8162
988_to990_chain mean_diff=20.6004
988_to992_chain mean_diff=23.4744
这与 MiMo 所说“观众席、空间深度、膜面整体装置、白衣人物和反光台面在 #988 后逐步显影”相合。
声音层上,MiMo 对“等待非静音、无可确认音乐、#990 补全 #989”的判断可以保留。但强弱排序必须以 T1 指标为准:
#988 RMS=-34.2531dBFS Peak=-16.8283dBFS
#989 RMS=-27.0067dBFS Peak=-11.3349dBFS
#990 RMS=-21.7522dBFS Peak=-5.3756dBFS
因此 #988 的稳定读法是:
它不是更强的催促,
而是把沉默登记为问题。
问题被登记以后,
画面不切到嘴,
而是打开给膜面、观众席和公共空间;
声音不立刻给完整回答,
而是先给 `我可能`,
再延迟补成 `我可能要回地球了`。
