本篇目录 / Contents
- 2026-06-24-4K无字幕母文件开场96分24秒到96分33秒第1052这一个月拍电影到1055一个什么东西复核
- 取证边界
- 资产
- 声音:#1052 是回接节点,不是 #1051 的余音
- 1052 exact:
- 1052 比 #1051 低 1.9790dB,所以它不是继续把 #1051 的努力报账推到更高;但它比 #1053 高 4.5036dB,也接近 #1054/#1055 的声压。它更像一个短而清晰的回接节点:把前面的 这样做 命名为“这一个月拍电影”,然后让 #1053 进入“我感受到的或者我体验到的”。
- 句内形状:前半建立,后半回落
- 空档和音乐边界:低能现场保持,不是干净静音或音乐桥
- 1052 exact 的 stereo_corr=1.000000、side_mid_ratio=0,不支持立体声空间突然打开。频谱也主要是人声低中频形状,不能确认配乐、旋律性音乐或设备提示。
- 画面:#1052 说“拍电影”时,没有离开材料现场
- MiMo T2 对照
- 1052 是一个短而完整的陈述节点,尾部下降。
- 1053 之后进入更长的经验叙述链。
- 1052 开始时仍处于身体/材料极近景现场。
- 1052 到 #1055 没有明显空间重置、风格化转场或音乐桥。
- 结论
- 1052 最稳是 拍电影经验回接:
- 文中引用的图像资料
2026-06-24-4K无字幕母文件开场96分24秒到96分33秒第1052这一个月拍电影到1055一个什么东西复核
取证边界
本页复核工程 #1052 子丑:
#1052 01:36:24.833-01:36:25.900 子丑:这一个月拍电影
两侧链条为:
#1051 阿蒙:我在很努力这样做
#1052 子丑:这一个月拍电影
#1053 子丑:我感受到的或者我体验到的
#1054 子丑:我扮演了一个
#1055 子丑:一个什么东西
问题不是 #1052 是否提到“拍电影”,而是它怎样提到“拍电影”:它是从现场逃到幕后解释,还是把 #1051 的 这样做 回接到这一个月正在发生的拍摄、表演、材料和感受经验里。
资产
资产目录:
inspool-wiki-zh/raw/assets/4k-nosub-restart-20260624/1052-filming-month-experience-return-nooffset/
关键文件:
audio/1052_exact_mono.wav
audio/1052_exact_stereo.wav
audio/1052_to1055_movie_role_chain_mono.wav
audio/1052_to1060_movie_fake_chain_mono.wav
clips/1052_exact_720p.mp4
clips/1052_to1055_movie_role_chain_540p.mp4
clips/1052_to1060_movie_fake_chain_540p.mp4
contact/contact_sheet_1052_time_order_labelled.jpg
contact/chain_contact_5781_5793_2fps_labelled.jpg
metrics/audio_summary_metrics.tsv
metrics/subsegment_metrics_1052.tsv
metrics/rms_100ms_curve_1052.tsv
metrics/top_windows.tsv
metrics/frame_color_metrics_time_order.tsv
metrics/frame_pair_difference_metrics_time_order.tsv
diagnostics/*silencedetect*
diagnostics/1052_to1055_540p_scene_gt018.log
diagnostics/1052_to1060_540p_scene_gt018.log
spectrograms/1052_exact_waveform.png
spectrograms/1052_exact_spectrogram.png
spectrograms/1052_to1054_chain_spectrogram.png
声音:#1052 是回接节点,不是 #1051 的余音
1052 exact:
duration=1.067s
RMS=-15.1580dBFS
Peak=-3.0688dBFS
voice250_4000_ratio=0.894792
presence4000_8000_ratio=0.000953
high8000_12000_ratio=0.000491
air12000_20000_ratio=0.001272
stereo_corr=1.000000
side_mid_ratio=0
相邻台词:
#1051 我在很努力这样做 RMS=-13.1790dBFS
#1052 这一个月拍电影 RMS=-15.1580dBFS
#1053 我感受到的或者我体验到的 RMS=-19.6616dBFS
#1054 我扮演了一个 RMS=-15.9033dBFS
#1055 一个什么东西 RMS=-15.6995dBFS
1052 比 #1051 低 1.9790dB,所以它不是继续把 #1051 的努力报账推到更高;但它比 #1053 高 4.5036dB,也接近 #1054/#1055 的声压。它更像一个短而清晰的回接节点:把前面的 这样做 命名为“这一个月拍电影”,然后让 #1053 进入“我感受到的或者我体验到的”。
句内形状:前半建立,后半回落
四等分:
q1=-14.5148dBFS
q2=-12.2774dBFS
q3=-20.0622dBFS
q4=-17.5544dBFS
first_half=-13.2536dBFS
tail_half=-18.6297dBFS
粗略短语分段只能作为候选,不作字词级定锚:
rough_phrase_zhe_yige_yue=-13.3316dBFS
rough_phrase_pai_dianying=-17.7177dBFS
100ms 曲线:
5784.833-5784.933 RMS=-19.6411dBFS
5784.933-5785.333 RMS=-12.1678 到 -12.5002dBFS
5785.333-5785.533 RMS=-16.1909 到 -22.3468dBFS
5785.633-5785.733 RMS=-14.8576dBFS
5785.733-5785.900 RMS=-20.5715 到 -20.7939dBFS
这说明 #1052 不是平直地说完。它先把“这一个月”一类的时间框架抬出来,随后尾部明显回落。不能把它写成弱弱带过;也不能把它写成新的强声对抗。它是一个声学上收束、语义上打开的短节点。
短窗也支持这个判断。#1052 exact 的最强窗为:
20ms 5784.989-5785.009 RMS=-10.6991dBFS
50ms 5785.128-5785.178 RMS=-11.0628dBFS
100ms 5785.083-5785.183 RMS=-11.6073dBFS
250ms 5785.108-5785.358 RMS=-12.1881dBFS
500ms 5784.883-5785.383 RMS=-12.9345dBFS
放到 #1052-#1054 链中,20/50/100/250ms 的最强窗落在 #1054 我扮演了一个 附近;但 500ms 最强窗仍落在 #1052 前半。也就是说,#1052 是框架抬起,#1054 才是后续扮演链里的局部短促增强。
空档和音乐边界:低能现场保持,不是干净静音或音乐桥
关键空档:
#1051->#1052 gap duration=3.233s RMS=-39.1207dBFS Peak=-21.1969dBFS
#1054->#1055 gap duration=1.834s RMS=-36.9981dBFS Peak=-9.8918dBFS
silencedetect -45dB:d=0.25 对 #1051->#1052 和 #1054->#1055 均无 silence event;对 #1052 exact 使用 -45dB:d=0.10 也无 silence event。
所以这里不能写作“干净静音”。更稳的写法是:
低能现场保持
相对安静的句间回落
人声尾部能量下降
无可确认音乐桥、设备提示、声道空间打开
1052 exact 的 stereo_corr=1.000000、side_mid_ratio=0,不支持立体声空间突然打开。频谱也主要是人声低中频形状,不能确认配乐、旋律性音乐或设备提示。
画面:#1052 说“拍电影”时,没有离开材料现场
接触表显示,#1052 入声前后不是新空间:
1051_tail_5781.500:胸口/上身蓝色眼状标记、肩臂、手部管状材料仍在同一近景中
1051_to1052_gap_pre1052_5784.600:画面压到身体侧面、蓝色线条局部、手部和管状材料
1052_start_5784.833:侧脸/嘴部在画面右缘,手持白紫/深蓝管状材料,管口贴近蓝色线条或标记
1052_mid_5785.366:构图继续保持,嘴部边缘、手、管状材料和身体侧面同框
1052_tail_5785.850:没有切入新空间,仍是身体侧面、手部材料、蓝色标记和侧脸边缘
1053_start_5785.900:几乎无可见转场,继续同一近景
这对 #1052 的判断非常关键。子丑说 这一个月拍电影 时,画面没有切到一个“拍电影说明空间”,也没有切到导演、摄影机、后台或远景。它把 拍电影 留在一个身体表面被看见、被画线、被材料接触的近景里。
图像指标也支持连续性:
1051_to1052_gap_pre1052 luma=0.218848 dark=0.349190
1052_start luma=0.217195 dark=0.365394
1052_mid luma=0.219450 dark=0.281103
1052_tail luma=0.219808 dark=0.234468
1053_start luma=0.219373 dark=0.234900
帧差也没有显示硬断裂:
pre1052->1052_start mean_abs_rgb_diff=0.021428
1052_start->1052_mid mean_abs_rgb_diff=0.035437
1052_mid->1052_tail mean_abs_rgb_diff=0.029748
1052_tail->1053_start mean_abs_rgb_diff=0.006683
1052_to1055_540p_scene_gt018.log 和 1052_to1060_540p_scene_gt018.log 均无 scene_score 命中。#1052 到 #1055 的变化更像同一室内近景中的身体、手、材料和构图滚动,而不是空间重置。
MiMo T2 对照
MiMo standard API 音频报告可保留:
-
1052 是一个短而完整的陈述节点,尾部下降。
- 不能确认配乐、音乐桥、设备提示或声道空间打开。
-
1053 之后进入更长的经验叙述链。
MiMo formal-safe 视频报告可保留:
-
1052 开始时仍处于身体/材料极近景现场。
- 画面中侧脸在边缘,手部持管状材料,材料靠近蓝色线条或标记。
-
1052 到 #1055 没有明显空间重置、风格化转场或音乐桥。
必须降级:
- MiMo 的说话人性别/身份判断不进入本页;T0 说话人为子丑。
- MiMo 把句间写成“干净静音”,但 T1
silencedetect不支持。只能写相对安静、低能现场保持。 - MiMo 的“颜料工具”“身体作为画布”等命名可作为描述便利,但本页只稳定写可见管状材料、蓝色线条/眼状标记、手部接触。
- MiMo 的“新解释入口”需要改写为“话题框架入口”。因为画面和声音没有支持离开现场的解释逃逸。
结论
1052 最稳是 拍电影经验回接:
#1051:我在很努力这样做
#1052:这一个月拍电影
#1053:我感受到的或者我体验到的
#1054/#1055:我扮演了一个 / 一个什么东西
它把 #1051 的 这样做 明确接到“这一个月拍电影”。但这个接法不是抽象解释,也不是幕后逃逸。因为 #1052 发声时,画面仍然贴在侧脸、嘴部边缘、手部、管状材料、蓝色标记和身体表面之间。
所以 #1052 的关键不是“终于说明这是拍电影”,而是:电影把“拍电影”重新放回正在被拍、正在被画、正在被材料接触的身体现场。它为 #1053 的感受/体验打开框架,也为 #1054/#1055 的“扮演了一个 / 一个什么东西”埋下空位。
文中引用的图像资料
以下图像由本篇已有文件引用对应;保留历史引用范围,图像展示不增加新的事实判断。





