P4 Theater

图书馆噪声治理与价值召回协议

来源版本:2026-06-14 · 公开:2026-09-08 · 4,847 字符 · P4 剧场研究档案

下载完整公开版 Markdown段落与引用数据(JSON)引用本文回到影片资料
本篇目录 / Contents

图书馆噪声治理与价值召回协议

[!important] 核心判断 当前问题不是“库里有垃圾信息”,而是“垃圾信息与高价值信息在检索层平权”。治理目标不是删除一切噪声,而是让低价值材料可存档、可追溯、可必要时调用,但默认不能抢占回答、写作和判断的第一召回位

一、问题定义

这个库已经不是早期资料库,而是一个大型研究系统。大型系统的危险不是信息少,而是:

全文检索把旧稿、草稿、模型候选、传播版本、日志和核心页放在同一张桌上。
模型看到谁的词频高、反链多、标题刺激,就容易先调用谁。
真正高价值的证据页、总入口和方法页反而被淹没。

这会造成四种后果:

  1. 旧版本复活:已经降级或被否定的旧稿被重新当成当前口径。
  2. T2 候选越级:MiMo、AGT、ChatGPT 导出、prompt 产物被当成事实或稳定结论。
  3. 传播稿污染证据:公众号、小红书、主题曲、Suno、EVA 比较稿等输出材料反过来裁决影片事实。
  4. 日志与工程页抢答log、健康报告、运行总账、prompt 页提供了很多关键词,却不是回答问题的内容源。

一句话:

不是资料坏了,是召回顺序坏了。

二、当前可见噪声结构

2026-06-14 本轮局部扫描看到几个风险信号:

风险数字 含义
wiki/synthesis 2707 页 综合页数量很大,里面混有总入口、成品稿、旧版本、草稿、传播稿、工作台。
synthesis.status draft=1147 大量综合页是草稿态;如果全文检索不降权,会与当前口径竞争。
synthesis.evidence_tier 缺失 1525 许多综合页缺证据层级字段,机器很难判断它该不该优先调用。
synthesis.canonical_status 缺失 1050 很多综合页没有明确正典/候选/旧稿状态。
wiki/sources mimo-report=1177 MiMo 是雷达层,不应默认压过 T0/T1 或人工综合。
sources.status pending_review=829 待复核来源不能默认当成稳定证据。
sources.evidence_tier 缺失 493 证据层级缺口会放大召回污染。
粗略文件名扫描 draft/version 151、public platform 109、model 69 仅按文件名粗扫,已经能看到传播稿、旧版本和模型页的检索噪声。

这些数字不意味着这些页面都应删除。它们意味着:默认召回必须分层

三、治理原则

1. 召回治理优先于删除治理

不要急着删。删会破坏历史、证据链和版本责任。

先做:

谁可优先调用?
谁只能作为背景?
谁只在用户明确要求时调用?
谁必须被排除在默认回答之外?

2. 价值白名单先于全文搜索

以后回答任何大问题,都不应先全库 rg。先从白名单和入口页进入:

当前图书馆前厅
全库认知地图与提纯协议
Obsidian库最有价值文章与信息盘点
证据层级
对应专题中枢页

全文搜索只能作为第二步补充,不是第一步裁决。

3. 噪声材料可留档,但默认降权

旧稿、草稿、模型候选、传播稿、日志、prompt、运行总账都可以保留。它们的价值是:

版本史
灵感池
失败记录
传播出口
模型雷达
工程审计

但它们默认不是:

事实来源
当前口径
正典定义
最终论证

4. 高价值材料要被主动抬升

有价值的信息不能只“存在”。它必须拥有:

入口
反链
一句话定位
使用场景
禁止误用说明

否则再好的页面也会在大库里沉底。

四、四层召回制度

P0:正门层,默认优先调用

只放当前口径、证据纪律、核心入口、总蓝图。

建议当前 P0:

[当前图书馆前厅-2026-05-25](/research/hs-fc3f875217423b53)
[全库认知地图与提纯协议-2026-05-28](/research/hs-b6d4e707bbd2782a)
[Obsidian库最有价值文章与信息盘点-2026-06-01](/research/hs-9dbcbc10745246db)
[证据层级](/research/hs-ffd57ca6ae2f2293)
人工确信最高优先级Canon-2026-05-05(馆内参考,未随本文公开)
00-字典总入口(馆内参考,未随本文公开)
13-圣经式密码本设计蓝图-正典注释索引与旁经(馆内参考,未随本文公开)

使用规则:

任何大问题,先读 P0。
P0 不一定给出全部答案,但负责定口径、定证据边界、定入口。

P1:稳定知识层,可主动调用

包括 active 概念页、成熟综合页、T0/T1 来源页、书稿中枢、字典中枢。

可用条件:

status active
有明确 source_rule
能回到证据层级
不是旧稿、失败稿、传播稿或模型雷达

P2:候选雷达层,只能辅助

包括 MiMo、AGT、ChatGPT 导出、候选概念、外部理论接口、未复核来源。

使用规则:

可以提示“可能有线索”。
不能直接裁决事实。
不能压过 T0/T1。
必须标注候选身份。

P3:版本史与传播层,默认不进事实回答

包括公众号稿、小红书稿、Suno、主题曲、EVA 对照、v1/v2/v3 重写稿、被用户否定稿。

使用规则:

只有在用户问“传播、标题、公众号、版本演化、失败稿、语气”时调用。
回答影片事实、概念定义、证据问题时默认排除。

P4:隔离层,只在明确任务中调用

包括运行日志、prompt、模型 token 账、健康报告长明细、raw 资产路径、导出 HTML、截图资产。

使用规则:

只在馆务、debug、归档、工具修复、证据复核时调用。
普通创作和理论回答中不默认调用。

五、每次回答前的调用闸门

以后面对任何问题,先做 6 秒判断:

1. 用户问的是事实、概念、写作、传播、馆务,还是版本史?
2. 本问题需要 P0 哪些入口?
3. 是否涉及身份、说话人、声源、时间码、真实心理、consent、现实伤害或生产史?
4. 如果涉及,是否已有 T0/T1?
5. 哪些材料必须默认排除?
6. 最终回答是否需要注明“本次调用路径”?

最重要的反射动作:

不要让搜索结果决定重要性。
先让任务类型决定召回层级。

六、推荐的检索过滤规则

1. 大问题检索

优先:

rg -n "关键词" inspool-wiki-zh/wiki/index.md inspool-wiki-zh/wiki/synthesis/当前图书馆前厅-2026-05-25.md inspool-wiki-zh/wiki/synthesis/全库认知地图与提纯协议-2026-05-28.md

再扩展到具体专题目录或概念页。

2. 避免默认污染的排除项

全文检索时,除非任务需要,默认排除:

wiki/log.md
raw/
exports/
*-assets/
*prompt*
*MiMo*
*Suno*
*公众号*
*小红书*
*v1*
*v2*
*v3*
*草稿*
*重写*
*发布版*

注意:这不是说它们没有价值,而是说它们不该默认抢答。

3. 证据问题检索

优先路径:

[证据层级](/research/hs-ffd57ca6ae2f2293)
-> 人工确信最高优先级Canon-2026-05-05(馆内参考,未随本文公开)
-> UserCorrections / LocalForensics / OpenClaw T0/T1 来源页
-> 再看 T2/MiMo 候选

4. 概念问题检索

优先路径:

[全库认知地图与提纯协议-2026-05-28](/research/hs-b6d4e707bbd2782a)
-> 核心概念页
-> 470 概念操作总纲
-> 相关综合页
-> 候选/旧名/桥接页

5. 字典问题检索

优先路径:

00-字典总入口(馆内参考,未随本文公开)
-> 13-圣经式密码本设计蓝图-正典注释索引与旁经(馆内参考,未随本文公开)
-> 14 个调研页
-> 07/09/12 等结构图谱页

七、建议新增但不批量滥改的字段

后续可以逐页、小批量、人工审读后增加以下字段。不要一次性机器批量改写。

retrieval_role: p0_entry | stable_synthesis | evidence_anchor | concept_core | candidate_radar | draft_archive | public_output | tool_log
retrieval_policy: prefer | allow | context_only | explicit_request_only | exclude_by_default
current_use: current | historical | superseded | rejected | pending_review

这些字段不替代 canonical_status / evidence_tier / source_rule,而是专门服务“模型应该不会优先读错东西”。

最低限度先做两类:

P0 白名单页:retrieval_policy: prefer
明显噪声页:retrieval_policy: explicit_request_only 或 exclude_by_default

八、三种垃圾信息的处理方式

1. 旧稿垃圾

不是删除,而是标明:

historical
superseded
rejected_by_user
draft_archive

并在当前入口页里说明它为什么不能当当前口径。

2. 模型候选垃圾

保留为雷达,但必须接入复核队列:

MiMo / AGT / ChatGPT 导出
-> 候选
-> T2-to-T1 复核
-> 通过后进证据页
-> 不通过则保留失败记录

3. 传播输出垃圾

公众号、小红书、主题曲、EVA 对照稿有传播价值,但不能反向污染理论和证据。

处理方式:

放在 public_output
只服务标题、语气、传播策略
不用于事实裁决
不用于核心概念正典定义

九、回答时的透明度要求

当问题复杂或容易被污染时,回答应主动说明:

本次优先调用:
本次只作背景:
本次排除:
仍待人工复核:

这会稍微慢一点,但能避免“看起来很聪明,其实调用了旧垃圾”的情况。

十、下一步可执行方案

第一阶段:建白名单

做一页:

[价值召回白名单-2026-06-14](/research/hs-6d4f6c3396a6efbf)

收 30-50 个 P0/P1 页面,按任务类型分:

事实
概念
字典
书稿
传播
馆务
证据

第二阶段:建灰名单

做一页:

[检索降权灰名单-2026-06-14](/research/hs-7882887422969d3f)

收旧稿、草稿、传播稿、模型候选和 prompt 页的主要模式,不逐页删。

第三阶段:改回答流程

未来所有 Wiki 回答默认执行:

P0 恢复口径
-> P1 找稳定内容
-> P2 补候选
-> P3/P4 只在明确任务中调用

第四阶段:抽样审计

每周或每轮大工作后,抽 5 个高频关键词:

技术幽灵性
档案静默
现场流
不继续权
证据层级

检查全文检索前 20 个结果里,有多少是 P0/P1,有多少是 P3/P4。如果垃圾超过一半,就补白名单或灰名单。

十一、最短结论

不要把图书馆整理成没有垃圾。
要把图书馆整理成垃圾不能抢答。

这个库需要的不是大扫除,而是召回制度:

P0 定口径。
P1 给答案。
P2 给雷达。
P3 留版本史。
P4 做工程审计。

只要这五层立起来,有价值的信息就会重新浮到前台,低价值信息也不会被误删,而是回到它应该待的位置。

引用与版本

P4 剧场研究档案:《图书馆噪声治理与价值召回协议》,来源版本 2026-06-14,公开研究版 2026-09-08

https://a.p4theater.top/research/hs-5771be9cf23a6e8d

馆内参考标记指尚未在本次文库公开的资料,不能视为读者已可访问的独立证据。不同版本、译文与同一材料的转述,不计作相互独立的证据。