本篇目录 / Contents
- 图书馆噪声治理与价值召回协议
- 一、问题定义
- 二、当前可见噪声结构
- 三、治理原则
- 1. 召回治理优先于删除治理
- 2. 价值白名单先于全文搜索
- 3. 噪声材料可留档,但默认降权
- 4. 高价值材料要被主动抬升
- 四、四层召回制度
- P0:正门层,默认优先调用
- P1:稳定知识层,可主动调用
- P2:候选雷达层,只能辅助
- P3:版本史与传播层,默认不进事实回答
- P4:隔离层,只在明确任务中调用
- 五、每次回答前的调用闸门
- 六、推荐的检索过滤规则
- 1. 大问题检索
- 2. 避免默认污染的排除项
- 3. 证据问题检索
- 4. 概念问题检索
- 5. 字典问题检索
- 七、建议新增但不批量滥改的字段
- 八、三种垃圾信息的处理方式
- 1. 旧稿垃圾
- 2. 模型候选垃圾
- 3. 传播输出垃圾
- 九、回答时的透明度要求
- 十、下一步可执行方案
- 第一阶段:建白名单
- 第二阶段:建灰名单
- 第三阶段:改回答流程
- 第四阶段:抽样审计
- 十一、最短结论
图书馆噪声治理与价值召回协议
[!important] 核心判断 当前问题不是“库里有垃圾信息”,而是“垃圾信息与高价值信息在检索层平权”。治理目标不是删除一切噪声,而是让低价值材料可存档、可追溯、可必要时调用,但默认不能抢占回答、写作和判断的第一召回位。
一、问题定义
这个库已经不是早期资料库,而是一个大型研究系统。大型系统的危险不是信息少,而是:
全文检索把旧稿、草稿、模型候选、传播版本、日志和核心页放在同一张桌上。
模型看到谁的词频高、反链多、标题刺激,就容易先调用谁。
真正高价值的证据页、总入口和方法页反而被淹没。
这会造成四种后果:
- 旧版本复活:已经降级或被否定的旧稿被重新当成当前口径。
- T2 候选越级:MiMo、AGT、ChatGPT 导出、prompt 产物被当成事实或稳定结论。
- 传播稿污染证据:公众号、小红书、主题曲、Suno、EVA 比较稿等输出材料反过来裁决影片事实。
- 日志与工程页抢答:
log、健康报告、运行总账、prompt 页提供了很多关键词,却不是回答问题的内容源。
一句话:
不是资料坏了,是召回顺序坏了。
二、当前可见噪声结构
2026-06-14 本轮局部扫描看到几个风险信号:
| 层 | 风险数字 | 含义 |
|---|---|---|
wiki/synthesis |
2707 页 | 综合页数量很大,里面混有总入口、成品稿、旧版本、草稿、传播稿、工作台。 |
synthesis.status |
draft=1147 |
大量综合页是草稿态;如果全文检索不降权,会与当前口径竞争。 |
synthesis.evidence_tier |
缺失 1525 | 许多综合页缺证据层级字段,机器很难判断它该不该优先调用。 |
synthesis.canonical_status |
缺失 1050 | 很多综合页没有明确正典/候选/旧稿状态。 |
wiki/sources |
mimo-report=1177 |
MiMo 是雷达层,不应默认压过 T0/T1 或人工综合。 |
sources.status |
pending_review=829 |
待复核来源不能默认当成稳定证据。 |
sources.evidence_tier |
缺失 493 | 证据层级缺口会放大召回污染。 |
| 粗略文件名扫描 | draft/version 151、public platform 109、model 69 | 仅按文件名粗扫,已经能看到传播稿、旧版本和模型页的检索噪声。 |
这些数字不意味着这些页面都应删除。它们意味着:默认召回必须分层。
三、治理原则
1. 召回治理优先于删除治理
不要急着删。删会破坏历史、证据链和版本责任。
先做:
谁可优先调用?
谁只能作为背景?
谁只在用户明确要求时调用?
谁必须被排除在默认回答之外?
2. 价值白名单先于全文搜索
以后回答任何大问题,都不应先全库 rg。先从白名单和入口页进入:
当前图书馆前厅
全库认知地图与提纯协议
Obsidian库最有价值文章与信息盘点
证据层级
对应专题中枢页
全文搜索只能作为第二步补充,不是第一步裁决。
3. 噪声材料可留档,但默认降权
旧稿、草稿、模型候选、传播稿、日志、prompt、运行总账都可以保留。它们的价值是:
版本史
灵感池
失败记录
传播出口
模型雷达
工程审计
但它们默认不是:
事实来源
当前口径
正典定义
最终论证
4. 高价值材料要被主动抬升
有价值的信息不能只“存在”。它必须拥有:
入口
反链
一句话定位
使用场景
禁止误用说明
否则再好的页面也会在大库里沉底。
四、四层召回制度
P0:正门层,默认优先调用
只放当前口径、证据纪律、核心入口、总蓝图。
建议当前 P0:
[当前图书馆前厅-2026-05-25](/research/hs-fc3f875217423b53)
[全库认知地图与提纯协议-2026-05-28](/research/hs-b6d4e707bbd2782a)
[Obsidian库最有价值文章与信息盘点-2026-06-01](/research/hs-9dbcbc10745246db)
[证据层级](/research/hs-ffd57ca6ae2f2293)
人工确信最高优先级Canon-2026-05-05(馆内参考,未随本文公开)
00-字典总入口(馆内参考,未随本文公开)
13-圣经式密码本设计蓝图-正典注释索引与旁经(馆内参考,未随本文公开)
使用规则:
任何大问题,先读 P0。
P0 不一定给出全部答案,但负责定口径、定证据边界、定入口。
P1:稳定知识层,可主动调用
包括 active 概念页、成熟综合页、T0/T1 来源页、书稿中枢、字典中枢。
可用条件:
status active
有明确 source_rule
能回到证据层级
不是旧稿、失败稿、传播稿或模型雷达
P2:候选雷达层,只能辅助
包括 MiMo、AGT、ChatGPT 导出、候选概念、外部理论接口、未复核来源。
使用规则:
可以提示“可能有线索”。
不能直接裁决事实。
不能压过 T0/T1。
必须标注候选身份。
P3:版本史与传播层,默认不进事实回答
包括公众号稿、小红书稿、Suno、主题曲、EVA 对照、v1/v2/v3 重写稿、被用户否定稿。
使用规则:
只有在用户问“传播、标题、公众号、版本演化、失败稿、语气”时调用。
回答影片事实、概念定义、证据问题时默认排除。
P4:隔离层,只在明确任务中调用
包括运行日志、prompt、模型 token 账、健康报告长明细、raw 资产路径、导出 HTML、截图资产。
使用规则:
只在馆务、debug、归档、工具修复、证据复核时调用。
普通创作和理论回答中不默认调用。
五、每次回答前的调用闸门
以后面对任何问题,先做 6 秒判断:
1. 用户问的是事实、概念、写作、传播、馆务,还是版本史?
2. 本问题需要 P0 哪些入口?
3. 是否涉及身份、说话人、声源、时间码、真实心理、consent、现实伤害或生产史?
4. 如果涉及,是否已有 T0/T1?
5. 哪些材料必须默认排除?
6. 最终回答是否需要注明“本次调用路径”?
最重要的反射动作:
不要让搜索结果决定重要性。
先让任务类型决定召回层级。
六、推荐的检索过滤规则
1. 大问题检索
优先:
rg -n "关键词" inspool-wiki-zh/wiki/index.md inspool-wiki-zh/wiki/synthesis/当前图书馆前厅-2026-05-25.md inspool-wiki-zh/wiki/synthesis/全库认知地图与提纯协议-2026-05-28.md
再扩展到具体专题目录或概念页。
2. 避免默认污染的排除项
全文检索时,除非任务需要,默认排除:
wiki/log.md
raw/
exports/
*-assets/
*prompt*
*MiMo*
*Suno*
*公众号*
*小红书*
*v1*
*v2*
*v3*
*草稿*
*重写*
*发布版*
注意:这不是说它们没有价值,而是说它们不该默认抢答。
3. 证据问题检索
优先路径:
[证据层级](/research/hs-ffd57ca6ae2f2293)
-> 人工确信最高优先级Canon-2026-05-05(馆内参考,未随本文公开)
-> UserCorrections / LocalForensics / OpenClaw T0/T1 来源页
-> 再看 T2/MiMo 候选
4. 概念问题检索
优先路径:
[全库认知地图与提纯协议-2026-05-28](/research/hs-b6d4e707bbd2782a)
-> 核心概念页
-> 470 概念操作总纲
-> 相关综合页
-> 候选/旧名/桥接页
5. 字典问题检索
优先路径:
00-字典总入口(馆内参考,未随本文公开)
-> 13-圣经式密码本设计蓝图-正典注释索引与旁经(馆内参考,未随本文公开)
-> 14 个调研页
-> 07/09/12 等结构图谱页
七、建议新增但不批量滥改的字段
后续可以逐页、小批量、人工审读后增加以下字段。不要一次性机器批量改写。
retrieval_role: p0_entry | stable_synthesis | evidence_anchor | concept_core | candidate_radar | draft_archive | public_output | tool_log
retrieval_policy: prefer | allow | context_only | explicit_request_only | exclude_by_default
current_use: current | historical | superseded | rejected | pending_review
这些字段不替代 canonical_status / evidence_tier / source_rule,而是专门服务“模型应该不会优先读错东西”。
最低限度先做两类:
P0 白名单页:retrieval_policy: prefer
明显噪声页:retrieval_policy: explicit_request_only 或 exclude_by_default
八、三种垃圾信息的处理方式
1. 旧稿垃圾
不是删除,而是标明:
historical
superseded
rejected_by_user
draft_archive
并在当前入口页里说明它为什么不能当当前口径。
2. 模型候选垃圾
保留为雷达,但必须接入复核队列:
MiMo / AGT / ChatGPT 导出
-> 候选
-> T2-to-T1 复核
-> 通过后进证据页
-> 不通过则保留失败记录
3. 传播输出垃圾
公众号、小红书、主题曲、EVA 对照稿有传播价值,但不能反向污染理论和证据。
处理方式:
放在 public_output
只服务标题、语气、传播策略
不用于事实裁决
不用于核心概念正典定义
九、回答时的透明度要求
当问题复杂或容易被污染时,回答应主动说明:
本次优先调用:
本次只作背景:
本次排除:
仍待人工复核:
这会稍微慢一点,但能避免“看起来很聪明,其实调用了旧垃圾”的情况。
十、下一步可执行方案
第一阶段:建白名单
做一页:
[价值召回白名单-2026-06-14](/research/hs-6d4f6c3396a6efbf)
收 30-50 个 P0/P1 页面,按任务类型分:
事实
概念
字典
书稿
传播
馆务
证据
第二阶段:建灰名单
做一页:
[检索降权灰名单-2026-06-14](/research/hs-7882887422969d3f)
收旧稿、草稿、传播稿、模型候选和 prompt 页的主要模式,不逐页删。
第三阶段:改回答流程
未来所有 Wiki 回答默认执行:
P0 恢复口径
-> P1 找稳定内容
-> P2 补候选
-> P3/P4 只在明确任务中调用
第四阶段:抽样审计
每周或每轮大工作后,抽 5 个高频关键词:
技术幽灵性
档案静默
现场流
不继续权
证据层级
检查全文检索前 20 个结果里,有多少是 P0/P1,有多少是 P3/P4。如果垃圾超过一半,就补白名单或灰名单。
十一、最短结论
不要把图书馆整理成没有垃圾。
要把图书馆整理成垃圾不能抢答。
这个库需要的不是大扫除,而是召回制度:
P0 定口径。
P1 给答案。
P2 给雷达。
P3 留版本史。
P4 做工程审计。
只要这五层立起来,有价值的信息就会重新浮到前台,低价值信息也不会被误删,而是回到它应该待的位置。
