# 图书馆噪声治理与价值召回协议

本文为研究档案公开版，保留来源版本的论述与限制。公开时间：2026-09-08；不表示已完成同行评审。 本文属于公开研究资料（历史笔记、研究稿或来源记录）：已完成格式、来源限制与重复项筛查，尚未完成逐篇独立事实复核；原文中的解释、候选判断和未确认内容均按其原有限制阅读。

来源版本日期：2026-06-14

证据边界：本页是馆务与检索治理协议，不新增片内事实裁决；不批量改写 canonical_status、evidence_tier、source_rule、content_status 等证据判断字段。

# 图书馆噪声治理与价值召回协议

> [!important] 核心判断
> 当前问题不是“库里有垃圾信息”，而是“垃圾信息与高价值信息在检索层平权”。治理目标不是删除一切噪声，而是让低价值材料可存档、可追溯、可必要时调用，但**默认不能抢占回答、写作和判断的第一召回位**。

## 一、问题定义

这个库已经不是早期资料库，而是一个大型研究系统。大型系统的危险不是信息少，而是：

```text
全文检索把旧稿、草稿、模型候选、传播版本、日志和核心页放在同一张桌上。
模型看到谁的词频高、反链多、标题刺激，就容易先调用谁。
真正高价值的证据页、总入口和方法页反而被淹没。
```

这会造成四种后果：

1. **旧版本复活**：已经降级或被否定的旧稿被重新当成当前口径。
2. **T2 候选越级**：MiMo、AGT、ChatGPT 导出、prompt 产物被当成事实或稳定结论。
3. **传播稿污染证据**：公众号、小红书、主题曲、Suno、EVA 比较稿等输出材料反过来裁决影片事实。
4. **日志与工程页抢答**：`log`、健康报告、运行总账、prompt 页提供了很多关键词，却不是回答问题的内容源。

一句话：

```text
不是资料坏了，是召回顺序坏了。
```

## 二、当前可见噪声结构

2026-06-14 本轮局部扫描看到几个风险信号：

| 层 | 风险数字 | 含义 |
|---|---:|---|
| `wiki/synthesis` | 2707 页 | 综合页数量很大，里面混有总入口、成品稿、旧版本、草稿、传播稿、工作台。 |
| `synthesis.status` | `draft=1147` | 大量综合页是草稿态；如果全文检索不降权，会与当前口径竞争。 |
| `synthesis.evidence_tier` | 缺失 1525 | 许多综合页缺证据层级字段，机器很难判断它该不该优先调用。 |
| `synthesis.canonical_status` | 缺失 1050 | 很多综合页没有明确正典/候选/旧稿状态。 |
| `wiki/sources` | `mimo-report=1177` | MiMo 是雷达层，不应默认压过 T0/T1 或人工综合。 |
| `sources.status` | `pending_review=829` | 待复核来源不能默认当成稳定证据。 |
| `sources.evidence_tier` | 缺失 493 | 证据层级缺口会放大召回污染。 |
| 粗略文件名扫描 | draft/version 151、public platform 109、model 69 | 仅按文件名粗扫，已经能看到传播稿、旧版本和模型页的检索噪声。 |

这些数字不意味着这些页面都应删除。它们意味着：**默认召回必须分层**。

## 三、治理原则

### 1. 召回治理优先于删除治理

不要急着删。删会破坏历史、证据链和版本责任。

先做：

```text
谁可优先调用？
谁只能作为背景？
谁只在用户明确要求时调用？
谁必须被排除在默认回答之外？
```

### 2. 价值白名单先于全文搜索

以后回答任何大问题，都不应先全库 `rg`。先从白名单和入口页进入：

```text
当前图书馆前厅
全库认知地图与提纯协议
Obsidian库最有价值文章与信息盘点
证据层级
对应专题中枢页
```

全文搜索只能作为第二步补充，不是第一步裁决。

### 3. 噪声材料可留档，但默认降权

旧稿、草稿、模型候选、传播稿、日志、prompt、运行总账都可以保留。它们的价值是：

```text
版本史
灵感池
失败记录
传播出口
模型雷达
工程审计
```

但它们默认不是：

```text
事实来源
当前口径
正典定义
最终论证
```

### 4. 高价值材料要被主动抬升

有价值的信息不能只“存在”。它必须拥有：

```text
入口
反链
一句话定位
使用场景
禁止误用说明
```

否则再好的页面也会在大库里沉底。

## 四、四层召回制度

### P0：正门层，默认优先调用

只放当前口径、证据纪律、核心入口、总蓝图。

建议当前 P0：

```text
[当前图书馆前厅-2026-05-25](/research/hs-fc3f875217423b53)
[全库认知地图与提纯协议-2026-05-28](/research/hs-b6d4e707bbd2782a)
[Obsidian库最有价值文章与信息盘点-2026-06-01](/research/hs-9dbcbc10745246db)
[证据层级](/research/hs-ffd57ca6ae2f2293)
人工确信最高优先级Canon-2026-05-05（馆内参考，未随本文公开）
00-字典总入口（馆内参考，未随本文公开）
13-圣经式密码本设计蓝图-正典注释索引与旁经（馆内参考，未随本文公开）
```

使用规则：

```text
任何大问题，先读 P0。
P0 不一定给出全部答案，但负责定口径、定证据边界、定入口。
```

### P1：稳定知识层，可主动调用

包括 active 概念页、成熟综合页、T0/T1 来源页、书稿中枢、字典中枢。

可用条件：

```text
status active
有明确 source_rule
能回到证据层级
不是旧稿、失败稿、传播稿或模型雷达
```

### P2：候选雷达层，只能辅助

包括 MiMo、AGT、ChatGPT 导出、候选概念、外部理论接口、未复核来源。

使用规则：

```text
可以提示“可能有线索”。
不能直接裁决事实。
不能压过 T0/T1。
必须标注候选身份。
```

### P3：版本史与传播层，默认不进事实回答

包括公众号稿、小红书稿、Suno、主题曲、EVA 对照、v1/v2/v3 重写稿、被用户否定稿。

使用规则：

```text
只有在用户问“传播、标题、公众号、版本演化、失败稿、语气”时调用。
回答影片事实、概念定义、证据问题时默认排除。
```

### P4：隔离层，只在明确任务中调用

包括运行日志、prompt、模型 token 账、健康报告长明细、raw 资产路径、导出 HTML、截图资产。

使用规则：

```text
只在馆务、debug、归档、工具修复、证据复核时调用。
普通创作和理论回答中不默认调用。
```

## 五、每次回答前的调用闸门

以后面对任何问题，先做 6 秒判断：

```text
1. 用户问的是事实、概念、写作、传播、馆务，还是版本史？
2. 本问题需要 P0 哪些入口？
3. 是否涉及身份、说话人、声源、时间码、真实心理、consent、现实伤害或生产史？
4. 如果涉及，是否已有 T0/T1？
5. 哪些材料必须默认排除？
6. 最终回答是否需要注明“本次调用路径”？
```

最重要的反射动作：

```text
不要让搜索结果决定重要性。
先让任务类型决定召回层级。
```

## 六、推荐的检索过滤规则

### 1. 大问题检索

优先：

```bash
rg -n "关键词" inspool-wiki-zh/wiki/index.md inspool-wiki-zh/wiki/synthesis/当前图书馆前厅-2026-05-25.md inspool-wiki-zh/wiki/synthesis/全库认知地图与提纯协议-2026-05-28.md
```

再扩展到具体专题目录或概念页。

### 2. 避免默认污染的排除项

全文检索时，除非任务需要，默认排除：

```text
wiki/log.md
raw/
exports/
*-assets/
*prompt*
*MiMo*
*Suno*
*公众号*
*小红书*
*v1*
*v2*
*v3*
*草稿*
*重写*
*发布版*
```

注意：这不是说它们没有价值，而是说它们不该默认抢答。

### 3. 证据问题检索

优先路径：

```text
[证据层级](/research/hs-ffd57ca6ae2f2293)
-> 人工确信最高优先级Canon-2026-05-05（馆内参考，未随本文公开）
-> UserCorrections / LocalForensics / OpenClaw T0/T1 来源页
-> 再看 T2/MiMo 候选
```

### 4. 概念问题检索

优先路径：

```text
[全库认知地图与提纯协议-2026-05-28](/research/hs-b6d4e707bbd2782a)
-> 核心概念页
-> 470 概念操作总纲
-> 相关综合页
-> 候选/旧名/桥接页
```

### 5. 字典问题检索

优先路径：

```text
00-字典总入口（馆内参考，未随本文公开）
-> 13-圣经式密码本设计蓝图-正典注释索引与旁经（馆内参考，未随本文公开）
-> 14 个调研页
-> 07/09/12 等结构图谱页
```

## 七、建议新增但不批量滥改的字段

后续可以逐页、小批量、人工审读后增加以下字段。不要一次性机器批量改写。

```yaml
retrieval_role: p0_entry | stable_synthesis | evidence_anchor | concept_core | candidate_radar | draft_archive | public_output | tool_log
retrieval_policy: prefer | allow | context_only | explicit_request_only | exclude_by_default
current_use: current | historical | superseded | rejected | pending_review
```

这些字段不替代 `canonical_status / evidence_tier / source_rule`，而是专门服务“模型应该不会优先读错东西”。

最低限度先做两类：

```text
P0 白名单页：retrieval_policy: prefer
明显噪声页：retrieval_policy: explicit_request_only 或 exclude_by_default
```

## 八、三种垃圾信息的处理方式

### 1. 旧稿垃圾

不是删除，而是标明：

```text
historical
superseded
rejected_by_user
draft_archive
```

并在当前入口页里说明它为什么不能当当前口径。

### 2. 模型候选垃圾

保留为雷达，但必须接入复核队列：

```text
MiMo / AGT / ChatGPT 导出
-> 候选
-> T2-to-T1 复核
-> 通过后进证据页
-> 不通过则保留失败记录
```

### 3. 传播输出垃圾

公众号、小红书、主题曲、EVA 对照稿有传播价值，但不能反向污染理论和证据。

处理方式：

```text
放在 public_output
只服务标题、语气、传播策略
不用于事实裁决
不用于核心概念正典定义
```

## 九、回答时的透明度要求

当问题复杂或容易被污染时，回答应主动说明：

```text
本次优先调用：
本次只作背景：
本次排除：
仍待人工复核：
```

这会稍微慢一点，但能避免“看起来很聪明，其实调用了旧垃圾”的情况。

## 十、下一步可执行方案

### 第一阶段：建白名单

做一页：

```text
[价值召回白名单-2026-06-14](/research/hs-6d4f6c3396a6efbf)
```

收 30-50 个 P0/P1 页面，按任务类型分：

```text
事实
概念
字典
书稿
传播
馆务
证据
```

### 第二阶段：建灰名单

做一页：

```text
[检索降权灰名单-2026-06-14](/research/hs-7882887422969d3f)
```

收旧稿、草稿、传播稿、模型候选和 prompt 页的主要模式，不逐页删。

### 第三阶段：改回答流程

未来所有 Wiki 回答默认执行：

```text
P0 恢复口径
-> P1 找稳定内容
-> P2 补候选
-> P3/P4 只在明确任务中调用
```

### 第四阶段：抽样审计

每周或每轮大工作后，抽 5 个高频关键词：

```text
技术幽灵性
档案静默
现场流
不继续权
证据层级
```

检查全文检索前 20 个结果里，有多少是 P0/P1，有多少是 P3/P4。如果垃圾超过一半，就补白名单或灰名单。

## 十一、最短结论

```text
不要把图书馆整理成没有垃圾。
要把图书馆整理成垃圾不能抢答。
```

这个库需要的不是大扫除，而是召回制度：

```text
P0 定口径。
P1 给答案。
P2 给雷达。
P3 留版本史。
P4 做工程审计。
```

只要这五层立起来，有价值的信息就会重新浮到前台，低价值信息也不会被误删，而是回到它应该待的位置。