RAG、召回摘要与知识库:摘要不是细节,召回不是审查
形式对象
RAG 和知识库检索看起来像解决问题。
资料太多。
让系统帮你找。
让模型帮你总结。
让摘要帮你快速读。
这些都很有用。
但真正危险的地方也在这里:
摘要会替细节先开口。
召回会替审查装成审查。
所以硬句是:
摘要不是细节,召回不是审查。
人称动作
| 人称位 | 在 RAG/摘要/知识库中如何作用 |
|---|---|
| 第一人称 | 写作者以为自己掌握资料,其实常常只是掌握了机器给出的入口。 |
| 第二人称 | 查询对系统发出请求,系统把你压成检索任务。 |
| 第三人称 | 原文被切块、向量化、摘要化、引用化,成为可拼接材料。 |
| 第四人称 | 人工审查台把多人判断组织起来,但不能让群体跳过细节。 |
| 第六人称 | 检索、排序、embedding、摘要模型和界面决定材料怎样回来。 |
作用链
原文进入知识库
-> 被切块和标注
-> 查询触发召回
-> 模型生成摘要
-> 摘要看起来完整
-> 细节被压扁
-> 人工审查必须重新打开原文
你之前指出的问题就在这里:
垃圾信息被不断调用。
高价值信息没能真实使用。
这不是偶然。
知识库如果不治理入口、权重、标签、证据层级和人工审核,就会偏向:
更短的材料。
更像结论的材料。
更容易被召回的材料。
更符合机器摘要口吻的材料。
回到《人类投降派》
适用位置:
041 保存以后停止占有。
044 写在那里不等于是真的。
045 索引决定谁先开口。
047 Owner 负责删掉什么。
048 我不能外包给机器。
这张卡是知识库治理核心。
它要求后续审查台必须有三层:
摘要层:快速看方向。
细节层:回到原文和片内证据。
人工层:决定升格、降权、删除、保留。
少一层都不行。
可写硬句
摘要不是细节,召回不是审查。
也可以写成:
系统把材料叫回来,不等于材料已经通过审判。
不可越界
不能把 RAG 召回当作事实证明。
不能让摘要替代原文细读。
不能让模型综合替代 Owner 审查。
只能迁移:
知识库召回会改变材料出场顺序,因此必须被证据层级和人工审查约束。
