数据沉淀 · 技术知识库
从真实资料开始

从杂乱信息到可复用认知

存下来,
还不等于形成知识。

AI 的价值不是替你制造更多摘要,而是把来源、时间、条件和结论连在一起,让重要信息在需要时找得到、信得过、能继续行动。

第一原则 原始证据不可丢;摘要、标签、向量与关系图属于可重建层。
水彩画:杂乱的文档、记录和媒体经过筛选,沉淀为有序的知识花园
AI 负责筛选与连接,人负责目标、边界和最终判断。

一条完整主线

七步把信息变成可用知识

不是“一键上传后问答”,而是一条可检查、可回滚的流水线。

  1. 01收集登记来源、时间、作者与权限
  2. 02解析保留标题、段落、表格与页码
  3. 03去噪去重、过滤广告、标记冲突与过期
  4. 04知识卡片把长材料拆成带证据的最小认知单元
  5. 05分层存储原文、表格、索引与关系各归其位
  6. 06检索按问题找证据,回答必须能回到原文
  7. 07反馈纠错、更新、淘汰,并沉淀为 Skill

不要只存摘要

一条“知识”至少包含什么?

没有出处和适用条件的结论,只是容易传播的文字。

核心内容事实 / 主张

一句能被验证、引用或用于决策的话。

来源定位
文件、链接、页码或时间戳
时间版本
何时成立,何时更新
上下文
对象、范围、前提与例外
状态
已核验、待确认、存在冲突
关系
支持、反驳、因果、属于
权限
谁能看、谁能改、能否外发
下一步
能用于什么决策或行动

数据该存在哪里

一种数据,一种最合适的容器

不要把所有内容都塞进向量数据库。搜索索引不是事实本身。

水彩画:从原始资料、结构化表格、知识卡片、语义索引到关系图谱的分层知识柜
下层保留证据,上层服务理解与行动;上层随时可以重建。
01 · 事实源

原始资料

录音、PDF、网页快照、图片与原始表格。只追加、少覆盖,保留校验值和版本。

文件系统 / 对象存储 / 飞书云文档
02 · 可计算层

结构化数据

把人物、日期、金额、事件和指标整理成稳定字段,便于过滤、统计和回溯。

CSV / Parquet / DuckDB / SQLite / 多维表格
03 · 治理层

元数据

记录来源、权限、版本、有效期、处理状态与数据血缘。

SQLite / PostgreSQL / 数据目录
04 · 找回层

语义索引

向量负责“意思相近”,关键词负责专有名词与精确编号,两者混合更稳。

Qdrant + 全文检索;索引可删除重建
05 · 关系层

关系图谱

只有当问题需要跨文档关系、全局主题或多跳推理时再构建,避免过度工程。

实体、关系、社区摘要;不是所有知识库都需要

AI 去噪不是“删得多”

让机器做粗活,让规则守住底线

先做可解释的确定性处理,再让模型做语义判断。

确定性规则

先清理

  • 文件哈希与近重复检测
  • 统一日期、单位和字段名
  • 过滤导航、广告与模板页脚
  • 保留原文到清洗结果的映射
轻量模型

再识别

  • 主题、实体、时间与行动项
  • 个人信息与敏感内容
  • 明显无关、低信息密度内容
  • 不确定项进入待确认队列
推理模型

后综合

  • 发现跨来源冲突与更新关系
  • 生成带引用的阶段总结
  • 回答“为什么”和“有什么影响”
  • 证据不足时明确拒答
人的决策点

只确认高影响问题

  • 哪些来源可信
  • 冲突以哪个版本为准
  • 哪些内容允许共享
  • 哪些结论可以驱动外部动作

论文给出的设计信号

不要把全部资料直接塞进上下文

研究支持分层检索、时间意识、引用和可拒答,而不是无限延长提示词。

同行评审 · TACL 2024

长上下文也会“看漏中间”

相关信息位于长上下文中部时,模型表现会下降。知识库应先检索,再提供少量关键证据。

Lost in the Middle ↗
同行评审 · ICLR 2024

长文档需要层级摘要

RAPTOR 把片段递归聚类和摘要成树,说明细节检索与全局理解需要不同粒度。

RAPTOR ↗
论文 · 2024

全局问题适合图结构

GraphRAG 从实体关系建立社区摘要,适合回答跨大量文档的主题与整体问题。

GraphRAG ↗
论文 · 2024

记忆必须处理时间与更新

LongMemEval 把长期记忆拆为信息提取、多会话、时间、更新和拒答,提醒我们不能只做相似度搜索。

LongMemEval ↗

开源组件 · 截至 2026-07-23 核验

按问题选工具,不按热度堆技术

以下项目均链接到官方仓库;部署前仍需核验最新许可证、版本与数据边界。

环节项目适合做什么注意事项
解析Docling ↗MIT本地解析 PDF、Office、网页、表格、公式与 OCR,输出 Markdown / JSON。先验证复杂表格和扫描件质量;原文件仍要保留。
检索工作台RAGFlow ↗Apache-2.0文档理解、切块可视化、检索和引用,适合团队做完整 RAG 流程。运维成本高于个人知识库;先用真实问题做小规模评估。
向量索引Qdrant ↗Apache-2.0语义检索、过滤与混合搜索;适合资料量和并发增长后使用。向量不是事实库,必须保留 source_id 和定位信息。
全局关系Microsoft GraphRAG ↗MIT从非结构化材料抽取实体关系并建立社区摘要。索引成本可能较高;官方也建议先从小数据集开始。

完成标准

衡量“有用”,而不是衡量“存了多少”

一套知识库只有在真实问题上可靠,才算完成沉淀。

可追溯

每个结论能回到文件、页码或时间戳。

够新

过期内容有状态,更新不会与旧版本混成一条。

不重复

同一事实合并展示,但保留多个独立来源。

会冲突

不强行合并矛盾,明确列出差异和待确认项。

权限正确

检索结果继承源数据权限,敏感内容不越界。

能拒答

证据不足时说不知道,不用流畅文字填空。

普通人的最小可行方案

今天只整理一个真实文件夹

不必先搭建复杂系统。选一个你经常反复查找的主题,例如客户资料、会议记录或行业研究。

  1. 1
    保留原件

    建立“原始资料”目录,不让 AI 覆盖源文件。

  2. 2
    统一命名

    用日期、主题、来源命名,并在表格登记链接和权限。

  3. 3
    生成知识卡片

    要求 AI 输出结论、证据定位、适用条件、状态和下一步。

  4. 4
    用五个真实问题测试

    看能否找对来源、识别冲突、在证据不足时拒答。

  5. 5
    沉淀为 Skill

    保存有效的输入格式、处理步骤、质量检查和输出模板。

有一批资料不知道如何整理?把目标、资料类型和最终要做的决定告诉项目 Agent。
生成我的整理方案