🔧 AI 知识库

我用 WorkBuddy + Obsidian,搭了一个会自己生长的个人知识库

原文链接

我用 WorkBuddy + Obsidian,搭了一个会自己生长的个人知识库

原文链接:https://mp.weixin.qq.com/s/VlcgqGtKt6OpESkvfBG0Zw

作者:叶小钗|发布时间:2026-06-23

摘要

基于 Karpathy LLM Wiki 理念,使用 WorkBuddy + Obsidian 搭建了一个可自我生长的个人知识库。核心思路不同于传统 RAG(查询时临时拼答案),而是让 LLM 提前将原始资料编译成结构化 Wiki,增量更新实体页、主题页和交叉引用,知识像滚雪球一样越滚越大。文章完整介绍了从架构设计、数据采集、知识编译、查询到自动化治理的端到端实践。

LLM Wiki 核心理念(Karpathy)

传统 RAG 的局限: 上传资料 → 查询时召回片段 → 临时综合回答。每次提问都从碎片重新拼答案,知识没有持续沉淀。

LLM Wiki 的做法: 提前把知识编译成可持续演化的结构化 Wiki——实体页、主题页、交叉引用、矛盾标注、综合结论。一次编译,持续复用。

增量更新: Agent 先判断新知识对应哪些已有实体/概念/主题,再决定更新旧页面还是创建新页面。新旧资料说法不一致时,同时保留来源、时间和适用范围,给出冲突提示。

三层架构

层级职责谁负责特点
Raw 层存放原始资料(文章、论文、图像、聊天记录等)人负责采集不可变,整个体系的事实来源
Wiki 层结构化知识(摘要、实体页、概念页、交叉引用)AI 负责更新由 LLM 维护,持续增量编译
Schema 层AGENTS.md,定义 Wiki 结构、工作流程和规范人编写 + 持续维护整个系统的灵魂

工具链

  • WorkBuddy: 承担编译器角色,负责对原始资料加工
  • Obsidian: 承担编辑器和 UI 视图,提供双向链接和关系图谱可视化
  • Obsidian Web Clipper: 浏览器插件,将网页提取为 Markdown 保存到 Vault
  • IMA 知识库: 移动端内容中转站(微信生态特别友好)

目录结构

kb-wiki/
├── AGENTS.md          # Schema 层,指导 AI 的工作原则
├── index.md           # Wiki 索引文件,快速定位内容
├── log.md             # 操作记录(时间、写入内容、新增项)
├── raw/               # 原始资料(不可变)
├── wiki/              # AI 编译后的结构化知识
└── templates/         # 模板文件,与 wiki 目录一一对应

整体工作流程

1. 数据采集

  • 电脑端: Obsidian Web Clipper 直接收藏到 raw/
  • 移动端(微信): 先收藏到 IMA 知识库 → WorkBuddy 定时任务自动同步到 raw/
  • 其他平台: 借助各平台 CLI + WorkBuddy 自动化任务
  • 多模态解析: 文档/图片/视频/音频/PPT/PDF 全部转为文本
  • 原则: 宁缺勿滥,只收集高质量内容

2. 知识编译

在 WorkBuddy 中告知:

阅读 raw/ 中新增文件,按 AGENTS.md 规范编译到 wiki/,更新 index.md 和 log.md

WorkBuddy 自动:提炼概念实体 → 创建摘要 → 建立 [[wikilinks]] 双向链接 → 更新索引和日志。

在 Obsidian 关系图谱中可直观看到知识之间的关联网络。

3. 查询知识

直接向 WorkBuddy 提问。流程:先读 index.md 判断相关页面 → 再加载 wiki 中对应知识 → 综合回答。类似目录索引定位章节,大幅提高检索效率。

4. 知识治理

WorkBuddy 定时任务(如每周)自动检查:Wiki 矛盾、孤立页面、断链。防止资料越多越乱。

企业场景局限

维度LLM Wiki传统 RAG
数据规模文档膨胀时 Token 消耗暴增,index.md 可能撑爆上下文只检索相关片段,成本可控
权限管理细粒度访问控制不完善成熟的权限体系
可溯源性依赖模型重构,存在幻觉风险可明确指向来源文档的具体段落

结论: LLM Wiki 适合个人知识库、学习研究等低风险场景;企业场景(尤其医疗、法律等严肃领域)需谨慎评估。

实践建议

从小主题开始,跑通采集→编译→查询→治理的完整闭环,再根据实际使用逐步调整,不追求一开始就大而全。