我用 WorkBuddy + Obsidian,搭了一个会自己生长的个人知识库
原文链接我用 WorkBuddy + Obsidian,搭了一个会自己生长的个人知识库
原文链接:https://mp.weixin.qq.com/s/VlcgqGtKt6OpESkvfBG0Zw
作者:叶小钗|发布时间:2026-06-23
摘要
基于 Karpathy LLM Wiki 理念,使用 WorkBuddy + Obsidian 搭建了一个可自我生长的个人知识库。核心思路不同于传统 RAG(查询时临时拼答案),而是让 LLM 提前将原始资料编译成结构化 Wiki,增量更新实体页、主题页和交叉引用,知识像滚雪球一样越滚越大。文章完整介绍了从架构设计、数据采集、知识编译、查询到自动化治理的端到端实践。
LLM Wiki 核心理念(Karpathy)
传统 RAG 的局限: 上传资料 → 查询时召回片段 → 临时综合回答。每次提问都从碎片重新拼答案,知识没有持续沉淀。
LLM Wiki 的做法: 提前把知识编译成可持续演化的结构化 Wiki——实体页、主题页、交叉引用、矛盾标注、综合结论。一次编译,持续复用。
增量更新: Agent 先判断新知识对应哪些已有实体/概念/主题,再决定更新旧页面还是创建新页面。新旧资料说法不一致时,同时保留来源、时间和适用范围,给出冲突提示。
三层架构
| 层级 | 职责 | 谁负责 | 特点 |
|---|---|---|---|
| Raw 层 | 存放原始资料(文章、论文、图像、聊天记录等) | 人负责采集 | 不可变,整个体系的事实来源 |
| Wiki 层 | 结构化知识(摘要、实体页、概念页、交叉引用) | AI 负责更新 | 由 LLM 维护,持续增量编译 |
| Schema 层 | AGENTS.md,定义 Wiki 结构、工作流程和规范 | 人编写 + 持续维护 | 整个系统的灵魂 |
工具链
- WorkBuddy: 承担编译器角色,负责对原始资料加工
- Obsidian: 承担编辑器和 UI 视图,提供双向链接和关系图谱可视化
- Obsidian Web Clipper: 浏览器插件,将网页提取为 Markdown 保存到 Vault
- IMA 知识库: 移动端内容中转站(微信生态特别友好)
目录结构
kb-wiki/
├── AGENTS.md # Schema 层,指导 AI 的工作原则
├── index.md # Wiki 索引文件,快速定位内容
├── log.md # 操作记录(时间、写入内容、新增项)
├── raw/ # 原始资料(不可变)
├── wiki/ # AI 编译后的结构化知识
└── templates/ # 模板文件,与 wiki 目录一一对应
整体工作流程
1. 数据采集
- 电脑端: Obsidian Web Clipper 直接收藏到 raw/
- 移动端(微信): 先收藏到 IMA 知识库 → WorkBuddy 定时任务自动同步到 raw/
- 其他平台: 借助各平台 CLI + WorkBuddy 自动化任务
- 多模态解析: 文档/图片/视频/音频/PPT/PDF 全部转为文本
- 原则: 宁缺勿滥,只收集高质量内容
2. 知识编译
在 WorkBuddy 中告知:
阅读 raw/ 中新增文件,按 AGENTS.md 规范编译到 wiki/,更新 index.md 和 log.md
WorkBuddy 自动:提炼概念实体 → 创建摘要 → 建立 [[wikilinks]] 双向链接 → 更新索引和日志。
在 Obsidian 关系图谱中可直观看到知识之间的关联网络。
3. 查询知识
直接向 WorkBuddy 提问。流程:先读 index.md 判断相关页面 → 再加载 wiki 中对应知识 → 综合回答。类似目录索引定位章节,大幅提高检索效率。
4. 知识治理
WorkBuddy 定时任务(如每周)自动检查:Wiki 矛盾、孤立页面、断链。防止资料越多越乱。
企业场景局限
| 维度 | LLM Wiki | 传统 RAG |
|---|---|---|
| 数据规模 | 文档膨胀时 Token 消耗暴增,index.md 可能撑爆上下文 | 只检索相关片段,成本可控 |
| 权限管理 | 细粒度访问控制不完善 | 成熟的权限体系 |
| 可溯源性 | 依赖模型重构,存在幻觉风险 | 可明确指向来源文档的具体段落 |
结论: LLM Wiki 适合个人知识库、学习研究等低风险场景;企业场景(尤其医疗、法律等严肃领域)需谨慎评估。
实践建议
从小主题开始,跑通采集→编译→查询→治理的完整闭环,再根据实际使用逐步调整,不追求一开始就大而全。