LLM-Wiki:让知识像花园一样持续生长

💡 原文中文,约19300字,阅读约需46分钟。
📝

内容提要

本文介绍llm-wiki理念:让AI长期维护Markdown知识图谱,区别于传统RAG的临时检索,实现知识复利。文章详述其三层架构(原始资料、知识层、操作规则)、核心操作(导入、查询、维护),并调研2026年生态工具,如OpenWiki、OpenKB等,提供选型建议和实现路线图,强调Markdown为真相层、索引可重建、写回需治理。

🔎

延伸解读

从“临时检索”到“知识复利”

文章将传统 RAG 比作临时资料员,每次提问都重新翻找资料,而 llm-wiki 则像长期图书管理员,平时就整理、归档、建立交叉引用,让知识不断沉淀。这种“知识复利”意味着每次阅读、问答、纠错都能成为可复用的资产,而非一次性消耗品。理解这一核心差异,有助于判断何时该用 RAG,何时该构建 llm-wiki。

三层架构:原始资料、知识层与操作规则

llm-wiki 的架构分为三层:原始资料层保存不可变的证据,知识层用 Markdown 页面和 wikilinks 构建结构化知识图谱,操作规则层则通过 CLAUDE.md 或 AGENTS.md 定义引用、合并、审批等规则。这种分层确保了知识的可追溯性和可维护性,是 llm-wiki 能长期运行的关键。

2026 生态:制造工具与交换标准的分工

文章调研了 2026 年的开源生态,指出新趋势是“制造工具”与“交换标准”分离。OpenWiki、OpenKB 等工具负责自动生成和维护 wiki,而 Google 的 OKF 则致力于定义知识包格式,让不同工具产出的 wiki 能互通。这种分工降低了用户的选择成本,但也需注意各项目多处于早期阶段,采用前应核实最新状态。

失败模式与治理:防止知识花园长杂草

llm-wiki 并非一劳永逸,文章列举了幻觉固化、引用漂移、旧事实不失效等失败模式,并强调治理的重要性。通过 claim 级引用、valid_from/valid_until 时间戳、lint 检查和人工审批等机制,可以缓解这些问题。核心原则是:生成内容不是事实,只有带来源、可核验、可审计的内容才逐渐接近事实。

Q&A

什么是 llm-wiki?它与传统 RAG 有何不同?

llm-wiki 是一种让 LLM 长期维护知识库的方法,它把资料提前整理成带引用、带链接、可审计的 Markdown 知识图谱。传统 RAG 是在用户提问时临时检索片段并拼凑答案,而 llm-wiki 在平时就持续编译知识,回答问题时先查已整理好的知识图谱,必要时再回原始资料核验,并将好答案回写,实现知识复利。

llm-wiki 的三层架构是什么?

llm-wiki 的三层架构包括:第一层 Raw Sources(原始事实层),保存原始资料如网页、PDF、代码等;第二层 Wiki 知识编译层,存放结构化的 Markdown 页面,如概念页、实体页、决策页等;第三层 Schema/Instructions(操作手册层),定义页面模板、引用规则、Lint 规则等,指导 agent 如何维护 wiki。

llm-wiki 的核心操作有哪些?

llm-wiki 的核心操作有三个:Ingest(导入)、Query(查询)和 Lint(维护)。Ingest 是将新资料保存为 raw source,并更新多个 wiki 页面,添加引用和链接;Query 是先查 wiki 知识图谱,必要时回原始资料核验,输出带引用的答案;Lint 是定期检查知识库健康,如断链、无引用、冲突、陈旧事实等,并修复问题。

2026 年有哪些 llm-wiki 相关的开源工具?

2026 年出现了多个相关工具:OpenWiki(LangChain)用于自动生成和维护代码库文档;OpenKB(VectifyAI)支持多格式文档编译成 Markdown 知识库;nashsu/llm_wiki 是一个可视化桌面应用;AutoSci(PKU DAIR)用于科研全流程;Google 的 OKF 是开放知识格式标准;qmd 是本地混合搜索引擎;AGENTS.md 是给 agent 的入场须知。

如何选择适合自己的 llm-wiki 工具?

选择工具取决于场景:若想给代码库自动生成并 CI 维护文档,选 OpenWiki;若有长 PDF 或多格式资料,选 OpenKB;若想要可视化桌面应用,选 nashsu/llm_wiki;若要做科研全流程,选 AutoSci;若想让多个工具互通,给页面加 OKF 的 type 字段;若只需本地混合搜索,用 qmd;若只需给 agent 入场须知,用 AGENTS.md。

llm-wiki 的推荐实现路线图是什么?

推荐路线图分阶段:Phase 0 定义目标对象;Phase 1 建立 Markdown canonical schema;Phase 2 建立可重建索引;Phase 3 开发 Ingest/Query/Lint CLI;Phase 4 实现 MCP resources(先只读);Phase 5 加入时间维度和来源追踪;Phase 6 建立评估和治理机制。

llm-wiki 有哪些失败模式?如何避免?

失败模式包括:幻觉固化、引用漂移、旧事实不失效、结构腐化、图抽取错误、写回污染、粒度失控。避免方法:对 claim 级引用、保留来源引用、使用 valid_from/valid_until、定期 lint、实体解析和图 diff、写回需审查、演化工作流。

🏷️

标签

➡️

继续阅读