内容提要
京东海博团队构建AI Native三层知识库,解决AI理解复杂系统、影响面分析依赖人工、测试预期难查询等问题。知识库包括底层项目×领域知识矩阵、中层角色化知识、上层Skill能力,并采用OKF规范将知识编译前移。通过Harness引擎实现知识消费与沉淀闭环。AB实验表明,带知识库方案提速约44%,覆盖更全面,测试用例采纳率达90%~100%。
延伸解读
知识库建设的关键:从检索优化转向知识生产
文章指出,当前AI应用瓶颈不在检索精度,而在知识源头。向量RAG、GraphRAG、Agentic Search等范式侧重运行时检索,但海博团队发现真正卡点是知识不成体系、无法结构化供给。因此他们将知识编译前移到维护期,采用OKF规范,在知识入库时就消化、重写、组织成互链Markdown树,运行时只需导航和摘录。这一思路对面临类似问题的团队有参考价值:与其不断优化检索算法,不如先解决知识的生产和治理问题。
三层知识架构如何支撑AI Native研发
海博团队设计了三层知识结构:底层是项目×领域知识矩阵,由代码仓库和链路梳理自动生成,提供客观事实;中层是角色化知识层,从同一底层派生测试、产品、运营等视角;上层是Skill能力层,将高频动作封装成可调用的技能。这种自底向上的结构确保知识不重复、可复用,且能随代码更新。对于希望构建AI知识库的团队,这种分层设计值得借鉴,尤其是底层矩阵的自动生成和反向索引(views)对影响面分析至关重要。
AB实验揭示知识库的实际收益与局限
文章通过AB实验对比了带知识库和仅用代码的方案:带知识库的方案需求分析耗时减少约44%,且能发现跨仓消费端缺自动重试、上线配置白名单门禁会静默失败等隐藏阻塞点。测试用例采纳率达90%~100%。但需注意,实验基于特定需求(跨仓消费链路+配置门禁较多),结论可能不适用于所有场景。此外,知识库的维护依赖人工确认和生命周期治理,并非一劳永逸。读者应关注其闭环机制:消费知识的同时也沉淀知识,确保知识库持续保鲜。
测试用例资产化:精准回归与知识反哺
海博团队将测试用例挂靠在领域知识上,使其成为可复用、可演进的资产。通过用例锚点与代码diff反查,实现精准测试推荐:直接命中、接口命中、数据面命中、链路扩散四级推导,给出必跑/应跑/建议跑的分级。在4个业务组落地中,AI生成用例采纳率90%~100%,测试人员从写用例转向审校补全。这一实践表明,测试用例不仅是验证手段,更是知识沉淀的载体,其效果取决于知识库对全链路业务的理解和保鲜程度。
Q&A
海博团队为什么要建设AI知识库?
因为大模型接入研发流程后,暴露出三个痛点:AI读不懂复杂系统,在百万行代码中乱搜,给出与架构不兼容的实现;影响面分析依赖少数资深员工,成为瓶颈和风险;测试预期散落在PRD、聊天记录和个人记忆中,无处可查。历史业务知识不成体系,人和AI每次都在从零重建理解。
海博AI知识库的三层架构分别是什么?
底层是项目知识×领域知识矩阵,由代码仓库和链路梳理构成,横向为单个代码仓的知识目录,纵向为跨项目的领域链路;中层是角色化知识层,从底层矩阵派生,面向测试、产品、运营等不同角色组织视图;上层是Skill能力层,将高频动作封装成Skill,让AI直接调用懂项目的动作。
OKF规范在知识库中起什么作用?
OKF是一套面向AI Agent的知识包装规范,包含三点:一个概念一个Markdown文件,用标题、表格、代码块提供语义锚点;YAML头部元数据,type为唯一必填项,AI无需通读全文即可识别文档用途;系统级保留文件,index.md作为全局目录支持渐进式披露,log.md记录变更。它支持宽容消费,字段不全或链接失效也不报错,可自动降级为普通文档。
Harness知识引擎如何实现知识的消费与沉淀闭环?
消费侧通过/okf-knowledge-read按需注入,6步Pipeline逐层收敛,从识别意图到分组注入精准上下文;沉淀侧在需求完成后,将master代码和harness过程产物通过/distill-catalog蒸馏进知识库,经人工确认后合并到master知识库分支。知识在“被用”的同时“被喂养”,形成双向闭环。
AB实验如何证明带知识库的方案更优?
AB实验用相同提示词、同一需求、同一代码仓并行设计研发方案。A组用知识库,B组仅用代码。结果A组需求分析耗时542秒,B组967秒,A组提速约44%;A组上下文来源为8篇结构化知识加3个源码文件,可溯源性更强;A组还发现了两个隐藏阻塞点:跨仓消费端缺自动重试、上线配置白名单门禁会静默失败。
测试用例如何成为可复用的知识资产?
用例挂在领域知识上,归属到具体业务域或子流程,可复用、可演进、可反哺。正向通过/prd-diff-testcase从PRD和知识库生成用例,反向通过/harvest-cases将历史用例去重归档回库。自动化等于用例原子加chains编排加变量贯穿。用例挂业务锚点后,通过git diff可反查受影响的用例,实现精准测试推荐。
知识库如何防止知识过期?
通过生命周期四步治理:建档时扫代码、配置、文档生成基线,每条知识绑定负责人和京ME通道;蒸馏反哺在需求完成后将master代码和harness过程产物蒸馏回库;冲突确认时蒸馏结果先人工确认,冲突由负责人拍板后合并;过期治理定期基于知识置信度进行有效续期、部分失效降级、完全失效归档。