内容提要
Lamarck 是一款基于真实调用遥测的 Agent 技能进化工具,通过后台观察每次调用,积累证据后提出修改,并验证回滚。它用四维判词评估,设证据门和用户批准机制,支持分级白名单和稳定态收敛,确保技能优化安全、可审计,避免过度干预。
延伸解读
信号来源的差异
传统优化依赖离线基准或人工构造的测试 prompt,信号来自专门设计的考场。lamarck 则直接利用生产环境中的真实调用和用户纠正作为 ground truth,信号更贴近实际使用。这种设计避免了测试集与真实分布不一致的问题,但也要求工具常驻运行,且需要积累足够的真实调用才能产生有效信号,冷启动期可能较长。
安全机制的多层防护
lamarck 通过证据门、用户批准、分级白名单、有界编辑和回滚机制来确保安全。证据门要求同一类缺口至少出现两次才触发提案,防止噪声干扰;用户三选一确保关键改动需人工确认;白名单分级控制编辑权限,默认 observe 模式只观察不修改;有界编辑限制单次改动范围,避免大范围重写;回滚机制则根据证据强度分级,强证据自动回滚,弱证据仅提案。这些机制共同降低了自动优化的风险。
收敛与稳定态设计
lamarck 通过状态机管理技能成熟度:active 状态全量评估,连续十次评估干净后转为 stable,此时仅做轻量扫描,每五次抽样全量评估以防漂移。用户纠正、基因哈希变化或新场景出现会唤醒回 active。这种设计在保证监控的同时减少不必要的计算开销,并将稳定状态作为可靠性凭证,同时识别长期零引用的条目作为修剪候选,实现用进废退。
局限性与适用边界
文章明确承认了若干限制:冷启动期无提案、观察性统计可能受任务漂移影响、模型判词存在误判可能、插件类技能无法获得基因哈希、遥测依赖 transcript 指针可能失效。此外,生产案例仍在积累中,结论尚未发布。这些限制提示用户,lamarck 更适合对安全要求较高且能接受渐进式优化的场景,部署前需评估自身对冷启动和潜在误判的容忍度。
Q&A
Lamarck 是什么工具?它如何改进 Agent 的技能?
Lamarck 是一款基于真实调用遥测的 Agent 技能进化工具。它通过后台观察每次真实调用,积累证据后提出修改,并验证回滚。它用四维判词评估,设证据门和用户批准机制,支持分级白名单和稳定态收敛,确保技能优化安全、可审计,避免过度干预。
Lamarck 如何收集信号?与传统的离线评测或人工测试有何不同?
Lamarck 的信号来自生产遥测,即真实的调用和用户的纠正。用户打断说“不是这个意思”就是 ground truth,比任何模型自评都硬。传统方法使用基准分数或人工测试 prompt,信号来自专门造出来的考场。Lamarck 装一次后所有已装 skill 都在观察下,不需要逐个挑、逐个写测试用例。
Lamarck 的评估机制是什么?它如何判断一个 skill 是否需要修改?
Lamarck 对每条待评条目进行四维判词评估:trigger_fit(触发是否正确)、gaps[](指令缺失)、outcome(干净/被纠正/失败)、friction(白走的弯路)。判词只许引用真实可见的执行痕迹,看不见就归档。评估结果逐行落进账本,有可复用的教训写进 learnings,被纠正和失败的蒸馏成回归用例。
Lamarck 如何防止过度修改或震荡?它有哪些安全机制?
Lamarck 有证据门和用户批准机制。证据门要求同一类缺口至少出现两次,场景围栏防止跨场景污染,反震荡防止覆写式打摆子,净增长预算限制行数增长。所有不可逆的一步都要用户点头,账本留在本地。还有分级白名单和稳定态收敛,确保优化安全、可审计。
Lamarck 如何验证修改?如果修改变差会怎样?
Lamarck 有三道验证:回放(用历史场景跑新旧版对比)、盲评(独立 subagent 对比新旧版和真实痕迹)、版本分窗(按基因哈希统计健康度)。回放和盲评是强证据,自动回滚;版本分窗是观察性统计,只出回滚提案,走用户三选一。回滚定义为恢复用户已批准的基线,不受三选一约束,但必须落账。
Lamarck 的成熟度状态是什么?它如何节省资源?
每个 skill 有两态:active 和 stable。默认 active,每条待评条目全量四维评估。连续十次评估干净后转 stable,之后每条只做一眼扫描,本回合没有纠正和异常就记 stable-skip 并加连击。但每第五条仍做全量评估,防止漂移。stable 状态和清白连击数作为生产可靠性凭证。
Lamarck 如何管理权限?用户如何控制哪些 skill 可以被修改?
Lamarck 有分级白名单,写在本地 config.json 中,不入库。三级:evolve(可施工)、suggest(只写建议)、observe(默认,只记账)。新装 skill 自动落 observe。插件、marketplace 和 synced 来的 skill 无论怎么配都不会被直接编辑,上限就是 suggest。
Lamarck 如何安装和使用?日常需要做什么?
安装用 npx lamarck-skill 一条命令,拷贝 skill、初始化配置、写钩子、自检。装完重启 Claude Code 或打开 /hooks。日常几乎不用管,想调节奏用 /lamarck mode every、manual 或 threshold N。头一周基本看不到动静,这是设计如此,钩子静静记账,攒够证据才触发评估。
Lamarck 有哪些局限性?
冷启动是真的,前期不会发生什么,要攒够真实调用才有信号。观察性统计混着任务漂移,版本分窗只敢出提案不敢自动回滚。判词由模型给出,虽然只许引用真实痕迹,但仍有误判可能,证据门和用户在环是两道闸。插件类 skill 拿不到基因哈希,版本分窗不生效。遥测存的是指针,transcript 清理后查不到原始上下文。生产案例还在积累中。
Lamarck 的未来规划是什么?它可能扩展到哪些领域?
路线图显示下一步不限于 skill:subagent 定义、CLAUDE.md 这类记忆文件、slash command、MCP 工具配置,凡是能反复在生产里被使用的、用来引导 agent 的文本产物,都可以套同一套遥测到账本到 rubric 到有门编辑的架构。真正被验证的是这套治理骨架,skill 只是第一个宿主。