内容提要
OpsBrain是一款面向家庭实验室的开源AI运维工具,基于Qwen3大模型实现“采集-推理-执行”闭环,每两分钟分析节点状态并执行白名单操作。其核心设计强调安全,包括默认试运行、白名单限制、操作上限及手动停止保护,确保AI仅作辅助而非决策者。支持集群联邦、实时仪表盘和每日报告,适合技术爱好者,但长期可靠性尚未充分验证。
延伸解读
安全设计:AI越能干,越要上锁
OpsBrain的核心设计哲学是“AI越能干,越要上锁”。它通过手动停止保护、默认试运行、白名单机制和操作上限四重安全措施,确保AI仅作为辅助而非决策者。手动停止保护是最高优先级规则,一旦用户手动停止某个容器,AI将永远无法操作它。这种设计反映了开发者对AI的不信任,强调在家庭服务器环境中“不出错”比“自动修复”更重要。
双轨机制:确定性规则与LLM推理互补
OpsBrain采用“确定性规则+LLM推理”的双轨机制。确定性规则如CPU持续5分钟超80%则重启容器、GPU显存超90%则杀进程、磁盘超85%则清理,这些是硬编码的,不经过AI。AI则负责处理规则覆盖不到的模糊地带,如异常组合或阈值内异常。这种架构比纯脚本灵活,比纯AI安全,适合家庭实验室的复杂场景。
适用场景与局限性
OpsBrain明确面向家庭实验室,适合懂技术、愿意折腾的用户。它假设用户已具备Python 3.10+、Docker、NVIDIA显卡和Ollama环境,且完整功能需在主机上运行,Docker Compose部署会失效。此外,长期可靠性尚未验证,作者也承认是“为满足个人需求而维护的项目”,用户需自行承担风险。
Q&A
OpsBrain是什么?它主要解决什么问题?
OpsBrain是一个面向家庭实验室(Homelab)的开源AI运维工具,基于Qwen3大模型实现“采集-推理-执行”的自动化闭环。它主要解决家庭服务器运维中容器崩溃、GPU显存溢出、磁盘空间不足等问题,通过自动分析和执行白名单操作来减少人工干预。
OpsBrain的工作流程是怎样的?
OpsBrain以2分钟为一个周期(可配置)运行:首先通过Collector从Netdata、Docker、nvidia-smi、TrueNAS等数据源采集系统和容器状态,生成collector.json;然后Reasoner将数据通过提示词模板发送给本地部署的Qwen3 14B模型,模型输出包含warnings、actions、summary、confidence的结构化JSON决策;最后Act执行引擎在通过安全检查后执行操作。此外,每2个周期进行集群联邦计算,每天23:55生成Markdown格式的每日报告。
OpsBrain有哪些安全机制?
OpsBrain的安全机制包括:1. 手动停止保护:用户手动停止的容器会被记录,AI永远不会尝试重启它;2. 默认试运行:dry_run默认为true,所有操作仅记录不执行;3. 白名单机制:只有白名单内的容器或服务才允许被操作;4. 操作上限:单次运行有重启次数上限,防止连锁反应。这些机制确保AI仅作为辅助,而非决策者。
OpsBrain如何结合确定性规则和AI推理?
OpsBrain采用“确定性规则 + LLM推理”的双轨机制。确定性规则是硬编码的,例如容器CPU持续5分钟超过80%则重启,GPU显存超过90%则强制结束进程,磁盘使用超过85%则执行docker system prune。AI推理负责处理规则覆盖不到的模糊地带,如从未见过的报错组合或多个指标同时异常。AI的建议必须通过三道安检才能执行。
OpsBrain支持多台服务器管理吗?
是的,OpsBrain支持集群联邦功能。它可以同时采集多个节点的状态(如Docker应用、TrueNAS存储、GPU实验),统一交给大模型推理。每2个周期计算集群稳定性评分、节点健康排名和跨节点异常关联,并提供实时仪表盘(端口9120)和每日报告。
OpsBrain适合哪些用户使用?
OpsBrain适合家庭实验室、个人服务器和技术爱好者。它假设用户已有Python 3.10+、Docker、NVIDIA显卡(nvidia-smi)和Ollama(已拉取qwen3:14b模型)。它不是一个开箱即用的产品,需要用户愿意折腾,且完整的GPU监控和修复功能需要在主机上直接运行,Docker Compose部署会部分失效。
OpsBrain的长期可靠性如何?
OpsBrain的长期可靠性尚未充分验证。开发者指出,模型每两分钟被唤醒一次,一年约26万次推理,但尚无对140亿参数模型进行26万次连续运维推理的压力测试。仪表盘中有“置信度恢复”和“GPU漂移衰减”监控曲线,但开发者未给出明确答案。文档最后注明“作者为满足个人需求而维护的项目”,意味着用户需自行承担风险。