内容提要
本文介绍如何结合Amazon Chronos2零样本时间序列预测与Amazon Bedrock AgentCore多智能体编排,构建端到端库存补货自动化系统。系统由监督、预处理、预测、报告四个LLM智能体协调确定性工具,将需求预测转化为可审计的采购订单。新SKU无需训练模型,仅上传CSV即可,推理成本降低98%,中位WAPE为12.3%。
延伸解读
零样本预测如何降低运营负担
传统时间序列方法需要为每个SKU单独训练模型,1万个SKU意味着1万个模型的训练、调参和维护,工程团队大量时间花在基础设施管理上。Chronos2作为时间序列基础模型,无需微调即可对新SKU进行零样本预测,仅需上传包含历史销售和未来协变量的CSV文件。这使新SKU上线时间从2-3周模型训练缩短到5分钟以内,且无需模型注册表或重训练计划,显著降低了运营复杂度。
多智能体架构的职责分离原则
系统采用四个LLM智能体(监督、预处理、预测、报告),每个智能体只负责特定推理任务,而确定性计算则封装为工具函数。这种分离确保LLM仅用于需要判断的环节,如解析模糊请求、选择协变量、解释预测异常;而数据加载、订单计算、约束检查等由纯Python函数执行。好处是每个智能体的上下文窗口只包含必要信息,避免因携带全部原始数据导致成本膨胀,同时保持推理质量。
成本优化:从常驻GPU到无服务器推理
Chronos2端点部署在SageMaker Serverless Inference上,相比常驻ml.g5.2xlarge实例每月约1091美元的成本,无服务器方案月成本约15美元,降低98%以上。代价是30-60秒的冷启动延迟,但对于夜间或每周运行的批量库存预测任务完全可以接受。AgentCore Runtime同样采用按需启动的微VM,无空闲成本。若需高频实时预测,则需评估调用量,约每月几千次调用是成本平衡点。
可审计性与故障处理设计
每个订单决策都通过AgentCore Observability自动记录完整追踪,包括智能体调用、工具执行、Chronos2返回结果及推荐理由,便于事后审计和问题排查。系统对故障采取分级策略:对S3读取和Chronos2调用实施重试与退避;协变量稀疏时降级处理并标记;图表生成失败不影响订单决策记录。约束违反时触发条件重试循环,最多3次后升级给用户,避免无限循环。
Q&A
这个库存补货自动化系统是怎么把需求预测变成采购订单的?
系统由四个LLM智能体(监督、预处理、预测、报告)协调确定性工具完成。监督智能体解析用户请求并规划流程,预处理智能体加载数据并选择协变量,预测智能体调用Chronos2生成概率预测并计算订单量、校验约束,报告智能体生成图表和决策记录。最终输出可审计的采购订单。
为什么选择Chronos2做库存预测,而不是传统时间序列模型?
传统方法(ARIMA、Holt-Winters)需要为每个SKU单独训练模型,运营负担随商品数量线性增长。Chronos2是零样本时间序列基础模型,无需针对新SKU训练,支持过去协变量和已知未来协变量(如促销、价格),还能做what-if情景分析。新SKU只需上传CSV,5分钟内即可完成接入。
多智能体架构相比单个大模型提示有什么好处?
单个LLM提示处理所有步骤会超出上下文窗口限制,无法单元测试,且任一步骤出错会导致整体失败。多智能体架构将判断交给LLM智能体,计算交给确定性工具,每个智能体只携带自己需要的上下文,保持每次运行的LLM成本可控,同时提高推理质量和可测试性。
系统如何决定哪些工作交给LLM智能体,哪些交给确定性工具?
判断标准是:如果固定输入后输出总是相同,就实现为确定性工具(@tool),由LLM调用;如果输出依赖解释或上下文,则由LLM智能体推理。例如加载文件、调用Chronos2、计算订单量、校验约束都是工具;解析用户请求、选择协变量、解释异常、生成建议理由则由智能体完成。
这个系统的成本相比传统方案降低了多少?
使用SageMaker Serverless Inference部署Chronos2,每月推理成本约15美元,而始终开启的ml.g5.2xlarge GPU端点每月约1091美元,成本降低98%。AgentCore Runtime也按需缩容到零,无空闲成本。适合夜间或每周批量预测任务。
系统如何处理预测和订单校验中的失败情况?
采用三种策略:对S3读取和Chronos2调用等工具进行带退避的重试(如冷启动重试3次,间隔30秒);如果协变量数据太稀疏,预处理智能体可降级处理并记录;图表生成等非关键路径失败不影响订单决策记录。约束校验失败时,监督智能体会调整约束并重新调用预测智能体,最多3次迭代后升级给用户。
AgentCore的Gateway和Policy在这个系统中起什么作用?
Gateway和Policy用于保护对外部系统的写入操作。系统中只有save_decision工具注册在Gateway上,因为它是订单成为持久化记录的关键写入点。Policy使用Cedar策略限制只有报告工作流的身份可以调用save_decision,并拒绝预算超过50000的高额订单,确保授权范围精确到写入边界。
新商品接入需要做哪些准备工作?
只需上传两个文件:一个包含历史销售和未来协变量的CSV,以及一个包含业务规则(安全库存、提前期、仓库容量、最小起订量等)的JSON配置。无需训练模型、修改代码或注册模型。系统会自动读取数据并运行预测流程。