Laya 是开源非自回归决策模型,直接返回结构化类型与值,省去文本生成和解析。文章介绍在 Apple Silicon Mac 本地运行 Laya,用 FastAPI 封装并打包为自定义容器,部署到 Amazon SageMaker AI 实时端点。实测模型加载约 28 秒,三次调用均成功,平均约 426 毫秒。作者认为 SageMaker AI 便于运维、监控和权限控制,但上线前需做业务评估、概率校准和压测。
完成下面两步后,将自动完成登录并继续当前操作。