小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
Self-healing GPU nodes in Kubernetes: What we learned building the EKS node monitoring agent

When you run Kubernetes at the scale we do on Amazon EKS, nodes break constantly. GPUs fall off the PCIe The post Self-healing GPU nodes in Kubernetes: What we learned building the EKS node...

Self-healing GPU nodes in Kubernetes: What we learned building the EKS node monitoring agent

The New Stack
The New Stack · 2026-07-19T13:00:00Z
在 Amazon EKS 上构建开源可观测性数据栈:VictoriaMetrics + Grafana Loki + Grafana Tempo

本文介绍了在Amazon EKS上构建开源可观测性数据栈的实践,使用VictoriaMetrics、Grafana Loki和Grafana Tempo处理指标、日志和链路数据。通过OpenTelemetry Operator实现微服务的零代码接入,并在Grafana中关联trace、log和metrics,提升故障排查效率。数据存储在Amazon S3和EBS gp3,整体架构清晰,运维负担较低。

在 Amazon EKS 上构建开源可观测性数据栈:VictoriaMetrics + Grafana Loki + Grafana Tempo

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-07-17T02:04:31Z
在 Amazon EKS 上构建安全的 AI Agent 沙箱

本文介绍了一种基于Amazon EKS的AI Agent沙箱方案,旨在实现多租户环境下的安全隔离和代码执行。通过使用Kata Containers和Cloud Hypervisor,提供独立的microVM,确保用户会话之间的完全隔离。该方案还包括预热池和自动扩缩容机制,以满足快速响应需求,适用于编程助手和合规环境。

在 Amazon EKS 上构建安全的 AI Agent 沙箱

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-07-15T01:27:22Z
AI Agent 存储选型:Curvine 如何在 EKS 上支撑万级Agent运行

本文介绍了Curvine如何在EKS上支持万级AI Agent的存储需求。随着AI基础设施向分布式模式转变,存储架构面临挑战。Curvine作为高性能分布式缓存文件系统,提供POSIX语义,支持快速动态存储供给,成功支撑10,000个独立Pod,展示了其在高密度有状态实例中的优势。

AI Agent 存储选型:Curvine 如何在 EKS 上支撑万级Agent运行

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-07-07T05:45:28Z
AI 时代的 EKS 升级范式:用 Kiro-cli 让 Agent 接管识别、升级与排障

本文探讨了如何通过Kiro-cli在AI时代实现EKS集群的自动化升级。以EKS 1.32升级到1.35为例,使用Kiro agent进行风险识别、升级执行和故障排查,显著提高效率。实验表明,加载Skill知识库后,升级时间从约6小时缩短至2.5小时,节省60%。Kiro agent能够自主执行任务,并在实践中发现新约束,更新知识库,展现出知识库的成长潜力。

AI 时代的 EKS 升级范式:用 Kiro-cli 让 Agent 接管识别、升级与排障

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-07-03T05:17:26Z
大规模运行Kubernetes:来自Amazon EKS的几个案例

亚马逊EKS通过自动化管理etcd生命周期和优化存储机制,提升了大规模Kubernetes集群控制平面的韧性和性能。新架构支持快速状态变化的工作负载,确保高可用性和数据一致性。此外,EKS推出了可预留的控制平面,以满足客户在高负载下的资源需求,确保稳定性和效率。

大规模运行Kubernetes:来自Amazon EKS的几个案例

The New Stack
The New Stack · 2026-06-30T13:00:00Z
EKS成本优化手册:通过Karpenter和资源调整将您的AWS账单降低60%

本手册介绍了一个七步计划,帮助企业将EKS费用从每月85,000美元降至34,000美元,优化基础设施而无需修改代码。主要步骤包括:调整资源请求、使用Karpenter进行智能节点管理、迁移到Graviton实例、添加VPC端点以消除数据传输费用、优化EBS卷和整合负载均衡器。这些措施可实现50-60%的成本节省。

EKS成本优化手册:通过Karpenter和资源调整将您的AWS账单降低60%

freeCodeCamp.org
freeCodeCamp.org · 2026-06-22T16:38:45Z
Zenjoy 基于 Amazon Bedrock 和 EKS 构建 AIOps Agent:打通 Prometheus、ES 与夜莺的智能化告警实战

Zenjoy基于Amazon Bedrock和EKS构建的AIOps Agent,通过数学算法与大语言模型结合,提升监控告警的准确性。该方案利用Z-Score和IQR等算法分析监控数据,减少误报和漏报,并通过夜莺平台实现告警统一管理,显著提高运维效率,适应微服务架构的复杂性。

Zenjoy 基于 Amazon Bedrock 和 EKS 构建 AIOps Agent:打通 Prometheus、ES 与夜莺的智能化告警实战

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-06-22T08:18:52Z
LiteLLM 生产级部署:基于 AWS ECS/EKS 的 AI Gateway 架构

本文介绍了如何在AWS上以生产级标准部署LiteLLM AI Gateway,涵盖ECS Fargate和EKS两种方案。LiteLLM提供统一的OpenAI兼容API,支持多模型管理、成本控制和安全合规。ECS Fargate适合运维团队,EKS适合需要精细控制的团队,均支持高可用性和弹性扩缩。

LiteLLM 生产级部署:基于 AWS ECS/EKS 的 AI Gateway 架构

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-06-15T09:56:40Z
Mountpoint S3 与 S3 Files 在 EKS 上的实战对比

本文对比了在EKS上使用Mountpoint S3和S3 Files访问S3数据的差异。Mountpoint S3是基于FUSE的轻量客户端,优化高吞吐量,但不支持完整POSIX语义;S3 Files通过NFS协议支持完整文件系统语义。针对AI场景,S3 Files在小文件访问和随机读方面表现优越,而Mountpoint S3在大文件顺序读上更具优势。

Mountpoint S3 与 S3 Files 在 EKS 上的实战对比

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-06-15T03:39:58Z
从 N 台 EC2 到 Amazon EKS + Amazon S3 Files:Waylens 的 OpenClaw 多智能体平台改造

Waylens 将其 OpenClaw 多智能体平台从多台 Amazon EC2 迁移至 Amazon EKS 和 S3 Files,提升了运维效率。改造后,Agent 自行处理升级和故障恢复,工程师仅在关键决策时介入。通过使用 CRD 和 Operator,Waylens 实现了统一管理和数据共享,显著减少了运维负担,提升了团队的工作效率。

从 N 台 EC2 到 Amazon EKS + Amazon S3 Files:Waylens 的 OpenClaw 多智能体平台改造

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-06-12T05:51:26Z
规划 Amazon EKS 从 1.32 升级到 1.35:关键变更识别与逐版本实施路径

本文讨论了如何将Amazon EKS从1.32升级到1.35,强调逐版本升级的重要性。升级时需评估自管理和托管组件的风险,识别关键变更,如cgroup v1弃用和containerd升级。建议制定详细的升级路径,确保每个阶段完成必要的准备和验证,以降低风险并确保系统稳定。

规划 Amazon EKS 从 1.32 升级到 1.35:关键变更识别与逐版本实施路径

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-06-10T10:15:39Z
如何在Amazon EKS上部署Spring Boot应用程序和MySQL

本教程介绍如何在Amazon EKS上部署Spring Boot应用程序和MySQL数据库,包括创建VPC、设置MySQL、部署EC2实例、创建SSH隧道、开发和Docker化Spring Boot应用、推送镜像到ECR、实现负载均衡及创建Kubernetes集群,最终实现高可用性和安全的生产环境。

如何在Amazon EKS上部署Spring Boot应用程序和MySQL

freeCodeCamp.org
freeCodeCamp.org · 2026-06-03T17:12:53Z
在 Amazon EKS 上使用 NVIDIA GPU Operator 管理自定义 GPU 驱动与 CUDA 工作负载

在Amazon EKS上,使用NVIDIA GPU Operator可以有效管理自定义GPU驱动和CUDA工作负载。EKS通过EC2节点支持GPU工作负载,GPU Operator简化了驱动的安装和管理,确保容器的稳定运行。选择EKS托管节点组可以降低运维负担。同时,结合Kiro和AWS MCP,平台团队能够通过自然语言进行集群巡检和问题排查,从而提升运维效率。

在 Amazon EKS 上使用 NVIDIA GPU Operator 管理自定义 GPU 驱动与 CUDA 工作负载

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-06-03T09:22:40Z
OpenClaw + Amazon Bedrock + Amazon EKS联动实践:打印机包装质检助手实战

本文介绍了如何利用OpenClaw、Amazon Bedrock和EKS Auto Mode构建打印机包装质检AI助手。通过AI Agent固化质检规则,提高质检效率和准确性,解决了人工目检的低效和标准化不足问题,显著提升了质检流程的自动化水平。

OpenClaw + Amazon Bedrock + Amazon EKS联动实践:打印机包装质检助手实战

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-05-26T05:29:02Z
ALS GeoAnalytics的LITHOLENS™如何通过Amazon EKS的机器学习革命性地改变岩心记录

ALS GeoAnalytics的LITHOLENS™平台利用机器学习和深度学习技术,自动化岩心记录,提高矿业地质分析效率。该系统通过Amazon EKS进行模型训练和推理,降低成本和温室气体排放。LITHOLENS™已在40多个项目中成功应用,提升矿物检测准确性,加快项目进度,推动矿业现代化。

ALS GeoAnalytics的LITHOLENS™如何通过Amazon EKS的机器学习革命性地改变岩心记录

AWS Architecture Blog
AWS Architecture Blog · 2026-05-19T15:09:36Z
德勤优化EKS环境配置,使用Amazon EKS和vCluster实现89%的测试环境加速

德勤通过使用Amazon EKS和vCluster,将环境配置时间从45分钟缩短至5分钟,提升了89%的效率,年节省约500小时。这一方案降低了基础设施成本,优化了资源管理,使QA团队能够独立快速创建测试环境,显著提高了开发效率。

德勤优化EKS环境配置,使用Amazon EKS和vCluster实现89%的测试环境加速

AWS Architecture Blog
AWS Architecture Blog · 2026-04-27T17:47:34Z
用 Kiro CLI 自动搭建 FluentBit 日志采集方案:两种 EKS 埋点数据落地 S3 Parquet 的实战对比

本文介绍了如何使用Kiro CLI和Amazon EKS MCP Server自动搭建FluentBit日志采集方案,并比较了两种将EKS埋点数据转存为S3 Parquet格式的方案。方案A需自编译镜像,适合追求简洁架构的用户;方案B通过Firehose和Glue实现转换,适合需要Schema管理的场景。Kiro CLI显著提升了搭建效率,简化了复杂操作。

用 Kiro CLI 自动搭建 FluentBit 日志采集方案:两种 EKS 埋点数据落地 S3 Parquet 的实战对比

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-04-24T09:54:20Z
从IDC到云上GPU:基于 Amazon EKS 的大模型推理混合云弹性部署实践

本文介绍了基于Amazon EKS和NVIDIA NIM的混合云大模型推理架构,强调本地GPU优先和云上弹性扩展的策略。通过KEDA和Karpenter实现自动扩缩容,优化成本和性能,满足中国客户需求。该方案解决了延迟、数据本地化和成本问题,提供统一监控和最佳实践,帮助企业有效利用现有GPU资源。

从IDC到云上GPU:基于 Amazon EKS 的大模型推理混合云弹性部署实践

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-04-24T06:02:50Z
增强Amazon EKS 节点自愈方案:基于 NPD 的故障持久化与安全修复探索

本文介绍了npd-node-replace组件的架构与实现,旨在自动化处理Kubernetes集群中的节点异常问题。该组件通过收集节点事件,提升集群的可用性与稳定性,支持多种节点形态,并提供可配置的容忍策略和通知机制,以便及时应对节点异常。

增强Amazon EKS 节点自愈方案:基于 NPD 的故障持久化与安全修复探索

亚马逊AWS官方博客
亚马逊AWS官方博客 · 2026-04-10T07:07:32Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码