小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
推理服务的缓存与调度:前缀、多级存储、集群路由

本文讨论长上下文推理服务的缓存与调度优化。核心原则是缓存未命中比命中贵几个数量级,因此设计围绕复用展开:单实例内通过块哈希实现前缀缓存;KV池采用write-back策略在GPU、DRAM、SSD间分层存储;集群层面用一致性哈希实现缓存亲和,并按请求类别分配预算以应对长请求突发。

推理服务的缓存与调度:前缀、多级存储、集群路由

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T23:30:00Z
企业级 EKS 集群生产环境配置最佳实践

本文介绍企业级EKS集群生产环境配置最佳实践,涵盖私有cluster endpoint、VPC Endpoints、Pod Identity替代IRSA、双EBS+LVM隔离容器运行时及四种CSI Driver接入。通过开源Terraform模块,一次apply约30分钟建成集群,并配9项健康检查验收,解决安全合规、节点稳定性、存储多样、弹性扩缩容和部署效率五大问题。

企业级 EKS 集群生产环境配置最佳实践

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-09-01T03:07:23Z

Kubernetes 1.37 推出 Pod Certificates 和 Cluster Trust Bundles,内置 X.509 证书签发,用于 TLS/mTLS,解决服务账户 JWT 的 bearer token 安全问题。该机制通过非对称签名实现持有证明,架构灵活,支持多种证书类型,但需安装第三方签名器(如 Tinycert)试用。

Kubernetes v1.37:Pod 证书与集群信任捆绑包

Kubernetes Blog Kubernetes Blog · 2026-08-28T18:30:00Z

本文总结kube-apiserver排障系列终章,提出机制排除树,按症状(401/403、webhook 503、APF 429、etcd延迟、Watch错误等)定位至Auth、Admission、APF、Storage或Watch轴。回收etcd系列停损线,明确Kine SQL后端Watch语义差异及events分集群边界。列出三个开放问题(watch cache SLO、线性读一致性、Lease fencing),强调以实测关闭,并给出ADR友好收束建议。

【kube-apiserver】选型收束与开放问题:排除树、Kine 与 events 分集群

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-28T00:00:00Z
单芯片到万卡集群体系化突破 中诚华隆HL200推理芯片及超节点集群重磅发布

中诚华隆发布HL200推理芯片及超节点智算集群,实现国产AI推理算力从单点突破到万卡级集群协同升级。芯片支持FP4/FP8低精度,能效比领先,适配主流大模型。集群方案覆盖8卡至万卡部署,优化算力密度与能效,推动大模型规模化商业落地,并与多家企业合作共建国产算力生态。

单芯片到万卡集群体系化突破 中诚华隆HL200推理芯片及超节点集群重磅发布

量子位 量子位 · 2026-08-24T07:04:36Z
DB-Scheduler vs Quartz:一张表干掉11张表的Java调度神器

DB-Scheduler是一款基于数据库的Java任务调度库,仅需一张表即可实现集群部署和任务持久化,吞吐量可达每秒2000至10000次。它采用乐观锁和心跳机制管理任务,但存在长任务重复执行、不支持毫秒级精度、缺乏监控等局限。相比Quartz的11张表,它更简洁高效,适合简单场景,但复杂需求下可能成为瓶颈。

DB-Scheduler vs Quartz:一张表干掉11张表的Java调度神器

极道 极道 · 2026-08-24T00:10:00Z

本文介绍Linkerd 2.20中Gateway API与多集群机制。2.20支持GAPI 1.2.1至1.5.1,推荐安装1.2.1,因Linkerd仅理解该版本字段,未知字段会被忽略。mesh内路由由Linkerd处理,南北向入口归Envoy Gateway。多集群需共享信任根,否则握手失败。未钉入2.20版本的能力不写入正文,排障需检查GAPI版本与资源字段。

【Linkerd】Gateway API 与多集群:GAPI 1.5.1 门与边界

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-23T00:00:00Z
AWS已弃用此EKS认证方法,但81%的集群仍在使用。

Kubernetes虽提升敏捷性,但并非自带安全,其动态复杂性常造成安全假象。企业普遍面临访问控制、容器镜像、集群配置、密钥管理及多租户等挑战,尤其在容器和集群层。Nutanix Kubernetes Platform(NKP)通过集中管理、默认安全策略、CIS加固、Gatekeeper准入控制及Istio加密,实现全栈防护,以应对AI时代的安全风险。

AWS已弃用此EKS认证方法,但81%的集群仍在使用。

The New Stack The New Stack · 2026-08-19T18:59:54Z

ClusterMesh 提供跨集群 Pod 连通、身份感知策略及服务发现,但非强一致或高可用保证。其依赖相同配置、无冲突 CIDR 及同步状态,存在身份容量限制与同步滞后风险。运维需关注集群 ID 固定、地址规划及同步状态,避免误将网络连通视为应用 HA。

【Cilium / eBPF】ClusterMesh:多集群身份、服务发现与明确不保证

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-16T00:00:00Z
Kiro 自组织多智能体集群的扩展模式

该文介绍了一种自组织多智能体集群模式,通过共享S3存储和日志协调,无需中央监督器。它适用于任务可分解为独立贡献的场景,如代码审查或头脑风暴。文中讨论了三种协调算法(环形、网格、群集)及其权衡,并指出集群可能出现的失败模式(如群体思维、漂移)。最后提供了开源参考实现kiro-flock的部署指南。

Kiro 自组织多智能体集群的扩展模式

AWS Architecture Blog AWS Architecture Blog · 2026-08-11T21:17:02Z
为什么你的KubeVirt虚拟机无法在集群间迁移——以及EVPN如何解决这一问题

本文介绍如何利用OpenPERouter和EVPN/VXLAN,在Kubernetes集群间实现KubeVirt虚拟机跨集群实时迁移。通过创建L2VNI自定义资源,搭建跨站点的二层网络和专用迁移网络,解决IP/MAC保持和流量隔离问题。平台团队可通过声明式配置管理网络,无需依赖物理网络变更,实现虚拟机无缝迁移。

为什么你的KubeVirt虚拟机无法在集群间迁移——以及EVPN如何解决这一问题

The New Stack The New Stack · 2026-08-08T14:00:00Z
集群MQTT血泪史:最蠢的就是不管状态场景,统一用一种一致性算法

该文探讨分布式系统中的状态管理,主张按语义分类状态而非追求统一一致性。通过集群MQTT内存爆炸案例,提出五类状态(连接所有权、离线状态、路由、持久消息、成员关系),每类对应不同保障和机制(如共识、哈希、AP路由、同步存储、Gossip)。核心原则是“语义定保障,保障定机制”,避免过度复制,实现资源高效。

集群MQTT血泪史:最蠢的就是不管状态场景,统一用一种一致性算法

极道 极道 · 2026-08-06T22:04:00Z

K8s集群因etcd故障无法操作,apiserver报504超时。etcd三节点中仅一个存活,另一节点WAL日志损坏导致重启失败。恢复方案:若其他两节点健康,移除坏节点并重新加入;若全部故障,用快照恢复。建议先备份数据,检查其他节点状态,再按场景操作。

K8s etcd 集群崩溃异常恢复

安志合的学习博客 安志合的学习博客 · 2026-08-05T10:25:28Z
在 K8s 里搭建 WireGuard VPN 并访问集群网络

本文介绍如何在K8s集群内搭建WireGuard VPN,使用wg-easy管理工具,通过NPS内网穿透实现远程访问集群网络。文章详细说明了部署配置、网络拓扑、踩坑记录(如INIT_ENABLED必须开启、禁用IPv6、配置sysctl)及客户端连接验证方法,最终实现像在内网一样直接访问Pod。

在 K8s 里搭建 WireGuard VPN 并访问集群网络

bboysoul的博客 bboysoul的博客 · 2026-08-04T16:12:00Z
亿级日活App的“算力生死劫”:推理成本倒挂,他们靠跨云架构砍掉75% GPU集群

出海AI应用面临算力贵、流量费高、延迟导致GPU空转的“三重算力锁链”,用户增长反而加剧亏损。某AI穿搭应用转向Akamai推理云,采用RTX PRO 6000和FP4量化,生成速度提升4倍,成本大降,流量费仅为传统云二十分之一,并通过混合多云架构和边缘节点解决延迟,实现扭亏为盈。

亿级日活App的“算力生死劫”:推理成本倒挂,他们靠跨云架构砍掉75% GPU集群

量子位 量子位 · 2026-08-04T01:27:41Z
Kubernetes升级不必再担心出问题:EKS如何让集群生命周期管理更简单、更安全

AWS EKS推出Kubernetes控制平面版本回滚功能,允许升级后7天内通过API恢复至旧版本,无需额外成本。此前升级不可逆,导致团队延迟升级。EKS还提供升级洞察、回滚就绪检查和MCP服务器,简化升级流程,降低风险,使升级成为常规运维任务。

Kubernetes升级不必再担心出问题:EKS如何让集群生命周期管理更简单、更安全

The New Stack The New Stack · 2026-08-01T15:00:00Z

本文介绍如何在三个GKE集群上部署Linkerd多集群扩展,实现联邦、扁平镜像和网关镜像三种模式共存。通过共享信任锚、全网格链接和标签配置,联邦服务自动故障转移,扁平镜像支持客户端选择特定集群,网关镜像适用于无扁平网络场景。混沌测试验证了集群故障时联邦服务自动重新平衡,而镜像服务需客户端处理。文章提供完整脚本和操作指南。

联邦集群实现Kubernetes零停机

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-07-27T11:00:00Z
构建 AI 驱动的 EKS 集群健康诊断 SaaS 平台 – 从静态规则到 MCP Agent 自主分析

本文介绍了一个面向Amazon EKS用户的AI驱动集群健康诊断SaaS平台,采用“确定性规则+AI关联分析+MCP Agent自主诊断”三层架构,实现从静态规则检查到AI Agent按需实时采集集群数据的智能化运维诊断,帮助用户快速定位集群配置风险并获得可执行的修复建议。

构建 AI 驱动的 EKS 集群健康诊断 SaaS 平台 – 从静态规则到 MCP Agent 自主分析

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-07-24T09:29:10Z
Kubernetes上的多集群数据库:架构与部署

本文介绍如何在Kubernetes上构建多集群MongoDB部署,以应对区域性故障。通过Percona Operator实现主站点和副本站点架构,利用MCS API连接集群,并采用2+2+1投票模式确保故障时能自动选举新主节点。该方案支持灾难恢复、实时迁移和无停机维护,故障切换通常在12秒内完成。

Kubernetes上的多集群数据库:架构与部署

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-07-22T11:42:00Z

本文介绍了在华为昇腾910B NPU服务器上配置AI训练环境的完整流程,涵盖磁盘RAID0组建与挂载、NPU驱动安装、TLS关闭、网络健康检查、ascend-docker-runtime及Containerd部署、K8s集群加入与设备插件安装,以及CPU锁频、THP调优、网卡队列和时钟源等性能优化措施。

如何添加 Huawei NPU 节点到 Kubernetes 集群

陈少文的博客 陈少文的博客 · 2026-07-22T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码