Kubernetes的核心是声明期望状态,系统自动将实际状态向期望状态靠拢。文章用亚马逊仓库比喻解释各组件:apiserver是唯一入口,etcd是真相账本,controller-manager发现差距,scheduler分配位置,kubelet执行落地,kube-proxy和EndpointSlices负责流量路由。控制面管理集群,数据面处理业务流量,Ingress可绕过kube-proxy直连Pod。
本文介绍Tetragon v1.7.0中TracingPolicy的选择器与内核过滤机制。TracingPolicyNamespaced仅作用于特定命名空间的Pod,podSelector和containerSelector分层匹配工作负载,hostSelector仅支持null或空值。无OCI hook时依赖API server可能产生竞态窗口。policyfilter默认在裸二进制关闭、Helm开启,关闭时需过滤的策略会加载失败而非静默全匹配。
> 本文是写作规划,不是可发布正文。拆解对象:Rook + Ceph-CSI 在 Kubernetes 上的编排与挂载路径——以 Rook v1.20.4(2026-08;rook.io/docs/rook/v1.20/)与 Ceph-CSI v3.17.0 为主线,把一次 PVC 从 StorageClass / e…
该文章是一个关于Kubernetes存储编排的系列教程,重点介绍Rook与Ceph-CSI。内容涵盖CSI规范、Rook Operator、RBD/CephFS供给、快照克隆及升级闸门,共16篇。文章提供阅读路径和排障指南,帮助工程师理解PVC生命周期、故障定位及选型决策,强调在K8s环境中有效运维Rook-Ceph。
本文介绍Kubernetes CSI存储规范,核心是将存储插件分为Controller(集群级供给)和Node(节点级挂载)两类。K8s通过external-provisioner等sidecar组件将API对象转换为CSI RPC调用。文章详细梳理了PVC从创建到Pod挂载的完整调用链,强调PVC Bound不等于挂载成功,排障时需区分供给、挂载和I/O问题所在层级。
Kubernetes 1.34引入动态资源分配(DRA),通过CEL表达式让工作负载按需选择GPU(如内存、型号、MIG切片或NVLink连接),替代传统节点标签和硬编码,解决异构GPU集群中调度不均、资源浪费问题,简化运维并提升效率。
K8s集群因etcd故障无法操作,apiserver报504超时。etcd三节点中仅一个存活,另一节点WAL日志损坏导致重启失败。恢复方案:若其他两节点健康,移除坏节点并重新加入;若全部故障,用快照恢复。建议先备份数据,检查其他节点状态,再按场景操作。
本文介绍如何在K8s集群内搭建WireGuard VPN,使用wg-easy管理工具,通过NPS内网穿透实现远程访问集群网络。文章详细说明了部署配置、网络拓扑、踩坑记录(如INIT_ENABLED必须开启、禁用IPv6、配置sysctl)及客户端连接验证方法,最终实现像在内网一样直接访问Pod。
本文讨论了GPU在人工智能中的重要性,特别是对Kubernetes用户的影响,强调了GPU基础设施在AI模型训练和服务中的关键作用。
Kubernetes v1.36正式发布了ImageVolume特性,允许将OCI镜像直接作为Pod的Volume挂载,支持只读数据的挂载,如模型权重和配置文件。该特性经过Alpha和Beta阶段后,现已无需手动开启Feature Gate,containerd也原生支持。这一特性的引入推动了OCI标准的演进。
KubeClipper 1.6.0 发布,支持 Kubernetes 1.36,升级 Containerd 至 2.x,Calico 更新至 v3.31.5。kcctl 命令行工具进行了优化,新增集群管理命令,提升了稳定性并修复了多个问题。用户可以通过简单命令快速部署 K8s 集群,实现多集群管理。
燧原科技在深圳的HAMi社区Meetup上介绍了国产GPU在Kubernetes生态中的云原生集成方案,涵盖GPU Operator的全生命周期管理、资源调度、设备注入及推理优化。该方案通过标准化的CDI和DRA,提升国产GPU的管理效率与兼容性,解决设备不可见和资源管理复杂等问题,强调与HAMi的协作,推动异构算力的统一调度与优化,提升GPU利用率。
我在一家游戏公司负责女性向AVG游戏的后端开发,管理服务器资源,参与多个项目。我的技术栈主要是Go和Kotlin,团队已熟练运用K8S。我希望持续学习,寻找新机会,期待挑战与成长。
本文介绍了如何将 Hermes Agent 迁移到 K3s 环境,使用 StatefulSet 管理持久化工作负载。首先需准备 K3s 集群和 containerd,初始化持久化数据目录,并部署 Gateway 和 Dashboard 服务,最后提供交互式 CLI 聊天的运行方法。
本周刊聚焦运维、Go语言和Vue技术生态,推荐多个优秀项目,包括K8S多集群管理工具、实验性Homebrew替代方案、轻量级动态网络管理工具和开源语音输入产品,涵盖个人理财、PDF处理和Jenkins插件等应用,旨在提升开发者和用户的工作效率。
本文探讨了事件作为可观测性的重要支柱,强调其与日志的本质差异。事件是系统状态转移的关键数据,有助于快速定位事故根因。文章介绍了变更事件、基础设施事件和业务事件的分类,以及如何通过CloudEvents标准化事件模型。同时,讨论了Kubernetes事件API和事件流平台(如Argo Events、Keptn)的应用,强调事件在事故响应中的重要性,并提出“变更即根因”的方法论,以提高故障排查效率。
Kite-Desktop 是一款基于 Wails v3 的桌面 Kubernetes 多集群管理工具,旨在提升运维人员的管理体验。它支持快速切换集群、资源管理、实时监控和 AI 交互等功能,现已发布多个版本,适用于 Mac 和 Windows 平台,欢迎用户下载试用并反馈。
数字主权的讨论正在从基础设施转向数据库层面。地缘政治压力促使企业重新评估对云服务的依赖,越来越多的企业将PostgreSQL视为可移植的云中立基础。Gabriele Bartolini指出,真正的主权始于数据库,确保跨环境的一致性有助于标准化部署和合规管理。通过Operator Pattern,数据库管理超越简单容器化,支持现代微服务架构,提升性能和控制力。
以色列工程师Nir Barak利用AI在一天内将JavaScript编写的JSONata重写为Go版本,节省每年50万美元的服务器成本,并实现1000倍的性能提升,展示了AI驱动重构的潜力。
2026年3月底,ingress-nginx将退役,k8s社区推荐迁移至云原生AI网关higress。higress支持k8s ingress和API控制台两种模式,兼容大多数ingress-nginx注解。迁移时需调整配置并验证连通性,且具备AI推理服务能力,满足AI时代需求。
完成下面两步后,将自动完成登录并继续当前操作。