LitmusChaos作为CNCF孵化的开源混沌工程平台,在2026年上半年发布了6个版本,新增26位贡献者,社区增长显著。Flipkart基于其构建多租户混沌平台,赢得CNCF案例竞赛并在KubeCon印度发表主题演讲。Canonical成为新采用者,项目还举办三场线下活动,并推出Prometheus指标支持等新功能。
2026年KubeCon + CloudNativeCon印度大会在孟买举行,LitmusChaos获得重要认可。Flipkart在大会上展示了其在LitmusChaos上的应用,并赢得了CNCF用户案例比赛。大会期间,LitmusChaos吸引了众多访客,讨论了混沌工程和AI时代的可靠性测试等话题,增强了社区参与感,推动了项目发展。
Flipkart在KubeCon + CloudNativeCon India 2026中获奖,因其基于Kubernetes和LitmusChaos构建的混沌工程平台。该平台通过在高流量节日销售前进行90%的混沌实验,提升了微服务的可靠性,并向LitmusChaos项目贡献了五项核心改进。
本文介绍了如何通过三个AI Agent技能简化混沌工程的实施。AI Agent能够自动完成故障注入、日志采集和分析,降低了门槛,使非专家也能参与。用户通过描述测试意图,可以快速进行实验,提升系统韧性,推动专业能力的普惠化。
混沌工程是一种通过主动制造故障来发现系统弱点的方法。Netflix通过Chaos Monkey等工具推动了这一理念的发展。与传统测试不同,混沌工程强调在生产环境中进行受控实验,以验证系统在异常情况下的表现。其核心原则包括建立稳态假设、模拟真实事件和持续自动化实验。通过混沌实验,团队能够发现并修复潜在脆弱点,从而提高系统韧性和团队信心。
LitmusChaos社区在2025年第四季度持续增长,发布多个版本,提升用户体验和安全性。新MCP服务器使混沌工程更易访问。Hacktoberfest等社区活动促进了贡献者参与,展示开源合作的力量。
Jepsen报告指出,NATS JetStream在特定故障下可能会丢失已确认的数据,揭示了持久化承诺与实际情况之间的差距。默认的fsync策略每两分钟执行一次,导致数据在此期间仅存于内存中,增加了数据丢失的风险。开发者需谨慎配置,理解“已确认”与“已落盘”的区别,并引入混沌工程测试以识别系统脆弱性。
混沌工程通过模拟故障来增强机器学习管道的可靠性,测试数据管道、模型注册和特征存储的韧性,以确保系统在压力下的表现。使用Chaos Mesh和Python脚本识别潜在问题,提高AI系统的可观察性和容错能力。
机器学习系统常常静默失败,导致隐性损害。与传统系统不同,AI系统的错误不易被察觉,可能因数据过时或特征漂移而产生不准确结果。混沌工程可以测试AI系统的韧性,通过故障注入识别潜在问题,从而提升系统的可靠性和用户信任。
谷歌云专家服务团队发布了关于云分布式系统混沌工程的指南,强调故障模拟在构建弹性架构中的重要性。该框架基于五个原则,包括建立“稳定状态假设”、在生产环境中实验和自动化测试等。谷歌云推荐使用开源的Chaos Toolkit进行故障注入实验。混沌工程已被多家科技公司采用,Netflix和AWS等也开发了相关工具以提升系统韧性。
Christina Yakomin分享了Vanguard在SRE转型中的经历,强调了从传统性能测试到现代微服务架构和混沌工程的转变。Vanguard通过自助工具和教练团队的建立,提高了团队的可靠性和敏捷性,推动了持续交付和性能测试的自助化,最终实现了更高的业务价值和系统韧性。
混沌工程通过受控实验识别系统弱点,增强系统韧性。AWS结合生成式AI,简化实验设计与执行,降低技术门槛,提高效率,使更多团队能够利用混沌工程构建可靠系统。
本研究提出了一种混沌工程框架,旨在识别大型语言模型多智能体系统的脆弱性,提升其韧性,确保关键应用的可靠性。
文章讨论了混沌工程的实践,利用LocalStack的Chaos Dashboard测试无服务器应用的韧性。作者发现应用在故障时表现不佳,强调在生产环境前进行混沌测试的重要性。通过模拟错误,作者深入理解了应用的健壮性,并计划分享这一经验。
云原生社区于2025年4月1日至4日在伦敦举办KubeCon + CloudNativeCon欧洲大会,LitmusChaos展示了混沌工程的新进展,包括与云IAM系统的集成和CI/CD中的自动混沌注入。与会者讨论了混沌工程的基础知识和工具,促进了社区交流与合作。
随着微服务和Kubernetes的普及,混沌工程成为提升系统弹性的关键方法。通过模拟故障,团队能够识别和修复潜在弱点,从而增强应用的可靠性。本文讨论了在Java和Node.js应用中实施混沌工程的步骤,包括工具的安装、配置及在Kubernetes和Istio环境中的实验执行。
作者在LocalStack上构建了一个无服务器的表情包游戏,使用了API Gateway、Lambda、DynamoDB和S3等技术,并通过Terraform定义基础设施代码。尽管遇到挑战,最终获得了信心,享受了本地安全测试的过程。接下来计划进行混沌工程实验。
2025年QA领域涌现出幽默创新的角色,如回归之神、开发杀手和AI低语者,重塑软件测试并引领AI测试和混沌工程等新趋势。参与#QATypes2025活动,分享你的QA类型!
混沌工程是一种通过主动注入故障来提升分布式系统弹性和稳定性的方法。京东物流计划在2024年实施混沌实验,以分析核心业务线的风险,确保系统在故障情况下的应急能力。实验将在生产环境中谨慎进行,并持续自动化运行,以发现潜在问题,增强系统的韧性和可靠性。
混沌工程(CE)和灾难恢复测试(DiRT)是应对现代技术挑战的重要方法。DiRT通过故意引发故障来增强系统韧性,揭示潜在风险。新框架DiRMA评估DiRT在人员、流程和工具方面的成熟度,帮助组织克服文化阻力和度量问题,推动持续改进。
完成下面两步后,将自动完成登录并继续当前操作。