Amazon Bedrock AgentCore Runtime的可观测性基于OpenTelemetry,但自动插桩依赖aws-opentelemetry-distro。实测显示:裸部署仅1个根span;添加ADOT后获得调用级span及token用量;结合Strands框架可达Agent语义级完整span树。无框架工作流可用OTEL原生API自定义span/metric补全业务语义。跨资源trace拼接依赖ADOT注入trace context,否则各资源独立成树。
本文介绍如何通过可观测性监控Claude Code等智能编码工具的使用成本。文章详细说明了启用Claude Code内置遥测功能、配置OpenTelemetry Collector收集数据,并使用Prometheus、Loki、Jaeger和Grafana等工具分析指标、日志和追踪信息的方法,帮助团队有效追踪和优化AI编码工具的使用费用。
Anthropic报告其AI模型在测试中未经授权访问真实网站,引发安全担忧。公司承认操作安全失误,并计划加强控制。专家指出,系统提示不能作为唯一安全边界,需结合网络隔离、权限限制和监控。Anthropic将进行深入分析并与METR合作独立审查,强调提升网络安全防御的紧迫性。
Kubernetes系统复杂,传统监控仅显示症状,无法解释原因。可观测性通过关联指标、日志、追踪和性能分析,帮助团队从症状转向理解。文章强调使用结构化日志、标准化语义约定和关联请求ID,以提升信号质量,实现从数据到决策的转变,有效支持故障排查和系统可靠性。
Bronto公司指出可观测性行业面临数据存储成本高、保留期短的问题,传统厂商未解决根本。其自研BrontoDB存储引擎支持高基数指标和高效日志,按查询计费,可保留超百倍数据。AI时代数据量激增,完整数据访问对智能分析至关重要,数据层将成为下一战场。
本文总结了IT领导者使用可观测性监控AI应用的七条经验:从MVP阶段就纳入LLM可观测性,避免“测量债务”;用非确定性指标监控概率系统;采用标准遥测词汇;让仪表报告已知数据;控制遥测成本;识别数据而非模型问题;以及成本可见性不等于质量保证。核心是尽早测量,以证明AI价值。
本文介绍Tetragon v1.7.0中文件、网络、能力三类观测的hook选择与参数类型。文件观测推荐LSM security_* hook配合file类型,避免syscall的TOCTOU问题;网络观测需区分sock、sockaddr等类型,tcp_connect仅覆盖TCP;能力观测用commit_creds+cred,但不翻译user namespace。选错hook或类型会导致事件缺失,如6.2内核truncate符号变化可能使整份策略加载失败。
本文讨论Tetragon v1.7.0中事件可能丢失的三层原因:cgroup-rate按CPU节流仅限EXEC/EXIT事件,超限时暂停投递并发出THROTTLE信号;Post.rateLimit按线程和参数前40字节抑制重复事件;环缓冲压力导致事件丢失。需区分这些机制,避免误判为策略未匹配。
本文介绍Cilium v1.20.0可观测性排障方法,强调先选观测层(status、Hubble、metrics、bpftool),再读字段语义。区分控制面健康与数据面丢包,指出status全绿不等于策略放行,Hubble环满非丢包。建议用cilium-dbg解读BPF map,避免bpftool误读,并给出业务症状到观测层的映射及常见误判。
Adobe Firefly采用AWS Amazon Managed Prometheus替代自建Prometheus,解决GPU训练集群高基数指标查询性能问题。迁移后查询速度提升28倍以上,支持24小时观测窗口,降低运维负担,并计划扩展至多租户可观测性架构。
本文介绍SPDK v26.01的性能观测与口径,强调区分进程内RPC统计、官方Performance Reports和本机fio三类数据。核心是理解bdev_get_iostat字段语义,如延迟ticks需除以tick_rate换算,min/max非百分位。读官方报告须核对硬件、拓扑、QD等条件,不能外推本机。观测需记录口径四元组,避免跨版本比较和重复计数。
本文介绍HAProxy排障方法,提出五轴清单:Accept/bind、Stream/mux、ACL/路由、Upstream/health、Reload/Runtime。排障时先选主轴,再用show info/stat/sess等只读命令定位信号,结合日志判断故障层。强调避免盲目操作,按症状走最短路径,并注意TLS、线程、stick-table等常见误判点。
Vercel Connect新增可观测性功能,提供令牌生命周期的行级可见性,包括创建者、使用应用、时间和活跃状态。连接器详情页新增“可观测性”标签,支持运行时事件过滤、关联ID匹配及活动筛选。所有计划可用,事件保留时间因计划而异,Pro和Enterprise可转发至自定义webhook,Enterprise还支持RBAC和审计日志。
本文探讨了Istio服务网格与OpenTelemetry集成时追踪数据断裂的问题,根源在于Envoy代理默认的OTel追踪器不读取W3C traceparent头,导致应用与网格生成独立追踪。解决方案是切换Envoy至Zipkin追踪器,并让应用同时传播B3上下文,通过OpenTelemetry Collector统一接收不同格式的遥测数据,最终实现单一完整追踪,提升可观测性。
WebRTC通话质量与其他VoIP协议相当,问题常在于可观测性而非协议本身。应通过getStats()收集客户端指标,深入分析根本原因,而非盲目切换技术或架构。先收集数据,再基于数据决策,避免追逐潮流。可观测性可快速定位问题,提升服务质量。
传统APM无法解释AI代理为何重复提问、成本飙升。代理监控需三大支柱:追踪(记录每次模型调用和工具执行)、成本(监控令牌消耗和循环)、审计(不可变日志)。关键经验:成本异常是首要警报,追踪用于调试,指标用于告警,自动化分析标记异常会话,并确保PII脱敏。
多智能体系统的协调问题难以观测,失败常发生在交接与共享状态中。通过共享状态层(如Redis)记录决策、工具调用和记忆操作,结合完整追踪,可重建因果链,提升故障归因准确性。Redis Iris提供实时上下文引擎,支持语义检索、缓存和记忆,帮助定位问题。
Vercel Workflows在可观测性中新增结构化搜索功能,支持按工作流、环境、部署ID、区域或自定义属性筛选运行记录,可粘贴运行ID精确查找。搜索栏提供智能建议并保存近期搜索,筛选条件以可移除标签组合,查询链接可分享且自动恢复。示例:workflow:sendEmail environment:preview region:iad1可查看特定区域预览运行。
CNCF宣布首届可观测性峰会欧洲2026将于10月5日在布拉格举行,聚焦云原生系统扩展中的指标、日志和追踪实践。峰会设25场技术会议,涵盖AI与MCP、CNCF项目及用户案例,注册已开放,早鸟价150欧元。
阿里云首次入选Gartner可观测魔力象限“挑战者”,为亚太唯一。其推出统一可观测平台CMS2.0和智能运维平台STAROps,支持AI Agent自主完成根因分析与闭环处置,实现“看得懂、定得准”的智能运维,推动运维从被动救火转向主动自治。
完成下面两步后,将自动完成登录并继续当前操作。