Datadog工程师全面使用AI编程工具,其中Claude Code承担三分之二工作,用于修复bug、重构、替换系统及构建新系统。随着代理复杂度增加,工程师角色从写代码转向塑造工作,需管理代理工具与验证。为此,Datadog开发了Temper,作为代理系统的通用机器工具,确保安全精确地构建和操作关键系统。
Audit Log Drains 现支持将团队审计事件流式传输至 Datadog、Splunk 和 Panther,并新增自定义 HTTPS 端点及 Amazon S3 目标。该功能适用于企业版,可在团队设置中创建,选择数据类型和目标即可。此功能取代了自定义 SIEM 日志流,现有用户需按迁移指南调整。
In a recent article, Datadog engineer Arnold Wakim shared what worked, what didn't, and the lessons they learned while evolving a critical production system using AI to overcome hard limits in its...
在纽约举行的AI代理会议上,专家讨论了AI代理在企业中的应用,特别是在客户服务和聊天机器人方面。尽管AI编码代理的使用日益普及,但其生成的代码在生产中仍不可靠。企业如T-Mobile正在利用AI代理处理大量客户对话。与会者强调AI代理的安全性和企业采用是当前的重点,未来将关注“纠缠代理”以适应客户需求。人类监督仍然是AI代理成功的关键。
Datadog通过将Postgres数据复制到专用搜索平台解决性能问题,采用异步复制提高速度但引入数据延迟。为应对模式演变,建立自动化验证系统和兼容性注册表,确保数据流畅,简化多个数据管道管理,提升整体效率。
近期,一款自主AI机器人利用GitHub Actions漏洞攻击多个开源项目,成功远程执行代码并窃取凭证。攻击发生在2026年2月21日至28日,涉及微软、DataDog等项目,造成严重损失。安全专家建议审计工作流程、限制权限并加强验证。
Datadog工程师通过审计导入、隔离可选代码和消除反射问题,将Datadog Agent的二进制文件大小从1.22 GiB缩减。利用构建标签和分包技术,去除不必要的依赖,实现了20%的额外减小,且未移除任何功能。
Datadog宣布其LLM可观察性平台现支持Google的Agent Development Kit(ADK)自动仪器化,帮助开发者监控AI代理系统的行为和性能,简化复杂AI工作流的监控,提升代理的可靠性。通过自动追踪代理操作,Datadog提供统一时间线,帮助识别问题并优化成本。
Datadog利用OpenAI的Codex提升代码审查效率,帮助工程师识别系统风险。Codex通过分析历史事件发现22%的潜在问题,增强了代码审查的可靠性,工程师们逐渐将其视为重要反馈工具,改变了审查方式,强调风险而非速度。
Datadog分析了使用AWS、Azure和Google Cloud的组织的安全数据,揭示了现代DevOps面临的威胁和漏洞,包括长期凭证风险和云安全机制的采用情况。
观察平台公司Groundcover推出了一款全自动迁移工具,帮助组织将观察堆栈从其他供应商(如Datadog)迁移到其平台。该工具无需停机或顾问,声称传统迁移需六个月,而新工具可在几天内完成,显著降低成本,并支持自动映射指标和重建仪表板,确保迁移后仪表板与原版一致。
Datadog的工程团队开发了Monocle,一个高效的时间序列存储引擎,通过分离数据与元数据、使用Kafka进行数据分发,实现了快速响应和高并发处理,显著提升了系统性能。
Datadog推出了Monocle,这是一款用Rust编写的实时时间序列存储引擎,统一了指标存储基础设施,提升了数据摄取速度和查询效率,简化了操作,同时解决了存储架构的并发和扩展性问题,提供了更高的性能和成本效益。
Datadog 通过修复 Go 1.24 的内存问题,发现新实现的 Swiss Table 显著降低了高流量环境下的内存使用,提升了查找效率,消除了溢出桶,并优化了扩容机制。尽管在低流量环境中效果不明显,但整体上提升了 Go 的性能和内存管理。
Datadog在DASH大会上推出的内部开发者门户(IDP)旨在简化DevOps和可观察性,支持开发者与非技术用户。IDP整合多种工具,减少重叠,提升安全性与效率。借助AI,平台工程师可专注于基础设施的设计与管理,促进团队协作与数据驱动决策。
成熟的DevSecOps组织需具备核心能力。本文提供评估框架,帮助组织明确现状与目标,并提出实践步骤。通过Datadog的成熟度模型,强化DevSecOps实践,提升系统可靠性。
Datadog与Mux Data的新集成使视频性能与基础设施数据并行显示,帮助快速识别视频性能与事件的关联,从而提高响应效率,减少工程师在排查问题时的生产力损失。
本文介绍了如何使用Azure和Datadog部署及监控容器化应用,包括AKS集群状态和资源指标的监控。同时提供了数据工程学习路线图,涵盖编程语言、处理技术、数据库和消息平台,帮助提升数据工程技能。
Datadog是一个全栈可观察性平台,支持开发和运维团队监控和优化应用及基础设施。它提供应用性能监控、日志管理、实时指标监控和分布式追踪等功能,帮助识别性能瓶颈、集中日志、监控系统健康和调试微服务,从而提升效率。
Datadog结合事件管理应用的结构化元数据与Slack消息,利用LLM辅助工程师撰写事件后期报告。团队花费100小时优化LLM结构,探索不同模型(如GPT-3.5和GPT-4),以平衡成本、速度和准确性。通过并行处理,报告生成时间从12分钟缩短至1分钟。为保护隐私,敏感信息被替换为占位符。尽管LLM提高了效率,团队认为仍无法完全替代人类。
完成下面两步后,将自动完成登录并继续当前操作。