Cloudflare实习生Aashi Patel开发了Cache Transcoding系统,利用Zstandard压缩算法在Pingora中编码缓存资产,将可压缩文本平均缩小至原大小的三分之一。该系统以少量CPU开销换取存储和带宽节省,测试中处理了超百万请求,验证了架构可行性,未来将优化压缩级别和参数。
Zerobus Ingest是Databricks推出的无服务器流式数据接收服务,支持每秒12GB的吞吐量。它通过推送API直接将数据写入Delta表,简化了传统Kafka架构的复杂性。Zerobus的动态分区设计和零拷贝解析器Zeroparser提升了性能,支持高吞吐量和低延迟的数据传输。该服务已在NASA的NEOWISE数据集上进行基准测试,展示了其强大的数据处理能力。
pb-mapper 是一款基于 Rust 开发的 TCP/UDP 公网穿透工具,支持多个本地服务共用一个公网端口。它通过 service key 注册和订阅,简化服务管理。用户可通过 CLI 或 Flutter UI 部署,支持 AI Agent 一键部署,性能和资源消耗优于传统方案,已在多个真实场景中稳定运行。
Uber has decentralized its Hive data warehouse, migrating 16,000 datasets totaling over 10 petabytes using pointer-based federation. The migration ensures zero downtime, strict ACL enforcement,...
Chronosphere通过将时间序列数据从ext4迁移到Btrfs文件系统,节省了74%的存储成本。Btrfs提供透明压缩和高效的数据管理,尽管在迁移过程中面临备份成本增加和IO风暴等挑战,但最终证明是大规模企业部署的可靠选择。
Reddit成功将超过500个Kafka代理和超过1PB的数据从EC2迁移到Kubernetes,整个过程无停机。迁移分为多个阶段,包括引入DNS中介、增加新代理、混合集群运行、逐步转移数据和控制平面迁移。通过小步、可逆的方式,Reddit确保了系统稳定性,避免了数据丢失和服务中断。
Arctic Wolf 每天处理超过一万亿事件,重构数据架构后,查询速度提升至秒级,数据新鲜度从小时降至分钟,支持实时威胁检测与响应,显著降低查询时间和成本。
自动驾驶面临边缘案例挑战,这些罕见场景常被忽视。Kyra Mozley介绍了Perception 2.0,通过基础模型和嵌入技术提升视频数据理解,简化数据标注,增强模型灵活性和准确性。新方法支持自然语言搜索和分类,快速识别复杂场景,提高安全性和可靠性。
在2025年QCon旧金山会议上,Stripe工程师Jimmy Morzaria介绍了其零停机数据迁移平台,支持每秒500万查询,可靠性达到99.9995%。该平台通过六个阶段实现数据迁移,确保数据一致性和最小性能影响,支持从小数据集到数十TB的分片。迁移过程包括注册、数据导入、异步复制和流量切换,确保金融数据的安全性和完整性。Stripe选择内部构建该平台以满足安全和性能需求。
在FrOSCon 2025大会上,VictoriaMetrics的Aliaksandr Valialkin探讨了如何通过专用日志数据库处理PB级日志,显著提升查询性能。他介绍了列式存储、时间分区、日志流索引和布隆过滤器等技术,使查询时间从70小时缩短至10秒,指出传统数据库在大规模日志处理中的局限性。
Airbnb的Mussel是一个高效管理派生数据的关键值存储系统,采用分区管理、无领导复制和统一存储引擎,解决了可扩展性和低延迟问题,支持实时和批量数据,确保高可用性和快速访问,成为数据基础设施的核心。
本研究解决了现有对抗攻击方法在图像分割任务中应用不足的问题。提出了一种新颖的通用对抗攻击方法,利用双特征分离和低频散射模块,从像素和频率空间指导对抗样本的训练。实验结果表明,该方法在攻击成功率和不同模型间的可迁移性上优于现有技术。
自2019年起,知乎采用TiDB分布式数据库,结合Kubernetes和TiDB Operator,实现高效的集群管理。通过自动化部署、数据迁移和监控,支持业务快速发展。TiDB生态架构涵盖数据迁移、监控和备份等功能,确保高可用性和稳定性。自研的天穹平台提升了研发和DBA团队的管理效率,满足多样化需求。
光谷马拉松将于2024年11月17日在华中科技大学举行。作者分享了训练和赛前准备,尽管天气恶劣,最终以3:30:51的成绩PB近5分钟。强调跑量和力量的重要性,认为持续跑步是关键。
Uber的实时数据基础设施是其业务核心,每天处理大量数据。系统由消息平台、流处理和OLAP组成,确保数据快速分析。关键要求包括一致性、可用性、数据新鲜度、可扩展性和成本效率。Uber使用定制的开源技术如Kafka、Flink和Pinot,支持动态定价、UberEats管理和实时预测等功能。
本文由知乎数据库负责人代晓磊撰写,介绍了知乎如何使用 TiDB 进行数据库在线迁移。文章详细描述了三种迁移方案:跨云跨 Kubernetes 集群的副本投放迁移、TiCDC 链接的主备集群迁移,以及其他特殊场景的迁移建议。通过这些方案,知乎成功将多个 TiDB 集群迁移至新机房,确保数据安全稳定,并分享了迁移过程中的准备条件和具体操作步骤。
去年我们推出了Insights功能,提供数据库查询性能的统计信息。通过dogfooding实验,扩展到数百TB的数据和每天数十亿条记录。现在是重新审视该功能和介绍Timescale功能和架构选择的好时机。可以在Timescale Cloud上运行PostgreSQL数据库。
Netflix开发了名为EVCache的缓存预热系统,以减少流媒体应用的延迟。EVCache支持多种用例,如查找缓存、临时数据存储、主存储和高容量数据。Netflix将EVCache用作一级缓存,它存储了PB级的数据。为了改进缓存预热过程,Netflix创建了一个缓存预热工具,具有副本预热和实例预热功能。缓存预热系统由控制器、转储器和填充器三个主要组件组成。实例预热器可以快速填充替换或重新启动的节点的数据。缓存预热工具在扩展和高效处理节假日流量方面取得了成功。
Shopify通过赋予小企业主权力,彻底改变了电子商务。他们的MySQL数据库以PB级规模存在,维持零停机时间面临挑战。Shopify使用分片平衡来分发流量,提高基础设施的生产力。他们采用数据驱动的方法进行分片再平衡,分析历史利用率和流量数据。Shopify还通过使用唯一标识符将相关请求路由到同一服务器来确保读一致性。他们通过利用Google Cloud Platform的快照功能来管理数据库备份和恢复,将恢复时间缩短到30分钟。Shopify的技术优先考虑用户体验和成本效益。
在PlanetScale,数据迁移可以无停机时间地进行,支持从旧数据库到新系统的迁移。该过程包括一致性快照、持续复制变更、验证数据一致性,并确保切换流量时无数据丢失,从而提升用户的迁移体验。
完成下面两步后,将自动完成登录并继续当前操作。