拥有8年工作经验,其中4年专注Rust,曾在美团、亚马逊、小米任职,现从事数据系统领域,如分布式计算、OLAP查询引擎等。活跃于开源社区,是Apache DataFusion committer。定居武汉,接受现场或远程办公,寻求data infra或AI infra职位,可通过邮箱联系。
阿里巴巴旗下高德推出Phys AI Data数据系统,包括Phys AI Foundry和Phys AI Map,旨在解决物理AI训练与应用中的数据问题。Phys AI Foundry提供高质量训练数据,支持机器人在真实场景中学习;Phys AI Map为机器人提供可理解的空间地图,帮助其在开放环境中导航。该系统已向具身智能行业开放,支持API接入,降低企业数据采集成本。
人工智能成本迅速下降,接近于零的推理成本将改变数据系统设计。未来,代理将主导知识工作,数据系统需满足代理的需求,如高效查询和状态管理。代理能够快速合成定制数据系统,但需确保其可靠性。随着代理与数据系统的界限模糊,未来将出现智能、自我优化的数据架构。
ELT是一种数据集成过程,将原始数据从源服务器传输到目标服务器上的数据系统,然后准备信息以供下游使用。相比之下,ETL过于复杂、劳动密集、成本高,不适合处理非结构化数据,也容易成为功能和计算瓶颈。ELT更加灵活,适合处理大量数据,特别是在云端和数据湖中进行分析,正在成为IT组织实现现代化和最大化现有投资价值的关键工具。
《设计数据密集型应用》第二版即将出版,作者Martin Kleppmann与Chris Riccomini探讨了云原生架构和AI对数据库架构的影响。书中将更新存储引擎和查询优化等内容,以适应现代数据系统的变化,强调未来数据库需具备灵活性,能够在不同环境中扩展。
在本期播客中,Srini与Fly.io的软件工程师Somtochi讨论了分布式数据系统的最新进展,重点介绍了最终一致性和快速复制的实现。Somtochi介绍了Corrosion框架,强调了速度与一致性之间的权衡,以及如何利用无冲突复制数据类型(CRDT)解决数据冲突并确保数据质量。
特朗普政府计划招募约1000名来自科技巨头的技术专家,成立美国科技力量(US Tech Force),以现代化联邦政府,专注于加速人工智能应用、提升政府效率及开发现代化数据系统。
谷歌承诺投资225万美元,与联合国经济委员会合作,推动非洲公共数据系统现代化,建立区域数据共享平台,并为国家统计局提供AI培训和技术支持,以促进粮食安全和经济发展。
文章指出,使用Python等解释型语言构建高吞吐量数据系统可能导致性能瓶颈和高成本,开发者常推迟优化,最终导致系统崩溃。相比之下,使用Rust、Go等编译型语言的团队能更高效地处理数据,减少错误和资源消耗。建议开发者审计现有系统,逐步用更可靠的语言重写关键部分。
本文总结了《设计数据密集型应用》第一章,指出可靠性、可扩展性和可维护性是数据系统的三大支柱。现代应用面临数据处理挑战,作者探讨了构建稳健系统的方法,并强调技术与用户体验的紧密关系。
数据管道自动化了数据的移动和转换,涵盖数据源、摄取、转换、存储和目标等核心阶段。它提高了效率、可扩展性和数据质量,但也面临复杂性、成本和安全等挑战。低代码平台和AI增强管道的新趋势正在改变数据工程,使其成为组织的重要资产。
本研究提出了一个统一的工业人工智能基础框架,解决了算法、模型与领域知识、数据系统集成不足的问题。框架包括知识模块、数据模块和模型模块,旨在提升工业应用的有效性,并通过旋转机械诊断案例验证其有效性。
本文探讨了当前数据系统被动使用大型语言模型的局限,建议通过主动理解用户输入和数据特征来提升效率与有效性,并展示了实际应用案例及未来研究方向。
Apache DolphinScheduler是一个分布式可视化任务调度开源系统,解决大数据任务依赖和数据研发ETL依赖复杂的问题。Cisco数据团队基于DolphinScheduler进行二次开发,与AWS云上的资源特性深度融合,增加了资源依赖和存储管理、Docker镜像管理、安全访问和权限管理、自动化云上资源管理等新功能。未来计划优化镜像推送、一键同步功能、自动映射至Auth系统和权限控制。
本文讨论了分布式数据系统中的关键概念和挑战,包括数据复制、复制滞后、多主节点复制/无主节点复制、数据分区、分区与二级索引、分区再平衡、请求路由、事务、分布式系统的挑战、一致性与共识。文章提到了主从复制、两阶段提交和Raft等常见技术方案和算法。
本文讨论了数据系统基础的可靠性、可扩展性、可维护性、数据模型与查询语言、数据存储与检索、数据编码与演化等方面。介绍了经典的数据结构和索引结构,以及不同的数据存储和查询方式。同时还涉及了数据编码和数据交流的相关概念。
本文讨论了从数据叙事的角度重新审视数据管理的问题,强调了数据管理系统和元数据的重要性,提出了将数据管理和数据叙事相结合的方法,以及人的角色在数据管理和数据叙事中的重要性。
本研究介绍了AI-DB,一种新型关系数据库系统,利用自监督神经网络实现语义SQL查询。提出了一种可解释性方法,捕捉关系实体间的关系,并通过概率Sketch提高存储效率。实验表明,该方法在节省空间的同时,提供与传统方法相同的解释质量。
2024年3月11日,一篇关于可组合数据管理系统VLDB的论文已发布,探讨了数据科学的发展和数据分析工具的演变,以及当前面临的挑战。文章介绍了一些与数据管理和分析相关的开源项目,如Apache Arrow、RAPIDS、DuckDB和Ibis等,致力于提高数据交换、查询执行和编程接口的模块化和互操作性。作者对未来的发展持乐观态度,并预测将出现新一轮的用户界面生产力投资浪潮。
【翻译】文章出自 pandas 库兼《Python数据分析》一书的作者 Wes McKinney,回顾了他从 2008 年以来在数据科学领域所做的事情和转变,同时分析和思考了模块化、互操作性和可组合性的未来趋势。
完成下面两步后,将自动完成登录并继续当前操作。