HDFS × YARN × AI 交叉领域高质量论文分析(2021–2026)

HDFS × YARN × AI 交叉领域高质量论文分析(2021–2026)

💡 原文中文,约5300字,阅读约需13分钟。
📝

内容提要

本文综述2021至2026年间AI/ML优化HDFS存储与YARN调度,以及两者支撑AI负载的研究。核心方向包括:用强化学习调优存储参数、数据放置和加密;用DRL改进集群任务调度与资源分配;以及HDFS/YARN作为AI训练基础设施。共收录29篇论文,重点推荐BYO-Model、DeepCAT+、Sia、AITURBO等,涵盖顶会成果与生产验证案例。

🔎

延伸解读

研究热度与方向分布

从收录的29篇论文看,AI/ML优化HDFS存储和YARN调度是绝对热点,分别有13篇和12篇,而HDFS/YARN支撑AI负载的研究相对较少(4篇)。这表明当前研究更侧重于用智能方法改进大数据基础设施自身,而非将大数据平台作为AI训练底座。未来,随着AI训练对存储和调度需求的增长,第三类方向可能成为新的研究增长点。

生产验证与学术前沿的差距

推荐列表中,BYO-Model和AITURBO均来自工业界(Google、华为云)并经过生产验证,而多数论文仍停留在仿真或小规模集群测试。这提示读者在评估论文成果时,需关注其是否经过大规模生产环境检验。工业界论文往往更注重实际部署中的约束(如TCO、兼容性),而学术界论文可能更侧重算法创新,两者在可落地性上存在差异。

技术路线:从启发式到深度强化学习

论文中优化HDFS和YARN的技术路线呈现明显演进:早期多采用启发式或传统ML(如集成学习、SVD),近期则大量使用深度强化学习(DRL),如DeepCAT+、Magpie、Q-scheduler等。DRL能自适应动态环境,但训练成本高、稳定性差。读者在借鉴时需权衡模型复杂度与实际收益,避免过度设计。

Q&A

2021至2026年间,AI/ML优化HDFS存储的主要研究方向有哪些?

主要方向包括:用机器学习/强化学习/深度学习优化HDFS的存储性能、数据放置、参数调优和安全加密。例如,BYO-Model用轻量ML模型指导数据放置,KML动态适配readahead和NFS rsize,Magpie用DRL调优静态参数,DQN-Enhanced DRL优化加密参数。

BYO-Model方法的核心思想是什么?它带来了什么收益?

BYO-Model(MLSys 2025)提出每个workload自带轻量ML模型,指导存储层的数据放置调度。它采用跨层架构,在应用层训练模型,在存储层推理,实现了TCO节省3.47倍。

DeepCAT+是如何实现大数据框架参数自动调优的?

DeepCAT+(IEEE TPDS 2024)使用TD3算法结合优先经验回放、Twin-Q Optimizer和渐进式神经网络迁移学习,自动调优Spark、YARN和HDFS的参数。

Sia调度器解决了什么问题?效果如何?

Sia(SOSP 2023)是异构感知、面向goodput优化的ML集群调度器,针对异构深度学习集群,在44-64 GPU集群上JCT降低30-93%,并可扩展到2000 GPU。

AITURBO是如何加速AI作业的云存储访问的?

AITURBO(FAST 2026)利用计算高速网络作为staging buffer,并提供grouped I/O API,加速AI作业的云存储访问,已在华为云生产部署。

在HDFS/YARN支撑AI负载方面,有哪些代表性工作?

代表性工作包括:AITURBO(FAST 2026)加速AI云存储,MeLoN(ACSOS-C 2021)在YARN上运行分布式DL,Xorbits(VLDB 2025)用去中心化actor模型加速ML pipeline,以及对比Lustre和HDFS在ML小文件场景性能的研究。

根据文章,哪些论文被列为Top 10精读推荐?

Top 10精读推荐包括:BYO-Model、DeepCAT+、Sia、AITURBO、Hadar、Origami、KML、Rubick、Magpie,以及DL Scheduling Survey。

🏷️

标签

➡️

继续阅读