内容提要
本文系统梳理了2021至2026年间HDFS与YARN领域的45篇高质量论文,按CCF等级、引用数等标准筛选。HDFS重点涵盖元数据可扩展性(如λFS、FMCache)与纠删码优化(如LESS),YARN聚焦深度学习GPU集群调度(如Hadar、Rubick)。报告按Tier分级推荐,并归类研究热点,为分布式存储与资源调度研究提供参考。
延伸解读
元数据可扩展性:从分区到异步化与网内缓存
报告显示,HDFS元数据研究正从传统的分区策略(如InfiniFS的访问-内容解耦)演进到更前沿的架构:λFS引入serverless函数实现弹性元数据服务,AsyncFS采用异步更新与可编程交换机协调,FMCache则在交换机数据平面直接缓存元数据。这些工作共同指向一个趋势:利用新硬件(如Tofino)和云原生范式(FaaS)来突破NameNode瓶颈,值得关注其在实际集群中的部署成本与兼容性。
纠删码优化:从修复带宽到I/O寻道与并行调度
纠删码研究不再仅关注修复带宽。LESS通过扩展子条带同时降低修复I/O量和寻道次数,NCBlob利用网络编码减少小blob的非连续I/O,HyperParaRC则通过亲和度启发式实现条带内并行修复。这些工作均在HDFS上实现并验证,表明修复性能优化正走向实用化,但需注意不同编码方案在数据访问性能与修复效率间的权衡。
YARN调度:面向深度学习集群的异构感知与重配置
YARN领域的研究重心明显转向深度学习GPU集群调度。Hadar通过异构感知调度将JCT降低3倍,Rubick则允许运行时重配置执行计划,突破静态假设。这些工作针对GPU集群的异构性和作业可重配置性,但多基于模拟或小规模集群验证,实际部署时需考虑与现有YARN调度器的集成复杂度。
报告筛选标准与局限性
报告基于CCF等级、引用数和相关度筛选,但存在局限:部分论文(如λFS)代码未公开,影响可复现性;Tier 3论文多发表于非顶会,质量参差;检索平台以arXiv和Semantic Scholar为主,可能遗漏部分重要工作。读者在参考推荐优先级时,应结合自身研究场景验证论文的适用性。
Q&A
HDFS元数据可扩展性方面有哪些重要的顶会论文?
HDFS元数据可扩展性方面的重要顶会论文包括:λFS(ASPLOS 2023)、CFS(USENIX ATC 2023)、InfiniFS(FAST 2022)、FMCache(FAST 2026)和AsyncFS(2024)。这些论文分别提出了基于serverless、精简临界区、访问-内容解耦、可编程交换机缓存和异步更新等创新方法。
LESS纠删码方案相比Clay码在修复性能上有哪些提升?
LESS纠删码方案在单块修复时间上比Clay码减少83.3%,全节点恢复时间减少36.6%。该方案通过分层扩展子条带降低修复I/O量和I/O寻道次数,并在Hadoop HDFS 3.3.4上实现验证,代码已开源。
YARN在深度学习GPU集群调度方面有哪些代表性工作?
YARN在深度学习GPU集群调度方面的代表性工作包括:Hadar(IPDPS 2024)提出异构感知调度,平均JCT比YARN-CS降低3倍;Rubick(MLSys 2025)利用作业可重配置性,在64-GPU集群上JCT降低3.2倍;此外还有TopDRL、RLTune等DRL方法。
FMCache是如何利用可编程交换机提升HDFS元数据性能的?
FMCache利用可编程交换机(Tofino)在数据平面直接缓存HDFS文件系统元数据,解决多Metadata Server场景下的可扩展性问题。相比原生HDFS,吞吐量提升高达181.6%,配合客户端缓存可额外提升139.6%,并在多个真实生产负载上验证。
CFS在元数据管理上采用了什么核心思路?
CFS提出“精简临界区”思路,将文件属性和命名空间分层管理:文件属性贴近数据存储(哈希分区防热点),命名空间用分布式数据库(保持局部性消除跨分片事务)。该方案在百度AI Cloud生产运行3年,吞吐量比HopsFS高1.76-75.82倍。
Trident是如何将分层存储感知引入任务调度的?
Trident将分层存储感知引入任务调度,将调度问题转化为二分图最小代价最大匹配问题,使用标准求解器寻优。它考虑了HDFS多级存储(内存/SSD/HDD)的性能差异,在Hadoop和Spark平台上应用完成时间减少最高66%。
UpFuzz在分布式存储系统升级中检测了什么类型的bug?
UpFuzz针对分布式存储系统(包括HDFS、Cassandra、HBase)升级中的数据格式不兼容bug进行自动检测。通过数据格式感知的变异策略,在24小时内发现比传统方法一年更多的兼容性问题,并获得了NSDI '26 Community Award。
HDFS纠删码方向有哪些值得关注的研究热点?
HDFS纠删码方向的研究热点包括:修复性能优化(如LESS、NCBlob、HyperParaRC)、宽条带设计(如CP-LRC)、数据更新优化(如TSUE)以及EC与复制性能对比(如Understanding the Performance of Erasure Codes in HDFS)。这些工作覆盖了从编码理论到实际部署的多个层面。