随着分布式数据分析应用的快速发展,分布式数据分析集群被广泛用于处理和存储海量数据。为了降低大规模集群中的存储冗余开销,纠删码被广泛应用以替代传统的多副本机制同时提供相同的容错能力,但是引入了高修复开销。现有研究普遍认为网络传输是纠删码修复过程的主要瓶颈,因此重点优化修复带宽和数据传输路径,但这一假设在分布式数据分析集群中并不总是成立。论文通过对 Spark 集群的测量和分析发现,在 K-means、OLAP 查询和 PageRank 等典型分布式数据分析负载下,前台分析任务会持续占用大量 CPU 资源,而网络带宽相对充裕,导致纠删码修复的主要瓶颈从网络传输转向解码计算。
针对这一问题,华中科技大学信息存储及应用实验室博士生李茗畦(第一作者)、王霖、姚晨炫等同学,在胡燏翀教授(通讯作者)的指导下,提出 COAR。COAR 综合考虑节点的上传带宽、下载带宽和解码能力,将修复任务优先分配给计算资源更充裕的节点。面对不同修复场景,COAR 设计了三个关键机制:面向单块修复的计算与网络资源协同感知修复模型,面向条带内多块修复的选择性复用机制,以及面向整节点修复的任务迁移机制。
论文在阿里云上实现并评估了 COAR,系统集成 Hadoop 3.0.0 和 Spark 2.4.0,并基于 HiBench 生成 K-means、OLAP 查询和 PageRank 三类代表性负载。实验结果表明,相比现有方案,COAR 将单块修复、多块修复和整节点修复时间最高分别降低 59.80%、58.07% 和 59.47%。
该研究被ICDCS '26(CCF-B,录取率18.59%)录用,题目为 “COAR: Computation-Aware Erasure-Coded Repair in Storage Clusters for Distributed Data Analytics”。相关成果为面向分布式数据分析负载的存储集群高效修复提供了新的设计思路,得到了国家自然科学基金项目(No. 62272185、No. U25A20423)、教育部信息存储系统重点实验室以及香港研究资助局卓越学科领域计划(AoE/P-404/18)的支持。


