今日
学术
人工智能与文化遗产
公众号
人工智能助力敦煌文化遗产保护:项目与数据集研究科普

研究摘要
本次研究介绍了一项用人工智能保护敦煌文化遗产的项目。面对敦煌莫高窟文物劣化、历史记载损毁的问题,研究团队尝试用计算机视觉和机器学习技术寻找解决办法。研究中用深度网络实现了文物的自动修复,实验发现,自动修复的效果能和考古学家的人工修复相媲美,能大大提升古画的修复效率。针对海量文物对象难以人工标注分析的问题,团队用检测与检索技术做相关分析,还对多种前沿方法做了全面的测试和对比。同时,团队构建了名为 “AI for Dunhuang” 的数据集,1.0 版本包含了修复、风格迁移、检测和检索相关的数据与标签,能为相关研究提供支撑。考虑到莫高窟由众多艺术家历经千余年建造,研究还利用风格迁移技术分析不同时期的艺术风格,为跨时代的艺术风格研究打下基础,相关数据集也随论文公开发布。
关键词:文化遗产保护,敦煌,人工智能,计算机视觉
研究问题
敦煌研究院经 30 年研究,已实现敦煌石窟数字化采集与保存,建成 “数字敦煌” 数据库,其数字化成果用于展览和学术研究,但传统保护仍面临诸多难题

创新点
一、研究将计算机视觉与机器学习技术系统性应用于敦煌文化遗产保护三大核心任务,并结合敦煌文物实际特性优化技术方法,解决了传统保护效率低、难度大的问题。
二、研究构建了按三大核心任务分类的“AI for Dunhuang”专属数据集,提供标准化数据源且已公开发布,满足了敦煌文化遗产AI保护领域对专属数据的需求。
三、研究设计了专家与机器协同的工作模式,并开发配套技术手段,解决了技术落地中的难点问题,提升了工作专业性与效率,推动了相关技术的实际应用。
研究方法
研究主要围绕虚拟修复、遗产属性检索、艺术风格迁移三个核心任务展开,为每个任务都设计了针对性的研究方法,同时搭建了专属的数据集,所有实验都基于专业的技术框架和硬件平台开展,保证了方法的可操作和可复现。
一、团队按研究任务,搭建“AI for Dunhuang”1.0版本专属数据集。
团队打造的 “AI for Dunhuang” 1.0 版本数据集,会根据不同研究任务分类搭建。虚拟修复的数据集,会先选取保存完好的敦煌图像,经过裁剪、缩放等处理后,人工剔除严重劣化的区域,还会制作两种模拟文物劣化的掩码,来模拟不同的损坏情况;遗产属性检索的数据集,选取了飞天、题记、供养人等五类壁画中常见的元素,从数字化壁画中裁剪出固定尺寸的图像,由敦煌研究院的专家标注元素位置并生成专业标签文件;艺术风格迁移的数据集,聚焦唐代敦煌特有的青绿山水风格,从多个洞窟的壁画中选取图像,按不同分辨率处理后裁剪成固定尺寸,再人工剔除无效的样本。

Fig.3 人工修复结果示例:a 因老化受损的壁画;b 经专家部分修复(上方缺失区域已精心补绘,并进行了轻微的色彩增强)。
二、团队选取两种深度学习模型用于虚拟修复,并开发配套交互软件。
团队选取了 PConv 和 EdgeConnect 两种深度学习模型作为基础方法,均在专业技术框架上实现,统一了输入输出的图像尺寸。PConv 模型采用类 U 型的网络结构,通过特定的卷积层融合文物损坏的掩码信息,模型会先在通用数据集上预训练,再用敦煌的专属数据微调优化;EdgeConnect 模型则分为两步工作,先由专门的模块预测文物劣化区域的边缘轮廓,再结合边缘信息完成颜色和纹理的填充,模型会直接采用通用数据集的预训练结果,冻结边缘预测模块后,用敦煌数据和通用数据的混合数据微调填充模块。同时团队还开发了可视化的交互软件,能帮助艺术家快速确定文物的劣化区域。

虚拟修复方法的输入、输出结果与真实参考图:a 模拟劣化的数字遗产图像;b 模拟劣化掩码;c 修复结果;d 真实参考图
三、团队选取8种目标检测模型测试,设计超大型壁画适配检测策略。
遗产属性检索则以目标检测技术为核心,团队选取了 8 种主流的目标检测模型做对比测试,除了一种模型从头开始训练外,其余模型均采用预训练的骨干网络并结合敦煌数据微调。实验设置了统一的训练轮次,采用两种行业通用的评价标准,以平均精度、平均召回率等为核心评价指标。针对超大型的壁画图像,团队还设计了滑动窗口的采样策略,先把大图裁剪成小图输入模型检测,再把检测结果还原到原始大图上。
艺术风格迁移则聚焦无配对图像的风格迁移问题,选取 8 种前沿方法开展测试,统一了输入输出的图像尺寸,以敦煌青绿山水风格图像为目标,以自然风景图像为参考,完成模型的训练和推理。同时采用两种方式评价迁移效果,一种是通过专业网络判断风格迁移的相似度,另一种是通过用户投票的方式,统计不同方法的视觉效果接受度。
研究结果
在虚拟修复的测试中,PConv 和 EdgeConnect 两种模型对不同类型的文物劣化,修复效果各有特点。
1. 虚拟修复对比
针对模拟霉菌、盐蚀的劣化情况,PConv 模型能更好地修复微小的损坏区域,各项量化评价指标也更优,但存在局部颜色融合不够自然的问题;EdgeConnect 模型则会有部分微小损坏点未修复的情况。

基于粉尘类掩码在飞天测试集上的虚拟修复结果

基于凝胶状掩码在飞天测试集上的虚拟修复结果
针对模拟物理损坏的劣化情况,EdgeConnect 模型修复的纹理更自然,视觉感知效果更好,而 PConv 模型虽然能填充更多细节,却容易出现和周边画面不协调的伪影,边界的修复效果也较差。在真实的劣化文物图像测试中,EdgeConnect 模型对小面积的损坏区域修复效果较好,修复的纹理能和周边区域自然融合,但面对大面积的损坏区域,很难准确预测画面结构,修复效果会受影响。
不过整体来看,修复后的图像相比原始图像都有明显提升,团队开发的交互软件也能有效减少艺术家的工作时间。

采用基于凝胶状掩码的 EdgeConnect 模型在真实劣化区域上的部分修复结果
2. 目标检测分析
在遗产属性检索的测试中,8 种目标检测模型的表现差异明显,其中 YOLO v5-S 模型的综合性能最好,各项核心评价指标均显著高于其他模型,另有一款 FSAF 模型表现次之,其余模型的性能则处于相近水平。

敦煌目标检测数据集示例。从上到下依次为飞天、题记、供养人、千佛纹样和非佛教人物类别的数据集样本。
所有模型对五类壁画元素的检测表现趋势一致,对千佛元素的检测效果最好,这是因为千佛图案形态固定、布局规整,检测难度低;对非佛教人物元素的检测效果最差,这类元素不仅形态多样,还常出现相互重叠的情况,很难精准判定边界。

非佛教人物的两个示例。图中所示的边界框紧凑且相互重叠,人物的风格呈现高度多样化。
YOLO v5-S 模型的优异表现,主要得益于其独特的数据增强技术,能更好地适配敦煌数据集的样本特点,对形态多变、类型多样的壁画元素检测效果更优。
3.风格迁移效果
在艺术风格迁移的测试中,8 种方法都能将自然风景照片转化为敦煌青绿山水风格,既保留照片原本的内容,又赋予其敦煌壁画的艺术特征,但效果好坏能明显分为三个层级。
第一层级的 Cycle-GAN、DualAST、Avatar-Net 三种方法,生成效果各有特色,Cycle-GAN 更贴近敦煌壁画的原始质感,画面细节和结构保留完好;DualAST 生成的画面空间立体感强,有欧式油画的视觉感受;Avatar-Net 则更偏向写意的传统绘画风格。
第二层级的 CUT、ADAIN、WCT 三种方法,能完成基本的风格迁移,但存在明显缺陷,比如色彩分布不均、纹理细节丢失、画面噪声较多等问题。
第三层级的 DFP 和 GATYS 两种方法,迁移效果较差,画面色彩混乱、伪影较多,会影响对图像内容的理解。
在量化评价和用户投票中,Cycle-GAN 方法的表现均为最优,和直观的视觉效果分析结果基本一致,仅有 Avatar-Net 方法的量化评分低于主观预期,这是因为评价指标更注重画面的结构完整性,而非色彩分布的准确性。

基于经典算法在敦煌山水风格数据集上生成的风格迁移结果。从左至右依次为:原始风景照片、Cycle‑GAN(Zhu 等人,2017)、CUT(Park 等人,2020)、DualAST(Chen 等人,2021)、GATYS(Gatys 等人,2016)、DFP(Wang 等人,2020)、ADAIN(Huang & Belongie,2017)、WCT(Li 等人,2017)以及 Avatar‑Net(Sheng 等人,2018)。
研究结论
研究展望
本研究虽有阶段性成果,但遗产属性检索对复杂壁画元素检测精度不足;虚拟修复难以应对大面积破损,修复完整性和合理性待提升;艺术风格迁移未能完全贴合敦煌壁画艺术精髓;AI 技术在 “数字敦煌” 中的集成及模块协同性需加强。
未来将引入多模态学习,结合视觉与文献信息提升技术性能;研究语义分割技术,支撑精细考古分析;扩充 “AI for Dunhuang” 数据集,优化数据质量与分布;针对敦煌文物特性改进算法,提升复杂场景处理能力;加强 AI 与 “数字敦煌” 平台集成,打造一体化智能保护平台。
引用本文
[1] Yu T , Lin C , Zhang S ,et al.Artificial Intelligence for Dunhuang Cultural Heritage Protection: The Project and the Dataset[J].International Journal of Computer Vision, 2022.DOI:10.1007/s11263-022-01665-x.
免责申明
-
仅用作学习研究,不作商用。图文若有侵权,请联系删除。
-
以上内容并非原文。若造成理解歧义,请各位读者点击【阅读原文】,以原文观点为准。分享的原文版权归原作者所有。
欢迎扫码
关注我们
