“助校”古籍智慧整理平台2.0
“助校”古籍智慧整理平台自2024年1月26日始投入使用,经过2年迭代升级,已成为一款面向数智时代古籍整理的设计先进、功能完备、性能卓越的全流程协作工具,现已升级为“助校”2.0系统,期待与同行专家交流、合作,共同探索古籍数字化与成果应用的未来方向!

一、产学研协同,锻造古籍整理利器
“助校”平台由武汉大学古籍整理研究所、武汉大学文化遗产智能计算实验室、北京新田科技有限公司联合开发。武汉大学古籍整理研究所为全国高校黄大年式教师团队、全国高校古委会直属重点研究所。自20世纪90年代开始探讨中文信息处理、人文计算等方面的话题,参与全国高校古委会、国家语委重大攻关项目“古今全汉字计算机信息处理系统”(“三二五工程”)。1998年《古音汇纂》构画蓝图之时,提出用数据库技术辅助大型学术辞书编撰之构想,持续建成4500万字的“古代典籍音注数据库”。2022年以来,更加重视古籍数字化与数字人文研究,在平台建设、数据集成、知识挖掘等方面成绩显著。武汉大学文化遗产智能计算实验室是教育部首批哲学社会科学实验室,融合信息管理学、历史学、古文献学,以及测绘科学与技术、计算机科学、人工智能等组成大尺度交叉学科研究团队,致力于开展有组织的文化遗产数智化活化利用前沿研究。“助校”平台的研发,由三方联合共建:北京新田科技有限公司开发运营,古籍所负责全过程全方位学术规划与指导,文化遗产智能计算实验室立项资助数据整理与结构化分析,致力于打造尊重古籍整理传统、适应数字化新模式的高端智慧平台,为整理者提供极致高效、符合学术直觉的交互体验,为团队和项目提供透明、精细、安全可控的工业化协作流水线,为成果应用产出高质量、可直接用于深度研究的结构化数据资产。

二、源于实践:深耕学术场景,打通全链路工作流
“助校”是服务文史资料整理和成果利用的软件,由B/S架构在线平台和一套丰富的数据处理工具构成,源起于武大古籍所古籍整理项目,上线后历经2年迭代更新,解决了影响工作效率和成果应用能力的诸多问题。每次升级都贴近真实需求,每个设计都力求有用、易用、好用,目前已成长为集OCR、在线合作整理、内容搜索、结构化数据生产、文档生成、成果发布、项目管理于一体的全链路整理平台,已在近30个项目、百余种校对任务中经300余人团队检验。
“助校”以“项目—文献—任务—页面”四层结构组织数据和整理工作。项目主持人新建项目并提供文献,后台完成图像处理、OCR、数据预处理后将文献拆分为页数合适的若干任务。任务导入平台后归属在项目下,项目成员分头认领任务逐页整理;任务完成后,整理者提交审核,管理员验收通过,任务结转进入下一整理阶段(新的校次或标点等),由其他项目成员认领实施,直至达成预定目标。平台支持按任务或文献导出Word、JSON、XML等成果文档。

“助校”面向高质量成果设计,OCR识别准确率高,支持Unicode最新版本和大规模表外字、表意文字描述序列(IDS,通过部件拆解录入生僻字/缺字)、字图等录入方式,对拼版、复杂版面、倾斜版面等均有良好支持。整理过程中,除文字校订,还关注、修订语序、行类型(文本单元角色,如正文、夹注、标题等)、段尾标记等,支持著录信息和页面元数据维护,支持页面、行框(OCR识别的文本单元,通常为版面空间中连续、规格相近的文字序列)级别的备注。导出Word文档高度结构化、格式化,并以批注形式保留备注;JSON/XML等格式是自带语法的数字资产,具有广泛兼容性,可直接用于知识图谱构建。

三、多重优势,重释文献数字化的生产力
1. 整理者友好的交互设计,简洁、高效
校对页左图右表,表内为OCR行框和交互元素,简洁明确;图文互动流畅,操作图像或文本格,都会瞬时在另一侧定位到相应区域/内容,所指即所得。
页面紧凑,默认只显示核心部件,最大化图片区域,充分利用屏幕空间;图像缩放、平移、区域聚焦等操作流畅,帮助整理者随心查看原图。
首创图文对齐的行框切片视图(在固定位置显示的浮动部件,由对齐的局部区域图像与文本框组成),配合最大化的图片区域,兼具整页概览和高清切片的优势。行框在页面的位置一目了然,既克服了传统校对“左顾右盼”的难题,也避免了常见校对工具将全部字框/行框展平到偌大区域中,整理者容易迷失在“行框森林”中的困惑。切片视图适配竖排、横排、混排版面,切片可自定义宽高,以适应不同清晰度的图像,减轻视觉疲劳,显著提升校对效率。
2. 一步到位的编校流程
行框调整、文字校对、文本结构化三个逻辑步骤在同一视图中呈现、操作,一步到位,实现高效人机协同。校订页不仅支持修订文字,还支持行框编辑、行框排序、行框类型设定和段尾标记;成果文档中,段尾标记前相邻、类型相同的行框会自动合并为段落,并按预设样式格式化,实现“文本流”到“结构化文档”的质变。整理者提交修订页后,即可查看与最终成果文档效果相同的预览页面,以及标题类行框实时生成的TOC(目录页),所见即所得。
在复杂、清晰度差的页面上,OCR识别难免出现漏识别、行框范围不准确等问题,行框编辑工具提供新增、拆分、合并、删除、重定位、重识别行框等功能,可高效弥补识别效果不佳页面的缺陷,避免二次处理。
校订者可添加行备注、页面备注,用于记录考证、存疑或特殊说明。主持人或其他专家可据此复核或讨论,实现跨时空的协同审校。
校订页还支持录入原图像上的卷目、页码等信息,支持对页面进行预定义的类别标记。
3. 集成多种实用辅助工具
内置多辞典查询、异体字查询、生僻字符查询等工具面板,均支持快捷键调用,避免切换软件或页面干扰专注状态,显著提升工作效率。
支持配置多组关键词,可用不同颜色高亮匹配文本,满足文献整理、专题研究的多样需求。
设计开发零宽/零高和半宽/半高两种标点字体,可在不影响图文对齐的前提下满足句读、标点、专词标注等整理需求。
为应对资料图像清晰度差等问题,内置多种图像处理器,如一键提高对比度、降低动态模糊等。
4. 面向效率的操作设计
丰富的快捷键支持。多数功能都支持键盘操作,从图像缩放、平移到行框排序、行类型切换、段尾标记、查询面板调用,均可通过键盘实现,整理者可以基本脱离鼠标完成整页校对。
选区和批量操作。支持多种方式构建选区,选区内多个行框可批量排序、修改行类型和段尾标记。页内支持查找、替换、快速行定位等,任务、项目内支持文本搜索和替换预览,都可有效提升整理效率。
5. 高度灵活的任务配置
平台数据模型中有“项目—文献—任务—页面”四层结构,项目管理者可在项目、文献、任务层面自定义任务的页面类型、行类型、行类型样式、行类型和段尾推断规则、校订页的关键词匹配和高亮规则、页面特征标记规则、初始化和成果导出时的文本替换规则等,实现对多样整理需求的高度适配。
6. 完善的项目管理机制
实时项目概览。主页显示最新项目统计图和各任务进度。
精细化工作统计。详细统计每位成员的工作时长、完成页面数、修订字数等,可直接导出为Excel表格。对于多人合作的任务,可分别统计各自贡献,客观呈现各成员工作量。统计数据可帮助主持人量化项目健康度、识别整理瓶颈、进行科学调配。
配套管理工具。主持人可通过成员管理、任务管理、项目编辑等工具调配项目和成员权限、认领关系等。
聚合审查页面。提供专门聚合视图,集中查看项目、任务级别的页面备注、行备注、文本修订等数据,方便全局巡检和质量抽检。

7. 健全的数据保护机制
权限设置。精细区别项目不同角色权限,构建从访问控制、内容传递到行为追溯的纵深防御体系,确保原始图像与整理成果仅限授权用户在授权范围内访问。
成果防丢。采用“分页提交”模式,随时提交阶段性成果,每次提交的数据都做完整、可回溯的记录;未提交的校订成果定时缓存,页面意外关闭后重新打开,自动提示载入缓存数据,最大程度防止工作成果的意外丢失。
资料防泄。针对档案整理等需求场景,所有影印图像地址均由高强度加密算法动态生成,避免遍历、批量下载或非法盗链;校订页与预览页可配置叠加包含用户信息的动态水印,防止拍摄泄密;页面设置多重防复制屏障和反调试措施,即使网页保存至本地,也难以还原出图像等数据。
安全审计。平台提供完善的访问、修订日志,每一处修改都可准确追溯。
数据备份。后台定时将数据同步到至少两处离线存储,杜绝服务器不可控灾难可能导致的数据丢失。

四、愿景:从“数字化生产”走向“数智化研究”
自2024年上线以来,“助校”平台已承接近30个古籍整理项目,累计完成百余种不同类别、形态的古籍、档案的整理工作,处理6万多页3200万字,完成校对文字总量逾2000万,经300余人专业校对团队(包括学者、文史专业学生、其他专业学生、古籍领域从业人员等)长期、高强度使用检验,其稳定性、易用性与效率得到广泛验证。经过2年建设,“助校”已升级为融文献深度整理、古籍结构化、数据集成与发布、知识挖掘为一体的综合智能平台,正式进入2.0阶段。目前,集成可编辑word视图、表格识别与校订、生僻字检索录入,支持多版本对校的3.0版本已在研发阶段,其定位也将实现由“助校”到“助研”的跨越,期望在教学、科研中得到更广泛的应用。

我们愿意开展多方合作,以“助校”平台为依托,以整理与研究项目为阵地,共同探索古籍数字化、智能化、结构化与知识图谱绘制、知识挖掘路径的新方向。我们期待与业内各类数字化项目合作,包括但不限于:面向学术出版的古籍校对、校勘、标点、排版,科研项目数据整理与数据库建设,图书馆、档案馆或集体大中型项目的文本校对与数据标注、成果发布,专类文献数据库、知识库建设,古籍整理领域专项工具研发(如多版本图像比对软件),依托古籍整理的科教融合实践育人、大创项目,等等。欢迎各兄弟单位、同行同仁垂询洽谈!

了解更多信息点击“阅读原文”或登录:https://gujipai.com/。