中世纪手稿史料中的全文检索:HIMANIS 项目对于电子版本的挑战与前景
Dominique Stutzmann、Jean-François Moufflet、Sébastien Hamel 著
原载《Médiévales: Langues, Textes, Histoire》73期,2017年秋,第67—96页
HIMANIS,即 Historical MANuscript Indexing for user-controlled Search,可译为“面向用户可控检索的历史手稿索引”,是一个欧洲研究项目。该项目由法国国家科研中心 文本研究与历史研究所,即 IRHT, CNRS, France 牵头,联合创新企业 A2iA,法国,格罗宁根大学,荷兰,以及 瓦伦西亚理工大学,西班牙,共同开展。它是在 JPI,即 Joint Programming Initiative “Cultural Heritage and Global Change: a challenge for Europe”(“文化遗产与全球变化:欧洲面临的挑战”)的 Heritage Plus Joint Call 征集中,从352个申请项目中入选的16个项目之一。HIMANIS 的目标,是以法国王室文书库登记册数字化后产生的图像为基础,对1302年至1483年间法国王室文书库登记册中抄写的文本进行索引;这些登记册现藏法国国家档案馆,档号为 JJ35 至 JJ211。在这一项目中,信息检索方面的挑战,即大规模且带有噪声的数据,使技术层面的问题,即手写文字识别,与历史研究层面的问题结合起来;后者包括古文字学和外交文书学分析、制度研究、君主制运行机制研究,以及民族国家诞生问题的研究。
本文旨在从使用便利性和解释学两个角度,为大规模数据语料中的信息获取提出一种模型。为此,第一部分介绍 HIMANIS 项目所选取的法国王室文书库登记册语料、目前用于获取其中信息的工具,以及这些材料如何以 TEI 形式加以规范化。第二部分则把电子版本问题化,将其视为“标准答案”与“训练场地”,从而颠倒了传统上把批判版本作为最终目标的做法。最后,第三部分描述本文提出的信息获取模型:一方面,它采用“索引”而非“转写”的路径;另一方面,它以单件文书为基本粒度。
法国王室文书库登记册:一个难以获取信息的语料
语料介绍
最早的文书库登记册可以追溯到腓力二世时期。这里不进入关于其起源的争论;但可以肯定的是,它们证明了王室政府记忆的保存与珍藏方式发生了深刻变化。这些登记册反映了13世纪初地缘政治格局剧烈变动背景下逐渐形成的行政方法,也体现了人们对于王权使命的理解。它们最初的目标,是保存有用文书的痕迹,并具体掌握国王的权利与承诺。登记册伴随着流动的文书库,在某种程度上取代了那些它所复制的特许状;而这些原件则仍然保存在巴黎王宫之中。
13世纪的登记册被外交文书学家更常称为“文书汇编—登记册”(cartulaires-registres)。它们的特点是具有一定的异质性,这是因为其中抄录的信息种类很多:事实上,其中并不只有特许状。文书不是以线性方式登记的,而是按照方法性原则,被分配到若干大型主题栏目之下;这些主题栏目的清单在整个世纪中不断变得复杂。到圣路易统治末期,这种复杂性已经使重新抄录的操作,也就是把文书重新归入这些主题之中的操作,变得难以维持。登记方式的复杂化,看似矛盾地受到王权成功扩张的推动,因为王权承担了越来越广泛的特权。这很可能解释了14世纪初腓力四世时期登记册管理方式的变化。从 JJ35 登记册开始,即涵盖 1302—1305年 的登记册,出现了被认为是常规形式的登记实践,也就是对大致按照时间顺序连续排列的文书进行系列性、连续性抄录。一个登记册中的文书,会在正文册页之前的目录表中列出;正文则抄录在随后的册帖之中,见图1。
这些目录表为每份文书分配一个编号,并提供一条简短的摘要;这条摘要本身也会被抄写在正文册帖中文书旁边的边栏里。
实际上,文书之间不能被理解为具有完全规则的线性顺序。确实存在年代顺序上的混乱,这些混乱来自较晚、延迟的登记,后来的增补,以及从文书库公证人那里回收来的册帖在装订时有时相当随意。不过,HIMANIS 项目所针对的语料,在结构和编制方式上仍具有相当的同质性;它排除了“文书汇编—登记册”,只保留那些采用系列性登记方式的登记册。
与最初的登记册相比,被选入登记的文书类型也明显发生了变化:具有永久效力的文书越来越受到优先记录,而较日常的行政文书则逐渐退居次要地位。登记内容最初涉及范围广泛的问题,后来则转变为更有选择性的登记。巴黎高等法院和审计院也接替了文书库的一部分职能。在文书库继续登记的文书中,如今有很大比例涉及针对特定个人的措施:著名的赦罪书,即向被判罪者授予王室赦免的文书,占据了重要部分;授予贵族身份的文书也属于这一类。除了这些针对个人的措施,它们体现了王权对臣民的控制之外,这些登记册仍然反映着卡佩王朝和瓦卢瓦王朝的政策。例如,15世纪末的登记册包含关于重新建立或创设集市和市场的文书,其背景是百年战争结束后王国商业活动日益加强。最后,若与最早的登记册比较,还可以看到,随着数十年过去,被登记的信息量变得越来越庞大。这种庞大的材料量解释了14世纪登记册与15世纪登记册之间的明显不平衡:这种不平衡既体现在可用于利用这些材料的工具上,也体现在史学界对它们的处理方式上。前者,也就是14世纪登记册,仍然有数量相当多且较为精确的清册研究;后者,即15世纪登记册,则除了少数例外,只能通过更局部或更概括性的成果来接近。虽然查理七世时期的登记册已有近期研究,但路易十一时期的登记册至今仍然在很大程度上不为人所知,也没有得到充分利用。

图1:JJ37 登记册目录表,1303—1307年
巴黎,法国国家档案馆,JJ37,f. Ar。

图2:清册与版本的地理和年代覆盖范围
检索工具
因此,HIMANIS 项目也是一个深化我们对这一庞大登记册整体认识的机会;从长远来看,它还可以通过若干工具促进新的研究,因为这些工具将使研究者更容易进入登记册的内容。因为就目前而言,在文书库登记册中进行信息检索是复杂的,而且常常令人沮丧:现有工具并不能免除研究者对各卷进行连续阅读。由于标题栏目和目录表过于简略,再加上编辑与清册编制工作并不完整,研究者仍然必须通过通读各卷来弥补这些不足,见图2。
在描述为实现全文阅读,或者至少为实现全文自动索引而开展的各项操作之前,有必要先简要介绍现有检索工具的状态及其数字化可用情况。这些工具分为三类:
第一类是系统性分析清册,即说明所描述登记册中全部文书的清册,见表1。

表1:系统性分析清册
第二类是选择性分析清册,即根据文书主题或地理范围而选取部分文书进行说明的清册,见表2。

表2:选择性分析清册与地理清册
第三类是部分版本/局部刊本,见表3。

表3:局部刊本
关于系统性清册,所有登记册都曾经过早期的梳理,但这种梳理极为简略,只是把登记册中所含文书的目录表汇编起来。在相关的四卷中,有三卷可以在“虚拟清册阅览室”中查阅:第一卷覆盖 JJA—JJN 以及 JJ1—JJ79;第三卷覆盖 JJ156—JJ211;第四卷则覆盖 JJ212—JJ2647。至于其他检索工具,虽然严格意义上的登记册系列从 JJ35 开始,但研究者可以利用已经出版的 JJ37—JJ79B 登记册清册,不过 JJ50—JJ64 的登记册清册没有索引;此外,JJ80—JJ96 登记册则有打字稿或手稿形式的清册。
地理性清册是在法国国家档案馆编制的,覆盖加斯科涅、朗格多克、鲁埃格以及卢瓦尔河中游地区。这些清册更容易利用,因为它们已经由法国国家图书馆数字化,并且通过 OCR 软件处理后,其内容以文本文件形式在 Gallica 数字图书馆中提供。法国国家档案馆当然并非无所作为;不过,尽管其中某些清册已经被数字化,甚至被转换为 EAD,即 Encoded Archival Description,“编码档案描述”格式,它们目前尚未向公众开放。虚拟清册阅览室目前还无法利用主题索引和人名索引;而在旧清册的大规模回溯转换过程中,索引也并不总是被整合进去。虽然全文检索可以在一定程度上弥补没有电子化索引的缺陷,但这种补偿仍然十分有限。
清册和刊本的现状,以及它们的转换情况,凸显了重要的启发式问题。索引没有被回溯转换,恐怕也与一个困难有关:在 EAD 这种结构化但“扁平”的系统中,很难对索引中的参照关系进行建模并加以利用,因为它并不系统地连接到权威记录。不过,这种情况也导致识别信息的丢失,无论是人物、地点,还是主题,都是如此。因此,这里存在一种潜在而尚未被充分问题化的张力:一方面是逐项累积信息的历史研究,另一方面则是其他形式的远读式利用方式,例如利用索引进行历史统计,或从外交文书学角度开展语料语言学研究。
一个可以统辖所有材料的统一格式
具体而言,这些清册无论是否带有索引,其格式都存在细微差异。在这种背景下,第一项工作就是为清册和刊本创建一种同质化的统一格式。这样一来,尽管清册和文本刊本之间存在根本差别,性质相同的信息仍然可以被放置在同一层级上,见图3。
尤其需要指出的是,我们选择将“文书”作为基本的颗粒度层级,无论我们是否掌握该文书的刊本。对于清册和文本刊本的电子编辑这一部分,我们选择使用 TEI。这是唯一能够将文本元数据,包括其传承信息,如原件、登记册、刊本,与转写文本和刊本正文结合起来的格式;同时,它还允许对这些文本进行标注和丰富,例如标注异文、缩写等。
在文档的上层结构中,对于统一后的清册,例如地理性清册,我们使用 <TEI> 作为根元素;对于包含按卷划分的清册,例如系统性清册,我们使用 <teiCorpus> 作为根元素,并为每一卷设置一个 <TEI> 元素。Paul Guérin 多卷本刊本也采用这种方式。在这两种情况下,一卷都被视为一个文本集合,即 <text>;它汇集了作为单独文本的各件文书,而这些文书则被编码为 <group> 元素中的 <text>。
在 HIMANIS 项目框架内,我们借鉴国立文献学院为文书编辑所提出的格式,但有意采取了与该机构另一种做法相反的选择。该机构曾选择用 EAD 发表一份古文献文本,即便那是一份如圣但尼清册这样的档案清册。我们这里则认为,清册是关于文本的一组元数据集合,即便我们目前尚未掌握这些文本本身。
因此,我们并不描述文书原件。不过这里必须指出一个实质性差异:我们在 <witness> 内部使用 <msDesc>,以便利用 TEI 原生编码所能提供的全部细致程度。这里具体体现为使用 <msIdentifier>,并配合 <repository> 和 <idno>。
从项目一开始就启动的清册规范化和电子编辑工作,已经取得了显著成果。尤其是合作伙伴 A2iA 训练了一个“识别器”,也就是一套专门适配某种特定书写形式进行转写的软件流程,用于处理 JJ84—JJ95 登记册的手稿清册。因此,这些原本除巴黎之外公众难以接触的清册,如今已经被结构化,并将能够像法国国家档案馆的其他清册一样在线发布,见图4。

图3:关于一件文书信息的编码示例

图4:JJ84 登记册手稿清册
尽管这项工作很有用,但它只是一个次要的、工具性的方面,其目的在于更好地利用机器学习的潜力,并依据经过验证的数据来自动评估结果。文本本身也是如此。
电子版本作为欧洲 HIMANIS 项目的“标准答案”
HIMANIS 项目首先以工具性的方式理解电子版本,将其视为“标准答案”和“训练场地”,从而使传统上把批判版本作为最终目标的做法受到挑战。电子版本如今被纳入一个更加丰富的源文献与元数据循环之中。为了说明这种看似颠倒的转变,有必要描述 HIMANIS 联合体、它面对大规模数据时所设定的目标,以及人工智能的学习方法。
面对大规模数据挑战的文化遗产
HIMANIS 提出对王室文书库登记册中的文本进行数字化和索引,以便开展科学利用和创新性使用。同时,该项目也强调,这些登记册是一种物质文化遗产,并且与法国君主制和中央集权意识形态有着深刻联系。它们最具体地反映了一种传统:中央国家在整个领土范围内介入个人生活。
这一跨学科项目结合了技术问题与人文学科问题。就计算机视觉而言,主要问题包括 Key Word Spotting,即关键词识别或关键词检索,索引,书写者识别,以及通过内容协商进行检索。就人文学科而言,首要问题是组织对所有保存文献的访问,并便利研究者在这一庞大而复杂的整体中开展历史研究和语言学研究。除了这一初步层面之外,真正的关键问题还包括大规模数据分析、网络分析和语料语言学;这些方法既可以一般性地使用,也可以应用于制度史,以及外交文书学和古文字学等历史学基础学科。事实上,这两门学科应当帮助我们更好地理解王室行政的运行机制,以及王权扩展国王权利的策略。
一个复杂的语料
处理登记册这一档案集合中的大规模数据,是一项复杂任务。其规模本身就令人印象深刻:该语料包括严格意义上的登记册,也就是法国国家档案馆中档号为 JJ35 至 JJ211 的各卷,时间范围为 1302年至1483年。它甚至还可以由十九部登记册,原件或抄本,以及八部格式书加以补充;这些材料已经由法国国家图书馆数字化。法国国家档案馆的数字化工作在 HIMANIS 项目开始之前已经启动,最初覆盖到 JJ91 登记册;如今这项工作已经完成,其中包括三十二部登记册,它们因卷册厚重而必须经过特殊处理,以改善叶面的呈现效果,甚至需要拆除装订。整个语料目前已经包含 70000 张图像。语料越庞大,全文检索的意义越明显;但与此同时,困难也随之增加。
前文已经说过,现有电子化清册对这一语料的描述十分薄弱,尤其是对整个语料后半部分的描述更为不足。现在还必须强调其结构上的多样性。从语言角度看,这一档案集合是双语的,主要包含拉丁文和法文文书;但其中也能见到奥克语、佛兰德语和纳瓦拉语文本。多语语料的利用总是比较棘手。这里的复杂性又因中世纪的认证抄件,即 vidimus,以及插入文书的实践而进一步增加;这种实践可能把一件王室文书变成一种多语拼贴。例如,在腓力六世时期,46% 的文书都涉及这种情况,并包含一至十件插入文书。此外,文书的外交文书学类型也非常多样,从赦罪书到命令书,再到永佃权解除文书、授贵族身份文书和确认文书,同时还经常纳入委托书和授权书的抄件。
正是这些目标,以及这一语料多语、非同质化、文献说明较少的特点,促使项目合作方制定了一种原创性策略:用电子版本来滋养人工智能。
电子版本作为预备阶段:格式、丰富化与易用性
训练一台“阅读机器”的可能性,已经由 HIMANIS 的两个合作方在此前的 ORIFLAMMS 项目中得到测试和发展。ORIFLAMMS 全称为 Ontology Research, Image Features, Letterform Analysis on Multilingual Medieval Scripts,即“本体研究、图像特征与多语中世纪文字字形分析”,由法国国家科研署/Cap Digital 资助,时间为 2013—2016年,项目编号 ANR-12-CORP-0010。该项目旨在研究书写如何随着正式程度和载体的不同而发生变化。为此,它采用的是自动且全面的“文本—图像对齐”,而不是选择性标注,以避免“确认偏误”和罕见现象被过度代表的问题。
其原则如下:研究者使用手写文本识别软件,即 HTR, Handwritten Text Recognition,也就是人工智能技术和深度神经网络;但他们并不直接期待机器给出一份转写文本,而是使用一份已经存在的转写文本,并建立统计模型,使自动生成的文本尽可能接近预先提供的“人工”转写文本。这个预先给出的文本被称为“标准答案”(ground truth,法文 vérité terrain)。顾名思义,这个“标准答案”应当是文本在实际材料中真实状态的代表性样本,与“模型”相对。
这一“标准答案”可以通过外部参考资源加以扩充,例如语言词典、命名实体参考库,如地名、人名和概念,以及词形还原工具。不过,它本身仍然是机器学习的核心构件,并且事实上已经包含了一个初步语言模型,例如词汇表、词频等。
在 HIMANIS 项目框架内,我们正是这样工具性地使用了 《普瓦图王室文书》 的电子版本。这个电子版本以 Paul Guérin 的刊本为基础。我们将其作为“标准答案”来训练机器,并借此获得杠杆效应,以便接近对整个语料的编辑;至少,也要能够对其中出现的词进行索引。这一版本共十二卷,总计 1744 件文书;它不仅是唯一可用的版本,而且还有一个优点:它覆盖了直到中世纪末的整个语料。
电子版本与图像之间的对齐操作构成了一个知识基础。在这个基础中,研究者恢复了一种在电子版本形成的历史过程中丢失的信息,即学术编辑者曾经看到、随后又转换为字符串的图形形态。如今被重新创建出来的这些信息,又被传播出去,用来解释尚未刊布的页面和文书。
为了促进文本—图像对齐,首先必须进行数据准备:也就是在已经编辑的文本与其出现的数字图像之间建立对应关系。这些对应关系通过插入 <pb/> 元素中的 @facs 属性来记录。当一件文书没有覆盖整页时,@facs 属性会指向一个 <zone>;这个 <zone> 被声明在 <teiHeader> 与 <text> 之间的 <facsimile> 区段中。随后,为了便于机器学习阅读,在 Paul Guérin 前三卷所提供的 474 件文书 中,项目为接近 300 件文书 的转写文本加入了换行标记,即 <lb/> 元素。这些文书对应 JJ35—JJ91 登记册的年代范围;这一部分在项目初期已经由法国国家档案馆数字化,并成为机器学习的基础。
这项时间投入不可忽视。此外,我们还丰富化了二十七份转写文本,对其中的缩写进行标记,希望这样能够便利自动阅读,并反过来丰富未来的编辑版本,同时使研究者能够从历时角度考察缩写系统的演变。实践中,第一轮对齐是在标注换行之前生成的;随后这一对齐被完整校正,以便提供更好的学习基础,也正是在这个过程中,<lb/> 元素被插入到电子版本之中。
对电子版本进行细致丰富化的努力,使我们看到了它的许多弱点:从转写错误,到非常强势、侵入性的编辑选择,都在其中显现出来。与此同时,这也验证了它对于训练人工智能的价值。在这一点上,人文学科与其自身成果质量之间的暧昧关系多次显现出来:由于这种成果不能被严格评估,外界也许太容易产生一种它理应完美的印象。无论如何,工程合作方期待的是 100% 的精确度;但中世纪材料的现实,首先就是缩写问题,使得“完美”必须依赖于编辑的预期和目标来定义。
因此,合作方原本期待获得一份能够穷尽标明缩写的版本,因为——至少我们最初是这样认为的——机器所能被期待生成的,只能是一串反映图像中文字状态的字符,并按照缩写规则和统计规律来还原。然而,出于易用性和认知方面的原因,提供这样的语料是不可能的。为了古文字学分析而让机器学习缩写、并自动丰富转写文本,这仍然是一个尚未解决的问题。不过,机器最终确实学会了通过“整体阅读”的方式来阅读文本,并还原缩写。质量问题,以及质量如何定义的问题,仍然是所有人文学科项目的关键问题。
还必须考虑易用性问题。易用性具有至关重要的地位,因为它同时制约数据的数量和质量:一个易用的工具,能够以更少的时间投入,成倍增加格式正确的数据。在 HIMANIS 项目中,无论是为 Paul Guérin 版本所涉及区域进行预先标注,还是后来校正对齐结果,我们都使用了 Transkribus 软件。该软件由 Transcriptorium 项目开发,并由 READ 联盟延续;HIMANIS 的合作方瓦伦西亚理工大学也是 READ 联盟成员,见图5。

图5:Transkribus 编辑与对齐软件界面,2016年6月
界面与软件:© 2013-201xDEA。Transkribus 是 READ 项目的一部分,并获得欧盟“地平线2020”研究与创新计划资助,资助协议编号 674943。图中所示文献:法国国家档案馆,JJ65A,f. 1r。
这一软件允许进行非常精确、非常描述性的对齐,例如标明缩写、上标词、被划掉的词等。它基于 PAGE 格式,并能够将结果导出为多种格式,如 METS、TEI、PDF、RTF、Excel。
我们在第一阶段将电子版本工具化,甚至颠覆了文本编辑活动这一最高成果,将其变成简单“索引”的踏脚石。现在有必要澄清相关概念以及元数据的循环。
“索引”“分析”“编辑”“评估”:元数据循环与正在进行的工作
“索引”一词具有多重含义。它始终指向一种以表格方式进入线性文本信息的途径;但索引既是编辑的最低层级,也是编辑的最高阶段。它是最终步骤,能够在一个版本中创造额外意义,并揭示那些原本只是潜伏其中的内容:当编辑者为一部文本提供圣经典故和回忆性引用的索引时,他打开了一扇通往重新理解的大门;这种理解不仅关乎作品本身,也关乎作者的思想。从这个意义上说,索引完成并展示了编辑者对文本的理解,是校勘工作和文本批判工作的最终成果。
档案中的“分析性”清册本身也在名称中包含了索引化的目标,因为分析的最终行为就是识别。然而,索引同时也是一种最低层级。正是在这个意义上,索引以 Roberto Busa 神父的《托马斯索引》,即 Index Thomisticus,这一具体形式,构成了数字人文学科的根基。索引是一种“废墟状态”的文本:那些被分散的碎片被重新聚集并加以分类,常常按照字母顺序排列。所有理解都从中被抽离出来;但它又通过捷径、语境和并置关系,包含着产生新阅读的潜力,见图6。

图6:Monk 为 JJ35 登记册生成的词语索引,2016年5月18日
在 HIMANIS 项目中,我们所创建的“索引”同样是一扇进入文本的大门:它既更加精确,也更少“智能”。事实上,它的目标是在王室文书库登记册这一浩瀚大陆中,找到某个被选定术语的出现位置,见图7。

图7:MONK 软件界面中某个词出现位置的可视化
Monkweb © 2005–2014 Lambert Schomaker。
这种索引尚未达到理解王室文书意义、识别行动者和地点的层次;但它为新的分析打开了道路。显然,它使研究者能够进入那些尚未编制清册的档案部分。更重要的是,它改变了可以提出的问题:一方面,它为研究者提供了进入史料文本性的路径,而这种文本性在清册编制和分析过程中已经被完全抹除;另一方面,由于它建立在图形分析的基础上,它也允许研究者围绕词语本身的形态进行检索,见图8。

图8:以 “abbatisse” 一词进行检索的示例
不同颜色表示每一个被框出的出现位置的置信度,即系统对该识别结果可靠性的判断,界面为2017年5月版本。
为了建立一个既适合研究、又相关且高效的索引,同时保留文本的语义价值,HIMANIS 项目的合作方试图利用权威数据、参考库以及语言学工具。
参考库与语言学工具
首先,语言学参考库在改进文本识别和索引方面具有重要潜力。它们可以通过规整和规范化术语,修正自动工具误读、或者其中某个字符被破坏的词。词频指标还可以更恰当地计算一个词的“置信度”,从而提供更好的检索服务。词形还原无论对于拉丁文,还是对于古法语和中古法语,都是有用的;它不仅能够改进被索引术语的相关性和置信度计算,更重要的是,它允许更智能的检索:研究者可以依据词根检索,而不受变格或变位形式的限制。同时,它也为考虑句法结构的词汇计量分析打开道路。
对于 HIMANIS 而言,这些工具必须同时覆盖法语和拉丁语。第一个参考库由各个刊本的文本构成,这些刊本提供了第一部“词典”;在工程科学语境中,所谓“词典”就是带有词频统计的词表。语料外部的参考库既包括定义术语但不提供词频的词典,例如拉丁文的 Du Cange 和 NGML,法文的 Godefroy、Tobler-Lommatzsch 和 DMF 2015;也包括词形还原工具,例如用于拉丁文的 TreeTagger 和 Collatinus,以及用于法文的 LGeRM。对于拉丁文,作为比较,我们还拥有《拉丁教父文集》和 CBMA 中的词频数据。
这些工具尽管具有强大的启发性潜力,但尚未被整合进 HIMANIS 的处理流程,因此这里还无法评估它们的贡献。
命名实体
HIMANIS 的词语索引还可以通过另一个领域得到改进,即命名实体领域。首先是地名和人名,其次也包括概念和主题。
若干参考库来自法国国家档案馆围绕王室文书库登记册开展的工作:简单来说,就是将系统性清册和地理性清册附录中已经出版的索引 OCR 化之后得到的内容。HIMANIS 的合作方对这些索引进行了清理,随后进行回溯转换,并借鉴 EAD 所提出的模型,利用 <index> 和 <term> 元素,在文书编号与被索引术语之间重新建立结构性链接。至于各个清册之间并不相同的参见关系,我们没有进行结构化处理。
得益于 A2iA 产生的高质量手写文字识别结果,我们也能够恢复手稿清册中的分析内容和地理索引条目。这些索引的优点是,它们直接针对所研究的卷册,并且包含了摘要中缺失的识别信息。不过,它们也混合了地名和人名;而如何妥善处理包含地名的人名,本来就是中世纪研究中的一个常见难题。地理性清册并不覆盖整个领土;尤其重要的是,所有这些索引只给出现代形式,因此不能为文本识别提供古形词典。于是,它们一方面可以作为衡量自动词语索引精确度的基准:它们并不提供“标准答案”,而只是提供一个最低限度的待识别出现项清单,而且并不给出其精确形式;另一方面,它们被回溯转换为电子形式,也为通过地图和时间轴进行数据可视化作准备,使地名彼此之间以及与其出现日期之间建立联系。
在外部参考库中,除了 GeoNames 和 Wikipedia,或者更准确地说 DBpedia 这类能够提供地理坐标的通用数据之外,我们还希望使用一系列地名字典。这些字典已经由法国历史与科学著作委员会按照特定 DTD 转换为 XML 格式。虽然它们同样不能覆盖中世纪王室文书库登记册所涉及的全部地理区域,但其价值在于能够提供古代形式和拉丁形式。
与语言学工具一样,命名实体参考库已经在项目第一阶段得到准备,但只会在第二阶段使用。
从数据到用户:众包、颗粒度、易用性与访问相关性
投入精力建立人名和地名等命名实体参考库,显然是必要的。因为使用者群体,无论是普通公众、家谱研究者,还是中世纪史学者,自然都会寻找这类信息。所有使用数字化档案的在线社群都能证明这一点;而它实际上只是延续了当初编制分析性清册时所要满足的需求。
然而,还有另一个方面也需要特别投入,因为它同样关系到使用者期待:即访问颗粒度的相关性,见图9。

图9:访问颗粒度与可视化环境
图中为一个模型,展示跨两页的一件文书以及关于该文书的信息。
事实上,任何使用纸本文书刊本的人都知道,首先必须判断自己使用的索引究竟指向页码,还是指向文书编号。Paul Guérin 版本的索引指向页码;分析性清册的索引则指向文书本身。登记册文本也面临同样的问题。对于计算机而言,这些词首先位于一张图像上,也就是位于一页上。然而,即便对于已经编制清册的部分,要确定每张图像的哪些区域属于哪一件文书,也是一件复杂的事情。
与人们可能想象的不同,在各件文书之间的空白处——如果确有空白的话——部分空间常常被用来抄写正文之外的说明,甚至被后来的标题、栏目和分析占据。在这种情况下,要把一页“切分”为若干件文书是困难的。此外,要把“图像区域”分配给“文书”,必须拥有文书清单、关于每件文书起止位置的完整信息,以及图像名称与实际叶码之间的对应关系。因此,基础设施必须具有多个层级:词语索引首先指向图像上的坐标;这些坐标指向页面;随后,这些坐标还必须与文书区域的坐标进行比对,以判断该词应归属于哪一件文书。
访问颗粒度及其与用户需求之间的关系,也可以促使研究者追问其他信息层级。如果单件文书是相关的基本层级,那么认证抄件,即 vidimus,以及插入文书,也可以接受特殊处理,以提高启发式相关性。这里同文本编辑一样,理论上可以选择不同的访问路径。同样,外交文书学家会希望进入另一种文本和图形颗粒度:此时页面中央的正文不再居于唯一中心,而让位于一些边缘信息;这些信息虽然位于边缘,却对研究文书库至关重要,例如题名、栏目、注释、校对说明,以及正文之外说明的处理方式。
访问颗粒度必须有一个易用性和认知层面的对应物:也就是一个能够按文书浏览的环境,其中每件文书都配备已有或已经回溯转换的信息,包括分析、刊本、学术索引和自动索引。这是 HIMANIS 从项目一开始就设定的目标。不过,尽管这看起来似乎最明显、最自然,却极难实现,因为它无法自动化,需要由具备专业能力的人员进行控制。至少,这些人员必须能够识别以罗马数字书写的中世纪叶码,判断一件文书是否延续到下一页,并核对编号与内容是否同最早的刊本和清册中的正文内容及编号相一致;而我们知道,这些编号本身经常有误,见图9。
项目最终选择在结束时提供全部信息的访问,即便其中有些信息尚未经过核验。这既适用于按文书进行的分段,也适用于索引本身。这种人工干预已经被整合到 MONK 基础设施之中;它允许用户核验索引条目,并在必要时予以纠正,无论是分段,还是词值本身,见图10。

图10:MONK 工作界面
图中显示索引修正以及不同被索引形式的可视化。
回到索引与电子版本
无论是否有用户干预,也无论是否能够“传播”阅读结果和改进结果——也就是说,识别出其他以相似方式被索引的词形,并为它们赋予新的标签——我们现在都必须回到索引与编辑之间的一个本质差异。事实上,索引虽然在语义上更贫乏,但在呈现方式上却更加丰富。它不是一个“扁平”的文本,而是一个“格状结构”:对于图像上的每一个词,都存在多种可能的解释,而每一种假设都带有一个置信度指标。
当然,可以把得分最高的假设依次拼接起来,从而还原出一个线性文本。但这样做会使用户面对大量错误,而且这些错误明显不如一种“内容协商”模型那样容易解释。在内容协商模型中,用户可以直接选择自己在检索中愿意接受的信息噪音程度。图10中,正确索引就在第二位。这两种访问方式具有不同功能和不同价值:线性阅读,即便有错误,也优先考虑意义;而索引则优先考虑信息原子,并为根据共现关系、词汇网络和语义网络重新创造意义作准备。
即便在对被索引文本进行线性还原的情况下,即便地名识别可以自动预先准备,我们距离一种数字批判版本或学术电子版本仍然很远。这里既缺少文本见证的识别和校勘,也缺少全部文本批判和历史批判。
评估不确定性:精确率、召回率与可用性
如果目标并不是制作批判版本,那么仍然有必要评估索引或还原文本的质量。正是在这里,不同学科的结合带来了新的内容。事实上,在工程科学中,衡量结果质量是常规做法,尤其是用“精确率”和“召回率”来衡量。就索引而言,精确率指的是:在被识别为符合某项查询的出现项中,正确出现项所占的百分比。召回率则指的是:在语料中所有出现项之中,被正确识别出来的出现项所占的百分比。
这种经过测量和量化的方法,在数字人文学中并不令人惊讶;但它深刻改变了传统校勘学的方法。在传统校勘学中,假定的完美几乎不给“评估”这一概念留下空间,随后也几乎不给“不确定性”这一概念留下空间。
衡量索引性能,要求构建一个具有代表性的“标准答案”。然而,代表性无法预先定义;而用于评估索引质量的标准答案,也会带来方法问题。事实上,一方面,这些材料是曾经用于训练的刊本,因此并不是一种中立的衡量标准,因为机器可能已经“背下”了相关段落;另一方面,清册索引不仅提供的是规范化和现代化的形式,而且还由人名和地名实体构成,而这类实体识别得更差,因为它们无法由语言模型预测出来。
通过精确率和召回率这双重指标进行评估,是一种清楚的性能指标,但很难建立。此外,它对于历史研究的确切意义仍然有待确定。例如,精确率的影响其实相对有限,因为历史学家若被免除了阅读 70000 页 的负担,往往很愿意自行剔除错误出现项。相反,如果研究目标是穷尽性,或者例如要通过最早出现的位置识别某一现象的兴起,那么召回率就会产生重要影响。
在许多情况下,历史学家只是希望通过单件文书寻找某个事实;此时,平均召回率对于这种点状研究来说并不重要,因为研究者首先面对的是“找到了”与“沉默”之间的二分选择。然而,面对“沉默”,新工具提供了新的手段,也可以发展出一些可以称为“敏捷”的检索策略,这一术语来自软件开发和项目管理。传统索引中的“沉默”意味着检索的终点;但按词查询则提供了绕过局部沉默的方法。若某个词被误识别,研究者可以检索相近形式,或者检索可能出现在同一语境中的其他词。
另一个性能指标,是应用于每一次索引的置信度指标。它能够提供更加丰富的阅读结果,而不局限于得分最高的结果。但如何用它评估性能?它对可用性又有什么影响?
这些问题一旦应用到书写者识别上,就更加棘手。Jean Guérout 曾提出识别 JJ37 至 JJ50 登记册中109种不同且活跃的手写字体;但在相关表格之前,他先写下这样一句说明:“我们知道,研究一个文书库的书写具有多么大的困难;人们也可能不得不追问,由此在不同书手之间作出的区分,其结果是否经得起所有考验。”那么,应当如何使用这一“标准答案”?
中世纪史料中的书写者识别,如今已经形成一套既有书目。然而,在缺少内部特征证明的情况下,古文字学家仍然处于归属判断之中;划定“同一”与“他者”之间的边界,是其责任和批判判断的问题。因此,在区分书手方面,严格来说并不存在真正可能的量化评估。相反,writer identification,即书写者识别技术,也最有能力客观衡量一个同质社会环境中的“图形变化”(cambio grafico),例如文书库书记员群体内部的书写变化。
在图书馆、数字档案和电子版本之间,元数据循环中正在出现一个新阶段。改进型检索工具的合并、整合和开放,尤其是手稿清册和打字稿清册的数字化,应当伴随史料数字化和刊本利用一同展开,并提供数字化史料、检索工具和刊本之间的导航。整个系统又因能够进入“全文”而得到丰富;“全文”成为新的颗粒度层级,也就是单件文书“文本”的层级。
在这个世界中,中世纪史料的被索引文本只是众多元数据之一。HIMANIS 项目由此让我们看到电子版本的一个意想不到的阶段:说句“可怕的话”,它重新恢复了对原始文本交付的重视,即便这种文本可能存在错误。这类似于语言学转向和校勘学作为科学建立之前,早期博学家的文本交付方式。今天,这种做法重新变得可能,并且可以得到辩护,因为文本并不是以线性且固定的方式被交付,而是以可塑索引的形式被交付;正因如此,它并不伪装成其他东西。它承认过去的批判工作,也能够容纳未来的批判工作。
这一整体位于开放关联数据的世界中。它使得根据被索引地名对文书进行地图可视化成为可能,并为项目界面之外的再利用打开道路。以自由许可证发布已创建的元数据,无论是词语索引还是识别信息,并不能穷尽知识产权问题;因为这里还涉及某些团队生产的技术,而这些团队中有些是私人机构,并且参与商业市场竞争。仍然开放的技术挑战,很大程度上涉及语言模型的整合,以及对双语语料的适当管理:也就是说,除了文本识别之外,还要加入文书语言识别,以便提供更相关的结果。
如果说索引是通往一种电子版本的过渡阶段——尽管这种电子版本也许永远不会到来——那么它已经从现在开始提出了一个问题:如何把大数据转化为对中世纪史学家有意义的信息。对地名和人名参考库的利用,并不能避免“假阳性”,而且会使网络分析变得复杂;中世纪大量同名现象要求研究者极其谨慎,因为数字人文学始终面对双重威胁:要么重复显而易见的东西,要么得出错误的结论。
我们必须学会解释不确定性,或者有意识、有限度地使用不确定性,以便说明“很可能”究竟意味着什么,并使历史推理更加“可追踪”。这要求历史学家比在质性分析中更进一步地界定:其史料对于所处理问题的相关性、条件性假设的质量,以及启发式方法的适用性。
Notes
1 FP7-ERANET-2013-RTD. Grant Agreement n° 618104. Cf. http://cordis.europa.eu/project/rcn/191238_fr.html et https://www.era-learn.eu/network-information/networks/jpi-cultural-heritage. Description de l’appel : https://www.era-learn.eu/network-information/networks/heritage-plus/jpi-cultural-heritage-and-global-change.
2 Registrum veterius (1204-1212), Bibliothèque apostolique vaticane, Ottoboni, lat. 2796.
3 Voir notamment Y. Potin, La Mise en archives du trésor des chartes (xiiie–xixe siècle), thèse pour le diplôme d’archiviste-paléographe, Paris, 2007, positions : http://theses.enc.sorbonne.fr/2007/potin.
4 La nova compilatio, qui prévoyait la mise au point d’un nouveau cartulaire-registre aux rubriques encore plus nombreuses, n’a semble-t-il jamais dépassé le stade de projet.
5 Les actes relatifs aux foires et marchés font l’objet d’une étude et d’une édition par les étudiants de l’Université Paris 7, sous la direction de Judicaël Petrowiste.
6 H. Larcher-Maurin, « Tam Parisius quam alibi ». Unité et pluralité de la chancellerie royale au temps de Charles VII, thèse pour le diplôme d’archiviste-paléographe, Paris, 2008, positions : http://theses.enc.sorbonne.fr/2008/larcher.
7 Tome 1 : https://www.siv.archives-nationales.culture.gouv.fr/siv/rechercheconsultation/consultation/ir/consultationIR.action?udId=&consIr=&irId=FRAN_IR_000421&frontIr=&auSeinIR=false ; tome 3 : https://www.siv.archives-nationales.culture.gouv.fr/siv/rechercheconsultation/consultation/ir/consultationIR.action?udId=&consIr=&irId=FRAN_IR_000423&frontIr=&auSeinIR=false ; tome 4 : https://www.siv.archives-nationales.culture.gouv.fr/siv/rechercheconsultation/consultation/ir/consultationIR.action?udId=&consIr=&irId=FRAN_IR_000424&frontIr=&auSeinIR=false.
8 Les index de ces registres, issus des règnes de Louis X, Philippe V et Charles IV, n’ont pas encore été publiés. Jean Guérout travaille néanmoins sur la finalisation des index des noms de lieux.
9 Le format de document électronique EAD (Encoded Archival Description) est un format basé sur le langage XML qui permet de structurer des descriptions de manuscrits ou de documents d’archives.
10 Plus précisément, les personnes qui ne sont pas identifiées comme des producteurs et qui ne bénéficient donc pas de notices d’autorité dans le référentiel ad hoc ne sont pas indexées par le système – cela représenterait d’ailleurs, compte tenu du nombre faramineux de noms d’individus que l’on trouve dans les archives, une masse de données considérable à gérer par le système d’information. Les noms de lieux sont quant à eux enregistrés dans un référentiel dédié. L’étape suivante consiste à faire le lien entre un composant <c> d’un inventaire en EAD et les entités pertinentes de ce référentiel.
11 O. Guyotjeannin et al., « Un acte diplomatique en TEI », École des chartes, http://developpements.enc.sorbonne.fr/diple/schema/acte. F. Glorieux et V. Jolivet, « Actes royaux du Poitou, schéma de balisage », École des chartes, Corpus, 2012, http://corpus.enc.sorbonne.fr/actesroyauxdupoitou/schema.
12 F. Clavaud, « The Digital Edition of the Medieval Charters of the Abbey of Saint-Denis : first Results and Prospects », Digital Medievalist, 8 (2013), https://journal.digitalmedievalist.org/articles/10.16995/dm.48/.
13 Sur ce point, nous divergeons du modèle proposé par l’École nationale des chartes, qui utilise <orgName> avec @type =”repository” et <num> avec @type =”idno”.
14 Le latin domine d’abord (80 % d’actes en latin) jusqu’en octobre 1330, date à partir de laquelle le français (80 % d’actes en français) le supplante. La latin redevient largement majoritaire sous Jean II. À partir de Charles V une pratique linguistique se met en place, principalement en fonction de la nature des actes enregistrés. Cf. S. Lusignan, La Langue des rois au Moyen Âge. Le français en France et en Angleterre, Paris, 2004.
15 Agence Nationale de la Recherche, « Projet ANR. Corpus, données et outils de la recherche en sciences humaines et sociales (Corpus) 2012 : projet ORIFLAMMS », 2013, http://www.agence-nationale-recherche.fr/Projet-ANR-12-CORP-0010 ; Consortium Oriflamms, « Compte rendu final du projet ORIFLAMMS/ORIFLAMMS Final report », Billet, Écriture médiévale & numérique | Écritures médiévales et lecture numérique. Carnet du projet ORIFLAMMS (Ontology Research, Image Features, Letterform Analysis on Multilingual Medieval Scripts), 4 janvier 2017, http://oriflamms.hypotheses.org/1592.
16 D. Stutzmann, « Ontologie des formes et encodage des textes manuscrits médiévaux. Le projet ORIFLAMMS », Document numérique, 16/3 (2013), p. 81-95, doi:10.3166/DN.16.3.69-79 ; D. Stutzmann et al., « From Text and Image to Historical Resource : Text-Image Alignment for Digital Humanists », Digital Humanities 2015, Sydney, 2015, http://dh2015.org/abstracts/xml/STUTZMANN_Dominique_From_Text_and_Image_to_Histor/STUTZMANN_Dominique_From_Text_and_Image_to_Historical_R.html.
17 T. Bluche, D. Stutzmann, C. Kermorvant, « Automatic Handwritten Character Segmentation for Paleographical Character Shape Analysis », 2016 12th IAPR Workshop on Document Analysis Systems (DAS), 2016, p. 42-47, doi:10.1109/DAS.2016.74.
18 http://corpus.enc.sorbonne.fr/actesroyauxdupoitou/.
19 P. Guérin et L. Celier, Recueil des documents concernant le Poitou contenus dans les registres de la chancellerie de France, 14 vol. , Poitiers, 1881, http://gallica.bnf.fr/ark:/12148/bpt6k2095072.
20 Il faut souligner ici que les technologies utilisées par A2iA et UPVLC exploitent uniquement l’information ligne par ligne (même quand on dispose d’un alignement au niveau des mots, c’est la ligne qui sert à apprendre).
21 Les autres éditions d’actes n’ont pas été utilisées, parce qu’elles portaient sur des volumes non numérisés en début de projet. Le formulaire d’Odart de Morchesne (Paris, BnF, fr. 5024), dont le microfilm a été numérisé par la BnF et dont le texte a été édité par l’École nationale des chartes (http://elec.enc.sorbonne.fr/morchesne/), pourra servir à mesurer la qualité d’une transcription générée automatiquement.
22 https://transkribus.eu/Transkribus/.
23 Du Cange (http://ducange.enc.sorbonne.fr) ; Godefroy (http://www.eonet.ne.jp/~ogurisu/francais/sect0013.html) ; Tobler-Lommatzsch (http://www.uni-stuttgart.de/lingrom/stein/tl/allgemeinf.htm) ; Novum Glossarium Mediae Latinitatis (www.glossaria.eu/ngml/) ; Dictionnaire du Moyen Français (DMF 2015, http://www.atilf.fr/dmf/).
24 TreeTagger (http://www.cis.uni-muenchen.de/~schmid/tools/TreeTagger/) ; Collatinus (http://outils.biblissima.fr/fr/collatinus/) ; LGeRM (http://www.atilf.fr/LGeRM/).
25 CBMA (http://www.cbma-project.eu/). Nous remercions Nicolas Perreaux de nous avoir communiqué ces instruments.
26 Les entrées d’index étant reliées à un numéro d’acte de l’inventaire et l’analyse indiquant cote, numéro d’acte et folio, il semblait envisageable d’utiliser l’information selon laquelle un mot « ressemblant » à l’entrée d’index se trouve « dans les environs » de telle image (parce qu’un acte peut s’étendre sur plusieurs pages). Un tel processus se révèle à la fois trop flou et trop contraignant pour être implémenté dans l’analyse de l’intelligence artificielle.
27 http://cths.fr/dico-topo/.
28 Nouveaux usages, nouveaux usagers : quels contenus, quels services allons-nous offrir ?, Actes des rencontres annuelles de la section Archives départementales (RASAD) de l’Association des archivistes français, Gazette des archives, 227 (2012) ; H. Wrede et ICARUS (International Centre for Archival Research), « What is the Topotheque ? Topotheque Portal », Topotheque. Our History, our Archive, 2015, http://www.topothek.at/en/what-is-the-topotheque/.
29 École nationale des chartes, Conseils pour l’édition de textes médiévaux, fascicule II, Actes et documents d’archives, Paris, 2001, p. 211-219.
30 R. McNicholl et T. Miles-Board, « TranScriptorium : Computer-Aided, Crowd-Sourced Transcription of Handwritten Text (for Repositories) », dans 10th International Conference on Open Repositories (OR2015), 2015 ; TranScriptorium et J. Sánchez Peiró, « Interactive-Predictive Handwritten Text Recognition. TranScriptorium », TranScriptorium, http://transcriptorium.eu/interactive-predictive-handwritten-text-recognition/ ; J. Andreu Sanchezet al., « ICFHR2016 Competition on Handwritten Text Recognition on the READ Dataset », dans Proceedings of International Conference on Frontiers in Handwriting Recognition, 2016, p. 630-635.
31 P. Sahle, « Scholarly Digital Editions. Complete List A-Z », 2008, http://www.uni-koeln.de/~ahz26/vlet/vlet_a-z.html ; P. Sahle, Digitale Editionsformen : zum Umgang mit der Überlieferung unter den Bedingungen des Medienwandels, 3 vol, Norderstedt, 2013 ; E. Pierazzo, Digital Scholarly Editing : Theories, Models and Methods, Farnham (Surrey)/Burlington, 2015.
32 J. Glénisson et J. Guérout, Registres du trésor des chartes : inventaire analytique, 1 : Règne de Philippe le Bel, éd. R. Fawtier et A. Chamson, Paris, 1958, p. XVLIII-LV.
33 J. Smit, « Paleography and the Digital Middle Ages : Experiences with the Groningen Intelligent Writer Identification System (GIWIS) », New York, 2010 ; Id., « Meten is weten ? De toepassing van het Groningen Intelligent Writer Identification System (GIWIS) op Hollandse kanselarij-oorkonden, 1299-1345 », Bulletin de la Commission royale d’Histoire, 176/2 (Chancelleries princières et Scriptoria dans les anciens Pays-Bas, xe–xve siècles/Vorstelijke kanselarijen en Scriptoria in de Lage Landen, 10de-15de eeuw, 2010), p. 343-60 ; V. Christleinet al., « Automatic Writer Identification in Historical Documents : A Case Study », Zeitschrift für digitale Geisteswissenschaften, 2 (2016) ; A. A. Brinket al., « Writer Identification Using Directional Ink-Trace with Measurements », Pattern Recognition, 45/1 (2012), p. 162-171, doi:10.1016/j.patcog.2011.07.005 ; L. Schomaker et M. Bulacu, « Automatic Writer Identification Using Connected-Component Contours and Edge-Based Features of Uppercase Western Script », IEEE Transactions on Pattern Analysis and Machine Intelligence, 26/6 (2004), p. 787-98, doi:10.1109/TPAMI.2004.18.