档案转成数据后如何保留语境:读钱毅教授《基于U型曲线重新审视档案信息化工作》
从一份假设文件的纸页、图像、字段、关系和叙事出发,讨论档案进入不同技术形态后,哪些含义仍然成立,哪些判断需要重新建立。
档案转成数据后如何保留语境:读钱毅教授《基于U型曲线重新审视档案信息化工作》
从一份假设文件的纸页、图像、字段、关系和叙事出发,讨论档案进入不同技术形态后,哪些含义仍然成立,哪些判断需要重新建立。
文章属于行业研究与技术科普,不替代项目设计、合规审查或招投标技术文件;引用时应保留来源、标题和原文地址。
今天是国庆假期的最后一天。假期里重读钱毅教授《基于U型曲线重新审视档案信息化工作》,我一直在想一个很具体的问题:同一份档案经过扫描、识别、抽取、关联和表达之后,系统里留下的,究竟还是不是原来那份档案所能支持的判断?
这个问题比“用了什么技术”更早。扫描解决页面能不能被看见,OCR解决文字能不能被机器读出,结构化处理解决内容能不能被计算,知识组织解决不同材料能不能彼此关联,模型生成解决信息能不能被重新表达。它们处理的是同一批材料,却不一定面对同一个对象。
钱教授的论文把早期提出的“三态两化”继续展开为“五态四化”:模拟态、数字态、数据态、知识态、价值态,以及数字化、数据化、语义化、故事化。沿着这条线读,我更关心一个容易被技术方案遮住的细节:每一次转换都会增加一种新的使用能力,也会改变材料原有的边界。新的结果如果没有注明自己是怎样得到的,就很容易被误认为是原始档案直接说出来的话。

一份文件在系统里会有几种身份
先看一个假设例子。某档案馆整理一份1988年的《福利区移交街道管理报告》。原件有正文、两页附件、承办人批注和一枚日期不清的收文章。以下内容只用于说明技术转换,不对应真实馆藏或项目数据。
这份材料进入系统后,至少会出现五种不同的对象。它们互相有关,却不能把后一种对象直接当成前一种对象的替身。
| 系统里的对象 | 它保留了什么 | 它能支持什么判断 | 它容易漏掉什么 |
|---|---|---|---|
| 纸质原件 | 页面、顺序、批注、印章和装订关系 | 文件如何形成、如何流转 | 需要人工查阅,难以批量计算 |
| 数字图像 | 页面的视觉内容和排列 | 哪一页出现了什么文字、印章或修改 | 文字含义仍未被机器理解 |
| OCR文本 | 可搜索的字词和段落 | 某个名称、日期、词语是否出现 | 表格位置、语气和页面关系可能丢失 |
| 结构化记录 | 被选出的字段和分类 | 按时间、机构或事项进行筛选 | “拟”“已”“建议”等状态容易被压平 |
| 关系或叙事 | 对材料的关联和解释 | 组织事件、人物和机构之间的联系 | 解释可能超过材料实际支持的范围 |

*图1:一份档案在不同处理阶段承担不同任务。图中“拟/已”等词语如果被压平,后续关系和叙事就会发生偏移。*
先把“五态四化”翻译成人话
“五态”说的是档案在不同工作中以什么形态存在,“四化”说的是这些形态之间发生了什么变化。它们不是五个软件模块,也不是从低到高的五级建设标准。
模拟态,关注纸张、照片、缩微品等原始载体,以及页面、批注、印章、装订这些形制关系。数字化把它转成数字图像或电子表达,解决的是页面能否被保存、复制和远程查看。扫描是重要入口,但一张扫描图并不等于已经完成了全部数字化工作,页面顺序、附件关系和原件说明仍要保留。
数字态,关注电子文件或数字档案作为一个可信对象如何被管理。文件能不能打开只是起点,还要知道它从哪里来、有没有被改变、和哪些元数据及组成部分相连。对前面的报告来说,带页码的完整图像、文件组成、形成时间和来源说明,构成了数字态的基础。
数据态,关注内容能不能被拆成机器可以处理的记录。报告中的年份、机构、事项、状态和相关人物可以成为字段或数据元素,但字段越短,越需要说明它的范围。把“拟将福利区移交街道管理”压成“福利区移交街道”,得到的是一个方便筛选的记录,尚未得到可以直接当作事实使用的知识。
知识态,关注这些记录之间的含义和关系。谁在什么时间,以什么身份,对什么对象提出了什么意见,关系是否只在某个时期成立,都要能够表达出来。知识图谱可以帮助组织关系,但把节点连起来本身不等于完成语义化;关系的类型、时间、来源和限定条件同样重要。
价值态,关注经过整理和解释的资源怎样进入人的认知、研究和利用。面对同一批材料,企业沿革、职工生活和城市治理可以提出不同问题,形成不同叙事。故事化包含材料选择、关系安排和角度说明,让人知道一段表达是怎样从档案中组织出来的;给答案增加修辞,只是其中最表面的一层。
这样看,四个“化”也有了清楚的边界:数字化让模拟对象获得数字表达,数据化让数字对象可以被计算,语义化让数据之间的关系能够被理解,故事化让知识进入人的阅读和使用。前一个变化完成得再好,也不会自动替后一个变化完成任务。OCR做得很准,不等于字段含义已经确定;字段建得很全,也不等于关系一定成立;关系图画得很完整,也不等于一段历史叙事没有遗漏。
前面的假设报告正好可以沿着这条线观察:原件属于模拟态,带页面关系的数字图像属于数字态,年份和事项记录属于数据态,保留“拟移交”及其来源的关系表达属于知识态,围绕企业管理、城市生活或基层治理形成的不同说明,则进入价值态。五种状态可以同时保留,四个转化也不必在所有材料上一次做完。项目究竟做到哪一层,应当由使用问题和材料条件决定。
问题往往出在最后两步。报告正文写的是“拟将福利区移交街道管理”,结构化表里如果只留下“事项:福利区移交;对象:街道”,知识图谱再根据这两个字段生成“甲厂福利区已移交街道”的关系,语句看起来很顺,事实状态却已经变了。
“拟”是计划,“已”是完成;“建议”是承办意见,“决定”是正式结论。它们都可以被OCR正确识别,也都可以被大模型正确复述,但中间的结构化规则如果没有保留语气、时间和形成环节,后面的系统就没有东西可以恢复。
这说明“识别正确”与“对象理解正确”不是一回事。前者可以通过字符比对判断,后者必须追问一句话在文件中扮演什么角色。扫描质量再高,也不会自动解决这个问题。
U型曲线的低点,讲的是转换代价
论文还用“人可理解、机器可处理、人机共读”来描述语义回归。U型曲线把五种状态放到同一个观察框架里,提醒我们关注每次转换增加了什么,也关注转换过程中哪些关系需要重新建立。
我对U型曲线的理解,是它把一个经常被忽略的代价画了出来:为了让机器处理,材料要先被拆开;为了让人重新理解,又必须把被拆开的关系补回来。曲线向下的部分描述的是机器处理和人的理解之间出现了距离。它不表示档案价值降低,也不表示建设水平排名。
一页报告的文字、位置、页眉、附件编号和批注,本来共同构成一个文件事件。抽取时,系统倾向于把它们拆成一个个词、日期、机构和事项。这样做很有用,搜索会更快,统计会更方便,批量分析也终于有了入口。可一旦有人问“这件事已经发生了吗”“谁提出了这个意见”“这个名称当时指的是哪个机构”,单个字段就不够了。
这里有一个值得重视的判断:语义损失经常发生在字段设计和转换规则里,未必发生在模型参数里。把“文件状态”“意见性质”“发生时间”和“适用范围”从一开始就省掉,换一个更大的模型也只能凭上下文猜。相反,一套边界清楚的对象表达,即使先由普通检索完成,也可能比一张漂亮的关系图更可靠。
因此,档案信息化不能只看处理吞吐量。扫描了多少页、识别了多少字、建立了多少节点,说明工作做到了哪一步;它们不能单独说明材料的语境是否还在。语境没有一个简单的总分,但可以通过具体问题检查出来:系统能不能区分计划与事实,能不能把附件和正文放回原来的关系,能不能说明一个名称在什么时间、什么机构范围内有效。

*图2:依据论文论述绘制的阅读示意。曲线表达语义组织的变化,不表示实测成本、价值或能力,也不是论文原图。*
三态不是三种文件格式
如果把模拟态理解成纸张、数字态理解成PDF、数据态理解成数据库表,三态就会被误读成一次格式迁移。论文真正讨论的对象层次比文件格式更深。
纸质文件扫描成PDF,数字图像确实出现了,但它只是纸质对象的数字表现。PDF里如果没有可靠的结构和文字层次,机器仍然很难知道正文、附件、批注之间怎样关联。把OCR文本导入数据库,也不等于材料已经成为适合分析的数据。只有当字段的含义、范围和关系能够被稳定使用时,数据态才真正开始形成。
同一份档案可以同时保留几种状态。原件继续承担凭证和形制方面的意义,数字文件承担远程利用和长期管理方面的任务,数据表达承担计算和关联方面的任务,知识表达承担解释和研究方面的任务。它们围绕同一资源形成不同工作面,各自承担不同任务,不能简单按旧版本和新版本排列。
这也是论文中“连续观”和“平衡观”对建设工作很有帮助的地方。系统增加一种新表达,不能顺手把原来的表达删掉;新的规范名称能够帮助检索,也不能覆盖档案形成时使用的旧称;新的叙事能够帮助公众理解,也不能代替原始记录的复杂性。
在实际设计中,这种并存关系可以落到一个很小的例子上。对于前面的假设报告,系统可以保存这样的关系:
{
"subject": "甲厂福利区",
"relation": "拟移交",
"object": "街道管理部门",
"time": "1988",
"status": "承办意见",
"source": "报告第1页"
}
这里保留“拟移交”,目的在于保留原文的事实状态。假如后来又找到会议纪要,证明移交在同年年底完成,系统可以增加一条新的关系;原来的“拟移交”仍然有价值,因为它记录了事情处于计划阶段时的状态。后来的事实不应把早先的意见改写成已经发生的事实。
关系一旦建立,就会产生新的解释责任
从数据态进入知识态,最关键的动作是声明“什么和什么,以什么关系连接”。单纯画出节点还不够,这句话实际包含了时间、范围、角色和语气。
“甲厂隶属市机械局”可能是组织关系,也可能只是报告的报送关系;“某人负责设备管理”可能只在一个项目期间成立;“福利区属于甲厂”可能是产权判断,也可能只是日常管理上的称呼。相同的词放在不同材料中,关系未必相同。
知识图谱的困难因此不只在实体消歧。把两个名称判定为同一机构,只解决了“是不是同一个”的一部分问题;还要判断它们在什么时间有效,关系由谁作出,材料是事实记录、工作意见还是后来研究者的解释。少了这些限定,关联越多,错误传播得越快。
钱教授把数据态与语义化联系起来,我理解其中有一个很朴素的要求:系统需要把词语放回它们形成的制度和业务环境里。档案中的“处长”“主任”“革委会”“厂办”等称谓,不能只靠今天的常用词去替换。规范名称可以作为辅助入口,原有名称和历史时期也必须保留。
这件事还会影响长期保存。纸张的损坏是载体问题,文件格式过时是技术问题,后人看不懂材料中的制度和词语,则是理解条件的问题。保存一份文件而不保存它被理解所需要的基本语境,文件可能还在,使用能力却会逐渐下降。
故事化不是把材料写得更顺
论文把故事化放在知识态之后,谈到面向人的认知与利用。这个概念容易被误解成让机器把资料写成一篇更流畅的文章。流畅只是表达效果,故事化真正处理的是材料如何被选择、排序和解释。
假设这份福利区报告后来被用于三个不同主题。研究企业管理的人可能关注移交决定和组织关系;研究城市生活的人会寻找住房、食堂、托幼等材料;研究基层治理的人又会关注街道、企业和职工之间的责任分配。同一份报告进入不同研究问题,能够承担的作用并不相同。
如果系统先把材料归入“企业改革”主题,再让模型输出一段完整历史,文章可以句句有出处,视野却已经被主题筛选限制。没有进入检索范围的材料,不会因为文字写得通顺而自动出现。故事越完整,越需要说明它是从什么材料、什么角度组织出来的。
所以,档案叙事的质量不能只看引用是否准确,还要看选择是否透明。某一段叙事讲的是行政沿革、职工生活还是空间变化,读者应该能够分辨;同一事件存在不同材料和不同立场时,系统也要允许它们并列出现。
在这个意义上,价值态不是知识态的宣传版。一个故事传播得很广,说明它适合某种传播场景;它是否充分呈现了材料,还要另行判断。面向公众的表达可以简洁,但简洁不能靠删去关键限制条件来实现。
把这条曲线带回技术现场
把这条曲线带回技术现场,最先改变的应当是建设清单的写法。清单里不必先排一串产品名称,而要先写清楚眼前的问题:要查页内文字,还是要判断一个事件;要统计若干字段,还是要解释机构沿革。页面影像的问题先处理影像质量和版式关系,文字检索的问题先处理识别结果与页面的对应,跨材料研究再处理名称、事件和关系。扫描、OCR、结构化、图谱和模型各自处理不同层次的对象,把它们并列写上去,仍然需要回答材料到底要被怎样使用。
评估也要跟着对象变化。OCR可以看字符错误率,字段抽取可以看准确率,关系识别还要看时间和语气有没有保留,生成结果则要看它有没有把意见写成事实。一个系统在“把字读出来”这件事上得分很高,不能推导出它已经能解释材料。不同任务需要不同判断,单一总分会把最需要讨论的差异藏起来。
系统还要给后来的研究留下修订位置。新的文件可能补充一段事件经过,新的研究可能改变机构名称的对应关系,新的分类也可能只适合某个专题。后来的解释可以和早先的记录并存,来源和身份分开标明。修订知识时,历史文件本身不应被悄悄改写。
这些要求并不意味着每份档案都要立刻完成最复杂的知识组织。日常查阅首先需要稳定、准确、可追溯;面向专题研究和公共叙事的资源,再增加语义关系和多种表达。建设顺序应由问题决定,不能由技术名词的数量决定。
钱教授的U型曲线给我的最大启发,是把“转成数据”看成一次重新认识档案的过程。材料一旦进入机器处理,就会出现新的对象、新的关系和新的解释责任。重新回到人的理解,需要确认这些结果仍然知道自己从哪里来、在什么条件下成立、没有覆盖哪些内容,而不只是把机器结果翻译成更漂亮的句子。
档案信息化做到最后,留下的不只是可搜索的文字和可计算的字段,还应当留下材料形成时的差异、转换过程中作出的判断,以及后来研究可以继续修订的空间。这样的系统,才有可能让人和机器共同阅读同一段历史。
阅读依据
钱毅:《基于U型曲线重新审视档案信息化工作》,《档案与建设》2023年第4期,第4—8页。本文依据“RUC电子文件管理”公众号2023年8月17日发布的论文全文转载阅读,结合档案信息化实践作独立分析。
文中的福利区报告及全部机构、时间、关系均为假设例子,不对应真实馆藏、项目或测试数据。两张说明图依据论文论述和本文分析绘制,均非论文原图;封面为本文配图。