档案高质量数据集的建设成本:人员、周期与分阶段投入
档案高质量数据集不是一次性标注任务。本文从人员、周期、复核比例和自动化边界分析建设成本,并给出分阶段落地办法。
档案高质量数据集的建设成本:人员、周期与分阶段投入
档案高质量数据集不是一次性标注任务。本文从人员、周期、复核比例和自动化边界分析建设成本,并给出分阶段落地办法。
文章属于行业研究与技术科普,不替代项目设计、合规审查或招投标技术文件;引用时应保留来源、标题和原文地址。
上一篇文章讨论了高质量数据集应当保留哪些关系和证据。真正进入项目预算时,还要回答一个更具体的问题:这些工作需要多少人、做多长时间,哪些可以交给机器,哪些必须由档案人员确认?
我的判断是:全量建设的成本很高,不适合作为普通数字档案项目的一次性交付;小范围建设可以落地,前提是从真实利用问题开始,按阶段验收,让投入随着实际收益增加。
如果把上一篇提出的完整标准直接变成今天档案行业普遍开展的建设项目,我的判断仍然是:“没法应用到现在的档案行业,至少现在当成项目做不太现实。” 这句话说的是一次性、全量、按高标准交付的项目方式,不是说高质量数据集没有价值,也不是说档案行业永远做不了。当前更现实的做法,是把它拆成若干个能被业务使用、能被验收、能控制投入的小项目。

先分清成本对应的工作
档案项目里经常把几种工作都叫作“做数据集”,预算和预期因此很容易失真。上一篇文章已经展开过数据关系,这里只保留成本判断所需要的分层。
把一批文件扫描、转成 OCR 文本,再切成若干段,属于数据准备。它解决的是“机器能不能读到内容”。
给问题配答案、给字段配正确值、把答案和页码对应起来,属于标注和评测。它解决的是“系统答得对不对,为什么对”。
把目录、电子文件、组件、元数据、开放状态、保管期限和版本关系持续维护起来,属于档案资源治理。它解决的是“这条结果能不能在业务里长期使用”。
三种工作所需要的人、时间和验收标准都不一样。一个项目如果只报“处理一百万页”,却没有说明做到了哪一层,数字很容易变成宣传材料。
这里还要补一个常被忽略的成本变量:数据从哪里来,以及由谁组织建设。数字罗塞塔公众号的杨博士在相关文章中提到,基于馆(室)藏存量档案即可建立的专题数据库,可以采用独立实施;但大型专题数据库如果仍由单个单位独立承担,容易遇到档案资源不足、人力有限的问题,这时可以采用跨区域、跨层级、跨部门的合作实施方式。这个判断对高质量数据集同样适用:从已有馆藏中筛选一批主题明确的材料,和面向多个部门征集新材料,根本不是同一种项目;只做资源聚合,和进一步提取人名、机构、事件及其证据关系,也不是同一种工作量。
这意味着,不能看到“建设数据集”几个字就直接按页数估价。存量档案的专题汇集,主要成本在筛选、挂接和质量核验;内容提取的成本在业务规则、抽取结果复核和错误返工;专项汇集还要加上前端征集、跨部门协调、材料接收和权属确认。大型专题如果资源分散,合作实施可能比单个单位独立承担更现实;扫描、录入等事务性工作可以外包,但选题、筛选、质量把关和安全责任不能一起外包出去。
可以先用下面这张表把成本边界分开。
| 工作层次 | 主要产物 | 能回答的问题 | 工作量特征 |
|---|---|---|---|
| OCR 与切分 | 页面图像、OCR 文本、段落或页片段 | 机器能不能读到 | 规模大,自动化程度较高 |
| 关系整理 | 档号、组件、页码、字段、版本、开放状态 | 这段内容属于谁,能不能给别人看 | 需要系统和规则配合 |
| 标注评测 | 问题、标准答案、证据位置、失败类型 | 答案是否正确,错在哪里 | 业务人员投入明显增加 |
| 持续治理 | 版本、复核记录、权限日志、回归结果 | 系统升级后是否还能复核 | 是长期运维工作 |
如果目标只是做内部检索试验,第一层加上一部分第二层可能已经够用;如果目标是训练模型、验收智能问答或支撑开放利用,第三层和第四层的投入就必须单独计算。项目最容易犯的错误,是用第一层的预算承诺第四层的结果。
成本主要花在哪里
成本高,原因并不在档案人员效率低,而在档案数据里有很多机器无法凭空判断的关系。
比如一页扫描件里出现三个日期。一个是文件形成日期,一个是签发日期,一个是附件中的历史日期。机器可以把三个日期都识别出来,却不能仅凭字面决定哪个日期应该写进哪个目录字段。
再比如一个项目有请示、批复、合同、变更单和验收材料。把每一页转成文字并不难,难的是知道它们属于同一个项目,知道某份变更单替代了哪一版合同,知道用户问“最终金额”时应该引用哪一份有效材料。
权限也一样。档案开放状态不是一段可以从 OCR 文本里推出来的自然语言。它可能来自开放审核记录、利用审批结果、密级或敏感信息处理规则。把这些信息混在文本里交给模型,等于把制度判断推迟到模型回答时,风险就已经发生了。
因此,人工工作主要集中在四个地方:
· 对机器无法确定的关系作出业务判断;
· 对机器生成的候选值进行抽查、确认或驳回;
· 为错误样本写清错误原因和处理办法;
· 在权限、版本和开放状态变化后重新确认影响范围。
换模型不能消除这些工作。模型可以减少初筛和录入,却不能替档案人员承担制度责任。
一次性全量做,为什么通常不划算
假设一个单位有几百万页数字化材料,项目组决定全部加工成细粒度数据集。表面上只是多几个字段,实际会形成一条很长的流水线:扫描质量检查、OCR、目录挂接、组件关联、字段复核、证据标注、权限确认、版本登记、评测和回归。
其中任何一环变动,后面的结果都可能要重跑。
OCR 引擎换了,原来的片段边界可能变化;目录修订了,样本对应的档号可能变化;开放状态调整了,评测题的可见范围可能变化;业务人员修订了标准答案,模型评测结果也会变化。全量建设并非把一堆文件加工一遍就结束,它还意味着建立一套新的资源维护责任。
如果项目没有明确的使用场景,全量标注往往会出现三种浪费:
第一,标注了很少被问到的材料。团队花了大量时间做细节,用户却仍然找不到最常用的那批档案。
第二,过早固定了错误规则。没有经过真实问题检验,字段定义、切分方式和答案口径可能都要返工。
第三,建完以后没人维护。新接收的电子文件、开放状态变化、目录修订和 OCR 重跑没有进入原来的流程,半年以后数据集就和实际系统脱节。
所以,全量一次性建设的成本判断基本成立。项目交付目标应当从“全部做完”改成“先证明这套方法值得继续做”。
这里也需要承认一个现实:对这套建设方法的质疑,并不等于反对数据治理本身。有人认为,文章中的拆解有一定道理,但不见得所有档案单位都必须按同样的深度和顺序去做。这个判断是成立的。档案虽然是一个细分领域,但不同地区、不同层级、不同门类之间的业务条件差异很大,馆藏规模、数字化基础、人员结构、开放要求和经费来源都不一样。高水平数字档案馆或数字档案室的建设,不能靠一套脱离实际的统一清单替代现场判断。
领至科技在项目中更看重“因地制宜、因材施教”:基础较弱的单位,先把归档、检测、目录与原文挂接、权限和备份这些底座做稳;已有较好数字资源的单位,再从高频利用的专题或问题切入,逐步增加内容提取和智能检索能力;资源分散、目标较大的专题,则考虑跨区域、跨层级、跨部门合作。高质量数据集的标准可以保持严格,但建设的范围、节奏和组织方式必须允许调整。小而可靠的数据集可以成为现实起点,要求所有单位立刻用同样的投入完成同样规模、同样深度的建设,才是真正不现实的做法。
可行的起点:先选一个问题,而不是先选一批文件
很多项目启动时先问“我们有多少档案”,更适合的第一个问题应该是:“用户最常问、最值得改善、又能拿到证据的问题是什么?”
比如,不要先承诺把建设项目档案全部结构化,可以先选一个明确问题:某类建设项目从立项到验收,哪些材料已经归档,缺什么,最终批复金额以哪份材料为准?
这个问题会自然带出需要的数据:项目名称、阶段、档号、组件、页码、有效版本、开放状态和答案依据。它也能让项目组判断,哪些关系会在实际利用中发挥作用,哪些字段只是看起来完整。
一个可落地的第一阶段可以只有以下范围:
| 范围 | 建议控制方式 |
|---|---|
| 门类 | 只选一个业务门类 |
| 项目或全宗 | 选一个资料相对完整的范围 |
| 问题 | 先收集 20 到 50 个真实问题 |
| 样本 | 每个问题准备能支持回答的少量档案 |
| 人工复核 | 只复核高风险字段和评测证据 |
| 验收 | 先看证据回跳、权限过滤和错误定位 |
这里关键在于把工作范围锁在一条能跑通的链路上,数字本身反而不是首要问题。一个回答如果能回到正确档号、组件和页码,普通用户无权查看的片段没有进入召回,错误可以定位到具体 OCR 页或版本,这个小试验就已经能回答一个关键问题:继续投入以后,收益会不会超过治理成本。
把人工用在最贵的地方
降低成本要先区分“机器可以先做”和“必须由人判断”的工作,不能只做简单的减人。
机器适合做页面质量初筛、OCR、版面分析、候选字段抽取、重复内容检测、链接完整性检查和评测题的初步召回。它们的共同特点是:可以给出候选结果,也可以接受失败和重跑。
人工应该优先处理日期冲突、责任者冲突、项目关系、版本效力、开放状态、敏感信息、证据位置和最终验收。它们的共同特点是:错了以后会影响业务判断、权限或对外利用。
可以给每种任务设一个简单的处理状态:机器候选、人工待定、人工确认、人工驳回、限制使用、需要补充材料。这样,人工无需从空白开始录入,而是在机器候选上做判断,同时把判断结果留下来。
置信度也应该用于分流,而不是拿来装饰界面。比如,OCR 质量高、字段前后关系一致、目录和原文互相印证的样本,可以进入抽查;低置信度、存在冲突或涉及开放状态的样本,进入人工队列。阈值不能拍脑袋设定,要用一小批真实样本测出来,并且每次规则变更后复测。
这会带来一个很现实的结果:不是所有页面都需要同样精细的标注。高频利用、容易出错、对权限敏感的材料值得精做;低频且风险低的材料可以先保持可检索,等真实需求出现以后再加深处理。
标注评测可以怎样提速
标注评测并不意味着让档案人员逐页从空白开始填写。技术手段可以把大量机械性工作提前完成,把人的时间集中到机器最没有把握、业务风险最高的地方。
第一步是机器预标注。OCR、版面分析和信息抽取模型可以先给出题名、日期、责任者、项目名称、候选证据页和相似材料。人工看到的是一组待确认结果,而不是一张空表。预标注必须保留原始候选、修改前结果和最终确认值,不能只保存最后的答案,否则后面无法判断机器到底错在哪里。
第二步是按置信度分流。字段格式、目录挂接和页码连续性可以先用规则检查;语义模型再处理项目关系、事件归属和复杂字段。高置信度且前后关系一致的样本进入抽查,低置信度、字段冲突、同名对象、版本不一致和涉及开放状态的样本进入人工队列。置信度不是装饰在界面上的分数,必须经过一批真实样本校准,能够说明哪些样本值得优先复核。
第三步是让系统记住人工已经解决过的问题。同一类文件可以复用字段定义、标注界面和相似样本的候选结果,但不能把相似直接当成正确。对于同一项目、同一批次或同一格式的材料,系统可以优先推荐历史判断,人工确认后再写入新版本;一旦出现例外,就把它作为新的反例保留下来。
第四步是把争议单独处理。普通字段可以按抽查比例复核,开放状态、敏感信息、版本效力和最终标准答案则应由业务人员确认,意见不一致时进入仲裁队列。双人复核不必覆盖每一页,但高风险判断不能因为追求速度而改成机器自动通过。
最后,评测结果要自动统计。检索命中率、证据页码准确率、字段一致性、拒答是否正确、权限拦截是否生效和版本更新前后的回归结果,都可以由程序生成报告。人工需要解释异常,不必再花时间逐条抄写统计结果。
这套分工可以概括为:机器扩大处理范围,规则发现明显问题,人工确认业务意义,评测证明改进是否有效。它降低的是每条样本的人工成本,不会把高质量数据集变成“模型批量生成、人工盖章”的快速包装。
第二种办法:把数据集分成三种用途
档案项目不应该把“训练数据集”当作唯一目标。很多团队一提数据集,就开始讨论给大模型微调,实际最先需要的往往是检索和评测数据。
检索数据集用来测试系统能不能找到正确材料,重点是问题、相关档案、证据页和权限状态。
评测数据集用来测试答案是否可靠,重点是标准答案、证据引用、允许的回答范围和拒答条件。
训练数据集才是用来改变模型行为或训练特定能力的材料,它对数量、格式、一致性和授权的要求更高。
三者可以共享部分来源,但不能混成一个没有用途标记的文件夹。先做检索评测,通常比直接做训练集便宜,也更容易看出问题究竟在数据、检索还是模型。
一个小型项目如果发现,系统找不到材料的原因是档案组件没有挂接,或者权限过滤没有前置,那么此时继续微调模型,只会把问题掩盖在更流畅的回答里。先把数据关系修好,往往比增加训练样本更省钱。
坏样本也要算成本
坏样本不需要无边界地收集。成本控制的办法,是让每类坏样本都对应一个具体的系统问题,并把复核范围限定在能影响验收结论的样本上。
例如,保留几页典型的低质量 OCR 页面,用来测识别失败后的处理;保留几组页码错位样本,用来测证据回跳;保留同名项目和旧版本材料,用来测排序和版本判断;保留几条权限受限材料,用来测检索阶段是否拦截。
每类样本先有一个失败假设,再决定要不要进数据集。没有对应测试问题的“坏样本收藏”,很快也会变成另一堆没人维护的文件。
资料库追求覆盖,数据集还要能帮助项目判断系统好坏。样本少一点没关系,关键是每条样本都知道用来检验什么,否则它也会变成一项维护成本。
周期比页面数量更能说明成本
高质量数据集最容易在项目验收后失效。档案业务继续发生,数据集却没有维护入口,前期投入就会逐渐折损。
新接收一批电子文件时,接收检测和组件挂接结果应该能够进入数据集的资源记录;目录字段修订时,要能查到哪些评测题受影响;开放状态变化时,要能重跑权限相关测试;OCR 重跑时,要能标记受影响的证据片段;模型或检索参数升级时,要能复用原来的问题集做回归。
不需要一开始就做成庞大的数据治理平台。先为评测样本保留档案对象、证据位置、权限状态、数据版本和最后复核记录,后续自动化才有抓手。
从数字档案馆和数字档案室建设的角度看,这个思路也更稳妥。归档、检测、资源管理、权限控制、利用审批、长期保存和日志审计本来就是业务基础。AI 数据集应当从这些已有流程中取数据、取状态、取证据,而不是另建一套脱离档案系统的“AI 文件夹”。
一个项目怎么估算投入
不能给所有单位报一个固定人数,但可以按角色和阶段估算。小规模验证通常需要三类角色:熟悉档案业务和开放审核的人,能处理 OCR、检索和数据关系的人,以及把真实问题带进来并参与验收的业务使用者。
这不代表必须新增三个全职岗位。小试验阶段,角色可以由现有人员兼任,但责任不能没有归属。尤其是权限判断和标准答案确认,不能由只懂技术的人代替业务人员签字。
当样本量扩大以后,增加最多的往往是复核和质量管理工作。因为机器候选可以批量生成,冲突处理、抽查、返工和版本说明会随着范围扩大而增加。
更合理的预算方式是按“问题数、样本复杂度、自动化覆盖率和人工复核比例”估算,而不是按“页面数”单独报价。1000 页结构清楚、权限明确的材料,可能比 200 页关系混乱、版本很多、开放状态复杂的材料更容易处理。
可以把成本粗略拆成四个变量:
| 成本变量 | 需要估算的内容 | 对周期的影响 |
|---|---|---|
| 样本规模 | 页数、档案对象数、组件数 | 决定机器处理和初筛时间 |
| 关系复杂度 | 同名对象、跨卷关联、版本数量 | 决定业务判断量 |
| 风险等级 | 权限、敏感信息、开放审核要求 | 决定人工复核比例 |
| 变更频率 | 新接收、目录修订、OCR 重跑频率 | 决定长期维护成本 |
这四项里,页面数量只影响第一项。真正容易把项目拖长的,往往是关系复杂度和风险等级。项目立项时如果只问“多少页”,后面的预算通常会偏低。
小范围试验可以按四个阶段安排:第一阶段用少量真实问题验证检索和证据回跳;第二阶段扩大样本,测机器候选和人工复核的比例;第三阶段加入权限和版本变化,测回归;第四阶段才决定是否扩展到更多门类。每一阶段都应有停止条件,上一阶段没有证明价值,就不应自动进入下一阶段。
什么时候应该暂停扩张
数据集建设也需要退出条件。出现下面几种情况时,继续堆人往往不是好办法:
· 真实用户没有稳定的问题,项目只能自己编题;
· 样本的档案关系和开放状态本身还没有理清;
· 人工复核标准经常变化,却没有形成书面规则;
· 评测结果不能说明改进来自数据、检索还是模型;
· 数据集建成后没有接收、修订和回归入口。
这时应该缩小范围,先解决业务问题,而不是继续追求样本数量。数据集建设的价值来自它能改变一个真实决策或真实利用流程,不能只用完成了多少条标注来证明。
结论
档案高质量数据集的成本,主要来自业务判断、证据复核、权限确认和持续维护。全量建设需要较大的长期投入,不应包装成几个月内完成的简单标注项目。
小范围建设则有现实可行性:先选一个门类和一组真实问题,先验证检索、证据回跳和权限边界,再根据复核比例、用户收益和维护负担决定是否扩大。这样既保留了高质量数据集的要求,也把项目风险控制在可以管理的范围内。
如需了解档案 AI 数据集、智能检索评测和数字档案馆建设方案,可以点击文末阅读原文访问领至科技官网。