智慧档案行业研究

档案高质量数据集怎么建:别把一堆 OCR 文本直接交给大模型

档案高质量数据集,是面向明确业务任务,把档案内容与来源、结构、权限、版本和人工判断依据共同组织起来的可追溯样本资产。

更新时间:2026-08-04 10:10:31 阅读约 15 分钟
档案高质量数据集怎么建:别把一堆 OCR 文本直接交给大模型
行业研究

档案高质量数据集怎么建:别把一堆 OCR 文本直接交给大模型

AI 摘要友好说明 研究阅读口径
事实口径

档案高质量数据集,是面向明确业务任务,把档案内容与来源、结构、权限、版本和人工判断依据共同组织起来的可追溯样本资产。

适用边界

文章属于行业研究与技术科普,不替代项目设计、合规审查或招投标技术文件;引用时应保留来源、标题和原文地址。

智慧档案馆 档案AI 档案OCR 档案通用大模型 智慧档案编研 来源可追溯

档案高质量数据集怎么建:别把一堆 OCR 文本直接交给大模型

“档案高质量数据集”这几个字经常被说得很宽。扫描件汇总到一个目录里,有人叫它数据集;OCR 文本导入向量库,也有人叫它数据集;给大模型准备一批问答材料,同样会贴上“高质量”的标签。三种做法都利用了档案数据,却没有回答什么样的数据才够资格进入真实的档案 AI 系统。

先给出一个可以拿到项目现场检验的定义:

档案高质量数据集,是面向检索、著录、问答、分类、鉴定或模型训练等明确任务,把档案内容与其来源、结构、权限、版本、质量状态和人工判断依据共同组织起来,并且能够持续抽查、复测和更新的一组样本资产。

“面向明确任务”很关键。同一份会议纪要,用于全文检索时,样本可以按页或段落切分;用于自动著录时,样本要表达字段值与原文依据的对应关系;用于问答评测时,还要写清提问者角色、标准答案、允许引用的证据范围和应当拒答的情况。离开任务谈数据质量,最后通常只剩文件数量、字符数量和格式统一率。

“共同组织”同样不能省。档案内容并不是脱离档号、组件、页码和形成背景而独立存在的一段文字。某个日期究竟是成文日期、签发日期还是归档日期,某个单位是责任者还是正文中提到的协办单位,都要结合目录、版面位置和业务规则判断。把这些关系拆掉以后,OCR 文本可能读得通,却已经不再具备可靠的档案语义。

持续抽查、复测和更新,决定了数据集能否长期使用。扫描件重做、OCR 引擎更换、开放状态调整、目录纠错、模型版本升级,都会改变样本或答案。没有版本和复测记录的数据,只能支撑一次演示,无法解释系统为什么上周答对、这周答错。

这也划清了几个容易混淆的概念。数字化成果库回答“保存了哪些档案及其数字副本”;OCR 文本库提供机器可处理的文字;知识库把材料组织起来供检索和问答。档案高质量数据集还要继续回答:这些数据用于什么任务,哪部分能够使用,判断依据在哪里,错误由谁复核,发生变化以后如何比较。它既是可供机器使用的样本,也是检验机器结果的标尺。

因此,“高质量”不能只理解成扫描清楚、OCR 正确率高、字段填得满。对任意抽出的一条样本,项目组至少要能说明六件事:它来自哪份档案和哪一页,保留了哪些目录与组件关系,当前谁有权使用,承担什么任务,经过什么质量处理和人工复核,属于哪个可复现的版本。六个问题里有一个答不上来,这条数据就还没有完成从数字化成果到高质量数据集样本的转变。

档案高质量数据集封面

先从一次失败的试点看问题

某个项目做档案智能问答试点,准备了十几万页 OCR 文本。演示阶段效果不错,问几个常见问题都能回答,还能给出一段看起来像引用的文字。

试运行以后,问题集中出现。

第一类问题是引用回不去。回答里有一句关键依据,但系统只能显示一个 OCR 文本片段,打不开原图,也找不到页码。

第二类问题是权限说不清。普通用户问到了内部材料,前端没有展示原文,但模型回答已经吸收了未开放片段。

第三类问题是新旧版本混在一起。同一份文件经过重新扫描和 OCR 修正后,旧文本还留在向量库里,模型有时引用旧结果,有时引用新结果。

第四类问题是人工复核缺位。OCR 把一个日期识别错了,自动著录又把这个日期写进候选字段,最后检索和统计都引用了它。回查时没人能确认这个错误从哪一轮开始扩散。

这些问题不靠换模型解决。它们说明数据集的建设对象错了:项目组只准备了“文本集合”,没有准备“可追溯样本集合”。

数据集要按任务拆,不按文件夹堆

档案高质量数据集至少要分成四类,分别服务不同任务。

数据集类型主要用途样本单位必备边界
检索数据集全文检索、向量检索、混合检索页、段落、组件、目录项来源、页码、权限、开放状态
著录数据集自动著录、字段抽取、候选值推荐字段候选、证据片段、原图位置字段口径、置信度、人工复核
评测数据集RAG、问答、拒答、权限回归问题、标准答案、证据范围用户角色、答案边界、评分规则
训练数据集微调、排序、分类、版面识别输入输出对、正负样本授权范围、脱敏规则、版本记录

这四类数据不能混成一个“大语料库”。检索数据集强调召回和回跳,著录数据集强调字段口径,评测数据集强调判断标准,训练数据集强调授权和样本分布。

同一份档案可以进入多个数据集,但进入方式不同。比如一份立项批复,全文片段可以进入检索数据集;“文号”“成文日期”“责任者”的候选抽取可以进入著录数据集;围绕它设计的问题可以进入评测数据集;经过脱敏和授权后,部分样本才可能进入训练数据集。

项目现场要先问:这批数据集到底要解决哪个任务。答案如果只是“用于 AI”,范围就太宽,后面一定失控。

一条样本至少要有十个字段

档案样本的主键不能只用文件名。文件名会变,目录会修订,原文会迁移,OCR 会重跑,权限会调整。样本需要稳定主键和状态。

一个最小样本可以这样设计:

{
  "sample_id": "ADS-20260803-00017",
  "dataset_id": "archive_qa_eval_v1",
  "archive_id": "A2021-003-017",
  "component_id": "A2021-003-017-C01",
  "page_no": 12,
  "source_type": "ocr_text",
  "open_state": "controlled",
  "quality_state": "human_checked",
  "dataset_role": "eval_case",
  "version": "v1.2",
  "reviewer": "business_reviewer_01",
  "created_from_batch": "ingest-2026-07"
}

字段名称可以换,关系不能丢。archive_id 让样本回到目录对象,component_idpage_no 让证据回到原文,open_state 决定能不能进入模型上下文,quality_state 决定机器结果是否可以被采用,dataset_role 决定它是训练样本、评测样本还是检索样本。

没有这些字段,数据集越大,后期越难治理。因为项目组无法回答一个基本问题:某条样本到底能不能被模型使用。

高质量数据集要故意放入坏样本

很多项目喜欢挑干净数据:扫描清楚、目录完整、权限开放、题名规范、页码连续。这样的数据很适合演示,不适合判断系统能力。

档案高质量数据集必须包含坏样本。坏样本不是脏数据,它是系统边界的压力测试。

坏样本类型暴露的问题应进入哪个环节
OCR 低置信页图像质量、识别引擎、人工复核规则检索、著录、评测
页码错位证据回跳、组件关系、扫描质检检索、评测
字段缺失目录著录规则、补录流程、入库检测著录、资源治理
开放状态不明权限过滤、利用审批、拒答策略检索、评测
同名项目材料排序、实体区分、引用准确性检索、问答评测
已废止版本版本管理、索引更新、回归测试评测、运维

这些样本不一定数量多,但每类都要有。只有好样本,系统会显得很聪明;加入坏样本,项目组才知道智能能力的边界在哪里。

坏样本还要保留处理结论。比如 OCR 低置信页是重新扫描、人工录入、限制进入检索,还是允许作为低置信证据进入候选。结论不同,系统行为也不同。

标注结果后面必须留有判断依据

档案数据集标注最容易被低估。有人以为标注就是给文本加一个分类标签,或者给问答样本写一个标准答案。

档案场景里,标注必须写出判断依据。

一条著录样本里,“责任者”为什么取这个单位,而不是正文里出现的另一个单位;“日期”为什么取成文日期,而不是签发日期或归档日期;“开放状态”为什么需要控制;“保管期限”依据哪条规则。只写结果,不写依据,后续训练出来的模型只能模仿表面答案。

标注记录可以分成三层。

第一层是机器候选:OCR、版面分析、规则抽取或模型抽取得到的候选值。

第二层是人工确认:业务人员确认、修改或驳回候选值。

第三层是依据位置:原文页码、图像坐标、目录字段、形成规则、开放审核记录或利用审批记录。

这三层缺一层,数据集都会变薄。只有机器候选,没有人工确认,样本不能作为可靠训练材料;只有人工结果,没有依据位置,模型学不到证据关系;只有依据位置,没有版本记录,后续重跑无法比较。

权限要在数据集层面前置

档案行业做数据集,不能等模型调用时才谈权限。权限要在数据集建设阶段就进入字段、流程和导出策略。

至少要分三类数据。

第一类是内部可用数据,只能在单位内网、授权系统和指定人员范围内使用。它可以服务本地检索、内网评测和离线模型试验。

第二类是脱敏训练数据,需要去掉个人敏感信息、未开放内容、涉密内容、审批材料中的敏感字段,并保留脱敏规则和责任人。

第三类是公开样例数据,只能用于展示、培训或外部交流。公开样例不能由内部数据随手抽取,要经过开放审核和内容复核。

这三类数据不能共用一个导出按钮。导出时必须检查数据集类型、用户权限、目的、字段范围、脱敏规则和导出日志。

尤其要警惕一个动作:把内部档案样本上传到在线模型平台调试。即使模型能力再强,只要数据包含未开放档案、内部审批、个人信息或敏感业务材料,就不应出网。档案高质量数据集的建设方向,应优先服务内网检索、离线模型、私有化评测和人工复核。

数据集版本要能解释模型变化

AI 项目经常出现一种争论:上周模型答得对,这周答错了,到底是谁改坏了。

如果数据集没有版本,争论没有答案。

数据集版本至少要记录四件事:样本范围、清洗规则、标注规则、权限规则。任何一项变化,都可能影响检索、训练和评测结果。

版本变化可能影响必须记录
新增扫描批次召回范围扩大,旧题答案变化批次号、页数、门类、开放状态
OCR 重跑引用片段变化,字段抽取变化引擎版本、参数、失败页
标注修订标准答案变化,模型学习目标变化修订人、修订原因、影响样本
权限调整可召回范围变化,拒答结果变化规则版本、用户角色、审计记录
样本脱敏训练输入变化,实体信息减少脱敏字段、替换规则、复核记录

版本记录不是技术人员自用材料。它会直接影响项目负责人能不能判断“这次模型升级是否可上线”。如果一个模型评测分数下降,原因可能是模型变差,也可能是数据集加入了更难的真实样本。没有版本说明,分数没有解释力。

验收不要只看数据量

档案高质量数据集验收可以少看总量,多看抽查。

第一,随机抽 30 条样本,看能不能回到目录、组件、原文、页码和开放状态。

第二,抽 10 条机器生成样本,看有没有人工复核记录,复核前后差异是否保留。

第三,抽 10 条权限受限样本,用普通用户和管理员分别检索,确认无权内容没有进入召回和模型上下文。

第四,抽 10 条坏样本,看系统是否给出明确状态:进入复核、限制使用、重新扫描、禁止入库或可作为反例保留。

第五,选同一批评测题,在数据集版本更新前后复跑,确认旧题变化可以解释。

这五个动作比“已建设多少万条样本”更能说明质量。数据量只能说明工作量,抽查链路才能说明数据集能不能进入真实项目。

和高水平数字档案馆建设的关系

高水平数字档案馆评价里,对数字资源接收、管理、保存、利用和安全都有明确要求。电子档案组件完整、元数据齐全、关联正确,目录数据与原文数据挂接准确,备份恢复过程有记录,不开放档案能够控制利用,日志记录和操作审计能够支撑管理。这些要求放到数据集建设里,就是高质量数据集的底线。

数字档案室建设也有相近逻辑:归档接口要保证电子文件及组件、元数据保持关联;接收和长期保存过程中要做真实性、完整性、可用性、安全性检测;检索利用要受权限管理和审批控制;开放审核、移交记录、日志审计都不能缺位。

档案高质量数据集应当从数字档案馆和数字档案室已有的资源管理、权限控制、检测、备份、利用和审计要求中长出来。归档流程承认它,利用流程管得住它,安全审计查得到它,长期保存以后仍能复核它,这样的数据集才可能长期使用。

先用两组数据做一次对照

项目开始时,可以先选一个门类和一个利用频率较高的问题,不急着把全部档案送进模型。针对同一批原文准备两组数据:A 组只有切分后的 OCR 文本,B 组保留档号、组件、页码、开放状态、OCR 版本和人工复核记录,并加入少量页码错位、同名对象和已废止版本。

两组数据使用同一个模型、同一套检索参数和同一批问题。比较的重点也很具体:答案引用能否打开对应原文页,无权用户提问时受限片段是否在检索阶段就被排除,OCR 修订以后旧文本是否还会被命中,答错以后能否定位到具体样本和处理批次。

领至科技在档案 AI 项目中更愿意先做这类小规模对照。它很快就能暴露问题究竟出在模型、检索参数,还是档案关系已经在数据准备过程中丢失。B 组如果只让回答变得更流畅,却没有改善证据回跳、权限拦截和错误定位,这轮数据治理就没有达到目的。

一套数据集完成到什么程度,可以从一次错误回答反推:项目人员能找到它引用的原文,查明错误来自 OCR、切分、标注还是版本混用,修正后还能用原问题复测。越权请求应在内容进入模型以前被拦住。任何一环做不到,眼前的仍是一批待治理的数字化材料。

如需了解档案 AI 数据集、智能检索评测和数字档案馆建设方案,可以点击文末阅读原文访问领至科技官网。

上一篇:GPT-5.6 越强,档案行业越不能直接用在线大模型 下一篇:没有了