项目规格 · 报告单

报告单:一张纸,三次不能合并的任务

采买说明书把报告单写成三类:纯报告单图片、报告单挂回病历、以及按指标拆开的复杂版式。这三类看起来都叫「报告」,样本单元却分别是一张、一份就诊、一行指标。混成一个文件夹之后,模型学到的是版式记忆,不是检查事件,也不是表格结构。本页把三类拆开,说明字段、分层、红线和文献对验收的约束。数量不在这里公布,沟通规模以数据卡和合同为准。

第一类 · 张 一次检查或检验 一张原始报告图 不含病历正文 看清版式 第二类 · 份 一次就诊 病史字段 + 多张图 文字必须指到图 对齐,不另做标注 第三类 · 条 一条指标 名称、数值、范围 保留原版式文本 漏行即不合格
图 1. 三类报告单的样本单元。张、份、条不能互相折算,也不能把一张图同时算进三个包充数。

为什么必须拆开

报告单图片训练的是「这页纸上写了什么、版式变了还能不能读」。就诊对齐训练的是「这段病史里的辅助检查,指的是哪一张图」。指标行训练的是「多栏、嵌套表格里,每一行指标有没有被拆全」。三件事的错误完全不同。第一类错在裁切、反光、把非报告当成报告。第二类错在文字和图对不上,或者把不同就诊拼进同一份。第三类错在漏掉一行、把参考范围抄进数值、或者把版式打成一串没有行列的文字。

如果只用一个合格率概括这三类,短板会被平均值盖住。一张清晰但挂错病历的图,在第一类里可能算合格,在第二类里必须不合格。一行指标抄错而图片很清晰,在第一类里看不出来,在第三类里是整行作废。所以验收按包进行,不按「报告单」这个总称进行。

说明书还要求分布均匀,不能把一个批次做成同一种版式、同一家医院的复印。均匀指的是检查类型、科室和正常、异常、危急值都要出现,不是把每一种报告都做成同样张数。具体比例写进该批次的数据卡,本页不预填比例,也不把任何目标量写成已经在库。

第一类:一次检查一张图

样本单元是一次检查或一次检验。交付物是原始报告单图片,覆盖检验报告、影像报告、病理报告、心电和其他专科报告。图必须来自真实报告,而不是把结构化字段重新排成一张看起来像医院抬头的图片。结构化字段可以另表存放,用来核对图片,但不能代替图片。

版式要覆盖不同医院、不同设备和不同年代的抬头。只收一种信息系统导出的整齐表格,模型会把表头位置当成特征。换一家医院,列的顺序一变,读取就失败。因此数据卡要写明本批包含多少种可区分的版式,而不是只写总张数。版式种类本身也要去重:同一模板改一个日期不算新版式。

正常、异常和危急值都要出现。只有异常报告时,模型会把任何可读的数字都解释成疾病。只有正常报告时,危急值的版式(加粗、箭头、单独一栏)从未见过。危急值在这里是版式和字段现象,不是疗效结论,也不表示拿到这些图就能识别临床风险。

图片要完整、清晰、可读。关键抬头、项目名称和结果区不能被手指、折角或裁切吃掉。模糊、反光、远距离拍摄不属于这一包。那些图有单独的任务,放在通用图片规格的低质量包里,用来学习停下来。把看不清的图放进第一类,等于强迫模型猜。猜出来的数字无法和纸面核对。

第一类必过的四项

四项同时满足,才算一条合格数据。说明书把批次合格线放在不低于百分之九十五。这是合同里要确认的验收线,不是本站已经测得的通过率。低于该线的批次按说明书可以整批返工。红线另计:隐私未去净、用生成图冒充真实报告、交付格式无法使用。红线不是按比例扣款就能留下的缺陷。

第二类:一次就诊,文字指到图

样本单元改成一次就诊或一份病历。一份里面可以有一张图,也可以有多张图。字段按就诊组织,而不是按图片组织。说明书列出的字段包括:虚拟标识、一级科室、二级科室、性别、年龄、主诉、现病史、既往史、个人史、婚育史、家族史、查体、专科查体、辅助检查、初步诊断、最后诊断,然后是报告单图片与对应的报告文字,按图片序号成对出现。

虚拟标识只用于把同一份里的文字和图片拴在一起,不使用真实姓名或卡号。年龄可以是区间或已脱标识的岁数,具体粒度在数据卡里写死,避免有的批次写「52 岁」、有的批次写完整出生日期。出生日期能反推身份,不进入这个字段。

辅助检查的文字必须能指到某一张图片。写了空腹血糖却没有对应的检验图,或者图是腹部超声而文字在描述血脂,这一份不合格。成对关系是这一包的核心,不是附加说明。说明书写明本包不包含额外标注。不要在这一包里再加病灶框、阴阳性标签或评分。那些是另一个合同。把标注混进来,会让「没有标签」和「有标签」的样本无法区分,后续也无法说明模型到底见过什么。

一份病历只能来自同一次就诊。不能把甲次的主诉、乙次的化验和丙次的影像订成一份,即使虚拟标识相同。时间对不上的材料会教模型用后来的结果解释当时的主诉。这种未来信息泄漏在病历规格的多轮包里同样被禁止,这里先在就诊层挡住。

第二类在第一类四项之外,增加两项:基本信息里约定的必填字段完整;辅助检查字段与图片一一对应。六项同时满足才算一份合格。科室在这一包里是分层标签,用来避免所有就诊都来自同一个门诊。它不是诊断,也不能用来声称覆盖了该科室的全部疾病。

一次就诊 主诉 · 病史 · 查体 辅助检查文字 初步诊断 / 最后诊断 报告图 1 与辅助检查成对 报告图 2 对不上,整份不合格
图 2. 第二类的合格条件是文字指到图。多出来的图、缺少的图、或描述的检查与图像不是同一种,整份不算合格。

第三类:一行指标,而不是一整页文字

第三类面向指标类检验报告,尤其是多栏、多表嵌套的复杂版式。样本单元从「一页」改成「一行指标」。一页报告如果有二十个项目,就应当出现二十行,而不是一行里塞进整页识别结果。每行至少包括:报告单名称或可回链到图片的标识、指标名称、指标数值、正常范围、指标含义,以及保留原结构的识别文本。

保留原结构的意思是:栏、表头、合并单元格和阅读顺序还在,而不是把所有字按从左到右、从上到下拍成一段。多栏报告若按单栏阅读,左栏的项目会接到右栏的数值上。这种错误在抽查「文字里有没有这个词」时发现不了,必须按行核对。

含义字段是对这个项目的简短说明,不是诊断,也不是治疗建议。它不能写成「因此患者患有某种病」。数值和范围必须抄自图片,不能用教科书里的常见范围替换这家医院的参考区间。不同实验室的单位和阈值不同,替换之后模型学到的是教科书,不是这张纸。

第三类的合格条件在清晰、属于报告、脱敏、去重之外,还要求识别文本与图片一致,并且指标逐条拆完、没有遗漏。六项同时满足才算一条。漏一行,这一页上的其余行也不能用来声称「这一页已经做完」。回链标识要能从行回到图片,否则无法复核。

科室是抽样框

说明书按科室列出检查报告和检验报告的类型,用来防止只交心血管或只交检验。检查与检验要分开统计。可沟通的科室包括心血管内科、内分泌科、呼吸科、消化科、肾内科、神经内科、血液科、风湿免疫科、感染科、肿瘤科、普通外科、骨科、泌尿外科与男科、妇产科、生殖医学科、儿科、皮肤科、耳鼻喉科、眼科、急诊与重症、临床营养,以及口腔、康复等长尾。

每个科室在说明书里举例的报告类型,是抽样时要核对的清单,不是已经采集完成的目录。例如心血管方向会同时看到心电图、动态心电、动态血压、心脏超声、冠脉相关影像,以及血脂、心肌标志物和凝血一类检验。消化方向会看到内镜、腹部超声或断层影像,以及肝功能、便常规和病理。眼科会看到光学相干断层、眼底照相、视野和眼压。这些名字用来问「这一批有没有只交了其中一种」。没有出现的类型可以在数据卡里标明缺口,不能用另一种报告顶上还把科室打成已覆盖。

长尾科室张数可以少,但不能为零却在说明里写成全科室。缺口写在数据卡上,比把缺口藏进「其他」更有用。下一批补哪种版式,由缺口决定,不由总张数决定。

文献改变的是验收问题,不是分数

跨医院的纸质或扫描报告,困难不在于某个字认得准不准,而在于同一临床概念在不同抬头下名称不同。Wang 等人在《Key Coverage Matters》里把这个问题写成规范字段及其别名:先有一份字段清单,再把各家医院的叫法映射上去,缺了关键字段就不能算这页已经结构化。映射表本身要人工核对,不能只靠一次模型输出。本规格因此要求第三类的指标名称能回链到图片上的原文,而不是只留一个规范化之后的名字。

复杂表格还带不确定度。arXiv:2507.02009 讨论的是表格结构识别和光学字符识别叠在一起时,应当对不可靠的单元格给出区间或拒答,而不是输出一个看起来整齐的数。合并单元格、模糊印刷和领域缩写都会让不确定度失效。第三类因此保留「不可拆」的状态:看不清的行标成不可拆,不补一个合理数值。补上的数无法在复核时与图片一致,按本规格就是不合格。

视觉模型很少自己停下来。ACL 2026 上 Cocchieri 等人的工作表明,医学问答设置里,模型即使在题目信息不足时也倾向于给出选项,而不是弃答。arXiv:2511.19806 则说明,光学字符识别错误不能靠输出概率可靠地发现,需要单独的弃答信号。第一类因此不接收应当弃答的废片;那些废片有自己的标签体系,见通用图片规格。把废片和清晰片混在一个包里,再要求百分之百可读,验收标准自己就矛盾了。

这些论文里的召回率、弃答率或覆盖率是他们实验集上的结果。本页不引用那些数字作为本目录的成绩,也不保证换一套报告单之后会得到同样的数。它们只说明验收时要问的三个问题:关键字段是否覆盖、看不清的格子有没有被填上、模型会不会在不该答的时候作答。

去重、脱敏和生成图

去重同时对本批和既往批次。同一张报告换格式、轻微裁边、或重新导出,仍然是重复。重复部分不计入验收数量。只按文件哈希去重不够,因为重新保存会改变哈希。数据卡要写明用什么方式判断「是不是同一张纸」,例如感知哈希加人工抽查,而不是声称已经绝对不重复。

脱敏的对象是身份,不是医学内容。姓名、证件号、就诊卡号、电话、详细住址、条形码里可反推身份的号码要去掉。检查项目、数值、科室和检查类型要留下,否则图片不再是报告。涂抹不能盖住结果区。脱敏失败是红线,不是合格率里的一个百分点。

禁止用生成模型画出一张「像报告」的图来充数。生成图即使看起来有医院抬头,也没有真实的检查事件,数值之间的关系是编的。说明书把这件事写成零容忍。拍摄或扫描可以来自合规的真实报告,但不能先生成再假装是扫描。低质量包同样禁止先模糊一张清晰图来冒充拍摄缺陷;那是另一页的约束,这里先把生成图挡在第一类门外。

交付和验收怎么分开

第一类建议按图片批次验收,第二类按就诊批次,第三类按指标行批次。批次大小和验收工作日以合同为准,不在本页写成已经排期。通过的批次才进入结算。全部批次结束后还有一次整体验收。未通过的批次整改后仍不通过,则该批次不结算。这是说明书里的流程,落地时以双方合同文本为准。

扣减只针对不合格比例和重复。红线触发的是拒收和整改,不是把隐私泄漏按条计价后继续使用。格式不符合约定、导致对方无法打开或无法按行核对,同样视为不可用。

交付形态是表格加嵌入的图片,图片和行要能对上文件名或嵌入位置。不要只交一个压缩包里的散图,再附一个对不上的表。第二类一份就诊占一组连续行或一张表,图的序号和报告文字的序号一致。第三类一页图片对应多行指标,每行都能回到那一页。

样例用于报价前看格式和脱敏,不代表库存。本页不贴示例报告、不写示例数值、不写示例病历句子。那些内容一旦放上公开网页,就会被当成已经交付的数据,也会把说明书里的虚构例子变成可被爬取的「病历」。

和另外五张规格的边界

低质量、反光、遮挡的报告图去通用图片规格,不进第一类。多轮问诊、治疗前后对比和随访去病历规格。单轮科普问答和百科词条去语料规格。药典、指南和教科书去书籍规格。医院等级和医生出诊去信息规格。一张报告如果同时被放进两个训练包,必须在数据卡里写明,并且不能再进入留出评测。评测用的报告如果和训练用的是同一页,门禁没有意义。

本页也不把报告单说成医疗器械,不把读取数值说成诊断,不把危急值覆盖说成能降低临床风险。能核对的只有:这三类的单元是否分开、字段是否回到图片、看不清的地方有没有被填上。

相邻规格:通用图片、病历、语料、书籍、医院与医生信息。目录在 采买规格。

沟通规模以数据卡和合同确认,不是现货库存。本页不构成医疗器械宣传,也不对模型临床疗效作承诺。文献只说明验收应当检查什么,不代表本目录已经测得那些论文里的数字。

索取数据卡 返回数据集目录