项目规格 · 语料

语料:一次提问一句回答,一条词条一篇正文

医学语料采买看起来像「多准备一些医学文字」。拆开之后只有两件不同的事:医患问答平台上的单轮问答,以及医学百科式词条。两件都不能代替多轮问诊,也不能代替有授权的教科书原文。本页说明字段、主题分层、授权链、去重和事实审核。条数不在这里公布,沟通规模以数据卡和合同为准。

问答 · 一条 = 一问一答 没有第二轮,没有会话上下文 来源、链接、问题、回答、主题 百科 · 一条 = 一个词条 定义与正文在同一条里 来源、链接、词条名、正文、主题 与公开网页重复的条,以及将进入 Medical Gate 的条,不计入训练交付
图 1. 两个子包的计数单位不同。下方红线表示:公开重复和评测留出都不算进可交付条数。

这一包故意不是对话

说明书写明交互形式是单轮:每条数据是一次提问加一次回答,不含追问,不含会话编号,不含上一句。把它叫成问诊对话,会让购买方以为模型见过「先问清诱因、再看检查、最后才下判断」的顺序。单轮回答通常把结论和注意事项写在同一段里,没有时间顺序。多轮里最容易出错的未来信息泄漏,在单轮包里无从检查,所以不能用这一包声称已经覆盖问诊策略。

问诊、报告解读、治疗前后对比和随访在病历规格里,样本单元是一次就诊或一条时间线。百科和问答如果被拷进那个包,字段对不上,也会把公开网页上的句子混进应当脱敏的病历。两个目录必须分开存储,标识也不能复用。

应用目的在说明书里写成充实医学知识底座。知识底座指的是概念、常见注意事项和词条结构能被抽查,不是临床决策,也不是诊疗效果。回答里出现「应当就医」可以保留为原文的一部分,但不能在数据卡里写成模型因此具备分诊能力。

问答子包的字段和主题

每条问答固定五个字段:数据来源、数据来源链接、问题、回答、主题类型。来源要写到平台或授权改写的责任方,不能只写「网络」。链接要能打开到授权范围内的页面,或指向内部存档编号并附授权文件编号。链接失效时,该条不能靠记忆补写,应当标成无法复核。

主题不是自由标签。说明书给出的分层是:常见病与多发病科普;慢性病管理与用药;症状与急诊识别;儿童、妇女、老年、妊娠等特殊人群;检查与体检解读、预防保健。一条只能有一个主题,避免同一段文字被两个主题各算一次。主题判据写在数据卡里。例如「体检里某项指标偏高怎么办」归检查解读,不归慢病管理,除非正文的主体是长期用药。

来源构成也要分开写:医学问答平台上的真实问答且已脱敏、由医生或医学编辑撰写、以及在授权下改写。改写必须能指回原句和改写说明。没有原句的「改写」与生成没有区别,不进入这一来源类。平台问答若仍含姓名、医院工号或可识别的病情细节,先脱敏再入库;去不净的不入库。

问题应当是用户会问的那一句,而不是把百科定义改成疑问句。回答应当回应那一句,而不是贴上整篇词条。答非所问在字段完整率里看不出来,必须在事实和相关性抽查里单独记。说明书要求医学专业内容经专业人员审核。审核记录至少包括审核人角色、日期和结论,不要求在公开页公布审核人姓名。

百科子包的字段和主题

每条百科固定五个字段:数据来源、数据来源链接、词条名称、词条内容、主题类型。主题分层是:疾病;症状与体征;检查、治疗与用药;特殊人群;预防保健与生活方式。疾病词条和症状词条不要合成一条。合成之后无法统计长尾症状有没有被疾病词条挤掉。

词条内容要结构化到能直接用于训练,但结构是字段,不是把段落改写成广告。定义、机制、表现、诊断界限、处理原则如果原词条里有,就按原有层次存放。原词条没有的层次不要补写。补写会把编辑的推断写成出处。剂量、禁忌和「不是」一类否定,必须保留原文,不能在压缩时删掉。删除否定是书籍规格里同样禁止的行为,这里提前适用。

百科来源要是已授权的词条或授权改写,而不是把公开网页整页抓取后改个标题。公开百科即使可浏览,也不自动获得再训练和再分发的权利。授权范围要写明能否用于模型训练、能否展示片段、能否再分发。缺任何一项,该条不计入。

主题比例是抽样框

说明书给问答和百科各自的主题比例,用来防止只交常见病。比例是沟通时要核对的结构,不是本站库存。常见病占比高是说明书的意图,长尾主题不能为零。特殊人群要能区分儿童、妊娠、老年,而不是合成一个「其他」标签。症状与急诊识别这一类,回答必须包含何时需要线下就医的原文信息;如果原文没有,不要代写,把该条标成「原文未覆盖就医界限」,由购买方决定是否接收。

同一主题内部还要避免只围绕少数病名重复。数据卡用病名或词条名做分布,而不是只用五个主题桶。五个桶都满、病名却只有十个,不符合「充实知识底座」的目的。具体病名清单在数据卡,不在本页罗列,以免被看成已经收录。

常见病科普 慢病与用药 症状与急诊识别 特殊人群 检查解读与预防 主题桶之内还要看病名是否散开。桶满不等于病名散开。
图 2. 主题分层只是第一层。第二层是病名或词条名的分布,写在数据卡里,不在本页预填数量。

事实错误是红线,不是风格问题

说明书把医学事实严重错误写成零容忍,把版权侵权也写成零容忍。两者都不能放进「合格率百分之九十五」里稀释。事实审核看的是:剂量和单位有没有被改、否定有没有被删、诊断界限有没有被说成已经确诊、过时的阈值有没有被写成当前标准却不注明年份。

审核不能只看回答是否通顺。通顺的错误比残缺的原文更危险,因为它会被当成可直接学习的目标。抽查要包含:随机条、每个主题的长尾条、以及含数字的条。含数字的条优先,因为单位和阈值最容易在改写时被换掉。审核发现严重错误,按说明书可以拒绝该批次并要求整改;整改后仍不合格,可以解除合同。这是验收条款,不是本目录已经完成审核的声明。

来源链接和主题标签也要求正确。链接指向另一篇文章、主题放错桶,该条不合格。四个条件同时满足才算一条合格数据:字段完整、来源与分类正确、事实审核通过、去重通过。四者缺一,不按「大部分字段对了」收下。

去重要针对公开集,而不只是本批

说明书写明与供应商重复样本去重,也写明与内部历史集或公开集重复的部分不计入验收数量。问答和百科特别容易与公开网页重合。只去掉完全相同的字符串不够。改写几个虚词、调换句子顺序,仍然可能是同一来源。数据卡要说明近重复的判法,以及抽查时如何打开来源链接比对。

更严格的一条是切分。将要进入 Medical Gate 或任何留出评测的题目,不能出现在这一包的训练交付里。同一问题换一种问法仍算同一题。百科词条如果被评测题整段引用,该词条从训练交付中撤下,或评测题从门禁中撤下,二者不能并存。公开榜的分数也不会因为购买了这一包就上升。能报告的只有:在约定的抽查规则下,事实错误和授权缺失有没有被退回。

授权链长什么样

供应商需要说明文字从哪里来:已获得版权授权的医学出版物电子文本、合规的问答或百科平台、或自有且能证明权利的语料。每条都能回到其中一类,并附文件编号。平台用户协议如果禁止再训练,该平台的内容不能因为「可以浏览」就进入本包。

授权证明完整率按说明书是百分之百。做不到的条直接剔除,不摊进合格率。报价前的样例要同时包含问答和百科,数量以合同为准,用来看格式、授权和事实,不代表其余条已经齐备。样例本身如果含可识别的患者叙述,先脱敏再提交。本页不转载任何示例问答或示例词条,避免把说明书里的举例当成已交付语料。

交付、批次和不能做的事

交付是结构化表格,一条一行,编码和换行固定,便于直接读取。不要把问答和百科放在同一张没有类型列的表里。类型列就是主题之上的子包标记。批次规模和验收工作日按合同。整体验收在全部批次之后。预付款比例、单价和发票不在本页出现。

这一包不做的事同样要写清。不生成「患者可能会问」的假问题来凑主题比例。不把多轮对话压成一问一答充数。不把指南原文拆碎放进百科正文而不附授权。不把药物广告改写成回答。不在回答末尾添加本站或任何厂商的联系方式。不声称这些文字经过了临床验证。

和书籍规格的边界是:书籍保留版本、页码和原书结构,单元是一部书的一个版本;语料的单元是一条问答或一条词条。把教科书章节贴进词条内容,如果没有单独授权,同时违反两页的规则。和病历规格的边界是:病历有就诊时间和轮次,语料没有。看到「医生说」「患者说」交替出现,应当退回病历规格,而不是当作单轮的一条。

能在数据卡上核对的只有这些:子包是否分开、五个字段是否齐全、主题是否按病名散开、授权编号能否打开、近重复和评测留出是否剔除、含数字的条是否有人审记录。除此之外的覆盖率和准确率,本页不写。

一条数据从进场到退回

进场时先看子包标记。没有标记的行不进入任何一个桶。然后看来源编号能否在授权清单里找到。找不到的行退出,不进入主题统计,避免用无授权的行把某个主题的比例撑起来。接着看字段是否为空。问题只有标题、回答只有「建议就医」、词条只有病名,都算不完整。空字段不使用默认句填充。

完整的行进入近重复比对。比对的对象包括本批、既往批次、购买方声明的历史集,以及数据卡里点名的公开来源。判为重复的行保留审计记录,但不计入条数。留下的行按主题和病名做分布。某个主题远低于约定结构时,不是把其他主题的行改标签,而是把缺口写进批次说明,由购买方决定这一批是否仍接收。

事实抽查在分布冻结之后进行。抽查不能只抽常见病。每个主题至少抽到长尾病名,含数字的行优先。审核意见写成「通过」「退回并写明错在剂量、否定、阈值或答非所问」。退回的行可以修订一次,修订要保留原句和改句。修订后仍错,该行剔除。若严重错误成片出现,按红线处理整批,而不是把错行删掉后仍宣称原批次合格。

最后才生成训练文件。训练文件不包含审核未通过的行,也不包含已标记为评测留出的行。文件内的行号要能回到原始表,以便复查。做不到回链的交付,视为格式不可用。一次性交付不包含周期性更新;质量问题的补发按合同时限响应,不把补发说成数据会自动变新。

这样走完,购买方看到的不是一个总条数,而是:授权清单、主题与病名分布、剔除原因、抽查记录和回链。总条数只有在这些附件都在时才有意义。本页把附件的名字写出来,是为了让数据卡有地方可核,不是为了宣布这些附件已经齐备。

主题判据怎么写才不会事后改标签

判据要在抽查之前冻结。常见病科普指的是对一种病的一般说明,读者不需要已经确诊。慢病与用药指的是已经在管理中的疾病和药物注意事项,原文要能看出是长期问题,而不是一次急性提问。症状与急诊识别指的是从症状出发,并包含何时离开线上、前往线下的原文信息。特殊人群必须能指出是儿童、妊娠、老年或其他说明书点名的人群,不能用「注意个体差异」代替。检查与体检解读指的是某一项或一组检查的含义,而不是顺带提到体检。

一条跨了两类时,按正文用最多篇幅的那类,并在备注里写另一类,备注不参与计数。禁止为了凑比例把备注改成主题。冻结之后发现某类不足,只能补采,不能改标签。补采的条同样走授权和事实审核,不因为是补的就免审。

词条与问答分开存放之后,还要防止同一事实在两张表里互相改写。问答的答案只能改问句所问的那一件事,不能把百科正文整段贴进去凑完整。词条正文也不能改成问答口吻来提高「可读性」。两张表各有来源链接。来源相同、句子相同,近重复规则仍然适用,保留更完整的那一条,另一条标成重复并退出计数。保留的一条要写明它同时覆盖了哪一条被退出的记录,方便复核,而不是让退出记录消失。

沟通规模以数据卡和合同确认,不是现货库存。本页不构成医疗器械宣传,也不对模型临床疗效作承诺。文献只说明验收应当检查什么,不代表本目录已经测得那些论文里的数字。

索取数据卡 返回数据集目录