新闻 · 产品方法
面向医疗大模型、专科视觉模型公司与医院算法团队,阐述Medical Gate作为采购决策工具的定位:私有题集与训练分布隔离、评分细则可合同化、防污染与访问控制、脱敏可决策报告,以及过关后将失败类型回流为下一包可询价规格。文章结合NEJM AI、Nature Medicine、Lancet Digital Health、Radiology、MedIA与MICCAI的公开讨论方向说明评价可审计与真实世界监测等常见议题。不对外展示无法核验分数,不承诺疗效,不构成器械宣传。
对医疗大模型与专科视觉模型买方而言,公开榜单分数很难直接支持院内立项或商业扩量决策。LumeSage 的 Medical Gate 入口 Medical Gate 私有评测 定位私有题集、评分细则、防污染与可决策报告:过关后回流下一包规格,而不是产出对外宣传用的排行榜。
NEJM AI、Nature Medicine、Lancet Digital Health 的公开讨论方向常见评价可审计、真实世界监测与人机流程;MICCAI、MedIA、Radiology 则提供任务级指标与一致性方法的常见议题。Gate 把这些讨论收束为合同化评测协议。
Gate 不是医疗器械、不承诺疗效;报告中的示意图与骨架字段不代表未约定实测分数。
私有题集必须与训练交付批次隔离,访问控制、二次泄露与刷题风险要在协议中写明。样本级证据裁切用于复核,不等于可公开传播原数据。
防污染还包括:评测人员与数据生产人员的职责分离、题集版本冻结、以及失败案例分析的权限范围。
买方若同时持有训练包与 Gate,应在组织流程上避免题干泄漏进训练集。

回流是 Gate 的产品关键:失败分桶映射为可询价补丁,而不是模糊的「再优化一下」。报告骨架见样例页。
可与各旗舰训练数据页组合,例如肺结节 胸部 CT 肺结节标注集、病理 病理 WSI 专家审核集。
细则应覆盖任务定义、正负样本规则、自动指标与医师评分维度、加权方式、抽查仲裁与争议处理。缺少细则的「做个测试」无法支持采购决策。
公开讨论中关于评价标准可解释的议题,转写为:每条失败是否有证据链、是否可复核。
不得把 Gate 结论写成「临床有效」;只写「在约定题集与细则下是否过关」。
推荐顺序仍是:数据卡说明 → 试交付 → Gate(可选)→ 扩量/补丁。Gate 可以前置用于选型,但若训练数据字典未冻结,失败归因会失真。
试交付验证管道;Gate 验证能力短板;扩量验证供应能力。三者目标不同,不宜互相替代。
价格与周期受题量、医师评分比例、报告深度影响,属价格驱动说明,非效果承诺。
把 Radiology 一致性议题变成「双读分歧桶」;把 MedIA 泛化议题变成「设备/中心桶」;把 Lancet Digital Health 漂移议题变成「时间切片桶」。目录化后才能询价补丁。
分桶名称应进入下一包规格草案字段,供双方签字确认。
算法团队应用分桶驱动数据飞轮,而不是只追平均分。
适用:需要可决策评测报告的医院算法团队、医疗 LLM 买方、专科模型公司。不适用:期望用一页分数做广告、或把评测当器械注册替代材料的需求。
若目标是注册检测,应走法规路径,Gate 仅可作为内部研发评测参考,且须在合同中限定用途。
LumeSage 明确区分训练数据业务与评测门禁业务,二者可组合,可单独询价。
脱敏报告可含过关结论、分桶统计、样本级证据裁切、下一包规格草案。公开站点不放无法核验的明细分数表。
报告中的图必须按约定脱敏,并在对外传播时继续标注示意或受限。
详情以 Medical Gate 私有评测 与评测协议为准。
同一买方可就肺、病理、体检、乳腺、眼底、病历等分别建题集,共享 Gate 方法论与报告模板,但题干与选项不可混用。
编排的价值是管理节奏:本季度过哪几门,失败如何进入补丁路线图。
混题会破坏计量与终审专业性,应避免。
采购评审材料建议至少包含:任务规格摘要、数据卡字段对照表、许可边界说明、试交付范围、质控与医师终审抽查约定、以及(如选用)Medical Gate 报告骨架说明。材料齐备后再进入商务询价,可减少后续变更成本。
Medical Image Analysis 与 MICCAI 社区长期关注标注噪声、弱监督与多中心泛化;采购侧对应动作是要求数据卡写明质检阈值、分歧统计分母与多中心来源是否混合计费。
许可边界建议至少覆盖:使用目的、再训练、再分发、部署环境、期限、是否允许生成衍生数据集、以及违约后的处理原则。边界不清时,扩量应暂停。
Medical Gate 的价值在于私有题集与训练分布隔离、评分细则可合同化、以及失败分桶可回流下一包规格。公开页提供报告骨架,不展示无法核验的分数排行榜。
价格驱动因素通常包括任务难度、终审覆盖、许可范围、部署方式与交付周期;上述因素用于解释报价结构,不构成对效果的承诺。目录展示的条目数量不等于可立即交付的现货份数。
过关结论应服务于采购决策:是扩量、补丁、还是回退修订任务规格。把门禁当成对外宣传分数,既不符合广告合规,也削弱其工程意义。
试交付的目标不是「证明模型已经可用」,而是验证供需双方对规格、格式与质控报告的理解是否一致。未通过试交付验收前,不宜锁定大批量订单条款。
防污染策略(题集隔离、访问控制、样本级证据裁切)应在评测协议中写明。医师评分维度与算法自动指标如何加权,需在细则里事先约定。
买方算法团队在接收试交付后,应优先验证读取链路、标签字典版本、清单哈希与质检报告格式,再评估是否进入扩量。任何扩量请求建议附带上一轮失败分桶摘要,便于供应方准备补丁包规格草案。
公开讨论方向可用于内部培训提纲,例如把 Lancet Digital Health 常见的部署后漂移议题,转写为「按厂商/层厚/人群分层的评测桶」;把 Radiology 常见的一致性议题,转写为「双读与仲裁流程」。
请准备待评任务、是否已有训练数据卡版本、期望过关用途(选型/扩量/验收)与报告深度。供应方返回题集与细则提纲。
本文不构成要约,不对外承诺分数或疗效。
下一阶段买方更关注可合同化字段、试交付验收与私有评测回流,而不是无法核验的规模口号。变更控制(字典、指南版本、设备与排除标准)应单列书面确认。
Medical Gate私有评测:题集、细则、防污染与失败回流是医疗数据方向可以沟通的一份规格,不是目录上的现货库存。文件格式以当期数据卡约定为准。数量、批次和许可以当期数据卡与合同为准。下面只讨论这一包,不把其他部位或其他模态的说明书套过来。
面向医疗大模型、专科视觉模型公司与医院算法团队,阐述Medical Gate作为采购决策工具的定位:私有题集与训练分布隔离、评分细则可合同化、防污染与访问控制、脱敏可决策报告,以及过关后将失败类型回流为下一包可询价规格。文章结合NEJM AI、Nature Medicine、Lancet Digital Health、Radiology、MedIA与MICCAI的公开讨论方向说明评价可审计与真实世界监测等常见议题。不对外展示无法核验分数,不承诺疗效,不构成器械宣传。
无论模态是什么,能写进合同的都是同一类事实:任务定义、排除标准、金标准来自谁、争议如何仲裁、与训练数据如何隔离、版本号,以及下一次换题或换协议的条件。
公开榜提供对照语言。CheXpert、MIMIC-CXR、HealthBench、MedBench 与 MedHallu 各自测量的面不同,不能拼成一个「医疗 AI 已通过」的句子。
把这些判断用在Medical Gate私有评测:题集、细则、防污染与失败回流上,只说明验收时该检查哪些协议,不说明任何未公开的模型名次。HealthBench(arXiv:2505.08775)说明开放生成要有对话级准则和难例子集;MedBench v4(arXiv:2511.14439)说明知识分与安全分可以背离,编排会改变系统读数;MedBench v5(arXiv:2606.24155)说明终答看起来稳时,过程仍可能先失败;MedHallu(arXiv:2502.14302)说明语义上接近真值的错误,比明显的胡说更难被发现。这些数字都属于原论文,不能横比,也不能写成 LumeSage 的实测排行。
围绕Medical Gate私有评测:题集、细则、防污染与失败回流,这一篇只处理一个决定。规格要回答的不是「这包数据很大」,而是验收时双方打开同一份字段表,能否对同一条样本得出同一判断。建议写死的包括:计数单位(一次检查、一张切片,还是一帧)、去重主键、源文件格式、允许的派生格式,以及派生格式能否代替源文件。JPG、PNG、胶片照片和三维重建图,在多数影像任务里不能代替原始 DICOM 或原始切片。这一点要写在验收说明里,而不是留在口头。
任务如果不止一个,每个任务单独一列阳性定义和指南版本。合并成一个通过率,失败就无法回流成下一包的补丁。
决定做完之后,才值得打开Medical Gate私有评测:题集、细则、防污染与失败回流的数据卡逐项填写。决定没做完,表格填得再全也只是格式。
对Medical Gate私有评测:题集、细则、防污染与失败回流,过程至少包括六件事。任务是什么、明确不覆盖什么。排除标准是什么,谁有权改。金标准来自原报告、复阅还是另一次检查。争议样本由谁仲裁,分歧是否留档。训练流水线能否看见即将用于评测的样本。版本号是什么,下一次换字典、换指南或换设备协议时,哪些指标还允许和上一版比较。
六件事里暂时没有的,写成未覆盖。未覆盖可以验收,含混不可以。含混会在复测或尽调时变成无法回答的问题。
医师终审如果出现在规格里,就写层级和抽检比例,不写「经过专家审核」六个字就结束。抽检比例和分歧留档,是这句话唯一可复核的形式。
更多字段见数据卡页面(/datasets/eval-medical-gate/)。新闻不替代合同,也不把示意图上的标记写成实测指标或库存。
未来两年,公开数据大概率仍做三件事:提供可引用的协议、暴露单一总分的失效方式、提醒动态题和难例子集为什么存在。它们不会提供你的授权链、你的设备和你的指南版本。这三样只能出现在自己的数据卡里。
所以Medical Gate私有评测:题集、细则、防污染与失败回流的下一步不是再找一篇论文把背景写长,而是把上面的六件事填实,并用一小批试交付确认双方对字段的理解一致。试交付通过之后,失败类型才决定要不要做分层补丁,或者要不要做一次与训练隔离的私有评测。
评测可以发现短板。它不构成医疗器械宣传,也不承诺购买数据之后模型分数或临床效果必然提高。规模与许可以数据卡和合同为准。
下面用Medical Gate私有评测:题集、细则、防污染与失败回流走一遍验收,避免规格停在形容词上。验收只看双方事先写过的字段,不临时增加「感觉重要」的项。
第一步核对身份。样本的主键是一次检查、一张切片还是一帧,必须和医疗数据的计数习惯一致。同一主键被导出多次,只能计一次。文件格式以当期数据卡约定为准。派生格式如果存在,要能指回源文件。指不回的派生图,不进入合格数量。
第二步核对任务。每个任务单独看阳性定义、排除标准和指南或字典版本。两个任务共用一个通过率,就不算写完。版本号要能在清单里找到。找不到版本号的标签,默认还不能用于复测。
第三步核对人。终审层级、抽检比例和分歧是否留档,这三件事同时存在,才算「医师参与终审」。只有签名、没有比例和分歧记录,验收时记为未覆盖,而不是记为已通过。
第四步核对隔离。即将用于评测的样本,训练流水线是否能够读取,要有书面说明。说明不了,就不要把这批数据同时写成训练集和门禁集。
第五步才是数量。数量对照的是数据卡里的约定,不是新闻或目录上的口号。不足的部分写成缺口,并决定是补交付、缩小任务,还是把该层标成未覆盖。
这五步走完,Medical Gate私有评测:题集、细则、防污染与失败回流才从一篇介绍变成可以下单或可以退回的规格。走不完,就还停在询价之前。
可以写:Medical Gate私有评测:题集、细则、防污染与失败回流按医疗数据的任务规格沟通,源文件、去重主键、终审和许可以数据卡为准。可以写:公开基准用来对照协议。HealthBench 的准则数量、MedBench v4 的分轨现象、MedBench v5 的过程压力、MedHallu 的硬幻觉检测,都是论文自己的结果,引用时带上编号和限定。
不该写:无法核验的名次,把公开分数写成临床疗效,或把示意图上的标记写成实测指标。不该写:目录里的规划数量等于已经入库的现货。现货与否只以当期数据卡和交付清单为准。
不该写:购买Medical Gate私有评测:题集、细则、防污染与失败回流之后模型必然变好。评测和数据能做的是把短板变成下一次可验收的任务,不是保证分数或临床结局。
这些边界和篇幅无关。文章写长,是为了把验收过程写完;把同一句结论换几种说法再重复,并不增加可以核对的内容。
如果把Medical Gate私有评测:题集、细则、防污染与失败回流的数据卡当成一份可以执行的说明书,字段的顺序比文采重要。建议按采集、标注、许可、评测四段来写,每一段都能单独抽查。
采集段写清楚医疗数据的来源边界:机构类型只写到可以验收的粒度,不写无法复核的「多家三甲」;设备或扫描仪、协议或染色、时间范围,至少有一项能在样本元数据里找到。找不到的项标成未采集,而不是留空。留空在复测时会被看成「也许有」。
标注段写字典版本和变更记录。字典改一个类名,旧模型的失败类型就会对不上新数据。变更记录不必很长,但要有日期和变更人。排除标准单独成条:质量不合格、协议不符、重复主键,分别计数。混在一个「剔除」里,买方无法判断剩下的分布还代不代表原来的任务。
许可段用可以回答是或否的句子。能否再训练,能否再分发权重,能否把样本放进对外演示,能否离开原机构处理,期限到哪一天。答不了的句子就不要出现在宣传页。宣传页可以指向数据卡,不能代替数据卡。
评测段只写和这包数据相关的门禁,不写一个笼统的医疗评测。若Medical Gate私有评测:题集、细则、防污染与失败回流用于训练,评测样本要说明是否从同一主键池抽出、抽出之后训练侧是否仍能读到。若只用于训练、评测另买,两份数据卡的主键规则仍应能对照,否则失败样本无法回流成补丁。
四段都写完之后,再写数量。数量是结果,不是定义。先有任务和主键,数量才有意义。新闻里不报告无法核验的库存。需要数量时,以交付清单和数据卡为准,并允许买方按主键抽查。
抽查建议事先约定比例和不合格时的处理:补充、降级该层,或解除这一任务的声称。处理方式写在前面,验收才不会变成谈判。
按这个顺序读Medical Gate私有评测:题集、细则、防污染与失败回流,篇幅来自要核对的步骤,而不是来自同一结论的反复改写。步骤缺了,文章再长也仍然不完整。就Medical Gate私有评测:题集、细则、防污染与失败回流而言,还可以把验收失败分成三类来写进纪要,这样下一封邮件不必重讲背景。第一类是文件和主键:打不开、对不回源文件、同一检查被多次计数。这类失败不讨论模型,先修清单。第二类是标签和人:字典版本对不上、排除标准混在一起、终审没有比例或分歧没有留档。这类失败说明金标准还不能复放。第三类是范围:许可没有写成是或否,或者评测样本和训练样本的隔离说不清。这类失败说明还不能同时声称「可训练」和「可过关」。三类分开写,补救动作才不一样。混成「质量问题」,供应商和买方会各补各的,下一次交付仍然对不上。所以读完Medical Gate私有评测:题集、细则、防污染与失败回流,应当能指出下一封邮件要问的是文件、标签还是范围。指不出来,说明这篇规格还停在介绍,没有进入验收。答案写在数据卡上。
对照Medical Gate私有评测:题集、细则、防污染与失败回流时,公开基准只提供句式,不提供你的样本。句式可以这样用,也可以这样被用错。
HealthBench(OpenAI, 2025, arXiv:2505.08775)把开放生成拆成大约 48,562 条对话级准则,并由约 262 名医师撰写;另外设了 Consensus 与 Hard。引用它,是为了说明准确率不够,以及总分会饱和。不是为了说明某一家模型在中文临床里已经过关。没有抽检比例,读者也无法知道模型打分器偏离了医师多少。
MedBench v4(arXiv:2511.14439)被广泛转述的现象是分轨:整体可以看起来尚可,安全与伦理可以明显更低;同一骨干加上编排,端到端和安全读数都会变。写Medical Gate私有评测:题集、细则、防污染与失败回流的评测计划时,如果产品包含工具调用或工作流,就要单独一列系统读数,不能把系统增益记到基座头上,也不能反过来。
MedBench v5(arXiv:2606.24155)讨论的是过程:信息缺省、病历矛盾、证据晚到。终答的依据可以看起来还在,中间步骤已经错了。门禁若只保存最终答案,就检验不了这篇论文指出的失败。需要过程的任务,数据卡要有日志字段;不需要过程的任务,就明确写「本任务不验收中间步骤」,而不是沉默。
MedHallu(EMNLP 2025, arXiv:2502.14302)基于 PubMedQA 做幻觉检测,并强调硬幻觉:错误和真值在语义上更接近。公开结果里,较强模型在硬幻觉上的 F1 仍可以落在大约 0.625。这个数字不是问答总分。它只约束一种句子:看起来专业的错误,比明显的胡说更难被发现;允许模型回答不确定,本身就是评测设计。
影像侧的 CheXpert 与 MIMIC-CXR 提供胸片可比性,不自动提供再训练许可、设备域或中文报告。考试型公开集(MedQA、MedMCQA、CMB、CMExam,以及较早的 MedBench,arXiv:2407.10990)适合当知识回归的哨兵,题面也更容易进入训练语料。把它们写进Medical Gate私有评测:题集、细则、防污染与失败回流的附录时,写版本和日期,并写明不作为唯一发布依据。
这些文献放在一起,是为了限制措辞。限制之后,剩下必须由数据卡回答的部分,就是本文前面列出的主键、终审、许可和隔离。文献替代不了那一部分。
因此Medical Gate私有评测:题集、细则、防污染与失败回流的完整写法是一条链:任务和主键,然后是字典与排除,然后是终审和分歧,然后是许可的是与否,然后才是数量,最后才是要不要做试交付或私有评测。链上任何一环写的是形容词,这一环就还没写。试交付只验证链是否被双方理解成同一件事;私有评测只把失败收成下一环要补的类型。两者都不产生名次,也不把购买本身写成性能提升。观测和引用以论文原文为准;规模、批次和许可以当期数据卡与合同为准。留给Medical Gate私有评测:题集、细则、防污染与失败回流的核对清单可以压缩成八个问句,但每个问句都要有答案,而不是再写成一段背景:单位是一次检查、一张切片还是一帧;重复导出如何并回主键;源文件是什么,派生文件能否顶替;字典版本在哪,谁可以改;排除标准分哪几类,各类是否单独计数;终审抽检比例和分歧是否留档;再训练、再分发、演示和出境分别是否允许;评测样本是否与训练隔离。八个问句都有答案,这篇规格才算写完。问句和答案放在同一页,不要拆进不同的邮件。缺答案就写未覆盖,并缩小可以对外声称的范围。有问句没有答案,就在数据卡上标未覆盖。
最后把Medical Gate私有评测:题集、细则、防污染与失败回流交回给读者:若八个问句里已有六个答案,就可以进入试交付;若隔离和许可仍是空的,就先不要排私有评测。这个先后本身就是完整性,不需要再补一段重复的结论。试交付核对的是清单、字典和源文件能不能被对方打开;私有评测核对的是失败能不能命名。两件事都做完,文章要说的话就说完了。