评测数据集 · 实体榜单 · medbench-mm · GB-Vision

2026-09-27前沿洞察 · 医疗大模型评测对应类目 GB-Vision

MedBench 多模态轨|公开对照与私有门禁对比:从公开评测到 GB-Vision 可合同门禁

影像/报告理解分轨:公开读数显示多模态整体弱于文本,感知尚可、跨模态推理偏弱。 本篇聚焦「公开对照与私有门禁对比」,对齐 2026-09-27 国际评测与数据集要求,服务 GB-Vision 询盘。

English entry: /en/gate/benchmarks/medbench-mm/

MedBench 多模态轨|公开对照与私有门禁对比:从公开评测到 GB-Vision 可合同门禁
示意图:用于说明评测与数据规格场景,不代表实测榜单分数、疗效或现货规模。

要回答的问题

观测窗口 2026-09-27。这篇评论讨论「MedBench 多模态轨|公开对照与私有门禁对比:从公开评测到 GB-Vision 可合同门禁」。

锚点是 MedBench 多模态轨(MedBench Multimodal,arXiv:2511.14439)。公开材料对它的定位是:影像/报告理解分轨:公开读数显示多模态整体弱于文本,感知尚可、跨模态推理偏弱。

我们把它当作需求地图上的一个点,用来判断 GB-Vision 这类私有评测集应当测量什么。下文先复述已经发表的协议与结果,再说明这些结果还留下了什么,最后给出数据集与门禁上的推论。

文中不报告 LumeSage 的榜单名次。没有可核验的对照实验,就不写分数。

图1 · MedBench 多模态轨

文献里已经站得住的部分

多模态医疗评测目前叠着三层公开传统,彼此不能互相替代。

第一层是影像标签与报告语料,代表是 CheXpert 与 MIMIC-CXR。它们让胸片分类和影像—报告对齐有了可复现对照,但许可、再训练边界和设备域并不随「我们跑过公开榜」一起交付。中文报告的书写习惯也与这些语料不同。

第二层是 MedBench v4 的多模态轨(arXiv:2511.14439)。公开材料的方向性结论是:多模态整体弱于文本,感知尚可,跨模态推理偏弱。一个总分会掩盖「看得见、写不对」或「写得像、对不齐影像」的失败。

第三层是 MedBench v5 的过程审计(arXiv:2606.24155)。对影像模型,这意味着门禁要抽查中间证据,而不只是最终印象句。MedBench 多模态轨 若被用作采购语言,应写明设备或染色协议、报告对齐键、争议样本由谁仲裁,而不是只写一个 VQA 准确率。

本文引用的公开材料限于可核对来源,数值均来自论文或平台公开表述,不转写成 LumeSage 的实测排行。若后续版本更新,以原论文与数据卡为准。

  • HealthBench. OpenAI, 2025. arXiv:2505.08775. 约 5,000 段多轮健康对话;262 名医师;约 48,562 条对话级准则;并设 Consensus 与 Hard 变体。
  • MedBench v4. arXiv:2511.14439. 面向中文医疗大语言模型、多模态与智能体的评测基础设施;公开讨论中可见知识分与安全分背离、多模态弱于文本、以及同一骨干上 Agent 编排对端到端与安全任务的抬升。
  • MedBench v5. arXiv:2606.24155. 从静态问答转向过程导向与幻觉感知:信息流压力(缺省、矛盾、证据延迟)、过程节点,以及幻觉从出现、传播到锚定的轨迹。
  • MedHallu. EMNLP 2025, arXiv:2502.14302. 基于 PubMedQA 的幻觉检测;公开结果指出「硬幻觉」上即使强模型的 F1 仍可落在约 0.625,且「不确定」选项与领域知识有助于检测。
  • MedBench(综合基准). arXiv:2407.10990. 早期中文医疗大模型综合评测体系,后被 v4/v5 基础设施接续。考试型对照还包括 MedQA、MedMCQA、CMB、CMExam 等公开集。
  • 影像侧公开对照常用 CheXpert、MIMIC-CXR;它们解决可比性,不自动解决授权、设备域与中文报告金标准。

这些数字可以怎样被引用

这些数字不能直接横比,也不能写成「我们超过了某篇论文」。它们的用途是约束句子。

HealthBench 的约 48,562 条准则说明:开放生成的分数是准则命中率,不是选择题准确率。准则由医师按重要性赋权,打分器是模型。因此报告里如果没有抽检比例,读者无法知道分数里有多少是打分器的偏好。Consensus 与 Hard 则说明作者自己也不认为整体分足够:一个用于共识,一个用于防止饱和。

MedBench v4 里被广泛转述的对比——整体大约 54 分、安全伦理可以低到大约 18 分——说明的是分轨,不是某一个模型的永久成绩。版本、子集和是否加上 Agent 编排都会改变读数。引用时要带上「v4、安全轨、基座而非编排后系统」这类限定。

MedHallu 的约 0.625 F1 针对的是硬幻觉检测,不是医疗问答总分。它说明「像专业表述的错误」比明显胡说更难被发现;也说明允许模型回答不确定,本身就是评测设计的一部分,而不只是产品话术。

MedBench v5 没有给出一个可以拿去宣传的新总分,它给出的是失败方式:终答的证据附着可以看起来稳定,过程在缺信息、矛盾和证据延迟下先坏。门禁若只存最终答案,就无法检验这篇论文提出的现象。

图2 · 映射

公开对照分与私有门禁结论如何分列

对照列回答:在 MedBench 多模态轨 的协议下,系统处于什么位置。门禁列回答:在双方冻结的私有集上,是否达到约定的分层阈值。两列回答的不是同一个问题,不能相加。

分列之后,差异本身才变得可解释:是题被记忆、是设备或人群域不同、是指南版本不同,还是编排策略带来的系统增益。解释不了的差异,先审计,再决定是否扩题。

对外句子只引用门禁结论。公开分可以放在附录,并写明协议版本与日期,同时写明它不代表疗效。

一段可放进评审附件的协议

下面是一段可以放进内部评审或合同附件的写法,主体是协议,不是形容词。它针对 MedBench 多模态轨,类目 GB-Vision。

「本次发布不使用 MedBench 多模态轨 的公开总分作为过关结论。公开协议仅保留为对照,版本与日期写在附录。过关与否依据 GB-Vision 的私有冻结集:分层、阈值和评分细则在评测开始前书面约定。报表至少分列:视觉感知、跨模态语义、临床决策支持类多模态任务。安全子集或难例子集未达到约定时,整体分不得覆盖该结论。每条失败样本归入类型,并注明对应的数据或策略动作。数据卡必填:设备/协议分层、报告对齐键、争议样本处理。」

这段话故意没有名次。名次需要可复现的对照实验和对方授权的题面;两者都不在这篇公开评论的证据范围里。

医师抽检建议写比例和分歧,而不是写「经过专家审核」。分歧样本应留档:它们往往就是下一版准则或下一包数据的来源,而不是应被平均掉的噪声。

图3 · 字段

由此推出的数据集要求

测量面建议覆盖:视觉感知、跨模态语义、临床决策支持类多模态任务。覆盖的方式是分列报表。能被总分淹没的维度,就还没有被覆盖。

协议上建议写死的字段是:设备/协议分层、报告对齐键、争议样本处理。此外,任何准备进入合同的集合都应说明排除标准、金标准来自谁、争议样本如何仲裁、与训练数据如何隔离、版本号以及下一次换题的条件。

这些要求直接来自上面的文献,而不是额外的清单:HealthBench 要求准则与抽检,MedBench v4 要求分轨与动态题,v5 要求过程日志,MedHallu 要求难度分层和「不确定」。在 MedBench 多模态轨 上缺了哪一条,就在数据卡上标成未覆盖,而不是在正文里用形容词带过。

2026–2027 年公开榜仍未完成的部分

到 2027 年,医疗模型评测里有三件公开榜尚未替产业完成的事,它们决定私有数据集的形态。

第一件是过程。MedBench v5 已经说明终答 grounding 可以稳定、中间节点仍然失败。下一代门禁会抽查日志:缺信息时是否追问,矛盾出现时是否改口,证据迟到时是否坚持旧结论。没有日志的基准,回答不了这些问题。

第二件是系统与模型的分离。MedBench v4 里,编排和工具策略可以抬升安全与端到端表现。评测集如果不记录策略版本和工具调用,就会把系统工程的进步记到基座模型头上,或反过来。

第三件是中文临床与授权数据。HealthBench 的准则网络、CheXpert / MIMIC 的影像许可、MedHallu 的英文文献问答,都是对照,不是你能直接采购来覆盖本院指南、本院设备和中文问诊的那一层。

这三件对应到 MedBench 多模态轨,就是本文强调的缺口。LumeSage 将 GB-Vision 放在这个缺口上:用医师终审、可版本化的题与审计附件,把论文里的协议翻译成可以下单的规格。公开榜继续担任地图。

读完可以做的决定

若你正在用 MedBench 多模态轨 做发布或尽调,可以把场景、对照基准的版本,以及是否需要医师抽检发给我们。意向类目为 GB-Vision。我们回复的是题集沟通说明或 Medical Gate 的排期要点,而不是一份新的排行榜。

联系方式见文末:微信二维码,或电话 +86 15010400907。请不要在表单中提交可识别患者的信息。

评测可以发现短板。它不构成医疗器械宣传,也不承诺购买数据之后模型分数或临床效果必然提高。

一次评审里实际要打开的材料

把「MedBench 多模态轨|公开对照与私有门禁对比:从公开评测到 GB-Vision 可合同门禁」落到一次内部评审,材料不该是另一篇综述,而该是可以翻页核对的四份东西。第一份是 MedBench 多模态轨 的协议说明:它测量 视觉感知、跨模态语义、临床决策支持类多模态任务。协议说明要写版本和日期,因为同一名字在不同年份对应的题集并不相同。第二份是对照结果,只保留与本次产品声称相关的分轨,不保留一张无法回溯子集的总分。

第三份是私有门禁,类目对应 GB-Vision。门禁在开评之前写好分层和阈值。开评之后再挑选「看起来过了」的子集,这份材料就失去了门禁的意义。第四份是失败样本。每条样本归入一种类型,并写明下一步是补数据、改策略,还是收窄产品声称的范围。类型来自缺口本身:授权影像买不到公开榜权限;报告金标准来源不清。

四份材料对不齐,评审的结论就是「还不能写已通过」。对不齐不是文稿没写完,是证据范围不够。把不够写成够,后面的尽调和复测都会打回来。

数据卡上建议与这四份材料用同一套字段:设备/协议分层、报告对齐键、争议样本处理。字段名在评审纪要、采购订单和复测报告里保持一致,六个月后才还能对上同一次实验。

这些判断分别能核对到哪篇公开文献

下面把本文用到的判断收回来源,避免读者把评论句误当成新的实验结果。

「开放生成不能只用准确率」核对 HealthBench(OpenAI, 2025, arXiv:2505.08775):约 5,000 段多轮健康对话,262 名医师,约 48,562 条对话级准则,并设 Consensus 与 Hard。准则命中率不是选择题准确率;打分器是模型,所以没有医师抽检比例的报告,读不出分数里有多少是打分器偏好。

「知识分和安全分可以背离,编排会改变读数」核对 MedBench v4(arXiv:2511.14439)。公开讨论中的方向是:基座模型整体均值可以落在大约 54/100,安全与伦理维度可以低到大约 18/100;同一骨干加上 Agent 编排后,端到端和安全读数都可以变化。引用时要写明是 v4、哪一条分轨、基座还是编排后的系统。

「终答看起来稳,过程仍可能先坏」核对 MedBench v5(arXiv:2606.24155)。论文关心的是信息流压力:关键信息缺省、病历内部矛盾、证据延迟到达,以及幻觉如何萌生、传播和被锚定。只存最终答案的门禁,检验不了这篇论文提出的失败方式。

「像专业表述的错误比明显胡说更难发现」核对 MedHallu(EMNLP 2025, arXiv:2502.14302)。它基于 PubMedQA 构造分层幻觉样本。公开结果指出,即便较强的模型,在硬幻觉上的 F1 仍可落在约 0.625;允许回答不确定、并引入领域知识,检测才会好转。这不是医疗问答总分。

考试型哨兵仍有用,但题面容易进入训练语料、指南版本往往不冻结。早期中文综合基准见 MedBench(arXiv:2407.10990),常一起被当作对照的还有 MedQA、MedMCQA、CMB、CMExam。影像侧的可比性来自 CheXpert 与 MIMIC-CXR 这一类公开语料,它们不自动带来再训练授权、设备域或中文报告金标准。

以上数字都是论文或平台自己的表述,不是 LumeSage 的实测排行。用在 MedBench 多模态轨 上时,只说明协议能约束哪一类句子,不说明任何未公开的模型名次。

因此数据卡上要写过程,而不只写一个终点

对 MedBench 多模态轨 而言,采购和发布真正缺的往往不是又一段背景介绍,而是过程能不能被第三方重读。重读至少包括:题或样本从哪一版指南、哪一台设备、哪一类人群来;谁给出金标准;争议样本由谁仲裁;训练流水线能否看见这些题;换题时哪一项指标还允许和上一版比较。

这些过程对应到字段就是:设备/协议分层、报告对齐键、争议样本处理。某一项暂时没有,就在数据卡上写成未覆盖,并说明未覆盖时产品不能声称已经测量了对应风险。未覆盖的风险,本文已经点过名:授权影像买不到公开榜权限;报告金标准来源不清。

类目 GB-Vision 的作用是把上述过程收成可以下单的规格:医师终审层级、冻结集版本、失败类型词表,以及评测短板如何写进下一包数据的任务说明。评测可以发现短板。它不承诺购买数据之后公开榜分数或临床效果必然提高,也不把示意图上的数字写成实测指标。

若材料里只剩一个总分和一句「经过专家审核」,就还没有写完。专家审核要能回答抽检比例、分歧是否留档、分歧样本是否进入下一版准则。留档的分歧比被平均掉的噪声更有用。

要点

MedBench 多模态轨公开协议能对照的是:视觉感知、跨模态语义、临床决策支持类多模态任务。这些维度要分列,不能收成一个总分。

公开材料测得到、合同里买不到的部分是:授权影像买不到公开榜权限;报告金标准来源不清。

写进数据卡时建议保持同名的字段是:设备/协议分层、报告对齐键、争议样本处理。缺哪一项,就标成未覆盖。

LumeSage 把公开对照留在需求地图上,把可下单的规格放在 GB-Vision 的私有层。观测窗口 2026-09-27;版本以原论文和当期数据卡为准。