评测数据集 · 实体榜单 · medbench-v5 · GB-Vision
从静态 QA 转向过程导向与幻觉感知:信息流压力源、动态过程审计与幻觉传播轨迹。 本篇聚焦「上线门禁协议」,对齐 2026-09-27 国际评测与数据集要求,服务 GB-Vision 询盘。
English entry: /en/gate/benchmarks/medbench-v5/
观测窗口 2026-09-27。这篇评论讨论「MedBench v5|上线门禁协议:从公开评测到 GB-Vision 可合同门禁」。
锚点是 MedBench v5(MedBench v5,arXiv:2606.24155)。公开材料对它的定位是:从静态 QA 转向过程导向与幻觉感知:信息流压力源、动态过程审计与幻觉传播轨迹。
我们把它当作需求地图上的一个点,用来判断 GB-Vision 这类私有评测集应当测量什么。下文先复述已经发表的协议与结果,再说明这些结果还留下了什么,最后给出数据集与门禁上的推论。
文中不报告 LumeSage 的榜单名次。没有可核验的对照实验,就不写分数。

MedBench v5(arXiv:2606.24155)把评测从「最后一句对不对」推进到「过程是否扛得住」。论文引入临床认知响应与医学原子技能两个维度,并施加信息流压力:关键信息缺省、病历内部矛盾、证据延迟到达。它还要求记录动态过程节点,并追踪幻觉如何萌生、传播、被锚定,以及如何与矛盾信息交互。
实验上的要点对门禁设计几乎是直接的:任务总分可以很高,过程并不稳定;压力源更容易打坏矛盾识别、诊断更新和自我纠正;与此同时,最终答案的证据 grounding 仍可能「看起来稳」。只验收终答的团队,会把过程崩溃误判成已通过。
所以 MedBench v5 对应的数据集要求,不是再收集一批静态问答,而是:中间步骤日志、压力源类型、自我纠正事件,以及这些日志里哪些可以脱敏后外发。
本文引用的公开材料限于可核对来源,数值均来自论文或平台公开表述,不转写成 LumeSage 的实测排行。若后续版本更新,以原论文与数据卡为准。
这些数字不能直接横比,也不能写成「我们超过了某篇论文」。它们的用途是约束句子。
HealthBench 的约 48,562 条准则说明:开放生成的分数是准则命中率,不是选择题准确率。准则由医师按重要性赋权,打分器是模型。因此报告里如果没有抽检比例,读者无法知道分数里有多少是打分器的偏好。Consensus 与 Hard 则说明作者自己也不认为整体分足够:一个用于共识,一个用于防止饱和。
MedBench v4 里被广泛转述的对比——整体大约 54 分、安全伦理可以低到大约 18 分——说明的是分轨,不是某一个模型的永久成绩。版本、子集和是否加上 Agent 编排都会改变读数。引用时要带上「v4、安全轨、基座而非编排后系统」这类限定。
MedHallu 的约 0.625 F1 针对的是硬幻觉检测,不是医疗问答总分。它说明「像专业表述的错误」比明显胡说更难被发现;也说明允许模型回答不确定,本身就是评测设计的一部分,而不只是产品话术。
MedBench v5 没有给出一个可以拿去宣传的新总分,它给出的是失败方式:终答的证据附着可以看起来稳定,过程在缺信息、矛盾和证据延迟下先坏。门禁若只存最终答案,就无法检验这篇论文提出的现象。

第一,MedBench v5 只作为回归哨兵,版本与日期写死,不作为唯一发布依据。
第二,GB-Vision 的私有集在约定分层上达到阈值;阈值写在协议里,而不是评测结束后再挑选。
第三,安全子集或 Hard 子集具备否决权。MedBench v4 的安全低分和 HealthBench Hard 的未饱和,都是这条判据的文献理由。
第四,未通过的样本要能归入失败类型,并决定下一步是补数据、改策略,还是收窄产品范围。没有这一步,门禁只是一个分数,不能指导下一次实验。
四条里有一条不成立,材料里就不写「已通过医疗评测」。
下面是一段可以放进内部评审或合同附件的写法,主体是协议,不是形容词。它针对 MedBench v5,类目 GB-Vision。
「本次发布不使用 MedBench v5 的公开总分作为过关结论。公开协议仅保留为对照,版本与日期写在附录。过关与否依据 GB-Vision 的私有冻结集:分层、阈值和评分细则在评测开始前书面约定。报表至少分列:临床认知响应、医学原子技能、缺省/矛盾/证据延迟压力、过程节点。安全子集或难例子集未达到约定时,整体分不得覆盖该结论。每条失败样本归入类型,并注明对应的数据或策略动作。数据卡必填:过程日志 schema、压力源类型、自我纠正事件、证据裁切规则。」
这段话故意没有名次。名次需要可复现的对照实验和对方授权的题面;两者都不在这篇公开评论的证据范围里。
医师抽检建议写比例和分歧,而不是写「经过专家审核」。分歧样本应留档:它们往往就是下一版准则或下一包数据的来源,而不是应被平均掉的噪声。

测量面建议覆盖:临床认知响应、医学原子技能、缺省/矛盾/证据延迟压力、过程节点、幻觉萌生到锚定轨迹。覆盖的方式是分列报表。能被总分淹没的维度,就还没有被覆盖。
协议上建议写死的字段是:过程日志 schema、压力源类型、自我纠正事件、证据裁切规则。此外,任何准备进入合同的集合都应说明排除标准、金标准来自谁、争议样本如何仲裁、与训练数据如何隔离、版本号以及下一次换题的条件。
这些要求直接来自上面的文献,而不是额外的清单:HealthBench 要求准则与抽检,MedBench v4 要求分轨与动态题,v5 要求过程日志,MedHallu 要求难度分层和「不确定」。在 MedBench v5 上缺了哪一条,就在数据卡上标成未覆盖,而不是在正文里用形容词带过。
到 2027 年,医疗模型评测里有三件公开榜尚未替产业完成的事,它们决定私有数据集的形态。
第一件是过程。MedBench v5 已经说明终答 grounding 可以稳定、中间节点仍然失败。下一代门禁会抽查日志:缺信息时是否追问,矛盾出现时是否改口,证据迟到时是否坚持旧结论。没有日志的基准,回答不了这些问题。
第二件是系统与模型的分离。MedBench v4 里,编排和工具策略可以抬升安全与端到端表现。评测集如果不记录策略版本和工具调用,就会把系统工程的进步记到基座模型头上,或反过来。
第三件是中文临床与授权数据。HealthBench 的准则网络、CheXpert / MIMIC 的影像许可、MedHallu 的英文文献问答,都是对照,不是你能直接采购来覆盖本院指南、本院设备和中文问诊的那一层。
这三件对应到 MedBench v5,就是本文强调的缺口。LumeSage 将 GB-Vision 放在这个缺口上:用医师终审、可版本化的题与审计附件,把论文里的协议翻译成可以下单的规格。公开榜继续担任地图。
若你正在用 MedBench v5 做发布或尽调,可以把场景、对照基准的版本,以及是否需要医师抽检发给我们。意向类目为 GB-Vision。我们回复的是题集沟通说明或 Medical Gate 的排期要点,而不是一份新的排行榜。
联系方式见文末:微信二维码,或电话 +86 15010400907。请不要在表单中提交可识别患者的信息。
评测可以发现短板。它不构成医疗器械宣传,也不承诺购买数据之后模型分数或临床效果必然提高。
把「MedBench v5|上线门禁协议:从公开评测到 GB-Vision 可合同门禁」落到一次内部评审,材料不该是另一篇综述,而该是可以翻页核对的四份东西。第一份是 MedBench v5 的协议说明:它测量 临床认知响应、医学原子技能、缺省/矛盾/证据延迟压力、过程节点、幻觉萌生到锚定轨迹。协议说明要写版本和日期,因为同一名字在不同年份对应的题集并不相同。第二份是对照结果,只保留与本次产品声称相关的分轨,不保留一张无法回溯子集的总分。
第三份是私有门禁,类目对应 GB-Vision。门禁在开评之前写好分层和阈值。开评之后再挑选「看起来过了」的子集,这份材料就失去了门禁的意义。第四份是失败样本。每条样本归入一种类型,并写明下一步是补数据、改策略,还是收窄产品声称的范围。类型来自缺口本身:终答 grounding 稳不等于过程稳;中间日志验收缺省;私有压力源题难买。
四份材料对不齐,评审的结论就是「还不能写已通过」。对不齐不是文稿没写完,是证据范围不够。把不够写成够,后面的尽调和复测都会打回来。
数据卡上建议与这四份材料用同一套字段:过程日志 schema、压力源类型、自我纠正事件、证据裁切规则。字段名在评审纪要、采购订单和复测报告里保持一致,六个月后才还能对上同一次实验。
下面把本文用到的判断收回来源,避免读者把评论句误当成新的实验结果。
「开放生成不能只用准确率」核对 HealthBench(OpenAI, 2025, arXiv:2505.08775):约 5,000 段多轮健康对话,262 名医师,约 48,562 条对话级准则,并设 Consensus 与 Hard。准则命中率不是选择题准确率;打分器是模型,所以没有医师抽检比例的报告,读不出分数里有多少是打分器偏好。
「知识分和安全分可以背离,编排会改变读数」核对 MedBench v4(arXiv:2511.14439)。公开讨论中的方向是:基座模型整体均值可以落在大约 54/100,安全与伦理维度可以低到大约 18/100;同一骨干加上 Agent 编排后,端到端和安全读数都可以变化。引用时要写明是 v4、哪一条分轨、基座还是编排后的系统。
「终答看起来稳,过程仍可能先坏」核对 MedBench v5(arXiv:2606.24155)。论文关心的是信息流压力:关键信息缺省、病历内部矛盾、证据延迟到达,以及幻觉如何萌生、传播和被锚定。只存最终答案的门禁,检验不了这篇论文提出的失败方式。
「像专业表述的错误比明显胡说更难发现」核对 MedHallu(EMNLP 2025, arXiv:2502.14302)。它基于 PubMedQA 构造分层幻觉样本。公开结果指出,即便较强的模型,在硬幻觉上的 F1 仍可落在约 0.625;允许回答不确定、并引入领域知识,检测才会好转。这不是医疗问答总分。
考试型哨兵仍有用,但题面容易进入训练语料、指南版本往往不冻结。早期中文综合基准见 MedBench(arXiv:2407.10990),常一起被当作对照的还有 MedQA、MedMCQA、CMB、CMExam。影像侧的可比性来自 CheXpert 与 MIMIC-CXR 这一类公开语料,它们不自动带来再训练授权、设备域或中文报告金标准。
以上数字都是论文或平台自己的表述,不是 LumeSage 的实测排行。用在 MedBench v5 上时,只说明协议能约束哪一类句子,不说明任何未公开的模型名次。
对 MedBench v5 而言,采购和发布真正缺的往往不是又一段背景介绍,而是过程能不能被第三方重读。重读至少包括:题或样本从哪一版指南、哪一台设备、哪一类人群来;谁给出金标准;争议样本由谁仲裁;训练流水线能否看见这些题;换题时哪一项指标还允许和上一版比较。
这些过程对应到字段就是:过程日志 schema、压力源类型、自我纠正事件、证据裁切规则。某一项暂时没有,就在数据卡上写成未覆盖,并说明未覆盖时产品不能声称已经测量了对应风险。未覆盖的风险,本文已经点过名:终答 grounding 稳不等于过程稳;中间日志验收缺省;私有压力源题难买。
类目 GB-Vision 的作用是把上述过程收成可以下单的规格:医师终审层级、冻结集版本、失败类型词表,以及评测短板如何写进下一包数据的任务说明。评测可以发现短板。它不承诺购买数据之后公开榜分数或临床效果必然提高,也不把示意图上的数字写成实测指标。
若材料里只剩一个总分和一句「经过专家审核」,就还没有写完。专家审核要能回答抽检比例、分歧是否留档、分歧样本是否进入下一版准则。留档的分歧比被平均掉的噪声更有用。
MedBench v5公开协议能对照的是:临床认知响应、医学原子技能、缺省/矛盾/证据延迟压力、过程节点、幻觉萌生到锚定轨迹。这些维度要分列,不能收成一个总分。
公开材料测得到、合同里买不到的部分是:终答 grounding 稳不等于过程稳;中间日志验收缺省;私有压力源题难买。
写进数据卡时建议保持同名的字段是:过程日志 schema、压力源类型、自我纠正事件、证据裁切规则。缺哪一项,就标成未覆盖。
LumeSage 把公开对照留在需求地图上,把可下单的规格放在 GB-Vision 的私有层。观测窗口 2026-09-27;版本以原论文和当期数据卡为准。