评测数据集 · 实体榜单 · medbench-agent · GB-Clin
同一骨干上 Agent 编排可显著抬升端到端与安全任务——评测必须区分模型能力与系统能力。 本篇聚焦「上线门禁协议」,对齐 2026-09-27 国际评测与数据集要求,服务 GB-Clin 询盘。
English entry: /en/gate/benchmarks/medbench-agent/
观测窗口 2026-09-27。这篇评论讨论「MedBench Agent 轨|上线门禁协议:从公开评测到 GB-Clin 可合同门禁」。
锚点是 MedBench Agent 轨(MedBench Agent Track,arXiv:2511.14439)。公开材料对它的定位是:同一骨干上 Agent 编排可显著抬升端到端与安全任务——评测必须区分模型能力与系统能力。
我们把它当作需求地图上的一个点,用来判断 GB-Clin 这类私有评测集应当测量什么。下文先复述已经发表的协议与结果,再说明这些结果还留下了什么,最后给出数据集与门禁上的推论。
文中不报告 LumeSage 的榜单名次。没有可核验的对照实验,就不写分数。

2025–2026 年的医疗评测文献,实际上在拆掉「一个准确率代表临床能力」这件事。
考试型公开集(MedQA、MedMCQA、CMB、CMExam,以及 MedBench 早期综合基准,arXiv:2407.10990)仍然适合作为知识回归的哨兵。它们的问题也被讲得很清楚:题面容易进入训练语料,指南版本往往不冻结,专科尾部和高风险拒答不在总分里。
对话与系统侧,HealthBench(arXiv:2505.08775)证明开放生成需要对话级医师准则;MedBench v4(arXiv:2511.14439)证明同一骨干加上 Agent 编排,端到端和安全读数都可以明显变化,所以「模型分」和「系统分」必须分列;MedBench v5(arXiv:2606.24155)证明终答看起来稳,过程仍可能在矛盾和证据延迟下崩溃;MedHallu(arXiv:2502.14302)证明硬幻觉不是二分类玩具题。
MedBench Agent 轨 处于这条文献链上的具体位置是:同一骨干上 Agent 编排可显著抬升端到端与安全任务——评测必须区分模型能力与系统能力。下文只讨论这个位置上还没有被公开榜解决、因而需要写进数据集与门禁协议的部分。
本文引用的公开材料限于可核对来源,数值均来自论文或平台公开表述,不转写成 LumeSage 的实测排行。若后续版本更新,以原论文与数据卡为准。
这些数字不能直接横比,也不能写成「我们超过了某篇论文」。它们的用途是约束句子。
HealthBench 的约 48,562 条准则说明:开放生成的分数是准则命中率,不是选择题准确率。准则由医师按重要性赋权,打分器是模型。因此报告里如果没有抽检比例,读者无法知道分数里有多少是打分器的偏好。Consensus 与 Hard 则说明作者自己也不认为整体分足够:一个用于共识,一个用于防止饱和。
MedBench v4 里被广泛转述的对比——整体大约 54 分、安全伦理可以低到大约 18 分——说明的是分轨,不是某一个模型的永久成绩。版本、子集和是否加上 Agent 编排都会改变读数。引用时要带上「v4、安全轨、基座而非编排后系统」这类限定。
MedHallu 的约 0.625 F1 针对的是硬幻觉检测,不是医疗问答总分。它说明「像专业表述的错误」比明显胡说更难被发现;也说明允许模型回答不确定,本身就是评测设计的一部分,而不只是产品话术。
MedBench v5 没有给出一个可以拿去宣传的新总分,它给出的是失败方式:终答的证据附着可以看起来稳定,过程在缺信息、矛盾和证据延迟下先坏。门禁若只存最终答案,就无法检验这篇论文提出的现象。

第一,MedBench Agent 轨 只作为回归哨兵,版本与日期写死,不作为唯一发布依据。
第二,GB-Clin 的私有集在约定分层上达到阈值;阈值写在协议里,而不是评测结束后再挑选。
第三,安全子集或 Hard 子集具备否决权。MedBench v4 的安全低分和 HealthBench Hard 的未饱和,都是这条判据的文献理由。
第四,未通过的样本要能归入失败类型,并决定下一步是补数据、改策略,还是收窄产品范围。没有这一步,门禁只是一个分数,不能指导下一次实验。
四条里有一条不成立,材料里就不写「已通过医疗评测」。
下面是一段可以放进内部评审或合同附件的写法,主体是协议,不是形容词。它针对 MedBench Agent 轨,类目 GB-Clin。
「本次发布不使用 MedBench Agent 轨 的公开总分作为过关结论。公开协议仅保留为对照,版本与日期写在附录。过关与否依据 GB-Clin 的私有冻结集:分层、阈值和评分细则在评测开始前书面约定。报表至少分列:任务规划、工具调用、场景交互、记忆与协作。安全子集或难例子集未达到约定时,整体分不得覆盖该结论。每条失败样本归入类型,并注明对应的数据或策略动作。数据卡必填:工具白名单版本、调用轨迹、治理策略 ID。」
这段话故意没有名次。名次需要可复现的对照实验和对方授权的题面;两者都不在这篇公开评论的证据范围里。
医师抽检建议写比例和分歧,而不是写「经过专家审核」。分歧样本应留档:它们往往就是下一版准则或下一包数据的来源,而不是应被平均掉的噪声。

测量面建议覆盖:任务规划、工具调用、场景交互、记忆与协作。覆盖的方式是分列报表。能被总分淹没的维度,就还没有被覆盖。
协议上建议写死的字段是:工具白名单版本、调用轨迹、治理策略 ID。此外,任何准备进入合同的集合都应说明排除标准、金标准来自谁、争议样本如何仲裁、与训练数据如何隔离、版本号以及下一次换题的条件。
这些要求直接来自上面的文献,而不是额外的清单:HealthBench 要求准则与抽检,MedBench v4 要求分轨与动态题,v5 要求过程日志,MedHallu 要求难度分层和「不确定」。在 MedBench Agent 轨 上缺了哪一条,就在数据卡上标成未覆盖,而不是在正文里用形容词带过。
到 2027 年,医疗模型评测里有三件公开榜尚未替产业完成的事,它们决定私有数据集的形态。
第一件是过程。MedBench v5 已经说明终答 grounding 可以稳定、中间节点仍然失败。下一代门禁会抽查日志:缺信息时是否追问,矛盾出现时是否改口,证据迟到时是否坚持旧结论。没有日志的基准,回答不了这些问题。
第二件是系统与模型的分离。MedBench v4 里,编排和工具策略可以抬升安全与端到端表现。评测集如果不记录策略版本和工具调用,就会把系统工程的进步记到基座模型头上,或反过来。
第三件是中文临床与授权数据。HealthBench 的准则网络、CheXpert / MIMIC 的影像许可、MedHallu 的英文文献问答,都是对照,不是你能直接采购来覆盖本院指南、本院设备和中文问诊的那一层。
这三件对应到 MedBench Agent 轨,就是本文强调的缺口。LumeSage 将 GB-Clin 放在这个缺口上:用医师终审、可版本化的题与审计附件,把论文里的协议翻译成可以下单的规格。公开榜继续担任地图。
若你正在用 MedBench Agent 轨 做发布或尽调,可以把场景、对照基准的版本,以及是否需要医师抽检发给我们。意向类目为 GB-Clin。我们回复的是题集沟通说明或 Medical Gate 的排期要点,而不是一份新的排行榜。
联系方式见文末:微信二维码,或电话 +86 15010400907。请不要在表单中提交可识别患者的信息。
评测可以发现短板。它不构成医疗器械宣传,也不承诺购买数据之后模型分数或临床效果必然提高。
把「MedBench Agent 轨|上线门禁协议:从公开评测到 GB-Clin 可合同门禁」落到一次内部评审,材料不该是另一篇综述,而该是可以翻页核对的四份东西。第一份是 MedBench Agent 轨 的协议说明:它测量 任务规划、工具调用、场景交互、记忆与协作。协议说明要写版本和日期,因为同一名字在不同年份对应的题集并不相同。第二份是对照结果,只保留与本次产品声称相关的分轨,不保留一张无法回溯子集的总分。
第三份是私有门禁,类目对应 GB-Clin。门禁在开评之前写好分层和阈值。开评之后再挑选「看起来过了」的子集,这份材料就失去了门禁的意义。第四份是失败样本。每条样本归入一种类型,并写明下一步是补数据、改策略,还是收窄产品声称的范围。类型来自缺口本身:只测补全不测治理策略;工具轨迹不可审计。
四份材料对不齐,评审的结论就是「还不能写已通过」。对不齐不是文稿没写完,是证据范围不够。把不够写成够,后面的尽调和复测都会打回来。
数据卡上建议与这四份材料用同一套字段:工具白名单版本、调用轨迹、治理策略 ID。字段名在评审纪要、采购订单和复测报告里保持一致,六个月后才还能对上同一次实验。
下面把本文用到的判断收回来源,避免读者把评论句误当成新的实验结果。
「开放生成不能只用准确率」核对 HealthBench(OpenAI, 2025, arXiv:2505.08775):约 5,000 段多轮健康对话,262 名医师,约 48,562 条对话级准则,并设 Consensus 与 Hard。准则命中率不是选择题准确率;打分器是模型,所以没有医师抽检比例的报告,读不出分数里有多少是打分器偏好。
「知识分和安全分可以背离,编排会改变读数」核对 MedBench v4(arXiv:2511.14439)。公开讨论中的方向是:基座模型整体均值可以落在大约 54/100,安全与伦理维度可以低到大约 18/100;同一骨干加上 Agent 编排后,端到端和安全读数都可以变化。引用时要写明是 v4、哪一条分轨、基座还是编排后的系统。
「终答看起来稳,过程仍可能先坏」核对 MedBench v5(arXiv:2606.24155)。论文关心的是信息流压力:关键信息缺省、病历内部矛盾、证据延迟到达,以及幻觉如何萌生、传播和被锚定。只存最终答案的门禁,检验不了这篇论文提出的失败方式。
「像专业表述的错误比明显胡说更难发现」核对 MedHallu(EMNLP 2025, arXiv:2502.14302)。它基于 PubMedQA 构造分层幻觉样本。公开结果指出,即便较强的模型,在硬幻觉上的 F1 仍可落在约 0.625;允许回答不确定、并引入领域知识,检测才会好转。这不是医疗问答总分。
考试型哨兵仍有用,但题面容易进入训练语料、指南版本往往不冻结。早期中文综合基准见 MedBench(arXiv:2407.10990),常一起被当作对照的还有 MedQA、MedMCQA、CMB、CMExam。影像侧的可比性来自 CheXpert 与 MIMIC-CXR 这一类公开语料,它们不自动带来再训练授权、设备域或中文报告金标准。
以上数字都是论文或平台自己的表述,不是 LumeSage 的实测排行。用在 MedBench Agent 轨 上时,只说明协议能约束哪一类句子,不说明任何未公开的模型名次。
对 MedBench Agent 轨 而言,采购和发布真正缺的往往不是又一段背景介绍,而是过程能不能被第三方重读。重读至少包括:题或样本从哪一版指南、哪一台设备、哪一类人群来;谁给出金标准;争议样本由谁仲裁;训练流水线能否看见这些题;换题时哪一项指标还允许和上一版比较。
这些过程对应到字段就是:工具白名单版本、调用轨迹、治理策略 ID。某一项暂时没有,就在数据卡上写成未覆盖,并说明未覆盖时产品不能声称已经测量了对应风险。未覆盖的风险,本文已经点过名:只测补全不测治理策略;工具轨迹不可审计。
类目 GB-Clin 的作用是把上述过程收成可以下单的规格:医师终审层级、冻结集版本、失败类型词表,以及评测短板如何写进下一包数据的任务说明。评测可以发现短板。它不承诺购买数据之后公开榜分数或临床效果必然提高,也不把示意图上的数字写成实测指标。
若材料里只剩一个总分和一句「经过专家审核」,就还没有写完。专家审核要能回答抽检比例、分歧是否留档、分歧样本是否进入下一版准则。留档的分歧比被平均掉的噪声更有用。
MedBench Agent 轨公开协议能对照的是:任务规划、工具调用、场景交互、记忆与协作。这些维度要分列,不能收成一个总分。
公开材料测得到、合同里买不到的部分是:只测补全不测治理策略;工具轨迹不可审计。
写进数据卡时建议保持同名的字段是:工具白名单版本、调用轨迹、治理策略 ID。缺哪一项,就标成未覆盖。
LumeSage 把公开对照留在需求地图上,把可下单的规格放在 GB-Clin 的私有层。观测窗口 2026-09-27;版本以原论文和当期数据卡为准。