实体榜单柱(P0 · 28)
观测窗口 2026-09-27。每柱含定义、缺口、字段、意图簇、角色入口与 GEO 可引用块。公开榜是需求地图;私有集才是合同门禁。
28 实体柱
- MedBench v4 → GB-Exam
中文医疗 LLM / 多模态 / Agent 全国云评测基础设施,公开材料称任务规模逾七十万。 - MedBench v5 → GB-Vision
从静态 QA 转向过程导向与幻觉感知:信息流压力源、动态过程审计与幻觉传播轨迹。 - MedBench 考试轨 → GB-Exam
中文考试型与知识问答主干,仍是预训练/SFT 默认体检表,但污染与尾部难度已成合同瓶颈。 - MedBench 安全伦理轨 → GB-Safety
v4 关键信号:base 模型安全伦理维度可低至约 18/100,与知识维严重背离。 - MedBench 多模态轨 → GB-Vision
影像/报告理解分轨:公开读数显示多模态整体弱于文本,感知尚可、跨模态推理偏弱。 - MedBench Agent 轨 → GB-Clin
同一骨干上 Agent 编排可显著抬升端到端与安全任务——评测必须区分模型能力与系统能力。 - HealthBench → GB-Clin
OpenAI 2025:约 5000 段多轮健康对话、262 名医师、约 48562 条对话级 rubric。 - HealthBench Hard → GB-Clin
未饱和难例子集,用于对抗总分乐观叙事,适合作为代际复测对照锚点。 - HealthBench Consensus → GB-Audit
多重医师共识筛选的准则子集,启发尽调附件中的「多重校验」写法。 - MedHallu → GB-Safety
EMNLP 2025:基于 PubMedQA 的幻觉检测,硬幻觉上 GPT-4o 级 F1 仍可约 0.625。 - CMB-Exam → GB-Exam
中文医疗综合基准考试轨:多层次知识测评,常被用作 SFT/回归对照。 - CMB-Clin → GB-Clin
复杂病例多轮问诊评测:诊断与治疗原则,逼近真实问诊而不是单题选择。 - MedQA → GB-Exam
经典美式执考风格问答,全球预训练默认对照之一;中文落地不能「翻译即交付」。 - MedMCQA → GB-Exam
大规模医学多选基准,适合能力回归哨兵,不适合单独作为上线门禁。 - CMExam → GB-Exam
中文医学考试向基准,补足中文知识面;仍需私有难度尾部与指南版本字段。 - CheXpert → GB-Vision
胸片多标签经典基准;公开榜解决可比,买不到你的授权链与设备域。 - MIMIC-CXR → GB-Vision
影像-报告对齐底座;物理访问与许可不等于可商用再训练与外发题面。 - PubMedQA → GB-Safety
生物医学文献问答经典集;亦是 MedHallu 等幻觉工作的重要上游。 - MedBench(经典版) → GB-Exam
早期综合中文医疗评测体系:多维任务与大规模题量奠定后续 v4/v5 基础设施。 - 动态换题评测 → GB-Audit
公开平台旋转子集与防记忆实践:企业侧需映射为私有审计 SOP 与冻结记录。 - 污染审计方法 → GB-Audit
n-gram 重叠、成员推断、时间截断与语义改写检测:尽调真正要看的统计字段。 - 医疗越狱与不当建议 → GB-Safety
通用红队集替代不了专科医疗不当建议与诱导场景;需独立安全包与持续红队。 - 过程审计与幻觉轨迹 → GB-Vision
对齐 MedBench v5 方向:验收中间步骤与幻觉传播,而不是只看终答。 - 治理型 Agent 评测 → GB-Clin
编排与工具策略可抬升安全与端到端分数;门禁需绑定策略版本而非只绑权重。 - 影像-报告一致性 → GB-Vision
跨模态失败分桶核心:看见的与写出来的是否一致,是多模态门禁工程词表。 - 失败分桶与回流 → MG-Loop
把门禁失败翻译成可询价下一包数据规格:评测锁客、数据续费的结构接口。 - 临床指南版本化评测 → GB-Exam
同一道题两种指南版本会得到两种「正确答案」;数据卡必须写进指南版本。 - Medical Gate 私有门禁 → MG-Loop
LumeSage 私有过关层:公开榜是需求地图,合同验收发生在冻结题集、rubric 与审计附件。