评测数据集 · 实体榜单 · healthbench · GB-Clin
OpenAI 2025:约 5000 段多轮健康对话、262 名医师、约 48562 条对话级 rubric。 对齐 2026-09-27 前沿评测进展,给出 GB-Clin 映射、字段清单与询盘入口。
English entry: /en/gate/benchmarks/healthbench/
正文约 600 字 · 观测窗口 2026-09-27 · 实体锚定 healthbench
HealthBench(HealthBench)· 观测窗口 2026-09-27。
OpenAI 2025:约 5000 段多轮健康对话、262 名医师、约 48562 条对话级 rubric。
主映射 SKU:GB-Clin(临床对话评测集)。相关扩展:GB-Safety。
参考文献标识:arXiv:2505.08775。
测量面:
产业共识缺口:
完整采购与门禁协议见意图簇文章,并回到类目页 GB-Clin。
| 能力维 | 解读口径 |
|---|---|
| 准确性 | 公开生态可对照;合同验收需私有冻结与字段化。 |
| 完整性 | 公开生态可对照;合同验收需私有冻结与字段化。 |
| 情境意识 | 公开生态可对照;合同验收需私有冻结与字段化。 |
| 沟通 | 公开生态可对照;合同验收需私有冻结与字段化。 |
| 指令遵循 | 公开生态可对照;合同验收需私有冻结与字段化。 |
公开测得到、合同买不到的缺口:
数据集要求字段(可摘抄):
Q:HealthBench主要测什么?
A:准确性;完整性;情境意识;沟通。
Q:为什么不能直接把 HealthBench 当合同门禁?
A:合成对话≠临床结局;中文私有 rubric 需重建;grader 需与医师校准。
Q:采购时应对齐哪些字段?
A:rubric_id;权重;抽检比例;分歧计量。
Q:LumeSage 如何映射?
A:公开对照保留为需求地图;付费发生在 GB-Clin 私有层与可审计附件。
Q:观测窗口?
A:2026-09-27;版本与公开材料可能更新,以数据卡为准。