首页/评测数据集/GB-Clin

SKU · GB-Clin · 临床对话 + rubric

LumeSage

从选择题到开放生成:医师 rubric 才是问诊 Agent 的可合同门禁。

OpenAI HealthBench(2025)把评测范式推到「对话级医师准则」:约 5,000 段健康对话、48,562 条 rubric、262 名跨 60 国医师参与。中文侧 CMB-Clin 与 MedBench Agent 轨同向。算法团队若仍只用 Exam 分数发布问诊产品,2026 年已不够格。

多轮问诊医师 rubric开放生成Agent 门禁

观测窗口:2026-09-27 · 公开材料为需求地图;合同交付以私有题集与数据卡为准。

相关公开榜 · 点击即询

下列为算法团队日常对齐的公开生态。点击榜单名可预填咨询表单;LumeSage 供给的是可合同化的私有映射层,而非复刻公开题。

LumeSage 怎么读这类榜

HealthBench(arXiv:2505.08775;OpenAI 2025 发布)证明:开放生成必须按「对话定制准则」计分,模型打分器需与医师判断校准。公开材料显示 o3 等推理模型相对前代有显著跃迁,同时放出 Consensus / Hard 变体以对抗饱和。PMC 等临床评论同步提醒:合成对话 ≠ 真实诊疗结局,不能替代外部临床验证。

MedBench v4 进一步显示:同一骨干上的 Agent 编排可大幅抬升端到端与安全任务表现——说明「对话 + 工具 + 治理」正在成为中文医疗评测主战场。

GB-Clin:交付中文(可含多语)多轮问诊私有集 + 可冻结的医师 rubric + 可选医师抽检,服务问诊 Agent / 临床助手的上线门禁与代际复测。

榜单 × 论文 × 模型进展

公开生态截至 2026-09算法工程含义LumeSage 映射
HealthBench5k 对话;医师定制 rubric;轴含 accuracy / communication / context 等。需要 rubric 工程与 grader 校准,而不仅是 Accuracy@1。中文私有对话 + 冻结 rubric
HealthBench Hard公开报告中头部模型仍有大量 headroom(Hard 分显著低于 Overall)。适合作为「未饱和」对照;合同仍需私有 Hard 集。难例对话包 · 年度更新
CMB-Clin中文临床对话评测脉络;与 Exam 分流。中文主诉、追问、拒答与转诊策略是差异化关键。中文临床多轮 + 专科标签
MedBench Agentv4:Agent 均值显著高于 base LLM;安全任务可随治理编排提升。评测要覆盖工具调用与流程合规,不只是单轮回答。流程题 + rubric + Gate 盲测

前沿模型信号

推理模型与长上下文模型在 HealthBench 类任务上进步更快;小模型性价比也在抬升。发布叙事应分 Overall / Consensus / Hard,避免只报乐观子集。

学术期刊提醒

临床期刊评论强调:无生态效度、纵向随访与患者结局缺失。GB-Clin 因此坚持「门禁语料 ≠ 临床疗效证明」话术。

2026 前瞻

多轮 + rubric + 工具调用将成为默认采购包;中文医师网与可审计授权是稀缺供给。LumeSage 壁垒在专家网与回流数据产线,不在「再做一个公开榜」。

本类目前沿洞察(7 篇)

每篇不少于 4300 字,实体锚定公开榜单柱;文末含微信二维码、电话与询盘表单。另见 实体榜单 28 柱。

查看全部洞察 · 实体榜单

就本类目提交询价简报

点击上方榜单可预填咨询对象。提交后同步商务邮箱与钉钉,并入库 CRM。请勿提交患者可识别信息。

提交 GB-Clin 询价简报

一个工作日内回复题集沟通说明或 Medical Gate 排期要点。指定本 SKU 的线索优先排期。

返回评测数据集 隐私政策

运营与合同主体:北京朗慧科技有限公司 · 品牌 LumeSage。本站不构成医疗器械宣传,不对模型临床疗效作承诺。公开榜分数不可作为合同过关依据。