← 评测数据集

评测数据集 · 前沿洞察(实体锚定)

六类目 × 7 篇,均锚定公开实体柱。另见 28 实体柱 与意图簇。

提交评测简报前沿洞察

GB-Exam · 考试型评测集

  1. 当选择题分数饱和:公开考试榜的污染机制与私有冻结集为什么成为 2026 发布门禁
  2. MedBench 考试轨之后:中文知识评测基础设施如何倒逼私有难度分层题包
  3. 难度标定不是调参:考试型评测集的分层协议、尾部分布与合同验收字段
  4. 同一道题两种指南版本:中文考试型数据为何必须把临床指南版本写进数据卡
  5. MedQA 到中文难例的迁移陷阱:跨语考试型评测为何不能直接「翻译即交付」
  6. 把考试集降级为回归哨兵:前沿团队如何避免用知识总分替代上线门禁
  7. 考试型评测数据集采购清单:从切分声明到换题窗口的可审计字段设计

GB-Clin · 临床对话评测集

  1. HealthBench 之后:对话级医师 rubric 如何改写问诊 Agent 的过关定义
  2. CMB-Clin 与中文多轮问诊:主诉追问、转诊与拒答策略为何必须分列计量
  3. MedBench v4 的 Agent 跃迁:同一骨干为何「编排」能抬升安全与端到端表现
  4. HealthBench Hard / Consensus:未饱和子集如何成为代际复测的对照锚点
  5. 合成对话的生态效度争议:临床期刊提醒之后,私有临床题集如何补证据链
  6. 模型打分器与医师判断校准:开放生成评测的工程债与抽检制度
  7. 临床对话评测集采购规格:rubric 冻结、多轮脚本与失败类型词表

GB-Safety · 安全评测集

  1. MedHallu 硬幻觉:为什么「看起来专业」的错误才是上线门禁的头号敌人
  2. 知识 60、安全 18:MedBench v4 揭示的分数背离如何摧毁单一总分叙事
  3. 医疗越狱与不当建议:通用红队集为何替代不了专科安全场景包
  4. 允许说「不确定」:拒答策略、覆盖率与产品体验之间的可合同平衡
  5. 治理型 Agent 与安全轨:编排能否修复 base 模型的伦理短板
  6. 从一次性评测到持续红队:安全评测集的版本节奏与回归阈值
  7. 安全评测数据集要求:场景本体、严重度分级与证据裁切规则

GB-Vision · 多模态评测集

  1. 感知强、推理弱:MedBench 多模态轨给影像大模型的真实压力测试
  2. MedBench v5 过程审计:为何终答 grounding「看起来稳」仍可能过程崩溃
  3. CheXpert / MIMIC 之后:授权、脱敏与再训练边界如何决定你能不能买到题
  4. 报告不一致与跨模态失败分桶:影像-文本联合评测的工程词表
  5. 影像题的金标准从哪里来:放射/病理终审与争议样本的数据卡写法
  6. 从看见图到写得出证据:多模态门禁为何要验收中间步骤日志
  7. GB-Vision 采购规格:设备分层、报告对齐键与私有小题构造方法

GB-Audit · 污染审计

  1. 动态换题与防记忆:公开平台实践如何映射到企业私有审计 SOP
  2. n-gram 重叠与成员推断:污染审计报告里真正该出现的统计字段
  3. 难度不是感觉:错误率、医师分歧与 Hard 集设计的标定方法
  4. HealthBench Consensus 的启发:多重医师校验如何进入尽调附件
  5. 融资与客户尽调要什么:一份可归档的评测可信度材料清单
  6. 题集 ACL 与样本级证据裁切:院内不出域场景下的审计要点
  7. 把审计做成 SKU:GB-Audit 与各题包捆绑交付的合同结构

MG-Loop · Gate回流

  1. 失败分桶词表:把「模型不行」翻译成可询价的下一包数据规格
  2. Gate 报告作为合同附件:过关结论、证据裁切与脱敏外发边界
  3. 补丁包规格书怎么写:设备域移、人群分层与伪影类型的计价单元
  4. 评测锁客、数据续费:算法负责人如何向采购解释 MG-Loop 的价值
  5. 从肺结节样板到专科闭环:影像/病理/体检任务如何挂接回流
  6. SFT 之后的能力回退:代际复测为何必须绑定旧门禁集与新难例
  7. MG-Loop 交付物清单:评测协议、分桶、规格草案与数据包SKU映射