← 评测数据集
评测数据集 · 前沿洞察(实体锚定)
六类目 × 7 篇,均锚定公开实体柱。另见
28 实体柱
与意图簇。
提交评测简报
前沿洞察
GB-Exam · 考试型评测集
当选择题分数饱和:公开考试榜的污染机制与私有冻结集为什么成为 2026 发布门禁
MedBench 考试轨之后:中文知识评测基础设施如何倒逼私有难度分层题包
难度标定不是调参:考试型评测集的分层协议、尾部分布与合同验收字段
同一道题两种指南版本:中文考试型数据为何必须把临床指南版本写进数据卡
MedQA 到中文难例的迁移陷阱:跨语考试型评测为何不能直接「翻译即交付」
把考试集降级为回归哨兵:前沿团队如何避免用知识总分替代上线门禁
考试型评测数据集采购清单:从切分声明到换题窗口的可审计字段设计
GB-Clin · 临床对话评测集
HealthBench 之后:对话级医师 rubric 如何改写问诊 Agent 的过关定义
CMB-Clin 与中文多轮问诊:主诉追问、转诊与拒答策略为何必须分列计量
MedBench v4 的 Agent 跃迁:同一骨干为何「编排」能抬升安全与端到端表现
HealthBench Hard / Consensus:未饱和子集如何成为代际复测的对照锚点
合成对话的生态效度争议:临床期刊提醒之后,私有临床题集如何补证据链
模型打分器与医师判断校准:开放生成评测的工程债与抽检制度
临床对话评测集采购规格:rubric 冻结、多轮脚本与失败类型词表
GB-Safety · 安全评测集
MedHallu 硬幻觉:为什么「看起来专业」的错误才是上线门禁的头号敌人
知识 60、安全 18:MedBench v4 揭示的分数背离如何摧毁单一总分叙事
医疗越狱与不当建议:通用红队集为何替代不了专科安全场景包
允许说「不确定」:拒答策略、覆盖率与产品体验之间的可合同平衡
治理型 Agent 与安全轨:编排能否修复 base 模型的伦理短板
从一次性评测到持续红队:安全评测集的版本节奏与回归阈值
安全评测数据集要求:场景本体、严重度分级与证据裁切规则
GB-Vision · 多模态评测集
感知强、推理弱:MedBench 多模态轨给影像大模型的真实压力测试
MedBench v5 过程审计:为何终答 grounding「看起来稳」仍可能过程崩溃
CheXpert / MIMIC 之后:授权、脱敏与再训练边界如何决定你能不能买到题
报告不一致与跨模态失败分桶:影像-文本联合评测的工程词表
影像题的金标准从哪里来:放射/病理终审与争议样本的数据卡写法
从看见图到写得出证据:多模态门禁为何要验收中间步骤日志
GB-Vision 采购规格:设备分层、报告对齐键与私有小题构造方法
GB-Audit · 污染审计
动态换题与防记忆:公开平台实践如何映射到企业私有审计 SOP
n-gram 重叠与成员推断:污染审计报告里真正该出现的统计字段
难度不是感觉:错误率、医师分歧与 Hard 集设计的标定方法
HealthBench Consensus 的启发:多重医师校验如何进入尽调附件
融资与客户尽调要什么:一份可归档的评测可信度材料清单
题集 ACL 与样本级证据裁切:院内不出域场景下的审计要点
把审计做成 SKU:GB-Audit 与各题包捆绑交付的合同结构
MG-Loop · Gate回流
失败分桶词表:把「模型不行」翻译成可询价的下一包数据规格
Gate 报告作为合同附件:过关结论、证据裁切与脱敏外发边界
补丁包规格书怎么写:设备域移、人群分层与伪影类型的计价单元
评测锁客、数据续费:算法负责人如何向采购解释 MG-Loop 的价值
从肺结节样板到专科闭环:影像/病理/体检任务如何挂接回流
SFT 之后的能力回退:代际复测为何必须绑定旧门禁集与新难例
MG-Loop 交付物清单:评测协议、分桶、规格草案与数据包SKU映射