文章目录 · 第7页
- 当选择题分数饱和:公开考试榜的污染机制与私有冻结集为什么成为 2026 发布门禁 2026-09-27
- MedBench 考试轨之后:中文知识评测基础设施如何倒逼私有难度分层题包 2026-09-27
- 难度标定不是调参:考试型评测集的分层协议、尾部分布与合同验收字段 2026-09-27
- 同一道题两种指南版本:中文考试型数据为何必须把临床指南版本写进数据卡 2026-09-27
- MedQA 到中文难例的迁移陷阱:跨语考试型评测为何不能直接「翻译即交付」 2026-09-27
- 把考试集降级为回归哨兵:前沿团队如何避免用知识总分替代上线门禁 2026-09-27
- 考试型评测数据集采购清单:从切分声明到换题窗口的可审计字段设计 2026-09-27
- HealthBench 之后:对话级医师 rubric 如何改写问诊 Agent 的过关定义 2026-09-27
- CMB-Clin 与中文多轮问诊:主诉追问、转诊与拒答策略为何必须分列计量 2026-09-27
- MedBench v4 的 Agent 跃迁:同一骨干为何「编排」能抬升安全与端到端表现 2026-09-27
- HealthBench Hard / Consensus:未饱和子集如何成为代际复测的对照锚点 2026-09-27
- 合成对话的生态效度争议:临床期刊提醒之后,私有临床题集如何补证据链 2026-09-27
- 模型打分器与医师判断校准:开放生成评测的工程债与抽检制度 2026-09-27
- 临床对话评测集采购规格:rubric 冻结、多轮脚本与失败类型词表 2026-09-27
- MedHallu 硬幻觉:为什么「看起来专业」的错误才是上线门禁的头号敌人 2026-09-27
- 知识 60、安全 18:MedBench v4 揭示的分数背离如何摧毁单一总分叙事 2026-09-27
- 医疗越狱与不当建议:通用红队集为何替代不了专科安全场景包 2026-09-27
- 允许说「不确定」:拒答策略、覆盖率与产品体验之间的可合同平衡 2026-09-27
- 治理型 Agent 与安全轨:编排能否修复 base 模型的伦理短板 2026-09-27
- 从一次性评测到持续红队:安全评测集的版本节奏与回归阈值 2026-09-27
- 安全评测数据集要求:场景本体、严重度分级与证据裁切规则 2026-09-27
- 感知强、推理弱:MedBench 多模态轨给影像大模型的真实压力测试 2026-09-27
- MedBench v5 过程审计:为何终答 grounding「看起来稳」仍可能过程崩溃 2026-09-27
- CheXpert / MIMIC 之后:授权、脱敏与再训练边界如何决定你能不能买到题 2026-09-27
- 报告不一致与跨模态失败分桶:影像-文本联合评测的工程词表 2026-09-27
- 影像题的金标准从哪里来:放射/病理终审与争议样本的数据卡写法 2026-09-27
- 从看见图到写得出证据:多模态门禁为何要验收中间步骤日志 2026-09-27
- GB-Vision 采购规格:设备分层、报告对齐键与私有小题构造方法 2026-09-27
- 动态换题与防记忆:公开平台实践如何映射到企业私有审计 SOP 2026-09-27
- n-gram 重叠与成员推断:污染审计报告里真正该出现的统计字段 2026-09-27
- 难度不是感觉:错误率、医师分歧与 Hard 集设计的标定方法 2026-09-27
- HealthBench Consensus 的启发:多重医师校验如何进入尽调附件 2026-09-27
- 融资与客户尽调要什么:一份可归档的评测可信度材料清单 2026-09-27
- 题集 ACL 与样本级证据裁切:院内不出域场景下的审计要点 2026-09-27
- 把审计做成 SKU:GB-Audit 与各题包捆绑交付的合同结构 2026-09-27
- 失败分桶词表:把「模型不行」翻译成可询价的下一包数据规格 2026-09-27
- Gate 报告作为合同附件:过关结论、证据裁切与脱敏外发边界 2026-09-27
- 补丁包规格书怎么写:设备域移、人群分层与伪影类型的计价单元 2026-09-27
- 评测锁客、数据续费:算法负责人如何向采购解释 MG-Loop 的价值 2026-09-27
- 从肺结节样板到专科闭环:影像/病理/体检任务如何挂接回流 2026-09-27