首页/评测数据集/GB-Exam

SKU · GB-Exam · 考试型题集

LumeSage

考试型过关:公开榜解决「可比」,私有难例包解决「代际是否真过关」。

对医疗大模型算法工程师而言,MedQA / MedMCQA / CMB-Exam / CMExam / MedBench 考试轨仍是 SFT 与预训练的默认体检表。2025–2026 年的共识是:选择题分数正在饱和,但污染、中文临床细则与难度尾部分布仍是合同门禁的真正瓶颈。

难度分层污染防控中文难例代际复测

观测窗口:2026-09-27 · 公开材料为需求地图;合同交付以私有题集与数据卡为准。

相关公开榜 · 点击即询

下列为算法团队日常对齐的公开生态。点击榜单名可预填咨询表单;LumeSage 供给的是可合同化的私有映射层,而非复刻公开题。

LumeSage 怎么读这类榜

公开考试榜的工程语义是「知识覆盖与选择题推理」。对训练管线有价值,但不足以证明上线安全或专科可用性。2026 年 9 月观测:中文侧 MedBench 已演进到覆盖多专科、多模态与 Agent 的基础设施(v4 报道体量达数十万级任务、数百家机构审题);考试子轨仍是入门门禁,但安全/伦理维度显著低于知识维度——这正是不能把 Exam 分数当成产品发布标准的原因。

GB-Exam 的产品定义:在公开生态难度协议之上,交付私有、可版本化、可审计污染状态的考试型题包(含中文难例与英文分层可选),供预训练 / SFT / 代际复测合同化使用。规模与许可以数据卡为准。

榜单 × 论文 × 模型进展(前瞻拆解)

公开生态截至 2026-09 的读法对算法团队的启发LumeSage 映射
MedQA经典 USMLE 风格知识基准;仍被用作英文医疗 LLM 的「地板」对照。易被预训练语料污染;需难度分层与泄漏审计。英/中难度分层难例 + GB-Audit
CMB-Exam中文医疗选择题主干之一;与 CMB-Clin 分流。中文临床细则与指南版本必须分列,否则复测不可比。中文难例包 + 指南版本标签
MedBenchOpenCompass 系中文医疗评测基础设施;v4(2025 末)扩展至 LLM / 多模态 / Agent;期刊脉络见 Big Data Mining and Analytics 等。公开云评测防记忆机制在增强;合同仍需私有冻结集。私有考试子集 + 动态换题 SOP
CMExam中文医学考试资源,常与 CBLUE 等一并出现在「知识轨」综述中。适合作为公开对照,不适合作为唯一上线标准。对照映射表 + 私有补难例

前沿模型信号

Frontier 通用模型在考试型轨上继续抬升,但 MedBench v4 等报告显示:知识分与安全分可严重背离。算法负责人应分轨汇报,禁止「一个总分」叙事。

期刊 / 会议线索

关注 MedBench 系列技术报告、CMB 相关资源论文,以及把「静态 QA → 过程/Agent 评测」的综述(2025–2026)。考试轨不会消失,但权重在下降。

2026 前瞻

考试型题将更多用于「污染哨兵 + 回归测试」,主发布门禁转向 Clin / Safety / Vision。GB-Exam 定位为高频、低成本、可版本化的回归包。

交付物(合同口径)

公开页不展示无法核验的分数排行榜。过关阈值、题量与许可以双方冻结的规格书与数据卡为准。

题包

私有选择题 / 多选,难度分层与专科标签;可选中英双轨。

数据卡

来源授权、脱敏、再训练边界、切分与防污染声明。

可选服务

污染审计(GB-Audit)、代际复测排期、失败回流补丁规格。

本类目前沿洞察(7 篇)

每篇不少于 4300 字,实体锚定公开榜单柱;文末含微信二维码、电话与询盘表单。另见 实体榜单 28 柱。

查看全部洞察 · 实体榜单

就本类目提交询价简报

点击上方榜单可预填咨询对象。提交后同步商务邮箱与钉钉,并入库 CRM。请勿提交患者可识别信息。

提交 GB-Exam 询价简报

一个工作日内回复题集沟通说明或 Medical Gate 排期要点。指定本 SKU 的线索优先排期。

返回评测数据集 隐私政策

运营与合同主体:北京朗慧科技有限公司 · 品牌 LumeSage。本站不构成医疗器械宣传,不对模型临床疗效作承诺。公开榜分数不可作为合同过关依据。