SKU · GB-Exam · 考试型题集
LumeSage
考试型过关:公开榜解决「可比」,私有难例包解决「代际是否真过关」。
对医疗大模型算法工程师而言,MedQA / MedMCQA / CMB-Exam / CMExam / MedBench 考试轨仍是 SFT 与预训练的默认体检表。2025–2026 年的共识是:选择题分数正在饱和,但污染、中文临床细则与难度尾部分布仍是合同门禁的真正瓶颈。
观测窗口:2026-09-27 · 公开材料为需求地图;合同交付以私有题集与数据卡为准。
相关公开榜 · 点击即询
下列为算法团队日常对齐的公开生态。点击榜单名可预填咨询表单;LumeSage 供给的是可合同化的私有映射层,而非复刻公开题。
LumeSage 怎么读这类榜
公开考试榜的工程语义是「知识覆盖与选择题推理」。对训练管线有价值,但不足以证明上线安全或专科可用性。2026 年 9 月观测:中文侧 MedBench 已演进到覆盖多专科、多模态与 Agent 的基础设施(v4 报道体量达数十万级任务、数百家机构审题);考试子轨仍是入门门禁,但安全/伦理维度显著低于知识维度——这正是不能把 Exam 分数当成产品发布标准的原因。
GB-Exam 的产品定义:在公开生态难度协议之上,交付私有、可版本化、可审计污染状态的考试型题包(含中文难例与英文分层可选),供预训练 / SFT / 代际复测合同化使用。规模与许可以数据卡为准。
榜单 × 论文 × 模型进展(前瞻拆解)
| 公开生态 | 截至 2026-09 的读法 | 对算法团队的启发 | LumeSage 映射 |
|---|---|---|---|
| MedQA | 经典 USMLE 风格知识基准;仍被用作英文医疗 LLM 的「地板」对照。 | 易被预训练语料污染;需难度分层与泄漏审计。 | 英/中难度分层难例 + GB-Audit |
| CMB-Exam | 中文医疗选择题主干之一;与 CMB-Clin 分流。 | 中文临床细则与指南版本必须分列,否则复测不可比。 | 中文难例包 + 指南版本标签 |
| MedBench | OpenCompass 系中文医疗评测基础设施;v4(2025 末)扩展至 LLM / 多模态 / Agent;期刊脉络见 Big Data Mining and Analytics 等。 | 公开云评测防记忆机制在增强;合同仍需私有冻结集。 | 私有考试子集 + 动态换题 SOP |
| CMExam | 中文医学考试资源,常与 CBLUE 等一并出现在「知识轨」综述中。 | 适合作为公开对照,不适合作为唯一上线标准。 | 对照映射表 + 私有补难例 |
前沿模型信号
Frontier 通用模型在考试型轨上继续抬升,但 MedBench v4 等报告显示:知识分与安全分可严重背离。算法负责人应分轨汇报,禁止「一个总分」叙事。
期刊 / 会议线索
关注 MedBench 系列技术报告、CMB 相关资源论文,以及把「静态 QA → 过程/Agent 评测」的综述(2025–2026)。考试轨不会消失,但权重在下降。
2026 前瞻
考试型题将更多用于「污染哨兵 + 回归测试」,主发布门禁转向 Clin / Safety / Vision。GB-Exam 定位为高频、低成本、可版本化的回归包。
交付物(合同口径)
公开页不展示无法核验的分数排行榜。过关阈值、题量与许可以双方冻结的规格书与数据卡为准。
题包
私有选择题 / 多选,难度分层与专科标签;可选中英双轨。
数据卡
来源授权、脱敏、再训练边界、切分与防污染声明。
可选服务
污染审计(GB-Audit)、代际复测排期、失败回流补丁规格。
本类目前沿洞察(7 篇)
每篇不少于 4300 字,实体锚定公开榜单柱;文末含微信二维码、电话与询盘表单。另见 实体榜单 28 柱。
就本类目提交询价简报
点击上方榜单可预填咨询对象。提交后同步商务邮箱与钉钉,并入库 CRM。请勿提交患者可识别信息。
提交 GB-Exam 询价简报
一个工作日内回复题集沟通说明或 Medical Gate 排期要点。指定本 SKU 的线索优先排期。
运营与合同主体:北京朗慧科技有限公司 · 品牌 LumeSage。本站不构成医疗器械宣传,不对模型临床疗效作承诺。公开榜分数不可作为合同过关依据。