首页/评测数据集/GB-Safety

SKU · GB-Safety · 安全拒答 / 幻觉

LumeSage

安全分可以低到让「知识高分」失去发布意义——门禁必须单独立项。

MedBench v4 公开读数中,base LLM 安全与伦理均值可低至约 18/100 量级,与知识维严重背离。MedHallu(EMNLP 2025,arXiv:2502.14302)证明「硬幻觉」检测对 GPT-4o 级模型仍困难。上线门禁若无独立 Safety 包,等于把风险留给客服与法务。

拒答幻觉越狱上线门禁

观测窗口:2026-09-27 · 公开材料为需求地图;合同交付以私有题集与数据卡为准。

相关公开榜 · 点击即询

下列为算法团队日常对齐的公开生态。点击榜单名可预填咨询表单;LumeSage 供给的是可合同化的私有映射层,而非复刻公开题。

LumeSage 怎么读这类榜

MedHallu:基于 PubMedQA 构造 1 万级问答对,系统生成幻觉答案并分 easy/medium/hard;硬幻觉与真值语义更近,检测 F1 可降至约 0.625。结论对产品含义:需要领域知识注入与「不确定则拒答」策略,而不是只靠医疗微调。

MedBench 安全轨:把伦理、违规建议、隐私等单列。v4 显示 Agent 治理可抬升安全任务——说明 Safety 评测应覆盖策略层,而不只是单次补全。

GB-Safety:私有拒答 / 幻觉 / 越狱医疗场景包 + 可选医师复核,用于上线门禁与版本回归。

榜单 × 论文 × 模型进展

公开生态截至 2026-09算法工程含义LumeSage 映射
MedHalluEMNLP 2025;幻觉检测专用基准。把「幻觉检测」与「拒答策略」写进 CI;Hard 集单独监控。硬幻觉私有包 + 不确定选项协议
MedBench Safetyv4:安全维度显著低于知识维;Agent 可改善。发布门禁应强制 Safety 分轨通过。安全场景包 + Gate 盲测
HealthBench 轴紧急场景、不确定性处理等主题与安全行为相关。开放生成的「不该说什么」与「该追问什么」同样计分。拒答 + 追问 rubric
医疗越狱红队与越狱评测在通用安全社区持续更新;医疗域需专科化。通用 jailbreak 集不能代替医疗不当建议场景。医疗越狱 / 违禁建议私有集

前沿模型信号

对齐与推理增强能抬升部分安全行为,但「看起来专业的硬幻觉」仍是长尾。产品应披露拒答率与人工抽检,而非只报有用性分数。

2026 前瞻

医院与云厂商采购会把 Safety 包列为框架协议标配;与 GB-Clin、GB-Audit 捆绑销售。失败类型回流到策略数据与补丁包。

合规话术

门禁通过 ≠ 医疗器械批准 ≠ 疗效承诺。公开沟通坚持该边界。

本类目前沿洞察(7 篇)

每篇不少于 4300 字,实体锚定公开榜单柱;文末含微信二维码、电话与询盘表单。另见 实体榜单 28 柱。

查看全部洞察 · 实体榜单

就本类目提交询价简报

点击上方榜单可预填咨询对象。提交后同步商务邮箱与钉钉,并入库 CRM。请勿提交患者可识别信息。

提交 GB-Safety 询价简报

一个工作日内回复题集沟通说明或 Medical Gate 排期要点。指定本 SKU 的线索优先排期。

返回评测数据集 隐私政策

运营与合同主体:北京朗慧科技有限公司 · 品牌 LumeSage。本站不构成医疗器械宣传,不对模型临床疗效作承诺。公开榜分数不可作为合同过关依据。