新闻 · 医学影像标注平台 · 医疗专家数据

2026-10-02产品介绍 · 前沿坐标预约演示

2026年10月标注质控对照前沿:提示式分割仍要人工锁定,准则不能收成单一总分

以二零二六年十月二日为观测日,把 SAM、MedSAM、nnU-Net、HealthBench、MedBench 与 MedHELM 译成标注质控要求:提示式轮廓仍要人工锁定,训练协议要可复现,准则不能收成一张 AUC,私有集留在合同里。放射插件中的 SAM 是报价增量,交互阈值不等于该模型。

正文约 5703 字 · 观测窗口 2026-10-02

2026年10月标注质控对照前沿:提示式分割仍要人工锁定,准则不能收成单一总分
封面用于说明产品模块与采购场景,不代表临床疗效、榜单分数或现货规模。

这些论文是坐标,不是我们的署名

2026 年 10 月 2 日回看医学影像标注的质控,缺的不是又一个形容词,而是一组可以对照的公开工作。Kirillov 等人的 Segment Anything(SAM,ICCV 2023)、Ma 等人的 MedSAM(Nature Communications,2024)、Isensee 等人的 nnU-Net(Nature Methods,2021)、HealthBench(arXiv:2505.08775)、MedBench v4(arXiv:2511.14439)与 v5(arXiv:2606.24155)、MedHELM(Nature Medicine)以及 MedHallu(EMNLP 2025,arXiv:2502.14302),各自回答不同的问题。北京朗慧科技有限公司(品牌 LumeSage)没有署名这些论文,也不把它们写成平台自有的方法学资产。

医学影像标注平台 要吸收的是推论,不是徽标。推论若不能变成质控动作,引用就只是装饰。下面每一节都按同一结构写:这篇工作实际声称什么,它不声称什么,以及标注项目今天可以执行的对应要求。对应要求能落在手册里的,就写手册步骤;只能落在 2026 年 9 月 20 日核算沟通稿里的,就写明那是增量,不是现网。

SAM:提示可以提出掩膜,锁定仍然属于人

SAM 把分割写成可提示的任务。点、框或掩膜作为提示,模型给出一块区域。这篇工作的对象是通用视觉,不是某一家医院的勾画规程,也不是 LumeSage 的产品论文。它说明交互式分割已经有了基础模型这一路,不说明任何安装了画笔的阅片器都因此具备 SAM。

对标注质控的要求很具体。即便将来有一条提示式轮廓,接受或拒绝仍要由人完成,并进入盲审和锁定。合作研究锁定之后只读。未锁定的模型输出是初稿。手册里一百八十余个预训练分割模型,覆盖肺、肝、肾、气道、骨骼、血管等,输入 CT、MR、PET,输出 Mask 或 Contour,用 GPU 推理,可在 MPR 中查看,地位同样是初稿,不是金标准。这些预训练模型不是 SAM 论文的复现声明,不能在课题方法学里写成「我们使用了 SAM」——除非合同里的那一项增量确实交付并被记录。

核算沟通稿中的放射插件,写明包含 SAM 分割,以及 MIP、VR、放疗与乳腺能力,相对于手册已有的 MPR 和 PET-CT 融合是增量。报价行存在,不等于演示手册功能时已经看到 SAM,更不等于 SAM 以「朗慧的论文」交付。采购若需要提示式分割,应把这一行单独验收:提示如何给出、输出是掩膜还是轮廓、谁锁定、失败样例如何退回。没有这些句子,插件名称只是一行范围说明。

流程示意:对应本文讨论的产品模块,部署范围以演示与合同清单为准。

交互阈值和插值不是 SAM 的化名

手册里的交互式分割阈值、自动追踪、插值、锚定点、按毫米自动扩展,是序列内部的几何和规则工具。阈值按用户给出的范围生成区域,插值在已有轮廓之间补层,扩展按毫米外扩。它们不依赖 SAM 论文里的提示式基础模型,也不因为界面上出现「自动」两个字就升级成 2023 年的那篇工作。质控记录应分开命名:规则工具写成规则工具,预训练初稿写成初稿,只有在放射插件该项交付之后,才允许出现 SAM 这个专名。

MedSAM 是 Ma 等人把 SAM 路线推进到医学图像的工作,发表于 Nature Communications(2024)。它讨论的是医学图像上的提示式分割,仍然不是本平台的署名论文,也不因放射插件写了 SAM 就自动等于 MedSAM 权重已经进库。方法学里要写实际加载的是哪一个模型、哪一版权重、提示是点还是框。写不出这三项,就不要借用 MedSAM 的引用给自己的轮廓背书。质控上,MedSAM 路线反而加强了同一句话:领域换到医学之后,人的锁定没有被取消。边界看起来像器官,仍可能多包含一条血管或少一层。这种接近正确的错误,比空白掩膜更需要盲审抽查。

nnU-Net:协议选择会搬动分割质量

nnU-Net 的核心经验不是「有一个永远领先的骨干」,而是预处理、网络配置、训练日程和后处理这一整套协议会显著改变分割结果。Isensee 等人把这套自配置写进 Nature Methods(2021)。标注平台不应声称自己的训练按钮就是 nnU-Net。应声称的是另一件做得到的事:一次训练必须能找回配置、数据和检查点。

手册中的深度学习支持二维和三维,任务包括分割、检测、分类和影像分类。过程可见 Loss、Dice、FROC、ROC、AUC,可以终止,并把最优点写入模型库。模型库保存权重、代码、关联数据和 checkpoint,按课题组隔离。隔离使另一课题组不能靠拷贝目录拿走权重。这四项合在一起,才是 nnU-Net 经验在本平台上的落点:质量争论发生时,能打开当时的协议,而不是只剩下一张曲线截图。配置没保存、数据未锁定、检查点与课题组分不开,曲线再平滑也不构成可复现训练。

因此质控单上建议固定三问。训练使用的划分是按病人还是按切片。最优点对应的锁定日期是哪一天。终止训练时,保留的是最优点还是最后一步。三问都答得出,协议才算留下。答不出,就不能在论文里写「训练设置遵循某公开协议」来回避本项记录。若课题组确实采用 nnU-Net 或任何其他公开实现,应把实现名称和版本写进关联代码的说明,与平台菜单名称区分开。

组学侧的同一教训:特征也要能指回规程

van Griethuysen 等人在 Cancer Research(2017)发表 PyRadiomics,使影像特征提取成为可复现工具,而不是各家私有的特征名词。手册调用的就是这条工具线,按当时版本记载一千六百八十八项特征,支持二维和三维,用 ICC 看稳定性,划分用随机或五折、十折,可并入临床变量,降维包括方差阈值、SelectKBest 和 Lasso,特征分析包括 PCA、相关和聚类,分类器十四种。这些名词是任务配置的一部分。

nnU-Net 对分割协议的提醒,同样适用于这张特征表。换一种重采样、换一次未锁定的轮廓,一千六百八十八项里会有一批跟着变。质控不能只归档最终的 AUC。至少要能指回:特征来自哪一版锁定轮廓,ICC 不稳定的特征有没有被剔除,临床变量是 Patient、Study 还是 VOI 层。报告是英文论文式 Word 草稿,不是临床报告。草稿里的数字若对不上任务编号,质控应判为未完成,而不是「文章已经有了」。

HealthBench:一个总分不是合同门禁

HealthBench 用医师撰写的准则给多轮健康对话打分。公开材料给出的规模大约是五千段对话、二百六十二名医师、四万八千五百六十二条定制准则,并区分 Consensus 与 Hard,同时提到 canary 和私有留出。它不是影像勾画软件,也不能被安装进标注平台来代替盲审。它的结构对质控有直接含义:总分会掩盖困难子集上的失败;准则必须单独存在;留出和污染防护是设计的一部分,不是事后补一句「数据独立」。

翻译到标注项目,准则对应盲审差异和特征稳定性,而不是幻灯片上的一个 AUC。差异要写明类型:外扩、漏标、命名不一致,并给出抽查范围。ICC 低的特征应被单独列出,而不是被总 AUC 平均掉。Hard 子集的类比是那些接近正确、因而容易被放过的轮廓,以及临床变量缺失的病例。Consensus 的类比是多名审核在同一规程下的一致部分。两者都要留,不能只留一致部分。

canary 与私有留出对应的动作,是声明训练轮廓和 医疗模型评测 中 Medical Gate 题目是否重叠。重叠可以按病人、按检查或按切片说明,但不能省略。公开榜是需求地图。可签约的工作是私有题、医师复核、污染说明和失败退回。完成标注不构成公开分数上升的承诺。把 HealthBench 的总分贴进验收附件,等于重复它已经反对的那种汇总。

MedBench:维度要拆开,过程要留下

MedBench v4 面向中文医疗场景,覆盖大模型以及多模态和智能体设置。公开讨论中,安全与伦理可以明显低于总分,多模态也可以低于文本。若引用具体分值,这里只采用这一组:基础大模型的总分均值大约为 54/100,安全与伦理维度可以大约为 18/100。多模态低于文本这一观察,本文不另编均值。这组差距对标注质控的提醒是:影像标签、文本标签、拒答或失败样例不能收成一个准确率。数据卡和任务报告应分栏,缺栏就不要用总分填空。

MedBench v5 把过程审计、信息流压力和幻觉轨迹放进评测。最终回答可以看起来稳定,过程却不稳定。标注项目里的对应物很容易举出。轮廓已经锁定,但说不清预标注改了多少。Word 已经导出,但任务编号对不上。下载包已经生成,但盲审尚未完成。曲线已经平稳,但训练被终止前保留的检查点没有写入模型库。这些都是「结果看起来完成、过程没有留下」的情况。质控通过的条件应包含过程,而不是只包含终态文件存在。

MedHallu 说明幻觉检测不是一道玩具式的是非题,困难样本往往离事实很近。放到轮廓上,就是差一层、差一条边界、把相邻结构画进去。质控抽样若只挑明显空白或明显画反的例子,会高估一致性。盲审记录最好显式包含一批「看起来差不多」的 VOI。这一要求不需要新的榜单,只需要在现有盲审里改变抽样,并把抽样范围写进规程版本。

MedHELM:私有集留在合同里

MedHELM 报道的评测集合包含三十七个数据集,其中十四个是私有集,不能再分发。论文可以讨论它们,读者不能据此索取文件。这个事实应直接写进 数据集与数据卡 的纪律:私有数据的限制来自合同和许可,不来自它是否被某篇论文点名。本院锁定的轮廓同理。十五天下载包只解决内部交接,不产生再分发权。数据卡要写许可、人群、规程版本、已知偏差,以及不得离开的内容。缺了禁止项,私有集就会在邮件转发里变成公开集。

CheXpert、MIMIC-CXR、MedQA、MedMCQA、CMB、CMExam 是公共生态中的数据集或考试集,不是 LumeSage 的库存。前沿坐标可以解释「公开社区已经有这些基准」,不能解释「购买标注服务就持有这些数据」。医院自己的 DICOM 经 HY-小采上传前脱敏后进入合作研究,人群描述只能覆盖这条路径上真正入库的检查。非 DICOM 不上传,视频分析不在手册范围内。把公开数据集的名字写进自己的数据卡来源栏,是另一种污染:来源被说大了。

医师终审的范围放在 医疗专家数据,不要写进模型论文的引用段。终审例数、复核的是边界还是临床变量、分歧如何处理,都是合同句子。MedHELM 里那些不能再分发的私有集,提醒的正是:专家看过,也不等于文件可以随便复制。看过的范围有多大,复制的权利有多窄,要分两句写。

把坐标收成一张质控表,而不是一句赶超

2026 年 10 月 2 日可以执行的质控,不必等待任何新模型发布。第一行,预标注和规则工具分开登记,SAM 专名只在放射插件该项交付后使用,提示式输出仍要人工锁定。第二行,训练配置、锁定日期、最优点和课题组隔离同时归档,用来承接 nnU-Net 对协议的要求,同时避免把平台训练器说成 nnU-Net。第三行,盲审差异、ICC 和困难样本分开报告,用来承接 HealthBench 和 MedBench 对「单一总分」的批评。第四行,数据卡写明不得再分发的内容,用来承接 MedHELM 的私有集规则。第五行,公开榜不进入通过结论。

这五行不使用范围上的绝对化用语,也不把标注平台说成诊疗设备。组学 Word 和深度学习 Word 保持草稿地位。一百八十余个分割模型保持初稿地位。报价中的质控中心、血缘、三级仲裁、1833 过程记录,仍然是增量:1833 相关工作的范围是过程材料对齐,不是认证。现网质控先用盲审、锁定、任务编号和数据卡把五行做实。增量质控中心若购买,再谈它如何覆盖这五行,而不是用它的行名代替今天的记录。

失败退回要写进同一张表。接收方或门禁评审发现轮廓与规程不符、重叠未声明、或过程只有终态没有轨迹,应退回重做。退回不是把接近正确的样本留在训练集里凑数。MedHallu 所强调的困难负例,最容易在「差不多就留着」的决定里漏掉。

方法学里可以出现的句子

课题方法学若使用平台,建议只写验证过的动词。可以写:影像经 HY-小采于上传前脱敏后进入合作研究;勾画使用某一工具或某一预训练初稿,经第二人盲审后锁定;组学特征来自 Pyradiomics,规模按手册为一千六百八十八项,稳定性用 ICC;或分割训练的最优点存入按课题组隔离的模型库,并注明终止或完成。这些句子都能在界面上找到对应物。

不应当写的句子同样具体。不要写平台作者提出了 SAM、MedSAM 或 nnU-Net。不要写交互式阈值即 SAM。不要写放射插件的增量行等于权重已经加载。不要写一次指标达到公开榜某一名次。不要写 MedHELM 的十四个私有集可以由本公司提供。不要写一百八十余个预训练模型覆盖了所有器官或所有病种。手册给出的是肺、肝、肾、气道、骨骼、血管等方向的初稿能力,等字本身就表示不是一份闭集清单,质控不要把它补成闭集。

预标注初稿被修订的比例,应在方法学里给出计数,而不是给出形容词。修订可以是擦除、涂抹、插值后的手工改点,或整层重画。计数来自盲审记录,不来自模型自报的置信度。手册没有把置信度定义成审核依据,质控也不要新造一个未经约定的阈值来代替人的锁定。CT、MR、PET 以外的材料不要写进同一段方法学,视频更不要写,除非视频插件另行交付并单独描述。

困难样本怎么进盲审

HealthBench 的 Hard 与 MedHallu 的困难样本,落到操作上是抽样框,不是新软件。抽样框可以按四类各取若干 VOI:预标注几乎未被改动的、改动很大的、层数不足五十因而没有 MPR 的、临床变量在 VOI 层缺失的。四类都写入规程版本。只抽改动很大的,会漏掉看起来不用改的系统误差,例如某一结构的预标注持续偏大,而标注员并未逐层检查。只抽整齐的例,则 ICC 和盲审都会被高估。

MedBench v5 的过程轨迹可以落成一张很短的表:绘制者、审核者、是否使用预标注、锁定时间、任务编号、模型库中的 checkpoint 名称。表上任何一格为空,质控结论就停在终态文件存在。这张表不需要过程审计产品先上线。质控中心仍是核算稿中的增量,未购买时用这张表,购买后再讨论它能否自动汇总。自动汇总没有交付之前,手写表就是记录。

信息流上的压力,在标注场景里常常是同一病人的轮廓、临床自由文本和外部公开题被放进同一次训练。检查不是多点几次按钮,而是核对划分:按病人分开之后,门禁题里是否还留着训练病人。留着就退回。失败退回写在 Medical Gate 的约定里,也写在质控表上。退回时同时注明是规程不符、重叠未声明,还是过程缺格。三种原因的改法不同,混成「质量不佳」就无法重做。

坐标会过时,记录不跟着口号过时

2026 年 10 月 2 日之后还会有新的分割模型和榜单。平台质控不把界面文案改成最新模型的名字。名字进入方法学的条件始终是:权重或代码确实在模型库或插件交付物里,提示方式被记录,人完成了锁定。nnU-Net 的经验之所以还能用,是因为它把质量归因于协议,而协议可以迁移到任何后继实现。HealthBench 的经验之所以还能用,是因为准则和困难子集不依赖某一次对话系统的发布日期。医院把这两条写进质控制度,比追逐模型新闻更稳。

公开生态里的 CheXpert、MIMIC-CXR、MedQA、MedMCQA、CMB、CMExam 仍只作为需求地图上的地名。若合作方要求按某一公开集的标签体系重标,应把标签体系写成规程版本,而不是把公开集的文件混入本院数据集。混入会同时制造许可问题和重叠问题。重标可以发生在合作研究里,来源栏仍写本院经上传前脱敏的 DICOM。非 DICOM 的公开图片即使与论文同名,也不能从这条路径入库。

放射插件若最终交付 SAM,验收时增加三行:提示类型、输出是 Mask 还是 Contour、锁定者姓名。这三行与手册里阈值、插值、自动追踪的记录并存,不互相覆盖。未交付时这三行保持空白,空白的含义是未购买,不是忘记填写。空白和「未纳入」都是完整答案。MIP、VR、放疗与乳腺也各自占一行,不要因为 SAM 三行填了,就把其余能力一并写成通过。

PyRadiomics 的引用同样保持克制。可以写特征由该工具提取、手册规模为一千六百八十八项,并给出本次实际启用的二维或三维、ICC 和降维方法。不要写平台因此重现了 2017 年论文中的全部实验。分类器十四种是菜单,不是每次任务的义务。质控看配置是否保存,不看菜单是否被点满。点满十四种却说不清锁定日期,仍然是协议缺失。

预训练初稿和基础模型不要写成同一条供应链

手册中的一百八十余个模型是平台内可调用的分割初稿,方向包括肺、肝、肾、气道、骨骼、血管等,模态是 CT、MR、PET。它们的质控动作是:记录调用了哪一个、输出 Mask 还是 Contour、人改了多少、谁锁定。SAM 和 MedSAM 是公开文献中的提示式路线,放射插件的报价行只点名 SAM 分割,没有把 MedSAM 写成已包含的权重。质控表上因此分成两栏。左栏是手册初稿,今天就可以填。右栏是 SAM,只有插件验收通过才填。右栏空白时,方法学引用停止在使用了平台预训练初稿,不出现 SAM 或 MedSAM 的文献来为这次勾画背书。

nnU-Net 也不进入左栏的模型名称,除非关联代码里确实有这份实现。左栏可以写训练协议已保存,这是论文经验的迁移,不是软件改名。保存的内容至少包括任务类型、二维或三维、是否终止、最优点所在的课题组。检测、分类、影像分类若没有在本次运行,就不要写进协议。写进了却没有 checkpoint,质控判为记录不完整。

HealthBench 的准则数量和医师数量用来说明需要多条准则,不用来要求本院照抄四万八千条。本院的准则可以短,但必须能指出困难子集。短准则加上空的困难子集,仍然是一个总分。MedBench 公开讨论里的分值差距,只说明安全维度可以远低于总分,不说明本院项目会得到那些分数。那两个数字属于外部评测,不是标注平台的输出,也不能写进验收或数据卡的质量栏。

询盘时请写要对照的坐标

若希望演示或采购沟通对准上述某一行,请在 标注平台预约 里写明:要核对的是预标注初稿、规则工具,还是放射插件中的 SAM 增量;训练要留下的是分割协议还是组学配置;质控报告是否必须拆开盲审差异与 ICC;数据卡是否在本次范围;有没有私有题要进入 Medical Gate。模态写 CT、MR 或 PET。部署写院内还是离线介质。不要把论文题目本身当成功能清单。

不要在公开表单粘贴患者姓名、检查号或影像。电话 +86 15010400907,邮箱 date@lumesage.com,微信 langhuiai,商务对接罗坤。地址:北京 · 北京大学科创园 B 栋 301 房。

本文是 2026 年 10 月 2 日的坐标说明,引用均指向公开论文,不表示这些工作由朗慧完成,不表示 SAM 随手册默认交付。合同以双方确认的清单为准。本页不构成医疗器械宣传,也不承诺引用这些论文或完成标注之后,任何公开评测分数会上升。

继续看产品与相邻文章

平台入口见 医学影像标注平台,专家数据见 医疗专家数据,数据卡见 数据集,评测门禁见 医疗模型评测(Medical Gate)。