新闻 · 产品方法
面向眼科人工智能研发与医院课题组,说明眼底彩照与OCT专科数据如何按疾病任务、设备与扫描协议、图像质量字典和不确定类进行拆包,并把专科医师终审、试交付读取验证与Medical Gate失败分桶写入采购附件;结合Lancet Digital Health、Nature Medicine、NEJM AI、MICCAI与MedIA等公开讨论方向,整理筛查流程、泛化与可审计评价等常见议题的检查项。示意图不代表实测,规模以数据卡为准。
眼科人工智能采购中,眼底彩照与光学相干断层成像(OCT)常被一并提及,但设备厂商、扫描协议、视野与信号质量差异显著。LumeSage 专科入口 眼科 · 眼底照相与OCT专科规格包 用于眼底/OCT 场景的规格化沟通:任务、质控、医师终审与许可写入数据卡,规模按规格询价。
Lancet Digital Health、Nature Medicine、NEJM AI 公开讨论方向常见眼科筛查流程、可审计评价与部署治理;MICCAI、MedIA、Radiology(及医学影像交叉讨论)常见分割、分期与多模态融合方法议题。本文只转写检查项。
不承诺诊疗疗效,不涉器械广告;示意图不代表实测指标。
不同疾病任务的标签体系与阳性定义不同,强行混训会在验收时互相拖累。建议按任务拆子集,或在同一卡内分列计量与质控阈值。
OCT 与眼底是否联合交付,取决于买方模型是否真正多模态;联合不等于可以省略单模态质控。
质量标签(虚焦、曝光、影遮挡)应单列,否则模型学到的是「坏图当阴性」。


两张示意图用于不同会议材料场景,均非实测。Gate 组合见 Medical Gate 私有评测。
筛查流程议题 → 人机位置与转诊标签是否在数据中可见;泛化议题 → 设备分层;评价议题 → 医师评分与自动指标如何写进细则。
避免「可替代眼科医生」表述。正确表述是提供研发用数据与评测材料。
跨机构数据的许可与脱敏要单独评审,尤其涉及外院协作时。
眼科终审应写明专科年资与是否需要眼底病/青光眼等亚专科仲裁。分级读片与抽查比例进入数据卡。
分歧分母定义要事先约定,例如按图、按眼还是按患者。
终审成本进入价格驱动说明,不作效果广告。
OCT 体积数据存储与传输成本高,试交付应验证买方可读与可存。许可写清再训练、再分发与是否允许云端训练。
演示必须用示意图。
扩量前确认上一版失败分桶是否转化为补丁订单。
体检包中的眼科相关字段不能自动替代专科眼底/OCT 包。应分卡。可与 体检多模态数据包 组合治理,但题集与终审分开。
与通用影像包的关系类似:专科口径优先。
详情以 眼科 · 眼底照相与OCT专科规格包 为准。
按设备、瞳孔状态、介质混浊、图像质量分层。Medical Gate 分桶与补丁询价对齐。
多模态模型要单列「缺模态」评测桶。
公开讨论中的漂移议题转写为时间与机构切片。
采购评审材料建议至少包含:任务规格摘要、数据卡字段对照表、许可边界说明、试交付范围、质控与医师终审抽查约定、以及(如选用)Medical Gate 报告骨架说明。材料齐备后再进入商务询价,可减少后续变更成本。
Medical Image Analysis 与 MICCAI 社区长期关注标注噪声、弱监督与多中心泛化;采购侧对应动作是要求数据卡写明质检阈值、分歧统计分母与多中心来源是否混合计费。
许可边界建议至少覆盖:使用目的、再训练、再分发、部署环境、期限、是否允许生成衍生数据集、以及违约后的处理原则。边界不清时,扩量应暂停。
Medical Gate 的价值在于私有题集与训练分布隔离、评分细则可合同化、以及失败分桶可回流下一包规格。公开页提供报告骨架,不展示无法核验的分数排行榜。
价格驱动因素通常包括任务难度、终审覆盖、许可范围、部署方式与交付周期;上述因素用于解释报价结构,不构成对效果的承诺。目录展示的条目数量不等于可立即交付的现货份数。
过关结论应服务于采购决策:是扩量、补丁、还是回退修订任务规格。把门禁当成对外宣传分数,既不符合广告合规,也削弱其工程意义。
试交付的目标不是「证明模型已经可用」,而是验证供需双方对规格、格式与质控报告的理解是否一致。未通过试交付验收前,不宜锁定大批量订单条款。
防污染策略(题集隔离、访问控制、样本级证据裁切)应在评测协议中写明。医师评分维度与算法自动指标如何加权,需在细则里事先约定。
买方算法团队在接收试交付后,应优先验证读取链路、标签字典版本、清单哈希与质检报告格式,再评估是否进入扩量。任何扩量请求建议附带上一轮失败分桶摘要,便于供应方准备补丁包规格草案。
公开讨论方向可用于内部培训提纲,例如把 Lancet Digital Health 常见的部署后漂移议题,转写为「按厂商/层厚/人群分层的评测桶」;把 Radiology 常见的一致性议题,转写为「双读与仲裁流程」。
请准备任务列表、设备范围、质量字典、许可与是否 Gate。
本文不构成要约或疗效承诺。
下一阶段买方更关注可合同化字段、试交付验收与私有评测回流,而不是无法核验的规模口号。变更控制(字典、指南版本、设备与排除标准)应单列书面确认。
眼底与OCT专科数据:任务拆分、质控字典与私有评测回流是医疗数据方向可以沟通的一份规格,不是目录上的现货库存。文件格式以当期数据卡约定为准。数量、批次和许可以当期数据卡与合同为准。下面只讨论这一包,不把其他部位或其他模态的说明书套过来。
面向眼科人工智能研发与医院课题组,说明眼底彩照与OCT专科数据如何按疾病任务、设备与扫描协议、图像质量字典和不确定类进行拆包,并把专科医师终审、试交付读取验证与Medical Gate失败分桶写入采购附件;结合Lancet Digital Health、Nature Medicine、NEJM AI、MICCAI与MedIA等公开讨论方向,整理筛查流程、泛化与可审计评价等常见议题的检查项。示意图不代表实测,规模以数据卡为准。
无论模态是什么,能写进合同的都是同一类事实:任务定义、排除标准、金标准来自谁、争议如何仲裁、与训练数据如何隔离、版本号,以及下一次换题或换协议的条件。
公开榜提供对照语言。CheXpert、MIMIC-CXR、HealthBench、MedBench 与 MedHallu 各自测量的面不同,不能拼成一个「医疗 AI 已通过」的句子。
把这些判断用在眼底与OCT专科数据:任务拆分、质控字典与私有评测回流上,只说明验收时该检查哪些协议,不说明任何未公开的模型名次。HealthBench(arXiv:2505.08775)说明开放生成要有对话级准则和难例子集;MedBench v4(arXiv:2511.14439)说明知识分与安全分可以背离,编排会改变系统读数;MedBench v5(arXiv:2606.24155)说明终答看起来稳时,过程仍可能先失败;MedHallu(arXiv:2502.14302)说明语义上接近真值的错误,比明显的胡说更难被发现。这些数字都属于原论文,不能横比,也不能写成 LumeSage 的实测排行。
围绕眼底与OCT专科数据:任务拆分、质控字典与私有评测回流,这一篇只处理一个决定。规格要回答的不是「这包数据很大」,而是验收时双方打开同一份字段表,能否对同一条样本得出同一判断。建议写死的包括:计数单位(一次检查、一张切片,还是一帧)、去重主键、源文件格式、允许的派生格式,以及派生格式能否代替源文件。JPG、PNG、胶片照片和三维重建图,在多数影像任务里不能代替原始 DICOM 或原始切片。这一点要写在验收说明里,而不是留在口头。
任务如果不止一个,每个任务单独一列阳性定义和指南版本。合并成一个通过率,失败就无法回流成下一包的补丁。
决定做完之后,才值得打开眼底与OCT专科数据:任务拆分、质控字典与私有评测回流的数据卡逐项填写。决定没做完,表格填得再全也只是格式。
对眼底与OCT专科数据:任务拆分、质控字典与私有评测回流,过程至少包括六件事。任务是什么、明确不覆盖什么。排除标准是什么,谁有权改。金标准来自原报告、复阅还是另一次检查。争议样本由谁仲裁,分歧是否留档。训练流水线能否看见即将用于评测的样本。版本号是什么,下一次换字典、换指南或换设备协议时,哪些指标还允许和上一版比较。
六件事里暂时没有的,写成未覆盖。未覆盖可以验收,含混不可以。含混会在复测或尽调时变成无法回答的问题。
医师终审如果出现在规格里,就写层级和抽检比例,不写「经过专家审核」六个字就结束。抽检比例和分歧留档,是这句话唯一可复核的形式。
更多字段见数据卡页面(/datasets/spec-eye-fundus-oct/)。新闻不替代合同,也不把示意图上的标记写成实测指标或库存。
未来两年,公开数据大概率仍做三件事:提供可引用的协议、暴露单一总分的失效方式、提醒动态题和难例子集为什么存在。它们不会提供你的授权链、你的设备和你的指南版本。这三样只能出现在自己的数据卡里。
所以眼底与OCT专科数据:任务拆分、质控字典与私有评测回流的下一步不是再找一篇论文把背景写长,而是把上面的六件事填实,并用一小批试交付确认双方对字段的理解一致。试交付通过之后,失败类型才决定要不要做分层补丁,或者要不要做一次与训练隔离的私有评测。
评测可以发现短板。它不构成医疗器械宣传,也不承诺购买数据之后模型分数或临床效果必然提高。规模与许可以数据卡和合同为准。
下面用眼底与OCT专科数据:任务拆分、质控字典与私有评测回流走一遍验收,避免规格停在形容词上。验收只看双方事先写过的字段,不临时增加「感觉重要」的项。
第一步核对身份。样本的主键是一次检查、一张切片还是一帧,必须和医疗数据的计数习惯一致。同一主键被导出多次,只能计一次。文件格式以当期数据卡约定为准。派生格式如果存在,要能指回源文件。指不回的派生图,不进入合格数量。
第二步核对任务。每个任务单独看阳性定义、排除标准和指南或字典版本。两个任务共用一个通过率,就不算写完。版本号要能在清单里找到。找不到版本号的标签,默认还不能用于复测。
第三步核对人。终审层级、抽检比例和分歧是否留档,这三件事同时存在,才算「医师参与终审」。只有签名、没有比例和分歧记录,验收时记为未覆盖,而不是记为已通过。
第四步核对隔离。即将用于评测的样本,训练流水线是否能够读取,要有书面说明。说明不了,就不要把这批数据同时写成训练集和门禁集。
第五步才是数量。数量对照的是数据卡里的约定,不是新闻或目录上的口号。不足的部分写成缺口,并决定是补交付、缩小任务,还是把该层标成未覆盖。
这五步走完,眼底与OCT专科数据:任务拆分、质控字典与私有评测回流才从一篇介绍变成可以下单或可以退回的规格。走不完,就还停在询价之前。
可以写:眼底与OCT专科数据:任务拆分、质控字典与私有评测回流按医疗数据的任务规格沟通,源文件、去重主键、终审和许可以数据卡为准。可以写:公开基准用来对照协议。HealthBench 的准则数量、MedBench v4 的分轨现象、MedBench v5 的过程压力、MedHallu 的硬幻觉检测,都是论文自己的结果,引用时带上编号和限定。
不该写:无法核验的名次,把公开分数写成临床疗效,或把示意图上的标记写成实测指标。不该写:目录里的规划数量等于已经入库的现货。现货与否只以当期数据卡和交付清单为准。
不该写:购买眼底与OCT专科数据:任务拆分、质控字典与私有评测回流之后模型必然变好。评测和数据能做的是把短板变成下一次可验收的任务,不是保证分数或临床结局。
这些边界和篇幅无关。文章写长,是为了把验收过程写完;把同一句结论换几种说法再重复,并不增加可以核对的内容。
如果把眼底与OCT专科数据:任务拆分、质控字典与私有评测回流的数据卡当成一份可以执行的说明书,字段的顺序比文采重要。建议按采集、标注、许可、评测四段来写,每一段都能单独抽查。
采集段写清楚医疗数据的来源边界:机构类型只写到可以验收的粒度,不写无法复核的「多家三甲」;设备或扫描仪、协议或染色、时间范围,至少有一项能在样本元数据里找到。找不到的项标成未采集,而不是留空。留空在复测时会被看成「也许有」。
标注段写字典版本和变更记录。字典改一个类名,旧模型的失败类型就会对不上新数据。变更记录不必很长,但要有日期和变更人。排除标准单独成条:质量不合格、协议不符、重复主键,分别计数。混在一个「剔除」里,买方无法判断剩下的分布还代不代表原来的任务。
许可段用可以回答是或否的句子。能否再训练,能否再分发权重,能否把样本放进对外演示,能否离开原机构处理,期限到哪一天。答不了的句子就不要出现在宣传页。宣传页可以指向数据卡,不能代替数据卡。
评测段只写和这包数据相关的门禁,不写一个笼统的医疗评测。若眼底与OCT专科数据:任务拆分、质控字典与私有评测回流用于训练,评测样本要说明是否从同一主键池抽出、抽出之后训练侧是否仍能读到。若只用于训练、评测另买,两份数据卡的主键规则仍应能对照,否则失败样本无法回流成补丁。
四段都写完之后,再写数量。数量是结果,不是定义。先有任务和主键,数量才有意义。新闻里不报告无法核验的库存。需要数量时,以交付清单和数据卡为准,并允许买方按主键抽查。
抽查建议事先约定比例和不合格时的处理:补充、降级该层,或解除这一任务的声称。处理方式写在前面,验收才不会变成谈判。
按这个顺序读眼底与OCT专科数据:任务拆分、质控字典与私有评测回流,篇幅来自要核对的步骤,而不是来自同一结论的反复改写。步骤缺了,文章再长也仍然不完整。就眼底与OCT专科数据:任务拆分、质控字典与私有评测回流而言,还可以把验收失败分成三类来写进纪要,这样下一封邮件不必重讲背景。第一类是文件和主键:打不开、对不回源文件、同一检查被多次计数。这类失败不讨论模型,先修清单。第二类是标签和人:字典版本对不上、排除标准混在一起、终审没有比例或分歧没有留档。这类失败说明金标准还不能复放。第三类是范围:许可没有写成是或否,或者评测样本和训练样本的隔离说不清。这类失败说明还不能同时声称「可训练」和「可过关」。三类分开写,补救动作才不一样。混成「质量问题」,供应商和买方会各补各的,下一次交付仍然对不上。所以读完眼底与OCT专科数据:任务拆分、质控字典与私有评测回流,应当能指出下一封邮件要问的是文件、标签还是范围。指不出来,说明这篇规格还停在介绍,没有进入验收。答案写在数据卡上。
对照眼底与OCT专科数据:任务拆分、质控字典与私有评测回流时,公开基准只提供句式,不提供你的样本。句式可以这样用,也可以这样被用错。
HealthBench(OpenAI, 2025, arXiv:2505.08775)把开放生成拆成大约 48,562 条对话级准则,并由约 262 名医师撰写;另外设了 Consensus 与 Hard。引用它,是为了说明准确率不够,以及总分会饱和。不是为了说明某一家模型在中文临床里已经过关。没有抽检比例,读者也无法知道模型打分器偏离了医师多少。
MedBench v4(arXiv:2511.14439)被广泛转述的现象是分轨:整体可以看起来尚可,安全与伦理可以明显更低;同一骨干加上编排,端到端和安全读数都会变。写眼底与OCT专科数据:任务拆分、质控字典与私有评测回流的评测计划时,如果产品包含工具调用或工作流,就要单独一列系统读数,不能把系统增益记到基座头上,也不能反过来。
MedBench v5(arXiv:2606.24155)讨论的是过程:信息缺省、病历矛盾、证据晚到。终答的依据可以看起来还在,中间步骤已经错了。门禁若只保存最终答案,就检验不了这篇论文指出的失败。需要过程的任务,数据卡要有日志字段;不需要过程的任务,就明确写「本任务不验收中间步骤」,而不是沉默。
MedHallu(EMNLP 2025, arXiv:2502.14302)基于 PubMedQA 做幻觉检测,并强调硬幻觉:错误和真值在语义上更接近。公开结果里,较强模型在硬幻觉上的 F1 仍可以落在大约 0.625。这个数字不是问答总分。它只约束一种句子:看起来专业的错误,比明显的胡说更难被发现;允许模型回答不确定,本身就是评测设计。
影像侧的 CheXpert 与 MIMIC-CXR 提供胸片可比性,不自动提供再训练许可、设备域或中文报告。考试型公开集(MedQA、MedMCQA、CMB、CMExam,以及较早的 MedBench,arXiv:2407.10990)适合当知识回归的哨兵,题面也更容易进入训练语料。把它们写进眼底与OCT专科数据:任务拆分、质控字典与私有评测回流的附录时,写版本和日期,并写明不作为唯一发布依据。
这些文献放在一起,是为了限制措辞。限制之后,剩下必须由数据卡回答的部分,就是本文前面列出的主键、终审、许可和隔离。文献替代不了那一部分。
因此眼底与OCT专科数据:任务拆分、质控字典与私有评测回流的完整写法是一条链:任务和主键,然后是字典与排除,然后是终审和分歧,然后是许可的是与否,然后才是数量,最后才是要不要做试交付或私有评测。链上任何一环写的是形容词,这一环就还没写。试交付只验证链是否被双方理解成同一件事;私有评测只把失败收成下一环要补的类型。两者都不产生名次,也不把购买本身写成性能提升。观测和引用以论文原文为准;规模、批次和许可以当期数据卡与合同为准。留给眼底与OCT专科数据:任务拆分、质控字典与私有评测回流的核对清单可以压缩成八个问句,但每个问句都要有答案,而不是再写成一段背景:单位是一次检查、一张切片还是一帧;重复导出如何并回主键;源文件是什么,派生文件能否顶替;字典版本在哪,谁可以改;排除标准分哪几类,各类是否单独计数;终审抽检比例和分歧是否留档;再训练、再分发、演示和出境分别是否允许;评测样本是否与训练隔离。八个问句都有答案,这篇规格才算写完。问句和答案放在同一页,不要拆进不同的邮件。缺答案就写未覆盖,并缩小可以对外声称的范围。有问句没有答案,就在数据卡上标未覆盖。
最后把眼底与OCT专科数据:任务拆分、质控字典与私有评测回流交回给读者:若八个问句里已有六个答案,就可以进入试交付;若隔离和许可仍是空的,就先不要排私有评测。这个先后本身就是完整性,不需要再补一段重复的结论。试交付核对的是清单、字典和源文件能不能被对方打开;私有评测核对的是失败能不能命名。两件事都做完,文章要说的话就说完了。