北京大学学报(自然科学版) 第62卷 第3期 2026年5月
Acta Scientiarum Naturalium Universitatis Pekinensis, Vol. 62, No. 3 (May 2026)
doi: 10.13209/j.0479-8023.2026.004
国家自然科学基金(62271016)和北京市自然科学基金(L242130)资助
收稿日期: 2025–03–25;
修回日期:2025–05–30
摘要 针对鼻腔及其细微解剖结构复杂多变、分割难度高的问题, 提出一种新颖的医学图像分割方法——解剖引导的隐式神经表示注意力网络 AIRA-Net。该方法通过隐式神经表示机制提取全局几何特征, 并通过交叉注意力模块实现跨尺度特征的高效融合, 从而充分整合全局先验与局部细节信息。此外, 针对鼻腔结构中灰度相近、特征稀疏的端面区域, 提出基于解剖先验的边缘加权损失函数, 可以有效地强化分割网络对边界区域的精准定位。针对包含 128 例 3D 头部 CT 数据集的实验结果表明, AIRA-Net 在鼻腔分割中实现 DSC 为91.66%, 比次优方法 nnU-Net 提升 4.5 个百分点; HD95 为 10.75mm, 比次优方法 Ua-Net 降低 2.82mm。
关键词 医学图像分割; 鼻腔分割; 隐式神经表示; 交叉注意力机制; 解剖先验引导
作为人体主要的呼吸通道, 鼻腔不仅负责空气进出肺部, 还在调节呼吸气体的温度、湿度及过滤外来颗粒物方面发挥关键作用, 从而维持机体生理平衡和健康状态。当鼻腔结构存在异常时, 气流会受到阻碍, 导致鼻腔呼吸功能受损, 进而引发鼻塞等症状, 在临床中十分常见[1–2]。鼻功能受损还可能导致慢性鼻炎和鼻息肉等病症, 甚至引发睡眠障碍, 破坏心血管系统的稳态, 造成身体和心理方面更广泛的不良影响[3–5]。此外, 鼻腔内部不仅有明显的主干气道, 还有鼻前庭、各类鼻窦及其分支, 这些解剖结构在疾病早期诊断、病变分型以及疗效评估中具有重要的临床价值。因此, 准确地评估包括鼻腔在内的上呼吸道形态, 不仅是明确病因和疗效评估的重要依据, 也是制定个性化治疗方案、进行手术规划以及开展大样本细化研究的基础[6–8]。
近年来, 随着放射学和影像学技术的迅速发展, 多种成像手段(如超声、X 射线、计算机断层扫描(computed tomography, CT)和磁共振成像(magnetic resonance imaging, MRI))因其无侵入性成像的特点, 应用于活体鼻部形态的评估。CT 具有低成本和高空间分辨率的优势, 成为气道评估和患者特异性鼻腔模型构建的首选工具[9–11]。基于 CT图像获得的分割结果进行鼻腔重建, 不仅可为计算流体动力学(computational fluid dynamics, CFD)分析提供坚实的基础[12–13], 还在内鼻手术规划[14]、鼻腔气流和药物输送等研究中发挥关键作用[15–16]。
尽管传统的手动分割方法被认为是金标准, 但耗时费力, 且受操作者经验影响, 难以满足大规模和精细化图像分析的需求[17]。尤其是在鼻腔及其内部细微解剖结构的分割中, 由于尺度跨度大, 结构复杂多变且与周边气道区域紧密相连, 缺乏清晰的界限, 自动分割工作面临巨大挑战[18–20]。虽然基于深度学习的 U-Net 等分割方法已在影像器官分割中取得较好成果, 但是在处理尺度差异较大和具有多变形状结构的目标时有局限性。一方面, 此类数据驱动的监督训练方法过度聚焦局部图像特征, 难以从全局的视野捕捉鼻腔的整体形状约束; 另一方面, 现有显式特征提取技术在跨尺度信息融合时缺乏有效的引导, 难以实现全局形状先验与局部细节特征的高效融合。因此, 如何在自动分割中充分整合全局形状信息和局部特征, 并利用隐含的解剖先验对分割网络进行有效的引导, 成为亟待解决的技术难题。
为解决上述问题, 本文提出一种基于解剖引导的隐式神经表示注意力机制的医学图像自动分割方法。该方法利用隐式神经表示来提取几何约束信息, 并通过通道交叉注意力机制对多尺度特征进行深度融合, 从而实现全局形状与局部细节的有效整合, 进而引导分割网络充分利用隐含的解剖先验。为进一步提升模型对特征稀疏区域体素(如管腔端面)识别的健壮性, 本文还设计一种基于解剖先验权重图的创新性损失函数, 既能保证整体分割的稳定性, 又可以显著地提高细微结构的分割精度。最后, 在包含 128 个 3D 头部 CT volume, 共计 34006个 CT 切片的数据集上进行实验, 来验证本文方法在临床应用中的有效性与优越性。
在鼻相关分割的传统方法中, 早期研究主要依赖图像滤波、阈值分割、区域生长和主动轮廓模型等经典图像处理技术[21–24]。研究者提出多种从图像数据中提取精细解剖结构的自动化或半自动化算法。例如, Liu 等[25]提出基于模糊连接性的MRI 上气道分割系统, 通过强度校正、VOI 定义和种子点交互实现分割, 但是, 该方法需要手动初始化种子。Fricke 等[26]通过手动选取感兴趣区域, 并且采用 k-means 聚类对气道进行分割, 从而量化呼吸周期中的体积变化, 但受限于样本数量且仅基于矢状面数据。Tong 等[27]使用交互式模糊连接性算法实现 4D 动态图像数据中的上气道实时分割, 并通过种子传递, 自动更新分割结果。尽管该方法有效地追踪了呼吸周期中的形态变化, 但初始种子仍然需要手动设定。此外, Giacomini 等[28]开发了基于阈值分割与分水岭技术的上颌窦体积量化算法。Bui 等[29]构建的由粗到精的 Level Set 分割框架则通过自适应阈值和形态学操作实现 ROI 初始化, 并结合K-L 散度与各向异性局部化主动轮廓进行精细分割, 在鼻腔和副鼻窦的三维重建中取得良好的效果。
为提高分割健壮性, 有研究者引入解剖先验信息。Huang 等[30]提出基于多图谱配准与统计形状模型的鼻腔自动分割方法, 将 SSM 嵌入图论分割框架, 并设计形状先验能量项联合随机游走算法, 从而实现自动化种子生成, 减少人工干预。Neelapu等[31]利用自动初始化的解剖标志, 结合空间–形状约束对多子区域进行分割。该方法对解剖标志的检测精度要求较高, 易受低分辨率图像影响。Cercos-Pita 等[32]提出的 NASAL-Geom 分割流程集成金属伪影抑制、边缘保留平滑和形态学增强技术, 虽然提升了建模精度, 但是多阶段参数调整使得流程较为复杂。总体而言, 传统视觉分割方法和半自动算法存在耗时长以及依赖人工干预较多的问题, 制约其在大规模数据处理中的应用[33–36]。
随着深度学习技术的快速发展, 基于卷积神经网络的分割框架(如 U-Net 及其衍生模型)逐渐成为解决复杂解剖结构分割问题的主流方法[37–39]。这些方法通过端到端的训练自动提取高层次特征, 显著地改善了传统方法在精细分割中的不足, 同时避免分割过程中的人工干预, 在多个器官和病灶的自动分割任务中表现出强大的能力。
目前, 已有一些研究利用深度学习方法来实现鼻腔和鼻窦等解剖结构的高精度分割。Humphries 等[40]采用 Tiramisu 架构实现自动鼻窦分割, 并结合统计分析来评估鼻窦炎症。Leonardi 等[41]通过引入压缩–激励模块, 增强 Tiramisu 模型的特征表达能力。Sin 等[42]基于 U-Net, 提出一种用于咽部气道的自动分割方法, 通过端到端的语义分割, 精确地提取气道形态。Pazos 等[43]提出的全自动鼻腔分割方法结合多中心数据集, 提升模型泛化能力。Xie 等[44]在U-Net 基础上引入区域兴趣策略来提高分割精度。此外, Sahu 等[45]通过结合 U-Net 与 DeepAtlas配准方法来提高鼻窦 CT 图像中的标签利用效率。Li 等[46]的MD-Unet 模型利用可变形卷积和 Tversky损失, 针对不规则形状目标进行自适应特征提取。Chen 等[47]提出的 ETU-Net 结合 CNN 与 Transfor-mer, 实现内窥镜下鼻出血图像的分割。Jin 等[37]将Swin Transformer 引入 U-Net, 实现上呼吸道三维自动分割, 并对不同子区域进行自动识别。
基于深度学习的研究在鼻腔及上呼吸道的分割中取得显著进展, 但仍然存在一些不足, 如对细小结构和复杂解剖变异的分割面临挑战, 特别是在气道边缘不明确和分辨率不足的情况下。此外, 尽管这些方法通过深度学习可以有效地提取特征, 但对于解剖先验信息的利用不充分。因此, 如何结合解剖先验与深度学习特征提取方法, 进一步提升分割精度和健壮性, 是研究的重要方向。
本文提出一种针对鼻腔及其细微解剖结构自动分割的解剖引导的隐式神经表示注意力网络(anato-my-guided implicit representation attention network, AIRA-Net), 核心在于隐式神经表示技术学习提取全局几何先验, 并通过交叉注意力模块实现全局几何特征和局部细节特征的有效融合, 同时结合基于解剖先验的边缘权重损失, 显著地提升分割精度。如图 1 所示, AIRA-Net 网络由两个 U 型网络分支组成。低分辨率分支在降采样图像上进行操作, 使其有效感受野能够覆盖更广阔的原始图像区域, 旨在捕捉目标的大尺度形状特征。为了有效地学习大尺度形状信息并生成适合与高分辨率特征融合的全局先验, 本文采用基于隐式神经表示的策略。首先, 从低分辨率分支的初步分割结果中提取代表目标表面的前景点云, 用于指导符号距离场(signed distan-ce function, SDF)预测网络的自监督训练。以空间查询点的三维坐标为输入, 学习预测这些点到点云所表示表面的 SDF 值。该 SDF 预测网络通过隐式的方式学习到目标表面的连续几何表示, 并具有连续性与分辨率无关的特性, 因而适合作为全局先验信息。随后, 这些全局先验在原分辨率分支中, 通过本文设计的 SDF 引导的交叉注意力模块, 与高分辨率的局部细节特征进行有效的融合, 充分结合全局与局部信息, 提升最终的分割精度。最后, 通过引入基于解剖先验构建的边缘权重损失函数, 有效地强化网络对难分割边界区域的关注。因此, 本文方法能够在充分利用全局形状约束的同时, 实现兼顾局部细节刻画。
图1 AIRA-Net 网络架构
Fig. 1 AIRA-Net network architecture
隐式神经表示(implicit neural representation, INR)是一种新兴的信号表示技术。它利用神经网络, 以多层感知机为网络结构, 直接学习从输入坐标到目标信号值的连续映射。映射的目标信号值可是多种形式, 如形状表面的符号距离值、图像的颜色或三维场景的密度等。相较于体素网格这类传统的离散表示方法, INR 的主要优势在于能以内存高效的方式连续且精细地表示复杂信号, 因此适合建模复杂的三维几何形状。本文应用隐式神经表示来学习鼻腔的全局几何特征。在具体实现时, 我们训练一个专门的网络来预测鼻腔表面的符号距离场。
在三维医学图像分割任务中, 受显存限制, 通常需将原始图像裁剪为较小的图像块进行训练, 这使得网络的感受野受限, 难以捕捉大尺度结构信息。我们利用低分辨率图像的图像块具有更大感受野的特性, 首先在低分辨率空间获取全局形状结构的先验, 进而通过隐式神经表示来学习对分割目标表面上连续几何特征的刻画。通过对低分辨率 CT图像进行分割, 产生初始分割掩膜:
,
其中, H, W和 D分别为原始图像的高度、宽度和深度。从初始掩膜中提取前景的表面体素, 作为隐式神经表示学习的代表性点。为确保点云数据的数值范围统一, 并保持各点之间的相对几何关系, 对每个体素在图像空间中的索引(i, j, k)进行中心归一化处理, 转换为连续坐标(x, y, z), 从而构成点云 Pc。将 Pc作为训练后续 SDF 预测网络的依据来学习目标形状的隐式表面表示。
为全面地捕捉局部上下文结构, 在每个代表性前景点的局部邻域内, 应用高斯采样生成一组随机查询点 Q。生成方式如下:
(1)
其中, pi为点云 Pc中的点; Dij的各分量服从均值为 0, 标准差为 δ的正态分布。该策略不仅涵盖前景区域的局部变化, 同时引入形状边界附近的背景信息, 为隐式表面的学习提供更全面的局部空间信息。
基于上述查询点, 参考 Neural-Pull 方法[48]训练SDF 预测网络, 实现隐式表面的自监督学习。本文中 SDF 值为点距离分割表面的最近距离, 当点位于表面以内时, SDF 值为负, 反之为正。如图 2 所示, 符号距离场预测网络结构由全连接层和激活层构成, 输入为各查询点 q的三维坐标。对于每个查询点 q, 在表面点云中找到其最近邻点 Pn 作为真实投影点, 并训练网络输出对该查询点的 SDF 预测 s= f (q)。该 SDF 值的梯度Ñf(q)可利用神经网络的梯度反向传播机制自动获取。根据 SDF 值与梯度的几何关系, 计算出查询点的预测投影点 q':
(2)
根据投影关系, 当网络预测准确时, 预测投影点 q'应与真实投影点 Pn重合, 从而最小化投影误差。基于此, 构造如下自监督损失函数:
(3)
t表示查询点 q在真实表面上的最近邻点。SDF 预测网络无需预先计算梯度和 SDF 值, 即可通过自动微分机制, 自适应捕捉目标结构的全局几何特征, 并逐步优化隐式表面表示。通过这种自监督的训练方式, SDF 预测网络不仅对输入的点云坐标进行拟合, 而且被引导学习到一个能够泛化到空间中任意查询点的连续函数 f(q), f(q)的零水平集隐式地定义了目标的全局三维表面几何结构。因此, 训练完成的 SDF 预测网络, 其内部的权重参数就编码了目标的全局形状信息。这使得该网络能够为空间中任意位置提供其相对于目标整体表面的几何位置信息(即 SDF 值), 从而作为全局形状先验, 有效地引导后续的分割过程。
图2 符号距离场预测网络结构
Fig. 2 Signed distance field prediction network structure
本文采用符号距离场引导的交叉注意力模块(SDF-guided cross-attention, SDF-ATT), 旨在通过深度融合隐式 SDF 预测网络生成的全局形状先验与分割网络解码器中的多尺度局部特征, 结合全局结构约束与局部精细信息来实现优势互补, 从而充分利用全局几何信息来优化局部特征表达。SDF-ATT模块部署在解码器的各阶段, 通过交叉注意力机制, 融合全局先验特征图与局部跳跃连接特征, 模块的结构如图 3 所示。
交叉注意力模块的输入包括编码器产生的跳连特征 Fs∈ℝC×h×w×l 以及由训练完成的 SDF 预测网络针对当前解码阶段分辨率生成的全局形状先验特征图 P∈ℝC×h×w×l。对 Fs和 P进行重塑及转置操作, 得到矩阵查询矩阵
和键矩阵
其中 s = h×w×l 表示特征图中所有空间位置的总数。二者的矩阵乘积为交叉注意力矩阵
, 其中每个元素 Aij表示 Fs中第 i个通道与 P中第 j个通道的相关性, 反映两组特征间的全局交互。交叉注意力矩阵 A的每一个元素都量化特定局部特征通道与特定全局特征通道之间的相关性, 从而显式地建立两者的联系。对交叉注意力矩阵 A与全局形状先验 P进行矩阵乘法操作来实现加权重组, 得到与原始跳跃特征 Fs具有相同通道数和分辨率的融合特征
。从注意力机制的角度看, 局部特征 Fs作为查询矩阵, 在作为键矩阵和值矩阵的全局特征 P中, 根据相关性, 有选择地提取并整合对当前局部信息最有用的全局形状线索, 生成一个经过局部上下文引导的融合特征表示 Ff。该过程实现通道信息的重新分配, 使得融合特征既保留解码器原有信息, 又充分融入全局形状先验。在模块的末端, 为确保信息完整性并增强网络稳定性, 通过残差连接, 将融合特征与 Fs相加, 得到增强特征 Fe:
图3 SDF 引导的交叉注意力模块结构
Fig. 3 SDF-guided cross-attention module structure
。 (4)
增强后的特征 Fe在 U 型分割网络的解码器中逐层解码, 生成最终的分割结果。该模块弥补了仅依赖局部特征在捕捉全局结构方面的不足, 为细粒度分割提供了丰富的全局上下文特征, 从而提升网络对复杂鼻腔结构的表达能力。
为强化模型对鼻腔端面等难分割边界区域的关注, 本文设计了一种基于解剖先验的边缘加权损失(anatomical boundary-weighted loss, ABWL)。
本文将鼻腔及其解剖结构的前景体素分为以下3 类: 1)内部体素: 其 3×3×3 邻域内所有体素均为前景; 2)侧壁体素: 位于前景边缘, 其 3×3×3 邻域内既包含前景体素, 又包含代表人体组织的背景体素; 3)端面体素: 其 3×3×3 邻域内存在代表空气的背景体素。其中, 端面体素由于与背景体素同为空气, 强度值相同, 没有灰度差异特征可供利用, 是分割任务中的难点。
为强化对端面区域的监督, 提升分割精度, 本文提出一种针对鼻腔及其解剖结构分割的自适应权重图生成方法。在低分辨率分支生成的分割掩膜中, 对所有边缘体素的 3×3×3 邻域进行分析。若邻域内不存在 CT 值大于–500HU (组织与空气的分界阈值)的体素, 则将该边缘体素归为端面体素。以识别出的端面体素为参考基准, 计算每个体素与其最近端面体素之间的欧几里得距离 d(x)。利用高斯衰减函数, 将 d(x)转换为权重 w(x):
(5)
其中, α控制距离 d为 0 处的权重最大提升量; 参数 σ 决定权重随距离 d增加而高斯衰减的速率; 距离阈值 r定义权重增强效应的作用范围, 若距离端面体素超过该阈值的体素, 其权重将不再额外增加, 保持为 1。为了在验证集上获得良好的加权效果并提升分割性能, 我们通过实验调优来设定超参数值。本文中, α, σ和 r分别设置为 1.0, 2.0 和 5.0。
基于生成的权重图 w(x), 本文设计多组分损失函数, 将 Dice 损失 Ldice、交叉熵损失 Lbce和边缘加权交叉熵损失 Ledge联合优化:
(6)
其中, λdice, λbce和 λedge是控制各损失项贡献的超参数, 本文分别设为 0.5, 0.3 和 0.2。边缘加权交叉熵损失 Ledge的计算方式如下:
, (7)
其中, w为根据式(5)计算得到的权重图; CE 表示逐体素交叉熵; 超参数 γ用于调制权重图 w对损失的影响强度, 其值通过实验调优被设置为 2.0; ε为用于确保除法数值稳定性的小常数, 本研究中设为1×10–6。该设计将训练重点引向端面区域, 并且通过总权重归一化来保持各部分损失的平衡。这种增强型边缘损失函数在保持整体分割性能的同时, 显著地提升网络对难分割端面体素的识别能力, 从而为鼻腔及相关解剖结构的精细分割提供有效的监督信号。
本文采用 128 例带有鼻腔及鼻前庭标注的三维头部 CT 数据集[49], 将本文方法与对比方法进行评估。按照 102 例训练集、13 例验证集和 13 例测试集的方式对数据进行划分。选取 5 种基于深度学习的最新医学图像分割方法[50–54], 与本文方法进行 对比。
为提升模型的泛化能力和鲁棒性, 在训练阶段采用在线数据增强策略, 包括随机旋转、随机缩放、随机弹性形变以及随机轴向镜像等几何变换, 还应用强度和外观变换, 如添加高斯噪声、应用高斯模糊、随机调整图像亮度和对比度以及随机伽马校正。本文提出的 AIRA-Net 模型及所有对比方法均基于 PyTorch 深度学习框架实现。模型训练采用AdamW 优化器进行参数优化, 设置初始学习率为 3 ×10–4, 权重衰减系数为 0.05, 动量相关的 beta 参数分别为 0.9 和 0.999, 数值稳定项为 1×10–8。学习率调度采用 OneCycleLR 策略, 在训练过程中动态地调整学习率, 最大学习率设定为 3×10–4, 预热阶段占总训练步数的 30%, 并采用余弦退火方式进行学习率衰减。所有模型均使用大小为 2 的批次(Batch Size)进行训练, 共训练 400 个轮次(Epochs)。
所有实验均在配备 Ubuntu 操作系统的计算机上进行, 主频为 3.50GHz 的 Intel i9-11900k 处理器, 内存为 64GB。GPU 为 Nvidia GeForce RTX 3090, 显存容量为 24GB。
本文将 Dice 相似系数(Dice similarity coeffi-cient, DSC)、第 95 百分位 Hausdorff 距离(95th per-centile Hausdorff distance, HD95)及平均对称表面距离(average symmetric surface distance, ASSD)作为衡量鼻腔与鼻前庭分割性能的指标。作为一种测量指标, DSC 用于量化分割预测对应的体素集合与实际标注对应的体素集合之间的重合度, 其计算方式为
其中, A与 B分别代表真实标注与分割预测结果; |A ∩B|表示 A与 B交集的基数, 即正确预测的体素数量; |A|和|B|分别代表集合 A与 B的基数, 即真实标注与分割预测中体素的总数。DSC 值为 1 表示真实标注与预测结果完全吻合; DSC 值为 0 则意味着两者无任何重叠。然而, DSC 主要衡量预测区域与真实标注区域的重叠程度, 对误分体素的空间位置不够敏感。在误分体素数量相近的情况下, 靠近真实边界的误分通常比远离真实边界的误分具有更小的空间偏差, 但二者可能得到相近的 DSC 值。因此, 本文进一步使用 HD95 来评估预测边界与真实边界之间的空间距离误差。Hausdorff 距离(Hausdorff distance, HD)衡量从一个集合到另一个集合中最近点的最大距离, 其定义如下:
(9)
其中, S表示分割预测的体素集合, G表示分割真值的表面体素集合, sup 表示集合的上确界, inf 表示集合的下确界。d代表分割预测中体素 s与分割真值中体素 g之间的欧几里得距离。HD 距离旨在寻找分割预测体素集合中的点到分割真值体素集合中最近点的所有距离中的最大值。鉴于 HD 值易受异常值影响, 图像分割领域常采用第 95 百分位数来降低异常值的影响, 并评估分割的空间准确性。
此外, 本文选取 ASSD 指标作为 HD95 的补充, ASSD 可用于评估分割预测与分割真值之间所有表面体素差异的平均状态, 定义如下:
(10)
其中, |S|和|G|分别表示分割预测和分割真值体素集合中的元素数量。与 HD95 指标不同, ASSD 更关注整体边界的平均匹配度, 而非只聚焦于分割预测与真值在极端情况下(去除 5%异常点后)的最大误差。HD95 与 ASSD 相结合, 有助于从局部最差表现以及整体平均表现两个角度来评估分割模型的优劣。
为验证本文所提方法的先进性, 我们在相同数据集上采用 5 种不同的分割方法进行对比实验, 包括 HDC-Net[50], nnU-Net[51], Ua-Net[52], Swin-Unet[53]和 nnFormer[54]。本文针对鼻腔和鼻前庭两类分割目标分别评估分割性能。
如表 1 所示, 在鼻腔分割方面, nnU-Net 和 nn-Former 分别取得约 87%的 DSC, 显示其在整体区域重叠方面具有较好的性能。Ua-Net 获得次优的HD95(13.57mm)和 ASSD(1.01mm), 反映其在鼻腔表面体素的勾画方面有较好的性能。相比之下, 本文方法在 DSC, HD95 和 ASSD 指标上均取得最佳结果, 与次优方法相比, DSC 提升 4.5 个百分点, 配对Wilcoxon 符号秩检验表明, 这一提升具有统计学显著性(p=0.0105)。同时, 本文方法比次优方法的HD95 降低 2.82mm, ASSD 降低 0.08mm。这表明, 对于体素分布范围较广且结构复杂多变的鼻腔分割, 本文方法不仅在分割目标的整体重叠方面更精确, 在边界勾画上也取得更高的准确性。这种优势主要得益于利用交叉注意力结构对隐式 SDF特征表示的有效融合以及引入基于解剖先验权重图构建的损失函数, 使得网络既能准确地描述鼻腔的整体结构, 又能细致地捕捉复杂多变的局部细节。
在鼻前庭分割方面, 所有方法的 DSC 指标呈现与鼻腔分割类似的趋势, 其中 nnU-Net 和 nnFormer仍然表现出较好的分割效果, 分别实现 90.60%和89.44%的 DSC。由于鼻前庭为局部集中的细微解剖结构, 所有方法的 HD95 和 ASSD 指标优于其在鼻腔分割中的表现。其中, Ua-Net 在 HD95 指标上的表现为次优, 而 nnU-Net 在 ASSD 指标上的表现为次优, 表明它们在鼻前庭边界勾画方面具有较强能力。相比之下, 本文方法将 DSC 提升至 92.07%, 与次优的 nnU-Net 配对 Wilcoxon 符号秩检验结果表明, 这一提升具有统计学显著性(p=0.0195)。此外, 本文方法的 HD95 降低至 2.98mm, ASSD 降低至0.22mm, 充分展示其在捕捉局部细节和精确定位边界方面优于其他对比方法, 证明了本文方法在细微解剖结构分割中的卓越性能。
图 4(a)分别以矢状面、轴面和冠状面 3 个视图展示不同方法对鼻腔分割的可视化结果。整体来看, 本文方法在边界贴合度和局部细节保留方面均优于其他对比方法。在矢状面和冠状面视图中, 在鼻腔前部和鼻甲附近等较为狭窄的区域, 本文方法能够更准确地勾画出真实解剖结构的轮廓, 避免了过分割或断裂的情况。在轴面视图中可以看到, 除本文方法和 Ua-Net 以外, 其他对比方法均出现对鼻窦的严重误分现象。在放大图的对比中可以看出, 本文方法对前景边界的分割相比 Ua-Net 显著提升, 本文方法对细小结构的刻画更加精细, 不易出现离散的分割缺口或虚假连接。这些可视化结果可与前述定量指标(DSC, HD95 和 ASSD)的提升相互印证, 说明本文方法在处理复杂鼻腔结构时优势显著。
表1 不同分割方法的定量比较
Table 1 Quantitative comparison of different segmentation methods.
分割方法鼻腔鼻前庭DSC/%HD95/mmASSD/mmDSC/%HD95/mmASSD/mm HDC-Net[50]59.96194.2633.9981.0674.0610.87 nnU-Net[51]87.16 22.66 1.1190.60 4.88 0.32 Ua-Net[52]79.95 13.57 1.0179.97 4.73 0.55 Swin-Unet[53]79.58 25.55 3.6477.7013.07 2.71 nnFormer[54]87.14 22.71 1.2289.44 5.26 0.35 本文方法91.66 10.75 0.9392.07 2.98 0.22
说明: 粗体数字标示性能最优, 下划线数字表示性能次优。
(a)和(b)的第1行、第3行和第5行分别为矢状面、轴面和冠状面视图。第2行、第4行和第6行展示红色方框内分割结果的局部放大
图4 鼻腔分割和鼻前庭分割的可视化对比
Fig. 4 Visualization comparison of nasal cavity segmentation and nasal vestibule segmentation
图 4(b)展示不同方法在鼻前庭分割上的可视化对比。与鼻腔相比, 鼻前庭区域更小且结构边界更加细微, 尤其在端面位置, 易出现与外部空气混淆的情况。可以看到, 在对比方法中, 鼻前庭边缘常出现断裂或过分平滑的现象, 而本文方法在多个视图中均能够更紧密地贴合前庭实际边界, 展现较好的连贯性和准确性。在轴面和冠状面的放大对比中, HDC-Net, nnU-Net, Swin-Unet 和 nnFormer 出现明显欠分割现象, 而 Ua-Net 的边缘勾画不能很好地与真值吻合。本文方法能在保证分割完整性的同时保持边缘勾画的吻合。结合前述量化结果可知, 本文方法在 DSC, HD95 和 ASSD 指标上均表现优异, 与可视化结果中的边界一致性和形状保真度相符。因此, 利用全局先验和局部特征的交叉注意力融合对鼻前庭等细微解剖结构的识别和勾画效果显著。
通过以上可视化分析, 能够更直观地说明本文方法在复杂解剖结构(如鼻腔)与细微解剖结构(如鼻前庭)的分割中, 都兼具全局形状把握与局部细节刻画的能力。结合定量指标和可视化结果的双重验证, 说明了本文方法的有效性与优势。
表 2 展示在鼻腔与鼻前庭的分割中, 不同模块对整体分割性能的影响。对比 4 种配置: 1)基线(仅包含基础分割网络); 2)基线+SDF 引导的交叉注意力结构(SDF-ATT); 3)基线+基于解剖先验的边缘加权损失(ABWL); 4)基线+ SDF-ATT+ ABWL, 将两者结合。
从消融结果可以看出, 对于鼻腔分割, 基线模型的 DSC 为 81.42%, HD95 为 25.56mm, ASSD 为1.84mm。单独引入 SDF-ATT 模块后, DSC 提升至90.63%, HD95 降至 17.48mm, ASSD 降至 1.49mm, 表明 SDF-ATT 模块通过融合全局几何先验和局部特征, 有效地提升模型的整体分割能力。相比之下, 单独引入 ABWL 模块时, 模型性能变化甚微, 甚至在某些指标上略有下降。这是因为在初始分割效果较差的情况下, 仅依靠边缘加权损失, 难以充分地引导网络关注细节。然而, 将 SDF-ATT 与 ABWL结合后, 模型的分割结果表现出比单独加入 SDF-ATT 进一步的提升, DSC, HD95 和 ASSD 均达到最优值, 分别为 91.66%, 10.75mm 和 0.93mm。这一结果表明, 二者的协同作用显著地提升分割的整体准确性和边界细节的精度。对于鼻前庭分割, 基线模型的 DSC 为 85.46%, HD95 为 51.22mm, ASSD 为2.33mm。与鼻腔分割类似, 单独引入 SDF-ATT 后, 分割效果有一定的改善。单独使用 ABWL 则提升不明显。然而, 二者结合后, 模型的 3 项指标均达到最佳, DSC 提升至 92.07%, HD95 降至 2.98mm, ASSD 下降至 0.22mm。关于鼻腔和鼻前庭的消融实验结果表明, 两者结合能够形成协同增益。SDF-ATT 能有效地捕捉整体形状信息, ABWL 则强化局部边缘细节, 二者共同提升了分割精度。
综合来看, SDF 引导的交叉注意力(SDF-ATT)模块在两种解剖区域中均显著地提升了模型的整体分割性能和边界定位精度, 尤其是在捕捉全局形状先验方面表现突出。虽然单独引入基于解剖先验的边缘加权损失(ABWL)难以使分割效果得到明显的改善, 但将 SDF-ATT 与 ABWL 结合使用后, 模型在 DSC, HD95 和 ASSD 指标上均达到最佳表现, 充分验证了全局先验信息与局部边缘强化的协同作用。消融实验结果证明了本文方法在提高分割精度和细化边界预测方面的有效性。
表2 AIRA-Net 的消融分析
Table 2 Ablation analysis of AIRA-Net
模型鼻腔鼻前庭DSC/% (↑)HD95/mm (↓)ASSD/mm (↓)DSC/% (↑)HD95/mm (↓)ASSD/mm (↓) 基线81.4225.561.8485.4651.222.33 基线+SDF-ATT90.6317.481.4991.17 3.040.84 基线+ABWL81.2625.621.9285.1834.940.75 基线+SDF-ATT+ABWL91.6610.750.9392.07 2.980.22
本文针对鼻腔及其解剖结构尺度跨度大、结构复杂多变以及腔道端面区域特征稀疏的难题, 提出一种基于隐式神经表示与交叉注意力机制相结合的自动分割网络 AIRA-Net。该方法通过高效融合全局形状信息与局部细节特征, 能够有效解决复杂结构分割中的关键问题。同时, 本文设计的基于解剖先验的自适应权重损失函数, 能够显著提升对端面区域等分割难点的精度。实验结果表明, 在鼻腔及鼻前庭分割任务中, 本方法不仅在整体区域重叠度(DSC)上获得显著的提升, 而且在边界定位精度(HD95 和ASSD)上表现优异, 相较于对比方法具备明显的优势。消融实验进一步验证了 SDF 引导的交叉注意力模块与基于解剖先验损失函数之间的协同增益效应。
本文提出的高精度自动分割技术具有重要的潜在应用价值。在临床实践中, 可以为医生提供精确的可重复的鼻腔三维解剖模型, 辅助诊断多种鼻部疾病(如慢性鼻窦炎、鼻息肉和鼻中隔偏曲等), 并进行分期和疗效评估; 可以为鼻内镜手术、鼻整形手术等提供重要的术前规划依据; 也能为呼吸气流的计算流体动力学分析提供高质量的几何输入, 用于研究患者特异性的鼻腔气流模式, 评估通气功能或优化鼻用药物递送策略。未来的研究将致力于在更大规模及多中心数据集上验证与优化本文模型泛化能力, 探索将该方法的应用扩展至更细微鼻腔内部结构(如各级鼻甲、鼻道及特定鼻窦口)的自动分割, 考虑引入如磁共振成像 MRI 等多模态图像信息来提升分割性能, 并研究与下游应用(如 CFD 仿真和手术规划软件)的集成, 促进临床转化。
参考文献
[1] Hsu D W, Suh J D. Anatomy and physiology of nasal obstruction. Otolaryngologic Clinics of North Ameri-ca, 2018, 51(5): 853–865
[2] Chandra R K, Patadia M O, Raviv J. Diagnosis of nasal airway obstruction. Otolaryngologic Clinics of North America, 2009, 42(2): 207–225
[3] Jourdy D. Inferior turbinate reduction. Operative Tech-niques in Otolaryngology-Head and Neck Surgery, 2014, 25(2): 160–170
[4] Mygind N, Dahl R. Anatomy, physiology and function of the nasal cavities in health and disease. Advanced Drug Delivery Reviews, 1998, 29(1): 3–12
[5] Bhattacharyya N. Ambulatory sinus and nasal surgery in the united states: demographics and perioperative outcomes. The Laryngoscope, 2010, 120(3): 635–638
[6] Liu C N, Kang K T, Yao C C J, et al. Changes in cone-beam computed tomography pediatric airway measure-ments after adenotonsillectomy in patients with OSA. JAMA Otolaryngology —Head & Neck Surgery, 2022, 148(7): 621–629
[7] Kongsong W, Waite P D, Alshahrani F. Comparison of airway changes after maxillomandibular advancement with or without genial tubercle advancement in obs-tructive sleep apnea using cone-beam computed tomo-graphy. American Journal of Orthodontics and Dento-facial Orthopedics, 2022, 162(5): 616–625
[8] Chen H, Elham E, Li Y, et al. Comparison of anatomic and aerodynamic characteristics of the upper airway among edentulous mild, moderate, and severe obstruc-tive sleep apnea in older adults. Journal of Clinical Sleep Medicine, 2022, 18: 759–768
[9] Chu G, Zhao J M, Han M Q, et al. Three-dimensional prediction of nose morphology in Chinese young adults: a pilot study combining cone-beam computed tomo-graphy and 3DMD photogrammetry system. Interna-tional Journal of Legal Medicine, 2020, 134(5): 1803–1816
[10] Balakrishnan S, Bu R, Waters C M, et al. Utility of endoscopic anatomical optical coherence tomography in functional rhinoplasty. Journal of Biomedical Op-tics, 2020, 25(1): 016001
[11] Li Y, Tao Y. Radiomics model based on enhanced gradient level set segmentation algorithm to predict the prognosis of endoscopic treatment of sinusitis. Compu-tational and Mathematical Methods in Medicine, 2022, 2022: 9511631
[12] Cisonni J, Lucey A D, King A J C, et al. Numerical simulation of pharyngeal airflow applied to obstructive sleep apnea: effect of the nasal cavity in anatomically accurate airway models. Medical & Biological Engi-neering & Computing, 2015, 53(11): 1129–1139
[13] Alsufyani N, Flores-Mir C, Major P. Three-dimen-sional segmentation of the upper airway using cone beam CT: a systematic review. Dentomaxillofacial Ra-diology, 2012, 41(4): 276–284
[14] Rhee J S. Measuring outcomes in nasal surgery. Ar-chives of Facial Plastic Surgery, 2009, 11(6): 416–419
[15] Inthavong K, Ge Q, Se C M K, et al. Simulation of sprayed particle deposition in a human nasal cavity including a nasal spray device. Journal of Aerosol Science, 2011, 42(2): 100–113
[16] Shi H, Kleinstreuer C, Zhang Z. Laminar airflow and nanoparticle or vapor deposition in a human nasal cavity model. Journal of Biomechanical Engineering, 2006, 128(5): 697–706
[17] Ma J, He Y, Li F, et al. Segment anything in medical images. Nature Communications, 2024, 15(1): no. 654
[18] Huang R, Nedanoski A, Fletcher D F, et al. An au-tomated segmentation framework for nasal computa-tional fluid dynamics analysis in computed tomogra-phy. Computers in Biology and Medicine, 2019, 115: 103505
[19] Morgan N J, MacGregor F B, Birchall M A, et al. Racial differences in nasal fossa dimensions determi-ned by acoustic rhinometry. Rhinology, 1995, 33: 224–228
[20] Kuo C F J, Leu Y S, Hu D J, et al. Application of intelligent automatic segmentation and 3D reconstruc-tion of inferior turbinate and maxillary sinus from computed tomography and analyze the relationship between volume and nasal lesion. Biomedical Signal Processing and Control, 2020, 57: 101660
[21] Heuzé Y. What does nasal cavity size tell us about functional nasal airways?. Bulletins et Mémoires de la Société d’anthropologie de Paris, 2019, 31(1/2): 69–76
[22] Cellina M, Gibelli D, Cappella A, et al. Nasal cavities and the nasal septum: anatomical variants and assess-ment of features with computed tomography. The Neu-roradiology Journal, 2020, 33(4): 340–347
[23] Iwasaki T, Saitoh I, Takemoto Y, et al. Evaluation of upper airway obstruction in class II children with fluid-mechanical simulation. American Journal of Orthodon-tics and Dentofacial Orthopedics, 2011, 139(2): e135–e145
[24] El A S, El H, Palomo J M, et al. A 3-dimensional airway analysis of an obstructive sleep apnea surgical correc-tion with cone beam computed tomography. Journal of Oral and Maxillofacial Surgery, 2011, 69(9): 2424–2436
[25] Liu J, Udupa J K, Odhner D, et al. Upper airway segmentation and measurement in MRI using fuzzy connectedness // Clough A V, Chen C T. Medical Imaging. San Diego, 2002: 463588
[26] Fricke B L, Abbott M B, Donnelly L F, et al. Upper airway volume segmentation analysis using cine MRI findings in children with tracheostomy tubes. Korean Journal of Radiology, 2007, 8(6): no. 506
[27] Tong Y, Udupa J K, Odhner D, et al. Minimally in-teractive segmentation of 4D dynamic upper airway MR images via fuzzy connectedness: minimally inter-active segmentation of 4D dynamic upper airway MR images. Medical Physics, 2016, 43(5): 2323–2333
[28] Giacomini G, Pavan A L M, Altemani J M C, et al. Computed tomography-based volumetric tool for stan-dardized measurement of the maxillary sinus. PLOS ONE, 2018, 13(1): e0190770
[29] Bui N L, Ong S H, Foong K W C. Automatic segmen-tation of the nasal cavity and paranasal sinuses from cone-beam CT images. International Journal of Com-puter Assisted Radiology and Surgery, 2015, 10(8): 1269–1277
[30] Huang R, Li A, Bi L, et al. A locally constrained sta-tistical shape model for robust nasal cavity segmenta-tion in computed tomography // 2016 IEEE 13th Inter-national Symposium on Biomedical Imaging (ISBI). Prague, 2016: 1334–1337
[31] Neelapu B C, Kharbanda O P, Sardana V, et al. A pilot study for segmentation of pharyngeal and sino-nasal airway subregions by automatic contour initialization. International Journal of Computer Assisted Radiology and Surgery, 2017, 12(11): 1877–1893
[32] Cercos-Pita J L, Cal I R, Duque D, et al. NASAL-geom, a free upper respiratory tract 3D model recon-struction software. Computer Physics Communica-tions, 2018, 223: 55–68
[33] Shen W G, Wang H Y, Lin Z G, et al. Stereotactic localization and visualization of the subthalamic nuc-leus. Chinese Medical Journal, 2009, 122(20): 2438–2443
[34] Saeed N, Hajnal J V, Oatridge A. Automated brain segmentation from single slice, multislice, or whole-volume MR scans using prior knowledge. Journal of Computer Assisted Tomography, 1997, 21(2): no. 192
[35] Avrunin O. Using a priori data for segmentation ana-tomical structures of the brain. Przegląd Elektrotech-niczny, 2017, 1(5): 104–107
[36] Alsufyani N A, Hess A, Noga M, et al. New algorithm for semiautomatic segmentation of nasal cavity and pharyngeal airway in comparison with manual segmen-tation using cone-beam computed tomography. Ameri-can Journal of Orthodontics and Dentofacial Orthope-dics, 2016, 150(4): 703–712
[37] Jin S, Han H, Huang Z, et al. Automatic three-dimen-sional nasal and pharyngeal airway subregions identi-fication via Vision Transformer. Journal of Dentistry, 2023, 136: 104595
[38] Ronneberger O, Fischer P, Brox T. U-Net: convolu-tional networks for biomedical image segmentation // Navab N, Hornegger J, Wells W M, et al. Medical Image Computing and Computer-Assisted Intervention —MICCAI 2015. Cham, 2015: 234–241
[39] Çiçek Ö, Abdulkadir A, Lienkamp S S, et al. 3D U-net: learning dense volumetric segmentation from sparse annotation // Ourselin S, Joskowicz L, Sabuncu M R, et al. Medical Image Computing and Computer-Assis-ted Intervention. Cham, 2016: 424–432
[40] Humphries S M, Centeno J P, Notary A M, et al. Volumetric assessment of paranasal sinus opacification on computed tomography can be automated using a convolutional neural network. International Forum of Allergy & Rhinology, 2020, 10(11): 1218–1225
[41] Leonardi R, Lo Giudice A, Farronato M, et al. Fully automatic segmentation of sinonasal cavity and pharyn-geal airway based on convolutional neural networks. American Journal of Orthodontics and Dentofacial Orthopedics, 2021, 159(6): 824–835
[42] Sin Ç, Akkaya N, Aksoy S, et al. A deep learning algorithm proposal to automatic pharyngeal airway de-tection and segmentation on CBCT images. Orthodon-tics & Craniofacial Research, 2021, 24(S2): 117–123
[43] Pazos B A, Navarro P, Azevedo S D, et al. Encoding upper nasal airway structure with U-net for respiratory healthcare applications // Practical Machine Learning for Developing Countries Workshop, International Con-ference on Learning Representations. Online Meeting, 2022: 1–5
[44] Xie L, Udupa J K, Tong Y, et al. Automatic upper airway segmentation in static and dynamic MRI via deep convolutional neural networks // Gimi B S, Krol A. Medical Imaging 2021: Biomedical Applications in Molecular, Structural, and Functional Imaging. Online Meeting, 2021: 2581974
[45] Sahu M, Xiao Y, Porras J L, et al. A label‐efficient framework for automated sinonasal CT segmentation in image‐guided surgery. Otolaryngology–Head and Neck Surgery, 2024, 171(4): 1217–1225
[46] Li F H, Zhao X M. MD-Unet: a deformable network for nasal cavity and paranasal sinus tumor segmenta-tion. Signal, Image and Video Processing, 2022, 16(5): 1225–1233
[47] Chen J, Liu Q, Wei Z, et al. ETU-net: efficient trans-former and convolutional U-style connected attention segmentation network applied to endoscopic image of epistaxis. Frontiers in Medicine, 2023, 10: 1198054
[48] Ma B, Han Z, Liu Y S, et al. Neural-pull: learning signed distance function from point clouds by learning to pull space onto surface // Proceedings of the 38th International Conference on Machine Learning. Online Meeting, 2021: 7246–7257
[49] Lu Y, Gao H, Qiu J, et al. DSIFNet: implicit feature network for nasal cavity and vestibule segmentation from 3D head CT. Computerized Medical Imaging and Graphics, 2024, 118: 102462
[50] Luo Z, Jia Z, Yuan Z, et al. HDC-Net: hierarchical decoupled convolution network for brain tumor seg-mentation. IEEE Journal of Biomedical and Health Informatics, 2021, 25(3): 737–745
[51] Isensee F, Jaeger P F, Kohl S A A, et al. nnU-Net: a self-configuring method for deep learning-based bio-medical image segmentation. Nature Methods, 2021, 18(2): 203–211
[52] Tang H, Chen X, Liu Y, et al. Clinically applicable deep learning framework for organs at risk delineation in CT images. Nature Machine Intelligence, 2019, 1(10): 480–491
[53] Cao H, Wang Y, Chen J, et al. Swin-Unet: Unet-like pure transformer for medical image segmentation // Karlinsky L, Michaeli T, Nishino K. Computer Vision —ECCV 2022 Workshops. Cham, 2023: 205–218
[54] Zhou H Y, Guo J, Zhang Y, et al. nnFormer: volumetric Medical Image Segmentation via a 3D Transformer. IEEE Transactions on Image Processing, 2023, 32: 4036–4045
Nasal Cavity Segmentation Based on Anatomy-Guided Implicit Representation Attention
Abstract This paper proposes a novel medical image segmentation framework — Anatomy-Guided Implicit Re-presentation Attention Network (AIRA-Net) — designed to address the challenges posed by the complex and variable anatomical structures of the nasal cavity and its subregions. AIRA-Net leverages an implicit neural representation to extract global geometric features and employs a dedicated cross-attention module to effectively fuse multi-scale local and global features. Furthermore, a boundary-weighted loss function based on anatomical priors is integrated to enhance segmentation precision in regions with sparse features, particularly at the cavity boundaries. Extensive experiments on a dataset comprising 128 3D head CT volumes demonstrate that AIRA-Net achieves a DSC of 91.66% in nasal cavity segmentation, surpassing the second-best method nnU-Net by 4.5 percentage points. Additionally, AIRA-Net attains a HD95 of 10.75 mm, which is 2.82 mm lower than that of the second-best method Ua-Net.
Key words medical image segmentation; nasal cavity segmentation; implicit neural representation; cross-attention mechanism; anatomy-guided prior