基于多尺度膨胀残差和双重注意力的可变形配准网络
Deformable Registration Network Based on Multi-scale Dilated Residual and Dual Attention
Corresponding authors: Tel: 13761603606, E-mail:yjusst@126.com.
Received: 2025-11-28
可变形配准在多项医学影像分析任务中具有重要作用.然而,卷积神经网络的固定感受野难以充分捕捉大脑的空间上下文信息,Transformer架构能有效捕获全局信息但计算开销大.因此,本文提出一种基于多尺度膨胀残差卷积和双重注意力的可变形配准网络.该网络采用多尺度膨胀残差卷积同时捕获局部细节和广泛的上下文信息,通过双重注意力模块增强特征的表达能力,并在解码器部分引入动态上采样精细重建高频细节以确保变形场的拓扑完整性.在两个公共脑部数据集上的实验结果表明,本文所提模型在戴斯相似性系数(DSC)、95%豪斯多夫距离(HD95)和非正雅可比行列式百分比等多个指标上实现了较高的配准效果,表明其具有更强的配准精度和更平滑的变形场.
关键词:
Deformable registration plays a significant role in multiple medical image analysis tasks. However, the fixed receptive field of convolutional neural networks makes it difficult to fully capture the spatial context information of the brain. While the Transformer architecture can effectively capture global information, it suffers from high computational cost. To address this dilemma, we propose a deformable registration network based on multi-scale dilated residual convolution and dual attention. This network employs a multi-scale dilated residual convolution to capture local details and extensive context information simultaneously. A dual attention module is integrated to enhance feature representation capability. The decoder section introduces dynamic upsampling to precisely reconstruct high-frequency details, thereby ensuring the topological integrity of the deformation field. Experiments were conducted on two public brain datasets. The results demonstrate that the proposed model achieves high registration performance across multiple metrics, including Dice similarity coefficient (DSC), 95% Hausdorff distance (HD95), and percentage of non-positive Jacobian determinant, indicating superior registration precision and smoother deformation fields.
Keywords:
本文引用格式
羊晶晶, 王远军.
YANG Jingjing, WANG Yuanjun.
引言
随着深度学习技术在图像分割、图像重建等众多计算机视觉任务中展现出优越的性能,一些研究学者将其引入医学图像配准中[7].根据训练方式的不同,基于深度学习的配准可分为半监督配准、全监督配准和无监督配准三种[8].前两类方法需要真实的变形场作为标签数据,而这些数据通常由传统算法生成或人工标注,获取成本高且存在一定误差.而无监督配准模型训练时无需真实的变形场,避免了对标签数据的依赖,只需要提供一对图像就可以预测变形场.因此,基于无监督学习的配准方法受到了广泛关注. Balakrishnan等人[7]设计了一个无监督配准通用模型VoxelMorph,该模型分为U-Net网络和空间变换网络(Spatial Transformer Networks,STN)[9]两部分,U-Net负责生成变形场,STN则根据变形场对运动图像进行变形得到配准后的图像.CycleMorph[10]是一种循环一致可变形配准方法,该方法训练了两个卷积神经网络(Convolutional Neural Networks,CNN),分别生成正向和反向变形场,并引入循环一致性损失以保证图像的拓扑结构.Mok等人[11]提出一个基于CNN的对称微分同胚配准模型SYMNet,该方法通过一个中间变形场估计两幅图像间正向和反向变换,保证变换的可逆性和拓扑结构.以上方法基于CNN实现,它们使用固定大小的卷积核,有限的感受野只能提取局部的信息,对远距离空间的建模能力存在局限性.
近年来,学者们在网络中引入Transformer架构[12]以建模远距离空间依赖关系.Transformer架构将输入图像分成多个patch,利用自注意力机制,通过查询(Query)、键(Key)和值(Value)矩阵计算每个patch与其他patch的相关性,使得该patch获得全局信息.Dosovitskiy等人[13]受其启发于2020年提出了Vision Transformer(ViT)模型,ViT模型将输入图像划分为固定大小的patch并映射为token,对于每个token给予一个可学习的位置编码和class token,然后传入Transformer模块并通过多层感知机头(Multilayer Perceptron Head,MLP Head)得到最终结果.Chen等人[14]将CNN和ViT模型结合设计了CNN-Transformer混合架构的模型Vit-V-Net,进一步提高了配准精度.在此基础上,Chen等人[15]进一步提出TransMorph模型,编码器使用Swin Transformer[16],利用窗口注意力替代ViT模型的全局注意力,并且不需要额外的位置编码,降低参数量的同时提升了配准性能.后续的一些方法基于Transformer架构进行改进.Shi等人[17]提出一种纯Transformer架构网络XMorpher,设计两个并行的特征提取网络分别提取固定图像和运动图像的特征,并通过交叉注意力模块建立两幅图像的对应关系,促进特征的高效融合. Zheng等人[18]将互注意力机制和递归网络结合,扩大感受野,对可变形配准进行逐步细化.Wang等人[19]利用多头邻域注意力机制显式分解不同的运动模态,再通过竞争加权模块融合多个变形子场,实现由粗到细的配准.Chen等人[20]设计双流特征提取分支,结合局部窗口自注意力和局部窗口交叉注意力实现图像间特征的显式匹配.
CNN通过固定卷积核获得局部感受野以提取特征空间,扩大感受野的方式为层级堆叠或者使用膨胀卷积,在参数量和计算效率方面具有优势.但受限于有限的感受野以及相同的卷积核权重,CNN方法难以建立图像间长距离的非线性空间映射,当图像存在大尺度形变或者复杂的非线性形变等情况时CNN方法的表现受限.而基于Transformer架构的方法通过自注意力机制显式建模任意特征间的相关性,让网络在全局范围内捕获空间对应关系,更适合处理大尺度形变和非线性形变,这一点弥补了CNN的不足,但通常会伴随更高的计算开销.因此,Liu等人[21]根据Transformer架构的理念提出了纯卷积网络ConvNeXt,为建模远距离依赖关系,采用大卷积核替代传统的3×3卷积核,有效扩大了感受野,并采用深度可分离卷积代替标准卷积,极大降低了网络计算量.然而,医学图像尤其脑部三维MRI为高维数据,使用大核卷积对显存和算力提出极高要求,此外,ConvNeXt每层编码使用单一大小的大核卷积,易导致局部细节丢失.
基于上述背景,本文提出了一种基于多尺度膨胀残差卷积和双重注意力的三维可变形配准网络(MDDA-Net).该网络通过多尺度膨胀残差卷积模块在不引入过多参数的基础上扩大感受野,高效提取多尺度特征;设计通道-空间双重注意力模块,过滤图像中的冗余信息,实现特征增强;引入动态上采样模块,避免传统插值导致的棋盘伪影,提高变形场质量.本研究主要贡献如下:
(1)设计多尺度膨胀残差卷积模块,将深度可分离卷积和膨胀卷积结合以扩大感受野,捕获多尺度特征.
(2)构建双重注意力模块,通过高效通道注意力和分组空间注意力的联合建模,增强特征表示.
(3)引入动态上采样模块,构造动态采样网格自适应调整采样位置,防止结构模糊或失真,提高网络配准精度.
1 实验部分
1.1 整体网络
本文提出的MDDA-Net网络框架如图1所示,整体框架为编码器-解码器的U型结构,首先,将固定图像和运动图像在通道维度拼接作为输入,在编码器阶段,先通过多尺度膨胀残差卷积模块(MDRC)捕获多尺度特征信息,每层编码器使用不同膨胀率的卷积扩大感受野.然后,采用双重注意力模块(CSDA)抑制冗余信息,对关键区域的特征进一步增强.之后经过动态上采样模块(Dysample)恢复图像分辨率,并与编码器经跳跃连接后的特征拼接.最后,利用空间变换函数对运动图像施加几何变形,生成配准后的图像.网络通过最小化损失函数促使运动图像和固定图像对齐,实现最佳配准.损失函数包括相似性损失Lsim和正则化损失Lsmooth,前者用于衡量经变形场变形后的运动图像和固定图像的对齐程度,后者用于保证变形场的平滑性.图像通过MDDA-Net各模块时的输入与输出维度详见附录表A1.
图1
1.2 多尺度膨胀残差卷积模块
结构如图2所示,整体模块为一个深度可分离卷积[22],其采用解耦设计将通道信息和空间信息分离.对于输入的特征Finput,首先经过深度卷积对每个输入通道单独处理以提取空间维度信息.考虑到膨胀卷积能够在扩大感受野的同时不增加网络的参数和计算量,因此将深度卷积中的普通卷积替换为膨胀卷积,每层编码器使用不同的膨胀率高效捕获多尺度信息,并使用残差连接防止梯度爆炸和消失.随后,通过两个1×1×1卷积对深度卷积部分残差连接后的输出
其中,
图2
图2
多尺度膨胀残差卷积模块. (a)深度卷积;(b)逐点卷积
Fig. 2
Multi-dilated residual convolution module. (a) Depthwise convolution; (b) Pointwise convolution
1.3 通道-空间双重注意力
大脑在不同解剖区域具有不同的特征,且脑部3D数据存在冗余信息较多,为了高效提取不同脑区特征并抑制无关信息的干扰,本文在MDRC模块后设计了通道-空间双重注意力模块(Channel-Spatial Dual Attention,CSDA),其结构如图3所示,包括通道注意力和分组空间注意力两部分,采用串联形式将两者结合.通道注意力模块中,对输入特征
Wc_out为使用激活函数映射得到的通道注意力权重.Convld的卷积核大小k根据通道数自适应计算以动态调整各个通道的权重,公式如下:
经通道注意力模块加权后的特征作为空间注意力模块的输入,在空间注意力模块中,本文使用了分组形式,将特征分成G组,每组包含C/G个通道,每组特征用
然后,空间注意力
图3
1.4 动态上采样
上采样模块位于网络的解码器部分,用于恢复图像分辨率并与同级经过跳跃连接的编码器特征进行融合.在基于深度学习的医学图像配准中,上采样的特征会影响后续变形场的准确性.最邻近插值、双线性插值等传统上采样方法通过简单的局部插值得到上采样后的图像,但前者会产生锯齿状伪影,后者会导致边缘模糊,均会影响配准的精度.因此,本文引入Dysample[23]进行上采样,如图4所示.与CARAFE[24]、FADE[25]此类基于动态核的上采样不同,Dysample利用动态采样点建模几何信息并结合PyTorch内置函数grid_sample实现上采样,具有更少计算量FLOPs和参数数量Params.具体来说,先通过双线性初始化获得初始采样位置G,目的在于当偏移量为零时保证网络输出与双线性插值结果一致,防止初始分布不均匀导致模型训练不稳定.接着输入特征X分别通过线性投影linear生成原始偏移
图4
之后将偏移量O和初始采样位置G相加,动态调整采样位置以自适应采样,提高上采样的质量.最后,通过grid_sample函数对点采样集S计算得到上采样后的特征
另外,在上采样过程中沿通道维度将特征图划分为g组,每组特征生成独立的偏移量,提升模型对不同区域的表达能力.
1.5 损失函数
配准的目的是生成一个最佳坐标变换,使损失函数最小化.损失函数分为两部分,一是计算配准后图像与固定图像间的相似性,二是对生成的变形场ϕ 进行空间正则化,以平滑变形场.形式如下:
其中,
本文使用归一化互相关(Normalized cross correlation,NCC)[26]作为相似性函数来优化图像间的相似性:
其中,Ω表示图像域,
优化相似性损失函数可以使配准后图像最大程度和固定图像相似,但得到的变形场不一定是光滑的,因此,在变形场的空间梯度上使用扩散正则化保证合理的变形.本文选用L2范数[7]来约束变形场的平滑性:
其中,
2 实验设置
2.1 数据集
本实验使用两个公开可用的脑部磁共振数据集IXI和LPBA40对各个模型进行实验评估.
IXI(Information eXtraction from Images)数据集[15]共包含576张T1加权脑部MR图像,按照7 : 1 : 2的比例划分为训练集、验证集和测试集,即分别使用403、58和115张图像进行训练、验证和测试.对于IXI数据集,本文进行了基于图谱的配准,选择Kim等人[10]提供的脑图谱MRI作为运动图像.所有扫描图像均使用FreeSurfer[27]进行预处理,包括颅骨剥离、重采样、仿射对齐及裁剪和归一化等步骤,所有图像尺寸裁剪为160×192×224,并使用专家标注的30个感兴趣区域(region of interest,ROI)的标签图来评估配准算法的性能.
LPBA40数据集[28]包含40张T1W脑部MRI,划分为训练集28张,验证集4张以及测试集8张,选择S01作为固定图像进行基于图谱的配准.所有图像均通过FreeSurfer软件预处理,具体操作同IXI,最后将图像大小裁剪为160×192×160,分辨率设为1 mm×1 mm×1 mm,并勾画56个ROI评估配准性能.
2.2 实验细节
2.3 评价指标
DSC根据配准后图像与固定图像对应ROI的重叠程度来量化两幅图像的相似性,具体定义如下:
其中,
雅可比行列式反映了图像中各个像素点发生变形的情况,用于评价变形场的平滑效果.公式如下:
其中,
豪斯多夫距离HD用于测量固定和配准后图像的解剖结构之间的最长距离.定义为:
其中,
参数量和计算量通过PyTorch内置函数进行计算.内存(Memory)表示模型配准一对图像时内存的使用情况.配准时间(Time)表示模型配准一对图像所需要的时间.传统配准方法的时间为基于CPU的计算时间,深度学习配准方法为基于GPU计算时间.本文的配准时间取测试集数据的平均值.
该小节和损失函数一节涉及多种常用的医学图像配准数学符号,为便于阅读,已将涉及的主要符号及其含义总结于附录表A3.
3 实验结果与分析
3.1 对比实验
在两个不同的数据集上进行基于图谱的配准,将本文提出的模型与SyN[29]、NiftyReg[30]、VoxelMorph-1[7]、VoxelMorph-2[7]、CycleMorph[10]、Vit-V-Net[14]及TransMorph[15]比较并进行定量和定性分析.其中,SyN和NiftyReg为基于迭代优化的经典传统配准算法,VoxelMorph-1、VoxelMorph-2以及CycleMorph是基于CNN的深度学习配准方法,Vit-V-Net和TransMorph是基于Transformer的深度学习配准方法.表1和表2是不同配准模型在IXI数据集和LPBA40数据集上的定量结果,粗体表示最优结果.
表1 不同配准模型在IXI数据集的定量结果
Table 1
| Model | DSC | HD95/mm | %|Jϕ|≤0/% | Params/k | Flops/G | Memory/MB | Time/s |
|---|---|---|---|---|---|---|---|
| SyN | 0.641 ± 0.040 | 2.118 ± 0.754 | <0.001 | N/A | N/A | 254 | 189.172 |
| NiftyReg | 0.635 ± 0.066 | 2.166 ± 0.655 | 0.006 ± 0.016 | N/A | N/A | 254 | 69.962 |
| VoxelMorph-1 | 0.722 ± 0.029 | 2.287 ± 0.805 | 1.668 ± 0.345 | 274.39 | 305.32 | 9128 | 0.378 |
| VoxelMorph-2 | 0.728 ± 0.030 | 2.278 ± 0.797 | 1.580 ± 0.344 | 301.41 | 400.31 | 10524 | 0.417 |
| CycleMorph | 0.738 ± 0.028 | 2.156 ± 0.760 | 1.732 ± 0.365 | 361.30 | 127.02 | 23724 | 0.483 |
| Vit-V-Net | 0.643 ± 0.041 | 2.399 ± 0.854 | 1.391 ± 0.284 | 31560.08 | 391.12 | 11370 | 0.317 |
| TransMorph | 0.744 ± 0.031 | 2.273 ± 0.786 | 1.540 ± 0.335 | 46771.25 | 714.16 | 16840 | 0.450 |
| MDDA-Net (本文模型) | 0.751 ± 0.027 | 2.107 ± 0.765 | 1.384 ± 0.355 | 439.18 | 581.96 | 16572 | 0.364 |
Time:SyN、NiftyReg基于CPU计算;其他方法均基于GPU计算
表2 不同配准模型在LPBA40数据集的定量结果
Table 2
| Model | DSC | HD95/mm | %|Jϕ|≤0/% | Params/k | Flops/G | Memory/MB | Time/s |
|---|---|---|---|---|---|---|---|
| SyN | 0.670 ± 0.032 | 1.105 ± 0.180 | <0.001 | N/A | N/A | 204 | 108.688 |
| NiftyReg | 0.660 ± 0.018 | 1.312 ± 0.401 | <0.001 | N/A | N/A | 204 | 32.996 |
| VoxelMorph-1 | 0.650 ± 0.027 | 1.310 ± 0.399 | 0.717 ± 0.302 | 274.39 | 218.09 | 8080 | 0.207 |
| VoxelMorph-2 | 0.651 ± 0.029 | 1.143 ± 0.261 | 0.665 ± 0.285 | 301.41 | 285.94 | 9804 | 0.242 |
| CycleMorph | 0.670 ± 0.026 | 1.143 ± 0.261 | 0.625 ± 0.236 | 361.30 | 90.73 | 17192 | 0.221 |
| Vit-V-Net | 0.636 ± 0.029 | 1.258 ± 0.409 | 0.586 ± 0.268 | 31560.08 | 279.31 | 8044 | 0.225 |
| TransMorph | 0.668 ± 0.027 | 1.177 ± 0.339 | 0.630 ± 0.240 | 46771.25 | 511.97 | 11978 | 0.257 |
| MDDA-Net (本文模型) | 0.673 ± 0.023 | 1.104 ± 0.179 | 0.507 ± 0.139 | 439.18 | 415.68 | 11954 | 0.237 |
Time:SyN、NiftyReg基于CPU计算;其他方法均基于GPU计算
从表1可以看出,在IXI数据集上,基于深度学习的配准方法的DSC值均比传统配准方法的高.具体来说,本文模型在所有方法中取得了最佳DSC值,达到0.751且具有最小的标准差,比次优方法TransMorph提高了0.94%.MDDA-Net的HD95最低,为2.107 mm,说明本文方法得到的配准后图像与固定图像的相似性最高.此外,本文提出的网络虽没有取得最佳的非正雅可比行列式,比传统配准方法略高,但在基于深度学习的配准方法中,本文模型生成的变形场的折叠率为最低,说明拓扑结构破坏更少,实现了更平滑的变形.与VoxelMorph-1和VoxelMorph-2相比,本文虽同为 CNN 模型但加入了多尺度膨胀残差卷积模块及动态上采样模块,故参数量、计算量和内存有所增加.CycleMorph为实现循环一致性构建了双重CNN,两次前向传播的激活值叠加导致内存增大,而本文模型只进行单次前向传播,故本文模型具有更低的内存占用.与Vit-V-Net、TransMorph使用注意力的方法相比,本文加入注意力机制后,参数量减少的同时实现了DSC的提升.在时间Time这一指标上,本文模型达到了次优的配准速度.从表2的定量结果可以发现,MDDA-Net在LPBA40数据集上的DSC和HD95分别达到0.673和1.104 mm,为所有模型里的最优值,非正雅可比行列式百分比(%|Jϕ|≤0)的值为0.507%,在基于深度学习的方法中取得最佳结果,仅次于SyN. 本文模型DSC与VoxelMorph-1相比提高了3.54%,与基于Transformer的配准方法(如TransMorph)相比优化了0.75%且参数量明显降低.与传统方法相比,本文模型的非正雅可比行列式百分比略差,但DSC和HD95具有一定优势.传统配准算法在非正雅可比行列式上显著优于基于深度学习的配准方法,是因为其基于微分同胚框架实现配准,根据常微分方程理论,模型生成的速度场几乎不会出现折叠,而对比方法中的基于深度学习的配准方法以及本文模型未设计显式的微分同胚约束,仅在损失函数中使用正则化项进行约束,该项无法提供严格的拓扑保证,因此仍会存在一定比例的非正雅可比行列式.此外,基于CNN的模型(VoxelMorph-1、VoxelMorph-2、CycleMorph及本文模型)在参数量上更具优势,而基于Transformer的模型(Vit-V-Net、TransMorph)因使用了全局注意力机制,参数量显著增加.本文模型具有较大的计算量和较高的内存占用,这是因为使用了多个MDRC,尤其是该模块在网络第三层堆叠了两次,比其他CNN模型的单次卷积更复杂.Dysample需要为每一个像素预测偏移量并据此构建动态采样网格,这一过程产生大量的可学习参数和中间张量也导致计算量和内存增加.在时间方面,本文模型在LPBA40数据集上仅比VoxelMorph-1增加了0.030 s,但DSC值有一定优势.
图5展示了多种配准方法在IXI数据集冠状面上的可视化结果,由上到下分别为各种方法配准后图像、变形场(RGB显示)、变形场(Grid显示).在第一行图像中,可以观察到SyN生成的配准图像在右上角存在缺陷区域,其他模型的配准后图像则没有.图中红色方框区域,SyN和NiftyReg生成的脑沟存在一定程度的细节丢失,这可能是变形场过度平滑导致的,而本文方法生成的脑沟更细致.观察第二和第三行的图像,可以发现MDDA-Net的变形场相对于其他基于深度学习方法更加平滑,折叠区域明显减少,证明MDDA-Net折叠率更低,能够生成更合理的变形.图6为LPBA40的可视化结果,同样展示了冠状面的配准结果和变形场,观察绿色方框脑室区域,传统方法的脑室区域较模糊,MDDA-Net的脑室区域则更加完整和清晰,取得了较好的配准效果,并且变形场的折叠体素较少.
图5
图5
不同配准模型在IXI数据集上的可视化结果
Fig. 5
Visualization results of different registration models on the IXI dataset
图6
图6
不同配准模型在LPBA40数据集上的可视化结果
Fig. 6
Visualization results of different registration models on the LPBA40 dataset
3.2 消融实验
3.2.1 MDRC、CSDA和Dysample的有效性
本实验在IXI数据集上进行消融实验,以验证MDRC、CSDA和Dysample的有效性,所有模块进行消融时保持网络配置一致.结果如表3所示,没有添加任何模块时,baseline的DSC、HD95、非正雅可比行列式百分比的值分别为0.730,2.146 mm和1.645%.比较添加单个模块的网络性能,仅添加MDRC和单独使用CSDA时,DSC分别提升至0.737和0.734,并且变形场具有更低的折叠率,这表明MDRC与标准卷积相比,能够捕捉不同尺度的特征信息,增强了网络对上下文信息的感知能力;CSDA则通过双维度的特征增强,有效抑制冗余信息.观察参数量、计算量和内存三项指标,可以发现加入CSDA模块后尽管内存占用有所上升,但其在不显著增加参数和计算量的前提下取得了比baseline更高的DSC且耗时更短.MDRC模块中堆叠了多个深度可分离卷积并引入反向瓶颈设计,参数量和计算量较baseline的单个卷积块有所增加,同时串行结构需要保存多个中间激活层以便网络反向传播时计算梯度,因此内存也会增加.当仅使用Dysample时,DSC提高了2.05%,非正雅可比行列式百分比的值降至1.533%,这表明Dysample通过动态调整采样位置,提高上采样特征质量,有助于生成更好的变形场.这一过程中涉及大量的坐标变换,因此使用Dysample时计算量和内存上升.当同时添加两个模块,同时使用MDRC和CSDA与baseline、单独使用MDRC、单独使用CSDA相比,DSC和非正雅可比行列式百分比都进一步提升,证明两两模块结合的有效性.同样地,同时使用MDRC和Dysample以及同时使用CSDA和Dysample,网络性能均有所提升.最后,当三个模块一起使用时,网络性能达到最佳,DSC较基线提升了2.88%,HD95减小了0.039 mm,非正雅可比行列式百分比由1.645%降至1.384%,这说明三个模块协同作用,在编码器部分利用MDRC和CSDA提取丰富的特征信息并提升重要特征的表达能力,同时解码器采用Dysample生成更平滑的变形场,减少折叠区域,实现了最优配准.
表3 消融实验定量结果
Table 3
| MDRC | CSDA | Dysample | DSC | HD95/mm | %|Jϕ|≤0/% | Params/k | Flops/G | Memory/MB | Time/s |
|---|---|---|---|---|---|---|---|---|---|
| 0.730 ± 0.030 | 2.146 ± 0.809 | 1.645 ± 0.355 | 396.55 | 571.33 | 11052 | 0.213 | |||
| √ | 0.737 ± 0.028 | 2.305 ± 0.843 | 1.567 ± 0.349 | 413.41 | 575.03 | 13230 | 0.212 | ||
| √ | 0.734 ± 0.029 | 2.197 ± 0.789 | 1.565 ± 0.348 | 397.36 | 572.62 | 12558 | 0.208 | ||
| √ | 0.745 ± 0.027 | 2.201 ± 0.786 | 1.533 ± 0.332 | 421.51 | 576.96 | 12910 | 0.211 | ||
| √ | √ | 0.739 ± 0.029 | 2.162 ± 0.793 | 1.496 ± 0.344 | 414.22 | 576.33 | 14732 | 0.216 | |
| √ | √ | 0.749 ± 0.026 | 2.134 ± 0.771 | 1.383 ± 0.328 | 438.37 | 580.66 | 15068 | 0.339 | |
| √ | √ | 0.748 ± 0.028 | 2.131 ± 0.767 | 1.523 ± 0.343 | 422.32 | 578.25 | 14298 | 0.235 | |
| √ | √ | √ | 0.751 ± 0.027 | 2.107 ± 0.765 | 1.384 ± 0.355 | 439.18 | 581.96 | 16572 | 0.364 |
图7为各模块在IXI数据集上消融的可视化结果,选取冠状面进行展示.红色方框标注区域,与baseline相比,添加MDRC和CSDA后,图像的局部细节更加清晰和完整,表明MDRC能充分提取局部特征和上下文信息,而CSDA则对特征进行选择与增强,显著增强网络的特征表达能力.使用Dysample时,可以观察到变形场的折叠区域较baseline减少,这说明动态上采样的方式有助于生成高质量的变形场.两个模块联合使用则进一步改善配准的效果,而同时将三个模块加入到网络中,蓝色箭头指示的变形场区域,MDDA-Net的折叠像素最少,说明保持了良好的拓扑结构,且配准后图像与固定图像在结构上更为相似,这与表3中定量指标的结果一致.
图7
3.2.2 与不同多尺度结构对比
MDRC目的在于提取多尺度特征,为验证其优越性,将MDRC与ASPP[33]对比.ASPP使用多个并行膨胀卷积捕获多尺度的上下文信息,MDRC则通过串行、逐层递增膨胀率的方式构建多尺度感受野.表4展示了两者的对比结果.根据表4的各项指标可以发现,MDRC和ASPP的DSC值相同,但ASPP的HD95和非正雅可比行列式百分比明显比MDRC差,其HD95为2.124 mm,非正雅可比行列式百分比的值达到1.506%,说明存在明显折叠区域.本文设计的MDRC在参数量、计算量、内存及时间等方面均优于ASPP. 根据ASPP的结构可以推测,其使用并行分支,每个分支具有不同的膨胀率,这会导致膨胀率较大的卷积核提取到的特征更稀疏且不连续,使得经解码器上采样后的变形场不够平滑.其并行分支在拼接前需保存多个分支的临时特征图,导致内存占用高、耗时长.同时,多分支的普通卷积比深度可分离卷积具有更多的计算参数,因此ASPP的参数量和计算量的值比MDRC高.而MDRC采用串行、渐进式的方式进行多尺度建模,使每一层都在上一层提取的特征的基础上进一步扩大范围,更利于捕捉细微的形变,降低计算负担的同时保证配准精度.
表4 与同类型模块的对比
Table 4
| Model | DSC | HD95/mm | %|Jϕ|≤0/% | Params/k | Flops/G | Memory/MB | Time/s(GPU) |
|---|---|---|---|---|---|---|---|
| +ASPP | 0.751 ± 0.028 | 2.124 ± 0.782 | 1.506 ± 0.352 | 466.05 | 591.62 | 18978 | 0.374 |
| +MDRC | 0.751 ± 0.027 | 2.107 ± 0.765 | 1.384 ± 0.355 | 439.18 | 581.96 | 16572 | 0.364 |
| +CBAM | 0.745 ± 0.026 | 2.170 ± 0.826 | 1.448 ± 0.344 | 439.00 | 581.65 | 16310 | 0.377 |
| +SE | 0.747 ± 0.026 | 2.151 ± 0.834 | 1.394 ± 0.328 | 438.79 | 580.95 | 15630 | 0.344 |
| +CSDA | 0.751 ± 0.027 | 2.107 ± 0.765 | 1.384 ± 0.355 | 439.18 | 581.96 | 16572 | 0.364 |
| +nearest | 0.739 ± 0.029 | 2.162 ± 0.793 | 1.496 ± 0.344 | 414.22 | 576.33 | 14732 | 0.216 |
| +trilinear | 0.740 ± 0.023 | 2.126 ± 0.766 | 1.434 ± 0.379 | 414.22 | 576.33 | 14732 | 0.351 |
| +Dysample | 0.751 ± 0.027 | 2.107 ± 0.765 | 1.384 ± 0.355 | 439.18 | 581.96 | 16572 | 0.364 |
3.2.3 与不同注意力机制对比
本文所设计的注意力模块CSDA旨在高效建模通道和空间双维度上的特征,增强网络对关键解剖区域的感知能力.为了验证CSDA的优越性,将CSDA替换为CBAM[34]和SE[35]注意力模块进行对比分析.结果如表4所示,本文的CSDA模块在参数量和计算量相近的情况下,DSC、HD95和非正雅可比行列式百分比的值等多个指标上均取得了最佳结果.DSC较CBAM、SE提升了0.81%和0.54%,HD95减小了2.90%和2.05%.SE注意力机制将空间维度进行压缩后使用全连接层学习通道间的相关性,模型会更加关注通道信息而忽略空间信息;CBAM则在通道注意力的基础上进一步引入空间注意力,同时关注通道和空间信息,但空间注意力对所有的通道使用统一的空间权重,容易忽略不同通道间的差异.而CSDA在通道注意力部分使用一维卷积实现跨通道特征提取,避免全连接层带来的计算开销,空间注意力部分分成多组独立的空间注意力,对不同特征分配不同权重,更有效地捕捉关键特征,提升配准精度.值得注意的是,CBAM和本文设计的CSDA同为通道-空间双维度注意力模块,两者在参数量、计算量和内存占用方面的结果相近,但CSDA的配准时间略优于CBAM,实现了更高的计算效率,展现了本文模块的有效性.
3.2.4 与不同上采样方式对比
上采样方式会影响变形场的生成效果,本实验将Dysample与nearest、trilinear对比以验证Dysample的优越性.nearest将距离最近的像素值作为采样点的像素值,计算开销更低但会导致局部不够光滑,产生锯齿状伪影;trilinear通过对周围8个像素点的值加权平均来计算目标值,能产生更平滑的结果,但由于权重取决于距离而非特征相关性,边缘处会出现过度平滑或模糊.Dysample则利用动态采样点构建采样网格,根据局部语义自适应调整采样位置实现对不同区域的配准.对比结果见表4,与nearest、trilinear相比,Dysample的DSC值显著提升,分别优化了1.62%和1.49%,HD95减小至2.107 mm,同时非正雅可比行列式百分比的值为1.384%,为三者中的最小值,表明Dysample生成的变形场具有最小的折叠区域.这说明nearest、trilinear的固定插值容易产生折叠,Dysample的动态插值则有效约束了变形场的折叠率.在效率方面,nearest和trilinear为固定插值,无需动态生成采样网格,故计算开销和内存更低.Dysample因引入动态采样点导致参数量、计算量和内存占用增加,但配准时间仅比trilinear增加0.013 s且配准精度更佳.
3.2.5 MDRC中不同膨胀率的影响
MDRC中使用膨胀卷积提取多尺度上下文信息,考虑到膨胀率会影响模型提取特征的能力,因此设置了三组对比实验来测试不同膨胀率对配准性能的影响.第一组在浅层网络就扩大膨胀率,第二组在第三层编码器中连续使用较大膨胀率,第三组在网络最深层使用更大的膨胀率.结果如表5所示,浅层就扩大膨胀率,其DSC较本文模型提高了0.27%,但HD95增大至2.148 mm且非正雅可比行列式百分比显著增大,说明过早扩大感受野可能会模糊局部细节,破坏变形场的连续性.中高层连续使用相同的膨胀率,导致特征变得稀疏,产生明显网格效应,配准精度下降.在深层网络使用更大的膨胀率,感受野虽然变大但特征点更加稀疏,可能会引入无关区域的噪声导致DSC、HD95和非正雅可比行列式百分比指标变差.综合多个指标,将膨胀率设置为1, 1, 1, 2, 2时达到最优的权衡,在浅层保证边缘、局部解剖结构的对齐,中高层通过逐步扩大膨胀率以保证空间连续性,深层不引入过大膨胀率避免产生大量空洞.
表5 MDRC中不同膨胀率的对比结果
Table 5
| Dilation | DSC | HD95/mm | %|Jϕ|≤0/% | Params/k | Flops/G | Memory/MB | Time/s (GPU) |
|---|---|---|---|---|---|---|---|
| 1,2,1,2,2 | 0.753 ± 0.027 | 2.148 ± 0.820 | 1.541 ± 0.339 | 439.18 | 581.96 | 16572 | 0.363 |
| 1,1,2,2,2 | 0.749 ± 0.026 | 2.108 ± 0.737 | 1.393 ± 0.313 | 439.18 | 581.96 | 16572 | 0.364 |
| 1,1,1,2,3 | 0.750 ± 0.026 | 2.254 ± 0.789 | 1.398 ± 0.318 | 439.18 | 581.96 | 16572 | 0.364 |
| 1,1,1,2,2 | 0.751 ± 0.027 | 2.107 ± 0.765 | 1.384 ± 0.355 | 439.18 | 581.96 | 16572 | 0.364 |
4 结论
本文提出了一种无监督可变形配准网络MDDA-Net,该网络通过设计多尺度膨胀残差卷积模块实现多尺度特征感知,在不同层编码器中捕获局部细节和更大范围的上下文信息.同时,设计通道-空间双重注意力,通过自适应通道注意力和分组空间注意力同时捕获通道和空间特征信息,提高网络对关键特征的表达能力.另外还引入动态上采样,改善传统上采样操作因固定采样导致几何结构失真的问题.利用本文提出的网络在IXI和LPBA40两个三维脑部数据集上实验并与主流的配准方法进行比较,多个评价指标的结果表明,MDDA-Net具有先进的配准性能,此外,设计消融实验验证了本文提出模块的有效性.本研究还存在一些不足之处:首先,本文仅聚焦于脑部数据集的配准,未来可以探索与分割或分类等任务结合,进一步提升模型在脑部疾病检测诊断方面的性能.其次,本文基于单模态图像设计模型,但在临床应用中,通常需要对CT-MRI等不同模态进行配准,后续考虑将研究拓展至多模态配准任务中.最后,虽然MDRC有效扩大了感受野并引入了多尺度上下文信息,但对于全局信息建模能力较弱,若使用更大的膨胀率来提取全局信息,会引入网格效应导致信息丢失,未来考虑构建全局模块以增强网络对长距离依赖的建模.
附件材料附录
表A1 网络各阶段输入与输出维度
Table A1
| 阶段 | 输入维度 | 输出维度 |
|---|---|---|
| 输入层 | [B,1,H,W,D]×2 | [B,2,H,W,D] |
| 第一层MDRC | [B,2,H,W,D] | [B,16,H,W,D] |
| 第一层CSDA | [B,16,H,W,D] | [B,16,H,W,D] |
| 第二层MDRC | [B,16,H/2,W/2,D/2] | [B,32, H/2,W/2,D/2] |
| 第二层CSDA | [B,32, H/2,W/2,D/2] | [B,32, H/2,W/2,D/2] |
| 第三层MDRC | [B,32, H/4,W/4,D/4] | [B,32, H/4,W/4,D/4] |
| 第三层CSDA | [B,32, H/4,W/4,D/4] | [B,32, H/4,W/4,D/4] |
| 第四层MDRC | [B,32, H/8,W/8,D/8] | [B,32, H/8,W/8,D/8] |
| 第四层CSDA | [B,32, H/8,W/8,D/8] | [B,32, H/8,W/8,D/8] |
| 第一层Dysample | [B,32, H/16,W/16,D/16] | [B,32, H/8,W/8,D/8] |
| 第二层Dysample | [B,32, H/8,W/8,D/8] | [B,32, H/4,W/4,D/4] |
| 第三层Dysample | [B,32, H/4,W/4,D/4] | [B,32, H/2,W/2,D/2] |
| 第四层Dysample | [B,32, H/2,W/2,D/2] | [B,16, H,W,D] |
| Conv3D | [B,16, H,W,D] | [B,3, H,W,D] |
注:B、H、W、D分别为批大小、图像高度、图像宽度、图像深度.
表A2 超参数设置
Table A2
| 参数名 | 具体设置 |
|---|---|
| 优化器 | Adam |
| 学习率 | 1×10-4 |
| 学习率衰减策略 | 多项式衰减(power=0.9) |
| 相似性损失 | NCC |
| 正则化损失 | L2 |
| 正则化权重λ | 1 |
| 批大小 | 1 |
| 数据增强 | 随机翻转 |
| 训练时GPU显存 | 16572 MB |
表A3 符号表
Table A3
| 符号 | 含义 |
|---|---|
| ϕ | 变形场 |
| 最佳变形场 | |
| 固定图像 | |
| 运动图像 | |
| 总损失 | |
| 配准后图像 | |
| 固定图像和配准后图像间的相似性损失 | |
| 变形场的正则化损失 | |
| Ω | 图像域 |
| p | 体素 |
| 以p为中心的局部邻域 | |
| 固定图像中以体素p为中心的平均体素值 | |
| 配准后图像以体素p为中心的平均体素值 | |
| p处变形场的空间梯度 | |
| p处的雅可比行列式 | |
| 配准后图像的标签 | |
| 固定图像的标签 |
利益冲突
无
参考文献
A body examination study of brain MRI registration in adolescents using fusion generative adversarial network
[J].
融合生成对抗网络的青少年脑MRI配准体测研究
[J].
Groupwise registration for magnetic resonance image based on variational inference
[J].
基于变分推断的磁共振图像群组配准
[J].
DOI:10.11938/cjmr20212918
[本文引用: 1]
为解决基于深度学习的成对配准方法精度低和传统配准算法耗时长的问题,本文提出一种基于变分推断的无监督端到端的群组配准以及基于局部归一化互相关(NCC)和先验的配准框架,该框架能够将多个图像配准到公共空间并有效地控制变形场的正则化,且不需要真实的变形场和参考图像.该方法得到的预估变形场可建模为概率生成模型,使用变分推断的方法求解;然后借助空间转换网络和损失函数来实现无监督方式训练.对于公开数据集LPBA40的3D脑磁共振图像配准任务,测试结果表明:本文所提出的方法与基线方法相比,具有较好的Dice得分、运行时间少且产生更好的微分同胚域,同时对噪声具有鲁棒性.
2D/3D multimode medical image alignment based on spatial histograms
[J].
DOI:10.3390/app12168261
URL
[本文引用: 1]
The key to image-guided surgery (IGS) technology is to find the transformation relationship between preoperative 3D images and intraoperative 2D images, namely, 2D/3D image registration. A feature-based 2D/3D medical image registration algorithm is investigated in this study. We use a two-dimensional weighted spatial histogram of gradient directions to extract statistical features, overcome the algorithm’s limitations, and expand the applicable scenarios under the premise of ensuring accuracy. The proposed algorithm was tested on CT and synthetic X-ray images, and compared with existing algorithms. The results show that the proposed algorithm can improve accuracy and efficiency, and reduce the initial value’s sensitivity.
Intensity-based quality assurance criteria for deformable image registration in image-guided radiotherapy
[J].DOI:10.1002/mp.v50.9 URL [本文引用: 1]
Lung 4D CT image registration based on high-order markov random field
[J].DOI:10.1109/TMI.42 URL [本文引用: 1]
CerebrA, registration and manual label correction of Mindboggle-101 atlas for MNI-ICBM152 template
[J].
DOI:10.1038/s41597-020-0557-9
PMID:32669554
[本文引用: 1]
Accurate anatomical atlases are recognized as important tools in brain-imaging research. They are widely used to estimate disease-specific changes and therefore, are of great relevance in extracting regional information on volumetric variations in clinical cohorts in comparison to healthy populations. The use of high spatial resolution magnetic resonance imaging and the improvement in data preprocessing methods have enabled the study of structural volume changes on a wide range of disorders, particularly in neurodegenerative diseases where different brain morphometry analyses are being broadly used in an effort to improve diagnostic biomarkers. In the present dataset, we introduce the Cerebrum Atlas (CerebrA) along with the MNI-ICBM2009c average template. MNI-ICBM2009c is the most recent version of the MNI-ICBM152 brain average, providing a higher level of anatomical details. Cerebra is based on an accurate non-linear registration of cortical and subcortical labelling from Mindboggle 101 to the symmetric MNI-ICBM2009c atlas, followed by manual editing.
Voxelmorph: a learning framework for deformable medical image registration
[J].DOI:10.1109/TMI.42 URL [本文引用: 7]
Recent advances and clinical applications of deep learning in medical image analysis
[J].DOI:10.1016/j.media.2022.102444 URL [本文引用: 1]
Spatial transformer networks
[J].
CycleMorph: cycle consistent unsupervised deformable image registration
[J].DOI:10.1016/j.media.2021.102036 URL [本文引用: 5]
Fast symmetric diffeomorphic image registration with convolutional neural networks
[C]//
Attention is all you need
[C]//
An image is worth 16×16 words:Transformers for image recognition at scale[PP/OL]
Transmorph: Transformer for unsupervised medical image registration
[J].DOI:10.1016/j.media.2022.102615 URL [本文引用: 4]
Swin transformer: Hierarchical vision transformer using shifted windows
[C]//
Xmorpher: Full transformer for deformable medical image registration via cross attention
[C]//
Recursive deformable image registration network with mutual attention
[C]//
Modet: Learning deformable image registration via motion decomposition transformer
[C]//
Transmatch: A transformer-based multilevel dual-stream feature matching network for unsupervised deformable image registration
[J].DOI:10.1109/TMI.2023.3288136 URL [本文引用: 1]
A convnet for the 2020s
[C]//
Xception: Deep learning with depthwise separable convolutions
[C]//
Learning to upsample by learning to sample
[C]//
Carafe: Content-aware reassembly of features
[C]//
FADE: Fusing the assets of decoder and encoder for task-agnostic upsampling
[C]//
Application of normalized cross correlation to image registration
[J].
FreeSurfer
[J].
DOI:10.1016/j.neuroimage.2012.01.021
PMID:22248573
[本文引用: 1]
FreeSurfer is a suite of tools for the analysis of neuroimaging data that provides an array of algorithms to quantify the functional, connectional and structural properties of the human brain. It has evolved from a package primarily aimed at generating surface representations of the cerebral cortex into one that automatically creates models of most macroscopically visible structures in the human brain given any reasonable T1-weighted input image. It is freely available, runs on a wide variety of hardware and software platforms, and is open source.Copyright © 2012 Elsevier Inc. All rights reserved.
Construction of a 3D probabilistic atlas of human cortical structures
[J].
DOI:10.1016/j.neuroimage.2007.09.031
PMID:18037310
[本文引用: 1]
We describe the construction of a digital brain atlas composed of data from manually delineated MRI data. A total of 56 structures were labeled in MRI of 40 healthy, normal volunteers. This labeling was performed according to a set of protocols developed for this project. Pairs of raters were assigned to each structure and trained on the protocol for that structure. Each rater pair was tested for concordance on 6 of the 40 brains; once they had achieved reliability standards, they divided the task of delineating the remaining 34 brains. The data were then spatially normalized to well-known templates using 3 popular algorithms: AIR5.2.5's nonlinear warp (Woods et al., 1998) paired with the ICBM452 Warp 5 atlas (Rex et al., 2003), FSL's FLIRT (Smith et al., 2004) was paired with its own template, a skull-stripped version of the ICBM152 T1 average; and SPM5's unified segmentation method (Ashburner and Friston, 2005) was paired with its canonical brain, the whole head ICBM152 T1 average. We thus produced 3 variants of our atlas, where each was constructed from 40 representative samples of a data processing stream that one might use for analysis. For each normalization algorithm, the individual structure delineations were then resampled according to the computed transformations. We next computed averages at each voxel location to estimate the probability of that voxel belonging to each of the 56 structures. Each version of the atlas contains, for every voxel, probability densities for each region, thus providing a resource for automated probabilistic labeling of external data types registered into standard spaces; we also computed average intensity images and tissue density maps based on the three methods and target spaces. These atlases will serve as a resource for diverse applications including meta-analysis of functional and structural imaging data and other bioinformatics applications where display of arbitrary labels in probabilistically defined anatomic space will facilitate both knowledge-based development and visualization of findings from multiple disciplines.
Symmetric diffeomorphic image registration with cross-correlation: evaluating automated labeling of elderly and neurodegenerative brain
[J].
DOI:10.1016/j.media.2007.06.004
PMID:17659998
[本文引用: 2]
One of the most challenging problems in modern neuroimaging is detailed characterization of neurodegeneration. Quantifying spatial and longitudinal atrophy patterns is an important component of this process. These spatiotemporal signals will aid in discriminating between related diseases, such as frontotemporal dementia (FTD) and Alzheimer's disease (AD), which manifest themselves in the same at-risk population. Here, we develop a novel symmetric image normalization method (SyN) for maximizing the cross-correlation within the space of diffeomorphic maps and provide the Euler-Lagrange equations necessary for this optimization. We then turn to a careful evaluation of our method. Our evaluation uses gold standard, human cortical segmentation to contrast SyN's performance with a related elastic method and with the standard ITK implementation of Thirion's Demons algorithm. The new method compares favorably with both approaches, in particular when the distance between the template brain and the target brain is large. We then report the correlation of volumes gained by algorithmic cortical labelings of FTD and control subjects with those gained by the manual rater. This comparison shows that, of the three methods tested, SyN's volume measurements are the most strongly correlated with volume measurements gained by expert labeling. This study indicates that SyN, with cross-correlation, is a reliable method for normalizing and making anatomical measurements in volumetric MRI of patients and at-risk elderly individuals.
Fast free-form deformation using graphics processing units
[J].
DOI:10.1016/j.cmpb.2009.09.002
PMID:19818524
[本文引用: 2]
A large number of algorithms have been developed to perform non-rigid registration and it is a tool commonly used in medical image analysis. The free-form deformation algorithm is a well-established technique, but is extremely time consuming. In this paper we present a parallel-friendly formulation of the algorithm suitable for graphics processing unit execution. Using our approach we perform registration of T1-weighted MR images in less than 1 min and show the same level of accuracy as a classical serial implementation when performing segmentation propagation. This technology could be of significant utility in time-critical applications such as image-guided interventions, or in the processing of large data sets.Copyright 2009 Elsevier Ireland Ltd. All rights reserved.
Measures of the amount of ecologic association between species
[J].DOI:10.2307/1932409 URL [本文引用: 1]
An efficient algorithm for calculating the exact Hausdorff distance
[J].DOI:10.1109/TPAMI.2015.2408351 URL [本文引用: 1]
Encoder-decoder with atrous separable convolution for semantic image segmentation
[C]//
CBAM: Convolutional block attention module
[C]//
Squeeze-and-excitation networks
[C]//
/
| 〈 |
|
〉 |
