Prompt-Agent-Driven Integration of Foundation Model Priors for Low-Count PET Reconstruction
基于提示代理与基础模型先验的低计数PET重建

论文链接:https://ieeexplore.ieee.org/document/10833823
项目链接:未找到
Abstract
低计数正电子发射断层扫描重建对于保持高成像质量,同时最大限度地减少示踪剂剂量和辐射暴露至关重要。尽管整合CT和MR数据的结构信息已被证明可以增强PET重建,但这通常需要同时进行PET和CT/MRI扫描,使工作流程复杂化,并增加辐射暴露。基础模型的最新进展为面对面CT/MRI成像提供了一种有前景的替代方案,有可能克服这些局限性。然而,已经观察到使用基础模型的分割掩码作为语义指导会在低计数PET重建中引入错误的结构。为了应对这一挑战,这项工作引入了一种创新的基于提示代理的框架,该框架与基础模型动态交互以检索和优化先验,从而最大限度地减少对重建过程的不当影响。具体来说,设计了一个用于单实例局域信息检索的框代理,同时引入了一个点代理,利用历史点提示在全局范围内逐步提示更广泛的语义结构。此外,还开发了一种MDP范式,以解决在保持MDP所需的独立性的同时利用历史点提示的挑战。在模拟和真实数据集上进行评估后,与最先进的方法相比,即使是那些利用面对面CT/MRI先验的方法,所提出的方法也表现出更优的定性和定量性能。
I. INTRODUCTION
正电子发射断层扫描(PET)是医学成像中的一种基本诊断工具,因其代谢和分子见解而被广泛使用。尽管它在临床诊断和研究中发挥着宝贵的作用,但人们一直在努力保持高成像质量,同时减少所需的示踪剂剂量,并最大限度地减少与电离辐射暴露相关的担忧。然而,重建低计数PET成像具有挑战性,因为它本质上是一个以不稳定解为特征的不适定逆问题。
为了减轻这种不稳定性,采用了正则化技术,结合了关于预期解特征的先验知识,以减少观测数据中噪声和其他不确定性的影响。例如,在重建框架中设计特定的惩罚或图像先验(例如,总变异TV、字典学习和核方法),以提高PET图像质量[1]-[3]。最近的研究表明,通过利用高空间分辨率磁共振成像(MRI)和计算机断层扫描(CT)作为先验来提供解剖特征,从而帮助PET图像重建、去噪和合成,取得了有前景的结果[4]-[8]。这种多模态方法利用MRI或CT等替代模态的先验知识,提供PET数据中通常缺乏的额外解剖信息。这种补充的解剖信息补充了PET数据中的结构弱点,从而促进了重建过程。
虽然这些多模态方法在增强PET成像方面显示出有希望的结果,但它们也引入了可能限制其临床应用的重大缺点。具体来说,这些方法通常依赖于标准剂量CT来提供详细的解剖指导,使患者暴露在更高水平的电离辐射中,这违反了尽可能低的合理可实现(ALARA)原则[9],[10]。同样,MRI通常需要更长的扫描时间并产生更高的成本,这可能会降低可及性和患者的舒适度。此外,通常集成在PET系统中用于衰减校正的低剂量CT或快速MRI并没有针对详细成像进行优化。这通常会导致图像质量降低,对伪影的敏感性增加。[11] [12],这损害了它们作为解剖指南的可靠性。此外,使用CT或MRI来增强PET重建,而不仅仅是衰减校正,增加了成像工作流程的复杂性。尽管仅用于衰减校正时,PET与CT/MRI之间的精确对准并非至关重要[13]、[14],但准确的解剖引导需要更精确的对准。这种严格的对齐必要性提高了诊断过程的复杂性,延长了手术时间,增加了成本,并加重了整体工作量。
为了应对传统多模态方法的挑战,本研究与依赖配对的现场PET-CT/MRI数据作为先验的方法不同,而是探索了基础模型作为先验的替代来源的潜力。神经网络已被证明能够作为图像恢复任务的有效先验[15]-[17]。此外,视觉基础模型的最新进展,如Segment Anything Model(SAM)和Medical SAM,在跨不同图像的详细分割方面表现出强大的能力,提供了有价值的结构和语义信息[18],[19]。医学基础模型在广泛的CT和MRI数据集上接受过训练,学习了这些模式的内在特征[19]-[21],使其有可能作为传统数据源的替代品,提供重建先验,并缓解与传统面对面先验相关的挑战,如CT或MRI的先验。探索使用基础模型进行重建先验提供了一种新方法,这在面对面多模态数据不可用的情况下特别有益。
基础模型的先前应用主要集中在生成用于语义指导的分割掩码上。然而,我们对将基础模型直接集成到重建算法中的观察表明,这种直接集成往往无法提供正确的指导,并对重建图像产生不成比例的影响,如图1(a)所示。将此策略应用于低计数PET重建有两个重大挑战,这可能会导致性能下降。首先,虽然像SAM这样的模型在各种各样的物体上表现出了卓越的性能,但它们的有效性可能会因不熟悉或失真的图像而高度变化和不稳定[22],[23]——这是PET成像的典型条件,基础模型的预训练通常缺乏PET数据集,PET图像本身分辨率较低。这种可变性阻碍了基础模型为低计数PET重建提供准确和稳定的指导。其次,研究表明,PET重建可能会受到其他模式的不成比例的影响,从而引入错误的结构[24]。鉴于基础模型的强大功能,有理由断言它们对PET成像的影响将更加明显。

受到在分割任务中有效使用框和点提示作为基础模型的强大监督工具的启发[25],[26],这项工作提出了一种新方法,该方法使用代理用框和点提示符提示基础模型,利用这些提示的基于基础模型的先验来促进低计数PET重建。为了解决基础模型指导的不稳定性,这项工作采用了点和框提示(视觉基础模型中的常用工具)来调节模型的响应。这些提示由经过训练以优化重建性能的代理动态生成,利用代理众所周知的适应复杂动态场景的能力[27]-[29],这正是低计数PET迭代重建的情况。为了尽量减少基础模型过度影响的风险,这项工作通过一个受控的多步骤过程整合了这些先验,使系统能够自我校正并逐步完善重建输出。如图1(b)所示,所提出的重建框架采用迭代重建算法,在迭代之间使用基于基础模型的增强模块,训练代理从基础模型中主动选择和检索先验。基础模型的解码器已被重新配置,可以直接生成先验而不是掩码,从而提供更全面的信息。然后利用这些先验通过融合来增强PET图像,并将增强的图像发送到下一次迭代。
具体来说,两个代理通过点和框提示从基础模型中主动检索先验信息。box代理通过一次定义一个特定边界来检索本地化的单实例信息,引导基础模型准确地聚焦在目标区域,而不会产生冲突的边界。相比之下,点代理建立在累积的点提示历史的基础上,逐渐捕捉更广泛的语义结构,并逐步完善模型的理解。这种设计与大多数视觉基础模型[18]、[19]的预训练阶段对这些提示的使用相一致,确保了清晰度,防止了输入冲突,并最大限度地提高了指导基础模型的有效性。这些代理基于马尔可夫决策过程(MDP)进行训练。为了将历史点提示纳入该框架,这项工作引入了一种新的MDP范式,该范式在遵守MDP独立性要求的同时容纳了历史输入。此外,这两个代理以分散的方式使用,便于处理;分散多智能体中常见的潜在不稳定问题由迭代重建算法(如期望最大化算法(EM))来解决,该算法保证了收敛性。在体模模拟、真实临床数据和实验数据上开展的广泛实验表明,所提出的方法无需依赖额外多模态数据,即可超越现有低剂量重建技术的性能。消融研究证实了基于代理的框架的有效性,在动物扫描中的进一步评估突显了所提出的方法在不进行额外训练的情况下对不同数据集的卓越鲁棒性。据我们所知,这是在促进PET重建之前,首次尝试利用基础模型作为先验信息来源。这项工作的贡献包括:
- 介绍了一种在促进低计数PET重建之前利用基础模型的新方法。这种方法避免了通常与使用多模态数据相关的额外辐射暴露和对准复杂性。
- 引入了分散的多代理设计来调节模型的响应,并减轻基础模型对PET重建的不当影响。这些代理主动从基础模型中检索先验,增强了重建过程。
- 引入了一种新的MDP范式,解决了与利用历史点促进和满足MDP的独立性要求相关的挑战,这对训练点提示策略至关重要。
II. RELATED WORKS
本节回顾了图像分析中基于先验的低计数PET重建方法、基于基础模型的成像增强方法和基于agent的方法的最新工作。
A. 基于先验的低计数PET重建
近几十年来,通过将先验整合到重建框架中,为提高PET图像质量做出了重大努力[30]-[32]。随着深度学习的出现,最近的进展集中在利用神经网络从先前图像中提取解剖特征,从而指导PET图像重建和去噪[4]-[8]。Song等人和Schramm等人的研究人员通过单独的卷积层处理PET和MRI通道,随后合并特征以解决PET和MRI之间的可变性[6],[7]。此外,三维卷积神经网络(3D CNN)已被用于将解剖信息映射到最大后验(MAP)重建过程中,作为正则化的一种形式[8]。此外,已经探索了无训练深度图像先验(DIP)等技术[33],[34]。具体来说,对于PET成像,开发了一个条件DIP(CDIP)框架,利用患者的CT或MRI数据作为修改后的3D U-Net的输入,该U-Net旨在适应有噪声的PET图像本身,从而允许根据解剖输入和由网络权重参数化的回归函数从先验中表示恢复的PET图像[34]。虽然CDIP方法在PET图像去噪方面显示出了有效性,但在实际环境中,为每个单独的PET数据集重新调整网络的需求带来了计算挑战[35]。这些方法通常需要使用面对面的多模态数据,这不仅增加了患者的辐射暴露,而且使处理复杂化。
B. 基于基础模型的成像增强
在图像恢复/增强(IR)领域,基础模型已成为关键工具。SAM[18]对1100万张图像中的10多亿个掩模进行了预训练,将同样广泛的训练方案扩展到图像分割能力。这种广泛的预训练使SAM能够以高精度和通用性执行复杂的分割任务,即使在看不见的医学成像数据集上也是如此,而不管初始图像质量和模态如何。
已经进行了许多尝试,试图利用SAM对自然图像内容的语义理解,这大大细化和增强了图像/视频恢复和增强任务中的语义先验,如超分辨率(SR)、去模糊和去噪[36]-[39]。例如,开发了一种新的SAM引导细化模块,利用SAM的深层语义先验来增强对齐和融合过程[39]。Wang等人生成了细粒度语义先验掩模,以增强SR任务的细节恢复[36]。受基础模型在图像恢复中令人印象深刻的能力的启发,本研究旨在利用视觉基础模型的力量进行低计数PET重建。
C. 基于Agent的图像分析方法
作为机器学习的基本工具,基于代理的方法对于管理需要自适应、反馈驱动决策和高精度的复杂动态环境至关重要[40],[41]。特别是,基于MDP的代理根据累积奖励迭代地改进他们的行为,使他们能够不断优化策略以应对不断变化的条件[42],[43]。最近的研究强调了代理在各种计算机视觉(CV)应用中的潜力,显示出对需要灵活性和鲁棒性的任务的改进[27],[29]。例如,Guo等人的用于可变形人脸跟踪的双代理深度强化学习(DADRL)框架使用两个代理迭代调整边界框和界标,显著提高了高可变性场景中的跟踪精度。在医学图像分析中,VoxelPrompt展示了由多模态提示引导的视觉语言代理的潜力,以提高分割和注释的准确性,增强复杂解剖结构中的特征描绘[44]。迭代低计数PET重建在整个迭代过程中面临着复杂和动态的条件。然而,在PET重建中使用代理驱动框架在很大程度上仍未得到探索。
III. METHOD

如图2所示,所提出的低剂量PET重建框架的架构基于EM等重建算法。迭代算法逐步重建PET图像,使其更接近原始图像。在迭代过程中,这项研究引入了一个基于基础模型的增强模块,以提升图像质量。该模块包含两个提示代理,它们主动提示基础模型增强给定的PET图像。具体来说,这两个提示代理根据当前的重建迭代结果生成提示——点和框。然后将这些提示与图像一起输入到医疗SAM中以检索先前信息。随后,将提取的先验与当前迭代图像的输出融合,用发送到下一次迭代的增强图像增强重建结果。该过程确保迭代重建通过越来越准确和上下文相关的先验信息逐渐增强,从而优化整体图像重建。接下来的部分将介绍提示代理的优化和预先形成的过程。
A. 多代理优化
提示代理的优化可以表述为经典的马尔可夫决策过程。在所提出的框架内,当前迭代图像与提示点集一起形成状态。代理的动作,即基于状态生成提示,受到当前状态和预期结果的影响。此MDP的环境包括基础模型和将当前图像状态转换为下一个图像状态的迭代。奖励由预测图像和目标图像之间的相似性来定义。使用两个专业代理:一个框代理和一个点代理。框代理通过在每个增强会话中生成新的框提示来提供局部指导,而点代理通过向提示点集添加新点来提供全局指导,以进行持续的改进。这种多智能体方法确保了图像增强过程中全局和局部细节的全面增强。本节详细介绍了代理优化的三个关键方面:问题公式化、函数近似和奖励函数。
1) 问题表述:采用经典的MDP框架,本研究描述了每个离散时间步长 i ∈ { 1 , 2 , … , T } i∈\{1,2,…,T\} i∈{1,2,…,T}的每个组成部分——状态、动作和奖励。初始状态从 i = 1 i=1 i=1开始,因为迭代重建方法通常用零或随机值初始化PET估计。从 i = 1 i=1 i=1开始,避免了对随机或全零图像进行基础模型推理,与迭代重建的步数计算相一致,并为以下描述提供了更清晰的框架。时间步骤 i i i的状态,表示为 s i = x i s_i = x_i si=xi, z i ∈ S z_i∈S zi∈S, S = X ∪ P S=X \cup P S=X∪P , X X X表示所有可能的迭代图像,维数为 N × N N×N N×N, Z Z Z表示 N × N N×N N×N图像上的所有可能的点提示集。对于动作,点代理 a i ∈ A p a_i∈A_p ai∈Ap向 z i z_i zi添加了一个新点,提供了更精细、更有针对性的指导。相反,框代理 a i ′ ∈ A b a^{′}_i∈A_b ai′∈Ab会生成一个框提示,提供局部指导。
该状态定义将点提示集 z i z_i zi合并到状态定义中,并将点代理的动作定义为向zi添加新点,从而将问题建模为马尔可夫决策过程。这里,每个动作都完全由当前状态决定,确保系统的行为严格遵守基于状态的决策原则,如公式1所示。
P ( s i + 1 ∣ s i ) = P ( { x i + 1 , z i + 1 } ∣ { x i , z i } ) = ∑ a ∈ A p π p ( a i ∣ s i ) P ( { x i + 1 , z i + 1 } ∣ { x i , z i } , a ) = ∑ a ∈ A p π p ( a i , s i ) P ( s i + 1 ∣ s i , a ) (1) \begin{aligned}\mathcal{P}(s_{i+1}|s_{i})&=\mathcal{P}(\{x_{i+1},z_{i+1}\}|\{x_{i},z_{i}\})\\&=\sum_{a\in\mathcal{A}_{\mathrm{p}}}\pi_{\mathrm{p}}(a_{i}|s_{i})\mathcal{P}(\{x_{i+1},z_{i+1}\}|\{x_{i},z_{i}\},a)\\&=\sum_{a\in\mathcal{A}_{\mathrm{p}}}\pi_{\mathrm{p}}(a_{i},s_{i})\mathcal{P}(s_{i+1}|s_{i},a)\end{aligned} \tag{1} P(si+1∣si)=P({xi+1,zi+1}∣{xi,zi})=a∈Ap∑πp(ai∣si)P({xi+1,zi+1}∣{xi,zi},a)=a∈Ap∑πp(ai,si)P(si+1∣si,a)(1)
其中P是将 s i s_i si转换为 s i + 1 s_{i+1} si+1的转换矩阵。该公式允许在迭代过程中累积点提示,增强点提示在提示基础模型方面的有效性,并将公式保持为马尔可夫决策过程。同时,框代理充当vanilla代理,每次都会生成一个新的框提示。最后,奖励 r i ∈ ℜ r_i∈ℜ ri∈ℜ量化了预测图像 x i + 1 x_{i+1} xi+1与grounth truth的 x G T x_{GT} xGT之间的相似性。
环境的动态由状态转移概率 P s s ′ a = P r { s i + 1 = s ′ ∣ s i = s , a i = a , a i ′ = a ′ } \mathcal{P}^a_{ss′}=Pr\{s_{i+1}=s^{′}|s_i=s,a_i=a,a^{′}_i=a^{′}\} Pss′a=Pr{si+1=s′∣si=s,ai=a,ai′=a′}和预期回报 R s a = E { r i + 1 = s ’ ∣ s t = s , a t = a , a i ′ = a ′ } \mathcal{R}^a_{s}=E\{r_{i+1}=s^{’}|s_t=s,a_t=a,a^{'}_i=a^{′}\} Rsa=E{ri+1=s’∣st=s,at=a,ai′=a′}, ∀ s , s ′ ∈ s , a ∈ A p , a ′ ∈ A b ∀s,s^{′}∈s,a∈A_p,a^{′}∈A_b ∀s,s′∈s,a∈Ap,a′∈Ab定义。在这个马尔可夫决策过程中,环境包括整个操作过程,包括提示基础模型进行预先提取,融合先验以生成增强图像,以及随后生成下一个状态图像 x i + 1 x_{i+1} xi+1的重建迭代,如如图3所示。

框和点代理的决策过程通过不同的策略正式化。点代理遵循策略 π p ( s , a , θ ) = P ~ r ( a i \pi _{\mathrm{p} }( s, a, \theta ) = \tilde{P} r( a_{i} πp(s,a,θ)=P~r(ai = a ∣ s i a| s_{i} a∣si = s , θ ~ ) , ∀ s s, \tilde{\theta } ) , \forall s s,θ~),∀s ∈ \in ∈ S , a \mathcal{S} , a S,a ∈ \in ∈ A p \mathcal{A} _{\mathrm{p} } Ap,其中 θ \theta θ ∈ \in ∈ ℜ l \Re ^{l} ℜl,对于 l l l << $| \mathcal{S} | 。同样,框代理遵循策略 。同样,框代理遵循策略 。同样,框代理遵循策略\pi_{\mathrm{b}}(s,a{\prime},\theta)=Pr(a_{i}{\prime}=a^{\prime}|s_{i}=$ s , θ ) , ∀ s ∈ S , a ′ ∈ A b s, \theta ) , \forall s\in \mathcal{S} , a^{\prime }\in \mathcal{A} _{\mathrm{b} } s,θ),∀s∈S,a′∈Ab,其中 θ ∈ ℜ l \theta\in\Re^l θ∈ℜl,对于 l < < ∣ S ∣ l<<|\mathcal{S}| l<<∣S∣。这些策略只考虑决策的当前状态,而忽略了其他代理的行为,从而简化了以独立学习范式为特征的完全分散的多代理环境中的训练过程。每个代理都使用单个代理强化学习算法进行优化。这种方法的潜在风险在于,由于两个智能体与同一环境交互并对其进行改变,可能会导致非稳态环境的出现。迭代backbone,如EM,通过稳定每个状态内的图像并确保解决方案的收敛来降低这种风险。
总之,图3中显示了一个简化的状态转换示例。在每次迭代 i i i中,给定迭代重建算法的状态 s i s_i si,两个代理分别根据策略 π p ( a ∣ s ) = \pi_\mathrm{p}(a|s)= πp(a∣s)= P ( A i = a ∣ S i = s ) P(A_{i}=a|S_{i}=s) P(Ai=a∣Si=s)和 π b ( a ′ ∣ s ) = P ( A i ′ = a ′ ∣ S i = s ) \pi_{\mathrm{b}}(a^{\prime}|s)=P(A_{i}^{\prime}=a^{\prime}|S_{i}=s) πb(a′∣s)=P(Ai′=a′∣Si=s)确定适当的动作。框代理绘制一个长方体,点代理向点集添加一个点。环境接收到该框并添加了点,将新点添加到点集 z i z_{i} zi并将其转换为 z i + 1 z_{i+1} zi+1。点提示集、框提示和 x i x_i xi由基础模型 B \mathcal{B} B处理,基础模型 B \mathcal{B} B输出先验并将其集成以将图像细化为 x i ′ x_i^{\prime} xi′。然后,将 x i ′ x_i^{\prime} xi′传递给迭代重建算法以生成 x i + 1 x_{i+1} xi+1。从代理的角度来看,基于基础模型的增强子以及迭代重建算法用作MDP环境,将状态从 s i s_{i} si转换为 s i + 1 s_{i+1} si+1, s i + 1 s_{i+1} si+1的奖励由 x i + 1 x_{i+1} xi+1和 x G T x_{GT} xGT之间的相似性定义。
2) 代理策略的优化目标:由于无法为每个状态动作对存储精确值,本研究采用函数近似来优化代理的策略。考虑到迭代重建算法将初始状态空间约束到 R N × N \mathbb{R}^{N×N} RN×N内的一个更小的子集,由分布 P ( s 1 ) P(s_1) P(s1)表示,可以有效地采用加权起始状态公式。这种方法通过在这个定义的初始状态子集上采用加权平均值来近似优化,从而简化了计算并有效地保持了代理的优化目标。
具体来说,初始状态 s 1 = { x 1 , ∅ } s_1=\{x_1,\emptyset\} s1={x1,∅}(没有先前的点提示)可以被视为 R N × N \mathbb{R}^{N\times N} RN×N内的一个子空间,它由迭代重建对数作为 P ( s 1 ) P(s_{1}) P(s1)的分布来控制。然后,可以采用起始状态公式来解决给定分布 P ( s 1 ) P(s_{1}) P(s1)的初始状态不固定的问题。优化初始状态分布中奖励的加权平均值。定义初始状态的概率分布,并将优化目标修改为公式(2)。该优化目标计算 P ( s 1 ) P(s_{1}) P(s1)内初始状态的预期回报,从而优化整体策略。
ρ ( π ) = E s 1 [ E { ∑ t = 2 I γ t − 1 r t ∣ s 1 , π } ] = ∑ s 1 p ( s 1 ) ρ ( π ∣ s 1 ) (2) \rho(\pi)=\mathbb{E}_{s_{1}}\left[\mathbb{E}\left\{\sum_{t=2}^{I}\gamma^{t-1}r_{t}|s_{1},\pi\right\}\right]=\sum_{s_{1}}p(s_{1})\rho(\pi|s_{1}) \tag{2} ρ(π)=Es1[E{t=2∑Iγt−1rt∣s1,π}]=s1∑p(s1)ρ(π∣s1)(2)
该代理旨在提示SAM模型生成先验,以促进提高图像质量。因此,奖励函数被设置为1-L1,测量 x i + 1 x_{i+1} xi+1和 x G T x_{GT} xGT之间的相似性。Richard的工作证明,策略 ρ ( π ) ρ(π) ρ(π)可以由神经网络近似器显式表示,与值函数无关,并根据预期奖励相对于网络参数的梯度进行更新[45]。因此,这项工作利用神经网络来接近策略。
B. 基础模型的先验与优化
在生成提示时,第 i i i个迭代图像 x i x_i xi(i>0,如第III节A问题公式中所定义)与提示一起被输入到基础模型中,以生成先前的 x p i x_{p_{i}} xpi。然后,将 x p i x_{p_{i}} xpi和 x i x_{i} xi之前的基础模型与简单的融合网络 F f u s i o n ( ⋅ , ⋅ ) F_{fusion}(\cdot,\cdot) Ffusion(⋅,⋅)进行融合,得到基础模型增强图像 x i ′ = F f u s i o n ( x i , x p i ) x_i^{\prime }= F_{fusion}( x_i, x_{p_i}) xi′=Ffusion(xi,xpi)。在这项研究中,医用SAM的编码器部分是固定的。相反,对于解码器部分,引入了一个并行解码器,将经过分割训练的SAM重新定向为生成基础模型先验。此外,为了提高这种新型解码器配置的训练效率,实现了一种基于深度迭代的损失函数。本节将介绍并行解码器,然后是优化目标,以提高其性能。
1) 并行解码器:引入并行解码器,使预训练的分割任务解码器适应前一代任务。该模块包括两个主要组件:冻结解码器和可训练解码器。冻结解码器利用医学SAM的能力提供稳定、基于参考的将编码的潜在表示转换为分割指导。这个冻结的组件确保系统受益于成熟的模式。与固定编码器相邻,可训练解码器并行运行,旨在在训练过程中动态调整其参数,以满足特定的图像增强任务。具体而言,冻结解码器的每一层的输出与可训练解码器的相应层的输出级联。这种结构允许在每一层融合来自两个解码器的输出,形成全面和分层的先验。这种方法保留了SAM的强大语义和结构指导,同时允许可训练层有效地适应PET重建任务。
2) 优化目标:在所提出的网络中,并行解码器的训练被包含在每个提示过程中,这不能很好地由比较最终预测和ground truth值的最终损失来指导。为了解决这个问题,引入了一个优化目标,在每次迭代中直接指导并行解码器。优化目标分为两部分;第一个是增强图像 x i ′ x^{′}_i xi′和ground truth x G T x_{GT} xGT之间的绝对差,如公式3所示。第二个是本次迭代的损失与下一次迭代之间的残差,如公式4所示。
L d i r ( x i ′ ) = L 1 ( x i ′ , x G T ) L e h c ( x i ′ ) = L d i r ( x i ′ ) + λ max ( 0 , L d i r ( x i ′ ) − L d i r ( x i − 1 ′ ) ) \begin{align} L_{dir}(x_{i}^{\prime})&=L_{1}(x_{i}^{\prime},x_{GT}) \tag{3} \\\\ L_{ehc}(x_{i}^{\prime})&=L_{dir}(x_{i}^{\prime})+\lambda\max(0,L_{dir}(x_{i}^{\prime})-L_{dir}(x_{i-1}^{\prime})) \tag{4} \end{align} Ldir(xi′)Lehc(xi′)=L1(xi′,xGT)=Ldir(xi′)+λmax(0,Ldir(xi′)−Ldir(xi−1′))(3)(4)
术语 max ( 0 , L d i r ( x i ′ ) − L d i r ( x i − 1 ′ ) ) \max(0,L_{dir}(x_i^{\prime})-L_{dir}(x_{i-1}^{\prime})) max(0,Ldir(xi′)−Ldir(xi−1′))惩罚 L d i r L_{dir} Ldir从 x i ′ x_i^{\prime} xi′到 x i − 1 ′ x_{i-1}^{\prime} xi−1′的任何增加。如果 L d i r ( x i ′ ) ≤ L d i r ( x i − 1 ′ ) L_dir(x_i^{\prime})\leq L_{dir}(x_{i-1}^{\prime}) Ldir(xi′)≤Ldir(xi−1′),则该项为零,不影响总损失。然而,如果 L d i r ( x i ′ ) > L d i r ( x i − 1 ′ ) L_{dir}(x_i^{\prime})>L_{dir}(x_{i-1}^{\prime}) Ldir(xi′)>Ldir(xi−1′),则该项将增加与增加成比例的惩罚。通过最小化这种增强损失 L e h c L_{ehc} Lehc,这项工作鼓励在迭代过程中减少 L d i r L_{dir} Ldir,从而在有利于重建之前鼓励每次提示。
IV. EXPERIMENTS
A. 数据集
使用三个数据集来评估所提出的方法:公开可用的脑Phantom模拟数据集、临床全身扫描数据集和真实的小动物扫描数据集。脑体模数据集包括PET和MRI模态,便于对基础模型先验和MR先验进行比较分析。临床全身数据集包括PET和CT模态,允许对基础模型先验与CT先验进行评估。最后,真实的小动物扫描数据集用作zero-shot场景,以评估方法对新数据集和未发现数据集的适应性。这些数据集的具体细节将在以下部分中详细介绍。
1) 脑Phantom模拟数据集:在这项研究中,使用了BrainWeb数据库中的20个3D大脑模型[46]。数据分为17个模型用于训练,3个用于验证和测试。每个模型都被处理成1.13×1.13×2.13 mm³的统一体素大小。对原始模型尺寸(362×434×362)进行重新采样和补零,以适应192×192×160的尺寸,生成3200个轴向二维切片。
采用由180个角度×275个径向bin组成的模拟PET扫描仪配置来获取正弦图输入数据[47]。通过使用系统矩阵和衰减图进行正向投影,生成了无噪声的正弦图数据。随后,在200K的总计数水平下引入泊松噪声,以模拟低剂量场景。此外,对均匀随机事件进行了建模,占总无噪声数据的20%。为了保持对初级光子事件的关注,本次模拟中没有包括散射。对于之前的MRI,使用切片厚度为3mm的相应T1加权MRI数据。
2) 临床全身数据集:该数据集包括110名在河南省人民医院接受全身PET/CT成像的患者的数据,这些患者使用UIH uEXPLORER(联合影像医疗,中国上海)。患者以253.23±44.45 mBq的剂量服用18F氟脱氧葡萄糖(FDG),每次扫描持续300秒。最终的数据包括每位患者约600张图像,在整个队列中总共有74030张图像。每个图像维度被标准化为192像素×192像素,体积分辨率为3.125mm×3.125mm。88个案例用于训练模型,22个用于测试。
低剂量图像是通过随机提取总采集数据的5%进行重建而生成的。低剂量和参考全剂量图像都通过全局最小最大缩放进行了归一化。扫描仪的模拟配置为180个角度×365个径向bin[47],每个PET图像都通过模拟扫描仪进行处理,以生成相应的正弦图,利用制造商的软件进行归一化、散射和随机性调整。使用配准后PET/CT扫描的CT信息进行衰减校正。此外,相应的标准诊断级别CT用作CT先验。
3) 真实的小动物数据:这项研究利用了32.2克体内实验小鼠的FDG扫描数据。受试者通过尾静脉注射13.5 MBq的18F-FDG,并在注射后60分钟进行PET扫描,清醒摄取期也持续60分钟。使用350-750keV的能量窗口和6.0ns的时间窗口记录了大约3.8×108个计数。中国科学院深圳先进技术研究所伦理委员会批准了这项研究。
扫描设备是我们实验室开发的原型系统[48]。列表模式数据被排列为斜正弦图,具有单层重仓,最大环差为97。使用我们实验室开发的小动物CT系统进行衰减校正。此外,使用原型软件执行了归一化、随机性和散射校正。通过傅里叶重折叠算法将倾斜正弦图进一步重折叠为195层二维正弦图(192角×216径向)[49]。将扫描数据的前10分钟提取为低剂量样本以验证所提出方法的有效性,同时采用EMPSF-Filter算法[50]对完整的60分钟数据进行重建,作为参考基准。
在这项研究中,上述临床全身患者数据集用于训练模型,并对该动物数据进行零短推理,以测试所提出方法的鲁棒性。对人类数据集中的原始图像进行重新采样,生成一系列216×216像素的图像,模仿原型小动物PET扫描仪的物理几何形状。用于生成训练数据正弦图的模拟扫描仪配置设置为192个角(180度)乘216个径向,与原型系统的规格相匹配。
B. 实施细节
预训练的医学SAM模型[59],[60]用作医学基础模型。可训练解码器保持与原始冻结解码器相同的大小,深度为2。所提出的方法是使用Adam优化器实现的。网络参数使用1×10−4的学习率进行优化,beta配置为(0.9,0.98),epsilon设置为1×10-6,权重衰减为0.001。在40个迭代周期和24个批量后应用学习率衰减策略。
C. 与最先进的方法相比
针对几种已建立的重建技术,包括迭代方法,如OSEM[51]和MLEM[53],对提出的方法进行了评估;基于核的方法,如KEM[61]和RKEM[56];以及基于神经网络的方法,如FBPNet[58]、CNNBPNet[57]、TrUNET-MAPEM[54]和ADMMNet[55]。对于KEM方法,我们先用MRI评估KEM,先用CT评估KEM和不使用任何其他模态评估KEM。在前两种情况下(标记为KEM w/AMP),如KEM文献[52]、[62]、[63]所述,使用高斯核生成过程从相应的模态图像(MRI或CT)生成核矩阵。相比之下,没有额外模态先验的KEM(标记为KEM w/o AMP)利用预重建图像作为其先验,使用高斯核函数从MLEM的第30次迭代中生成核矩阵,这是PET重建中的常见做法[56],[63]。对于采用U-net[64]作为底层架构的FBPNet和CNNBPNet,先验直接集成到U-net骨干网中。此外,nnU-Net[65]与EM算法相结合,在不引入先验的情况下评估基于U-Net的方法的有效性。分析了所提出方法的两种实现,分别称为proposed w/EM和proposed w/KEM,它们分别使用EM和KEM算法作为迭代重建骨干。这两种实现都运行了30次迭代,每10次迭代应用一次基础模型增强。这种累积方法旨在提高框架的计算效率。为了评估这些方法的性能,采用了四个常用的指标,包括峰值信噪比(PSNR)、结构相似性指标(SSIM)[66]、均方根误差(RMSE)和通用图像质量指标(UQI)[67]。
1) BrainWeb和临床全身数据集:图4显示了在BrainWeb和全身数据集上使用各种方法重建的三个轴向图像切片。综合先验(如适用)显示在第一列中。

如图4所示,整合先验的方法始终优于那些不利用CT/MRI获取先验信息的方法,证明了将这些先验纳入重建过程的有效性。值得注意的是,利用CT/MRI先验的方法在描绘身体和器官结构方面表现出显著的增强,这一特征在没有先验的方法中不太明显。独特的是,所提出的方法在结构细节上实现了类似的增强,而不依赖于特定案例的先验。相反,它利用了从基础模型中主动检索到的先验,有效地提高了图像质量。然而,如第三行的CNNBPNet结果所示,MRI先验明显影响了重建。相比之下,所提出的方法通过利用提示代理从基础模型中主动提示适当的先验,避免了引入不正确的结构。值得注意的是,如图4的第一行所示,通过所提出的方法重建的图像偶尔会表现出过度平滑。这种过度平滑主要是降噪的副作用。纳入先前信息是一种正规化形式;虽然这可以有效地降低噪声并增强收敛性,但也可能导致重建图像中细节的平滑度提高。
此外,EM+nnUnet在临床数据集上表现出色。增强的结构细节可能是由于nnUnet捕获和记忆数据集分布的能力。与110个病例的更大临床数据集相比,BrainWeb数据集的性能相对较差,仅包含20个病例,这一说法得到了支持。这些发现在真实小动物实验部分得到了进一步证实,其中与其他方法相比,EM+nnUnet在零样本领域适应场景中表现出的有效性能最低。所提出的方法优于比较方法,提供了更清晰的结构恢复和更有效的降噪。

如表I所示,定量评估证实了这两个数据集的这些优势。重要的是,所提出的方法不依赖于传统的面对面事先支持,在所有指标上都取得了最佳性能,证明了它们的优越性。此外,比较了所提出方法的两种具有不同迭代骨干的实现,EM和KEM,两者都始终优于其他方法。这证明了所提出的方法在不同迭代重建技术中的有效性和适应性。
2) 真实的小动物结果:图5显示了使用我们实验室的原型PET扫描仪获取的活小鼠数据的重建图像。这些图像是使用最初在临床人体数据上训练的网络重建的,随后在零射击推理场景中对小鼠数据进行测试,以评估所提出方法的鲁棒性。在所有方法中观察到的PSNR值的降低可归因于Zero-shot适应场景,其中小鼠数据在模型训练期间完全看不见。值得注意的是,EM+nnUNET方法在零样本设置中表现出显著的局限性,表明对人类数据集的潜在过度拟合,并表现出有限的泛化能力。尽管存在这些挑战,所有方法都有效地抑制了噪声,但在不同程度上损害了细节保留。相比之下,所提出的方法恢复了更精细的细节和结构,同时保持了细节保留和噪声抑制之间的最佳平衡。它实现了最高的PSNR值,表明性能优越。零射击测试场景中的这种增强性能可能受益于基础模型的鲁棒性,其中基础模型学习的大量数据特征为管理Zero-shot·任务提供了关键支持。

D. 消融研究
1) 每个模块的有效性:本节评估了拟议框架内每个组成部分的有效性,详见表II。最初,将基础模型直接整合到基线方法中并没有产生积极影响,主要是因为低剂量PET数据的医学SAM不稳定,这可能会导致重建过程中的误导性指导。然而,随着代理模块的加入,所有指标都显示出显著的改善,突显了代理在提高模型性能方面的作用。代理模型旨在促使基础模型生成先验,这些先验对PET图像重建过程有显著帮助,从而有利于整体性能指标。此外,添加并行解码器导致度量进一步增加。这种自适应不仅使SAM模型的输出与重建需求更紧密地对齐,而且利用其深度学习能力来提高生成图像的质量。

2) 框和点代理配置:进行了一项消融研究,以评估框提示代理和点提示代理的有效性。表III显示了一项消融研究,评估了各种配置的框代理和点代理的性能,包括与历史点累积策略的组合。基线模型KEM与先前的替代模态(KEM w/AMP)可作为比较的参考。值得注意的是,尽管没有一种基于代理的配置利用额外的模态作为先验,但它们都优于KEM,KEM受益于面对面配对CT先验。这突显了所提出的方法在使用代理从基础模型中检索先验信息方面的有效性。

结果表明,独立的框代理和没有历史点累积的点代理(没有PA的点代理)实现了类似的性能,与框代理更局部的焦点相比,点代理由于其更广泛的全局焦点而具有轻微的边缘。这种区别强调了这些代理在不同尺度上引导模型注意力方面所起的互补作用。
将累积策略应用于点代理(带PA的点代理)会在所有指标上产生实质性的改进。这种增强可以归因于累积的点,这有助于基础模型逐渐细化其重点。由于该模型在预训练时使用了多个数据点,历史数据点的积累能够充分利用这一训练优势,从而提供更精准的指导。
累积点代理和框代理的组合使用(点代理w/PA+box代理)在所有指标中得分最高,突显了这两种代理的协同效应。这种组合展示了这些代理如何协同工作以最大化模型输出,而累积策略进一步提高了性能。
3) 多激励代理策略:本节分析了多激励代理模型的策略。图6描述了提示代理策略的三个代表性案例,案例1-3说明了学习点提示策略,案例3包括框提示场景。点提示代理旨在跨迭代指导整体语义指导。案例1展示了一个高效的初始点提示,该提示将基础模型的焦点广泛地引导到目标区域,固定解码器生成的蓝色掩模证明了这一点。后续要点逐步完善了这一重点。案例2强调了一种情况,即初始提示无法充分捕捉目标区域,需要对第二个提示进行重大调整,从而成功地重新引导模型的注意力。附近的第三个提示进一步细化了焦点。

案例3说明了一个场景,其中连续的提示无法有效地捕捉到广泛的目标区域,促使点位置发生多次剧烈变化以建立成功的提示集。这种情况也强调了方框提示的关键作用,特别是在初始点提示错误时。方框提示巧妙地聚焦于局部区域,通过条带增强了目标定位,大大提高了覆盖概率。这些案例举例说明了使用历史点提示逐步完善提示的好处。
图7中的比较分析显示了框提示与点提示的不同焦点,框提示集中在局部区域,点提示集中在更广泛的语义上下文中。这种差异符合设计意图,框提示提供本地化功能,点提示提供持续、精细的上下文。通过点提示观察到的渐进式细化强调了在整个迭代过程中使用历史点来增强详细特征表示的有效性。图7中还包括点和框组合提示的情况。与仅框提示相比,混合提示将其注意力扩展到更广泛的全局区域。同时,与仅点提示相比,它绘制了一个更详细和更明确的边界,而不是由仅点提示创建的广义语义区域。这种改进也反映在PSNR矩阵中,其中混合提示达到了最佳效果。

4) 并行解码器的有效性:为了评估并行解码器的效率,我们使用L1损失度量分析了冻结和可训练解码器生成的先验与ground truth之间的差异。如图8所示,在整个训练过程中,来自冻结解码器的先验相似性保持相对恒定,从初始提示到第三个提示,相异性仅略有下降。这种变化是由精炼的提示引起的,冻结解码器的面向分段的特性限制了它对重大变化的适应性。相反,可训练解码器在整个训练过程中表现出先验和ground truth之间的差异性显著降低。此外,从第一个提示到最后一个提示,减少是一致的,突显了并行解码器有效地将分段训练的SAM模型适应重建任务的能力。

5) 拟议框架的稳健(鲁棒)性:为了检查拟议框架与各种迭代重建方法的兼容性,表IV提供了一项消融研究,评估了与各种迭代框架(包括OSEM、EM和KEM)集成的拟议方法的性能。这些结果验证了所提出的方法在不同重建方法中的有效性。

这些指标表明,在所有框架中,所提出的方法始终优于具有额外先验的基线KEM(KEM w/AMP)。这项研究强调了所提出的方法在增强各种迭代框架中的图像重建方面的灵活性和强度,利用基础模型生成动态先验并提高重建质量。
为了进一步分析增强频率的稳健(鲁棒)性,表V展示了一项消融研究,研究了不同增强水平对基础模型推理时间的影响。实验采用不同的增强频率进行:无增强、每三次迭代、每二次迭代和每次迭代进行一次增强。本研究旨在探讨增强频率与重建质量之间的关系。

结果表明,提高增强频率通常会提高性能指标,最高的增强频率会产生最佳分数。值得注意的是,即使在较低的增强频率下,性能也接近最高水平,这表明降低增强频率不会显著影响重建质量。这些发现表明,所提出的方法可以在性能和推理时间之间取得平衡,因为适度的增强频率仍然比没有增强产生实质性的改进。这种适应性允许有效地使用计算资源,而不会大大降低重建精度,使其成为具有不同处理能力和时间限制的场景的灵活方法。
V. DISCUSSION
低计数PET成像需要以最小的辐射暴露实现高图像质量的方法。传统的增强技术通常依赖于面对面的CT或MRI先验,增加了工作流程的复杂性并增加了辐射剂量,这与ALARA原理相冲突。为了解决这些局限性,本研究引入了一种框架,该框架利用基础模型来促进PET重建,而不直接依赖于CT或MRI。使用基于代理的提示系统——使用框代理来获取局部细节,使用点代理来捕获更广泛的结构——该框架从基础模型中动态提取先验。通过最大限度地减少对面对面CT/MRI先验的需求,这种方法简化了成像工作流程,并具有更安全、更易获得的低计数PET成像的临床潜力。
A. 基于ROI的快速收敛性分析
为了演示更扩展的收敛过程并分析提示与感兴趣区域(ROI)之间的关系,图9显示了三个过程的收敛。随着迭代的进行,重建图像越来越符合ground truth情况,证明了向目标图像的有效收敛。在后续的迭代中,这一点尤为明显,输出中的结构细节与ground truth中的细节非常相似。

在图9所示的整个迭代过程中,框提示始终围绕ROI定位,形状和位置只有微小的调整。这种稳定性表明,框提示有效地关注了ROI,同时也捕获了相关细节。然而,正如在其他情况下观察到的那样,如图6和图7所示,框提示偶尔会转移到ROI之外的其他重要区域。这种自适应行为突出了基础模型识别整个图像中各种结构的能力,使其能够提高整体重建质量,而不仅仅关注ROI。这种能力是基础模型相对于特定任务网络的明显优势,支持更全面的图像改进方法。
点提示呈现出动态模式,在迭代过程中,多个点在ROI附近收敛。尽管这些点最初会四处移动,但它们最终会合并成一个点,主要靠近投资回报率。这种行为是合理的,因为点的收敛反映了整个图像的稳定性。随着图像的收敛,两个代理(框和点提示)的输出变得更加集中和一致,有助于高保真重建。
B. 临床ROI和3D一致性评估
为了从临床角度进一步分析所提出的方法,使用包括肺癌患者的临床数据集对肺部的ROI进行了分析。图10显示了一例肺鳞状细胞癌(LUSC)的ROI分析结果,其特征是肺上部有明显的肿瘤肿块。首先,使用小提琴图(violin plot)分析整个肿瘤的三维面积值分布,如图10顶部所示。小提琴图显示,所提出的方法实现了与ground truth值紧密对齐的标准化摄取值(SUV)分布,表明有效的降噪效果。相比之下,EM、OSEM、KEM和RKEM方法显示出更宽的分布,表明存在更大的可变性和噪声。总体而言,与其他方法相比,所提出的方法提供了更一致和准确的肿瘤区域SUV值表示。从临床角度来看,本方法的SUV(标准摄取值)分布与真实值更为接近,表明其能够为肿瘤活性提供更可靠的量化评估,这对于精准诊断和治疗方案的制定至关重要。

除了SUV分布分析之外,从多个解剖角度评估重建图像进一步说明了所提出方法的有效性。图10底部的重建结果突出了所有方法在保持与ground truth一致性方面的整体有效性。重要的是,ROI的冠状面、矢状面和横断面视图在所有三个视角上都表现出了强大的一致性。传统方法,例如EM确保解决方案的收敛性,而所提出的方法利用迭代重建框架作为保持数据完整性的关键组件。尽管先验来自单个视图,但它们与迭代重建输出融合在一起,并在框架内迭代改进。这个过程保证了不同视图之间的一致性,使结果与传统方法的可靠性相一致。总体而言,所提出的方法与ground truth情况最为一致,证明了所提出方法相对于比较算法的噪声压缩效率。
为了进一步证明不同视图之间的一致性,图11显示了全身冠状视图的重建结果。值得注意的是,该模型是在2D横向视图上训练的,而图像显示了从采样列表模式数据中导出的低计数正弦图生成的重建的冠状视图。图像显示,所提出的方法实现了与ground truth的最接近对准,表现出最小的噪声和最大的细节。相比之下,基于神经网络的ADMMNet和CNNBPNET方法在冠状面视图中表现出不同程度的性能下降和结果不一致性,这主要归因于其对二维横断面数据的依赖性,以及模型无法学习其他视图(如冠状面)间的一致性特征。然而,基于EM的方法,包括EM-Unet和提出的方法,在冠状视图中显示出更好的一致性,这归功于EM框架的严格数学基础,它确保了不同视图之间的数据完整性和保真度。这一观察结果与图10中对冠状、矢状和横断面的分析一致,其中迭代方法,包括所提出的方法,尽管仅在二维横断面数据上进行训练,但在不同的视图之间表现出良好的一致性。

C. 潜在限制
必须承认我们研究中的某些局限性。与集成提示代理和管理历史提示相关的计算需求可能会给临床工作流程中的实时应用带来挑战。满足这些需求对于优化性能和确保我们的框架能够无缝地融入常规成像实践至关重要。未来的工作将集中在完善模型架构和提高计算效率上。
VI. CONCLUSION
在这项研究中,我们开发了一种新的基于代理的方法,该方法利用基础模型先验来增强低计数PET重建。所提出的方法减少了对CT和MRI等直接多模态成像的依赖,从而最大限度地减少了辐射暴露并简化了成像工作流程。具体来说,这项工作引入了一个分散的多智能体系统,该系统与基础模型动态交互以检索和优化先验,确保对重建过程的不当影响最小。我们对模拟、临床数据和真实动物研究的全面评估强调了我们的方法优于现有方法,证明了PET图像质量的定量和定性增强。
更多推荐

所有评论(0)