Clinical decision-making spans a complex pipeline from diagnosis and prognosis to treatment planning and delivery, in which heterogeneous data, such as radiology imaging, histopathology, molecular measurements, and electronic health records, must be integrated for patient-care specific decisions. The current clinical routine relies on manual data assessment by radiologists, pathologists, and multidisciplinary teams and suffers from substantial inter- and intra-observer variability, time-constrained decision-making, and fragmented multidisciplinary coordination. Current advances in Deep Learning (DL), driven by progress in neural architectures and large-scale training, have demonstrated strong performance across disease diagnosis and phenotyping, segmentation, cross-modal fusion, and dose computation and prediction. However, translating these gains into consistent, system-level improvements along the clinical pipeline remains challenging. Many DL models depend on large labeled datasets due to their over-parameterized supervised training. In addition, they generalize poorly under disease heterogeneity due to distribution shifts across patient populations and acquisition protocols. Their performance degrades with incomplete or unpaired multimodal inputs because standard fusion architectures assume aligned modalities, and they incur high computational cost from gradient-based optimization over the non-convex, non-linear loss landscapes that characterize imaging and treatment planning. These open problems, recurring across real-world clinical scenarios, continue to hinder deployment and reduce the reliability and timeliness of DL-supported care. In this context, this dissertation expands DL techniques for medical imaging for clinical routine and research practice along three complementary axes: (1) addressing data scarcity and fine-grained or hidden phenotypic variation through generative repurposing and representation-learning strategies, (2) modeling multimodal interactions under unpaired or partially missing data for phenotyping and prognosis, and (3) accelerating radiotherapy workflows through large-deformation-robust image registration, context-aware tumor contouring and learning-to-optimize treatment planning. More specifically, it repurposes the discriminator of an unconditional ProGAN for diabetic retinopathy grading under data scarcity, with a human-aligned perceptual metric, and introduces Principal Component Analysis (PCA)/Convolutional Auto-Encoder (CAE)-informed models that surface hidden strata in Synchrotron Radiation Microscopy Computed Tomography (SR-microCT) bone disease diagnosis and grading. For multimodal integration, it presents a disease-aware feature-variation distillation framework that transfers knowledge from histopathology to SR-microCT without paired data, and a pathology-radiology fusion architecture with dynamic contextual embedding and gradient-curvature steering that remains robust to missing modalities for cancer survival prediction. For radiotherapy, it introduces a multiscale attention network for breast tumor contouring in Dynamic Contrast-Enhanced-Magnetic Resonance Imaging (DCE-MRI), a physiologically inspired spatial regularization for joint rigid–deformable abdominal MRI registration, and a diffusion-driven learning-to-optimize framework for Volumetric Modulated Arc Therapy (VMAT) planning, coupling one-shot fluence map generation with Long Short-Term Memory (LSTM)-based latent optimization. Together, these methodologies would help move DL models one step closer to clinical translation, with increased efficacy and objectivity in patient outcome diagnosis, prognostication, and therapy, as well as transformative clinical applications such as the discovery of novel biomarkers and the reduction in time-to-treatment.
Il processo decisionale clinico si articola in una pipeline complessa che va dalla diagnosi e prognosi, fino alla pianificazione e somministrazione della terapia, e richiede l'integrazione di dati eterogenei, come immagini radiologiche, preparati istopatologici, misurazioni molecolari e cartelle cliniche elettroniche, per giungere a decisioni personalizzate per la cura del paziente. Il paradigma clinico attuale si fonda sulla analisi manuale dei dati raccolti da parte di radiologi, patologi e gruppi multidisciplinari, ed è perciò soggetto a un'elevata variabilità inter- e intra-osservatore, a decisioni prese sotto pressione temporale e a un coordinamento multidisciplinare spesso frammentato. I recenti progressi del Deep Learning (DL), sostenuti dall'evoluzione delle architetture neurali e dall'addestramento su larga scala, hanno dimostrato prestazioni elevate nella diagnosi e nella fenotipizzazione delle patologie, nel delineamento di tumori e organi, e nella predizione del miglior trattamento medico da somministrare. Tuttavia, tradurre questi progressi in miglioramenti coerenti e a livello di sistema lungo l'intera pipeline clinica rimane una sfida aperta. Il buon funzionamento di molti modelli di DL dipende infatti da grandi quantità di dati etichettati necessari all'addestramento supervisionato. In aggiunta, molti modelli di DL generalizzano in modo limitato quando la patologia si presenta eterogenea a causa della variazione di distribuzione tra popolazioni di pazienti e protocolli di acquisizione. Quando gli input multimodali si presentano incompleti o non appaiati, la prestazione del DL degrada, poiché le strategie di fusione tradizionali assumono modalità allineate. In parallelo, alcune ottimizzazioni basate su soluzioni non convesse e non lineari comportano elevati costi computazionali. Questi problemi aperti, ricorrenti negli scenari clinici reali, continuano a ostacolare l'adozione del DL durante il processo decisionale clinico, riducendo l'affidabilità e la tempestività dell'assistenza medica potenzialmente supportata. In questo contesto, questa tesi si propone di migliorare le tecniche di DL per l'imaging medicale sviluppando nuove strategie lungo tre direttrici complementari: (1) affrontare la scarsità di dati etichettati e le variazioni fenotipiche fini o nascoste tramite strategie di repurposing di modelli generativi e di representation learning; (2) modellare le interazioni multimodali in presenza di dati non appaiati o mancanti, con finalità di fenotipizzazione e prognosi; (3) velocizzare i flussi di lavoro in radioterapia attraverso registrazione delle immagini robuste a grandi deformazioni, metodi multiscala per la segmentazione di tumori e approcci di learning-to-optimize applicati alla pianificazione del trattamento. Per affrontare la scarsità di dati, si riutilizza il discriminatore di una ProGAN non condizionata sfruttando una metrica percettiva allineata al giudizio umano, e si introducono modelli basati su Principal Component Analysis (PCA) e Convolutional Auto-Encoder (CAE) in grado di far emergere strati nascosti nella diagnosi di patologie ossee da immagini di tomografia computerizzata alla microscala acquisite al sincrotrone (SR-microCT). Per l'integrazione multimodale, si propone una strategia di distillazione dipendente dalla patologia, che trasferisce informazioni estratte dall'istopatologia alla SR-microCT riducendo la necessità di dati appaiati, insieme a un'architettura di fusione di immagini di istopatologia-radiologia con embedding contestuale dinamico e meccanismo di gradient-curvature steering, che mantiene buone prestazioni anche in presenza di modalità mancanti durante la prognosi. Per la radioterapia, si presentano una rete ad attenzione multiscala per la delineazione dei tumori mammari in immagini di Risonanza Magnetica (RM) con contrasto, una regolarizzazione spaziale per la registrazione congiunta rigida-deformabile di RM addominali, e una strategia di learning-to-optimize guidato da diffusion model per la pianificazione della radioterapia ad arco a modulazione volumetrica (VMAT), che combina una generazione one-shot della mappa di fluenza con un'ottimizzazione nello spazio latente basata su un modello a Long Short-Term Memory (LSTM). Nel complesso, l'obiettivo ultimo è che l'avanzamento su questi aspetti possa contribuire ad avvicinare ulteriormente il DL alla clinica, con un'accresciuta efficacia e oggettività nella diagnosi, nella prognosi e nella terapia dei pazienti, aprendo al contempo la strada ad applicazioni cliniche trasformative come la scoperta di nuovi biomarcatori e la riduzione dei tempi di avvio del trattamento.
Advancing deep learning across the medical imaging pipeline: from disease phenotyping to treatment optimization
Poles, Isabella
2026
Abstract
Clinical decision-making spans a complex pipeline from diagnosis and prognosis to treatment planning and delivery, in which heterogeneous data, such as radiology imaging, histopathology, molecular measurements, and electronic health records, must be integrated for patient-care specific decisions. The current clinical routine relies on manual data assessment by radiologists, pathologists, and multidisciplinary teams and suffers from substantial inter- and intra-observer variability, time-constrained decision-making, and fragmented multidisciplinary coordination. Current advances in Deep Learning (DL), driven by progress in neural architectures and large-scale training, have demonstrated strong performance across disease diagnosis and phenotyping, segmentation, cross-modal fusion, and dose computation and prediction. However, translating these gains into consistent, system-level improvements along the clinical pipeline remains challenging. Many DL models depend on large labeled datasets due to their over-parameterized supervised training. In addition, they generalize poorly under disease heterogeneity due to distribution shifts across patient populations and acquisition protocols. Their performance degrades with incomplete or unpaired multimodal inputs because standard fusion architectures assume aligned modalities, and they incur high computational cost from gradient-based optimization over the non-convex, non-linear loss landscapes that characterize imaging and treatment planning. These open problems, recurring across real-world clinical scenarios, continue to hinder deployment and reduce the reliability and timeliness of DL-supported care. In this context, this dissertation expands DL techniques for medical imaging for clinical routine and research practice along three complementary axes: (1) addressing data scarcity and fine-grained or hidden phenotypic variation through generative repurposing and representation-learning strategies, (2) modeling multimodal interactions under unpaired or partially missing data for phenotyping and prognosis, and (3) accelerating radiotherapy workflows through large-deformation-robust image registration, context-aware tumor contouring and learning-to-optimize treatment planning. More specifically, it repurposes the discriminator of an unconditional ProGAN for diabetic retinopathy grading under data scarcity, with a human-aligned perceptual metric, and introduces Principal Component Analysis (PCA)/Convolutional Auto-Encoder (CAE)-informed models that surface hidden strata in Synchrotron Radiation Microscopy Computed Tomography (SR-microCT) bone disease diagnosis and grading. For multimodal integration, it presents a disease-aware feature-variation distillation framework that transfers knowledge from histopathology to SR-microCT without paired data, and a pathology-radiology fusion architecture with dynamic contextual embedding and gradient-curvature steering that remains robust to missing modalities for cancer survival prediction. For radiotherapy, it introduces a multiscale attention network for breast tumor contouring in Dynamic Contrast-Enhanced-Magnetic Resonance Imaging (DCE-MRI), a physiologically inspired spatial regularization for joint rigid–deformable abdominal MRI registration, and a diffusion-driven learning-to-optimize framework for Volumetric Modulated Arc Therapy (VMAT) planning, coupling one-shot fluence map generation with Long Short-Term Memory (LSTM)-based latent optimization. Together, these methodologies would help move DL models one step closer to clinical translation, with increased efficacy and objectivity in patient outcome diagnosis, prognostication, and therapy, as well as transformative clinical applications such as the discovery of novel biomarkers and the reduction in time-to-treatment.| File | Dimensione | Formato | |
|---|---|---|---|
|
Poles_PhD_Thesis_2026.pdf
accesso aperto
Licenza:
Tutti i diritti riservati
Dimensione
22.16 MB
Formato
Adobe PDF
|
22.16 MB | Adobe PDF | Visualizza/Apri |
I documenti in UNITESI sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.
https://hdl.handle.net/20.500.14242/376969
URN:NBN:IT:POLIMI-376969