This PhD thesis presents a comprehensive investigation into the design of explainable methods for predicting efficiency related to off-target and on-target events on guide RNA (gRNA) sequences in CRISPR/Cas9 base editing. The research was conducted within the project ”Development of an innovative platform for the design of highly effec- tive and specific CRISPR screens”, led by Tommaso Selmi (CNR Institute for Biomed- ical Technologies), which is part of the PNRR CN3-Spoke7-WP1 National Center for Gene Therapy and Drugs based on RNA Technology. Background and Motivation CRISPR/Cas9 has revolutionized genome editing by en- abling precise DNA modifications through customizable guide RNA (gRNA) sequences that direct the Cas9–gRNA complex toward complementary genomic loci. Upon recog- nition of the target sequence, the complex binds to the DNA, allowing site-specific editing. While gene knockout (CRISPR-KO) involves DNA breaks that can cause un- predictable insertions or deletions, base editing (CRISPR-BE) offers more controlled point mutations without DNA breaks. However, off-target effects—where gRNA binds to unintended DNA locations due to sequence similarity—remain a critical challenge that can cause cell malfunction or death. Current predictive models suffer from two major limitations: low accuracy in efficiency prediction and domain specificity that pre- vents knowledge transfer between knockout and base editing domains. Research Questions and Methodology The thesis addresses two primary research questions: (RQ1) whether it is possible to improve prediction accuracy while preserv- ing explainability, and (RQ2) to what extent knowledge acquired for knockout predic- tion can be transferred to base editing domains. The methodological approach in- volves designing an ensemble framework that integrates four established CRISPR prediction models—CRISPRedict (linear GLM model), CRISPRAidit (MLP with 473 features), CRISPRon (CNN-based architecture), and DeepHF (BiLSTM with biological features)—using XGBoost as a meta-learner. SHAP (SHapley Additive exPlanations) was employed as the primary explainability tool due to its linear representation that facilitates aggregation within the ensemble hierarchy. Major Contributions The thesis comprises three interconnected studies. The first study aimed at developing a systematic scoping review following PRISMA-ScR guide- lines that analyzed 72 CRISPR/Cas9 predictive models published between 2014 and 2023 from an initial pool of 357 records. The review revealed that deep learning models (43.1%) dominate the field, followed by machine learning (17.0%) and ensemble ap- 1 proaches. Notably, only 7 papers addressed interpretability and 2 addressed explain- ability explicitly, highlighting a significant gap in transparent predictive modeling. The four models selected for in-depth analysis—CRISPRedict, CRISPRAidit, CRISPRon, and DeepHF—represented diverse computational paradigms while offering different levels of explainability.

Questa tesi di dottorato presenta un’indagine completa sulla progettazione di metodi spiegabili per la previsione dell’efficienza relativa agli eventi off-target e on-target nelle sequenze di guide RNA (gRNA) nel contesto del base editing CRISPR/Cas9. La ricerca è stata condotta nell’ambito del progetto “Development of an innovative platform for the design of highly effective and specific CRISPR screens”, guidato da Tommaso Selmi (CNR Institute for Biomedical Technologies), parte del PNRR CN3-Spoke7-WP1 National Center for Gene Therapy and Drugs based on RNA Technology. Contesto e Motivazione CRISPR/Cas9 ha rivoluzionato l’editing genomico consentendo modifiche precise del DNA tramite sequenze di guide RNA (gRNA) personalizzabili che indirizzano il complesso Cas9–gRNA verso loci genomici complementari. Dopo il riconoscimento della sequenza bersaglio, il complesso si lega al DNA permettendo un editing sito-specifico. Mentre il gene knockout (CRISPR-KO) comporta rotture del DNA che possono causare inserzioni o delezioni imprevedibili, il base editing (CRISPR-BE) consente mutazioni puntiformi più controllate senza rotture del DNA. Tuttavia, gli effetti off-target — nei quali la gRNA si lega a posizioni genomiche non intenzionali a causa della similarità di sequenza — rimangono una sfida critica che può causare malfunzionamenti cellulari o morte cellulare. I modelli predittivi attuali soffrono di due limitazioni principali: bassa accuratezza nella previsione dell’efficienza e specificità di dominio che impedisce il trasferimento della conoscenza tra knockout e base editing. Domande di Ricerca e Metodologia La tesi affronta due principali domande di ricerca: (RQ1) se sia possibile migliorare l’accuratezza predittiva preservando la spiegabilità e (RQ2) in che misura la conoscenza acquisita per la previsione knockout possa essere trasferita al dominio del base editing. L’approccio metodologico consiste nella progettazione di un framework ensemble che integra quattro modelli consolidati di previsione CRISPR — CRISPRedict (modello lineare GLM), CRISPRAidit (MLP con 473 caratteristiche), CRISPRon (architettura basata su CNN) e DeepHF (BiLSTM con caratteristiche biologiche) — utilizzando XGBoost come meta-learner. SHAP (SHapley Additive exPlanations) è stato impiegato come principale strumento di spiegabilità grazie alla sua rappresentazione lineare che facilita l’aggregazione nella gerarchia dell’ensemble. Contributi Principali La tesi comprende tre studi interconnessi. Il primo studio mirava a sviluppare una scoping review sistematica seguendo le linee guida PRISMA-ScR, analizzando 72 modelli predittivi CRISPR/Cas9 pubblicati tra il 2014 e il 2023 a partire da un insieme iniziale di 357 articoli. La revisione ha evidenziato che i modelli di deep learning (43,1%) dominano il campo, seguiti dal machine learning (17,0%) e dagli approcci ensemble. In particolare, solo 7 articoli affrontavano l’interpretabilità e 2 trattavano esplicitamente la spiegabilità, evidenziando una significativa lacuna nella modellazione predittiva trasparente. I quattro modelli selezionati per l’analisi approfondita — CRISPRedict, CRISPRAidit, CRISPRon e DeepHF — rappresentano paradigmi computazionali differenti offrendo diversi livelli di spiegabilità.

Progettazione di metodi spiegabili per prevedere gli effetti off-target e on-target sulle sequenze di gRNA nell'editing di basi CRISPR/Cas9

HASIN, FAIZA
2026

Abstract

This PhD thesis presents a comprehensive investigation into the design of explainable methods for predicting efficiency related to off-target and on-target events on guide RNA (gRNA) sequences in CRISPR/Cas9 base editing. The research was conducted within the project ”Development of an innovative platform for the design of highly effec- tive and specific CRISPR screens”, led by Tommaso Selmi (CNR Institute for Biomed- ical Technologies), which is part of the PNRR CN3-Spoke7-WP1 National Center for Gene Therapy and Drugs based on RNA Technology. Background and Motivation CRISPR/Cas9 has revolutionized genome editing by en- abling precise DNA modifications through customizable guide RNA (gRNA) sequences that direct the Cas9–gRNA complex toward complementary genomic loci. Upon recog- nition of the target sequence, the complex binds to the DNA, allowing site-specific editing. While gene knockout (CRISPR-KO) involves DNA breaks that can cause un- predictable insertions or deletions, base editing (CRISPR-BE) offers more controlled point mutations without DNA breaks. However, off-target effects—where gRNA binds to unintended DNA locations due to sequence similarity—remain a critical challenge that can cause cell malfunction or death. Current predictive models suffer from two major limitations: low accuracy in efficiency prediction and domain specificity that pre- vents knowledge transfer between knockout and base editing domains. Research Questions and Methodology The thesis addresses two primary research questions: (RQ1) whether it is possible to improve prediction accuracy while preserv- ing explainability, and (RQ2) to what extent knowledge acquired for knockout predic- tion can be transferred to base editing domains. The methodological approach in- volves designing an ensemble framework that integrates four established CRISPR prediction models—CRISPRedict (linear GLM model), CRISPRAidit (MLP with 473 features), CRISPRon (CNN-based architecture), and DeepHF (BiLSTM with biological features)—using XGBoost as a meta-learner. SHAP (SHapley Additive exPlanations) was employed as the primary explainability tool due to its linear representation that facilitates aggregation within the ensemble hierarchy. Major Contributions The thesis comprises three interconnected studies. The first study aimed at developing a systematic scoping review following PRISMA-ScR guide- lines that analyzed 72 CRISPR/Cas9 predictive models published between 2014 and 2023 from an initial pool of 357 records. The review revealed that deep learning models (43.1%) dominate the field, followed by machine learning (17.0%) and ensemble ap- 1 proaches. Notably, only 7 papers addressed interpretability and 2 addressed explain- ability explicitly, highlighting a significant gap in transparent predictive modeling. The four models selected for in-depth analysis—CRISPRedict, CRISPRAidit, CRISPRon, and DeepHF—represented diverse computational paradigms while offering different levels of explainability.
4-mag-2026
Inglese
Questa tesi di dottorato presenta un’indagine completa sulla progettazione di metodi spiegabili per la previsione dell’efficienza relativa agli eventi off-target e on-target nelle sequenze di guide RNA (gRNA) nel contesto del base editing CRISPR/Cas9. La ricerca è stata condotta nell’ambito del progetto “Development of an innovative platform for the design of highly effective and specific CRISPR screens”, guidato da Tommaso Selmi (CNR Institute for Biomedical Technologies), parte del PNRR CN3-Spoke7-WP1 National Center for Gene Therapy and Drugs based on RNA Technology. Contesto e Motivazione CRISPR/Cas9 ha rivoluzionato l’editing genomico consentendo modifiche precise del DNA tramite sequenze di guide RNA (gRNA) personalizzabili che indirizzano il complesso Cas9–gRNA verso loci genomici complementari. Dopo il riconoscimento della sequenza bersaglio, il complesso si lega al DNA permettendo un editing sito-specifico. Mentre il gene knockout (CRISPR-KO) comporta rotture del DNA che possono causare inserzioni o delezioni imprevedibili, il base editing (CRISPR-BE) consente mutazioni puntiformi più controllate senza rotture del DNA. Tuttavia, gli effetti off-target — nei quali la gRNA si lega a posizioni genomiche non intenzionali a causa della similarità di sequenza — rimangono una sfida critica che può causare malfunzionamenti cellulari o morte cellulare. I modelli predittivi attuali soffrono di due limitazioni principali: bassa accuratezza nella previsione dell’efficienza e specificità di dominio che impedisce il trasferimento della conoscenza tra knockout e base editing. Domande di Ricerca e Metodologia La tesi affronta due principali domande di ricerca: (RQ1) se sia possibile migliorare l’accuratezza predittiva preservando la spiegabilità e (RQ2) in che misura la conoscenza acquisita per la previsione knockout possa essere trasferita al dominio del base editing. L’approccio metodologico consiste nella progettazione di un framework ensemble che integra quattro modelli consolidati di previsione CRISPR — CRISPRedict (modello lineare GLM), CRISPRAidit (MLP con 473 caratteristiche), CRISPRon (architettura basata su CNN) e DeepHF (BiLSTM con caratteristiche biologiche) — utilizzando XGBoost come meta-learner. SHAP (SHapley Additive exPlanations) è stato impiegato come principale strumento di spiegabilità grazie alla sua rappresentazione lineare che facilita l’aggregazione nella gerarchia dell’ensemble. Contributi Principali La tesi comprende tre studi interconnessi. Il primo studio mirava a sviluppare una scoping review sistematica seguendo le linee guida PRISMA-ScR, analizzando 72 modelli predittivi CRISPR/Cas9 pubblicati tra il 2014 e il 2023 a partire da un insieme iniziale di 357 articoli. La revisione ha evidenziato che i modelli di deep learning (43,1%) dominano il campo, seguiti dal machine learning (17,0%) e dagli approcci ensemble. In particolare, solo 7 articoli affrontavano l’interpretabilità e 2 trattavano esplicitamente la spiegabilità, evidenziando una significativa lacuna nella modellazione predittiva trasparente. I quattro modelli selezionati per l’analisi approfondita — CRISPRedict, CRISPRAidit, CRISPRon e DeepHF — rappresentano paradigmi computazionali differenti offrendo diversi livelli di spiegabilità.
CRISPR/Cas9,; gRNA fuori bersaglio; Efficienza dell'RNA,; apprendimento automa; gene knockout,
CONSIGLIO, ARIANNA
MENCAR, CORRADO
CASTELLANO, GIOVANNA
Università degli studi di Bari
File in questo prodotto:
File Dimensione Formato  
Thesis_Faiza_Hasin Final File april 10th_signed(faiza,corrado,arianna) (1) (1).pdf

accesso aperto

Licenza: Tutti i diritti riservati
Dimensione 22.84 MB
Formato Adobe PDF
22.84 MB Adobe PDF Visualizza/Apri
Thesis_Faiza_Hasin Final File april 10th_signed(faiza,corrado,arianna) (1) (1)_1.pdf

accesso aperto

Licenza: Tutti i diritti riservati
Dimensione 22.84 MB
Formato Adobe PDF
22.84 MB Adobe PDF Visualizza/Apri

I documenti in UNITESI sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/20.500.14242/378562
Il codice NBN di questa tesi è URN:NBN:IT:UNIBA-378562