Human visual attention is a fundamental cognitive process that enables individuals to efficiently interpret complex visual environments. By selectively prioritizing salient and task-relevant regions, humans extract critical information while suppressing irrelevant stimuli. This selective mechanism supports perception, decision-making, and interaction with a dynamic world. Foundational work in neuroscience and cognitive science has established key principles of spatial attention, feature-based selection, and the interaction between top-down and bottom-up control. In parallel, advances in Artificial Intelligence and Computer Vision have inspired autonomous systems that emulate human prioritization of visual information. Unlike traditional saliency models that predict static regions of interest, scanpath models capture both spatial and temporal aspects of visual exploration, including the sequence, timing, and trajectory of gaze shifts. This thesis introduces probabilistic and generative frameworks for scanpath prediction, contributing to a deeper understanding and modeling of temporal dynamics and inter-subject variability. We propose TPP-Gaze, a mathematically principled framework, inspired by the theory of Neural Temporal Point Processes, which conceptualizes scanpaths as sequences of stochastic events occurring irregularly over time. This formulation addresses a key limitation of existing approaches: while many accurately model where to look, they often lack a principled representation of when gaze shifts occur. By explicitly modeling temporal evolution, TPP-Gaze provides a more complete description of visual attention dynamics. Human attention is inherently variable across individuals, influenced by cognitive biases, preferences, and context. To capture such variability, we introduce ScanDiff, a stochastic diffusion-based model capable of generating diverse and realistic gaze trajectories. Unlike methods that produce a single average scanpath, ScanDiff reflects the natural heterogeneity of visual behavior across observers. Beyond methodological contributions, this research provides a comprehensive overview of current models and datasets, highlighting trends, challenges, and opportunities for integrating human attentional mechanisms into artificial systems. The practical relevance of the proposed models is demonstrated through eye-tracking experiments and data collection across multiple domains. These include studies on gaze behavior in authentic versus manipulated images, the integration of perceptual signals into deepfake detection frameworks, and the analysis of attention in neurodevelopmental conditions. Additionally, the thesis introduces new resources, including a large-scale multimodal egocentric dataset capturing gaze, motion, and environmental context in culturally diverse settings. These data reveal distinctive attentional patterns and cognitive mechanisms, informing the design of human-centered computational models for applications such as media authenticity assessment, behavioral analysis, and multimodal attention modeling. In conclusion, this thesis advances the study of human visual attention by (i) developing computational models that capture the spatio-temporal structure of scanpaths, (ii) providing empirical evidence into gaze dynamics under varied conditions, and (iii) exploring real-world applications of attention modeling. By bridging cognitive science and artificial intelligence, this work deepens theoretical understanding while enhancing the computational modeling of human-like visual behavior.

L’attenzione visiva umana è un processo cognitivo che consente agli individui di interpretare in modo efficiente ambienti visivi complessi. Attraverso la prioritarizzazione di regioni salienti e rilevanti per il problema, gli esseri umani estraggono informazioni critiche sopprimendo al contempo gli stimoli irrilevanti. Questo meccanismo di selezione supporta la percezione, il processo decisionale e l’interazione con un mondo dinamico. Studi nelle neuroscienze hanno stabilito principi chiave dell’attenzione spaziale, della selezione basata sugli attributi visivi e dell’interazione tra controllo top-down e bottom-up. I progressi nell’Intelligenza Artificiale e nella Computer Vision hanno ispirato lo sviluppo di sistemi autonomi in grado di emulare la prioritarizzazione umana delle informazioni visive. A differenza dei modelli di salienza tradizionali, che predicono regioni di interesse statiche, i modelli di scanpath catturano sia gli aspetti spaziali che quelli temporali dell’esplorazione visiva, inclusi la sequenza, la tempistica e la traiettoria dello sguardo. Questa tesi introduce framework probabilistici e generativi per la generazione degli scanpath, contribuendo a una comprensione più approfondita delle dinamiche temporali e della variabilità tra individui. Proponiamo TPP-Gaze, un framework ispirato alla teoria dei Neural Temporal Point Processes, che concettualizza gli scanpath come sequenze di eventi stocastici che accadono in modo irregolare nel tempo. Tale formulazione affronta un limite chiave degli approcci esistenti: mentre molti modelli rappresentano accuratamente dove guardare, spesso mancano di una rappresentazione rigorosa di quando avvengono gli spostamenti dello sguardo. Modellando esplicitamente l’evoluzione temporale, TPP-Gaze fornisce una descrizione più completa delle dinamiche dell’attenzione visiva. L’attenzione umana è intrinsecamente variabile tra individui, influenzata da bias cognitivi, preferenze e contesto. Per catturare tale variabilità, introduciamo ScanDiff, un modello stocastico basato su diffusione, capace di generare traiettorie di sguardo diverse e realistiche. A differenza dei metodi che producono un singolo scanpath medio, ScanDiff riflette la naturale eterogeneità del comportamento visivo. Oltre ai contributi metodologici, questa ricerca fornisce una panoramica completa dei modelli e dei dataset attuali, evidenziando trend, sfide e opportunità per integrare i meccanismi attentivi umani nei sistemi artificiali. La rilevanza pratica dei modelli proposti è dimostrata attraverso esperimenti di eye-tracking e raccolta dati in diversi domini. Questi includono studi sul comportamento visivo in immagini autentiche rispetto a immagini manipolate, l’integrazione di segnali percettivi per il rilevamento dei deepfake e l’analisi dell’attenzione in condizioni neuroevolutive. Inoltre, la tesi introduce un dataset egocentrico multimodale che cattura sguardo, movimento e contesto ambientale in ambiti culturalmente diversificati. Questi dati rivelano pattern attentivi distintivi, contribuendo alla progettazione di modelli centrati sull’uomo per applicazioni quali la valutazione dell’autenticità dei media, l’analisi comportamentale e la modellazione multimodale dell’attenzione. In conclusione, questa tesi avanza lo studio dell’attenzione visiva umana attraverso (i) lo sviluppo di modelli computazionali che catturano la struttura spazio-temporale degli scanpath, (ii) la definizione di evidenze empiriche sulle dinamiche dello sguardo in diverse condizioni e (iii) l’esplorazione di applicazioni reali della modellazione dell’attenzione. Collegando scienze cognitive e intelligenza artificiale, questo lavoro approfondisce la comprensione teorica e migliora la modellazione computazionale del comportamento visivo umano.

Dall’ Attenzione Visiva Umana ai Modelli Computazionali: Predizione dello Scanpath e Applicazioni in Scenari Reali

CARTELLA, GIUSEPPE
2026

Abstract

Human visual attention is a fundamental cognitive process that enables individuals to efficiently interpret complex visual environments. By selectively prioritizing salient and task-relevant regions, humans extract critical information while suppressing irrelevant stimuli. This selective mechanism supports perception, decision-making, and interaction with a dynamic world. Foundational work in neuroscience and cognitive science has established key principles of spatial attention, feature-based selection, and the interaction between top-down and bottom-up control. In parallel, advances in Artificial Intelligence and Computer Vision have inspired autonomous systems that emulate human prioritization of visual information. Unlike traditional saliency models that predict static regions of interest, scanpath models capture both spatial and temporal aspects of visual exploration, including the sequence, timing, and trajectory of gaze shifts. This thesis introduces probabilistic and generative frameworks for scanpath prediction, contributing to a deeper understanding and modeling of temporal dynamics and inter-subject variability. We propose TPP-Gaze, a mathematically principled framework, inspired by the theory of Neural Temporal Point Processes, which conceptualizes scanpaths as sequences of stochastic events occurring irregularly over time. This formulation addresses a key limitation of existing approaches: while many accurately model where to look, they often lack a principled representation of when gaze shifts occur. By explicitly modeling temporal evolution, TPP-Gaze provides a more complete description of visual attention dynamics. Human attention is inherently variable across individuals, influenced by cognitive biases, preferences, and context. To capture such variability, we introduce ScanDiff, a stochastic diffusion-based model capable of generating diverse and realistic gaze trajectories. Unlike methods that produce a single average scanpath, ScanDiff reflects the natural heterogeneity of visual behavior across observers. Beyond methodological contributions, this research provides a comprehensive overview of current models and datasets, highlighting trends, challenges, and opportunities for integrating human attentional mechanisms into artificial systems. The practical relevance of the proposed models is demonstrated through eye-tracking experiments and data collection across multiple domains. These include studies on gaze behavior in authentic versus manipulated images, the integration of perceptual signals into deepfake detection frameworks, and the analysis of attention in neurodevelopmental conditions. Additionally, the thesis introduces new resources, including a large-scale multimodal egocentric dataset capturing gaze, motion, and environmental context in culturally diverse settings. These data reveal distinctive attentional patterns and cognitive mechanisms, informing the design of human-centered computational models for applications such as media authenticity assessment, behavioral analysis, and multimodal attention modeling. In conclusion, this thesis advances the study of human visual attention by (i) developing computational models that capture the spatio-temporal structure of scanpaths, (ii) providing empirical evidence into gaze dynamics under varied conditions, and (iii) exploring real-world applications of attention modeling. By bridging cognitive science and artificial intelligence, this work deepens theoretical understanding while enhancing the computational modeling of human-like visual behavior.
20-lug-2026
Inglese
L’attenzione visiva umana è un processo cognitivo che consente agli individui di interpretare in modo efficiente ambienti visivi complessi. Attraverso la prioritarizzazione di regioni salienti e rilevanti per il problema, gli esseri umani estraggono informazioni critiche sopprimendo al contempo gli stimoli irrilevanti. Questo meccanismo di selezione supporta la percezione, il processo decisionale e l’interazione con un mondo dinamico. Studi nelle neuroscienze hanno stabilito principi chiave dell’attenzione spaziale, della selezione basata sugli attributi visivi e dell’interazione tra controllo top-down e bottom-up. I progressi nell’Intelligenza Artificiale e nella Computer Vision hanno ispirato lo sviluppo di sistemi autonomi in grado di emulare la prioritarizzazione umana delle informazioni visive. A differenza dei modelli di salienza tradizionali, che predicono regioni di interesse statiche, i modelli di scanpath catturano sia gli aspetti spaziali che quelli temporali dell’esplorazione visiva, inclusi la sequenza, la tempistica e la traiettoria dello sguardo. Questa tesi introduce framework probabilistici e generativi per la generazione degli scanpath, contribuendo a una comprensione più approfondita delle dinamiche temporali e della variabilità tra individui. Proponiamo TPP-Gaze, un framework ispirato alla teoria dei Neural Temporal Point Processes, che concettualizza gli scanpath come sequenze di eventi stocastici che accadono in modo irregolare nel tempo. Tale formulazione affronta un limite chiave degli approcci esistenti: mentre molti modelli rappresentano accuratamente dove guardare, spesso mancano di una rappresentazione rigorosa di quando avvengono gli spostamenti dello sguardo. Modellando esplicitamente l’evoluzione temporale, TPP-Gaze fornisce una descrizione più completa delle dinamiche dell’attenzione visiva. L’attenzione umana è intrinsecamente variabile tra individui, influenzata da bias cognitivi, preferenze e contesto. Per catturare tale variabilità, introduciamo ScanDiff, un modello stocastico basato su diffusione, capace di generare traiettorie di sguardo diverse e realistiche. A differenza dei metodi che producono un singolo scanpath medio, ScanDiff riflette la naturale eterogeneità del comportamento visivo. Oltre ai contributi metodologici, questa ricerca fornisce una panoramica completa dei modelli e dei dataset attuali, evidenziando trend, sfide e opportunità per integrare i meccanismi attentivi umani nei sistemi artificiali. La rilevanza pratica dei modelli proposti è dimostrata attraverso esperimenti di eye-tracking e raccolta dati in diversi domini. Questi includono studi sul comportamento visivo in immagini autentiche rispetto a immagini manipolate, l’integrazione di segnali percettivi per il rilevamento dei deepfake e l’analisi dell’attenzione in condizioni neuroevolutive. Inoltre, la tesi introduce un dataset egocentrico multimodale che cattura sguardo, movimento e contesto ambientale in ambiti culturalmente diversificati. Questi dati rivelano pattern attentivi distintivi, contribuendo alla progettazione di modelli centrati sull’uomo per applicazioni quali la valutazione dell’autenticità dei media, l’analisi comportamentale e la modellazione multimodale dell’attenzione. In conclusione, questa tesi avanza lo studio dell’attenzione visiva umana attraverso (i) lo sviluppo di modelli computazionali che catturano la struttura spazio-temporale degli scanpath, (ii) la definizione di evidenze empiriche sulle dinamiche dello sguardo in diverse condizioni e (iii) l’esplorazione di applicazioni reali della modellazione dell’attenzione. Collegando scienze cognitive e intelligenza artificiale, questo lavoro approfondisce la comprensione teorica e migliora la modellazione computazionale del comportamento visivo umano.
Attenzione Visiva; Predizione Scanpath; Variabilità Sguardo; Raccolta Dati; Dinamica Sguardo
CUCCHIARA, Rita
ROVATI, Luigi
Università degli studi di Modena e Reggio Emilia
File in questo prodotto:
File Dimensione Formato  
Cartella.pdf

accesso aperto

Licenza: Tutti i diritti riservati
Dimensione 66.34 MB
Formato Adobe PDF
66.34 MB Adobe PDF Visualizza/Apri

I documenti in UNITESI sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/20.500.14242/376007
Il codice NBN di questa tesi è URN:NBN:IT:UNIMORE-376007