Vision is central to human perception, reasoning, and interaction, and enabling similar perceptual capabilities in artificial systems remains a key ambition of artificial intelligence. As computer vision matures, its impact increasingly depends on the ability to extract reliable and actionable information from visual input as it unfolds in real-world environments, under limited computational resources and in the presence of substantial variability. In this context, wearable and egocentric (first-person) cameras have emerged as a compelling platform for embodied AI, offering a human-aligned view of everyday activities, object interactions, and social behavior. These devices promise rich opportunities for assistance and natural interaction, but they also expose the need for perception methods that are robust to unconstrained conditions and efficient enough to operate continuously on resource-limited hardware. This motivates the study of visual perception methods that are accurate and deployable in real-world settings. This thesis investigates methods that advance robust and efficient visual perception compatible with the demands of egocentric and wearable applications. The contributions span three core dimensions: action understanding in streaming video, efficient sensing and computation, and the estimation of gaze as a cue for social behavior. First, we address online action detection (OAD), the task of recognizing actions directly from streaming video. To support progress in this area, we derive a new benchmark from large-scale egocentric datasets and systematically evaluate state-of-the-art architectures. Building on these foundations, we introduce Continuous Online Action Detection (COAD), a problem formulation in which models must learn and adapt continuously while processing video streams, without revisiting past data. This setting reflects practical deployment constraints and highlights the value of online adaptation for personalized systems operating in evolving environments. To further improve efficiency and robustness under such constraints, we explore event-based vision as an alternative sensing modality. Event cameras operate asynchronously and output sparse brightness changes with microsecond precision, offering low latency, low power consumption, and resilience to motion blur. We propose FARSE-CNN, a convolutional–recurrent architecture for event-by-event asynchronous processing that directly exploits event sparsity. FARSE-CNN demonstrates competitive performance across recognition and detection tasks in both egocentric and exocentric scenarios while drastically reducing computational overhead, illustrating the potential of event-driven processing for embedded perception. Finally, we examine appearance-based gaze estimation as a means to model social attention in natural interactions. Existing approaches typically rely on normalization procedures that align faces based on head pose, but such steps are fragile and inefficient in unconstrained environments. We introduce Constrained Rotation Optimization (CROp), a principled geometric formulation that models face cropping as a virtual camera rotation, defining a consistent mapping between crop and camera coordinates. CROp enables systematic comparison between normalized and unnormalized settings and shows that crop-based estimation can offer robust and accurate gaze prediction without explicit alignment. Together, these contributions advance the development of dependable, efficient, and adaptive visual perception methods suited to real-world conditions. By integrating online learning, event-driven sensing, and a systematic analysis of gaze estimation approaches, this thesis lays the groundwork for systems capable of operating continuously and responsively in dynamic environments.

La visione svolge un ruolo fondamentale nella percezione, nel ragionamento e nell’interazione umana, e dotare i sistemi artificiali di capacità percettive analoghe rappresenta ancora oggi uno degli obiettivi centrali dell’intelligenza artificiale. Con il progresso della visione artificiale, la sua efficacia dipende sempre più dalla capacità di estrarre informazioni affidabili e utili da dati visivi acquisiti in contesti reali, caratterizzati da forte variabilità e da risorse computazionali spesso limitate. In questo scenario, le telecamere indossabili ed egocentriche si sono affermate come una piattaforma particolarmente promettente per l’intelligenza artificiale embodied, poiché offrono una prospettiva in prima persona sulle attività quotidiane, sulle interazioni con gli oggetti e sulle dinamiche sociali. Allo stesso tempo, queste applicazioni richiedono metodi di percezione visiva che siano non solo accurati, ma anche robusti in condizioni non controllate e sufficientemente efficienti abbastanza da poter funzionare in modo continuo su dispositivi con capacità computazionali ridotte. Questa tesi studia tecniche per una percezione visiva robusta ed efficiente, compatibile con i vincoli delle applicazioni egocentriche e indossabili. I contributi si sviluppano lungo tre direttrici principali: la comprensione delle azioni da flussi video in tempo reale, meccanismi e modalità alternative efficienti di acquisizione ed elaborazione visiva, e la stima dello sguardo come segnale per l’analisi del comportamento sociale. In primo luogo, affrontiamo il problema dell’online action detection (OAD), cioè il riconoscimento delle azioni direttamente da flussi video continui. Per favorire lo sviluppo della ricerca in questo ambito, definiamo un nuovo benchmark a partire da dataset egocentrici di larga scala e conduciamo una valutazione sistematica delle principali architetture allo stato dell’arte. Su queste basi, introduciamo il problema del Continuous Online Action Detection (COAD), in cui i modelli devono apprendere e adattarsi progressivamente durante l’elaborazione del flusso video, senza poter riutilizzare i dati osservati in precedenza. Questa formulazione riflette in modo più realistico le condizioni operative di molti sistemi reali e mette in luce l’importanza dell’adattamento online per applicazioni personalizzate in ambienti dinamici. Per migliorare ulteriormente efficienza e robustezza sotto tali vincoli, esploriamo inoltre la visione event-based come modalità alternativa di acquisizione. Le event camera operano in maniera asincrona e registrano variazioni locali di luminosità con precisione temporale dell’ordine dei microsecondi, offrendo vantaggi significativi in termini di latenza, consumo energetico e resistenza al motion blur. In questo contesto proponiamo FARSE-CNN, un’architettura convoluzionale-ricorrente progettata per un’elaborazione asincrona evento per evento, capace di sfruttare direttamente la natura sparsa del segnale. FARSE-CNN ottiene prestazioni competitive in compiti di riconoscimento e rilevamento, sia in scenari egocentrici sia exocentrici, riducendo in modo significativo il costo computazionale e mostrando il potenziale dell’elaborazione event-driven per sistemi di percezione embedded. Infine, analizziamo la stima dello sguardo (appearance-based gaze estimation) come strumento per modellare l’attenzione sociale nelle interazioni naturali. Gli approcci esistenti si basano generalmente su procedure specifiche di normalizzazione del volto guidate dalla posa della testa, che però risultano spesso fragili e poco efficienti in contesti non controllati. Per superare questi limiti introduciamo Constrained Rotation Optimization (CROp), una formulazione geometrica che interpreta l'operazione di cropping del volto come il risultato della rotazione di una telecamera virtuale e definisce in modo coerente la corrispondenza tra il sistema di coordinate del crop e quello della telecamera. Questo approccio consente di confrontare in modo sistematico configurazioni normalizzate e non normalizzate, mostrando che la stima dello sguardo direttamente dal crop del volto può raggiungere risultati accurati e robusti anche in assenza di un allineamento esplicito. Nel complesso, i contributi presentati in questa tesi avanzano lo sviluppo di metodi di percezione visiva affidabili, efficienti e adattivi, capaci di operare in condizioni realistiche. Integrando apprendimento online, sensing event-driven e un’analisi sistematica della stima dello sguardo, questo lavoro contribuisce alla costruzione di sistemi in grado di funzionare in modo continuo e reattivo in ambienti dinamici.

Efficient and robust visual perception for wearable and egocentric systems

SANTAMBROGIO, RICCARDO
2026

Abstract

Vision is central to human perception, reasoning, and interaction, and enabling similar perceptual capabilities in artificial systems remains a key ambition of artificial intelligence. As computer vision matures, its impact increasingly depends on the ability to extract reliable and actionable information from visual input as it unfolds in real-world environments, under limited computational resources and in the presence of substantial variability. In this context, wearable and egocentric (first-person) cameras have emerged as a compelling platform for embodied AI, offering a human-aligned view of everyday activities, object interactions, and social behavior. These devices promise rich opportunities for assistance and natural interaction, but they also expose the need for perception methods that are robust to unconstrained conditions and efficient enough to operate continuously on resource-limited hardware. This motivates the study of visual perception methods that are accurate and deployable in real-world settings. This thesis investigates methods that advance robust and efficient visual perception compatible with the demands of egocentric and wearable applications. The contributions span three core dimensions: action understanding in streaming video, efficient sensing and computation, and the estimation of gaze as a cue for social behavior. First, we address online action detection (OAD), the task of recognizing actions directly from streaming video. To support progress in this area, we derive a new benchmark from large-scale egocentric datasets and systematically evaluate state-of-the-art architectures. Building on these foundations, we introduce Continuous Online Action Detection (COAD), a problem formulation in which models must learn and adapt continuously while processing video streams, without revisiting past data. This setting reflects practical deployment constraints and highlights the value of online adaptation for personalized systems operating in evolving environments. To further improve efficiency and robustness under such constraints, we explore event-based vision as an alternative sensing modality. Event cameras operate asynchronously and output sparse brightness changes with microsecond precision, offering low latency, low power consumption, and resilience to motion blur. We propose FARSE-CNN, a convolutional–recurrent architecture for event-by-event asynchronous processing that directly exploits event sparsity. FARSE-CNN demonstrates competitive performance across recognition and detection tasks in both egocentric and exocentric scenarios while drastically reducing computational overhead, illustrating the potential of event-driven processing for embedded perception. Finally, we examine appearance-based gaze estimation as a means to model social attention in natural interactions. Existing approaches typically rely on normalization procedures that align faces based on head pose, but such steps are fragile and inefficient in unconstrained environments. We introduce Constrained Rotation Optimization (CROp), a principled geometric formulation that models face cropping as a virtual camera rotation, defining a consistent mapping between crop and camera coordinates. CROp enables systematic comparison between normalized and unnormalized settings and shows that crop-based estimation can offer robust and accurate gaze prediction without explicit alignment. Together, these contributions advance the development of dependable, efficient, and adaptive visual perception methods suited to real-world conditions. By integrating online learning, event-driven sensing, and a systematic analysis of gaze estimation approaches, this thesis lays the groundwork for systems capable of operating continuously and responsively in dynamic environments.
13-apr-2026
Inglese
La visione svolge un ruolo fondamentale nella percezione, nel ragionamento e nell’interazione umana, e dotare i sistemi artificiali di capacità percettive analoghe rappresenta ancora oggi uno degli obiettivi centrali dell’intelligenza artificiale. Con il progresso della visione artificiale, la sua efficacia dipende sempre più dalla capacità di estrarre informazioni affidabili e utili da dati visivi acquisiti in contesti reali, caratterizzati da forte variabilità e da risorse computazionali spesso limitate. In questo scenario, le telecamere indossabili ed egocentriche si sono affermate come una piattaforma particolarmente promettente per l’intelligenza artificiale embodied, poiché offrono una prospettiva in prima persona sulle attività quotidiane, sulle interazioni con gli oggetti e sulle dinamiche sociali. Allo stesso tempo, queste applicazioni richiedono metodi di percezione visiva che siano non solo accurati, ma anche robusti in condizioni non controllate e sufficientemente efficienti abbastanza da poter funzionare in modo continuo su dispositivi con capacità computazionali ridotte. Questa tesi studia tecniche per una percezione visiva robusta ed efficiente, compatibile con i vincoli delle applicazioni egocentriche e indossabili. I contributi si sviluppano lungo tre direttrici principali: la comprensione delle azioni da flussi video in tempo reale, meccanismi e modalità alternative efficienti di acquisizione ed elaborazione visiva, e la stima dello sguardo come segnale per l’analisi del comportamento sociale. In primo luogo, affrontiamo il problema dell’online action detection (OAD), cioè il riconoscimento delle azioni direttamente da flussi video continui. Per favorire lo sviluppo della ricerca in questo ambito, definiamo un nuovo benchmark a partire da dataset egocentrici di larga scala e conduciamo una valutazione sistematica delle principali architetture allo stato dell’arte. Su queste basi, introduciamo il problema del Continuous Online Action Detection (COAD), in cui i modelli devono apprendere e adattarsi progressivamente durante l’elaborazione del flusso video, senza poter riutilizzare i dati osservati in precedenza. Questa formulazione riflette in modo più realistico le condizioni operative di molti sistemi reali e mette in luce l’importanza dell’adattamento online per applicazioni personalizzate in ambienti dinamici. Per migliorare ulteriormente efficienza e robustezza sotto tali vincoli, esploriamo inoltre la visione event-based come modalità alternativa di acquisizione. Le event camera operano in maniera asincrona e registrano variazioni locali di luminosità con precisione temporale dell’ordine dei microsecondi, offrendo vantaggi significativi in termini di latenza, consumo energetico e resistenza al motion blur. In questo contesto proponiamo FARSE-CNN, un’architettura convoluzionale-ricorrente progettata per un’elaborazione asincrona evento per evento, capace di sfruttare direttamente la natura sparsa del segnale. FARSE-CNN ottiene prestazioni competitive in compiti di riconoscimento e rilevamento, sia in scenari egocentrici sia exocentrici, riducendo in modo significativo il costo computazionale e mostrando il potenziale dell’elaborazione event-driven per sistemi di percezione embedded. Infine, analizziamo la stima dello sguardo (appearance-based gaze estimation) come strumento per modellare l’attenzione sociale nelle interazioni naturali. Gli approcci esistenti si basano generalmente su procedure specifiche di normalizzazione del volto guidate dalla posa della testa, che però risultano spesso fragili e poco efficienti in contesti non controllati. Per superare questi limiti introduciamo Constrained Rotation Optimization (CROp), una formulazione geometrica che interpreta l'operazione di cropping del volto come il risultato della rotazione di una telecamera virtuale e definisce in modo coerente la corrispondenza tra il sistema di coordinate del crop e quello della telecamera. Questo approccio consente di confrontare in modo sistematico configurazioni normalizzate e non normalizzate, mostrando che la stima dello sguardo direttamente dal crop del volto può raggiungere risultati accurati e robusti anche in assenza di un allineamento esplicito. Nel complesso, i contributi presentati in questa tesi avanzano lo sviluppo di metodi di percezione visiva affidabili, efficienti e adattivi, capaci di operare in condizioni realistiche. Integrando apprendimento online, sensing event-driven e un’analisi sistematica della stima dello sguardo, questo lavoro contribuisce alla costruzione di sistemi in grado di funzionare in modo continuo e reattivo in ambienti dinamici.
File in questo prodotto:
File Dimensione Formato  
PhD_Thesis-5.pdf

non disponibili

Licenza: Tutti i diritti riservati
Dimensione 32.57 MB
Formato Adobe PDF
32.57 MB Adobe PDF

I documenti in UNITESI sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.

Utilizza questo identificativo per citare o creare un link a questo documento: https://hdl.handle.net/20.500.14242/376630
Il codice NBN di questa tesi è URN:NBN:IT:POLIMI-376630