Computing infrastructures have been evolving from centralized cloud architectures to distributed continua including edge, fog, and cloud resources, driven by the explosive growth of Internet of Things devices and the increasing computational demands of Artificial Intelligence applications. This paradigm shift generates novel challenges in resource management: how can we dynamically allocate resources across heterogeneous infrastructure to meet strict Quality of Service requirements? How can we do so while minimizing costs, in particular if computational loads fluctuate unpredictably and system conditions continuously change? This thesis addresses these challenges through FIGARO, a novel framework based on hierarchical Reinforcement Learning designed for adaptive resource management in computing continua. We formulate the Component Placement and Resource Optimization problem as a Markov Decision Process, enabling the application of learning-based methods to what has traditionally been approached as a static combinatorial optimization problem. The system is based on transfer learning, with an offline training phase before deploying agents in simulated or real environments. We integrate expert knowledge from heuristic-based optimization tools through Behavioral Cloning, significantly accelerating the learning process. The key innovation is a hierarchical architecture that decomposes the global optimization problem into coordinated local decision-making processes, achieving scalability to realistic system sizes while being able to learn policies that generalize across various operational conditions. We validate FIGARO with extensive experiments in simulated environments and real-world systems thanks to the Serverledge serverless platform. Our results show that the hierarchical implementation is effective, achieving Quality of Service violation rates below 4% while maintaining a resource efficiency level comparable to expert-designed solutions. FIGARO has good generalization capabilities to unforeseen distribution shifts and unexpected system changes. In addition, we explore the concept of antifragility in software systems, and propose a vaccination-inspired methodology for proactive adaptation through controlled perturbation injection during training. Preliminary experiments on simulated systems show that exposing agents to synthetic environmental variations during training could enhance their generalization capabilities. This approach suggests a possible pathway toward systems that not only resist against disruptive events but actually improve through exposure to them. The contributions of this thesis extend beyond the specific technical solutions to establish Reinforcement Learning as a viable approach for autonomous resource management in production computing systems, investigating new possibilities for adaptive infrastructure that continuously learns and improves from operational experience.
Le infrastrutture computazionali si sono evolute dalle architetture cloud centralizzate verso continuum distribuiti che includono risorse edge, fog e cloud, spinte dalla crescita esplosiva di dispositivi Internet of Things e dalle crescenti richieste computazionali delle applicazioni di Intelligenza Artificiale. Questo cambio di paradigma genera nuove sfide nella gestione delle risorse: come possiamo allocare dinamicamente le risorse in un'infrastruttura eterogenea per soddisfare rigorosi requisiti di Qualità del Servizio (QoS)? Come possiamo farlo minimizzando i costi, in particolare se i carichi computazionali fluttuano in modo imprevedibile e le condizioni del sistema cambiano continuamente? Questa tesi affronta tali sfide attraverso FIGARO, un nuovo framework basato sull'Apprendimento per Rinforzo (Reinforcement Learning) gerarchico, progettato per la gestione adattiva delle risorse nel computing continuum. Formuliamo il problema dell'allocazione dei componenti e dell'ottimizzazione delle risorse come un Processo Decisionale di Markov (MDP), permettendo quindi di applicare metodi basati sull'apprendimento a quello che tradizionalmente è stato affrontato come un problema di ottimizzazione combinatoria statica. Il sistema si basa sul transfer learning, con una fase di addestramento offline prima di distribuire gli agenti in ambienti simulati o reali. Integriamo la conoscenza di un esperto (derivante da sistemi di ottimizzazione basati su euristiche) attraverso il Behavioral Cloning, accelerando significativamente il processo di apprendimento. L'innovazione chiave è un'architettura gerarchica che decompone il problema di ottimizzazione globale in processi decisionali locali coordinati, ottenendo scalabilità per dimensioni di sistema realistiche e la capacità di apprendere policy in grado di generalizzare in varie condizioni operative. Abbiamo validato FIGARO in maniera estensiva in ambienti simulati e in sistemi reali, grazie alla piattaforma Serverledge. I nostri risultati mostrano che l'implementazione gerarchica è efficace, raggiungendo tassi di violazione della QoS inferiori al 4%, pur sempre mantenendo un livello di efficienza delle risorse paragonabile alle soluzioni progettate da esperti. FIGARO presenta buone capacità di generalizzazione rispetto a cambiamenti imprevisti nella distribuzione dei dati e variazioni inaspettate del sistema. Inoltre, esploriamo il concetto di antifragilità nei sistemi software e proponiamo una metodologia ispirata alla vaccinazione per l'adattamento proattivo attraverso l'iniezione controllata di perturbazioni durante l'addestramento. Esperimenti preliminari su sistemi simulati mostrano che esporre gli agenti a variazioni ambientali sintetiche durante l'addestramento potrebbe migliorare le loro capacità di generalizzazione. Questo approccio suggerisce un possibile percorso verso sistemi che non solo resistono agli eventi dirompenti, ma migliorano effettivamente attraverso l'esposizione ad essi. I contributi di questa tesi si estendono oltre le specifiche soluzioni tecniche per stabilire il Reinforcement Learning come un approccio praticabile per la gestione autonoma delle risorse nei sistemi di calcolo in produzione, studiando nuove possibilità per infrastrutture adattive che apprendono e migliorano continuamente dall'esperienza operativa.
Adaptive management of computational resources through reinforcement learning
Cavadini, Riccardo
2026
Abstract
Computing infrastructures have been evolving from centralized cloud architectures to distributed continua including edge, fog, and cloud resources, driven by the explosive growth of Internet of Things devices and the increasing computational demands of Artificial Intelligence applications. This paradigm shift generates novel challenges in resource management: how can we dynamically allocate resources across heterogeneous infrastructure to meet strict Quality of Service requirements? How can we do so while minimizing costs, in particular if computational loads fluctuate unpredictably and system conditions continuously change? This thesis addresses these challenges through FIGARO, a novel framework based on hierarchical Reinforcement Learning designed for adaptive resource management in computing continua. We formulate the Component Placement and Resource Optimization problem as a Markov Decision Process, enabling the application of learning-based methods to what has traditionally been approached as a static combinatorial optimization problem. The system is based on transfer learning, with an offline training phase before deploying agents in simulated or real environments. We integrate expert knowledge from heuristic-based optimization tools through Behavioral Cloning, significantly accelerating the learning process. The key innovation is a hierarchical architecture that decomposes the global optimization problem into coordinated local decision-making processes, achieving scalability to realistic system sizes while being able to learn policies that generalize across various operational conditions. We validate FIGARO with extensive experiments in simulated environments and real-world systems thanks to the Serverledge serverless platform. Our results show that the hierarchical implementation is effective, achieving Quality of Service violation rates below 4% while maintaining a resource efficiency level comparable to expert-designed solutions. FIGARO has good generalization capabilities to unforeseen distribution shifts and unexpected system changes. In addition, we explore the concept of antifragility in software systems, and propose a vaccination-inspired methodology for proactive adaptation through controlled perturbation injection during training. Preliminary experiments on simulated systems show that exposing agents to synthetic environmental variations during training could enhance their generalization capabilities. This approach suggests a possible pathway toward systems that not only resist against disruptive events but actually improve through exposure to them. The contributions of this thesis extend beyond the specific technical solutions to establish Reinforcement Learning as a viable approach for autonomous resource management in production computing systems, investigating new possibilities for adaptive infrastructure that continuously learns and improves from operational experience.| File | Dimensione | Formato | |
|---|---|---|---|
|
RiccardoCavadini_reviewed_thesis.pdf
non disponibili
Licenza:
Tutti i diritti riservati
Dimensione
9.2 MB
Formato
Adobe PDF
|
9.2 MB | Adobe PDF |
I documenti in UNITESI sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.
https://hdl.handle.net/20.500.14242/376790
URN:NBN:IT:POLIMI-376790