Apprendimento per rinforzo multi-obiettivo spiegabile con politiche condizionate da Pareto

Mostra/ Apri
Autore
Chulev, Joanikij <2002>
Data
2026-09-03Disponibile dal
2026-09-10Abstract
L’apprendimento per rinforzo multi-obiettivo (MORL) affronta problemi decisionali che coinvolgono obiettivi in conflitto. Le Pareto-Conditioned Networks (PCN) rappresentano molteplici compromessi all’interno di un’unica politica, condizionando le azioni a un comando di ritorno desiderato. Sebbene questo comando esprima gli obiettivi dell’agente, la relazione appresa tra stato, comando e azione rimane opaca. Questa tesi studia il comando come interfaccia esplicativa. Il lavoro presenta quattro contributi. In primo luogo, introduce una PCN basata esclusivamente sul ritorno, che elimina il condizionamento esplicito sull’orizzonte pur ottenendo prestazioni comparabili al condizionamento su ritorno e orizzonte negli ambienti valutati. In secondo luogo, sviluppa spiegazioni controfattuali nello spazio dei comandi, che identificano le modifiche minime al comando necessarie affinché la stessa politica, nello stesso stato, preferisca una specifica azione alternativa. Il metodo proposto, CF-ZOO, combina un’inizializzazione informata dal fronte di Pareto con un’ottimizzazione black-box di ordine zero, senza richiedere accesso ai meccanismi interni del modello. In terzo luogo, introduce un segnale di influenza dell’obiettivo che distingue l’influenza del comando dalla confidenza della politica e viene validato rispetto a una verità di riferimento comportamentale in diversi ambienti. In quarto luogo, fornisce un banco di prova interattivo per l’ispezione dei rollout, la generazione e la verifica delle spiegazioni controfattuali e il supporto alle valutazioni con utenti umani. Nel complesso, questi contributi consentono spiegazioni locali, contrastive e a livello di obiettivo attraverso i comandi di ritorno desiderato. Multi-objective reinforcement learning (MORL) addresses decisions involving conflicting objectives. Pareto-Conditioned Networks (PCNs) represent multiple trade-offs in a single policy by conditioning actions on a desired-return command. Although this command expresses the agent’s objectives, the learned state–command–action mapping remains opaque. This thesis investigates the command as an explanatory interface. It makes four contributions. First, it introduces a return-only PCN that removes explicit horizon conditioning while achieving performance comparable to return-and-horizon conditioning across the evaluated environments. Second, it develops command-space counterfactual explanations that identify minimal command changes required for the same policy, in the same state, to prefer a specified alternative action. The proposed CF-ZOO method combines Pareto-front-informed initialization with blackbox zeroth-order optimization, without requiring access to model internals. Third, it introduces a goal-influence signal that separates command influence from policy confidence and is validated against behavioural ground truth across diverse environments. Fourth, it provides an interactive testbed for inspecting rollouts, generating and verifying counterfactual explanations, and supporting human evaluations. Together, these contributions enable local, contrastive, and objective-level explanations through desired-return commands.
Tipo
info:eu-repo/semantics/masterThesisCollezioni
- Laurea Magistrale [8051]

