Show simple item record

Diversity in Reinforcement Learning

dc.contributor.advisorGarcke, Jochen
dc.contributor.authorFeiden, Arno Berengar
dc.date.accessioned2026-08-04T09:39:37Z
dc.date.available2026-08-04T09:39:37Z
dc.date.issued04.08.2026
dc.identifier.urihttps://hdl.handle.net/20.500.11811/14349
dc.description.abstractReinforcement learning is a machine learning paradigm that aims to develop optimal policies for discrete-time control problems based on quantitative feedback on the learner’s behaviour. Reinforcement learning is formulated as a gradient-based optimisation procedure, but reinforcement learning problems with unique optimal solutions are rare. This work focuses on ways to distinguish policies that solve the same reinforcement learning problem differently.
A pointed analysis of reinforcement learning literature, specifically of policy gradient methods, shows that policies are best understood through their behaviour: The actions that the policy selects based on the encountered state. There are two equivalent main approaches to understanding this behaviour empirically: Episodic behavioural characterisation, which interprets a policy as a random element in the space of state-action time series and behavioural characterisation through the occupancy measure, which interprets a policy as a random element representing the visitation frequency in the space of state-action pairs.
Both characterisations can be used to deduce general, problem-agnostic distance measures either by comparing time series or by comparing sampled distributions. Their utility is first explored by visualising small populations of policies. The relationships between policies that emerge in the visualisation also reflect other, hidden relationships, thereby validating the approach.
This idea is then integrated with an evolutionary algorithm. Evolutionary computation is a branch of optimisation techniques that improve populations of candidate solutions. In quality-diversity methods specifically, the members of the population are encouraged to differ from one another to improve the evolutionary process. When these methods are used to solve reinforcement learning problems, a measure of distance between candidate solutions is required. The developed techniques to distinguish policies are successfully connected with MAP-Elites, a quality-diversity heuristic that is often used for reinforcement learning problems and typically distinguishes policies based on selective, problem-specific criteria.
The applications validate the established general distances measure, but they also show that a diverse population of solutions is, for example, more explorative and more robust against environmental changes even if the diversity is not directed towards the specific goal such as exploration or robustness. This reveals the intrinsic value of diversity.
en
dc.description.abstractVielfalt im verstärkenden Lernen
Verstärkendes Lernen ist ein Paradigma des maschinellen Lernens, das darauf abzielt, optimale Strategien für zeitdiskrete Steuerungsprobleme auf der Grundlage quantitativer Rückmeldungen zum Verhalten des Lernenden zu entwickeln. Verstärkendes Lernen wird als gradientenbasiertes Optimierungsverfahren formuliert, konkrete Probleme haben allerdings selten eindeutige optimale Lösungen. Diese Arbeit konzentriert sich darauf, Strategien zu unterscheiden, die dasselbe Problem unterschiedlich lösen.
Eine gezielte Analyse der Literatur zum verstärkenden Lernen, insbesondere zu Gradientenverfahren auf Strategien, zeigt, dass diese am besten anhand ihres Verhaltens verstanden werden: anhand der Aktionen, die die Strategie auf Grundlage des Systemzustands auswählt. Es gibt zwei gleichwertige, zentrale Ansätze, um dieses Verhalten empirisch zu verstehen: die episodische Verhaltenscharakterisierung, die eine Strategie als Zufallsvariable im Raum der Zustands-Aktions-Zeitreihen interpretiert, und die Verhaltenscharakterisierung durch die Belegungsmaßzahl, die eine Strategie als Zufallsvariable im Raum der Zustands-Aktions-Paare interpretiert.
Beide Charakterisierungen können verwendet werden, um allgemeine, problemunabhängige Distanzmaße abzuleiten, entweder durch den Vergleich von Zeitreihen oder durch den Vergleich von Stichprobenverteilungen. Ihr Nutzen wird zunächst durch die Visualisierung kleiner Populationen von Strategien untersucht. Die Beziehungen zwischen den Strategien, die sich in der Visualisierung zeigen, spiegeln auch andere, verborgene Beziehungen wider, was den Ansatz validiert.
Diese Idee wird dann in einen evolutionären Algorithmus integriert. Evolutionäres Rechnen ist eine Sparte von Optimierungstechniken, die Populationen von potenziellen Lösungen iterativ verbessern. Insbesondere bei Qualitäts-Diversitäts-Methoden werden die Individuen dieser Population dazu angeregt, unterschiedlich zu sein, um den evolutionären Prozess zu verbessern. Wenn solche Methoden zur Lösung von Problemen des verstärkenden Lernens eingesetzt werden, ist ein Distanzmaß zwischen Strategien erforderlich. Die entwickelten Techniken zur Unterscheidung von Strategien lassen sich erfolgreich mit MAP-Elites verbinden, einer Qualitäts-Diversitäts-Heuristik, die häufig für Probleme des verstärkenden Lernens verwendet wird und Strategien in der Regel anhand selektiver, problemspezifischer Kriterien unterscheidet.
Die Anwendungen validieren die hier etablierten, allgemeinen Distanzmaße, zeigen aber auch, dass eine vielfältige Population von Lösungen zum Beispiel explorativer und robuster gegenüber Umweltveränderungen ist, selbst wenn die Vielfalt nicht auf ein bestimmtes Ziel wie Exploration oder Robustheit ausgerichtet ist. Das offenbart den intrinsischen Wert von Vielfalt.
de
dc.language.isoeng
dc.rightsNamensnennung 4.0 International
dc.rights.urihttp://creativecommons.org/licenses/by/4.0/
dc.subjectVerstärkendes Lernen
dc.subjectVielfalt
dc.subjectZeitreihenanalyse
dc.subjectDatenverarbeitung
dc.subjectReinforcement Learning
dc.subjectOccupancy Measure
dc.subjectQuality-Diversity
dc.subjectData Analysis
dc.subject.ddc510 Mathematik
dc.titleDiversity in Reinforcement Learning
dc.typeDissertation oder Habilitation
dc.publisher.nameUniversitäts- und Landesbibliothek Bonn
dc.publisher.locationBonn
dc.rights.accessRightsopenAccess
dc.identifier.urnhttps://nbn-resolving.org/urn:nbn:de:hbz:5-91296
dc.relation.doihttps://doi.org/10.1145/3583133.3590741
dc.relation.doihttps://doi.org/10.1145/3638530.3654295
dc.relation.doihttps://doi.org/10.1145/3712256.3726337
ulbbn.pubtypeErstveröffentlichung
ulbbnediss.affiliation.nameRheinische Friedrich-Wilhelms-Universität Bonn
ulbbnediss.affiliation.locationBonn
ulbbnediss.thesis.levelDissertation
ulbbnediss.dissID9129
ulbbnediss.date.accepted02.07.2026
ulbbnediss.instituteMathematisch-Naturwissenschaftliche Fakultät : Fachgruppe Mathematik / Institut für Numerische Simulation (INS)
ulbbnediss.fakultaetMathematisch-Naturwissenschaftliche Fakultät
dc.contributor.coRefereeNeitzel, Ira
ulbbnediss.contributor.orcidhttps://orcid.org/0009-0009-4233-247X
ulbbnediss.contributor.gnd1415418624


Files in this item

Thumbnail

This item appears in the following Collection(s)

Show simple item record

The following license files are associated with this item:

Namensnennung 4.0 International