Diversity in Reinforcement Learning
Diversity in Reinforcement Learning

| dc.contributor.advisor | Garcke, Jochen | |
| dc.contributor.author | Feiden, Arno Berengar | |
| dc.date.accessioned | 2026-08-04T09:39:37Z | |
| dc.date.available | 2026-08-04T09:39:37Z | |
| dc.date.issued | 04.08.2026 | |
| dc.identifier.uri | https://hdl.handle.net/20.500.11811/14349 | |
| dc.description.abstract | Reinforcement learning is a machine learning paradigm that aims to develop optimal policies for discrete-time control problems based on quantitative feedback on the learner’s behaviour. Reinforcement learning is formulated as a gradient-based optimisation procedure, but reinforcement learning problems with unique optimal solutions are rare. This work focuses on ways to distinguish policies that solve the same reinforcement learning problem differently. A pointed analysis of reinforcement learning literature, specifically of policy gradient methods, shows that policies are best understood through their behaviour: The actions that the policy selects based on the encountered state. There are two equivalent main approaches to understanding this behaviour empirically: Episodic behavioural characterisation, which interprets a policy as a random element in the space of state-action time series and behavioural characterisation through the occupancy measure, which interprets a policy as a random element representing the visitation frequency in the space of state-action pairs. Both characterisations can be used to deduce general, problem-agnostic distance measures either by comparing time series or by comparing sampled distributions. Their utility is first explored by visualising small populations of policies. The relationships between policies that emerge in the visualisation also reflect other, hidden relationships, thereby validating the approach. This idea is then integrated with an evolutionary algorithm. Evolutionary computation is a branch of optimisation techniques that improve populations of candidate solutions. In quality-diversity methods specifically, the members of the population are encouraged to differ from one another to improve the evolutionary process. When these methods are used to solve reinforcement learning problems, a measure of distance between candidate solutions is required. The developed techniques to distinguish policies are successfully connected with MAP-Elites, a quality-diversity heuristic that is often used for reinforcement learning problems and typically distinguishes policies based on selective, problem-specific criteria. The applications validate the established general distances measure, but they also show that a diverse population of solutions is, for example, more explorative and more robust against environmental changes even if the diversity is not directed towards the specific goal such as exploration or robustness. This reveals the intrinsic value of diversity. | en |
| dc.description.abstract | Vielfalt im verstärkenden Lernen Verstärkendes Lernen ist ein Paradigma des maschinellen Lernens, das darauf abzielt, optimale Strategien für zeitdiskrete Steuerungsprobleme auf der Grundlage quantitativer Rückmeldungen zum Verhalten des Lernenden zu entwickeln. Verstärkendes Lernen wird als gradientenbasiertes Optimierungsverfahren formuliert, konkrete Probleme haben allerdings selten eindeutige optimale Lösungen. Diese Arbeit konzentriert sich darauf, Strategien zu unterscheiden, die dasselbe Problem unterschiedlich lösen. Eine gezielte Analyse der Literatur zum verstärkenden Lernen, insbesondere zu Gradientenverfahren auf Strategien, zeigt, dass diese am besten anhand ihres Verhaltens verstanden werden: anhand der Aktionen, die die Strategie auf Grundlage des Systemzustands auswählt. Es gibt zwei gleichwertige, zentrale Ansätze, um dieses Verhalten empirisch zu verstehen: die episodische Verhaltenscharakterisierung, die eine Strategie als Zufallsvariable im Raum der Zustands-Aktions-Zeitreihen interpretiert, und die Verhaltenscharakterisierung durch die Belegungsmaßzahl, die eine Strategie als Zufallsvariable im Raum der Zustands-Aktions-Paare interpretiert. Beide Charakterisierungen können verwendet werden, um allgemeine, problemunabhängige Distanzmaße abzuleiten, entweder durch den Vergleich von Zeitreihen oder durch den Vergleich von Stichprobenverteilungen. Ihr Nutzen wird zunächst durch die Visualisierung kleiner Populationen von Strategien untersucht. Die Beziehungen zwischen den Strategien, die sich in der Visualisierung zeigen, spiegeln auch andere, verborgene Beziehungen wider, was den Ansatz validiert. Diese Idee wird dann in einen evolutionären Algorithmus integriert. Evolutionäres Rechnen ist eine Sparte von Optimierungstechniken, die Populationen von potenziellen Lösungen iterativ verbessern. Insbesondere bei Qualitäts-Diversitäts-Methoden werden die Individuen dieser Population dazu angeregt, unterschiedlich zu sein, um den evolutionären Prozess zu verbessern. Wenn solche Methoden zur Lösung von Problemen des verstärkenden Lernens eingesetzt werden, ist ein Distanzmaß zwischen Strategien erforderlich. Die entwickelten Techniken zur Unterscheidung von Strategien lassen sich erfolgreich mit MAP-Elites verbinden, einer Qualitäts-Diversitäts-Heuristik, die häufig für Probleme des verstärkenden Lernens verwendet wird und Strategien in der Regel anhand selektiver, problemspezifischer Kriterien unterscheidet. Die Anwendungen validieren die hier etablierten, allgemeinen Distanzmaße, zeigen aber auch, dass eine vielfältige Population von Lösungen zum Beispiel explorativer und robuster gegenüber Umweltveränderungen ist, selbst wenn die Vielfalt nicht auf ein bestimmtes Ziel wie Exploration oder Robustheit ausgerichtet ist. Das offenbart den intrinsischen Wert von Vielfalt. | de |
| dc.language.iso | eng | |
| dc.rights | Namensnennung 4.0 International | |
| dc.rights.uri | http://creativecommons.org/licenses/by/4.0/ | |
| dc.subject | Verstärkendes Lernen | |
| dc.subject | Vielfalt | |
| dc.subject | Zeitreihenanalyse | |
| dc.subject | Datenverarbeitung | |
| dc.subject | Reinforcement Learning | |
| dc.subject | Occupancy Measure | |
| dc.subject | Quality-Diversity | |
| dc.subject | Data Analysis | |
| dc.subject.ddc | 510 Mathematik | |
| dc.title | Diversity in Reinforcement Learning | |
| dc.type | Dissertation oder Habilitation | |
| dc.publisher.name | Universitäts- und Landesbibliothek Bonn | |
| dc.publisher.location | Bonn | |
| dc.rights.accessRights | openAccess | |
| dc.identifier.urn | https://nbn-resolving.org/urn:nbn:de:hbz:5-91296 | |
| dc.relation.doi | https://doi.org/10.1145/3583133.3590741 | |
| dc.relation.doi | https://doi.org/10.1145/3638530.3654295 | |
| dc.relation.doi | https://doi.org/10.1145/3712256.3726337 | |
| ulbbn.pubtype | Erstveröffentlichung | |
| ulbbnediss.affiliation.name | Rheinische Friedrich-Wilhelms-Universität Bonn | |
| ulbbnediss.affiliation.location | Bonn | |
| ulbbnediss.thesis.level | Dissertation | |
| ulbbnediss.dissID | 9129 | |
| ulbbnediss.date.accepted | 02.07.2026 | |
| ulbbnediss.institute | Mathematisch-Naturwissenschaftliche Fakultät : Fachgruppe Mathematik / Institut für Numerische Simulation (INS) | |
| ulbbnediss.fakultaet | Mathematisch-Naturwissenschaftliche Fakultät | |
| dc.contributor.coReferee | Neitzel, Ira | |
| ulbbnediss.contributor.orcid | https://orcid.org/0009-0009-4233-247X | |
| ulbbnediss.contributor.gnd | 1415418624 |
Files in this item
This item appears in the following Collection(s)
-
E-Dissertationen (4610)




