zurück zur Suche
Du lernst die mathematischen Grundlagen von Reinforcement Learning kennen: Markov-Entscheidungsprozesse (MDPs), tabellarische RL-Methoden wie Monte Carlo, Temporal Difference, SARSA und Q-Learning sowie Grundlagen der stochastischen Approximationsrechnung, um Konvergenzen dieser Algorithmen zu analysieren. Am Ende kannst Du dynamische Entscheidungsprobleme unter Unsicherheit als MDP formulieren und mit tabellarischen RL-Algorithmen lösen.
Noch keine Bewertungen für dieses Modul.
Fülle nur die Kategorien aus, die du beurteilen kannst – je Kategorie entweder Sterne und Text zusammen oder gar nichts.
Bewertungen werden vor der Veröffentlichung automatisch geprüft.
Offizielle Seite in TUMonline · Angaben unverbindlich.