Suche

Finde Modelle, Firmen und Themen

Suche im News-Archiv nach Themen, die du dauerhaft verfolgen willst.

Ergebnisse für “Offline RL”
Forschung

<h1>LLM-gesteuerte Subgoal-Ordnung verbessert Offline RL bei sparsamen Belohnungen</h1> <p>Offline-Reinforcement-Learning (RL) lernt aus vorab gesammelten Datensätzen und vermeidet damit teure und riskante Online-Interaktionen. Bei Aufgaben mit langen Zeithorizonten und seltenen Belohnungen stößt es jedoch häufig an Grenzen. Traditionelle Offline‑RL‑Ansätze, die Aufgaben in Zwischenziele zerlegen, berücksichtigen meist nicht die zeitlichen Abhängigkeiten zwischen diesen Subzielen und setzen auf ungenaue Bel

arXiv – cs.LG