Apprentissage par renforcementRL — Reinforcement Learning
Réponse directe
Une méthode où un agent apprend à choisir des actions en recevant des récompenses ou des pénalités dans un environnement.
Explication détaillée
L’agent essaie des actions, observe leurs conséquences et ajuste sa stratégie, appelée politique, afin d’augmenter les récompenses cumulées. Une récompense peut être immédiate ou arriver après une suite d’actions, ce qui rend l’apprentissage plus complexe. La qualité du comportement dépend fortement de la manière dont l’objectif et les récompenses ont été définis.
Exemple
Dans un jeu, un agent reçoit une récompense lorsqu’il gagne. En évaluant de nombreuses parties, il apprend quelles suites d’actions augmentent ses chances de victoire.
Analogie
C’est comme apprendre à sortir d’un labyrinthe avec des points gagnés pour les bons progrès et perdus pour les impasses.
Erreurs fréquentes
« Renforcement signifie seulement féliciter une bonne réponse. » La méthode porte sur des actions, un environnement et des récompenses cumulées.
« RL et RLHF sont synonymes. » Le RLHF est une application particulière utilisant un signal issu de préférences humaines.
« Une récompense élevée garantit un bon comportement. » Un agent peut exploiter une règle mal définie sans accomplir l’intention réelle.
Termes liés
Sources
- Reinforcement Learning: An Introduction — Sutton et Barto — Sutton & Barto · consulté le 2026-07-24
- Google for Developers — Machine Learning Glossary, reinforcement learning — Google for Developers · consulté le 2026-07-24
Dernière mise à jour : 24/07/2026 · Rédaction : Alban Speckaert
