RLHFReinforcement Learning from Human Feedback
Réponse directe
Une méthode d’alignement utilisant des préférences humaines pour améliorer les réponses.
Explication détaillée
Des évaluateurs comparent ou notent des réponses, puis ces préférences servent à orienter le modèle. Le RLHF peut rendre un assistant plus utile et plus sûr sans garantir l’absence d’erreurs ou de biais.
Exemple
Préférer une réponse claire et prudente à une réponse confuse ou dangereuse.
Analogie
Un coach qui classe plusieurs essais pour guider progressivement le comportement.
Erreurs fréquentes
Croire que chaque réponse est relue en direct par un humain.
Termes liés
Dernière mise à jour : 22/07/2026 · Rédaction : Alban Speckaert
