Aller au contenu
Notitia

RLHFReinforcement Learning from Human Feedback

Réponse directe

Une méthode d’alignement utilisant des préférences humaines pour améliorer les réponses.

Explication détaillée

Des évaluateurs comparent ou notent des réponses, puis ces préférences servent à orienter le modèle. Le RLHF peut rendre un assistant plus utile et plus sûr sans garantir l’absence d’erreurs ou de biais.

Exemple

Préférer une réponse claire et prudente à une réponse confuse ou dangereuse.

Analogie

Un coach qui classe plusieurs essais pour guider progressivement le comportement.

Erreurs fréquentes

Croire que chaque réponse est relue en direct par un humain.

Termes liés

Dernière mise à jour : 22/07/2026 · Rédaction : Alban Speckaert