DPODirect Preference Optimization
Réponse directe
Une méthode qui entraîne directement un modèle à préférer de meilleures réponses.
Explication détaillée
La DPO utilise des paires de réponses préférée et rejetée pour ajuster le modèle, sans construire séparément un modèle de récompense complet. Elle est souvent employée lors de l’alignement.
Exemple
Apprendre à favoriser une réponse précise plutôt qu’une réponse verbeuse et incorrecte.
Analogie
Étudier directement des comparaisons bon/mauvais pour améliorer son jugement.
Erreurs fréquentes
Confondre cette DPO avec le délégué à la protection des données du RGPD.
Dernière mise à jour : 22/07/2026 · Rédaction : Alban Speckaert
