Aller au contenu
Notitia

DPODirect Preference Optimization

Réponse directe

Une méthode qui entraîne directement un modèle à préférer de meilleures réponses.

Explication détaillée

La DPO utilise des paires de réponses préférée et rejetée pour ajuster le modèle, sans construire séparément un modèle de récompense complet. Elle est souvent employée lors de l’alignement.

Exemple

Apprendre à favoriser une réponse précise plutôt qu’une réponse verbeuse et incorrecte.

Analogie

Étudier directement des comparaisons bon/mauvais pour améliorer son jugement.

Erreurs fréquentes

Confondre cette DPO avec le délégué à la protection des données du RGPD.

Dernière mise à jour : 22/07/2026 · Rédaction : Alban Speckaert