Latence
Réponse directe
Le délai entre une demande et le début ou la fin de la réponse.
Explication détaillée
La latence dépend du réseau, de la charge, du modèle et de la quantité de calcul. Le temps avant le premier token et le temps total sont deux mesures différentes.
Exemple
Un assistant commence à répondre après 800 millisecondes.
Analogie
Le temps d’attente avant qu’un interlocuteur commence à parler.
Erreurs fréquentes
Confondre faible latence et grande vitesse de génération après le démarrage.
Dernière mise à jour : 22/07/2026 · Rédaction : Alban Speckaert
