Aller au contenu
Notitia

Latence

Réponse directe

Le délai entre une demande et le début ou la fin de la réponse.

Explication détaillée

La latence dépend du réseau, de la charge, du modèle et de la quantité de calcul. Le temps avant le premier token et le temps total sont deux mesures différentes.

Exemple

Un assistant commence à répondre après 800 millisecondes.

Analogie

Le temps d’attente avant qu’un interlocuteur commence à parler.

Erreurs fréquentes

Confondre faible latence et grande vitesse de génération après le démarrage.

Dernière mise à jour : 22/07/2026 · Rédaction : Alban Speckaert