Concept LLM & agents
Inférence / Inference
Que veut dire « Inférence / Inference » dans le jargon de l’IA ?
Le moment où le modèle produit une réponse à partir d'une entrée. C'est l'usage courant, par opposition à l'entraînement. En local, l'inférence consomme votre GPU.
Autres formes : inference, inférence, Inférence.
L'inférence est la phase d'usage d'un modèle déjà entraîné : il reçoit une entrée et produit une sortie, sans que ses paramètres internes changent. C'est ce qui se passe à chaque appel, par opposition à l'entraînement ou au fine-tuning.
Exemple d’usage : Une relecture d'article a corrigé une confusion fréquente : l'inférence, la génération de tokens un par un lors de l'utilisation du modèle, n'est pas aussi parallélisable que le laisse penser la comparaison avec l'entraînement ou le traitement initial du prompt.
Laisser un commentaire