Les benchmarks LLM sont des questionnaires standardisés que l'on fait passer aux modèles de langage pour comparer leurs connaissances, leur fiabilité et leur comportement conversationnel.
Benchmarks standardisés pour évaluer les performances des modèles de langage. MMLU (Massive Multitask Language Understanding) teste les connaissances sur 57 disciplines. HELM (Holistic Evaluation of Language Models) évalue de manière multidimensionnelle (précision, biais, efficacité). MT-Bench évalue les capacités conversationnelles via des juges automatiques. Ces benchmarks sont des indicateurs de qualité, mais ne remplacent pas une évaluation métier spécifique au contexte ESG.
Les benchmarks d'évaluation des LLM, tels que MMLU, HELM ou MT-Bench, sont des outils essentiels pour mesurer les performances et identifier les risques technologiques intrinsèques aux modèles d'IA, notamment les biais, les hallucinations ou la robustesse, qui peuvent avoir des implications directes sur les droits humains et la fiabilité des informations.
Termes connexes (Technologie)
IA fantôme (Shadow AI)
Utilisation non autorisée d'outils d'intelligence artificielle par les employés, contournant les politiques de sécurité, de conformité et de gouvernance de l'entreprise. Ce phénomène représente un risque ESG majeur : fuite de données sensibles, non-conformité RGPD/IA Act, absence de traçabilité et d'audit.
Ingénierie de prompt ESG
Discipline d'optimisation des instructions textuelles (prompts) données aux modèles d'IA pour obtenir des réponses pertinentes, précises et conformes aux exigences du reporting de durabilité. Inclut la structuration des requêtes, l'injection de contexte réglementaire et la réduction des hallucinations.
Hallucination IA
Génération par un modèle d'IA de contenus faux, inventés ou non étayés par les données sources, présentés avec une apparence de certitude. Risque critique pour le reporting ESG où l'exactitude et la traçabilité des informations sont essentielles pour l'audit externe.
Token (unité de traitement IA)
Unité élémentaire de texte traitée par les modèles de langage (environ 4 caractères ou 0,75 mot en français). Le nombre de tokens détermine le coût de calcul, la consommation énergétique et l'empreinte carbone d'une requête IA. Métrique clé pour l'optimisation Green AI.
GPU (Processeur graphique)
Processeur spécialisé dans le calcul parallèle, essentiel pour l'entraînement et l'inférence des modèles d'IA. Les GPU représentent la principale source de consommation énergétique et d'émissions carbone des infrastructures IA, avec des enjeux d'approvisionnement en terres rares et de recyclage.
Récupération de chaleur fatale (data center)
Valorisation de la chaleur résiduelle générée par les serveurs et GPU des centres de données pour alimenter des réseaux de chauffage urbain, des serres agricoles ou des processus industriels. Levier clé d'économie circulaire pour réduire l'impact environnemental net des infrastructures IA.
