Le mélange d'experts est une technique qui active, pour chaque question, seulement une petite partie d'un grand modèle d'IA, comme consulter uniquement les spécialistes concernés au sein d'une grande organisation.
Architecture de réseau de neurones où seule une fraction des paramètres (les 'experts') est activée dynamiquement pour chaque Token ou requête, selon une passerelle (gating). Cette approche permet de construire des modèles très grands tout en réduisant le coût de calcul par inférence. Elle est utilisée dans Mixtral, Grok et certaines versions de GPT. En ESG, elle améliore l'efficacité énergétique des modèles, mais complique l'audit et l'explicabilité.
Gain de sobriété réel à l'inférence, mais deux angles morts : (1) l'empreinte d'entraînement reste élevée (le modèle complet doit être appris) et l'empreinte intrinsèque des GPU s'amortit sur une base d'usage plus étroite ; (2) la logique de routage entre experts est un composant supplémentaire à auditer (biais du gating, spécialisation cachée sur certaines populations). Documenter la métrique pertinente : énergie par requête réelle, pas nombre théorique de paramètres actifs.
Un modèle MoE de 70 milliards de paramètres n'active que 12 milliards par requête, réduisant la consommation GPU de 40 % comparé à un modèle dense équivalent pour la classification de documents ESG.
Termes connexes (Technologie)
IA fantôme (Shadow AI)
Utilisation non autorisée d'outils d'intelligence artificielle par les employés, contournant les politiques de sécurité, de conformité et de gouvernance de l'entreprise. Ce phénomène représente un risque ESG majeur : fuite de données sensibles, non-conformité RGPD/IA Act, absence de traçabilité et d'audit.
Ingénierie de prompt ESG
Discipline d'optimisation des instructions textuelles (prompts) données aux modèles d'IA pour obtenir des réponses pertinentes, précises et conformes aux exigences du reporting de durabilité. Inclut la structuration des requêtes, l'injection de contexte réglementaire et la réduction des hallucinations.
Hallucination IA
Génération par un modèle d'IA de contenus faux, inventés ou non étayés par les données sources, présentés avec une apparence de certitude. Risque critique pour le reporting ESG où l'exactitude et la traçabilité des informations sont essentielles pour l'audit externe.
Token (unité de traitement IA)
Unité élémentaire de texte traitée par les modèles de langage (environ 4 caractères ou 0,75 mot en français). Le nombre de tokens détermine le coût de calcul, la consommation énergétique et l'empreinte carbone d'une requête IA. Métrique clé pour l'optimisation Green AI.
GPU (Processeur graphique)
Processeur spécialisé dans le calcul parallèle, essentiel pour l'entraînement et l'inférence des modèles d'IA. Les GPU représentent la principale source de consommation énergétique et d'émissions carbone des infrastructures IA, avec des enjeux d'approvisionnement en terres rares et de recyclage.
Récupération de chaleur fatale (data center)
Valorisation de la chaleur résiduelle générée par les serveurs et GPU des centres de données pour alimenter des réseaux de chauffage urbain, des serres agricoles ou des processus industriels. Levier clé d'économie circulaire pour réduire l'impact environnemental net des infrastructures IA.
