Retour
NOTE

Artificial General Intelligence (AGI) :
Anticipation des objectifs et implications pour la sécurité et le contrôle

Octobre 2025|GPAI Policy Lab

Télécharger la note (PDF)

Résumé

Les développeurs n'écrivent pas directement l'objectif interne des modèles d'IA : l'entraînement sélectionne les comportements qui performent en entraînement, sans internaliser les objectifs souhaités.

La complexité des objectifs humains rend impossible de spécifier exhaustivement les comportements attendus, et oblige à optimiser sur des proxys simplifiés. Suivant la loi de Goodhart, optimiser intensément un proxy amène à des résultats découplés de l'objectif. En conséquence, les IA adoptent fréquemment des comportements inattendus qui maximisent le score sans réaliser l'intention.

Par ailleurs, l'entraînement récompense la performance mesurée sur un nombre restreint d'exemples, ce qui favorise la conformité de surface plutôt que l'alignement interne. Ainsi, même en spécifiant parfaitement de bons objectifs lors de l'entraînement, il faut s'attendre à ce que ces objectifs ne soient pas internalisés et que d'autres objectifs soient poursuivis une fois qu'une AGI aura été déployée dans le monde.

Les incitations techniques, économiques et concurrentielles poussent au développement de systèmes de plus en plus performants, généraux et agentiques. Ces modèles seront de plus en plus capables de développer un modèle du monde, d'internaliser des objectifs, de planifier pour atteindre ces objectifs, et de modifier leur environnement pour dérouler ce plan de manière autonome.

Tout agent suffisamment capable tend à développer des objectifs instrumentaux convergents : préservation fonctionnelle (éviter d'être interrompu), résistance à la modification de ses objectifs, acquisition de ressources, auto-amélioration. Ces comportements sont renforcés mécaniquement à l'entraînement car ils augmentent les chances de réussite indépendamment des buts finaux poursuivis.

Les modèles avancés acquièrent également des capacités de modélisation de leur environnement (situational awareness). Ils peuvent détecter s'ils sont en situation d'évaluation et adapter leur comportement pour maximiser leur score.

Il en résulte des dynamiques problématiques dont on observe déjà les prémisses : simulation d'alignement (deception), sous-performance volontaire (sandbagging), et complaisance visant à satisfaire l'utilisateur (sycophancy). Ces tendances compromettent la fiabilité des évaluations et posent un problème de contrôle en creusant un écart entre comportements apparents et réels.

Citer cette note

General-Purpose AI Policy Lab, « Artificial General Intelligence (AGI) : Anticipation des objectifs et implications pour la sécurité et le contrôle », Note n°2, octobre 2025. https://gpaipolicylab.org/note-2

General Purpose AI Policy Lab
Mail de contact : contact@gpaipolicylab.org
Localisation : Campus Cyber 5-7 rue Bellini, La Défense, Puteaux

© 2025 GPAI Policy Lab. Tous droits réservés.