Retour
NOTE

Évaluation des IA de frontière :
des difficultés croissantes

Juin 2026|GPAI Policy Lab

Télécharger la note (PDF)

Résumé exécutif

— Contexte —

La présidence française du G7 place la sécurité de l’IA au sommet de l’agenda numérique, permettant d’aborder les questions de sécurité dans leur globalité. Actuellement, la sécurité de l’IA repose en partie sur la capacité des évaluations à documenter les risques des systèmes de frontière. Or, les évaluations sous-estiment structurellement les capacités réelles des modèles, et peuvent maintenant être détectées et contournées par les systèmes d’IA les plus avancés. Cette note examine ce que les évaluations peuvent, et ne peuvent pas apporter en matière de garanties de sécurité.

Tom David, Président-Directeur Général
du General-Purpose AI Policy Lab

— Questions —

  • ●Quelles sont les spécificités du domaine de l’évaluation de l’IA ?
  • ●À quelles difficultés les évaluateurs devront-ils faire face dans les années à venir ?
  • ●Quelles leçons peut-on en tirer pour l’évaluation des IA à usage général ?

— Synthèse —

Les développeurs d’IA à usage général de frontière ne contrôlent pas les capacités et comportements exacts des IA qu’ils entraînent, et se reposent donc sur des évaluations. Ces capacités ne sont pas spécifiées par les développeurs, mais émergent d’un processus d’entraînement empirique et itératif formant des « boîtes noires ». Les évaluations sont ainsi le principal moyen d’accéder à ce que le modèle a réellement appris.

Les évaluations actuelles, majoritairement construites comme des examens figés, présentent plusieurs problèmes bien documentés : contamination des données d’entraînement, saturation rapide des tests les plus difficiles, erreurs dans la conception des tâches par les experts humains et impossibilité de spécifier parfaitement l’objectif souhaité.

Deux propriétés intrinsèques biaisent en outre les conclusions : l’écart d’élicitation (elicitation gap), qui conduit à sous-estimer systématiquement les capacités réelles et rend impossible de prouver qu’un échec n’est pas dû à des conditions sous-optimales ; et la capacité à détecter le contexte d’évaluation (evaluation awareness), qui permet aux modèles de produire des sorties différentes en test et en déploiement (sandbagging).

Schéma en iceberg : les capacités évaluées ne représentent qu'une partie des capacités réelles ; l'écart provient de l'élicitation, du sandbagging et des capacités hors benchmark.
Sources de divergence entre les capacités mesurées et réelles des systèmes d’IA à usage général.

Il n’est donc pas possible, dans le paradigme actuel, de garantir l’absence de capacités dangereuses dans un système d’IA de frontière sur la seule base d’évaluations. Elles offrent des signaux importants, mais le développement d’un cadre de gestion des risques comparable à celui d’autres industries critiques reste un problème ouvert.

Enfin, l’accès aux modèles conditionne fortement la qualité des évaluations. Seules quelques organisations partenaires (UK AISI, US CAISI, METR) disposent d’un accès précoce, généralement incomplet et soumis aux délais imposés par les développeurs.

— Implications pour les acteurs français et européens —

L’accès précoce aux modèles de frontière est indispensable

La crédibilité des dispositifs européens d’évaluation dépendra de leur capacité à obtenir un accès étendu aux modèles. Évaluer uniquement avant déploiement ne permettra pas de suivre les risques qui émergent durant les phases d’entraînement.

Les évaluations ne fournissent pas de garanties de sécurité

L’elicitation gap et l’evaluation awareness impliquent que des évaluations favorables sont un signal nécessaire mais non suffisant pour décider du déploiement d’un modèle. Aucune approche connue ne peut actuellement fournir de garantie de sécurité pour ces systèmes.

Citer cette note

General-Purpose AI Policy Lab, « Évaluation des IA de frontière : des difficultés croissantes », Note n°7, juin 2026. https://gpaipolicylab.org/note-7

General Purpose AI Policy Lab
Mail de contact : contact@gpaipolicylab.org
Localisation : Campus Cyber 5-7 rue Bellini, La Défense, Puteaux

© 2025 GPAI Policy Lab. Tous droits réservés.