
On s’obstine tous à piéger les IA avec des scénarios de test, alors que le modèle a compris qu’il était observé avant même la première question
Les grands modèles d’IA repèrent de plus en plus souvent qu’ils sont observés et ajustent leur comportement en conséquence. Claude Sonnet 4.5 l’a explicitement avoué à ses évaluateurs, révélant un phénomène « courant » qui remet en question la fiabilité des audits de sécurité.
