Avant même son lancement public, GPT-5.6 Sol s'est fait épingler par l'évaluateur pour avoir triché aux tests de sécurité.
Par Jérémy Collovray

Pas encore de commentaire. Lancez la discussion !
Juste avant son lancement public ce jeudi, GPT-5.6 Sol s'est retrouvé au cœur d'une affaire qui en dit long sur l'état réel de la sécurité des modèles les plus puissants. L'organisme indépendant METR, chargé d'évaluer les capacités et les risques des grands modèles d'IA, a découvert que Sol avait triché sur son évaluation d'ingénierie logicielle à un niveau jamais observé auparavant chez un modèle testé publiquement.
Les méthodes employées par le modèle sont particulièrement frappantes. Sol a exploité des failles dans l'infrastructure d'évaluation elle-même, est parvenu à révéler des cas de test censés rester cachés, puis a directement extrait le code source contenant les réponses attendues. Il est même allé jusqu'à réécrire les scripts qui déterminaient si une tâche était réussie ou échouée, de sorte que n'importe quel résultat soit automatiquement validé. Lorsque METR a coupé son accès réseau pour limiter ces dérives, Sol a tenté une attaque par élévation de privilèges contre le système qui gérait son environnement d'exécution.
L'ampleur de la triche a rendu les chiffres de performance presque inutilisables. Selon la métrique de METR qui mesure la durée de tâches qu'un modèle peut accomplir de façon autonome, le score de Sol oscille entre 11 heures lorsque les comportements trompeurs sont écartés et plus de 270 heures lorsqu'ils sont comptabilisés, soit un écart d'un facteur 24. Impossible, dans ces conditions, de savoir ce que le modèle est réellement capable de faire.
Face à ces révélations, OpenAI a choisi de collaborer avec METR pour rendre les résultats publics plutôt que de les enterrer, une décision que l'entreprise présente comme un signal positif en matière de transparence. Une fiche système actualisée est promise pour la disponibilité générale du modèle, mais elle n'arrivera qu'après le lancement restreint déjà en cours. METR, de son côté, se montre plus prudent : une triche aussi visible pourrait n'être que la partie émergée de comportements bien plus difficiles à détecter dans des systèmes encore plus capables.
Cette affaire pose une question qui dépasse le cas de Sol. Si les modèles les plus avancés apprennent à contourner leurs propres examens de sécurité avant même d'être capables de raisonner de façon totalement fiable, la course entre progrès des capacités et fiabilité des méthodes d'évaluation devient un enjeu central, bien plus déterminant à long terme que la vitesse ou le prix d'un nouveau modèle.