Un communiqué publié par l'entreprise française de cybersécurité YesWeHack jeudi met en évidence une découverte surprenante : l'agent de codage d'OpenAI, Codex, a été capable d'identifier et d'exploiter indépendamment une vulnérabilité critique dans WordPress, pouvant mener à l'exécution de code à distance. Cette révélation a relancé les débats sur le rôle de l'intelligence artificielle en cybersécurité et dans les programmes de récompense pour la détection de vulnérabilités, où les chercheurs sont payés pour trouver et signaler les fautes logicielles. L'essai a impliqué Codex, alimenté par le modèle GPT-5.6 Sol, et a démontré que l'IA peut effectuer de manière autonome des tâches complexes généralement gérées par des experts humains. Lancé par OpenAI en avril 2025, Codex est principalement un outil en ligne de commande conçu pour écrire et exécuter du code en fonction d'instructions naturelles.
Pour les tests, YesWeHack a connecté Codex à des outils tels que Burp Suite, une plateforme largement utilisée pour tester la sécurité des applications web, et un navigateur contrôlé via le protocole MCP. Cette configuration a permis à l'IA d'observer et de manipuler le trafic web, de la même manière qu'un testeur de pénétration humain le ferait. L'IA a pu retracer les vulnérabilités jusqu'à leur source en analysant l'application depuis l'extérieur. En outre, les chercheurs ont partagé en ligne des "feuilles de réflexion" - des stratégies prédéfinies pour l'IA - qui peuvent être personnalisées avec des expertises individuelles pour améliorer ses capacités de détection de vulnérabilités.
Un chercheur connu sous le pseudonyme HashKitten a testé Codex sur WordPress en le défiant de trouver un chemin vers l'exécution de code à distance sans aucune authentification. Le test avait été conçu pour empêcher l'IA de s'appuyer sur des solutions existantes ou de comparer ses résultats avec des correctifs connus. Codex a identifié une incohérence dans l'API de traitement par lots de WordPress, la transformant en une vulnérabilité d'injection SQL exploitables. Après avoir vérifié le résultat, le chercheur a relancé l'IA pour voir si la vulnérabilité pouvait être étendue. En quelques heures, Codex a réussi à lier la faille à d'autres comportements logiciels, créant une chaîne complète d'exécution de code à distance. Selon l'étude, l'ensemble du processus a coûté moins de 25 dollars en ressources de calcul.
YesWeHack a également testé Codex contre deux défis de sécurité "boîte noire" sur la plateforme PortSwigger, où l'IA n'avait reçu aucune information sur les vulnérabilités censées être trouvées. Dans un test, elle a identifié une vulnérabilité XSS dans la manière dont les messages étaient gérés entre les fenêtres du navigateur, malgré une recherche initiale de pages de connexion inexistantes. Dans un autre test, elle a contourné un jeton d'authentification mal sécurisé en modifiant un paramètre technique pour imiter une identité d'administrateur fictif. Les deux tâches ont été accomplies efficacement, et Codex s'est arrêté à l'objectif sans dépasser, ce que les chercheurs ont noté comme un signe de comportement responsable.
Comparé à un test similaire sur Claude Code d'Anthropic, Codex a performé plus globalement, achevant les exploits sans nécessiter d'intervention humaine. Toutefois, YesWeHack a souligné que les conditions du test n'étaient pas identiques et que les systèmes d'IA peuvent encore commettre des erreurs, s'embourber dans des pistes fausses ou créer des solutions instables. L'étude insiste sur le fait que bien que des outils d'IA comme Codex soient puissants, une surveillance humaine reste cruciale. Les chercheurs et experts en sécurité sont encore ceux qui définissent l'étendue des tests et valident si les résultats sont effectivement exploitables.
Un agent de codage IA démontre une exploitation autonome de vulnérabilités critiques
Contenu réécrit par une IA à partir de sources de presseComment ça marche
aicodexcybersecurityvulnerabilitywordpressbug-bounty
Sources d'origine :
- 🇫🇷Clubic



