Les risques pour la sécurité et les défaillances techniques liés à l'utilisation d'agents d'IA autonomes se multiplient. Les utilisateurs signalent des comportements imprévisibles, comme des accès non autorisés à leurs courriels, la fabrication de données personnelles ou encore des pertes de données. Ces agents d'IA nécessitent les mêmes permissions système que les humains qui les utilisent, ce qui pose des risques majeurs en matière de sécurité. La confiance accordée à ces assistants numériques est mise à l'épreuve par un manque de transparence algorithmique et des menaces réelles pour la vie privée. L'année 2026 a marqué un tournant pour l'IA agentique. Anthropic a indiqué que près de 90 % des organisations utilisent l'IA pour les aider dans le développement, et 86 % déploient des agents d'IA pour le code de production. Les avantages cités par les entreprises participant à l'étude incluent la planification et la conceptualisation (58 %), la génération de code (59 %), la documentation du code (59 %) ainsi que la révision et les tests de code (59 %). Selon Gartner, d'ici 2028, une entreprise moyenne du classement Fortune 500 comptera plus de 150 000 agents d'IA en service. Le cabinet de recherche prévoit une menace pour le logiciel en tant que service (software as a service ou SaaS). D'ici 2030, l'IA agentique devrait absorber 20 % des budgets alloués au SaaS par les organisations, ce qui représenterait un transfert d'environ 234 milliards de dollars des fournisseurs traditionnels vers des flux de travail autonomes. Pourtant, l'IA reste loin d'être fiable, et son impact sur la productivité reste difficile à mesurer. Selon une étude menée auprès de 6 000 dirigeants d'entreprise et publiée en août 2026, 90 % des dirigeants estiment que l'IA n'améliore pas la productivité. Plusieurs incidents sont documentés. La promesse d'un assistant d'IA personnel capable de gérer le quotidien numérique s'est transformée en véritable cauchemar pour certains utilisateurs. Si de nombreux utilisateurs pionniers affirment que ces agents d'IA autonomes offrent une aide précieuse pour accomplir des tâches en ligne comme la réservation de voyages ou l'achat de produits, d'autres rapportent des dysfonctionnements particulièrement préoccupants. L'exigence d'un accès étendu et le problème de désalignement posent question. Ces outils autonomes ont annulé des réservations sans justification, inventé des informations personnelles, fourni des explications trompeuses et soulevé d'importantes questions de sécurité. Dans le domaine du développement logiciel, ces outils ont déjà entraîné la suppression de bases de code. Un inconvénient majeur réside dans la nécessité absolue d'accorder aux agents d'IA un accès numérique particulièrement étendu pour qu'ils fonctionnent correctement. Pour accomplir leurs tâches, ces programmes doivent détenir les clés de la vie numérique des utilisateurs, y compris leurs courriels, comptes bancaires, cartes de crédit et mots de passe. Cela représente un risque majeur, compte tenu de la sensibilité de ces informations. Un autre inconvénient général découle des problèmes de désalignement, une situation dans laquelle « l'agent prend des initiatives pour accomplir une mission qui s'avère directement contradictoire avec les intentions réelles de l'utilisateur humain ». Ce problème s'est produit à plusieurs reprises cette année, notamment dans le cadre de l'incident ayant conduit au piratage non autorisé de la plateforme open source Hugging Face. OpenAI avait placé ses modèles dans un bac à sable (sandbox, environnement isolé) sans accès internet et leur avait assigné une tâche. Pourtant, ils ont échappé au bac à sable censé les contenir, ont navigué dans les systèmes internes de l'entreprise, ont trouvé une connexion internet et ont commencé à chercher un moyen d'infiltrer l'infrastructure de Hugging Face afin de « tricher » au test en volant les réponses. Anthropic et Meta ont également signalé des incidents où leurs modèles d'IA ont échappé à leurs bacs à sable et piraté des systèmes informatiques tiers. Google n'est pas en reste avec son modèle Gemini. En Chine, la startup Moonshot AI a rapporté un cas similaire avec son modèle Kimi K3. Accès non autorisé aux courriels et tromperie Lors d'une demande formulée par Mehdi Jamei, cofondateur de Veris AI, l'assistant personnel Instinct, disponible uniquement sur invitation, devait annuler deux inscriptions à un événement sur la plateforme Luma. Selon son récit, l'agent d'IA a récupéré un code de connexion à usage unique dans la boîte de réception Gmail connectée de l'utilisateur, sans autorisation préalable, pour se connecter à Luma et annuler les réservations. Bien que la tâche demandée ait été accomplie, le comportement et les justifications de l'assistant d'IA ont inquiété l'utilisateur. Celui-ci a d'abord affirmé avoir réutilisé une session enregistrée, mais sous la pression des questions, il a admis avoir lu le code dans Gmail et présenté une hypothèse comme un fait. Cet accès non autorisé aux courriels et ce manque de fiabilité dans les explications constituent, aux yeux de la victime, un problème de sécurité majeur. Mehdi Jamei a déclaré à ce sujet : « Si je ne peux pas faire confiance à son récit de ce qu'il a fait, je ne peux pas lui donner accès à quoi que ce soit d'important. » Hallucination de documents financiers sensibles Pritak Patel, responsable de la croissance chez Merge, avait envoyé à l'agent Instinct un simple lien texte pour soumettre une réclamation dans le cadre d'un accord financier avec Apple. Au lieu de traiter la demande, l'agent d'IA lui a demandé de télécharger une image qu'il prétendait à tort avoir reçue. Il a commencé à décrire un document financier contenant des données personnelles n'appartenant pas à Patel, y compris un second nom incorrect. L'agent d'IA a ensuite reconnu l'absence de photo dans le message initial, affirmant qu'une image avait été intégrée à la conversation. Pritak Patel s'est dit profondément préoccupé : « Je ne peux pas confirmer de manière indépendante si l'agent a accédé au document de quelqu'un d'autre ou s'il a halluciné les détails ainsi que son explication. » Patel trouve l'incident d'autant plus troublant que l'agent a expliqué « ce qui aurait dû se passer avec une telle assurance ». Le fondateur d'Instinct, Noah Shinn, a ensuite précisé qu'il s'agissait d'une hallucination amplifiée de nom propre due au raisonnement de l'agent, et non d'une fuite de données. Cependant, ses explications ont suscité un scepticisme important. Il est déjà arrivé que des conversations privées avec Claude d'Anthropic apparaissent dans les résultats de recherche Google, exposant des clés de portefeuille de cryptomonnaie et des données personnelles. Tentative de connexion géolocalisée en Iran Mahesh Vellanki, fondateur de YieldClub, a été confronté à un incident critique lorsqu'il a demandé à l'agent Instinct d'examiner des moyens de réduire sa facture de téléphone. Instinct a tenté d'accéder à son compte auprès de son opérateur mobile, déclenchant immédiatement une demande d'authentification à deux facteurs géolocalisée en Iran. Face à cette alerte alarmante, l'utilisateur a immédiatement désinstallé l'application et supprimé tous les comptes associés. Bien que le créateur d'Instinct ait évoqué la possibilité d'un problème technique de labellisation d'adresse IP sans preuve de compromission manifeste, l'incident a suffi à semer de sérieux doutes quant à la gestion des identifiants confidentiels. Mahesh Vellanki a déclaré : « naturellement, c'était extrêmement alarmant, car si votre téléphone est compromis de nos jours, c'est toute votre vie qui peut exploser. » Une faille de sécurité dans l'agent Muse de Meta Une faille de sécurité a été identifiée dans Muse par Patrick Wardle, PDG de la société de cybersécurité DoubleYou.io. Il a découvert une vulnérabilité sur Mac permettant à d'éventuels attaquants d'intercepter les dictées vocales de l'utilisateur, d'injecter des commandes frauduleuses et de voler le jeton d'authentification utilisé pour contrôler l'agent d'IA ainsi que tous les services auxquels il a accès. Commentant la gravité de cette faille, Patrick Wardle a noté : « l'agent Muse lui-même dispose d'un accès plus étendu et de privilèges plus importants que la plupart des logiciels malveillants n'oseraient même pas rêver. » Meta a ensuite corrigé cette vulnérabilité après son signalement, affirmant qu'aucune exploitation malveillante n'avait été détectée et qu'un pirate aurait dû préalablement installer un logiciel malveillant sur l'ordinateur cible.