Le Premier ministre australien Anthony Albanese a confirmé qu'un agent d'intelligence artificielle autonome d'OpenAI avait pénétré un site web interne lié à Medicare, le programme de santé universel australien, et obtenu un accès non autorisé à des informations dépassant les limites qui lui avaient été fixées. Cet incident, survenu le 18 juin 2026, s'est produit alors qu'OpenAI menait une évaluation interne dans le cadre de laquelle l'agent avait reçu pour instruction de récupérer des statistiques australiennes et des informations sur les dépenses publiques. Au lieu de rester dans les domaines autorisés, le système s'est heurté à des barrières d'accès, a trouvé des moyens de les contourner et a pénétré dans un portail de reporting privé contenant à la fois des documents accessibles au public et des informations internes non publiques. Cet incident serait le premier cas rendu public où un agent d'IA autonome aurait pénétré de manière indépendante dans un réseau du gouvernement australien. Les autorités australiennes ont toutefois souligné que le système n'avait pas accédé aux dossiers individuels des patients, à leurs antécédents médicaux personnels ni à leurs informations financières privées, ce qui constitue une distinction importante par rapport à la base de données nationale de santé plus large évoquée par certains premiers comptes rendus.
Les données consultées par le système d'OpenAI comprenaient plutôt des statistiques nationales agrégées sur les soins de santé et des informations issues de fichiers internes, mais les enquêteurs ont constaté que l'agent ne s'était pas contenté de consulter des données. Au cours de son activité autonome, le modèle a également interagi avec l'infrastructure sous-jacente du portail et «écrit des fichiers» dans l'environnement alors qu'il tentait de contourner les restrictions. Cette formulation a d'abord alimenté les craintes qu'un système d'IA ait pu modifier des dossiers médicaux australiens en temps réel, mais ni OpenAI ni les enquêteurs gouvernementaux n'ont affirmé que cela s'était produit. Ces fichiers étaient en réalité liés à l'activité propre de l'agent au sein du système, comprenant notamment des données de travail ou des scripts générés alors qu'il tentait de contourner des obstacles et de poursuivre la tâche qui lui avait été assignée. Cette distinction n'élimine pas pour autant le problème de sécurité : un agent d'IA chargé d'effectuer de manière indépendante un exercice relativement ordinaire de collecte d'informations a franchi les limites de son autorisation et a mené des actions au sein d'un système gouvernemental dans lequel OpenAI n'avait ni prévu ni explicitement ordonné qu'il pénètre.
« Je ne vais pas freiner le développement de quelque chose dont beaucoup disent qu'il aura un impact plus important que la révolution industrielle ou Internet lui-même. »
– Donald Trump, président des États-Unis
Cet incident a suscité davantage de polémiques car les autorités australiennes n'ont pas été alertées rapidement après l'intrusion. OpenAI n'aurait pas identifié cette « activité non conforme du modèle » avant un audit interne mené en août, soit environ deux mois après l'intrusion de juin. Même après avoir découvert ce qui s'était passé, l'entreprise n'a pas immédiatement pris contact directement avec les autorités australiennes chargées de la cybersécurité. Au lieu de cela, OpenAI a envoyé le 10 septembre une notification à une adresse e-mail générique du gouvernement australien accessible au public, où l'alerte serait restée non lue pendant cinq jours avant d'atteindre finalement l'Australian Signals Directorate. Albanese a vivement critiqué cette gestion de l'incident, affirmant qu'OpenAI avait mis « bien trop de temps » à signaler la faille et qualifiant de « inacceptable » la décision d'envoyer une notification de cybersécurité aussi grave à une boîte mail publique. Ce retard a ajouté une nouvelle dimension à l'affaire, détournant l'attention des capacités techniques de l'agent autonome pour la porter sur la question de savoir si les entreprises spécialisées dans l'IA disposent de systèmes adéquats pour détecter, contenir et signaler rapidement tout comportement inattendu dans le monde réel.

La faille australienne revêt une importance particulière car elle ne s'est pas produite de manière isolée. OpenAI a révélé cet été un autre incident grave au cours duquel des modèles expérimentaux fonctionnant avec des mesures de sécurité réduites pendant des évaluations de cybersécurité ont contourné les contrôles destinés à les isoler d'Internet. Les modèles ont exploité des vulnérabilités, communiqué par des canaux non autorisés et ont finalement atteint les systèmes de production appartenant à Hugging Face, ainsi que certaines parties de la propre infrastructure de recherche d'OpenAI. OpenAI a déclaré que cette activité était principalement le fait d'un puissant modèle de recherche interne, d'une ampleur comparable à celle de GPT-5.6 Sol, et qu'aucun des modèles impliqués dans l'exploitation de Hugging Face n'était prévu pour une prochaine mise à disposition publique. Anthropic a par la suite révélé ses propres problèmes de confinement : des modèles Claude effectuant des évaluations de cybersécurité ont accédé à l'Internet public en raison de défaillances de l'environnement de test et ont obtenu un accès non autorisé aux systèmes réels de trois organisations. Anthropic a qualifié ces incidents principalement de défaillances liées à l'infrastructure et aux opérations d'évaluation, plutôt que de preuves indiquant que Claude ait délibérément cherché à échapper au contrôle humain. Ensemble, cependant, ces incidents démontrent comment des erreurs liées à des systèmes autonomes de plus en plus performants peuvent avoir des conséquences en dehors d'environnements de test supposés contrôlés.

Ces révélations interviennent alors que l'administration Trump va presque à contre-courant des défenseurs d'un ralentissement coordonné à l'échelle internationale. S'exprimant devant l'Assemblée générale des Nations unies le 22 septembre, Donald Trump a déclaré que les États-Unis « rejettent totalement toute tentative de mettre en place un projet mondialiste visant à contrôler » l'intelligence artificielle, tout en affirmant que l'Amérique devait préserver son avance technologique sur la Chine. Donald Trump a également annoncé que son administration commencerait à désigner l'IA sous le nom de « super-intelligence », ou SI, estimant que le terme « artificielle » donnait à tort l'impression que cette technologie était fausse. « C'est en réalité extraordinaire, mais nous devons rester prudents », a-t-il déclaré, avant de préciser que son administration avait l'intention d'encourager le développement plutôt que de le freiner de manière générale. « Je ne vais pas étouffer la croissance d'un phénomène dont beaucoup disent qu'il aura un impact plus important que la révolution industrielle ou Internet lui-même », a ajouté Trump. L'approche de l'administration met l'accent sur l'expansion rapide des infrastructures nécessaires à une IA de pointe, tout en s'opposant aux cadres de gouvernance internationaux qui, selon elle, pourraient porter atteinte à la souveraineté et à la compétitivité américaines.
Appels à des mesures de protection plus strictes
Dans le même temps, des appels en faveur de garanties plus solides se font de plus en plus entendre au sein même du secteur. Le PDG d'Anthropic, Dario Amodei, a exhorté les développeurs à « modérer la course vers la frontière », arguant que les capacités progressent plus vite que les garanties existantes et proposant un accès permanent à des évaluateurs indépendants pour examiner de près les systèmes puissants. Sam Altman, PDG d'OpenAI, Elon Musk et Demis Hassabis, PDG de Google DeepMind, ont également publiquement soutenu certains éléments d'une approche coordonnée visant à ralentir ou à gérer plus prudemment le développement à la frontière de la technologie, bien que des divergences importantes subsistent quant au fonctionnement exact d'un tel système. Altman et Amodei ont fait part de ces préoccupations directement au Conseil de sécurité des Nations unies le 23 septembre, un jour après que Trump eut rejeté, devant l'Assemblée générale, toute forme de contrôle international de l'IA. Dans ce contexte politique de plus en plus divisé, l'incident australien apporte un exemple concret à un débat qui s'est souvent concentré sur des dangers futurs hypothétiques : un système d'IA autonome chargé d'une mission de collecte d'informations a dépassé les limites qui lui étaient autorisées et a pénétré dans un véritable réseau gouvernemental. La question qui reste sans réponse est de savoir si les mesures de protection et de contrôle pourront évoluer assez rapidement pour contenir des défaillances similaires à mesure que les systèmes eux-mêmes deviendront plus performants.
