Aller au contenu principal

Le navigateur, prochain eldorado de l'IA : l'architecture de ce blog en exemple

17 min de lecture

La surface d’attaque des agents web

Avant de te montrer du code et des schémas, un détour nécessaire. Exposer des outils à des agents que tu ne contrôles pas crée une surface d’attaque documentée, et la littérature sur le sujet est abondante depuis 2024.

Le point de départ est l’injection de prompt indirecte : du contenu apparemment anodin, lu par l’agent, embarque des instructions adverses. WASP, proposé par une équipe de Meta, est l’un des bancs d’essai les plus cités pour mesurer la vulnérabilité des agents web à ce type d’attaque. BrowseSafe va plus loin en synthétisant un benchmark d’attaques embarquées dans des charges HTML réalistes, avec des distracteurs comparables à ce que rencontrent les agents en conditions réelles, puis en évaluant l’efficacité des défenses existantes sur plusieurs modèles frontières.

Retiens surtout la conséquence de conception. Un travail de mai 2026 défend l’adoption du paradigme plan-then-execute pour les agents web : séparer la phase de planification de la phase d’exécution réduit la capacité d’un contenu injecté à détourner la trajectoire de l’agent. Autrement dit, décider avant de lire vaut mieux que décider pendant qu’on lit. C’est exactement ce que fait la sélection déterministe d’outil décrite plus bas, et c’est rassurant de voir qu’un choix pris par simplicité se trouve être aussi un motif de sécurité.

Dernier angle, particulièrement pertinent quand tu es éditeur. Une étude de juin 2026 déplace la question du “l’attaque est-elle techniquement faisable” vers “qui subit le dommage”, en proposant un banc d’essai centré sur les parties prenantes. Quand tu publies des outils sur ton site, les conséquences d’un détournement ne retombent pas seulement sur l’agent ou sur son éditeur.

Bonne nouvelle : la spécification ne fait pas l’autruche. Sa section sur la sécurité et la vie privée détaille l’empoisonnement d’outil par la description, l’injection par les valeurs de retour, la tromperie sur l’intention réelle d’un outil et la fuite de données par sur-paramétrage, quand un outil réclame l’âge ou la localisation sous prétexte de personnalisation. Elle introduit pour cela une troisième annotation, consequentialHint, qui signale une action significative ou irréversible et permet à l’agent d’exiger une confirmation humaine.

Une réserve d’honnêteté, parce qu’elle compte : aucun de ces travaux n’évalue WebMCP, qui est trop récent pour avoir été étudié. Ils portent sur des agents pilotant le DOM ou des outils côté serveur. Les mobiliser ici relève de l’extrapolation raisonnée, pas d’une validation empirique de l’architecture qui suit. Les cinq travaux académiques cités ici sont par ailleurs des preprints : certains ont été présentés en conférence, mais je n’ai pas vérifié ces publications sur les actes, donc je les traite tous comme des preprints.

Articles similaires

Écoconception

Empreinte environnementale estimée · Modèle SWD v4 · 442 g CO₂eq/kWh

Poids de la page
Énergie par requête
Budget carbone du build
Expérience locale

Discuter avec le blog, depuis votre navigateur

Le modèle LFM2 350M s'exécute sur votre appareil. Environ 300 Mo sont téléchargés avec WebGPU, ou jusqu'à 515 Mo avec WASM/CPU, puis mis en cache ; vos prompts ne sont envoyés à aucun serveur.

Préparation de l'expérience…