Des agents sur le web ouvert : navigation au sein d'une boucle de décision
Une taxonomie de la navigation agentique, les modes de défaillance auxquels nous avons consacré le plus de temps, et les résultats empiriques de six espaces de travail enterprise mesurés par rapport à un holdout préservé.
Marc Sanchez·
#IA agentique
#Recherche
#Web ouvert
La plupart des déploiements d'agents basés sur des modèles de langage en entreprise traitent encore le web ouvert comme une note de bas de page : une fonctionnalité de démonstration, un enrobage de recherche, un moyen d'hydrater une invite. Nous soutenons l'inverse. Pour un système de decisioning des revenus, la couche de navigation n'est pas une fonction de commodité. C'est le mécanisme qui extrait la génération d'hypothèses de la propre distribution de données de l'opérateur, et c'est la plus grande source de nouveaux degrés de liberté que la boucle a acquis au cours des dix-huit derniers mois.
Ceci est une note de recherche, pas une page de produit. Elle documente les choix de conception, les modes de défaillance sur lesquels nous avons passé le plus de temps, et les résultats empiriques de six espaces de travail enterprise qui ont exécuté la couche de navigation contre un holdout préservé pendant au moins huit semaines.
1. Pourquoi le web ouvert doit être intégré à la boucle
Une boucle de decisioning des revenus comporte quatre stations : signal, hypothèse, action candidate, expérimentation. Trois des quatre sont naturellement bornées par les propres données de l'opérateur. Les signaux sont calculés sur les événements de première partie. Les actions candidates sont contraintes par la couche d'action que l'opérateur a mise en place. Les expérimentations sont mesurées par rapport à un holdout sur la propre base de l'opérateur. Seule une station est illimitée par construction : la création d'hypothèses.
La création d'hypothèses est l'étape qui demande, pour une opportunité de revenus donnée, quels mécanismes plausibles pourraient la faire évoluer. En pratique, cette étape a toujours été le plafond du débit de la boucle. Une équipe de cinq analystes seniors peut évaluer des milliers d'opportunités par semaine, mais le nombre d'hypothèses distinctes et testables qu'ils peuvent articuler face à ces opportunités est plus proche de cinquante. Le reste de la boucle s'arrête.
Les agents de modèles linguistiques augmentent ce plafond, mais seulement jusqu'aux limites de leur distribution d'entraînement. Sans contexte externe, un agent produira des hypothèses fluides qui recycleront les schémas déjà existants dans les données de l'opérateur et dans le pré-entraînement du modèle. Les deux sont, par définition, tournés vers le passé. La couche de navigation est ce qui permet à la création d'hypothèses de s'attacher au temps présent.
2. Une taxonomie de l'objectif réel de la navigation
Nous avons examiné 41 000 requêtes initiées par des agents à travers les six espaces de travail pilotes et les avons regroupées par intention. Cinq catégories couvrent 94 % du trafic. Il est important de les nommer, car la plupart de la confusion autour de la navigation agentique disparaît lorsque les catégories sont clairement distinguées.
Catégorie A. Recherche de référence. Récupération d'un document public spécifique dont l'agent sait déjà qu'il existe : une page de directives réglementaires, un barème tarifaire publié, la politique de retour déclarée d'une entreprise. Contenu créatif faible, valeur de citation élevée. 38 % des récupérations.
Catégorie B. Élargissement tonal et de format. Lecture de matériel de catégorie adjacente pour élargir la gamme de variantes créatives candidates que l'agent proposera. L'intention n'est pas de copier : c'est de déplacer la distribution des propositions de l'agent loin du mode de ses données d'entraînement. 21 % des récupérations.
Catégorie C. Découverte de signaux externes. Faire remonter des faits sur le monde qui influencent plausiblement une opportunité de revenus mais sont inaccessibles à partir des données de première partie : lancements d'appareils, changements de calendrier sportif, un mouvement public de prix par un concurrent, une anomalie météorologique. 19 % des récupérations.
Catégorie D. Surveillance des offres concurrentes. La catégorie la plus demandée et la plus disciplinée. Des récupérations structurées d'un ensemble nommé de surfaces concurrentes à une cadence fixe, comparées à un instantané antérieur, saisies dans le flux d'opportunités. 12 % des récupérations.
Catégorie E. Test de résistance des hypothèses. Étant donné une hypothèse proposée, rechercher activement des preuves publiques qui la falsifieraient avant la conception d'une expérimentation. C'est l'utilisation la plus à fort effet de levier par recherche, et la moins intuitive. 4 % des recherches, et responsable d'une part disproportionnée des hypothèses qui ont été annulées avant d'avoir consommé un holdout.
Les 6 % restants sont une longue traîne d'intentions ponctuelles qui ne se sont pas stabilisées en catégorie. Nous continuons à les observer.
3. Ce que nous n'avons délibérément pas construit
Deux décisions de conception ont pris environ un tiers du temps total de révision de conception sur ce projet. Elles méritent d'être nommées explicitement, car toutes deux sont fondamentales.
3.1 Pas d'écritures autonomes sur des surfaces tierces
La couche de navigation est en lecture seule par rapport à toute surface que l'opérateur ne possède pas. Toute écriture, que ce soit la création d'un compte, la soumission d'un formulaire ou une transaction, est acheminée via la couche d'action normale de l'espace de travail, qui dispose déjà d'une autorisation humaine et d'un audit. Ce n'est pas une limitation de capacité. Nous l'avons choisi. Dès qu'un agent peut écrire sur une surface tierce, l'opérateur hérite des conditions de service de cette surface, de sa discipline tarifaire et de son risque adversarial. Rien de tout cela n'appartient à la boucle de decisioning des revenus.
3.2 Pas de volume à l'échelle d'un crawler
La couche est limitée en amont par ce qu'un analyste humain récupérerait plausiblement en une journée de travail, avec un plafond par espace de travail qui est ajustable mais strictement limité. Si un espace de travail a besoin de données externes à plus grand volume, la bonne approche est d'acquérir une licence ou d'acheter un flux, et non de faire itérer un agent. Cette limite ne concerne pas principalement le coût. Elle concerne la qualité du signal qui survit lorsque le volume est contraint : la récupération bornée oblige l'agent à être précis sur ce qu'il demande, ce qui améliore les hypothèses qui en résultent.
4. Provenance, ou pourquoi chaque récupération est un objet de première classe
Dans le modèle de données de l'espace de travail, une récupération n'est pas un effet secondaire d'une invite. C'est un objet stocké avec une URL, un horodatage capturé, un hachage de contenu, un instantané rendu et un pointeur vers l'hypothèse ou l'action candidate qui l'a demandée. Tout ce que l'agent cite ultérieurement renvoie à un objet de récupération spécifique. Tout ce qu'un examinateur humain souhaite auditer renvoie au même objet.
Ceci est important pour trois raisons qu'il est facile de sous-estimer jusqu'à ce qu'un incident ne rende la chose évidente.
Reproducibility. Une hypothèse qui faisait référence à une page publique n'est reproductible que si la page telle que l'agent l'a vue est préservée. Les pages publiques changent. Sans un instantané capturé, un évaluateur en aval ne peut pas distinguer une hallucination de l'agent d'une modification de page.
Attribution des lectures causales. Lorsqu'une expérimentation déplace l'ARPU, la rétrospective doit souvent identifier quel contexte externe a contribué à l'hypothèse qui a mené à la conception. La provenance transforme cette rétrospective d'une anecdote en une requête.
Gouvernance du modèle lui-même. Si un modèle de navigation s'avère de mauvaise qualité (par exemple, une source de catégorie B qui produit constamment des variantes créatives sous-performantes), l'espace de travail peut réduire le poids ou bloquer cette source au niveau de la politique. Cela n'est possible que parce que chaque récupération est étiquetée et stockée.
5. Modes de défaillance sur lesquels nous avons passé le plus de temps
5.1 Recherche de confirmation
Le mode de défaillance par défaut de tout agent de navigation est de rechercher des preuves qui soutiennent l'hypothèse qu'il a déjà produite. Si on le laisse faire, la boucle devient une machine à confirmation. Notre atténuation est structurelle, non pas au niveau du prompt : les récupérations de catégorie E (test de résistance de l'hypothèse) sont programmées par la boucle, non pas demandées par l'agent auteur de l'hypothèse. Un deuxième agent, avec un prompt système différent et sans visibilité sur la formulation de l'hypothèse originale, est chargé de trouver des preuves publiques qui l'infirmeraient. Le résultat du test de résistance est joint à l'hypothèse avant qu'elle ne soit éligible pour un créneau d'expérimentation.
5.2 Monoculture de source
Laissés à eux-mêmes, les agents convergent vers un petit nombre de sources de grande autorité. C'est efficace et erroné. Cela réduit la distribution tonale et analytique exactement là où la couche de navigation est censée l'élargir. Notre solution est une métrique de diversité des sources par espace de travail, calculée chaque semaine, avec un seuil minimum souple. Lorsque la métrique baisse, la boucle oriente les récupérations vers des sources sous-représentées pour la semaine suivante. C'est une petite correction, appliquée continuellement, et elle a permis aux espaces de travail pilotes de rester en dehors de l'attracteur de monoculture pendant toute la période d'observation.
5.3 Illusion de fraîcheur
Une page récupérée porte un horodatage, mais le contenu de la page peut dater de plusieurs années. Les agents traiteront tout contenu récupéré comme récent, à moins qu'ils ne soient forcés de le raisonner. L'atténuation est un champ de date extraite obligatoire sur toute récupération de catégorie C ou D, l'extraction elle-même étant vérifiée par un second passage. Les récupérations qui ne peuvent pas résoudre une date extraite sont rétrogradées dans le contexte d'auteur d'hypothèse.
5.4 Risque d'injection d'invite
Les pages publiques sont une surface d'entrée non fiable. La mitigation est standard maintenant, mais n'était pas évidente il y a un an : le contenu récupéré n'est jamais composé directement dans un system prompt. Il est passé par un analyseur qui supprime les instructions, conservé comme données dans un emplacement de contexte séparé, et l'agent est invité à le traiter comme une preuve à examiner, et non comme des instructions à suivre. Chaque espace de travail exécute une suite d'injection par une équipe rouge chaque semaine contre un pool rotatif de pages réelles que les agents ont récupérées.
6. Résultats empiriques de la cohorte pilote
Six workspaces, de huit à quatorze semaines chacun, couche de navigation activée sur 50 % aléatoires des créneaux de création d'hypothèses et désactivée sur les 50 % restants. La comparaison se fait au niveau de l'hypothèse, pas au niveau de l'expérimentation, car l'effet de la couche de navigation est en amont de la sélection de l'expérimentation.
Taux d'hypothèse novatrice. Les hypothèses jugées par des réviseurs humains comme matériellement différentes de toute hypothèse précédemment proposée dans l'espace de travail sont passées de 11 % à 27 % des créneaux éligibles. C'est le résultat principal.
Taux d'échec d'hypothèse avant l'expérimentation. Augmentation de 19 % à 34 %. C'est un bon résultat. Il reflète la capacité de la catégorie E à tuer les hypothèses lors des tests de stress qui auraient auparavant consommé du holdout. Le holdout économisé a été réaffecté à des tests plus prioritaires.
Taux de réussite de l'expérimentation. Augmentation de 22 % à 29 % des expériences déployées ayant fait évoluer la métrique cible avec signification. Le mécanisme, tel que nous pouvons le mieux l'identifier, est un effet de composition des deux premiers : les hypothèses nouvelles qui survivent aux tests de stress sont systématiquement mieux conçues au moment où elles entrent dans la file d'attente des expériences.
Délai avant la première action candidate. Diminution de 41 % à la médiane. Les recherches de référence de catégorie A éliminent une grande classe de boucles de clarification entre l'agent et le réviseur humain.
La méthodologie complète, la composition des cohortes et les deltas par workspace sont dans l'annexe distribuée aux opérateurs pilotes. Nous publierons une version anonymisée une fois qu'une seconde cohorte aura terminé au T3.
7. Ce que cela change dans la gestion de la boucle
La couche de navigation ne réduit pas le nombre d'humains impliqués dans la boucle. Elle change ce qu'ils font. Auparavant, la compétence rare de l'analyste senior était l'écriture d'hypothèses elle-même : savoir quoi demander à une opportunité de revenus donnée. Après, la compétence rare est l'arbitrage d'hypothèses : savoir laquelle des hypothèses proposées par l'agent mérite un holdout. C'est un travail véritablement différent, plus proche d'un réviseur scientifique que d'un analyste, et les espaces de travail qui ont obtenu le plus grand uplift sont ceux qui ont ajusté leur personnel pour le refléter.
8. Quelle est la prochaine étape
Extraction typée. Les récupérations de catégorie D arriveront dans le flux d'opportunités sous forme d'objets conformes au schéma plutôt que de texte libre, de sorte qu'un changement de prix de la concurrence devient un signal typé qui peut être joint au modèle d'élasticité prix du workspace.
Notebooks de recherche. Une interface consultable où un humain peut voir la session de navigation complète de l'agent pour une hypothèse donnée, y compris les pages qu'il a récupérées, les pages qu'il a rejetées et la trace de raisonnement, avant que l'hypothèse ne soit éligible pour un slot d'expérimentation.
Réputation de la source inter-espaces de travail. signal anonymisé et opt-in sur les sources qui produisent des hypothèses qui survivent aux tests de stress sur l'ensemble de la base d'opérateurs. C'est le point sur lequel nous sommes le plus prudents, car les systèmes de réputation ont leurs propres modes de défaillance, et nous préférerions le livrer en retard plutôt que de le livrer de manière incorrecte.
9. Clôture
La valeur de la couche de navigation n'est pas que les agents puissent lire Internet. Les agents sont capables de lire Internet depuis des années. La valeur est que, à l'intérieur d'une boucle de decisioning avec une provenance stricte, des atténuations structurelles pour la recherche de confirmation et une mesure randomisée contre un holdout préservé, le contexte externe devient une entrée qui peut être évaluée aussi rigoureusement que tout signal de première partie. Le web cesse d'être une démonstration et devient une source contrôlée de variance dans la seule station de la boucle qui a toujours été réellement contrainte par l'imagination.
La navigation agentique est une capacité auditable et encadrée qui permet aux agents IA de récupérer, lire et citer des pages web publiques dans le cadre d'une boucle de décision, chaque récupération étant stockée comme un objet de première classe avec URL, horodatage et hachage de contenu.
Pourquoi laisser les agents naviguer sur le web ouvert ?
Parce que la rédaction d'hypothèses est la seule étape d'une boucle de decisioning de revenus qui n'est pas naturellement limitée par les données de première partie. Le contexte externe est ce qui élève les hypothèses au-delà de la distribution de données de l'opérateur et du pré-entraînement du modèle.
Comment l'injection de prompt est-elle gérée lorsque les agents consultent des pages publiques ?
Le contenu récupéré n'est jamais directement composé dans une invite système. Il est analysé pour supprimer les instructions, conservé comme preuve dans un emplacement de contexte séparé, et l'agent est invité à le considérer comme des données. Une suite d'injection d'équipe rouge est exécutée chaque semaine sur un pool tournant de pages réelles récupérées.
Les agents Markin peuvent-ils acheter, s'inscrire ou soumettre des formulaires sur des sites tiers ?
Non. La couche de navigation est en lecture seule contre toute surface que l'opérateur ne possède pas. Toute écriture passe par la couche d'action de l'espace de travail avec autorisation humaine.
Les mêmes boucles que cette note décrit fonctionnent 24 heures sur 24, 7 jours sur 7, sur ta base de clients. Observe l'espace de travail décider, expérimenter et exécuter en 1:1.