Actualizaciones de producto··Lectura de 14 minutos
Agentes en la web abierta: navegando dentro de un bucle de toma de decisiones
Una taxonomía de navegación agéntica, los modos de fallo en los que más tiempo pasamos y resultados empíricos de seis espacios de trabajo enterprise medidos frente a un holdout preservado.
Marc Sanchez·
#IA Agéntica
#Investigación
#Web abierta
La mayoría de las implementaciones enterprise de agentes de modelos de lenguaje aún tratan la web abierta como una nota a pie de página: una facilidad de demostración, un envoltorio de búsqueda, una forma de hidratar un prompt. Argumentamos lo contrario. Para un sistema de decisioning de ingresos, la capa de navegación no es una característica de conveniencia. Es el mecanismo que eleva la generación de hipótesis fuera de la distribución de datos del propio operador, y es la mayor fuente de nuevos grados de libertad que el ciclo ha ganado en los últimos dieciocho meses.
Esto es una nota de investigación, no una página de producto. Documenta las decisiones de diseño, los modos de fallo en los que pasamos la mayor parte del tiempo y los resultados empíricos de seis espacios de trabajo enterprise que ejecutaron la capa de navegación frente a un holdout preservado durante al menos ocho semanas.
1. Por qué la web abierta debe estar dentro del circuito
Un bucle de decisioning de ingresos tiene cuatro estaciones: señal, hipótesis, acción candidata, experimento. Tres de las cuatro están naturalmente limitadas por los propios datos del operador. Las señales se calculan sobre eventos de first-party. Las acciones candidatas están restringidas por la capa de acción que el operador ha configurado. Los experimentos se miden contra un holdout en la propia base del operador. Solo una estación no está limitada por construcción: la autoría de la hipótesis.
La autoría de hipótesis es el paso que pregunta, de una oportunidad de ingresos dada, qué mecanismos plausibles podrían moverla. En la práctica, este paso siempre ha sido el techo en el rendimiento del ciclo. Un equipo de cinco analistas senior puede puntuar miles de oportunidades por semana, pero el número de hipótesis distintas y probables que pueden articular contra esas oportunidades es más cercano a cincuenta. El resto del ciclo se detiene.
Los agentes de modelo de lenguaje elevan ese techo, pero solo hasta el límite de su distribución de entrenamiento. Sin contexto externo, un agente producirá hipótesis fluidas que reciclan cualquier patrón que ya exista en los datos del operador y en el preentrenamiento del modelo. Ambos son, por definición, retrospectivos. La capa de navegación es lo que permite que la autoría de hipótesis se adhiera al tiempo presente.
2. Una taxonomía de para qué sirve realmente la navegación
Analizamos 41.000 recuperaciones iniciadas por agentes en los seis espacios de trabajo piloto y las agrupamos por intención. Cinco categorías cubren el 94% del tráfico. Vale la pena nombrarlas, porque la mayor parte de la confusión en torno a la navegación agencial colapsa cuando se mantienen las categorías separadas.
Categoría A. Búsqueda de referencia. Recuperar un documento público específico que el agente ya sabe que existe: una página de guía de un regulador, una tabla de tarifas publicada, la política de devoluciones declarada de una empresa. Contenido de baja creatividad, alto valor de citación. 38% de las recuperaciones.
Categoría B. Ampliación tonal y de formato. Lectura de material de categorías adyacentes para ampliar el rango de variantes creativas candidatas que propondrá el agente. La intención no es copiar: es mover la distribución de propuestas del agente fuera del modo de sus datos de entrenamiento. 21 % de las recuperaciones.
Categoría C. Descubrimiento de señales externas. Identificar hechos sobre el mundo que influyen plausiblemente en una oportunidad de ingresos pero que son inalcanzables desde datos de primera parte: lanzamientos de dispositivos, cambios en el calendario deportivo, un movimiento de precios públicos de un competidor, una anomalía climática. 19 % de las capturas.
Categoría D. Vigilancia de ofertas de la competencia. La categoría más solicitada y la más disciplinada. Recuperaciones estructuradas de un conjunto nombrado de superficies de la competencia con una cadencia fija, diferenciadas de una instantánea previa, introducidas en el feed de oportunidades. El 12 % de las recuperaciones.
Categoría E. Prueba de estrés de hipótesis. Dada una hipótesis propuesta, buscar activamente evidencia pública que la falsifique antes de que se diseñe un experimento. Este es el uso de mayor apalancamiento por búsqueda, y el menos intuitivo. 4 % de las búsquedas, y responsable de una parte desproporcionada de las hipótesis que se descartaron antes de que consumieran holdout.
El 6 % restante es una cola larga de intenciones únicas que no se estabilizaron en una categoría. Seguimos observándolas.
3. Lo que deliberadamente no construimos
Dos decisiones de diseño consumieron aproximadamente un tercio del tiempo total de revisión de diseño en este proyecto. Merece la pena nombrarlas explícitamente, porque ambas son fundamentales.
3.1 No hay escrituras autónomas contra superficies de terceros
La capa de navegación es de solo lectura frente a cualquier superficie que el operador no posea. Cualquier escritura, ya sea creando una cuenta, enviando un formulario o realizando una transacción, se enruta a través de la capa de acción normal del espacio de trabajo, que ya cuenta con autorización y auditoría humana. Esto no es una limitación de capacidad. Lo elegimos. En el momento en que un agente puede escribir en una superficie de terceros, el operador hereda los términos de servicio de esa superficie, su disciplina de tarifas y su riesgo adversario. Ninguno de esos elementos pertenece al ciclo de decisioning de ingresos.
3.2 No hay volumen a escala de rastreador
La capa está limitada superiormente por lo que un analista humano buscaría plausiblemente en una jornada laboral, con un límite por espacio de trabajo que es ajustable pero tiene un tope. Si un espacio de trabajo necesita datos externos de mayor volumen, la acción correcta es licenciar o comprar una fuente, no hacer que un agente itere. Este límite no se trata principalmente del coste. Se trata de la calidad de la señal que sobrevive cuando el volumen está restringido: la búsqueda limitada obliga al agente a ser específico sobre lo que está pidiendo, lo que mejora las hipótesis resultantes.
4. Procedencia, o por qué cada obtención es un objeto de primera clase
En el modelo de datos del espacio de trabajo, una 'fetch' no es un efecto secundario de un 'prompt'. Es un objeto almacenado con una URL, una marca de tiempo capturada, un 'hash' de contenido, una instantánea renderizada y un puntero a la hipótesis o acción candidata que la solicitó. Todo lo que el agente cite posteriormente se resuelve en un objeto 'fetch' específico. Todo lo que un revisor humano quiera auditar se resuelve en el mismo objeto.
Esto es importante por tres razones que son fáciles de subestimar hasta que un incidente lo impone.
Reproducibility. Una hipótesis que hacía referencia a una página pública es reproducible solo si la página tal como la vio el agente se conserva. Las páginas públicas cambian. Sin una instantánea capturada, un revisor posterior no puede distinguir una alucinación del agente de una edición de página.
Atribución de lecturas causales. Cuando un experimento mueve el ARPU, la retrospectiva a menudo necesita identificar qué contexto externo contribuyó a la hipótesis que llevó al diseño. La procedencia convierte esa retrospectiva de una anécdota en una consulta.
Gobernanza del propio modelo. Si un patrón de navegación resulta ser de baja calidad (por ejemplo, una fuente de categoría B que produce consistentemente variantes creativas con bajo rendimiento), el espacio de trabajo puede restar peso o bloquear esa fuente a nivel de política. Esto solo es posible porque cada "fetch" está etiquetado y almacenado.
5. Modos de fallo en los que pasamos más tiempo
5.1 Búsqueda de confirmación
El modo de fallo predeterminado de cualquier agente de navegación es buscar pruebas que respalden la hipótesis que ya ha producido. Dejado a su suerte, el ciclo se convierte en una máquina de confirmación. Nuestra mitigación es estructural, no a nivel de prompt: las búsquedas de categoría E (pruebas de estrés de hipótesis) se programan por el ciclo, no las solicita el agente autor de la hipótesis. Un segundo agente, con un prompt del sistema diferente y sin visibilidad del marco de la hipótesis original, tiene la tarea de encontrar pruebas públicas que la falsificarían. El resultado de la prueba de estrés se adjunta a la hipótesis antes de que sea elegible para un espacio de experimento.
5.2 Monocultivo de fuentes
Los agentes, dejados a su aire, convergen en un pequeño número de fuentes de alta autoridad. Esto es eficiente e incorrecto. Limita la distribución tonal y analítica exactamente donde la capa de navegación está destinada a ampliarla. Nuestra mitigación es una métrica de diversidad de fuentes por espacio de trabajo, calculada semanalmente, con un umbral mínimo. Cuando la métrica disminuye, el bucle sesga las recuperaciones hacia fuentes subrepresentadas durante la semana siguiente. Es una pequeña corrección, aplicada continuamente, y ha mantenido los espacios de trabajo piloto fuera del atractor de monocultivo durante toda la ventana de observación.
5.3 Ilusión de frescura
Una página recuperada tiene una marca de tiempo, pero el contenido de la página puede tener años. Los agentes tratarán cualquier contenido recuperado como reciente a menos que se les obligue a razonar sobre ello. La mitigación es un campo obligatorio de fecha de extracción en cualquier recuperación de categoría C o D, con la extracción misma doblemente verificada por una segunda pasada. Las recuperaciones que no pueden resolver una fecha de extracción son degradadas en el contexto de autoría de la hipótesis.
5.4 Riesgo de inyección de prompts
Las páginas públicas son una superficie de entrada no confiable. La mitigación es estándar ahora, pero no era obvia hace un año: el contenido recuperado nunca se compone directamente en un mensaje del sistema. Se pasa a través de un analizador que elimina las instrucciones, se conserva como datos en una ranura de contexto separada y se le indica al agente que lo trate como evidencia sobre la que razonar, no como instrucciones a seguir. Cada espacio de trabajo ejecuta semanalmente una suite de inyección de equipo rojo contra un grupo rotativo de páginas reales que los agentes han recuperado.
6. Resultados empíricos de la cohorte piloto
Seis espacios de trabajo, de ocho a catorce semanas cada uno, con la capa de navegación habilitada en un 50 % aleatorizado de las ranuras de autoría de hipótesis y deshabilitada en el otro 50 %. La comparación es a nivel de hipótesis, no a nivel de experimento, porque el efecto de la capa de navegación es anterior a la selección del experimento.
Tasa de hipótesis novedosas. Las hipótesis juzgadas por los revisores humanos como materialmente diferentes de cualquier hipótesis propuesta anteriormente en el espacio de trabajo aumentaron del 11 % al 27 % de los espacios elegibles. Este es el resultado principal.
Tasa de descarte de hipótesis antes del experimento. Aumentó del 19 % al 34 %. Este es un buen resultado. Refleja que las pruebas de estrés de la categoría E eliminaron hipótesis que anteriormente habrían consumido holdout. El holdout guardado se reasignó a pruebas de mayor prioridad.
Tasa de éxito del experiment. Aumentó del 22 % al 29 % el número de experimentos enviados que movieron la métrica objetivo con significancia. El mecanismo, según podemos identificar, es un efecto compositivo de los dos primeros: las hipótesis novedosas que sobreviven a las pruebas de estrés están sistemáticamente mejor diseñadas en el momento en que entran en la cola de experimentos.
Tiempo hasta la primera acción candidata. Cayó un 41% en la mediana. Las búsquedas de referencia de la Categoría A eliminan una gran clase de bucles de aclaración entre el agente y el revisor humano.
La metodología completa, la composición de la cohorte y los deltas por espacio de trabajo se encuentran en el apéndice distribuido a los operadores piloto. Publicaremos una versión anonimizada una vez que una segunda cohorte finalice en el tercer trimestre.
7. Qué cambia esto en la dotación de personal del ciclo
La capa de navegación no reduce el número de humanos involucrados en el ciclo. Cambia lo que hacen. Antes, la habilidad escasa del analista senior era la propia autoría de hipótesis: saber qué pedir de una determinada oportunidad de ingresos. Después, la habilidad escasa es la adjudicación de hipótesis: saber cuál de las hipótesis propuestas por el agente merece holdout. Este es un trabajo genuinamente diferente, más parecido a un revisor científico que a un analista, y los espacios de trabajo que obtuvieron el mayor uplift fueron los que ajustaron el personal para reflejarlo.
8. Qué viene después
Extracción tipada. Las extracciones de Categoría D se aterrizarán en el feed de oportunidades como objetos conformes al esquema en lugar de texto libre, de modo que un cambio de precios de la competencia se convierte en una señal tipificada que se puede unir al propio modelo de elasticidad de precios del workspace.
Cuadernos de investigación. Una superficie revisable donde un humano puede ver la sesión de navegación completa del agente para una hipótesis dada, incluyendo las páginas que recuperó, las páginas que rechazó y el rastro de razonamiento, antes de que la hipótesis sea elegible para un slot de experimento.
Reputación de la fuente entre espacios de trabajo. Señal anonimizada y opt-in sobre qué fuentes producen hipótesis que sobreviven a las pruebas de estrés en toda la base de operadores. Esta es la parte con la que somos más cautelosos, porque los sistemas de reputación tienen sus propios modos de fallo, y preferimos lanzarlo tarde que lanzarlo mal.
9. Cierre
El valor de la capa de navegación no es que los agentes puedan leer internet. Los agentes han podido leer internet durante años. El valor es que, dentro de un bucle de decisioning con una estricta procedencia, mitigaciones estructurales para la búsqueda de confirmación y medición aleatoria contra un holdout preservado, el contexto externo se convierte en una entrada que puede evaluarse con la misma rigurosidad que cualquier señal de primera parte. La web deja de ser una demostración y se convierte en una fuente controlada de varianza en la única estación del bucle que realmente estuvo limitada por la imaginación.
La navegación agéntica es una capacidad auditada y con alcance que permite a los agentes de IA buscar, leer y citar páginas web públicas como parte de un bucle de toma de decisiones, con cada búsqueda almacenada como un objeto de primera clase con URL, marca de tiempo y hash de contenido.
Por qué permitir a los agentes navegar por la web abierta?
Porque la autoría de hipótesis es la única estación en un ciclo de decisioning de ingresos que no está naturalmente limitada por los datos de primera parte. El contexto externo es lo que eleva las hipótesis fuera de la propia distribución de datos del operador y el pre-entrenamiento del modelo.
¿Cómo se gestiona la inyección de "prompt" cuando los agentes navegan por páginas públicas?
El contenido recuperado nunca se compone directamente en un prompt del sistema. Se analiza para eliminar instrucciones, se conserva como evidencia en un espacio de contexto separado, y se le pide al agente que razone sobre él como datos. Un paquete de inyección de equipo rojo se ejecuta semanalmente contra un grupo rotatorio de páginas reales recuperadas.
¿Pueden los agentes de Markin comprar, registrarse o enviar formularios en sitios de terceros?
No. La capa de navegación es de solo lectura contra cualquier superficie que el operador no posea. Cualquier escritura pasa a través de la capa de acción del espacio de trabajo con autorización humana.
Los mismos bucles que describe esta nota funcionan 24/7 contra tu base de clientes. Observa cómo el espacio de trabajo decide, experimenta y ejecuta 1:1.