Investigadores de Google desarrollan método para evitar que los agentes de IA aprendan de memoria
7 de octubre de 2026 · 2 min de lectura
Investigadores de Google Cloud AI Research y varias universidades han desarrollado una nueva técnica para evitar que los agentes de IA se especialicen demasiado en tareas de prueba y aprendan de memoria. La técnica, llamada RRSI (Auto-mejora recursiva regularizada de arneses de agentes), también busca reducir los costos de cómputo. Los agentes de IA modernos utilizan un arnés, una estructura de indicaciones, planes de ejecución, herramientas, memoria y control de lo que el modelo ve en cada paso. Este arnés determina si un agente lee el archivo correcto antes de modificarlo, si se recupera de un error y si entrega sus resultados de manera ordenada. Según un nuevo artículo de investigación, gran parte del progreso reciente en los agentes proviene del trabajo en este arnés, no de nuevos modelos.
Hasta ahora, este proceso ha sido manual, pero métodos más recientes lo automatizan, permitiendo que un modelo de lenguaje modifique el arnés en función de la retroalimentación de las tareas de prueba. Sin embargo, esta auto-optimización tiene un efecto secundario: los agentes pueden aprender de memoria las tareas de prueba, lo que mejora su rendimiento en estas tareas pero no en tareas nuevas. Para abordar esto, RRSI limita las sugerencias de cambios y evita que el sistema repita ideas fallidas. También experimenta con partes del arnés que no han sido modificadas previamente. La técnica fue probada en ocho benchmarks en tres áreas: programación, trabajo de oficina agente y diseño de ingeniería.
RRSI logró hasta 14,1 puntos en las tareas de entrenamiento y hasta 4,7 puntos en benchmarks nunca vistos, con un 30% menos de consumo de tokens en operación en comparación con la variante no regulada. Además, RRSI mejoró el rendimiento de un modelo más débil, Gemini 3.1 Flash Lite, aumentando su precisión de 11,2 a 14,6 puntos. Los investigadores concluyen que la auto-mejora solo hace a los agentes de IA más confiables cuando la retroalimentación repetida se convierte en cambios permanentes.