Harnesses

Google-forskare utvecklar metod för att förhindra att KI-agenter lär sig utantill

7 oktober 2026 · 2 min läsning

Även publicerad på Español, Русский, Norsk, English

Four people working at computers in a sunlit office workspace
Compagnons / Unsplash

Forskare från Google Cloud AI Research och flera universitet har utvecklat en ny metod för att förhindra att KI-agenter lär sig utantill och samtidigt spara beräkningskostnader. KI-agenter som kontinuerligt optimerar sin arbetsmiljö tenderar att specialisera sig för mycket på sina testuppgifter. Den nya metoden, kallad RRSI (Regularized Recursive Self-Improvement of Agent Harnesses), syftar till att motverka detta beteende. RRSI begränsar antalet oberoende justeringar som en kandidat får göra samtidigt och minskar detta budget över tid. Systemet minns tidigare försök för att undvika att upprepa misslyckade idéer. Vid val av förändringar granskar en kritiker varje förslag och avvisar de som bygger in uppgiftsnamn, lösningar eller andra benchmark-specifika knep. En ytterligare regel godkänner högre beräkningskostnader endast om de åtföljs av en mätbar prestandaförbättring.

Komponenter som inte längre är till nytta tas bort. Metoden testades på åtta benchmarkar inom tre områden: programmering, agentbaserat kontorsarbete och ingenjörsdesign. Det underliggande modellen, Claude Opus 4.8, var hela tiden fryst. RRSI förbättrade prestandan med upp till 14,1 poäng på de uppgifter den tränades på och med upp till 4,7 poäng på fem benchmarkar den aldrig sett tidigare, med cirka 30 procent mindre tokenförbrukning i drift jämfört med den oreglerade varianten. Ingen av de osedda benchmarkarna föll under utgångsvärdet, vilket vanligtvis händer med ett utantill lärande ramverk. Alla metoder presterade bra på träningsuppgifterna, men på nya uppgifter vände sig bilden. Två metoder hamnade till och med under utgångsramverket. RRSI uppnådde den minsta träningsvinsten av alla varianter och var samtidigt den enda metoden som tydligt överträffade utgångsvärdet på de osedda uppgifterna.

Denna kompromiss skapas av bromsmekanismerna. Ett med Gemini 3.5 Flash optimerat kodningsramverk höjde noggrannheten för det betydligt svagare Gemini 3.1 Flash Lite oförändrat från 11,2 till 14,6 poäng. De upptäckta mekanismerna beror alltså inte på prestandanivån för det modell som de arbetades fram med. Författarna erkänner att deras undersökning begränsas till ramverket med fasta modeller och inte täcker fall med ändrade modellvikter. Slutsatsen är att KI-agenter endast blir tillförlitligt effektivare genom självförbättring när upprepat feedback omvandlas till permanenta förändringar. Koden är tillgänglig på GitHub.