Google-forskere utvikler metode for å hindre at kunstig intelligens lærer testoppgaver utenat
7. oktober 2026 · 2 min lesing
Forskere fra Google Cloud AI Research og flere universiteter har utviklet en ny metode for å forhindre at kunstig intelligens-agenter spesialiserer seg for mye på sine egne testoppgaver.
Moderne agenter bruker et rammeverk bestående av instruksjoner, arbeidsflyter, verktøy og minne som styrer hvordan en fast språkmodell opererer. Mye av den nyeste fremgangen for slike agenter kommer fra forbedringer i dette rammeverket fremfor nye modeller. Nyere metoder automatiserer dette ved at en språkmodell endrer rammeverket basert på tilbakemeldinger fra testoppgaver, noe som beskrives som en form for rekursiv selvforbedring.
Forskerne påpeker at denne selvoptimaliseringen har en bakside. Fordi det brukes et begrenset sett med testoppgaver, lærer agenten disse faktiske oppgavene utenat. Dette fører til at ytelsen stiger på treningsoppgavene, mens gevinstene minker eller forsvinner helt på nye, usette oppgaver. Dette skjer fordi systemet husker mønstre som kun passer til én bestemt målestokk, foretrekker kandidater som gjør det bra ved tilfeldighet, eller legger til unødvendig kompleksitet.
Den nye metoden, kalt RRSI, begrenser selvoptimaliseringen på to punkter. For det første innføres et budsjett for hvor mange uavhengige justeringer en kandidat kan samle, og dette budsjettet synker over tid. Systemet husker også tidligere forsøk for å unngå gjentakelse av mislykkede ideer. For det andre vurderer en kritiker alle forslag og forkaster triks som er spesifikke for målestokken, som for eksempel navn på oppgaver eller løsninger. I tillegg aksepteres høyere beregningskostnader kun hvis det er en målbar ytelsesgevinst.
RRSI ble testet på åtte målestokker innen programmering, kontorarbeid og ingeniørdesign ved bruk av modellen Claude Opus 4.8. Resultatene viser at RRSI økte med opptil 14,1 poeng på treningsoppgavene og opptil 4,7 poeng på fem usette målestokker. Samtidig hadde metoden rundt 30 prosent lavere forbruk av tokens i drift enn den uregulerte varianten. RRSI var den eneste metoden som lå betydelig over utgangsverdien på de usette oppgavene.
Forskerne testet også om et rammeverk optimalisert med Gemini 3.5 Flash kunne hjelpe svakere modeller. Et slikt rammeverk løftet nøyaktigheten til Gemini 3.1 Flash Lite fra 11,2 til 14,6 poeng. Forfatterne bemerker at undersøkelsen er begrenset til rammeverk med faste modeller og ikke dekker tilfeller der modellvektene endres.