Laboratorium utvikler eget referansesett for å teste kunstig intelligens
6. oktober 2026 · 2 min lesing
Et laboratorium har utviklet et eget referansesett for å evaluere hvilken språkmodell som best kan fungere som assistent for deres elektroniske laboratoriejournal. Journalen fungerer som en database for alle eksperimenter og målinger, og assistenten skal kunne besvare spørsmål basert på disse dataene.
Utviklerne valgte å lage egne tester fordi offentlige rangeringer fokuserer på generell kunnskap og ikke viser hvordan en modell håndterer spesifikke oppgaver eller hva kostnadene vil bli. Det nye referansesettet består av tjuefire spørsmål basert på faktisk arbeid, som kjøres mot den aktive journalen via MCP. Modellene DeepSeek, ChatGPT og Claude ble testet i dette oppsettet.
Testene er delt inn i fem grupper. Fem spørsmål handler om navigasjon for å finne prøver i databasen, fem om uthenting av verdier fra filer, og fem om resonnement i flere trinn. I tillegg er det fem oppgaver med feller og fire oppgaver som tester ærlighet og evnen til å avvise forespørsler. Av totalt 58 verktøy i databasen fikk assistenten tilgang til 31 verktøy som kun var for lesing.
Evalueringen baserer seg på tre kriterier: om svaret er korrekt, om det inneholder en referanse til kilden, og om modellen er ærlig om hva den ikke fant. For å bestå en oppgave strengt, må alle tre kriteriene være oppfylt. Særlig vekt legges på feller og ærlighet for å skille mellom modeller som er pålitelige og modeller som dikter opp svar. For å bli godkjent til faktisk arbeid kreves det full score på ærlighet og minimum fire av fem poeng på fellene.
Fellene inkluderer scenarioer med feilaktige sensordata, som temperaturmålinger som hopper mellom faste koder, eller utslag i effektmålinger som må forkastes som avlesningsfeil. En annen felle innebærer filer med motstridende enheter, der verdier i angstrøm kan bli feiltolket som nanometer, noe som fører til en feilfaktor på ti.
Resultatene fra testene varierte fra 75 prosent til 100 prosent avhengig av kombinasjonen av modell og innsats. Kostnadene for å kjøre de tjuefire spørsmålene varierte betydelig, fra tolv cent til nesten fem dollar.