Nytt mätvärde utvärderar hur väl kodande agenter kan återskapa tredimensionella scener från fotografier
6 oktober 2026 · 2 min läsning
Forskare från University of Maryland och AWS har presenterat LEGO-Anything, ett system där kodande agenter skapar redigerbara tredimensionella scener utifrån ett enda fotografi genom att skriva och förbättra kod steg för steg.
Metoden kallas för bild-till-kod och innebär att en agent skriver kod för programvaran Blender. Istället för att skapa scenen i ett enda steg arbetar agenten iterativt genom att skriva kod, köra den, granska resultatet och göra justeringar tills scenen motsvarar förlagan. Fördelen med detta tillvägagångssätt är att programmet explicit registrerar objekt, geometri, arrangemang och kameraposition, vilket gör att scenen kan köras, granskas och ändras.
För att mäta agenternas prestation har teamet utvecklat LEGO-Bench. Detta mätvärde består av 208 bilder från 104 inomhus- och utomhusscener med totalt 443 registrerade tillgångar. Bilderna är renderade från professionella simulator-scener för att ge naturliga indata samtidigt som den exakta geometrin, djupet och objekttilldelningen förblir dolda för automatisk utvärdering.
Utvärderingen sker inom tre kategorier: giltighet, vilket kontrollerar om ett användbart scen-artefakt levererats, rekonstruktion, som mäter den synliga geometrins noggrannhet, samt utseende, vilket jämför den renderade scenen pixel för pixel med originalbilden.
Resultaten visar att alla sex testade konfigurationer av GPT lyckades leverera fungerande scener, men precisionen varierade kraftigt. Den bästa modellen, GPT-6 Astra, uppnådde ett totalvärde på 53,4 procent för inomhusscener och 39,6 procent för utomhusscener, medan svagare konfigurationer endast nådde cirka 15 procent. Precisionen sjunker när scenerna blir mer komplexa, och utomhusmiljöer visade sig vara svårare än inomhusmiljöer. För GPT-6 Astra ökade värdet i ett kontorstest från 32,3 till 61,8 procent när resonemangsansträngningen ökades.
Analyser av agenternas arbetsprocesser avslöjade problem med dåliga starter, ändringar som raderade tidigare framsteg och en opålitlig självbedömning. När modellerna fick avgöra vilken av två versioner som bäst passade originalet låg deras omdömen gällande geometrin nära eller under slumpnivån.
Som en lösning utvecklade författarna LEGO-Plugin, en utökning som inte kräver ytterligare träning. Den förankrar startscenen i referensbilden, ersätter självbedömningen med konkreta mätningar och skyddar korrekta framsteg. Detta plugin förbättrade alla sex modeller, där de svagaste agenterna såg störst ökning med upp till 62,7 procent, medan toppmodellen endast förbättrades med drygt två procent.
Slutligen testades om de återskapade scenerna kunde användas för bildanalysuppgifter som objektsidentifiering, segmentering och djupuppskattning. Utan extra träning gav scenerna användbara men inte enastående resultat, där objektsidentifieringen presterade bäst.