SDU-forskere udvikler ny algoritme til effektiv maskinaflæring
Vinay Chakravarthi Gogineni og Esmaeil Nadimi har udviklet en algoritme til machine unlearning i store AI-systemer. Foto: SDU

SDU-forskere udvikler ny algoritme til effektiv maskinaflæring

Forskere fra Syddansk Universitet har skabt en metode, der lader AI-modeller glemme specifikke data uden at miste generel ydeevne eller kræve omkostningstung gentræning

Del artiklen på

Af Lars Bennetzen

GDPR giver brugere ret til at få data slettet, men for AI-systemer er det teknisk udfordrende at fjerne tillært viden uden at svække modellens præcision. Det kræver ofte ressourcetung gentræning af hele modellen.

To forskere fra SDU Applied AI and Data Science, Vinay Chakravarthi Gogineni og Esmaeil Nadimi, har nu publiceret en løsning i Journal of Machine Learning Research. De har udviklet en algoritme til machine unlearning, der fjerner viden fra specifikke datapunkter.

- GDPR-lovgivningen gør det til en bunden opgave ikke kun at arbejde med maskinlæring, men også med maskinaflæring, så det her er noget, rigtig mange arbejder på lige nu, siger lektor Vinay Chakravarthi Gogineni og fortsætter:

- Vi håber, at vi med vores algoritme kan bidrage til større datasikkerhed og privatliv for brugerne.

Målrettet sletning i neurale netværk

Metoden gør det muligt at identificere og slette viden relateret til enkelte brugere i et neuralt netværk uden at fjerne generelle færdigheder.

- Meget forsimplet kan man sige, at algoritmen kan finde frem til de dele af et neuralt netværk, som har med de specifikke datapunkter at gøre, så man kan slette dem – og kun dem. Algoritmen fokuserer udelukkende på de specifikke neuroner, som kan bruges til at identificere en bruger, ikke alle de generelle, forklarer professor og leder af forskningsgruppen SDU Applied AI and Data Science Esmaeil Nadimi.

Ved eksempelvis ansigtsgenkendelse betyder det, at systemet sletter viden om et specifikt ansigt, men bevarer evnen til generelt at genkende ansigtsformer.

- Det er den her meget målrettede sletning, der gør, at vores algoritme ikke forringer AI-modellernes performance, siger Vinay Chakravarthi Gogineni.

Fokus på sundhedsdata og sprogmodeller

Forskerne vurderer, at behovet for databeskyttelse stiger i takt med udbredelsen af profilering og deepfakes. Særligt inden for sundhedsdata er muligheden for komplet sletning afgørende, da data kan blive følsomme over tid.

- Medicinsk og genetiske data afslører ekstremt meget om en person. En almindelig borger i dag kan om ti år være politisk leder eller have en samfundskritisk rolle, og så må sundhedsdata ikke kunne afsløre sårbarheder, forklarer Vinay Chakravarthi Gogineni.

Forskerne arbejder nu på at udvide brugen af algoritmen fra ansigtsgenkendelse til også at omfatte store sprogmodeller og billedgeneratorer.