Hoppa till huvudinnehåll

LeakPro 1: Läckage och risköversyn av maskininlärningsmodeller

Flera studier har visat möjligheten att extrahera data från tränade maskininlärningsmodeller. Dessa exempel utförs dock vanligtvis under idealistiska förhållanden och det har varit oklart om risken kvarstår under mer realistiska omständigheter. LeakPros mål var att skapa realistiska tester.

AI Sweden podcast om LeakPro

AI Sweden podcast träffade Johan Östman för att förstå vad LeakPro-ramverket handlar om och vilka machine learning-kopplade risker projektet velat adressera. 

Utmaningar

Maskininlärningsmodeller är algoritmer som internt kodar förmågan att identifiera mönster i en datakälla. Inom många domäner, t.ex. inom livsvetenskap eller finans, kan data dock vara känslig. Det är därför av viktigt att bedöma svårigheten i att extrahera känslig information under realistiska angreppsscenarier.

Projektet skapade LeakPro, en plattform för att bedöma informationläckage i relation till i) tränade maskininlärningsmodeller, ii) under träning med federerad inlärning, och iii) vid användning av syntetiska data.

Syfte

Det primära syftet var att skapa LeakPro, en öppen plattform för att utvärdera risken för informationläckage i maskininlärningsapplikationer. LeakPro följer följande principer:

  1. Öppenhet: LeakPro utvecklades som ett öppet verktyg för det svenska ekosystemet. Då inferensattacker främst existerar som isolerade öar inom forskningslitteraturen strävade vi efter att samla in attackmetoder av hög kvalitet för olika modaliteter och göra dem tillgängliga för icke-experter.
  2. Skalbarhet: Eftersom det finns en mängd olika inferensattacker och området ständigt utvecklas var det viktigt att LeakPro designades modulärt för att möjliggöra skalbarhet och inkludering av nya attacker. Dessutom låter LeakPro användare att bedöma informationsläckage i, för sina användingsfall, realistiska miljöer. På så sätt möjliggör LeakPro identifiering/validering av realistiska attackvektorer.
  3. Relevans: För att säkerställa LeakPro:s fortsatta relevans antog vi inte bara en öppen källkod-strategi utan arbetade också för dess integration inom RISE Cyber Range för att förbereda för en långsiktig överlämning. Dessutom, för att verifiera LeakPro:s praktiska tillämpning, hade vi ambitionen att integrera LeakPro internt hos AstraZeneca, Sahlgrenska och Region Halland.

Utfall

LeakPro erbjuder en holistisk plattform, som kan köras lokalt, för att bedöma informationsläckage i följande sammanhang:

  1. Av tränade maskininlärningsmodeller under medlemskapattacker och konstruktionsattacker av träningsdata under öppen åtkomst (white-box) och API-åtkomst (black-box). Flera datamodaliteter stöds, t.ex. tabell, bilder och text.
  2. Under träningsstadiet för federerad inlärning där angriparen utgör antingen en klient eller server: Attackerna som inkluderats är medlemskapsinferens och återskapande av träningsdata.
  3. Informationläckaget mellan syntetiska data och dess ursprungliga datakälla: Intressanta attacker inkluderar medlemskapsinferens, länkbarhet och inferens av saknade värden.
  4. LeakPro finns tillgängligt som open source.
  5. LeakPro fortsätter 2025–2027 med ett utökat fokus. Läs mer om LeakPro 2.

LeakPro repository

Tillgänglig under Apache 2.0 licens: LeakPro repository

Fakta

Finansiering: Vinnova: Advanced and Innovative Digitalization

Total projektbudget: 18 373 296 SEK

Projektperiod: 1/12-2023 - 1/12-2025

Deltagare: AI Sweden, RISE, Scaleout, Syndata, Sahlgrenska University Hospital, Region Halland, och AstraZeneca

Referensgrupp (legala experter): AI Sweden, RISE, Region Halland, IMY och Esam

Finansiering från Avancerad Digitalisering
 

För mer information, kontakta

Fazeleh Hoseini
Fazeleh Hoseini
Research scientist
+46 (0)73-305 69 22

Relaterade nyheter

LeakPro workshop

LeakPro 2 utökar framgångsrikt verktyg för integritetsbedömning inom AI

2026-03-18
LeakPro 2 syftar till att skapa ett verktyg som inte bara kvantifierar risken för att en modell skulle kunna läcka känsliga data, utan även vilken inverkan ett sådant läckage kan få. Arbetet bygger på...
Fazeleh Hoseini and Johan Östman

LeakPro 2: Operativ hantering av integritetsrisker i AI-system

LeakPro 2 är ett ramverk för att utvärdera och minska integritetsrisker i maskininlärningsmodeller. Det kombinerar integritetsattacker, utvärdering av integritetsstärkande tekniker (PET) och...
Picture of Johan Östman

LeakPro skapar förutsättningar för samarbeten kring känslig data

2025-01-29
I senaste avsnittet av AI Sweden Podcast berättar Johan Östman, forskare och projektledare på AI Sweden, om projektet LeakPro. Ambitionen är att bättre förstå – och därmed också kunna förhålla sig...
Johan Östman and Fazeleh Hoseini, Research engineers at AI Sweden

När kommer AI-modeller att läcka din känsliga data?

2024-06-05
Projektet LeakPro är ett ambitiöst initiativ vars mål är att ge svenska organisationer nödvändig kunskap och verktyg som behövs för att de ska kunna använda AI tränade på känslig data. Att AI-modeller...