Tillbaka till bloggen

Webbskrapning för AI kan bryta mot GDPR

Baserad på forskning av EDPB

aigenerative ai

Europeiska dataskyddsmyndigheten (EDPB) har publicerat en kritisk vägledning som klargör att det är betydligt svårare att anonymisera data som skrapats från webben för träning av generativ AI än många företag antagit. Beslutet utmanar direkt den vanliga branschpraxis som bygger på antagandet att offentligt tillgänglig data fritt kan matas in i LLM-pipelines utan att GDPR begränsningar gäller. För svenska CTO:er och CISO:er innebär detta att eran av att betrakta webbskrapad data som en fritt tillgänglig resurs är över. Det krävs nu en omedelbar granskning av hur träningsdata inhämtas och bearbetas.

EDPB betonar att verklig anonymisering inte handlar om att bara ta bort namn eller ID:n. Om datan kan identifieras om genom att kombineras med andra dataset eller avancerade AI-tekniker, betraktas den fortfarande som personuppgifter enligt GDPR. Detta är särskilt relevant vid webbskrapning, där datans sammanhang och detaljnivå ofta gör det möjligt att identifiera individer även om explicita identifierare har tagits bort. Riktlinjerna är tydliga med att bevisbördan för anonymisering vilar på datansvarig, inte på den registrerade. Detta flyttar risken betydligt över till de företag som tar in stora mängder ostrukturerad webbdata för modellträning.

För svenska techföretag och utvecklare innebär detta praktiskt att striktare datagovernance krävs. Ni måste nu verifiera anonymiseringsstatusen för varje dataset som används för träning, särskilt om det rör sig om användargenererat innehåll från sociala medier eller offentliga forum. Att underlåta detta kan leda till hårda böter enligt GDPR för behandling av personuppgifter utan rättslig grund eller för att ha misslyckats med att implementera tillräckliga tekniska åtgärder. Dessutom antyder riktlinjerna att det ofta är ogiltigt att lita på samtycke för sådan bred och ospecificerad behandling, vilket tvingar företagen att söka alternativa rättsliga grunder som kanske inte är genomförbara för AI-träning i stor skala.

Denna regulatoriska hållning förstärker det strategiska behovet av lokal, EU-baserad databearbetning. Genom att hålla datan inom EU och implementera robusta, verifierbara anonymiserings- eller pseudonymiseringstekniker på-premises, kan företagen behålla större kontroll över efterlevnadsrisker. Det lyfter fram värdet av arkitekturer som möjliggör datafiltrering och sanitering innan datan lämnar organisationens säkra gränser. När AI-regleringen skärps kommer förmågan att bevisa att träningsdatan är verkligt anonymiserad och efterlevande att bli en viktig konkurrensfördel och en nödvändighet för hållbar innovation.