Retroillustration av tre kollegor vid en dator som sorterar utskrivna webbsidor i märkta fack medan en man håller ett dokument med rubriken Consultation.
Fem kontroller delar upp webbmaterialet innan det blir träningsdata.

NYHET // WEBBSKRAPNING // GENERATIV AI // GDPR // EDPB

EDPB:S REMISSUTKAST OM WEBBSKRAPNING FÖR GENERATIV AI: FEM GDPR-KONTROLLER FÖRE INSAMLINGEN

Offentlig webbdata är inte automatiskt fri att samla in för AI-träning. I ett nytt remissutkast beskriver Europeiska dataskyddsstyrelsen webbskrapning som storskalig behandling som kan omfatta personuppgifter, flera ansvariga aktörer, känsliga uppgifter och svåra transparenskrav. Här är fem kontroller att göra innan den första sidan hämtas.

Publicerad: 2026-08-25 // Lästid: ca 10 min

AVSÄNDARE OCH GRANSKNING

Vem står bakom innehållet?

Den här texten är redaktionellt framtagen av AI på svenska för verksamhetsansvariga, AI-ansvariga, dataskyddsombud, jurister och beställare som överväger att samla extern webbdata för att träna eller finjustera generativ AI. Den bygger på EDPB:s riktlinjer 03/2026 om webbskrapning för generativ AI (öppnas i ny flik) och EDPB:s nyhet om antagandet. Källorna kontrollerades 2026-08-25. Riktlinjerna är antagna för offentlig konsultation till och med den 30 oktober 2026 och är alltså inte en slutlig version. Texten är ett arbetsstöd, inte juridisk rådgivning i ett enskilt fall.

REDAKTIONELLT ANSVAR: C. LEIJON

UTGÅNGSPUNKTEN

Offentligt betyder åtkomligt – inte fritt från GDPR

EDPB definierar webbskrapning som automatiserad hämtning och lagring av information från offentligt tillgängliga webbtjänster, exempelvis öppna register, nyhetssidor, sociala medier, forum och personliga webbplatser. När materialet innehåller uppgifter som direkt eller indirekt kan kopplas till en person omfattar hämtning, rensning, strukturering och lagring behandling av personuppgifter. Då gäller GDPR för personuppgiftsdelen även om samma datamängd också innehåller stora mängder opersonligt material.

Det går därför inte att börja med en bred insamling och skjuta dataskyddsfrågan till rensningssteget. EDPB konstaterar att en organisation efter en storskalig skrapning kan ha svårt att veta exakt vilka personer och uppgifter som finns i mängden. När modellen väl har tränats kan personuppgifter dessutom vara svåra att ta bort ur modellen. Förhandskontrollen är därmed ett faktiskt beslut om behandling, inte ett administrativt tillägg efter teknikvalet.

Utkastet gäller både när en organisation skrapar själv och när den anlitar någon annan. Det behandlar även återanvändning av en redan skrapad datamängd, men fokuserar på privata aktörer och extern webbdata. Offentliga verksamheter behöver därför läsa dokumentet med den avgränsningen i åtanke och ta stöd av sitt dataskyddsombud eller sin jurist för den egna rättsliga grunden.

KONTROLL 1

Rita aktörskartan innan ni beställer en enda datarad

Skriv först upp vem som väljer ändamålet, källorna, insamlingskriterierna, lagringsplatsen och den senare AI-träningen. Den som tekniskt kör skrapan är inte automatiskt personuppgiftsansvarig. Om en AI-utvecklare anlitar ett skrapföretag som följer dokumenterade instruktioner om källor och kategorier kan utvecklaren vara ansvarig och skrapföretaget biträde. Om båda gemensamt bestämmer ändamål och väsentliga medel kan gemensamt ansvar bli aktuellt.

En färdig datamängd från en datamäklare gör inte ansvarskedjan enklare. EDPB:s utgångspunkt är att leverantören och AI-utvecklaren i princip ansvarar för sina egna separata behandlingar när de själva bestämmer respektive ändamål och medel. Köparen måste alltså bedöma sin återanvändning och kan inte ersätta den analysen med formuleringen ”leverantören garanterar GDPR”.

Dokumentera för varje steg: organisation, faktisk uppgift, beslut som aktören tar, instruktioner, åtkomst och ansvarig kontaktperson. Om en leverantör är biträde behöver rollanalysen följas av den avtalsgranskning som beskrivs i vår checklista för personuppgiftsbiträdesavtal med AI-leverantörer. Men avtalet kommer efter rollbeslutet; det kan inte skapa en biträdesrelation som inte stämmer med hur arbetet faktiskt organiseras.

KONTROLL 2

Formulera ändamål, rättslig grund och transparens tillsammans

”Träna en bättre modell” är för oprecist som beslutsunderlag. Beskriv vilket slags modell eller finjustering det gäller, vilka användare och funktioner den ska betjäna, om syftet är internt, kommersiellt eller forskning och varför just personuppgifter behövs. Ändamålet ska vara specificerat, uttryckligt och legitimt, och personuppgifterna får inte senare användas på ett sätt som är oförenligt med det.

EDPB skriver att privata aktörer ofta åberopar berättigat intresse enligt artikel 6.1 f, men det är ingen standardbiljett till webbskrapning. Tre villkor måste vara uppfyllda samtidigt: intresset ska vara legitimt, behandlingen nödvändig och de registrerades intressen eller grundläggande rättigheter får inte väga tyngre. I nödvändighetsprövningen ska ni fråga om ett lika effektivt men mindre ingripande alternativ finns, exempelvis snävare källor, pseudonymiserade uppgifter eller syntetiska data. Allmänt tillgängliga uppgifter är inte i sig ett samtycke till AI-träning, och avsaknad av en robots.txt-fil är inte samtycke enligt GDPR.

Planera samtidigt informationen enligt artikel 14. EDPB öppnar för att individuell information i vissa utformningar kan vara omöjlig eller kräva oproportionerlig ansträngning, men undantaget får inte användas rutinmässigt. Bedömningen ska väga arbetsinsatsen mot konsekvenserna för de registrerade och bland annat beakta antal personer, uppgifternas ålder och skyddsåtgärder. Om undantaget används måste informationen alltid göras offentligt tillgänglig. Den bör beskriva personuppgiftskategorier, ändamål, rättslig grund, källor, om källorna är offentliga och skrapans egenskaper. Där det går rekommenderas en sökbar lista över domäner eller webbadresser och insamlingsdatum eller period.

KONTROLL 3

Minimera före insamlingen – inte bara i efterhand

Dataminimering förbjuder inte stora träningsmängder, men den tillåter inte personuppgifter som är onödiga, irrelevanta eller otillräckliga för ändamålet. EDPB säger uttryckligen att bedömningen bör göras innan skrapningen börjar. Börja därför med en datakarta: vilka källtyper, kataloger, språk, tidsperioder, fält och format behövs? Välj riktad insamling framför en crawler som fritt följer nya länkar när ändamålet kan uppnås så.

Gör exkluderingslistan lika konkret som inkluderingslistan. Utkastet nämner filter för exempelvis personnummer och telefonnummer, att utesluta webbplatser som huvudsakligen används av minderåriga och att respektera tekniska signaler som robots.txt, ai.txt, autentisering och CAPTCHA. En källa som kräver inloggning är inte fritt tillgänglig bara för att organisationen tekniskt kan nå den. Efter insamlingen kan syntaxfilter, anonymisering, pseudonymisering och i vissa fall syntetiska ersättningsdata minska exponeringen, men de reparerar inte ett från början oförsvarligt urval.

Dokumentera kontrollen som testbara regler: ”samla endast svenska supportsidor publicerade efter 2024-01-01”, ”uteslut profilsidor och kommentarsfält” och ”stoppa filer med identifierbara hälso- eller platsfält”. Då går reglerna att granska före körning och verifiera på ett stickprov. En formulering som ”ta bort känsligt innehåll senare” saknar däremot både gräns och kontrollpunkt.

KONTROLL 4

Bygg ett stopp för särskilda kategorier och sårbara personer

Uppgifter om bland annat etniskt ursprung, politiska åsikter, hälsa och sexuell läggning omfattas av artikel 9. Avsiktlig skrapning av sådana uppgifter kräver både en rättslig grund enligt artikel 6 och ett tillämpligt undantag enligt artikel 9.2. Att uppgiften har publicerats på internet skapar inget allmänt undantag. Även finansiella uppgifter, platsdata, uppgifter om lagöverträdelser och uppgifter om barn kan väga tungt i intresseavvägningen, trots att kategorierna inte är identiska juridiskt.

EDPB diskuterar EU-domstolens mål GC m.fl. om oavsiktlig och kvarvarande insamling av särskilda kategorier, men betonar att resonemanget inte är en generell frisedel. En tillämpning kräver en bedömning i det enskilda fallet och bland annat att behandlingen är oavsiktlig, att den liknar den situation som domstolen prövade och att den ansvariga inom sina möjligheter genomför åtgärder som förhindrar insamling och spridning.

Gör därför ett stoppbeslut före körningen. Om källorna strukturellt rymmer uppgifter om barn, patientgrupper, politiska eller religiösa forum, sexliv eller andra särskilda kategorier ska dataskyddsombud eller jurist bedöma upplägget innan insamling. Dokumentera förfilter, spärrade källor, kontroll efter hämtning, omedelbar radering av träffar och åtgärder mot att modellen återger uppgifterna. Om ni inte kan visa hur risken fångas är ”vi avsåg inte att samla in det” inte en tillräcklig kontroll.

KONTROLL 5

Spara källans identitet, tidpunkt och kvalitetsbevis

Webbinnehåll ändras, blir inaktuellt och kan vara fel redan vid publiceringen. EDPB rekommenderar därför att i möjligaste mån välja officiella, tillförlitliga och underhållna källor framför gamla aggregatorer, tidsstämpla hämtningen och validera uppgifterna före AI-träning. Valideringen kan omfatta formatkontroller och faktastickprov. Ju bredare insamlingen är, desto svårare blir det att kartlägga, rätta och hålla personuppgifterna aktuella.

Skapa en källjournal med domän eller URL, källa och källtyp, hämtningstid med tidszon, urvalsregel, förväntade personuppgifter, kvalitetstest, beslut och ansvarig. För en inköpt datamängd bör journalen dessutom ange leverantörens kontaktväg och villkoren för den ursprungliga insamlingen. Samma underlag hjälper er att lämna begriplig information och att svara på invändningar eller rättighetsbegäranden.

Källjournalen bör kopplas till verksamhetens dokumentation, inte ligga kvar som en utvecklares tillfälliga logg. När behandlingen ska beskrivas i den löpande dataskyddsdokumentationen kan ni använda vår guide till registerförteckningen enligt artikel 30 för AI. Skriv samtidigt vem som får godkänna nya domäner och när en förändrad källa kräver ny riskbedömning.

BESLUTSUNDERLAG

Samla fem kontroller på en sida före start

  • Alla aktörer och behandlingar är kartlagda som ansvarig, gemensamt ansvarig eller biträde utifrån faktiska beslut och instruktioner.
  • Ändamålet är precist, rättslig grund är dokumenterad och informationslösningen är beslutad innan insamling.
  • Inkluderade och exkluderade källor, kategorier, tidsperioder och filter är testbara och kopplade till dataminimering.
  • Särskilda kategorier, barn och andra känsliga sammanhang har ett dokumenterat stopp- eller eskaleringsflöde.
  • Källjournalen fångar URL eller domän, tidpunkt, kvalitetstest, ansvarig och villkor för inköpta datamängder.

Sätt ett tydligt utfall: starta, starta efter åtgärd eller stoppa och eskalera. Dataskyddsombud eller jurist bör kopplas in när rättslig grund, artikel 9-undantag, ansvarsfördelning eller transparensundantag är oklara. Bedöm också om behandlingens omfattning och risker kräver en konsekvensbedömning avseende dataskydd. Det beslutet kan inte ersättas av den här checklistan.

VANLIGA FRÅGOR

Vanliga frågor om webbskrapning för generativ AI

Får ni skrapa personuppgifter bara för att de ligger öppet på webben?

Nej. Offentlig åtkomst är inte samtycke till AI-träning. Om insamlingen innebär behandling av personuppgifter gäller GDPR och den personuppgiftsansvariga måste bland annat ha ett specificerat ändamål och en rättslig grund.

Kan berättigat intresse användas för AI-träning?

Det kan vara möjligt för privata aktörer, men det kräver tre kumulativa villkor: ett legitimt intresse, nödvändig behandling och en intresseavvägning där de registrerades intressen och rättigheter inte väger tyngre. Bedömningen måste göras i det enskilda fallet.

Måste varje person informeras individuellt?

Inte alltid. Artikel 14.5 b kan i vissa utformningar bli relevant om individuell information är omöjlig eller kräver oproportionerlig ansträngning. Undantaget får inte användas rutinmässigt, och informationen måste alltid göras offentligt tillgänglig tillsammans med lämpliga skyddsåtgärder.

Vad ska stoppas före insamlingen?

Stoppa eller eskalera upplägg där rollerna är oklara, ändamålet är allmänt hållet, rättslig grund saknas, källorna inte går att avgränsa eller där särskilda kategorier av personuppgifter sannolikt kommer att samlas in utan ett hållbart undantag enligt artikel 9.2.

KÄLLOR

Källor och vidare läsning

KÄLLOR KONTROLLERADE: 2026-08-25 // REMISSUTKAST – KONTROLLERA SLUTLIG VERSION EFTER KONSULTATIONEN // INTE JURIDISK RÅDGIVNING.

FLER ARTIKLAR

ARKIV // FÖRDJUPNING // SÖKBART