Datenschutz
Kein generelles Verbot von Web-Scraping nach EDSA-Leitlinien
von Ricarda Puschky
Mit seinen Leitlinien 3/2026, veröffentlicht im Juli 2026, zur Verarbeitung personenbezogener Daten für die Entwicklung und den Einsatz von KI-Modellen schafft der Europäische Datenschutzausschuss (EDSA) mehr Klarheit beim Umgang mit öffentlich zugänglichen personenbezogenen Daten. Eine der wichtigsten Aussagen: Das sogenannte Web-Scraping ist datenschutzrechtlich nicht grundsätzlich verboten. Als Rechtsgrundlage kann insbesondere das berechtigte Interesse nach Art. 6 Abs. 1 lit. f DSGVO in Betracht kommen. Die dabei entwickelten Grundsätze knüpfen dementsprechend an die allgemeinen datenschutzrechtlichen Anforderungen an.
Diese Feststellung dürfte viele Unternehmen erleichtern. Gleichzeitig macht der EDSA aber deutlich, dass eine Verarbeitung nur zulässig ist, wenn die Interessenabwägung sorgfältig durchgeführt wird. Dabei rückt insbesondere ein Begriff in den Mittelpunkt: die „vernünftigen Erwartungen“ der betroffenen Personen.
Nicht jede Verarbeitung ist automatisch zu erwarten
Nach Auffassung des EDSA wissen viele Menschen inzwischen, dass öffentlich zugängliche Informationen im Internet von Dritten gesammelt und weiterverarbeitet werden können – insbesondere vor dem Hintergrund der rasanten Entwicklung generativer KI-Systeme.
Daraus folgt jedoch nicht, dass Betroffene mit jeder denkbaren Verarbeitung rechnen müssen. Entscheidend sind vielmehr der jeweilige Zweck der Verarbeitung, die Art der Daten sowie der Verantwortliche, der diese verarbeitet.
Dieser Grundsatz erscheint zunächst nachvollziehbar. Für die Praxis bleibt allerdings eine entscheidende Frage offen: Wo verläuft die Grenze zwischen einer Verarbeitung, mit der Betroffene noch vernünftigerweise rechnen müssen, und einer, die ihre Erwartungen überschreitet? Gerade diese Abgrenzung ist für Unternehmen wichtig, wenn sie ihre Interessenabwägung nach Art. 6 Abs. 1 lit. f DSGVO durchführen. Konkrete und objektive Kriterien liefert der EDSA hierzu jedoch nur begrenzt.
Ein Beispiel des EDSA wirft weitere Fragen auf
Besonders interessant ist deshalb ein Blick auf eines der Praxisbeispiele in den Leitlinien.
Dort beschreibt der EDSA den Fall, dass eine Person Inhalte auf einer frei zugänglichen Plattform veröffentlicht. Die Plattform enthält keine technischen Beschränkungen gegen Web-Scraping und weist ihre Nutzenden ausdrücklich darauf hin, dass Inhalte von Dritten automatisiert ausgelesen werden können.
Unter diesen Voraussetzungen kommt der EDSA zu dem Ergebnis, dass Betroffene vernünftigerweise damit rechnen können, dass ihre Daten sogar zum Training von KI-Modellen verwendet werden.
Dieses Beispiel ist bemerkenswert. Schließlich gehört das Training generativer KI-Systeme sicherlich nicht zu den alltäglichen oder offensichtlichsten Formen der Datenverarbeitung. Wenn der EDSA selbst davon ausgeht, dass Betroffene unter diesen Umständen sogar mit einer solchen Nutzung rechnen müssen, stellt sich umso mehr die Frage, nach welchen objektiven Maßstäben die Grenze in anderen Fällen gezogen werden soll.
Interessant wäre beispielsweise die Bewertung einer Website, auf der personenbezogene Daten zwar öffentlich zugänglich sind, die Betreiber jedoch keinen ausdrücklichen Hinweis auf ein mögliches automatisches Auslesen geben. Nach den allgemeinen Aussagen des EDSA spricht vieles dafür, dass zumindest ein gewisses Maß an Weiterverarbeitung trotzdem noch zu den vernünftigen Erwartungen gehören könnte. Eine eindeutige Antwort liefern die Leitlinien jedoch nicht.
Welche Faktoren sollen Unternehmen berücksichtigen?
Immerhin nennt der EDSA einige Kriterien, die bei der Beurteilung der vernünftigen Erwartungen eine Rolle spielen können. Dazu gehören unter anderem:
- die Art der Website (z. B. soziales Netzwerk, Forum oder frei zugängliche Internetseite),
- der Grad der öffentlichen Zugänglichkeit,
- ob die betroffene Person die Daten selbst veröffentlicht hat,
- sowie der Charakter der jeweiligen Plattform.
Besonders hilfreich ist dabei eine vom EDSA formulierte Faustregel: Je öffentlicher personenbezogene Daten von der betroffenen Person selbst zugänglich gemacht wurden, desto eher kann erwartet werden, dass auch Dritte diese Daten verarbeiten. Diese Aussage dürfte Unternehmen künftig eine wichtige Orientierung bei der Durchführung ihrer Interessenabwägung geben.
Technische Schutzmaßnahmen als Kriterium – wirklich praktikabel?
Kritischer zu bewerten ist dagegen eine weitere Überlegung des EDSA. Danach sollen auch technische Schutzmaßnahmen einer Website – etwa robots.txt- oder ai.txt-Dateien, CAPTCHAs oder vergleichbare Zugriffsbeschränkungen – Einfluss auf die vernünftigen Erwartungen der betroffenen Personen haben.
Die Idee dahinter: Sind Betroffenen solche Schutzmechanismen bekannt und werden die Daten dennoch gescrapt, soll dies gegen eine vernünftige Erwartung der Verarbeitung sprechen.
In der Praxis wirft dieser Ansatz jedoch einige Fragen auf. Zum einen werden hier Maßnahmen des Websitebetreibers mit den Erwartungen der betroffenen Personen verknüpft. Zum anderen müssen Verantwortliche ihre Interessenabwägung bereits vor Beginn der Verarbeitung durchführen. Wie sie dabei zuverlässig feststellen sollen, ob einzelne Nutzende überhaupt Kenntnis von robots.txt-Dateien, ai.txt oder ähnlichen technischen Mechanismen hatten, bleibt offen. Gleiches gilt für die Möglichkeit des Scrapings allgemein. Ob Betroffene über das hierfür erforderliche technische Verständnis verfügen, lässt sich regelmäßig weder objektiv überprüfen noch dokumentieren.
Allenfalls können Verantwortliche – soweit dies möglich ist – prüfen, ob eine Website entsprechende Schutzmaßnahmen einsetzt und ob hierauf zusätzlich ausdrücklich hingewiesen wird. Ob dies tatsächlich Rückschlüsse auf die Erwartungen der Nutzenden zulässt, erscheint jedoch fraglich.
Gerade dieser Punkt zeigt, dass der EDSA die Interessenabwägung teilweise an Kriterien knüpft, die sich in der Praxis nur schwer belastbar bewerten lassen. Für Unternehmen dürfte dies die bestehende Rechtsunsicherheit eher erhöhen als verringern.
Hilfreiche Leitlinien mit bleibenden Unsicherheiten
Die Leitlinien 3/2026 bestätigen, dass das Scraping öffentlich zugänglicher personenbezogener Daten nicht grundsätzlich unzulässig ist und grundsätzlich auf ein berechtigtes Interesse nach Art. 6 Abs. 1 lit. f DSGVO gestützt werden kann. Gleichzeitig machen sie deutlich, dass die Interessenabwägung künftig noch stärker von den vernünftigen Erwartungen der betroffenen Personen abhängt.
Positiv ist, dass der EDSA mit seiner Faustregel zur Veröffentlichung öffentlich zugänglicher Daten sowie seinem Praxisbeispiel zum KI-Training durchaus hilfreiche Orientierungspunkte bietet. Weniger überzeugend wirken dagegen Kriterien, die auf schwer überprüfbaren Annahmen über das technische Wissen einzelner Betroffener beruhen. Hier wäre eine stärkere Orientierung an objektiv feststellbaren Umständen für die Praxis wünschenswert gewesen.