Reddit går til krig mod AI-gigant: Anklager Perplexity for massiv datastjæleri
Hold nu fast – det her er stort! Reddit har netop fyret en juridisk bombe af mod AI-startup Perplexity, og beskyldningerne er ikke til at kimse af. Vi snakker milliarder af stjålne datapunkter, omgåelse af sikkerhedssystemer og det, Reddit kalder “industriel datahvidvaskning”. Ja, du læste rigtigt – datahvidvaskning.
Hvad handler sagen egentlig om?
Reddit har sagsøgt Perplexity AI og tre dataindsamlingsfirmaer – Oxylabs fra Litauen, AWMProxy fra Rusland og det Texas-baserede SerpApi – for ulovligt at have skrabet platformens data til at træne Perplexitys AI-drevne søgemaskine. Og vi snakker ikke småting her. Ifølge sagsøgningen har disse firmaer systematisk omgået Reddits sikkerhedsforanstaltninger for at stjæle data, som Perplexity “desperat har brug for” til deres såkaldte “answer engine”-system.
Ben Lee, Reddits juridiske chef, holder ikke noget tilbage: “AI-virksomheder er låst i et kapløb om kvalitetsindhold fra mennesker – og det pres har skabt en ‘datahvidvasknings-økonomi’ i industriel skala.”
Sådan gjorde de det (angiveligt)
Her bliver det teknisk – og ret så snedigt. Reddit påstår, at de tre dataindsamlingsfirmaer brugte avancerede metoder til at omgå platformens beskyttelse:
- Residential proxies: Ved at route trafik gennem almindelige hjemme-IP-adresser kunne de maskere, at det var bots, der hentede data
- Omgåelse af rate limits og CAPTCHAs: De tekniske barrierer, der normalt stopper automatiseret scraping, blev simpelthen kørt uden om
- “Hvidvaskning” af data: Ved at sende data gennem mellemmænd fik det til at se ud som “ren” tredjepartsdata, der kunne sælges videre til Perplexity
Det smarte (eller uhyggelige, afhængigt af perspektiv) er, at denne metode gør det næsten umuligt for Reddit at spore, hvor deres data ender.
Perplexitys aggressive respons
Efter Reddit sendte et cease-and-desist-brev sidste år, gjorde Perplexity noget bemærkelsesværdigt: De øgede deres citationer af Reddit med det fyrredobbelte. Det er enten ekstremt frækt eller et forsøg på at legitimere deres brug af data – eller begge dele.
Perplexity selv afviser beskyldningerne kontant: “Vores tilgang forbliver principfast og ansvarlig, mens vi leverer faktuelle svar med præcis AI, og vi vil ikke tolerere trusler mod åbenhed og offentlighedens interesse.”
Hvorfor er det her så vigtigt?
Dette er langt mere end bare endnu en tech-retssag. Det handler om fremtidens spilleregler for AI-udvikling:
For Reddit: Platformen har indgået lukrative licensaftaler med Google (angiveligt 60 millioner dollars årligt) og OpenAI. Ulovlig scraping underminerer direkte deres forretningsmodel.
For AI-industrien: Hvis Reddit vinder, kan det:
- Tvinge AI-virksomheder til at betale for træningsdata, hvilket vil ramme startups hårdt
- Sætte præcedens for, hvordan Computer Fraud and Abuse Act (CFAA) fortolkes i AI-æraen
- Accelerere lovgivning om databeskyttelse og ejerskab
For internettet generelt: Sagen rejser fundamentale spørgsmål om, hvem der ejer brugergeneret indhold, og om AI-træning udgør “fair use” eller tyveri.
Det store billede: Datakapløbet intensiveres
Reddit er ikke alene. New York Times sagsøgte OpenAI og Microsoft i 2023, og flere medier overvejer lignende skridt. Vi ser konturerne af en ny virkelighed, hvor:
- Platforme aggressivt beskytter data som en indtægtskilde
- AI-virksomheder er desperate efter kvalitetsindhold
- Mellemmænd (som proxy-tjenester) kommer under pres for at kontrollere deres kunder
- Akademisk forskning og legitim data-indsamling risikerer at blive ramt som kollateral skade
Hvad siger de andre?
Oxylabs udtrykte sig “chokeret og skuffet” og påpegede, at Reddit aldrig har kontaktet dem direkte. SerpApi afviser blankt beskyldningerne og lover at forsvare sig “kraftigt” i retten. AWMProxy har endnu ikke kommenteret – hvilket måske ikke er så mærkeligt, givet deres russiske base og de nuværende sanktioner.
Hvad sker der nu?
Sagen er stadig i de tidlige stadier, men Reddit kræver:
- Uspecificerede økonomiske erstatninger (læs: potentielt astronomiske beløb)
- Et permanent forbud mod Perplexitys brug af Reddit-data
Udfaldet kan forme hele AI-industriens fremtid. Hvis Reddit vinder stort, kan vi se en bølge af lignende søgsmål og en fundamental ændring i, hvordan AI-systemer får adgang til træningsdata.
Bundlinjen
Dette er ikke bare en juridisk kamp mellem to tech-virksomheder. Det er en definerende øjeblik for, hvordan vi balancerer innovation i AI med respekt for dataejerskab og brugerrettigheder. Og med milliarder af dollars på spil på begge sider, kan du være sikker på, at dette bliver en langvarig og intens juridisk krig.
Spørgsmålet er: Skal AI-virksomheder betale for de data, der gør deres systemer intelligente? Eller er offentligt tilgængeligt indhold fair game i innovationens navn? Reddit siger klart nej til det sidste – og resten af tech-verdenen holder vejret.
Sagen fortsætter, og DagensAI.dk følger selvfølgelig udviklingen tæt.




