Wikimedia går all-in på AI-revolutionen med en imponerende række nye initiativer, der skal gøre verdens største vidensbase mere tilgængelig for både udviklere og kunstig intelligens. Og nej, Wikipedia bliver ikke til en chatbot – men den bliver meget smartere bagved.
Vektorer gør Wikipedia AI-klar
Det største nybrud kommer fra Wikidata Embedding Project, hvor Wikimedia Deutschland har brugt det seneste år på at omdanne 19 millioner Wikidata-poster til AI-venlige vektorer. Forestil dig det som en gigantisk graf med prikker og forbindelseslinjer – Douglas Adams ville være forbundet til både “menneske” og titlerne på hans bøger.
Projektet er udviklet i samarbejde med Jina.AI og DataStax (ejet af IBM) og understøtter Model Context Protocol, som gør det lettere for AI-systemer at kommunikere med datakilder. Når du søger efter “videnskabsmand”, får du ikke bare søgeresultater – du får omfattende lister over prominente atomfysikere, forskere fra Bell Labs, oversættelser til forskellige sprog og relaterede begreber som “forsker” og “lærd”.
David mod Goliath i AI-verdenen
Målet er at udjævne spillefeltet for mindre AI-udviklere, der ikke har OpenAI’s og Anthropic’s ressourcer til selv at vektorisere Wikidata. “Det handler virkelig om at give dem et forspring og i det mindste give dem en chance,” forklarer Lydia Pintscher, Wikidata portfolio lead.
Et eksempel på, hvordan dette kan bruges til gavn, er Govdirectory – en platform der bruger Wikidata til at hjælpe brugere med at finde sociale medier og e-mails for offentlige embedsmænd verden over.
Mennesker først, AI bagefter
Wikimedia Foundations AI-strategi fra april 2025 sætter frivillige redaktører i centrum. AI skal fjerne tekniske barrierer, ikke erstatte mennesker. Initiativerne inkluderer AI-assisteret moderering, forbedret informationssøgning, automatiseret oversættelse og guidede mentorsystemer til nye frivillige.
Strategien bygger på open source-prioritering, gennemsigtighed og flersproget support – alt sammen guidet af Wikimedias værdier omkring privatliv og menneskerettigheder.
Strukturerede data til alle
På Kaggle kan udviklere nu finde AI-klar Wikipedia-data i struktureret JSON-format i stedet for rå artikeltekst. Dette inkluderer abstracts, korte beskrivelser, infobox-data, billedlinks og segmenterede artikelsektioner – alt sammen frit licenseret under Creative Commons.
Wikimedia Enterprise har også introduceret en ny Parsed Tables-funktion, der konverterer komplekse Wikipedia-tabeller til ren, maskinlæsbar JSON-data.
Strategiske partnerskaber
Wikimedia Enterprise har indgået vigtige partnerskaber, herunder samarbejde med ProRata.ai til at drive Gist.ai søgemaskinen med menneske-kurateret Wikimedia-indhold. Organisationen arbejdede også med Nomic AI, som brugte Wikimedia Enterprise’s Structured Contents dataset til at skabe den første fulde open source-vektorisering af flersproget Wikipedia.
Kvalitetskontrol i AI-æraen
Mens tilgængeligheden udvides, styrkes kvalitetskontrollen også. I august 2025 vedtog Wikipedia en politik, der tillader redaktører at nominere mistænkte AI-genererede artikler til hurtig sletning. Fællesskabet havde tidligere etableret AI Cleanup WikiProject i 2023 for at håndtere problemer med AI-genereret indhold af lav kvalitet.
Med disse initiativer viser Wikimedia, at de forstår AI-æraens muligheder og udfordringer. De gør data mere tilgængelig gennem avancerede søgeteknologier, mens de fastholder den menneskecentrerede redaktionsproces, der har gjort Wikipedia til en pålidelig videnskilde i næsten 25 år.




