Når verdens mest avancerede AI-systemer stadig kæmper med at læse en simpel PDF-fil, er der grund til at stille spørgsmål ved, hvor langt vi egentlig er kommet med den kunstige intelligens.
20.000 sider kaos
I november sidste år stod journalist Luke Igel og hans kolleger overfor en monumental opgave: House Oversight Committee havde netop frigivet 20.000 sider dokumenter fra Jeffrey Epstein-sagen. Alle som PDF’er. Alle mere eller mindre ulæselige.
Problemet blev kun værre, da Justitsministeriet i de følgende måneder slap yderligere tre millioner filer løs – igen som PDF’er med så dårlig tekstgenkendelse, at dokumenterne reelt var usøgbare. “Der var ingen brugbar grænseflade,” fortalte Igel frustreret.
Kun 3 ud af 11 klarer opgaven
Det viser sig, at dette ikke bare er et problem med gamle scannede dokumenter. Forskning har afsløret, at kun 3 ud af 11 testede AI-sprogmodeller faktisk kan læse PDF-filer korrekt. Ja, du læste rigtigt – trods milliarder investeret i AI-udvikling, kan de fleste systemer ikke klare en af de mest basale digitale opgaver.
GPT-4’s ærlige indrømmelse
Selv den avancerede GPT-4 model har sine begrænsninger. Når den bliver bedt om at læse en 500-siders PDF, indrømmer systemet ærligt, at det kun kan nå gennem cirka 37 procent af dokumentet, før det løber ind i tidsbegrænsninger. Det er som at ansætte en læser, der går hjem midt i bogen.
Hvorfor er PDF’er så svære?
Problemet er mangefacetteret. AI-systemer skal samtidig processere tekst, billeder og strukturelle elementer – en kompleks opgave der bliver eksponentielt sværere med større dokumenter. Når dokumenter er scannede eller har komplekse layouts, skal systemerne først konvertere billeder til tekst via OCR-teknologi, og her går det ofte galt med forvredne og ubrugelige resultater.
Nødløsningen: Gør det simpelt
Eksperternes råd er nærmest komisk i sin enkelhed: Konverter PDF’en til ren tekst først. Det viser sig, at AI faktisk klarer sig meget bedre med simple tekstfiler end med det format, som stort set hele forretningsverdenen bruger dagligt.
Adobe forsøger at redde sin egen filtype
I et forsøg på at løse problemet har Adobe lanceret en AI Assistant i beta-version, trænet specifikt til at forstå PDF-struktur. Det er næsten ironisk: Firmaet bag PDF-formatet må nu udvikle specialiseret AI for at læse deres egen opfindelse.
Så næste gang nogen lover dig, at AI kan revolutionere din dokumenthåndtering, så spørg dem lige: “Ja, men kan den læse en PDF?”




