Google har lige kastet endnu en AI-bombe på markedet – og denne gang er det ikke bare “endnu en chatbot” eller “endnu en billedgenerator”. Nej, tech-giganten kalder deres nye model Gemini Omni for et “world model”, der kan “skabe hvad som helst ud fra hvad som helst”. Og ja, det lyder lige så vanvittigt, som det er.
Fra bamse på ferie til AI-revolution
Da journalisten fra The Verge sidste år deepfakede sin søns bamse – en plys-hjort ved navn Buddy – på ferie, var det et uskyldigt eksperiment. Men det åbnede øjnene for, hvor uhyggeligt nemt det er blevet at skabe realistiske videoer med AI. Og nu? Nu har Google taget det til et helt nyt niveau.
Hvad fanden er “anything-to-anything”?
Forestil dig det her: Du giver AI’en tekst, billeder, lyd eller video – og den spytter noget helt andet ud i en anden form. Vil du have en video lavet ud fra et foto og en lydfil? No problem. Vil du redigere en video med blot en tekstbesked? Piece of cake. Det er præcis det, Gemini Omni lover at kunne.
I modsætning til traditionelle AI-modeller, der typisk kun arbejder i én retning (tekst-til-billede, for eksempel), er Omni trænet på tværs af alle modaliteter samtidigt. Det betyder, at den forstår sammenhænge mellem tekst, billeder, lyd og video på en måde, tidligere modeller ikke kunne.
Hvad kan den egentlig lige nu?
Okay, lad os lige holde hesten. Selvom Google taler stort om “anything-to-anything”, er den første offentlige version – Gemini Omni Flash – primært fokuseret på video-generering og -redigering. Men det er stadig ret imponerende:
Modellen kan generere video ud fra tekst, billeder, lyd eller andre videoer. Den kan redigere eksisterende videoer med simple kommandoer. Og ifølge Google kan den simulere fysik og bevægelse mere realistisk end tidligere værktøjer – så ingen flere svævende hænder eller mærkelige ansigtsudtryk. Måske.
Hvor finder du det?
Gemini Omni ruller ud i Gemini-appen, Google Flow og angiveligt også i YouTube Shorts. Google positionerer det som en del af deres bredere kreative værktøjskasse snarere end en standalone forbrugermodel, du bare kan lege med derhjemme.
Det er bare begyndelsen
Omni er ikke bare en sjov gadget. Det er en del af Googles massive strategi for at integrere AI i bogstaveligt talt alt, hvad de laver: Søgning, Chrome, YouTube, Docs, Android – you name it. De vil have Gemini til at blive det lag, der ligger under hele dit digitale liv.
Samtidig har Google også annonceret Gemini Spark – en always-on personlig AI-agent, der kan skrive emails, lave studievejledninger og overvåge dine abonnementer. Fordi hvem har ikke brug for endnu en AI, der holder øje med deres Netflix-regning?
Men er det ikke bare… slop?
Her kommer vi tilbage til bamsen. The Verge-journalisten stillede sig selv spørgsmålet: Hvor går grænsen mellem harmløs sjov med generativ AI og ren slop? Måske er det en perfekt cirkel i et Venn-diagram. Måske ikke.
Men én ting er sikker: Værktøjerne til at lave realistiske videoer bliver bedre og bedre, og de kræver forbløffende lidt indsats og knowhow. Det åbner døren for kreativitet – men også for misinformation, deepfakes og en hel del AI-genereret content, vi måske ikke har brug for.
Hvad betyder det for os?
Google sælger Omni som et gennembrud i “world understanding” og multimodalitet. Men lad os være ærlige: Den fulde “anything-to-anything”-kapabilitet er nok stadig mere et fremtidsløfte end nutidig virkelighed. Outputlængde og værktøjsadgang er sandsynligvis begrænset i denne tidlige fase.
Men retningen er klar: Vi bevæger os mod en verden, hvor AI ikke bare svarer på spørgsmål eller genererer billeder, men kan transformere enhver form for input til enhver form for output. Og det er både vildt spændende og lidt skræmmende på samme tid.
Så næste gang dit barn spørger, om bamsen kan komme på ferie, ved du, hvad du skal gøre. Eller måske hellere ikke.




