OpenAIs seneste model tager tekstbeskeder og forvandler dem til "komplekse scener med flere karakterer, specifikke typer bevægelser" og mere.
OpenAI lancerer en ny videogenereringsmodel, og den hedder Sora. AI-virksomheden siger, at Sora "kan skabe realistiske og fantasifulde scener ud fra tekstinstruktioner." Tekst-til-video-modellen giver brugerne mulighed for at lave fotorealistiske videoer på op til et minut – alt baseret på instruktioner, de har skrevet.
Sora kan skabe "komplekse scener med flere karakterer, specifikke typer bevægelser og præcise detaljer om motivet og baggrunden", ifølge OpenAI:s indledende blogindlæg. Virksomheden bemærker også, at modellen kan forstå, hvordan objekter "eksisterer i den fysiske verden", samt "præcist fortolke rekvisitter og generere overbevisende karakterer, der udtrykker levende følelser".
Modellen kan også generere en video baseret på et stillbillede, samt udfylde manglende billeder i en eksisterende video eller udvide den. De Sora-genererede demoer, der er inkluderet i OpenAI's Blogindlæggene inkluderer et luftfoto af Californien under guldfeberen, en video, der ser ud som om den er taget indefra et tog i Tokyo, og andre. Mange har nogle tegn på AI – som et mistænkeligt bevægeligt gulv i en video fra et museum – og OpenAI siger, at modellen “kan have svært ved præcist at simulere fysikken i en kompleks scene”, men resultaterne er generelt ret imponerende.
For et par år siden var tekst-til-billede-generatorer som Midjourney i spidsen for modellers evne til at omdanne ord til billeder. Men for nylig er video begyndt at forbedres med en bemærkelsesværdig hastighed: virksomheder som Runway og Pika har vist deres egne imponerende tekst-til-video-modeller frem, og Googles Lumiere forventes også at være en af OpenAIs hovedkonkurrenter på dette område. Ligesom Sora tilbyder Lumiere brugerne tekst-til-video.værktøj og giver dem også mulighed for at lave videoer ud fra et stillbillede.
Sora er i øjeblikket kun tilgængelig for "røde teammedlemmer", der vurderer modellen for potentiel skade og risiko. OpenAI tilbyder også adgang til feedback for udvalgte billedkunstnere, designere og filmskabere. Den bemærker, at den eksisterende model muligvis ikke nøjagtigt simulerer fysikken i en kompleks scene og muligvis ikke korrekt fortolker visse tilfælde af årsag og virkning.
Tidligere på måneden annoncerede OpenAI, at de tilføjede vandmærker til deres tekst-til-billede-værktøj DALL-E 3, men bemærker, at de "nemt kan fjernes." Ligesom deres andre AI-produkter vil OpenAI skulle kæmpe med konsekvenserne af, at falske, AI-genererede fotorealistiske videoer forveksles med ægte videoer. .








