Disse mærkelige, foruroligende billeder viser, at AI bliver smartere

storyboard Ai-genererede billeder

Allen Institute for AI





Af alle AI-modeller i verden, OpenAI's GPT-3 har mest fanget offentlighedens fantasi. Det kan udspy digte, noveller og sange med lidt tilskyndelse, og det er blevet demonstreret at narre folk til at tro, at dets output var skrevet af et menneske. Men dens veltalenhed er mere et salontrick, der ikke skal forveksles med ægte intelligens.

Ikke desto mindre mener forskere, at de teknikker, der blev brugt til at skabe GPT-3, kunne indeholde hemmeligheden bag mere avanceret kunstig intelligens. GPT-3 trænede på en enorm mængde tekstdata. Hvad hvis de samme metoder blev trænet på både tekst og billeder?

Nu har ny forskning fra Allen Institute for Artificial Intelligence, AI2, taget denne idé til næste niveau. Forskerne har udviklet en ny tekst-og-billede-model, også kendt som en visuel-sprogmodel, der kan generere billeder med en billedtekst. Billederne ser foruroligende og freakish ud - intet som de hyperrealistiske deepfakes genereret af GAN'er - men de kan vise en lovende ny retning for at opnå mere generaliserbar intelligens og måske også smartere robotter.



Udfyld det blanke

GPT-3 er en del af en gruppe modeller kendt som transformere, som først blev populær med succesen med Googles BERT. Før BERT var sprogmodeller ret dårlige. De havde nok forudsigelseskraft til at være nyttige til applikationer som autofuldførelse, men ikke nok til at generere en lang sætning, der fulgte grammatikregler og sund fornuft.

BERT ændrede det ved at introducere en ny teknik kaldet maskering . Det går ud på at gemme forskellige ord i en sætning og bede modellen om at udfylde det tomme felt. For eksempel:

  • Kvinden gik til ___ for at træne.
  • De købte en ___ brød til at lave sandwich.

Tanken er, at hvis modellen bliver tvunget til at udføre disse øvelser, ofte millioner af gange, begynder den at opdage mønstre i, hvordan ord samles til sætninger og sætninger til afsnit. Som et resultat heraf kan den bedre generere såvel som fortolkning af tekst, og få den tættere på at forstå betydningen af ​​sprog. (Google bruger nu BERT for at vise mere relevante søgeresultater i sin søgemaskine .) Efter at maskering viste sig at være yderst effektiv, forsøgte forskerne at anvende det på visuelle sprogmodeller ved at skjule ord i billedtekster, som f.eks.



En giraf stående nær et træ.

En ____ står på en jordbund nær et træ.

AI2

Denne gang kunne modellen se på begge de omgivende ord og indholdet af billedet for at udfylde det tomme felt. Gennem millioner af gentagelser kunne den så opdage ikke kun mønstrene blandt ordene, men også forholdet mellem ordene og elementerne i hvert billede.

Resultatet er modeller, der er i stand til at relatere tekstbeskrivelser til visuelle referencer – ligesom babyer kan skabe forbindelser mellem de ord, de lærer, og de ting, de ser. Modellerne kan for eksempel se på billedet nedenfor og skrive en fornuftig billedtekst som Kvinder, der spiller landhockey. Eller de kan svare på spørgsmål om det som Hvad er farven på bolden? ved at forbinde ordet kugle med det cirkulære objekt i billedet.



Kvinder, der spiller landhockey

En visuel-sproget model ville være i stand til fornuftigt at skrive dette billede: 'Kvinder, der spiller landhockey'.

JOHN TORCASIO / UNSPLASH

Et billede siger mere end tusind ord

Men AI2-forskerne ønskede at vide, om disse modeller faktisk havde udviklet en konceptuel forståelse af den visuelle verden. Et barn, der har lært ordet for en genstand, kan ikke kun fremtrylle ordet for at identificere objektet, men også tegne objektet, når det bliver bedt om det, selvom selve objektet ikke er til stede. Så forskerne bad modellerne om at gøre det samme: at generere billeder fra billedtekster. Alle spytter de useriøse pixelmønstre ud i stedet.

Et forvirrende net af pixels.

Det er en fugl! Det er et fly! Nej, det er bare gobbledygook genereret af AI.



AI2

Det giver mening: At transformere tekst til billeder er langt sværere end omvendt. En billedtekst specificerer ikke alt, der er indeholdt i et billede, siger Ani Kembhavi, der leder computervisionsteamet hos AI2. Så en model skal trække på en masse sund fornuft om verden for at udfylde detaljerne.

Hvis den bliver bedt om at tegne en giraf, der går på en vej, for eksempel, skal den også udlede, at vejen er mere tilbøjelig til at være grå end pink og mere tilbøjelig til at være ved siden af ​​en græsmark end ved siden af ​​havet— selvom ingen af ​​disse oplysninger er eksplicitte.

Så Kembhavi og hans kolleger Jaemin Cho, Jiasen Lu og Hannaneh Hajishirzi besluttede at se, om de kunne lære en model al denne implicitte visuelle viden ved at justere deres tilgang til maskering. I stedet for at træne modellen til bare at forudsige maskerede ord i billedteksterne fra de tilsvarende billeder, trænede de den også til at forudsige maskerede pixels på billederne på basis af deres tilsvarende billedtekster.

De endelige billeder genereret af modellen er ikke ligefrem realistiske. Men det er ikke meningen. De indeholder de rigtige visuelle koncepter på højt niveau - AI-ækvivalenten til et barn, der tegner en pindefigur for at repræsentere et menneske. (Du kan selv prøve modellen her .)

Forskellige output genereret af AI2

Eksempler på billeder genereret af AI2's model fra billedteksterne under dem.

AI2

Visuelle sprogmodellers evne til at lave denne form for billedgenerering repræsenterer et vigtigt skridt fremad i AI-forskning. Det antyder, at modellen faktisk er i stand til et vist abstraktionsniveau, en grundlæggende færdighed til at forstå verden.

På længere sigt kan dette få konsekvenser for robotteknologi. Jo bedre en robot er til at forstå sine visuelle omgivelser og bruge sproget til at kommunikere om dem, jo ​​mere komplekse opgaver vil den være i stand til at udføre. På kort sigt kan denne type visualisering også hjælpe forskere til bedre at forstå præcis, hvad black box AI-modeller lærer, siger Hajishirzi.

Fremover planlægger teamet at eksperimentere mere for at forbedre kvaliteten af ​​billedgenereringen og udvide modellens visuelle og sproglige ordforråd til at omfatte flere emner, objekter og adjektiver.

Billedgenerering har virkelig været en manglende puslespilsbrik, siger Lu. Ved at aktivere dette kan vi få modellen til at lære bedre repræsentationer til at repræsentere verden.

skjule