Denne avocado-lænestol kan være fremtiden for kunstig intelligens

Åbn AI





Med GPT-3 , viste OpenAI, at en enkelt dyb-læringsmodel kunne trænes til at bruge sproget på en række forskellige måder blot ved at smide det med enorme mængder tekst. Det viste det så ved at bytte tekst til pixels , kunne den samme tilgang bruges til at træne en AI til at færdiggøre halvfærdige billeder. GPT-3 efterligner, hvordan mennesker bruger ord; Billede GPT-3 forudsiger, hvad vi ser.

Nu har OpenAI sat disse ideer sammen og bygget to nye modeller, kaldet GIV HENDE og KLIP , der kombinerer sprog og billeder på en måde, der vil gøre AI'ere bedre til at forstå både ord og hvad de refererer til.

Vi lever i en visuel verden, siger Ilya Sutskever, chefforsker ved OpenAI. I det lange løb vil du have modeller, der forstår både tekst og billeder. AI vil være i stand til at forstå sprog bedre, fordi den kan se, hvad ord og sætninger betyder.



OpenAIs nye sproggenerator GPT-3 er chokerende god - og fuldstændig åndssvag

AI er den største sprogmodel, der nogensinde er skabt og kan generere fantastisk menneskelignende tekst efter behov, men vil ikke bringe os tættere på ægte intelligens.

På trods af alle GPT-3's flair kan dens output føles ubundet fra virkeligheden, som om den ikke ved, hvad den taler om. Det er fordi det ikke gør. Ved at jorde tekst i billeder forsøger forskere ved OpenAI og andre steder at give sprogmodeller en bedre kendskab til hverdagens begreber som mennesker bruger til at forstå tingene.

DALL·E og CLIP kommer på dette problem fra forskellige retninger. Ved første øjekast er CLIP (Contrastive Language-Image Pre-training) endnu et billedgenkendelsessystem. Bortset fra at den har lært at genkende billeder ikke fra mærkede eksempler i kuraterede datasæt, som de fleste eksisterende modeller gør, men fra billeder og deres billedtekster taget fra internettet. Den lærer, hvad der er i et billede, fra en beskrivelse i stedet for en etiket på ét ord, såsom kat eller banan.



CLIP trænes ved at få det til at forudsige, hvilken billedtekst fra et tilfældigt udvalg på 32.768 der er den rigtige for et givet billede. For at finde ud af dette lærer CLIP at forbinde en lang række objekter med deres navne og de ord, der beskriver dem. Dette lader den derefter identificere objekter i billeder uden for sit træningssæt. De fleste billedgenkendelsessystemer er trænet til at identificere bestemte typer objekter, såsom ansigter i overvågningsvideoer eller bygninger i satellitbilleder. Ligesom GPT-3 kan CLIP generalisere på tværs af opgaver uden yderligere træning. Det er også mindre sandsynligt end andre avancerede billedgenkendelsesmodeller at blive ført på afveje af modstridende eksempler, som er blevet subtilt ændret på måder, der typisk forvirrer algoritmer, selvom mennesker måske ikke bemærker en forskel.

I stedet for at genkende billeder, tegner DALL·E (som jeg gætter på er et WALL·E/Dali-ordspil) dem. Denne model er en mindre version af GPT-3, der også er blevet trænet i tekst-billede-par taget fra internettet. Givet en kort billedtekst på naturligt sprog, såsom et maleri af en capybara, der sidder i en mark ved solopgang eller et tværsnitsbillede af en valnød, genererer DALL·E masser af billeder, der matcher den: snesevis af capybaraer i alle former og størrelser foran orange og gul baggrund; række efter række af valnødder (dog ikke alle i tværsnit).

Bliv surrealistisk

Resultaterne er slående, selvom de stadig er blandet. Billedteksten et farvet glasvindue med et billede af et blåt jordbær giver mange rigtige resultater, men også nogle med blå vinduer og røde jordbær. Andre indeholder intet, der ligner et vindue eller et jordbær. Resultaterne fremvist af OpenAI-teamet i et blogindlæg ikke er blevet plukket i hånden, men rangeret af CLIP, som har udvalgt de 32 DALL·E-billeder for hver billedtekst, som den mener passer bedst til beskrivelsen.



Tekst-til-billede er en forskningsudfordring, der har eksisteret et stykke tid, siger Mark Riedl, der arbejder med NLP og beregningsmæssig kreativitet ved Georgia Institute of Technology i Atlanta. Men dette er et imponerende sæt eksempler.

Billeder tegnet af DALL·E til billedteksten En baby daikon radise i en tutu, der går tur med en hund

For at teste DALL·E's evne til at arbejde med nye koncepter, gav forskerne den billedtekster, der beskrev genstande, som de troede, den ikke ville have set før, såsom en avocado-lænestol og en illustration af en baby daikon-radise i en tutu, der gik tur med en hund. I begge disse tilfælde genererede AI billeder, der kombinerede disse koncepter på plausible måder.



Især lænestolene ligner alle stole og avocadoer. Det, der overraskede mig mest, er, at modellen kan tage to ikke-relaterede koncepter og sætte dem sammen på en måde, der resulterer i noget form for funktionelt, siger Aditya Ramesh, der har arbejdet på DALL·E. Det skyldes nok, at en halveret avocado ligner en højrygget lænestol, med pit som pude. For andre billedtekster, såsom en snegl lavet af harpe, er resultaterne mindre gode, med billeder, der kombinerer snegle og harper på mærkelige måder.

DALL·E er den slags system, som Riedl forestillede sig at underkaste sig Lovelace 2.0 test , et tankeeksperiment, som han fandt på i 2014. Testen skal erstatte Turing-testen som et benchmark for måling af kunstig intelligens. Det antager, at et kendetegn på intelligens er evnen til at blande koncepter på kreative måder. Riedl foreslår, at det at bede en computer om at tegne et billede af en mand, der holder en pingvin, er en bedre test af klogskab end at bede en chatbot om at dupere et menneske i samtale, fordi det er mere åbent og mindre let at snyde.

Den virkelige test er at se, hvor langt AI'en kan skubbes uden for sin komfortzone, siger Riedl.

Billeder tegnet af DALL·E til billedteksten snegl lavet af harpe

Modellens evne til at generere syntetiske billeder ud af ret finurlig tekst forekommer mig meget interessant, siger Ani Kembhavi ved Allen Institute for Artificial Intelligence (AI2), som også har udviklet en system, der genererer billeder fra tekst . Resultaterne ser ud til at adlyde den ønskede semantik, hvilket jeg synes er ret imponerende. Jaemin Cho, en kollega til Kembhavi, er også imponeret: Eksisterende tekst-til-billede generatorer har ikke vist dette niveau af kontrol med at tegne flere objekter eller DALL·E's rumlige ræsonnementevner, siger han.

Alligevel viser DALL·E allerede tegn på belastning. At inkludere for mange objekter i en billedtekst udvider dens evne til at holde styr på, hvad der skal tegnes. Og at omformulere en billedtekst med ord, der betyder det samme, giver nogle gange forskellige resultater. Der er også tegn på, at DALL·E efterligner billeder, den er stødt på online i stedet for at generere nye.

Jeg er en lille smule mistænksom over for daikon-eksemplet, som stilistisk antyder, at det kan have lært noget kunst udenad fra internettet, siger Riedl. Han bemærker, at en hurtig søgning bringer en masse tegneseriebilleder af menneskeskabte daikoner frem. GPT-3, som DALL·E er baseret på, er berygtet for at huske, siger han.

Alligevel er de fleste AI-forskere enige om, at jordforbindelse af sprog i visuel forståelse er en god måde at gøre AI'er smartere.

Fremtiden kommer til at bestå af systemer som dette, siger Sutskever. Og begge disse modeller er et skridt hen imod det system.

skjule