Ethvert teknologisk skifte er en mulighet til å fremme vitenskapelige oppdagelser, akselerere menneskelig fremgang og forbedre liv. Jeg tror overgangen vi ser akkurat nå med AI vil være den mest omfattende i våre liv, langt større enn overgangen til mobil eller nettet før den. AI har potensial til å skape muligheter – fra det hverdagslige til det ekstraordinære – for mennesker overalt. Det vil bringe nye bølger av innovasjon og økonomisk fremgang, og drive kunnskap, læring, kreativitet og produktivitet i en skala vi aldri har sett før.
Det er det som begeistrer meg: muligheten til å gjøre AI nyttig for alle, overalt i verden.
Nesten åtte år inn i vår reise som et AI-først selskap, bare øker tempoetMillioner av mennesker bruker nå generativ AI i produktene våre for å gjøre ting de ikke kunne for bare et år siden, fra å finne svar på mer komplekse spørsmål til å bruke nye verktøy for å samarbeide og skape. Samtidig bruker utviklere modellene og infrastrukturen vår til å bygge nye generative AI-applikasjoner, og oppstartsbedrifter og bedrifter over hele verden vokser med AI-verktøyene våre.
Dette er en utrolig hastighet, og likevel har vi bare begynt å skrape i overflaten av hva som er mulig.
Vi nærmer oss dette arbeidet på en dristig og ansvarlig måte. Det betyr å være ambisiøse i forskningen vår og forfølge kapasiteter som vil gi enorme fordeler for mennesker og samfunn, samtidig som vi bygger inn sikkerhetstiltak og samarbeider med myndigheter og eksperter for å håndtere risikoer etter hvert som AI blir mer kapabel. Og vi fortsetter å investere i de aller beste verktøyene, grunnleggende modellene og infrastrukturen og bruker dem til produktene våre og andre, veiledet av våre KI-prinsipper .
Nå tar vi neste steg i reisen vår med Gemini, vår mest kapable og allsidige modell hittil, med toppmoderne ytelse på tvers av mange ledende testresultater. Vår første utgivelse, Gemini 1.0, er optimalisert for forskjellige størrelser: Ultra, Pro og Nano. Dette er de første modellene fra Gemini-æraen og den første realiseringen av visjonen vi hadde da vi grunnla Google DeepMind tidligere i år. Denne nye æraen med modeller representerer en av de største vitenskapelige og tekniske innsatsene vi noensinne har gjort som selskap. Jeg er virkelig spent på hva som ligger foran oss, og på mulighetene Gemini vil åpne for folk overalt.
Introduksjon av Gemini
Av Demis Hassabis, administrerende direktør og medgründer av Google DeepMind, på vegne av Gemini-teamet
AI har vært fokuset i mitt livsverk, slik det har vært for mange av mine forskerkollegaer. Helt siden jeg programmerte AI for dataspill som tenåring, og i løpet av mine år som nevroforsker der jeg prøvde å forstå hvordan hjernen fungerer, har jeg alltid trodd at hvis vi kunne bygge smartere maskiner, kunne vi utnytte dem til å gagne menneskeheten på utrolige måter.
Dette løftet om en verden ansvarlig styrt av AI fortsetter å drive arbeidet vårt hos Google DeepMind. Vi har lenge ønsket å bygge en ny generasjon av AI-modeller, inspirert av hvordan mennesker forstår og samhandler med verden. AI som føles mindre som smart programvare og mer som noe nyttig og intuitivt – en eksperthjelper eller assistent.
I dag er vi ett skritt nærmere denne visjonen når Vi introduserer Gemini , den mest kapable og generelle modellen vi noen gang har bygget.
Gemini er et resultat av omfattende samarbeid mellom team hos Google, inkludert våre kolleger hos Google Research. Det ble bygget fra grunnen av for å være multimodalt, noe som betyr at det kan generalisere og sømløst forstå, operere på tvers av og kombinere ulike typer informasjon, inkludert tekst, kode, lyd, bilde og video.
Vi introduserer Gemini: vår største og mest kapable AI-modell
Gemini er også vår mest fleksible modell hittil – den kjører effektivt på alt fra datasentre til mobile enheter. Dens banebrytende funksjoner vil forbedre hvordan utviklere og bedriftskunder bygger og skalerer med AI betydelig.
Vi har optimalisert Gemini 1.0, vår første versjon, for tre forskjellige størrelser:
- Gemini Ultra – vår største og mest kapable modell for svært komplekse oppgaver.
- Gemini Pro – vår beste modell for skalering på tvers av et bredt spekter av oppgaver.
- Gemini Nano – vår mest effektive modell for oppgaver på enheten.
Toppmoderne ytelse
Vi har grundig testet Gemini-modellene våre og evaluert ytelsen deres på en rekke oppgaver. Fra naturlig bilde, lyd og videoforståelse til matematisk resonnering, overgår Gemini Ultras ytelse dagens toppmoderne resultater på 30 av de 32 mye brukte akademiske referansepunktene som brukes i forskning og utvikling av store språkmodeller (LLM-er).
Med en score på 90,0 % er Gemini Ultra den første modellen som utkonkurrerer menneskelige eksperter på MMLU (massiv multitasking språkforståelse), som bruker en kombinasjon av 57 fag som matematikk, fysikk, historie, jus, medisin og etikk for å teste både verdenskunnskap og problemløsningsevner.
Vår nye MMLU-referanseverdi lar Gemini bruke resonneringsevnen sin til å tenke nøyere før de svarer på vanskelige spørsmål, noe som fører til betydelige forbedringer i forhold til å bare bruke førsteinntrykket sitt.
Gemini overgår toppmoderne ytelse på en rekke testtester, inkludert tekst og koding.
Gemini Ultra oppnår også en toppmoderne vurdering på 59,4 % på den nye MMMU- referansepunktet, som består av multimodale oppgaver som spenner over ulike domener som krever bevisst resonnering.
I bildetestene vi testet, overgikk Gemini Ultra tidligere toppmoderne modeller, uten hjelp av optiske tegngjenkjenningssystemer (OCR) som trekker ut tekst fra bilder for videre behandling. Disse testtestene fremhever Geminis innebygde multimodalitet og indikerer tidlige tegn på Geminis mer komplekse resonneringsevner.
Se mer informasjon i vår teknisk rapport for Gemini .
Gemini overgår toppmoderne ytelse på en rekke multimodale standarder.
Neste generasjons funksjoner
Frem til nå har standardmetoden for å lage multimodale modeller involvert trening av separate komponenter for ulike modaliteter og deretter sy dem sammen for å grovt etterligne noe av denne funksjonaliteten. Disse modellene kan noen ganger være flinke til å utføre visse oppgaver, for eksempel å beskrive bilder, men sliter med mer konseptuell og kompleks resonnering.
Vi designet Gemini til å være multimodal, forhåndstrint fra starten av på ulike modaliteter. Deretter finjusterte vi den med ytterligere multimodale data for å forbedre effektiviteten ytterligere. Dette hjelper Gemini med å sømløst forstå og resonnere om enhver type input fra grunnen av, mye bedre enn eksisterende multimodale modeller – og funksjonene er toppmoderne på nesten alle domener.
Lær mer om Tvillingenes muligheter og se hvordan det fungerer .
Sofistikert resonnement
Gemini 1.0s sofistikerte multimodale resonneringsevner kan hjelpe deg med å forstå kompleks skriftlig og visuell informasjon, noe som gjør den unikt dyktig til å avdekke kunnskap som kan være vanskelig å skille mellom store mengder data.
Dens bemerkelsesverdige evne til å trekke ut innsikt fra hundretusenvis av dokumenter ved å lese, filtrere og forstå informasjon vil bidra til å levere nye gjennombrudd i digitale hastigheter på mange felt, fra vitenskap til finans.
Forstå tekst, bilder, lyd og mer
Gemini 1.0 ble trent til å gjenkjenne og forstå tekst, bilder, lyd og mer samtidig, slik at den bedre kan forstå nyansert informasjon og svare på spørsmål om komplekse emner. Dette gjør den spesielt god til å forklare resonnement i komplekse fag som matematikk og fysikk.
Avansert koding
Vår første versjon av Gemini kan forstå, forklare og generere kode av høy kvalitet i verdens mest populære programmeringsspråk, inkludert Python, Java, C++ og Go. Evnen til å fungere på tvers av språk og resonnere rundt kompleks informasjon gjør den til en av de ledende grunnleggende modellene for koding i verden.
Gemini Ultra utmerker seg i flere kodingsstandarder, inkludert MenneskeligEvaluering , en viktig bransjestandard for evaluering av ytelse på kodeoppgaver, og Natural2Code, vårt interne datasett, som bruker forfattergenererte kilder i stedet for nettbasert informasjon.
Gemini kan også brukes som en motor for mer avanserte kodesystemer. For to år siden introduserte vi Alfakode , det første AI-kodegenereringssystemet som nådde et konkurransedyktig ytelsesnivå i programmeringskonkurranser.
Ved å bruke en spesialisert versjon av Gemini, laget vi et mer avansert kodegenereringssystem, AlphaCode 2, som utmerker seg ved å løse konkurransedyktige programmeringsproblemer som går utover koding og involverer kompleks matematikk og teoretisk informatikk.
Når den evalueres på samme plattform som den originale AlphaCode, viser AlphaCode 2 massive forbedringer, og løser nesten dobbelt så mange problemer, og vi anslår at den overgår 85 % av konkurrentene – opp fra nesten 50 % for AlphaCode. Når programmerere samarbeider med AlphaCode 2 ved å definere bestemte egenskaper som kodeeksemplene skal følge, yter den enda bedre.
Vi er glade for at programmerere i økende grad bruker svært kapable AI-modeller som samarbeidsverktøy som kan hjelpe dem med å resonnere rundt problemer, foreslå kodedesign og bistå med implementering – slik at de kan lansere apper og designe bedre tjenester raskere.
Se mer informasjon i vår tekniske rapport om AlphaCode 2. .
Mer pålitelig, skalerbar og effektiv
Vi trente Gemini 1.0 i stor skala på vår AI-optimaliserte infrastruktur ved hjelp av Googles spesialdesignede Tensor-prosesseringsenheter (TPU) v4 og v5e. Og vi designet den til å være vår mest pålitelige og skalerbare modell å trene, og vår mest effektive å bruke.
På TPU-er kjører Gemini betydelig raskere enn før, mindre og mindre kapable modeller. Disse spesialdesignede AI-akseleratorene har vært kjernen i Googles AI-drevne produkter som betjener milliarder av brukere, som Søk, YouTube, Gmail, Google Maps, Google Play og Android. De har også gjort det mulig for selskaper over hele verden å trene storskala AI-modeller kostnadseffektivt.
I dag annonserer vi det kraftigste, mest effektive og skalerbare TPU-systemet hittil., Cloud TPU v5p , utviklet for å trene banebrytende AI-modeller. Denne neste generasjons TPU-en vil akselerere Gemini sin utvikling og hjelpe utviklere og bedriftskunder med å trene generative AI-modeller i stor skala raskere, slik at nye produkter og muligheter kan nå kunder raskere.
Bygget med ansvar og sikkerhet i sentrum
Hos Google er vi forpliktet til å utvikle dristig og ansvarlig kunstig intelligens i alt vi gjør. Vi bygger videre på Googles KI-prinsipper og robuste sikkerhetspolicyer i produktene våre, legger vi til nye beskyttelser for å ta hensyn til Gemini sine multimodale muligheter. I hvert utviklingstrinn vurderer vi potensielle risikoer og jobber med å teste og redusere dem.
Gemini har de mest omfattende sikkerhetsevalueringene av alle Google-kontoer AI-modeller til dags dato, inkludert for skjevhet og toksisitet. Vi har gjennomført ny forskning på potensielle risikoområder som nettkriminalitet, overtalelse og autonomi, og har brukt Google Researchs beste i sin klasse teknikker for kontradiktorisk testing for å bidra til å identifisere kritiske sikkerhetsproblemer før implementeringen av Gemini.
For å identifisere blinde flekker i vår interne evalueringsmetodikk, samarbeider vi med en mangfoldig gruppe eksterne eksperter og partnere for å stressteste modellene våre på tvers av en rekke problemstillinger.
For å diagnostisere problemer med innholdssikkerhet i løpet av Gemini sine opplæringsfaser og sikre at resultatene overholder våre retningslinjer, bruker vi referansepunkter som Virkelige toksisitetsspørsmål , et sett med 100 000 ledetekster med varierende grad av toksisitet hentet fra nettet, utviklet av eksperter ved Allen Institute for AI. Mer informasjon om dette arbeidet kommer snart.
For å begrense skade har vi utviklet dedikerte sikkerhetsklassifiseringsverktøy for å identifisere, merke og filtrere ut innhold som involverer vold eller negative stereotypier, for eksempel. Kombinert med robuste filtre er denne lagdelte tilnærmingen utformet for å gjøre Gemini tryggere og mer inkluderende for alle. I tillegg fortsetter vi å håndtere kjente utfordringer for modeller som fakta, forankring, attribusjon og bekreftelse.
Ansvar og sikkerhet vil alltid være sentralt i utviklingen og utrullingen av modellene våre. Dette er en langsiktig forpliktelse som krever samarbeid, så vi samarbeider med bransjen og det bredere økosystemet for å definere beste praksis og sette sikkerhetsstandarder gjennom organisasjoner som MLCommons , Grense Modellforum og dets AI-sikkerhetsfond , og vår Sikkert AI-rammeverk (SAIF), , som ble utviklet for å bidra til å redusere sikkerhetsrisikoer spesifikt for AI-systemer i offentlig og privat sektor. Vi vil fortsette å samarbeide med forskere, myndigheter og sivilsamfunnsgrupper over hele verden mens vi utvikler Gemini.
Gjør Gemini tilgjengelig for verden
Gemini 1.0 rulles nå ut på tvers av en rekke produkter og plattformer:
Gemini Pro i Google-produkter
Vi tilbyr Gemini til milliarder av mennesker gjennom Google-produkter.
Fra og med i dag Bard vil bruke en finjustert versjon av Gemini Pro for mer avansert resonnering, planlegging, forståelse og mer. Dette er den største oppgraderingen til Bard siden lanseringen. Den vil være tilgjengelig på engelsk i mer enn 170 land og territorier, og vi planlegger å utvide til forskjellige modaliteter og støtte nye språk og steder i nær fremtid.
Vi tar også Tvillingene til piksel . Pixel 8 Pro er den første smarttelefonen som er designet for å kjøre Gemini Nano, som driver nye funksjoner som Summarize i Opptaker-appen og ruller ut Smart Reply i Gboard, først med WhatsApp, Line og KakaoTalk. 1 – med flere meldingsapper som kommer neste år.
I løpet av de kommende månedene vil Gemini være tilgjengelig i flere av produktene og tjenestene våre, som Søk, Annonser, Chrome og Duet AI.
Vi har allerede begynt å eksperimentere med Gemini i Søk, der det gjør vår søkegenerative opplevelse (SGE) raskere for brukere, med en 40 % reduksjon i ventetid på amerikansk engelsk, sammen med forbedringer i kvalitet.
Bygger med tvillingene
Fra 13. desember kan utviklere og bedriftskunder få tilgang til Gemini Pro via Gemini API i Google AI Studio eller Google Cloud Vertex AI .
Google AI Studio er et gratis, nettbasert utviklerverktøy for rask prototyping og lansering av apper med en API-nøkkel. Når det er på tide med en fullstendig administrert AI-plattform, tillater Vertex AI tilpasning av Gemini med full datakontroll og utnytter ytterligere Google Cloud-funksjoner for bedriftssikkerhet, trygghet, personvern og datastyring og samsvar.
Android-utviklere vil også kunne bygge med Gemini Nano, vår mest effektive modell for oppgaver på enheten, via AICore, en ny systemfunksjon som er tilgjengelig i Android 14, og starter med Pixel 8 Pro-enheter. Registrer deg for en tidlig forhåndsvisning av AICore .
Gemini Ultra kommer snart
For Gemini Ultra gjennomfører vi for tiden omfattende tillits- og sikkerhetskontroller, inkludert å sette inn klarerte eksterne parter i red-team-modus, og videreutvikler modellen ved hjelp av finjustering og forsterkende læring fra menneskelig tilbakemelding (RLHF) før den gjøres allment tilgjengelig.
Som en del av denne prosessen vil vi gjøre Gemini Ultra tilgjengelig for utvalgte kunder, utviklere, partnere og sikkerhets- og ansvarlighetseksperter for tidlig eksperimentering og tilbakemeldinger før vi ruller det ut til utviklere og bedriftskunder tidlig neste år.
Tidlig neste år lanserer vi også Bard Avansert , en ny, banebrytende AI-opplevelse som gir deg tilgang til våre beste modeller og funksjoner, med start i Gemini Ultra.
Gemini-æraen: Muliggjør en fremtid preget av innovasjon
Dette er en viktig milepæl i utviklingen av AI og starten på en ny æra for oss i Google, ettersom vi fortsetter å innovere raskt og ansvarlig utvikle egenskapene til modellene våre.
Vi har gjort store fremskritt med Gemini så langt, og vi jobber hardt med å utvide mulighetene ytterligere for fremtidige utgivelser, inkludert fremskritt innen planlegging og minne, og økning av kontekstvinduet for å behandle enda mer informasjon for å gi bedre svar.
Vi er begeistret for de fantastiske mulighetene i en verden som er ansvarlig drevet av AI – en fremtid preget av innovasjon som vil øke kreativiteten, utvide kunnskapen, fremme vitenskapen og forandre hvordan milliarder av mennesker lever og arbeider rundt om i verden.








