Jokainen teknologinen muutos on mahdollisuus edistää tieteellisiä löytöjä, nopeuttaa ihmiskunnan kehitystä ja parantaa ihmisten elämää. Uskon, että tekoälyn myötä juuri nyt näkemämme muutos on elämämme merkittävin, paljon suurempi kuin aiempi siirtyminen mobiiliin tai verkkoon. Tekoälyllä on potentiaalia luoda mahdollisuuksia – arkipäiväisistä poikkeuksellisiin – ihmisille kaikkialla. Se tuo mukanaan uusia innovaatio- ja talouskehitysaaltoja, jotka edistävät tietoa, oppimista, luovuutta ja tuottavuutta ennennäkemättömässä mittakaavassa.
Se minua innostaa: mahdollisuus tehdä tekoälystä hyödyllistä kaikille, kaikkialla maailmassa.
Lähes kahdeksan vuotta tekoälyyn keskittyvänä yrityksenä, vain kiihdyttää vauhtiaMiljoonat ihmiset käyttävät nyt generatiivista tekoälyä tuotteissamme tehdäkseen asioita, joita he eivät pystyneet tekemään vielä vuosi sitten, monimutkaisempien kysymysten vastausten löytämisestä uusien työkalujen käyttöön yhteistyöhön ja luomiseen. Samaan aikaan kehittäjät käyttävät mallejamme ja infrastruktuuriamme uusien generatiivisten tekoälysovellusten rakentamiseen, ja startupit ja muut yritykset ympäri maailmaa kasvavat tekoälytyökalujemme avulla.
Tämä on uskomatonta nopeutta, ja silti vasta raapaisemme pintaa siitä, mikä on mahdollista.
Lähestymme tätä työtä rohkeasti ja vastuullisesti. Tämä tarkoittaa kunnianhimoista tutkimustyötä ja sellaisten kykyjen hyödyntämistä, jotka tuovat valtavia hyötyjä ihmisille ja yhteiskunnalle, samalla kun rakennamme suojatoimia ja teemme yhteistyötä hallitusten ja asiantuntijoiden kanssa riskien hallitsemiseksi tekoälyn kehittyessä kyvykkäämmäksi. Jatkamme investoimista parhaisiin työkaluihin, perustavanlaatuisiin malleihin ja infrastruktuuriin ja tuomme ne tuotteisiimme ja muihin käytäntöjemme ohjaamina. Tekoälyn periaatteet .
Nyt otamme seuraavan askeleen matkallamme Geminin kanssa, joka on tähän mennessä tehokkain ja monipuolisin mallimme, ja jonka huippuluokan suorituskyky on monissa johtavissa vertailuarvoissa. Ensimmäinen julkaisumme, Gemini 1.0, on optimoitu eri kokoluokille: Ultra, Pro ja Nano. Nämä ovat Gemini-aikakauden ensimmäiset mallit ja ensimmäinen toteutus visiostamme, joka meillä oli, kun perustimme Google DeepMindin aiemmin tänä vuonna. Tämä uusi mallien aikakausi edustaa yhtä suurimmista tieteellisistä ja teknisistä ponnisteluista, joita olemme yrityksenä koskaan tehneet. Olen todella innoissani siitä, mitä on edessä, ja mahdollisuuksista, joita Gemini avaa ihmisille kaikkialla.
Esittelyssä Kaksoset
Demis Hassabis, toimitusjohtaja ja yksi perustajista Google DeepMind, Gemini-tiimin puolesta
Tekoäly on ollut elämäntyöni keskipiste, kuten se on ollut monille tutkimuskollegoilleni. Siitä lähtien, kun ohjelmoin tekoälyä tietokonepeleihin teini-ikäisenä ja neurotieteilijänä yrittäessäni ymmärtää aivojen toimintaa, olen aina uskonut, että jos pystyisimme rakentamaan älykkäämpiä koneita, voisimme valjastaa ne hyödyttämään ihmiskuntaa uskomattomilla tavoilla.
Tämä lupaus tekoälyn vastuullisesti voimaannuttamasta maailmasta ohjaa edelleen työtämme Google DeepMindillä. Olemme jo pitkään halunneet rakentaa uuden sukupolven tekoälymalleja, jotka saavat inspiraationsa siitä, miten ihmiset ymmärtävät maailmaa ja ovat vuorovaikutuksessa sen kanssa. Tekoälyä, joka tuntuu vähemmän älykkäältä ohjelmistolta ja enemmän joltain hyödylliseltä ja intuitiiviselta – asiantuntevalta auttajalta tai avustajalta.
Tänään olemme askeleen lähempänä tätä visiota, kun esittelemme Geminit , kyvykkäin ja yleisin malli, jonka olemme koskaan rakentaneet.
Gemini on Googlen tiimien, mukaan lukien Google Researchin kollegojemme, laajamittaisen yhteistyön tulos. Se rakennettiin alusta alkaen multimodaaliseksi, mikä tarkoittaa, että se voi yleistää ja ymmärtää saumattomasti, toimia erityyppisten tietojen, kuten tekstin, koodin, äänen, välillä ja yhdistää niitä., kuva ja video.
Esittelyssä Gemini: suurin ja tehokkain tekoälymallimme
Gemini on myös tähän mennessä joustavin mallimme – se toimii tehokkaasti kaikessa datakeskuksista mobiililaitteisiin. Sen huippuluokan ominaisuudet parantavat merkittävästi sitä, miten kehittäjät ja yritysasiakkaat rakentavat ja skaalaavat tekoälyn avulla.
Olemme optimoineet Gemini 1.0:n, ensimmäisen versiomme, kolmelle eri koolle:
- Gemini Ultra — suurin ja tehokkain mallimme erittäin monimutkaisiin tehtäviin.
- Gemini Pro — paras mallimme skaalautumiseen monenlaisiin tehtäviin.
- Gemini Nano — tehokkain mallimme laitteella suoritettaviin tehtäviin.
Huippuluokan suorituskyky
Olemme testanneet Gemini-mallejamme perusteellisesti ja arvioineet niiden suorituskykyä useissa eri tehtävissä. Luonnollisen kuvan, äänen ja videon ymmärtämisestä matemaattiseen päättelyyn Gemini Ultran suorituskyky ylittää nykyiset huipputulokset 30:ssä 32:sta laajalti käytetystä akateemisesta vertailuarvosta, joita käytetään suurten kielimallien (LLM) tutkimuksessa ja kehityksessä.
90,0 pisteen %-tuloksella Gemini Ultra on ensimmäinen malli, joka on päihittänyt ihmisasiantuntijat... MMLU (massiivinen moniajoa hyödyntävä kielen ymmärtäminen), jossa käytetään 57 oppiaineen, kuten matematiikan, fysiikan, historian, oikeustieteen, lääketieteen ja etiikan, yhdistelmää sekä maailmantuntemuksen että ongelmanratkaisutaitojen testaamiseen.
Uusi MMLU-vertailuarvomme antaa Gemini-kokeille mahdollisuuden käyttää päättelykykyjään ajatellakseen tarkemmin ennen vaikeisiin kysymyksiin vastaamista, mikä johtaa merkittäviin parannuksiin verrattuna pelkän ensivaikutelman käyttämiseen.
Gemini ylittää huippuluokan suorituskyvyn useilla vertailuarvoilla, mukaan lukien tekstin ja koodauksen.
Gemini Ultra saavuttaa myös huippuluokan 59,4 % -luokituksen uudella MMMU- vertailuarvo, joka koostuu eri osa-alueita kattavista multimodaalisista tehtävistä, jotka vaativat tietoista päättelyä.
Testaamissamme kuvantamisvertailuissa Gemini Ultra suoriutui aiempia huippumalleja paremmin ilman optisia tekstintunnistusjärjestelmiä (OCR), jotka poimivat kuvista tekstiä jatkokäsittelyä varten. Nämä vertailut korostavat Geminin luontaista multimodaalisuutta ja osoittavat varhaisia merkkejä Geminin monimutkaisemmista päättelykyvyistä.
Katso lisätietoja osiostamme tekninen raportti Geminille .
Gemini ylittää huippuluokan suorituskyvyn useissa multimodaalisissa vertailuarvoissa.
Seuraavan sukupolven ominaisuudet
Tähän asti multimodaalisten mallien luomisen vakiomenetelmänä on ollut erillisten komponenttien kouluttaminen eri modaliteeteille ja niiden yhdistäminen yhteen jäljittelemään karkeasti joitakin näistä toiminnoista. Nämä mallit voivat joskus olla hyviä tiettyjen tehtävien suorittamisessa, kuten kuvien kuvaamisessa, mutta niillä on vaikeuksia käsitteellisemmän ja monimutkaisemman päättelyn kanssa.
Suunnittelimme Geminin natiivisti multimodaaliseksi, alusta alkaen esikoulutetuksi eri modaliteeteille. Sitten hienosääsimme sitä lisäämällä multimodaalista dataa tehokkuuden parantamiseksi entisestään. Tämä auttaa Geminiä saumattomasti ymmärtämään ja perustelemaan kaikenlaista syötettä alusta alkaen paljon paremmin kuin nykyiset multimodaaliset mallit – ja sen ominaisuudet ovat huippuluokkaa lähes kaikilla osa-alueilla.
Lue lisää aiheesta Kaksosten mahdollisuudet ja katso, miten ne toimivat .
Hienostunut päättely
Gemini 1.0:n kehittyneet multimodaaliset päättelyominaisuudet voivat auttaa sinua ymmärtämään monimutkaista kirjallista ja visuaalista tietoa, mikä tekee siitä ainutlaatuisen taitavan paljastamaan tietoa, jota voi olla vaikea erottaa suurista tietomääristä.
Sen huomattava kyky poimia oivalluksia sadoista tuhansista dokumenteista lukemalla, suodattamalla ja ymmärtämällä tietoa auttaa saavuttamaan uusia läpimurtoja digitaalisella nopeudella monilla aloilla tieteestä rahoitukseen.
Ymmärrä tekstiä, kuvia, ääntä ja muuta
Gemini 1.0 on opetettu tunnistamaan ja ymmärtämään tekstiä, kuvia, ääntä ja paljon muuta samanaikaisesti, joten se pystyy paremmin ymmärtämään vivahteikasta tietoa ja vastaamaan kysymyksiin monimutkaisista aiheista. Tämä tekee siitä erityisen hyvän selittämään päättelyä monimutkaisissa aineissa, kuten matematiikassa ja fysiikassa.
Edistynyt koodaus
Ensimmäinen Gemini-versiomme pystyy ymmärtämään, selittämään ja luomaan korkealaatuista koodia maailman suosituimmilla ohjelmointikielillä, kuten Pythonilla, Javalla, C++:lla ja Go:lla. Sen kyky toimia eri kielillä ja analysoida monimutkaista tietoa tekee siitä yhden maailman johtavista koodauksen perusmalleista.
Gemini Ultra loistaa useissa koodausvertailuissa, mukaan lukien HumanEval , joka on merkittävä alan standardi koodaustehtävien suorituskyvyn arvioimiseen, ja Natural2Code, sisäinen tietojoukkomme, joka käyttää kirjoittajien luomia lähteitä verkkopohjaisten tietojen sijaan.
Geminiä voidaan käyttää myös moottorina edistyneemmille koodausjärjestelmille. Kaksi vuotta sitten esittelimme Aakkoskoodi , ensimmäinen tekoälypohjainen koodinluontijärjestelmä, joka on saavuttanut kilpailukykyisen suorituskykytason ohjelmointikilpailuissa.
Käyttämällä Geminin erikoisversiota loimme edistyneemmän koodinluontijärjestelmän, AlphaCode 2:n, joka loistaa ratkaisemaan kilpailukykyisiä ohjelmointiongelmia, jotka ylittävät koodauksen rajat ja sisältävät monimutkaista matematiikkaa ja teoreettista tietojenkäsittelytiedettä.
Kun AlphaCodea arvioitiin samalla alustalla kuin alkuperäistä AlphaCodea, AlphaCode 2:ssa on havaittu merkittäviä parannuksia, sillä se ratkaisee lähes kaksi kertaa enemmän ongelmia. Arvioimme sen suoriutuvan kilpailijoista 85 kertaa %:tä paremmin – kun AlphaCode suoriutui lähes 50 kertaa paremmin. Kun ohjelmoijat tekevät yhteistyötä AlphaCode 2:n kanssa määrittelemällä tiettyjä ominaisuuksia koodiesimerkeille, se toimii vielä paremmin.
Olemme innoissamme siitä, että ohjelmoijat käyttävät yhä enemmän erittäin tehokkaita tekoälymalleja yhteistyötyökaluina, jotka voivat auttaa heitä pohtimaan ongelmia, ehdottamaan koodisuunnitelmia ja avustamaan toteutuksessa – jotta he voivat julkaista sovelluksia ja suunnitella parempia palveluita nopeammin.
Lisätietoja on AlphaCode 2:n teknisessä raportissamme. .
Luotettavampi, skaalautuvampi ja tehokkaampi
Koulutimme Gemini 1.0:n skaalautuvasti tekoälyoptimoidulla infrastruktuurillamme käyttäen Googlen räätälöityä Tensor-prosessointiyksiköt (TPU) v4 ja v5e. Ja suunnittelimme sen luotettavimmaksi ja skaalautuvimmaksi malliksi kouluttaa ja tehokkaimmaksi käyttää.
TPU-näytöillä Gemini toimii huomattavasti nopeammin kuin ennen, pienempiä ja vähemmän suorituskykyisiä malleja. Nämä erityisesti suunnitellut tekoälykiihdyttimet ovat olleet Googlen tekoälypohjaisten tuotteiden ytimessä, jotka palvelevat miljardeja käyttäjiä, kuten Haku, YouTube, Gmail, Google Maps, Google Play ja Android. Ne ovat myös mahdollistaneet yrityksille ympäri maailmaa laaja-alaisten tekoälymallien kouluttamisen kustannustehokkaasti.
Tänään julkistamme tähän mennessä tehokkaimman, tehokkaimman ja skaalautuvan TPU-järjestelmän., Pilvipohjainen TPU v5p , joka on suunniteltu kouluttamaan huippuluokan tekoälymalleja. Tämä seuraavan sukupolven TPU nopeuttaa Geminin kehitystä ja auttaa kehittäjiä ja yritysasiakkaita kouluttamaan laaja-alaisia generatiivisia tekoälymalleja nopeammin, mikä mahdollistaa uusien tuotteiden ja mahdollisuuksien nopeamman saavuttamisen asiakkaisiin.
Rakennettu vastuullisesti ja turvallisesti
Googlella olemme sitoutuneet kehittämään rohkeaa ja vastuullista tekoälyä kaikessa toiminnassamme. Googlen pohjalta Tekoälyn periaatteet Ja tuotteidemme vankkojen tietoturvakäytäntöjen ansiosta lisäämme uusia suojausmenetelmiä Geminin multimodaalisten ominaisuuksien huomioon ottamiseksi. Jokaisessa kehitysvaiheessa otamme huomioon mahdolliset riskit ja pyrimme testaamaan ja lieventämään niitä.
Geminillä on kattavimmat turvallisuusarvioinnit kaikki Google Tähänastiset tekoälymallit, mukaan lukien harhan ja myrkyllisyyden osalta. Olemme tehneet uutta tutkimusta mahdollisista riskialueista kuten kyberrikollisuus, suostuttelu ja autonomia, ja on soveltanut Google Researchin luokkansa parhaita kilpailevat testaustekniikat auttaakseen tunnistamaan kriittiset tietoturvaongelmat ennen Geminin käyttöönottoa.
Sisäisen arviointimenetelmämme sokeiden pisteiden tunnistamiseksi työskentelemme monipuolisen ulkopuolisten asiantuntijoiden ja kumppaneiden ryhmän kanssa testataksemme mallejamme useilla eri osa-alueilla.
Sisällön tietoturvaongelmien diagnosoimiseksi Geminin koulutusvaiheiden aikana ja sen tulosten käytäntöjemme mukaisuuden varmistamiseksi käytämme vertailuarvoja, kuten Todelliset myrkyllisyyskehotteet , Allenin tekoälyinstituutin asiantuntijoiden kehittämä 100 000 eriasteisen myrkyllisyysasteen verkosta poimitun tehtävän sarja. Lisätietoja tästä työstä on tulossa pian.
Vahinkojen rajoittamiseksi olemme rakentaneet erityisiä turvallisuusluokittelijoita esimerkiksi väkivaltaa tai negatiivisia stereotypioita sisältävän sisällön tunnistamiseksi, merkitsemiseksi ja suodattamiseksi. Yhdessä vankkojen suodattimien kanssa tämä monikerroksinen lähestymistapa on suunniteltu tekemään Gemini-mallista turvallisemman ja osallistavamman kaikille. Lisäksi jatkamme tunnettujen mallien, kuten faktojen, perustelujen, attribuutioiden ja vahvistusten, haasteiden ratkaisemista.
Vastuullisuus ja turvallisuus ovat aina keskeisiä malliemme kehittämisessä ja käyttöönotossa. Tämä on pitkän aikavälin sitoumus, joka vaatii yhteistyötä, joten työskentelemme alan ja laajemman ekosysteemin kanssa määritelläksemme parhaat käytännöt ja asettaaksemme turvallisuus- ja suojaustavoitteita organisaatioiden, kuten MLCommons , Raja Mallifoorumi ja sen Tekoälyn turvallisuusrahasto , ja meidän Turvallinen tekoälykehys (SAIF), , joka on suunniteltu auttamaan tekoälyjärjestelmiin liittyvien tietoturvariskien lieventämisessä julkisella ja yksityisellä sektorilla. Jatkamme yhteistyötä tutkijoiden, hallitusten ja kansalaisyhteiskunnan ryhmien kanssa ympäri maailmaa Gemini-järjestelmän kehittämisen yhteydessä.
Geminien saataville asettaminen maailmalle
Gemini 1.0 on nyt saatavilla useille tuotteille ja alustoille:
Gemini Pro Googlen tuotteissa
Tuomme Gemini-palvelun miljardien ihmisten ulottuville Googlen tuotteiden kautta.
Alkaen tänään Bard käyttää hienosäädettyä versiota Gemini Prosta edistyneempään päättelyyn, suunnitteluun, ymmärtämiseen ja muuhun. Tämä on Bardin suurin päivitys sen julkaisun jälkeen. Se on saatavilla englanniksi yli 170 maassa ja alueella, ja aiomme laajentaa sitä eri modaliteettiin ja tukea uusia kieliä ja sijainteja lähitulevaisuudessa.
Otamme myös Gemini Pixeliksi . Pixel 8 Pro on ensimmäinen Gemini Nanolla varustettu älypuhelin, joka tukee uusia ominaisuuksia, kuten Yhteenveto-ominaisuutta Tallentaja-sovelluksessa ja Smart Reply -ominaisuutta Gboardissa, alkaen WhatsAppista, Linesta ja KakaoTalkista. 1 – ja ensi vuonna on tulossa lisää viestisovelluksia.
Tulevina kuukausina Gemini tulee saataville useammissa tuotteissamme ja palveluissamme, kuten Haussa, Mainoksissa, Chromessa ja Duet AI:ssa.
Olemme jo aloittaneet Gemini-hakukokeilun, jossa se nopeuttaa hakugeneratiivista kokemustamme (SGE) käyttäjille, lyhentää viivettä 40 %:lla yhdysvaltain englannin kielellä ja parantaa laatua.
Rakentaminen kaksosten kanssa
13. joulukuuta alkaen kehittäjät ja yritysasiakkaat voivat käyttää Gemini Prota Gemini-rajapinnan kautta Google AI Studiossa tai Google Cloud Vertex -tekoäly .
Google AI Studio on ilmainen, verkkopohjainen kehitystyökalu sovellusten nopeaan prototyyppien luomiseen ja käynnistämiseen API-avaimella. Kun on aika täysin hallitulle tekoälyalustalle, Vertex AI mahdollistaa Geminin räätälöinnin täydellä datan hallinnalla ja hyödyntää Google Cloudin lisäominaisuuksia yrityksen tietoturvan, suojauksen, yksityisyyden sekä datan hallinnan ja vaatimustenmukaisuuden parantamiseksi.
Android-kehittäjät voivat myös rakentaa Gemini Nanolla, tehokkaimmalla laitekohtaisiin tehtäviin tarkoitetulla mallillamme, AICoren kautta. AICore on uusi Android 14:ssä saatavilla oleva järjestelmäominaisuus Pixel 8 Pro -laitteista alkaen. Rekisteröidy AICoren varhainen esikatselu .
Gemini Ultra tulossa pian
Gemini Ultran osalta teemme parhaillaan laajoja luotettavuus- ja tietoturvatarkistuksia, mukaan lukien luotettavien ulkoisten osapuolten yhdistäminen punaiseen tiimiin, ja mallin jatkojalostusta hienosäädön ja ihmispalautteesta (RLHF) tapahtuvan vahvistusoppimisen avulla ennen kuin se on yleisesti saatavilla.
Osana tätä prosessia tarjoamme Gemini Ultran valikoiduille asiakkaille, kehittäjille, kumppaneille sekä tietoturva- ja vastuullisuusasiantuntijoille varhaista kokeilua ja palautetta varten ennen kuin se julkaistaan kehittäjille ja yritysasiakkaille ensi vuoden alussa.
Ensi vuoden alussa käynnistämme myös Bard Advanced , uusi, uraauurtava tekoälykokemus, joka antaa sinulle käyttöösi parhaat mallimme ja ominaisuuksimme, alkaen Gemini Ultrasta.
Kaksosten aikakausi: innovaatioiden tulevaisuuden mahdollistaminen
Tämä on merkittävä virstanpylväs tekoälyn kehityksessä ja uuden aikakauden alku meille Googlella, kun jatkamme nopeaa innovointia ja malliemme ominaisuuksien vastuullista kehittämistä.
Olemme edistyneet Geminin kanssa tähän mennessä hyvin, ja työskentelemme ahkerasti laajentaaksemme sen ominaisuuksia tulevia julkaisuja varten, mukaan lukien suunnittelun ja muistin parannukset sekä konteksti-ikkunan kasvattaminen, jotta voimme käsitellä entistä enemmän tietoa parempien vastausten tarjoamiseksi.
Olemme innoissamme tekoälyn vastuullisesti voimaannuttaman maailman tarjoamista upeista mahdollisuuksista – innovaatioiden tulevaisuudesta, joka lisää luovuutta, laajentaa tietoa, edistää tiedettä ja mullistaa miljardien ihmisten elämän ja työnteon ympäri maailmaa.








