Suuren kielimallin vetämän tekoälyn kehityksen ansiosta graafisen ikonografian tutkimus ja soveltaminen ovat tuoneet mukanaan uuden mahdollisuuden, joka edistää suuren kielimallin kehittymistä suureksi visiomalliksi." 30.12.2023 uudenvuodenaattona ja uudenvuodenpäivänä Wang Yaonan, Kiinan tekniikan akatemian akateemikko ja National Engineering Research Center for Robot Visual Perception and Control Technologyn johtaja, kertoi viimeisimmistä trendeistä konenäköälyn kehityksessä. Kiinan graafisen grafiikan seuran 19. nuorten tutkijoiden konferenssissa.
Nandu-toimittajan eksklusiivisessa haastattelussa Wang Yaonan sanoi, että tekoäly tekee konenäön älykkään ja korkeampi aritmeettinen teho voi tukea suurten visuaalisten mallien koulutusta. Älykkäät isot visiomallit tarvitsevat kuitenkin myös korkeampia aritmeettisia tasoja, parempia malliarkkitehtuuria ja tehokkaampia oppimisalgoritmeja.
Tämän konferenssin järjestävät Kiinan kuvagrafiikan yhdistys, Pazhou Lab, Etelä-Kiinan teknillinen yliopisto, Sun Yat-senin yliopisto ja Kiinan kuvagrafiikan seuran nuorisotyökomitea.
Puhutaan alan trendeistä
Visuaalisesta tietojenkäsittelystä visuaaliseen älykkyyteen
Yao-Nan Wang: Kiinan konenäkötutkimuksella on lähes 40 vuoden historia, alun perin anturitutkimuksesta, eli valoinformaation muuntamisesta kuvainformaatioksi. Seuraavaksi on tehtävä näön käsittely, mukaan lukien saadun kuvan parantaminen sen selkeyttämiseksi.
Kun kuva on selkeä, meidän on saatava kuvasta kohde, josta olemme kiinnostuneita. Esimerkiksi kuljettajattoman ajamisen alalla konenäön on tunnistettava kuvassa olevat kohteet vastatakseen kysymykseen, kumpi on henkilö ja kumpi auto.
Näitä me kutsumme kolmeksi konenäön pääalueeksi. Tiivistän sen: kuvantamiseen, käsittelyyn ja ymmärtämiseen.
Konenäkö on siirtynyt menneisyydestä visuaalisesta tietojenkäsittelystä visuaaliseen älykkyyteen nykyään. Visuaalinen laskenta yhdistettynä tekoälyyn on parantanut kognition tasoa ja lisännyt kykyä ymmärtää monimutkaisia ympäristöjä, ja koko visuaalisen älykkyyden toimiala on kehittynyt nopeasti viimeisen vuoden aikana.
Konenäköälyn kehittämisen suunta on toteuttaa monenlaisia sovelluksia, joita sovelletaan teolliseen tarkastukseen, älykkääseen valmistukseen ja satelliittikaukokartoitukseen sekä muilla aloilla.
Konenäöstä puhuttaessa meidän on puhuttava sen sovelluksesta, sovellusvetoisesta teknologian kehittämisestä. Kiinan kuvagrafiikkayhdistyksellä on 30 erityiskomiteaa, jotka keskittyvät pääasiassa graafisiin kuviin tutkimuksen suorittamiseksi, palvelemaan kansantaloutta. Näillä teknologioilla on laaja valikoima sovellusskenaarioita, mukaan lukien teollisuus, maatalous, maantieteelliset tietojärjestelmät, kaukokartoitus, maavarat ja niin edelleen.
Ihminen voi nähdä maailman syntyessään ja ymmärtää maailmaa sen jälkeen, ja 80 % tiedosta hankitaan näön kautta. Konenäkö on simuloida ihmissilmää, ja lopulta saavuttaa ihmissilmän tason, ja joissain asioissa ylittää ihmissilmän, nähdä kauemmas, nähdä selvemmin.
Puhu suuresta visiomallista
Iso visuaalinen malli tulee yhä älykkäämmäksi
Yao-Nan Wang: Big Language Model on dataohjattu tekoäly, joka käyttää kirjoista, kielestä ja tekstistä saatua tietoa datana kouluttaakseen hermoverkkomallin, joka osaa perustella ja vastata oppimaansa perusteella.
Suuren visuaalisen mallin data puolestaan tulee pääasiassa erilaisista kuvista, mukaan lukien ihmisen ja luonnon tuottamasta visuaalisesta datasta. Esimerkiksi lääketieteellinen iso visuaalinen malli on syöttää kuvat ihmiselimistä ja vaurioista visuaalisena datana suureen malliin ja sitten harjoitella saamaan se, jotta se voi lukea CT-kuvia kuin lääkäri ja saavuttaa potilaan tilan perusteleminen valokuvien ottamisen jälkeen, kun potilas tulee lääkäriin.
Nykyinen visuaalinen malli ei ole sama kuin ihmisen aivot, kuten kuvittelemme, ero on edelleen erittäin suuri. Oppimisdatan lisääntymisen ja malliparametrien säätämisen myötä mallista tulee koko ajan isompi ja enemmän tietoa ja sen älykkyystaso nousee yhä korkeammalle ja älykkäämmälle.
Meidän on nostettava aritmeettisen tehon tasoa ja kiihdytettävä laskentanopeutta, jotta voimme rakentaa malleja nopeammin; suunnitella parempia malliarkkitehtuureja, mukaan lukien enemmän tulkittavuutta ja turvallisempaa ja hallittavampaa; ja tutkia tehokkaampia oppimisalgoritmeja.
Itse asiassa visuaalinen makromallinnus ei ole viime vuosina uutta, vaan sitä on kehitetty askel askeleelta. 1980-luvulla tekoälyn kehittyessä ihmiset alkoivat tutkia hermoverkkoja. Se on vain, että viime vuosina aritmeettiset ja algoritmiset kyvyt ovat lisääntyneet, jotta ihmiset voivat yrittää rakentaa suuria malleja, mikä synnyttää suuria kielimalleja ja suuria visuaalisia malleja. Aikaisemmin, kun aritmeettista voimaa ei ollut tarpeeksi, ihmiset eivät tehneet niin suuria malleja.
Puhutaan vuoden 2024 näkymistä
Toivomme liiketoiminnan kasvavan Guangzhousta koko maahan ja maailmaan.
Yaonan Wang: Hunanin yliopiston robottien visuaalisen havainnoinnin ja ohjausteknologian kansallinen tekniikan tutkimuskeskus on muuttanut Guangzhou Zengchengiin, joka sijaitsee Guangdongin-Hongkongin ja Macaon Suurlahden alueella, vuonna 2022 ja perusti HU Guangdong-Hong Kong-Macao Greater Bayn. Area Innovation Research Institute (Guangzhou Zengcheng).
Instituutti keskittyy älykkään näön tutkimukseen ja soveltamiseen koneiden, mukaan lukien erikoiskäyttörobotit älykkään valmistuksen, lääketieteen ja lääketeollisuuden aloilla sekä yleistettyihin suuriin näkömalleihin. Näitä tutkimuksia sovelletaan esimerkiksi valmistavaan teollisuuteen, joka voi korvata suuren joukon työntekijöitä ja suorittaa tuotteiden laadun tarkastuksen, erityisesti 3C- ja huippuluokan osateollisuudessa. Tällä hetkellä instituutissa on kehitetty ohjelmisto- ja laitteistojärjestelmiä, joiden päätehtävänä on vahvistaa Guangdongin yritysten digitaalista ja älykästä muutosta ja edistää valmistavan teollisuuden kehitystä.
Lisäksi instituutissa on myös älykkäitä konenäkö- ja ohjausjärjestelmiä, joita käytetään pääasiassa huippuluokan älylaitteiden, kuten teollisten Internet-ohjelmistojen valmistuksessa, joissa on erittäin paljon algoritmeja.
Guangdong on uudistuksen ja avautumisen eturintamassa ja tärkein taloudellinen taistelukenttä, jossa on täydellinen teollinen ketju ja toimitusketju, ja monet tuotantoyritykset, tulimme Guangdongin ulkoasuun ensinnäkin markkinoiden kysynnän vuoksi. Lisäksi meidän tutkimuskeskus on useita T & K-tiimi Guangdong on laskeutunut paljon hankkeita, muutos tieteellisten ja teknologisten saavutusten.
Vuoden 2023 ensimmäisellä puoliskolla kohtasimme haasteita, lähinnä osien ja komponenttien toimituksissa. Vuonna 2024 uskon, että nämä ongelmat ratkaistaan ja Guangdongin tekoälyteollisuuden teollisuusketjua, toimitusketjua ja T & K-valmiuksia parannetaan. Isoilla kotimarkkinoilla avataan uusia raitoja. Elinvoimaisessa ilmapiirissä, jossa kaikki tekevät aloitteen, toimivat ja innovoivat, haasteet voidaan ratkaista.
Olen luottavainen tekoälyteollisuuden kehitykseen Guangdongissa. Viimeisten 30 vuoden aikana olemme tehneet paljon työtä ollaksemme omavaraisia tieteessä ja tekniikassa ja keränneet paljon tieteellisiä tutkimustuloksia. Guangdong on Kiinan suurin talousalue.
Harrastamamme tekoälyn ja robotiikan ala on saavuttanut hyvän mahdollisuuden, joka on kasvanut räjähdysmäisesti viimeisen kahden vuoden aikana tuoden mukanaan monia uusia markkinoita ja vetämällä uusia teollisia polkuja. Tulevaisuudessa älykkäitä päätteitä tulee yhä enemmän, mikä johtaa myös tuotantolaitosten ja laiteteollisuuden kehitykseen. Vuonna 2024 toivon, että tutkimuslaitoksemme Zengchengissä, Guangzhoussa voi viedä liiketoimintamme koko maahan ja maailmaan.
