Photo by <a href="https://unsplash.com/@frostroomhead?utm_source=WP+Agent&utm_medium=referral">Rodion Kutsaiev</a> on <a href="https://unsplash.com/?utm_source=WP+Agent&utm_medium=referral">Unsplash</a>
„Google“ išleido lengvą DI modelį telefonams – tekstą, vaizdus, garsą ir vaizdo įrašus apdoroja lokaliai
„Google DeepMind“ pristatė „EmbeddingGemma 2“ – kompaktišką atviro svorio dirbtinio intelekto modelį, sukurtą veikti tiesiai telefone, nešiojamajame kompiuteryje ar kitame galiniame įrenginyje. Modelis vienoje erdvėje gali susieti tekstą, programinį kodą, vaizdus, garsą ir vaizdo įrašus.
Visa „EmbeddingGemma 2“ versija turi 740 mln. parametrų, tačiau architektūra modulinė: jei reikia tik teksto, galima naudoti mažesnę dalį. „Google“ nurodo, kad kvantuota teksto versija „Pixel 11 Pro“ telefone gali veikti naudodama apie 191 MB aktyviosios RAM, o pilna multimodalinė versija – apie 567 MB.
Modelis paskelbtas su komerciškai leidžiančia „Apache 2.0“ licencija. Technines detales „Google“ pateikia oficialiame pristatyme.
Ką toks modelis gali daryti telefone
„EmbeddingGemma 2“ nėra pokalbių robotas kaip „Gemini“ ar „ChatGPT“. Jo užduotis – skirtingą informaciją paversti skaitinėmis reprezentacijomis, vadinamomis embeddingais, kad sistema galėtų suprasti semantinį panašumą.
Praktiškai tai leidžia, pavyzdžiui, parašyti „rask vaizdo įrašą, kuriame šuo bėga per sniegą“ ir ieškoti ne pagal failo pavadinimą, o pagal patį turinį. Taip pat galima balsu apibūdinti norimą vaizdo įrašo momentą, ieškoti panašios nuotraukos arba indeksuoti dokumentus bei kodą.
Svarbiausia, kad visa tai gali vykti lokaliai. Failų nereikia siųsti į debesį vien tam, kad būtų sukurtas paieškos indeksas. Tai sumažina delsą, gali veikti be interneto ir suteikia daugiau privatumo.
TechNaujienos.lt jau rašė apie naujausius „Google“ DI modelius. „EmbeddingGemma 2“ yra visai kitos klasės produktas: ne milžiniškas debesijos modelis, o specializuotas variklis, kurį kūrėjai gali įdėti tiesiai į programėlę.
Kodėl vietinis DI tampa vis svarbesnis
Dideli modeliai paprastai veikia duomenų centruose, nes jiems reikia daug atminties ir skaičiavimo galios. Tačiau ne kiekvienai užduočiai reikia šimtų milijardų parametrų. Paieškai, klasifikavimui ar duomenų suradimui mažesnis specializuotas modelis gali būti greitesnis ir pigesnis.
„Google“ teigia, kad „EmbeddingGemma 2“ palaiko iki 8 000 žetonų kontekstą ir gali vienu metu apdoroti įvairių formatų duomenis. Modelis taip pat sukurtas taip, kad jo sugeneruojamus vektorius būtų galima sutrumpinti, sumažinant vietinės duomenų bazės dydį.
Tai svarbu mobilioms programėlėms: kūrėjai gali kurti išmanesnę nuotraukų, garso, dokumentų ar vaizdo įrašų paiešką nesiųsdami viso vartotojo turinio į serverį.
Ilgainiui tokie modeliai gali tapti nematoma telefono dalimi. Vartotojas nebūtinai žinos, kad naudojamas „EmbeddingGemma“, tačiau jo galerija, dokumentų paieška ar asmeninis DI asistentas galės daug geriau suprasti vietinius failus – ir tai atlikti pačiame įrenginyje.
Kaip vertinate šį straipsnį?
Prenumeruokite mūsų „YouTube“ kanalą ir mėgaukitės įdomiais vaizdo reportažais apie mokslą ir technologijas.
Trumpai, aiškiai ir be triukšmo – gaukite svarbiausias technologijų ir mokslo naujienas pirmieji.
DIENOS SKAITOMIAUSI
Ukraina smogė Rusijai į skaudžiausią vietą – skelbia paralyžiavusi daugiau nei pusę naftos perdirbimo pajėgumų
2Maskva skelbia apie 650 dronų bangą – liepsnojo vienas svarbiausių regiono degalų mazgų
3DI elektros apetitas tampa milžiniškas – „Google“ ruošia daugiau nei 1 mlrd. dolerių branduolinės energijos sandorį
4„Incognito“ režimas nepadaro jūsų nematomais – štai kas vis tiek gali matyti, kur naršote
5SBU dronai už 500 km smogė Rusijos aerodromui – skelbia sunaikinę Su-35 ir Su-34
NAUJAUSI
Taip pat skaitykite
Atrinkome panašius straipsnius, kurie gali jums patikti.