For noen dager siden annonserte Google-utviklere i et blogginnlegg at de har bestemt seg for å bruke Lyra til åpen kildekode. Lyra bruker maskinlæring for å muliggjøre taleanrop av høy kvalitet i situasjoner med lav båndbredde.
Dette er til fordel for og lar andre utviklere forbedre kommunikasjonsapplikasjonene sine og utvikle Lyra i nye retninger.
En stift av medieapplikasjoner i flere tiår, kodeker har gjort det mulig for båndbreddeintensive applikasjoner å overføre data effektivt.
Som sådan presenterer utviklingen av kodeker, for både video og lyd, en kontinuerlig utfordring : å gi stadig økende kvalitet, bruke mindre data og minimere latens for sanntidskommunikasjon.
Selv om video kan se ut til å forbruke mye mer båndbredde enn lyd, kan moderne videokodeker oppnå lavere bithastigheter enn noen av høykvalitets talekodeker som brukes i dag.
Kombinasjonen av tale- og videokodeker med lav bithastighet kan gi en videosamtaleopplevelse av høy kvalitet, selv på nettverk med lav båndbredde. Historisk sett har imidlertid stemmesignalet blitt mindre forståelig og mer robotisk jo lavere bithastigheten til en lydkodek er.
Selv om noen mennesker har tilgang til et jevnt bredbåndsnett av høy kvalitet, er ikke dette nivået av tilkobling universelt, og selv folk som bor i godt tilkoblede områder, noen ganger møter dårlige nettverkstilkoblinger, dårlige nettverkstilkoblinger og tilkobling.
For å løse dette problemet skapte Google Lyra, en talekodek av høy kvalitet med ultralav bitrate som gjør talekommunikasjon tilgjengelig selv på de tregeste nettverkene.
For å gjøre dette, brukte Google tradisjonelle kodeteknikker samtidig som de utnyttet fremskritt innen maskinlæring med modeller trent over tusenvis av timer med data for å lage en ny metode for å komprimere og overføre talesignaler.
Lyras kode er skrevet i C++ for å gi hastighet, effektivitet og interoperabilitet, og den bruker også Bazel-rammeverket med Abseil og GoogleTest-rammeverket for omfattende enhetstesting.
Basic API gir et grensesnitt for koding og dekoding på pakke- og filnivå. Den komplette verktøyet for signalbehandling er også tilgjengelig og inkluderer forskjellige filtre og transformasjoner.
“Eksempelapplikasjonen vår integreres med Android NDK for å vise hvordan du integrerer Lyras opprinnelige kode i et Java-basert Android-program. Vi gir også vektorn og kvantifiseringsmidlene som trengs for å kjøre Lyra, ”sa Google. Denne utgivelsen gir de nødvendige verktøyene for utviklere å kode og dekode lyd med Lyra, optimalisert for 64-biters Android ARM-plattform, med en versjon for Linux.
Funksjonene dekodes til bølgeform ved hjelp av en generativ modell. Generative modeller er en spesiell type maskinlæringsmodell som er godt egnet for å gjenskape en komplett lydbølgeform fra et begrenset antall funksjoner.
Lyras arkitektur er svært lik tradisjonelle lydkodeker , som har vært ryggraden i internettkommunikasjon i flere tiår. Selv om disse tradisjonelle kodekene er avhengige av digitale signalbehandlingsteknikker, ligger Lyras styrke i den generative modellens evne til å rekonstruere et talesignal av høy kvalitet.
Google implementerte Lyra i sin gratis videosamtaler-app Duo og sa at den gjorde koden åpen kildekode fordi de tror at den kan være egnet for andre apper.
Google mener det er en rekke apper Lyra kan være egnet for, enten det er for arkivering av store mengder tale, for å spare batterilevetid eller for å lindre nettverksbelastning i travle situasjoner.
"Vi ser frem til å se kreativiteten som kjennetegner open source-fellesskapet brukt på Lyra for å levere kraftige og unike applikasjoner," sa Google.
Kilde: https://opensource.googleblog.com