Néhány nappal ezelőtt a A Google fejlesztői kiadták az általuk készített blogbejegyzés útján a Lyra nyílt forráskódúvá tétele. A Lyra a gépi tanuláson alapul, hogy alacsony sávszélességű helyzetekben kiváló minőségű hanghívásokat lehessen lehetővé tenni.
Amellyel ez előnyöket kínál, és lehetővé teszi más fejlesztők számára az alkalmazások táplálását kommunikációt és fejlessze a Lyra új irányokba.
A médiaalkalmazások évtizedek óta a kodekek lehetővé tették a sávszélesség-igényes alkalmazások számára az adatok hatékony továbbítását.
Mint olyan, a kodek fejlesztése mind a video, mind az audio számára folyamatos kihívást jelent- Minél jobb minőséget biztosítson, kevesebb adatot használjon, és minimalizálja a késést a valós idejű kommunikációhoz.
Bár úgy tűnik, hogy a videó sokkal nagyobb sávszélességet fogyaszt, mint az audio, a modern videokodekek alacsonyabb bitsebességet érhetnek el, mint néhány ma használt kiváló minőségű beszéd kodek.
A kombináció Az alacsony bitsebességű hang- és videokodekek kiváló minőségű videohívási élményt hozhatnak alacsony sávszélességű hálózatokon is. Történelmileg azonban minél alacsonyabb az audio kodek bitsebessége, annál kevésbé érthető a hangjel és annál robotibb.
Továbbá, noha egyesek hozzáférnek egy állandóan jó minőségű szélessávú hálózathoz, ez a szintű kapcsolat nem univerzális, sőt a jól összekapcsolt területeken élő emberek is néha gyenge hálózati kapcsolatokkal, gyenge hálózati kapcsolatokkal és csatlakozási lehetőségekkel küzdenek.
A probléma megoldásához A Google létrehozta a Lyra, egy kiváló minőségű, rendkívül alacsony bitsűrűségű beszédkodeket ami a hangkommunikációt még a leglassabb hálózatokon is elérhetővé teszi.
Ehhez A Google hagyományos kódolási technikákat alkalmazott, miközben kihasználta az előrelépéseket a gépi tanulás során, több ezer órányi adatokon át képzett modellekkel új módszer létrehozására a hangjelek tömörítésére és továbbítására.
A Lyra kódját C ++ nyelven írják a sebesség érdekében, hatékonyság és interoperabilitás, emellett a Bazel keretrendszert és az Abseil-t, valamint a GoogleTest keretrendszert használja a teljes egység teszteléséhez.
Az Basic API felületet kínál kódoláshoz és dekódoláshoz csomag- és fájlszinten. A teljes jelfeldolgozó eszközlánc szintén rendelkezésre áll, és különféle szűrőket és transzformációkat tartalmaz.
„Mintaalkalmazásunk az Android NDK-val integrálva megmutatja, hogyan lehet integrálni a Lyra natív kódját egy Java-alapú Android-alkalmazásba. Megadjuk a Lyra futtatásához szükséges vektorsúlyokat és kvantorokat is ”- mondta a Google. Ez a kiadás biztosítja a fejlesztők számára a szükséges eszközöket a hang kódolásához és dekódolásához a 64 bites Android ARM platformra optimalizált Lyra segítségével, Linux-verzióval.
A funkciókat generatív modell segítségével hullám formába dekódoljuk. A generatív modellek egy speciális típusú gépi tanulási modellek, amelyek jól alkalmazhatók a teljes audio hullámforma korlátozott számú funkcióból történő létrehozására.
A Lyra felépítése nagyon hasonlít a hagyományos audio kodekekre, amelyek évtizedek óta az internetes kommunikáció gerincét képezik. Míg ezek a hagyományos kodekek digitális jelfeldolgozási technikákon alapulnak, a Lyra abban rejlik, hogy a generatív modell képes rekonstruálni egy kiváló minőségű beszédjelet.
A Google megvalósította a Lyrát a Duo ingyenes videohívási alkalmazásában, és közölte, hogy nyílt forráskódúvá teszi a kódot, mert úgy gondolja, hogy alkalmas lehet más alkalmazásokra.
A Google úgy véli, hogy számos olyan alkalmazás létezik, amelyekre a Lyra alkalmas lehet, legyen szó akár nagy mennyiségű hang archiválásáról, az akkumulátor élettartamának megtakarításáról vagy a hálózati torlódások enyhítéséről forgalmas helyzetekben.
"Örömmel várjuk a kreativitást, amely jellemzi a nyílt forráskódú közösséget, amelyet erőteljes és egyedi alkalmazások szállítására alkalmaznak a Lyra-ban" - mondta a Google.
forrás: https://opensource.googleblog.com