Преди няколко дни Разработчиците на Google пуснаха чрез публикация в блог, която са взели решението да се направи Lyra с отворен код. Lyra се основава на машинно обучение, за да позволи висококачествени гласови повиквания в ситуации с ниска честотна лента.
С което това предимства и позволява на други разработчици да подават своите приложения комуникация и развитие на Лира в нови посоки.
Основен продукт от медийни приложения от десетилетия, кодеците са позволили на приложенията с интензивна честотна лента да предават данни ефективно.
Като такъв, разработването на кодеци, както за видео, така и за аудио, представлява постоянно предизвикателство- Осигурете все по-високо качество, използвайте по-малко данни и минимизирайте латентността за комуникация в реално време.
Въпреки че може да изглежда, че видеоклипът консумира много по-голяма честотна лента от аудиото, съвременните видео кодеци могат да постигнат по-ниски битови скорости от някои от висококачествените речеви кодеци, използвани днес.
Комбинацията от Гласовите и видео кодеците с ниска скорост на предаване могат да донесат висококачествено видеообаждане дори в мрежи с ниска честотна лента. Исторически обаче, колкото по-ниска е битрейтът на аудио кодека, толкова по-неразбираем е гласовият сигнал и толкова по-роботизиран е той.
Също така, въпреки че някои хора имат достъп до постоянна висококачествена широколентова мрежа, това ниво на свързаност не е универсално и дори хората, които живеят в добре свързани райони, понякога са изправени пред лоши мрежови връзки, лоши мрежови връзки и свързаност.
За да разрешите този проблем, Google създаде Lyra, висококачествен речев кодек с ултра ниска битова скорост което прави гласовата комуникация достъпна дори в най-бавните мрежи.
За да направите това, Google прилага традиционни техники за кодиране, като същевременно се възползва от напредъка в машинно обучение с модели, обучени за хиляди часове данни, за да се създаде нов метод за компресиране и предаване на гласови сигнали.
Кодът на Lyra е написан на C ++ за скорост, ефективност и оперативна съвместимост, плюс използва рамката Bazel с Abseil и рамката GoogleTest за пълни модулни тестове.
Basic API предоставя интерфейс за кодиране и декодиране на ниво пакет и файл. Осигурена е и пълната верига от инструменти за обработка на сигнали, която включва различни филтри и трансформации.
„Нашето примерно приложение се интегрира с Android NDK, за да покаже как да интегрираме собствения код на Lyra в базирано на Java приложение за Android. Ние също така предоставяме векторните тегла и кванторите, необходими за стартирането на Lyra “, каза Google. Тази версия предоставя необходимите инструменти за разработчици за кодиране и декодиране на аудио с Lyra, оптимизирана за 64-битовата Android ARM платформа, с версия за Linux.
Характеристиките се декодират във форма на вълна с помощта на генеративен модел. Генеративните модели са специален тип модел на машинно обучение, подходящ за пресъздаване на цялостна аудио форма на вълната от ограничен брой функции.
Архитектурата на Lyra много прилича на традиционните аудио кодеци, които са гръбнакът на интернет комуникацията от десетилетия. Докато тези традиционни кодеци се основават на техники за цифрова обработка на сигнали, Lyra се състои в способността на генеративния модел да реконструира висококачествен речев сигнал.
Google внедри Lyra в безплатното си приложение за видеообаждания Duo и заяви, че прави кода с отворен код, защото смята, че може да е подходящ за други приложения.
Google смята, че има редица приложения, за които Lyra може да е подходяща, независимо дали става въпрос за архивиране на големи количества глас, спестяване на живот на батерията или облекчаване на задръстванията в мрежата при натоварени ситуации.
„Очакваме с нетърпение да видим креативността, която характеризира общността с отворен код, приложена към Lyra за доставяне на мощни и уникални приложения“, каза Google.
Fuente: https://opensource.googleblog.com