Пре неколико дана, програмери компаније Google су у објави на блогу објавили да су одлучили да поставе Лиру отвореног кода. Лира користи машинско учење како би омогућила висококвалитетне гласовне позиве у ситуацијама са малим пропусним опсегом.
Ово користи и омогућава другим програмерима да побољшају своје комуникационе апликације и развијају Лиру у новим правцима.
Кодеци који су деценијама били главна медијска апликација омогућили су апликацијама које захтевају пропусни опсег ефикасан пренос података.
Стога, развој кодека, како за видео тако и за аудио, представља стални изазов : обезбедити све већи квалитет, користити мање података и минимизирати латенцију за комуникацију у реалном времену.
Иако се чини да видео троши много више пропусног опсега од звука, савремени видео кодеци могу постићи ниже брзине преноса од неких висококвалитетних говорних кодека који се данас користе.
Комбинација гласовних и видео кодека са ниском брзином преноса података може да обезбеди висококвалитетно искуство видео позива чак и на мрежама са малим пропусним опсегом. Међутим, историјски гледано, што је нижа брзина преноса података аудио кодека, гласовни сигнал постаје мање разумљив и „роботизованији“.
Такође, иако неки људи имају приступ конзистентној висококвалитетној широкопојасној мрежи, овај ниво повезаности није универзалан, па чак и људи који живе у добро повезаним подручјима понекад се суочавају са лошим мрежним везама, лошим мрежним везама и недостатком повезаности.
Да би решио овај проблем, Гугл је креирао Лиру, висококвалитетни гласовни кодек са ултра ниском брзином преноса података који омогућава гласовну комуникацију чак и на најспоријим мрежама.
Да би то урадио, Гугл је применио традиционалне технике кодирања, користећи напредак у машинском учењу са моделима обученим током хиљада сати података како би створио нови метод компресије и преноса гласовних сигнала.
Лирин код је написан у C++ језику како би се обезбедила брзина, ефикасност и интероперабилност, а такође користи и Базел фрејмворк са Абсеилом и GoogleTest фрејмворк за свеобухватно јединично тестирање.
Басиц АПИ пружа интерфејс за кодирање и декодирање на нивоу пакета и датотека. Комплетан ланац алата за обраду сигнала је такође обезбеђен и укључује разне филтере и трансформације.
„Наш примерак апликације интегрише се са Андроид НДК да би показао како интегрирати Лирин матични код у Андроид апликацију засновану на Јави. Такође обезбеђујемо векторске тежине и квантификаторе потребне за покретање Лире “, рекао је Гоогле. Ово издање пружа потребне алате програмерима за кодирање и декодирање звука помоћу програма Лира, оптимизованог за 64-битну Андроид АРМ платформу, са верзијом за Линук.
Карактеристике се декодирају у таласни облик помоћу генеративног модела. Генеративни модели су посебна врста модела машинског учења која је погодна за поновно стварање комплетног аудио таласног облика из ограниченог броја функција.
Лирина архитектура је веома слична традиционалним аудио кодецима , који су деценијама били окосница интернет комуникације. Док се ови традиционални кодеци ослањају на технике дигиталне обраде сигнала, Лирина снага лежи у способности генеративног модела да реконструише висококвалитетни гласовни сигнал.
Гоогле је имплементирао Лиру у своју бесплатну апликацију за видео позиве Дуо и рекао да прави код отвореног кода јер сматра да би могао бити погодан за друге апликације.
Гоогле верује да постоји велики број апликација за које би Лира могла бити погодна, било да се ради о архивирању велике количине гласа, уштеди трајања батерије или ублажавању загушења мреже у заузетим ситуацијама.
„Радујемо се што ћемо видети креативност која карактерише заједницу отвореног кода примењену на Лира за испоруку моћних и јединствених апликација“, рекао је Гоогле.
Извор: https://opensource.googleblog.com