Google發布了Android音頻編解碼器Lyra的源代碼 

幾天前,Google開發者在一篇部落格文章中宣布,他們決定開源 Lyra。 Lyra利用機器學習技術,即使在低頻寬環境下也能實現高品質的語音通話。

有利於其他開發者增強他們的通訊應用程序,並使他們能夠朝著新的方向發展 Lyra。

數十年來,編解碼器是媒體應用程序的主要部分,它使帶寬密集型應用程序能夠有效地傳輸數據。

因此,視訊和音訊編解碼器的開發面臨著持續的挑戰:在提供不斷提高的品質的同時,減少數據使用量,並最大限度地降低即時通訊的延遲。

儘管視頻似乎比音頻消耗更多的帶寬,但是現代視頻編解碼器可以實現比當今使用的某些高質量語音編解碼器更低的比特率。

低位元速率語音和視訊編解碼器的組合即使在低頻寬網路上也能提供高品質的視訊通話體驗。然而,從以往經驗來看,音訊編解碼器的位元率越低,語音訊號的清晰度就越差,聽起來也越機械。

另外,儘管有些人可以使用一致的高質量寬帶網絡,但是這種連接級別並不普遍,甚至居住在連接良好的地區的人有時也會面臨網絡連接不良,網絡連接不良和連接性不足的問題。

為了解決這個問題,Google開發了 Lyra,這是一種高品質、超低位元率的語音編解碼器,即使在最慢的網路上也能進行語音通訊。

為了實現這一目標,Google運用了傳統的編碼技術,同時利用機器學習的進步,透過數千小時的資料訓練模型,創造了一種壓縮和傳輸語音訊號的新方法。

Lyra 的程式碼是用 C++ 編寫的,以提供速度、效率和互通性,它還使用了 Bazel 框架、Abseil 和 GoogleTest 框架進行全面的單元測試。

基本API提供了用於在數據包和文件級別進行編碼和解碼的接口。 還提供了完整的信號處理工具鏈,其中包括各種濾波器和變換。

“我們的示例應用程序與Android NDK集成在一起,以展示如何將Lyra的本機代碼集成到基於Java的Android應用程序中。 我們還提供了運行Lyra所需的向量權重和量詞,” Google說。 該版本為開發人員提供了必要的工具,以使用Lyra進行音頻編碼和解碼,Lyra已針對64位Android ARM平台進行了優化,並具有適用於Linux的版本。

使用生成模型將特徵解碼為波形。 生成模型是一種特殊類型的機器學習模型,非常適合通過有限的功能重新創建完整的音頻波形。

Lyra 的架構與傳統的音訊編解碼器非常相似,而傳統的音訊編解碼器幾十年來一直是網路通訊的支柱。雖然這些傳統編解碼器依賴數位訊號處理技術,但 Lyra 的優勢在於其生成模型能夠重建高品質的語音訊號。

谷歌在其免費的視頻通話應用程序Duo中實現了Lyra,並表示正在將代碼開源,因為它認為它可能適用於其他應用程序。

Google認為,Lyra可能適用於許多應用程序,無論是用於存檔大量語音,節省電池壽命還是在繁忙情況下緩解網絡擁塞。

谷歌說:“我們期待看到代表Lyra的開源社區所具有的創造力,以提供強大而獨特的應用程序。”

資料來源:https ://opensource.googleblog.com


在 Google 中將其新增為首選來源