Keputusan NVIDIA untuk membuka sumber Audio2Muka menandakan satu langkah penting bagi mereka yang mencipta watak digital dengan ekspresi semulajadi. Dengan langkah ini, syarikat menggalakkan lebih banyak studio dan pembangun untuk berintegrasi Animasi wajah dan penyegerakan bibir yang dijana AI dalam permainan video, aplikasi 3D dan pengalaman mendalam tanpa halangan akses biasa.
Keluaran meliputi SDK Audio2Face, model bagi regresi dan penyebaran dalam versinya v3.0, Dan rangka kerja latihan untuk menyesuaikan tingkah laku dengan datanya sendiri. Pertaruhan tertumpu pada mempercepatkan penggunaan avatar berasaskan AI dalam sektor seperti permainan video, media, hiburan dan perkhidmatan pelanggan.
Apakah itu Audio2Face dan mengapa ia penting?
Audio2Face berubah isyarat pertuturan (fonem, prosodi dan nuansa emosi) ke dalam lengkung dan data animasi yang menyegerakkan bibir dan ungkapan dengan sangat setia. Output ini boleh digunakan dalam masa sebenar atau dalam proses ?, daripada sinematik prarakaman kepada interaksi dinamik secara langsung dalam enjin grafik.
Bagi pemain atau penonton, keputusannya ialah a ekspresif yang lebih dipercayai, dengan watak yang bertindak balas secara konsisten terhadap nada dan irama audio, meningkatkan rendaman dalam adegan dialog, Penutup dan perkhidmatan dengan pembantu maya.
SDK, templat dan alatan tersedia
Penerbitan termasuk SDK Audio2FaceModel regresi y penyiaran v3.0, Dan persekitaran latihan diperlukan untuk menyesuaikan teknologi kepada gaya muka dan pelantar yang berbeza. Ada juga pemalam rasmi perenggan Autodesk Maya (v2.0) y Unreal Engine 5 (v2.5), supaya penyepaduan ke dalam saluran paip profesional adalah mudah.

Selain itu, model pelengkap diedarkan seperti Audio2Emosi, mampu membuat kesimpulan keadaan emosi daripada audio, dan sampel set data untuk mula bereksperimen secepat mungkin. Bagi mereka yang mencari lebih banyak maklumat dan sumber, NVIDIA merujuk kepada ACE untuk Permainan, di mana set alat berkaitan disusun.
Penyepaduan ke dalam aliran kerja 3D
Dalam pengeluaran sedia ada, yang Pemalam Maya dan Unreal Engine 5 memudahkan untuk memetakan output Audio2Face ke pelantar muka, dan menggabungkannya dengan lapisan animasi buatan tangan atau sistem tangkapan. SDK membenarkan automatik proses, membina alat dalaman dan menghubungkan AI dengan penyunting animasi atau sistem menghasilkan biasa dalam kajian.
Teknologinya ialah dioptimumkan untuk dijalankan pada prestasi tinggi pada GPU moden (seperti siri RTX), walaupun hakikat bahawa kod itu terbuka memudahkan untuk meneroka konfigurasi penggunaan lain dan pelarasan tersuai mengikut keperluan setiap projek.
Model pelengkap dan penyesuaian
Dengan rangka kerja latihan Setelah dikeluarkan, pasukan teknikal boleh memperhalusi model dengan pepohon fonem mereka sendiri, peraturan linguistik dan kepelbagaian suara, atau menyasarkan output kepada gaya pelantar tertentu. Gabungan dengan Audio2Emosi membuka pintu kepada nuansa ekspresif yang lebih mencerminkan masa dan niat penceramah.
Bagi mereka yang baru bermula, data sampel membolehkan anda mengesahkan penyaluran audio, menguji penyegerakan bibir dan menilai kualiti pindahkan ke pelantar sebelum melabur dalam korpus latihan anda sendiri.
Penerimaan dalam industri
Audio2Face telah pun disepadukan ke dalam alatan dan projek kajian dan pembekal dalam sektor tersebut. Nama yang disebut termasuk Codemasters, NetEase, Reallusion, Perfect World Games, GSC Games World, Convai, Inworld AI, Streamlabs dan UneeQ Digital Humans, tanda bahawa teknologi itu telah matang dalam tetapan kehidupan sebenar.
- Penjelasan semula memperbadankan Audio2Face dalam iClone y Pencipta Watak, menggabungkannya dengan fungsi seperti muka wayang kulit y AccuLip untuk memperhalusi penyegerakan bibir.
- Surviosdalam Alien: Rogue Incursion Edisi Berevolusi, mengoptimumkannya saluran paip animasi muka untuk menaikkan rendaman dalam realiti maya.
- Farm 51 menerapkannya dalam Chernobylite 2: Zon Pengecualian, mencapai tahap realisme lebih baik daripada keluaran pertamanya.
Komuniti terbuka dan kerjasama
Dengan kod yang boleh diakses, NVIDIA menjemput anda pembangun, pelajar dan penyelidik untuk menyumbangkan penambahbaikan, mencadangkan ciri baharu dan menyesuaikan penyelesaian kepada kes penggunaan tertentu. Syarikat itu juga menggalakkan penyertaan dalam Pelayan Audio2Face Discord, titik pertemuan untuk berkongsi kemajuan dan menyelesaikan soalan teknikal.
Perubahan lesen memudahkan komuniti untuk mencuba aliran kerja heterogen, daripada permainan video dan VTubing kepada pembantu maya korporat, menyatukan asas kod untuk diulang dengan cepat dan dengan ketelusan.
Dengan pembukaan Audio2Face, ekosistem animasi muka berpandukan AI mendapat rangsangan yang ketara: lebih akses, penyepaduan yang lebih baik dan jadual penerimaan yang, memandangkan kes-kes yang telah diketahui, mempunyai perjalanan yang panjang untuk kedua-duanya dalam pengeluaran AAA seperti dalam pasukan kecil yang mencari kualiti tanpa bermula dari awal.