Ugrás a tartalomhoz

 

3D konvolúciós neuronhálón és neurális vokóderen alapuló némabeszéd-interfész

  • Metaadatok
Tartalom: http://acta.bibl.u-szeged.hu/73362/
Archívum: SZTE Egyetemi Kiadványok Repozitórium
Gyűjtemény: Szakterület = 01. Természettudományok: 01.02. Számítás- és információtudomány
Szakterület = 01. Természettudományok
Szakterület = 06. Bölcsészettudományok: 06.02. Nyelvek és irodalom
Szakterület = 06. Bölcsészettudományok
Tipus = Konferencia vagy workshop anyag
Cím:
3D konvolúciós neuronhálón és neurális vokóderen alapuló némabeszéd-interfész
Létrehozó:
Tóth László
Honarmandi Shandiz Amin
Gosztolya Gábor
Zainkó Csaba
Markó Alexandra
Csapó Tamás Gábor
Dátum:
2021
Téma:
01. Természettudományok
01.02. Számítás- és információtudomány
06. Bölcsészettudományok
06.02. Nyelvek és irodalom
Tartalmi leírás:
A némabeszéd-interfészek célja beszédjel előállítása valamilyen, az artikulációs szervek mozgását rögzítő felvételből, például a nyelvmozgást tartalmazó ultrahang-videóból. Jelenleg erre a konverzióra a mély neuronhálókat alkalmazó megoldások tűnnek a legígéretesebbnek. Képek felismerésére már régóta alkalmazzák a konvolúciós neuronhálókat, a legjobb eredményt azonban akkor kaphatjuk, ha a videó egyes képkockáit nem külön-külön, hanem sorozatként dolgozzuk fel. Egy lehetséges megoldás erre, ha a képeket feldolgozó konvolúciós háló kimeneteinek sorozatát egy visszacsatolt neuronhálóval egyesítjük. Jelen cikkben viszont egy másik megoldással próbálkozunk, nevesül 3-dimenziós konvolúciós hálókat használunk, ahol a képek két dimenziója mellett az idő képezi a harmadik tengelyt. A 3D konvolúciós hálóknak is egy speciális változatát alkalmazzuk, amely a térbeli és időbeli konvolúciós lépéseket felbontott formában végzi el – ezt a fajta hálózatot sikeresen használták már más videófelismerési feladatokban is. Kísérleteinkben a 3D neuronháló némileg pontosabb eredményeket adott, mint a kombinált konvolúciós+visszacsatolt modell, ami azt mutatja, hogy ez a megközelítés alternatívája lehet a rekurrens hálókra épülő, általában lassabban és nehézkesebben tanítható modelleknek.
Nyelv:
magyar
magyar
Típus:
Konferencia vagy workshop anyag
NonPeerReviewed
Formátum:
part
Azonosító:
Tóth László; Honarmandi Shandiz Amin; Gosztolya Gábor; Zainkó Csaba; Markó Alexandra; Csapó Tamás Gábor: 3D konvolúciós neuronhálón és neurális vokóderen alapuló némabeszéd-interfész.
Kapcsolat: