Kereső
Bejelentkezés
Kapcsolat
3D konvolúciós neuronhálón és neurális vokóderen alapuló némabeszéd-interfész |
Tartalom: | http://acta.bibl.u-szeged.hu/73362/ |
---|---|
Archívum: | SZTE Egyetemi Kiadványok Repozitórium |
Gyűjtemény: |
Szakterület = 01. Természettudományok: 01.02. Számítás- és információtudomány
Szakterület = 01. Természettudományok Szakterület = 06. Bölcsészettudományok: 06.02. Nyelvek és irodalom Szakterület = 06. Bölcsészettudományok Tipus = Konferencia vagy workshop anyag |
Cím: |
3D konvolúciós neuronhálón és neurális vokóderen alapuló némabeszéd-interfész
|
Létrehozó: |
Tóth László
Honarmandi Shandiz Amin
Gosztolya Gábor
Zainkó Csaba
Markó Alexandra
Csapó Tamás Gábor
|
Dátum: |
2021
|
Téma: |
01. Természettudományok
01.02. Számítás- és információtudomány
06. Bölcsészettudományok
06.02. Nyelvek és irodalom
|
Tartalmi leírás: |
A némabeszéd-interfészek célja beszédjel előállítása valamilyen, az artikulációs szervek mozgását rögzítő felvételből, például a nyelvmozgást tartalmazó ultrahang-videóból. Jelenleg erre a konverzióra a mély neuronhálókat alkalmazó megoldások tűnnek a legígéretesebbnek. Képek felismerésére már régóta alkalmazzák a konvolúciós neuronhálókat, a legjobb eredményt azonban akkor kaphatjuk, ha a videó egyes képkockáit nem külön-külön, hanem sorozatként dolgozzuk fel. Egy lehetséges megoldás erre, ha a képeket feldolgozó konvolúciós háló kimeneteinek sorozatát egy visszacsatolt neuronhálóval egyesítjük. Jelen cikkben viszont egy másik megoldással próbálkozunk, nevesül 3-dimenziós konvolúciós hálókat használunk, ahol a képek két dimenziója mellett az idő képezi a harmadik tengelyt. A 3D konvolúciós hálóknak is egy speciális változatát alkalmazzuk, amely a térbeli és időbeli konvolúciós lépéseket felbontott formában végzi el – ezt a fajta hálózatot sikeresen használták már más videófelismerési feladatokban is. Kísérleteinkben a 3D neuronháló némileg pontosabb eredményeket adott, mint a kombinált konvolúciós+visszacsatolt modell, ami azt mutatja, hogy ez a megközelítés alternatívája lehet a rekurrens hálókra épülő, általában lassabban és nehézkesebben tanítható modelleknek.
|
Nyelv: |
magyar
magyar
|
Típus: |
Konferencia vagy workshop anyag
NonPeerReviewed
|
Formátum: |
part
|
Azonosító: |
Tóth László; Honarmandi Shandiz Amin; Gosztolya Gábor; Zainkó Csaba; Markó Alexandra; Csapó Tamás Gábor: 3D konvolúciós neuronhálón és neurális vokóderen alapuló némabeszéd-interfész.
|
Kapcsolat: |