Nuovo riconoscimento spazio-temporale continuo della lingua dei segni utilizzando una rete multifunzionale attenta(1)

Jun 01, 2023

Astratto: Dati i flussi video, miriamo a rilevare correttamente i segni non segmentati relativi al riconoscimento continuo della lingua dei segni (CSLR). Nonostante l'aumento dei metodi di deep learning proposti in quest'area, la maggior parte di essi si concentra principalmente sull'utilizzo solo di una funzione RGB, sia l'immagine a pieno formato che i dettagli di mani e viso. La scarsità di informazioni per il processo di formazione CSLR limita pesantemente la capacità di apprendere più funzionalità utilizzando i frame di input video. Inoltre, lo sfruttamento di tutti i fotogrammi in un video per l'attività CSLR potrebbe portare a prestazioni non ottimali poiché ogni fotogramma contiene un diverso livello di informazioni, comprese le caratteristiche principali nell'inferenza del rumore. Pertanto, proponiamo un nuovo riconoscimento del linguaggio dei segni continuo spaziotemporale utilizzando l'attenta rete multi-funzione per migliorare CSLR fornendo caratteristiche chiave extra. Inoltre, sfruttiamo lo strato di attenzione nei moduli spaziali e temporali per enfatizzare contemporaneamente molteplici caratteristiche importanti. I risultati sperimentali di entrambi i set di dati CSLR dimostrano che il metodo proposto raggiunge prestazioni superiori rispetto agli attuali metodi all'avanguardia di 0.76 e 20,56 per il punteggio WER sui set di dati CSL e PHOENIX, rispettivamente.

Desert living cistanche

Cistanche alle erbe di Superman

Parole chiave: linguaggio dei segni continuo; spaziale; temporale; multifunzionalità; punti chiave; auto-attenzione

1. Introduzione

La lingua dei segni dà la priorità alla comunicazione manuale utilizzando gesti delle mani, linguaggio del corpo e movimenti delle labbra invece del suono per comunicare [1,2]. Di solito, la lingua dei segni viene utilizzata da persone non udenti o con problemi di udito, ma può essere utilizzata anche in situazioni in cui è impossibile o difficile udire i suoni. Pertanto, è necessario un sistema di riconoscimento della lingua dei segni (SLR) poiché aiuta a connettere le persone con problemi di udito e quelle che non lo sono.

Negli ultimi anni, i ricercatori hanno concentrato molta attenzione sulla SLR a causa delle ricche informazioni visive che fornisce. Gli studi SLR recenti sono generalmente raggruppati in riconoscimento della lingua dei segni isolata (ISLR) o riconoscimento della lingua dei segni continuo (CSLR). Diversi lavori affrontano solo l'ISLR [3,4], mentre altri analizzano solo compiti più semplici, come i gesti statici per il riconoscimento dell'alfabeto [5]. Nel frattempo, i metodi più recenti sono generalmente più complicati in quanto risolvono compiti CSLR [6–8]. Rispetto a ISLR, CSLR è un problema più impegnativo in quanto comporta la ricostruzione delle sentenze.

Cistanche tea2

Tè alla cistanche

Fare clic qui per visualizzare i prodotti del tè Cistanche deserticola

【Chiedi di più】 Email:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

La ricerca CSLR è ancora molto richiesta perché la sua implementazione è strettamente correlata alle condizioni quotidiane nel mondo reale. Questo approccio mira a riconoscere la serie di glosse che si verificano in una serie di video senza una chiara segmentazione o addirittura senza alcuna segmentazione. Inoltre, incorpora una grande quantità di ricerca sull'apprendimento automatico e una comprensione approfondita del comportamento umano. Ad esempio, coinvolge il tracciamento del movimento umano [9], il riconoscimento dei gesti [10] e il riconoscimento facciale [11]. Tuttavia, ci sono diverse sfide per eseguire attività CSLR.

Innanzitutto, la raccolta e l'annotazione dei dati sono costose per CSLR [12]. Questa è forse una delle sfide affrontate nel suo sviluppo poiché il CSLR è coinvolto in una grande rete e la quantità di dati influisce fortemente sulle prestazioni [13]. Inoltre, diversi set di dati disponibili per la lingua dei segni sono debolmente annotati [12,14,15]. Per risolvere questo problema, numerosi studi hanno utilizzato un approccio debolmente supervisionato, insieme all'applicazione di un modulo di allineamento e di estrazione di caratteristiche all'architettura di rete [12].

In secondo luogo, rispetto a ISLR, CSLR è più complicato. Informazioni sufficienti vengono acquisite utilizzando diverse funzionalità; è stato dimostrato che ciò consente di ottenere prestazioni migliori rispetto all'utilizzo di una singola funzionalità, come riportato in lavori precedenti [16-18]. Queste caratteristiche multiple sono costituite dalla caratteristica principale che è un'immagine del corpo che raggiunge la massima precisione e caratteristiche aggiuntive, come posa, testa, mano sinistra e mano destra, che hanno una precisione inferiore per le prestazioni individuali [17,18]. L'addestramento di una rete di grandi dimensioni con una grande quantità di dati richiede molto tempo [13]. L'aggiunta del flusso di input aumenta anche il tempo di addestramento, mentre l'utilizzo di funzionalità aggiuntive basate su immagini aumenta il costo [19]. Pertanto, dobbiamo scegliere caratteristiche importanti in modo da poterci allenare in modo efficiente.

Cistanche deserticola slice (1)

Cistanche di erbe cinesi

In terzo luogo, l'input video ha un gran numero di immagini nella sequenza. Alcune immagini hanno una forma della mano poco chiara a causa del movimento veloce, che potrebbe portare a informazioni errate. Pertanto, il nostro modello proposto utilizza l'auto-attenzione basata su [20] per aiutare a selezionare informazioni importanti. Inoltre, l'auto-attenzione dimostrata da [21,22] ha un impatto sul miglioramento delle prestazioni.

Pertanto, proponiamo un nuovo modello chiamato STAMF (Novel Spatiotemporal Attentive Multi-Feature) per gestire tutti i problemi. Abbiamo seguito i lavori precedenti [17,23], che hanno dimostrato di funzionare per CSLR con problemi di annotazione debole. Costruiscono il modello utilizzando tre componenti principali: il primo è il modulo spaziale, il secondo è il modulo temporale e il terzo è il modulo di apprendimento della sequenza. Proponiamo un input multi-funzionalità efficiente ed efficace utilizzando la funzionalità full frame insieme alle funzionalità dei punti chiave per eseguire attività CSLR. La funzione a pieno formato rappresenta l'immagine del corpo come caratteristica principale e le caratteristiche del punto chiave come caratteristica aggiuntiva. La caratteristica del punto chiave è la posa del corpo, incluso il dettaglio della posa della mano. Questa posa del corpo è la caratteristica aggiuntiva più efficace poiché in alcuni lavori è stato dimostrato che raggiunge la massima precisione dopo la caratteristica a pieno formato [17,18]. Utilizziamo anche un modulo di attenzione che utilizza l'auto-attenzione basata su [20] per catturare la caratteristica importante e per aiutare l'apprendimento della sequenza a migliorare le prestazioni.

Il contributo di questo manoscritto è riassunto come segue: • Introduciamo una nuova attenzione temporale nel modulo della sequenza per catturare i punti temporali importanti che contribuiscono all'output finale; • Introduciamo la multi-funzione che consiste nella caratteristica full-frame dal valore RGB del fotogramma come caratteristica principale e caratteristiche chiave che includono la posa del corpo con il dettaglio della forma della mano come caratteristica aggiuntiva per migliorare le prestazioni di riconoscimento del modello; • Utilizziamo la metrica WER per dimostrare che il nostro modello STAMF proposto supera i modelli all'avanguardia su entrambi i set di dati di benchmark CSLR attraverso gli esperimenti.

cistanche—Improve memory4

Supplemento Cistanche vicino a me-Migliora la memoria

2. Lavori correlati

Ci sono stati diversi progressi nella tecnologia e molte ricerche sono state fatte su SLR. Studi precedenti [24-27] hanno esplorato la possibilità di utilizzare ISLR che ha una segmentazione per ogni parola. Negli ultimi anni, sono stati utilizzati metodi basati sul deep learning per estrarre caratteristiche utilizzando reti convoluzionali, 2D [28,29] o 3D [30,31], per la loro forte rappresentazione visiva. La maggior parte delle prime ricerche sul riconoscimento della lingua dei segni era incentrata su ISLR con caratteristiche multimodali [30-32], come RGB, mappe di profondità e scheletri, che offrono prestazioni migliori.

Al giorno d'oggi, CSLR è diventato più popolare, sebbene non sia stato segmentato chiaramente tra ogni parola. I primi lavori utilizzano un estrattore di caratteristiche della CNN [6,33] e HMM [34] per costruire l'obiettivo della sequenza. Alcune recenti ricerche sui sistemi CSLR [17,23] hanno incluso tre passaggi principali nell'esecuzione del compito di riconoscimento del problema. In primo luogo, hanno condotto l'estrazione delle caratteristiche spaziali, quindi la segmentazione temporale e infine la sintesi di frasi con un modello linguistico [35], oppure hanno utilizzato l'apprendimento in sequenza [17,23]. Questo apprendimento in sequenza ha utilizzato Bi-LSTM e CTC per estrarre la relazione tra la brillantezza dei segni nelle sequenze video. Anche se utilizza un'annotazione debole che ha sequenze video non segmentate per definire le glosse dei segni, questi approcci hanno mostrato risultati promettenti.

Tuttavia, il più recente studio CLSR correlato che ha implementato un approccio multifunzionale [17] ha utilizzato cinque funzionalità contemporaneamente. L'approccio multi-funzione è più pesante rispetto all'utilizzo di meno funzioni [19]. Questo approccio, inoltre, non è in grado di gestire i frame rumorosi della sequenza video che contengono informazioni poco chiare, ad esempio una forma della mano sfocata a causa del movimento rapido. Inoltre, fare affidamento sull'apprendimento di sequenze basato su RNN può incontrare problemi con sequenze lunghe e può perdere il contesto globale [20].

cistanche—Improve memory3

Supplemento Cistanche vicino a me-Migliora la memoria

L'attuale ricerca mira a migliorare le prestazioni aggiungendo un meccanismo di auto-attenzione [21,22] in grado di gestire sequenze più lunghe per apprendere il contesto globale. L'auto-attenzione si basa sulle prime ricerche [20] che hanno dimostrato che l'auto-attenzione ha il vantaggio di essere in grado di gestire lunghe dipendenze. Tuttavia, questa auto-attenzione è più facile da imparare su un percorso più breve rispetto a un percorso più lungo con lunghe dipendenze. Nei precedenti lavori del CLSR [21,22] l'auto-attenzione potrebbe aiutare la rete ad apprendere la caratteristica in modo più efficace.

Pertanto, in questo articolo, introduciamo un nuovo modello multi-funzionalità attento spaziotemporale. Questo modello proposto estrae efficacemente le caratteristiche importanti e apprende meglio la sequenza fornendo informazioni importanti utilizzando un meccanismo di auto-attenzione da multi-funzione. Tutti i processi vengono eseguiti in un approccio end-to-end.

3. Metodo proposto

Questa sezione descrive in dettaglio le tecniche di base del nostro modello proposto per CSLR. Pertanto, iniziamo questa sezione spiegando la panoramica del nostro modello proposto. Inoltre, forniamo maggiori dettagli su ciascun componente chiave, incluso il modulo spaziale, il modulo temporale e il modulo di apprendimento della sequenza. Inoltre, spieghiamo anche il nostro modulo di attenzione proposto per aiutare il modello ad apprendere meglio. Infine, possiamo integrare il framework per l'addestramento e l'inferenza nel nostro modello proposto.

3.1. Panoramica del quadro

Dato un input video, il nostro modello proposto mira a prevedere il segno corrispondente in una frase gloss corretta. Il primo modulo genera molteplici caratteristiche spaziali, come le caratteristiche full frame e keypoint per ogni T frame del video. Quindi, il modulo temporale ci consente di estrarre le correlazioni temporali delle caratteristiche spaziali tra i frame per entrambi i flussi. Come passaggio finale, le reti spaziali e temporali sono state collegate alla memoria bidirezionale a lungo-breve termine (Bi-LSTM) e CTC per l'apprendimento di sequenze e l'inferenza. Successivamente, spieghiamo i nostri componenti principali in modo più dettagliato e consecutivamente. La panoramica dell'architettura proposta è illustrata nella Figura 1.

Figure 1


Figura 1. L'architettura complessiva del metodo proposto è costituita da tre componenti: un modulo spaziale, un modulo temporale e un modulo di apprendimento in sequenza. Il modulo spaziale prende prima la sequenza di immagini per estrarre le caratteristiche frame-wise e quindi applica il modulo temporale per estrarre le caratteristiche temporali. Quindi, le caratteristiche temporali vengono inviate al modulo di apprendimento della sequenza per eseguire la previsione delle parole e trasformarle in una frase

3.2. Modulo spaziale

Il modulo spaziale sfrutta una funzionalità full-frame e le funzionalità dei punti chiave, come mostrato nella Figura 2. Questo modulo utilizza l'architettura di rete 2D-CNN come spina dorsale e ResNet50 viene scelto per acquisire le multi-funzionalità. ResNet50 è più efficace da utilizzare rispetto alla recente architettura ResNet in termini di tempo pur avendo un risultato comparabile [36,37]. L'RGB utilizza direttamente ResNet50, mentre il punto chiave è ottenuto da HRNet [38] dal fotogramma video ed è estratto utilizzando ResNet50 per ottenere le caratteristiche del punto chiave.

Figure 2


Figura 2. L'architettura del modulo spaziale utilizza l'input multi-stream. Flusso RGB come funzione full frame e flusso punti chiave come funzione punto chiave.

3.2.1. Funzionalità full frame

Abbiamo applicato i nostri passaggi di pre-elaborazione ai dati RGB e quindi abbiamo inserito i nostri dati nel modello. Li inseriamo quindi come input full frame nella nostra architettura. La Figura 3 mostra l'illustrazione dell'immagine RGB originale sul lato sinistro e l'immagine ritagliata sul lato destro. L'immagine ritagliata viene utilizzata come input dal modello. Questo illustra la fase di pre-elaborazione che riduce le parti meno importanti dell'immagine e pone maggiore attenzione sul firmatario. Questo ritaglio utilizza un metodo di ritaglio casuale da [12] per aumentare il set di dati. La funzione fullframe viene estratta dall'immagine ritagliata per ogni fotogramma della sequenza utilizzando ResNet50.

Figure 3


Figura 3. Funzionalità a pieno formato che utilizza l'immagine RGB, l'(immagine a sinistra) è l'immagine originale e l'(immagine a destra) è l'immagine ritagliata per adattarla al modello proposto

3.2.2. Caratteristiche principali

Abbiamo estratto le caratteristiche dei punti chiave nel modulo spaziale dai dati RGB per ogni fotogramma nell'input video. La qualità delle caratteristiche dei punti chiave ha un ruolo importante nel nostro modello proposto, quindi abbiamo bisogno di utilizzare un approccio robusto, come HRNet [38]. Abbiamo impiegato HRNet pre-addestrato [38] per stimare tutti i 133 punti chiave del corpo e abbiamo utilizzato 27 dei 133 punti chiave dal suo risultato. Come mostrato nella Figura 4, il lato sinistro è il punto chiave originale della parte superiore del corpo e il lato destro sono i 27 punti chiave selezionati della parte superiore del corpo. Questi 27 punti chiave includono polsi, gomiti, spalle, collo, mani e dita.

Figure 4


Figura 4. Caratteristiche dei punti chiave del set di dati PHOENIX-RWTH [33,39], (immagine a sinistra) estrazione dall'immagine RGB e (immagine a destra) è il punto chiave selezionato utilizzato dal modello proposto.

3.3. Modulo temporale

Il modulo temporale mira ad apprendere informazioni spaziotemporali dal modulo spaziale. I moduli temporali sono costruiti da un raggruppamento temporale impilato per ogni flusso. Come mostrato nella Figura 5, il modulo di raggruppamento temporale è costituito da un livello di convoluzione temporale e un livello di raggruppamento per estrarre le caratteristiche dagli input sequenziali.

Figure 5.


Figura 5. L'architettura del modulo temporale consiste in una CNN 1D sovrapposta e uno strato di pooling integrato con un modulo di attenzione. Lavora in parallelo per entrambi i flussi di caratteristiche concatenati alla fine dei livelli impilati e produci una singola caratteristica temporale con una lunghezza della sequenza quattro volte inferiore.

L'input è un elenco di multifunzionalità spaziali della fase precedente. La caratteristica temporale è ottenuta utilizzando lo strato di convoluzione temporale che è un singolo strato convoluzionale 1D con le stesse lunghezze di input e output, seguito da un singolo strato di raggruppamento che riduce la dimensione a metà. L'utilizzo di questi due livelli di raggruppamento temporale impilati è la migliore configurazione, secondo i lavori precedenti [12]. Dopo ogni raggruppamento temporale, incorporiamo un modulo di attenzione che verrà spiegato in dettaglio nella Sezione 3.4. Alla fine, concateniamo l'output del pool temporale da entrambi i flussi.

3.4. Modulo Attenzione

Il video ha più fotogrammi in cui alcune parti dell'immagine sono a volte sfocate. Il set di dati RTWH-PHOENIX [33,39] ha più frame difettosi rispetto al set di dati CSL [8,40,41]. Questo accade quando il movimento è troppo veloce, creando un'immagine sfocata e determinando una posizione errata del punto chiave. Questo frame è considerato difettoso e potenzialmente porta a un'errata interpretazione sia delle caratteristiche RGB che dei punti chiave. La Figura 6 mostra un'illustrazione di frame difettosi nel set di dati RTWH-PHOENIX [33]. Per affrontare questo problema, abbiamo aggiunto un livello di attenzione.

Figure 6


Figura 6. Illustrazione dei frame difettosi sul set di dati RWTH-PHOENIX [33,39]. Alcuni dei punti chiave nell'area della mano sono nella posizione sbagliata a causa di immagini sfocate.

Utilizzando l'algoritmo CTC, l'allineamento del percorso insieme alla sua etichettatura viene eseguito utilizzando un'etichetta vuota e rimuovendo le etichette ripetute. CTC preferisce prevedere le etichette vuote piuttosto che i bordi lucidi quando non è in grado di distinguere i bordi lucidi, ma nessuno dei risultati è convincente. Ciò porta la rete a utilizzare CTC per produrre picchi nei risultati durante l'analisi, l'apprendimento e la previsione [42,43]. Generalmente, la perdita CTC cerca i fotogrammi chiave e l'ultimo risultato è la previsione di un particolare fotogramma chiave che ha un'alta probabilità di essere un'etichetta vuota o un'etichetta non vuota. Se il gloss prevede consecutivamente la stessa etichetta o etichetta vuota, si ottiene lo stesso output. Tuttavia, se c'è un'etichetta di inserimento tra la stessa etichetta, anche se c'è un solo errore, ne risulta una perdita molto maggiore. Qui l'aggiunta di uno strato di attenzione aiuta a selezionare l'importante sequenza temporale prima di essere utilizzata per l'apprendimento sequenziale.

Il modulo di attenzione utilizza un meccanismo di auto-attenzione a più teste [20]. Il modulo multi-head viene utilizzato per eseguire diversi meccanismi di attenzione paralleli contemporaneamente. L'attenzione a più teste funziona in modo indipendente per concentrarsi sulle dipendenze a breve termine o sulle dipendenze a lungo termine in una testa separata. Ciascun output viene quindi concatenato linearmente e trasformato nella forma desiderata.

Allo stesso tempo, il meccanismo di auto-attenzione a più teste si prende cura delle informazioni provenienti da molteplici sottospazi di rappresentazione, a seconda della storia delle osservazioni. Per semplicità, indichiamo le sequenze di input come X. Matematicamente, per il modello di attenzione a testa singola, dato l'input X t − T plus 1:t=[X t − T plus 1, · · ·, X t ] ∈ RT × N × P, si ottengono tre sottospazi, ovvero il sottospazio interrogativo Q ∈ RN × dq, il sottospazio chiave K ∈ RN × dk, e il sottospazio dei valori V ∈ RN × dv. Il processo di apprendimento subspaziale latente può essere formulato come [20]:

Q=XWQ, K=XWK , V=XWV ,

Quindi, il prodotto scalare dell'attenzione viene utilizzato per calcolare l'output dell'attenzione come [20]:

Attenzione(Q, K, V)=so f tmaxQKT/ p dkV,

Inoltre, se abbiamo più teste che seguono contemporaneamente le molteplici rappresentazioni dell'input, possiamo ottenere contemporaneamente risultati più rilevanti. Il passaggio finale consiste nel concatenare tutte le teste e proiettarle nuovamente per calcolare il punteggio finale [20]:

MultiTesta(Q,K,V)=Concat(testa1,..., teste )WO,

testa=Attenzione(Qi,Ki,Vi),

dove Qi=XWQ i , Ki=XWVi , e WO ∈ R hd × dmodel. Infine, può selezionare la parte importante dalla sequenza delle caratteristiche perché non tutte le informazioni nella sequenza sono importanti.

Come mostrato nella Figura 7, usiamo il modulo di attenzione in diverse configurazioni. Il primo modulo di attenzione è posto alla fine del modulo spaziale, mentre il secondo e il terzo modulo di attenzione sono posti nel modulo temporale. Il secondo modulo di attenzione chiamato modulo temporale precoce, è posto dopo il primo blocco di raggruppamento temporale come input, mentre il terzo modulo di attenzione temporale, chiamato modulo di attenzione temporale tardiva, è posto dopo il secondo blocco di raggruppamento temporale.

Figure 7

Figura 7. I moduli di attenzione sono incorporati in moduli spaziali e temporali in diverse configurazioni.

Potrebbe piacerti anche