Migliore estrazione dei parametri delle funzionalità dai segnali vocali utilizzando l'algoritmo di apprendimento automatico(2)
May 30, 2023
3.7. Set di dati I processi di raccolta e generazione dei set di dati sono stati eseguiti come segue. In questo studio, il set di dati con 120 ore di audio è stato utilizzato per l'addestramento del modello. Il set di dati include registrazioni audio vocali costituite da frasi con un massimo di 15 parole con una lunghezza totale di circa 120 ore.

Ginseng del deserto
Inoltre, il set di dati include una grande quantità di testo diverso da utilizzare nello sviluppo del modello linguistico. Sono state raccolte oltre 90.650 espressioni, 415.780 parole e 65.810 parole uniche che sono state incluse nel corpus testuale, risultando in circa 120 ore di dati vocali trascritti. Abbiamo suddiviso il set di dati in set di addestramento, convalida e test. Le statistiche del set di dati
sono riportati in Tabella 3.
Tabella 3. Le specifiche del set di dati.

Abbiamo suddiviso il set di dati in tre cartelle corrispondenti ai set di addestramento, convalida e test. Ogni cartella contiene registrazioni audio e trascrizioni. I nomi dei file audio e delle trascrizioni corrispondenti sono gli stessi, tranne per il fatto che le registrazioni audio vengono archiviate come file WAV, mentre le trascrizioni vengono archiviate come file TXT utilizzando la codifica UTF-8. Tutte le trascrizioni sono rappresentate utilizzando l'alfabeto latino composto da 29 lettere e il simbolo dell'apostrofo. Per prevenire l'overfitting, abbiamo applicato tecniche di aumento dei dati basate sulla perturbazione della velocità e sul potenziamento spettrale.

Cistanche deserticola
4. Metodo proposto
Un compito importante per i programmatori nello sviluppo di sistemi di riconoscimento vocale è la creazione di un metodo ottimale per l'espressione parametrica dei segnali vocali [45]. Questo metodo consente un'eccellente separazione dei suoni e delle parole pronunciate, garantendo al tempo stesso che gli oratori siano insensibili ai modelli di pronuncia e ai cambiamenti nell'ambiente acustico. La maggior parte degli errori nel riconoscimento delle parole sono causati da un cambiamento nell'intonazione del segnale a causa di uno spostamento del microfono o di una differenza nell'intonazione della pronuncia [46]. Un'altra causa comune di errori sono le deformazioni casuali non lineari della forma dello spettro, che sono sempre presenti nel segnale vocale di un parlante [47,48]. Pertanto, uno dei compiti più importanti nella creazione di efficaci sistemi di riconoscimento vocale è la selezione di una rappresentazione che sia sufficiente per il contenuto del segnale analizzato nonché insensibile alle voci degli oratori e ai vari ambienti acustici.

Supplemento Cistanche vicino a me-Migliorare la memoria
Il sistema utilizzato per l'estrazione dei parametri della funzione in genere ha i seguenti requisiti. Il contenuto informativo, cioè l'insieme dei parametri delle caratteristiche, deve garantire l'identificazione affidabile di elementi vocali riconoscibili. Inoltre, il loudness, cioè la massima compressione del segnale audio, e la correlazione non statistica dei parametri devono essere ridotti al minimo. Occorre inoltre conseguire l'indipendenza dal parlante, cioè la massima sottrazione delle informazioni relative alle caratteristiche del parlante dal vettore dei caratteri. Infine, deve essere fornita l'omogeneità, che si riferisce ai parametri che hanno la stessa varianza media e la capacità di utilizzare metriche semplici per determinare l'affinità tra set di caratteri [49]. Tuttavia, non è sempre possibile soddisfare tutti i requisiti contemporaneamente perché tali requisiti sono contraddittori. La descrizione parametrica degli elementi del discorso dovrebbe essere sufficientemente dettagliata per distinguerli in modo affidabile e dovrebbe essere il più concisa possibile.

Cistanche alle erbe di Superman
In pratica, il segnale vocale ricevuto da un microfono viene digitalizzato a una frequenza di campionamento compresa tra 8 e 22 kHz. I valori numerici seriali sono divisi in frammenti di discorso (frame) con una durata da 10 a 30 ms, che corrispondono a parti di discorso quasi stazionarie. Da ogni fotogramma viene calcolato un vettore di caratteristiche, che viene successivamente utilizzato a livello acustico di riconoscimento vocale. Attualmente è disponibile un'ampia gamma di metodi per la rappresentazione parametrica di segnali basati su analisi di autocorrelazione, filtraggio lineare hardware, analisi spettrale e LPC. L'approccio più comune per la parametrizzazione del parlato è l'analisi spettrale dei frammenti di segnale e il calcolo dei loro coefficienti cepstrali.
Gli MFCC sono stati usati come caratteristiche informative per il segnale vocale [41]. Queste caratteristiche sono ampiamente utilizzate nel riconoscimento vocale e si basano su due concetti principali: la scala cepstrale e Mel. I principali vantaggi dell'algoritmo sono il suo alto livello di familiarità e facilità di parola. Le funzioni MFCC sono separate dai segnali vocali registrati. L'algoritmo MFCC utilizza i risultati degli algoritmi di commutazione del fonogramma e dello spettro. L'algoritmo classico utilizzato per calcolare gli MFCC è illustrato nella Figura 5.

Figura 5. Schema classico per il calcolo degli MFCC.
Questo studio presenta un metodo rapido per estrarre i parametri di funzione da un segnale vocale. L'algoritmo proposto per il calcolo rapido degli MFCC è mostrato in Figura 6.

Figura 6. Framework proposto per il calcolo degli MFCC.
Consideriamo la sequenza di esecuzione dell'algoritmo proposto per l'estrazione rapida dei parametri di funzione da un segnale vocale
4.1. Divisione in frame
Dopo il filtraggio preliminare, il segnale vocale viene suddiviso in frame di 16 ms. Ogni fotogramma (eccetto il primo) contiene gli ultimi 10 ms del fotogramma precedente. Questo processo continua fino alla fine del segnale. In questo studio, poiché la frequenza di campionamento del segnale vocale è di 16 kHz, la lunghezza del frame è N=256 e la lunghezza dell'offset è M=160. La sovrapposizione è del 62,5 percento della lunghezza del fotogramma. In genere si consiglia una copertura compresa tra il 50% e il 75% della lunghezza del fotogramma.
4.2. Finestra di Hanning e valori decrescenti
È stata utilizzata una dimensione della finestra Hanning di 1D. La finestra di Hanning è anche chiamata finestra del coseno in rilievo. La finestra di Hanning può essere considerata come la somma dello spettro di frequenza di tre finestre temporali rettangolari. Può utilizzare i lobi laterali per annullarsi a vicenda, eliminando le interferenze ad alta frequenza e le perdite di energia. Le finestre Hanning sono funzioni di finestra molto utili.

Supplemento Cistanche vicino a me-Migliorare la memoria
【Chiedi di più】 Email:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
Una scatola di pesi viene utilizzata per ridurre la distorsione e levigare i singoli fotogrammi. Il segnale fluttuante esaminato in questo studio è costituito da un tono denso. L'ampiezza del tono piatto è determinata dall'ampiezza del tono puro alla frequenza f, che viene filtrata attraverso la finestra di Hanning.
Un aspetto critico di questa finestra è che imposta i bordi dei frame a zero. In questo caso, le energie corte possono essere calcolate passando attraverso la finestra, e possono essere trasferite dalla sequenza utilizzata per calcolare le energie di ampiezza minore. Lo scopo è quello di rimuovere i segnali a bassa energia dal segnale calcolando l'energia del segnale mentre si uniforma il segnale da questa finestra. Questo processo richiede la seguente equazione dell'energia del segnale:

dove En è l'energia del frammento del segnale di ingresso e xi è il valore del segnale.
Oltre all'elaborazione della finestra che utilizza (11), il segnale viene elaborato nella fase successiva, il che riduce significativamente il numero di valori che entrano nel processore. La Figura 7 presenta l'algoritmo di elaborazione parallela.
La dimensione della finestra rappresenta un numero di campioni e una durata. È il parametro principale dell'analisi. La dimensione della finestra dipende dalla frequenza fondamentale, dall'intensità e dai cambiamenti nel segnale.

Figura 7. Algoritmo della finestra di Hanning per la rimozione delle parti silenziose. 4.3. Switch STFT (Short-Time Fourier Transform) Esiste una comprensione intuitiva del significato di un'altezza alta o bassa. STFT è una trasformata correlata a Fourier che viene utilizzata per determinare la frequenza sinusoidale e il contenuto di fase delle sezioni locali di un segnale mentre cambia nel tempo. In pratica, il calcolo STFT comporta la divisione di un segnale temporale più lungo in segmenti più brevi di uguale lunghezza, seguita da un calcolo separato della trasformata di Fourier su ciascun segmento più breve. Ciò rivela lo spettro di Fourier di ciascun segmento più breve. I segnali a tempo discreto sono utilizzato in pratica. La corrispondente conversione tempo-frequenza è una conversione discreta di Fourier, che descrive la lunghezza del segnale Xn come rappresentativa del dominio di frequenza del valore complesso degli N coefficienti. STFT, che descrive l'evoluzione delle componenti di frequenza nel tempo, è uno degli strumenti più utilizzati per l'analisi e l'elaborazione del parlato [50]. Simile allo spettro stesso, un vantaggio di STFT è che i suoi parametri hanno interpretazioni fisiche e intuitive. STFT è tipicamente visualizzato utilizzando gli spettri logaritmici 20log10 (X(h, k)). Tali spettri logaritmici 2D possono quindi essere visualizzati utilizzando una mappa termica nota come spettrogramma. Nella terza fase dell'algoritmo, la procedura di commutazione spettrale STFT viene applicata ai frame che passano attraverso la finestra del peso. La STFT del segnale si ottiene aprendo le finestre e determinando la DFT di ciascuna finestra. In particolare, la trasformazione per le finestre Xn e Wn del segnale di ingresso è determinata come segue:

dove l'indice k corrisponde ai valori di frequenza e wn è la funzione finestra, che comunemente è una finestra di Hanning o una finestra gaussiana centrata attorno allo zero.
4.4. Mel Trasforma
Nella quarta fase, il segnale che viene trasferito alla banda di frequenza viene suddiviso in intervalli mediante filtri triangolari. I confini del fifiltro sono calcolati utilizzando la frequenza del gesso. La transizione al campo di frequenza del gesso si basa sulla seguente equazione:

dove f è l'intervallo di frequenza.
L'interruttore di retromarcia è determinato come segue:

Si consideri NN come il numero di fifiltri (generalmente si usano 26 fifiltri) e di flussi, pari all'intervallo di frequenza in esame. Questo intervallo viene trasferito alla scala Mel e suddiviso in NN intervalli di intersezione uniformemente distribuiti. I limiti lineari appropriati alla frequenza sono determinati all'interno del fifield, mentre i coefficienti di ponderazione che si ottengono in base alla fifiltrazione sono indicati con H. Successivamente, i fifiltri vengono applicati al modulo quadrato dei coefficienti ottenuti dalla trasformata di Fourier. I valori che si ottengono sono logaritmici grazie alla seguente espressione:

L'algoritmo di decomposizione del valore singolare viene implementato nella fase finale del calcolo degli MFCC.
5. Risultati sperimentali
Abbiamo implementato e testato il metodo proposto in Visual Studio 2019 C plus plus su un PC con CPU da 4,90 GHz, 32 GB di RAM e due GPU Nvidia GeForce 2080Ti, come mostrato nella Tabella 4. Il sistema è stato testato in diversi ambienti di dispositivi per valutare le prestazioni del metodo di estrazione delle caratteristiche del segnale. Negli esperimenti, durante il funzionamento dell'algoritmo (Figura 8), quando la sequenza delle superfici del segnale era n=15, il numero di valori è stato ridotto del 40-50 percento e il tempo di elaborazione è aumentato di 1. 2-piega. Di conseguenza, questo algoritmo ha mostrato un'efficienza significativamente più elevata. Inoltre, questo algoritmo ha consentito la separazione e l'eliminazione delle aree di silenzio durante il passaggio attraverso la finestra di Hanning.
Sono disponibili diversi mezzi possibili per evitare lo spreco di banda di memoria. Proponiamo una nuova soluzione che aumenta le prestazioni di calcolo abbinando la dimensione dei frame di segnale a una dimensione del blocco di memoria cache. Questo tipo di ottimizzazione può influire in modo significativo sulle prestazioni complessive dell'elaborazione parallela. Tuttavia, può essere utilizzato nell'elaborazione del segnale digitale dividendo il segnale in frame tramite implementazioni su processori multicore. Tuttavia, in pratica, la selezione viene solitamente eseguita su piccola scala, corrispondente alla larghezza del bus dati che collega la memoria cache alla memoria principale e alla dimensione del suo blocco. Il nostro metodo implementa l'uso ottimale di queste memorie nel calcolo parallelo. L'organizzazione della memoria cache gioca un ruolo essenziale negli algoritmi di elaborazione parallela quando si dividono i dati in flussi. In particolare, la presenza di effetti vettore-matrice nell'elaborazione dei segnali digitali e la dimensione dei loro flussi dovrebbe essere regolata in base alla dimensione dei blocchi della cache. Ciò può essere ottenuto utilizzando il metodo proposto, come illustrato nella Figura 9.
Tabella 4. Le specifiche dettagliate della configurazione sperimentale.


figura 8. (a) Segnale in ingresso iniziale e (b) aspetto del segnale dopo l'applicazione dell'algoritmo proposto.

Figura 9. Struttura di elaborazione parallela utilizzando processori RK3288.
In questa sezione, discutiamo un'analisi quantitativa per confrontare le prestazioni di diversi sistemi. Abbiamo confrontato il nostro metodo con noti algoritmi di riconoscimento vocale basati su approcci di deep learning. Le metriche di valutazione sono essenziali per calcolare varie strategie per il riconoscimento vocale e valutare le prestazioni di diversi approcci. Sebbene abbiamo utilizzato i risultati di altri studi per il confronto, non siamo certi che siano veri perché i codici sorgente e i set di dati di questi metodi non sono pubblicamente disponibili per verificare le prestazioni effettive. La Figura 10 illustra il risultato della rimozione delle parti silenziose durante il passaggio di un frammento di segnale vocale attraverso la finestra di Hanning basata sull'algoritmo rapido proposto. I risultati di velocità ottenuti dall'analisi sono presentati nella Tabella 5.

Figura 10. Valore k dell'algoritmo KNN (con selezione delle caratteristiche).
Tabella 5. Risultati sperimentali del metodo proposto.

È stato determinato un intervallo per trovare il grado dell'intorno che fornisce il miglior valore di accuratezza nell'algoritmo KNN. L'intervallo specificato copre 1–25. Nella Figura 10 è stato applicato il grafico dell'algoritmo KNN con la selezione delle caratteristiche. Quando il grafico è stato esaminato, quando il valore di vicinato era 1 all'inizio, l'accuratezza dell'addestramento era molto più alta dell'accuratezza del test. Nell'algoritmo KNN creato utilizzando le funzionalità selezionate per correlazione, l'accuratezza del modello è stata determinata pari al 99,15% nel set di dati di addestramento e al 97,35% nel set di dati di test.
Il tasso di errore di parola (WER) o il tasso di errore di carattere viene in genere utilizzato per valutare l'accuratezza dell'estrazione di caratteristiche da un segnale vocale. Si tratta di matrici oggettive utili per un corretto confronto delle tecniche di riconoscimento. Nei nostri studi precedenti [51-56], abbiamo calcolato metriche come la misura F (FM), la precisione e il richiamo. L'FM è la media ponderata che bilancia le misurazioni tra la precisione e i tassi di richiamo. La precisione è il rapporto tra il numero di osservazioni positive previste correttamente e il numero totale di osservazioni positive previste. Il richiamo è il rapporto tra il numero di osservazioni positive previste correttamente e il numero totale di osservazioni nella classe effettiva, come indicato in (9). Le seguenti equazioni possono essere utilizzate per calcolare la precisione media e i tassi di richiamo dei metodi di estrazione delle caratteristiche:

dove TP indica il numero di veri positivi, FP indica il numero di falsi positivi e FN indica il numero di falsi negativi.
L'FM è calcolato utilizzando (10), considerando sia la precisione che il richiamo.

La FM media, il richiamo e la precisione del metodo proposto erano del 98,4%. Il falso rilevamento si è verificato nell'1,6% dei casi a causa del rumore indesiderato dei segnali al microfono. L'intervallo di accuratezza del modello era compreso tra 0 e 1 e i punteggi di stima della metrica hanno raggiunto i loro valori migliori a 1. Una valutazione del nostro metodo e di altri metodi di estrazione delle caratteristiche vocali recentemente pubblicati è presentata nella Tabella 6. Lo stesso numero di funzionalità è stato utilizzato per un confronto equo. Un totale di 325 campioni vocali di ciascun gruppo sono stati analizzati da soggetti con caratteristiche simili. Sono stati esaminati anche gli effetti di diverse lunghezze di frame in base al numero di banchi fifilter nell'MFCC e diverse lunghezze di frame nell'ordine dell'LPC per una maggiore precisione.
Tabella 6. Risultati dell'accuratezza quantitativa dell'estrazione delle caratteristiche vocali.

Come accennato in precedenza, il WER è la misura più comune per le prestazioni di riconoscimento vocale. Viene calcolato confrontando una trascrizione di riferimento con l'output del riconoscimento vocale. Sulla base di questo confronto è possibile calcolare il numero di errori, che tipicamente appartengono a tre categorie: (1) inserimenti quando una parola non è presente nel riferimento nell'output del riconoscimento vocale automatico (ASR), (2) cancellazioni quando manca una parola nell'output ASR e (3) sostituzioni quando una parola viene confusa con un'altra parola. Il WER può essere calcolato come segue.

dove S è il numero di sostituzioni di parole riconosciute in modo errato, D è il numero di delezioni, I è il numero di inserzioni e N è il numero di parole nella trascrizione di riferimento. Il problema principale nel calcolo di questo punteggio è l'allineamento tra le sequenze di due parole. Questo può essere determinato attraverso la programmazione dinamica usando la distanza di Levenshtein [67].
Sulla base della tabella 6, abbiamo eseguito un'analisi statistica per indicare l'accuratezza media dei metodi confrontati utilizzando la metrica di valutazione WER, come illustrato nella figura 11. 78% e 96%. Abbiamo utilizzato i risultati forniti nei documenti pertinenti per il confronto; tuttavia, l'accuratezza di questi valori non è facilmente verificabile perché i codici sorgente e i set di dati di questi metodi non sono pubblicamente disponibili per confermare le loro reali prestazioni. Tuttavia, nel caso di scene standard, è stato dimostrato sperimentalmente che il metodo proposto fornisce un'eccellente precisione di estrazione delle caratteristiche del parlato riducendo il tempo di calcolo, anche quando i dati del parlato sono rumorosi o di bassa qualità.

Figura 11. Risultati quantitativi degli approcci di estrazione delle caratteristiche del segnale vocale utilizzando grafici verticali.
Inoltre, abbiamo valutato i risultati falsi positivi dei metodi selezionati. Come si può osservare dalla Figura 12, l'approccio proposto presentava il minor numero di errori. Inoltre, il metodo di calcolo parallelo altamente efficiente ha ridotto significativamente la selezione delle caratteristiche del segnale sonoro e gli errori di estrazione. L'overfifitting è stato uno dei problemi principali durante la formazione e quasi tutti i modelli di machine learning ne soffrono. Abbiamo cercato di ridurre il rischio di overfifitting utilizzando una tecnica di selezione delle funzionalità che mira invece a classificare l'importanza delle funzionalità esistenti nel set di dati e scartare quelle meno importanti (non vengono create nuove funzionalità).

Figura 12. Risultati visibili degli esperimenti di estrazione delle caratteristiche del segnale vocale falso positivo.
La tabella 7 mostra i risultati delle prestazioni dei metodi utilizzati negli ambienti di riconoscimento vocale in base a diverse proprietà. Il nostro approccio proposto non soffre di rumori di sottofondo indesiderati e non necessari e non è influenzato da voci umane di bassa qualità come voci rauche, voci prodotte con mal di gola o persino suoni di esseri umani con completa perdita della voce. Il nostro metodo mira a superare i problemi di apparecchiature di registrazione inadeguate, rumore di fondo, accenti e dialetti difficili e varie altezze di una voce. In un ambiente normale, i migliori risultati per rilevare ed estrarre accuratamente le sfide delle caratteristiche del parlato sono stati ottenuti utilizzando il metodo proposto con un tempo di elaborazione ridotto.
Tabella 7. Revisione del rilevamento delle caratteristiche vocali e delle prestazioni di estrazione utilizzando varie funzionalità.

I risultati dei metodi di riconoscimento vocale sono stati classificati come potenti, normali o deboli per le sette categorie. Il potente criterio dimostra che l'algoritmo può superare tutti i tipi di sfide. Al contrario, il criterio normale indica che l'algoritmo potrebbe fallire in alcuni casi perché i confini delle parole non sono definiti in anticipo. Infine, il criterio debole suggerisce che l'algoritmo non è affidabile in presenza di rumore di fondo o vibrazioni.
6. Limitazioni
È difficile concludere che i metodi finora proposti non presentino carenze. Il nostro metodo proposto può anche dar luogo a errori dovuti a vari ambienti di rumore. Per superare questo problema, abbiamo mirato a ridurre il numero di funzionalità nel set di dati creando nuove funzionalità da funzionalità esistenti [69]. Poiché l'overfifitting è stato uno dei problemi principali per l'addestramento di diversi modelli durante la competizione, l'arricchimento dei dati di addestramento aggiungendo campioni di dati da diverse risorse potrebbe essere una possibile soluzione per migliorare i risultati. Indipendentemente dai suddetti problemi, i risultati sperimentali hanno rivelato che il nostro metodo era molto robusto ed efficace per le attività di estrazione delle caratteristiche vocali, con una precisione media del 98,4% e FM del 99,5%.
7. Conclusioni
Per i sistemi di riconoscimento vocale è stato proposto un nuovo approccio di calcolo parallelo ad alte prestazioni che utilizza un metodo di apprendimento automatico. I problemi di accelerazione in macchine con risorse di elaborazione limitate possono essere risolti utilizzando sistemi distribuiti. La velocità di calcolo nei sistemi di riconoscimento dei segnali può essere aumentata e le prestazioni delle piattaforme multicore possono essere migliorate creando e utilizzando algoritmi efficienti e rapidi. I risultati dimostrano che il modello proposto riduce il tempo di elaborazione e migliora la precisione di estrazione delle caratteristiche del 98,4% utilizzando efficacemente gli MFCC. È stato osservato che anche le caratteristiche con valori di correlazione bassi estratti dalla selezione delle caratteristiche sono efficaci nel successo del modello. L'analisi statistica è stata eseguita sui dati pre-elaborati e le informazioni significative sono state prodotte dai dati utilizzando l'algoritmo di apprendimento automatico K-nearest neighbors (KNN).
Gli studi futuri si concentreranno sul miglioramento dell'accuratezza del nostro metodo utilizzando approcci di deep learning e sull'ottimizzazione della memoria cache dei processori multicore per rilevare ed estrarre segnali vocali senza una significativa perdita di qualità. Inoltre, intendiamo costruire un modello di analisi spettrale basato sull'elaborazione parallela con solide prestazioni di analisi che consentiranno la creazione di dispositivi embedded con basse risorse computazionali utilizzando set di dati vocali Taris [70] nell'ambiente 3D CNN e 3D U-Net [71– 75]
Riferimenti
1. Meng, YJ; Liu, WJ; Zhang, RZ; Du, HS Speech Feature Parametro Estrazione e Riconoscimento Basato su Interpolazione. Appl. Mecc. Madre. 2014, 602–605, 2118–2123. [CrossRef] 2. Musaev, M.; Rakhimov, M. Addestramento accelerato per reti neurali convoluzionali. In Proceedings of the 2020 International Conference on Information Science and Communications Technologies (ICISCT), Tashkent, Uzbekistan, 4–6 novembre 2020; pp. 1–5. [CrossRef] 3. Sì, F.; Yang, J. Un modello di rete neurale profonda per l'identificazione degli oratori. Appl. Sci. 2021, 11, 3603. [CrossRef] 4. Musaev, M.; Rakhimov, M. Un metodo per mappare un blocco di memoria principale nella cache nell'elaborazione parallela del segnale vocale. In Proceedings of the 2019 International Conference on Information Science and Communications Technologies (ICISCT), Karachi, Pakistan, 9–10 marzo 2019; pp. 1–4. [CrossRef] 5. Jiang, N.; Liu, T. Un algoritmo di segmentazione e clustering vocale migliorato basato su SOM e k-means. Matematica. Problema Ing. 2020, 2020, 3608286. [CrossRef] 6. Hu, W.; Yang, Z.; Chen, C.; Sole, B.; Xie, Q. Un approccio di segmentazione delle vibrazioni per il sistema multi-azione della torretta a controllo numerico. Elaborazione video dell'immagine del segnale. 2021, 16, 489–496. [CrossRef]
7. Popescu, TD; Aiordachioaie, D. Rilevamento dei guasti dei cuscinetti volventi utilizzando la segmentazione ottimale dei segnali vibranti. Mecc. Sist. Processo di segnale. 2019, 116, 370–391. [CrossRef] 8. Shihab, MSH; Aditya, S.; Setu, JH; Imtiaz-Ud-Din, KM; Efat, MIA Una tecnica ibrida di estrazione delle caratteristiche GRU-CNN per l'identificazione degli oratori. In Proceedings of the 2020 23rd International Conference on Computer and Information Technology (ICCIT), Dhaka, Bangladesh, 19–21 dicembre 2020; pp. 1–6. [CrossRef] 9. Korkmaz, O.; Atasoy, A. Riconoscimento delle emozioni dal segnale vocale utilizzando coefficienti cepstrali a frequenza mel. In Proceedings of the 9th International Conference on Electrical and Electronics Engineering (ELECO), Bursa, Turchia, 26–28 novembre 2015; pp. 1254–1257. 10. Ayvaz, U.; Gürüler, H.; Khan, F.; Ahmed, N.; Whangbo, T.; Abdusalomov, A. Riconoscimento automatico dell'altoparlante utilizzando i coefficienti cepstrali di frequenza Mel attraverso l'apprendimento automatico. Calcolo CMC. Madre. Continua. 2022, 71, 5511–5521. 11. Al Qaderi, M.; Lahamer, E.; Rad, A. Un sistema di identificazione degli altoparlanti a due livelli tramite fusione di classificatori eterogenei e cooperazione di caratteristiche complementari. Sensori 2021, 21, 5097. [CrossRef] 12. Batur Dinler, Ö.; Aydin, N. Un set di parametri di funzionalità ottimale basato su reti neurali ricorrenti recidivanti recintate per il rilevamento di segmenti vocali. Appl. Sci. 2020, 10, 1273. [CrossRef] 13. Kim, H.; Shin, JW Dual-Mic Speech Enhancement basato su TF-GSC con soppressione delle perdite e recupero del segnale. Appl. Sci. 2021, 11, 2816. [CrossRef] 14. Lee, S.-J.; Kwon, H.-Y. Una strategia di pre-elaborazione per il denoising dei dati vocali basata sul rilevamento del segmento vocale. Appl. Sci. 2020, 10, 7385. [CrossRef] 15. Rusnac, A.-L.; Grigore, O. Architetture della CNN e metodi di estrazione delle caratteristiche per il riconoscimento vocale immaginario EEG. Sensori 2022, 22, 4679. [CrossRef] [PubMed] 16. Wafa, R.; Khan, QM; Malik, F.; Abdusalomov, AB; Cho, Yi; Odarchenko, R. L'impatto della metodologia agile sul successo del progetto, con un ruolo di moderazione dell'adattamento del lavoro della persona nel settore IT del Pakistan. Appl. Sci. 2022, 12, 10698. [CrossRef] 17. Aggarwal, A.; Srivastava, A.; Agarval, A.; Chahal, N.; Singh, D.; Alnuaim, AA; Alhadlaq, A.; Lee, H.-N. Estrazione di funzionalità a due vie per il riconoscimento delle emozioni vocali utilizzando il deep learning. Sensori 2022, 22, 2378. [CrossRef] [PubMed] 18. Marini, M.; Vanello, N.; Fanucci, L. Ottimizzazione dei parametri di estrazione delle caratteristiche dipendenti dal parlante per migliorare le prestazioni di riconoscimento vocale automatico per le persone con disartria. Sensori 2021, 21, 6460. [CrossRef] 19. Tiwari, S.; Giain, A.; Sharma, AK; Almustafa, KM Phonocardiogram Signal Based Multi-Class Cardiac Diagnostic Support Syste. Accesso IEEE 2021, 9, 110710–110722. [CrossRef] 20. Mohtaj, S.; Schmitt, V.; Möller, S. Un modello basato sull'estrazione di caratteristiche per l'identificazione dell'incitamento all'odio. arXiv 2022, arXiv: 2201.04227. 21. Kuldoshbay, A.; Abdusalomov, A.; Muchiddinov, M.; Baratov, N.; Makhmudov, F.; Cho, YI Miglioramento del metodo di classificazione automatica delle immagini ecografiche utilizzato sulla CNN. Int. J. Wavelets Multirisoluzione Inf. Processi. 2022, 20, 2150054. 22. Passricha, V.; Aggarwal, RK Un ibrido di deep CNN e LSTM bidirezionale per il riconoscimento vocale automatico. J. Intell. Sist. 2020, 29, 1261–1274. [CrossRef] 23. Mukhamadiyev, A.; Khujayarov, I.; Djuraev, O.; Cho, J. Metodo di riconoscimento vocale automatico basato su approcci di apprendimento profondo per la lingua uzbeka. Sensori 2022, 22, 3683. [CrossRef] [PubMed] 24. Li, F.; Liu, M.; Zhao, Y.; Kong, L.; Dong, L.; Liu, X.; Hui, M. Estrazione delle caratteristiche e classificazione del suono cardiaco utilizzando reti neurali convoluzionali 1D. EURASIP J. Adv. Processo di segnale. 2019, 2019, 59. [CrossRef] 25. Chang, L.-C.; Hung, J.-W. Uno studio preliminare sull'estrazione di caratteristiche vocali robuste basato sulla massimizzazione della probabilità di stati nei modelli acustici profondi. Appl. Sist. Innov. 2022, 5, 71. [CrossRef] 26. Ramírez, J.; Gorriz, JM; Segura, Rilevamento dell'attività vocale JC. Fondamenti e robustezza del sistema di riconoscimento vocale. In Robusto riconoscimento vocale e comprensione; Grimm, M., Kroschel, K., Eds.; I-TECH Education and Publishing: Londra, Regno Unito, 2007; pp. 1–22. 27. Oh, metodo di estrazione delle caratteristiche vocali robuste basato su DNN e rimozione del rumore del segnale utilizzando il filtro LMS di previsione media migliorato per il riconoscimento vocale. J.Converg. Inf. Tecnol. 2021, 11, 1–6. [CrossRef] 28. Abbaschian, BJ; Sierra Sosa, D.; Elmaghraby, A. Tecniche di apprendimento profondo per il riconoscimento delle emozioni vocali, dai database ai modelli. Sensori 2021, 21, 1249. [CrossRef] 29. Rakhimov, M.; Mamadjanov, D.; Mukhiddinov, A. Un approccio parallelo ad alte prestazioni all'elaborazione delle immagini nel calcolo distribuito. In Proceedings of the 2020 IEEE 14th International Conference on Application of Information and Communication Technologies (AICT), Uzbekistan, Tashkent, 7–9 ottobre 2020; pp. 1–5. [CrossRef] 30. Abdusalomov, A.; Muchiddinov, M.; Djuraev, O.; Khamdamov, U.; Whangbo, TK Estrazione automatica di oggetti salienti basata su soglia adattiva localmente per generare grafica tattile. Appl. Sci. 2020, 10, 3350. [CrossRef] 31. Abdusalomov, A.; Whangbo, TK Un miglioramento per il metodo di riconoscimento in primo piano utilizzando la tecnica di rimozione delle ombre per ambienti interni. Int. J. Wavelets Multirisoluzione Inf. Processi. 2017, 15, 1750039. [CrossRef] 32. Abdusalomov, A.; Whangbo, TK Rilevamento e rimozione delle ombre degli oggetti in movimento utilizzando la geometria e le informazioni sul colore per i flussi video interni. Appl. Sci. 2019, 9, 5165. [CrossRef] 33. Mery, D. Computer Vision for X-ray Testing; Springer International Publishing: Cham, Svizzera, 2015; P. 271, ISBN 978-3319207469. 34. Mark, S. Le immagini vocali ricalibrano i confini della percezione del parlato. Alle dieci. Percezione. Psicofisica. 2016, 78, 1496–1511. [CrossRef] 35. Mudgal, E.; Mukuntharaj, S.; Modak, MU; Rao, YS Riconoscimento vocale in tempo reale basato su modello utilizzando filtri digitali su DSP-TMS320F28335. In Proceedings of the 2018 Fourth International Conference on Computing Communication Control and Automation (ICCUBEA), Pune, India, 16–18 agosto 2018; pp. 1–6. [CrossRef]






