Table of Contents
Introduction aux filtres RII dans l'amélioration de la parole
Les filtres Infinite Impulse Response (IIR) sont une pierre angulaire du traitement numérique moderne du signal (DSP), en particulier dans le traitement de la parole et du signal vocal. Leur capacité inhérente à une sélectivité de fréquence forte avec une faible empreinte calculatrice les rend idéales pour les applications en temps réel où la latence et la puissance de traitement sont limitées. Contrairement aux filtres Finite Impulse Response (FIR), qui reposent uniquement sur des entrées passées, les filtres IIR intègrent des retours d'information sur les sorties précédentes, créant une réponse impulsionnelle qui se poursuit théoriquement indéfiniment.
La demande de communication vocale plus claire continue de croître à mesure que la téléconférence, les assistants vocaux et les appels mobiles deviennent omniprésents. Les filtres IIR répondent aux principaux défis tels que la réduction du bruit ambiant, l'annulation des échos et la péréquation adaptative. Cet article fournit une exploration autorisée de la théorie des filtres IIR, des méthodologies de conception, des applications pratiques dans l'amélioration de la parole, et les ingénieurs de compromis doivent naviguer pour déployer efficacement ces filtres.
Quels sont les filtres IIR?
Un filtre IIR est un type de filtre numérique caractérisé par sa réponse d'impulsion infinie, ce qui signifie que sa sortie dépend à la fois des échantillons d'entrée actuels et passés ainsi que des échantillons de sortie passés.
[[n] = b0[x[n] + b1x[n-1] + ... + bMx[n-M] – a1[y[n-1] – a[2y[n-2] – ... – a]N]y[n-N]
Ici, y[n] est l'échantillon de sortie, x[n] est l'échantillon d'entrée, les coefficients bi représentent le chemin de flux vers l'avant (zéros), et les coefficients ai représentent le chemin de retour (pôles). La nature récursive de cette équation donne au filtre sa réponse infinie. Dans le domaine z, la fonction de transfert H(z) est une fonction rationnelle:
H(z) = (b[0[ + b1[z[–1 + ... + bM[z[–M[) / (1 + a]1[]z[–1] + ... + a]N[]z[[N])
Les pôles (les racines du dénominateur) doivent se trouver à l'intérieur du cercle de l'unité pour que le filtre soit stable. Il s'agit d'une contrainte critique de conception qui distingue IIR des filtres FIR. En raison de la rétroaction, les filtres IIR peuvent obtenir une réponse de fréquence donnée avec beaucoup moins de coefficients qu'un filtre FIR équivalent – souvent 5-10 fois moins – ce qui les rend efficaces par calcul pour le matériel de traitement vocal encombré de ressources.
Caractéristiques clés
- Structure récursive:[ Utilise les chemins de flux et de rétroaction, permettant des transitions pointues.
- Réponse de phase complexe:[ Phase typiquement non linéaire, qui peut introduire des variations de retard de groupe qui affectent les signaux transitoires comme la parole.
- Sensibilité de stabilité:[ Nécessite un placement prudent des pôles; les erreurs de quantification peuvent pousser des pôles à l'extérieur du cercle de l'unité.
- Imulation analogique:[ Peut simuler des filtres analogiques classiques (Butterworth, Chebyshev, Elliptic) avec une grande fidélité.
Demandes d'amélioration de la parole
L'amélioration de la parole vise à améliorer l'intelligibilité et la qualité perceptuelle des signaux vocaux dégradés par le bruit, la réverbération ou les distorsions de canaux.
Contexte Réduction du bruit
L'une des utilisations les plus courantes des filtres IIR pour améliorer la parole est la suppression du bruit de fond stationnaire, comme le bruit de ventilateur, le frottement moteur ou le drone de climatisation. En concevant un filtre IIR à passage élevé ou à bandstop qui cible la gamme de fréquences du bruit, le signal de parole (qui occupe généralement 300-3400 Hz pour la téléphonie) peut être relativement préservé. Les filtres IIR adaptés sont particulièrement efficaces pour éliminer les hums à une fréquence unique (par exemple, interférence de la ligne de puissance de 50/60 Hz) sans déformer le spectre de la parole.
Annulation d'écho adaptatif
Dans les systèmes de télécommunication et de conférence, l'écho acoustique des haut-parleurs capté par les microphones dégrade la qualité de la parole. Les filtres IIR adaptatifs modélisent le chemin de l'écho en utilisant des structures récursives pour estimer l'écho et l'annuler. Les algorithmes ][Les moindres carrés récursifs] sont souvent adaptés aux topologies IIR, bien que la surveillance de la stabilité soit essentielle.
Signal de parole Pré-Émphasis et De-Emphasis
Un filtre passe-haut de premier ordre de l'IRI stimule les composants à haute fréquence pour améliorer le rapport signal-bruit pour le traitement ultérieur (p. ex., codage prédictif linéaire). Le filtre de désemphase correspondant au récepteur restaure l'inclinaison spectrale d'origine. Comme les filtres de l'IRI peuvent implémenter la caractéristique de pré-emphase avec un seul pôle et un seul zéro, ils sont extrêmement efficaces.
Détection d'activités vocales (VAD)
De nombreux systèmes d'amélioration de la parole reposent sur une VAD précise pour mettre à jour les estimations du bruit uniquement pendant le silence. Les filtres IIR Bandpass peuvent isoler les bandes de fréquences où l'énergie de la parole est concentrée (p. ex. 100-4000 Hz) et calculer le rapport d'énergie. La nature récursive lisse les mesures d'énergie, réduisant les faux déclencheurs dus au bruit transitoire.
Techniques de conception de filtre IIR pour la parole
Les ingénieurs ont plusieurs prototypes de filtres analogiques classiques qui se mapent directement aux filtres numériques IIR par transformation bilinéaire ou invariance d'impulsion. Le choix dépend du compromis entre l'ondulation de la bande passante, l'atténuation de la bande stop et la linéarité de phase.
Filtres Butterworth
La réponse de Butterworth est maximalement plate dans la bande passante et monotonique dans la bande passante et le bouchon. Pour améliorer la parole, un filtre à passe-haut de deuxième ordre de Butterworth (p. ex., coupe 80 Hz) élimine le frottement à basse fréquence sans introduire d'ondulation qui colorerait la voix. La pénalité est un renversement relativement progressif, exigeant des commandes plus élevées pour la séparation du bruit aigu, mais cela est acceptable lorsque le coût de calcul est modéré.
Filtres Chebyshev (type I)
Dans les tâches de réduction du bruit où un léger ondulateur (< 1 dB) dans la bande de parole est tolérable, un filtre à passe-bas ou à passe-bande Chebyshev peut obtenir une atténuation plus nette du bruit hors bande avec moins de pôles qu'un Butterworth. Par exemple, un filtre de quatrième ordre Chebyshev pourrait remplacer un Butterworth de huitième ordre, en économisant des coefficients. Des valeurs standard comme 0,5 dB sont courantes dans les IC de traitement de la voix.
Filtres elliptiques (Cauer)
Les filtres elliptiques fournissent le plus fort écoulement pour un ordre donné en permettant l'ondulation en bande passante et en bande stop. Ils sont utilisés lorsque la séparation de fréquence entre la parole et le bruit est étroite, comme l'élimination d'une interférence en bande étroite tout en conservant des harmoniques de la parole adjacentes. Cependant, la distorsion de phase est sévère et une conception soignée est nécessaire pour éviter le pré-ringing dans les segments de parole transitoires.
Filtres à besel
Pour les applications de la parole où la préservation de la forme d'onde est importante, comme dans l'analyse vocale audio ou médicale de haute fidélité, les filtres Bessel IIR présentent une dispersion minimale. L'échange est un roll‐off plus lent, ce qui signifie que plus d'étapes sont nécessaires pour la même performance de bande d'arrêt.
Filtres IIR adaptatifs pour environnements dynamiques
Les environnements acoustiques du monde réel changent constamment : un ventilateur peut changer de vitesse, un profil sonore de route peut changer, ou une personne peut se déplacer par rapport au microphone.Les filtres IIR adaptatifs peuvent suivre ces changements en mettant à jour leurs coefficients en fonction d'un signal d'erreur.Le filtre IIR LMS adaptatif utilise une méthode de descente en gradient pour minimiser l'erreur carrée moyenne entre le résultat souhaité (parler propre) et la sortie du filtre.
Une autre architecture commune de l'IRI est le Notch-Based Adaptive Noise Canceller. Il utilise un filtre d'IRI de deuxième ordre avec une fréquence centrale réglable. Le filtre est mis à jour à l'aide d'un algorithme de suivi de fréquence (p. ex., le traqueur de fréquence basé sur RLS) pour verrouiller sur le composant sonore dominant, comme une machine tournante ou un hum électrique.
Stabilité et considérations de phase
Le plus grand défi dans l'utilisation des filtres IIR pour le traitement de la parole est d'assurer la stabilité. Parce que la sortie est remise en marche, toute erreur de quantification ou de tronquage de coefficient peut déplacer des pôles en dehors du cercle de l'unité, provoquant une oscillation.
- Appliquer une échelle de coefficient pour éviter le débordement.
- Utiliser des structures en treillis ou en forme couplée qui maintiennent les positions des pôles pendant l'adaptation.
- Vérifier périodiquement l'emplacement des pôles et les stabiliser en resserrant les rayons des pôles en dessous de 1,0.
La perception de la parole est sensible à la linéarité de la phase, en particulier pour les transitoires comme les plosifs (p, t, k). Les filtres IIR introduisent un déplacement de phase non linéaire qui peut réduire les pics transitoires, réduisant la clarté. Dans les applications où la phase compte (p. ex., les appareils auditifs binauraux ou le mélange de musique), les ingénieurs peuvent utiliser des filtres de compensation de phase tout passage pour linéraliser la réponse globale, ou ils peuvent opter pour un filtre FIR malgré le coût de calcul plus élevé.
Comparaison des filtres RIP par rapport aux filtres RIP pour la parole
La décision d'utiliser le RII ou le RIP dépend souvent des contraintes d'application. Le tableau ci-dessous résume les principales différences dans le contexte du traitement des signaux vocaux :
| Property | IIR | FIR |
|---|---|---|
| Computational efficiency | Very high (few coefficients) | Low (many coefficients for sharp transitions) |
| Phase linearity | Nonlinear (requires external compensation) | Linear possible (symmetric coefficients) |
| Stability | Conditional (poles must be inside unit circle) | Inherently stable (no feedback) |
| Quantization sensitivity | High (coefficient rounding can destabilize) | Low (no feedback path to amplify errors) |
| Memory usage | Low | Higher (larger buffer for past inputs) |
Dans la pratique, de nombreux systèmes d'amélioration de la parole utilisent une approche hybride : filtres IIR pour la formation initiale du bruit (p. ex., pré-accentuation et filtrage d'encoche) et filtres FIR pour l'étape finale d'annulation ou de dé-réverbération de l'écho adaptative où la fidélité de phase est importante.
Mise en œuvre pratique dans les systèmes en temps réel
Les implémentations en points fixes sont courantes dans les appareils auditifs et les bandes de base des téléphones mobiles.Les ingénieurs utilisent des structures de formulaire I direct pour réduire le risque de débordement, ou la forme II directe est déposée[ pour minimiser la mémoire d'état.
Un exemple notable est le [Code de langage], où les banques de filtres d'analyse (IRI en polyphase) divisent le signal en sous-bandes, chacune étant traitée avec une simple porte de bruit de l'IRI. Un autre est le [Dispositifs d'analyse ADAU1787[module d'annulation de l'écho][[module d'annulation de l'écho][module][[module][module] d'analyse de l'écho, qui permet de modéliser le chemin d'écho avec seulement 16 coefficients, et d'améliorer la perte de retour d'écho de 40 dB.
Pour les développeurs travaillant avec des bibliothèques populaires DSP, la bibliothèque ARM CMSIS‐DSP et SciPy de traitement des signaux fournissent des routines robustes de conception et d'implémentation de filtres IIR qui peuvent être prototypes sur un PC puis portés sur du matériel.
Recherche actuelle et orientations futures
Les recherches en cours dans les filtres IIR pour la parole portent sur deux domaines principaux : systèmes d'adaptation profondément intégrés[ et des systèmes de filtrage assistés par apprentissage profond[.Les réseaux neuronaux sont utilisés pour prédire des coefficients de filtrage IIR optimaux pour un environnement sonore donné, combinant l'efficacité du traitement IIR avec l'adaptabilité de l'apprentissage machine.Des chercheurs d'institutions comme Les laboratoires audio internationaux Erlangen explorent le faisceau de formage IIR pour les haut-parleurs intelligents, où les filtres orientent la réponse du réseau de microphone avec un minimum de retard.
Une autre tendance émergente est l'utilisation de filtres à ordre fractionnel , qui offrent un contrôle encore plus précis sur la pente de roulis, utiles pour modéliser la fonction de transfert acoustique des pièces.
Conclusion
Leur efficacité inégalée dans la réalisation d'une sélectivité de fréquence avec des coefficients minimaux en fait le premier choix pour la réduction du bruit en temps réel, l'annulation des échos et la mise au point de spectres dans les appareils alimentés par batterie. Bien que les défis tels que la stabilité et la distorsion de phase nécessitent une conception et une surveillance minutieuses, les algorithmes modernes d'adaptation et les structures robustes des filtres ont largement atténué ces problèmes.