Sans compression, une seule chanson de qualité CD consommerait plus de 30 Mo, rendant le streaming et le stockage portable impossible. Le génie des codecs modernes réside non seulement dans l'efficacité mathématique, mais dans l'exploitation des limites de l'audition humaine. Ce champ, psychoacoustique, fournit la feuille de route perceptuelle qui permet aux ingénieurs de jeter de grandes quantités de données sonores sans compromettre l'expérience de l'auditeur.

La relation entre psychoacoustique et compression audio est symbiotique. À mesure que notre compréhension du système auditif s'approfondit, les algorithmes de compression deviennent plus efficaces. Ce raffinement continu a façonné le paysage des médias numériques, des premiers jours du MP3 aux codes de streaming sophistiqués utilisés aujourd'hui. Cet article explore les principes fondamentaux de la psychoacoustique, leur mise en œuvre dans le codage perceptuel, l'évolution des codecs, et l'avenir de la science auditive dans le traitement des signaux.

Les fondements de la perception de l'audit humain

Pour comprendre pourquoi nous pouvons jeter jusqu'à 90% des données dans un fichier audio sans que l'auditeur moyen ne s'en rende compte, il faut d'abord comprendre les contraintes biologiques et psychologiques de l'oreille humaine. L'oreille n'est pas un microphone parfait; c'est un organe non linéaire, dépendant de la fréquence et sensible au contexte.

L'anatomie de l'ouïe et la membrane basilaire

L'oreille externe recueille le son et le canalise vers le tympan. Les osicules de l'oreille moyenne amplifient les vibrations mécaniques et les transmettent à la cochlée de l'oreille interne. À l'intérieur de la cochlée, la membrane basilaire agit comme un analyseur de spectre en temps réel. Une onde itinérante se déplace le long de la membrane, et sa position de pointe dépend de la fréquence du son entrant. Les hautes fréquences provoquent un déplacement maximum près de la base, tandis que les basses fréquences atteignent un pic près de l'apex. La distribution des cellules capillaires le long de cette membrane dicte notre résolution de fréquence.

Bandes critiques et échelle d'écorce

Ces filtres, appelés bandes critiques , définissent notre capacité à résoudre différentes fréquences. La largeur de ces bandes augmente avec la fréquence. Cela signifie que nous pouvons distinguer facilement entre 100 Hz et 200 Hz, mais nous avons du mal à distinguer entre 4000 Hz et 4100 Hz. Cette résolution de fréquence non linéaire est formalisée dans la échelle de bark[, nommée d'après Heinrich Barkhausen. L'échelle de bark cartographie la fréquence physique (Hz) à la fréquence perceptuelle (Bark). Un bark correspond à une bande critique. Cette échelle est fondamentale pour le codage audio perceptuel parce qu'elle dicte la façon dont le masque se propage à travers le spectre.

Le seuil absolu de l'audition

Une autre limite critique est le seuil absolu d'audition (ATH). Nous n'entendons pas toutes les fréquences aussi bien. Les humains sont les plus sensibles aux sons dans la gamme moyenne, à peu près entre 2 kHz et 5 kHz, où résident les consonnes de la parole et de nombreux transitoires musicaux. La sensibilité descend fortement en dessous de 500 Hz et au-dessus de 8 kHz. L'ATH est souvent visualisé en utilisant des contours d'égale luminosité (courbes Fletcher-Munson), qui montrent le niveau de pression sonore nécessaire pour qu'une tonalité soit perçue comme aussi forte à différentes fréquences. Les codes perceptuels exploitent directement l'ATH : toute énergie spectrale inférieure à l'ATH est jugée inaudible et peut être éliminée ou quantifiée avec une précision extrêmement faible.

Phénomènes psychoacoustiques de base exploités pour la compression

Alors que l'ATH définit les limites globales de l'audition, masking[ définit les limites locales et dynamiques. Le masquage se produit lorsqu'un son (le masqueur) rend un autre son (le masque) inaudible. C'est l'outil le plus puissant dans le codage audio perceptuel.

Masque simultané (fréquentiel)

Un ton fort à une fréquence augmente le seuil auditif des fréquences voisines. La forme de cette courbe de masquage est asymétrique : elle s'étend plus vers des fréquences plus élevées (à la hausse de la masquage) que les fréquences inférieures. Si un tambour frappe à 100 Hz, il peut masquer un cymbale à 8000 Hz, mais le cymbale ne masquera pas facilement le tambour de masquage. Il y a deux types principaux de masqueurs :

  • Les signaux à bande étroite (comme un ton pur ou une note de flûte) ont un motif de masque bien défini.
  • Les signaux à large bande (comme le son du vent ou un tambour de piège) ont un motif de masque flatteur mais peuvent masquer sur une plus grande gamme de fréquences.

Les encodeurs analysent le signal d'entrée pour identifier les composants tonaux et sonores et calculer le seuil de masquage combiné pour chaque bande critique. Les composants de signal qui tombent sous ce seuil sont des candidats potentiels pour la réduction des bits.

Masquage temporel

L'oreille demande du temps pour traiter les sons, ce qui crée une fenêtre pour masquer les événements qui ne sont pas simultanés. Il y a deux types de masque temporel:

Pré-masquage (masquage en arrière)

C'est le phénomène le plus surprenant : un son fort peut masquer un son plus silencieux qui se produit avant il. C'est possible parce que le cerveau prend jusqu'à 20 millisecondes pour enregistrer un son plus calme. Si une forte explosion arrive avant que le cerveau ait fini de traiter le son calme, le son calme est écrasé. C'est la fenêtre la plus courte de masquer (généralement 5-20 ms) mais il est essentiel pour gérer les transitoires d'attaque.

Après le masquage (Masquage vers l'avant)

C'est le phénomène le plus intuitif. Après un arrêt sonore fort, l'oreille reste « morte » pendant une courte période (50-200 ms). Les cellules capillaires de la membrane basilaire prennent le temps d'arrêter de vibrer et de récupérer leur sensibilité. Pendant cette période, les sons silencieux qui suivent le son fort sont masqués. Ceci est exploité par les encodeurs lorsqu'ils traitent des sons percutants. Un coup de tambour masquera la queue de réverbération ou une note suivante, permettant à l'encodeur de dépenser moins de bits sur les conséquences immédiates.

Mise en œuvre des principes psychoacoustiques dans les Codecs

La traduction de la théorie psychoacoustique en algorithme de compression pratique est un exploit d'ingénierie complexe. Il faut transformer l'audio en un domaine où les seuils de masquage peuvent être calculés et appliqués. C'est le domaine du codeur audio perceptuel.

Le modèle psychoacoustique en action

Tous les codecs perceptuels modernes suivent une architecture de haut niveau similaire. Le signal d'entrée PCM (Pulse-Code Modulation) est d'abord fenêtré et transformé en domaine de fréquence en utilisant un [MDCT] ou une banque de filtres hybrides. L'encodeur exécute ensuite un modèle psychoacoustique en parallèle.

  1. Analyse spécifique:[ Le signal est analysé à l'aide d'une transformée de Fourier rapide (FFT) pour obtenir une résolution haute fréquence.
  2. Cartographie des bandes critiques: Les lignes spectrales sont regroupées en bandes critiques basées sur l'échelle Bark.
  3. Fonctionnement du seuil de masquage :[ Le modèle identifie les masqueurs tonaux et sonores et calcule leurs courbes de masquage individuelles. Ces courbes sont résumées pour créer un seuil global de masquage pour chaque bande critique. Ce seuil représente l'énergie sonore maximale admissible de quantification qui restera inaudible.
  4. Ratio de signal à la tâche (SMR):[ L'encodeur calcule le SMR pour chaque bande. Un SMR élevé signifie que le signal est fort par rapport au seuil de masquage, laissant de la place pour une quantification lourde. Un SMR faible signifie que le signal est proche du seuil et doit être codé avec soin.

Allocation de bits et formation du bruit

Sur la base du SMR, l'encodeur alloue un budget de bits limité dans le spectre de fréquence. Les bandes avec un SMR élevé reçoivent moins de bits (quantisation grossière), tandis que les bandes avec un faible SMR reçoivent plus de bits (quantisation fine). Ce processus est appelé nois de formation. En formant le bruit de quantification pour s'adapter sous le seuil de masquage, l'encodeur rend le bruit inaudible pour l'auditeur.

Le but d'un encodeur perceptuel n'est pas de minimiser le bruit total de quantification, mais de minimiser le bruit sonore

]

][FLT:]

]

[FLT:]

][FLT:][FLT:][FLT:][FLT:][FLT:]][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:]][FLT:][F][FLT

Codecs perceptifs standards pour l'industrie

Différents codes ont mis en œuvre ces principes avec des niveaux de sophistication variables.

MPEG-1 couche audio III (MP3)

Le MP3 a été le premier codec perceptuel à succès. Il a utilisé une banque de filtres hybrides (filtre quadrimétrique polyphasé suivi d'un MDTC) et un modèle psychoacoustique de base. Bien que révolutionnaire pour son temps, sa résolution de fréquence était limitée, et sa résolution temporelle était faible. Cela a conduit au son «wishy» célèbre sur les cymbales et «pré-écho» sur les attaques transitoires à faibles débits (128 kbps et moins).

Codage audio avancé (AAC)

AAC a été conçu comme le successeur de MP3 et est le fondement de la diffusion moderne (Apple Music, YouTube). Il offre des performances supérieures grâce à plusieurs innovations clés:

  • Pure MDCT: AAC utilise un MDCT pur avec une fenêtre plus grande (1024 échantillons), offrant une meilleure résolution de fréquence pour les signaux fixes.
  • Cassage de la fenêtre:[ AAC peut basculer dynamiquement vers une fenêtre courte (128 échantillons) pour empêcher l'écho pré-écho sur les signaux transitoires, offrant une fidélité d'attaque beaucoup plus grande que MP3.
  • Temporal Noise Shaping (TNS): TNS travaille dans le domaine temporel pour contrôler la propagation temporelle du bruit de quantification, en abordant directement le problème pré-écho.
  • Codage stéréo amélioré: L'AAC permet le codage stéréo en articulation pour exploiter le masquage intercanaux. Explorer les spécifications techniques de l'AAC.

Autres codescs à noter

Sony ATRAC (Codage acoustique de transformation adaptive) utilisé pour MiniDiscs, et Dolby Digital (AC-3) utilisé au cinéma, étaient également des premiers adoptants de codage perceptuel, chacun avec des modèles psychoacoustiques uniques adaptés à leurs cas d'utilisation spécifiques (faible puissance ou multicanal, respectivement).

Avantages et limitations perceptives

Les avantages de la compression psychoacoustique sont évidents : des ordres de réduction de la taille des données permettant la diffusion en continu, des lecteurs de musique portables et de la radio numérique.

Transparence et efficacité

Le saint graal du codage perceptuel est transparence, le point où l'auditeur ne peut pas distinguer le signal comprimé de l'original. Ceci dépend fortement du débit et du matériel d'écoute. Pour les passages simples de la voix, la transparence peut être atteinte à 64 kbps avec des codecs modernes. Pour la musique complexe et chaotique (par exemple, les climaxs orchestraux, le heavy metal), la transparence peut nécessiter 192 kbps ou plus. Le «coup de mort» de l'audio perceptuel reste un domaine d'étude actif, car les auditeurs deviennent plus critiques avec les équipements de haute fidélité.

Artéfacts communs

Quand un codec est poussé au-delà de ses limites, le modèle psychoacoustique échoue, et des artefacts audibles apparaissent.

  • Pré-Echo: Cause de l'échec du masquage temporel. Le bruit de quantification se propage dans le temps avant une attaque aiguë, créant un son «warbling» ou «smaked».
  • Spectral Holes: Les hautes fréquences sont complètement supprimées parce que l'encodeur les juge masquées, ce qui entraîne un son terne, "fermé".
  • Birdie Artifacts: Le bruit de la tonalité, souvent métallique ou pare-boule, apparaît là où l'encodeur a mal quantifié une ligne spectrale spécifique.
  • Parcourblage:[ Imagerie stéréo instable ou "gage" du son en raison de paramètres stéréo articulaires mal codés.

Tests d'écoute et subjectivité

La norme de l'industrie est la méthode MUSHRA (Multi Stimulus test with Hidden Reference and Anchor), normalisée par l'UIT (UIT-R BS.1534). Les auditeurs sont présentés avec une référence et plusieurs versions codées, y compris une ancre de faible qualité. Ils évaluent la «qualité audio de base» de chacun sur une échelle de 0 à 100. Ce test rigoureux révèle que, bien que les codecs se soient considérablement améliorés, aucun codec n'est universellement transparent à des débits bas pour tous les auditeurs et tout le contenu. ]Lire la suite de la norme MUSHRA.

L'évolution du codage audio perceptuel

La recherche de débits inférieurs et d'une transparence plus élevée ne s'est pas arrêtée avec l'AAC. Les chercheurs ont trouvé des moyens d'augmenter le codeur perceptuel de base avec des outils paramétriques qui vont au-delà du codage direct des signaux.

Réplication de bandes spectrales et de bandes à haut rendement (ACA-HE)

HE-AAC (aacPlus) introduit Spectral Band Replication (SBR). Au lieu de coder directement les hautes fréquences (p. ex., au-dessus de 8 kHz), l'encodeur guide le décodeur sur la façon de les reconstruire à partir des basses fréquences codées. Cela exploite la sensibilité décroissante de l'oreille aux hautes fréquences et au pas. Le résultat est significativement amélioré à des débits très bas (32-48 kbps), ce qui en fait la norme pour la radio Internet et la diffusion à bande basse.

Opus et xHE-AAC : L'état moderne de l'art

Opus est un codec ouvert et libre de redevances qui combine un codec vocal (SILK) et un codec audio général (CELT). Il bascule dynamiquement entre eux en fonction du signal d'entrée. Opus est largement loué pour sa qualité constante sur une large gamme de bits (6 kbps à 510 kbps) et sa faible latence, ce qui le rend idéal pour la diffusion VoIP et en temps réel.

xHE-AAC étend HE-AAC avec Enhanced Spectral Band Replication (eSBR) et un noyau de codage audio et de parole unifié (USAC). Il peut fournir une qualité remarquablement faible (jusqu'à 12 kbps) et gère sans heurts le contenu mixte (speech over music). Il est le codec derrière MPEG-H Audio et est utilisé pour la diffusion sur des plateformes comme Netflix.

L'élévation des codescs appris par machine

La dernière frontière en matière de compression audio est l'application de l'apprentissage profond. Les réseaux neuronaux sont maintenant utilisés pour apprendre les schémas de compression de bout en bout, apprenant efficacement leur propre «modèle psychoacoustique» à partir de données.

  • Modèles de bout en bout:[ Codecs comme Google SoundStream et Meta EnCodec utilisent des réseaux neuronaux pour coder l'audio directement dans un espace latent. Un modèle génératif (comme un transformateur ou GAN) reconstruise ensuite l'audio.
  • Cues perceptives apprises:[ Ces modèles sont souvent formés à l'aide d'une combinaison de fonctions de perte standard (p. ex. MSE) et d'une perte discriminatoire qui tente de distinguer entre audio original et codé. Cela oblige implicitement le modèle à préserver les caractéristiques les plus perceptuelles, souvent surperformantes des modèles psychoacoustiques fabriqués à la main à des débits extrêmement bas (p. ex., 3-6 kbps).

Les futurs horizons de l'audio perceptuel

L'avenir de la psychoacoustique en compression est hautement personnalisé et immersif. Les codecs traditionnels utilisent un modèle unique de l'ouïe « normale ». À mesure que la technologie des aides auditives s'améliore, nous nous dirigeons vers la psychacoustique personnalisée. Les futurs codecs peuvent intégrer un audiogramme spécifique de l'utilisateur pour optimiser la compression pour leur profil auditif unique.

De plus, les formats audio immersifs comme Dolby Atmos et [MPEG-H[ présentent de nouveaux défis. Ces formats sont basés sur des objets, ce qui signifie que les sons sont décrits comme des objets individuels avec des coordonnées spatiales.

Conclusion

La psychoacoustique reste le cœur battant de tout système de compression audio efficace. Des bandes critiques de l'échelle Bark aux réseaux neuronaux des codes AI modernes, le principe reste le même : en comprenant les limites biologiques et psychologiques de l'audition humaine, nous pouvons concevoir une transmission efficace et de haute qualité des données.