Dijital ses devrimi, sesi ayrık verilerle temsil etme yeteneğine sahiptir. kompresyon olmadan, tek bir CD kalitesi şarkısı 30 MB'den fazla tüketilir, beton ve taşınabilir depolama engelleyicisi sağlar. Modern kodcular dahi sadece matematiksel verimlilikten yoksundur, ancak insan işitme sınırlamalarının sömürüsündedir.Bu alan, [Dönetici][/FONT][/TRNT][/TRNT][/TRNT][/FONT][/FONT][/FONT][/FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=TRNT=FONT=FONT=STRNT=FONT=FONT=FONT=FO
Psikokiyal ve ses sıkıştırması arasındaki ilişki, bugün kullanılan sofistike akış kodculara benzemektedir. Bu makale, perceptual kodlaması, kodculardaki uygulamaları ve sinyal işlemedeki denetçi bilimin gelişimini araştırıyor.
İnsan Auditory Perceptions
Ortalama dinleyici olmadan bir ses dosyasında verilerin %90'ına kadar atabileceğimizi anlamak için öncelikle insan kulağının biyolojik ve psikolojik kısıtlamaları anlamalıyız.
İşitme ve Basilar Membranının Anatomisi
Dış kulak ses toplar ve kulaklara kanallar. orta kulak osicles, mekanik titreşimleri basitleştirir ve onları içsel kulakta koklea iletir.İçinde, kochlea, 03.)basilar membranı) bu membranlar boyunca doğru bir dalga hareket eder.Bu membran boyunca hareket eder ve en yüksek pozisyondan gelen sesin frekansına bağlıdır.
Eleştirel Bands ve Bark Scale
Bazilar membranı, 100 Hz ve 200 arasında kolayca ayırt edebileceğimiz gibi işlevlerin bir banka olarak işlev görür, ancak 4000 Hz ve 4100 Hz. Bu doğrusal olmayan frekans çözünürlüğü, farklı frekansları çözme yeteneğimizi tanımlar.[Dörtüncü sınıfları) Bu, Heinrich Barkhausen'un üzerinden 100 Hz. Bark ölçeğini ayırt etmek için mücadele ettiğimiz anlamına gelir.
Nihai Threshold of Hear
Bir başka kritik sınırlama, işitmenin eşiği ile 0,0) 0 (ATH) Tüm frekansları eşit derecede iyi duymayız. İnsanlar orta sınıfta ses çıkarmak için en hassastır, kabaca 2 kHz ve 5 kHz arasında, konuşma konsonları ve birçok müzikal geçiciler, 500 Hz ve 8 kHz'nin üzerinde hassas bir şekilde algılanan ses seviyesinin altında olduğu gibi algılanabilir.
Core Psychoacoustic Phenomena Exploited for Essay
ATH, işitmenin küresel sınırlarını tanımlarken, 0:0) Yerel, dinamik sınırları tanımlar. Maskeleme, bir ses (seçmiş) başka bir ses (seçmiş) algılayıcı olarak en güçlü araçtır.
Simultane (Frequency) Maskeleme
Simultane maskeleme aynı anda iki sesin bulunduğunda meydana gelir. Bir tek frekansta yüksek bir ton işitme eşini ortaya çıkarır.Bu maskeleme eğrisinin şekli asimetrik: daha yüksek frekanslara doğru yayılır (daha yüksek frekanslara doğru yayılır) 100 Hz.
- [FONT:0)Tonal Maskeler: [Dönder: [Dönder: 1) Narrow-band sinyalleri (örneğin saf ton veya grip notu gibi) iyi tanımlanmış maskeleme desenleri vardır.
- [FONT:0]Noise Maskeler: [Dönder: [Dönder:) Broadband sinyalleri (örneğin rüzgarın sesi veya bir kokpit davul gibi) daha geniş bir frekans aralığında maske oluşturabilir.
Encoders hem tonal hem de gürültü benzeri bileşenleri tanımlamak için giriş sinyalini analiz eder ve her kritik grup için birleşik maskeleme eşini hesaplar.Bu eşiğin altında düşen herhangi bir sinyal bileşeni biraz azaltılabilir.
Temporal Maske
İşitme anında değildir. kulak, zaman zaman gerektirir ve bu, simult olmayan maskeleme olayları için pencere yaratır. İki zaman maskeleme türü vardır:
Pre-Masking (Backward Maskeing)
Bu en şaşırtıcı fenomendir: yüksek sesleniş sessiz sesin maskelenmesi gerekir, önceki [Dönetici: 0-20 m) ama beyin geçici saldırıları yönetmek için 20 milisaniye kadar sürer.Eğer yüksek bir patlama sessiz ses işlemeden önce gelirse, sessiz sesin aşırı yazılması gerekir.
Post-Masking (Forward Maskeing)
Bu daha sezgisel bir fenomendir. Yüksek seslenişten sonra, kulak kısa bir süre için "tamamlanmış" kalır (- 50-200 ms). Bazilar membranındaki saç hücreleri vibrating'i durdurma ve duyarlılığını kurtarmayı gerektirir.Bu dönemde, sesin maskelendiği sessiz sesler maskelenir.
Kodcsacoustic Principles in Codecs
Psiko-psikiyatik teorinin pratik bir sıkıştırma algoritmasına çevirisi karmaşık bir mühendisliktir. Maskeli eşlerin hesaplanabilir ve uygulanabilir olabileceği bir alana ses dönüştürmek gerekir.Bu, [[Dönemli ses kodur).
Eylemdeki Psikokotik Model
Tüm modern perceptual codecs benzer bir üst düzey mimariyi takip eder. giriş PCM (Pulse-Kolaylama) sinyali ilk pencereli ve frekans alanına bir şekilde dönüştürülür.[Dönemli Eşdeğerlikli)[Dörtsel Dönüşüm (MDCT) veya karma bir filtre bankası.
- [FONT:0]Spectral Analiz: [Dönetici:[Dönetici:[Dönetici: 0) Sinyal, yüksek frekans çözünürlüğü elde etmek için hızlı Fourier Dönüşümü (FFT) kullanılarak analiz edilir.
- [FONT:0]Critical Band Mapping: ⁇ hatları Bark ölçeğine dayanan kritik gruplar halinde gruplandırılmıştır.
- [FONT:0]Masking Threshold Hesapion: Model tonal ve gürültü maskeleyicilerini tanımlar ve bireysel maskeleme eğrilerini hesaplar. Bu eğriler her kritik grup için küresel bir maskeleme eşi oluşturmak için yapılır.Bu eşleme, anlaşılabilir olan maksimum miktar ölçümleyici gürültü enerjisini temsil eder.
- [FONT:0)Signal-to-Mask Oranı (SMR): [Dönder her grup için SMR hesaplar. Yüksek bir SMR, sinyalin maskeleme eşine göre güçlü olduğu anlamına gelir. düşük bir SMR, sinyalin eşiğine yakın olduğu anlamına gelir ve dikkatli kodlanmalıdır.
Bit Allocation ve Gürültü Shaping
SMR'ye dayanarak, encoder frekans spektrumu boyunca sınırlı bir miktar bütçeye sahiptir. yüksek bir SMR ile daha az miktar (küresel ölçüm) elde ederken, gruplar daha düşük bir SMR ile daha fazla miktar alır (değerlendirme).Bu işlem, [Dönlendirme:0)
[FONT:0] Bir perceptual encoderin amacı, toplam ölçüm gürültüyü en aza indirmek değil, ancak en aza indirmek için ).
Endüstri-Strate Perceptual Codecs
Farklı kodcular bu ilkeleri farklı türverim düzeyleri ile uyguladılar.
MPEG-1 Audio Katman III (MP3)
MP3 ilk yaygın olarak başarılı bir kural koduydı. Bu, düşük sayıdaki (körtücük) ve temel psikokutik modelde takip edilen karma filtre bankası (polifak kuature filtre) kullandı. Zamanları için devrimci olsa da, frekans çözünürlüğü sınırlıydı ve sürekli olarak kabul edilemez bir şekilde kabul edildi.
Gelişmiş Ses Coding (AAC)
AAC, MP3'e kadar yenilendi ve modern akışın temeli (Apple Müzik, YouTube). Birkaç önemli yenilik aracılığıyla üstün performans sunuyor:
- [FONT:0)Pure MDCT:[Dönetici:[Dönetici: 1 ) AAC daha büyük bir pencere büyüklüğü ile saf MDCT kullanır (1024 örnek), sabit sinyaller için daha iyi frekans çözünürlüğü sağlar.
- [FONT:0)Window Switching:[[Dönetici:[Dönetici:0) AAC, MP3'ten çok daha iyi bir saldırı sağlamasını engellemek için kısa bir pencereye (128 örnek) dinamik olarak geçiş yapabilir.
- [FONT:0]Temporal Gürültü Shaping (TNS): ), TNS zaman aralığında ölçüm gürültüsünün zaman aralığına, doğrudan ön-echo problemine hitap etmek için çalışır.
- [FONT=0) Geliştirilmiş Stereo Coding: [Dönetici: [Dönetici:0] AAC, AAC'nin teknik özelliklerini ayrıntılı olarak kullanmak için ortak stereo kodlamaya izin verir.
Diğer Notable Codecs
Sony'nin ATRAC[[DDolby Digital (AC-3) [Dolby Digital (AC-3)[Dolby Digital (AC-3)[Dolby Digital (AC-3)[Dolby Digital (AC-3)[Dolby Digital (AC-3)[Dolby Digital) tarafından kullanılan, her biri belirli kullanım durumları için özelleştirilmiş benzersiz psikososyal modeller ile aynı zamanda erken kabul edildi (düşük güç veya çoklu kanal).
Faydaları ve Perceptual Limitations
Psikokiyal sıkıştırmanın faydaları kendi kendine ait: veri büyüklüğünde ölçeklendirme siparişleri, taşınabilir müzik oyuncuları ve dijital radyo. Ancak, yaklaşımın doğal sınırları vardır.
Transparency vs. Verimliliği
Algoritmaın kutsal graili şu şekildedir:0)transparency[Dönetici:0)[Dönetici][Döneticileri, ağır metal), şeffaflık, 192 kbps veya daha fazla ihtiyaç duyulan "tatüel ses geçişi için, yüksek sadakatli bir çalışma alanı olarak 64.
Common Artifacts
Bir kodc sınırlarının ötesine itildiğinde, psikokuoustik model başarısız olur ve audible eserler ortaya çıkar.
- [FONT:0)Öyle: [Dönetici: [Dönder: 1)) Bir keskin saldırıdan önce, "savaş" veya "smeared" ses yaratmadan önce, zaman içinde geri dönüştüğünün nedeni.
- [FONT:0]Spectral Holes:[Dönetici: [Dönder: Yüksek frekanslar tamamen kaldırıldı çünkü encoder onları maskeli, sıkıcı, “kapılı” bir sesle ortaya çıkardı.
- [FONT:0]Birdie Artifacts:[Dönetici: 1) Tonal gürültü, genellikle metalik veya savaş, encoder'in belirli bir ⁇ hattını kötü bir şekilde ölçtüğü görülüyor.
- [FONT:0)Warbling:[Dönemli stereo görüntüleme veya "swklama" kötü kodlu ortak stereo parametreler nedeniyle sesin "swk"ı.
Dinleme Testleri ve Konuness
Kod kalitesi doğal olarak özneldir. Endüstri standardı, düşük kaliteli olan bazı versiyonlarla sunulmaktadır. [Uygunlukta kullanılabilecek, 0 ila 100 $ ile ilgili "basın ses kalitesi" oranını arttırır.Bu titiz test, kodcular dramatik bir şekilde geliştirildiğinde, tüm dinler ve içerik için düşük çözünürlükte hiçbir kodlu versiyonda eşitsiz olarak şeffaf değildir.[MNT=D)
Perceptual Audio Coding
Daha düşük ve daha yüksek şeffaflık arayışı AAC ile durmadı. Araştırmacılar doğrudan sinyal kodlamasının ötesine geçen parametrik araçlarla ilgili temel algılayıcıları geliştirmenin yollarını buldular.
Yüksek verimsiz AAC (HE-AAC) ve Spectral Band Replication
HE-AAC (aacPlus) bunu doğrudan kodlu düşük frekanslardan yeniden inşa etmeyi öğretir.Bu, yüksek frekanslara ve eğime göre yüksek frekanslara (örneğin, 8 kHz) kodlamak yerine, internet radyo ve düşük bant genişliğine nasıl yeniden inşa edileceği konusunda standarttır.
Opus ve xHE-AAC: Modern Sanat Devleti
[FONT:0)Opus[Dönetici:0) Bir konuşma kodu (SILK) ve genel bir ses kodu (CELT) arasında dinamik olarak anahtarlar, Opus kodu hakkında yaygın olarak övgüler vardır (Döneticileri) ve düşük gecikmelileri bir dizi ile VoIP ve gerçek zamanlı akış için idealdir.
[FONT=0]xHE-AAC[DÜDÜDÜDÜDÜDÜSÜSÜSÜSÜŞÜNÜSÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜye Değer:2.Öyle İLGİLİ:0)[DÜye Olmayanlar ve Seslendirme ve Seslendirme (USAC) Ana Sayfaları: 12 kbps'ye kadar) ve karışık içerik (örneğin, müzik üzerinde) sorunsuz bir şekilde kodlanır.
Makine-Learned Codecs
Ses sıkıştırmasındaki son sınır derin öğrenme uygulamasıdır. Neural ağları artık son uç uç uç-to-end sıkıştırma programlarını öğrenmek için kullanılır, kendi "psikoaktik modeli"lerini verilerden etkin bir şekilde öğrenmektir.
- [FONT:0]Bit bit bit bit-to-Bitki Modeller:[Dönetici:0][Dönetici:0)[Dönetici:0)[Döneticileri ve Meta'surFLT: 4)EnKolep[Döneticileri) doğrudan geç bir alana kodlayan bir optik ağ kullanıyor.
- [FONT:0) Tanımlanmış Perceptual Cues: Bu modeller genellikle standart kayıp fonksiyonlarının bir kombinasyonunu kullanarak eğitilmiştir (örneğin, MSE) ve aİLFLT:2).
Kalıcı Sesde Future Horizons
Kompajta psikososyallerin geleceği oldukça kişiselleştirilmiş ve immersive. Geleneksel kodcular, eşsiz işitme teknolojisi için bir "normal" işitme modelini optimize etmek için bir kullanıcı tarafından belirli bir sesgramı kullanabilir.
Ayrıca, immersive audio formatları gibi:0)Dolby Atmos[DDDolby)[DFLT:2) ve [[FONTD[DDDDDDDDDDDDDD)[FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FO
Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç
Psikokotik her verimli ses sıkıştırma sisteminin dövme kalbidir. Bark ölçeğinin sinir ağlarından modern AI kodculara kadar, prensip aynı kalır: insan işitmenin biyolojik ve psikolojik sınırlamalarını anlamakla, etkili, yüksek kaliteli veri iletimini sürdürebiliriz.