[ה] מהפכה של אודיו דיגיטלית תלויה ביכולת לייצג מידע דיסקרטי.ללא דחיסה, שיר באיכות תקליטור יחיד יקטן מעל 30 MB, ביצוע הזרמת אחסון נייד לא מעשי.הגאונות של קודים מודרניים אינה רק ביעילות מתמטית, אלא גם בניצול המגבלות של השימוע האנושי.

היחסים בין פסיכוקדיטיקה ודחיסת אודיו הם סימביוטיים.כפי שהבנה שלנו של מערכת השמע מעמיק, אלגוריתמים דחיסה הופכים יעילים יותר.זיכוך מתמשך זה עיצב את הנוף של מדיה דיגיטלית, מן הימים הראשונים של MP3 ועד קודים המתוחכמים בשימוש היום. מאמר זה חוקר את עקרונות הליבה של פסיכוקימיקה, יישום שלהם בקידוד perceptualding, האבולוציה של קוד, ועתיד של עיבוד מדעי.

יסודות ה-Ouditory Perception

כדי להבין מדוע אנו יכולים לזרוק עד 90% מהמידע בקובץ אודיו ללא המאזינים הממוצע, עלינו להבין תחילה את המגבלות הביולוגיות והפסיכולוגיות של האוזן האנושית.האוזן אינה מיקרופון מושלם; היא לא לינארית, תלות בתדר, ואיברים רגישים להקשר.

האנטומיה של השמיעה והבזילאר ממברנן

האוזן החיצונית אוספת קול וערוצים אותו לאוזן.האווסיסטים של האוזן התיכונה מגבירים את הרטטים המכניים ומעבירים אותם לכפירה באוזן הפנימית.בתוך ה- cochlea, ה-FLT:0basilar membraneFLT:1 פועל כנתח ספקטרום בזמן אמת. A נע לאורך המנבר, ונקודת השיא שלו תלויה בתדירות גבוהה של שערה זו, בעוד שגובהו של שערה הוא גבוה, תלוי בתדירות גבוהה של התדירות גבוהה.

בתי מלון ו-Bark Scale

[הידועים] כבנק של מסננים חופפים (Spotpe-pass Filters) פילטרים אלה, הידועים כ-FLT:0 להקות קריטיות הרץ 1 (FLT:1), מגדירים את יכולתנו לפתור תדרים שונים.רוחב הלהקות הללו עולה עם תדירות.זה אומר שאנחנו יכולים להבחין בין 100 הרץ ל-200 הרץ בקלות, אך אנו נאבקים להבחין בין 4000 טרה- 4100 ⁇ ).

« « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « «

עוד הגבלה קריטית היא סף מוחלט של שמיעה (ATH) 1 (ATH) איננו שומעים את כל התדרים באופן שווה, בני האדם רגישים ביותר לצלילים בטווח הבינוני, בערך בין 2 kHz ו-5 kspecable במדויק, שבו קווי דיבור וריאציות מוזיקליות רבות שוכנות מתחת ל-500 הרץ ומעל 8 kuncible Energy, כאשר ניתן לראות את הדיוקן הסגולה הנמוכה ביותר: AFuncredit ניתן להבחין בצלילים שונים (מטווח קצר)

Phenomena פסיכוזיקית Core להורדה

בעוד שה-ATH מגדיר את הגבולות הגלובליים של השמיעה, FLT:0 (המסת'מינג'ר:1) מגדיר את הגבולות המקומיים והדינמית.מסיכה מתרחשת כאשר צליל אחד (הממסי) הופך צליל אחר (המסימנט) לבלתי-הוהסבר.

סימולטני (Frequency) Masking

מסיכה סימולטנית מתרחשת כאשר שני צלילים נוכחים בו זמנית.טון חזק בתדר אחד מעלה את סף השמיעה בתדרים הסמוכים.צורה של עקומת המסיכה הזו היא אסימטרית: היא מתפשטת יותר לתדרים גבוהים יותר (הפצה של מסיכה) מאשר תדרים נמוכים יותר.אם תוף בעיטות ב-100 הרץ, היא יכולה להסוות התרסקות מטריה ב 8000, אבל הערפילית לא תהיה בקלות: שני סוגי מסכות ראשוניות של מסיכה.

  • (ב) ויקרא י"א: "ב"א, כ"ד, יש לו דפוס מסיכה מוגדר היטב.
  • (ב) ⁇ (ב"א): "המסכות מסכות: 1" (בדומה לצליל הרוח או תופים של נבט) יש דפוס מסיכה שטוח יותר, אך יכול להסוות בטווח רחב יותר של תדרים.

Encoders לנתח את אות קלט כדי לזהות מרכיבים חד-משמעיים ורעש, לחשב את הסף המשולב מסיכה עבור כל להקה קריטית. כל רכיבי אות ליפול מתחת לסף זה הם מועמדים פוטנציאליים לירידה במקצת.

מסכה זמנית

השמיעה אינה מיידית, האוזן דורשת זמן לעבד צלילים, וזה יוצר חלון לסיכות אירועים שאינם בו-זמנית.

Pre-Masking (Backward Masking)

זוהי התופעה המפתיעה ביותר: קול חזק יכול להסוות צליל שקט יותר המתרחשת לפני ההרחבה:0 לפני כן, זה אפשרי כי המוח לוקח עד 20 מילי שניות לרשום קול שקט לחלוטין.אם פרץ חזק מגיע לפני שהמוח סיים עיבוד הקול השקט, הקול השקט נכתב יתר על המידה.

פוסט-מזרקה (Forward Masking)

זוהי התופעה האינטואיטיבית יותר.לאחר קול חזק עוצר, האוזן נותרה "מחוסמת" לתקופה קצרה (50-200 מ"ס) תאי השיער על המברה הבזיליקה לוקחים זמן להפסיק להבריח ולאושש את הרגישות שלהם. במהלך תקופה זו, צלילים שקטים שעוקבים אחרי הצליל המומסים.זה מנוצלים על ידי קודקודים כאשר מתמודדים עם צלילים מקדימים.

יישום עקרונות פסיכוקריטיים ב- Codecs

תרגום של תיאוריה פסיכוקריטית לאלגוריתם דחיסה מעשי הוא הישג הנדסי מורכב.הוא דורש להפוך אודיו לתוך דומיין שבו ניתן לחשב את סף המסיכה וליישם.זהו התחום של ה-FLT:0perceptual אודיו CoderuaFLT:1.

המודל הפסיכוזוטי בפעולה

כל הקידודים המודרניים עוקבים אחר אדריכלות דומה ברמה גבוהה.ה-PCM (Pulse-code Modulation) הוא הראשון החלון והפך למרחב התדירות באמצעות AFLT:0Modified Discrete Cosine Transform (MDCT)FLT:1 או בנק סינון היברידי.

  1. (ב) ,0) ניתוחי מדרגה: 1FLT: האות ניתח באמצעות שינוי מהיר (FFT) כדי להשיג רזולוציה גבוהה של תדירות.
  2. (ב) ,0) ,Critical Band Mapping:FLT:1 ,קווים ספקטרליים מחולקים ללהקות קריטיות המבוססות על סולם בראק.
  3. (FLT:0)Masking Threshold Calculation: ההרחבה מזהה מסכות טונאליות ורעש מחשב את עקומות המסכות הבודדות שלהם. עקומות אלה מסוכמות כדי ליצור סף מסיכה עולמי עבור כל להקה קריטית.סף זה מייצג את אנרגיית הרעש המרשימה ביותר שניתן להגדרה מקסימלית שעדיין לא ניתן לטעון.
  4. (ב) ⁇ :0 signal-to-Mask Ratio (SMR): ההרחבה 1 (הקודש) מחשב את ה- SMR עבור כל להקה. A גבוה SMR אומר שהאות חזק יחסית לסף המסכות, משאיר מקום להגדרה כבדה.

« קצת אללוקיישן ו- Noise Shaping

בהתבסס על ה-SMR, ה-coder מקצה תקציב מוגבל בספקטרום התדירות. Bands עם SMR גבוה לקבל פחות ביטים (קונארזה קוונטיזציה), בעוד שלהקות עם SMR נמוך מקבלים יותר ביטים (פליננציה) תהליך זה נקרא FLT:0noise spLT:1 על ידי עיצוב הרעש הקוונטי כדי להתאים מתחת למסיכה, קודר הופך את הרעש להאזנה.

(ב) "התכלית של קוד-הנפש אינה למזער את הרעש הקוונטי הכולל, אלא למזער את הרעש המפואר הראשון:2 רעש קוונטי על ידי הסתרתו מתחת לסף המסיכות של האות."

התעשייה-Standard Perceptual Codecs

קודים שונים יישמו עקרונות אלה עם רמות שונות של תחכום.

MPEG-1 Audio Layer III (MP3)

ה- MP3 היה ה-Perceptual Codec הראשון שהצליח מאוד להשיג בנק סינון היברידי (מסנן של קוואדרציה של פילטר לאחר MDCT) ומודל פסיכו-אקטי בסיסי, בעודו מהפכני לזמן שלו, החלטת התדר שלו הייתה מוגבלת, ורזולוציה הזמנית שלו הייתה גרועה.

Advanced Audio Coding (AAC)

AAC תוכנן כורשו ל- MP3 והוא הבסיס של הזרמת המודרנית (Apple Music, YouTube) הוא מציע ביצועים מעולים באמצעות מספר חידושים מרכזיים:

  • (FLT:0)Pure MDCTib: AAC משתמש ב-MDCT טהור בגודל חלון גדול יותר (1024 דגימות), מתן רזולוציה טובה יותר של תדירות עבור אותות נייחים.
  • (FLT:0)Window Switching:FLT:1 AAC יכול לעבור באופן דינמי לחלון קצר (128 דגימות) כדי למנוע pre-echo על אותות טרנספורמטיביים, המציע הרבה יותר טוב שוחד התקפה מאשר MP3.
  • (ב) ⁇ (TNS): TERLT:1) עובד באותו זמן התחום כדי לשלוט בהתפשטות הזמן של רעש קוונטי, ישירות בהתמודדות עם הבעיה לפני צ'ו.
  • (ב) ,0) ,הוכיחו את סיג'ו קולינג: ⁇ 1 (AAC) מאפשר לקידוד משותף של סטריאו לנצל מסיכה בין ערוצים.

קודים נוספים

סוני (FLT:0)ATRACFLT:1ua (Aaptive Transform Acous Coding) המשמש עבור מינידיסקים, ו-FLT:2Dolby Digital (AC-3)FLT:3 המשמש בקולנוע, היו גם מאמצים מוקדמים של קידוד perceptual, כל אחד עם מודלים פסיכוקויים ייחודיים המותאמים לשימושם (כוח נמוך או ערוצים, בהתאמה).

יתרונות ומגבלות קדמוניות

היתרונות של דחיסה פסיכוקריטית הם ברורים: הזמנות של צמצום גודל בנתונים המאפשרות הזרמת, שחקני מוסיקה ניידים ורדיו דיגיטלי.

שקיפות מול יעילות

הגליכה הקדושה של הקידוד התפיסתי היא:0 (transparencyFLT:1) – הנקודה שבה המאזינים אינם יכולים להבחין בין האות המחוספס מהמקור.זה תלוי במידה רבה ב bitrate ובחומר ההאזנה.עבור קטעי שירה פשוטים, שקיפות יכולה להתבצע ב-64 kbps עם קודים מודרניים.

אמנות משותפת

כאשר קודק נדחק מעבר לגבולותיו, המודל הפסיכוקלי נכשל, וממצאים בלתי ניתנים לזיהוי מופיעים.

  • (ב) ⁇ :0) ,(FLT:1) נגרמה על ידי כישלון מסכת זמן.רעש קוונטי מתפשט לאחור בזמן לפני התקפה חדה, יצירת צליל "מלחמה" או "מרוצה" (התרגשות).
  • (ב) ⁇ :0) ⁇ ⁇ : "החלים הגבוהים" (ב) הוסרו לחלוטין משום שהקודמן שופט אותם להיות מסומנים, וכתוצאה מכך צליל "סגור"
  • (ב) ⁇ :0) ,ב"ר ארטיפקט: רעש טונאלי, לעתים קרובות מתכתי או מלחמה, מופיע היכן שהקודש הכין קו ספקטרלי מסוים.
  • (ב) ⁇ :0) , ⁇ (ב) ⁇ (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

בדיקות הקשבה וסובייקטיביות

איכות קוד-קוד היא סובייקטיבית מטבעה.סטנדרט התעשייה הוא ה-FLT:0MUSHRASHRASHRAFLT:1 (MUlti Stimulus Test with Hidden Reference and Anchor) , סטנדרטי על ידי ITU (ITU-R BS.1534). להאזין מוצגים עם התייחסות וכמה גרסאות קוד, כולל עוגן באיכות נמוכה.

התפתחותו של אודיו חטוף

החיפוש אחר ביטטים נמוכים יותר ושקיפות גבוהה יותר לא נפסק עם AAC. חוקרים מצאו דרכים להגדיל את הקוד התפיסתי הבסיסי עם כלים טמטריים מעבר לקידוד אותות ישיר.

High-Efficiency AAC (HE-AAC) ו- Spectral Band Replication

הוא-AAC (AacPlus) מציג את ה-FLT:0 כפלת Band Replication (SBR)BuildFLT:1 במקום לקידוד תדרים הגבוהים (למשל מעל 8 kHz) ישירות, ה-coder מנחה את ה-coder על איך לשחזר אותם בתדרים נמוכים קודקוד.

אופוס ו- xHE-AAC: המדינה המודרנית של האמנות

(ב) [ה][דרוש מקור]] [ה]]] [ה]] [ה]] [ה]]] [ה]]]][ה]]]][ה]]]]] הוא [התגמלות [ה] [התחילה] [התחילה] [ה] [ה]] [התחילה]] [ה]] [ה] [ה]] [ה]] היא] [ה] היא] היא] [ה] [ה] [ה], על פיה], על פי ה[[ה], על פי ה[[ה'[ה'[ה'[ה'], [ה'[ה'], [ה'[ה'], [ה'[ה'], [ה'], [ה'], [ה'], [ה'[ה'], [ה'], [ה'], [ה'], [ה'], [ה'], [ה'[ה'], [ה'], [ה'], [ה'], [ה'[ה']]], [ה'[

[01:0]xHE-AveACFLT 1 מרחיב את ה-AAC עם ההרחבה:2 [Enhanced Spectral Band Replication (eSBR)FLT 3: ונאום מאוחד ושיח אודיו משותף (USAC) הליבה יכולה לספק איכות גבוהה ב bitrates נמוכים להפליא (בהמשך 12bps) ותכנים מעורבים (pereative) כמו סטרימינג אודיו על גבי גירסאות חלקיות של Netflix.

עלייתם של קודים ממוחשבים

הגבול האחרון בדחיסת אודיו הוא היישום של למידה עמוקה.רשתות נילי משמשים כעת כדי ללמוד תוכניות דחיסה מקצה לקצה, ביעילות ללמוד את "מודל פסיכולוגי" משלהם מהנתונים.

  • (ב) ,0) מודלי END-סוף: צופן 1 (קודש:2SoundStreamcioFLT 3: ו- Meta'sFLT:4EnccodeirFLT:5 להשתמש ברשתות עצביות כדי לקוד אודיו ישירות לתוך חלל מאוחר.
  • (ב) (ב) ,0) למד את ה-Perceptual Cues: ⁇ 1 (המודלים האלה מאומן לעתים קרובות באמצעות שילוב של פונקציות אובדן סטנדרטיות (למשל, MSE) ו-AFLT:2discriminator LossFLT 3, שמנסה להבחין בין אודיו מקורי וקודד.

Horizons in Perceptual Audio

העתיד של פסיכוקדיטיקה בדחיסה הוא מאוד מותאמים אישית ו immersive. Codecs מסורתי להשתמש במודל בגודל אחד של שמיעה "נורמלית" כמו טכנולוגיית סיוע שמיעה משתפרת, אנו נעים לכיוון FLT:0 פסיכוקלימיזציה פסיכו-אישית FLT:1 . קודים עתידיים עשויים לשלב אודיו ספציפי של המשתמש כדי להתאים דחיסה עבור פרופיל השמיעה הייחודי שלהם.

יתר על כן, פורמטי אודיו מרשימים כמו FLT:0Dolby AtmosFLT:1 ו-FLT:2 MPEG-HoriFLT 3 מציגים אתגרים חדשים. פורמטים אלה מבוססים על אובייקטים, כלומר צלילים מתוארים כאובייקטים בודדים עם קואורדינטים מרחביים.זה דורש מודלים פסיכו-קוגניים חדשים אשר מהווים מסיכה מרחבית ואפקט טרום-מידה.

מסקנה

פסיכוקימיסטים נותר הלב הפועם של כל מערכת דחיסת אודיו יעילה.מהלהקות הקריטיות של סולם ברק לרשתות העצביות של קודים מודרניים של בינה מלאכותית, העיקרון נשאר זהה: על ידי הבנת המגבלות הביולוגיות והפסיכולוגיות של השמיעה האנושית, אנו יכולים להנדס ביעילות, באיכות גבוהה העברת נתונים.ההמשך של מודלים תפיסתיים מניעים את עתידם של חומרים מרשימים, נאמנות גבוהה, וזמין עבור כולם.