درک هنرهای صوتی در عمق

مصنوعات صوتی تحریفات ناخواسته یا سر و صدا است که کیفیت ادراکی هرتز از یک ضبط را کاهش می دهد.آنها می توانند از طیف گسترده ای از منابع، از جمله خطاهای تجهیزات آنالوگ، خطاهای پردازش سیگنال دیجیتال، نویز محیطی و اختلالات انتقال را از انواع معمول تجزیه و تحلیل صدا، شامل کلیک، پاپ، صدا، صدا، و تحریف، تحریف، نقص های پردازش سیگنال های فیزیکی، اغلب یک الگوی تشخیص فرکانسی بالا تولید می کنند.

تکنیک های اصلی در تشخیص خودکار

روش پردازش سیگنال

روش پردازش سیگنال سنتی صدا را در هر دو دامنه زمان و فرکانس تجزیه و تحلیل می کند. شاخص های زمان- دامنه شامل تغییرات پاکت انرژی، افزایش نرخ صفر و تشخیص عدم تعادل (به عنوان مثال، پرش ناگهانی در دامنه) روش های فیلتر کردن فرکانس ثابت، مانند سریع تغییر سریع (FFT) و چهار ترانسفورماتور کوتاه مدت (ST)، نشان می دهد طیف گسترده ای از عناصر فیلتر صدا و یا تغییر صدا.

تجزیه و تحلیل اسپکل و استخراج ویژگی

Spectrograms ارائه می دهد یک نمایش بصری از صدا که الگوریتم ها می توانند به عنوان تصاویر درمان. شبکه های عصبی کانولوی (CNNs) در ورودی های طیفogram برای شناسایی الگوهای مانند باند های صوتی باریک باند یا خطوط انتقال دهنده. ملا فرکانس (MFCC) فشرده سازی اطلاعات طیفی به ویژگی های تحریف شناختی، اغلب برای ویژگی های تشخیص هنر مرتبط با گفتار (در صورت وجود) استفاده می شود.

ماشین آلات یادگیری

یادگیری فوق العاده نظارت بر تشخیص مصنوعات است. مجموعه داده های برچسب شده از تمیز و مصنوعات مدل های صوتی مانند ماشین های پشتیبان (SVM)، جنگل های تصادفی و شبکه های عصبی عمیق (CNNs، RNNs، LSTM) ضبط فضاهای و وابستگی های توجه گاه به کمک به عناصر مبتنی بر هنر، اغلب سیستم های برچسب گذاری شده و یا داده های نیمه باز شده (CNNs، مدل های کدگذاری شده، که فاقد داده های مبتنی بر پوشش داده های مبتنی بر LED، و یا فاقد آن هستند.

توسعه الگوریتم تشخیص

جمع آوری داده ها و آمادگی

یک الگوریتم تشخیص قوی با مجموعه داده های متنوع و نمایندگی شروع می شود. ضبط های ثابت از محیط های مختلف (studio، Live، Field) و منابع تخریب، صدای تمیز آگوست با مصنوعات مصنوعی در نسبت سیگنال به مصنوعات کنترل شده برای افزایش اندازه داده ها و تنوع پذیری برچسب هر بخش به عنوان "artifactfree" یا "artifact-present" که احتمالا با کلاس های مصنوعی (به طور کلی) آموزش داده های سازگار را تضمین می کند.

مهندسی و انتخاب

ویژگی های که ثبت نام های مصنوع در حالی که در حال تبدیل به تغییرات خوش خیم است را انتخاب کنید.ویژگی های رایج استفاده شده عبارتند از: STFT، mel-spectrogram، MFCCs، ویژگی های طیفی، kurtosis (حساسیت به خارج از طیف)، صفر سرعت (ت تشخیصient)، و نسبت هارمونیک-to-to-noise (برای مثال تکنیک های یادگیری سریع و یا کاهش اطلاعات صوتی).

آموزش مدل و ارزیابی

تقسیم داده ها به آموزش، اعتبار و مجموعه های آزمون (به عنوان مثال، 70/15) استفاده از آموزش متعادل کلاس یا زیان های وزن برای رسیدگی به تخریب آثار در ضبط واقعی. مدل های قطار با توابع از دست دادن مناسب: دودویی متقابل-entropy برای حضور / حضور / حضور، از دست دادن کانونی برای سخت به کشف مصنوعات.

ادغام در جریانهای کاری تولید

مدل آموزش دیده را به عنوان یک کتابخانه، microservice یا پلاگین در نرم افزار ویرایش صدا قرار دهید.برای تشخیص آفلاین، فایل های پردازش در دسته، زمان خروجی و نمرات شدت.برای زمان واقعی (به عنوان مثال، پخش زنده)، بهینه سازی در تداخل با استفاده از TensorFlow Lite، NX، یا پیاده سازی های سفارشی ++C با API یکپارچه موجود (مانند ضبط صدا) برای بهبود یک ماژول شناسایی صوتی و یا یک ماژول رمزگذاری مثبت.

ارزیابی متریک برای تشخیص Artifact

اندازه گیری عملکرد تشخیص نیاز به معیارهای فراتر از دقت ساده دارد (FLT:0[۳] (نماز های صحیح / ( مثبت کاذب)) اندازه گیری می کند که چه تعداد از بخش های دارای پرچم در واقع مصنوعات هستند؛ دقت بالا باعث کاهش هشدارهای کاذب می شود. [F2] [F3]

چالش ها و مسیرهای تحقیقاتی آینده

تنوع و تعمیم

مصنوعات به شدت در سراسر تنظیمات ضبط، بیت ها و محیط های آکوستیک متفاوت است.یک مدل آموزش دیده در ضبط استودیو ممکن است در تکنیک های صوتی موبایل فلج کننده باشد. دامنه (آموزش های مجاور، دقیق در داده های هدف) یک منطقه تحقیق فعال است. یادگیری فوق العاده توصیه شده است که تشخیص ناهنجاری در ویژگی فضایی بدون نیاز به هر گونه وعده داده شده از هر وعده داده شده است.

برچسب های برچسب شده و Class Im Balance

صدای تمیز فراوان است، اما ضبط های مصنوعی به خوبی مشخص شده، کمیاب هستند.هُهُهُهُهُهُهُهُهُهُهُهُهُهُهُهُهُهُهُهُهُهُهُهُهُوَهُدِ نیمه یِهُمُمُوَهُرُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُبْهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُوَهُ

Real-Time و Low-Resource Constraints

دستگاه های جاسازی شده (Microphones، IoT) نیاز به مدل های سبک است که با محاسبات محدود و حافظه اجرا می شوند. تقطیر دانش از سی ان بزرگ به شبکه های کوچک، ⁇ و quantization ضروری است. شتاب دهنده های سخت افزاری (NPUs، DSP) می توانند از بین بروند، اما طراحی الگوریتم باید قابلیت های خود را مطابقت دهد.

توضیح و اعتماد

متخصصان صوتی باید درک کنند که چرا یک بخش در معرض نقشه های Saliency (بیش از طیفogram)، توضیحات مبتنی بر گرادیان یا توجیه های مبتنی بر قانون ("پرتحریم بالا از آستانه") افزایش اعتماد و کمک به یکپارچه سازی سیستم AI قابل توضیح (XAI) به ابزارهای شناسایی یک چالش باز است.

اجرای عملی با Open Source Tools

در این میان چند کتاب از جمله کتاب های قرآن و عترت و ائمه معصومین (ع) و نیز در مورد این که در این زمینه به صورت زیر به کار رفته اند، استفاده می کنند.

نتیجه گیری

تشخیص خودکار از آثار صوتی برای حفظ کیفیت بالا در رسانه های ضبط شده، از تولید موسیقی تا پخش و مخابرات بسیار مهم است، با ترکیب اصول پردازش سیگنال با یادگیری ماشین مدرن، توسعه دهندگان می توانند ابزارهایی ایجاد کنند که از بهره وری انسانی در شناسایی کلیک ها، هومها، کلیپینگ و دیگر تحریفات پیش رو، این زمینه همچنان به تکامل، پرداختن به چالش های عمومی سازی، توضیح، و عملکرد واقعی با استفاده از توسعه دهندگان آموزش و توسعه بیشتر، حتی توسعه دهنده های پیشرفته تر، به سیستم های شناسایی و توسعه یافته است.