یادگیری بدون نظارت یک نوع یادگیری ماشینی است که داده ها را بدون پاسخ های برچسب شده تجزیه و تحلیل می کند، به ویژه برای داده های متنی مفید است، که در آن برچسب ها ممکن است در دسترس نباشد یا هزینه ای برای به دست آوردن آن باشد.این مقاله تکنیک های رایج و کاربردهای عملی یادگیری بدون نظارت در پردازش داده های متنی را بررسی می کند.

تکنیک های آموزشی Unsupervised Text Learning

چندین تکنیک برای استخراج اطلاعات معنی دار از داده های متنی بدون نظارت گروه های خوشه ای مانند اسناد یا کلمات استفاده می شود، در حالی که کاهش ابعاد داده های بالا را به اشکال قابل کنترل ساده می کند. مدل سازی موضوعات زیر را در داخل کادر بزرگ متن مشخص می کند.

تکنیک های مشترک

  • خوشه بندی های خوشه ای: داده های متنی را به خوشه ها بر اساس شباهت ویژگی تقسیم می کند.
  • [LDA] [LDA] [LDA] کشف موضوعات با مدل سازی توزیع کلمات در سراسر اسناد.
  • ] تجزیه و تحلیل قطعات پیش بینی (PCA): کاهش ابعاد فضایی برای تجسم و تجزیه و تحلیل.
  • و یا در بسترهای ، کلمات را در فضاهای پیوسته بردار برای ثبت روابط معنایی، نشان می دهد.

مثال های Application

تکنیک های یادگیری یکپارچه در زمینه های مختلف اعمال می شود.در خوشه سند، آنها مجموعه های بزرگ را برای بازیابی آسان تر سازماندهی می کنند. مدل سازی موضوع کمک می کند تا موضوعات رایج در رسانه های اجتماعی یا مقالات خبری را شناسایی کند. Word جاسازی شده با درک شباهت های معنایی موتورهای جستجو را افزایش می دهد.