تشخیص هویت (NER) یک کار کلیدی در پردازش زبان طبیعی است که شامل شناسایی و طبقه بندی موجودات در متن است. علی رغم پیشرفت در یادگیری ماشین، چندین مشکل رایج مانع دقت سیستم های NER می شوند.

سقوط های مشترک در NER

یک مسئله مکرر، طبقه بندی نادرستی از نهادهای به دلیل زمینه مبهم است.برای مثال، کلمه "Apple" می تواند به یک شرکت یا یک میوه اشاره کند، بسته به زمینه دیگر، شناخت نهادهای دارای فرمت های مختلف، مانند اختصار یا از دست دادن، مدل ها اغلب با نهادهای ناشناخته یا اصطلاحات جدید که در آموزش داده ها وجود ندارد، مبارزه می کنند.

رویکردهای ریاضی برای بهبود

تکنیک های ریاضی می توانند دقت را با ارائه نمایندگی قوی تر از متن افزایش دهند. روش های قفسه بندی مانند کلمه بردارها اطلاعات معنایی را کد می کنند، به مدل های مختلف نهادی حتی در زمینه های مبهم، مانند مدل های پنهان مارکوف (HMMs) و فیلد های تصادفی وضعیت (CRFs)، از وابستگی های آماری برای بهبود تشخیص و طبقه بندی مرزی استفاده کنند.

استراتژی های اصلاح

  • یادداشت های مفهومی: از مدل هایی مانند BERT برای استفاده از نمایندگی های آگاه از متن استفاده کنید.
  • مهندسی مواد: یکپارچه سازی ویژگی های ریاضی مانند فرکانس، co-occurrence و اطلاعات موقعیتی.
  • مدل های بالقوه: [FLT 1] CRFs را به مدل سازی وابستگی بین توکن های همسایه برای تشخیص بهتر مرز نهاد اعمال کنید.
  • ] داده های آگوستmentation: داده های مصنوعی را برای افشای مدل ها به فرمت های مختلف نهادی و کاهش مسائل موجود ناشناخته، تولید می کند.