شناسایی لغات بازدارنده در متون فارسی با استفاده از یک یادگیر تقویتی دو لایه

سال انتشار: 1404
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 33

فایل این مقاله در 6 صفحه با فرمت PDF قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

CSCG06_267

تاریخ نمایه سازی: 4 مهر 1405

چکیده مقاله:

شناسایی کلمات بازدارنده یکی از مهمترین مراحل پیش پردازش متون در همه زبان هاست. تعیین ارزش کلمات کلیدی، طبیعی، لغات بازدارنده، اطلاعاتی و آماری هر لغت نه تنها در ساخت لیستی از کلمات بازدارنده بلکه در سایر فرآیندهای پردازش متن نیز از جمله استخراج کلمات کلیدی، تعیین شباهت متون، خلاصه سازی متون و... بسیار حائز اهمیت است. در این مقاله متدی مبتنی بر یادگیری تقویتی جهت شناسایی این لغات پیشنهاد می گردد که دسته بندی یادگیری ماشین به نحوی که از سایر لیست های دست ساز آماده موجود در زبان فارسی بازده پردازشی و دقت بالاتری ارائه دهد. این یادگیر تقویتی در دو لایه، یکی در سطح لغات و دیگری در سطح پیکره متنی عمل می نماید. لایه نخست در سطح لغات بر شمول یا عدم شمول هر لغت در لیست لغات بازدارنده تصمیم گیری نموده و پس از پردازش همه لغات پیکره، لایه دوم در سطح پیکره میزان اثر حذف لغات برچسب خورده در لایه اول را بر دقت فرآیند دسته بندی اسناد ارزیابی و پاداش یا جزایی را در پاسخ برمی گرداند. این اپیزود در مرحله بعد در سطح لغات توسط لایه اول دوباره انجام شده و لیست حاصله به داوری لایه دوم گذاشته می شود. بازخورد لایه دوم در دقت فرآیند شناسایی لغات بازدارنده در لایه اول تاثیرگذار بوده و این فرآیند تا همگرایی و عدم تغییر کلی دقت دسته بندی اسناد ادامه می یابد.

نویسندگان

عمران یونسی

عضو هیئت علمی گروه کامپیوتر دانشگاه پیام نور