شناسایی لغات بازدارنده در متون فارسی با استفاده از یک یادگیر تقویتی دو لایه
محل انتشار: ششمین کنفرانس بین المللی محاسبات نرم
سال انتشار: 1404
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 33
فایل این مقاله در 6 صفحه با فرمت PDF قابل دریافت می باشد
- صدور گواهی نمایه سازی
- من نویسنده این مقاله هستم
استخراج به نرم افزارهای پژوهشی:
شناسه ملی سند علمی:
CSCG06_267
تاریخ نمایه سازی: 4 مهر 1405
چکیده مقاله:
شناسایی کلمات بازدارنده یکی از مهمترین مراحل پیش پردازش متون در همه زبان هاست. تعیین ارزش کلمات کلیدی، طبیعی، لغات بازدارنده، اطلاعاتی و آماری هر لغت نه تنها در ساخت لیستی از کلمات بازدارنده بلکه در سایر فرآیندهای پردازش متن نیز از جمله استخراج کلمات کلیدی، تعیین شباهت متون، خلاصه سازی متون و... بسیار حائز اهمیت است. در این مقاله متدی مبتنی بر یادگیری تقویتی جهت شناسایی این لغات پیشنهاد می گردد که دسته بندی یادگیری ماشین به نحوی که از سایر لیست های دست ساز آماده موجود در زبان فارسی بازده پردازشی و دقت بالاتری ارائه دهد. این یادگیر تقویتی در دو لایه، یکی در سطح لغات و دیگری در سطح پیکره متنی عمل می نماید. لایه نخست در سطح لغات بر شمول یا عدم شمول هر لغت در لیست لغات بازدارنده تصمیم گیری نموده و پس از پردازش همه لغات پیکره، لایه دوم در سطح پیکره میزان اثر حذف لغات برچسب خورده در لایه اول را بر دقت فرآیند دسته بندی اسناد ارزیابی و پاداش یا جزایی را در پاسخ برمی گرداند. این اپیزود در مرحله بعد در سطح لغات توسط لایه اول دوباره انجام شده و لیست حاصله به داوری لایه دوم گذاشته می شود. بازخورد لایه دوم در دقت فرآیند شناسایی لغات بازدارنده در لایه اول تاثیرگذار بوده و این فرآیند تا همگرایی و عدم تغییر کلی دقت دسته بندی اسناد ادامه می یابد.
نویسندگان
عمران یونسی
عضو هیئت علمی گروه کامپیوتر دانشگاه پیام نور