تشخیص متون توهین آمیز در موتورهای جستجو با استفاده از یادگیری ماشین

  • سال انتشار: 1400
  • محل انتشار: هفتمین کنفرانس بین المللی وب پژوهی
  • کد COI اختصاصی: IRANWEB07_019
  • زبان مقاله: فارسی
  • تعداد مشاهده: 1398
دانلود فایل این مقاله

نویسندگان

نیما سیفی

دانشجوی کارشناسی ارشد، گروه مهندسی کامپیوتر، دانشگاه گیلان، رشت، ایران

مهدی امینیان

استادیار، گروه مهندسی کامپیوتر، دانشگاه گیلان، رشت، ایران

چکیده

با توجه به گسترش محتوا در بسترهای رسانهای و ارتباطی مختلف و همچنین دسترسی کاربران به این امکانات، لزوم بررسی محتوای به اشتراک گذاشته شده به ویژه در ابعاد فرهنگی و اجتماعی به منظور ارائه داده های با کیفیت به افراد حاضر در این عرصه ها همواره احساس میشود. یکی از مسائلی که در محتوای متنی، به خصوص محتوای ویژه کودکان، فرهنگی، دانشگاهی و ... بسیار پر اهمیت است تشخیص متون توهین آمیز به کار برده شده است که در این مقاله به آن پرداخته میشود. با استفاده از یادگیری ماشین SVM)، Naïve Bayes و (KNN داده های پیش پردازش شده را به مدل مورد نظر آموزش میدهیم و انتظار داریم که خروجی مدلی باشد که با دریافت متن احتمال رکیک بودن محتوا را تشخیص دهد. داده های مورد نظر مجموعه ای از جستجو های انجام شده در یک موتور جستجوی فارسی هستند که به منظور افزایش محتوا، دوباره این عبارات را در گوگل جستجو کرده و صفحه اول نتیجه را به داده ها اضافه می کنیم. سپس تشخیص میدهیم که داده مورد نظر رکیک میباشد یا خیر (برچسب گذاری). مدل مورد نظر این داده ها را یادگیری کرده و پس از آن مدلی داریم که میتواند احتمال رکیک بودن داده ورودی را تشخیص دهد. نتایج بدستآمده نشان میدهد که معیار اندازه گیری صحت (Precision) در مدل های Naïve Bayes، SVM و KNN به ترتیب برابر با ۹۴.۰۵ ، ۹۷.۲۸ و ۸۶.۴۸ خواهد بود.

کلیدواژه ها

یادگیری ماشین، پردازش زبان طبیعی، تشخیص کلمات رکیک، SVM ، Naïve Bayes ، .KNN

مقالات مرتبط جدید

اطلاعات بیشتر در مورد COI

COI مخفف عبارت CIVILICA Object Identifier به معنی شناسه سیویلیکا برای اسناد است. COI کدی است که مطابق محل انتشار، به مقالات کنفرانسها و ژورنالهای داخل کشور به هنگام نمایه سازی بر روی پایگاه استنادی سیویلیکا اختصاص می یابد.

کد COI به مفهوم کد ملی اسناد نمایه شده در سیویلیکا است و کدی یکتا و ثابت است و به همین دلیل همواره قابلیت استناد و پیگیری دارد.