مقایسه الگوریتم ها و مدل های پردازش زبان طبیعی در تحلیل داده های متنی فارسی: از روش های سنتی تا مدل های پیشرفته

سال انتشار: 1403
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 424

فایل این مقاله در 13 صفحه با فرمت PDF قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

ECICONFE09_058

تاریخ نمایه سازی: 18 اسفند 1403

چکیده مقاله:

این پژوهش به بررسی و مقایسه الگوریتم ها و مدل های پردازش زبان طبیعی (NLP) در تحلیل داده های متنی فارسی پرداخته است. هدف اصلی، ارزیابی عملکرد روش های سنتی مانند TF-IDF و RAKE و مدل های پیشرفته تری همچون Word۲Vec، BERT، و ParsBERT در وظایف متداول NLP از جمله استخراج کلمات کلیدی، تحلیل احساسات، و طبقه بندی موضوعی است. نتایج حاصل از تحلیل تطبیقی نشان می دهد که روش های سنتی، به دلیل پیچیدگی محاسباتی پایین و سرعت پردازش بالا، گزینه های مناسب برای کاربردهای ساده و سریع هستند، اما در درک روابط معنایی عمیق و تحلیل جملات پیچیده محدودیت دارند. در مقابل، مدل های پیشرفته، به ویژه ParsBERT که برای زبان فارسی بهینه سازی شده است، دقت بالایی در تحلیل ویژگی های زبانی پیچیده از جمله چندمعنایی بودن کلمات و ساختار نحوی متغیر ارائه می دهند. با این حال، این مدل ها نیازمند منابع محاسباتی قابل توجهی بوده و ممکن است برای پروژه هایی با محدودیت منابع چالش برانگیز باشند. این مطالعه نشان می دهد که انتخاب الگوریتم مناسب برای تحلیل داده های متنی فارسی به عوامل متعددی از جمله پیچیدگی وظایف، منابع محاسباتی موجود، و نوع داده ها بستگی دارد. یافته های این پژوهش می تواند راهنمایی ارزشمند برای پژوهشگران و توسعه دهندگان در انتخاب و استفاده بهینه از الگوریتم های NLP در کاربردهای زبان فارسی ارائه کند.

کلیدواژه ها:

پردازش زبان طبیعی (NLP) ، TF-IDF ، RAKE ، Word۲Vec ، BERT ، ParsBERT ، تحلیل احساسات