پیش بینی تطبیقی احساسات در گفتار چند زبانه با استفاده از مدل های ترنسفورمر چندوجهی و یادگیری انتقالی
سال انتشار: 1404
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 277
فایل این مقاله در 12 صفحه با فرمت PDF قابل دریافت می باشد
- صدور گواهی نمایه سازی
- من نویسنده این مقاله هستم
استخراج به نرم افزارهای پژوهشی:
شناسه ملی سند علمی:
ITCT26_071
تاریخ نمایه سازی: 17 مهر 1404
چکیده مقاله:
تحلیل احساسات در گفتار، به عنوان یکی از حوزه های پیشرفته در پردازش زبان طبیعی و تعامل انسان–ماشین، طی سال های اخیر توجه بسیاری را به خود جلب کرده است. با رشد ارتباطات چندزبانه و افزایش تقاضا برای سیستم های هوشمند چندزبانه، نیاز به مدل هایی که قادر به درک احساسات انسانی در زبان های گوناگون باشند، بیش از پیش احساس می شود. این پژوهش با هدف طراحی یک سامانه ی تطبیقی تحلیل احساسات گفتاری در محیط های چندزبانه، بر پایه ی مدل های ترنسفورمر و یادگیری انتقالی انجام شده است. معماری پیشنهادی متشکل از مدل wav۲vec ۲.۰ برای استخراج ویژگی های صوتی، و XLM-R برای پردازش معنایی چندزبانه است. برای آموزش و ارزیابی، از دیتاست های استاندارد شامل IEMOCAP (انگلیسی)، EMO-DB (آلمانی) و FAFEW-Persian (فارسی) استفاده گردید. نتایج نشان داد که مدل در زبان انگلیسی دقت ۸۵.۲٪، در آلمانی ۸۲.۵٪، و در فارسی ۷۸.۴٪ را به دست آورده و با آموزش چندزبانه، دقت کلی به ۸۷.۱٪ افزایش یافته است. همچنین، تحلیل ماتریس اغتشاش نشان داد که بیشترین خطاها مربوط به تفکیک بین احساسات ملایم (مانند "غم" و "خنثی") بوده است. این پژوهش اثبات کرد که ترکیب یادگیری انتقالی و ترنسفورمرهای چندوجهی، مسیر مناسبی برای توسعه ی سیستم های تحلیل احساسات گفتاری در زبان های کم منبع، به ویژه فارسی فراهم می کند.
کلیدواژه ها:
نویسندگان
ستاره ثمربخش تهرانی
کارشناسی ارشد مهندسی فناوری اطلاعات – تجارت الکترونیکی ، گروه کامپیوتر و IT ، دانشگاه غیرانتفاعی مهر آستان ، آستانه اشرفیه ، گیلان ، ایران