ساخت پیکره مقایسه ای تخصصی «پارسا»

سال انتشار: 1403
نوع سند: مقاله ژورنالی
زبان: فارسی
مشاهده: 158

نسخه کامل این مقاله ارائه نشده است و در دسترس نمی باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

JR_JLRZ-16-52_008

تاریخ نمایه سازی: 17 مهر 1403

چکیده مقاله:

امروزه ظهور فناوری های رایانه ای و تولید حجم بسیار بزرگی از متون به زبان های گوناگون، منابع پیکره ای عظیمی برای پژوهشگران مشتاق به ساخت پیکره فراهم کرده است. پیکره مقایسه ای، پیکره ای است دوزبانه یا چندزبانه که شامل متونی است مشابه در حوزه های موضوعی یکسان. علیرغم کاربرد فراوان این نوع پیکره ها در مطالعات مختلف از جمله پژوهش-های زبانی، ترجمه ماشینی و سامانه های خودکار بازیابی اطلاعات بینازبانی، پژوهشگران همواره با کمبود پیکره های مقایسه ای مواجه بوده اند. در پژوهش حاضر یک پیکره مقایسه ای تخصصی ساخته شده است (پارسا)، که شامل چکیده های فارسی و انگلیسی پایان نامه ها و رساله های ثبت شده در پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) است. این پیکره شامل بیش از ۸۹ میلیون واژه فارسی و ۷۹ میلیون واژه انگلیسی است. محتوای این پیکره عمومی نیست و حاوی متون بسیار تخصصی در حوزه های موضوعی کلان مانند علوم اجتماعی، علوم انسانی و هنر، فنی ومهندسی و رشته های مربوط به این حوزه ها است و از این نظر برای پردازش های زبانی که مستلزم بهره گرفتن از متون تخصصی است، بسیار ارزشمند است. برای ساخت این پیکره، پس از نمونه گیری، داده ها فارسی وارد فرایند پیش پردازش (هنجارسازی و واحدسازی) شدند و سپس، داده ها برچسب گذاری شدند (برچسب گذاری اجزای واژگانی کلام). سپس، برچسب های متون فارسی کنترل شدند. داده-های انگلیسی نیز به صورت ماشینی برچسب گذاری شدند. پیکره ساخته‎شده قابلیت بسیار بالایی برای داده کاوی، پژوهش-های مربوط به ترجمه ماشینی و استفاده در تمام پژوهش هایی که بر روی متون علمی انجام می شود را دارا است.

نویسندگان

الهام علایی ابوذر

پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)

علی اصغر حجت پناه

پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)