ساخت پیکره مقایسه ای تخصصی «پارسا»
محل انتشار: فصلنامه زبان پژوهی، دوره: 16، شماره: 52
سال انتشار: 1403
نوع سند: مقاله ژورنالی
زبان: فارسی
مشاهده: 158
نسخه کامل این مقاله ارائه نشده است و در دسترس نمی باشد
- صدور گواهی نمایه سازی
- من نویسنده این مقاله هستم
استخراج به نرم افزارهای پژوهشی:
شناسه ملی سند علمی:
JR_JLRZ-16-52_008
تاریخ نمایه سازی: 17 مهر 1403
چکیده مقاله:
امروزه ظهور فناوری های رایانه ای و تولید حجم بسیار بزرگی از متون به زبان های گوناگون، منابع پیکره ای عظیمی برای پژوهشگران مشتاق به ساخت پیکره فراهم کرده است. پیکره مقایسه ای، پیکره ای است دوزبانه یا چندزبانه که شامل متونی است مشابه در حوزه های موضوعی یکسان. علیرغم کاربرد فراوان این نوع پیکره ها در مطالعات مختلف از جمله پژوهش-های زبانی، ترجمه ماشینی و سامانه های خودکار بازیابی اطلاعات بینازبانی، پژوهشگران همواره با کمبود پیکره های مقایسه ای مواجه بوده اند. در پژوهش حاضر یک پیکره مقایسه ای تخصصی ساخته شده است (پارسا)، که شامل چکیده های فارسی و انگلیسی پایان نامه ها و رساله های ثبت شده در پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) است. این پیکره شامل بیش از ۸۹ میلیون واژه فارسی و ۷۹ میلیون واژه انگلیسی است. محتوای این پیکره عمومی نیست و حاوی متون بسیار تخصصی در حوزه های موضوعی کلان مانند علوم اجتماعی، علوم انسانی و هنر، فنی ومهندسی و رشته های مربوط به این حوزه ها است و از این نظر برای پردازش های زبانی که مستلزم بهره گرفتن از متون تخصصی است، بسیار ارزشمند است. برای ساخت این پیکره، پس از نمونه گیری، داده ها فارسی وارد فرایند پیش پردازش (هنجارسازی و واحدسازی) شدند و سپس، داده ها برچسب گذاری شدند (برچسب گذاری اجزای واژگانی کلام). سپس، برچسب های متون فارسی کنترل شدند. داده-های انگلیسی نیز به صورت ماشینی برچسب گذاری شدند. پیکره ساختهشده قابلیت بسیار بالایی برای داده کاوی، پژوهش-های مربوط به ترجمه ماشینی و استفاده در تمام پژوهش هایی که بر روی متون علمی انجام می شود را دارا است.
کلیدواژه ها:
نویسندگان
الهام علایی ابوذر
پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)
علی اصغر حجت پناه
پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)