مرور نظام مند بر روش های تشخیص محتوای مولد هوش مصنوعی با تاکید چالش های زبان فارسی

سال انتشار: 1405
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 12

فایل این مقاله در 10 صفحه با فرمت PDF قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

EECMAI14_032

تاریخ نمایه سازی: 31 تیر 1405

چکیده مقاله:

گسترش سریع مدل های زبانی بزرگ مانند DeepSeek GPT و نمونه های متن باز آن ها سیل عظیمی از متون خودکار را به فضای آنلاین سرازیر کرده است. تشخیص این متون از نوشتار انسانی روزبه روز دشوارتر می شود. این مسئله در حوزه آموزش، روزنامه نگاری و یکپارچگی علمی پیامدهای جدی به دنبال داشته است. آنچه در ادبیات پژوهشی موجود کمتر به آن پرداخته شده چالش های خاص این حوزه برای زبان های کم منبع به ویژه فارسی است. زبان فارسی با ساختار ریخت شناختی پیچیده، سیستم نوشتاری راست به چپ و کمبود داده های برچسب گذاری شده با مشکلاتی روبروست که روش های توسعه یافته برای زبان انگلیسی را با کاهش بازدهی مواجه کرده است. این مقاله یک مرور جامع از روش های تشخیص متن تولید شده توسط هوش مصنوعی ارائه می دهد که با تمرکز ویژه بر زبان فارسی شکاف های تحقیقاتی و چشم انداز آتی این حوزه را تحلیل می کند. مقالات بررسی شده از معتبرترین کنفرانس های NLP از جمله ACL، EMNLP، NeurIPS، ICLR و COLING در بازه ۲۰۲۳ تا ۲۰۲۵ انتخاب شده اند. نتایج نشان می دهد که باوجود پیشرفت های چشمگیر در روش های آماری مبتنی بر watermark و مبتنی بر ترنسفورمر زبان فارسی هنوز از پوشش کافی در این حوزه برخوردار نیست و پژوهش های محدودی به صورت مستقیم به این زبان پرداخته اند.

کلیدواژه ها:

تشخیص متن هوش مصنوعی ، مدل های زبانی بزرگ ، زبان فارسی ، روش های آماری ، watermark ، ترنسفورمر

نویسندگان

اسرین وکیلی

گروه مهندسی کامپیوتر دانشگاه ملی مهارت، تهران، ایران