مروری نظام مند بر روش های خلاصه سازی خودکار متن مبتنی بر پردازش زبان طبیعی: از روش های آماری تا مدل های زبانی بزرگ

سال انتشار: 1405
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 38

فایل این مقاله در 8 صفحه با فرمت PDF و WORD قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

FTBAI01_001

تاریخ نمایه سازی: 11 مهر 1405

چکیده مقاله:

رشد انفجاری محتوای متنی، خلاصه سازی خودکار متن را به یک ضرورت در پردازش زبان طبیعی تبدیل کرده است. این پژوهش یک مرور نظام مند از تحول روش های خلاصه سازی از رویکردهای آماری اولیه تا مدل های زبانی بزرگ ارائه می دهد. روش شناسی این مطالعه مبتنی بر تحلیل مقایسه ای-تطبیقی معماری ها، معیارهای ارزیابی و تکامل پارادایم ها از روش های استخراجی به انتزاعی است. یافته ها نشان می دهد که معماری Transformer نقطه عطف این حوزه بوده و مدل هایی مانند BART و PEGASUS به دلیل آموزش هدفمند، در خلاصه سازی انتزاعی پیشرو هستند. تحلیل تطبیقی ما نشان داد که هرچند مدل های زبانی بزرگ پیشرفت های چشمگیری در روانی و انسجام متن به ارمغان آورده اند، اما هسته اصلی مسائل به سمت چالش های معرفت شناختی مانند امانتداری و توهم تغییر یافته است. آینده این حوزه در گروی توسعه مدل های "آگاه به واقعیت"، روش های ارزیابی عمیق تر و حرکت به سمت خلاصه سازی انسان محور و شخصی سازی شده است. پیوند زدن قدرت مدل های مولد با پایگاه های دانش بیرونی از طریق رویکردهایی نظیر RAG، محتمل ترین مسیر برای نسل بعدی سیستم های خلاصه ساز خواهد بود. با این حال، چالش هایی نظیر توهم اطلاعاتی، هزینه های محاسباتی و شکاف میان معیارهای خودکار و ارزیابی انسانی همچنان پابرجاست. این مقاله با تحلیل دقیق نقاط عطف و چالش ها، مسیرهای پژوهشی آینده را ترسیم می کند.

کلیدواژه ها:

نویسندگان

سعید جباری

دانشجوی دکترا مهندسی کامپیوتردانشگاه آزاد قم

احمد شریف

دانشجوی دکترا مهندسی کامپیوتردانشگاه آزاد قم