ارائه راه کارهای جهت کاهش فشار گرافیکی و بهینه سازیمدل های زبانی بزرگ

سال انتشار: 1403
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 210

فایل این مقاله در 9 صفحه با فرمت PDF قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

DEA16_103

تاریخ نمایه سازی: 4 اردیبهشت 1404

چکیده مقاله:

مدلهای زبانی بزرگ (LLMs) سیستمهای هوش مصنوعی پیشرفته ای هستند که برای درک، تولید و پردازش زبان انسانی طراحی شدهاند. این مدلها با استفاده از داده های متنی گسترده و معماریهای یادگیری عمیق، به ویژه مدل های ترنسفورمر، قادر به انجام وظایف مختلف پردازش زبان طبیعی (NLP) مانند طبقهبندی متن، ترجمه و تعاملات متنی هستند. مدل هایی مانند GPT-۳ از OpenAI و BERT از Google نمونههایی از LLMs هستند که توانایی تولید متن منسجم و مرتبط با زمینه از ورودیهای حداقلی را دارند. توسعه LLM ها به تاریخ پردازش زبان طبیعی (NLP) مرتبط است که از سیستمهای مبتنی بر قواعد در دهه ۱۰۵۹ به مدلهای آماری در دهه ۱۰۹۹ و سپس به یادگیری عمیق در دهه ۲۰۱۰ تکامل یافته است. پیشرفتهای محاسباتی و دسترسی به داده های بزرگ، باعث تولید مدلهایی شده است که قادر به درک و تولید متن مشابه انسان در مقیاسهای بی سابقه هستند. این مدلها به سرعت در صنایع مختلفی مانند بهداشت، مالی، آموزش و سرگرمی کاربرد یافته اند. با وجود پتانسیل تحول آفرین LLM ها، مسائل اخلاقی همچون سوگیری، حریم خصوصی و مسئولیتپذیری همچنان چالش های مهمی به شمار میروند. همچنین نگرانی هایی در مورد تاثیرات زیستمحیطی آموزش این مدل ها و دقت محتوای تولید شده (که به آن 'توهمات' مدل گفته میشود) وجود دارد ک ه ما در این مقاله مورد بررسی قرار می دهیم.

کلیدواژه ها:

مدلهای زبانی بزرگ (LLM) ، پردازش زبان طبیعی (NLP) ، یادگیری عمیق ، مدل ترنسفورمر ، GPT-۳ ، BERT

نویسندگان

مصطفی ماهی

استادیار، گروه مهندسی کامپیوتر و فناوری اطلاعات، دانشگاه پیام نور، تهران، ایران

علیرضا صحت

کارشناسی مهندسی نرم افزار، گروه مهندسی کامپیوتر و فناوری اطلاعات، دانشگاه پیام نور، تهران، ایران