ارائه ی چارچوبی تفسیرپذیر و پایدار مبتنی بر یادگیری تقویتی عمیق برای تصمیم گیری تطبیقی در محیط های پویا
سال انتشار: 1405
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 47
فایل این مقاله در 19 صفحه با فرمت PDF قابل دریافت می باشد
- صدور گواهی نمایه سازی
- من نویسنده این مقاله هستم
استخراج به نرم افزارهای پژوهشی:
شناسه ملی سند علمی:
CECCONF30_011
تاریخ نمایه سازی: 2 شهریور 1405
چکیده مقاله:
الگوریتم های یادگیری تقویتی عمیق (DRL) علی رغم موفقیت در حل مسائل پیچیده، در محیط های پویا با دو چالش اساسی «عدم پایداری در برابر تغییرات توزیع داده ها» و «ماهیت غیرشفاف تصمیم گیری» روبرو هستند. این چالش ها مانع از به کارگیری آن ها در سیستم های حساس به امنیت می شود. پژوهش حاضر با هدف رفع این محدودیت ها، یک چارچوب هیبریدی نوین ارائه می دهد که در آن لایه تصمیم گیری مبتنی بر الگوریتم بهینه PPO با یک ماژول تفسیرپذیر مفهوم محور (Concept-based) ادغام شده است. راهکار پیشنهادی با بهره گیری از تکنیک های تنظیم کننده (Regularization) برای پایداری و تحلیل نقشه های برجستگی (Saliency Maps) برای شفاف سازی، امکان تصمیم گیری تطبیقی را فراهم می کند. ارزیابی های تجربی در محیط های شبیه سازی پویا نشان می دهد که مدل پیشنهادی به دقت ۹۶.۴٪ در اجرای سیاست های بهینه دست یافته و در مقایسه با مدل های پایه (Baseline) مانند SAC و DQN، پایداری عملکرد را تا ۱۸٪ در محیط های نویزی افزایش داده است. همچنین، نتایج نشان دهنده بهبود ۱۴ درصدی در شاخص وفاداری (Fidelity) توضیحات نسبت به متدهای پس ینی (Post-hoc) متداول است. این نتایج تایید می کند که چارچوب پیشنهادی تعادلی بهینه میان عملکرد فنی و تفسیرپذیری انسانی برقرار کرده است.
کلیدواژه ها:
نویسندگان
امین علی ملایی
گروه مهندسی کامپیوترواحدمیبددانشگاه آزاداسلامی میبدایران
محمد رضا ملاخلیلی میبدی
گروه مهندسی کامپیوترواحدمیبددانشگاه آزاداسلامی میبدایران