یادگیری تقویتی پایدار با تنظیم هوشمند اندازه گام ها با الگوریتم GTD۲-Ratchet
سال انتشار: 1405
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 8
فایل این مقاله در 12 صفحه با فرمت PDF قابل دریافت می باشد
- صدور گواهی نمایه سازی
- من نویسنده این مقاله هستم
استخراج به نرم افزارهای پژوهشی:
شناسه ملی سند علمی:
CITSCO02_028
تاریخ نمایه سازی: 22 شهریور 1405
چکیده مقاله:
یادگیری تقویتی در محیط های خارج از سیاست با چالش پایداری و نرخ همگرایی روبروست. الگوریتم های خانواده GTD۲ اگرچه برای حل مشکل واگرایی طراحی شده اند، اما کارایی آن ها به شدت تحت تاثیر انتخاب دستی اندازه گام (Step-size) قرار دارد. در این مقاله الگوریتم جدیدی تحت عنوان GTD۲-Ratchet معرفی می شود که با بهره گیری از مکانیزم تنظیم هوشمند اندازه گام پایداری یادگیری را در محیط های پیچیده تضمین می کند. روش پیشنهادی با ایجاد یک سد حفاظتی (Ratchet) از نوسانات شدید پارامترها در مراحل اولیه یادگیری جلوگیری کرده و همگرایی سریع تر به نقطه بهینه را میسر می سازد. نتایج شبیه سازی در محیط های استاندارد نشان می دهد که الگوریتم پیشنهادی در مقایسه با GTD۲ کلاسیک علاوه بر کاهش واریانس خطا نسبت به تنظیمات اولیه پارامترها نیز مقاومت بیشتری نشان می دهد.
کلیدواژه ها: