یادگیری تقویتی پایدار با تنظیم هوشمند اندازه گام ها با الگوریتم GTD۲-Ratchet

سال انتشار: 1405
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 8

فایل این مقاله در 12 صفحه با فرمت PDF قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

CITSCO02_028

تاریخ نمایه سازی: 22 شهریور 1405

چکیده مقاله:

یادگیری تقویتی در محیط های خارج از سیاست با چالش پایداری و نرخ همگرایی روبروست. الگوریتم های خانواده GTD۲ اگرچه برای حل مشکل واگرایی طراحی شده اند، اما کارایی آن ها به شدت تحت تاثیر انتخاب دستی اندازه گام (Step-size) قرار دارد. در این مقاله الگوریتم جدیدی تحت عنوان GTD۲-Ratchet معرفی می شود که با بهره گیری از مکانیزم تنظیم هوشمند اندازه گام پایداری یادگیری را در محیط های پیچیده تضمین می کند. روش پیشنهادی با ایجاد یک سد حفاظتی (Ratchet) از نوسانات شدید پارامترها در مراحل اولیه یادگیری جلوگیری کرده و همگرایی سریع تر به نقطه بهینه را میسر می سازد. نتایج شبیه سازی در محیط های استاندارد نشان می دهد که الگوریتم پیشنهادی در مقایسه با GTD۲ کلاسیک علاوه بر کاهش واریانس خطا نسبت به تنظیمات اولیه پارامترها نیز مقاومت بیشتری نشان می دهد.

کلیدواژه ها:

یادگیری تقویتی ، پیش بینی خارج از سیاست ، GTD-Ratchet ، تنظیم تطبیقی اندازه گام ها

نویسندگان

حبیب متین

دانشجوی دکتری مهندسی کامپیوتر دانشگاه آزاد اسلامی، واحد سنندج، ایران

وفا میهمی

استاد دکتری تخصصی هوش مصنوعی دانشگاه آزاد اسلامی، واحد سنندج، ایران