واکاوی رفتار عامل هوشمند در محیط بازی Snake Game بر پایه اصول یادگیری تقویتی
سال انتشار: 1405
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 496
- صدور گواهی نمایه سازی
- من نویسنده این مقاله هستم
استخراج به نرم افزارهای پژوهشی:
شناسه ملی سند علمی:
ICMCAI02_093
تاریخ نمایه سازی: 9 تیر 1405
چکیده مقاله:
پارادایم یادگیری تقویتی یکی از رویکردهای بنیادین در توسعه عامل های هوشمند قلمداد می شود که در آن موجودیت یادگیرنده از طریق تعامل دینامیک و مستمر با اتمسفر پیرامون، پردازش سیگنال های تشویقی و واکاوی تجربی پیامد اکشن های خود، خط مشی رفتاری خویش را کالیبره می کند. با این حال، در بخش عمده ای از ادبیات پژوهش، متدولوژی ارزیابی سیستم های هوشمند منحصرا بر سنجه های کمی سطحی نظیر امتیاز نهایی یا طول عمر اپیزود متمرکز شده است؛ در حالی که این شاخص ها به تنهایی قادر به تبیین دقیق کیفیت منطق تصمیم گیری سیستم نخواهند بود. هدف تحقیق حاضر، کالبدشکافی ساختاری و رفتاری عامل هوشمند مستقر در شبیه ساز Snake بر پایه دکترین یادگیری تقویتی و با تمرکز بر الزامات مهندسی کیفیت نرم افزار است. متدولوژی این تحقیق ماهیتی کیفی داشته و بر استدلال منطقی-تحلیلی استوار است که در قالب آن، ترانزیشن رفتاری عامل در سه لایه ساختاری مورد مداقه قرار می گیرد: فاز اول شامل گذار سیستماتیک از استراتژی های احتمالی به الگوهای مبتنی بر بهینه سازی تابع پاداش؛ فاز دوم معطوف به تحول استراتژیک از رفتارهای پاداش محور آنی به پارادایم تصمیم گیری بقاگرا؛ و فاز سوم متمرکز بر ارزیابی متدولوژیک رفتار اکتسابی بر پایه معیارهای پایداری، تست پذیری و اتکاپذیری سیستم های نرم افزاری. برآیند دستاوردها نشان می دهد که هوشمندی در این بستر به صورت تدریجی متبلور شده و هرگز به تسخیر پاداش های لوکال محدود نمی شود. سیستم زمانی به بلوغ معماری دست می یابد که علاوه بر فرآیند امتیازگیری، مکانیزم های مدیریت ریسک را فعال کرده، پتانسیل پایداری اپیزود را حفظ نماید و در نهایت، خروجی هایی پایدار، تحلیل پذیر و مهندسی پذیر از خود بازتولید کند.
کلیدواژه ها:
نویسندگان
سمیرا خنشا
گروه مهندسی برق و کامپیوتر، واحد زرقان، دانشگاه آزاد اسلامی، زرقان، ایران.
محمد مهدی جعفرپور
گروه مهندسی برق و کامپیوتر، واحد زرقان، دانشگاه آزاد اسلامی، زرقان، ایران.