واکاوی رفتار عامل هوشمند در محیط بازی Snake Game بر پایه اصول یادگیری تقویتی

سال انتشار: 1405
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 496

فایل این مقاله در 15 صفحه با فرمت PDF و WORD قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

ICMCAI02_093

تاریخ نمایه سازی: 9 تیر 1405

چکیده مقاله:

پارادایم یادگیری تقویتی یکی از رویکردهای بنیادین در توسعه عامل های هوشمند قلمداد می شود که در آن موجودیت یادگیرنده از طریق تعامل دینامیک و مستمر با اتمسفر پیرامون، پردازش سیگنال های تشویقی و واکاوی تجربی پیامد اکشن های خود، خط مشی رفتاری خویش را کالیبره می کند. با این حال، در بخش عمده ای از ادبیات پژوهش، متدولوژی ارزیابی سیستم های هوشمند منحصرا بر سنجه های کمی سطحی نظیر امتیاز نهایی یا طول عمر اپیزود متمرکز شده است؛ در حالی که این شاخص ها به تنهایی قادر به تبیین دقیق کیفیت منطق تصمیم گیری سیستم نخواهند بود. هدف تحقیق حاضر، کالبدشکافی ساختاری و رفتاری عامل هوشمند مستقر در شبیه ساز Snake بر پایه دکترین یادگیری تقویتی و با تمرکز بر الزامات مهندسی کیفیت نرم افزار است. متدولوژی این تحقیق ماهیتی کیفی داشته و بر استدلال منطقی-تحلیلی استوار است که در قالب آن، ترانزیشن رفتاری عامل در سه لایه ساختاری مورد مداقه قرار می گیرد: فاز اول شامل گذار سیستماتیک از استراتژی های احتمالی به الگوهای مبتنی بر بهینه سازی تابع پاداش؛ فاز دوم معطوف به تحول استراتژیک از رفتارهای پاداش محور آنی به پارادایم تصمیم گیری بقاگرا؛ و فاز سوم متمرکز بر ارزیابی متدولوژیک رفتار اکتسابی بر پایه معیارهای پایداری، تست پذیری و اتکاپذیری سیستم های نرم افزاری. برآیند دستاوردها نشان می دهد که هوشمندی در این بستر به صورت تدریجی متبلور شده و هرگز به تسخیر پاداش های لوکال محدود نمی شود. سیستم زمانی به بلوغ معماری دست می یابد که علاوه بر فرآیند امتیازگیری، مکانیزم های مدیریت ریسک را فعال کرده، پتانسیل پایداری اپیزود را حفظ نماید و در نهایت، خروجی هایی پایدار، تحلیل پذیر و مهندسی پذیر از خود بازتولید کند.

کلیدواژه ها:

نویسندگان

سمیرا خنشا

گروه مهندسی برق و کامپیوتر، واحد زرقان، دانشگاه آزاد اسلامی، زرقان، ایران.

محمد مهدی جعفرپور

گروه مهندسی برق و کامپیوتر، واحد زرقان، دانشگاه آزاد اسلامی، زرقان، ایران.