یک مرور نظام مند از روشهای یادگیری تقویتی برای بهینه سازی چراغ های راهنمایی و مدیریت هوشمند جریان ترافیک در کلان شهرهای در حال توسعه

سال انتشار: 1405
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 48

فایل این مقاله در 19 صفحه با فرمت PDF قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

ICST05_1006

تاریخ نمایه سازی: 10 مهر 1405

چکیده مقاله:

زمینه و هدف: یادگیری تقویتی (RL) به عنوان رویکردی داده مبنا برای کنترل تطبیقی چراغ های راهنمایی در مواجهه با تقاضای ناپایدار ناوگان آمیخته و مشاهده ناپذیری جزئی مطرح است. این مرور نظام مند با تمرکز بر کلان شهرهای در حال توسعه، وضعیت دانش در کنترل تک تقاطع و شبکه ای هماهنگی چندعاملی و ادغام با پیش بینی و اینترنت اشیا را جمع بندی می کند و مسیرهای استقرار کم ریسک را پیشنهاد می دهد. روش با اتکا به اصول PRISMA و معیارهای شمول، شفاف مطالعات داوری شده در حوزه های حمل و نقل، کنترل و محاسبات استخراج و از منظر طراحی حالت کنش پاداش خانواده الگوریتمی سازوکار هماهنگی محیط ارزیابی (شبیه ساز میدان) سنجه ها و قوت مبناها تحلیل روایی شد. یافته ها: گونه های بازیگر منتقد (PO/SAC/DDPG)، یادگیری Q عمیق و تجزیه ارزش در محیط های چندعاملی غالب اند؛ الگوی آموزش متمرکز اجرای نامتمرکز (CTDE) به دلیل توازن میان هماهنگی و هزینه ارتباط ترجیح دارد. کیفیت نمایش حالت از سیگنال های حداقلی صف اشغال تا ویژگی های گراف و ورودی های ادراکی عامل مرزی عملکرد است و تزریق پیش بینی های کوتاه افق مشاهده پذیری را بهبود می دهد. پاداش های فشار محور در رژیم های نزدیک اشباع از قفل شدگی شبکه جلوگیری می کنند اما نیازمند کالیبراسیون سناریویی اند تا اهداف انصاف و ایمنی قربانی نشوند. در قیاس با مبناهای قوی، فرا اکتشافی، مزیت RL عمدتا در شبکه های بزرگ تر و محیط های ناایستا پدیدار می شود. بدنه شواهد میدانی محدود است و شکاف شبیه سازی واقعیت، خرابی، حسگر، لرزش، ارتباط پابرجا می ماند. نتیجه گیری: برای بسترهای کم منبع راهبرد ترکیبی توصیه می شود؛ بذرگذاری با طرح های تثبیت شده و فرا اکتشافی، به کارگیری MARL با CTDE و پیام رسانی حداقلی همسایگی و استقرار مرحله ای با پوشش های ایمنی، خط لوله داده MLOps و گزارشگری تکرارپذیر با رشد ظرفیت داده و محاسبه ادغام بینایی لبه، پایش پهپادی و تلماتری CAV می تواند منافع بیشتری آزاد کند؛ مشروط بر آن که KPIهای انصاف و ایمنی هم سنگ تاخیر و توان عبوری در پاداش و ارزیابی وارد شوند. نوآوری: ارزش این مرور نقشه راهی عمل گرایانه برای انتقال RL از شبیه ساز به میدان در کلان شهرهای در حال توسعه ارائه می دهد که همزمان به محدودیت های حسگری، محاسباتی و الزامات حکمرانی پاسخ می دهد.

کلیدواژه ها:

نویسندگان

محمدحسن خامسی میبدی

گروه مهندسی نقشه برداری دانشگاه ملی مهارت، تهران، ایران