بهبود امنیت و اخلاق در یادگیری تقویتی با بازخورد انسانی RLHF تمرکز بر مسئولیت پذیری
سال انتشار: 1405
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 47
فایل این مقاله در 5 صفحه با فرمت PDF قابل دریافت می باشد
- صدور گواهی نمایه سازی
- من نویسنده این مقاله هستم
استخراج به نرم افزارهای پژوهشی:
شناسه ملی سند علمی:
ECMCONF11_030
تاریخ نمایه سازی: 13 مرداد 1405
چکیده مقاله:
یادگیری تقویتی با بازخورد انسانی (Reinforcement Learning from Human Feedback یا RLHF) به عنوان یکی از رویکردهای مهم در هم راستاسازی رفتار سامانه های یادگیری ماشین با ترجیحات و قضاوت های انسانی مطرح شده است. با این وجود هم راستاسازی از مسیر بازخورد انسانی لزوما به معنای تضمین امنیت و اخلاق نیست؛ بلکه کیفیت داده ها، سازوکارهای ارزیابی، طراحی مدل پاداش و نحوه استقرار سامانه تعیین کننده میزان کاهش یا افزایش ریسک های رفتاری است. مقاله حاضر با اتخاذ رویکرد مسئولیت پذیری به عنوان محور، تحلیل نشان می دهد که چگونه می توان RLHF را از سطح یک تکنیک به سطح یک چارچوب پاسخگو و قابل ممیزی ارتقا داد. در این راستا ابعاد فنی، سازمانی و اجتماعی مسئولیت پذیری بررسی می شوند و راهکارهایی برای کاهش مخاطراتی نظیر سوگیری در برچسب زنی، بازی دادن پاداش (reward hacking) و ناکارآمدی در کنترل های پس از استقرار ارائه می گردد.
کلیدواژه ها:
نویسندگان