چارچوب PersianPassEval: ارزیابی قدرت رمز عبور چندزبانه و حساس به فرهنگ با استفاده از یادگیری عمیق معنایی و ویژگی های آماری بومی شده
سال انتشار: 1404
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 14
فایل این مقاله در 11 صفحه با فرمت PDF قابل دریافت می باشد
- صدور گواهی نمایه سازی
- من نویسنده این مقاله هستم
استخراج به نرم افزارهای پژوهشی:
شناسه ملی سند علمی:
DEA17_158
تاریخ نمایه سازی: 28 شهریور 1405
چکیده مقاله:
علی رغم پیشرفت های چشمگیر در روش های احراز هویت نوین، رمزهای عبور متنی همچنان پرکاربردترین مکانیزم حفاظت از حساب های کاربری در جهان هستند. با این حال، گزارش Verizon DBIR ۲۰۲۴ نشان می دهد که ۸۱٪ از رخنه های داده ای موفق ناشی از استفاده از رمزهای ضعیف، قابل حدس یا تکراری بوده است. روش های سنتی ارزیابی قدرت رمز عبور مانند zxcvbn و PasswordMeter عمدتا بر معیارهای سطحی مانند طول، تنوع کاراکتر و وجود کلمات دیکشنری تکیه دارند و از درک الگوهای معنایی، نحوی و به ویژه الگوهای فرهنگی-زبانی کاربران عاجزند. این ضعف به ویژه در زبان های غیرلاتین مانند فارسی که دارای الفبا، تقویم، نام ها و عبارات فرهنگی متفاوتی هستند، بسیار مشهود است. در این مقاله، چارچوب PersianPassEval را معرفی می کنیم: یک مدل ترکیبی و چندزبانه برای ارزیابی قدرت رمز عبور که برای نخستین بار به طور خاص الگوهای فرهنگی فارسی را به صورت سیستماتیک مدل سازی می کند. این چارچوب از ترکیب بردارهای معنایی تولیدشده توسط مدل Word۲Vec فاین تیون شده روی بیش از ۵۵۰ میلیون رمز عبور واقعی نشت شده، توکن سازی BPE، شبکه دوطرفه BiLSTM، و ادغام با ۴۲ ویژگی آماری و فرهنگی بومی شده استفاده می کند و در نهایت با استفاده از Random Forest طبقه بندی نهایی را انجام می دهد. مدل روی سه مجموعه داده بزرگ RockYou، Have I Been Pwned و به ویژه PersianLeak-۱۴۰۴ (بزرگ ترین مجموعه داده عمومی رمزهای عبور فارسی با ۸.۳ میلیون نمونه واقعی جمع آوری شده از رخنه های ۱۴۰۳–۱۴۰۴) آموزش دیده است. نتایج تجربی نشان دهنده بهبود میانگین ۱۲٪ در F۱-score و ۱۵٪ در AUC نسبت به zxcvbn، و مهم تر از آن، بهبود چشمگیر ۲۲٪ در F۱-score روی داده های فارسی است. PersianPassEval اولین مدلی است که موفق به تشخیص الگوهای فرهنگی مانند ترکیب «نام + سال شمسی»، عبارات احساسی فارسی، نام های مذهبی و الگوهای کیبورد محلی با دقت بسیار بالا شده است.
کلیدواژه ها:
امنیت رمز عبور ، پردازش زبان طبیعی ، یادگیری عمیق ، چندزبانگی ، الگوهای فرهنگی ، مجموعه داده PersianLeak-۱۴۰۴ ، BiLSTM ، Random Forest ، Culturally-Sensitive Password Strength Estimation
نویسندگان
حامد منکرسی
استادیار دانشکده مهندسی کامپیوتر، دانشگاه رازی کرمانشاه
غلامرضا احمدی
دانشجوی دکترای معماری کامپیوتر، دانشکده مهندسی کامپیوتر، دانشگاه رازی، کرمانشاه