تایید هویت گوینده مبتنی بر طبقه بند عمیق LSTM با ویژگی های MFCC و ارزیابی فاصله کسینوسی

سال انتشار: 1404
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 16

فایل این مقاله در 9 صفحه با فرمت PDF قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

CSCG06_061

تاریخ نمایه سازی: 4 مهر 1405

چکیده مقاله:

تایید گوینده یکی از مسایل کلیدی در حوزه ی پردازش گفتار و امنیت زیستی است که کاربردهای گسترده ای از جمله در سامانه های احراز هویت بانکداری الکترونیکی و کنترل دسترسی دارد. در این پژوهش یک چارچوب نوین مبتنی بر ترکیب رویکرد طبقه بندی و استخراج بردارهای تعبیه صوتی ارائه می شود. ابتدا ویژگی های طیفی گفتار به کمک ضرایب MFCC استخراج شده و سپس توالی آنها به یک شبکه عمیق LSTM با لایه های پنهان متوالی داده می شود. شبکه عمیق به عنوان یک طبقه بند با تابع هزینه Cross Entropy Loss آموزش دیده و بردارهای تعبیه ۱۲۸ بعدی از آخرین لایه پنهان استخراج می شوند. در مرحله ی ارزیابی شبکه عمیق به عنوان یک مدل تعبیه سازی جهت استخراج بردار تعبیه عمل کرده و شباهت گویندگان با استفاده از فاصله کسینوسی سنجیده می شود. در نهایت شباهت گویندگان با یک مقدار آستانه بهینه برای تصمیم گیری مقایسه می شود که با کمک داده های اعتبارسنجی تعیین شده است. نتایج آزمایش ها بر روی مجموعه داده PERSID۳۳ نشان می دهد که روش پیشنهادی دقت بسیار بالایی در تایید گوینده دارد، بیش از %۹۹ در داده های آزمون و نرخ خطای پذیرش کاذب (FAR) و رد کاذب (FRR) نیز در سطح بسیار پایینی قرار گرفته است. این نتایج نشان دهنده ی کارایی و پایداری مدل پیشنهادی در کاربردهای واقعی است.

کلیدواژه ها:

تایید گوینده ، یادگیری عمیق ، شبکه ، MFCC ، LSTM ، تابع هزینه Cross Entropy Loss

نویسندگان

وحید کیانی

استادیار گروه مهندسی کامپیوتر دانشکده فنی و مهندسی دانشگاه بجنورد

سمیرا حورعلی

استادیار گروه مهندسی کامپیوتر دانشکده فنی و مهندسی دانشگاه کوثر بجنورد

عاطفه پاکزاد

استادیار گروه مهندسی کامپیوتر دانشکده فنی و مهندسی دانشگاه کوثر بجنورد