جبران تنوعات گوینده در شبکه های عصبی بازشناخت گفتار به روش تنظیم ورودی

سال انتشار: 1382
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 1,159

فایل این مقاله در 6 صفحه با فرمت PDF قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

ICBME11_021

تاریخ نمایه سازی: 27 تیر 1387

چکیده مقاله:

مسئله تنوعات گوینده، یکی از مهمترین عواملی است که بر کارآیی سیستم های بازشناخت گفتار اثر می گذارد. در این مقاله روشی پیشنهاد می شود که در آن با کمک تنظیم ورودی قسمتی از این تأثیر در شبکه های عصبی بازشناخت گفتار جبران می وشد. ابتدا در میان 71 گوینده آموزش، گوینده با بالاترین درصد صحت تشخیص آوا را به عنوان گوینده مرجع انتخاب می کنیم. سپس با استافده از الگوریتم پس انتشار خطا همه سیگنال گفتار مربوط به گویندگان آموزش و آزمون را طوری تنظیم می کنیم که بر گوینده مرجع منطبق شوند. مدل بازشناخت گفتار با دادگان آموزش تنظیم شده، تعلیم و با دادگان آزمون تنظیم شده، آزموده می شود. با اعمال این روش و تلفیق نتایج این شبکه با شبکه بدون تنظیم ورودی بر اساس بیشترین سطح اطمینان، 2/6% افزایش در صحت تشخیص آوا به دست می آید.

کلیدواژه ها:

بازشناخت گفتار - شبکه های عصبی - تنظیم ورودی - تنوعات گوینده

نویسندگان

ایثار نژادقلی

دانشجوی کارشناسی ارشد بیوالکتریک

سیدعلی سید صالحی

استادیار دانشکده مهندسی پزشکی دانشگاه صنعتی امیرکبیر

مراجع و منابع این مقاله:

لیست زیر مراجع و منابع استفاده شده در این مقاله را نمایش می دهد. این مراجع به صورت کاملا ماشینی و بر اساس هوش مصنوعی استخراج شده اند و لذا ممکن است دارای اشکالاتی باشند که به مرور زمان دقت استخراج این محتوا افزایش می یابد. مراجعی که مقالات مربوط به آنها در سیویلیکا نمایه شده و پیدا شده اند، به خود مقاله لینک شده اند :
  • رحیمی‌نژاد، مهدی ؛ "توسعه و بهبود روشهای رایج استخراج مشخصه ...
  • سید صالحی س.ع : " بازشناخت گفتار پیوسته فارسی با ...
  • C. J. Leggetter, P. C. Woodland, "Maximum Likelihood Linear Regression ...
  • h Ircnian Conference on Biomedical Engineering, February 2004 ...
  • Adaptation of Continuous Density Hidden Markov Models", Computer Speech and ...
  • J. Gauvian, "Maximum a posteriori estimation for mu ltivariate Gaussian ...
  • Y. Tsao, S. M. Lee, F. C. Chou, L. S. ...
  • E. J. Pusateri, T. J. Hazen, "Rapid Speaker Adaptation Using ...
  • C. Huang, T. Chen, S. Li, E. Chang and J. ...
  • F. Beaufays, H. Bourlard, H. Franco, N. Margon, "Neural Networks ...
  • M. Bijankhan, et. al, "FARSDAT - The Speech Database of ...
  • نمایش کامل مراجع