بازشناسی مقاوم گفتار با استفاده از ویژگی الگوهای زمانی به دست آمده از ساختار شبکه عصبی بهینه شده MTMLP

سال انتشار: 1393
نوع سند: مقاله ژورنالی
زبان: فارسی
مشاهده: 482

فایل این مقاله در 14 صفحه با فرمت PDF قابل دریافت می باشد

این مقاله در بخشهای موضوعی زیر دسته بندی شده است:

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

JR_ISEE-5-3_003

تاریخ نمایه سازی: 6 دی 1400

چکیده مقاله:

ویژگی الگوهای زمانی سیگنال صوتی از دو حوزه زمانی و یا بردارهای بازنمایی شده قابل استخراج است. این ویژگی دربرگیرنده اطلاعات و مشخصات زمان بلند از تغییرات پیوسته واحدهای گفتاری است. در این مقاله، ویژگی الگوهای زمانی با استفاده از خروجی مقدار احتمال پسین واجی ساختار بهینه شده شبکه عصبی MTMLP، از مجموعه بردارهای بازنمایی مبتنی بر طیف (مانند ویژگی گفتاری LFBE) و همچنین، مبتنی بر کپستروم (مانند ویژگی گفتاری MFCC) استخراج شده است. با ترکیب اطلاعات الگوهای زمانی (دینامیک زمان بلند) به دست آمده از حوزه های لگاریتم طیف و کپستروم به بردار ویژگی های پایه بازشناسی، شامل ویژگی های گفتاری متداول MFCC و مشتقات زمانی اول و دوم آن (دینامیک زمان کوتاه)، نشان داده شده است که دقت بازشناسی واج در شرایط دادگان آزمون تمیز، حدود ۱ درصد نسبت به نتایج بهترین سیستم پایه بازشناسی بهبود می یابد. این در حالی است که ویژگی های به دست آمده از روش پیشنهادی، بازشناسی مقاومتری را در شرایط نویزی مختلف (تا حدود ۱۳ درصد) حاصل می نمایند که نشان دهنده مقاوم به نویز بودن روش پیشنهادی است.

نویسندگان

یاسر شکفته

مربی، گروه پردازش صوت و زبان طبیعی، پژوهشگاه توسعه فناوری های پیشرفته - تهران – ایران و دانشجوی دکتری، دانشکده مهندسی پزشکی - دانشگاه صنعتی امیرکبیر - تهران - ایران

فرشاد الماس گنج

دانشیار گروه بیوالکتریک، دانشکده مهندسی پزشکی - دانشگاه صنعتی امیرکبیر - تهران - ایران

مراجع و منابع این مقاله:

لیست زیر مراجع و منابع استفاده شده در این مقاله را نمایش می دهد. این مراجع به صورت کاملا ماشینی و بر اساس هوش مصنوعی استخراج شده اند و لذا ممکن است دارای اشکالاتی باشند که به مرور زمان دقت استخراج این محتوا افزایش می یابد. مراجعی که مقالات مربوط به آنها در سیویلیکا نمایه شده و پیدا شده اند، به خود مقاله لینک شده اند :
  • Lippmann, R., “Speech Perception by Humans and Machines”, Speech Communication, ...
  • Chulhee, L., “Optimizing Feature Extraction for Speech Recognition”, IEEE Trans. ...
  • Deng, L., “Processing of Acoustic Signals in a Cochlear Model ...
  • Drullman, R., Festen, J., Plomp, R., “Effect of Temporal Envelope ...
  • Allen, J.B., “Harvey Fletcher's Role in the Creation of Communication ...
  • Kandel, E., Essential of Neural System, Addison-Wesley Publishing Company, ۱st ...
  • Hermansky, H., Sharma, S., “Temporal Patterns (TRAPS) in ASR of ...
  • Chen, B., Zhu, Q., Morgan, N., “Tonotopic Multi-Layer Perceptron, a ...
  • Chen, B., Zhu, Q., Morgan, N., “Learning long-term Temporal Features ...
  • Okawa, S., Nakajima, T., Shirai, K., “A Recombination Strategy for ...
  • Motlicek, P., Cernocky, J., “Time-domain based Temporal Processing with Application ...
  • Athineos, M., Hermansky, H., Ellis, D., “LP-TRAP: Linear Predictive Temporal ...
  • Hermansky, H., “TRAP-TANDEM: Data-driven Extraction of Temporal Features from Speech”, ...
  • Valente, F., Vepa, J., Plahl, C., Gollan, C., Hermansky, H., ...
  • Chen, B.Y., Learning Discriminant Narrow band Temporal Patterns for Automatic ...
  • Hermansky, H., Ellis, D.P., Sharma, S., “Tandem Connectionist Feature Extraction ...
  • Zhu, Q., Stolcke, A., Chen, B.Y., Morgan, N., “Using MLP ...
  • Valente, F., “Multi-stream Speech Recognition based on Dempster–Shafer Combination Rule”, ...
  • Kazemi, A.R., Sobhanmanesh, F., “MLP Refined Posterior Features for Noise ...
  • Park, J., Diehl, F., Gales, M.J.F., Tomalin, M., Woodland, P.C., ...
  • Pinto, J., Garimella, S., Magimai-Doss, M., Hermansky, H., Bourlard, H., ...
  • Ikbal, S., Misra, H., Hermansky, H., Magimai, M., “Phase autocorrelation ...
  • Zhu, Q., Chen, B., Morgan, N., Stolcke, A., “On Using ...
  • Morgan, N., Chen, B.Y., Zhu, Q., Stolcke, A., “TRAPping Conversational ...
  • Richard, M.D., Lippmann, R.P., “Neural Network Classifiers Estimate Bayesian a ...
  • Ikbal, S., Nonlinear Feature Transformations for Noise Robust Speech Recognition, ...
  • Ellis, D.P., Singh, R., Sivadas, S., “Tandem Acoustic Modeling in ...
  • Sivadas, S., Hermansky, H., “Hierarchical Tandem Feature Extraction”, In Proc. ...
  • Sainath, T.N., Ramabhadran, B., Nahamoo, D., Kanevsky, D., Sethy, A., ...
  • Sivaram, G.S.V.S., Nemala, S.K., Elhilali, M., Tran, T.D., Hermansky, H., ...
  • Sivaram, G.S.V.S., Hermansky, H., “Sparse Multilayer Perceptron for Phoneme Recognition”, ...
  • Gemmeke, J.F., Virtanen, T., Hurmalainen, A., “Exemplar-based Sparse Representations for ...
  • White, H., “Learning in Artificial Neural Networks: A Statistical Perspective”, ...
  • Zavaliagkos, G., Zhao, Y., Schwartz, R., Makhoul, J., “A Hybrid ...
  • Shekofteh, Y., Almasgnaj, F., “Improvement of Speech Recognition using Neural ...
  • Chen C., Bilmes J., “MVA Processing of Speech Features”, IEEE ...
  • HTK (v.۳.۴), Hidden Markov Model Toolkit: <http://htk.eng.cam.ac.uk/>[۳۹] Bijankhan, M., Sheikhzadegan, ...
  • NOISEX-۹۲, SPIB noise data, Available from: http://spib.rice.edu/spib/select_noise.html ...
  • Kittler, J., Hatef, M., Duin, R.P.W., Matas, J., “On Combining ...
  • Nejadgholi, I., Seyyedsalehi, S.A., “Nonlinear Normalization of Input Patterns to ...
  • Shekofteh, Y., Almasganj, F., “Autoregressive Modeling of Speech Trajectory Transformed ...
  • Vali, M., Seyyedsalehi, S.A., “Robust Recognition of Telephone Speech using ...
  • Shekofteh, Y., Almasganj, F., “Feature Extraction based on Speech Attractors ...
  • نمایش کامل مراجع