بهبود گشتار صدای گفتار احساسی با استفاده از یک تابع انرژی کارآمد

سال انتشار: 1405
نوع سند: مقاله ژورنالی
زبان: فارسی
مشاهده: 141

فایل این مقاله در 15 صفحه با فرمت PDF قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

JR_ABMIR-4-1_011

تاریخ نمایه سازی: 5 خرداد 1405

چکیده مقاله:

یکی از موضوعات مهم در حوزه پردازش صوت و گفتار، تغییر احساس در گفتار است. ازجمله چالش های موردتوجه، محاسبه مقدار دقیق ویژگی های اصلی شامل انرژی، گام و دیرش است. هرچند قبلا روش های موثری ارائه شده اند، لیکن روش های موجود برای محاسبه انرژی به جهت اینکه فقط پارامتر دامنه را لحاظ می کنند، به تنهایی برای مدل سازی نوای گفتار کارایی مطلوبی ندارند. این پژوهش نشان می دهد که چگونه می توان از تابع جدیدی برای محاسبه انرژی جهت مدل سازی گشتار گفتار احساسی بهره برد. روش پیشنهادی برای محاسبه انرژی، بر اساس حساسیت سیستم شنوایی انسان در فرکانس های مختلف عمل می کند. در این روش انرژی بر اساس فاصله نقاط اکسترمم که مرتبط با دامنه و فرکانس است محاسبه می شود. جهت ارزیابی کارایی، یک سیستم گشتار گفتار احساسی با استفاده از تابع انرژی پیشنهادی بر روی پایگاه داده گفتار احساسی Persian ESD پیاده سازی و با روش های معمول محاسبه انرژی مقایسه شد. نتایج آزمایشی طبق نظرسنجی CMOS نشان می دهد که تابع پیشنهادی، کیفیت گفتار احساسی تولیدشده را در حد مطلوبی افزایش داده است.

نویسندگان

مجید نیک زر

دانشجوی دکتری، گروه مهندسی کامپیوتر، دانشگاه بوعلی سینا، همدان، ایران

حسن ختن لو

استاد، گروه مهندسی کامپیوتر، دانشگاه بوعلی سینا، همدان، ایران

میر حسین دزفولیان

استادیار، گروه مهندسی کامپیوتر، دانشگاه بوعلی سینا، همدان، ایران

مراجع و منابع این مقاله:

لیست زیر مراجع و منابع استفاده شده در این مقاله را نمایش می دهد. این مراجع به صورت کاملا ماشینی و بر اساس هوش مصنوعی استخراج شده اند و لذا ممکن است دارای اشکالاتی باشند که به مرور زمان دقت استخراج این محتوا افزایش می یابد. مراجعی که مقالات مربوط به آنها در سیویلیکا نمایه شده و پیدا شده اند، به خود مقاله لینک شده اند :
  • T. Qi, S. Wang, C. Lu and T. Song, "PromptEVC: ...
  • K. Zhou, B. Sisman, R. Liu and H. Li, "Emotional ...
  • L. R. Murray and J. L. Arnott, "Toward the simulation ...
  • K. Waghmare, S. Kayte and B. Gawali, "Analysis of Pitch ...
  • P. Y. Oudeyer, "The production and recognition of emotions in ...
  • S. S. Sadeghi, H. Khotanlou and M. R. Mahand, "Automatic ...
  • N. Esfandian, "Phoneme Classification using Temporal Tracking of Speech Clusters ...
  • M. Aliabadi, R. Golmohammadi, M. Mansoorizadeh, H. Khotanlou and A. ...
  • M. Karami Mollaei and M. Eshaghi, "A NEW ALGORITHM FOR ...
  • A. A. Kiaei and H. Khotanlou, "Segmentation of Medical Images ...
  • S. Özaydın, "Examination of Energy Based Voice Activity Detection Algorithms ...
  • Speech Emotion Recognition Using Scalogram Based Deep Structure [مقاله ژورنالی]
  • Y. Stylianou, "VOICE TRANSFORMATION: A SURVEY," in IEEE International Conference ...
  • O. Turk and L. M. Arslan, "Robust processing techniques for ...
  • L. Mary, Extraction of Prosody for Automatic Speaker, Language, Emotion ...
  • D. Ververidis and C. Kotropoulos, "Emotional speech classification using Gaussian ...
  • D. Verma, S. K. Barnwal, A. Barve, M. K. J. ...
  • M. K. Reddy and K. S. Rao, "Excitation Modeling Method ...
  • J. B. Singh and P. K. Lehana, "Emotional speech analysis ...
  • S. Karimi and M. H. Sedaaghi, "How to categorize emotional ...
  • J. Holmes and W. Holmes, Speech Synthesis and Recognition, Second ...
  • L. R. Rabiner and R. W. Schafer, Introduction to Digital ...
  • M. Mansoorizadeh and N. Moghaddam Charkari, "Multimodal information fusion application ...
  • A. V. Oppenheim, A. S. Willsky and H. Nawab, Signals ...
  • S. Hadiyoso, I. D. Irawati and A. Rizal, "Epileptic Electroencephalogram ...
  • M. Jalil, A. Butt and A. Malik, "Short-Time Energy, Magnitude, ...
  • M. Hamidi and M. Mansoorizade, "EMOTION RECOGNITION FROM PERSIAN SPEECH ...
  • H.K. Vydana, S.R. Kadiri and A.K. Vuppala, "Vowel-Based Non-uniform Prosody ...
  • P. R. Hill, Audio and Speech Processing with MATLAB, New ...
  • N. Keshtiari, M. Kuhlmann, M. Eslami and G. Klann-Delius, "Recognizing ...
  • S. H. Mohammadi and A. Kain, "An overview of voice ...
  • K. S. Rao, Predicting Prosody from Text for Text-to-Speech Synthesis, ...
  • M. Nikzar, H. Khotanlou and M. Dezfoulian, "THE RELATIONSHIP BETWEEN ...
  • An Empirical Comparison of Distance Measures for Multivariate Time Series Clustering [مقاله ژورنالی]
  • R. C. Streijl, S. Winkler and D. S. Hands, "Mean ...
  • نمایش کامل مراجع