هوش مصنوعی چندوجهی: مروری بر رویکردها و کاربردهای پردازش داده های متنی، تصویری و صوتی

سال انتشار: 1404
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 81

فایل این مقاله در 9 صفحه با فرمت PDF قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

ECMECONF27_036

تاریخ نمایه سازی: 23 فروردین 1405

چکیده مقاله:

هوش مصنوعی چندوجهی به عنوان یکی از حوزه های نوظهور در یادگیری ماشین، بر توسعه مدل هایی تمرکز دارد که قادرند چندین نوع داده ناهمگون از جمله متن، تصویر، صدا و ویدئو را به صورت همزمان پردازش و تحلیل کنند. ترکیب این منابع اطلاعاتی مختلف، امکان درک عمیق تر از داده ها و بهبود عملکرد سیستم های هوشمند را فراهم می کند. پیشرفت های اخیر در معماری های یادگیری عمیق، به ویژه مدل های مبتنی بر ترنسفورمر و مدل های بنیادی چندوجهی، نقش مهمی در توسعه این حوزه ایفا کرده اند. مدل های پیشرفته ای مانند GPT‑۴o، Gemini و Flamingo، توانایی ادغام و هم ترازی اطلاعات چندوجهی را نشان داده و کاربردهای گسترده ای در زمینه هایی مانند تعامل انسان و ماشین، سیستم های جستجوی چندرسانه ای، تحلیل ویدئو، آموزش هوشمند و پزشکی دیجیتال ایجاد کرده اند. با وجود این پیشرفت ها، چالش هایی همچون همگام سازی داده های ناهمگون، نیاز به منابع محاسباتی بالا، مقیاس پذیری مدل ها و مسائل مرتبط با حریم خصوصی و تفسیرپذیری همچنان مطرح هستند. بررسی رویکردها و کاربردهای این مدل ها نشان می دهد که هوش مصنوعی چندوجهی نقش مهمی در توسعه نسل آینده سیستم های هوشمند و تعامل طبیعی تر میان انسان و ماشین خواهد داشت.

نویسندگان

شهلا موسوی

دانشجوی دکترای دانشگاه آزاداسلامی، واحد اصفهان (خوراسگان)،اصفهان،ایران