مدلی ترکیبی از Vision Transformer و CNN برای تحلیل تصاویر پزشکی با تاکید بر تفسیرپذیری و کاهش نیاز به داده های بزرگ

سال انتشار: 1405
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 16

فایل این مقاله در 13 صفحه با فرمت PDF قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

SMARTCITYC04_207

تاریخ نمایه سازی: 24 مرداد 1405

چکیده مقاله:

تحلیل تصاویر پزشکی یکی از مهم ترین حوزه های پژوهشی در هوش مصنوعی و یادگیری عمیق به شمار می رود و نقش کلیدی در تشخیص، پایش و درمان بیماری ها ایفا می کند. با وجود پیشرفت های چشمگیر شبکه های عصبی کانولوشنی (CNN) در استخراج ویژگی های محلی از تصاویر، این مدل ها همچنان با چالش هایی نظیر نیاز به حجم عظیم داده آموزشی، محدودیت در درک وابستگی های بلندمدت بین بخش های مختلف تصویر و ضعف در تفسیرپذیری مواجه هستند. از سوی دیگر، مدل های مبتنی بر ترنسفورمر به ویژه Vision Transformer (ViT) توانسته اند درک بهتری از روابط سراسری تصویر ارائه دهند، اما در استخراج ویژگی های ریزمحلی عملکرد بهینه ای ندارند. در این پژوهش، یک مدل ترکیبی از CNN و ViT پیشنهاد می شود که هدف آن ترکیب قدرت استخراج ویژگی های محلی توسط CNN و توانایی ViT در تحلیل روابط سراسری تصویر است. نوآوری اصلی تحقیق حاضر در طراحی معماری هیبریدی است که ضمن افزایش دقت و پایداری مدل، نیاز به داده های گسترده را کاهش داده و امکان تفسیرپذیری بیشتری در تصمیم گیری مدل فراهم می سازد. انتظار می رود که نتایج این رویکرد در مقایسه با مدل های صرفا CNN یا ViT، بهبود قابل توجهی در معیارهایی همچون دقت (Accuracy)، حساسیت (Sensitivity) و قابلیت تفسیر (Explainability) داشته باشد.

کلیدواژه ها:

تصاویر پزشکی ، شبکه عصبی کانولوشنی (CNN) ، Vision Transformer (ViT) ، مدل های ترکیبی

نویسندگان

حمید رضا الماسی

دانشجو کارشناسی ارشد مهندسی کامپیوتر، موسسه آموزش عالی آپادانا، شیراز، ایران

محمد زارع

دپارتمان فناوری اطلاعات دانشگاه صنعتی شیراز، شیراز، ایران