بررسی تطبیقی جامع استخراج ویژگی (Vision Transformer ViT) در برابر شبکه های کانولوشنی (CNN) مدرن برای تشخیص عیوب سطح شیشه؛ ارزیابی تاثیر ادغام ویژگی و طبقه بندهای یادگیری ماشین

سال انتشار: 1404
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 8

فایل این مقاله در 7 صفحه با فرمت PDF قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

CSCG06_146

تاریخ نمایه سازی: 4 مهر 1405

چکیده مقاله:

در این پژوهش یک بررسی تطبیقی جامع برای ارزیابی عملکرد استخراج ویژگی چهار معماری عمیق شامل مبدل بینایی (ViT) و سه مدل کانولوشنی (ConvNextBase، EfficientNetB۰، ResNet۵۰) بر روی مجموعه داده عیوب سطح شیشه انجام شد. با توجه به چالش های ناشی از عدم توازن شدید کلاس ها در مجموعه داده اولیه که تنها ۱۰۸۰ تصویر داشت، از یک استراتژی افزایش داده هدفمند شامل چرخش، برش و وارونگی استفاده شد تا حجم مجموعه آموزشی به حدود ۹۰۰۰ تصویر متوازن افزایش یابد. ویژگی های استخراج شده توسط هر مدل سپس به طور جداگانه توسط هفت طبقه بند یادگیری ماشین شامل رگرسیون منطقی، ماشین بردار پشتیبان، درخت تصمیم، نزدیک ترین همسایگی، جنگل تصادفی، آدابوست و XGBoost ارزیابی شدند. همچنین یک رویکرد ادغام ویژگی برای ترکیب خروجی ویژگی های استخراج شده از هر چهار مدل مورد آزمون قرار گرفت. نتایج نشان داد که معماری ViT با توانایی خود در ثبت ویژگی های سراسری و ظریف، تصویر به وضوح برتر از معماری های کانولوشنی عمل کرد و بهترین دقت کلی ۹۸.۷۷ را با طبقه بندهای ماشین بردار پشتیبان و XGBoost به دست آورد. تحلیل نتایج نشان داد که ترکیب ویژگی های ViT با مدل های کانولوشنی ضعیف تر منجر به کاهش عملکرد نسبت به ViT تکی شد که این یافته بر برتری مطلق ViT برای این کاربرد صنعتی تاکید می کند.

نویسندگان

زهرا زارع شاهی

دانشجوی کارشناسی ارشد هوش مصنوعی و رباتیک، دانشگاه میبد، میبد، ایران

فاطمه زارع مهرجردی

استادیار گروه مهندسی کامپیوتر، دانشگاه میبد، میبد، ایران

محسن سرداری زارچی

دانشیار گروه مهندسی کامپیوتر، دانشگاه میبد، میبد، ایران