طبقه بندی انواع سرطان بر اساس الگوهای بیان ژن با استفاده از یادگیری ماشین و رویکرد هوش مصنوعی تفسیرپذیر
سال انتشار: 1405
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 8
فایل این مقاله در 31 صفحه با فرمت PDF قابل دریافت می باشد
- صدور گواهی نمایه سازی
- من نویسنده این مقاله هستم
استخراج به نرم افزارهای پژوهشی:
شناسه ملی سند علمی:
ETSCONG02_004
تاریخ نمایه سازی: 14 شهریور 1405
چکیده مقاله:
زمینه و هدف: سرطان به عنوان یکی از عوامل اصلی مرگ ومیر در جهان، نیازمند روش های تشخیصی دقیق و غیرتهاجمی است. تحلیل داده های بیان ژن (Gene Expression Data) حاصل از فناوری های توالی یابی مانند RNA-seq، فرصتی بی نظیر برای شناسایی الگوهای مولکولی خاص انواع مختلف سرطان فراهم کرده است. با این حال، ابعاد بالای داده ها (حضور هزاران ژن در هر نمونه) و پیچیدگی الگوها، چالش های جدی برای روش های سنتی ایجاد کرده است. روش شناسی: در این پژوهش، یک چارچوب یادگیری ماشین برای طبقه بندی چندکلاسه ی انواع سرطان بر اساس داده های بیان ژن از پایگاه داده ی جامع سرطان (TCGA) ارائه شده است. این چارچوب شامل مراحل پیش پردازش داده، انتخاب ویژگی های کلیدی با استفاده از روش های آماری و الگوریتم های یادگیری ماشین، و سپس طبقه بندی با استفاده از مدل های Random Forest (RF)، XGBoost و Support Vector Machine (SVM) می باشد. برای غلبه بر چالش ابعاد بالا و افزایش تفسیرپذیری مدل، از تکنیک SHAP (Shapley Additive Explanations) برای شناسایی ژن های تاثیرگذار و ارائه ی توضیحات شفاف برای پیش بینی های مدل استفاده شده است. یافته ها: مدل Random Forest با دقت ۹۹.۸۲٪ و مدل XGBoost با دقت ۹۹.۳۷٪ در طبقه بندی پنج نوع سرطان شایع در زنان (شامل سرطان پستان، آدنوکارسینوم ریه، سرطان تیروئید، سرطان تخمدان و آدنوکارسینوم کولون) عملکرد برتری نشان دادند. تحلیل SHAP منجر به شناسایی ۱۷۲ ژن منحصربه فرد (کمتر از ۱٪ از کل ویژگی های ورودی) شد که به عنوان تاثیرگذارترین نشانگرهای زیستی در فرآیند تشخیص عمل می کنند. نتایج نشان داد که رویکرد پیشنهادی نه تنها دقت بالایی دارد، بلکه با ارائه ی توضیحات شفاف، قابلیت اعتماد پزشکان به سیستم های تشخیص مبتنی بر هوش مصنوعی را افزایش می دهد. نتیجه گیری: چارچوب ارائه شده با ترکیب الگوریتم های قدرتمند یادگیری ماشین و تکنیک های تفسیرپذیری، یک ابزار کارآمد و قابل اطمینان برای طبقه بندی سرطان و شناسایی نشانگرهای زیستی فراهم می کند. این رویکرد می تواند به عنوان یک سیستم پشتیبان تصمیم گیری در حوزه ی انکولوژی دقیق (Precision Oncology) مورد استفاده قرار گیرد. تحقیقات آینده بر روی ترکیب داده های چندحالته (Multi-omics) و به کارگیری یادگیری فدرال برای افزایش تعمیم پذیری مدل ها متمرکز خواهد بود.
کلیدواژه ها:
نویسندگان
پریسا قهرمان شهرکی
مهندس کامپیوتر
سارا قهرمان شهرکی
دانشجوی زیست شناسی سلولی ملکولی دانشگاه اصفهان