ارزیابی دقت تشخیصی و استدلال بالینی مدلهای زبانی بزرگ (LMS) در سناریوهای بیمار محور و مدیریت بیماریهای مزمن یک مرور سیستماتیک
محل انتشار: هفتمین همایش ملی مراقبت و درمان با محوریت « مراقبت و درمان انسان محور در عصر نوآوری و تحول دیجیتال »
سال انتشار: 1405
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 10
متن کامل این مقاله منتشر نشده است و فقط به صورت چکیده یا چکیده مبسوط در پایگاه موجود می باشد.
توضیح: معمولا کلیه مقالاتی که کمتر از ۵ صفحه باشند در پایگاه سیویلیکا اصل مقاله (فول تکست) محسوب نمی شوند و فقط کاربران عضو بدون کسر اعتبار می توانند فایل آنها را دریافت نمایند.
- صدور گواهی نمایه سازی
- من نویسنده این مقاله هستم
استخراج به نرم افزارهای پژوهشی:
شناسه ملی سند علمی:
CNTCONF07_171
تاریخ نمایه سازی: 4 مهر 1405
چکیده مقاله:
مقدمه با گسترش روزافزون هوش مصنوعی در نظام سلامت استفاده از مدلهای زبانی بزرگ (LLMS) به عنوان ابزارهای پشتیبان تصمیم گیری بالینی مورد توجه قرار گرفته است. اگرچه این مدلها در پاسخ به سوالات ساختاریافته ی آزمونهای پزشکی عملکرد درخشانی داشته اند، اما توانایی آنها در محیطهای پویای بالینی و تعاملات چند مرحله ای با بیمار همچنان در هاله ای از ابهام است. این مرور سیستماتیک با هدف ارزیابی و سنتز شواهد تجربی پیرامون عملکرد تشخیصی و ظرفیت برنامه ریزی درمانی این مدلها در سناریوهای شبیه سازی شده تدوین شده است. در روش کار این مطالعه با رعایت دقیق پروتکل PRISMA انجام گرفت. جستجوی سیستماتیک در پایگاههای داده معتبر تا سال ۲۰۲۶ انجام شد. از مجموع ۴۸۰ رکورد اولیه پس از حذف موارد تکراری و غربالگری عناوین و چکیده ها ۴۵ مقاله به صورت تمام متن بررسی شدند. نهایتا ۱۲ مطالعه تجربی اولیه Primary studies با کیفیت بالا که عملکرد مدلهایی نظیر Gemini و مدلهای تخصصی پزشکی را در تعاملات شبیه سازی شده پزشک بیمار مانند چارچوب (CRAFT-MD) ارزیابی کرده بودند وارد تحلیل نهایی شدند. یافته ها: تحلیل داده ها نشان می دهد که تغییر قالب از سناریوهای متنی ثابت (Vignettes) به مکالمات چند مرحله ای با بیمار (Multi-turn conversations) منجر به افت چشمگیر دقت تشخیصی مدل ها می شود؛ به طوری که ارزیابی ها نشان داد دقت ۴-GPT در سوالات چند گزینه ای از %۸۲٫۰۰ به ۶۲٫۷ و در فرمت سوالات تشریحی (بدون گزینه) از ۴۸٫۶ به ۲۶٫۴ کاهش می یابد. در نهایت، این مدل ها غالبا فاقد توانایی سنجش عدم قطعیت بوده و تمایل بالایی به اعتمادبه نفس کاذب (Overconfidence) نشان می دهند. نتیجه گیری با وجود پتانسیل بالای مدل های زبانی در پردازش داده های پزشکی یافته های ما به روشنی نشان می دهد که این سیستم ها هنوز برای مدیریت پیچیده بیماران در دنیای واقعی بالغ نشده اند. افت چشمگیر دقت مدل ها در مکالمات پویای بالینی و بروز خطاهای خطرناک در برنامه ریزی درمانی یک زنگ خطر جدی است. بنابراین در مقطع کنونی هوش مصنوعی صرفا باید نقش یک دستیار هوشمند را در کنار پزشک متخصص ایفا کند. سپردن هرگونه تصمیم گیری مستقل به این ابزارها تهدیدی مستقیم برای ایمنی بیمار است و استفاده بالینی از آنها نیازمند نظارت انسانی بی وقفه و بازنگری های اساسی در معماری این سیستم هاست.
کلیدواژه ها:
هوش مصنوعی ، مدلهای زبانی بزرگ (LMS) ، استدلال بالینی ، دقت تشخیصی ، تصمیم گیری بالینی ، مراقبت بیمار محور
نویسندگان
هادی رضائی
کمیته تحقیقات دانشجویی دانشگاه علوم پزشکی تبریز تبریز، ایران
علی یوسف زاده
کمیته تحقیقات دانشجویی دانشگاه علوم پزشکی تبریز تبریز، ایران
سید علی حسین زاده
کمیته تحقیقات دانشجویی دانشگاه علوم پزشکی تبریز تبریز، ایران
هادی صالح پور
کمیته تحقیقات دانشجویی دانشگاه علوم پزشکی تبریز تبریز، ایران