مدل های زبانی- بصری در گزارش نویسی رادیولوژی: از معماری و توهم تا چالش ها و چشم انداز بومی سازی

سال انتشار: 1405
نوع سند: مقاله ژورنالی
زبان: فارسی
مشاهده: 91

فایل این مقاله در 13 صفحه با فرمت PDF قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

JR_SASE-12-1_004

تاریخ نمایه سازی: 7 تیر 1405

چکیده مقاله:

افزایش حجم تصاویر پزشکی و کمبود رادیولوژیست، خودکارسازی گزارش نویسی را به یک ضرورت بالینی تبدیل کرده است. بررسی جامع پیشرفت ها، معماری ها، کاربردها، چالش ها و چشم انداز مدل های زبانی-بصری (VLM) در تولید گزارش رادیولوژی. مروری نظام مند با جستجو در پایگاه های PubMed، Scopus، Web of Science، IEEE Xplore، arXiv و Google Scholar از ژانویه ۲۰۲۰ تا مه ۲۰۲۶. از ۴۸۷ مقاله اولیه، ۳۲ مقاله کلیدی انتخاب شد. معماری های غالب ترکیب رمزگذارهای تصویری Transformer با رمزگشاهای متنی LLM است. مدل های شاخص شامل Merlin (دقت ۸۹٪ در طبقه بندی ۳۰ نوع ضایعه CT)، MedScribe (کاهش ۲۳٪ توهمات)، VALOR (بهبود ۱۷٪ همسانی بالینی) و Glio-LLaMA-Vision (AUC ۰.۹۲) هستند. چالش اصلی، پدیده توهم با نرخ ۵ تا ۱۵٪ یافته های کاذب است. VLMs به عنوان ابزار کمکی در کنار رادیولوژیست ها بهره وری را افزایش می دهند، اما تا جایگزینی کامل فاصله دارند. اولویت ها شامل مدل های قابل توضیح (XAI)، بازیابی اطلاعات (RAG) و بومی سازی برای زبان فارسی است.

نویسندگان

علیرضا حبیبی

مهندسی کامپیوتر، دانشگاه ملی مهارت دارالفنون، دانشگاه بجنورد

علی ایزدی

مهندسی کامپیوتر، دانشگاه ملی مهارت دارالفنون، دانشگاه بجنورد