دقت هوش مصنوعی در برابر ارزیاب انسانی
سال انتشار: 1404
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 53
فایل این مقاله در 19 صفحه با فرمت PDF قابل دریافت می باشد
- صدور گواهی نمایه سازی
- من نویسنده این مقاله هستم
استخراج به نرم افزارهای پژوهشی:
شناسه ملی سند علمی:
SREDCONF01_4894
تاریخ نمایه سازی: 30 خرداد 1405
چکیده مقاله:
یکی از محوری ترین بحث های این حوزه، مقایسه دقت سیستم های هوش مصنوعی با ارزیاب های انسانی است. پژوهشی که در پایگاه ساینس دایرکت (۲۰۲۵) منتشر شده نشان داد که ChatGPT در تصحیح به دقت ۷۵ درصد دست یافته و بیشتر خطاهایش ناشی از علامت زدن پاسخ های نادرست به عنوان درست بوده، که نشان دهنده ضعف در پایبندی به روبریک تصحیح در مقایسه با ارزیاب های انسانی است. فلودن (۲۰۲۵) نیز نشان داده که در حالی که ChatGPT می تواند نمرات قابل قبولی نزدیک به نمره دهندگان انسانی تولید کند، ثبات آن در سوالات متنی خاص کاهش می یابد که نگرانی هایی را درباره عمق درک آن ایجاد می کند. در عین حال، باید توجه کرد که نقص دقت در هوش مصنوعی لزوما برتری انسان را تضمین نمی کند. مالوف و تورستاینسون (۲۰۱۶) نشان دادند که تصحیح انسانی نیز اغلب با تناقض قابل توجهی در میان ارزیابان مختلف روبروست. گناناپراکاسام و لوردوسامی (۲۰۲۴) استدلال می کنند که سیستم های هوش مصنوعی با پایبندی دقیق به معیارهای تصحیح استاندارد، می توانند این ناسازگاری را کاهش دهند و عدالت در ارزیابی را بهبود بخشند؛ به ویژه در موقعیت هایی که معیارهای کمی مانند دستور زبان، ساختار و دقت واقعی مدنظر است. بنابراین، بحث دقت را نباید در قالب تقابل ساده انسان در برابر ماشین دید، بلکه باید ترکیب بهینه این دو را هدف قرار داد.
نویسندگان
علی جفره
دبیر