دقت هوش مصنوعی در برابر ارزیاب انسانی

سال انتشار: 1404
نوع سند: مقاله کنفرانسی
زبان: فارسی
مشاهده: 53

فایل این مقاله در 19 صفحه با فرمت PDF قابل دریافت می باشد

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این مقاله:

شناسه ملی سند علمی:

SREDCONF01_4894

تاریخ نمایه سازی: 30 خرداد 1405

چکیده مقاله:

یکی از محوری ترین بحث های این حوزه، مقایسه دقت سیستم های هوش مصنوعی با ارزیاب های انسانی است. پژوهشی که در پایگاه ساینس دایرکت (۲۰۲۵) منتشر شده نشان داد که ChatGPT در تصحیح به دقت ۷۵ درصد دست یافته و بیشتر خطاهایش ناشی از علامت زدن پاسخ های نادرست به عنوان درست بوده، که نشان دهنده ضعف در پایبندی به روبریک تصحیح در مقایسه با ارزیاب های انسانی است. فلودن (۲۰۲۵) نیز نشان داده که در حالی که ChatGPT می تواند نمرات قابل قبولی نزدیک به نمره دهندگان انسانی تولید کند، ثبات آن در سوالات متنی خاص کاهش می یابد که نگرانی هایی را درباره عمق درک آن ایجاد می کند. در عین حال، باید توجه کرد که نقص دقت در هوش مصنوعی لزوما برتری انسان را تضمین نمی کند. مالوف و تورستاینسون (۲۰۱۶) نشان دادند که تصحیح انسانی نیز اغلب با تناقض قابل توجهی در میان ارزیابان مختلف روبروست. گناناپراکاسام و لوردوسامی (۲۰۲۴) استدلال می کنند که سیستم های هوش مصنوعی با پایبندی دقیق به معیارهای تصحیح استاندارد، می توانند این ناسازگاری را کاهش دهند و عدالت در ارزیابی را بهبود بخشند؛ به ویژه در موقعیت هایی که معیارهای کمی مانند دستور زبان، ساختار و دقت واقعی مدنظر است. بنابراین، بحث دقت را نباید در قالب تقابل ساده انسان در برابر ماشین دید، بلکه باید ترکیب بهینه این دو را هدف قرار داد.

نویسندگان