مژگان عروجی
3 یادداشت منتشر شدهشناسنامه دار کردن داده ها برای هوش مصنوعی
در عصر گذار از داده های پژوهشی سنتی به داده های مبتنی بر هوش مصنوعی، یک شکاف بزرگ میان داشتن داده و قابل استفاده بودن داده وجود دارد. بسیاری از مدل های یادگیری ماشین به دلیل استفاده از دیتاست هایی که فاقد مستندات زمینه ای هستند، دچار سوگیری[1] ، ناعدالتی و شکست در محیط های واقعی می شوند. برای پر کردن این خلاء، چارچوب Datasheets for Datasets که توسط گبرو و همکاران[2](2021) تبیین شد، از یک گزارش ساده به یک ابزار مدیریت ریسک ارتقا یافته است.
بهتر است اول با ساختار Datasheets آشنا شویم.
ساختار Datasheet و اهمیت استراتژیک هر بخش
برای درک بهتر، ریسک های پژوهشی را پوشش می دهد
۱. ریشه یابی انگیزه و هدف[3]
این بخش فراتر از یک توضیح ساده است. این بخش مشخص می کند که آیا این داده ها برای کاربردهای عمومی ساخته شده اند یا برای یک دامنه خاص (مثلا تشخیص پزشکی). اگر پژوهشگری از یک دیتاست طراحی شده برای بسته بندی کالا در یک مدل مثلا تشخیص جرم استفاده کند، با خطای بنیادی مواجه خواهد شد. مشخص کردن انگیزه، مرزهای استفاده مجاز را تعیین می کند.
- دیتاست با چه هدفی و برای پاسخ به چه پرسش پژوهشی ایجاد شده است؟
- چه نهاد یا تیمی حامی مالی یا مجری گردآوری داده بوده است؟
۲. شفافیت در ترکیب و ساختار[4]
در اینجا باید به جزئیات داده پرداخت. آیا داده ها تکراری هستند؟ آیا توزیع ویژگی ها (مانند سن، جنسیت یا نژاد) متعادل است؟ عدم شفافیت در این بخش، عامل اصلی ایجاد سوگیری ها را در مدل های هوش مصنوعی ایجاد می کند که می تواند منجر به تبعیض در تصمیم گیری های الگوریتمی نیز شود.
- نمونه ها چه چیزی را نشان می دهند (متن، تصویر پزشکی، ژنوم، جداول آماری)؟
- آیا داده ها کامل هستند یا مقادیر گمشده دارند؟
۳. مستندسازی فرایند گردآوری و اخلاق[5]
این بخش هسته اصلی حاکمیت داده است. پاسخ به سوالاتی نظیر "آیا رضایت آگاهانه اخذ شده است؟" یا "آیا داده ها از منابع باز با مجوزهای معتبر گرفته شده اند؟". از نظر حقوقی و اخلاقی حیاتی است. در پروژه های زیست پزشکی، این بخش مرز میان پژوهش قانونی و نقض حریم خصوصی است.
۴. فرایند پیش پردازش[6]
این واقعیت وجود دارد که داده ها هرگز خام باقی نمی مانند. اعمال فیلترها، حذف داده های پرت یا تغییر مقیاس، ویژگی های آماری داده را تغییر می دهد. اگر این تغییرات در Datasheet ثبت نشوند، پژوهشگر بعدی با یک «جعبه سیاه» مواجه است که نمی داند چرا نتایج مدل با داده های اولیه تفاوت دارد. این همان مفهوم اصالت و منشاء[7]است که در بحث AI-Readiness مطرح شد. https://civilica.com/note/26404/
۵. خطوط قرمز استفاده[8]
این یکی از نوآورانه ترین بخش های این چارچوب است. توسعه دهندگان باید صراحتا اعلام کنند که این دیتا ست برای چه کاربردهایی خطرناک است (مثلا استفاده از داده های چهره برای سیستم های نظارتی بدون اجازه). این کار از سوء استفاده های غیر متعارف و پیامدهای اخلاقی ناخواسته جلوگیری می کند.
برای درک عینی این روند، امروزه پلتفرم های اشتراک گذاری داده مانند Hugging Face[9]ساختار Datasheet را در قالب استاندارد Dataset Card (آموزش ساخت توضیح داده شده است)[10]، به صورت اجباری پیاده سازی می کنند. برای مثال، در دیتاست های استانداردی مثل GLUE (مجموعه داده ارزیابی درک زبان طبیعی)، شناسنامه دیتاست شامل سه بخش اصلی است:
- بخش فراداده ماشین خوان (YAML Header): شامل زبان،میزان حجم و مشخصات فنی (train, validation, test).
- بخش ساختاریافته متن (Markdown Body): تشریح دقیق چگونگی جمع آوری هر زیرمجموعه (مانند داده های اخبار یا پرسش و پاسخ).
- بخش ملاحظات اخلاقی و سوگیری (Considerations): بحث صریح درباره محدودیت های زبانی و سوگیری های احتمالی پنهان در متن ها.[11]
وضعیت پژوهش ها و اسناد این حوزه در ایران
تهیه برگه مشخصات صرفا یک کار اداری یا گزارش نویسی نیست. بلکه ابزاری عملی برای ثبت زمینه تولید داده و تسهیل استفاده ایمن از آن در یادگیری ماشین است. تدوین این مستند استاندارد به پژوهشگران دیگر کمک می کند تا بدون آزمون و خطاهای پرهزینه، محدودیت ها و ظرفیت های داده را بشناسند و از آموزش مدل روی داده های نامناسب جلوگیری کنند.
در مورد موضوع Datasheets for Datasets و استانداردهای پیشرفته مدیریت داده های پژوهشی (RDM) در ایران، باید به این نکته توجه داشت که فقدان اسناد استاندارد بومی به چشم می خورد. در حال حاضر، سند رسمی یا استاندارد ملی (مانند ISOهای بومی) در ایران که دقیقا بر اساس الگوی گبرو برای “Datasheets” تدوین شده باشد، وجود ندارد. اکثر سازمان ها و دانشگاه های ایران همچنان بر مدل های سنتی مدیریت داده (ذخیره سازی و آرشیو) تمرکز دارند. اما تدوین شناسنامه تنها وقتی اثر واقعی خود را نشان می دهد که زیرساختی برای نگهداری، اشتراک گذاری و اعتبارسنجی آن وجود داشته باشد.
در یادداشت بعدی، پلتفرم های مدیریت داده های پژوهشی را مرور می کنیم...
منابع
- Gebru, T., Morgenstern, J., Vecchione, B., Vaughan, J. W., Wallach, H., Daumé III, H., & Crawford, K. (2021). Datasheets for datasets. Communications of the ACM, 64(12), 86–92. https://doi.org/10.1145/3458723
- Pushkarna, M., Zaldivar, A., & Kjartansson, O. (2022). Data Cards: Purposeful and transparent dataset documentation for responsible AI. In ACM Conference on Fairness, Accountability, and Transparency (FAccT '22) (pp. 1776–1826). Association for Computing Machinery. https://doi.org/10.1145/3531146.3533231
- Wang, A., Singh, A., Michael, J., Hill, F., Levy, O., & Bowman, S. R. (2018). GLUE: A multi-task benchmark and analysis platform for natural language understanding. In Proceedings of the 2018 EMNLP Workshop BlackboxNLP: Analyzing and Interpreting Neural Networks for NLP ,pp. 353–355. Association for Computational Linguistics. https://doi.org/10.18653/v1/W18-5446
[1] - Bias
[2] - Gebru et al.
[3] - Motivation
[4] - Composition
[5] - Collection & Ethics
[6] - Preprocessing & Provenance
[7] - Provenance
[8] - Prohibited Uses
[9] - https://huggingface.co/datasets