معیارهای داده ای AI-ready و تفاوت آن با FAIR

10 شهریور 1405 - خواندن 8 دقیقه - 24 بازدید

در یادداشت قبلی (https://civilica.com/note/26091/ ) به اهمیت داده های پژوهشی هم برای انسان و هم برای ماشین اشاره شد، در این بحث به دنبال معیارهای داده های آماده برای هوش مصنوعی هستیم. در بحث مدیریت داده های پژوهشی، اصول FAIR نقطه ی شروع مهمی است، اما در سال های اخیر روشن شده که این اصول به تنهایی برای استفاده از داده در سامانه های یادگیری ماشین و هوش مصنوعی کافی نیست. FAIR بیشتر بر این تمرکز دارد که داده ها دسترس پذیر، تعامل پذیر و قابل استفاده مجدد باشند، اما داده ای که FAIR باشد الزاما برای مدل های هوش مصنوعی مناسب نیست، برعکس داده ای که برای آموزش یا ارزیابی یک مدل AI مناسب است، ممکن است هنوز از نظر مستندسازی، مجوزها یا کیفیت ساختاری، کاملا آماده نباشد، به همین دلیل، در ادبیات جدید، مفهوم AI-ready data به عنوان لایه ای فراتر از این اصول مطرح شده است.

FAIR به دنبال چیست؟

مقاله ی اصلی FAIR توسط Wilkinson و همکاران در سال ۲۰۱۶ منتشر شد و از همان ابتدا تاکید داشت که داده ها باید نه فقط برای انسان، بلکه برای سامانه های محاسباتی نیز قابل استفاده باشند. اصول FAIR بر چهار محور قابل یافت پذیری، دسترسی پذیری، هم کنش پذیری و قابل استفاده مجدد استوار است. در این چارچوب، شناسه ی پایدار، فراداده ی غنی، واژگان کنترل شده، مجوز روشن، از عناصر اصلی اند (Wilkinson et al., 2016). اما FAIR در اصل یک چارچوب راهنما است، نه یک استاندارد اجرایی کامل برای هوش مصنوعی. یعنی FAIR می گوید داده چگونه باید توصیف و منتشر شود تا قابل کشف و استفاده باشد، ولی لزوما نمی گوید داده برای یک pipeline یادگیری ماشین، برای آموزش مدل یا برای ارزیابی الگوریتم، از نظر ساختار و کیفیت کافی است یا نه. همین فاصله است که باعث شده مفهوم AI-ready data به طور مستقل رشد کند.

به بیان ساده، FAIR بیشتر می پرسد:

  • آیا داده قابل پیدا کردن است؟
  • آیا دسترسی به آن روشن است؟
  • آیا فراداده و واژگان آن با سامانه های دیگر سازگار است؟
  • آیا می توان از آن دوباره استفاده کرد؟

اما AI-ready data علاوه بر این ها می پرسد:

  • آیا داده برای پردازش ماشینی تمیز و قابل خواندن است؟
  • آیا ساختار آن برای مدل مناسب است؟
  • آیا برچسب ها، ویژگی ها، و توزیع داده برای استفاده در یادگیری ماشین قابل اتکا هستند؟
  • آیا داده به گونه ای ثبت شده که امکان بازتولید داشته باشد؟

AI-ready data به دنبال چیست؟

در منابع جدید، AI-ready data معمولا به داده ای گفته می شود که نه فقط ذخیره و توصیف شده، بلکه برای پردازش خودکار، آموزش مدل، ارزیابی، و بازاستفاده ی محاسباتی نیز آماده است. در گزارش ها و چارچوب ها دو بعد آن مورد بررسی قرار می گیرد آمادگی محاسباتی و آمادگی فراداده ای. آمادگی محاسباتی یعنی داده از نظر قالب، ساختار، انسجام، پاکیزگی، نوع داده و قابلیت بارگذاری در ابزارهای تحلیلی مناسب باشد. آمادگی فراداده ای یعنی داده با مستندات کافی، مجوز مشخص، توصیف استاندارد و اطلاعات لازم برای فهم دامنه و کاربرد همراه باشد. کافیلد و همکاران در مقاله ی AI-readiness Criteria for Biomedical Data این نکته را برجسته می کنند که آمادگی داده برای هوش مصنوعی چیزی فراتر از انطباق پذیری ساده با FAIR است. نویسندگان تاکید می کنند که برای کاربردهای زیست پزشکی، باید معیارهای دقیق تری برای کیفیت، زمینه ی تولید، قابلیت تفسیر و مستندسازی داده وجود داشته باشد، چون داده ای که برای انسان قابل فهم است، لزوما برای مدل یادگیری ماشین قابل اتکا نیست (Caufield et al, 2024).

AI-ready data باید ویژگی هایی همانند ساختار ثابت و قابل خواندن برای ماشین، فراداده ی کامل و ساخت یافته، نسخه بندی و تاریخچه ی تغییرات، مجوز استفاده ی قابل خواندن برای ماشین، واژگان و استانداردهای قابل تبادل، اطلاعات کافی درباره ی کیفیت، خطا، و محدودیت ها، آمادگی برای یک سناریوی مشخص تحلیلی یا مدل سازی را داشته باشد.

معیارهای عملی AI-ready data

چند معیار عملی اصلی برای AI-ready data تعریف شده است:

- کیفیت داده: کیفیت داده فقط صحت به معنای کلاسیک و تعریف های متعارف نیست بلکه شامل تناسب داده با وظیفه ی تحلیلی نیز می شود.

- فراداده ی غنی و ساخت یافته: فراداده تنها توضیح انسانی نباشد. باید به صورت ساخت یافته ثبت شود تا سامانه های محاسباتی بتوانند آن را بخوانند. این همان نقطه ای است که FAIR و AI-ready به هم نزدیک می شوند، اما AI-ready یک گام جلوتر می رود و فراداده را برای استفاده ی ماشینی عملیاتی می کند (Gebru et al., 2018)

- provenance و نسخه بندی: استانداردهای W3C PROV برای ثبت منشا داده، فعالیت های تولید و موجودیت های دخیل در ایجاد یا تغییر داده اهمیت دارند.

- مجوز و محدودیت های استفاده: در داده های پژوهشی، مخصوصا داده هایی که قرار است برای آموزش مدل ها استفاده شوند، مجوز باید روشن باشد. یکی از مشکلات رایج این است که داده از نظر علمی قابل استفاده است، اما از نظر حقوقی یا مجوزی برای استفاده در آموزش مدل یا انتشار مجدد مناسب نیست.

- سازگاری با استانداردهای تبادل داده: برای کاربردهای AI، داده باید تا حد امکان با قالب های استاندارد و قابل تبادل توصیف شود. در این زمینه، استاندارد Croissant از MLCommons[1] اهمیت پیدا کرده است. Croissant یک فرمت فراداده برای توصیف مجموعه داده ها است و به طور خاص برای کشف پذیری، حمل پذیری و بازتولید طراحی شده است.

- تناسب با کاربرد: داده ای که برای تحلیل آماری مناسب است، لزوما برای آموزش یک مدل زبانی، تشخیص تصویر یا تحلیل مناسب نیست.

در نهایت:

FAIR می گوید داده باید قابل پیدا کردن، دسترسی، تعامل، و استفاده ی مجدد باشد و AI-ready می گوید داده علاوه بر این، باید برای پردازش خودکار، آموزش مدل، ارزیابی و بازتولیدپذیری عملی نیز آماده باشد. بنابراین AI-ready data را می توان مرحله ای پیشرفته تر از FAIR دانست. مرحله ای که در آن داده نه فقط آرشیو یا منتشر شده، بلکه به صورت فعال برای استفاده در سامانه های هوش مصنوعی طراحی شده است. در پژوهش های داده محور امروزه، به ویژه در حوزه هایی مثل زیست پزشکی، ژنومیک، تصویر پزشکی، اقلیم و داده های بزرگ علمی، این تمایز صرفا نظری نیست بلکه یک شرط عملی برای استفاده ی قابل اعتماد از داده است.

می توان گفت تمایز میان FAIR و AI-Readiness یک هشدار عملی برای پروژه هاست. برآورده کردن اصول FAIR شرط لازم اما ناکافی برای ورود به دنیای یادگیری ماشین است. اگر داده ها تنها در همین سطح متوقف شوند، بیشتر وقت تیم های داده همچنان صرف پاکسازی، تبدیل قالب و مهندسی داده های خام خواهد شد. دستیابی به داده های AI-Ready نیازمند استقرار استانداردهایی نظیر شناسنامه های استاندارد داده، ردیابی دقیق منشا داده و قالب های معنایی مدرن از همان نقطه آغاز جمع آوری داده است.

در یادداشت بعدی به شناسنامه دار کردن داده های پژوهشی می پردازیم، استانداری که اگر درست تدوین نشود شکافی سخت برای داده های هوش مصنوعی محسوب می گردد.

منابع

- Caufield, J. H., Clark, T., Parker, J. A., Al Manir, S., Amorim, E., Eddy, J., Gim, N., Gow, B., & Bridge2AI Standards Working Group. (2024). AI-readiness criteria for biomedical data[Preprint]. bioRxiv. https://doi.org/10.1101/2024.10.23.619844

- Gebru, T., Morgenstern, J., Vecchione, B., Vaughan, J. W., Wallach, H., Daumé III, H., & Crawford, K. (2018). Datasheets for datasets. arXiv. https://doi.org/10.48550/arXiv.1803.09010

- GO FAIR Initiative. (n.d.). The FAIR principles. GO FAIR. Retrieved September 1, 2026, from https://www.go-fair.org/fair-principles/

- MLCommons. (2024). Croissant format specification 1.1. MLCommons Association. https://docs.mlcommons.org/croissant/docs/croissant-spec-1.1.html

- Wilkinson, M. D., Dumontier, M., Aalbersberg, I. J., Appleton, G., Axton, M., Baak, A., Blomberg, N., Boiten, J.-W., da Silva Santos, L. B., Bourne, P. E., Bouwman, J., Brookes, A. J., Clark, T., Crosas, M., Dillo, I., Dumon, O., Edmunds, S., Evelo, C. T., Finkers, R., … Mons, B. (2016). The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data, 3(1), 160018. https://doi.org/10.1038/sdata.2016.18

- World Wide Web Consortium. (2013). PROV-DM: The PROV data model (W3C Recommendation). W3C. https://www.w3.org/TR/prov-dm/

- World Wide Web Consortium. (2013). PROV-O: The PROV ontology (W3C Recommendation). W3C. https://www.w3.org/TR/prov-o/

[1] - MLCommons: docs.mlcommons.org/croissant